20 Conclusión
20.1 Resumen de contenidos
El contenido del libro se estructura en cinco bloques temáticos, organizados según el nivel de complejidad estadística y el número de variables implicadas en cada técnica.
20.1.1 Preparación de datos y conceptos fundamentales
El primer bloque cubre la importación de ficheros de encuesta, la gestión de variables y ponderaciones, y el tratamiento de valores perdidos, incluyendo la distinción entre los patrones MCAR, MAR y MNAR y las estrategias de tratamiento asociadas a cada uno. Se desarrollaron también los niveles de medición —nominal, ordinal, de intervalo y de razón—, que determinan qué procedimientos estadísticos son aplicables a cada tipo de variable.
20.1.2 Estadística descriptiva e inferencial
El segundo bloque comprende la estadística descriptiva y la visualización de datos: medidas de tendencia central, dispersión y forma de la distribución, y métodos de detección de valores atípicos, tanto exploratorios (diagrama de caja, percentiles, filtro de Hampel) como basados en pruebas formales (test de Grubbs, de Dixon, de Rosner).
A continuación se desarrolló la inferencia estadística: el marco de contraste de hipótesis, el p-valor y el nivel de significación, aplicados a un conjunto de pruebas bivariantes que incluye la prueba t y el ANOVA —de uno y de dos factores, con su correspondiente análisis de interacción— para la comparación de medias; el test chi-cuadrado para la asociación entre variables categóricas; y las alternativas no paramétricas (U de Mann-Whitney, rangos con signo de Wilcoxon, Kruskal-Wallis, correlaciones de Spearman y de Kendall) para los casos en que no se cumple el supuesto de normalidad.
20.1.3 Análisis multivariante
El tercer bloque desarrolla el análisis multivariante, organizado según la distinción entre técnicas de interdependencia (orientadas a explorar la estructura interna de un conjunto de variables, sin distinción previa entre dependientes e independientes) y técnicas de dependencia (orientadas a explicar o predecir una variable resultado a partir de un conjunto de predictores):
- Análisis de correspondencias (simple y múltiple): transformación de tablas de contingencia en representaciones gráficas de baja dimensión, aplicada al análisis de posicionamiento de marca y a la segmentación de variables categóricas.
- Análisis de componentes principales: reducción de la dimensionalidad de conjuntos de variables cuantitativas correlacionadas mediante combinaciones lineales no correlacionadas entre sí.
- Análisis clúster: identificación de segmentos en los datos mediante métodos jerárquicos y no jerárquicos (k-medias), junto con el proceso de caracterización y perfilado de los segmentos obtenidos.
- Análisis discriminante: validación estadística de una clasificación de grupos preexistente y construcción de una función de clasificación para nuevos casos.
- Segmentación CHAID: construcción de árboles de decisión basados en el test chi-cuadrado como criterio de división, con resultados expresados en forma de reglas categóricas.
- Regresión múltiple y logística: modelado predictivo y explicativo de variables dependientes cuantitativas y categóricas a partir de múltiples predictores.
20.1.4 Validación de escalas de medida y modelos teóricos
El cuarto bloque trata la validación de instrumentos de medida y la prueba estadística de modelos teóricos:
- Análisis de fiabilidad: evaluación de la consistencia interna de una escala de medida mediante el alfa de Cronbach y el omega de McDonald, con el correspondiente diagnóstico y depuración de ítems.
- Análisis factorial confirmatorio: contraste formal de la estructura factorial hipotetizada para un conjunto de ítems, con evaluación de la validez convergente y discriminante.
- Modelos de ecuaciones estructurales: estimación conjunta de un modelo de medida y un modelo estructural, desde la perspectiva confirmatoria del CB-SEM y la perspectiva predictiva del PLS-SEM.
20.1.5 Modelos de elección discreta y análisis conjoint
El quinto y último bloque desarrolla, a lo largo de cuatro capítulos independientes, la modelización de las preferencias y decisiones de compra del consumidor:
- Conjoint tradicional: estimación de utilidades parciales mediante regresión sobre puntuaciones u órdenes otorgados por el encuestado a perfiles de producto completos.
- Análisis conjoint basado en elecciones (CBC): estimación de modelos logit condicionales sobre la teoría de la utilidad aleatoria, con cálculo de la importancia relativa de los atributos, la disposición a pagar y simulación de cuotas de mercado entre configuraciones de producto.
- Diseño de experimentos y estimación avanzada: generación y evaluación estadística de diseños CBC antes de la recogida de datos, y estimación de modelos logit con parametrización directa en espacio de disposición a pagar.
- MaxDiff (escalamiento de mejor-peor): priorización de listas de elementos no combinables mediante la misma familia de modelos logit condicionales utilizada en el CBC.
20.2 Principio metodológico aplicado
A lo largo del libro se ha aplicado de forma sistemática un criterio de equivalencia con SPSS: cuando una técnica dispone de procedimiento equivalente en ese software, los resultados obtenidos en R se han construido para ser directamente comparables —mismos estadísticos, mismas pruebas previas (test de Levene antes de la prueba t y del ANOVA; KMO y test de esfericidad de Bartlett antes del ACP), mismos criterios de decisión. Este criterio responde al objetivo declarado del libro: facilitar la transición de un entorno de trabajo basado en SPSS hacia un flujo de trabajo en R y Quarto, sin que ese cambio de herramienta implique una modificación de la metodología estadística empleada.
Cuando una técnica no dispone de procedimiento equivalente en SPSS —el análisis de correspondencias, el análisis factorial confirmatorio, los modelos de ecuaciones estructurales, el análisis conjoint— se ha seguido el estándar de referencia académico en R, identificando explícitamente en cada caso si el criterio aplicado corresponde a una convención SPSS o a una convención propia del ecosistema R.
20.3 Limitaciones y extensiones no cubiertas
El contenido de este libro no constituye un repertorio exhaustivo de las técnicas disponibles para el análisis de datos en investigación de mercados. Quedan fuera del alcance de este texto:
- Series temporales y previsión de demanda: descomposición estacional, suavizado exponencial y modelos ARIMA.
- Diseños experimentales de mayor complejidad: ANOVA con más de dos factores, diseños de medidas repetidas y diseños factoriales completos.
- Extensiones de los modelos de elección discreta: modelos logit jerárquicos o mixtos, y diseños conjoint adaptativos (ACBC).
Los conceptos estadísticos desarrollados en este libro —significación, varianza, correlación, validez de constructo y especificación de modelos— constituyen el marco conceptual necesario para abordar estas y otras técnicas no incluidas en el presente texto.