En investigación de mercados, la mayor parte de los proyectos cuantitativos comparten una misma estructura de trabajo. Se diseña un cuestionario, se recoge la información mediante entrevistas (online, telefónicas o presenciales), y el resultado es un fichero de datos: una matriz donde cada fila es un entrevistado y cada columna es una variable. Ese fichero es el punto de partida de todo el análisis.
La secuencia habitual de un proyecto de investigación cuantitativa tiene cinco fases bien diferenciadas:
Formulación del problema a investigar
Diseño de la investigación
Recolección de los datos
Análisis de datos e interpretación de los resultados
Redacción del informe, conclusiones y recomendaciones
Este material se centra en la cuarta fase. No porque las demás sean menos importantes — un mal diseño de cuestionario no se arregla con ningún análisis — sino porque es donde R aporta más valor y donde el analista pasa la mayor parte de su tiempo real en un proyecto.
1.2 ¿Qué es el análisis exploratorio de datos?
Antes de aplicar cualquier técnica estadística, todo buen análisis comienza con una exploración. El análisis exploratorio de datos (EDA, por sus siglas en inglés) es el proceso de examinar los datos con detenimiento para entender su estructura, detectar anomalías, identificar patrones iniciales y formular preguntas relevantes.
Como señalan Wickham et al. (2023), el análisis de datos no es un proceso formal con reglas estrictas: es más bien un estado mental que invita a explorar con libertad antes de comprometerse con hipótesis concretas. En la práctica, esto significa que antes de hacer una regresión o un análisis clúster, conviene responder preguntas mucho más básicas:
¿Cuántas entrevistas hay en el fichero? ¿Hay duplicados?
¿Qué variables contiene? ¿Están bien codificadas?
¿Cuántos valores perdidos hay y dónde se concentran?
¿Las distribuciones tienen la forma esperada?
¿Hay valores extremos (outliers) que puedan distorsionar los resultados?
Estas preguntas parecen simples, pero su respuesta determina la calidad de todo lo que viene después. Un análisis multivariante impecable sobre datos mal preparados no tiene ningún valor.
1.3 Las fases del análisis en la práctica
En un proyecto real de investigación de mercados, el trabajo analítico suele organizarse en cuatro grandes bloques, que son los que articulan este material:
1.3.1 1. Preparación y depuración de los datos
Es la fase más costosa en tiempo y la más infraestimada. Incluye la importación del fichero, la revisión de la estructura de variables, el tratamiento de valores perdidos, la recodificación de variables y la aplicación de factores de ponderación cuando la muestra no es autoponderada.
En R, esta fase se realiza principalmente con los paquetes del ecosistema tidyverse(Wickham et al. 2019) para la manipulación general, y con expss(Demin 2023) para todo lo relacionado con encuestas ponderadas y tablas cruzadas.
1.3.2 2. Descripción y visualización
Una vez los datos están limpios y bien estructurados, se describe su contenido: distribuciones de frecuencias, medidas de tendencia central y dispersión, tablas de contingencia. La visualización es una herramienta fundamental en esta fase, no un adorno del informe final.
Para visualización estática se utiliza ggplot2(Wickham 2016) con temas profesionales; para gráficos interactivos en documentos HTML, highcharter(Kunst 2026).
1.3.3 3. Inferencia estadística
El objetivo de esta fase es generalizar los resultados de la muestra a la población. Se trabaja con contrastes de hipótesis, intervalos de confianza y pruebas bivariantes: chi-cuadrado para variables categóricas, pruebas t y ANOVA para comparar medias, correlaciones para explorar asociaciones lineales.
1.3.4 4. Análisis multivariante
Cuando las preguntas de investigación implican relaciones entre más de dos variables simultáneamente, se recurre a las técnicas multivariantes: análisis de correspondencias, análisis de componentes principales, análisis clúster y modelos de regresión. Cada una de estas técnicas responde a un tipo concreto de pregunta de negocio y tiene sus propios requisitos de aplicación.
1.4 R como entorno de análisis reproducible
Una de las ventajas fundamentales de trabajar con R frente a herramientas de menú como SPSS es la reproducibilidad: todo el análisis queda documentado en un script o en un documento Quarto que puede re-ejecutarse en cualquier momento, auditarse y modificarse con facilidad.
En este material, todos los análisis se presentan en formato .qmd (Quarto), lo que permite combinar texto, código y resultados en un único documento. Las técnicas implementadas reproducen fielmente los algoritmos que utiliza SPSS, de modo que los resultados son directamente comparables.
Un primer vistazo a cualquier fichero de datos se hace con dplyr::glimpse(), que muestra el número de filas y columnas, el tipo de cada variable y los primeros valores:
Code
library(dplyr)# Quick structural overview of a datasetdplyr::glimpse(example_data)
# Count NAs per variablecolSums(is.na(example_data))
id gender age satis
0 0 1 1
Estos dos pasos — glimpse() y recuento de NAs — son el punto de partida de cualquier análisis, independientemente de la complejidad de las técnicas que vengan después.
1.5 Lo que no cubre este material
Este material no es un curso de R desde cero. Se asume que el lector tiene un conocimiento mínimo del lenguaje: sabe instalar paquetes, entiende qué es un dataframe y puede ejecutar código en RStudio. Si se necesita una base más sólida, la referencia recomendada es “R for Data Science”(Wickham et al. 2023), disponible gratuitamente en r4ds.hadley.nz.
Tampoco se adentra en la matemática subyacente a las técnicas estadísticas más allá de lo necesario para entender qué hace el algoritmo y cómo interpretar sus resultados. El foco está en la aplicación práctica y en la interpretación orientada a la toma de decisiones en un contexto de marketing e investigación de mercados.
Wickham, Hadley, Mara Averick, Jennifer Bryan, et al. 2019. “Welcome to the tidyverse.”Journal of Open Source Software 4 (43): 1686. https://doi.org/10.21105/joss.01686.
Wickham, Hadley, Mine Çetinkaya-Rundel, and Garrett Grolemund. 2023. R for Data Science: Visualize, Model, Transform, Tidy, and Import Data. 2nd ed. O’Reilly Media, Inc.
# El proceso de análisis en investigación de mercados```{r}#| echo: false#| message: false#| warning: falsesource("script.R")```## El punto de partida: datos de encuestaEn investigación de mercados, la mayor parte de los proyectos cuantitativoscomparten una misma estructura de trabajo. Se diseña un cuestionario, se recogela información mediante entrevistas (online, telefónicas o presenciales), y elresultado es un fichero de datos: una matriz donde cada fila es un entrevistadoy cada columna es una variable. Ese fichero es el punto de partida de todo elanálisis.La secuencia habitual de un proyecto de investigación cuantitativa tiene cincofases bien diferenciadas:- Formulación del problema a investigar- Diseño de la investigación- Recolección de los datos- **Análisis de datos e interpretación de los resultados**- Redacción del informe, conclusiones y recomendacionesEste material se centra en la cuarta fase. No porque las demás sean menosimportantes — un mal diseño de cuestionario no se arregla con ningún análisis —sino porque es donde R aporta más valor y donde el analista pasa la mayor partede su tiempo real en un proyecto.## ¿Qué es el análisis exploratorio de datos?Antes de aplicar cualquier técnica estadística, todo buen análisis comienza conuna exploración. El análisis exploratorio de datos (EDA, por sus siglas eninglés) es el proceso de examinar los datos con detenimiento para entender suestructura, detectar anomalías, identificar patrones iniciales y formularpreguntas relevantes.Como señalan @wickham2023r, el análisis de datos no es un proceso formal conreglas estrictas: es más bien un estado mental que invita a explorar conlibertad antes de comprometerse con hipótesis concretas. En la práctica, estosignifica que antes de hacer una regresión o un análisis clúster, convieneresponder preguntas mucho más básicas:- ¿Cuántas entrevistas hay en el fichero? ¿Hay duplicados?- ¿Qué variables contiene? ¿Están bien codificadas?- ¿Cuántos valores perdidos hay y dónde se concentran?- ¿Las distribuciones tienen la forma esperada?- ¿Hay valores extremos (*outliers*) que puedan distorsionar los resultados?Estas preguntas parecen simples, pero su respuesta determina la calidad de todolo que viene después. Un análisis multivariante impecable sobre datos malpreparados no tiene ningún valor.## Las fases del análisis en la prácticaEn un proyecto real de investigación de mercados, el trabajo analítico sueleorganizarse en cuatro grandes bloques, que son los que articulan este material:### 1. Preparación y depuración de los datosEs la fase más costosa en tiempo y la más infraestimada. Incluye la importacióndel fichero, la revisión de la estructura de variables, el tratamiento devalores perdidos, la recodificación de variables y la aplicación de factores deponderación cuando la muestra no es autoponderada.En R, esta fase se realiza principalmente con los paquetes del ecosistema`tidyverse`[@tidyverse] para la manipulación general, y con `expss`[@expss]para todo lo relacionado con encuestas ponderadas y tablas cruzadas.### 2. Descripción y visualizaciónUna vez los datos están limpios y bien estructurados, se describe su contenido:distribuciones de frecuencias, medidas de tendencia central y dispersión, tablasde contingencia. La visualización es una herramienta fundamental en esta fase,no un adorno del informe final.Para visualización estática se utiliza `ggplot2`[@ggplot] con temasprofesionales; para gráficos interactivos en documentos HTML, `highcharter`[@highcharter].### 3. Inferencia estadísticaEl objetivo de esta fase es generalizar los resultados de la muestra a lapoblación. Se trabaja con contrastes de hipótesis, intervalos de confianza ypruebas bivariantes: chi-cuadrado para variables categóricas, pruebas t y ANOVApara comparar medias, correlaciones para explorar asociaciones lineales.### 4. Análisis multivarianteCuando las preguntas de investigación implican relaciones entre más de dosvariables simultáneamente, se recurre a las técnicas multivariantes: análisis decorrespondencias, análisis de componentes principales, análisis clúster ymodelos de regresión. Cada una de estas técnicas responde a un tipo concreto depregunta de negocio y tiene sus propios requisitos de aplicación.## R como entorno de análisis reproducibleUna de las ventajas fundamentales de trabajar con R frente a herramientas demenú como SPSS es la **reproducibilidad**: todo el análisis queda documentado enun script o en un documento Quarto que puede re-ejecutarse en cualquier momento,auditarse y modificarse con facilidad.En este material, todos los análisis se presentan en formato `.qmd` (Quarto), loque permite combinar texto, código y resultados en un único documento. Lastécnicas implementadas reproducen fielmente los algoritmos que utiliza SPSS, demodo que los resultados son directamente comparables.```{r}#| echo: false#| message: false#| warning: false# Example: basic inspection of a dataframe in R# This is what a typical first step looks like in any projectexample_data <-data.frame(id =1:8,gender =factor(c("Mujer","Hombre","Mujer","Mujer","Hombre","Mujer","Hombre","Mujer")),age =c(34, 28, 45, NA, 52, 29, 38, 41),satis =c(7, 5, 8, 6, NA, 9, 4, 7))```Un primer vistazo a cualquier fichero de datos se hace con `dplyr::glimpse()`,que muestra el número de filas y columnas, el tipo de cada variable y losprimeros valores:```{r}#| echo: true#| message: falselibrary(dplyr)# Quick structural overview of a datasetdplyr::glimpse(example_data)```Y para detectar valores perdidos de forma rápida:```{r}#| echo: true# Count NAs per variablecolSums(is.na(example_data))```Estos dos pasos — `glimpse()` y recuento de `NA`s — son el punto de partida decualquier análisis, independientemente de la complejidad de las técnicas quevengan después.## Lo que no cubre este materialEste material no es un curso de R desde cero. Se asume que el lector tiene unconocimiento mínimo del lenguaje: sabe instalar paquetes, entiende qué es un*dataframe* y puede ejecutar código en RStudio. Si se necesita una base mássólida, la referencia recomendada es *"R for Data Science"* [@wickham2023r],disponible gratuitamente en [r4ds.hadley.nz](https://r4ds.hadley.nz).Tampoco se adentra en la matemática subyacente a las técnicas estadísticas másallá de lo necesario para entender qué hace el algoritmo y cómo interpretar susresultados. El foco está en la aplicación práctica y en la interpretaciónorientada a la toma de decisiones en un contexto de marketing e investigación demercados.