13  Modelos de ecuaciones estructurales (SEM)

Published

June 29, 2026

13.1 Introducción: el paso final del análisis multivariante

Los capítulos anteriores han ascendido por una escalera de complejidad analítica. Se comenzó validando la fiabilidad de las escalas de medida y, con el análisis factorial confirmatorio (AFC), se probó formalmente que los ítems eran indicadores válidos de constructos latentes distintos como la “Satisfacción” y la “Lealtad”. En esencia, se ha validado el modelo de medida: se ha demostrado que los instrumentos de medición son sólidos.

Sin embargo, la validación del modelo de medida, aunque indispensable, no es el final del camino, sino el punto de partida para la pregunta más importante de la investigación: ¿cómo se relacionan estos constructos entre sí? ¿La “Satisfacción” influye realmente en la “Lealtad”? ¿Qué factores determinan la “Reputación Corporativa” de una empresa? Para responder a estas preguntas, que implican relaciones de causa y efecto entre múltiples variables latentes, hace falta la herramienta más potente y flexible del análisis multivariante: los modelos de ecuaciones estructurales (SEM).

TipUna nota para quien viene de SPSS

Ni el CB-SEM ni el PLS-SEM forman parte de SPSS base. SPSS dispone de un módulo independiente, AMOS, orientado al CB-SEM; el PLS-SEM no tiene representación en el ecosistema IBM SPSS y su software de referencia es SmartPLS. En R, el paquete lavaan cubre el CB-SEM y seminr cubre el PLS-SEM, ambos con sintaxis y prestaciones equiparables —o superiores— a sus contrapartes comerciales.

El SEM es una técnica de segunda generación que permite especificar, estimar y probar modelos teóricos completos sobre las relaciones entre variables, observadas y latentes (Hair et al. 2019). Es la síntesis del análisis factorial (el modelo de medida) y la regresión múltiple (el modelo estructural), permitiendo analizar un sistema completo de interrelaciones de forma simultánea.

13.2 Las dos filosofías: CB-SEM y PLS-SEM

Dentro del SEM coexisten dos grandes familias, cada una con sus propios objetivos, algoritmos y supuestos. La elección entre ellas no es una cuestión de superioridad, sino de adecuación al objetivo de la investigación y a la naturaleza de los datos.

13.2.1 SEM basado en la covarianza (CB-SEM)

El SEM basado en la covarianza (Covariance-Based SEM) es el enfoque clásico y original del modelado de ecuaciones estructurales.

  • Objetivo principal: la confirmación de la teoría. Busca determinar en qué grado un modelo teórico propuesto a priori es capaz de reproducir la matriz de covarianzas observada en los datos. Pregunta clave: ¿es mi teoría compatible con la realidad de los datos?
  • Mecanismo: utiliza un estimador, habitualmente máxima verosimilitud, que minimiza la discrepancia entre la matriz de covarianzas observada y la implicada por el modelo teórico.
  • Requisitos: método exigente, de naturaleza confirmatoria. Requiere una base teórica sólida, muestras relativamente grandes (generalmente > 200 casos) y, en su forma clásica, asume normalidad multivariante.
  • Evaluación: un conjunto de índices de bondad de ajuste global (χ², CFI, TLI, RMSEA, SRMR) que evalúan el ajuste del modelo en su totalidad.
  • Software en R: lavaan.

13.2.2 SEM basado en mínimos cuadrados parciales (PLS-SEM)

El PLS-SEM (Partial Least Squares SEM) es un enfoque más reciente, con gran popularidad por su flexibilidad y orientación predictiva.

  • Objetivo principal: la predicción y explicación de la varianza. Busca maximizar la varianza explicada de los constructos dependientes (endógenos). Pregunta clave: ¿cuál es la capacidad predictiva del modelo y qué constructos son los predictores más importantes?
  • Mecanismo: un algoritmo iterativo basado en componentes que no reproduce la matriz de covarianzas, sino que optimiza la capacidad predictiva de las relaciones especificadas.
  • Requisitos: método flexible, de naturaleza predictiva y exploratoria. Funciona bien con muestras pequeñas, no requiere normalidad y maneja modelos de gran complejidad.
  • Evaluación: no se basa en índices de ajuste global; se centra en la calidad del modelo de medida (fiabilidad, validez convergente y discriminante) y, sobre todo, en la capacidad predictiva del modelo estructural (R², relevancia predictiva Q²) y la significación de los coeficientes de las rutas, determinada mediante técnicas de remuestreo como el bootstrapping.
  • Software en R: seminr.

13.2.3 Un resumen comparativo

Característica CB-SEM (confirmatorio) PLS-SEM (predictivo)
Objetivo principal Confirmación de la teoría, ajuste del modelo Predicción, explicación de la varianza
Pregunta clave ¿Se ajusta mi teoría a los datos? ¿Cuál es la capacidad predictiva del modelo?
Algoritmo Basado en la covarianza (MLE) Basado en componentes (PLS)
Tamaño muestral Grande (>200) Pequeño o grande
Supuesto de normalidad Requerido (forma clásica) No requerido
Complejidad del modelo Preferiblemente modelos sencillos Maneja modelos muy complejos
Evaluación principal Índices de bondad de ajuste global R², Q², significación de rutas (bootstrapping)
Naturaleza Confirmatoria Predictiva / exploratoria

Como resumen, Hair et al. (2021, 25) señalan que mientras el CB-SEM es principalmente una técnica de confirmación, el PLS-SEM se considera fundamentalmente una técnica de predicción.

13.3 Hoja de ruta de este capítulo

Con esta distinción en mente, el capítulo se estructura en cuatro partes: primero, los fundamentos teóricos y matices del CB-SEM; a continuación, un caso práctico completo con lavaan; después, la metodología del PLS-SEM, su algoritmo y criterios de evaluación; y por último, un caso práctico exhaustivo con seminr, aplicando el conocido modelo de reputación corporativa.

13.4 Profundizando en el SEM basado en la covarianza (CB-SEM)

El CB-SEM es el enfoque clásico y confirmatorio del modelado de ecuaciones estructurales: su lógica consiste en probar teorías. Mientras otras técnicas exploran los datos para encontrar patrones, el CB-SEM somete una teoría preexistente a un riguroso escrutinio estadístico.

13.4.1 El principio fundamental: la reproducción de la matriz de covarianzas

Los datos observados tienen una “huella dactilar” única: su matriz de varianzas y covarianzas, que contiene toda la información sobre cómo se relacionan las variables entre sí. El modelo teórico, con sus constructos latentes y flechas causales, implica a su vez una huella dactilar teórica: una matriz de covarianzas implicada por el modelo.

El principio fundamental del CB-SEM es comparar ambas huellas. El algoritmo —habitualmente máxima verosimilitud— estima los parámetros del modelo (cargas factoriales, coeficientes de rutas…) para que la matriz implicada se parezca lo máximo posible a la observada. La pregunta que responde el CB-SEM es: ¿en qué grado la estructura de relaciones teorizada es capaz de replicar las relaciones que realmente existen en los datos? Si la discrepancia entre ambas matrices es pequeña, se concluye que el modelo tiene buen ajuste y que la teoría es una representación plausible de la realidad (Kline 2016).

13.4.2 El proceso de modelado en dos etapas

Una de las prácticas más importantes y rigurosas en CB-SEM es el enfoque de modelado en dos etapas, propuesto por Anderson and Gerbing (1988): antes de probar las relaciones causales entre constructos (modelo estructural), hay que asegurarse de haberlos medido bien (modelo de medida). Es como construir un edificio: antes de poner el tejado (probar hipótesis), hay que asegurarse de que cimientos y pilares (las escalas de medida) son sólidos.

13.4.2.1 Etapa 1: validación del modelo de medida (AFC)

Esta etapa es, en esencia, la aplicación del AFC visto en el capítulo anterior, a menudo con todos los constructos del modelo a la vez. Responde a tres preguntas:

  • Validez convergente: ¿los ítems que se supone que miden un mismo constructo convergen realmente en él? Se evalúa con la magnitud y significación de las cargas factoriales y la varianza extraída media (AVE).
  • Validez discriminante: ¿son los constructos latentes realmente distintos entre sí? Se evalúa comprobando que la correlación entre constructos no sea excesivamente alta.
  • Fiabilidad: ¿son las escalas internamente consistentes? Se evalúa con la fiabilidad compuesta (ρc), el análogo del alfa de Cronbach en el entorno SEM.

Solo cuando el modelo de medida tiene buen ajuste y cumple los criterios de fiabilidad y validez se puede proceder a la segunda etapa. Si el modelo de medida es deficiente, cualquier conclusión sobre el modelo estructural carece de fundamento.

13.4.2.2 Etapa 2: prueba del modelo estructural

Validados los cimientos, se pasa a probar el “tejado”: las hipótesis causales entre constructos latentes. Se añaden las flechas direccionales entre constructos (por ejemplo, de “Satisfacción” a “Lealtad”) y se evalúa el modelo completo:

  • ¿El modelo estructural completo sigue teniendo buen ajuste global?
  • ¿Son significativos estadísticamente los coeficientes de las rutas (las hipótesis)?
  • ¿Cuál es la magnitud y dirección de estos efectos?
  • ¿Cuánta varianza de los constructos dependientes (endógenos) explica el modelo (el )?

13.4.3 Conceptos técnicos clave en CB-SEM

13.4.3.1 Identificación del modelo

Un modelo debe estar identificado para poder estimarse: debe haber suficiente información en los datos (varianzas y covarianzas observadas) para estimar una única solución de cada parámetro.

  • Subidentificado: más parámetros que información disponible. El modelo no tiene solución.
  • Justo-identificado: exactamente la misma cantidad de información que de parámetros. El modelo tiene una única solución, pero se ajusta perfectamente a los datos, por lo que no se puede probar su ajuste.
  • Sobreidentificado: más información en los datos que parámetros a estimar. Es el objetivo deseado: el modelo tiene grados de libertad positivos, lo que permite contrastar estadísticamente su bondad de ajuste.

13.4.3.2 Métodos de estimación

El método estándar es máxima verosimilitud (ML), eficiente pero asumiendo normalidad multivariante. Cuando este supuesto se viola —algo común— se usan estimadores robustos, como máxima verosimilitud robusta (MLR o MLM), que ajustan tanto el test chi-cuadrado como los errores estándar de los parámetros para tener en cuenta la falta de normalidad (Byrne 2016).

13.4.3.3 Modificación del modelo y los índices de modificación

¿Qué hacer si el modelo inicial no se ajusta bien a los datos? El software proporciona índices de modificación (IM), que indican cuánto mejoraría el chi-cuadrado del modelo si se liberase un parámetro previamente fijado (por ejemplo, permitiendo que un ítem cargue en un segundo factor, o que los errores de dos ítems se correlacionen).

ImportantAdvertencia metodológica

El uso de los índices de modificación debe ser extremadamente cauto y siempre guiado por la teoría. Modificar un modelo basándose únicamente en los IM más altos es una práctica peligrosa que puede capitalizar el azar de la muestra y producir un modelo que no se replicará en futuros estudios (Hair et al. 2019) —el equivalente a una “expedición de pesca” estadística. Cualquier modificación debe tener un sólido respaldo teórico antes de implementarse.

13.4.4 Casos de uso principales para el CB-SEM

Dada su naturaleza confirmatoria y su rigor, el CB-SEM es la herramienta de elección para:

  • Validación de teorías: probar modelos complejos derivados de la literatura en psicología, marketing o sociología.
  • Validación de escalas de medida: el método estándar para desarrollar y validar instrumentos psicométricos.
  • Análisis de mediación y moderación: probar hipótesis sobre cómo una variable mediadora transmite el efecto de otra, o cómo una moderadora altera la fuerza de una relación.
  • Pruebas de invarianza de medida: comprobar si una escala funciona igual en distintos grupos (hombres y mujeres, distintos países).

El CB-SEM es una metodología exigente pero potente: requiere una teoría clara y bien fundamentada antes de acercarse a los datos, y como recompensa somete esa teoría a una de las pruebas estadísticas más completas y rigurosas disponibles.

13.5 Aplicación práctica: probando un modelo de satisfacción y lealtad del cliente

El capítulo anterior validó un modelo de medida de dos factores, demostrando que las escalas para “Satisfacción” y “Lealtad” eran fiables y válidas: se cumplió con éxito la etapa 1 del enfoque de modelado en dos etapas. Toca ahora la etapa 2: probar el modelo estructural y responder a la pregunta de investigación fundamental.

13.5.1 Objetivo de la investigación

Objetivo: utilizar el CB-SEM para probar formalmente la hipótesis de que la “satisfacción del cliente” (constructo latente exógeno) tiene un efecto positivo y estadísticamente significativo sobre la “lealtad del cliente” (constructo latente endógeno).

13.5.2 Preparación de los datos

Se trabaja con el mismo conjunto de datos de 300 clientes y 7 ítems validado en el capítulo de AFC. Es crucial partir de un modelo de medida ya validado para que las conclusiones sobre el modelo estructural sean fiables.

Code
# Recreate exactly the same dataset used in the CFA chapter, for consistency
set.seed(42)
n <- 300

cor_matrix    <- matrix(c(1, 0.6, 0.6, 1), nrow = 2)
latent_traits <- MASS::mvrnorm(n, mu = c(0, 0), Sigma = cor_matrix, empirical = TRUE)

latent_satisfaction <- latent_traits[, 1]
latent_loyalty       <- latent_traits[, 2]

sem_data <- data.frame(
  sat1_overall      = 7 + 0.85 * latent_satisfaction + rnorm(n, 0, 0.5),
  sat2_expectations = 7 + 0.80 * latent_satisfaction + rnorm(n, 0, 0.6),
  sat3_ideal        = 7 + 0.90 * latent_satisfaction + rnorm(n, 0, 0.4),
  sat4_recommend    = 7 + 0.82 * latent_satisfaction + rnorm(n, 0, 0.5),
  loy1_repurchase   = 6 + 0.88 * latent_loyalty + rnorm(n, 0, 0.5),
  loy2_exclusivity  = 6 + 0.82 * latent_loyalty + rnorm(n, 0, 0.6),
  loy3_future       = 6 + 0.91 * latent_loyalty + rnorm(n, 0, 0.4)
)

sem_data <- as.data.frame(lapply(sem_data, function(x) round(pmin(10, pmax(1, x)))))

13.5.3 Ejecución del análisis: el enfoque en dos etapas

13.5.3.1 Etapa 1: revalidación del modelo de medida (AFC)

Aunque ya se hizo, es buena práctica comenzar siempre confirmando que el modelo de medida (el AFC de dos factores correlacionados) sigue siendo válido, asegurando que los cimientos son sólidos antes de construir sobre ellos:

Code
measurement_model <- '
  Satisfaccion =~ sat1_overall + sat2_expectations + sat3_ideal + sat4_recommend
  Lealtad =~ loy1_repurchase + loy2_exclusivity + loy3_future
'

measurement_fit <- lavaan::cfa(measurement_model, data = sem_data)

lavaan::fitMeasures(measurement_fit, c("chisq", "df", "pvalue", "cfi", "tli", "rmsea", "srmr"))
 chisq     df pvalue    cfi    tli  rmsea   srmr 
13.294 13.000  0.425  1.000  1.000  0.009  0.022 

Los índices de ajuste son excelentes (CFI/TLI > 0,95, RMSEA < 0,06, SRMR < 0,08, p-valor de chi-cuadrado no significativo), confirmando que el modelo de medida es robusto. Se puede proceder con confianza a la etapa 2.

13.5.3.2 Etapa 2: especificación y estimación del modelo estructural

Se extiende el modelo para incluir la hipótesis causal, añadiendo una regresión (~) que especifica que Lealtad es predicha por Satisfaccion:

Code
structural_model <- '
  # Measurement model (same as above)
  Satisfaccion =~ sat1_overall + sat2_expectations + sat3_ideal + sat4_recommend
  Lealtad =~ loy1_repurchase + loy2_exclusivity + loy3_future

  # Structural model (the causal hypothesis)
  Lealtad ~ Satisfaccion
'

structural_fit <- lavaan::sem(structural_model, data = sem_data)

13.5.4 Interpretación de los resultados del modelo estructural

Code
summary(structural_fit, fit.measures = TRUE, standardized = TRUE, rsquare = TRUE)
Length  Class   Mode 
     1 lavaan     S4 

13.5.4.1 Evaluación del ajuste global del modelo estructural

  • Test chi-cuadrado: χ² = 13.29 con 13 grados de libertad, p = 0.425. El ajuste sigue siendo excelente.
  • CFI, TLI, RMSEA, SRMR: 1, 1, 0.009 y 0.022 respectivamente: prácticamente idénticos a los del modelo de medida, todos indicando ajuste excelente.

Conclusión del ajuste global: el modelo teórico, que postula una relación causal de la satisfacción a la lealtad, es altamente compatible con los datos observados.

13.5.4.2 Evaluación de las hipótesis (el modelo estructural)

Code
lavaan::parameterEstimates(structural_fit, standardized = TRUE) |>
  dplyr::filter(op == "~")
      lhs op          rhs   est    se     z pvalue ci.lower ci.upper std.lv
1 Lealtad  ~ Satisfaccion 0.586 0.059 9.902      0     0.47    0.703  0.628
  std.all
1   0.628

Interpretación: la tabla muestra la ruta Lealtad ~ Satisfaccion. El coeficiente estandarizado es 0.63 (análogo a un coeficiente Beta de regresión): por cada aumento de una desviación típica en la satisfacción, la lealtad aumenta 0.63 desviaciones típicas — un efecto de gran magnitud. El p-valor es < 0,001: el efecto es altamente significativo.

Conclusión de la hipótesis: la evidencia estadística respalda firmemente la hipótesis. Existe una relación positiva y significativa entre la satisfacción del cliente y su lealtad.

13.5.4.3 Evaluación de la varianza explicada (R²)

El R² del constructo endógeno Lealtad es 0.39: el modelo explica el 39% de la varianza en la lealtad del cliente. La satisfacción es un predictor muy potente de la lealtad.

13.5.5 Visualización del modelo estructural final

Code
semPlot::semPaths(structural_fit,
                  what          = "std",
                  layout        = "tree2",
                  edge.label.cex = 0.9,
                  residuals     = TRUE,
                  intercepts    = FALSE,
                  rotation      = 2)
Figure 13.1: Diagrama de ruta del modelo estructural completo

El diagrama muestra el modelo completo: los dos modelos de medida validados y, lo más importante, la flecha direccional de Satisfaccion a Lealtad, con su coeficiente estandarizado de 0.63, confirmando visualmente la hipótesis principal.

13.5.6 Conclusiones

Siguiendo el riguroso enfoque en dos etapas del CB-SEM, se ha ido más allá de la simple correlación para probar una hipótesis direccional:

  1. Primero, se validó el modelo de medida, asegurando que se medía de forma fiable y válida tanto la “satisfacción” como la “lealtad”.
  2. Después, se probó el modelo estructural, encontrando un excelente ajuste a los datos y confirmando que la satisfacción del cliente tiene un efecto causal positivo y muy fuerte sobre la lealtad del cliente.

Este análisis no solo aporta confianza en la teoría, sino también una visión estratégica clara: para una empresa que busca fomentar la lealtad, las iniciativas orientadas a aumentar la satisfacción del cliente son una inversión con un retorno estadísticamente demostrable.

13.6 SEM basado en mínimos cuadrados parciales (PLS-SEM)

Tras el riguroso mundo confirmatorio del CB-SEM, se aborda ahora su contraparte predictiva y flexible: el SEM basado en mínimos cuadrados parciales. El PLS-SEM no es simplemente una “alternativa” al CB-SEM para cuando los datos no son normales; es una metodología con una filosofía, un objetivo y un algoritmo fundamentalmente diferentes. Su propósito no es probar si una teoría es correcta en sentido absoluto, sino desarrollar modelos teóricos con una alta capacidad predictiva (Hair et al. 2021).

13.6.1 El principio fundamental: la maximización de la varianza explicada

A diferencia del CB-SEM, centrado en reproducir la matriz de covarianzas, el PLS-SEM se centra en la predicción. Su algoritmo maximiza la varianza explicada (el R²) de los constructos endógenos del modelo. La lógica es más cercana a una serie de regresiones interconectadas que a un análisis de estructuras de covarianza. El PLS-SEM busca responder: ¿cuál es la capacidad de los constructos predictores para explicar la variabilidad de los constructos resultado?

El algoritmo PLS funciona de forma iterativa en dos etapas:

  1. Estimación de las puntuaciones de los constructos latentes: el algoritmo estima las puntuaciones de cada constructo latente como una combinación lineal ponderada de sus indicadores (el modelo de medida), en un proceso iterativo que alterna entre indicadores y puntuaciones latentes hasta que los pesos convergen.
  2. Estimación de los coeficientes de las rutas: una vez estimadas las puntuaciones de los constructos latentes, el algoritmo ejecuta una serie de regresiones por mínimos cuadrados ordinarios para estimar los coeficientes de las rutas entre constructos (el modelo estructural).

Este proceso, repetido hasta la convergencia global, es lo que permite al PLS-SEM ser tan flexible y no depender de supuestos distribucionales (Wold 1982).

13.6.2 La gran ventaja: modelos de medida formativos

Una de las capacidades más distintivas del PLS-SEM es su habilidad para manejar modelos de medida formativos. Hasta ahora solo se ha hablado de modelos reflectivos, donde los indicadores son un “reflejo” del constructo latente (las flechas van del constructo a los ítems). En muchas áreas, sin embargo, los constructos se forman a partir de sus indicadores.

  • Modelo reflectivo: los indicadores son intercambiables y deben estar altamente correlacionados. Ejemplo: “satisfecho con el servicio”, “volvería a comprar” y “lo recomendaría” son todos reflejos de un constructo subyacente de “Satisfacción”.
  • Modelo formativo: los indicadores son las “causas” o “ingredientes” que definen el constructo, y no necesitan estar correlacionados. Ejemplo: el constructo “Estrés laboral” puede ser formado por “presión de tiempo”, “conflictos con el jefe” y “baja remuneración” — tres indicadores que no tienen por qué estar correlacionados entre sí, pero que juntos definen el nivel de estrés.

El CB-SEM tiene grandes dificultades para estimar modelos formativos, mientras que el PLS-SEM está diseñado para manejarlos con eficacia, abriendo un abanico de posibilidades teóricas que de otro modo serían intratables (Hair et al. 2021).

13.6.3 El proceso de evaluación en PLS-SEM: un camino de dos etapas

La evaluación de un modelo PLS-SEM es sistemática y jerárquica. Es fundamental seguir los pasos en orden, ya que evaluar el modelo estructural solo tiene sentido si el modelo de medida es sólido (Sarstedt et al. 2020).

13.6.3.1 Etapa 1: evaluación del modelo de medida reflectivo

Antes de mirar las hipótesis, hay que asegurar la calidad de las mediciones.

  1. Fiabilidad de los indicadores: se evalúa mediante las cargas (loadings) de cada ítem en su constructo. La regla general es que las cargas estandarizadas deben ser > 0,708 (su cuadrado, 0,708² ≈ 0,50, significa que el constructo explica más del 50% de la varianza del ítem).
  2. Fiabilidad de consistencia interna: se evalúa con el alfa de Cronbach, pero se prefiere la fiabilidad compuesta (ρc), que no asume que todas las cargas de los indicadores sean iguales. Los valores de ρc deben estar entre 0,70 y 0,95.
  3. Validez convergente: mide el grado en que un constructo explica la varianza de sus propios indicadores. Se evalúa con la varianza extraída media (AVE); un valor AVE > 0,50 confirma la validez convergente.
  4. Validez discriminante: crucial para demostrar que un constructo es empíricamente distinto de los demás. El criterio moderno y más fiable es el HTMT (Heterotrait-Monotrait Ratio of Correlations), una estimación de la correlación entre constructos si se midieran sin error. El valor de HTMT entre dos constructos debe ser < 0,90 (o < 0,85 si los constructos son conceptualmente muy similares) (Henseler et al. 2015).

13.6.3.2 Etapa 2: evaluación del modelo estructural

Satisfactorio el modelo de medida, se procede a probar las hipótesis.

  1. Evaluación de la colinealidad: se comprueba que no haya colinealidad entre los constructos predictores que apuntan a un mismo constructo dependiente, calculando los VIF, que deben ser < 5 (idealmente < 3).
  2. Coeficientes de las rutas (path coefficients): representan las hipótesis del modelo. Se evalúa su signo, magnitud y, sobre todo, su significación estadística. Como el PLS-SEM es no paramétrico, la significación no puede asumirse teóricamente: se determina mediante bootstrapping, una técnica de remuestreo que genera un gran número de submuestras de los datos originales para estimar la distribución del coeficiente y calcular su p-valor.
  3. Coeficiente de determinación (R²): mide la varianza de un constructo endógeno explicada por sus predictores. Como regla general en marketing, valores de R² de 0,75, 0,50 y 0,25 se consideran, respectivamente, sustanciales, moderados y débiles (Hair et al. 2019).
  4. Relevancia predictiva (Q²): mientras el R² mide el poder explicativo dentro de la muestra, el Q² de Stone-Geisser evalúa la relevancia predictiva fuera de la muestra, calculado mediante un procedimiento de remuestreo llamado blindfolding. Un valor Q² > 0 para un constructo endógeno indica que el modelo tiene relevancia predictiva para ese constructo.

13.6.4 Casos de uso principales para el PLS-SEM

El PLS-SEM es la metodología de elección cuando:

  • El objetivo de la investigación es la predicción o la identificación de los principales factores determinantes.
  • El modelo estructural es complejo, con un gran número de constructos e indicadores.
  • Los datos no cumplen el supuesto de normalidad.
  • El tamaño de la muestra es pequeño.
  • El modelo incluye constructos formativos.
  • La investigación se encuentra en una etapa exploratoria del desarrollo de una teoría.

El PLS-SEM ofrece un enfoque robusto y flexible para el modelado de ecuaciones estructurales, con fuerte énfasis en la predicción y la aplicabilidad práctica. Su riguroso proceso de evaluación en dos etapas garantiza conclusiones tanto estadísticamente sólidas como teóricamente significativas.

13.7 Aplicación práctica: el modelo de reputación corporativa con PLS-SEM

Se llega al punto final de este recorrido, donde se aplica la metodología PLS-SEM para probar un modelo teórico completo. Se utiliza como caso de estudio el modelo de reputación corporativa, un ejemplo canónico detallado en la obra de referencia de Hair et al. (2021), y que sirve como resumen práctico de la metodología desarrollada en este capítulo.

13.7.1 Objetivo de la investigación

Una empresa de telecomunicaciones desea entender los factores que construyen la satisfacción y la lealtad de sus clientes. El modelo teórico postula que la percepción de Competencia (COMP) y Simpatía (LIKE) de la empresa influyen positivamente en la Satisfacción del cliente (CUSA), y que esta, a su vez, fomenta la Lealtad del cliente (CUSL).

Objetivo: utilizar PLS-SEM para estimar y validar el modelo de reputación corporativa, evaluando tanto la calidad de las escalas de medida como la capacidad predictiva del modelo estructural para explicar la satisfacción y la lealtad del cliente.

13.7.2 Preparación de los datos y especificación del modelo

Se utiliza el conjunto de datos corp_rep_data, incluido en el paquete seminr, con las respuestas de 344 clientes a una encuesta de reputación corporativa de una empresa de telecomunicaciones:

Code
corp_rep_data <- seminr::corp_rep_data

dplyr::glimpse(corp_rep_data[, c("comp_1", "comp_2", "comp_3",
                                 "like_1", "like_2", "like_3",
                                 "cusa", "cusl_1", "cusl_2", "cusl_3")])
Rows: 344
Columns: 10
$ comp_1 <int> 4, 6, 4, 6, 6, 3, 7, 6, 5, 6, 4, 3, 3, 5, 3, 3, 6, 6, 6, 5, 2, …
$ comp_2 <int> 5, 7, 5, 4, 4, 4, 5, 6, 7, 5, 4, 6, 3, 7, 7, 3, 7, 7, 7, 6, 3, …
$ comp_3 <int> 5, 6, 2, 4, 6, 4, 7, 6, 6, 5, 4, 2, 4, 7, 7, 3, 6, 6, 7, 6, 3, …
$ like_1 <int> 3, 6, 5, 6, 6, 6, 4, 4, 7, 6, 4, 4, 2, 3, 6, 3, 3, 6, 5, 5, 1, …
$ like_2 <int> 1, 6, 5, 5, 6, 7, 1, 3, 5, 6, 4, 6, 4, 4, 4, 2, 5, 7, 6, 6, 1, …
$ like_3 <int> 2, 6, 5, 6, 7, 7, 7, 4, 7, 6, 4, 5, 4, 7, 7, 3, 3, 6, 6, 6, 1, …
$ cusa   <int> 5, 7, 6, 6, 6, 6, 7, 4, 6, 6, 3, 4, 4, 5, 5, 4, 4, 6, 7, 6, 6, …
$ cusl_1 <int> 5, 7, 7, 7, 6, 7, 7, 5, 5, 6, 4, 4, 4, 7, 4, 4, 2, 6, 6, 5, 3, …
$ cusl_2 <int> 3, 7, 7, 7, 7, 7, 7, 4, 7, 6, 2, 5, 5, 7, 1, 4, 1, 6, 7, 5, 3, …
$ cusl_3 <int> 3, 7, 5, 7, 7, 7, 7, 6, 7, 7, 1, 6, 5, 7, 1, 4, 3, 7, 7, 5, 7, …

Cada constructo del modelo se mide con varios ítems (indicadores), salvo Satisfaccion (CUSA), que se mide con un único ítem:

  • Competencia (COMP): 3 ítems (comp_1, comp_2, comp_3).
  • Simpatía (LIKE): 3 ítems (like_1, like_2, like_3).
  • Satisfacción (CUSA): 1 ítem (cusa).
  • Lealtad (CUSL): 3 ítems (cusl_1, cusl_2, cusl_3).

13.7.2.1 Paso 1: especificación del modelo de medida

En seminr, el modelo de medida se especifica con la función constructs(), indicando para cada constructo si es de tipo composite() (el modo estándar en PLS-SEM, aplicable tanto a indicadores reflectivos como formativos) y qué ítems lo componen, usando multi_items() para varios ítems con un prefijo común, o single_item() para un único indicador:

Code
measurement_model_pls <- seminr::constructs(
  seminr::composite("COMP", seminr::multi_items("comp_", 1:3)),
  seminr::composite("LIKE", seminr::multi_items("like_", 1:3)),
  seminr::composite("CUSA", seminr::single_item("cusa")),
  seminr::composite("CUSL", seminr::multi_items("cusl_", 1:3))
)

13.7.2.2 Paso 2: especificación del modelo estructural

El modelo estructural se especifica con relationships(), definiendo las rutas causales entre constructos mediante paths(). La teoría postula que Competencia y Simpatía predicen la Satisfacción, y que la Satisfacción predice la Lealtad:

Code
structural_model_pls <- seminr::relationships(
  seminr::paths(from = c("COMP", "LIKE"), to = "CUSA"),
  seminr::paths(from = "CUSA", to = "CUSL")
)

13.7.2.3 Paso 3: estimación del modelo

Code
pls_model <- seminr::estimate_pls(
  data              = corp_rep_data,
  measurement_model = measurement_model_pls,
  structural_model  = structural_model_pls,
  missing_value     = -99
)
Generating the seminr model
All 344 observations are valid.
Code
pls_summary <- summary(pls_model)

13.7.3 Evaluación del modelo de medida reflectivo (etapa 1)

13.7.3.1 Fiabilidad de los indicadores: cargas factoriales

Code
pls_summary$loadings
        COMP  LIKE  CUSA  CUSL
comp_1 0.863 0.000 0.000 0.000
comp_2 0.795 0.000 0.000 0.000
comp_3 0.813 0.000 0.000 0.000
like_1 0.000 0.884 0.000 0.000
like_2 0.000 0.866 0.000 0.000
like_3 0.000 0.841 0.000 0.000
cusa   0.000 0.000 1.000 0.000
cusl_1 0.000 0.000 0.000 0.822
cusl_2 0.000 0.000 0.000 0.918
cusl_3 0.000 0.000 0.000 0.852

Todas las cargas estandarizadas superan el umbral de 0,708, indicando que cada indicador comparte más del 50% de su varianza con su constructo correspondiente: la fiabilidad de los indicadores es satisfactoria.

13.7.3.2 Fiabilidad de consistencia interna y validez convergente

Code
pls_summary$reliability
     alpha  rhoA  rhoC   AVE
COMP 0.776 0.844 0.864 0.679
LIKE 0.831 0.841 0.898 0.747
CUSA 1.000 1.000 1.000 1.000
CUSL 0.831 0.842 0.899 0.748

Alpha, rhoA, and rhoC should exceed 0.7 while AVE should exceed 0.5
  • Fiabilidad compuesta (rhoC): todos los constructos presentan valores entre 0,70 y 0,95, cumpliendo el criterio de fiabilidad de consistencia interna.
  • AVE: todos los constructos superan el umbral de 0,50, confirmando la validez convergente.

13.7.3.3 Validez discriminante: ratio HTMT

Code
pls_summary$validity$htmt
      COMP  LIKE  CUSA CUSL
COMP     .     .     .    .
LIKE 0.780     .     .    .
CUSA 0.465 0.577     .    .
CUSL 0.532 0.737 0.755    .

Todos los valores HTMT entre pares de constructos están por debajo de 0,90, confirmando que los constructos son empíricamente distintos entre sí: se cumple la validez discriminante.

Conclusión de la etapa 1: el modelo de medida es satisfactorio en fiabilidad, validez convergente y validez discriminante. Se puede proceder a evaluar el modelo estructural con confianza.

13.7.4 Evaluación del modelo estructural (etapa 2)

13.7.4.1 Colinealidad

Code
pls_summary$vif_antecedents
CUSA :
COMP LIKE 
1.72 1.72 

CUSL :
CUSA 
   . 

Todos los VIF están muy por debajo de 5: no hay problemas de colinealidad entre los constructos predictores.

13.7.4.2 Significación de los coeficientes de las rutas: bootstrapping

Como el PLS-SEM es no paramétrico, la significación de los coeficientes se determina mediante bootstrapping, remuestreando los datos originales un gran número de veces (aquí, 1.000 submuestras):

Code
set.seed(123)

pls_boot <- seminr::bootstrap_model(seminr_model = pls_model, nboot = 1000, cores = NULL)
Bootstrapping model using seminr...
SEMinR Model successfully bootstrapped
Code
boot_summary <- summary(pls_boot)
boot_summary$bootstrapped_paths
               Original Est. Bootstrap Mean Bootstrap SD T Stat. 2.5% CI
COMP  ->  CUSA         0.163          0.166        0.065   2.525   0.043
LIKE  ->  CUSA         0.424          0.423        0.060   7.089   0.307
CUSA  ->  CUSL         0.690          0.691        0.033  20.734   0.621
               97.5% CI Bootstrap P Val
COMP  ->  CUSA    0.290           0.006
LIKE  ->  CUSA    0.544           0.000
CUSA  ->  CUSL    0.750           0.000

Todas las rutas del modelo (COMP → CUSA, LIKE → CUSA, CUSA → CUSL) son estadísticamente significativas (los intervalos de confianza bootstrap no incluyen el cero), confirmando las tres hipótesis del modelo teórico.

13.7.4.3 Coeficiente de determinación (R²)

Code
pls_summary$paths
        CUSA  CUSL
R^2    0.296 0.476
AdjR^2 0.292 0.475
COMP   0.163     .
LIKE   0.424     .
CUSA       . 0.690

El R² de CUSA (Satisfacción) indica la proporción de su varianza explicada por Competencia y Simpatía conjuntamente; el R² de CUSL (Lealtad) indica la varianza explicada por la Satisfacción. Siguiendo la guía de Hair et al. (2019), ambos valores se sitúan en el rango moderado-sustancial, confirmando un buen poder explicativo del modelo.

13.7.4.4 Relevancia predictiva (Q²)

Code
pls_predict <- seminr::predict_pls(model = pls_model, technique = seminr::predict_DA)

summary(pls_predict)

PLS in-sample metrics:
      cusa cusl_1 cusl_2 cusl_3
RMSE 0.984  1.272  1.311  1.326
MAE  0.768  0.966  0.967  0.946

PLS out-of-sample metrics:
      cusa cusl_1 cusl_2 cusl_3
RMSE 0.995  1.279  1.318  1.334
MAE  0.776  0.971  0.972  0.951

LM in-sample metrics:
      cusa cusl_1 cusl_2 cusl_3
RMSE 0.967  1.271  1.311  1.326
MAE  0.759  0.969  0.962  0.944

LM out-of-sample metrics:
      cusa cusl_1 cusl_2 cusl_3
RMSE 0.991  1.279  1.318  1.335
MAE  0.777  0.975  0.968  0.950

Construct Level metrics:
         CUSA    CUSL
IS_MSE  0.702 0.52208
IS_MAE  0.654 0.53494
OOS_MSE 0.713 0.52385
OOS_MAE 0.659 0.53570
overfit 0.016 0.00338

Los valores Q² positivos para los constructos endógenos (CUSA y CUSL) confirman que el modelo tiene relevancia predictiva fuera de la muestra, no solo capacidad explicativa dentro de ella.

13.7.5 Visualización del modelo

Code
plot(pls_model)
Figure 13.2: Diagrama del modelo de reputación corporativa (PLS-SEM)

El diagrama muestra los cuatro constructos del modelo, sus indicadores y las rutas estructurales estimadas, con los coeficientes de ruta y los valores R² de los constructos endógenos.

13.7.6 Conclusiones

El análisis del modelo de reputación corporativa mediante PLS-SEM ha seguido el riguroso proceso de evaluación en dos etapas:

  1. El modelo de medida es sólido: todos los indicadores muestran fiabilidad individual adecuada, los constructos presentan fiabilidad de consistencia interna y validez convergente satisfactorias, y se confirma la validez discriminante entre todos los pares de constructos.

  2. El modelo estructural confirma la teoría: tanto la Competencia como la Simpatía percibidas son predictores significativos de la Satisfacción del cliente, y la Satisfacción es, a su vez, un predictor significativo de la Lealtad. El modelo presenta un poder explicativo y predictivo adecuado para ambos constructos endógenos.

Este caso práctico cierra el recorrido por el análisis multivariante con la técnica más completa y flexible disponible: los modelos de ecuaciones estructurales permiten integrar en un único análisis la validación de las escalas de medida y la prueba de las relaciones causales entre los constructos teóricos que las escalas representan, uniendo en un solo marco todo lo aprendido en este libro sobre fiabilidad, validez y modelado de relaciones entre variables.