A menudo, después de recoger los datos, no está claro qué prueba estadística hay que aplicar. Por suerte, en la mayoría de los análisis básicos basta con responder tres preguntas para dar con la prueba adecuada. En este artículo resumimos esas preguntas, una tabla de decisión y los supuestos de cada prueba junto con la forma de comprobarlos.
Tres preguntas que hay que responder primero
1. ¿De qué tipo es la variable de resultado?
- Continua (numérica): valores de los que se puede calcular una media, como la estatura, una puntuación, las ventas o el tiempo de reacción
- Categórica: valores que se reparten en categorías, como el sexo, si se compró o no, o la marca preferida. Los datos suelen resumirse como frecuencias (cuántas personas).
Las categorías con orden (ordinales), como una escala Likert de 5 puntos, suelen analizarse con pruebas no paramétricas si se trata de una sola pregunta, y como variables continuas si se trata de la puntuación sumada de varias preguntas.
2. ¿Cuántos grupos se comparan?
Comprueba si comparas un grupo con un valor de referencia, dos grupos entre sí o tres o más grupos. Si no se trata de comparar grupos sino de estudiar la relación entre dos variables, pasa a la correlación y la regresión.
3. ¿Las mediciones están emparejadas?
- Independientes: dos grupos formados por personas distintas (la clase A y la clase B)
- Emparejadas (relacionadas): cuando se mide dos veces a los mismos sujetos (antes y después) o cuando hay parejas definidas, como gemelos o matrimonios
Si se analizan datos emparejados con una prueba para muestras independientes, las diferencias individuales se mezclan con el error y la potencia cae mucho. A la inversa, analizar datos independientes con una prueba para muestras emparejadas es un error.
Tabla de decisión
| Objetivo | Datos | Prueba paramétrica | Alternativa no paramétrica |
|---|---|---|---|
| Comparar la media de un grupo con un valor de referencia | Continuos | Prueba t para una muestra | Prueba de rangos con signo de Wilcoxon |
| Comparar las medias de dos grupos independientes | Continuos | Prueba t para muestras independientes (Welch) | Prueba U de Mann-Whitney |
| Comparar dos mediciones emparejadas | Continuos | Prueba t para muestras emparejadas | Prueba de rangos con signo de Wilcoxon |
| Comparar las medias de tres o más grupos | Continuos | ANOVA de un factor | Prueba de Kruskal-Wallis |
| Si la distribución de una variable categórica se ajusta a proporciones esperadas | Categóricos | Prueba chi-cuadrado de bondad de ajuste | Prueba exacta multinomial·binomial |
| Si dos variables categóricas están relacionadas | Categóricos | Prueba chi-cuadrado de independencia | Prueba exacta de Fisher |
| Relación lineal entre dos variables continuas | Continuos | Correlación de Pearson, regresión simple | Correlación de rangos de Spearman |
Algunas aclaraciones:
- Para dos grupos independientes conviene usar por defecto la prueba t de Welch. La prueba t de Student, que supone varianzas iguales, distorsiona la tasa de error cuando las varianzas o los tamaños de los grupos difieren, mientras que la de Welch apenas pierde nada cuando las varianzas son iguales.
- No hagas varias pruebas t con tres o más grupos. Si contrastas cada par con α=0.05, la tasa global de error de tipo I aumenta. Primero se examina la diferencia global con un ANOVA y después se hacen pruebas post hoc.
- La comparación de dos proporciones (tasa de conversión A frente a B) puede hacerse con la prueba chi-cuadrado de independencia sobre una tabla 2×2, y el resultado coincide con el de la prueba z para dos proporciones.
Ejemplo: prueba chi-cuadrado de independencia 2×2
Se mostraron dos textos publicitarios a 50 personas cada uno y se registró si hicieron clic.
| Texto | Clic | Sin clic | Total |
|---|---|---|---|
| A | 30 | 20 | 50 |
| B | 18 | 32 | 50 |
| Total | 48 | 52 | 100 |
La variable de resultado (clic o no) es categórica y el texto también, así que se usa la prueba chi-cuadrado de independencia.
- Frecuencias esperadas:
total de fila × total de columna / total general. A·clic es50 × 48 / 100 = 24, A·sin clic es50 × 52 / 100 = 26, y para B también 24 y 26. (observado − esperado)² / esperadoen cada celda:(30−24)²/24 = 1.5,(20−26)²/26 ≈ 1.3846,(18−24)²/24 = 1.5,(32−26)²/26 ≈ 1.3846- Estadístico chi-cuadrado:
χ² ≈ 5.769 - Grados de libertad:
(número de filas − 1) × (número de columnas − 1) = 1 - Valor p: aprox.
0.0163(el valor crítico para α=0.05 es aprox. 3.841)
Como p < 0.05, se concluye que el texto y el clic están relacionados. La tasa de clics es del 60 % para A y del 36 % para B. Si a los mismos datos se les aplica la corrección de continuidad de Yates, se obtiene χ² ≈ 4.848 y p ≈ 0.0277, valores algo más conservadores. Conviene indicar en el informe qué método se usó.
Comprobación de supuestos
Toda prueba da un valor p exacto solo si se cumplen sus condiciones previas. Los supuestos principales y cómo comprobarlos son los siguientes.
Independencia
Es un supuesto común a todas las pruebas. Se incumple si las respuestas de una misma persona entran varias veces o si hay una estructura agrupada, como estudiantes de una misma clase. Más que comprobarlo con una prueba estadística, se juzga a partir del diseño de la recogida de datos.
Normalidad (prueba t, ANOVA, prueba de la correlación de Pearson)
- En sentido estricto, lo que debe ser aproximadamente normal no son los datos, sino la distribución de la media muestral. Gracias al teorema central del límite, con unas 30 observaciones o más por grupo la prueba t es bastante robusta, salvo que la distribución esté muy sesgada.
- Si la muestra es pequeña, revisa con un histograma, un diagrama de caja o un gráfico Q-Q que no haya una asimetría extrema ni valores atípicos.
- Las pruebas de normalidad como la de Shapiro-Wilk pasan por alto incumplimientos con muestras pequeñas y detectan diferencias triviales con muestras grandes, así que conviene juzgar junto con los gráficos.
Igualdad de varianzas
Si usas la prueba t de Welch, no tienes que preocuparte por este supuesto. En el ANOVA, comprueba si la razón entre las desviaciones estándar de los grupos supera 2 y, si difieren mucho, considera el ANOVA de Welch.
Frecuencias esperadas (prueba chi-cuadrado)
La prueba chi-cuadrado es un método aproximado y resulta imprecisa cuando las frecuencias esperadas son pequeñas. El criterio más usado es que todas las celdas tengan una frecuencia esperada de 5 o más (también se usa un criterio más flexible: "no más del 20 % de celdas con frecuencia esperada menor que 5 y ninguna menor que 1"). Si una tabla 2×2 no cumple el criterio, se usa la prueba exacta de Fisher. En el ejemplo anterior todas las frecuencias esperadas son de 24 o más, así que no hay problema.
Linealidad (correlación de Pearson, regresión)
Dibuja primero un diagrama de dispersión. Si la relación es curva, la r de Pearson la subestima. Si la relación es monótona, la correlación de Spearman es una alternativa.
¿Cuándo usar pruebas no paramétricas?
- Cuando la muestra es pequeña y la distribución está muy sesgada o hay valores atípicos
- Cuando los datos son rangos u ordinales
- Cuando interesa la mediana o la posición de la distribución
Las pruebas no paramétricas requieren menos supuestos, pero a cambio tienen algo menos de potencia cuando se cumple el supuesto de normalidad. Además, en sentido estricto la prueba U de Mann-Whitney no contrasta que "las medias sean iguales", así que hay que tener cuidado de no interpretar su resultado como una diferencia de medias.
Este sitio ofrece calculadoras de prueba t (una muestra, independientes con Welch y emparejadas), chi-cuadrado (bondad de ajuste e independencia) y correlación y regresión. Tras elegir el método con la tabla de decisión anterior, puedes calcularlo directamente en la calculadora correspondiente.
Resumen
- La prueba se determina con tres criterios: el tipo de variable de resultado (continua o categórica), el número de grupos comparados y si las mediciones están emparejadas.
- Para las medias de dos grupos independientes se usa la prueba t de Welch; para antes y después, la prueba t emparejada; para tres o más grupos, el ANOVA.
- La relación entre dos variables categóricas se analiza con la prueba chi-cuadrado de independencia; la tabla 2×2 del ejemplo da
χ² ≈ 5.769, 1 grado de libertad yp ≈ 0.0163. - En la prueba chi-cuadrado, comprueba que las frecuencias esperadas sean de 5 o más y, si no lo son, usa la prueba exacta de Fisher.
- Si los supuestos se incumplen de forma importante, considera alternativas no paramétricas como Wilcoxon, Mann-Whitney, Kruskal-Wallis o Spearman.