El valor p aparece en informes de investigación, resultados de pruebas A/B y artículos científicos, pero también es el estadístico que con más frecuencia se interpreta mal. Tanto es así que en 2016 la Asociación Estadounidense de Estadística (ASA) publicó una declaración oficial específica sobre su uso correcto. En este artículo partimos de la definición exacta del valor p y repasamos con ejemplos los malentendidos habituales y la forma correcta de informar.
Definición del valor p
El valor p se define así:
Suponiendo que la hipótesis nula es cierta, la probabilidad de obtener un resultado tan extremo como el observado o más extremo aún
Lo esencial es la condición inicial. El valor p se calcula bajo el supuesto de que "la hipótesis nula es correcta", así que no dice cuál es la probabilidad de que ese supuesto sea cierto. Un valor p pequeño significa que "si la hipótesis nula fuera correcta, datos como estos aparecerían rara vez", es decir, que los datos no encajan bien con la hipótesis nula.
Ejemplo: comparación de las medias de dos grupos
Supongamos que las puntuaciones del grupo A, que usó un nuevo método de estudio, y del grupo B, que usó el método habitual, son las siguientes (8 personas en cada grupo).
- A:
72, 75, 78, 80, 74, 77, 79, 81 - B:
70, 71, 74, 73, 69, 72, 75, 68
La hipótesis nula es "las medias poblacionales de ambos grupos son iguales" y la alternativa, "son diferentes". Usaremos la prueba t de Welch, que no supone varianzas iguales.
- Medias:
x̄_A = 77.0,x̄_B = 71.5, diferencia5.5 - Desviaciones estándar muestrales:
s_A ≈ 3.1168,s_B ≈ 2.4495 - Error estándar:
SE = √(s_A²/n_A + s_B²/n_B) = √(9.7143/8 + 6.0000/8) = √1.9643 ≈ 1.4015 - Estadístico de prueba:
t = 5.5 / 1.4015 ≈ 3.924 - Grados de libertad de Welch: aprox.
13.26 - Valor p bilateral: aprox.
0.0017
La interpretación es la siguiente: "Si las medias poblacionales de los dos métodos fueran realmente iguales, la probabilidad de que la diferencia entre las medias muestrales fuera de 5.5 puntos o más (en cualquier dirección) sería de aproximadamente el 0.17 %". Como es mucho menor que el nivel de significación de 0.05, se rechaza la hipótesis nula.
El nivel de significación α
El nivel de significación α es un criterio que se fija antes de ver los datos. Si p ≤ α, se rechaza la hipótesis nula. α es la proporción máxima que se tolera del error de rechazar la hipótesis nula cuando es cierta (error de tipo I); por convención se usa mucho 0.05, aunque según la disciplina y la situación también se emplean 0.01 o 0.10.
α y el valor p son conceptos distintos. α es la tasa de error a largo plazo del procedimiento de prueba, mientras que el valor p expresa en qué medida los datos concretos se apartan de la hipótesis nula.
5 errores comunes
1. "El valor p es la probabilidad de que la hipótesis nula sea cierta"
No. p = 0.0017 no significa que "la probabilidad de que la hipótesis nula sea cierta es del 0.17 %". El valor p es la probabilidad de los datos bajo la condición de que la hipótesis nula es cierta, mientras que la probabilidad de que la hipótesis nula sea cierta es la probabilidad de la hipótesis dados los datos. Las dos probabilidades condicionales van en sentido opuesto, y para obtener la segunda hace falta una inferencia bayesiana que incluya una probabilidad a priori.
2. "1 − p es la probabilidad de que la hipótesis alternativa sea cierta" o "la probabilidad de replicar el resultado"
Es el primer error dado la vuelta, así que también es falso. p = 0.03 no significa que haya un 97 % de probabilidad de que exista un efecto, ni que al repetir el mismo experimento se vaya a obtener un resultado significativo con un 97 % de probabilidad.
3. "Si p > 0.05, no hay efecto"
Un resultado no significativo no es "evidencia de que no hay efecto", sino que "no hay evidencia suficiente para afirmar que existe un efecto". Con muestras pequeñas es fácil obtener un valor p grande aunque exista un efecto real. Por ejemplo, si lanzamos una moneda 100 veces y salen 60 caras, el valor p de la prueba binomial exacta bilateral para la hipótesis nula de moneda equilibrada es aproximadamente 0.0569. Supera por poco 0.05, pero eso no permite concluir que la moneda sea equilibrada.
4. "Cuanto menor es el valor p, mayor es el efecto"
El valor p es el resultado conjunto del tamaño del efecto y del tamaño de muestra. Con una muestra lo bastante grande, incluso una diferencia minúscula resulta significativa. Aunque la diferencia de medias entre dos grupos sea de 0.02 veces la desviación estándar (una diferencia prácticamente irrelevante), con 100,000 personas por grupo se obtiene z ≈ 4.47 y p ≈ 0.0000077. Por eso hay que informar el tamaño del efecto junto con el valor p. En el ejemplo anterior del método de estudio, el tamaño del efecto (d de Cohen, calculado con la media de las varianzas de las dos muestras) es de aproximadamente 1.96, lo que por convención se considera un "efecto grande".
5. "p = 0.049 y p = 0.051 llevan a conclusiones opuestas"
0.05 no es una ley de la naturaleza, sino un umbral de conveniencia. La fuerza de la evidencia que aportan ambos valores es casi la misma. Además, si se hacen varias pruebas y solo se informan las significativas (comparaciones múltiples), o si se siguen recogiendo datos hasta que el resultado sea significativo (p-hacking), la tasa real de error de tipo I supera con creces α.
Potencia estadística y tamaño de muestra
Al interpretar un resultado no significativo hay que considerar también la potencia (la probabilidad de detectar como significativo un efecto que realmente existe). Por ejemplo, si la diferencia real entre dos grupos tiene un tamaño del efecto d = 0.5 (moderado) y se hace una prueba bilateral con α = 0.05, la potencia con 20 personas por grupo es de solo un 34 % aproximadamente. Con 64 personas por grupo llega a cerca del 80 %. Si un estudio con 20 personas por grupo da un resultado no significativo, lo más probable es que no tuviera potencia suficiente para detectar el efecto, más que que el efecto no exista.
Puntos clave de la declaración de la ASA
Los principios planteados por la declaración de la ASA de 2016 se resumen así:
- Los valores p pueden indicar en qué medida los datos son incompatibles con un modelo estadístico concreto.
- Los valores p no miden la probabilidad de que una hipótesis sea cierta ni la probabilidad de que los datos se hayan producido solo por azar.
- Las conclusiones científicas y las decisiones no deben basarse únicamente en si el valor p supera un umbral concreto.
- Una inferencia correcta exige informar de forma transparente todo el proceso de análisis.
- El valor p no mide el tamaño de un efecto ni la importancia de un resultado.
- Por sí solo, el valor p no es una buena medida de la evidencia sobre un modelo o una hipótesis.
Pruebas bilaterales y unilaterales
- Prueba bilateral: contrasta "hay una diferencia (en cualquier dirección)". Cuenta los valores extremos de ambas colas.
- Prueba unilateral: contrasta una dirección fijada, como "A es mayor que B". Solo cuenta una cola.
En distribuciones simétricas como la t, si la dirección observada coincide con la hipótesis alternativa, el valor p unilateral es la mitad del bilateral. En el ejemplo anterior, el valor p unilateral de "A es mayor" es aproximadamente 0.00084. La prueba unilateral solo debe usarse cuando la dirección se ha fijado con fundamento teórico antes de ver los datos. Cambiar a una prueba unilateral tras ver los resultados para reducir el valor p a la mitad es un uso incorrecto.
Cómo informar correctamente
- Indica el valor p exacto (
p = 0.0017en lugar dep < 0.05). - Incluye el tamaño del efecto y el intervalo de confianza.
- Especifica la prueba usada, si es bilateral o unilateral, el tamaño de muestra y el número de pruebas realizadas.
En la calculadora de prueba t de este sitio puedes consultar a la vez el valor t, los grados de libertad, los valores p bilateral y unilateral y el tamaño del efecto.
Resumen
- El valor p es la probabilidad de obtener un resultado tan extremo o más que el observado, suponiendo que la hipótesis nula es cierta.
- El valor p no es la probabilidad de que la hipótesis nula sea cierta, ni la de que exista un efecto, ni la de replicar el resultado.
- Un resultado no significativo no demuestra que no haya efecto, y un valor p pequeño tampoco implica un efecto grande.
- En la comparación de dos grupos del ejemplo (t de Welch): t ≈ 3.924, grados de libertad aprox. 13.26, p bilateral ≈ 0.0017 y p unilateral ≈ 0.00084.
- Informa juntos el valor p exacto, el tamaño del efecto y el intervalo de confianza, y fija de antemano la dirección de la prueba unilateral.