Cuando se quiere saber si dos variables se mueven juntas, las primeras herramientas son el análisis de correlación y el de regresión. Sus cálculos se solapan mucho, pero responden a preguntas distintas. La correlación pregunta "¿con qué fuerza se mueven juntas las dos variables?", y la regresión, "¿cuánto cambia y en promedio cuando x aumenta en una unidad?".
El coeficiente de correlación de Pearson r
La r de Pearson expresa la fuerza y la dirección de la relación lineal entre dos variables continuas con un valor entre −1 y 1.
r = Sxy / √(Sxx × Syy)Sxy = Σ(x−x̄)(y−ȳ),Sxx = Σ(x−x̄)²,Syy = Σ(y−ȳ)²
Si r está cerca de 1, hay una relación lineal positiva fuerte; si está cerca de −1, una relación lineal negativa fuerte; si está cerca de 0, la relación lineal es débil. Los criterios de fuerza varían según la disciplina, pero es frecuente la convención de considerar débil, moderada y fuerte una correlación con valor absoluto de 0.1, 0.3 y 0.5.
Que r esté cerca de 0 no significa que no haya relación. Incluso una relación curva clara, como y = x², puede dar una r cercana a 0. Por eso, antes de calcular el coeficiente de correlación hay que mirar siempre primero el diagrama de dispersión.
La correlación de rangos de Spearman ρ
La ρ de Spearman es la r de Pearson calculada después de sustituir los valores originales por sus rangos. Cuando no hay empates, equivale a esta fórmula sencilla:
ρ = 1 − 6Σd² / (n(n²−1))(d es la diferencia de rangos de cada par)
La ρ de Spearman capta relaciones que aumentan o disminuyen de forma constante en una sola dirección (monótonas) aunque no sean rectas, y se ve menos afectada por los valores atípicos. También puede usarse con datos ordinales (como clasificaciones de satisfacción).
Ejemplo: horas de estudio y puntuación
Horas de estudio (x, en horas) y puntuación (y) de 6 estudiantes.
| Estudiante | x | y | x−x̄ | y−ȳ | (x−x̄)(y−ȳ) |
|---|---|---|---|---|---|
| 1 | 1 | 52 | −2.5 | −9.667 | 24.167 |
| 2 | 2 | 55 | −1.5 | −6.667 | 10.000 |
| 3 | 3 | 61 | −0.5 | −0.667 | 0.333 |
| 4 | 4 | 60 | 0.5 | −1.667 | −0.833 |
| 5 | 5 | 68 | 1.5 | 6.333 | 9.500 |
| 6 | 6 | 74 | 2.5 | 12.333 | 30.833 |
Paso 1: medias
x̄ = 21 / 6 = 3.5, ȳ = 370 / 6 ≈ 61.667
Paso 2: sumas de cuadrados y suma de productos cruzados
Sxy = 24.167 + 10.000 + 0.333 − 0.833 + 9.500 + 30.833 = 74Sxx = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5Syy ≈ 333.333
Paso 3: r de Pearson
r = 74 / √(17.5 × 333.333) = 74 / √5833.33 ≈ 74 / 76.376 ≈ 0.9689
Es una relación lineal positiva muy fuerte. El valor p bilateral de la prueba para esta r (hipótesis nula ρ=0, 4 grados de libertad) es aproximadamente 0.0014.
Paso 4: ρ de Spearman
Los rangos de x son 1 a 6 tal cual, y los rangos de y son 1, 2, 4, 3, 5, 6 (como 60 es menor que 61, se intercambian los rangos de los estudiantes 3 y 4). Las diferencias de rango d son 0, 0, −1, 1, 0, 0 y Σd² = 2.
ρ = 1 − 6 × 2 / (6 × (36 − 1)) = 1 − 12 / 210 ≈ 0.9429
Paso 5: recta de regresión
- Pendiente:
b = Sxy / Sxx = 74 / 17.5 ≈ 4.2286 - Intersección:
a = ȳ − b × x̄ = 61.667 − 4.2286 × 3.5 ≈ 46.867 - Ecuación de regresión:
ŷ ≈ 46.867 + 4.2286x
Interpretación de la pendiente y de r²
- Pendiente 4.2286: significa que, para un estudiante que estudia 1 hora más, se predice en promedio una puntuación unos 4.23 puntos mayor. La pendiente tiene unidades (puntos/hora), así que cambia si se cambian las unidades de x o de y. En cambio, r no tiene unidades.
- Intersección 46.867: es el valor predicho cuando x=0. Aquí correspondería a no estudiar nada, pero como no hay ningún x=0 en los datos, se trata de una extrapolación fuera del rango observado y hay que interpretarla con cautela.
- Coeficiente de determinación r² ≈ 0.9387: significa que alrededor del 93.9 % de la variación total de las puntuaciones se explica por la relación lineal con las horas de estudio. En la regresión simple, r² es igual al cuadrado de la r de Pearson.
La pendiente y r siempre tienen el mismo signo, y se cumple b = r × (s_y / s_x). Es decir, con la misma r, la pendiente es mayor cuanto más se dispersa y.
El efecto de los valores atípicos
Añadamos un estudiante a los datos anteriores: estudió 7 horas, pero obtuvo 30 puntos (supongamos que el día del examen se encontraba mal).
| Criterio | 6 estudiantes originales | 7 con el valor atípico |
|---|---|---|
| r de Pearson | aprox. 0.9689 | aprox. −0.1149 |
| ρ de Spearman | aprox. 0.9429 | aprox. 0.2143 |
Un solo punto llegó a cambiar el signo de la r de Pearson. Como la r de Pearson usa medias y desviaciones al cuadrado, un único punto extremo tanto en x como en y puede dominar el resultado. La ρ de Spearman también se vio afectada, pero al usar rangos su variación fue relativamente menor. Por estas razones, se recomienda seguir este orden:
- Revisar primero con un diagrama de dispersión si hay valores atípicos o relaciones curvas.
- Comprobar si el valor atípico es un error de captura o un valor real.
- Si es un valor real, informar los resultados con y sin el valor atípico, o presentar también la ρ de Spearman.
Correlación no es causalidad
Aunque exista una correlación fuerte, no se puede afirmar que x sea la causa de y. Las razones habituales son las siguientes:
- Una tercera variable (variable de confusión): las ventas de helados y los accidentes en el agua aumentan a la vez, pero la causa de ambos es la temperatura.
- Causalidad inversa: con la correlación sola no se puede distinguir si las personas que hacen mucho ejercicio están más sanas o si las personas sanas hacen más ejercicio.
- El azar: si se examinan muchos pares de variables, aparecen por casualidad correlaciones fuertes incluso entre variables sin relación.
- Sesgo de selección: si solo entran en la muestra las personas que cumplen una condición determinada, pueden aparecer correlaciones que no existían o desaparecer las que sí existían.
Para afirmar una relación causal se necesita un experimento con asignación aleatoria o un diseño de estudio que controle sistemáticamente las variables de confusión. Lo mismo vale para la pendiente de una regresión: es más seguro interpretarla no como "si cambias x, y cambia", sino como "entre sujetos con distinta x, y difiere en promedio en esta cantidad".
¿Qué usar?
| Situación | Recomendación |
|---|---|
| Dos variables continuas, relación lineal, sin valores atípicos | r de Pearson |
| Relación monótona pero curva, con valores atípicos o datos ordinales | ρ de Spearman |
| Predecir y a partir de x o conocer la magnitud del cambio | Regresión lineal simple (pendiente·intersección·r²) |
Si pegas pares x, y en la calculadora de correlación y regresión de este sitio, obtendrás de una vez la r de Pearson, la ρ de Spearman, la ecuación de regresión y r².
Resumen
- La r de Pearson mide la fuerza de una relación lineal, y la ρ de Spearman, la fuerza de una relación monótona basada en rangos.
- En los 6 pares del ejemplo, r ≈ 0.9689, ρ ≈ 0.9429, ecuación de regresión
ŷ ≈ 46.867 + 4.2286xy r² ≈ 0.9387. - La pendiente es el cambio medio de y por unidad de x (tiene unidades), y r² es la proporción de la variación de y explicada por la relación lineal.
- Un solo valor atípico puede hacer que la r de Pearson pase de 0.9689 a −0.1149, así que mira primero el diagrama de dispersión.
- Ni la correlación ni la pendiente de la regresión demuestran causalidad.