GUIDE 08

Correlación y regresión: r de Pearson, ρ de Spearman e interpretación de la pendiente

Pearson frente a Spearman, r², pendiente de la regresión, correlación frente a causalidad y efecto de los valores atípicos, con ejemplo.

Cuando se quiere saber si dos variables se mueven juntas, las primeras herramientas son el análisis de correlación y el de regresión. Sus cálculos se solapan mucho, pero responden a preguntas distintas. La correlación pregunta "¿con qué fuerza se mueven juntas las dos variables?", y la regresión, "¿cuánto cambia y en promedio cuando x aumenta en una unidad?".

El coeficiente de correlación de Pearson r

La r de Pearson expresa la fuerza y la dirección de la relación lineal entre dos variables continuas con un valor entre −1 y 1.

  • r = Sxy / √(Sxx × Syy)
  • Sxy = Σ(x−x̄)(y−ȳ), Sxx = Σ(x−x̄)², Syy = Σ(y−ȳ)²

Si r está cerca de 1, hay una relación lineal positiva fuerte; si está cerca de −1, una relación lineal negativa fuerte; si está cerca de 0, la relación lineal es débil. Los criterios de fuerza varían según la disciplina, pero es frecuente la convención de considerar débil, moderada y fuerte una correlación con valor absoluto de 0.1, 0.3 y 0.5.

Que r esté cerca de 0 no significa que no haya relación. Incluso una relación curva clara, como y = x², puede dar una r cercana a 0. Por eso, antes de calcular el coeficiente de correlación hay que mirar siempre primero el diagrama de dispersión.

La correlación de rangos de Spearman ρ

La ρ de Spearman es la r de Pearson calculada después de sustituir los valores originales por sus rangos. Cuando no hay empates, equivale a esta fórmula sencilla:

  • ρ = 1 − 6Σd² / (n(n²−1)) (d es la diferencia de rangos de cada par)

La ρ de Spearman capta relaciones que aumentan o disminuyen de forma constante en una sola dirección (monótonas) aunque no sean rectas, y se ve menos afectada por los valores atípicos. También puede usarse con datos ordinales (como clasificaciones de satisfacción).

Ejemplo: horas de estudio y puntuación

Horas de estudio (x, en horas) y puntuación (y) de 6 estudiantes.

Estudiantexyx−x̄y−ȳ(x−x̄)(y−ȳ)
1152−2.5−9.66724.167
2255−1.5−6.66710.000
3361−0.5−0.6670.333
44600.5−1.667−0.833
55681.56.3339.500
66742.512.33330.833

Paso 1: medias

x̄ = 21 / 6 = 3.5, ȳ = 370 / 6 ≈ 61.667

Paso 2: sumas de cuadrados y suma de productos cruzados

  • Sxy = 24.167 + 10.000 + 0.333 − 0.833 + 9.500 + 30.833 = 74
  • Sxx = 6.25 + 2.25 + 0.25 + 0.25 + 2.25 + 6.25 = 17.5
  • Syy ≈ 333.333

Paso 3: r de Pearson

r = 74 / √(17.5 × 333.333) = 74 / √5833.33 ≈ 74 / 76.376 ≈ 0.9689

Es una relación lineal positiva muy fuerte. El valor p bilateral de la prueba para esta r (hipótesis nula ρ=0, 4 grados de libertad) es aproximadamente 0.0014.

Paso 4: ρ de Spearman

Los rangos de x son 1 a 6 tal cual, y los rangos de y son 1, 2, 4, 3, 5, 6 (como 60 es menor que 61, se intercambian los rangos de los estudiantes 3 y 4). Las diferencias de rango d son 0, 0, −1, 1, 0, 0 y Σd² = 2.

ρ = 1 − 6 × 2 / (6 × (36 − 1)) = 1 − 12 / 210 ≈ 0.9429

Paso 5: recta de regresión

  • Pendiente: b = Sxy / Sxx = 74 / 17.5 ≈ 4.2286
  • Intersección: a = ȳ − b × x̄ = 61.667 − 4.2286 × 3.5 ≈ 46.867
  • Ecuación de regresión: ŷ ≈ 46.867 + 4.2286x

Interpretación de la pendiente y de r²

  • Pendiente 4.2286: significa que, para un estudiante que estudia 1 hora más, se predice en promedio una puntuación unos 4.23 puntos mayor. La pendiente tiene unidades (puntos/hora), así que cambia si se cambian las unidades de x o de y. En cambio, r no tiene unidades.
  • Intersección 46.867: es el valor predicho cuando x=0. Aquí correspondería a no estudiar nada, pero como no hay ningún x=0 en los datos, se trata de una extrapolación fuera del rango observado y hay que interpretarla con cautela.
  • Coeficiente de determinación r² ≈ 0.9387: significa que alrededor del 93.9 % de la variación total de las puntuaciones se explica por la relación lineal con las horas de estudio. En la regresión simple, r² es igual al cuadrado de la r de Pearson.

La pendiente y r siempre tienen el mismo signo, y se cumple b = r × (s_y / s_x). Es decir, con la misma r, la pendiente es mayor cuanto más se dispersa y.

El efecto de los valores atípicos

Añadamos un estudiante a los datos anteriores: estudió 7 horas, pero obtuvo 30 puntos (supongamos que el día del examen se encontraba mal).

Criterio6 estudiantes originales7 con el valor atípico
r de Pearsonaprox. 0.9689aprox. −0.1149
ρ de Spearmanaprox. 0.9429aprox. 0.2143

Un solo punto llegó a cambiar el signo de la r de Pearson. Como la r de Pearson usa medias y desviaciones al cuadrado, un único punto extremo tanto en x como en y puede dominar el resultado. La ρ de Spearman también se vio afectada, pero al usar rangos su variación fue relativamente menor. Por estas razones, se recomienda seguir este orden:

  1. Revisar primero con un diagrama de dispersión si hay valores atípicos o relaciones curvas.
  2. Comprobar si el valor atípico es un error de captura o un valor real.
  3. Si es un valor real, informar los resultados con y sin el valor atípico, o presentar también la ρ de Spearman.

Correlación no es causalidad

Aunque exista una correlación fuerte, no se puede afirmar que x sea la causa de y. Las razones habituales son las siguientes:

  • Una tercera variable (variable de confusión): las ventas de helados y los accidentes en el agua aumentan a la vez, pero la causa de ambos es la temperatura.
  • Causalidad inversa: con la correlación sola no se puede distinguir si las personas que hacen mucho ejercicio están más sanas o si las personas sanas hacen más ejercicio.
  • El azar: si se examinan muchos pares de variables, aparecen por casualidad correlaciones fuertes incluso entre variables sin relación.
  • Sesgo de selección: si solo entran en la muestra las personas que cumplen una condición determinada, pueden aparecer correlaciones que no existían o desaparecer las que sí existían.

Para afirmar una relación causal se necesita un experimento con asignación aleatoria o un diseño de estudio que controle sistemáticamente las variables de confusión. Lo mismo vale para la pendiente de una regresión: es más seguro interpretarla no como "si cambias x, y cambia", sino como "entre sujetos con distinta x, y difiere en promedio en esta cantidad".

¿Qué usar?

SituaciónRecomendación
Dos variables continuas, relación lineal, sin valores atípicosr de Pearson
Relación monótona pero curva, con valores atípicos o datos ordinalesρ de Spearman
Predecir y a partir de x o conocer la magnitud del cambioRegresión lineal simple (pendiente·intersección·r²)

Si pegas pares x, y en la calculadora de correlación y regresión de este sitio, obtendrás de una vez la r de Pearson, la ρ de Spearman, la ecuación de regresión y r².

Resumen

  • La r de Pearson mide la fuerza de una relación lineal, y la ρ de Spearman, la fuerza de una relación monótona basada en rangos.
  • En los 6 pares del ejemplo, r ≈ 0.9689, ρ ≈ 0.9429, ecuación de regresión ŷ ≈ 46.867 + 4.2286x y r² ≈ 0.9387.
  • La pendiente es el cambio medio de y por unidad de x (tiene unidades), y r² es la proporción de la variación de y explicada por la relación lineal.
  • Un solo valor atípico puede hacer que la r de Pearson pase de 0.9689 a −0.1149, así que mira primero el diagrama de dispersión.
  • Ni la correlación ni la pendiente de la regresión demuestran causalidad.

→ Calcular ahora: Correlación

Actualizado 2026-09-23