4. Correlación¶
¿Por qué algunos países ahorran una gran parte de su ingreso mientras otros no ahorran casi nada? En la década de 1960, economistas que estudiaban la teoría del ciclo de vida del ahorro reunieron una pequeña tabla de varios países para buscar una respuesta. Para 50 países registraron la tasa agregada de ahorro personal, promediada de 1960 a 1970. Junto a ella anotaron algunas características de cada economía: la fracción de la población menor de 15 años, la fracción mayor de 75, el ingreso per cápita y qué tan rápido crecía ese ingreso. La idea del ciclo de vida predice que las personas ahorran durante sus años laborales y gastan esos ahorros cuando son jóvenes o ancianas, así que un país con muchos dependientes, jóvenes o ancianos, debería ahorrar menos.
La Figure 1 muestra la primera parte de esa tabla: la tasa de ahorro frente a la proporción de la población menor de 15 años. La nube desciende. Los países con más niños tienden a ahorrar menos, tal como dice la teoría. Pero ¿qué tan fuerte es esa tendencia? “Desciende” es una imagen, no un número, y una imagen no puede entrar en un informe ni en una comparación. Queremos un solo número que mida qué tan estrechamente se mueven juntas dos cantidades, uno que no dependa de si el ahorro se expresa en porcentaje o el ingreso en dólares, y al que podamos adjuntar un margen de error.

Figure 1:La tasa de ahorro cae a medida que sube la proporción de dependientes jóvenes, pero la dispersión es amplia: la caída descendente es real y la dispersión a su alrededor es grande. Una correlación de -0.46 pone un solo número sobre ambos hechos a la vez.
Ese número es el coeficiente de correlación (correlation coefficient) (definido formalmente en la Definición 4.1), y este capítulo trata de leerlo con honestidad. En los Capítulos 2 y 3 construimos toda una recta y probamos cada una de sus partes, desde la pendiente hasta el intervalo de predicción; la correlación hace una pregunta más pequeña y más simétrica, qué tan estrechamente se mueven juntas dos cantidades, y la Sección 4.2 mostrará que es ese mismo ajuste visto a través de un solo número. La correlación es el resumen de trabajo de una relación en línea recta: comprime todo un diagrama de dispersión en un solo valor entre -1 y +1. También es uno de los números más maltratados en toda la estadística, culpado por afirmaciones causales que nunca hizo, inflado por valores atípicos, escondido por curvas y encogido por una muestra mal elegida. Al terminar podrás calcularlo, probarlo, construirle un intervalo y, tan importante como lo anterior, decir cuándo te está mintiendo.
4.1 El coeficiente de correlación¶
Intuición¶
Aquí está la meta en una frase sencilla: tomar todo un diagrama de dispersión y reducirlo a un solo número que diga qué tan estrechamente se mueven juntas las dos cosas, y hacer que ese número salga igual sin importar en qué unidades las mediste. Ese número es la correlación, y esta sección la construye a partir de piezas que ya tienes.
La pendiente de regresión del Capítulo 2 ya mide cómo se mueve con , pero lleva las unidades del problema: para los datos de ahorro la pendiente está en porcentaje de ahorro por punto porcentual de población joven. Cambia el ahorro a una fracción en lugar de un porcentaje y la pendiente cambia también. Eso hace difícil comparar pendientes entre distintos pares de variables. La correlación resuelve el problema de las unidades midiendo la asociación en una escala pura, sin dimensiones.
El truco es estandarizar. Antes de comparar cómo se mueven dos variables, ponlas a ambas en igualdad de condiciones: resta la media de cada variable y divide entre su desviación estándar, de modo que cada una se convierta en un conjunto de puntuaciones z sin unidades. Un país que está una desviación estándar por encima de la media en población joven y media desviación estándar por debajo de la media en ahorro aporta un producto de al conteo. Suma esos productos y promédialos, y habrás medido si un por encima del promedio tiende a venir con un por encima del promedio (positivo), por debajo del promedio (negativo) o con ninguno (cerca de cero). El promedio de los productos estandarizados siempre cae entre -1 y +1. Ese promedio es la correlación.
La Figure 2 hace visible esta contabilidad sobre los datos de ahorro. Divide el gráfico en las dos medias en cuatro cuadrantes. Un país en el cuadrante superior derecho o inferior izquierdo está del mismo lado de ambas medias, así que su producto es positivo. Un país en los otros dos cuadrantes está en lados opuestos, así que su producto es negativo. Como más juventud tiende a venir con menos ahorro, la mayoría de los puntos caen en los dos cuadrantes negativos, y el promedio de todos los productos sale negativo. Ese promedio negativo es la correlación.

Figure 2:La correlación es solo el promedio de estos productos con signo. En los datos de ahorro los puntos se amontonan en los dos cuadrantes negativos (naranja), así que el promedio es negativo y r es igual a menos 0.46.
Fórmula¶
Recuerda las sumas de desviaciones de 2.2 Mínimos cuadrados desde los primeros principios: , , y el producto cruzado . Estandarizar la covarianza entre las dos desviaciones estándar da la correlación.
es la covarianza: el producto promedio de las desviaciones emparejadas, positivo cuando y tienden a estar del mismo lado de sus medias.
y son las desviaciones estándar muestrales de y .
es la covarianza reescalada entre las dos desviaciones estándar, lo cual cancela todas las unidades y fija el valor dentro de .
En palabras: es la covarianza de y medida en unidades de desviación estándar de cada una, así que dice cuántas desviaciones estándar se mueve , en promedio, por cada desviación estándar de , con un tope de uno. Los factores en , y se cancelan en el cociente, y por eso la segunda forma de usa las sumas de desviaciones crudas sin ningún divisor.
Derivación (por qué vive en )¶
Demostración. Estandariza ambas variables. Escribe y . Por construcción y (las desviaciones al cuadrado de suman , y dividir cada una entre deja ; lo mismo para ), y la correlación es . Ahora usa el hecho de que una suma de cuadrados nunca es negativa. Para cualquiera de las dos elecciones de signo,
Divide entre . La elección del signo más da , así que ; la elección del signo menos da , así que . Por lo tanto . La igualdad se cumple solo cuando la suma al cuadrado es exactamente cero, es decir cuando para todo : los puntos estandarizados caen en una recta perfecta, así que significa una relación exacta en línea recta y nada menos.
R¶
Leer una correlación es más fácil una vez que ves toda una tabla de ellas. La función cor
aplicada a varias columnas devuelve la matriz de correlación (correlation matrix), todas
las correlaciones por pares a la vez.
savings <- read.csv("data/savings.csv")
round(cor(savings[, c("sr", "pop15", "pop75", "dpi", "ddpi")]), 3) sr pop15 pop75 dpi ddpi
sr 1.000 -0.456 0.317 0.220 0.305
pop15 -0.456 1.000 -0.908 -0.756 -0.048
pop75 0.317 -0.908 1.000 0.787 0.025
dpi 0.220 -0.756 0.787 1.000 -0.129
ddpi 0.305 -0.048 0.025 -0.129 1.000La diagonal es toda de unos (cada variable se correlaciona perfectamente consigo misma), y
la matriz es simétrica. La tasa de ahorro sr se correlaciona -0.456 con la proporción
de población joven y +0.317 con la proporción de población anciana, exactamente los dos
signos que predice la teoría del ciclo de vida. Nota también el -0.908 entre pop15 y
pop75: los países con muchos niños tienen pocos ancianos y viceversa, así que esos dos
predictores llevan casi la misma información. Esa casi duplicación importará cuando los
datos de ahorro regresen para la regresión múltiple en el Capítulo 8 y para los
diagnósticos en el Capítulo 9.
Para calibrar tu ojo, la Figure 3 muestra seis nubes con correlaciones desde fuertemente negativa hasta casi perfecta. Una correlación de todavía parece una mancha sin forma para la mayoría de la gente; hay que llegar a 0.7 o así antes de que la tendencia lineal salte a la vista. La correlación de ahorro de -0.46 está entre el segundo y el tercer panel.

Figure 3:Seis correlaciones para que el ojo memorice. Las correlaciones débiles cerca de más o menos 0.3 parecen casi redondas; una banda lineal clara no aparece hasta que la correlación alcanza aproximadamente 0.7.
Leer una correlación a partir de una imagen es una habilidad que se entrena, y los seis paneles congelados de arriba solo te llevan hasta cierto punto, así que recorre el deslizador de abajo por todo el rango y calibra tu ojo contra una nube que se mueve.
Un deslizador fija la correlación poblacional rho y reconstruye los mismos 120 puntos con ese valor: cada punto conserva su X y solo se mueven las alturas. La r de la muestra nunca es exactamente rho.
4.2 La correlación y la pendiente de regresión¶
Intuición¶
La correlación y la pendiente de regresión del Capítulo 2 están midiendo la misma relación, así que no pueden ser números independientes. La pendiente responde “cuántas unidades de por unidad de ”, llevando unidades; la correlación responde “cuántas desviaciones estándar de por desviación estándar de ”, sin llevar ninguna. Convierte una en la otra poniendo o quitando las unidades, lo cual significa multiplicar o dividir por el cociente de las dos desviaciones estándar. Esta sección hace eso exacto, porque el vínculo entre y explica un hecho que encontrarás una y otra vez: la correlación al cuadrado es la fracción de la varianza que explica la regresión.
Fórmula¶
La pendiente y la correlación están ligadas por
es la pendiente de mínimos cuadrados de sobre de 2.2 Mínimos cuadrados desde los primeros principios.
son las desviaciones estándar muestrales, así que es el factor de conversión de unidades entre las dos escalas.
es el coeficiente de determinación de 3.8 R cuadrada y su interpretación, la parte de la variación total en que explica la recta ajustada.
En palabras: la pendiente es la correlación escalada según cuánta más dispersión tiene que , y elevar al cuadrado la correlación da exactamente la proporción de la varianza de que explica la regresión.
Derivación (el vínculo exacto entre , y )¶
Demostración. Parte de las dos definiciones y factoriza. Como (los factores se cancelan),
Despejando se obtiene . Ambas estimaciones comparten el signo de , así que una pendiente positiva siempre viene con una correlación positiva y nunca discrepan en signo.
Ahora la conexión con . A partir de la recta ajustada de 2.2 Mínimos cuadrados desde los primeros principios la suma de cuadrados de la regresión es , y como esto es . Divide entre :
Así que el coeficiente de determinación no es más que la correlación al cuadrado, en la regresión lineal simple.
Vale la pena enunciar una consecuencia más, porque explica un enigma del Capítulo 2. Si regresas sobre en lugar de sobre , la pendiente es . Multiplica las dos pendientes:
Las dos pendientes de regresión son recíprocas solo cuando , es decir solo cuando el ajuste es perfecto. De lo contrario, regresar sobre y sobre dan rectas genuinamente distintas, y sus pendientes se multiplican para dar . La correlación es el único resumen simétrico al que no le importa a cuál variable llames la respuesta.
4.3 Inferencia para la correlación¶
Intuición¶
El -0.46 es una correlación muestral, calculada a partir de los 50 países que resultaron estar en la tabla. Detrás de ella hay una correlación poblacional (la letra griega rho), el valor que obtendríamos de todos los países que podrían existir bajo las mismas condiciones. Tenemos las mismas dos preguntas de siempre: ¿podría el verdadero ser cero, con nuestro -0.46 solo como ruido de muestreo, y qué rango de valores de es consistente con los datos? La primera es una prueba de hipótesis, la segunda un intervalo de confianza. La prueba resulta ser una que ya conoces disfrazada, y el intervalo necesita un cambio de variable ingenioso.
Fórmula¶
Para probar contra , usa
Para un intervalo de confianza primero cambiamos de escala, usando la transformación de Fisher (Fisher’s z).
La Figure 5 muestra lo que hace la transformación. Cerca del centro de la escala apenas cambia : un paso de 0.45 a 0.50 mueve solo 0.06. Pero a medida que se acerca a las paredes en la curva se vuelve casi vertical, así que el mismo paso de 0.05 de 0.90 a 0.95 mueve en 0.36, más de cinco veces más lejos. La transformación da a los valores amontonados cerca del techo espacio para expandirse, que es exactamente lo que convierte su pila desbalanceada en una campana simétrica.

Figure 5:La z de Fisher deja el medio de la escala de correlación casi intacto pero estira los extremos: el mismo paso de 0.05 en r que apenas mueve z en el medio se vuelve un salto grande cerca de la pared en 1. Ese estiramiento descongestiona la pila de correlaciones cerca del techo.
En esta escala la distribución muestral de es aproximadamente normal con una dispersión que ya no depende del desconocido, ; la siguiente derivación muestra por qué, y el Teorema 4.7 lo enuncia con precisión.
es el estadístico de prueba; bajo la hipótesis nula de no correlación sigue una distribución con grados de libertad.
es la tangente hiperbólica inversa; estira los extremos amontonados de la escala hacia .
El estadístico transformado es aproximadamente normal con una varianza, , que ya no depende del desconocido.
En palabras: la prueba de correlación es una prueba con grados de libertad, y para construir un intervalo nos movemos a una escala donde la distribución muestral es normal con una dispersión conocida, construimos el intervalo ahí, y transformamos de vuelta.
Derivación (la prueba de correlación es la prueba de la pendiente)¶
Demostración. De 3.7 La prueba F y su equivalencia con la prueba t la pendiente se prueba con , donde y . Dos hechos de 4.2 La correlación y la pendiente de regresión hacen el trabajo. Primero, , ya que . Segundo, . Sustituye:
El se cancela, y el estadístico de la pendiente y el estadístico de la correlación son el mismo número idéntico. Probar “¿es cero la pendiente?” y “¿es cero la correlación?” son la misma prueba, como deben serlo, ya que y comparten un signo y se anulan juntos.
Esbozo de derivación (la transformación de Fisher)¶
La prueba maneja , pero un intervalo de confianza para un distinto de cero es más difícil, por dos razones. Cuando está lejos de cero la distribución muestral de es sesgada, porque queda atrapado bajo el techo en 1 (o sobre el piso en -1) y se amontona contra él. Y la varianza de depende del propio , así que ni siquiera podemos escribir un error estándar fijo. La idea de Fisher fue encontrar una transformación que cure ambos problemas a la vez.
Demostración (esbozo). Para una muestra de una población normal bivariada, la teoría de muestras grandes da a una media aproximada y una varianza
Queremos una función tal que tenga una varianza libre de . El método delta (una expansión de Taylor de primer orden, ) dice
Para eliminar la dependencia de , exige . Integrar esa derivada da
y con esta elección , constante al fin. El análisis más fino de Fisher reemplaza el por para un mejor ajuste en muestras pequeñas y muestra que la distribución de es cercana a la normal, no sesgada. Así que .
Dos notas de honestidad. La distribución muestral exacta de bajo normalidad bivariada se conoce en forma cerrada pero es una función especial complicada; la aproximación normal a es lo que todo el mundo realmente usa, y la siguiente simulación muestra por qué es segura. Y todo el argumento supone que los datos son en verdad normales bivariados. Cuando eso está en duda, el bootstrap del Capítulo 5 (5.4 El bootstrap para la regresión) da un intervalo de confianza para que no se apoya en ningún supuesto distribucional.
Para construir un intervalo del 95 por ciento: calcula , forma , y transforma ambos extremos de vuelta con .
La transformación, verificada por simulación¶
El argumento de Fisher se apoyó en dos afirmaciones: que es sesgado mientras que es casi normal, y que la desviación estándar de es cercana a . Ambas son verificables sin más álgebra. Extrae muchas muestras de una normal bivariada con un conocido, calcula cada vez, y observa la pila de resultados.
set.seed(4210)
simulate_r <- function(n, rho, reps = 10000) {
replicate(reps, {
z1 <- rnorm(n)
z2 <- rnorm(n)
xa <- z1
ya <- rho * z1 + sqrt(1 - rho^2) * z2
cor(xa, ya)
})
}
rs <- simulate_r(n = 20, rho = 0.7)
zs <- atanh(rs)
round(c(mean_r = mean(rs), sd_r = sd(rs),
mean_z = mean(zs), sd_z = sd(zs),
theory_sd_z = 1 / sqrt(20 - 3)), 4) mean_r sd_r mean_z sd_z theory_sd_z
0.6919 0.1250 0.8906 0.2412 0.2425 rng = np.random.default_rng(4210)
def simulate_r(n, rho, reps=10000):
out = np.empty(reps)
for i in range(reps):
z1 = rng.standard_normal(n)
z2 = rng.standard_normal(n)
xa = z1
ya = rho * z1 + np.sqrt(1 - rho ** 2) * z2
out[i] = np.corrcoef(xa, ya)[0, 1]
return out
rs = simulate_r(20, 0.7)
zs = np.arctanh(rs)
print(round(rs.mean(), 4), round(rs.std(ddof=1), 4),
round(zs.mean(), 4), round(zs.std(ddof=1), 4),
round(1 / np.sqrt(20 - 3), 4))0.6893 0.1254 0.8852 0.2405 0.2425La desviación estándar simulada de es 0.2412 (R) y 0.2405 (Python), ambas un pelo por debajo del teórico , lo que confirma la fórmula de la varianza. La media de cae cerca de , próxima al 0.89 simulado. La Figure 6 cuenta la mitad visual de la historia: las correlaciones crudas se agrupan y sesgan hacia el techo en 1, mientras que los valores transformados se sitúan bajo una curva normal simétrica. Ese sesgo es exactamente por qué nunca construimos el intervalo en la escala cruda de .

Figure 6:Diez mil correlaciones muestrales con rho verdadero 0.7 y n 20. La r cruda (izquierda) es sesgada y amontona el techo en 1; la z transformada de Fisher (derecha) es casi normal con la dispersión predicha, que es por qué los intervalos de confianza se construyen en la escala z.
4.4 El modelo normal bivariado¶
Intuición¶
Hasta ahora hemos imaginado una variable como un conjunto de perillas que fijamos de antemano, con solo la otra libre de variar, el montaje de regresión del Capítulo 2. La correlación tiene un segundo hogar, más equitativo, donde ambas mediciones son aleatorias y llegan juntas como un par, como la estatura y el peso de una persona al azar medidos en el mismo momento. En esa imagen las dos variables se extraen juntas de una sola distribución conjunta. La distribución más limpia de ese tipo es la normal bivariada (bivariate normal), cuyas líneas de contorno son elipses. Cuando la correlación es cero la elipse es un círculo; a medida que crece la correlación el círculo se estira e inclina hacia la línea de 45 grados, volviéndose un cigarro delgado a medida que se acerca a . La Figure 7 muestra la progresión.

Figure 7:La normal bivariada en tres correlaciones. El parámetro rho controla cuánto se estiran e inclinan los contornos circulares en elipses; en rho cerca de 1 las dos variables son casi una línea recta.
Fórmula¶
En palabras: la fórmula da más miedo que la idea. La densidad se acumula más alta en el punto central y decae en anillos ovalados a su alrededor, y el único número decide cuánto se inclinan y estiran esos anillos alejándose de los círculos. Lee las piezas una a la vez.
son las dos medias y las dos desviaciones estándar.
es la correlación poblacional; es el único parámetro que liga y , y hace que la densidad se factorice en dos normales separadas.
La forma cuadrática entre corchetes es lo que dibuja los contornos elípticos; su término cruzado lleva el .
El hecho más útil sobre este modelo es lo que dice sobre una vez que conoces . La distribución condicional (conditional distribution) de dado es de nuevo normal, con
En palabras: dentro de una normal bivariada, la regresión de sobre es exactamente lineal, con pendiente poblacional , y la varianza restante es la varianza original encogida por el factor .
Derivación (la recta de regresión oculta)¶
Demostración. La densidad conjunta se factoriza como , donde es la marginal . Divide la densidad completa entre esa marginal. Los términos que dependen solo de se cancelan, y después de completar el cuadrado en dentro del exponente, lo que queda es una densidad normal en con media y varianza . El paso de completar el cuadrado es la misma álgebra que se usa para la normal univariada; el término cruzado es lo que empuja el centro de la distribución condicional fuera de por una cantidad proporcional a .
Compara la pendiente poblacional con la pendiente muestral de 4.2 La correlación y la pendiente de regresión: son la misma fórmula, una con cantidades poblacionales y otra con sus estimaciones muestrales. La recta de regresión del Capítulo 2 es la versión muestral de la media condicional de la normal bivariada. Y la identidad de la varianza es la gemela poblacional de : conocer elimina la fracción de la varianza de , dejando . Cuando , conocer explica 0.49 de la varianza y deja algo más de la mitad.
4.5 La correlación de rangos de Spearman¶
Intuición¶
La de Pearson mide la asociación en línea recta, y confía en cada valor tal como es, así que un solo punto extremo puede moverla mucho. A menudo te interesa una pregunta más suave: a medida que sube, ¿tiende a subir, sea o no a lo largo de una línea recta? Esa es una pregunta sobre orden, no sobre distancia, y tiene su propio coeficiente. La correlación de rangos de Spearman (Spearman rank correlation) (Definición 4.10) reemplaza cada valor por su rango (el más pequeño es 1, el siguiente es 2, y así) y luego calcula la correlación de Pearson ordinaria de esos rangos. Como los rangos ignoran qué tan separados están los valores y solo ven su orden, Spearman no se perturba por un valor atípico solitario ni por curvas que son monótonas pero no rectas.
La Figure 8 muestra el caso de la curva. A la izquierda hay una relación que siempre sube pero se dobla, así que Pearson lee solo 0.91, penalizando el doblez. Reemplaza cada valor por su rango, y los mismos puntos se ajustan a una diagonal perfecta: el rango 1 en se empareja con el rango 1 en , el rango 2 con el rango 2, y así hasta arriba. Como el orden es perfecto, aunque el espaciado no lo sea, Spearman es exactamente 1. Los rangos enderezan cualquier curva monótona.

Figure 8:Los mismos datos monótonos pero curvos vistos de dos maneras. Pearson lee solo 0.91 porque la nube cruda se dobla, pero los rangos caen en una línea perfecta, así que Spearman es exactamente 1. Spearman premia el orden e ignora el espaciado.
Fórmula¶
es la posición de en la lista ordenada de los valores de , y análogamente para .
está en igual que la de Pearson, es igual a +1 para cualquier relación estrictamente creciente (no solo una línea recta) y -1 para cualquier relación estrictamente decreciente.
En palabras: Spearman es Pearson aplicado a los rangos, así que mide si las dos variables suben y bajan juntas en orden, y no le importa el espaciado exacto de los valores.
R y Python¶
Los datos de ahorro tienen un caso de prueba natural. La tasa de crecimiento del ingreso,
ddpi, se correlaciona con la tasa de ahorro, pero un país, Libia, tuvo una enorme tasa de
crecimiento del ingreso durante el periodo y solo una tasa de ahorro mediana. Ese único
punto arrastra hacia abajo la correlación de Pearson. Spearman, que ve a Libia simplemente
como “el país de mayor crecimiento” en lugar de como un punto muy alejado a la derecha, se
perturba menos.

Figure 9:El crecimiento extremo del ingreso de Libia la convierte en un valor atípico que arrastra la correlación de Pearson hasta 0.30; Spearman, que lee solo rangos, reporta la más fuerte 0.41 que se ve en el grueso de los países.
Ninguno de los dos números es “el correcto”. Responden preguntas distintas. Pearson pregunta sobre la fuerza en línea recta y cuenta la distancia de Libia; Spearman pregunta sobre el orden monótono y no lo hace. Cuando discrepan, esa discrepancia es información: dice que hay presente un valor atípico o una curva, y deberías mirar el gráfico antes de citar cualquiera de los dos.
La distancia entre los dos coeficientes es más fácil de creer cuando la abres y la cierras con tu propio dedo, así que arrastra el sustituto de Libia y observa cuál de los dos números reacciona.
Arrastra de lado el punto de la extrema derecha y la r de Pearson cae de 0.85 a 0.46, mientras que la correlación de rangos de Spearman se mantiene en 0.885, porque ningún par de puntos cambió jamás de lugar.
4.6 Cuatro maneras en que una correlación miente¶
Un solo número que comprime un diagrama de dispersión debe tirar información, y a veces tira la parte que importaba. La demostración fundacional es el cuarteto de Anscombe: cuatro conjuntos de datos, construidos por el estadístico Frank Anscombe en 1973, que comparten las mismas medias, las mismas desviaciones estándar, la misma correlación de 0.816 y la misma recta ajustada, y sin embargo no se parecen en nada.
anscombe <- read.csv("data/anscombe.csv")
stats_row <- function(i) {
xi <- anscombe[[paste0("x", i)]]
yi <- anscombe[[paste0("y", i)]]
f <- lm(yi ~ xi)
c(set = i, mean_x = mean(xi), mean_y = mean(yi),
r = cor(xi, yi), b0 = coef(f)[[1]], b1 = coef(f)[[2]])
}
round(t(sapply(1:4, stats_row)), 3) set mean_x mean_y r b0 b1
[1,] 1 9 7.501 0.816 3.000 0.5
[2,] 2 9 7.501 0.816 3.001 0.5
[3,] 3 9 7.500 0.816 3.002 0.5
[4,] 4 9 7.501 0.817 3.002 0.5anscombe = pd.read_csv("data/anscombe.csv")
for i in range(1, 5):
xi = anscombe[f"x{i}"]
yi = anscombe[f"y{i}"]
f = smf.ols(f"y{i} ~ x{i}", data=anscombe).fit()
print(i, round(xi.mean(), 2), round(yi.mean(), 3),
round(xi.corr(yi), 3), round(f.params.iloc[0], 3),
round(f.params.iloc[1], 3))1 9.0 7.501 0.816 3.0 0.5
2 9.0 7.501 0.816 3.001 0.5
3 9.0 7.5 0.816 3.002 0.5
4 9.0 7.501 0.817 3.002 0.5Las cuatro filas son idénticas hasta tres decimales. La Figure 11 las grafica, y solo el gráfico revela la verdad. El Conjunto I es una dispersión lineal genuina, el caso honesto. El Conjunto II es una curva suave, donde una correlación en línea recta es el resumen totalmente equivocado. El Conjunto III es una recta perfecta con un valor atípico que inclina el ajuste y baja de 1 a 0.82. El Conjunto IV es el más alarmante: diez puntos apilados en un solo valor de no llevan ninguna información sobre la pendiente, y un solo punto solitario muy a la derecha inventa toda la correlación. Elimina ese único punto y queda indefinida. La lección que sacó Anscombe, y el primer hábito de cualquier analista honesto, es graficar los datos antes de confiar en el número.

Figure 11:El cuarteto de Anscombe: cuatro conjuntos de datos con medias idénticas, correlaciones de 0.82 y rectas ajustadas, pero cuatro formas diferentes. Solo el panel I queda bien resumido por una correlación; el número es engañoso para la curva, el valor atípico y el único punto de apalancamiento.
El cuarteto es una pieza de museo, construida para dejar clara la idea. Los mismos cuatro fallos aparecen en datos reales, así que aquí están uno por uno, con el mecanismo nombrado.
No linealidad. La correlación mide solo la asociación en línea recta. Una relación puede ser perfectamente predecible y aun así tener una correlación de Pearson cercana a cero, como en una forma de U simétrica donde cae y luego sube: las mitades de bajada y de subida se cancelan. Una pequeña nunca significa “sin relación”. Significa “sin relación en línea recta”, y la única forma de distinguir es mirar. El Conjunto II de Anscombe es esta trampa; el remedio es un diagrama de dispersión y, si aparece una curva, las transformaciones del Capítulo 10.
Valores atípicos. Como eleva al cuadrado las distancias, un solo punto muy alejado de la multitud puede dominar la suma, ya sea fabricando una correlación (Conjunto IV) o destruyéndola (Conjunto III). El ejemplo de Libia en la Figure 9 es la versión suave, con datos reales. Las defensas son graficar los datos, verificar si uno o dos puntos están impulsando el resultado recalculando sin ellos, y reportar Spearman junto con Pearson cuando discrepan.
Restricción del rango. La correlación depende de la dispersión de . Aprieta esa dispersión y la correlación se encoge hacia cero, aunque la relación subyacente no haya cambiado en absoluto. Los datos de estatura de Galton lo muestran con claridad.
galton <- read.csv("data/galton_heights.csv")
band <- galton[galton$midparentHeight >= 69 & galton$midparentHeight <= 71, ]
round(c(full_r = cor(galton$midparentHeight, galton$childHeight),
full_n = nrow(galton),
band_r = cor(band$midparentHeight, band$childHeight),
band_n = nrow(band),
sd_full = sd(galton$midparentHeight),
sd_band = sd(band$midparentHeight)), 3) full_r full_n band_r band_n sd_full sd_band
0.321 934.000 0.143 393.000 1.802 0.527 A lo largo de los 934 hijos la correlación entre la estatura media de los padres y la estatura del hijo es 0.32. Conserva solo las familias cuya estatura media de los padres está entre 69 y 71 pulgadas, recortando la desviación estándar de las estaturas de los padres de 1.80 a 0.53, y la correlación cae por más de la mitad a 0.14, como muestra la Figure 12. Nada sobre la herencia cambió; simplemente dejamos de mirar a los padres bajos y altos. Por esto una correlación calculada dentro de un grupo estrecho, estudiantes admitidos, empleados contratados, pacientes que sobreviven, subestima de forma rutinaria la asociación en la población completa. Siempre que leas una correlación débil, pregúntate sobre qué rango de se calculó.

Figure 12:Restringir la estatura media de los padres a la estrecha banda amarilla recorta su dispersión en dos tercios y reduce la correlación a la mitad, de 0.32 a 0.14, aunque la relación en sí no cambia. La correlación depende del rango de X que muestreas.
Fija tú mismo el ancho de esa banda y comprueba cuánta correlación puedes destruir sin tocar un solo dato.
Dos deslizadores mueven y redimensionan la banda sombreada, que es la única franja de estaturas de los padres que se correlaciona. Estrecharla a 69 hasta 71 pulgadas recorta r de 0.321 a 0.100 mientras los 220 hijos siguen exactamente donde estaban.
Correlación ecológica. Una correlación calculada sobre promedios de grupo no es la correlación para los individuos, y suele ser mayor, porque promediar cancela la dispersión dentro del grupo. Agrupa a los hijos de Galton por familia y correlaciona la estatura media del hijo de la familia con la estatura media de los padres.
fam <- aggregate(cbind(midparentHeight, childHeight) ~ family,
data = galton, FUN = mean)
round(c(individual_r = cor(galton$midparentHeight, galton$childHeight),
family_r = cor(fam$midparentHeight, fam$childHeight),
n_families = nrow(fam)), 3)individual_r family_r n_families
0.321 0.399 205.000 La correlación a nivel individual es 0.32; la correlación de promedios familiares es 0.40, como muestra la Figure 14. Promediar suaviza las diferencias de hermano a hermano y deja una imagen más apretada, así que el número agregado exagera qué tan bien puede predecirse la estatura de un hijo a partir de los padres. Inferir el comportamiento individual a partir de promedios de grupo es la falacia ecológica (ecological fallacy), y ha llevado a errores reales: una correlación entre países, estados o distritos puede ser fuerte mientras que la misma correlación entre las personas dentro de ellos es débil o incluso opuesta. La unidad que correlacionas es parte de la afirmación.

Figure 14:Los 205 promedios familiares (naranja) se correlacionan más fuertemente (0.40) que los 934 hijos individuales (gris, 0.32), porque promediar elimina la dispersión dentro de la familia. Una correlación sobre medias de grupo no es la correlación para individuos.
La afirmación de Anscombe solo cala si confirmas que los números de verdad se quedan quietos mientras la imagen cambia, así que recorre tú mismo los cuatro conjuntos y fija la vista en los valores y no en la gráfica.
Un deslizador recorre los cuatro conjuntos de Anscombe y reajusta la recta cada vez. La correlación, el intercepto, la pendiente y la media de Y apenas se apartan de 0.816, 3.00, 0.50 y 7.50 mientras la forma de los datos cambia por completo.
4.7 La regresión a la media, y por qué la correlación no es causalidad¶
Hay una quinta confusión que merece su propia sección, porque engañó al propio inventor de la regresión y todavía llena las noticias. Cuando Francis Galton graficó las estaturas de los hijos contra las de sus padres en la década de 1880, encontró que los padres altos tenían hijos que eran más altos que el promedio pero no tan altos como los padres, y los padres bajos tenían hijos que eran más bajos que el promedio pero no tan bajos. Al principio sospechó de alguna fuerza biológica que jalaba a la población hacia la mediocridad. No hay tal fuerza. El jalón hacia el promedio es una certeza matemática siempre que la correlación es menor que perfecta, y tiene un nombre: regresión a la media (regression to the mean).
La identidad de 4.2 La correlación y la pendiente de regresión lo hace exacto. En unidades estándar, donde ambas variables son puntuaciones z, las desviaciones estándar son ambas 1, así que la pendiente de regresión es . Un padre que está 2 desviaciones estándar por encima de la media tiene hijos predichos en solo desviaciones estándar por encima de la media. Para los datos de Galton , así que los hijos de padres muy altos se predicen apenas desviaciones estándar hacia arriba, muy por debajo de sus padres.

Figure 16:En unidades estándar la pendiente ajustada es exactamente r igual a 0.32, mucho menos pronunciada que la línea discontinua de estaturas iguales de pendiente 1. Los hijos de padres altos se predicen solo un tercio del camino hacia lo alto; los hijos de padres bajos solo un tercio del camino hacia lo bajo. Esa brecha es la regresión a la media.
La regresión a la media no es un hecho especial sobre la herencia. Ocurre siempre que dos mediciones están correlacionadas de forma imperfecta, que es casi siempre. El estudiante que saca el puntaje más alto en el examen parcial tiende a sacar un puntaje más bajo (todavía bueno, solo menos extremo) en el final. El atleta novato que aparece en la portada de una revista tras una temporada espectacular tiende a hacerlo peor al año siguiente, la llamada maldición de la portada, sin ninguna maldición involucrada. Una clínica inscribe a los pacientes con la presión arterial más alta, los trata, y ve caer su presión en promedio, en parte porque las lecturas más extremas eran extremas en parte por suerte y vuelven a la deriva por sí solas. En cada caso la lectura ingenua culpa a una causa, la presión de la fama, un medicamento milagroso, cuando la correlación imperfecta entre dos mediciones ya predice la deriva. Siempre que selecciones casos porque fueron extremos y luego los midas de nuevo, espera regresión a la media, y no le des el crédito ni la culpa a una historia.
Esta es la forma más profunda de la advertencia más vieja en estadística: la correlación no es causalidad. Una correlación entre y es consistente con que cause , con que cause , con que alguna tercera variable impulse a ambas, y con la pura coincidencia. La correlación de ahorro de -0.46 no prueba que tener hijos haga a un país ahorrativo o derrochador; el ingreso, la cultura y la historia están detrás de ambas. La correlación gana su lugar como una descripción y una primera pista, no como un veredicto. Separar las causas genuinas de las falsas necesita o bien un experimento diseñado o bien el cuidadoso razonamiento causal que el Capítulo 16 aborda (16.1 Dibujar una historia causal: diagramas de rutas), y es la cosa más difícil que este libro te pide mantener clara.
4.8 Resumen del capítulo¶
Ahora puedes describir una relación en línea recta con un solo número sin unidades y decir cuánto confiar en él. Conociste la correlación de Pearson como una covarianza estandarizada, demostraste que vive en , la ligaste con la pendiente de regresión y con , probaste y construiste un intervalo para el valor poblacional , la ubicaste dentro del modelo normal bivariado, la suavizaste en la versión de rangos de Spearman, y aprendiste las cinco maneras en que engaña: la no linealidad, los valores atípicos, la restricción del rango, la agregación ecológica y el salto a la causalidad.
Resultados clave de un vistazo
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Correlación de Pearson (Def 4.1) | cualquier dato numérico emparejado | |
| Cotas de (Teo 4.2) | ; syss una recta exacta | siempre |
| Correlación, pendiente, (Teo 4.4) | , | regresión lineal simple |
| Prueba de correlación (Teo 4.6) | , errores normales | |
| Distribución de Fisher (Teo 4.7) | normal bivariada, grande | |
| Condicional normal bivariada (Teo 4.9) | , | normal bivariada |
| Correlación de Spearman (Def 4.10) | Pearson de los rangos | orden monótono; datos ordinales o valores atípicos |
Términos clave. Coeficiente de correlación, covarianza muestral, matriz de correlación, coeficiente de determinación, transformación de Fisher, distribución normal bivariada, distribución condicional, correlación de rangos de Spearman, restricción del rango, correlación ecológica (y la falacia ecológica), regresión a la media.
Ahora deberías poder
Calcular la correlación de Pearson a mano y con software, y leerla como una covarianza estandarizada libre de unidades.
Derivar la identidad y mostrar que .
Probar con el estadístico y construir un intervalo de confianza para con la de Fisher, verificándolo por simulación.
Enunciar el modelo normal bivariado y leer su recta de regresión poblacional y la varianza restante .
Calcular la correlación de rangos de Spearman y decidir cuándo los rangos son más seguros que los valores crudos.
Diagnosticar la no linealidad, los valores atípicos, la restricción del rango y la correlación ecológica.
Explicar la regresión a la media y por qué una correlación fuerte todavía no es evidencia de causalidad.
Dónde encaja esto. En el flujo de trabajo de modelado de El flujo de trabajo del modelado, la
correlación sirve a la etapa EXPLORAR: antes de ajustar nada, observas cómo se mueven juntas
cada par de variables, y la matriz de correlación es la compañera numérica del diagrama de
dispersión. También alcanza la etapa USAR, a través de la inferencia para y las
advertencias que te impiden convertir una asociación descrita en una causa afirmada. Se
construye directamente sobre la recta de mínimos cuadrados de 2.2 Mínimos cuadrados desde los primeros principios y la
descomposición ANOVA de 3.6 El enfoque del análisis de varianza, ya que , y son tres vistas de
un mismo ajuste. Sus herramientas se usan de nuevo pronto: la identidad entre y de
4.2 La correlación y la pendiente de regresión regresa en el Capítulo 12 como una verificación de un que se
infla (12.2 Elegir entre modelos: criterios de selección); los mismos datos de ahorro se vuelven una segunda regresión
múltiple trabajada en el Capítulo 8, donde la fuerte correlación entre pop15 y pop75 que
viste en la matriz se convierte en un problema real de colinealidad; el jalón desmedido de
Libia se convierte en un diagnóstico de influencia con nombre en el Capítulo 9
(9.3 Influencia: qué puntos cambian realmente el ajuste); y el hilo de “la correlación no es causalidad” se retoma en el
Capítulo 16 con las herramientas para razonar con cuidado sobre él (16.1 Dibujar una historia causal: diagramas de rutas).
4.9 Preguntas frecuentes¶
P1. ¿Una correlación de 0.5 es el doble de fuerte que una de 0.25? No en el sentido que más importa. Si “fuerza” significa parte de la varianza explicada, entonces da y da , así que la primera explica cuatro veces más varianza, no el doble. La correlación y la varianza explicada son escalas distintas; deja siempre claro a cuál te refieres.
P2. ¿Qué es una correlación “grande”? Depende por completo del campo. En un experimento de física estrechamente controlado podría ser decepcionante; en las ciencias sociales, donde los resultados tienen muchas causas, puede ser un hallazgo real y útil. No hay umbral universal. Reporta el número, el intervalo y el gráfico, y deja que el lector juzgue frente a las normas del tema.
P3. La correlación es simétrica pero la regresión no. ¿Por qué? La correlación pregunta si dos variables se mueven juntas y no distingue una respuesta de un predictor, así que . La regresión señala una variable como la respuesta y minimiza las distancias verticales hacia ella, así que intercambiar los papeles cambia qué distancias minimizas y da una recta distinta. Sus pendientes se multiplican para dar , coincidiendo solo cuando el ajuste es perfecto.
P4. Si , ¿son y independientes? No. Una correlación cero significa que no hay asociación en línea recta, pero una relación curva fuerte (una forma de U, un círculo) puede tener mientras y son de todo menos independientes. La independencia implica correlación cero; lo inverso solo se cumple dentro de modelos especiales como la normal bivariada, donde sí fuerza la independencia porque la densidad se factoriza.
P5. ¿Cuál debo reportar, Pearson o Spearman? Reporta Pearson cuando te importa la fuerza en línea recta y los datos son aproximadamente lineales sin valores atípicos salvajes. Echa mano de Spearman cuando la relación es monótona pero curva, cuando los valores atípicos están moviendo a Pearson, o cuando las variables son rangos ordinales desde el inicio. Si los dos discrepan mucho, esa brecha es una señal para graficar los datos y averiguar por qué, no para elegir en silencio el número más grande.
P6. ¿Por qué el intervalo de confianza para sale desbalanceado alrededor de ? Porque el intervalo se construye simétricamente en la escala de Fisher y luego se dobla de vuelta con , que es no lineal cerca de los extremos. Para los datos de ahorro está en el centro del intervalo simétrico, pero después de transformar de vuelta las cotas no son equidistantes de -0.46. Esa asimetría es una característica deseable: respeta las paredes duras en que un intervalo simétrico en la escala cruda ignoraría.
P7. ¿Una correlación significativa significa que la relación es fuerte? No. La significancia y la fuerza son cosas distintas. Con una muestra suficientemente grande, una correlación diminuta de 0.05 puede ser estadísticamente significativa, es decir “probablemente no exactamente cero”, mientras explica una cuarta parte de uno por ciento de la varianza. Lee siempre el tamaño de y su intervalo, no solo el valor p; una pequeña dice que el efecto es real, no que es grande.
4.10 Problemas de práctica¶
(A) En una oración cada uno, di qué te dicen el signo y el tamaño de una correlación, y por qué no tiene unidades.
(A) Un informe da entre dos variables y lo llama “80 por ciento de acuerdo”. Explica qué está mal y da la interpretación correcta de 0.8.
(A) La correlación de ahorro entre
srypop15es -0.46. Interpreta tanto el signo como la magnitud para un lector que nunca ha visto una correlación.(A) Explica por qué una correlación de exactamente 0 no significa que y no estén relacionadas. Bosqueja o describe una relación con que sin embargo sea perfectamente predecible.
(A) Da la lista de cuatro preguntas que correrías antes de confiar en cualquier correlación reportada, y di contra qué trampa protege cada pregunta.
(A) Se encuentra una correlación débil de 0.1 entre el puntaje SAT y el promedio universitario, calculada solo entre estudiantes admitidos en una escuela selectiva. Nombra la trampa y predice si la correlación de la población completa es mayor o menor.
(A) Explica la regresión a la media en tus propias palabras, y da un ejemplo cotidiano que no sea de estaturas ni de puntajes de exámenes.
(A) ¿Por qué las dos pendientes de regresión (de sobre y de sobre ) son en general distintas, y cuándo son recíprocas entre sí?
(B) Demuestra que (Teorema 4.2) usando el hecho de que para los valores estandarizados . Enuncia la condición de igualdad y qué significa geométricamente.
(B) Deriva la identidad a partir de las definiciones y .
(B) Muestra que en la regresión lineal simple (Teorema 4.4), partiendo de y .
(B) Demuestra que las dos pendientes de regresión satisfacen , donde es la pendiente de sobre . Explica por qué esto obliga a que sea una igualdad, no una desigualdad.
(B) Deriva el estadístico de correlación (Teorema 4.6) a partir del estadístico de la pendiente , usando .
(B) Explica el argumento del método delta detrás del Teorema 4.7: partiendo de , muestra que hace que sea aproximadamente constante, y realiza la integral .
(B) En la normal bivariada, usa el resultado de la media condicional (Teorema 4.9) para mostrar que la pendiente de regresión poblacional de sobre es , y que la fracción de la varianza de que queda después de condicionar en es .
(B) Muestra que si cada exactamente (una recta perfecta, ), entonces . ¿Cuál de las condiciones de igualdad de la derivación de las cotas cumple esto?
(B) Una muestra tiene con . Calcula el intervalo de confianza de Fisher del 95 por ciento para a mano, mostrando la , el error estándar y la transformación de vuelta.
(B) Demuestra que la correlación de rangos de Spearman es igual a +1 para cualquier relación estrictamente creciente , no solo una lineal, considerando cómo lucen los rangos de y .
(C) Carga
savings.csvy reproduce la matriz de correlación completa desr,pop15,pop75,dpi,ddpi. Identifica las correlaciones positiva más fuerte y negativa más fuerte y explica cada una en palabras.(C) Para
srypop75, calcula , corre la prueba , y construye el intervalo de Fisher del 95 por ciento en R o Python. Di si la correlación es significativa e interpreta el intervalo.(C) Confirma en los datos de ahorro que y para la regresión de
srsobredpi. Reporta los cuatro números.(C) Calcula las correlaciones de Pearson y de Spearman entre
dpiysr. Difieren; haz el diagrama de dispersión y explica qué países impulsan la brecha.(C) Usando
anscombe.csv, reproduce la tabla que muestra que los cuatro conjuntos comparten la misma media, correlación y recta ajustada, luego grafica los cuatro y describe cómo cada uno se aparta (o no) de una línea recta.(C) Usando
galton_heights.csv, demuestra la restricción del rango: calcula la correlación en todos los hijos, luego en el subconjunto con estatura media de los padres entre 68 y 70 pulgadas, y reporta cuánto se encogen la correlación y la desviación estándar de la estatura de los padres.(C) Usando
galton_heights.csv, ajustachildHeight ~ midparentHeight, reporta la pendiente estandarizada, y explica el número como regresión a la media. Predice la estatura de un hijo cuya estatura media de los padres está 3 desviaciones estándar por encima de la media, en unidades estándar.(C) Simula la distribución muestral de para y con 5000 extracciones (semilla 4210), y verifica que la desviación estándar de sea cercana a . Reporta ambos números.
(C) Agrega
galton_heights.csvpor familia y compara las correlaciones a nivel individual y de promedios familiares entre la estatura media de los padres y la del hijo. Explica la dirección de la diferencia como un efecto ecológico.(C) Toma cualquier par de los datos de ahorro con una correlación moderada y elimina el único punto más extremo. Recalcula y reporta cuánto se movió, luego di si ese punto califica como influyente.
4.11 Práctica de examen¶
Estas cinco preguntas están escritas al estilo de los exámenes del curso. Cada una te pide explicar tu razonamiento en oraciones completas, no solo reportar un número, porque así es como se califican los exámenes: un valor pelado gana poco crédito, y un razonamiento claro con un pequeño desliz gana la mayor parte. Trabaja cada una en papel antes de abrir la respuesta modelo. Donde una pregunta muestra salida de software, es salida genuina de los conjuntos de datos del libro.
EP 4.1 Interpreta la salida en contexto¶
Para los 50 países en savings.csv, la tasa de ahorro sr está correlacionada con la
proporción de la población mayor de 75 años, pop75. Aquí está la salida de cor.test.
Pearson's product-moment correlation
data: savings$sr and savings$pop75
t = 2.3118, df = 48, p-value = 0.02513
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
0.04186153 0.54670273
sample estimates:
cor
0.3165211 Reporta la correlación muestral e interpreta su signo y su tamaño en el contexto de las dos variables. Di si la correlación es significativamente distinta de cero al nivel del 5 por ciento y cómo lo lees en la salida. Interpreta el intervalo de confianza, explica en una oración por qué no es simétrico alrededor de la correlación muestral, y di si el resultado muestra que tener más personas ancianas hace que un país ahorre más.
Respuesta modelo
La correlación muestral es , positiva y de moderada a débil. El signo positivo
dice que las dos se mueven en la misma dirección: los países con una proporción mayor de
personas de más de 75 años tienden a tener tasas de ahorro más altas, que es el patrón que
la teoría del ciclo de vida predice para los ancianos. El tamaño, cerca de un tercio, es lo
bastante débil como para que la nube todavía luciera bastante sin forma en un diagrama de
dispersión; está lejos de una recta apretada. La correlación es significativamente distinta
de cero al nivel del 5 por ciento, porque el valor p 0.025 está por debajo de 0.05, y de
forma equivalente porque el intervalo de confianza del 95 por ciento no
contiene el cero. Ese intervalo es el conjunto de valores poblacionales consistentes
con los datos, y es amplio: la correlación verdadera podría ser casi nada (0.04) o
moderadamente fuerte (0.55), así que la evidencia es real pero lejos de ser precisa. El
intervalo no es simétrico alrededor de porque se construye simétricamente en la
escala de Fisher y luego se dobla de vuelta con , que es no lineal y respeta la
pared dura en . Por último, el resultado no muestra que las personas ancianas
causen mayor ahorro: estos son datos observacionales, y el ingreso, la cultura y en especial
la proporción de juventud (que se correlaciona -0.908 con pop75) están detrás de ambas
variables. Una respuesta débil se detiene en “positiva y significativa” sin notar que el
intervalo casi toca el cero, o lee la correlación como prueba de una causa.
EP 4.2 La afirmación de una estudiante¶
Una compañera de clase corre la correlación entre la tasa de ahorro sr y la tasa de
crecimiento del ingreso ddpi y obtiene lo siguiente.
r = 0.3048 r^2 = 0.0929 t = 2.2171 p = 0.031385Ella escribe: “La correlación entre el crecimiento del ingreso y el ahorro es estadísticamente significativa (), así que el crecimiento del ingreso es un fuerte impulsor del ahorro nacional.” Evalúa su afirmación, corrigiendo cada error que encuentres.
Respuesta modelo
Su oración empaqueta dos errores distintos. El primero es confundir la significancia con la fuerza. El pequeño valor p solo nos dice que la correlación poblacional probablemente no es exactamente cero; no dice nada sobre qué tan grande es la asociación. Aquí la correlación es , y al elevarla al cuadrado se obtiene , así que el crecimiento del ingreso explica solo cerca del 9 por ciento de la variación de país a país en las tasas de ahorro, dejando el 91 por ciento sin explicar. Esa es una relación débil, no fuerte, por pequeño que sea el valor p. Con 50 países incluso una correlación modesta supera la barra de la significancia. El segundo error es la palabra “impulsor”, que afirma causalidad a partir de una correlación observacional. Una correlación positiva entre el crecimiento y el ahorro es igualmente consistente con que el ahorro alimente el crecimiento, con que un tercer factor como el desarrollo económico general eleve a ambos, o con la coincidencia. La lectura honesta es que las tasas de ahorro y el crecimiento del ingreso están débil y positivamente asociados entre estos países, una asociación poco probable de ser puro ruido de muestreo, y que los datos por sí solos no pueden decirnos hacia dónde apunta la flecha causal ni si existe una. Una respuesta débil corrige solo uno de los dos errores, típicamente atrapando el desliz de la causalidad pero aún aceptando “fuerte”, o al revés.
EP 4.3 Qué cambiaría si¶
A lo largo de los 934 hijos en galton_heights.csv, la correlación entre la estatura media de
los padres y la estatura del hijo es la siguiente.
full_r = 0.321 full_n = 934 full_sd(midparent) = 1.802Supón que recalcularas esta correlación usando solo las familias cuya estatura media de los padres está entre 69.5 y 70.5 pulgadas. Predice si la correlación subiría, bajaría o quedaría igual, explica el mecanismo, y di si la relación subyacente entre padres e hijos ha cambiado.
Respuesta modelo
La correlación bajaría, y la relación subyacente no cambiaría en absoluto. Esto es la restricción del rango. Una correlación depende de cuánto varía el predictor: estrechar las estaturas medias de los padres a una banda de una pulgada recorta su dispersión con fuerza, de una desviación estándar de 1.80 a cerca de 0.30, así que la estatura de los padres ahora explica una porción mucho menor de la variación en la estatura del hijo aunque cada pulgada extra de estatura de los padres siga prediciendo la misma fracción de pulgada de estatura del hijo. Recalcular sobre la banda da con solo 221 hijos, bajando de 0.321 en los datos completos, aproximadamente un tercio del original. La herencia misma queda intacta: la pendiente de regresión, la biología y la dispersión de los hijos alrededor de la recta son todas iguales. Simplemente dejamos de mirar a los padres bajos y altos, y una relación medida sobre una franja estrecha de luce más débil que la misma relación medida sobre el rango completo. Por esto exactamente una correlación calculada dentro de un grupo seleccionado, como estudiantes admitidos o empleados contratados, subestima la asociación en la población completa. Una respuesta débil predice que la correlación subiría, o concluye que la relación entre padres e hijos misma se debilitó en lugar de que solo se encogió el rango muestreado de .
EP 4.4 Explica por qué¶
Para el crecimiento del ingreso ddpi contra la tasa de ahorro sr, los dos coeficientes de
correlación discrepan, y un país sobresale.
pearson = 0.3048 spearman = 0.4082
country ddpi sr
Libya 16.71 8.89Explica por qué las correlaciones de Pearson y de Spearman difieren aquí, usando a Libia para hacer concreto el mecanismo. Luego di cuál de los dos números es “el correcto” y qué debería llevarte a hacer su discrepancia.
Respuesta modelo
Pearson y Spearman discrepan porque leen a Libia de forma muy distinta. Pearson trabaja a partir de los valores crudos y en efecto eleva al cuadrado las distancias, así que un punto lejano de la multitud carga un peso desmedido. El crecimiento del ingreso de Libia de 16.7 por ciento es más del doble que el de cualquier otro país, lo que la coloca muy a la derecha, mientras que su tasa de ahorro de 8.9 es poco notable. Esa combinación, extrema en pero ordinaria en , jala la recta de mínimos cuadrados hacia lo plano y arrastra la correlación de Pearson hasta 0.30. Spearman primero reemplaza cada valor por su rango, así que Libia se vuelve simplemente “rango 50 en crecimiento”, un paso más allá del siguiente país; su enorme distancia cruda se comprime a un solo salto de rango. Libre de ese único punto de apalancamiento, Spearman reporta el patrón monótono más fuerte, 0.41, que se mantiene entre los otros 49 países. Ninguno de los dos números es “el correcto”, porque responden preguntas distintas: Pearson mide la fuerza en línea recta y cuenta la distancia de Libia, mientras que Spearman mide el orden monótono y no lo hace. Su discrepancia es en sí misma información. Señala que hay presente un valor atípico o una curva, y la respuesta correcta es graficar los datos y mirar a Libia antes de citar cualquiera de los dos coeficientes. Una respuesta débil declara un número simplemente correcto, o culpa de la brecha al tamaño de la muestra o al redondeo en lugar de a la posición de Libia como un valor atípico de alto apalancamiento en la variable de crecimiento.
EP 4.5 La afirmación de un estudiante sobre la regresión a la media¶
La regresión de la estatura del hijo sobre la estatura media de los padres en
galton_heights.csv da lo siguiente.
r = 0.321 slope = 0.637 sd(midparent) = 1.802 sd(child) = 3.579Un estudiante razona: “Los hijos de padres altos son en promedio más bajos que sus padres, así que las familias altas están revirtiendo hacia el promedio, y a lo largo de suficientes generaciones la estatura de todos convergerá a la media.” Evalúa el razonamiento, usando la pendiente estandarizada, y di qué le pasará en realidad a la dispersión de las estaturas a lo largo de las generaciones.
Respuesta modelo
El estudiante ha redescubierto el propio error de Galton. En unidades estándar la pendiente es igual a la correlación, , así que un hijo se predice solo cerca de un tercio del camino hacia afuera desde la media en que estuvieron los padres. Ese jalón hacia el promedio es real, pero es aritmética, no una fuerza biológica. Se sigue automáticamente cada vez que dos mediciones están correlacionadas de forma menos que perfecta: como parte de la estatura de un padre alto es transmisible y parte es azar, los hijos heredan en promedio solo la parte transmisible y por eso caen más cerca del medio. De manera decisiva, la regresión a la media es simétrica y no encoge a la población. Los hijos de padres promedio incluyen algunos muy altos y algunos muy bajos, y de padres no extremos nacen hijos extremos con la misma frecuencia, lo que vuelve a llenar ambas colas. La desviación estándar de los hijos, 3.579 pulgadas, no se está colapsando hacia cero; la distribución de estaturas permanece con más o menos la misma dispersión generación tras generación. Así que la conclusión de “convergencia a una sola estatura” está equivocada: no hay deriva hacia la uniformidad, solo una dispersión estable en la que los casos extremos de un lado tienden a ser menos extremos del otro. El razonamiento también lee en silencio una causa dentro de una correlación, lo que los datos no pueden sostener. Una respuesta débil acepta la idea de una fuerza que revierte o predice que la dispersión de estaturas se encogerá con el tiempo, sin notar que la regresión a la media es una consecuencia de doble vía de una correlación imperfecta y deja la varianza poblacional intacta.
Juego del capítulo¶
Chapter summary (in English)
This chapter is about correlation, the number between -1 and +1 that summarizes how
strong the straight-line relationship between two variables is. We use the cross-country
savings data for 50 countries (savings): the savings rate sr against the share of young
population pop15. The Pearson correlation coefficient
is the standardized, unit-free covariance, and here it
equals -0.46: more youth, less saving. We prove that using the fact that a
sum of squares is never negative.
Correlation and the regression slope are tied exactly: and ,
the coefficient of determination. For sr against pop15, and
: the line explains 21 percent of the variation.
To make inferences about , the test turns out to be identical to the slope test. The confidence interval uses Fisher’s transformation, , which stabilizes the variance; a simulation confirms it. For the savings data, the 95 percent interval for is .
The bivariate normal model is the natural home of correlation: its contours are ellipses and its conditional mean is the population regression line. The Spearman rank correlation applies Pearson to the ranks and resists outliers, like Libya in the savings data.
Finally we see how correlation lies: nonlinearity, outliers, restriction of range, ecological correlation, and the leap to causation. Regression to the mean, illustrated with the Galton heights, explains why extreme cases tend to moderate with no special cause. Correlation describes; it does not prove cause.