Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

4. Correlación

¿Por qué algunos países ahorran una gran parte de su ingreso mientras otros no ahorran casi nada? En la década de 1960, economistas que estudiaban la teoría del ciclo de vida del ahorro reunieron una pequeña tabla de varios países para buscar una respuesta. Para 50 países registraron la tasa agregada de ahorro personal, promediada de 1960 a 1970. Junto a ella anotaron algunas características de cada economía: la fracción de la población menor de 15 años, la fracción mayor de 75, el ingreso per cápita y qué tan rápido crecía ese ingreso. La idea del ciclo de vida predice que las personas ahorran durante sus años laborales y gastan esos ahorros cuando son jóvenes o ancianas, así que un país con muchos dependientes, jóvenes o ancianos, debería ahorrar menos.

La Figure 1 muestra la primera parte de esa tabla: la tasa de ahorro frente a la proporción de la población menor de 15 años. La nube desciende. Los países con más niños tienden a ahorrar menos, tal como dice la teoría. Pero ¿qué tan fuerte es esa tendencia? “Desciende” es una imagen, no un número, y una imagen no puede entrar en un informe ni en una comparación. Queremos un solo número que mida qué tan estrechamente se mueven juntas dos cantidades, uno que no dependa de si el ahorro se expresa en porcentaje o el ingreso en dólares, y al que podamos adjuntar un margen de error.

Diagrama de dispersión de la tasa agregada de ahorro frente al porcentaje de población menor de 15 años para 50 países, con una recta de mínimos cuadrados de pendiente descendente. Los países con una baja proporción de menores de 15 (alrededor de 25 por ciento) ahorran en su mayoría entre 10 y 17 por ciento, mientras que los países con una proporción alta (alrededor de 45 por ciento) se dispersan ampliamente desde casi 0 hasta cerca de 18 por ciento. La recta cae de aproximadamente 13 por ciento de ahorro hasta cerca de 7 por ciento a lo largo del rango.

Figure 1:La tasa de ahorro cae a medida que sube la proporción de dependientes jóvenes, pero la dispersión es amplia: la caída descendente es real y la dispersión a su alrededor es grande. Una correlación de -0.46 pone un solo número sobre ambos hechos a la vez.

Ese número es el coeficiente de correlación (correlation coefficient) (definido formalmente en la Definición 4.1), y este capítulo trata de leerlo con honestidad. En los Capítulos 2 y 3 construimos toda una recta y probamos cada una de sus partes, desde la pendiente hasta el intervalo de predicción; la correlación hace una pregunta más pequeña y más simétrica, qué tan estrechamente se mueven juntas dos cantidades, y la Sección 4.2 mostrará que es ese mismo ajuste visto a través de un solo número. La correlación es el resumen de trabajo de una relación en línea recta: comprime todo un diagrama de dispersión en un solo valor entre -1 y +1. También es uno de los números más maltratados en toda la estadística, culpado por afirmaciones causales que nunca hizo, inflado por valores atípicos, escondido por curvas y encogido por una muestra mal elegida. Al terminar podrás calcularlo, probarlo, construirle un intervalo y, tan importante como lo anterior, decir cuándo te está mintiendo.

4.1 El coeficiente de correlación

Intuición

Aquí está la meta en una frase sencilla: tomar todo un diagrama de dispersión y reducirlo a un solo número que diga qué tan estrechamente se mueven juntas las dos cosas, y hacer que ese número salga igual sin importar en qué unidades las mediste. Ese número es la correlación, y esta sección la construye a partir de piezas que ya tienes.

La pendiente de regresión del Capítulo 2 ya mide cómo se mueve YY con XX, pero lleva las unidades del problema: para los datos de ahorro la pendiente está en porcentaje de ahorro por punto porcentual de población joven. Cambia el ahorro a una fracción en lugar de un porcentaje y la pendiente cambia también. Eso hace difícil comparar pendientes entre distintos pares de variables. La correlación resuelve el problema de las unidades midiendo la asociación en una escala pura, sin dimensiones.

El truco es estandarizar. Antes de comparar cómo se mueven dos variables, ponlas a ambas en igualdad de condiciones: resta la media de cada variable y divide entre su desviación estándar, de modo que cada una se convierta en un conjunto de puntuaciones z sin unidades. Un país que está una desviación estándar por encima de la media en población joven y media desviación estándar por debajo de la media en ahorro aporta un producto de (+1)(0.5)=0.5(+1)(-0.5) = -0.5 al conteo. Suma esos productos y promédialos, y habrás medido si un XX por encima del promedio tiende a venir con un YY por encima del promedio (positivo), por debajo del promedio (negativo) o con ninguno (cerca de cero). El promedio de los productos estandarizados siempre cae entre -1 y +1. Ese promedio es la correlación.

La Figure 2 hace visible esta contabilidad sobre los datos de ahorro. Divide el gráfico en las dos medias en cuatro cuadrantes. Un país en el cuadrante superior derecho o inferior izquierdo está del mismo lado de ambas medias, así que su producto es positivo. Un país en los otros dos cuadrantes está en lados opuestos, así que su producto es negativo. Como más juventud tiende a venir con menos ahorro, la mayoría de los puntos caen en los dos cuadrantes negativos, y el promedio de todos los productos sale negativo. Ese promedio negativo es la correlación.

Diagrama de dispersión de los 50 países con ambas variables convertidas a unidades estándar, de modo que las dos medias se encuentran en el origen y dividen el gráfico en cuatro cuadrantes. Los cuadrantes superior derecho e inferior izquierdo, donde un punto está del mismo lado de ambas medias y el producto es positivo, están marcados con un signo más y contienen círculos azules. Los cuadrantes superior izquierdo e inferior derecho, donde el producto es negativo, están ligeramente sombreados y marcados con un signo menos y contienen triángulos naranjas. La mayoría de los países son triángulos naranjas en los dos cuadrantes negativos, así que el producto promedio es negativo.

Figure 2:La correlación es solo el promedio de estos productos con signo. En los datos de ahorro los puntos se amontonan en los dos cuadrantes negativos (naranja), así que el promedio es negativo y r es igual a menos 0.46.

Fórmula

Recuerda las sumas de desviaciones de 2.2 Mínimos cuadrados desde los primeros principios: Sxx=(XiXˉ)2S_{xx} = \sum (X_i - \bar X)^2, Syy=(YiYˉ)2S_{yy} = \sum (Y_i - \bar Y)^2, y el producto cruzado Sxy=(XiXˉ)(YiYˉ)S_{xy} = \sum (X_i - \bar X)(Y_i - \bar Y). Estandarizar la covarianza entre las dos desviaciones estándar da la correlación.

En palabras: rr es la covarianza de XX y YY medida en unidades de desviación estándar de cada una, así que dice cuántas desviaciones estándar se mueve YY, en promedio, por cada desviación estándar de XX, con un tope de uno. Los factores (n1)(n-1) en sxys_{xy}, sxs_x y sys_y se cancelan en el cociente, y por eso la segunda forma de rr usa las sumas de desviaciones crudas sin ningún divisor.

Derivación (por qué rr vive en [1,1][-1, 1])

Demostración. Estandariza ambas variables. Escribe ui=(XiXˉ)/sxu_i = (X_i - \bar X)/s_x y vi=(YiYˉ)/syv_i = (Y_i - \bar Y)/s_y. Por construcción ui2=(n1)\sum u_i^2 = (n-1) y vi2=(n1)\sum v_i^2 = (n-1) (las desviaciones al cuadrado de XX suman SxxS_{xx}, y dividir cada una entre sx2=Sxx/(n1)s_x^2 = S_{xx}/(n-1) deja n1n-1; lo mismo para YY), y la correlación es r=1n1uivir = \frac{1}{n-1}\sum u_i v_i. Ahora usa el hecho de que una suma de cuadrados nunca es negativa. Para cualquiera de las dos elecciones de signo,

0i=1n(uivi)2=ui2+vi22uivi=(n1)+(n1)2(n1)r.0 \le \sum_{i=1}^n (u_i \mp v_i)^2 = \sum u_i^2 + \sum v_i^2 \mp 2\sum u_i v_i = (n-1) + (n-1) \mp 2(n-1) r .

Divide entre 2(n1)>02(n-1) > 0. La elección del signo más da 01+r0 \le 1 + r, así que r1r \ge -1; la elección del signo menos da 01r0 \le 1 - r, así que r1r \le 1. Por lo tanto 1r1-1 \le r \le 1. La igualdad se cumple solo cuando la suma al cuadrado es exactamente cero, es decir cuando vi=±uiv_i = \pm u_i para todo ii: los puntos estandarizados caen en una recta perfecta, así que r=±1r = \pm 1 significa una relación exacta en línea recta y nada menos. \blacksquare

R

Leer una correlación es más fácil una vez que ves toda una tabla de ellas. La función cor aplicada a varias columnas devuelve la matriz de correlación (correlation matrix), todas las correlaciones por pares a la vez.

savings <- read.csv("data/savings.csv")
round(cor(savings[, c("sr", "pop15", "pop75", "dpi", "ddpi")]), 3)
          sr  pop15  pop75    dpi   ddpi
sr     1.000 -0.456  0.317  0.220  0.305
pop15 -0.456  1.000 -0.908 -0.756 -0.048
pop75  0.317 -0.908  1.000  0.787  0.025
dpi    0.220 -0.756  0.787  1.000 -0.129
ddpi   0.305 -0.048  0.025 -0.129  1.000

La diagonal es toda de unos (cada variable se correlaciona perfectamente consigo misma), y la matriz es simétrica. La tasa de ahorro sr se correlaciona -0.456 con la proporción de población joven y +0.317 con la proporción de población anciana, exactamente los dos signos que predice la teoría del ciclo de vida. Nota también el -0.908 entre pop15 y pop75: los países con muchos niños tienen pocos ancianos y viceversa, así que esos dos predictores llevan casi la misma información. Esa casi duplicación importará cuando los datos de ahorro regresen para la regresión múltiple en el Capítulo 8 y para los diagnósticos en el Capítulo 9.

Para calibrar tu ojo, la Figure 3 muestra seis nubes con correlaciones desde fuertemente negativa hasta casi perfecta. Una correlación de ±0.3\pm 0.3 todavía parece una mancha sin forma para la mayoría de la gente; hay que llegar a 0.7 o así antes de que la tendencia lineal salte a la vista. La correlación de ahorro de -0.46 está entre el segundo y el tercer panel.

Seis diagramas de dispersión dispuestos en dos filas, cada uno una nube de unos 120 puntos, etiquetados con su correlación. Desde arriba a la izquierda las correlaciones son aproximadamente menos 0.9 (una banda descendente apretada), menos 0.4 (una mancha descendente floja), 0.0 (una nube redonda sin forma), 0.3 (una mancha apenas inclinada), 0.7 (una banda ascendente clara) y 0.95 (una recta ascendente muy apretada).

Figure 3:Seis correlaciones para que el ojo memorice. Las correlaciones débiles cerca de más o menos 0.3 parecen casi redondas; una banda lineal clara no aparece hasta que la correlación alcanza aproximadamente 0.7.

Leer una correlación a partir de una imagen es una habilidad que se entrena, y los seis paneles congelados de arriba solo te llevan hasta cierto punto, así que recorre el deslizador de abajo por todo el rango y calibra tu ojo contra una nube que se mueve.

Un deslizador fija la correlación poblacional rho y reconstruye los mismos 120 puntos con ese valor: cada punto conserva su X y solo se mueven las alturas. La r de la muestra nunca es exactamente rho.

4.2 La correlación y la pendiente de regresión

Intuición

La correlación y la pendiente de regresión del Capítulo 2 están midiendo la misma relación, así que no pueden ser números independientes. La pendiente b1b_1 responde “cuántas unidades de YY por unidad de XX”, llevando unidades; la correlación rr responde “cuántas desviaciones estándar de YY por desviación estándar de XX”, sin llevar ninguna. Convierte una en la otra poniendo o quitando las unidades, lo cual significa multiplicar o dividir por el cociente de las dos desviaciones estándar. Esta sección hace eso exacto, porque el vínculo entre rr y b1b_1 explica un hecho que encontrarás una y otra vez: la correlación al cuadrado es la fracción de la varianza que explica la regresión.

Fórmula

La pendiente y la correlación están ligadas por

b1=rsysx,r=b1sxsy,r2=R2=SSRSSTO.b_1 = r\,\frac{s_y}{s_x}, \qquad r = b_1\,\frac{s_x}{s_y}, \qquad r^2 = R^2 = \frac{\mathrm{SSR}}{\mathrm{SSTO}} .

En palabras: la pendiente es la correlación escalada según cuánta más dispersión tiene YY que XX, y elevar al cuadrado la correlación da exactamente la proporción de la varianza de YY que explica la regresión.

Derivación (el vínculo exacto entre rr, b1b_1 y R2R^2)

Demostración. Parte de las dos definiciones y factoriza. Como sy/sx=Syy/Sxxs_y/s_x = \sqrt{S_{yy}/S_{xx}} (los factores (n1)(n-1) se cancelan),

b1=SxySxx=SxySxxSyyrSxxSyySxx=rSyySxx=rsysx.b_1 = \frac{S_{xy}}{S_{xx}} = \underbrace{\frac{S_{xy}}{\sqrt{S_{xx} S_{yy}}}}_{r}\cdot \frac{\sqrt{S_{xx} S_{yy}}}{S_{xx}} = r\,\sqrt{\frac{S_{yy}}{S_{xx}}} = r\,\frac{s_y}{s_x} .

Despejando rr se obtiene r=b1sx/syr = b_1\, s_x/s_y. Ambas estimaciones comparten el signo de SxyS_{xy}, así que una pendiente positiva siempre viene con una correlación positiva y nunca discrepan en signo.

Ahora la conexión con R2R^2. A partir de la recta ajustada de 2.2 Mínimos cuadrados desde los primeros principios la suma de cuadrados de la regresión es SSR=(Y^iYˉ)2=b12Sxx\mathrm{SSR} = \sum(\hat Y_i - \bar Y)^2 = b_1^2 S_{xx}, y como b1Sxx=Sxyb_1 S_{xx} = S_{xy} esto es SSR=b1Sxy\mathrm{SSR} = b_1 S_{xy}. Divide entre SSTO=Syy\mathrm{SSTO} = S_{yy}:

R2=SSRSSTO=b1SxySyy=SxySxxSxySyy=Sxy2SxxSyy=r2.R^2 = \frac{\mathrm{SSR}}{\mathrm{SSTO}} = \frac{b_1 S_{xy}}{S_{yy}} = \frac{S_{xy}}{S_{xx}}\cdot\frac{S_{xy}}{S_{yy}} = \frac{S_{xy}^2}{S_{xx} S_{yy}} = r^2 .

Así que el coeficiente de determinación no es más que la correlación al cuadrado, en la regresión lineal simple. \blacksquare

Vale la pena enunciar una consecuencia más, porque explica un enigma del Capítulo 2. Si regresas XX sobre YY en lugar de YY sobre XX, la pendiente es b1=Sxy/Syyb_1' = S_{xy}/S_{yy}. Multiplica las dos pendientes:

b1b1=SxySxxSxySyy=r2.b_1 \cdot b_1' = \frac{S_{xy}}{S_{xx}}\cdot\frac{S_{xy}}{S_{yy}} = r^2 .

Las dos pendientes de regresión son recíprocas solo cuando r2=1r^2 = 1, es decir solo cuando el ajuste es perfecto. De lo contrario, regresar YY sobre XX y XX sobre YY dan rectas genuinamente distintas, y sus pendientes se multiplican para dar r2r^2. La correlación es el único resumen simétrico al que no le importa a cuál variable llames la respuesta.

4.3 Inferencia para la correlación

Intuición

El -0.46 es una correlación muestral, calculada a partir de los 50 países que resultaron estar en la tabla. Detrás de ella hay una correlación poblacional ρ\rho (la letra griega rho), el valor que obtendríamos de todos los países que podrían existir bajo las mismas condiciones. Tenemos las mismas dos preguntas de siempre: ¿podría el verdadero ρ\rho ser cero, con nuestro -0.46 solo como ruido de muestreo, y qué rango de valores de ρ\rho es consistente con los datos? La primera es una prueba de hipótesis, la segunda un intervalo de confianza. La prueba resulta ser una que ya conoces disfrazada, y el intervalo necesita un cambio de variable ingenioso.

Fórmula

Para probar H0:ρ=0H_0: \rho = 0 contra Ha:ρ0H_a: \rho \ne 0, usa

t=rn21r2,ttn2 bajo H0.t^{\ast} = \frac{r\sqrt{n-2}}{\sqrt{1 - r^2}}, \qquad t^{\ast} \sim t_{n-2} \ \text{bajo } H_0 .

Para un intervalo de confianza primero cambiamos de escala, usando la transformación zz de Fisher (Fisher’s z).

La Figure 5 muestra lo que hace la transformación. Cerca del centro de la escala apenas cambia rr: un paso de 0.45 a 0.50 mueve zz solo 0.06. Pero a medida que rr se acerca a las paredes en ±1\pm 1 la curva se vuelve casi vertical, así que el mismo paso de 0.05 de 0.90 a 0.95 mueve zz en 0.36, más de cinco veces más lejos. La transformación da a los valores amontonados cerca del techo espacio para expandirse, que es exactamente lo que convierte su pila desbalanceada en una campana simétrica.

Una curva de z igual a arctanh de r graficada contra r de menos 1 a 1. A lo largo del medio la curva casi se superpone con la recta de identidad punteada, así que z está cerca de r. A medida que r se acerca a más o menos 1 la curva se dobla bruscamente hacia arriba y hacia abajo hacia más y menos infinito. Un marcador verde muestra un paso de 0.05 en r cerca del medio (0.45 a 0.50) que produce solo un cambio de 0.06 en z; un marcador naranja muestra el mismo paso de 0.05 cerca de la pared (0.90 a 0.95) que produce un cambio de 0.36 en z.

Figure 5:La z de Fisher deja el medio de la escala de correlación casi intacto pero estira los extremos: el mismo paso de 0.05 en r que apenas mueve z en el medio se vuelve un salto grande cerca de la pared en 1. Ese estiramiento descongestiona la pila de correlaciones cerca del techo.

En esta escala la distribución muestral de zz es aproximadamente normal con una dispersión que ya no depende del ρ\rho desconocido, zN(arctanh(ρ), 1/(n3))z \approx N(\operatorname{arctanh}(\rho),\ 1/(n-3)); la siguiente derivación muestra por qué, y el Teorema 4.7 lo enuncia con precisión.

En palabras: la prueba de correlación es una prueba tt con n2n-2 grados de libertad, y para construir un intervalo nos movemos a una escala donde la distribución muestral es normal con una dispersión conocida, construimos el intervalo ahí, y transformamos de vuelta.

Derivación (la prueba tt de correlación es la prueba tt de la pendiente)

Demostración. De 3.7 La prueba F y su equivalencia con la prueba t la pendiente se prueba con t=b1/s{b1}t = b_1 / s\{b_1\}, donde s{b1}=MSE/Sxxs\{b_1\} = \sqrt{\mathrm{MSE}/S_{xx}} y MSE=SSE/(n2)\mathrm{MSE} = \mathrm{SSE}/(n-2). Dos hechos de 4.2 La correlación y la pendiente de regresión hacen el trabajo. Primero, SSE=SSTOSSR=Syy(1r2)\mathrm{SSE} = \mathrm{SSTO} - \mathrm{SSR} = S_{yy}(1 - r^2), ya que SSR=r2Syy\mathrm{SSR} = r^2 S_{yy}. Segundo, b1Sxx=r(sy/sx)Sxx=rSyyb_1\sqrt{S_{xx}} = r\,(s_y/s_x)\sqrt{S_{xx}} = r\sqrt{S_{yy}}. Sustituye:

t=b1MSE/Sxx=b1SxxSSE/(n2)=rSyySyy(1r2)/(n2)=rn21r2=t.t = \frac{b_1}{\sqrt{\mathrm{MSE}/S_{xx}}} = \frac{b_1 \sqrt{S_{xx}}}{\sqrt{\mathrm{SSE}/(n-2)}} = \frac{r\sqrt{S_{yy}}}{\sqrt{S_{yy}(1-r^2)/(n-2)}} = \frac{r\sqrt{n-2}}{\sqrt{1-r^2}} = t^{\ast} .

El SyyS_{yy} se cancela, y el estadístico tt de la pendiente y el estadístico tt de la correlación son el mismo número idéntico. Probar “¿es cero la pendiente?” y “¿es cero la correlación?” son la misma prueba, como deben serlo, ya que b1b_1 y rr comparten un signo y se anulan juntos. \blacksquare

Esbozo de derivación (la transformación zz de Fisher)

La prueba tt maneja ρ=0\rho = 0, pero un intervalo de confianza para un ρ\rho distinto de cero es más difícil, por dos razones. Cuando ρ\rho está lejos de cero la distribución muestral de rr es sesgada, porque rr queda atrapado bajo el techo en 1 (o sobre el piso en -1) y se amontona contra él. Y la varianza de rr depende del propio ρ\rho, así que ni siquiera podemos escribir un error estándar fijo. La idea de Fisher fue encontrar una transformación g(r)g(r) que cure ambos problemas a la vez.

Demostración (esbozo). Para una muestra de una población normal bivariada, la teoría de muestras grandes da a rr una media aproximada ρ\rho y una varianza

Var(r)(1ρ2)2n.\operatorname{Var}(r) \approx \frac{(1-\rho^2)^2}{n} .

Queremos una función gg tal que g(r)g(r) tenga una varianza libre de ρ\rho. El método delta (una expansión de Taylor de primer orden, g(r)g(ρ)+g(ρ)(rρ)g(r) \approx g(\rho) + g'(\rho)(r - \rho)) dice

Var(g(r))(g(ρ))2Var(r)=(g(ρ))2(1ρ2)2n.\operatorname{Var}\big(g(r)\big) \approx \big(g'(\rho)\big)^2 \operatorname{Var}(r) = \big(g'(\rho)\big)^2 \frac{(1-\rho^2)^2}{n} .

Para eliminar la dependencia de ρ\rho, exige g(ρ)=1/(1ρ2)g'(\rho) = 1/(1-\rho^2). Integrar esa derivada da

g(ρ)=dρ1ρ2=12ln1+ρ1ρ=arctanh(ρ),g(\rho) = \int \frac{d\rho}{1-\rho^2} = \tfrac12 \ln\frac{1+\rho}{1-\rho} = \operatorname{arctanh}(\rho),

y con esta elección Var(g(r))1/n\operatorname{Var}(g(r)) \approx 1/n, constante al fin. El análisis más fino de Fisher reemplaza el nn por n3n-3 para un mejor ajuste en muestras pequeñas y muestra que la distribución de z=arctanh(r)z = \operatorname{arctanh}(r) es cercana a la normal, no sesgada. Así que zN(arctanh(ρ),1/(n3))z \approx N(\operatorname{arctanh}(\rho),\, 1/(n-3)). \blacksquare

Dos notas de honestidad. La distribución muestral exacta de rr bajo normalidad bivariada se conoce en forma cerrada pero es una función especial complicada; la aproximación normal a zz es lo que todo el mundo realmente usa, y la siguiente simulación muestra por qué es segura. Y todo el argumento supone que los datos son en verdad normales bivariados. Cuando eso está en duda, el bootstrap del Capítulo 5 (5.4 El bootstrap para la regresión) da un intervalo de confianza para ρ\rho que no se apoya en ningún supuesto distribucional.

Para construir un intervalo del 95 por ciento: calcula z=arctanh(r)z = \operatorname{arctanh}(r), forma z±1.96/n3z \pm 1.96/\sqrt{n-3}, y transforma ambos extremos de vuelta con tanh\tanh.

La transformación, verificada por simulación

El argumento de Fisher se apoyó en dos afirmaciones: que rr es sesgado mientras que zz es casi normal, y que la desviación estándar de zz es cercana a 1/n31/\sqrt{n-3}. Ambas son verificables sin más álgebra. Extrae muchas muestras de una normal bivariada con un ρ\rho conocido, calcula rr cada vez, y observa la pila de resultados.

set.seed(4210)
simulate_r <- function(n, rho, reps = 10000) {
  replicate(reps, {
    z1 <- rnorm(n)
    z2 <- rnorm(n)
    xa <- z1
    ya <- rho * z1 + sqrt(1 - rho^2) * z2
    cor(xa, ya)
  })
}
rs <- simulate_r(n = 20, rho = 0.7)
zs <- atanh(rs)
round(c(mean_r = mean(rs), sd_r = sd(rs),
        mean_z = mean(zs), sd_z = sd(zs),
        theory_sd_z = 1 / sqrt(20 - 3)), 4)
     mean_r        sd_r      mean_z        sd_z theory_sd_z 
     0.6919      0.1250      0.8906      0.2412      0.2425 
rng = np.random.default_rng(4210)
def simulate_r(n, rho, reps=10000):
    out = np.empty(reps)
    for i in range(reps):
        z1 = rng.standard_normal(n)
        z2 = rng.standard_normal(n)
        xa = z1
        ya = rho * z1 + np.sqrt(1 - rho ** 2) * z2
        out[i] = np.corrcoef(xa, ya)[0, 1]
    return out

rs = simulate_r(20, 0.7)
zs = np.arctanh(rs)
print(round(rs.mean(), 4), round(rs.std(ddof=1), 4),
      round(zs.mean(), 4), round(zs.std(ddof=1), 4),
      round(1 / np.sqrt(20 - 3), 4))
0.6893 0.1254 0.8852 0.2405 0.2425

La desviación estándar simulada de zz es 0.2412 (R) y 0.2405 (Python), ambas un pelo por debajo del teórico 1/17=0.24251/\sqrt{17} = 0.2425, lo que confirma la fórmula de la varianza. La media de zz cae cerca de arctanh(0.7)=0.867\operatorname{arctanh}(0.7) = 0.867, próxima al 0.89 simulado. La Figure 6 cuenta la mitad visual de la historia: las correlaciones crudas se agrupan y sesgan hacia el techo en 1, mientras que los valores transformados se sitúan bajo una curva normal simétrica. Ese sesgo es exactamente por qué nunca construimos el intervalo en la escala cruda de rr.

Dos histogramas lado a lado a partir de 10000 muestras simuladas de tamaño 20 con correlación verdadera 0.7. El histograma izquierdo de la correlación muestral r es claramente sesgado, con una cola larga hacia valores más pequeños y una acumulación aguda cerca de 0.9, y una línea discontinua marca el rho verdadero de 0.7. El histograma derecho de z igual a arctanh de r es simétrico y sigue de cerca una curva normal superpuesta centrada cerca de 0.87.

Figure 6:Diez mil correlaciones muestrales con rho verdadero 0.7 y n 20. La r cruda (izquierda) es sesgada y amontona el techo en 1; la z transformada de Fisher (derecha) es casi normal con la dispersión predicha, que es por qué los intervalos de confianza se construyen en la escala z.

4.4 El modelo normal bivariado

Intuición

Hasta ahora hemos imaginado una variable como un conjunto de perillas que fijamos de antemano, con solo la otra libre de variar, el montaje de regresión del Capítulo 2. La correlación tiene un segundo hogar, más equitativo, donde ambas mediciones son aleatorias y llegan juntas como un par, como la estatura y el peso de una persona al azar medidos en el mismo momento. En esa imagen las dos variables se extraen juntas de una sola distribución conjunta. La distribución más limpia de ese tipo es la normal bivariada (bivariate normal), cuyas líneas de contorno son elipses. Cuando la correlación es cero la elipse es un círculo; a medida que crece la correlación el círculo se estira e inclina hacia la línea de 45 grados, volviéndose un cigarro delgado a medida que se acerca a ±1\pm 1. La Figure 7 muestra la progresión.

Tres gráficos de contorno de densidades normales bivariadas con márgenes normales estándar. En rho 0 los contornos son círculos concéntricos. En rho 0.6 son elipses inclinadas a lo largo de la diagonal ascendente. En rho 0.9 son elipses largas y delgadas que abrazan la línea de 45 grados.

Figure 7:La normal bivariada en tres correlaciones. El parámetro rho controla cuánto se estiran e inclinan los contornos circulares en elipses; en rho cerca de 1 las dos variables son casi una línea recta.

Fórmula

En palabras: la fórmula da más miedo que la idea. La densidad se acumula más alta en el punto central (μX,μY)(\mu_X, \mu_Y) y decae en anillos ovalados a su alrededor, y el único número ρ\rho decide cuánto se inclinan y estiran esos anillos alejándose de los círculos. Lee las piezas una a la vez.

El hecho más útil sobre este modelo es lo que dice sobre YY una vez que conoces XX. La distribución condicional (conditional distribution) de YY dado X=xX = x es de nuevo normal, con

E{YX=x}=μY+ρσYσX(xμX),Var{YX=x}=σY2(1ρ2).E\{Y \mid X = x\} = \mu_Y + \rho\,\frac{\sigma_Y}{\sigma_X}(x - \mu_X), \qquad \operatorname{Var}\{Y \mid X = x\} = \sigma_Y^2(1 - \rho^2).

En palabras: dentro de una normal bivariada, la regresión de YY sobre XX es exactamente lineal, con pendiente poblacional ρσY/σX\rho\,\sigma_Y/\sigma_X, y la varianza restante es la varianza original encogida por el factor 1ρ21 - \rho^2.

Derivación (la recta de regresión oculta)

Demostración. La densidad conjunta se factoriza como f(x,y)=fX(x)f(yx)f(x,y) = f_X(x)\, f(y \mid x), donde fXf_X es la marginal N(μX,σX2)N(\mu_X, \sigma_X^2). Divide la densidad completa entre esa marginal. Los términos que dependen solo de xx se cancelan, y después de completar el cuadrado en yy dentro del exponente, lo que queda es una densidad normal en yy con media μY+ρ(σY/σX)(xμX)\mu_Y + \rho(\sigma_Y/\sigma_X)(x-\mu_X) y varianza σY2(1ρ2)\sigma_Y^2(1-\rho^2). El paso de completar el cuadrado es la misma álgebra que se usa para la normal univariada; el término cruzado 2ρ(xμX)(yμY)/(σXσY)-2\rho(x-\mu_X)(y-\mu_Y)/(\sigma_X\sigma_Y) es lo que empuja el centro de la distribución condicional fuera de μY\mu_Y por una cantidad proporcional a (xμX)(x - \mu_X). \blacksquare

Compara la pendiente poblacional ρσY/σX\rho\,\sigma_Y/\sigma_X con la pendiente muestral b1=rsy/sxb_1 = r\,s_y/s_x de 4.2 La correlación y la pendiente de regresión: son la misma fórmula, una con cantidades poblacionales y otra con sus estimaciones muestrales. La recta de regresión del Capítulo 2 es la versión muestral de la media condicional de la normal bivariada. Y la identidad de la varianza Var{YX}=σY2(1ρ2)\operatorname{Var}\{Y \mid X\} = \sigma_Y^2(1 - \rho^2) es la gemela poblacional de R2=r2R^2 = r^2: conocer XX elimina la fracción ρ2\rho^2 de la varianza de YY, dejando 1ρ21 - \rho^2. Cuando ρ=0.7\rho = 0.7, conocer XX explica 0.49 de la varianza y deja algo más de la mitad.

4.5 La correlación de rangos de Spearman

Intuición

La rr de Pearson mide la asociación en línea recta, y confía en cada valor tal como es, así que un solo punto extremo puede moverla mucho. A menudo te interesa una pregunta más suave: a medida que XX sube, ¿tiende YY a subir, sea o no a lo largo de una línea recta? Esa es una pregunta sobre orden, no sobre distancia, y tiene su propio coeficiente. La correlación de rangos de Spearman (Spearman rank correlation) (Definición 4.10) reemplaza cada valor por su rango (el más pequeño es 1, el siguiente es 2, y así) y luego calcula la correlación de Pearson ordinaria de esos rangos. Como los rangos ignoran qué tan separados están los valores y solo ven su orden, Spearman no se perturba por un valor atípico solitario ni por curvas que son monótonas pero no rectas.

La Figure 8 muestra el caso de la curva. A la izquierda hay una relación que siempre sube pero se dobla, así que Pearson lee solo 0.91, penalizando el doblez. Reemplaza cada valor por su rango, y los mismos puntos se ajustan a una diagonal perfecta: el rango 1 en XX se empareja con el rango 1 en YY, el rango 2 con el rango 2, y así hasta arriba. Como el orden es perfecto, aunque el espaciado no lo sea, Spearman es exactamente 1. Los rangos enderezan cualquier curva monótona.

Dos paneles. El panel izquierdo grafica Y contra X para 40 puntos que suben lentamente y luego de forma pronunciada, una curva suave que se dobla hacia arriba; su título reporta r de Pearson igual a 0.91. El panel derecho grafica el rango de Y contra el rango de X para los mismos 40 puntos; caen exactamente sobre una línea diagonal discontinua, y el título reporta Spearman igual a 1.00.

Figure 8:Los mismos datos monótonos pero curvos vistos de dos maneras. Pearson lee solo 0.91 porque la nube cruda se dobla, pero los rangos caen en una línea perfecta, así que Spearman es exactamente 1. Spearman premia el orden e ignora el espaciado.

Fórmula

En palabras: Spearman es Pearson aplicado a los rangos, así que mide si las dos variables suben y bajan juntas en orden, y no le importa el espaciado exacto de los valores.

R y Python

Los datos de ahorro tienen un caso de prueba natural. La tasa de crecimiento del ingreso, ddpi, se correlaciona con la tasa de ahorro, pero un país, Libia, tuvo una enorme tasa de crecimiento del ingreso durante el periodo y solo una tasa de ahorro mediana. Ese único punto arrastra hacia abajo la correlación de Pearson. Spearman, que ve a Libia simplemente como “el país de mayor crecimiento” en lugar de como un punto muy alejado a la derecha, se perturba menos.

Diagrama de dispersión de la tasa de ahorro frente a la tasa de crecimiento del ingreso para 50 países. La mayoría de los países se agrupan con tasas de crecimiento de 0 a 8 por ciento y tasas de ahorro de 0 a 18 por ciento. Un diamante rojo, etiquetado Libia, está muy a la derecha con una tasa de crecimiento cerca de 17 por ciento y una tasa de ahorro cerca de 9 por ciento. Un cuadro de texto reporta r de Pearson igual a 0.30 y Spearman igual a 0.41.

Figure 9:El crecimiento extremo del ingreso de Libia la convierte en un valor atípico que arrastra la correlación de Pearson hasta 0.30; Spearman, que lee solo rangos, reporta la más fuerte 0.41 que se ve en el grueso de los países.

Ninguno de los dos números es “el correcto”. Responden preguntas distintas. Pearson pregunta sobre la fuerza en línea recta y cuenta la distancia de Libia; Spearman pregunta sobre el orden monótono y no lo hace. Cuando discrepan, esa discrepancia es información: dice que hay presente un valor atípico o una curva, y deberías mirar el gráfico antes de citar cualquiera de los dos.

La distancia entre los dos coeficientes es más fácil de creer cuando la abres y la cierras con tu propio dedo, así que arrastra el sustituto de Libia y observa cuál de los dos números reacciona.

Arrastra de lado el punto de la extrema derecha y la r de Pearson cae de 0.85 a 0.46, mientras que la correlación de rangos de Spearman se mantiene en 0.885, porque ningún par de puntos cambió jamás de lugar.

4.6 Cuatro maneras en que una correlación miente

Un solo número que comprime un diagrama de dispersión debe tirar información, y a veces tira la parte que importaba. La demostración fundacional es el cuarteto de Anscombe: cuatro conjuntos de datos, construidos por el estadístico Frank Anscombe en 1973, que comparten las mismas medias, las mismas desviaciones estándar, la misma correlación de 0.816 y la misma recta ajustada, y sin embargo no se parecen en nada.

anscombe <- read.csv("data/anscombe.csv")
stats_row <- function(i) {
  xi <- anscombe[[paste0("x", i)]]
  yi <- anscombe[[paste0("y", i)]]
  f <- lm(yi ~ xi)
  c(set = i, mean_x = mean(xi), mean_y = mean(yi),
    r = cor(xi, yi), b0 = coef(f)[[1]], b1 = coef(f)[[2]])
}
round(t(sapply(1:4, stats_row)), 3)
     set mean_x mean_y     r    b0  b1
[1,]   1      9  7.501 0.816 3.000 0.5
[2,]   2      9  7.501 0.816 3.001 0.5
[3,]   3      9  7.500 0.816 3.002 0.5
[4,]   4      9  7.501 0.817 3.002 0.5
anscombe = pd.read_csv("data/anscombe.csv")
for i in range(1, 5):
    xi = anscombe[f"x{i}"]
    yi = anscombe[f"y{i}"]
    f = smf.ols(f"y{i} ~ x{i}", data=anscombe).fit()
    print(i, round(xi.mean(), 2), round(yi.mean(), 3),
          round(xi.corr(yi), 3), round(f.params.iloc[0], 3),
          round(f.params.iloc[1], 3))
1 9.0 7.501 0.816 3.0 0.5
2 9.0 7.501 0.816 3.001 0.5
3 9.0 7.5 0.816 3.002 0.5
4 9.0 7.501 0.817 3.002 0.5

Las cuatro filas son idénticas hasta tres decimales. La Figure 11 las grafica, y solo el gráfico revela la verdad. El Conjunto I es una dispersión lineal genuina, el caso honesto. El Conjunto II es una curva suave, donde una correlación en línea recta es el resumen totalmente equivocado. El Conjunto III es una recta perfecta con un valor atípico que inclina el ajuste y baja rr de 1 a 0.82. El Conjunto IV es el más alarmante: diez puntos apilados en un solo valor de xx no llevan ninguna información sobre la pendiente, y un solo punto solitario muy a la derecha inventa toda la correlación. Elimina ese único punto y rr queda indefinida. La lección que sacó Anscombe, y el primer hábito de cualquier analista honesto, es graficar los datos antes de confiar en el número.

Una cuadrícula de dos por dos de diagramas de dispersión, el cuarteto de Anscombe, cada uno con la misma recta ajustada y-hat igual a 3 más 0.5 x y la misma r de 0.82. El panel I es una banda floja de puntos con pendiente ascendente. El panel II es una curva suave cóncava hacia abajo. El panel III es una recta ascendente apretada con un punto muy por encima de ella. El panel IV tiene diez puntos apilados en una columna vertical en x igual a 8 más un punto aislado en x igual a 19.

Figure 11:El cuarteto de Anscombe: cuatro conjuntos de datos con medias idénticas, correlaciones de 0.82 y rectas ajustadas, pero cuatro formas diferentes. Solo el panel I queda bien resumido por una correlación; el número es engañoso para la curva, el valor atípico y el único punto de apalancamiento.

El cuarteto es una pieza de museo, construida para dejar clara la idea. Los mismos cuatro fallos aparecen en datos reales, así que aquí están uno por uno, con el mecanismo nombrado.

No linealidad. La correlación mide solo la asociación en línea recta. Una relación puede ser perfectamente predecible y aun así tener una correlación de Pearson cercana a cero, como en una forma de U simétrica donde YY cae y luego sube: las mitades de bajada y de subida se cancelan. Una rr pequeña nunca significa “sin relación”. Significa “sin relación en línea recta”, y la única forma de distinguir es mirar. El Conjunto II de Anscombe es esta trampa; el remedio es un diagrama de dispersión y, si aparece una curva, las transformaciones del Capítulo 10.

Valores atípicos. Como rr eleva al cuadrado las distancias, un solo punto muy alejado de la multitud puede dominar la suma, ya sea fabricando una correlación (Conjunto IV) o destruyéndola (Conjunto III). El ejemplo de Libia en la Figure 9 es la versión suave, con datos reales. Las defensas son graficar los datos, verificar si uno o dos puntos están impulsando el resultado recalculando sin ellos, y reportar Spearman junto con Pearson cuando discrepan.

Restricción del rango. La correlación depende de la dispersión de XX. Aprieta esa dispersión y la correlación se encoge hacia cero, aunque la relación subyacente no haya cambiado en absoluto. Los datos de estatura de Galton lo muestran con claridad.

galton <- read.csv("data/galton_heights.csv")
band <- galton[galton$midparentHeight >= 69 & galton$midparentHeight <= 71, ]
round(c(full_r = cor(galton$midparentHeight, galton$childHeight),
        full_n = nrow(galton),
        band_r = cor(band$midparentHeight, band$childHeight),
        band_n = nrow(band),
        sd_full = sd(galton$midparentHeight),
        sd_band = sd(band$midparentHeight)), 3)
 full_r  full_n  band_r  band_n sd_full sd_band 
  0.321 934.000   0.143 393.000   1.802   0.527 

A lo largo de los 934 hijos la correlación entre la estatura media de los padres y la estatura del hijo es 0.32. Conserva solo las familias cuya estatura media de los padres está entre 69 y 71 pulgadas, recortando la desviación estándar de las estaturas de los padres de 1.80 a 0.53, y la correlación cae por más de la mitad a 0.14, como muestra la Figure 12. Nada sobre la herencia cambió; simplemente dejamos de mirar a los padres bajos y altos. Por esto una correlación calculada dentro de un grupo estrecho, estudiantes admitidos, empleados contratados, pacientes que sobreviven, subestima de forma rutinaria la asociación en la población completa. Siempre que leas una correlación débil, pregúntate sobre qué rango de XX se calculó.

Diagrama de dispersión de la estatura del hijo contra la estatura media de los padres para 934 hijos de Galton, con un ligero jitter. Una banda vertical amarilla resalta las estaturas de los padres de 69 a 71 pulgadas. Los puntos fuera de la banda son grises, los puntos dentro son azules. Una etiqueta de texto reporta la correlación de todos los datos como 0.32 y la correlación dentro de la banda amarilla como 0.14.

Figure 12:Restringir la estatura media de los padres a la estrecha banda amarilla recorta su dispersión en dos tercios y reduce la correlación a la mitad, de 0.32 a 0.14, aunque la relación en sí no cambia. La correlación depende del rango de X que muestreas.

Fija tú mismo el ancho de esa banda y comprueba cuánta correlación puedes destruir sin tocar un solo dato.

Dos deslizadores mueven y redimensionan la banda sombreada, que es la única franja de estaturas de los padres que se correlaciona. Estrecharla a 69 hasta 71 pulgadas recorta r de 0.321 a 0.100 mientras los 220 hijos siguen exactamente donde estaban.

Correlación ecológica. Una correlación calculada sobre promedios de grupo no es la correlación para los individuos, y suele ser mayor, porque promediar cancela la dispersión dentro del grupo. Agrupa a los hijos de Galton por familia y correlaciona la estatura media del hijo de la familia con la estatura media de los padres.

fam <- aggregate(cbind(midparentHeight, childHeight) ~ family,
                 data = galton, FUN = mean)
round(c(individual_r = cor(galton$midparentHeight, galton$childHeight),
        family_r = cor(fam$midparentHeight, fam$childHeight),
        n_families = nrow(fam)), 3)
individual_r     family_r   n_families 
       0.321        0.399      205.000 

La correlación a nivel individual es 0.32; la correlación de promedios familiares es 0.40, como muestra la Figure 14. Promediar suaviza las diferencias de hermano a hermano y deja una imagen más apretada, así que el número agregado exagera qué tan bien puede predecirse la estatura de un hijo a partir de los padres. Inferir el comportamiento individual a partir de promedios de grupo es la falacia ecológica (ecological fallacy), y ha llevado a errores reales: una correlación entre países, estados o distritos puede ser fuerte mientras que la misma correlación entre las personas dentro de ellos es débil o incluso opuesta. La unidad que correlacionas es parte de la afirmación.

Diagrama de dispersión de la estatura del hijo contra la estatura media de los padres. Los puntos grises son los 934 hijos individuales, formando una nube amplia con correlación 0.32. Los puntos naranjas son los 205 promedios familiares, formando una nube más apretada con correlación 0.40 que recorre el medio de la gris.

Figure 14:Los 205 promedios familiares (naranja) se correlacionan más fuertemente (0.40) que los 934 hijos individuales (gris, 0.32), porque promediar elimina la dispersión dentro de la familia. Una correlación sobre medias de grupo no es la correlación para individuos.

La afirmación de Anscombe solo cala si confirmas que los números de verdad se quedan quietos mientras la imagen cambia, así que recorre tú mismo los cuatro conjuntos y fija la vista en los valores y no en la gráfica.

Un deslizador recorre los cuatro conjuntos de Anscombe y reajusta la recta cada vez. La correlación, el intercepto, la pendiente y la media de Y apenas se apartan de 0.816, 3.00, 0.50 y 7.50 mientras la forma de los datos cambia por completo.

4.7 La regresión a la media, y por qué la correlación no es causalidad

Hay una quinta confusión que merece su propia sección, porque engañó al propio inventor de la regresión y todavía llena las noticias. Cuando Francis Galton graficó las estaturas de los hijos contra las de sus padres en la década de 1880, encontró que los padres altos tenían hijos que eran más altos que el promedio pero no tan altos como los padres, y los padres bajos tenían hijos que eran más bajos que el promedio pero no tan bajos. Al principio sospechó de alguna fuerza biológica que jalaba a la población hacia la mediocridad. No hay tal fuerza. El jalón hacia el promedio es una certeza matemática siempre que la correlación es menor que perfecta, y tiene un nombre: regresión a la media (regression to the mean).

La identidad de 4.2 La correlación y la pendiente de regresión lo hace exacto. En unidades estándar, donde ambas variables son puntuaciones z, las desviaciones estándar son ambas 1, así que la pendiente de regresión es b1=r(sy/sx)=rb_1 = r\,(s_y/s_x) = r. Un padre que está 2 desviaciones estándar por encima de la media tiene hijos predichos en solo r×2r \times 2 desviaciones estándar por encima de la media. Para los datos de Galton r=0.32r = 0.32, así que los hijos de padres muy altos se predicen apenas 0.32×2=0.640.32 \times 2 = 0.64 desviaciones estándar hacia arriba, muy por debajo de sus padres.

Diagrama de dispersión de la estatura del hijo contra la estatura media de los padres, ambas en unidades estándar, para 934 hijos de Galton. Una línea roja discontinua de 45 grados marca puntajes estándar iguales. Una línea verde sólida de mínimos cuadrados con la pendiente mucho menor de 0.32 recorre la nube. La línea verde está bien por debajo de la línea roja en el lado derecho y por encima de ella en el izquierdo, mostrando predicciones jaladas hacia la media en ambos extremos.

Figure 16:En unidades estándar la pendiente ajustada es exactamente r igual a 0.32, mucho menos pronunciada que la línea discontinua de estaturas iguales de pendiente 1. Los hijos de padres altos se predicen solo un tercio del camino hacia lo alto; los hijos de padres bajos solo un tercio del camino hacia lo bajo. Esa brecha es la regresión a la media.

La regresión a la media no es un hecho especial sobre la herencia. Ocurre siempre que dos mediciones están correlacionadas de forma imperfecta, que es casi siempre. El estudiante que saca el puntaje más alto en el examen parcial tiende a sacar un puntaje más bajo (todavía bueno, solo menos extremo) en el final. El atleta novato que aparece en la portada de una revista tras una temporada espectacular tiende a hacerlo peor al año siguiente, la llamada maldición de la portada, sin ninguna maldición involucrada. Una clínica inscribe a los pacientes con la presión arterial más alta, los trata, y ve caer su presión en promedio, en parte porque las lecturas más extremas eran extremas en parte por suerte y vuelven a la deriva por sí solas. En cada caso la lectura ingenua culpa a una causa, la presión de la fama, un medicamento milagroso, cuando la correlación imperfecta entre dos mediciones ya predice la deriva. Siempre que selecciones casos porque fueron extremos y luego los midas de nuevo, espera regresión a la media, y no le des el crédito ni la culpa a una historia.

Esta es la forma más profunda de la advertencia más vieja en estadística: la correlación no es causalidad. Una correlación entre XX y YY es consistente con que XX cause YY, con que YY cause XX, con que alguna tercera variable impulse a ambas, y con la pura coincidencia. La correlación de ahorro de -0.46 no prueba que tener hijos haga a un país ahorrativo o derrochador; el ingreso, la cultura y la historia están detrás de ambas. La correlación gana su lugar como una descripción y una primera pista, no como un veredicto. Separar las causas genuinas de las falsas necesita o bien un experimento diseñado o bien el cuidadoso razonamiento causal que el Capítulo 16 aborda (16.1 Dibujar una historia causal: diagramas de rutas), y es la cosa más difícil que este libro te pide mantener clara.

4.8 Resumen del capítulo

Ahora puedes describir una relación en línea recta con un solo número sin unidades y decir cuánto confiar en él. Conociste la correlación de Pearson como una covarianza estandarizada, demostraste que vive en [1,1][-1, 1], la ligaste con la pendiente de regresión y con R2R^2, probaste y construiste un intervalo para el valor poblacional ρ\rho, la ubicaste dentro del modelo normal bivariado, la suavizaste en la versión de rangos de Spearman, y aprendiste las cinco maneras en que engaña: la no linealidad, los valores atípicos, la restricción del rango, la agregación ecológica y el salto a la causalidad.

Resultados clave de un vistazo

ResultadoEnunciado o fórmulaVálido cuando
Correlación de Pearson (Def 4.1)r=Sxy/SxxSyyr = S_{xy}/\sqrt{S_{xx} S_{yy}}cualquier dato numérico emparejado
Cotas de rr (Teo 4.2)1r1-1 \le r \le 1; r=±1r = \pm 1 syss una recta exactasiempre
Correlación, pendiente, R2R^2 (Teo 4.4)b1=rsy/sxb_1 = r\, s_y/s_x,  r2=R2\ r^2 = R^2regresión lineal simple
Prueba tt de correlación (Teo 4.6)t=rn2/1r2tn2t^{\ast} = r\sqrt{n-2}/\sqrt{1-r^2} \sim t_{n-2}H0:ρ=0H_0:\rho = 0, errores normales
Distribución zz de Fisher (Teo 4.7)z=arctanh(r)N(arctanhρ, 1n3)z = \operatorname{arctanh}(r) \approx N(\operatorname{arctanh}\rho,\ \tfrac{1}{n-3})normal bivariada, nn grande
Condicional normal bivariada (Teo 4.9)E{Yx}=μY+ρσYσX(xμX)E\{Y \mid x\} = \mu_Y + \rho\frac{\sigma_Y}{\sigma_X}(x-\mu_X), Var=σY2(1ρ2)\operatorname{Var} = \sigma_Y^2(1-\rho^2)(X,Y)(X, Y) normal bivariada
Correlación de Spearman (Def 4.10)Pearson de los rangosorden monótono; datos ordinales o valores atípicos

Términos clave. Coeficiente de correlación, covarianza muestral, matriz de correlación, coeficiente de determinación, transformación zz de Fisher, distribución normal bivariada, distribución condicional, correlación de rangos de Spearman, restricción del rango, correlación ecológica (y la falacia ecológica), regresión a la media.

Ahora deberías poder

Dónde encaja esto. En el flujo de trabajo de modelado de El flujo de trabajo del modelado, la correlación sirve a la etapa EXPLORAR: antes de ajustar nada, observas cómo se mueven juntas cada par de variables, y la matriz de correlación es la compañera numérica del diagrama de dispersión. También alcanza la etapa USAR, a través de la inferencia para ρ\rho y las advertencias que te impiden convertir una asociación descrita en una causa afirmada. Se construye directamente sobre la recta de mínimos cuadrados de 2.2 Mínimos cuadrados desde los primeros principios y la descomposición ANOVA de 3.6 El enfoque del análisis de varianza, ya que rr, b1b_1 y R2R^2 son tres vistas de un mismo ajuste. Sus herramientas se usan de nuevo pronto: la identidad entre rr y b1b_1 de 4.2 La correlación y la pendiente de regresión regresa en el Capítulo 12 como una verificación de un R2R^2 que se infla (12.2 Elegir entre modelos: criterios de selección); los mismos datos de ahorro se vuelven una segunda regresión múltiple trabajada en el Capítulo 8, donde la fuerte correlación entre pop15 y pop75 que viste en la matriz se convierte en un problema real de colinealidad; el jalón desmedido de Libia se convierte en un diagnóstico de influencia con nombre en el Capítulo 9 (9.3 Influencia: qué puntos cambian realmente el ajuste); y el hilo de “la correlación no es causalidad” se retoma en el Capítulo 16 con las herramientas para razonar con cuidado sobre él (16.1 Dibujar una historia causal: diagramas de rutas).

4.9 Preguntas frecuentes

P1. ¿Una correlación de 0.5 es el doble de fuerte que una de 0.25? No en el sentido que más importa. Si “fuerza” significa parte de la varianza explicada, entonces r=0.5r = 0.5 da r2=0.25r^2 = 0.25 y r=0.25r = 0.25 da r2=0.0625r^2 = 0.0625, así que la primera explica cuatro veces más varianza, no el doble. La correlación y la varianza explicada son escalas distintas; deja siempre claro a cuál te refieres.

P2. ¿Qué es una correlación “grande”? Depende por completo del campo. En un experimento de física estrechamente controlado r=0.95r = 0.95 podría ser decepcionante; en las ciencias sociales, donde los resultados tienen muchas causas, r=0.3r = 0.3 puede ser un hallazgo real y útil. No hay umbral universal. Reporta el número, el intervalo y el gráfico, y deja que el lector juzgue frente a las normas del tema.

P3. La correlación es simétrica pero la regresión no. ¿Por qué? La correlación pregunta si dos variables se mueven juntas y no distingue una respuesta de un predictor, así que r(X,Y)=r(Y,X)r(X, Y) = r(Y, X). La regresión señala una variable como la respuesta y minimiza las distancias verticales hacia ella, así que intercambiar los papeles cambia qué distancias minimizas y da una recta distinta. Sus pendientes se multiplican para dar r2r^2, coincidiendo solo cuando el ajuste es perfecto.

P4. Si r=0r = 0, ¿son XX y YY independientes? No. Una correlación cero significa que no hay asociación en línea recta, pero una relación curva fuerte (una forma de U, un círculo) puede tener r=0r = 0 mientras XX y YY son de todo menos independientes. La independencia implica correlación cero; lo inverso solo se cumple dentro de modelos especiales como la normal bivariada, donde ρ=0\rho = 0 sí fuerza la independencia porque la densidad se factoriza.

P5. ¿Cuál debo reportar, Pearson o Spearman? Reporta Pearson cuando te importa la fuerza en línea recta y los datos son aproximadamente lineales sin valores atípicos salvajes. Echa mano de Spearman cuando la relación es monótona pero curva, cuando los valores atípicos están moviendo a Pearson, o cuando las variables son rangos ordinales desde el inicio. Si los dos discrepan mucho, esa brecha es una señal para graficar los datos y averiguar por qué, no para elegir en silencio el número más grande.

P6. ¿Por qué el intervalo de confianza para ρ\rho sale desbalanceado alrededor de rr? Porque el intervalo se construye simétricamente en la escala zz de Fisher y luego se dobla de vuelta con tanh\tanh, que es no lineal cerca de los extremos. Para los datos de ahorro r=0.46r = -0.46 está en el centro del intervalo zz simétrico, pero después de transformar de vuelta las cotas (0.65,0.20)(-0.65, -0.20) no son equidistantes de -0.46. Esa asimetría es una característica deseable: respeta las paredes duras en ±1\pm 1 que un intervalo simétrico en la escala cruda ignoraría.

P7. ¿Una correlación significativa significa que la relación es fuerte? No. La significancia y la fuerza son cosas distintas. Con una muestra suficientemente grande, una correlación diminuta de 0.05 puede ser estadísticamente significativa, es decir “probablemente no exactamente cero”, mientras explica una cuarta parte de uno por ciento de la varianza. Lee siempre el tamaño de rr y su intervalo, no solo el valor p; una pp pequeña dice que el efecto es real, no que es grande.

4.10 Problemas de práctica

  1. (A) En una oración cada uno, di qué te dicen el signo y el tamaño de una correlación, y por qué rr no tiene unidades.

  2. (A) Un informe da r=0.8r = 0.8 entre dos variables y lo llama “80 por ciento de acuerdo”. Explica qué está mal y da la interpretación correcta de 0.8.

  3. (A) La correlación de ahorro entre sr y pop15 es -0.46. Interpreta tanto el signo como la magnitud para un lector que nunca ha visto una correlación.

  4. (A) Explica por qué una correlación de exactamente 0 no significa que XX y YY no estén relacionadas. Bosqueja o describe una relación con r=0r = 0 que sin embargo sea perfectamente predecible.

  5. (A) Da la lista de cuatro preguntas que correrías antes de confiar en cualquier correlación reportada, y di contra qué trampa protege cada pregunta.

  6. (A) Se encuentra una correlación débil de 0.1 entre el puntaje SAT y el promedio universitario, calculada solo entre estudiantes admitidos en una escuela selectiva. Nombra la trampa y predice si la correlación de la población completa es mayor o menor.

  7. (A) Explica la regresión a la media en tus propias palabras, y da un ejemplo cotidiano que no sea de estaturas ni de puntajes de exámenes.

  8. (A) ¿Por qué las dos pendientes de regresión (de YY sobre XX y de XX sobre YY) son en general distintas, y cuándo son recíprocas entre sí?

  9. (B) Demuestra que 1r1-1 \le r \le 1 (Teorema 4.2) usando el hecho de que (ui±vi)20\sum(u_i \pm v_i)^2 \ge 0 para los valores estandarizados ui,viu_i, v_i. Enuncia la condición de igualdad y qué significa geométricamente.

  10. (B) Deriva la identidad b1=rsy/sxb_1 = r\,s_y/s_x a partir de las definiciones b1=Sxy/Sxxb_1 = S_{xy}/S_{xx} y r=Sxy/SxxSyyr = S_{xy}/\sqrt{S_{xx} S_{yy}}.

  11. (B) Muestra que R2=r2R^2 = r^2 en la regresión lineal simple (Teorema 4.4), partiendo de SSR=b12Sxx\mathrm{SSR} = b_1^2 S_{xx} y SSTO=Syy\mathrm{SSTO} = S_{yy}.

  12. (B) Demuestra que las dos pendientes de regresión satisfacen b1b1=r2b_1 \cdot b_1' = r^2, donde b1b_1' es la pendiente de XX sobre YY. Explica por qué esto obliga a que rb1b1|r| \le \sqrt{|b_1 b_1'|} sea una igualdad, no una desigualdad.

  13. (B) Deriva el estadístico tt de correlación t=rn2/1r2t^{\ast} = r\sqrt{n-2}/\sqrt{1-r^2} (Teorema 4.6) a partir del estadístico tt de la pendiente b1/s{b1}b_1/s\{b_1\}, usando SSE=Syy(1r2)\mathrm{SSE} = S_{yy}(1 - r^2).

  14. (B) Explica el argumento del método delta detrás del Teorema 4.7: partiendo de Var(r)(1ρ2)2/n\operatorname{Var}(r) \approx (1-\rho^2)^2/n, muestra que g(ρ)=arctanh(ρ)g(\rho) = \operatorname{arctanh}(\rho) hace que Var(g(r))\operatorname{Var}(g(r)) sea aproximadamente constante, y realiza la integral dρ/(1ρ2)\int d\rho/(1-\rho^2).

  15. (B) En la normal bivariada, usa el resultado de la media condicional (Teorema 4.9) para mostrar que la pendiente de regresión poblacional de YY sobre XX es ρσY/σX\rho\,\sigma_Y/\sigma_X, y que la fracción de la varianza de YY que queda después de condicionar en XX es 1ρ21 - \rho^2.

  16. (B) Muestra que si cada Yi=a+bXiY_i = a + b X_i exactamente (una recta perfecta, b0b \ne 0), entonces r=sign(b)r = \operatorname{sign}(b). ¿Cuál de las condiciones de igualdad de la derivación de las cotas cumple esto?

  17. (B) Una muestra tiene r=0.6r = 0.6 con n=19n = 19. Calcula el intervalo de confianza de Fisher del 95 por ciento para ρ\rho a mano, mostrando la zz, el error estándar y la transformación de vuelta.

  18. (B) Demuestra que la correlación de rangos de Spearman es igual a +1 para cualquier relación estrictamente creciente Y=h(X)Y = h(X), no solo una lineal, considerando cómo lucen los rangos de XX y YY.

  19. (C) Carga savings.csv y reproduce la matriz de correlación completa de sr, pop15, pop75, dpi, ddpi. Identifica las correlaciones positiva más fuerte y negativa más fuerte y explica cada una en palabras.

  20. (C) Para sr y pop75, calcula rr, corre la prueba tt, y construye el intervalo de Fisher del 95 por ciento en R o Python. Di si la correlación es significativa e interpreta el intervalo.

  21. (C) Confirma en los datos de ahorro que b1=rsy/sxb_1 = r\,s_y/s_x y R2=r2R^2 = r^2 para la regresión de sr sobre dpi. Reporta los cuatro números.

  22. (C) Calcula las correlaciones de Pearson y de Spearman entre dpi y sr. Difieren; haz el diagrama de dispersión y explica qué países impulsan la brecha.

  23. (C) Usando anscombe.csv, reproduce la tabla que muestra que los cuatro conjuntos comparten la misma media, correlación y recta ajustada, luego grafica los cuatro y describe cómo cada uno se aparta (o no) de una línea recta.

  24. (C) Usando galton_heights.csv, demuestra la restricción del rango: calcula la correlación en todos los hijos, luego en el subconjunto con estatura media de los padres entre 68 y 70 pulgadas, y reporta cuánto se encogen la correlación y la desviación estándar de la estatura de los padres.

  25. (C) Usando galton_heights.csv, ajusta childHeight ~ midparentHeight, reporta la pendiente estandarizada, y explica el número como regresión a la media. Predice la estatura de un hijo cuya estatura media de los padres está 3 desviaciones estándar por encima de la media, en unidades estándar.

  26. (C) Simula la distribución muestral de rr para n=15n = 15 y ρ=0.6\rho = 0.6 con 5000 extracciones (semilla 4210), y verifica que la desviación estándar de arctanh(r)\operatorname{arctanh}(r) sea cercana a 1/n31/\sqrt{n-3}. Reporta ambos números.

  27. (C) Agrega galton_heights.csv por familia y compara las correlaciones a nivel individual y de promedios familiares entre la estatura media de los padres y la del hijo. Explica la dirección de la diferencia como un efecto ecológico.

  28. (C) Toma cualquier par de los datos de ahorro con una correlación moderada y elimina el único punto más extremo. Recalcula rr y reporta cuánto se movió, luego di si ese punto califica como influyente.

4.11 Práctica de examen

Estas cinco preguntas están escritas al estilo de los exámenes del curso. Cada una te pide explicar tu razonamiento en oraciones completas, no solo reportar un número, porque así es como se califican los exámenes: un valor pelado gana poco crédito, y un razonamiento claro con un pequeño desliz gana la mayor parte. Trabaja cada una en papel antes de abrir la respuesta modelo. Donde una pregunta muestra salida de software, es salida genuina de los conjuntos de datos del libro.

EP 4.1 Interpreta la salida en contexto

Para los 50 países en savings.csv, la tasa de ahorro sr está correlacionada con la proporción de la población mayor de 75 años, pop75. Aquí está la salida de cor.test.

	Pearson's product-moment correlation

data:  savings$sr and savings$pop75
t = 2.3118, df = 48, p-value = 0.02513
alternative hypothesis: true correlation is not equal to 0
95 percent confidence interval:
 0.04186153 0.54670273
sample estimates:
      cor 
0.3165211 

Reporta la correlación muestral e interpreta su signo y su tamaño en el contexto de las dos variables. Di si la correlación es significativamente distinta de cero al nivel del 5 por ciento y cómo lo lees en la salida. Interpreta el intervalo de confianza, explica en una oración por qué no es simétrico alrededor de la correlación muestral, y di si el resultado muestra que tener más personas ancianas hace que un país ahorre más.

EP 4.2 La afirmación de una estudiante

Una compañera de clase corre la correlación entre la tasa de ahorro sr y la tasa de crecimiento del ingreso ddpi y obtiene lo siguiente.

r = 0.3048   r^2 = 0.0929   t = 2.2171   p = 0.031385

Ella escribe: “La correlación entre el crecimiento del ingreso y el ahorro es estadísticamente significativa (p=0.03p = 0.03), así que el crecimiento del ingreso es un fuerte impulsor del ahorro nacional.” Evalúa su afirmación, corrigiendo cada error que encuentres.

EP 4.3 Qué cambiaría si

A lo largo de los 934 hijos en galton_heights.csv, la correlación entre la estatura media de los padres y la estatura del hijo es la siguiente.

full_r = 0.321   full_n = 934   full_sd(midparent) = 1.802

Supón que recalcularas esta correlación usando solo las familias cuya estatura media de los padres está entre 69.5 y 70.5 pulgadas. Predice si la correlación subiría, bajaría o quedaría igual, explica el mecanismo, y di si la relación subyacente entre padres e hijos ha cambiado.

EP 4.4 Explica por qué

Para el crecimiento del ingreso ddpi contra la tasa de ahorro sr, los dos coeficientes de correlación discrepan, y un país sobresale.

pearson  = 0.3048   spearman = 0.4082
country    ddpi    sr
Libya     16.71   8.89

Explica por qué las correlaciones de Pearson y de Spearman difieren aquí, usando a Libia para hacer concreto el mecanismo. Luego di cuál de los dos números es “el correcto” y qué debería llevarte a hacer su discrepancia.

EP 4.5 La afirmación de un estudiante sobre la regresión a la media

La regresión de la estatura del hijo sobre la estatura media de los padres en galton_heights.csv da lo siguiente.

r = 0.321   slope = 0.637   sd(midparent) = 1.802   sd(child) = 3.579

Un estudiante razona: “Los hijos de padres altos son en promedio más bajos que sus padres, así que las familias altas están revirtiendo hacia el promedio, y a lo largo de suficientes generaciones la estatura de todos convergerá a la media.” Evalúa el razonamiento, usando la pendiente estandarizada, y di qué le pasará en realidad a la dispersión de las estaturas a lo largo de las generaciones.

Juego del capítulo