Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

8. La regresión múltiple en la práctica

Volvemos a las ciudades de Dwaine Studios de los Capítulos 6 y 7 (7.1 El modelo y los mínimos cuadrados en forma matricial), donde una cadena de estudios de retratos en pueblos de tamaño medio quiere decidir, para una ciudad en la que nunca ha entrado, cuánto venderá un nuevo estudio. Dos números registrados sobre cada una de sus 21 ciudades explican de forma plausible esa respuesta: la población objetivo targtpop (miles de personas menores de 16 años, el conjunto de posibles clientes de retratos familiares) y el ingreso disponible dispoinc (miles de dólares por persona, cuánto tienen esas familias para gastar), que juntos predicen las ventas anuales sales (miles de dólares).

En el Capítulo 6 organizamos estos datos en matrices, y en el Capítulo 7 resolvimos las ecuaciones normales XXb=XY\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y} para obtener los coeficientes de mínimos cuadrados b=(XX)1XY=(68.86, 1.45, 9.37)\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} = (-68.86,\ 1.45,\ 9.37); véase 7.1 El modelo y los mínimos cuadrados en forma matricial. Esa fue la etapa de AJUSTE. Este capítulo trata de lo que viene después: leer esos tres números con honestidad, decidir cuáles predictores se ganan su lugar, y conocer las trampas que esperan a cualquiera que reporte un coeficiente sin pensar. La Figure 1 muestra la materia prima, las ventas contra cada predictor uno a la vez.

Dos diagramas de dispersión uno al lado del otro para las 21 ciudades de Dwaine Studios. El panel izquierdo grafica las ventas en miles de dólares contra la población objetivo, mostrando una fuerte tendencia lineal ascendente. El panel derecho grafica las ventas contra el ingreso disponible, mostrando una tendencia positiva ascendente más débil pero aún presente, con más dispersión.

Figure 1:Las ventas de Dwaine contra cada predictor por separado. Ambas pendientes son positivas: una mayor población objetivo y un mayor ingreso van cada uno con mayores ventas. El trabajo del capítulo es desenredar estas dos historias que se solapan en un solo modelo que sostiene ambas a la vez.

Ambos cuadros suben, así que ambos predictores parecen útiles. Pero los dos predictores también se mueven juntos (las ciudades más ricas tienden a tener perfiles de edad distintos), y ese solapamiento es toda la dificultad de la regresión múltiple. Un coeficiente en una regresión múltiple no es la pendiente que verías en un diagrama de dispersión de un solo predictor. Responde a una pregunta más cuidadosa, y este capítulo trata de plantear esa pregunta correctamente, probar si un predictor pertenece al modelo, y ver la respuesta en una imagen.

8.1 Lectura de los coeficientes de una regresión múltiple

Intuición

El ajuste nos entregó tres números. Esta sección trata de lo que significa honestamente cada uno, porque la lectura obvia es la equivocada. La versión corta: un número en una regresión múltiple responde a una pregunta más cuidadosa que el mismo número de aspecto parecido en un gráfico de un solo predictor.

El ajuste de Dwaine es sales^=68.86+1.45targtpop+9.37dispoinc\widehat{\text{sales}} = -68.86 + 1.45\,\text{targtpop} + 9.37\,\text{dispoinc}. Es tentador leer el 9.37 igual que leemos una pendiente de regresión simple: “sube el ingreso una unidad y las ventas suben 9.37”. Esa lectura está mal de una manera concreta e importante. En un mundo de un solo predictor, mover el ingreso significa mover todo lo demás que viaja con el ingreso. En la regresión múltiple, el coeficiente del ingreso ya tuvo en cuenta la población objetivo. Mide lo que el ingreso agrega después de que la población objetivo ha dicho todo lo que puede decir.

La frase limpia es: un coeficiente de regresión múltiple es una pendiente parcial (partial slope) (Definición 8.1). Es el cambio en la respuesta media por un cambio de una unidad en ese predictor, manteniendo fijos los demás predictores. “Mantener fijo” es lo que lo hace distinto del panorama marginal de la Figure 1, donde nada se mantiene fijo y cada predictor se desplaza junto con todos los demás.

Fórmula

El modelo de regresión lineal múltiple con p1p-1 predictores se enuncia en la Definición 8.2.

Término por término:

En palabras: cada βk\beta_k es el efecto de su propio predictor después de que a los demás predictores del modelo se les ha dado su turno. Cambia qué más hay en el modelo y cambias la pregunta, así que puedes cambiar el coeficiente.

R

El ajuste en sí es una sola línea; la lectura es la parte difícil. Partimos de las mismas 21 ciudades.

dwaine <- read.csv("data/dwaine.csv")
fit <- lm(sales ~ targtpop + dispoinc, data = dwaine)
round(coef(fit), 4)
(Intercept)    targtpop    dispoinc
   -68.8571      1.4546      9.3655

El modelo ajustado ya no es una recta sino un plano que se posa sobre el suelo (targtpop, dispoinc), como en la Figure 2. Cada coeficiente es la inclinación de ese plano en una dirección. La pendiente parcial del ingreso es qué tan empinadamente sube el plano cuando caminas en la dirección del ingreso manteniendo fija tu coordenada de población.

Un diagrama de dispersión tridimensional de las 21 ciudades de Dwaine con la población objetivo y el ingreso disponible en los ejes del suelo y las ventas en el eje vertical, con el plano ajustado de mínimos cuadrados trazado a través de la nube de puntos. El plano se inclina hacia arriba en ambas direcciones del suelo, más empinadamente a lo largo del eje de la población.

Figure 2:El ajuste de Dwaine es un plano, no una recta. Caminar en la dirección de la población objetivo con el ingreso fijo asciende el plano a razón de 1.45; caminar en la dirección del ingreso con la población fija lo asciende a razón de 9.37. Las dos pendientes parciales son las dos inclinaciones de esta única superficie.

8.2 Los límites de “mantener fijos los demás”

Intuición

“Mantener fijos los demás predictores” es la interpretación correcta, y es también donde la gente cuidadosa se mete en problemas. La frase es una afirmación sobre la aritmética del plano ajustado: siempre es cierto que el coeficiente es la inclinación del plano en una dirección con las demás coordenadas fijadas. El problema es que la oración promete calladamente algo que los datos pueden no sostener, que de verdad podrías encontrar, o crear, dos ciudades idénticas en todos los predictores menos uno. Cuando los predictores se mueven juntos, esa promesa es ficción.

Mira otra vez los predictores de Dwaine. La población objetivo y el ingreso disponible tienen una correlación de 0.78. Las ciudades con muchas familias jóvenes son sistemáticamente distintas en ingreso de las ciudades con pocas. Así que “dos ciudades con la misma población objetivo pero distinto ingreso” describe una rebanada más delgada de la realidad de lo que suena, y “mantener fija la población y empujar el ingreso lejos” puede sacarte por completo de la nube de ciudades que alguna vez existieron. El coeficiente sigue siendo calculable y sigue teniendo sentido como descripción de la superficie ajustada. Lo que se debilita es el ensueño causal de que podrías intervenir sobre un predictor y dejar los demás sin tocar.

El mecanismo: un coeficiente depende de sus acompañantes

Un coeficiente no es una propiedad de un predictor. Es una propiedad de un predictor y de la compañía que mantiene. Agrega o quita otro predictor y el coeficiente puede moverse, a veces poco, a veces lo suficiente para cambiar de signo. La Figure 3 muestra la historia del ingreso de Dwaine de las dos maneras: la pendiente marginal empinada cuando el ingreso está solo, y la pendiente parcial más suave una vez que se tiene en cuenta la población.

Un diagrama de dispersión de las ventas de Dwaine contra el ingreso disponible, con los puntos coloreados por población objetivo de claro (baja) a oscuro (alta). Una recta discontinua empinada muestra la regresión simple de las ventas sobre el ingreso solo, pendiente 31.17. Segmentos sólidos más cortos dentro de bandas de color de población similar muestran una pendiente dentro de banda más suave cercana a 9.37, ilustrando que con población fija el efecto del ingreso es menor.

Figure 3:Dos respuestas a “cómo se relaciona el ingreso con las ventas”. La recta discontinua empinada ignora la población y reporta pendiente 31.17. Dentro de grupos de ciudades que comparten un nivel de población (mismo color), la pendiente del ingreso es mucho más suave, cercana a la pendiente parcial 9.37. La diferencia es la población que acompaña al ingreso en los datos crudos.

Cuando “mantener fijo” describe espacio vacío

El límite más profundo es geométrico. Mantener fija la población y variar el ingreso traza una recta a través del suelo (targtpop, dispoinc). Si la nube de datos es una elipse inclinada, porque los dos predictores están correlacionados, entonces la mayor parte de esa recta cae fuera de la nube. El modelo aún devolverá un valor ajustado ahí, pero está extrapolando hacia una región donde ninguna ciudad ha sido observada, y ningún dato restringe la respuesta. Volveremos a esto en 8.7 Dos peligros: extrapolación oculta y variables ocultas con una imagen; por ahora, retén la advertencia: un coeficiente puede estar perfectamente estimado y aun así describir una comparación que nunca podrás hacer de verdad.

El widget de abajo mantiene fija la población por ti, un nivel a la vez, para que veas cómo la pendiente parcial suave y la pendiente marginal empinada dejan de parecer rivales.

Corta el plano ajustado en una población objetivo y desliza esa población arriba y abajo. La pendiente parcial se queda en 9.37 mientras la línea marginal, de pendiente 31.17, solo traza dónde quedan esos cortes.

8.3 Sumas de cuadrados adicionales

Intuición

Necesitamos una forma de preguntar “¿cuánto agrega un predictor?” que no dependa de quedarse mirando un coeficiente. La medida natural es cuánta variación no explicada elimina un predictor cuando se une a un modelo que ya tiene a los demás. Ajusta el modelo sin el predictor y anota su suma de cuadrados del error; agrega el predictor y anota la nueva y menor suma de cuadrados del error; la caída es la suma de cuadrados adicional (extra sum of squares) del predictor (Definición 8.3). Es la variación que solo este predictor podía recoger, una vez que los demás han hecho su parte.

Dos hechos hacen que esto funcione. Primero, agregar un predictor nunca puede hacer más grande la suma de cuadrados del error (lo demostramos abajo), así que la caída nunca es negativa. Segundo, la variación total SSTO\mathrm{SSTO} en YY no depende del modelo, así que un SSE\mathrm{SSE} menor significa un SSR\mathrm{SSR} mayor: la suma de cuadrados adicional es variación que se mueve de la columna “no explicada” a la columna “explicada”.

Una imagen concreta la idea de “solo este predictor podía recoger”. Piensa en la variación de la respuesta como una diana, y en cada predictor como un círculo que cubre la parte que puede explicar. Cuando dos predictores están correlacionados, sus círculos se solapan, y la parte compartida puede acreditarse solo a uno de ellos: al que entró primero en el modelo. La suma de cuadrados adicional del segundo predictor es apenas su propia media luna, la parte de su círculo que el círculo del primer predictor no cubrió ya. La Figure 5 dibuja esto para los predictores de grasa corporal con los que trabajamos a continuación.

Un diagrama de Venn esquemático. Un círculo grande y tenue es la variación total en la grasa corporal. Un círculo azul rotulado SSR(triceps) = 352.3 y un círculo naranja rotulado SSR(thigh dado triceps) = 33.2 están dentro de él y se solapan en una región compartida. Una flecha apunta a la parte del círculo grande que queda fuera de ambos círculos de predictor, rotulada error SSE. Las áreas son esquemáticas, no a escala.

Figure 5:La suma de cuadrados adicional como círculos que se solapan. triceps entra primero y reclama todo el solapamiento compartido, así que thigh, al entrar segundo, recibe crédito solo por su propia media luna (33.2), no por la región mayor que comparte con triceps. Por eso la suma de cuadrados adicional de un predictor posterior es pequeña cuando los predictores se solapan, y por eso reordenarlos cambia el reparto.

Fórmula

Para un modelo que ya contiene un conjunto de predictores, escribe SSE()\mathrm{SSE}(\cdot) para su suma de cuadrados del error. La suma de cuadrados adicional de X2X_2 dado X1X_1 se define en la Definición 8.3.

En palabras: SSR(X2X1)\mathrm{SSR}(X_2 \mid X_1) es la variación explicada adicional que compras al agregar X2X_2 a un modelo que ya tiene X1X_1. La barra vertical se lee “dado” o “ajustado por”.

Las sumas de cuadrados adicionales se encadenan en una descomposición de la suma de cuadrados total de la regresión. Agregando predictores uno a la vez,

SSR(X1,X2,X3)=SSR(X1)+SSR(X2X1)+SSR(X3X1,X2),\mathrm{SSR}(X_1, X_2, X_3) = \mathrm{SSR}(X_1) + \mathrm{SSR}(X_2 \mid X_1) + \mathrm{SSR}(X_3 \mid X_1, X_2),

que es exactamente lo que imprime la tabla ANOVA secuencial (Tipo I), una fila por predictor en el orden en que los listas. Como el orden es una elección, también lo es el reparto: reordena los predictores y las partes cambian, aunque su SSR\mathrm{SSR} total no.

Derivación (agregar un predictor no puede aumentar SSE)

Demostración. Sea el modelo reducido el que usa los predictores de un conjunto RR y el modelo completo el que usa RR junto con un predictor más, de modo que las columnas del modelo completo generan un espacio mayor. Por 7.2 La geometría de los mínimos cuadrados, el vector ajustado es la proyección ortogonal de Y\mathbf{Y} sobre el espacio columna de la matriz de diseño, y SSE\mathrm{SSE} es la distancia al cuadrado de Y\mathbf{Y} a ese espacio. Todo vector ajustado que el modelo reducido puede producir está también disponible para el modelo completo (fija en cero el coeficiente adicional), así que el espacio columna del modelo completo contiene al del modelo reducido. Proyectar sobre un subespacio mayor cae al menos igual de cerca de Y\mathbf{Y}:

SSE(full)=minvfull spaceYv2    minvreduced spaceYv2=SSE(reduced).\mathrm{SSE}(\text{full}) = \min_{\mathbf{v} \in \text{full space}} \lVert \mathbf{Y} - \mathbf{v}\rVert^2 \;\le\; \min_{\mathbf{v} \in \text{reduced space}} \lVert \mathbf{Y} - \mathbf{v}\rVert^2 = \mathrm{SSE}(\text{reduced}).

Por lo tanto SSR(X2X1)=SSE(X1)SSE(X1,X2)0\mathrm{SSR}(X_2 \mid X_1) = \mathrm{SSE}(X_1) - \mathrm{SSE}(X_1, X_2) \ge 0, con igualdad solo cuando el predictor agregado no compra nada (su contribución ajustada ya está en el espacio reducido). \blacksquare

R y Python

El ejemplo clásico trabajado no es Dwaine sino los datos de grasa corporal de ALRM: 20 hombres, el porcentaje de grasa corporal medido por pesaje bajo el agua, contra tres predictores de cinta métrica, el pliegue del tríceps, la circunferencia del muslo y la circunferencia del medio del brazo. Está hecho para esta sección porque los predictores se solapan mucho, así que el orden importa bastante.

La Figure 6 dibuja la descomposición como una barra apilada: la variación total en la grasa corporal partida en las piezas secuenciales más el error restante.

Una sola barra horizontal apilada que muestra la suma de cuadrados total de la grasa corporal, 495.4, dividida en cuatro segmentos: un segmento grande para triceps (352.3), uno más pequeño para thigh dado triceps (33.2), uno aún más pequeño para midarm dado triceps y thigh (11.5), y el error residual (98.4). Cada segmento está rotulado con su valor.

Figure 6:La variación total en la grasa corporal, partida por sumas de cuadrados adicionales secuenciales. El primer predictor reclama la parte del león; cada predictor posterior agrega menos porque los predictores de cinta métrica se solapan. El segmento más a la derecha es la variación que ningún predictor explicó.

8.4 La prueba lineal general

Intuición

Las sumas de cuadrados adicionales miden cuánto agrega un predictor; ahora preguntamos si esa adición es más de lo que produciría el ruido. La herramienta es una comparación de dos modelos, uno reducido (sin los términos en cuestión) y uno completo (con ellos). Si los términos adicionales no valen nada, la suma de cuadrados del error del modelo completo será solo trivialmente menor que la del modelo reducido, una caída no mayor que la que daría la dispersión aleatoria. Si los términos adicionales importan, la caída será grande en relación con el nivel de ruido. La prueba lineal general (general linear test) (Definición 8.5) convierte “grande en relación con el ruido” en un solo estadístico FF.

Fórmula

Sea el modelo completo con SSE(F)\mathrm{SSE}(F) sobre dfF=npFdf_F = n - p_F grados de libertad y el modelo reducido con SSE(R)\mathrm{SSE}(R) sobre dfR=npRdf_R = n - p_R, donde el modelo reducido es el modelo completo con algunos coeficientes forzados a cero. El estadístico de la prueba lineal general y su distribución nula se enuncian en el Teorema 8.6.

En palabras: FF^{*} es la variación adicional explicada por coeficiente descartado, medida en unidades de la varianza del ruido. Bajo el modelo reducido (los coeficientes descartados son de verdad cero) con errores normales, FF(q, npF)F^{*} \sim F(q,\ n - p_F), y un FF^{*} grande es evidencia contra el modelo reducido. Rechazamos el modelo reducido cuando FF^{*} excede el valor crítico superior de FF, equivalentemente cuando su valor p es pequeño.

Derivación (el estadístico de prueba y su distribución)

Demostración. Escribe Y^F\widehat{\mathbf{Y}}_F y Y^R\widehat{\mathbf{Y}}_R para los vectores ajustados del modelo completo y del reducido. Por 7.2 La geometría de los mínimos cuadrados cada uno es la proyección ortogonal de Y\mathbf{Y} sobre un espacio columna, y el espacio reducido es un subespacio del espacio completo. Parte el residuo del modelo reducido a través del ajuste completo:

YY^R=(YY^F)full residual+(Y^FY^R)extra fit.\mathbf{Y} - \widehat{\mathbf{Y}}_R = \underbrace{(\mathbf{Y} - \widehat{\mathbf{Y}}_F)}_{\text{full residual}} + \underbrace{(\widehat{\mathbf{Y}}_F - \widehat{\mathbf{Y}}_R)}_{\text{extra fit}}.

El residuo completo es ortogonal a todo el espacio columna completo, y Y^FY^R\widehat{\mathbf{Y}}_F - \widehat{\mathbf{Y}}_R vive dentro de ese espacio, así que las dos piezas son perpendiculares. Pitágoras da

SSE(R)=SSE(F)+Y^FY^R2,\mathrm{SSE}(R) = \mathrm{SSE}(F) + \lVert \widehat{\mathbf{Y}}_F - \widehat{\mathbf{Y}}_R \rVert^2,

así que la suma de cuadrados del numerador SSE(R)SSE(F)=Y^FY^R2\mathrm{SSE}(R) - \mathrm{SSE}(F) = \lVert \widehat{\mathbf{Y}}_F - \widehat{\mathbf{Y}}_R\rVert^2 es la longitud al cuadrado del vector de ajuste adicional, que vive en un subespacio de dimensión q=pFpRq = p_F - p_R. De ahí vienen sus qq grados de libertad. La Figure 7 dibuja este triángulo rectángulo. \blacksquare

Un diagrama de triángulo rectángulo. El vector de respuesta Y está en la cima. Un cateto largo baja de Y al ajuste del modelo completo Y-gorro-F, rotulado como el residuo completo con longitud al cuadrado SSE(F). Un cateto horizontal corto va de Y-gorro-F al ajuste del modelo reducido Y-gorro-R dentro del subespacio reducido, rotulado el ajuste adicional. La hipotenusa de Y a Y-gorro-R está rotulada como el residuo reducido con longitud al cuadrado SSE(R). Un marcador de ángulo recto está en Y-gorro-F.

Figure 7:La prueba lineal general es Pitágoras. El residuo reducido (hipotenusa, SSE(R)) se parte en el residuo completo (cateto largo, SSE(F)) y el vector de ajuste adicional (cateto corto), que se encuentran en ángulo recto. La prueba compara la longitud al cuadrado del cateto corto, por coeficiente descartado, con el nivel de ruido.

La afirmación distribucional necesita una capa más. Bajo el modelo reducido con errores normales, las dos piezas perpendiculares son independientes, y cada longitud al cuadrado dividida por σ2\sigma^2 es una ji cuadrada: SSE(F)/σ2χnpF2\mathrm{SSE}(F)/\sigma^2 \sim \chi^2_{n - p_F} y (SSE(R)SSE(F))/σ2χq2(\mathrm{SSE}(R) - \mathrm{SSE}(F))/\sigma^2 \sim \chi^2_{q}. Dividir cada ji cuadrada por sus grados de libertad y tomar el cociente da una variable F(q, npF)F(q,\ n-p_F). Los hechos de independencia y ji cuadrada descansan sobre la geometría de teoría normal de las proyecciones construida en 7.3 La matriz sombrero. El argumento completo usa el teorema de Cochran sobre formas cuadráticas, que está más allá del álgebra matricial que este libro demuestra. Así que tomamos esos dos hechos distribucionales sobre la autoridad de esa geometría, y verificamos toda la maquinaria numéricamente más abajo. El texto de ALRM, Capítulo 7, da los detalles de forma cuadrática para quien los quiera.

Pruebas sobre un subconjunto de coeficientes

Los datos de ahorro dan una prueba de subconjunto limpia, y llevan el segundo hilo continuo de este capítulo. En el Capítulo 4 usaste estos 50 países para estudiar la correlación y sus trampas (4.2 La correlación y la pendiente de regresión); ahora los ajustamos como una regresión múltiple. La respuesta sr es la tasa de ahorro personal agregada, y los predictores son el porcentaje de población menor de 15 años (pop15), el porcentaje mayor de 75 años (pop75), el ingreso disponible per cápita (dpi), y su tasa de crecimiento (ddpi). La teoría del ahorro por ciclo de vida dice que las dos medidas de dependencia, pop75 y dpi, podrían no importar una vez que la estructura de edad y el crecimiento están en el modelo. Esa es una hipótesis sobre dos coeficientes a la vez, y la prueba lineal general está hecha para ella.

Un solo coeficiente: la prueba es exactamente t2t^2

Cuando el modelo reducido descarta un solo coeficiente (q=1q = 1), la prueba lineal general debe coincidir con la prueba tt que el software ya imprime para ese coeficiente. Y coincide, exactamente.

Demostración. De 7.4 La distribución muestral de b la varianza estimada de bkb_k es s2{bk}=MSEckks^2\{b_k\} = \mathrm{MSE}\cdot c_{kk}, donde ckkc_{kk} es la kk-ésima entrada diagonal de (XX)1(\mathbf{X}'\mathbf{X})^{-1}. La suma de cuadrados adicional por descartar el único predictor XkX_k resulta ser SSR(Xkothers)=bk2/ckk\mathrm{SSR}(X_k \mid \text{others}) = b_k^2 / c_{kk}. Sustituyendo ambos en la prueba lineal general con q=1q = 1,

F=SSR(Xkothers)/1MSE=bk2/ckkMSE=bk2MSEckk=bk2s2{bk}=(bks{bk})2=tk2.F^{*} = \frac{\mathrm{SSR}(X_k \mid \text{others})/1}{\mathrm{MSE}} = \frac{b_k^2 / c_{kk}}{\mathrm{MSE}} = \frac{b_k^2}{\mathrm{MSE}\cdot c_{kk}} = \frac{b_k^2}{s^2\{b_k\}} = \left(\frac{b_k}{s\{b_k\}}\right)^2 = t_k^2.

Así que la prueba de subconjunto con un coeficiente descartado es el cuadrado del estadístico tt ordinario, y una variable F(1,np)F(1, n-p) es el cuadrado de una variable tnpt_{n-p}. Las dos pruebas son una sola prueba. \blacksquare

Antes de confiar en una sola fila de una tabla secuencial, asciende y degrada tú mismo los predictores y observa cómo FF^{*} vuelve a decidir si el más reciente se ganó su lugar.

Deja entrar los predictores de grasa corporal uno a uno, en cualquiera de los seis órdenes, y observa cómo cambian cada suma de cuadrados adicional y su F* de la prueba lineal general mientras la SSR total no cambia.

8.5 Gráficos de variable agregada

Intuición

Un coeficiente es un solo número; a veces quieres ver la relación parcial que resume. El obstáculo es que no puedes simplemente graficar YY contra XkX_k, porque esa imagen mezcla todos los demás predictores. El gráfico de variable agregada (added-variable plot) (Definición 8.8), también llamado gráfico de regresión parcial, quita primero los demás predictores de ambos ejes, y luego grafica lo que queda.

Aquí está la receta. Para ver el efecto parcial de XkX_k: regresa YY sobre todos los demás predictores y guarda los residuos eYe_Y, la parte de YY que los demás no explican. Regresa XkX_k sobre todos los demás predictores y guarda los residuos eXe_X, la parte de XkX_k que los demás no explican. Ahora grafica eYe_Y contra eXe_X. A ambos ejes se les ha purgado de los demás predictores, así que el gráfico muestra la relación entre YY y XkX_k que es genuinamente nueva. Su pendiente es exactamente el coeficiente de regresión múltiple bkb_k, un hecho que demostramos abajo, así que el gráfico es una imagen del número mismo en la tabla de coeficientes.

La única regla que la gente rompe es olvidar limpiar el eje horizontal: residualizan YY pero luego lo grafican contra el predictor crudo. La Figure 9 expone los tres pasos para que ambos ejes reciban el mismo tratamiento.

Un diagrama de flujo de tres pasos. Paso 1, una caja azul, regresa Y sobre los demás predictores y guarda los residuos e_Y, la parte de Y que los demás no captan. Paso 2, una caja naranja, regresa X_k sobre los demás predictores y guarda los residuos e_X, la parte de X_k que los demás no captan. Flechas desde ambos llevan al Paso 3, una caja verde, grafica e_Y contra e_X y lee la pendiente, que es igual al coeficiente b_k. Un encabezado dice que ambos ejes deben tener los demás predictores removidos, y una nota al pie advierte que omitir cualquiera de los pasos de limpieza rompe la igualdad.

Figure 9:El gráfico de variable agregada en tres pasos. Ambos ejes deben purgarse de los demás predictores antes de graficar, no solo la respuesta. Limpia solo un eje y la pendiente ya no es el coeficiente, que es el error que recorre el Inténtalo 8.5.

Fórmula

Para el predictor XkX_k en un modelo cuyos demás predictores se agrupan como X(k)X_{(-k)},

eY=YY^(from X(k)),eX=XkX^k(from X(k)),e_Y = Y - \widehat{Y}\big(\text{from } X_{(-k)}\big), \qquad e_X = X_k - \widehat{X}_k\big(\text{from } X_{(-k)}\big),

y el gráfico de variable agregada es la dispersión de eYe_Y contra eXe_X. La pendiente de mínimos cuadrados de esa dispersión es igual a bkb_k, el coeficiente del modelo completo sobre XkX_k.

Derivación (la pendiente de variable agregada es igual a bkb_k)

Demostración (Frisch-Waugh, caso de dos predictores). Toma el modelo completo Y=b0+b1X1+b2X2+eY = b_0 + b_1 X_1 + b_2 X_2 + e y deja que X1X_1 desempeñe el papel de “el otro predictor” mientras construimos el gráfico de variable agregada para X2X_2. Parte X2X_2 en su proyección sobre {1,X1}\{\mathbf{1}, X_1\} y el residuo: X2=X^2+eXX_2 = \widehat{X}_2 + e_X, donde eX{1,X1}e_X \perp \{\mathbf{1}, X_1\} por construcción. Sustituye en la ecuación ajustada y agrupa los términos que viven en span{1,X1}\operatorname{span}\{\mathbf{1}, X_1\}:

Y=(b0+b1X1+b2X^2)in span{1,X1}+b2eX+e.Y = \underbrace{(b_0 + b_1 X_1 + b_2 \widehat{X}_2)}_{\text{in } \operatorname{span}\{\mathbf{1},\,X_1\}} + b_2\, e_X + e.

Ahora forma eYe_Y removiendo la parte {1,X1}\{\mathbf{1}, X_1\} de YY, es decir, proyectando YY sobre el complemento ortogonal de span{1,X1}\operatorname{span}\{\mathbf{1}, X_1\}. El primer grupo se desvanece bajo esta proyección. El término eXe_X ya es ortogonal a {1,X1}\{\mathbf{1}, X_1\}, así que sobrevive intacto. El residuo completo ee es ortogonal a {1,X1,X2}\{\mathbf{1}, X_1, X_2\}, por ende a {1,X1}\{\mathbf{1}, X_1\}, así que también sobrevive. Por lo tanto

eY=b2eX+e.e_Y = b_2\, e_X + e.

Finalmente regresa eYe_Y sobre eXe_X por el origen (ambos vectores de residuos tienen media cero). La pendiente es

eY,eXeX,eX=b2eX+e, eXeX2=b2+e,eXeX2=b2,\frac{\langle e_Y, e_X\rangle}{\langle e_X, e_X\rangle} = \frac{\langle b_2 e_X + e,\ e_X\rangle}{\lVert e_X\rVert^2} = b_2 + \frac{\langle e, e_X\rangle}{\lVert e_X\rVert^2} = b_2,

porque e,eX=0\langle e, e_X\rangle = 0: el residuo completo ee es ortogonal a X2X_2 y a {1,X1}\{\mathbf{1}, X_1\}, por ende a eX=X2X^2e_X = X_2 - \widehat{X}_2. La pendiente de variable agregada es exactamente el coeficiente de regresión múltiple. El mismo argumento funciona con cualquier número de otros predictores en lugar de X1X_1. \blacksquare

R y Python

Un gráfico de variable agregada para el ingreso disponible en el modelo de Dwaine. El eje horizontal es el ingreso disponible con la población objetivo removida, el eje vertical es las ventas con la población objetivo removida. Los 21 puntos se dispersan alrededor de una recta ascendente cuya pendiente está rotulada 9.37, coincidiendo con el coeficiente de regresión múltiple.

Figure 10:El gráfico de variable agregada para el ingreso, con la población objetivo purgada de ambos ejes. Su pendiente es el coeficiente de regresión múltiple 9.37 exactamente. La inclinación ascendente confirma que el ingreso agrega información más allá de la población; la dispersión muestra cuánta.

Un gráfico de variable agregada también puede revelar lo contrario, un predictor con casi nada que agregar. La Figure 11 muestra el gráfico para la tasa de crecimiento ddpi en el modelo de ahorro, cuya pendiente parcial es un 0.41 positivo pero suave.

Un gráfico de variable agregada para la tasa de crecimiento del ingreso ddpi en el modelo de ahorro. El eje horizontal es ddpi con los otros tres predictores removidos, el eje vertical es la tasa de ahorro con esos predictores removidos. Los 50 puntos de país se dispersan alrededor de una recta suavemente ascendente rotulada con pendiente 0.41.

Figure 11:El gráfico de variable agregada para el crecimiento del ingreso en el modelo de ahorro. La pendiente suavemente ascendente, 0.41, es el efecto parcial del crecimiento sobre el ahorro una vez que se tienen en cuenta la estructura de edad y el ingreso. La amplia dispersión es por lo que el efecto, aunque real, es solo marginalmente significativo.

En vez de aceptar la receta por fe, mueve el deslizador de limpieza de abajo y observa cómo la pendiente marginal se convierte en el coeficiente delante de ti.

Quita de ambos ejes lo que explica la población objetivo, poco a poco, y observa cómo la pendiente viaja desde la marginal 31.17 hasta la pendiente de variable agregada 9.37, que es exactamente el coeficiente de dispoinc.

8.6 R2R^2, R2R^2 ajustado y coeficientes estandarizados

Intuición

Ya podemos probar cuáles predictores pertenecen al modelo; el siguiente trabajo es resumir todo un modelo en un número y comparar modelos de distinto tamaño de forma justa. R2R^2 es la fracción de la variación de la respuesta que el modelo explica, y tiene una falla seductora: nunca baja cuando agregas un predictor, aunque sea una columna de ruido aleatorio. Eso lo hace inútil para comparar modelos de distinto tamaño, porque el modelo más grande siempre gana. El R2R^2 ajustado (adjusted R2R^2) (Definición 8.10) corrige esto cobrando renta por cada predictor: sube solo si el nuevo predictor explica más de lo que explicaría un predictor promedio de ruido. Los coeficientes estandarizados (standardized coefficients) (Definición 8.11) resuelven un problema distinto: los coeficientes crudos viven en unidades distintas (dólares, miles de personas, porcentajes), así que no puedes comparar sus tamaños; poner todo en unidades de desviación estándar hace justa la comparación.

Fórmula

R2=1SSESSTO,Ra2=1SSE/(np)SSTO/(n1)=1n1np(1R2).R^2 = 1 - \frac{\mathrm{SSE}}{\mathrm{SSTO}}, \qquad R^2_a = 1 - \frac{\mathrm{SSE}/(n-p)}{\mathrm{SSTO}/(n-1)} = 1 - \frac{n-1}{n-p}\,(1 - R^2).

En palabras: R2R^2 mide la fracción explicada, Ra2R^2_a mide la fracción explicada después de pagar por el tamaño del modelo, y bkb_k^{*} mide el tamaño del efecto en desviaciones estándar, así que distintos predictores pueden ordenarse en una sola escala.

Derivación (R2R^2 nunca baja; Ra2R^2_a sí puede)

Demostración. Por el resultado de monotonía de 8.3 Sumas de cuadrados adicionales (Teorema 8.4), agregar un predictor no puede elevar SSE\mathrm{SSE}, y SSTO\mathrm{SSTO} no depende del modelo. Por ende SSE/SSTO\mathrm{SSE}/\mathrm{SSTO} no puede subir, así que R2=1SSE/SSTOR^2 = 1 - \mathrm{SSE}/\mathrm{SSTO} no puede bajar: todo predictor agregado deja R2R^2 igual o más alto, que es por lo que R2R^2 solo no puede elegir un modelo. El R2R^2 ajustado se comporta distinto porque usa MSE=SSE/(np)\mathrm{MSE} = \mathrm{SSE}/(n-p). Agregar un predictor inútil baja SSE\mathrm{SSE} un poco pero también baja el divisor npn-p en uno; si la reducción en SSE\mathrm{SSE} es menor de lo que exige la reducción en npn-p, MSE\mathrm{MSE} sube y Ra2R^2_a baja. Así que Ra2R^2_a puede bajar cuando un predictor no gana su grado de libertad, que es exactamente el comportamiento que queremos de una medida consciente del tamaño del modelo. \blacksquare

La Figure 13 lo hace concreto: partiendo del modelo de ahorro real, agregamos columnas de puro ruido aleatorio una a la vez y observamos cómo R2R^2 trepa mientras Ra2R^2_a se hunde.

Un gráfico de líneas con el número de predictores basura agregados en el eje horizontal, de cero a diez, y dos curvas. La curva de R cuadrada sube de forma sostenida desde cerca de 0.34 hacia 0.45 conforme se agregan predictores de ruido. La curva de R cuadrada ajustada empieza en el mismo punto pero se desliza hacia abajo, terminando por debajo de su valor inicial.

Figure 13:Agregar predictores de puro ruido al modelo de ahorro. La R cuadrada (curva superior) sube con cada columna basura, porque nunca baja cuando se agrega un predictor. La R cuadrada ajustada (curva inferior) se desliza hacia abajo, reportando correctamente que las columnas de ruido no valen sus grados de libertad.

R y Python

La Figure 14 ordena los cuatro coeficientes estandarizados sobre un solo eje, que los coeficientes crudos, viviendo en unidades incompatibles, nunca podrían compartir.

Un gráfico de barras horizontal de los cuatro coeficientes estandarizados del modelo de ahorro. pop15 es una barra larga a la izquierda en -0.94, pop75 una barra izquierda más corta en -0.49, ddpi una barra derecha en 0.26, y dpi una barra izquierda diminuta en -0.07. Una línea de referencia vertical marca el cero.

Figure 14:Los coeficientes de ahorro sobre una regla común de desviación estándar. La proporción de población joven (pop15) tiene por mucho el mayor efecto estandarizado, y es negativo; el ingreso (dpi) casi ninguno. Solo después de estandarizar pueden compararse así predictores en porcentaje y en dólares.

8.7 Dos peligros: extrapolación oculta y variables ocultas

Intuición

Dos fallas merecen su propia sección porque son invisibles en la tabla de coeficientes y fatales para una conclusión. La primera es la extrapolación oculta (hidden extrapolation) (Definición 8.13): predecir en una combinación de valores de predictor que está dentro del rango de cada predictor por separado pero fuera de la región donde ocurren juntos. La segunda es la variable oculta (lurking variable) (Definición 8.14): un predictor omitido que, si se incluyera, movería o invertiría los coeficientes que reportaste.

Extrapolación oculta

Con un solo predictor, la extrapolación es fácil de vigilar: quédate dentro del rango observado de XX. Con varios predictores, la región observada no es una caja sino una nube, normalmente inclinada porque los predictores están correlacionados. Un punto de consulta puede estar dentro del rango propio de cada predictor y aun así caer muy fuera de la nube. La Figure 15 muestra el caso de Dwaine: una ciudad con población objetivo 75 e ingreso disponible 16 es poco notable en cada eje por sí solo, y sin embargo ninguna ciudad real combina una población tan grande con un ingreso tan bajo, así que una predicción ahí es una extrapolación que los rangos de una variable nunca señalarían.

Un diagrama de dispersión de las 21 ciudades de Dwaine con la población objetivo en el eje horizontal y el ingreso disponible en el eje vertical, formando una nube elíptica inclinada hacia arriba. Una envolvente convexa sombreada delinea las ciudades observadas. Un punto de consulta rojo en población 75, ingreso 16 está dentro de los rangos horizontal y vertical pero claramente fuera de la envolvente sombreada, en la región vacía inferior derecha.

Figure 15:Extrapolación oculta en dos predictores. El punto de consulta rojo cae dentro del rango observado de la población y dentro del rango observado del ingreso, pero fuera de la nube inclinada donde los dos ocurren juntos. Una predicción ahí es una extrapolación que ninguna revisión de rango de una sola variable atraparía.

La revisión práctica es preguntar si un punto de consulta cae dentro de la región conjunta de los datos, no solo dentro de cada margen. El Capítulo 9 hace esto riguroso con la matriz sombrero: el valor de apalancamiento hiih_{ii} de 7.3 La matriz sombrero mide qué tan lejos se sienta un punto del centro de la nube de predictores, y un punto nuevo cuyo apalancamiento excedería a los observados es una extrapolación oculta.

Variables ocultas

Una regresión solo puede ajustar por los predictores que le das. Si falta una variable importante y se correlaciona tanto con la respuesta como con un predictor incluido, el coeficiente que reportas absorbe la influencia de la variable faltante y puede quedar muy equivocado, incluso invertido. Esta es la versión de regresión múltiple de la advertencia de que correlación no es causación de 4.2 La correlación y la pendiente de regresión, y es por lo que un coeficiente observacional siempre es provisional: algún factor no medido podría estar haciendo el trabajo.

“Incluso invertido” suena a exageración hasta que lo ves. La Figure 16 muestra el mecanismo en un conjunto de datos esquemático. Ignora la variable oculta y los puntos marchan hacia arriba de izquierda a derecha, así que la pendiente parece positiva. Colorea los puntos por el grupo oculto y cada grupo se inclina al revés: dentro de cualquier grupo la pendiente es negativa. Un modelo que nunca vio el grupo reporta la tendencia ascendente y obtiene el signo exactamente al revés.

Un diagrama de dispersión esquemático de la respuesta Y contra el predictor X. Los puntos caen en tres grupos coloreados, azul abajo a la izquierda, verde en el medio, naranja arriba a la derecha. Una recta general discontinua a través de todos los puntos sube, rotulada pendiente general positiva con la variable oculta ignorada. Dentro de cada grupo coloreado una recta sólida baja, rotulada que dentro de cada grupo la pendiente es negativa. Las pendientes general y dentro de grupo tienen signos opuestos.

Figure 16:Una variable oculta puede invertir el signo de una pendiente. La recta general discontinua sube porque los grupos están a distintas alturas; las rectas sólidas dentro de grupo todas bajan. Si el grupo es una variable que nunca mediste, tu coeficiente ajustado reporta la pendiente ascendente y se pierde por completo la verdadera pendiente descendente.

La postura honesta es nombrar las variables ocultas que puedas imaginar y admitir las que no. En el estudio de Dwaine, la competencia local, la antigüedad de cada estudio y la publicidad regional están todas plausiblemente relacionadas tanto con las ventas como con las características de la ciudad; ninguna está en el modelo, así que cada pendiente parcial es “lo mejor que podemos decir con estas tres columnas”, no una verdad final. Ninguna cantidad de aritmética dentro de un conjunto fijo de predictores puede descartar una variable que nunca mediste.

8.8 Resumen del capítulo

Ahora puedes tomar una regresión múltiple ajustada y hacer el trabajo que importa después del ajuste. Puedes leer cada coeficiente como una pendiente parcial, enunciando en palabras la comparación controlada que hace y la frase exacta “manteniendo fijos los demás predictores”, y puedes explicar por qué esa frase se debilita cuando los predictores están correlacionados y puede describir una región sin datos. Puedes calcular sumas de cuadrados adicionales y leer una tabla ANOVA secuencial como una descomposición de SSR\mathrm{SSR}. Puedes correr la prueba lineal general para un coeficiente o un grupo, derivar su estadístico FF de la partición pitagórica de modelos anidados, y mostrar que colapsa a t2t^2 para un solo coeficiente. Puedes construir un gráfico de variable agregada y demostrar que su pendiente es el coeficiente de regresión múltiple. Puedes calcular R2R^2, R2R^2 ajustado y coeficientes estandarizados, y explicar por qué solo los dos últimos son seguros para comparar modelos o efectos. Y puedes detectar los dos peligros que oculta una tabla de coeficientes: la extrapolación oculta en el espacio conjunto de predictores y la variable oculta que ningún modelo midió.

Resultados clave de un vistazo

ResultadoEnunciado o fórmulaVálido cuando
Pendiente parcial (Definición 8.1)bkb_k es el cambio en E{Y}E\{Y\} por unidad de XkX_k, con los demás predictores fijosmodelo de regresión múltiple
Suma de cuadrados adicional (Definición 8.3)SSR(X2X1)=SSE(X1)SSE(X1,X2)\mathrm{SSR}(X_2\mid X_1) = \mathrm{SSE}(X_1) - \mathrm{SSE}(X_1,X_2)cualquier par anidado de modelos
Monotonía de SSE (Teorema 8.4)SSE(full)SSE(reduced)\mathrm{SSE}(\text{full}) \le \mathrm{SSE}(\text{reduced}), así que SSR(X2X1)0\mathrm{SSR}(X_2\mid X_1)\ge 0los predictores reducidos son subconjunto de los completos
Prueba lineal general (Teorema 8.6)F=[SSE(R)SSE(F)]/qSSE(F)/(npF)F(q,npF)F^{*} = \dfrac{[\mathrm{SSE}(R)-\mathrm{SSE}(F)]/q}{\mathrm{SSE}(F)/(n-p_F)} \sim F(q, n-p_F)errores normales, modelo reducido verdadero
Identidad de un coeficiente (Teorema 8.7)F=bk2/s2{bk}=tk2F^{*} = b_k^2/s^2\{b_k\} = t_k^2al descartar un solo coeficiente (q=1q=1)
Pendiente de variable agregada (Teorema 8.9)la pendiente de eYe_Y sobre eXe_X es igual a bkb_kcualquier regresión múltiple (Frisch-Waugh)
Monotonía de R2R^2 (Teorema 8.12)R2R^2 nunca baja al agregar predictores; Ra2R^2_a sí puedeal comparar modelos anidados
R2R^2 ajustado (Definición 8.10)Ra2=1n1np(1R2)R^2_a = 1 - \frac{n-1}{n-p}(1-R^2)al comparar modelos de distinto tamaño
Coeficiente estandarizado (Definición 8.11)bk=bk(sXk/sY)b_k^{*} = b_k\,(s_{X_k}/s_Y)al ordenar efectos en distintas unidades

Términos clave

pendiente parcial, modelo de regresión lineal múltiple, suma de cuadrados adicional, ANOVA secuencial (Tipo I), prueba lineal general, modelo completo, modelo reducido, gráfico de variable agregada, coeficiente de determinación (R2R^2), R2R^2 ajustado, coeficiente estandarizado, extrapolación oculta, variable oculta, multicolinealidad.

Ahora deberías ser capaz de

Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado este capítulo es sobre todo USO: toma el ajuste que el Capítulo 7 produjo para Dwaine en forma matricial y lo convierte en interpretación, pruebas y advertencias honestas, con la prueba lineal general sirviendo también al AJUSTE al decidir cuáles términos pertenecen. El Capítulo 7 dio el estimador y su varianza; este capítulo dio el razonamiento que convierte una estimación en una afirmación. Lo que aplazamos es la etapa de VERIFICACIÓN: si algún caso individual está corriendo calladamente el ajuste, y si los supuestos del modelo se sostienen del todo. Ese es el trabajo del Capítulo 9. Vuelve a los datos de ahorro, señalando a Libia como el caso que dobla el ajuste y a Zambia como un valor atípico de residuo grande, y construye los diagnósticos de influencia (9.3 Influencia: qué puntos cambian realmente el ajuste) y el estadístico de apalancamiento al que apunta 9.1 Los valores de apalancamiento y la matriz sombrero, que juntos deciden cuánta de la confianza de este capítulo sobrevive al contacto con datos reales. La prueba lineal general que aprendiste aquí es el motor de pruebas que el Capítulo 11 reutiliza para predictores categóricos e interacciones (11.1 De categorías a números: codificación con indicadores) y el Capítulo 12 para la selección de variables (12.2 Elegir entre modelos: criterios de selección), sin que ninguno la vuelva a derivar.

8.9 Preguntas frecuentes

P1. ¿Por qué es tan distinto el coeficiente de regresión múltiple del ingreso de la pendiente de regresión simple? Porque responden a preguntas distintas. La pendiente simple 31.17 compara ciudades que difieren en ingreso y deja que la población difiera junto con él; la pendiente parcial 9.37 compara ciudades que difieren en ingreso pero comparten población. Cuando los predictores están correlacionados, las dos preguntas tienen respuestas distintas, y solo la pendiente parcial se gana la frase “manteniendo fija la población”.

P2. ¿“Manteniendo fijos los demás predictores” significa que puedo intervenir sobre un predictor y esperar el cambio de ese coeficiente? No. El coeficiente describe una comparación entre casos que ya difieren, no el efecto de una acción. Con datos observacionales, y en especial con predictores correlacionados o una variable oculta, actuar sobre un predictor no necesariamente reproduce la asociación observada. El coeficiente es una descripción de la superficie ajustada, no una promesa sobre intervenciones.

P3. La ANOVA secuencial da sumas de cuadrados distintas cuando reordeno los predictores. ¿Cuál orden es el correcto? Ninguno es únicamente correcto; el orden es una elección sobre qué significa “dados los demás”. El primer predictor recibe su suma de cuadrados de regresión simple completa, cada uno posterior recibe solo lo que agrega más allá de los anteriores. Las piezas siempre suman el mismo SSR\mathrm{SSR}. Si quieres cada predictor ajustado por todos los demás a la vez, usa su prueba tt (o la prueba lineal general descartando solo ese predictor), que no depende del orden.

P4. ¿Cuándo debo usar la prueba lineal general en lugar de solo leer los estadísticos tt? Úsala siempre que quieras probar varios coeficientes a la vez, como “¿estos dos predictores juntos agregan algo?”. Un grupo de tt individualmente no significativos no te dice si el grupo en conjunto importa, porque los predictores pueden compartir su poder explicativo; la prueba lineal general pregunta la cuestión conjunta directamente. Para un solo coeficiente, la prueba lineal general y la prueba tt son idénticas (F=t2F^{*} = t^2).

P5. ¿Por qué R2R^2 siempre sube cuando agrego un predictor, aunque sea inútil? Porque agregar un predictor solo puede bajar (o no cambiar) SSE\mathrm{SSE}, y SSTO\mathrm{SSTO} es fijo, así que R2=1SSE/SSTOR^2 = 1 - \mathrm{SSE}/\mathrm{SSTO} solo puede subir. Por eso exactamente R2R^2 no puede usarse para elegir entre modelos de distinto tamaño; usa el R2R^2 ajustado, que penaliza cada parámetro agregado, o una prueba formal.

P6. La pendiente de mi gráfico de variable agregada coincide con el coeficiente exactamente. ¿Es coincidencia? No, es un teorema (Frisch-Waugh). Remover los demás predictores tanto de la respuesta como del predictor objetivo, y luego regresar los residuos, reproduce el coeficiente del modelo completo exactamente. Eso es lo que hace del gráfico de variable agregada una imagen fiel del coeficiente en lugar de un bosquejo aproximado.

P7. Los tres coeficientes de grasa corporal son no significativos, y sin embargo el FF general es altamente significativo. ¿Cómo puede ser útil el modelo si ningún predictor individual lo es? Esta es la huella de la multicolinealidad. Los tres predictores de cinta métrica se solapan tanto que ninguno agrega mucho dados los otros dos, así que cada tt individual es pequeño; pero juntos explican bien la grasa corporal, así que el FF general es grande. Los predictores son sustitutos, no contribuyentes independientes. El Capítulo 12 retoma este tema de multicolinealidad en un estudio de grasa corporal mayor y mide el solapamiento con el factor de inflación de varianza.

8.10 Problemas de práctica

  1. (A) Indica en una oración qué significa el coeficiente de Dwaine 1.4546 sobre targtpop, nombrando sus unidades y qué se mantiene fijo.

  2. (A) Explica la diferencia entre la pendiente de regresión simple de sales sobre dispoinc (31.17) y el coeficiente de regresión múltiple (9.37). ¿Cuál mantiene fija la población?

  3. (A) Define en palabras la suma de cuadrados adicional SSR(X2X1)\mathrm{SSR}(X_2 \mid X_1), y explica por qué nunca puede ser negativa.

  4. (A) Un modelo reducido descarta tres predictores de un modelo completo. Indica los grados de libertad del numerador de la prueba lineal general que los compara.

  5. (A) ¿Por qué R2R^2 nunca disminuye cuando se agrega un predictor? Responde usando la identidad R2=1SSE/SSTOR^2 = 1 - \mathrm{SSE}/\mathrm{SSTO}.

  6. (A) Un colega reporta que el R2R^2 ajustado bajó cuando agregó una variable, y concluye que cometió un error. ¿Tiene razón? Explica.

  7. (A) En tus propias palabras, ¿qué pone un gráfico de variable agregada en cada eje, y por qué ninguno de los ejes es la variable cruda?

  8. (A) Da un ejemplo, en el contexto de Dwaine, de una variable oculta que podría distorsionar el coeficiente del ingreso, y di por qué importaría.

  9. (A) Explica por qué un punto de consulta puede ser una extrapolación oculta aun cuando cada valor de predictor esté dentro de su propio rango observado.

  10. (A) Los tres coeficientes de grasa corporal son individualmente no significativos pero el FF general es altamente significativo. Explica cómo pueden ser ciertas ambas cosas.

  11. (B) Demuestra que agregar un predictor a un modelo no puede aumentar SSE\mathrm{SSE} (Teorema 8.4), usando la caracterización por proyección de los mínimos cuadrados de 7.2 La geometría de los mínimos cuadrados.

  12. (B) Muestra que SSR(X2X1)=SSR(X1,X2)SSR(X1)\mathrm{SSR}(X_2 \mid X_1) = \mathrm{SSR}(X_1, X_2) - \mathrm{SSR}(X_1) es equivalente a SSE(X1)SSE(X1,X2)\mathrm{SSE}(X_1) - \mathrm{SSE}(X_1, X_2), citando cuál cantidad es independiente del modelo.

  13. (B) Deriva la identidad pitagórica SSE(R)=SSE(F)+Y^FY^R2\mathrm{SSE}(R) = \mathrm{SSE}(F) + \lVert \widehat{\mathbf{Y}}_F - \widehat{\mathbf{Y}}_R\rVert^2 para modelos anidados, indicando dónde se usa la ortogonalidad.

  14. (B) Partiendo de s2{bk}=MSEckks^2\{b_k\} = \mathrm{MSE}\cdot c_{kk} y SSR(Xkothers)=bk2/ckk\mathrm{SSR}(X_k \mid \text{others}) = b_k^2/c_{kk}, demuestra que la prueba lineal general con q=1q = 1 da F=tk2F^{*} = t_k^2 (Teorema 8.7).

  15. (B) Demuestra que la pendiente del gráfico de variable agregada para XkX_k es igual al coeficiente del modelo completo bkb_k, en el caso de dos predictores (Teorema 8.9, Frisch-Waugh).

  16. (B) Deriva Ra2=1n1np(1R2)R^2_a = 1 - \frac{n-1}{n-p}(1 - R^2) a partir de la definición Ra2=1SSE/(np)SSTO/(n1)R^2_a = 1 - \frac{\mathrm{SSE}/(n-p)}{\mathrm{SSTO}/(n-1)}, y explica cuándo agregar un predictor lo baja.

  17. (B) Muestra que el coeficiente estandarizado satisface bk=bk(sXk/sY)b_k^{*} = b_k\,(s_{X_k}/s_Y) relacionando la regresión sobre variables estandarizadas con la regresión sobre variables crudas.

  18. (B) Explica por qué reordenar los predictores cambia las sumas de cuadrados secuenciales pero nunca cambia su total ni los coeficientes del modelo completo. Vincula tu respuesta a cuáles cantidades afecta el orden.

  19. (B) La prueba lineal general para la regresión general compara el modelo completo con el modelo de solo intercepto. Muestra que su FF^{*} es igual a MSR/MSE\mathrm{MSR}/\mathrm{MSE} con MSR=SSR/(p1)\mathrm{MSR} = \mathrm{SSR}/(p-1).

  20. (C) Ajusta el modelo de Dwaine en R o Python y reproduce b0,b1,b2b_0, b_1, b_2, R2R^2, y el error estándar residual. Confirma MSE=SSE/(np)\mathrm{MSE} = \mathrm{SSE}/(n-p) a partir de los residuos.

  21. (C) Sobre bodyfat3.csv, imprime la ANOVA secuencial en los dos órdenes de predictores (triceps-luego-thigh y thigh-luego-triceps) y reporta cómo difieren SSR(thigh)\mathrm{SSR}(\text{thigh}) y SSR(thightriceps)\mathrm{SSR}(\text{thigh} \mid \text{triceps}). Explica la diferencia.

  22. (C) Corre la prueba lineal general descartando pop75 y dpi del modelo de ahorro, primero con la comparación de modelos incorporada y luego a mano a partir de las dos sumas de cuadrados del error. Confirma que coinciden y reporta FF^{*} y su valor p.

  23. (C) Para el modelo de ahorro, verifica F=t2F^{*} = t^2 para el único predictor ddpi: calcula la prueba lineal general descartando ddpi y compárala con el cuadrado del estadístico tt de ddpi.

  24. (C) Construye el gráfico de variable agregada para pop15 en el modelo de ahorro. Reporta la pendiente, confirma que es igual al coeficiente del modelo completo sobre pop15, y describe la dispersión.

  25. (C) Agrega tres columnas de ruido normal estándar (semilla 4210) a los datos de ahorro, reajusta con las columnas adicionales, y reporta cómo cambian R2R^2 y el R2R^2 ajustado. ¿Cuál se comporta con sensatez?

  26. (C) Estandariza las variables de Dwaine y reajusta; reporta los dos coeficientes estandarizados y di cuál predictor tiene el mayor efecto estandarizado. ¿Coincide el orden con los estadísticos tt crudos?

  27. (C) Predice las ventas de Dwaine en población objetivo 75 e ingreso 16, y por separado en las medias muestrales. Argumenta a partir de la Figure 15 cuál predicción confiarías y por qué.

  28. (C) Ajusta el modelo completo de tres predictores de grasa corporal y reporta los tres estadísticos tt y el FF general. Explica, usando las correlaciones entre los predictores, por qué los veredictos individual y conjunto discrepan.

  29. (B) Un estudiante afirma que como SSR(X2X1)0\mathrm{SSR}(X_2 \mid X_1) \ge 0 siempre, agregar cualquier predictor siempre mejora el modelo. Explica con precisión qué puede y qué no puede significar “mejorar” aquí, distinguiendo SSE\mathrm{SSE}, R2R^2, R2R^2 ajustado, y la predicción fuera de muestra.

  30. (C) Usando el modelo de Dwaine, calcula un intervalo de confianza del 95% para las ventas medias y un intervalo de predicción del 95% para las ventas de una ciudad nueva en población objetivo 65.4 e ingreso 17.6. Explica en una oración por qué el intervalo de predicción es más ancho, citando 3.5 Intervalo de predicción para una observación nueva.

8.11 Práctica de examen

Estas cinco preguntas están escritas al estilo de los exámenes del curso: cada una te pide explicar tu razonamiento en oraciones completas, no solo producir un número. Lee la salida, decide qué dice, y escribe el argumento que querrías que un evaluador leyera. Trabaja cada una antes de abrir su respuesta modelo.

EP 8.1. El modelo de ahorro de cuatro predictores se ajusta a los 50 países, y R imprime la tabla de coeficientes de abajo.

            Estimate Std. Error t value Pr(>|t|)
(Intercept)  28.5661     7.3545  3.8842   0.0003
pop15        -0.4612     0.1446 -3.1885   0.0026
pop75        -1.6915     1.0836 -1.5610   0.1255
dpi          -0.0003     0.0009 -0.3618   0.7192
ddpi          0.4097     0.1962  2.0882   0.0425

Interpreta el coeficiente sobre pop15 como una pendiente parcial, dando sus unidades y la frase exacta de lo que se mantiene fijo. Luego, usando el valor tt y el valor p, explica si pop15 es distinguible de cero al nivel del 5%. Finalmente, un compañero lee el coeficiente casi nulo de dpi (0.0003)(-0.0003) y concluye que el ingreso disponible no tiene relación con la tasa de ahorro; explica en oraciones completas por qué esa conclusión se excede.

EP 8.2. Un estudiante ajusta los tres predictores de grasa corporal en dos órdenes distintos e imprime la tabla ANOVA secuencial (Tipo I) cada vez.

Response: bodyfat        (order: triceps, thigh, midarm)
          Df Sum Sq Mean Sq F value    Pr(>F)
triceps    1 352.27  352.27 57.2768 1.131e-06
thigh      1  33.17   33.17  5.3931   0.03373
midarm     1  11.55   11.55  1.8773   0.18956
Residuals 16  98.40    6.15
Response: bodyfat        (order: thigh, triceps, midarm)
          Df Sum Sq Mean Sq F value    Pr(>F)
thigh      1 381.97  381.97 62.1052 6.735e-07
triceps    1   3.47    3.47  0.5647   0.46330
midarm     1  11.55   11.55  1.8773   0.18956
Residuals 16  98.40    6.15

El estudiante escribe: “Thigh recibe una suma de cuadrados de 381.97 en la segunda tabla pero solo 33.17 en la primera. La misma variable no puede tener dos sumas de cuadrados distintas, así que una de estas tablas debe ser un error del software”. Evalúa esta afirmación, y explica en oraciones completas qué representan realmente los dos números de thigh.

EP 8.3. En el modelo de ahorro quieres saber si los dos predictores económicos, dpi y ddpi, pueden eliminarse una vez que los dos predictores demográficos pop15 y pop75 están en el modelo. La comparación de modelos imprime:

Model 1: sr ~ pop15 + pop75
Model 2: sr ~ pop15 + pop75 + dpi + ddpi
  Res.Df    RSS Df Sum of Sq     F  Pr(>F)
1     47 726.17
2     45 650.71  2    75.455 2.609 0.08471

Enuncia las hipótesis nula y alternativa que evalúa esta prueba y tu decisión al nivel del 5%. Luego, recordando del resumen del modelo completo en EP 8.1 que dpi tiene t=0.36t = -0.36 (p=0.72p = 0.72) mientras ddpi tiene t=2.09t = 2.09 (p=0.0425p = 0.0425), explica en oraciones completas por qué sería un error reaccionar a esta prueba conjunta no significativa eliminando tanto dpi como ddpi.

EP 8.4. Para el modelo de ahorro, el gráfico de variable agregada para pop15 se construye residualizando tanto la respuesta como pop15 sobre los otros tres predictores, y se calcula su pendiente.

AV slope pop15 = -0.4612   full coef pop15 = -0.4612

Explica por qué la pendiente del gráfico de variable agregada debe ser igual al coeficiente del modelo completo, nombrando el resultado que lo garantiza. Luego explica qué cambiaría si un estudiante residualizara solo la respuesta sr sobre los otros predictores pero graficara esos residuos contra los valores crudos de pop15 en lugar de contra el pop15 residualizado: ¿seguiría siendo la pendiente -0.4612, y qué cantidad representaría esa pendiente mal construida?

EP 8.5. Partiendo del modelo de ahorro de cuatro predictores, se agregan tres columnas de puro ruido normal estándar (semilla 4210) y el modelo se reajusta.

model                     R2       adj R2
sr ~ 4 predictors         0.3385   0.2797
sr ~ 4 predictors + 3 noise 0.3980   0.2977

Explica por qué R2R^2 subió de 0.3385 a 0.3980 aunque las tres columnas agregadas son puro ruido. Luego explica por qué este ascenso no es evidencia de que el modelo más grande sea mejor, y di qué te dicen el R2R^2 ajustado y la predicción fuera de muestra en este caso.

8.12 Juego del capítulo