8. La regresión múltiple en la práctica¶
Volvemos a las ciudades de Dwaine Studios de los Capítulos 6 y 7 (7.1 El modelo y los mínimos cuadrados en forma matricial), donde una
cadena de estudios de retratos en pueblos de tamaño medio quiere decidir, para una ciudad en la que
nunca ha entrado, cuánto venderá un nuevo estudio. Dos números registrados sobre cada una de sus 21
ciudades explican de forma plausible esa respuesta: la población objetivo targtpop (miles de
personas menores de 16 años, el conjunto de posibles clientes de retratos familiares) y el ingreso
disponible dispoinc (miles de dólares por persona, cuánto tienen esas familias para gastar), que
juntos predicen las ventas anuales sales (miles de dólares).
En el Capítulo 6 organizamos estos datos en matrices, y en el Capítulo 7 resolvimos las ecuaciones normales para obtener los coeficientes de mínimos cuadrados ; véase 7.1 El modelo y los mínimos cuadrados en forma matricial. Esa fue la etapa de AJUSTE. Este capítulo trata de lo que viene después: leer esos tres números con honestidad, decidir cuáles predictores se ganan su lugar, y conocer las trampas que esperan a cualquiera que reporte un coeficiente sin pensar. La Figure 1 muestra la materia prima, las ventas contra cada predictor uno a la vez.

Figure 1:Las ventas de Dwaine contra cada predictor por separado. Ambas pendientes son positivas: una mayor población objetivo y un mayor ingreso van cada uno con mayores ventas. El trabajo del capítulo es desenredar estas dos historias que se solapan en un solo modelo que sostiene ambas a la vez.
Ambos cuadros suben, así que ambos predictores parecen útiles. Pero los dos predictores también se mueven juntos (las ciudades más ricas tienden a tener perfiles de edad distintos), y ese solapamiento es toda la dificultad de la regresión múltiple. Un coeficiente en una regresión múltiple no es la pendiente que verías en un diagrama de dispersión de un solo predictor. Responde a una pregunta más cuidadosa, y este capítulo trata de plantear esa pregunta correctamente, probar si un predictor pertenece al modelo, y ver la respuesta en una imagen.
8.1 Lectura de los coeficientes de una regresión múltiple¶
Intuición¶
El ajuste nos entregó tres números. Esta sección trata de lo que significa honestamente cada uno, porque la lectura obvia es la equivocada. La versión corta: un número en una regresión múltiple responde a una pregunta más cuidadosa que el mismo número de aspecto parecido en un gráfico de un solo predictor.
El ajuste de Dwaine es . Es tentador leer el 9.37 igual que leemos una pendiente de regresión simple: “sube el ingreso una unidad y las ventas suben 9.37”. Esa lectura está mal de una manera concreta e importante. En un mundo de un solo predictor, mover el ingreso significa mover todo lo demás que viaja con el ingreso. En la regresión múltiple, el coeficiente del ingreso ya tuvo en cuenta la población objetivo. Mide lo que el ingreso agrega después de que la población objetivo ha dicho todo lo que puede decir.
La frase limpia es: un coeficiente de regresión múltiple es una pendiente parcial (partial slope) (Definición 8.1). Es el cambio en la respuesta media por un cambio de una unidad en ese predictor, manteniendo fijos los demás predictores. “Mantener fijo” es lo que lo hace distinto del panorama marginal de la Figure 1, donde nada se mantiene fijo y cada predictor se desplaza junto con todos los demás.
Fórmula¶
El modelo de regresión lineal múltiple con predictores se enuncia en la Definición 8.2.
Término por término:
es la respuesta para el caso (las ventas de Dwaine para la ciudad ).
es el -ésimo predictor para el caso .
es la pendiente parcial del predictor : el cambio en por cada aumento de una unidad en con todos los demás predictores mantenidos fijos.
es el intercepto, la respuesta media cuando todos los predictores valen cero.
es el número de parámetros de regresión incluyendo el intercepto; aquí . Con casos, la varianza del error se estima con divisor , es decir , exactamente el estimador de 7.5 Estimación de la varianza del error.
En palabras: cada es el efecto de su propio predictor después de que a los demás predictores del modelo se les ha dado su turno. Cambia qué más hay en el modelo y cambias la pregunta, así que puedes cambiar el coeficiente.
R¶
El ajuste en sí es una sola línea; la lectura es la parte difícil. Partimos de las mismas 21 ciudades.
dwaine <- read.csv("data/dwaine.csv")
fit <- lm(sales ~ targtpop + dispoinc, data = dwaine)
round(coef(fit), 4)(Intercept) targtpop dispoinc
-68.8571 1.4546 9.3655El modelo ajustado ya no es una recta sino un plano que se posa sobre el suelo (targtpop, dispoinc), como en la Figure 2. Cada coeficiente es la inclinación de ese plano en una dirección. La pendiente parcial del ingreso es qué tan empinadamente sube el plano cuando caminas en la dirección del ingreso manteniendo fija tu coordenada de población.

Figure 2:El ajuste de Dwaine es un plano, no una recta. Caminar en la dirección de la población objetivo con el ingreso fijo asciende el plano a razón de 1.45; caminar en la dirección del ingreso con la población fija lo asciende a razón de 9.37. Las dos pendientes parciales son las dos inclinaciones de esta única superficie.
8.2 Los límites de “mantener fijos los demás”¶
Intuición¶
“Mantener fijos los demás predictores” es la interpretación correcta, y es también donde la gente cuidadosa se mete en problemas. La frase es una afirmación sobre la aritmética del plano ajustado: siempre es cierto que el coeficiente es la inclinación del plano en una dirección con las demás coordenadas fijadas. El problema es que la oración promete calladamente algo que los datos pueden no sostener, que de verdad podrías encontrar, o crear, dos ciudades idénticas en todos los predictores menos uno. Cuando los predictores se mueven juntos, esa promesa es ficción.
Mira otra vez los predictores de Dwaine. La población objetivo y el ingreso disponible tienen una correlación de 0.78. Las ciudades con muchas familias jóvenes son sistemáticamente distintas en ingreso de las ciudades con pocas. Así que “dos ciudades con la misma población objetivo pero distinto ingreso” describe una rebanada más delgada de la realidad de lo que suena, y “mantener fija la población y empujar el ingreso lejos” puede sacarte por completo de la nube de ciudades que alguna vez existieron. El coeficiente sigue siendo calculable y sigue teniendo sentido como descripción de la superficie ajustada. Lo que se debilita es el ensueño causal de que podrías intervenir sobre un predictor y dejar los demás sin tocar.
El mecanismo: un coeficiente depende de sus acompañantes¶
Un coeficiente no es una propiedad de un predictor. Es una propiedad de un predictor y de la compañía que mantiene. Agrega o quita otro predictor y el coeficiente puede moverse, a veces poco, a veces lo suficiente para cambiar de signo. La Figure 3 muestra la historia del ingreso de Dwaine de las dos maneras: la pendiente marginal empinada cuando el ingreso está solo, y la pendiente parcial más suave una vez que se tiene en cuenta la población.

Figure 3:Dos respuestas a “cómo se relaciona el ingreso con las ventas”. La recta discontinua empinada ignora la población y reporta pendiente 31.17. Dentro de grupos de ciudades que comparten un nivel de población (mismo color), la pendiente del ingreso es mucho más suave, cercana a la pendiente parcial 9.37. La diferencia es la población que acompaña al ingreso en los datos crudos.
Cuando “mantener fijo” describe espacio vacío¶
El límite más profundo es geométrico. Mantener fija la población y variar el ingreso traza una recta a través del suelo (targtpop, dispoinc). Si la nube de datos es una elipse inclinada, porque los dos predictores están correlacionados, entonces la mayor parte de esa recta cae fuera de la nube. El modelo aún devolverá un valor ajustado ahí, pero está extrapolando hacia una región donde ninguna ciudad ha sido observada, y ningún dato restringe la respuesta. Volveremos a esto en 8.7 Dos peligros: extrapolación oculta y variables ocultas con una imagen; por ahora, retén la advertencia: un coeficiente puede estar perfectamente estimado y aun así describir una comparación que nunca podrás hacer de verdad.
El widget de abajo mantiene fija la población por ti, un nivel a la vez, para que veas cómo la pendiente parcial suave y la pendiente marginal empinada dejan de parecer rivales.
Corta el plano ajustado en una población objetivo y desliza esa población arriba y abajo. La pendiente parcial se queda en 9.37 mientras la línea marginal, de pendiente 31.17, solo traza dónde quedan esos cortes.
8.3 Sumas de cuadrados adicionales¶
Intuición¶
Necesitamos una forma de preguntar “¿cuánto agrega un predictor?” que no dependa de quedarse mirando un coeficiente. La medida natural es cuánta variación no explicada elimina un predictor cuando se une a un modelo que ya tiene a los demás. Ajusta el modelo sin el predictor y anota su suma de cuadrados del error; agrega el predictor y anota la nueva y menor suma de cuadrados del error; la caída es la suma de cuadrados adicional (extra sum of squares) del predictor (Definición 8.3). Es la variación que solo este predictor podía recoger, una vez que los demás han hecho su parte.
Dos hechos hacen que esto funcione. Primero, agregar un predictor nunca puede hacer más grande la suma de cuadrados del error (lo demostramos abajo), así que la caída nunca es negativa. Segundo, la variación total en no depende del modelo, así que un menor significa un mayor: la suma de cuadrados adicional es variación que se mueve de la columna “no explicada” a la columna “explicada”.
Una imagen concreta la idea de “solo este predictor podía recoger”. Piensa en la variación de la respuesta como una diana, y en cada predictor como un círculo que cubre la parte que puede explicar. Cuando dos predictores están correlacionados, sus círculos se solapan, y la parte compartida puede acreditarse solo a uno de ellos: al que entró primero en el modelo. La suma de cuadrados adicional del segundo predictor es apenas su propia media luna, la parte de su círculo que el círculo del primer predictor no cubrió ya. La Figure 5 dibuja esto para los predictores de grasa corporal con los que trabajamos a continuación.

Figure 5:La suma de cuadrados adicional como círculos que se solapan. triceps entra primero y reclama todo el solapamiento compartido, así que thigh, al entrar segundo, recibe crédito solo por su propia media luna (33.2), no por la región mayor que comparte con triceps. Por eso la suma de cuadrados adicional de un predictor posterior es pequeña cuando los predictores se solapan, y por eso reordenarlos cambia el reparto.
Fórmula¶
Para un modelo que ya contiene un conjunto de predictores, escribe para su suma de cuadrados del error. La suma de cuadrados adicional de dado se define en la Definición 8.3.
es la suma de cuadrados del error del modelo solo con .
es la suma de cuadrados del error una vez que se agrega .
Las dos expresiones del lado derecho son iguales porque es el mismo total para ambos modelos (3.6 El enfoque del análisis de varianza), así que cualquier caída en es un ascenso igual en .
En palabras: es la variación explicada adicional que compras al agregar a un modelo que ya tiene . La barra vertical se lee “dado” o “ajustado por”.
Las sumas de cuadrados adicionales se encadenan en una descomposición de la suma de cuadrados total de la regresión. Agregando predictores uno a la vez,
que es exactamente lo que imprime la tabla ANOVA secuencial (Tipo I), una fila por predictor en el orden en que los listas. Como el orden es una elección, también lo es el reparto: reordena los predictores y las partes cambian, aunque su total no.
Derivación (agregar un predictor no puede aumentar SSE)¶
Demostración. Sea el modelo reducido el que usa los predictores de un conjunto y el modelo completo el que usa junto con un predictor más, de modo que las columnas del modelo completo generan un espacio mayor. Por 7.2 La geometría de los mínimos cuadrados, el vector ajustado es la proyección ortogonal de sobre el espacio columna de la matriz de diseño, y es la distancia al cuadrado de a ese espacio. Todo vector ajustado que el modelo reducido puede producir está también disponible para el modelo completo (fija en cero el coeficiente adicional), así que el espacio columna del modelo completo contiene al del modelo reducido. Proyectar sobre un subespacio mayor cae al menos igual de cerca de :
Por lo tanto , con igualdad solo cuando el predictor agregado no compra nada (su contribución ajustada ya está en el espacio reducido).
R y Python¶
El ejemplo clásico trabajado no es Dwaine sino los datos de grasa corporal de ALRM: 20 hombres, el porcentaje de grasa corporal medido por pesaje bajo el agua, contra tres predictores de cinta métrica, el pliegue del tríceps, la circunferencia del muslo y la circunferencia del medio del brazo. Está hecho para esta sección porque los predictores se solapan mucho, así que el orden importa bastante.
La Figure 6 dibuja la descomposición como una barra apilada: la variación total en la grasa corporal partida en las piezas secuenciales más el error restante.

Figure 6:La variación total en la grasa corporal, partida por sumas de cuadrados adicionales secuenciales. El primer predictor reclama la parte del león; cada predictor posterior agrega menos porque los predictores de cinta métrica se solapan. El segmento más a la derecha es la variación que ningún predictor explicó.
8.4 La prueba lineal general¶
Intuición¶
Las sumas de cuadrados adicionales miden cuánto agrega un predictor; ahora preguntamos si esa adición es más de lo que produciría el ruido. La herramienta es una comparación de dos modelos, uno reducido (sin los términos en cuestión) y uno completo (con ellos). Si los términos adicionales no valen nada, la suma de cuadrados del error del modelo completo será solo trivialmente menor que la del modelo reducido, una caída no mayor que la que daría la dispersión aleatoria. Si los términos adicionales importan, la caída será grande en relación con el nivel de ruido. La prueba lineal general (general linear test) (Definición 8.5) convierte “grande en relación con el ruido” en un solo estadístico .
Fórmula¶
Sea el modelo completo con sobre grados de libertad y el modelo reducido con sobre , donde el modelo reducido es el modelo completo con algunos coeficientes forzados a cero. El estadístico de la prueba lineal general y su distribución nula se enuncian en el Teorema 8.6.
es la suma de cuadrados adicional explicada por los términos que el modelo reducido descartó: variación que el modelo completo puede dar cuenta y el reducido no.
es el número de coeficientes fijados a cero bajo el modelo reducido, llámalo .
El denominador es la estimación de del modelo completo.
En palabras: es la variación adicional explicada por coeficiente descartado, medida en unidades de la varianza del ruido. Bajo el modelo reducido (los coeficientes descartados son de verdad cero) con errores normales, , y un grande es evidencia contra el modelo reducido. Rechazamos el modelo reducido cuando excede el valor crítico superior de , equivalentemente cuando su valor p es pequeño.
Derivación (el estadístico de prueba y su distribución)¶
Demostración. Escribe y para los vectores ajustados del modelo completo y del reducido. Por 7.2 La geometría de los mínimos cuadrados cada uno es la proyección ortogonal de sobre un espacio columna, y el espacio reducido es un subespacio del espacio completo. Parte el residuo del modelo reducido a través del ajuste completo:
El residuo completo es ortogonal a todo el espacio columna completo, y vive dentro de ese espacio, así que las dos piezas son perpendiculares. Pitágoras da
así que la suma de cuadrados del numerador es la longitud al cuadrado del vector de ajuste adicional, que vive en un subespacio de dimensión . De ahí vienen sus grados de libertad. La Figure 7 dibuja este triángulo rectángulo.

Figure 7:La prueba lineal general es Pitágoras. El residuo reducido (hipotenusa, SSE(R)) se parte en el residuo completo (cateto largo, SSE(F)) y el vector de ajuste adicional (cateto corto), que se encuentran en ángulo recto. La prueba compara la longitud al cuadrado del cateto corto, por coeficiente descartado, con el nivel de ruido.
La afirmación distribucional necesita una capa más. Bajo el modelo reducido con errores normales, las dos piezas perpendiculares son independientes, y cada longitud al cuadrado dividida por es una ji cuadrada: y . Dividir cada ji cuadrada por sus grados de libertad y tomar el cociente da una variable . Los hechos de independencia y ji cuadrada descansan sobre la geometría de teoría normal de las proyecciones construida en 7.3 La matriz sombrero. El argumento completo usa el teorema de Cochran sobre formas cuadráticas, que está más allá del álgebra matricial que este libro demuestra. Así que tomamos esos dos hechos distribucionales sobre la autoridad de esa geometría, y verificamos toda la maquinaria numéricamente más abajo. El texto de ALRM, Capítulo 7, da los detalles de forma cuadrática para quien los quiera.
Pruebas sobre un subconjunto de coeficientes¶
Los datos de ahorro dan una prueba de subconjunto limpia, y llevan el segundo hilo continuo de este
capítulo. En el Capítulo 4 usaste estos 50 países para estudiar la correlación y sus trampas
(4.2 La correlación y la pendiente de regresión); ahora los ajustamos como una regresión múltiple. La respuesta sr es la tasa
de ahorro personal agregada, y los predictores son el porcentaje de población menor de 15 años
(pop15), el porcentaje mayor de 75 años (pop75), el ingreso disponible per cápita (dpi), y su
tasa de crecimiento (ddpi). La teoría del ahorro por ciclo de vida dice que las dos medidas de
dependencia, pop75 y dpi, podrían no importar una vez que la estructura de edad y el crecimiento
están en el modelo. Esa es una hipótesis sobre dos coeficientes a la vez, y la prueba lineal general
está hecha para ella.
Un solo coeficiente: la prueba es exactamente ¶
Cuando el modelo reducido descarta un solo coeficiente (), la prueba lineal general debe coincidir con la prueba que el software ya imprime para ese coeficiente. Y coincide, exactamente.
Demostración. De 7.4 La distribución muestral de b la varianza estimada de es , donde es la -ésima entrada diagonal de . La suma de cuadrados adicional por descartar el único predictor resulta ser . Sustituyendo ambos en la prueba lineal general con ,
Así que la prueba de subconjunto con un coeficiente descartado es el cuadrado del estadístico ordinario, y una variable es el cuadrado de una variable . Las dos pruebas son una sola prueba.
Antes de confiar en una sola fila de una tabla secuencial, asciende y degrada tú mismo los predictores y observa cómo vuelve a decidir si el más reciente se ganó su lugar.
Deja entrar los predictores de grasa corporal uno a uno, en cualquiera de los seis órdenes, y observa cómo cambian cada suma de cuadrados adicional y su F* de la prueba lineal general mientras la SSR total no cambia.
8.5 Gráficos de variable agregada¶
Intuición¶
Un coeficiente es un solo número; a veces quieres ver la relación parcial que resume. El obstáculo es que no puedes simplemente graficar contra , porque esa imagen mezcla todos los demás predictores. El gráfico de variable agregada (added-variable plot) (Definición 8.8), también llamado gráfico de regresión parcial, quita primero los demás predictores de ambos ejes, y luego grafica lo que queda.
Aquí está la receta. Para ver el efecto parcial de : regresa sobre todos los demás predictores y guarda los residuos , la parte de que los demás no explican. Regresa sobre todos los demás predictores y guarda los residuos , la parte de que los demás no explican. Ahora grafica contra . A ambos ejes se les ha purgado de los demás predictores, así que el gráfico muestra la relación entre y que es genuinamente nueva. Su pendiente es exactamente el coeficiente de regresión múltiple , un hecho que demostramos abajo, así que el gráfico es una imagen del número mismo en la tabla de coeficientes.
La única regla que la gente rompe es olvidar limpiar el eje horizontal: residualizan pero luego lo grafican contra el predictor crudo. La Figure 9 expone los tres pasos para que ambos ejes reciban el mismo tratamiento.

Figure 9:El gráfico de variable agregada en tres pasos. Ambos ejes deben purgarse de los demás predictores antes de graficar, no solo la respuesta. Limpia solo un eje y la pendiente ya no es el coeficiente, que es el error que recorre el Inténtalo 8.5.
Fórmula¶
Para el predictor en un modelo cuyos demás predictores se agrupan como ,
y el gráfico de variable agregada es la dispersión de contra . La pendiente de mínimos cuadrados de esa dispersión es igual a , el coeficiente del modelo completo sobre .
es la respuesta con la explicación de los demás predictores removida.
es el predictor con la explicación de los demás predictores removida, su parte única.
La pendiente de sobre es ; la dispersión alrededor de la recta muestra qué tan limpiamente la parte única de predice la parte no emparejada de .
Derivación (la pendiente de variable agregada es igual a )¶
Demostración (Frisch-Waugh, caso de dos predictores). Toma el modelo completo y deja que desempeñe el papel de “el otro predictor” mientras construimos el gráfico de variable agregada para . Parte en su proyección sobre y el residuo: , donde por construcción. Sustituye en la ecuación ajustada y agrupa los términos que viven en :
Ahora forma removiendo la parte de , es decir, proyectando sobre el complemento ortogonal de . El primer grupo se desvanece bajo esta proyección. El término ya es ortogonal a , así que sobrevive intacto. El residuo completo es ortogonal a , por ende a , así que también sobrevive. Por lo tanto
Finalmente regresa sobre por el origen (ambos vectores de residuos tienen media cero). La pendiente es
porque : el residuo completo es ortogonal a y a , por ende a . La pendiente de variable agregada es exactamente el coeficiente de regresión múltiple. El mismo argumento funciona con cualquier número de otros predictores en lugar de .
R y Python¶

Figure 10:El gráfico de variable agregada para el ingreso, con la población objetivo purgada de ambos ejes. Su pendiente es el coeficiente de regresión múltiple 9.37 exactamente. La inclinación ascendente confirma que el ingreso agrega información más allá de la población; la dispersión muestra cuánta.
Un gráfico de variable agregada también puede revelar lo contrario, un predictor con casi nada que
agregar. La Figure 11 muestra el gráfico para la tasa de crecimiento ddpi en el
modelo de ahorro, cuya pendiente parcial es un 0.41 positivo pero suave.

Figure 11:El gráfico de variable agregada para el crecimiento del ingreso en el modelo de ahorro. La pendiente suavemente ascendente, 0.41, es el efecto parcial del crecimiento sobre el ahorro una vez que se tienen en cuenta la estructura de edad y el ingreso. La amplia dispersión es por lo que el efecto, aunque real, es solo marginalmente significativo.
En vez de aceptar la receta por fe, mueve el deslizador de limpieza de abajo y observa cómo la pendiente marginal se convierte en el coeficiente delante de ti.
Quita de ambos ejes lo que explica la población objetivo, poco a poco, y observa cómo la pendiente viaja desde la marginal 31.17 hasta la pendiente de variable agregada 9.37, que es exactamente el coeficiente de dispoinc.
8.6 , ajustado y coeficientes estandarizados¶
Intuición¶
Ya podemos probar cuáles predictores pertenecen al modelo; el siguiente trabajo es resumir todo un modelo en un número y comparar modelos de distinto tamaño de forma justa. es la fracción de la variación de la respuesta que el modelo explica, y tiene una falla seductora: nunca baja cuando agregas un predictor, aunque sea una columna de ruido aleatorio. Eso lo hace inútil para comparar modelos de distinto tamaño, porque el modelo más grande siempre gana. El ajustado (adjusted ) (Definición 8.10) corrige esto cobrando renta por cada predictor: sube solo si el nuevo predictor explica más de lo que explicaría un predictor promedio de ruido. Los coeficientes estandarizados (standardized coefficients) (Definición 8.11) resuelven un problema distinto: los coeficientes crudos viven en unidades distintas (dólares, miles de personas, porcentajes), así que no puedes comparar sus tamaños; poner todo en unidades de desviación estándar hace justa la comparación.
Fórmula¶
es la variación total en , fija sin importar el modelo.
compara sumas de cuadrados crudas; las compara por grado de libertad, así que agregar un parámetro (elevar ) se penaliza a través del factor .
Un coeficiente estandarizado es , el coeficiente que obtienes al ajustar la regresión sobre variables reescaladas primero para tener desviación estándar uno.
En palabras: mide la fracción explicada, mide la fracción explicada después de pagar por el tamaño del modelo, y mide el tamaño del efecto en desviaciones estándar, así que distintos predictores pueden ordenarse en una sola escala.
Derivación ( nunca baja; sí puede)¶
Demostración. Por el resultado de monotonía de 8.3 Sumas de cuadrados adicionales (Teorema 8.4), agregar un predictor no puede elevar , y no depende del modelo. Por ende no puede subir, así que no puede bajar: todo predictor agregado deja igual o más alto, que es por lo que solo no puede elegir un modelo. El ajustado se comporta distinto porque usa . Agregar un predictor inútil baja un poco pero también baja el divisor en uno; si la reducción en es menor de lo que exige la reducción en , sube y baja. Así que puede bajar cuando un predictor no gana su grado de libertad, que es exactamente el comportamiento que queremos de una medida consciente del tamaño del modelo.
La Figure 13 lo hace concreto: partiendo del modelo de ahorro real, agregamos columnas de puro ruido aleatorio una a la vez y observamos cómo trepa mientras se hunde.

Figure 13:Agregar predictores de puro ruido al modelo de ahorro. La R cuadrada (curva superior) sube con cada columna basura, porque nunca baja cuando se agrega un predictor. La R cuadrada ajustada (curva inferior) se desliza hacia abajo, reportando correctamente que las columnas de ruido no valen sus grados de libertad.
R y Python¶
La Figure 14 ordena los cuatro coeficientes estandarizados sobre un solo eje, que los coeficientes crudos, viviendo en unidades incompatibles, nunca podrían compartir.

Figure 14:Los coeficientes de ahorro sobre una regla común de desviación estándar. La proporción de población joven (pop15) tiene por mucho el mayor efecto estandarizado, y es negativo; el ingreso (dpi) casi ninguno. Solo después de estandarizar pueden compararse así predictores en porcentaje y en dólares.
8.7 Dos peligros: extrapolación oculta y variables ocultas¶
Intuición¶
Dos fallas merecen su propia sección porque son invisibles en la tabla de coeficientes y fatales para una conclusión. La primera es la extrapolación oculta (hidden extrapolation) (Definición 8.13): predecir en una combinación de valores de predictor que está dentro del rango de cada predictor por separado pero fuera de la región donde ocurren juntos. La segunda es la variable oculta (lurking variable) (Definición 8.14): un predictor omitido que, si se incluyera, movería o invertiría los coeficientes que reportaste.
Extrapolación oculta¶
Con un solo predictor, la extrapolación es fácil de vigilar: quédate dentro del rango observado de . Con varios predictores, la región observada no es una caja sino una nube, normalmente inclinada porque los predictores están correlacionados. Un punto de consulta puede estar dentro del rango propio de cada predictor y aun así caer muy fuera de la nube. La Figure 15 muestra el caso de Dwaine: una ciudad con población objetivo 75 e ingreso disponible 16 es poco notable en cada eje por sí solo, y sin embargo ninguna ciudad real combina una población tan grande con un ingreso tan bajo, así que una predicción ahí es una extrapolación que los rangos de una variable nunca señalarían.
La revisión práctica es preguntar si un punto de consulta cae dentro de la región conjunta de los datos, no solo dentro de cada margen. El Capítulo 9 hace esto riguroso con la matriz sombrero: el valor de apalancamiento de 7.3 La matriz sombrero mide qué tan lejos se sienta un punto del centro de la nube de predictores, y un punto nuevo cuyo apalancamiento excedería a los observados es una extrapolación oculta.
Variables ocultas¶
Una regresión solo puede ajustar por los predictores que le das. Si falta una variable importante y se correlaciona tanto con la respuesta como con un predictor incluido, el coeficiente que reportas absorbe la influencia de la variable faltante y puede quedar muy equivocado, incluso invertido. Esta es la versión de regresión múltiple de la advertencia de que correlación no es causación de 4.2 La correlación y la pendiente de regresión, y es por lo que un coeficiente observacional siempre es provisional: algún factor no medido podría estar haciendo el trabajo.
“Incluso invertido” suena a exageración hasta que lo ves. La Figure 16 muestra el mecanismo en un conjunto de datos esquemático. Ignora la variable oculta y los puntos marchan hacia arriba de izquierda a derecha, así que la pendiente parece positiva. Colorea los puntos por el grupo oculto y cada grupo se inclina al revés: dentro de cualquier grupo la pendiente es negativa. Un modelo que nunca vio el grupo reporta la tendencia ascendente y obtiene el signo exactamente al revés.

Figure 16:Una variable oculta puede invertir el signo de una pendiente. La recta general discontinua sube porque los grupos están a distintas alturas; las rectas sólidas dentro de grupo todas bajan. Si el grupo es una variable que nunca mediste, tu coeficiente ajustado reporta la pendiente ascendente y se pierde por completo la verdadera pendiente descendente.
La postura honesta es nombrar las variables ocultas que puedas imaginar y admitir las que no. En el estudio de Dwaine, la competencia local, la antigüedad de cada estudio y la publicidad regional están todas plausiblemente relacionadas tanto con las ventas como con las características de la ciudad; ninguna está en el modelo, así que cada pendiente parcial es “lo mejor que podemos decir con estas tres columnas”, no una verdad final. Ninguna cantidad de aritmética dentro de un conjunto fijo de predictores puede descartar una variable que nunca mediste.
8.8 Resumen del capítulo¶
Ahora puedes tomar una regresión múltiple ajustada y hacer el trabajo que importa después del ajuste. Puedes leer cada coeficiente como una pendiente parcial, enunciando en palabras la comparación controlada que hace y la frase exacta “manteniendo fijos los demás predictores”, y puedes explicar por qué esa frase se debilita cuando los predictores están correlacionados y puede describir una región sin datos. Puedes calcular sumas de cuadrados adicionales y leer una tabla ANOVA secuencial como una descomposición de . Puedes correr la prueba lineal general para un coeficiente o un grupo, derivar su estadístico de la partición pitagórica de modelos anidados, y mostrar que colapsa a para un solo coeficiente. Puedes construir un gráfico de variable agregada y demostrar que su pendiente es el coeficiente de regresión múltiple. Puedes calcular , ajustado y coeficientes estandarizados, y explicar por qué solo los dos últimos son seguros para comparar modelos o efectos. Y puedes detectar los dos peligros que oculta una tabla de coeficientes: la extrapolación oculta en el espacio conjunto de predictores y la variable oculta que ningún modelo midió.
Resultados clave de un vistazo
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Pendiente parcial (Definición 8.1) | es el cambio en por unidad de , con los demás predictores fijos | modelo de regresión múltiple |
| Suma de cuadrados adicional (Definición 8.3) | cualquier par anidado de modelos | |
| Monotonía de SSE (Teorema 8.4) | , así que | los predictores reducidos son subconjunto de los completos |
| Prueba lineal general (Teorema 8.6) | errores normales, modelo reducido verdadero | |
| Identidad de un coeficiente (Teorema 8.7) | al descartar un solo coeficiente () | |
| Pendiente de variable agregada (Teorema 8.9) | la pendiente de sobre es igual a | cualquier regresión múltiple (Frisch-Waugh) |
| Monotonía de (Teorema 8.12) | nunca baja al agregar predictores; sí puede | al comparar modelos anidados |
| ajustado (Definición 8.10) | al comparar modelos de distinto tamaño | |
| Coeficiente estandarizado (Definición 8.11) | al ordenar efectos en distintas unidades |
Términos clave
pendiente parcial, modelo de regresión lineal múltiple, suma de cuadrados adicional, ANOVA secuencial (Tipo I), prueba lineal general, modelo completo, modelo reducido, gráfico de variable agregada, coeficiente de determinación (), ajustado, coeficiente estandarizado, extrapolación oculta, variable oculta, multicolinealidad.
Ahora deberías ser capaz de
Leer cada coeficiente como una pendiente parcial, con sus unidades y la frase “manteniendo fijos los demás predictores”.
Explicar por qué “mantener fijo” se debilita bajo predictores correlacionados y puede describir una región sin datos.
Calcular una suma de cuadrados adicional y leer una tabla ANOVA secuencial como una descomposición de .
Correr la prueba lineal general para un coeficiente o un grupo, y mostrar que se reduce a cuando .
Construir un gráfico de variable agregada y demostrar que su pendiente es igual al coeficiente de regresión múltiple.
Calcular y contrastar , ajustado y coeficientes estandarizados, y decir por qué nunca baja cuando se agrega un predictor.
Detectar la extrapolación oculta en el espacio conjunto de predictores y explicar cómo una variable oculta puede invertir el signo de un coeficiente.
Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado este capítulo es sobre todo USO: toma el ajuste que el Capítulo 7 produjo para Dwaine en forma matricial y lo convierte en interpretación, pruebas y advertencias honestas, con la prueba lineal general sirviendo también al AJUSTE al decidir cuáles términos pertenecen. El Capítulo 7 dio el estimador y su varianza; este capítulo dio el razonamiento que convierte una estimación en una afirmación. Lo que aplazamos es la etapa de VERIFICACIÓN: si algún caso individual está corriendo calladamente el ajuste, y si los supuestos del modelo se sostienen del todo. Ese es el trabajo del Capítulo 9. Vuelve a los datos de ahorro, señalando a Libia como el caso que dobla el ajuste y a Zambia como un valor atípico de residuo grande, y construye los diagnósticos de influencia (9.3 Influencia: qué puntos cambian realmente el ajuste) y el estadístico de apalancamiento al que apunta 9.1 Los valores de apalancamiento y la matriz sombrero, que juntos deciden cuánta de la confianza de este capítulo sobrevive al contacto con datos reales. La prueba lineal general que aprendiste aquí es el motor de pruebas que el Capítulo 11 reutiliza para predictores categóricos e interacciones (11.1 De categorías a números: codificación con indicadores) y el Capítulo 12 para la selección de variables (12.2 Elegir entre modelos: criterios de selección), sin que ninguno la vuelva a derivar.
8.9 Preguntas frecuentes¶
P1. ¿Por qué es tan distinto el coeficiente de regresión múltiple del ingreso de la pendiente de regresión simple? Porque responden a preguntas distintas. La pendiente simple 31.17 compara ciudades que difieren en ingreso y deja que la población difiera junto con él; la pendiente parcial 9.37 compara ciudades que difieren en ingreso pero comparten población. Cuando los predictores están correlacionados, las dos preguntas tienen respuestas distintas, y solo la pendiente parcial se gana la frase “manteniendo fija la población”.
P2. ¿“Manteniendo fijos los demás predictores” significa que puedo intervenir sobre un predictor y esperar el cambio de ese coeficiente? No. El coeficiente describe una comparación entre casos que ya difieren, no el efecto de una acción. Con datos observacionales, y en especial con predictores correlacionados o una variable oculta, actuar sobre un predictor no necesariamente reproduce la asociación observada. El coeficiente es una descripción de la superficie ajustada, no una promesa sobre intervenciones.
P3. La ANOVA secuencial da sumas de cuadrados distintas cuando reordeno los predictores. ¿Cuál orden es el correcto? Ninguno es únicamente correcto; el orden es una elección sobre qué significa “dados los demás”. El primer predictor recibe su suma de cuadrados de regresión simple completa, cada uno posterior recibe solo lo que agrega más allá de los anteriores. Las piezas siempre suman el mismo . Si quieres cada predictor ajustado por todos los demás a la vez, usa su prueba (o la prueba lineal general descartando solo ese predictor), que no depende del orden.
P4. ¿Cuándo debo usar la prueba lineal general en lugar de solo leer los estadísticos ? Úsala siempre que quieras probar varios coeficientes a la vez, como “¿estos dos predictores juntos agregan algo?”. Un grupo de individualmente no significativos no te dice si el grupo en conjunto importa, porque los predictores pueden compartir su poder explicativo; la prueba lineal general pregunta la cuestión conjunta directamente. Para un solo coeficiente, la prueba lineal general y la prueba son idénticas ().
P5. ¿Por qué siempre sube cuando agrego un predictor, aunque sea inútil? Porque agregar un predictor solo puede bajar (o no cambiar) , y es fijo, así que solo puede subir. Por eso exactamente no puede usarse para elegir entre modelos de distinto tamaño; usa el ajustado, que penaliza cada parámetro agregado, o una prueba formal.
P6. La pendiente de mi gráfico de variable agregada coincide con el coeficiente exactamente. ¿Es coincidencia? No, es un teorema (Frisch-Waugh). Remover los demás predictores tanto de la respuesta como del predictor objetivo, y luego regresar los residuos, reproduce el coeficiente del modelo completo exactamente. Eso es lo que hace del gráfico de variable agregada una imagen fiel del coeficiente en lugar de un bosquejo aproximado.
P7. Los tres coeficientes de grasa corporal son no significativos, y sin embargo el general es altamente significativo. ¿Cómo puede ser útil el modelo si ningún predictor individual lo es? Esta es la huella de la multicolinealidad. Los tres predictores de cinta métrica se solapan tanto que ninguno agrega mucho dados los otros dos, así que cada individual es pequeño; pero juntos explican bien la grasa corporal, así que el general es grande. Los predictores son sustitutos, no contribuyentes independientes. El Capítulo 12 retoma este tema de multicolinealidad en un estudio de grasa corporal mayor y mide el solapamiento con el factor de inflación de varianza.
8.10 Problemas de práctica¶
(A) Indica en una oración qué significa el coeficiente de Dwaine 1.4546 sobre
targtpop, nombrando sus unidades y qué se mantiene fijo.(A) Explica la diferencia entre la pendiente de regresión simple de
salessobredispoinc(31.17) y el coeficiente de regresión múltiple (9.37). ¿Cuál mantiene fija la población?(A) Define en palabras la suma de cuadrados adicional , y explica por qué nunca puede ser negativa.
(A) Un modelo reducido descarta tres predictores de un modelo completo. Indica los grados de libertad del numerador de la prueba lineal general que los compara.
(A) ¿Por qué nunca disminuye cuando se agrega un predictor? Responde usando la identidad .
(A) Un colega reporta que el ajustado bajó cuando agregó una variable, y concluye que cometió un error. ¿Tiene razón? Explica.
(A) En tus propias palabras, ¿qué pone un gráfico de variable agregada en cada eje, y por qué ninguno de los ejes es la variable cruda?
(A) Da un ejemplo, en el contexto de Dwaine, de una variable oculta que podría distorsionar el coeficiente del ingreso, y di por qué importaría.
(A) Explica por qué un punto de consulta puede ser una extrapolación oculta aun cuando cada valor de predictor esté dentro de su propio rango observado.
(A) Los tres coeficientes de grasa corporal son individualmente no significativos pero el general es altamente significativo. Explica cómo pueden ser ciertas ambas cosas.
(B) Demuestra que agregar un predictor a un modelo no puede aumentar (Teorema 8.4), usando la caracterización por proyección de los mínimos cuadrados de 7.2 La geometría de los mínimos cuadrados.
(B) Muestra que es equivalente a , citando cuál cantidad es independiente del modelo.
(B) Deriva la identidad pitagórica para modelos anidados, indicando dónde se usa la ortogonalidad.
(B) Partiendo de y , demuestra que la prueba lineal general con da (Teorema 8.7).
(B) Demuestra que la pendiente del gráfico de variable agregada para es igual al coeficiente del modelo completo , en el caso de dos predictores (Teorema 8.9, Frisch-Waugh).
(B) Deriva a partir de la definición , y explica cuándo agregar un predictor lo baja.
(B) Muestra que el coeficiente estandarizado satisface relacionando la regresión sobre variables estandarizadas con la regresión sobre variables crudas.
(B) Explica por qué reordenar los predictores cambia las sumas de cuadrados secuenciales pero nunca cambia su total ni los coeficientes del modelo completo. Vincula tu respuesta a cuáles cantidades afecta el orden.
(B) La prueba lineal general para la regresión general compara el modelo completo con el modelo de solo intercepto. Muestra que su es igual a con .
(C) Ajusta el modelo de Dwaine en R o Python y reproduce , , y el error estándar residual. Confirma a partir de los residuos.
(C) Sobre
bodyfat3.csv, imprime la ANOVA secuencial en los dos órdenes de predictores (triceps-luego-thigh y thigh-luego-triceps) y reporta cómo difieren y . Explica la diferencia.(C) Corre la prueba lineal general descartando
pop75ydpidel modelo de ahorro, primero con la comparación de modelos incorporada y luego a mano a partir de las dos sumas de cuadrados del error. Confirma que coinciden y reporta y su valor p.(C) Para el modelo de ahorro, verifica para el único predictor
ddpi: calcula la prueba lineal general descartandoddpiy compárala con el cuadrado del estadístico deddpi.(C) Construye el gráfico de variable agregada para
pop15en el modelo de ahorro. Reporta la pendiente, confirma que es igual al coeficiente del modelo completo sobrepop15, y describe la dispersión.(C) Agrega tres columnas de ruido normal estándar (semilla
4210) a los datos de ahorro, reajusta con las columnas adicionales, y reporta cómo cambian y el ajustado. ¿Cuál se comporta con sensatez?(C) Estandariza las variables de Dwaine y reajusta; reporta los dos coeficientes estandarizados y di cuál predictor tiene el mayor efecto estandarizado. ¿Coincide el orden con los estadísticos crudos?
(C) Predice las ventas de Dwaine en población objetivo 75 e ingreso 16, y por separado en las medias muestrales. Argumenta a partir de la Figure 15 cuál predicción confiarías y por qué.
(C) Ajusta el modelo completo de tres predictores de grasa corporal y reporta los tres estadísticos y el general. Explica, usando las correlaciones entre los predictores, por qué los veredictos individual y conjunto discrepan.
(B) Un estudiante afirma que como siempre, agregar cualquier predictor siempre mejora el modelo. Explica con precisión qué puede y qué no puede significar “mejorar” aquí, distinguiendo , , ajustado, y la predicción fuera de muestra.
(C) Usando el modelo de Dwaine, calcula un intervalo de confianza del 95% para las ventas medias y un intervalo de predicción del 95% para las ventas de una ciudad nueva en población objetivo 65.4 e ingreso 17.6. Explica en una oración por qué el intervalo de predicción es más ancho, citando 3.5 Intervalo de predicción para una observación nueva.
8.11 Práctica de examen¶
Estas cinco preguntas están escritas al estilo de los exámenes del curso: cada una te pide explicar tu razonamiento en oraciones completas, no solo producir un número. Lee la salida, decide qué dice, y escribe el argumento que querrías que un evaluador leyera. Trabaja cada una antes de abrir su respuesta modelo.
EP 8.1. El modelo de ahorro de cuatro predictores se ajusta a los 50 países, y R imprime la tabla de coeficientes de abajo.
Estimate Std. Error t value Pr(>|t|)
(Intercept) 28.5661 7.3545 3.8842 0.0003
pop15 -0.4612 0.1446 -3.1885 0.0026
pop75 -1.6915 1.0836 -1.5610 0.1255
dpi -0.0003 0.0009 -0.3618 0.7192
ddpi 0.4097 0.1962 2.0882 0.0425Interpreta el coeficiente sobre pop15 como una pendiente parcial, dando sus unidades y la frase
exacta de lo que se mantiene fijo. Luego, usando el valor y el valor p, explica si pop15 es
distinguible de cero al nivel del 5%. Finalmente, un compañero lee el coeficiente casi nulo de dpi
y concluye que el ingreso disponible no tiene relación con la tasa de ahorro; explica en
oraciones completas por qué esa conclusión se excede.
Respuesta modelo
El coeficiente -0.4612 sobre pop15 es una pendiente parcial: comparando dos países que comparten
los mismos valores de pop75, dpi y ddpi, aquel cuya proporción de población menor de 15 años es
un punto porcentual mayor se predice que tendrá una tasa de ahorro cerca de 0.46 puntos porcentuales
menor. Las unidades son puntos porcentuales de tasa de ahorro por punto porcentual de proporción de
población joven, y la frase que gana la interpretación es “manteniendo fijos pop75, dpi y ddpi”.
Como con un valor p de 0.0026, muy por debajo de 0.05, pop15 es claramente
distinguible de cero al nivel del 5%; los datos dan evidencia fuerte de que su pendiente parcial no es
cero. El compañero se excede por dos razones. Primero, el coeficiente es diminuto en tamaño
principalmente porque dpi se mide en dólares crudos, así que un cambio de un dólar es un movimiento
minúsculo y su efecto por dólar es naturalmente pequeño; el tamaño en una escala cruda no es lo mismo
que la importancia, que es por lo que estandarizamos antes de ordenar efectos. Segundo, y más básico,
el coeficiente mide el efecto parcial del ingreso dados los otros tres predictores, no la relación
total del ingreso con el ahorro. Una correlación simple grande entre dpi y la tasa de ahorro podría
aún existir y ser absorbida por pop15 y pop75, que están ellas mismas correlacionadas con el
ingreso. La afirmación honesta es que el ingreso agrega poco una vez que la estructura de edad y el
crecimiento están en el modelo, no que el ingreso no tenga relación con el ahorro.
Una respuesta débil reporta “no significativo” o “significativo” sin enunciar la comparación controlada
y las unidades detrás de pop15, y acepta el salto del compañero de un coeficiente pequeño a “sin
relación” sin separar la escala cruda de la importancia ni el efecto parcial de la asociación total.
EP 8.2. Un estudiante ajusta los tres predictores de grasa corporal en dos órdenes distintos e imprime la tabla ANOVA secuencial (Tipo I) cada vez.
Response: bodyfat (order: triceps, thigh, midarm)
Df Sum Sq Mean Sq F value Pr(>F)
triceps 1 352.27 352.27 57.2768 1.131e-06
thigh 1 33.17 33.17 5.3931 0.03373
midarm 1 11.55 11.55 1.8773 0.18956
Residuals 16 98.40 6.15Response: bodyfat (order: thigh, triceps, midarm)
Df Sum Sq Mean Sq F value Pr(>F)
thigh 1 381.97 381.97 62.1052 6.735e-07
triceps 1 3.47 3.47 0.5647 0.46330
midarm 1 11.55 11.55 1.8773 0.18956
Residuals 16 98.40 6.15El estudiante escribe: “Thigh recibe una suma de cuadrados de 381.97 en la segunda tabla pero solo 33.17 en la primera. La misma variable no puede tener dos sumas de cuadrados distintas, así que una de estas tablas debe ser un error del software”. Evalúa esta afirmación, y explica en oraciones completas qué representan realmente los dos números de thigh.
Respuesta modelo
El estudiante está equivocado; ambas tablas son correctas, y no están reportando la misma cantidad. Una tabla ANOVA secuencial da a cada predictor la suma de cuadrados adicional que gana dados los predictores listados antes de él, así que la fila de una variable depende de su posición. En la primera tabla thigh entra segundo, así que su fila es : la variación que thigh explica después de que triceps ya reclamó todo lo que los dos comparten. En la segunda tabla thigh entra primero, así que su fila es : la variación que thigh explica por sí solo, incluyendo la gran pieza que comparte con triceps. Los dos números difieren precisamente porque triceps y thigh están fuertemente correlacionados, así que la mayor parte del poder explicativo marginal de thigh se solapa con triceps y se acredita a cualquier predictor que entre primero. Nada es inconsistente: ambas tablas tienen la misma suma de cuadrados residual 98.40 y el mismo total, y ambas dan a midarm la misma fila de último lugar 11.55 porque en ambos órdenes midarm entra después de los otros dos. La lección es que una suma de cuadrados de Tipo I responde a “dados los predictores anteriores”, no a “para este predictor solo”, así que reordenar se espera que mueva las filas del medio dejando el total y los coeficientes del modelo completo sin cambio.
Una respuesta débil solo dice “el orden importa” sin nombrar que los dos números son frente a , y se pierde de que el solapamiento existe porque los predictores están correlacionados, que es la razón por la que cambia el reparto.
EP 8.3. En el modelo de ahorro quieres saber si los dos predictores económicos, dpi y ddpi,
pueden eliminarse una vez que los dos predictores demográficos pop15 y pop75 están en el modelo.
La comparación de modelos imprime:
Model 1: sr ~ pop15 + pop75
Model 2: sr ~ pop15 + pop75 + dpi + ddpi
Res.Df RSS Df Sum of Sq F Pr(>F)
1 47 726.17
2 45 650.71 2 75.455 2.609 0.08471Enuncia las hipótesis nula y alternativa que evalúa esta prueba y tu decisión al nivel del 5%. Luego,
recordando del resumen del modelo completo en EP 8.1 que dpi tiene () mientras
ddpi tiene (), explica en oraciones completas por qué sería un error
reaccionar a esta prueba conjunta no significativa eliminando tanto dpi como ddpi.
Respuesta modelo
La prueba compara el modelo reducido, que fuerza a cero ambos coeficientes económicos, contra el modelo
completo que los conserva. La hipótesis nula es que
juntas, y la alternativa es que al menos uno de ellos es distinto de cero. El estadístico es
sobre 2 y 45 grados de libertad, con un valor p de
0.085. Al nivel del 5% esto no es significativo, así que la prueba conjunta no rechaza el modelo
reducido: los dos predictores económicos no mejoran claramente el ajuste como par. Aun así sería un
error eliminar ambos. La prueba conjunta pregunta una sola cuestión de sí o no sobre los dos
coeficientes a la vez, y su respuesta queda diluida por dpi, que contribuye casi nada (su
individual es -0.36). Pero ddpi por sí solo es individualmente significativo al nivel del 5%
(, ), lo que significa que el crecimiento del ingreso disponible sí agrega
información más allá de la demografía. Promediar un predictor útil con uno inútil puede empujar un
conjunto por debajo de la significancia aunque un miembro del par pertenezca al modelo. El movimiento
sensato es eliminar dpi solo y reexaminar ddpi, no descartar ambos por la fuerza de una prueba
conjunta borrosa.
Una respuesta débil se detiene en “, así que eliminar ambos”, tratando la prueba
conjunta como si autorizara eliminar cada predictor individualmente, y nunca nota que ddpi es
significativo por sí solo.
EP 8.4. Para el modelo de ahorro, el gráfico de variable agregada para pop15 se construye
residualizando tanto la respuesta como pop15 sobre los otros tres predictores, y se calcula su
pendiente.
AV slope pop15 = -0.4612 full coef pop15 = -0.4612Explica por qué la pendiente del gráfico de variable agregada debe ser igual al coeficiente del modelo
completo, nombrando el resultado que lo garantiza. Luego explica qué cambiaría si un estudiante
residualizara solo la respuesta sr sobre los otros predictores pero graficara esos residuos contra
los valores crudos de pop15 en lugar de contra el pop15 residualizado: ¿seguiría siendo la
pendiente -0.4612, y qué cantidad representaría esa pendiente mal construida?
Respuesta modelo
El gráfico de variable agregada pone , la respuesta con los otros tres predictores removidos, en
el eje vertical, y , pop15 con los mismos tres predictores removidos, en el eje horizontal. Por
el resultado de Frisch-Waugh (Teorema 8.9), la pendiente de mínimos cuadrados de sobre es
igual al coeficiente del modelo completo exactamente, que es por lo que ambos
números se imprimen como -0.4612: el gráfico es una imagen fiel del coeficiente, no una aproximación
a él. Si el estudiante limpia solo el eje vertical y grafica contra pop15 crudo, la igualdad se
rompe. El eje horizontal todavía carga la parte de pop15 que se solapa con pop75, dpi y ddpi,
así que la confusión que el gráfico de variable agregada existe para eliminar se ha removido de un solo
eje, no de ambos. La pendiente resultante no sería -0.4612 en general, ni sería la pendiente de
regresión simple de sr sobre pop15; es un híbrido ininterpretable, la pendiente de una respuesta
parcialmente limpiada sobre un predictor no limpiado, que no responde a ninguna pregunta bien
planteada. La disciplina del método es que ambos ejes deben tener los mismos demás predictores
removidos; residualizar un eje y no el otro es la forma más común en que la gente rompe la
construcción.
Una respuesta débil dice solo “la pendiente cambia” sin explicar que el eje horizontal crudo vuelve a mezclar la confusión, y sin reconocer que la pendiente mal construida no es igual ni a la pendiente parcial -0.4612 ni a la pendiente de regresión simple.
EP 8.5. Partiendo del modelo de ahorro de cuatro predictores, se agregan tres columnas de puro
ruido normal estándar (semilla 4210) y el modelo se reajusta.
model R2 adj R2
sr ~ 4 predictors 0.3385 0.2797
sr ~ 4 predictors + 3 noise 0.3980 0.2977Explica por qué subió de 0.3385 a 0.3980 aunque las tres columnas agregadas son puro ruido. Luego explica por qué este ascenso no es evidencia de que el modelo más grande sea mejor, y di qué te dicen el ajustado y la predicción fuera de muestra en este caso.
Respuesta modelo
, y por la monotonía de (Teorema 8.12) agregar cualquier predictor, útil o inútil, solo puede bajar o dejarlo sin cambio, mientras que es fijo porque depende solo de la respuesta. Así que solo puede subir o quedarse plano, y aquí subió cerca de 0.06. Ese ascenso es un artefacto dentro de muestra: con solo 50 países, tres columnas aleatorias pueden afinarse por mínimos cuadrados para absorber un poco del zigzag idiosincrásico de esta muestra particular, lo que baja aunque las columnas no carguen señal real. No es evidencia de un mejor modelo, porque nunca baja cuando se agregan predictores y por lo tanto no puede distinguir una mejora real del ajuste de ruido. El ajustado es la comparación honesta: cobra una renta de grados de libertad a través del factor , y aquí apenas se movió, subiendo solo de 0.2797 a 0.2977 frente al salto mucho mayor de , así que no premia las columnas de ruido como lo hace . El ajustado no está forzado a subir, y sobre muchas columnas basura se desliza hacia abajo, como muestra la Figure 13. La predicción fuera de muestra sería el veredicto más agudo: sobre países nuevos las columnas de ruido no cargan señal, así que el modelo más grande predeciría igual de bien o peor que el modelo de cuatro predictores, exponiendo la ganancia de como sobreajuste.
Una respuesta débil trata el más alto como una mejora genuina, o afirma que el ajustado está garantizado a bajar cuando se agrega ruido; el punto correcto es que no debe bajar por construcción, mientras que el ajustado simplemente deja de premiar el tamaño automáticamente.
Chapter summary (in English)
This chapter covers what comes after fitting a multiple regression. We return to Dwaine Studios from Chapter 7, where we solved the normal equations to get , and learn to interpret them honestly. A multiple regression coefficient is a partial slope: the change in the mean response per unit of the predictor, holding the other predictors fixed. That phrase describes the fitted surface well, but it weakens when predictors are correlated, because “holding fixed” can describe a region with no data.
A coefficient changes with the company it keeps: the slope of sales on dispoinc falls from
31.17 to 9.37 when targtpop is added, because the second number controls for population. We
define extra sums of squares, ,
which measure how much variation a predictor explains once the others are included, computed on the
body-fat data: .
The general linear test compares a full model against a reduced one through
, derived with the
Pythagorean theorem for nested models; for a single coefficient it reduces to . On the
savings data we show that pop75 and dpi can be dropped (, ).
Added-variable plots show the partial relationship: their slope is exactly the coefficient. We also
distinguish , which never falls when predictors are added, from adjusted , which
penalizes model size, define standardized coefficients to compare effects, and warn about two
dangers: hidden extrapolation in several dimensions and lurking variables that no model ever
measured. Chapter 9 revisits this same data with influence diagnostics.
