7. El modelo lineal general¶
Volvemos a las ciudades de Dwaine Studios del 6. Álgebra de matrices para la regresión. La empresa opera una cadena de estudios de retratos en ciudades medianas, del tipo de lugar que las familias visitan para las fotos de graduación y de fiestas, y quiere una regla para adivinar cuánto venderá un estudio nuevo antes de firmar un contrato de alquiler. Dos datos de una ciudad son fáciles de consultar por adelantado: la cantidad de gente joven (población de 16 años o menos, en miles) y el ingreso disponible per cápita (en miles de dólares). La pregunta es si esos dos números juntos predicen las ventas anuales del estudio lo bastante bien como para guiar la expansión.
En el Capítulo 6 ya armaste este ajuste a mano: construiste la matriz de diseño, formaste y , invertiste la matriz pequeña y resolviste para los coeficientes . Lo que esa aritmética no podía decirte es por qué la receta es la correcta, ni cuánto confiar en los números que devuelve. Este capítulo demuestra por qué, y convierte el ajuste en inferencia. La Figure 1 muestra el panorama crudo: las ventas suben con cada predictor por separado, pero ninguna gráfica por sí sola te dice qué hacen los dos predictores en conjunto, y ese “en conjunto” es el punto central de la regresión múltiple.

Figure 1:Las ventas de Dwaine Studios suben tanto con el conteo de población joven como con el ingreso disponible cuando cada uno se ve por separado. La regresión múltiple hace una pregunta más difícil: ¿cuánto aporta cada predictor una vez que el otro ya está en el modelo?
La regresión lineal simple, de los Capítulos 2 y 3, maneja un solo predictor. Las preguntas reales casi siempre traen varios. Podríamos intentar reconstruir toda la teoría predictor por predictor, pero ese camino se vuelve feo rápido: dos predictores, luego tres, cada uno con sus propias ecuaciones normales y fórmulas de varianza. En vez de eso hacemos lo que el 6. Álgebra de matrices para la regresión preparó. Escribimos el modelo una sola vez, en forma matricial, de modo que un predictor o diez se vean idénticos en la página. Todo resultado del Capítulo 2, las estimaciones de mínimos cuadrados, su insesgadez, sus varianzas, la optimalidad de Gauss-Markov, el divisor , reaparece aquí en una única forma limpia que funciona para cualquier número de predictores a la vez. Este capítulo es donde la regresión deja de ser una colección de casos especiales y se vuelve un solo método general.
Este es el capítulo más abstracto del curso, y vale la pena decir una palabra sobre cómo leerlo. La geometría del 7.2 La geometría de los mínimos cuadrados es la idea que conviene retener: una vez que imaginas el ajuste como bajar una perpendicular desde los datos hasta el espacio de ajustes posibles, toda demostración que sigue se reduce a uno de dos hechos sobre la matriz sombrero. Sostén esa imagen y el álgebra se vuelve contabilidad.
7.1 El modelo y los mínimos cuadrados en forma matricial¶
Intuición¶
En el Capítulo 2 un solo predictor daba una pendiente y un intercepto. Agrega un segundo predictor y tienes dos pendientes más un intercepto; la respuesta media es ahora un plano inclinado en vez de una recta, como muestra la Figure 2 para Dwaine. Con más predictores es una hoja plana en un espacio que no puedes imaginar. Escribir símbolos separados para cada coeficiente y sumas separadas para cada ecuación normal enterraría la idea bajo la contabilidad. La solución es apilar las observaciones en vectores y matrices y dejar que una línea de álgebra matricial lleve toda la contabilidad por nosotros.

Figure 2:Con un predictor el ajuste es una recta; con dos es un plano inclinado. Las ventas de cada ciudad son un punto oscuro, el plano es la conjetura del modelo, y cada tallo punteado es un residuo. La regresión múltiple encuentra el plano cuyos tallos son los más pequeños en longitud cuadrada total.
La parte sistemática de cada observación es una suma ponderada de los valores de los predictores de esa ciudad, con los mismos pesos () reutilizados para cada ciudad. Apilar las ciudades verticalmente convierte “los mismos pesos aplicados a cada fila” en un único producto matriz por vector. La Figure 3 muestra los cuatro objetos y sus formas.

Figure 3:El modelo lineal general como arreglos apilados. La matriz de diseño X lleva una columna inicial de unos para que el intercepto beta-0 se maneje exactamente como cualquier otro coeficiente.
Fórmula¶
El modelo lineal general (general linear model) (Definición 7.1) reúne las observaciones en una sola ecuación matricial.
En palabras: la respuesta de cada observación es igual a una suma ponderada de los valores de los predictores de esa observación más un error aleatorio, y los mismos pesos se reutilizan para cada fila. Los cuatro objetos son:
es el vector de respuestas, una entrada por observación.
es la matriz de diseño (design matrix) (Definición 7.2). Su primera columna son todos unos (para el intercepto); cada columna restante contiene los valores de un predictor. La fila son los datos de la ciudad .
es el vector de parámetros desconocidos .
es el vector de errores aleatorios.
es el número de parámetros, contando el intercepto; con predictores, . Aquí y .
Los supuestos sobre los errores del Capítulo 2 se vuelven dos enunciados compactos sobre todo el vector a la vez:
En palabras: cada error promedia a cero, y la matriz de covarianza es por la identidad. Ese único símbolo empaqueta los dos supuestos a la vez: cada error tiene la misma varianza (a lo largo de la diagonal), y errores distintos están incorrelacionados (fuera de la diagonal). Como y son fijos, y también. Suponemos en todo momento que tiene rango de columna completo : ningún predictor es una copia de otro, ni una combinación lineal exacta de los demás. Eso es exactamente lo que hace invertible a (6.4 La inversa y las ecuaciones normales).
Para ajustar el modelo reutilizamos la idea de mínimos cuadrados de 2.2 Mínimos cuadrados desde los primeros principios: elegir el vector de coeficientes que hace que los valores ajustados queden lo más cerca posible de los datos en error cuadrático total. Escribiendo un vector candidato como , la suma de errores cuadrados es
donde es la fila de . En palabras: es la longitud cuadrada del vector de residuos, la misma cantidad que el Capítulo 2 minimizó, ahora escrita como un único producto punto. El minimizador es el estimador de mínimos cuadrados (least-squares estimator) (Teorema 7.3)
En palabras: reúne los productos cruzados de los predictores () y de los predictores con la respuesta (), y multiplica por la inversa del primero. Derivamos esto a continuación, y luego lo verificamos en Dwaine.
Derivación por cálculo¶
Demostración. Expande usando las reglas de transposición de 6.2 Transpuesta y multiplicación de matrices. Como es un escalar, es igual a su propia transpuesta , así que los dos términos del medio se combinan:
Minimizamos tomando el gradiente respecto a e igualándolo a cero. El gradiente es solo el vector de derivadas parciales, una por cada entrada de , e igualarlo a cero halla el fondo del tazón. Dos reglas de derivada vectorial hacen el trabajo: para un vector constante , ; y para una matriz simétrica , . Estas son las gemelas vectoriales de las reglas escalares y que ya conoces. La matriz es simétrica, así que
Igualar el gradiente a cero y dividir entre 2 da las ecuaciones normales (normal equations) (Definición 7.4)
Como tiene rango de columna completo, es invertible (6.4 La inversa y las ecuaciones normales), así que podemos multiplicar por la izquierda por :
Este punto estacionario es el mínimo global, no un punto de silla ni un máximo, porque la matriz de segundas derivadas de es , que es definida positiva; una cuadrática con hessiana definida positiva es estrictamente convexa y tiene un único punto más bajo.
Estas son las mismas ecuaciones normales del Capítulo 2, ahora enunciadas una sola vez para cualquier número de predictores. En 2.2 Mínimos cuadrados desde los primeros principios las dos ecuaciones normales escalares eran y ; la única ecuación matricial contiene ambas y una más por cada predictor adicional, como veremos en 7.7 La regresión simple como caso especial.
R¶
El Capítulo 6 construyó y para Dwaine a mano. Aquí dejamos que la computadora las forme y resuelva.
dwaine <- read.csv("data/dwaine.csv")
head(dwaine, 3)
X <- cbind(1, dwaine$targtpop, dwaine$dispoinc)
Y <- dwaine$sales
dim(X) targtpop dispoinc sales
1 68.5 16.7 174.4
2 45.2 16.8 164.4
3 91.3 18.2 244.2
[1] 21 37.2 La geometría de los mínimos cuadrados¶
Intuición¶
La derivación por cálculo halla la respuesta pero oculta por qué es la respuesta. Hay una imagen que vuelve obvios los mínimos cuadrados, y vale la pena cargarla el resto del curso. Piensa en la respuesta como una sola flecha (un punto) en un espacio de dimensiones, un eje por observación. A medida que el vector de coeficientes recorre todos los valores posibles, el vector ajustado traza un subespacio plano: toda combinación lineal de las columnas de . Este subespacio es el espacio de columnas (column space) de (Definición 7.5), y contiene toda predicción que el modelo puede llegar a hacer.
El punto de datos casi nunca queda exactamente en ese subespacio, porque los datos reales tienen ruido. Así que el problema de ajuste es: ¿cuál punto del espacio de columnas está más cerca de ? El punto más cercano de una superficie plana a un punto exterior es el pie de la perpendicular bajada desde el punto hasta la superficie. Ese pie es , y el segmento perpendicular es el vector de residuos . La Figure 4 dibuja exactamente esto para el caso más pequeño que cabe en una página, tres observaciones y dos columnas.

Figure 4:Los mínimos cuadrados como proyección. El vector ajustado Y-gorro es el punto del espacio de columnas más cercano a Y, alcanzado bajando una perpendicular; el residuo e es esa perpendicular, que toca el espacio de columnas en ángulo recto.
Fórmula¶
La condición geométrica es que el residuo sea ortogonal a cada columna de :
En palabras: cada columna de , multiplicada punto por el vector de residuos, da cero, así que el residuo apunta en una dirección que el modelo no puede representar. Al expandir se recuperan las ecuaciones normales , de modo que la geometría y el cálculo conducen a la solución idéntica.
Derivación por proyección¶
Derivación (mínimos cuadrados como proyección ortogonal). Sea la solución de las ecuaciones normales, de modo que con . Toma cualquier otro vector de coeficientes candidato , con vector ajustado . Divide la brecha de a ese candidato pasando por :
La segunda pieza vive en el espacio de columnas. Su longitud cuadrada se suma sin término cruzado, porque el término cruzado se anula por ortogonalidad:
Por lo tanto, por el teorema de Pitágoras en dimensiones,
con igualdad solo cuando , es decir . Como tiene rango de columna completo, esto obliga a . Así que la solución de las ecuaciones normales da la única suma de errores cuadrados más pequeña, y es el punto del espacio de columnas más cercano a .
Esta es la misma identidad algebraica que la demostración del Capítulo 2 en 2.2 Mínimos cuadrados desde los primeros principios, ahora leída como geometría: el término cruzado se anula allí porque y , que es precisamente escrito por extenso. La vista de proyección (en 6.5 Matrices idempotentes y de proyección) es la que hay que recordar, porque los diagnósticos del Capítulo 9 tratan todos sobre qué observaciones quedan en rincones incómodos del espacio de columnas.
R y Python¶

Figure 5:Los residuos de Dwaine contra los valores ajustados forman una banda plana y sin patrón alrededor de cero, la imagen que respalda los supuestos de varianza constante y linealidad. El Capítulo 9 convierte este hábito en un conjunto completo de herramientas de diagnóstico.
La ortogonalidad es fácil de enunciar y fácil de dudar, así que la simulación de abajo te entrega los datos y te invita a romperla.
Arrastra cualquiera de las siete ciudades a donde quieras. La pendiente y SCE responden, pero las dos entradas de X’e, y la brecha de Pitágoras STC menos SCR menos SCE, se quedan en cero.
7.3 La matriz sombrero¶
Intuición¶
La Sección 7.2 imaginó el ajuste como una proyección de sobre el espacio de columnas. Esa proyección la realiza una sola matriz, y darle un nombre rinde frutos el resto del capítulo. El vector ajustado es una función lineal fija de los datos: sustituye la fórmula de en y obtienes . La matriz que queda frente a convierte las respuestas crudas en valores ajustados, así que se gana el nombre de matriz sombrero (hat matrix) (Definición 7.6): le pone el sombrero (gorro) a . Es la matriz más útil en el resto del curso. Sus entradas diagonales son los valores de apalancamiento que señalan valores de predictores inusuales (Capítulo 9), y su álgebra hace que los resultados de varianza de abajo salgan en una línea.
Fórmula¶
La matriz sombrero y los vectores ajustado y de residuos son
es y depende solo de los predictores, no de .
: cada valor ajustado es un promedio ponderado fijo de todas las respuestas, con pesos leídos de una fila de .
: el residuo es lo que queda después de proyectar, así que es en sí misma una proyección, sobre el espacio perpendicular a las columnas de .
La Figure 7 muestra la matriz sombrero de Toluca como una cuadrícula de pesos; las entradas diagonales, resaltadas, son los valores de apalancamiento .

Figure 7:La matriz sombrero H de Toluca convierte respuestas en valores ajustados. Leer a lo largo de la fila i da los pesos que construyen el i-ésimo valor ajustado; las entradas diagonales doradas resaltadas son los valores de apalancamiento que el Capítulo 9 usa para encontrar observaciones inusuales.
Derivación (propiedades de H)¶
Demostración. Escribe , que es simétrica porque lo es (la inversa de una matriz simétrica es simétrica, por 6.4 La inversa y las ecuaciones normales).
Simétrica. Usando de 6.2 Transpuesta y multiplicación de matrices,
Idempotente. Proyectar dos veces equivale a proyectar una vez. La del medio cancela su inversa:
La Figure 8 muestra por qué: una vez que ha dejado un vector en el espacio de columnas, proyectar de nuevo no puede moverlo.
Traza . La traza de una matriz es la suma de sus entradas diagonales. Usa la propiedad cíclica de la traza, (una identidad estándar: ambos lados igualan ), para deslizar alrededor:
En consecuencia también es simétrica e idempotente, con . Esa traza son los grados de libertad del error, y es la razón por la que el divisor en la estimación de la varianza es , demostrado en 7.5 Estimación de la varianza del error.

Figure 8:Por qué H es idempotente. Proyectar el vector y sobre el espacio de columnas lo deja en Hy dentro de ese espacio; proyectar una segunda vez lo deja exactamente donde está, así que HH es igual a H.
R y Python¶
La afirmación de que depende solo de los predictores suena a tecnicismo hasta que intentas moverla con la respuesta, que es justo lo que te pide la siguiente simulación.
Arrastra una ciudad directo hacia arriba y los apalancamientos no se mueven en absoluto; arrástrala de lado y saltan de inmediato, mientras la traza de H sigue clavada en p.
7.4 La distribución muestral de b¶
Intuición¶
El vector salió de una sola muestra de 21 ciudades. Otras 21 ciudades darían un un poco distinto, así que es aleatorio, con una media y una covarianza a través de las muestras que pudimos haber extraído. Dos preguntas se repiten del Capítulo 2, ahora para todo un vector: ¿es correcto en promedio, y cuánto varía? Las respuestas son limpias porque es una matriz fija por , y 6.7 Vectores aleatorios, esperanza y matrices de covarianzas nos dice exactamente cómo pasan las medias y las covarianzas a través de un mapa lineal.
Fórmula¶
El vector de mínimos cuadrados es insesgado con una matriz de covarianza construida a partir de :
En palabras: en promedio da en el vector de coeficientes verdadero, y su matriz de covarianza es por la matriz inversa de productos cruzados. Las entradas diagonales son las varianzas de los coeficientes individuales; las entradas fuera de la diagonal son las covarianzas entre ellos, por lo cual dos coeficientes pueden estar correlacionados (la nube inclinada de la Figure 10). Reemplazar por su estimación da la matriz de covarianza estimada , cuyas raíces cuadradas diagonales son los errores estándar que imprime el software.
Derivación (media y covarianza de b)¶
Demostración. Escribe con la matriz fija . Para una matriz fija por un vector aleatorio, 6.7 Vectores aleatorios, esperanza y matrices de covarianzas da y .
Media. Como ,
Covarianza. Como ,
donde la del medio cancela una inversa y la simetría de maneja la transpuesta.
Si agregamos el supuesto de normalidad , entonces es normal multivariante, y un mapa lineal fijo de una normal multivariante es de nuevo normal multivariante (6.8 La normal multivariante, en breve). Así que
En palabras: bajo errores normales cada coeficiente se distribuye normalmente alrededor de su valor verdadero, y esto es lo que impulsa las pruebas y los intervalos de confianza del Capítulo 8. La Figure 10 confirma la covarianza por simulación: reajustar muchos conjuntos de datos dispersa las dos pendientes de Dwaine en una elipse inclinada que coincide con .

Figure 10:Simular 4000 reajustes dispersa las dos estimaciones de pendiente de Dwaine en una elipse inclinada. La inclinación descendente es una covarianza negativa: las dos estimaciones de pendiente se compensan, porque los predictores están correlacionados. La elipse teórica azul de sigma-cuadrada por la matriz inversa de productos cruzados coincide con la nube simulada.
R y Python¶
La fórmula de la covarianza es una predicción sobre datos que no has recogido, así que la simulación de abajo los recoge por ti mil veces y la comprueba.
Cada reajuste usa las mismas 21 ciudades con errores nuevos. Presiona Tomar 1000 y la dispersión del montón de b1 coincide con el error estándar que la fórmula matricial predijo de antemano.
7.5 Estimación de la varianza del error¶
Intuición¶
Los coeficientes describen el plano; el modelo todavía tiene una incógnita más, la varianza del error , que fija cuánto se dispersan los datos fuera del plano. Como en el Capítulo 2 la estimamos a partir de los residuos, pero ahora debemos hallar el divisor correcto para un modelo con parámetros en vez de 2. La respuesta es , y la razón es la traza que calculamos en 7.3 La matriz sombrero: ajustar coeficientes gasta direcciones de los datos, y deja direcciones para que viva el residuo. La Figure 12 mantiene la contabilidad a la vista: las direcciones de los datos se dividen en una parte de ajuste y una parte de residuo, y promediamos el residuo cuadrado sobre sus propias direcciones, no sobre las .

Figure 12:Las n direcciones de los datos se dividen en p direcciones gastadas ajustando el plano y n menos p dejadas para el residuo. Dividir SSE entre n menos p, no entre n, promedia sobre exactamente las direcciones que el residuo es libre de llenar, que es lo que hace insesgado al MSE.
Fórmula¶
La suma de cuadrados del error (error sum of squares) y el estimador de son
es la longitud cuadrada del vector de residuos, la variación que el modelo no explicó.
divide entre sus grados de libertad , y estima .
es la desviación estándar del error estimada, en las unidades de .
Derivación (por qué el divisor es n - p)¶
Necesitamos un hecho sobre el valor esperado de una forma cuadrática. Es demostrable a nuestro nivel, así que lo demostramos y luego lo aplicamos.
Lema (esperanza de una forma cuadrática). Para cualquier vector aleatorio con media y covarianza , y cualquier matriz simétrica fija ,
Demostración. El escalar es igual a su propia traza, y la traza es cíclica, así que . Tomando esperanzas y usando (6.7 Vectores aleatorios, esperanza y matrices de covarianzas),
ya que es un escalar.
Demostración del Teorema 7.9. Aplica el lema con , , y . Las dos piezas son:
Pieza de la traza. , usando la traza de 7.3 La matriz sombrero.
Pieza de la media. El término de la media se anula, porque (la matriz sombrero deja sin cambio las columnas de , ya que estas ya están en el espacio de columnas). Por lo tanto
Combinando, , así que
El divisor , y ningún otro, hace insesgado al .
Este es el resultado del Capítulo 2 generalizado: allí daba el divisor ; aquí cualquier modelo divide entre menos el número de parámetros. La Figure 13 muestra qué sale mal con el divisor ingenuo : dividir entre en vez de sesga la estimación hacia abajo, y la brecha es mayor cuando es una fracción grande de .

Figure 13:Dividir SSE entre n - p (azul) centra la estimación de la varianza en la verdad; dividir entre n (naranja) la jala sistemáticamente hacia abajo. El sesgo es el precio de estimar p coeficientes antes de medir los residuos.
R y Python¶
También podemos leer qué tan bien ajusta el plano en general. La variación total se divide en la parte que el modelo explica y la parte que no, y reporta la fracción explicada, exactamente como en 3.6 El enfoque del análisis de varianza pero ahora para muchos predictores.
SSTO <- sum((Y - mean(Y))^2)
SSR <- SSTO - SSE
c(SSTO = round(SSTO, 2), SSR = round(SSR, 2), SSE = round(SSE, 2),
R2 = round(1 - SSE / SSTO, 4)) SSTO SSR SSE R2
26196.2100 24015.2800 2180.9300 0.9167SSTO = np.sum((Y - Y.mean()) ** 2)
SSR = SSTO - SSE
print(round(SSTO, 2), round(SSR, 2), round(SSE, 2), round(1 - SSE / SSTO, 4))26196.21 24015.28 2180.93 0.9167Los dos predictores juntos explican alrededor del de la variación en las ventas de Dwaine. El Capítulo 8 desglosa este número, advierte cómo solo puede subir cuando se agregan predictores, y construye la prueba lineal general sobre el que acabamos de calcular (8.3 Sumas de cuadrados adicionales).
7.6 El teorema de Gauss-Markov¶
Intuición¶
Elegimos los mínimos cuadrados porque el error cuadrático es una penalización natural, y el Capítulo 2 premió esa elección: en la regresión simple, ningún otro estimador lineal insesgado supera a . El mismo premio se cumple para el vector completo, y la demostración matricial apenas es más larga que la escalar. La afirmación es que cualquier competidor construido como una combinación lineal fija de las respuestas, y obligado a ser correcto en promedio, debe tener una matriz de covarianza al menos tan grande como la de . No se necesita normalidad; los supuestos de errores de media cero, varianza constante e incorrelacionados bastan. La Figure 14 muestra la recompensa en Toluca: los mínimos cuadrados y un estimador insesgado competidor están ambos centrados en la verdad, pero los mínimos cuadrados se dispersan mucho menos.

Figure 14:Tanto la pendiente de mínimos cuadrados (azul, angosta) como un competidor de dos puntos (naranja, ancho) son insesgados, centrados en la pendiente verdadera. Los mínimos cuadrados tienen la dispersión menor, exactamente lo que garantiza el teorema de Gauss-Markov.
Fórmula¶
Derivación (b es MELI)¶
Demostración. Sea cualquier estimador lineal con una matriz fija de . Su media es . Para que sea insesgado para para todo posible, necesitamos
Escribe , definiendo como la diferencia respecto a la matriz de mínimos cuadrados. La condición de insesgadez se vuelve
Ahora calcula la covarianza. Como , . Expande con . Los dos términos cruzados se anulan porque (y su transpuesta ):
Lo que sobrevive es
Por lo tanto
Para cualquier fijo, la varianza del escalar es
El término agregado es una longitud cuadrada, así que todo competidor lineal insesgado tiene varianza al menos la de , con igualdad solo cuando ; hacer que recorra los vectores coordenados obliga a , es decir, el competidor es mismo. Los mínimos cuadrados son MELI.
Poniendo y se recupera el enunciado del Capítulo 2 de que es MELI (2.5 Comportamiento muestral y el teorema de Gauss-Markov); la demostración matricial hizo cada coeficiente, y cada combinación lineal de coeficientes, a la vez.
7.7 La regresión simple como caso especial¶
Intuición¶
Todo lo de los Capítulos 2 y 3 debería salir de las fórmulas matriciales cuando hay un solo predictor, y así es. Verlo ocurrir una vez convierte las fórmulas generales de abstracciones en herramientas confiables: la misma máquina que ajustó el plano de Dwaine ajusta la recta de Toluca, y devuelve los números exactos que ya conoces. La Figure 15 es toda la idea en una imagen: una fórmula, dos trabajos.

Figure 15:Una fórmula matricial hace dos trabajos. Pon p igual a 2 y colapsa en las fórmulas escalares exactas del Capítulo 2 para la recta de Toluca; pon p igual a 3 y ajusta el plano de Dwaine. El modelo general no reemplaza a la regresión simple, la contiene.
Derivación (las fórmulas matriciales se reducen al Capítulo 2)¶
Derivación (el caso ). Con un predictor, la matriz de diseño es , así que
donde y son las sumas de cuadrados y productos cruzados del Capítulo 2, y son las medias muestrales. La inversa de una matriz divide entre su determinante (6.4 La inversa y las ecuaciones normales),
Multiplicar por y simplificar (cada entrada colapsa usando y las definiciones de ) da
que son exactamente los estimadores del Capítulo 2 y . La matriz de covarianza se reduce de la misma manera: la entrada inferior derecha de es , que coincide con , y la entrada superior izquierda es , que coincide con de 2.5 Comportamiento muestral y el teorema de Gauss-Markov.
El Ejemplo 7.5 ya confirmó esto numéricamente: la tubería matricial devolvió los , de Toluca, y los errores estándar 26.1774 y 0.3470, las mismas cifras que el Capítulo 2 produjo a partir de las fórmulas escalares. El modelo lineal general no reemplaza a la regresión simple; la contiene.
7.8 Resumen del capítulo¶
Este capítulo convirtió la aritmética matricial del Capítulo 6 en una regresión múltiple completa. Una ecuación, , lleva cualquier número de predictores. Los mínimos cuadrados proyectan sobre el espacio de columnas de , dando por cálculo y por geometría por igual. La matriz sombrero empaqueta esa proyección, y sus dos propiedades, ser una proyección (simétrica e idempotente) con traza , impulsan la distribución muestral de , el divisor en el , y la optimalidad de Gauss-Markov. Cada fórmula del Capítulo 2 regresa como el caso especial .
Resultados clave de un vistazo.
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Estimador de mínimos cuadrados (Teorema 7.3) | minimiza | de rango de columna completo |
| Ecuaciones normales (Definición 7.4) | , equivalentemente | cualquier ajuste de mínimos cuadrados |
| Propiedades de la matriz sombrero (Teorema 7.7) | simétrica, idempotente, , | de rango de columna completo |
| Media y covarianza de (Teorema 7.8) | , | , |
| Distribución muestral (Teorema 7.8) | errores también normales | |
| Insesgadez del MSE (Teorema 7.9) | , así que | |
| Gauss-Markov (Teorema 7.10) | es el mejor estimador lineal insesgado de | , ; sin normalidad |
| Coeficiente de determinación | (Dwaine 0.9167) | descriptivo, cualquier ajuste |
Términos clave. modelo lineal general, matriz de diseño, ecuaciones normales, estimador de mínimos cuadrados, espacio de columnas, matriz sombrero, matriz idempotente, rango de columna completo, grados de libertad del error, mejor estimador lineal insesgado (MELI).
Ahora deberías poder.
Escribir cualquier regresión lineal como e identificar la matriz de diseño, el vector de coeficientes y el vector de errores.
Derivar de dos maneras: por cálculo y por proyección ortogonal.
Interpretar los mínimos cuadrados geométricamente como la proyección de sobre el espacio de columnas de , con el residuo perpendicular a él.
Demostrar que la matriz sombrero es simétrica e idempotente con traza , y usarla para escribir valores ajustados y residuos.
Derivar la media y la covarianza de y enunciar su distribución muestral bajo errores normales.
Demostrar que es insesgado para usando la traza de .
Enunciar y demostrar el teorema de Gauss-Markov en forma matricial: es el mejor estimador lineal insesgado.
Recuperar cada fórmula de la regresión simple del Capítulo 2 como el caso especial .
Dónde encaja esto. Este capítulo es el motor general para la etapa AJUSTAR del flujo de trabajo del curso (El flujo de trabajo del modelado): estima los coeficientes y la varianza del error para un modelo de cualquier tamaño, reemplazando el álgebra predictor por predictor de los Capítulos 2 y 3 con una fórmula que una computadora puede correr para diez predictores tan fácilmente como para uno. También arma la etapa VERIFICAR, porque la matriz sombrero es el objeto que el Capítulo 9 (9. Diagnósticos del modelo) convierte en los valores de apalancamiento y las medidas de influencia, y la etapa USAR, porque es lo que el Capítulo 8 convierte en pruebas e intervalos. El Capítulo 8 toma el ajuste de Dwaine construido aquí, interpreta cada coeficiente con cuidado, y desarrolla la maquinaria de sumas de cuadrados extra y de la prueba lineal general (8.3 Sumas de cuadrados adicionales) que decide qué predictores necesita un modelo.
7.9 Preguntas frecuentes¶
P1. ¿Por qué la matriz de diseño necesita una columna de unos? La columna de unos permite que el intercepto se maneje como cualquier otro coeficiente: su “valor de predictor” es 1 para cada observación, así que es la misma base para cada fila. Sin ella el plano ajustado sería forzado a pasar por el origen. La primera ecuación normal, que viene de esa columna, es exactamente .
P2. ¿Qué significa rango de columna completo, y qué se rompe sin él? Rango de columna completo significa que ninguna columna de predictor es una combinación lineal de las demás (incluida la columna de unos). Si una lo es, digamos un predictor registrado tanto en metros como en pies, entonces es singular y no existe, así que no hay un único: infinitos vectores de coeficientes ajustan igual de bien. El software entonces descarta una columna o devuelve un error. Las casi-violaciones (predictores muy correlacionados) son multicolinealidad, el tema del Capítulo 12.
P3. ¿Vale la pena calcular la matriz sombrero para datos reales? Como matriz completa , por lo general no; el software obtiene los valores ajustados y los residuos de forma más barata. Pero sus entradas diagonales , los valores de apalancamiento, se calculan y usan constantemente en los diagnósticos, y su álgebra (simétrica, idempotente, traza ) es lo que hace funcionar la teoría. Piensa en como una herramienta de demostración y una fuente de los valores de apalancamiento, no como algo que imprimes.
P4. ¿Por qué el divisor es y no o ? Cada parámetro que estimas usa un grado de libertad antes de medir los residuos. Una varianza muestral estima una cantidad (la media) y divide entre ; una regresión con parámetros divide entre . La derivación por traza de 7.5 Estimación de la varianza del error muestra exactamente, así que es el único divisor que hace insesgado al . Dividir entre (la elección de máxima verosimilitud) es sesgado hacia abajo.
P5. ¿Necesito errores normales para algo de esto? No, para la mayoría no. El estimador , su insesgadez, su covarianza , la insesgadez del , y la optimalidad de Gauss-Markov se cumplen todas solo con errores de media cero, varianza constante e incorrelacionados. La normalidad es un supuesto extra, usado para obtener la distribución muestral normal multivariante exacta de y las pruebas y del Capítulo 8.
P6. Los coeficientes de Dwaine de la fórmula matricial y de lm coincidieron exactamente. ¿Eso
está siempre garantizado? Sí, salvo diferencias diminutas de punto flotante. Ambos calculan el
mismo ; lm y statsmodels usan una rutina más
estable numéricamente (una descomposición QR o SVD) en vez de formar la inversa explícitamente, lo
cual importa solo para diseños mal condicionados. Para datos bien portados como estos, cada dígito
impreso coincide.
P7. ¿Por qué las dos estimaciones de pendiente de Dwaine están correlacionadas negativamente en la Figure 10? Porque los dos predictores están ellos mismos correlacionados positivamente entre ciudades. Cuando una muestra hace que la pendiente de población salga alta, el ajuste compensa haciendo que la pendiente de ingreso salga baja para evitar contar dos veces la señal compartida. Ese intercambio es exactamente la entrada fuera de la diagonal de , y es por lo que no puedes leer la incertidumbre de un coeficiente sin toda la matriz de covarianza.
7.10 Problemas de práctica¶
(A) Escribe el modelo de Dwaine en la forma , dando las dimensiones de cada uno de los cuatro objetos y describiendo la primera columna de .
(A) Explica en una oración cada uno qué representan y , y por qué las ecuaciones normales los usan.
(A) Enuncia los dos supuestos de error y en palabras simples, diciendo qué codifican la diagonal y la fuera de la diagonal de cada una.
(A) En la imagen de proyección, ¿qué es el espacio de columnas de , dónde queda , y en qué dirección apunta el residuo? Responde sin fórmulas.
(A) Da las tres propiedades de la matriz sombrero demostradas en este capítulo y di qué significa cada una geométricamente.
(A) ¿Por qué el divisor en es igual a ? Responde nombrando qué cuenta el número y qué cuenta .
(A) Un colega dice “con normalidad el estimador de mínimos cuadrados es MELI; sin ella, no lo es”. Corrige el enunciado, nombrando exactamente qué supuestos usa el teorema de Gauss-Markov.
(A) Explica por qué (una matriz ) no puede reemplazar a en las ecuaciones normales.
(B) Partiendo de , expándela, toma el gradiente, y deriva las ecuaciones normales y (Teorema 7.3). Justifica por qué el punto estacionario es un mínimo.
(B) Demuestra la identidad de proyección para cualquier , mostrando que el término cruzado se anula, y concluye que minimiza de forma única el SSE.
(B) Demuestra que es simétrica e idempotente (Teorema 7.7). Luego demuestra que también es simétrica e idempotente.
(B) Demuestra usando la propiedad cíclica de la traza, y deduce .
(B) Muestra y úsalo para demostrar . Explica en palabras por qué la matriz sombrero deja sin cambio las columnas de .
(B) Deriva y (Teorema 7.8), nombrando los hechos de vectores aleatorios que usas en cada paso. Luego, agregando el supuesto , enuncia la distribución muestral completa de y explica por qué la media y la covarianza no necesitaron normalidad pero este enunciado distribucional sí.
(B) Demuestra el lema de la forma cuadrática , y luego úsalo para mostrar (Teorema 7.9).
(B) Enuncia y demuestra el teorema de Gauss-Markov en forma matricial (Teorema 7.10). ¿Dónde en la demostración entra el supuesto , y dónde entra el rango de columna completo?
(B) Para el diseño de regresión simple , calcula , su determinante, y , y deriva y a partir de la fórmula matricial.
(B) Usando la reducción del problema 17, deriva y a partir de .
(B) Muestra que bajo el modelo, usando , , y . ¿Por qué importa esto para los diagnósticos?
(B) Demuestra que agregar un predictor (una columna nueva a ) no puede aumentar el , usando el argumento de proyección de que agrandar el espacio de columnas solo puede acercar a .
(C) Lee
dwaine.csv, construye y , y calcula a partir de en R o Python. Confirma que tu respuesta coincide conlm/smf.ols.(C) Para el ajuste de Dwaine, calcula el vector de residuos y verifica numéricamente que (las tres entradas) y que .
(C) Construye la matriz sombrero de Dwaine y verifica que es simétrica e idempotente y tiene traza 3. Luego reporta las cinco entradas diagonales más grandes y di qué indica un grande sobre los predictores de esa ciudad.
(C) Calcula , y para Dwaine de dos maneras: a partir del vector de residuos, y de
summary/.summary2(). Luego calcula y reporta el porcentaje en que subestima al .(C) Calcula la matriz de covarianza estimada para Dwaine, reporta los tres errores estándar, y confirma que coinciden con el resumen incorporado. Reporta la correlación entre las dos estimaciones de pendiente a partir de la entrada fuera de la diagonal.
(C) Reajusta Toluca a través de las fórmulas matriciales y confirma , , , y los dos errores estándar, coincidiendo con el Capítulo 2 hasta el último dígito.
(C) Escribe una simulación (semilla
4210) que extraiga 2000 conjuntos de datos del modelo ajustado de Dwaine, reajuste cada uno, y reporte la media de las 2000 estimaciones de cada coeficiente (verificando la insesgadez) y la desviación estándar de la pendiente de población objetivo (verificando ).(C) Haz la regresión de
salesde Dwaine sobretargtpopsola, luego sobretargtpopydispoincjuntas, y confirma numéricamente que agregardispoincbaja el . Relaciona la caída con el argumento de proyección del problema 20.
7.11 Práctica de examen¶
EP 7.1 (interpretar la salida en contexto). Un colega ajusta el modelo de Dwaine en R y lee la tabla de coeficientes.
Estimate Std. Error t value Pr(>|t|)
(Intercept) -68.8571 60.0170 -1.1473 0.2663
targtpop 1.4546 0.2118 6.8682 0.0000
dispoinc 9.3655 4.0640 2.3045 0.0333Interpreta el coeficiente de targtpop y su valor en el contexto de las ventas del estudio,
siendo explícito sobre qué se mantiene fijo. Luego evalúa la conclusión del colega: “el intercepto
tiene , así que no es significativamente distinto de cero, lo que significa que el modelo
está mal especificado y deberíamos quitar el intercepto”. Di si la conclusión es correcta y por qué.
Respuesta modelo
Manteniendo fijo el ingreso disponible, cada mil residentes jóvenes adicionales en una ciudad se asocia con unos 1.4546 mil dólares, aproximadamente $1{,}455, de ventas anuales predichas adicionales. El valor de 6.87 es la estimación dividida entre su error estándar (); está lejos de cero y su valor p es esencialmente cero, así que la pendiente de población objetivo es claramente distinguible de cero en cualquier nivel usual, y la población objetivo carga señal predictiva real una vez que el ingreso ya está en el modelo.
La conclusión del colega es incorrecta en ambos puntos. La insignificancia del intercepto solo significa que los datos no pueden fijar la altura del plano ajustado en el punto donde ambos predictores valen cero, que está muy fuera del rango de cualquier ciudad real (poblaciones cerca de 62 mil e ingresos cerca de 17 mil dólares en estos datos), así que un intercepto holgado ahí es esperado e inofensivo. Un intercepto insignificante no es evidencia de mala especificación, y quitar el intercepto es una decisión de modelado fuerte y por lo general equivocada: fuerza el plano ajustado a pasar por el origen, distorsiona cada pendiente, y rompe la identidad que garantiza la columna de unos. Conserva el intercepto.
Una respuesta débil reporta la pendiente como un número crudo sin la comparación “manteniendo fijo el ingreso” ni las unidades, y trata el gran valor p del intercepto como un defecto por arreglar en vez de un enunciado sobre una región extrapolada que ninguna ciudad ocupa.
EP 7.2 (explicar por qué, y qué cambiaría si). Explica con oraciones completas por qué el divisor en es y no . Luego responde un “qué cambiaría si”: supón que un analista siguió agregando predictores a los datos de Dwaine hasta que el modelo tuvo parámetros, uno por cada observación. Describe qué le pasa al , al divisor, y al , y explica por qué un ajuste con es una advertencia y no un éxito.
Respuesta modelo
El divisor es porque ajustar coeficientes gasta de las direcciones independientes en los datos antes de medir los residuos. Formalmente, y , así que ; dividir entre , y ningún otro número, hace del un estimador insesgado de . Dividir entre subestimaría sistemáticamente la varianza del error.
Si , el espacio de columnas de llena todo el espacio de respuestas de 21 dimensiones, así que la proyección es igual a exactamente y cada residuo es cero, dando . El divisor , así que está indefinido: no quedan grados de libertad para el error. Un cero no significa que el modelo sea perfecto; significa que el modelo tiene suficientes parámetros para interpolar los datos exactamente, así que ha aprendido el ruido junto con la señal y no puede decir nada sobre ni sobre una ciudad nueva. Un ajuste dentro de la muestra perfecto con cero grados de libertad es la firma del sobreajuste.
Una respuesta débil dice “ ajusta por los parámetros” sin conectarlo con la insesgadez o la traza, y trata como un buen resultado en vez de reconocer que cero grados de libertad del error no dejan nada con qué estimar la varianza.
EP 7.3 (un estudiante afirma X, evalúa). Un estudiante escribe: “Agregar un predictor nunca puede aumentar el , y siempre sube el . Así que la mejor estrategia es seguir agregando predictores hasta que el esté lo más cerca posible de 1”. Usando la imagen de proyección de los mínimos cuadrados, evalúa las dos afirmaciones factuales y la estrategia que respaldan.
Respuesta modelo
Las dos afirmaciones factuales son verdaderas. Agregar una columna a agranda su espacio de columnas, y proyectar sobre un subespacio más grande solo puede acercar el pie de la perpendicular a , nunca alejarlo, así que no puede subir; el ajuste viejo sigue disponible como un caso especial donde el coeficiente nuevo es cero. Como y es fijo, un no creciente significa un no decreciente.
La estrategia, sin embargo, es incorrecta. Como el sube incluso para predictores que son puro ruido, un alto comprado apilando predictores no es evidencia de un buen modelo; en el límite el ajuste interpola los datos con y sin explicar nada fuera de la muestra. Cada predictor agregado también gasta un grado de libertad, reduciendo e inflando las varianzas de los coeficientes, sobre todo cuando el predictor nuevo está correlacionado con los ya presentes. La pregunta correcta no es si el bajó sino si bajó más de lo que el ruido predeciría, que es exactamente lo que mide la prueba lineal general del Capítulo 8.
Una respuesta débil o bien disputa erróneamente los dos hechos verdaderos o acepta la estrategia, sin notar que una subida garantizada del no carga información sobre si un predictor pertenece al modelo.
EP 7.4 (interpretar salida calculada en contexto). Los valores de apalancamiento son las entradas diagonales de la matriz sombrero para el ajuste de Dwaine. Los seis más grandes, y una verificación de su suma, están abajo.
row 20 targtpop= 82.7 dispoinc= 19.1 h_ii=0.2788
row 13 targtpop= 88.4 dispoinc= 17.4 h_ii=0.2390
row 15 targtpop= 52.5 dispoinc= 17.8 h_ii=0.2095
row 3 targtpop= 91.3 dispoinc= 18.2 h_ii=0.1737
row 5 targtpop= 46.9 dispoinc= 17.3 h_ii=0.1620
row 19 targtpop= 89.6 dispoinc= 18.1 h_ii=0.1611
sum(h_ii) = 3.0000 mean(targtpop)=62.02 mean(dispoinc)=17.14Explica qué dice un grande sobre una ciudad, e interpreta por qué la fila 20 tiene el valor de apalancamiento más grande aunque su población objetivo (82.7) no es la más grande en los datos. Luego explica por qué los valores de apalancamiento suman exactamente 3, y usa el corte de regla empírica para decir si alguna ciudad de Dwaine debería llamarse un punto de alto apalancamiento.
Respuesta modelo
Un grande significa que la ciudad queda lejos del centro de la nube de predictores, así que sus valores de predictores son inusuales y su propia respuesta jala su valor ajustado con fuerza hacia sí misma. La fila 20 tiene el valor de apalancamiento más grande no por una sola coordenada sino por la combinación: su ingreso disponible 19.1 es el más alto en los datos, muy por encima de la media de 17.14, y su población objetivo 82.7 también está muy por encima de la media de 62.02, así que queda en un rincón lejano del espacio bidimensional de predictores. El valor de apalancamiento mide la distancia al centro conjunto, así que una ciudad puede tener un valor de apalancamiento más alto que otra con una población mayor sola si es más extrema en ambos predictores juntos.
Los valores de apalancamiento suman 3 porque , demostrado en 7.3 La matriz sombrero: la traza de la matriz de proyección cuenta los parámetros, así que el total de los valores de apalancamiento que el ajuste distribuye entre las ciudades está fijo en sin importar los datos. Contra el corte , el valor de apalancamiento más grande (0.2788) queda justo por debajo, así que por esta regla empírica ninguna ciudad de Dwaine se señala como punto de alto apalancamiento; el diseño está bastante balanceado, sin ninguna ciudad dominando el espacio de predictores.
Una respuesta débil lee el valor de apalancamiento a partir de la población objetivo sola, no nota que mide la distancia conjunta al centro de ambos predictores, y no puede explicar la propiedad de suma igual a como la traza de .
EP 7.5 (qué cambiaría si). Un analista reexpresa la población objetivo en cientos de personas en
vez de miles, multiplicando cada valor de targtpop por 10, y reajusta. Las dos tablas de
coeficientes están abajo.
original rescaled
Estimate Std. Error Estimate Std. Error
(Intercept) -68.8571 60.0170 -68.8571 60.0170
targtpop 1.4546 0.2118 0.1455 0.0212
dispoinc 9.3655 4.0640 9.3655 4.0640
original MSE=121.16 R2=0.9167 rescaled MSE=121.16 R2=0.9167Explica, con oraciones completas y con referencia al álgebra del modelo, por qué el coeficiente de población objetivo y su error estándar se dividen ambos entre 10 mientras que su valor , los valores ajustados, el , y el quedan todos sin cambio. ¿Qué te dice esto sobre leer el tamaño de un coeficiente como una medida de la importancia de un predictor?
Respuesta modelo
Reescalar un predictor por un factor de 10 reemplaza su columna por . Para que el plano ajustado haga las mismas predicciones, el coeficiente de esa columna debe dividirse entre 10, ya que : el producto que entra en queda sin cambio, así que los valores ajustados, los residuos, el , el y el son todos idénticos al ajuste original. El error estándar se divide entre 10 por la misma razón que la estimación, porque se mide en las unidades propias del coeficiente (dólares por cien personas en vez de dólares por mil personas), así que la razón es adimensional y no se mueve; la evidencia de que la pendiente difiere de cero es exactamente tan fuerte como antes.
La lección es que la magnitud cruda de un coeficiente no es una medida de la importancia de un predictor, porque puedes hacer un coeficiente diez veces más grande o más pequeño con solo cambiar las unidades de su predictor, sin cambio en el ajuste ni en la fuerza de la evidencia. Para comparar importancia debes mirar cantidades libres de escala como el valor , o estandarizar primero los predictores.
Una respuesta débil enuncia que los números cambian sin ligar el factor de 10 a que el producto queda fijo, y no saca la conclusión de que el tamaño del coeficiente, al depender de las unidades, no puede ordenar predictores por importancia.
7.12 Juego del capítulo¶
Chapter summary (in English)
This chapter presents the general linear model , which writes any regression, with one predictor or many, in a single matrix form. The design matrix has a first column of ones for the intercept and one column per predictor; gathers the parameters and the errors, with and .
The least-squares estimator is , obtained two ways: by calculus, deriving the normal equations ; and by orthogonal projection, where is the point of the column space of closest to and the residual is perpendicular to that space. For Dwaine Studios, .
The hat matrix satisfies and is symmetric and idempotent with trace . From this comes , the correct divisor for estimating the variance: is unbiased, proved with a trace argument. For Dwaine, and .
The vector has mean and covariance ; under normal errors it follows a multivariate normal distribution. The Gauss-Markov theorem shows that is the best linear unbiased estimator, without needing normality. Finally, the simple regression of Chapter 2 appears as the case: the matrix formulas reproduce , , and for the Toluca Company, digit by digit.