Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

7. El modelo lineal general

Volvemos a las ciudades de Dwaine Studios del 6. Álgebra de matrices para la regresión. La empresa opera una cadena de estudios de retratos en ciudades medianas, del tipo de lugar que las familias visitan para las fotos de graduación y de fiestas, y quiere una regla para adivinar cuánto venderá un estudio nuevo antes de firmar un contrato de alquiler. Dos datos de una ciudad son fáciles de consultar por adelantado: la cantidad de gente joven (población de 16 años o menos, en miles) y el ingreso disponible per cápita (en miles de dólares). La pregunta es si esos dos números juntos predicen las ventas anuales del estudio lo bastante bien como para guiar la expansión.

En el Capítulo 6 ya armaste este ajuste a mano: construiste la matriz de diseño, formaste XX\mathbf{X}'\mathbf{X} y XY\mathbf{X}'\mathbf{Y}, invertiste la matriz pequeña y resolviste para los coeficientes b\mathbf{b}. Lo que esa aritmética no podía decirte es por qué la receta b=(XX)1XY\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} es la correcta, ni cuánto confiar en los números que devuelve. Este capítulo demuestra por qué, y convierte el ajuste en inferencia. La Figure 1 muestra el panorama crudo: las ventas suben con cada predictor por separado, pero ninguna gráfica por sí sola te dice qué hacen los dos predictores en conjunto, y ese “en conjunto” es el punto central de la regresión múltiple.

Dos diagramas de dispersión lado a lado para las 21 ciudades de Dwaine Studios. Un panel grafica las ventas en miles de dólares contra el ingreso disponible en miles de dólares; el otro grafica las mismas ventas contra la población objetivo en miles. Cada panel tiene una recta ajustada con pendiente ascendente, y ambas nubes de puntos suben con claridad, con ventas que van de aproximadamente 140 a 290 mil dólares.

Figure 1:Las ventas de Dwaine Studios suben tanto con el conteo de población joven como con el ingreso disponible cuando cada uno se ve por separado. La regresión múltiple hace una pregunta más difícil: ¿cuánto aporta cada predictor una vez que el otro ya está en el modelo?

La regresión lineal simple, de los Capítulos 2 y 3, maneja un solo predictor. Las preguntas reales casi siempre traen varios. Podríamos intentar reconstruir toda la teoría predictor por predictor, pero ese camino se vuelve feo rápido: dos predictores, luego tres, cada uno con sus propias ecuaciones normales y fórmulas de varianza. En vez de eso hacemos lo que el 6. Álgebra de matrices para la regresión preparó. Escribimos el modelo una sola vez, en forma matricial, de modo que un predictor o diez se vean idénticos en la página. Todo resultado del Capítulo 2, las estimaciones de mínimos cuadrados, su insesgadez, sus varianzas, la optimalidad de Gauss-Markov, el divisor n2n-2, reaparece aquí en una única forma limpia que funciona para cualquier número de predictores a la vez. Este capítulo es donde la regresión deja de ser una colección de casos especiales y se vuelve un solo método general.

Este es el capítulo más abstracto del curso, y vale la pena decir una palabra sobre cómo leerlo. La geometría del 7.2 La geometría de los mínimos cuadrados es la idea que conviene retener: una vez que imaginas el ajuste como bajar una perpendicular desde los datos hasta el espacio de ajustes posibles, toda demostración que sigue se reduce a uno de dos hechos sobre la matriz sombrero. Sostén esa imagen y el álgebra se vuelve contabilidad.

7.1 El modelo y los mínimos cuadrados en forma matricial

Intuición

En el Capítulo 2 un solo predictor daba una pendiente y un intercepto. Agrega un segundo predictor y tienes dos pendientes más un intercepto; la respuesta media es ahora un plano inclinado en vez de una recta, como muestra la Figure 2 para Dwaine. Con más predictores es una hoja plana en un espacio que no puedes imaginar. Escribir símbolos separados para cada coeficiente y sumas separadas para cada ecuación normal enterraría la idea bajo la contabilidad. La solución es apilar las observaciones en vectores y matrices y dejar que una línea de álgebra matricial lleve toda la contabilidad por nosotros.

Un diagrama de dispersión tridimensional de las 21 ciudades de Dwaine. Los ejes del piso son la población objetivo en miles y el ingreso disponible en miles de dólares; el eje vertical son las ventas en miles de dólares. Un plano azul translúcido se inclina hacia arriba a través de la caja, y cada punto de datos oscuro está unido al plano por un tallo vertical corto punteado y gris, el residuo. Los puntos quedan por encima y por debajo del plano sin brecha sistemática.

Figure 2:Con un predictor el ajuste es una recta; con dos es un plano inclinado. Las ventas de cada ciudad son un punto oscuro, el plano es la conjetura del modelo, y cada tallo punteado es un residuo. La regresión múltiple encuentra el plano cuyos tallos son los más pequeños en longitud cuadrada total.

La parte sistemática de cada observación es una suma ponderada de los valores de los predictores de esa ciudad, con los mismos pesos (β0,β1,\beta_0, \beta_1, \dots) reutilizados para cada ciudad. Apilar las ciudades verticalmente convierte “los mismos pesos aplicados a cada fila” en un único producto matriz por vector. La Figure 3 muestra los cuatro objetos y sus formas.

Un esquema de la ecuación Y igual a X beta más épsilon dibujada como cuatro cajas etiquetadas. Una caja oscura alta n por 1 de respuestas Y1 a Yn es igual a una caja azul ancha n por p, la matriz de diseño X, cuya primera columna son todos unos y cuyas demás columnas tienen valores de predictores, multiplicada por una caja gris p por 1 de coeficientes beta-0 a beta-p-menos-1, más una caja gris n por 1 de errores épsilon-1 a épsilon-n.

Figure 3:El modelo lineal general como arreglos apilados. La matriz de diseño X lleva una columna inicial de unos para que el intercepto beta-0 se maneje exactamente como cualquier otro coeficiente.

Fórmula

El modelo lineal general (general linear model) (Definición 7.1) reúne las nn observaciones en una sola ecuación matricial.

En palabras: la respuesta de cada observación es igual a una suma ponderada de los valores de los predictores de esa observación más un error aleatorio, y los mismos pesos se reutilizan para cada fila. Los cuatro objetos son:

Los supuestos sobre los errores del Capítulo 2 se vuelven dos enunciados compactos sobre todo el vector a la vez:

E{ε}=0,Cov{ε}=σ2I.E\{\boldsymbol{\varepsilon}\} = \mathbf{0}, \qquad \operatorname{Cov}\{\boldsymbol{\varepsilon}\} = \sigma^2 \mathbf{I} .

En palabras: cada error promedia a cero, y la matriz de covarianza es σ2\sigma^2 por la identidad. Ese único símbolo empaqueta los dos supuestos a la vez: cada error tiene la misma varianza σ2\sigma^2 (a lo largo de la diagonal), y errores distintos están incorrelacionados (fuera de la diagonal). Como X\mathbf{X} y β\boldsymbol{\beta} son fijos, E{Y}=XβE\{\mathbf{Y}\} = \mathbf{X}\boldsymbol{\beta} y Cov{Y}=σ2I\operatorname{Cov}\{\mathbf{Y}\} = \sigma^2 \mathbf{I} también. Suponemos en todo momento que X\mathbf{X} tiene rango de columna completo pp: ningún predictor es una copia de otro, ni una combinación lineal exacta de los demás. Eso es exactamente lo que hace invertible a XX\mathbf{X}'\mathbf{X} (6.4 La inversa y las ecuaciones normales).

Para ajustar el modelo reutilizamos la idea de mínimos cuadrados de 2.2 Mínimos cuadrados desde los primeros principios: elegir el vector de coeficientes b\mathbf{b} que hace que los valores ajustados queden lo más cerca posible de los datos en error cuadrático total. Escribiendo un vector candidato como b\mathbf{b}, la suma de errores cuadrados es

Q(b)=i=1n(Yixib)2=(YXb)(YXb),Q(\mathbf{b}) = \sum_{i=1}^n (Y_i - \mathbf{x}_i'\mathbf{b})^2 = (\mathbf{Y} - \mathbf{X}\mathbf{b})'(\mathbf{Y} - \mathbf{X}\mathbf{b}) ,

donde xi\mathbf{x}_i' es la fila ii de X\mathbf{X}. En palabras: QQ es la longitud cuadrada del vector de residuos, la misma cantidad que el Capítulo 2 minimizó, ahora escrita como un único producto punto. El minimizador es el estimador de mínimos cuadrados (least-squares estimator) (Teorema 7.3)

b=(XX)1XY.\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} .

En palabras: reúne los productos cruzados de los predictores (XX\mathbf{X}'\mathbf{X}) y de los predictores con la respuesta (XY\mathbf{X}'\mathbf{Y}), y multiplica por la inversa del primero. Derivamos esto a continuación, y luego lo verificamos en Dwaine.

Derivación por cálculo

Demostración. Expande QQ usando las reglas de transposición de 6.2 Transpuesta y multiplicación de matrices. Como bXY\mathbf{b}'\mathbf{X}'\mathbf{Y} es un escalar, es igual a su propia transpuesta YXb\mathbf{Y}'\mathbf{X}\mathbf{b}, así que los dos términos del medio se combinan:

Q(b)=YY2bXY+bXXb.Q(\mathbf{b}) = \mathbf{Y}'\mathbf{Y} - 2\,\mathbf{b}'\mathbf{X}'\mathbf{Y} + \mathbf{b}'\mathbf{X}'\mathbf{X}\mathbf{b} .

Minimizamos tomando el gradiente respecto a b\mathbf{b} e igualándolo a cero. El gradiente es solo el vector de derivadas parciales, una por cada entrada de b\mathbf{b}, e igualarlo a cero halla el fondo del tazón. Dos reglas de derivada vectorial hacen el trabajo: para un vector constante a\mathbf{a}, b(ab)=a\nabla_{\mathbf{b}}(\mathbf{a}'\mathbf{b}) = \mathbf{a}; y para una matriz simétrica M\mathbf{M}, b(bMb)=2Mb\nabla_{\mathbf{b}}(\mathbf{b}'\mathbf{M}\mathbf{b}) = 2\mathbf{M}\mathbf{b}. Estas son las gemelas vectoriales de las reglas escalares ddb(ab)=a\frac{d}{db}(ab) = a y ddb(mb2)=2mb\frac{d}{db}(mb^2) = 2mb que ya conoces. La matriz XX\mathbf{X}'\mathbf{X} es simétrica, así que

bQ=2XY+2XXb.\nabla_{\mathbf{b}} Q = -2\,\mathbf{X}'\mathbf{Y} + 2\,\mathbf{X}'\mathbf{X}\mathbf{b} .

Igualar el gradiente a cero y dividir entre 2 da las ecuaciones normales (normal equations) (Definición 7.4)

XXb=XY.\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y} .

Como X\mathbf{X} tiene rango de columna completo, XX\mathbf{X}'\mathbf{X} es invertible (6.4 La inversa y las ecuaciones normales), así que podemos multiplicar por la izquierda por (XX)1(\mathbf{X}'\mathbf{X})^{-1}:

b=(XX)1XY.\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} .

Este punto estacionario es el mínimo global, no un punto de silla ni un máximo, porque la matriz de segundas derivadas de QQ es 2XX2\mathbf{X}'\mathbf{X}, que es definida positiva; una cuadrática con hessiana definida positiva es estrictamente convexa y tiene un único punto más bajo. \blacksquare

Estas son las mismas ecuaciones normales del Capítulo 2, ahora enunciadas una sola vez para cualquier número de predictores. En 2.2 Mínimos cuadrados desde los primeros principios las dos ecuaciones normales escalares eran ei=0\sum e_i = 0 y Xiei=0\sum X_i e_i = 0; la única ecuación matricial XXb=XY\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y} contiene ambas y una más por cada predictor adicional, como veremos en 7.7 La regresión simple como caso especial.

R

El Capítulo 6 construyó XX\mathbf{X}'\mathbf{X} y XY\mathbf{X}'\mathbf{Y} para Dwaine a mano. Aquí dejamos que la computadora las forme y resuelva.

dwaine <- read.csv("data/dwaine.csv")
head(dwaine, 3)
X <- cbind(1, dwaine$targtpop, dwaine$dispoinc)
Y <- dwaine$sales
dim(X)
  targtpop dispoinc sales
1     68.5     16.7 174.4
2     45.2     16.8 164.4
3     91.3     18.2 244.2
[1] 21  3

7.2 La geometría de los mínimos cuadrados

Intuición

La derivación por cálculo halla la respuesta pero oculta por qué es la respuesta. Hay una imagen que vuelve obvios los mínimos cuadrados, y vale la pena cargarla el resto del curso. Piensa en la respuesta Y\mathbf{Y} como una sola flecha (un punto) en un espacio de nn dimensiones, un eje por observación. A medida que el vector de coeficientes b\mathbf{b} recorre todos los valores posibles, el vector ajustado Y^=Xb\hat{\mathbf{Y}} = \mathbf{X}\mathbf{b} traza un subespacio plano: toda combinación lineal de las columnas de X\mathbf{X}. Este subespacio es el espacio de columnas (column space) de X\mathbf{X} (Definición 7.5), y contiene toda predicción que el modelo puede llegar a hacer.

El punto de datos Y\mathbf{Y} casi nunca queda exactamente en ese subespacio, porque los datos reales tienen ruido. Así que el problema de ajuste es: ¿cuál punto del espacio de columnas está más cerca de Y\mathbf{Y}? El punto más cercano de una superficie plana a un punto exterior es el pie de la perpendicular bajada desde el punto hasta la superficie. Ese pie es Y^\hat{\mathbf{Y}}, y el segmento perpendicular es el vector de residuos e=YY^\mathbf{e} = \mathbf{Y} - \hat{\mathbf{Y}}. La Figure 4 dibuja exactamente esto para el caso más pequeño que cabe en una página, tres observaciones y dos columnas.

Un diagrama tridimensional. Un plano azul translúcido e inclinado es el espacio de columnas de X, generado por dos flechas oscuras etiquetadas columnas de X. Una flecha negra etiquetada Y apunta desde el origen hacia arriba fuera del plano. Una flecha azul etiquetada Y-gorro igual a HY yace en el plano. Un segmento dorado punteado etiquetado e igual a Y menos Y-gorro conecta la punta de Y-gorro hasta la punta de Y y toca el plano en ángulo recto, marcado por un pequeño cuadrado dorado.

Figure 4:Los mínimos cuadrados como proyección. El vector ajustado Y-gorro es el punto del espacio de columnas más cercano a Y, alcanzado bajando una perpendicular; el residuo e es esa perpendicular, que toca el espacio de columnas en ángulo recto.

Fórmula

La condición geométrica es que el residuo sea ortogonal a cada columna de X\mathbf{X}:

Xe=0,donde e=YXb.\mathbf{X}'\mathbf{e} = \mathbf{0}, \qquad \text{donde } \mathbf{e} = \mathbf{Y} - \mathbf{X}\mathbf{b} .

En palabras: cada columna de X\mathbf{X}, multiplicada punto por el vector de residuos, da cero, así que el residuo apunta en una dirección que el modelo no puede representar. Al expandir X(YXb)=0\mathbf{X}'(\mathbf{Y} - \mathbf{X}\mathbf{b}) = \mathbf{0} se recuperan las ecuaciones normales XXb=XY\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y}, de modo que la geometría y el cálculo conducen a la solución idéntica.

Derivación por proyección

Derivación (mínimos cuadrados como proyección ortogonal). Sea b\mathbf{b} la solución de las ecuaciones normales, de modo que Xe=0\mathbf{X}'\mathbf{e} = \mathbf{0} con e=YXb\mathbf{e} = \mathbf{Y} - \mathbf{X}\mathbf{b}. Toma cualquier otro vector de coeficientes candidato b\mathbf{b}^{\ast}, con vector ajustado Xb\mathbf{X}\mathbf{b}^{\ast}. Divide la brecha de Y\mathbf{Y} a ese candidato pasando por Y^=Xb\hat{\mathbf{Y}} = \mathbf{X}\mathbf{b}:

YXb=(YXb)e+X(bb)g.\mathbf{Y} - \mathbf{X}\mathbf{b}^{\ast} = \underbrace{(\mathbf{Y} - \mathbf{X}\mathbf{b})}_{\mathbf{e}} + \underbrace{\mathbf{X}(\mathbf{b} - \mathbf{b}^{\ast})}_{\mathbf{g}} .

La segunda pieza g=X(bb)\mathbf{g} = \mathbf{X}(\mathbf{b} - \mathbf{b}^{\ast}) vive en el espacio de columnas. Su longitud cuadrada se suma sin término cruzado, porque el término cruzado se anula por ortogonalidad:

eg=eX(bb)=(Xe)(bb)=0(bb)=0.\mathbf{e}'\mathbf{g} = \mathbf{e}'\mathbf{X}(\mathbf{b} - \mathbf{b}^{\ast}) = (\mathbf{X}'\mathbf{e})'(\mathbf{b} - \mathbf{b}^{\ast}) = \mathbf{0}'(\mathbf{b} - \mathbf{b}^{\ast}) = 0 .

Por lo tanto, por el teorema de Pitágoras en nn dimensiones,

YXb2=e2+g2    e2,\|\mathbf{Y} - \mathbf{X}\mathbf{b}^{\ast}\|^2 = \|\mathbf{e}\|^2 + \|\mathbf{g}\|^2 \; \ge \; \|\mathbf{e}\|^2 ,

con igualdad solo cuando g2=0\|\mathbf{g}\|^2 = 0, es decir Xb=Xb\mathbf{X}\mathbf{b}^{\ast} = \mathbf{X}\mathbf{b}. Como X\mathbf{X} tiene rango de columna completo, esto obliga a b=b\mathbf{b}^{\ast} = \mathbf{b}. Así que la solución de las ecuaciones normales da la única suma de errores cuadrados más pequeña, y Y^\hat{\mathbf{Y}} es el punto del espacio de columnas más cercano a Y\mathbf{Y}. \blacksquare

Esta es la misma identidad algebraica que la demostración del Capítulo 2 en 2.2 Mínimos cuadrados desde los primeros principios, ahora leída como geometría: el término cruzado se anula allí porque ei=0\sum e_i = 0 y Xiei=0\sum X_i e_i = 0, que es precisamente Xe=0\mathbf{X}'\mathbf{e} = \mathbf{0} escrito por extenso. La vista de proyección (en 6.5 Matrices idempotentes y de proyección) es la que hay que recordar, porque los diagnósticos del Capítulo 9 tratan todos sobre qué observaciones quedan en rincones incómodos del espacio de columnas.

R y Python

Un diagrama de dispersión de los 21 residuos de Dwaine en miles de dólares en el eje vertical contra las ventas ajustadas en el eje horizontal, con una línea horizontal punteada en cero. Los puntos se dispersan por encima y por debajo de cero sin forma de embudo y sin curvatura.

Figure 5:Los residuos de Dwaine contra los valores ajustados forman una banda plana y sin patrón alrededor de cero, la imagen que respalda los supuestos de varianza constante y linealidad. El Capítulo 9 convierte este hábito en un conjunto completo de herramientas de diagnóstico.

La ortogonalidad es fácil de enunciar y fácil de dudar, así que la simulación de abajo te entrega los datos y te invita a romperla.

Arrastra cualquiera de las siete ciudades a donde quieras. La pendiente y SCE responden, pero las dos entradas de X’e, y la brecha de Pitágoras STC menos SCR menos SCE, se quedan en cero.

7.3 La matriz sombrero

Intuición

La Sección 7.2 imaginó el ajuste como una proyección de Y\mathbf{Y} sobre el espacio de columnas. Esa proyección la realiza una sola matriz, y darle un nombre rinde frutos el resto del capítulo. El vector ajustado es una función lineal fija de los datos: sustituye la fórmula de b\mathbf{b} en Y^=Xb\hat{\mathbf{Y}} = \mathbf{X}\mathbf{b} y obtienes Y^=X(XX)1XY\hat{\mathbf{Y}} = \mathbf{X}(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y}. La matriz que queda frente a Y\mathbf{Y} convierte las respuestas crudas en valores ajustados, así que se gana el nombre de matriz sombrero (hat matrix) (Definición 7.6): le pone el sombrero (gorro) a Y\mathbf{Y}. Es la matriz más útil en el resto del curso. Sus entradas diagonales son los valores de apalancamiento que señalan valores de predictores inusuales (Capítulo 9), y su álgebra hace que los resultados de varianza de abajo salgan en una línea.

Fórmula

La matriz sombrero y los vectores ajustado y de residuos son

H=X(XX)1X,Y^=HY,e=(IH)Y.\mathbf{H} = \mathbf{X}(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}', \qquad \hat{\mathbf{Y}} = \mathbf{H}\mathbf{Y}, \qquad \mathbf{e} = (\mathbf{I} - \mathbf{H})\mathbf{Y} .

La Figure 7 muestra la matriz sombrero de Toluca como una cuadrícula de pesos; las entradas diagonales, resaltadas, son los valores de apalancamiento hiih_{ii}.

Un mapa de calor de 25 por 25 de la matriz sombrero de Toluca, con rojo para entradas positivas y azul para negativas, la mayoría cerca de cero. Las 25 celdas diagonales están resaltadas en dorado, marcando los valores de apalancamiento h-i-i, que son las entradas más grandes de cada fila.

Figure 7:La matriz sombrero H de Toluca convierte respuestas en valores ajustados. Leer a lo largo de la fila i da los pesos que construyen el i-ésimo valor ajustado; las entradas diagonales doradas resaltadas son los valores de apalancamiento que el Capítulo 9 usa para encontrar observaciones inusuales.

Derivación (propiedades de H)

Demostración. Escribe A=(XX)1\mathbf{A} = (\mathbf{X}'\mathbf{X})^{-1}, que es simétrica porque XX\mathbf{X}'\mathbf{X} lo es (la inversa de una matriz simétrica es simétrica, por 6.4 La inversa y las ecuaciones normales).

Simétrica. Usando (BCD)=DCB(\mathbf{BCD})' = \mathbf{D}'\mathbf{C}'\mathbf{B}' de 6.2 Transpuesta y multiplicación de matrices,

H=(XAX)=XAX=XAX=H.\mathbf{H}' = \big(\mathbf{X}\mathbf{A}\mathbf{X}'\big)' = \mathbf{X}\mathbf{A}'\mathbf{X}' = \mathbf{X}\mathbf{A}\mathbf{X}' = \mathbf{H} .

Idempotente. Proyectar dos veces equivale a proyectar una vez. La XX\mathbf{X}'\mathbf{X} del medio cancela su inversa:

HH=XAXXAX=XAX=H.\mathbf{H}\mathbf{H} = \mathbf{X}\mathbf{A}\,\mathbf{X}'\mathbf{X}\,\mathbf{A}\mathbf{X}' = \mathbf{X}\mathbf{A}\mathbf{X}' = \mathbf{H} .

La Figure 8 muestra por qué: una vez que H\mathbf{H} ha dejado un vector en el espacio de columnas, proyectar de nuevo no puede moverlo.

Traza pp. La traza de una matriz es la suma de sus entradas diagonales. Usa la propiedad cíclica de la traza, tr(BC)=tr(CB)\operatorname{tr}(\mathbf{B}\mathbf{C}) = \operatorname{tr}(\mathbf{C}\mathbf{B}) (una identidad estándar: ambos lados igualan i,jBijCji\sum_{i,j} B_{ij} C_{ji}), para deslizar X\mathbf{X} alrededor:

tr(H)=tr ⁣(XAX)=tr ⁣(AXX)=tr ⁣((XX)1(XX))=tr(Ip)=p.\operatorname{tr}(\mathbf{H}) = \operatorname{tr}\!\big(\mathbf{X}\mathbf{A}\mathbf{X}'\big) = \operatorname{tr}\!\big(\mathbf{A}\mathbf{X}'\mathbf{X}\big) = \operatorname{tr}\!\big((\mathbf{X}'\mathbf{X})^{-1}(\mathbf{X}'\mathbf{X})\big) = \operatorname{tr}(\mathbf{I}_p) = p .

En consecuencia IH\mathbf{I} - \mathbf{H} también es simétrica e idempotente, con tr(IH)=np\operatorname{tr}(\mathbf{I} - \mathbf{H}) = n - p. Esa traza son los grados de libertad del error, y es la razón por la que el divisor en la estimación de la varianza es npn - p, demostrado en 7.5 Estimación de la varianza del error. \blacksquare

Un diagrama bidimensional. Una recta azul que pasa por el origen está etiquetada el espacio de columnas. Una flecha negra y apunta hacia arriba y a la derecha; una flecha azul Hy yace a lo largo de la recta; un segmento dorado punteado e conecta la punta de Hy con la punta de y, tocando la recta en ángulo recto. Una anotación pequeña señala que proyectar Hy una segunda vez no lo mueve.

Figure 8:Por qué H es idempotente. Proyectar el vector y sobre el espacio de columnas lo deja en Hy dentro de ese espacio; proyectar una segunda vez lo deja exactamente donde está, así que HH es igual a H.

R y Python

La afirmación de que H\mathbf{H} depende solo de los predictores suena a tecnicismo hasta que intentas moverla con la respuesta, que es justo lo que te pide la siguiente simulación.

Arrastra una ciudad directo hacia arriba y los apalancamientos no se mueven en absoluto; arrástrala de lado y saltan de inmediato, mientras la traza de H sigue clavada en p.

7.4 La distribución muestral de b

Intuición

El vector b\mathbf{b} salió de una sola muestra de 21 ciudades. Otras 21 ciudades darían un b\mathbf{b} un poco distinto, así que b\mathbf{b} es aleatorio, con una media y una covarianza a través de las muestras que pudimos haber extraído. Dos preguntas se repiten del Capítulo 2, ahora para todo un vector: ¿es b\mathbf{b} correcto en promedio, y cuánto varía? Las respuestas son limpias porque b\mathbf{b} es una matriz fija por Y\mathbf{Y}, y 6.7 Vectores aleatorios, esperanza y matrices de covarianzas nos dice exactamente cómo pasan las medias y las covarianzas a través de un mapa lineal.

Fórmula

El vector de mínimos cuadrados es insesgado con una matriz de covarianza construida a partir de (XX)1(\mathbf{X}'\mathbf{X})^{-1}:

E{b}=β,Cov{b}=σ2(XX)1.E\{\mathbf{b}\} = \boldsymbol{\beta}, \qquad \operatorname{Cov}\{\mathbf{b}\} = \sigma^2 (\mathbf{X}'\mathbf{X})^{-1} .

En palabras: en promedio b\mathbf{b} da en el vector de coeficientes verdadero, y su matriz de covarianza es σ2\sigma^2 por la matriz inversa de productos cruzados. Las entradas diagonales son las varianzas de los coeficientes individuales; las entradas fuera de la diagonal son las covarianzas entre ellos, por lo cual dos coeficientes pueden estar correlacionados (la nube inclinada de la Figure 10). Reemplazar σ2\sigma^2 por su estimación MSE\mathrm{MSE} da la matriz de covarianza estimada s2{b}=MSE(XX)1s^2\{\mathbf{b}\} = \mathrm{MSE}\,(\mathbf{X}'\mathbf{X})^{-1}, cuyas raíces cuadradas diagonales son los errores estándar que imprime el software.

Derivación (media y covarianza de b)

Demostración. Escribe b=AY\mathbf{b} = \mathbf{A}\mathbf{Y} con la matriz fija A=(XX)1X\mathbf{A} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'. Para una matriz fija por un vector aleatorio, 6.7 Vectores aleatorios, esperanza y matrices de covarianzas da E{AY}=AE{Y}E\{\mathbf{A}\mathbf{Y}\} = \mathbf{A}\,E\{\mathbf{Y}\} y Cov{AY}=ACov{Y}A\operatorname{Cov}\{\mathbf{A}\mathbf{Y}\} = \mathbf{A}\operatorname{Cov}\{\mathbf{Y}\}\mathbf{A}'.

Media. Como E{Y}=XβE\{\mathbf{Y}\} = \mathbf{X}\boldsymbol{\beta},

E{b}=(XX)1XXβ=(XX)1(XX)β=β.E\{\mathbf{b}\} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\,\mathbf{X}\boldsymbol{\beta} = (\mathbf{X}'\mathbf{X})^{-1}(\mathbf{X}'\mathbf{X})\boldsymbol{\beta} = \boldsymbol{\beta} .

Covarianza. Como Cov{Y}=σ2I\operatorname{Cov}\{\mathbf{Y}\} = \sigma^2\mathbf{I},

Cov{b}=A(σ2I)A=σ2(XX)1XX(XX)1=σ2(XX)1,\operatorname{Cov}\{\mathbf{b}\} = \mathbf{A}\,(\sigma^2\mathbf{I})\,\mathbf{A}' = \sigma^2 (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\,\mathbf{X}(\mathbf{X}'\mathbf{X})^{-1} = \sigma^2 (\mathbf{X}'\mathbf{X})^{-1} ,

donde la XX\mathbf{X}'\mathbf{X} del medio cancela una inversa y la simetría de (XX)1(\mathbf{X}'\mathbf{X})^{-1} maneja la transpuesta. \blacksquare

Si agregamos el supuesto de normalidad εN(0,σ2I)\boldsymbol{\varepsilon} \sim N(\mathbf{0}, \sigma^2\mathbf{I}), entonces Y\mathbf{Y} es normal multivariante, y un mapa lineal fijo de una normal multivariante es de nuevo normal multivariante (6.8 La normal multivariante, en breve). Así que

bN ⁣(β, σ2(XX)1).\mathbf{b} \sim N\!\big(\boldsymbol{\beta},\ \sigma^2 (\mathbf{X}'\mathbf{X})^{-1}\big) .

En palabras: bajo errores normales cada coeficiente se distribuye normalmente alrededor de su valor verdadero, y esto es lo que impulsa las pruebas tt y los intervalos de confianza del Capítulo 8. La Figure 10 confirma la covarianza por simulación: reajustar muchos conjuntos de datos dispersa las dos pendientes de Dwaine en una elipse inclinada que coincide con σ2(XX)1\sigma^2 (\mathbf{X}'\mathbf{X})^{-1}.

Un diagrama de dispersión de 4000 pares simulados de estimaciones de pendiente, la pendiente de población objetivo b1 en el eje horizontal y la pendiente de ingreso disponible b2 en el eje vertical. La nube es una elipse alargada e inclinada que baja de arriba a la izquierda hacia abajo a la derecha, centrada cerca de b1 igual a 1.45 y b2 igual a 9.4. Una curva azul traza la elipse teórica del 95 por ciento y coincide con la nube.

Figure 10:Simular 4000 reajustes dispersa las dos estimaciones de pendiente de Dwaine en una elipse inclinada. La inclinación descendente es una covarianza negativa: las dos estimaciones de pendiente se compensan, porque los predictores están correlacionados. La elipse teórica azul de sigma-cuadrada por la matriz inversa de productos cruzados coincide con la nube simulada.

R y Python

La fórmula de la covarianza es una predicción sobre datos que no has recogido, así que la simulación de abajo los recoge por ti mil veces y la comprueba.

Cada reajuste usa las mismas 21 ciudades con errores nuevos. Presiona Tomar 1000 y la dispersión del montón de b1 coincide con el error estándar que la fórmula matricial predijo de antemano.

7.5 Estimación de la varianza del error

Intuición

Los coeficientes describen el plano; el modelo todavía tiene una incógnita más, la varianza del error σ2\sigma^2, que fija cuánto se dispersan los datos fuera del plano. Como en el Capítulo 2 la estimamos a partir de los residuos, pero ahora debemos hallar el divisor correcto para un modelo con pp parámetros en vez de 2. La respuesta es npn - p, y la razón es la traza que calculamos en 7.3 La matriz sombrero: ajustar pp coeficientes gasta pp direcciones de los datos, y deja npn - p direcciones para que viva el residuo. La Figure 12 mantiene la contabilidad a la vista: las nn direcciones de los datos se dividen en una parte de ajuste y una parte de residuo, y promediamos el residuo cuadrado sobre sus propias npn - p direcciones, no sobre las nn.

Una barra horizontal de longitud total n igual a 21 que representa las direcciones de los datos. Un segmento azul corto de longitud p igual a 3 a la izquierda está etiquetado gastado en el ajuste, el espacio de columnas. Un segmento dorado largo de longitud n menos p igual a 18 a la derecha está etiquetado dejado para el residuo, el espacio del error. Una doble flecha debajo de toda la barra marca el total de 21 direcciones de datos.

Figure 12:Las n direcciones de los datos se dividen en p direcciones gastadas ajustando el plano y n menos p dejadas para el residuo. Dividir SSE entre n menos p, no entre n, promedia sobre exactamente las direcciones que el residuo es libre de llenar, que es lo que hace insesgado al MSE.

Fórmula

La suma de cuadrados del error (error sum of squares) y el estimador de σ2\sigma^2 son

SSE=ee=Y(IH)Y,s2=MSE=SSEnp,s=MSE.\mathrm{SSE} = \mathbf{e}'\mathbf{e} = \mathbf{Y}'(\mathbf{I} - \mathbf{H})\mathbf{Y}, \qquad s^2 = \mathrm{MSE} = \frac{\mathrm{SSE}}{n - p}, \qquad s = \sqrt{\mathrm{MSE}} .

Derivación (por qué el divisor es n - p)

Necesitamos un hecho sobre el valor esperado de una forma cuadrática. Es demostrable a nuestro nivel, así que lo demostramos y luego lo aplicamos.

Lema (esperanza de una forma cuadrática). Para cualquier vector aleatorio Y\mathbf{Y} con media μ\boldsymbol{\mu} y covarianza Σ\boldsymbol{\Sigma}, y cualquier matriz simétrica fija A\mathbf{A},

E{YAY}=tr(AΣ)+μAμ.E\{\mathbf{Y}'\mathbf{A}\mathbf{Y}\} = \operatorname{tr}(\mathbf{A}\boldsymbol{\Sigma}) + \boldsymbol{\mu}'\mathbf{A}\boldsymbol{\mu} .

Demostración. El escalar YAY\mathbf{Y}'\mathbf{A}\mathbf{Y} es igual a su propia traza, y la traza es cíclica, así que YAY=tr(AYY)\mathbf{Y}'\mathbf{A}\mathbf{Y} = \operatorname{tr}(\mathbf{A}\mathbf{Y}\mathbf{Y}'). Tomando esperanzas y usando E{YY}=Σ+μμE\{\mathbf{Y}\mathbf{Y}'\} = \boldsymbol{\Sigma} + \boldsymbol{\mu}\boldsymbol{\mu}' (6.7 Vectores aleatorios, esperanza y matrices de covarianzas),

E{YAY}=tr ⁣(A(Σ+μμ))=tr(AΣ)+tr(Aμμ)=tr(AΣ)+μAμ,E\{\mathbf{Y}'\mathbf{A}\mathbf{Y}\} = \operatorname{tr}\!\big(\mathbf{A}(\boldsymbol{\Sigma} + \boldsymbol{\mu}\boldsymbol{\mu}')\big) = \operatorname{tr}(\mathbf{A}\boldsymbol{\Sigma}) + \operatorname{tr}(\mathbf{A}\boldsymbol{\mu}\boldsymbol{\mu}') = \operatorname{tr}(\mathbf{A}\boldsymbol{\Sigma}) + \boldsymbol{\mu}'\mathbf{A}\boldsymbol{\mu} ,

ya que tr(Aμμ)=μAμ\operatorname{tr}(\mathbf{A}\boldsymbol{\mu}\boldsymbol{\mu}') = \boldsymbol{\mu}'\mathbf{A}\boldsymbol{\mu} es un escalar. \blacksquare

Demostración del Teorema 7.9. Aplica el lema con A=IH\mathbf{A} = \mathbf{I} - \mathbf{H}, μ=Xβ\boldsymbol{\mu} = \mathbf{X}\boldsymbol{\beta}, y Σ=σ2I\boldsymbol{\Sigma} = \sigma^2\mathbf{I}. Las dos piezas son:

Pieza de la traza. tr ⁣((IH)σ2I)=σ2tr(IH)=σ2(np)\operatorname{tr}\!\big((\mathbf{I} - \mathbf{H})\sigma^2\mathbf{I}\big) = \sigma^2 \operatorname{tr}(\mathbf{I} - \mathbf{H}) = \sigma^2 (n - p), usando la traza de 7.3 La matriz sombrero.

Pieza de la media. El término de la media se anula, porque (IH)X=XHX=XX=0(\mathbf{I} - \mathbf{H})\mathbf{X} = \mathbf{X} - \mathbf{H}\mathbf{X} = \mathbf{X} - \mathbf{X} = \mathbf{0} (la matriz sombrero deja sin cambio las columnas de X\mathbf{X}, ya que estas ya están en el espacio de columnas). Por lo tanto

μ(IH)μ=βX(IH)Xβ=β0β=0.\boldsymbol{\mu}'(\mathbf{I} - \mathbf{H})\boldsymbol{\mu} = \boldsymbol{\beta}'\mathbf{X}'(\mathbf{I} - \mathbf{H})\mathbf{X}\boldsymbol{\beta} = \boldsymbol{\beta}'\mathbf{0}\,\boldsymbol{\beta} = 0 .

Combinando, E{SSE}=σ2(np)+0=(np)σ2E\{\mathrm{SSE}\} = \sigma^2(n - p) + 0 = (n - p)\sigma^2, así que

E{MSE}=E{SSE}np=σ2.E\{\mathrm{MSE}\} = \frac{E\{\mathrm{SSE}\}}{n - p} = \sigma^2 .

El divisor npn - p, y ningún otro, hace insesgado al MSE\mathrm{MSE}. \blacksquare

Este es el resultado del Capítulo 2 E{MSE}=σ2E\{\mathrm{MSE}\} = \sigma^2 generalizado: allí p=2p = 2 daba el divisor n2n - 2; aquí cualquier modelo divide entre nn menos el número de parámetros. La Figure 13 muestra qué sale mal con el divisor ingenuo nn: dividir entre nn en vez de npn - p sesga la estimación hacia abajo, y la brecha es mayor cuando pp es una fracción grande de nn.

Dos histogramas superpuestos de 5000 estimaciones simuladas de sigma-cuadrada para el modelo de Dwaine. El histograma azul, que divide SSE entre n menos p, está centrado en el valor verdadero cerca de 121. El histograma dorado, que divide entre n, está desplazado a la izquierda y centrado cerca de 104, sesgado hacia abajo. Una línea vertical gris punteada marca la sigma-cuadrada verdadera en 121.

Figure 13:Dividir SSE entre n - p (azul) centra la estimación de la varianza en la verdad; dividir entre n (naranja) la jala sistemáticamente hacia abajo. El sesgo es el precio de estimar p coeficientes antes de medir los residuos.

R y Python

También podemos leer qué tan bien ajusta el plano en general. La variación total SSTO=(YiYˉ)2\mathrm{SSTO} = \sum (Y_i - \bar{Y})^2 se divide en la parte que el modelo explica y la parte que no, y R2=1SSE/SSTOR^2 = 1 - \mathrm{SSE}/\mathrm{SSTO} reporta la fracción explicada, exactamente como en 3.6 El enfoque del análisis de varianza pero ahora para muchos predictores.

SSTO <- sum((Y - mean(Y))^2)
SSR <- SSTO - SSE
c(SSTO = round(SSTO, 2), SSR = round(SSR, 2), SSE = round(SSE, 2),
  R2 = round(1 - SSE / SSTO, 4))
      SSTO        SSR        SSE         R2
26196.2100 24015.2800  2180.9300     0.9167
SSTO = np.sum((Y - Y.mean()) ** 2)
SSR = SSTO - SSE
print(round(SSTO, 2), round(SSR, 2), round(SSE, 2), round(1 - SSE / SSTO, 4))
26196.21 24015.28 2180.93 0.9167

Los dos predictores juntos explican alrededor del 91.7%91.7\% de la variación en las ventas de Dwaine. El Capítulo 8 desglosa este número, advierte cómo solo puede subir cuando se agregan predictores, y construye la prueba lineal general sobre el SSE\mathrm{SSE} que acabamos de calcular (8.3 Sumas de cuadrados adicionales).

7.6 El teorema de Gauss-Markov

Intuición

Elegimos los mínimos cuadrados porque el error cuadrático es una penalización natural, y el Capítulo 2 premió esa elección: en la regresión simple, ningún otro estimador lineal insesgado supera a b1b_1. El mismo premio se cumple para el vector completo, y la demostración matricial apenas es más larga que la escalar. La afirmación es que cualquier competidor construido como una combinación lineal fija de las respuestas, y obligado a ser correcto en promedio, debe tener una matriz de covarianza al menos tan grande como la de b\mathbf{b}. No se necesita normalidad; los supuestos de errores de media cero, varianza constante e incorrelacionados bastan. La Figure 14 muestra la recompensa en Toluca: los mínimos cuadrados y un estimador insesgado competidor están ambos centrados en la verdad, pero los mínimos cuadrados se dispersan mucho menos.

Dos histogramas superpuestos de 5000 estimaciones simuladas de la pendiente de Toluca. El histograma azul, mínimos cuadrados, es alto y angosto y está centrado en la pendiente verdadera 3.5702. El histograma dorado, un competidor de dos puntos que usa solo los lotes más ligero y más pesado, es bajo y ancho, también centrado cerca de 3.5702 pero mucho más disperso. Una línea gris punteada marca la pendiente verdadera.

Figure 14:Tanto la pendiente de mínimos cuadrados (azul, angosta) como un competidor de dos puntos (naranja, ancho) son insesgados, centrados en la pendiente verdadera. Los mínimos cuadrados tienen la dispersión menor, exactamente lo que garantiza el teorema de Gauss-Markov.

Fórmula

Derivación (b es MELI)

Demostración. Sea b=CY\mathbf{b}^{\ast} = \mathbf{C}\mathbf{Y} cualquier estimador lineal con una matriz fija C\mathbf{C} de p×np \times n. Su media es E{CY}=CXβE\{\mathbf{C}\mathbf{Y}\} = \mathbf{C}\mathbf{X}\boldsymbol{\beta}. Para que b\mathbf{b}^{\ast} sea insesgado para β\boldsymbol{\beta} para todo β\boldsymbol{\beta} posible, necesitamos

CX=Ip.\mathbf{C}\mathbf{X} = \mathbf{I}_p .

Escribe C=(XX)1X+D\mathbf{C} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' + \mathbf{D}, definiendo D\mathbf{D} como la diferencia respecto a la matriz de mínimos cuadrados. La condición de insesgadez CX=I\mathbf{C}\mathbf{X} = \mathbf{I} se vuelve

I=[(XX)1X+D]X=I+DX,asıˊ queDX=0.\mathbf{I} = \big[(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' + \mathbf{D}\big]\mathbf{X} = \mathbf{I} + \mathbf{D}\mathbf{X}, \qquad \text{así que} \qquad \mathbf{D}\mathbf{X} = \mathbf{0} .

Ahora calcula la covarianza. Como Cov{Y}=σ2I\operatorname{Cov}\{\mathbf{Y}\} = \sigma^2\mathbf{I}, Cov{b}=σ2CC\operatorname{Cov}\{\mathbf{b}^{\ast}\} = \sigma^2\mathbf{C}\mathbf{C}'. Expande CC\mathbf{C}\mathbf{C}' con C=(XX)1X+D\mathbf{C} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' + \mathbf{D}. Los dos términos cruzados se anulan porque DX=0\mathbf{D}\mathbf{X} = \mathbf{0} (y su transpuesta XD=0\mathbf{X}'\mathbf{D}' = \mathbf{0}):

(XX)1XD=(XX)1(DX)=0.(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{D}' = (\mathbf{X}'\mathbf{X})^{-1}(\mathbf{D}\mathbf{X})' = \mathbf{0} .

Lo que sobrevive es

CC=(XX)1XX(XX)1+DD=(XX)1+DD.\mathbf{C}\mathbf{C}' = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{X}(\mathbf{X}'\mathbf{X})^{-1} + \mathbf{D}\mathbf{D}' = (\mathbf{X}'\mathbf{X})^{-1} + \mathbf{D}\mathbf{D}' .

Por lo tanto

Cov{b}=σ2(XX)1+σ2DD=Cov{b}+σ2DD.\operatorname{Cov}\{\mathbf{b}^{\ast}\} = \sigma^2 (\mathbf{X}'\mathbf{X})^{-1} + \sigma^2\mathbf{D}\mathbf{D}' = \operatorname{Cov}\{\mathbf{b}\} + \sigma^2\mathbf{D}\mathbf{D}' .

Para cualquier c\mathbf{c} fijo, la varianza del escalar cb\mathbf{c}'\mathbf{b}^{\ast} es

Var{cb}=cCov{b}c+σ2cDDc=Var{cb}+σ2Dc2.\operatorname{Var}\{\mathbf{c}'\mathbf{b}^{\ast}\} = \mathbf{c}'\operatorname{Cov}\{\mathbf{b}\}\mathbf{c} + \sigma^2 \mathbf{c}'\mathbf{D}\mathbf{D}'\mathbf{c} = \operatorname{Var}\{\mathbf{c}'\mathbf{b}\} + \sigma^2\|\mathbf{D}'\mathbf{c}\|^2 .

El término agregado σ2Dc20\sigma^2\|\mathbf{D}'\mathbf{c}\|^2 \ge 0 es una longitud cuadrada, así que todo competidor lineal insesgado tiene varianza al menos la de cb\mathbf{c}'\mathbf{b}, con igualdad solo cuando Dc=0\mathbf{D}'\mathbf{c} = \mathbf{0}; hacer que c\mathbf{c} recorra los vectores coordenados obliga a D=0\mathbf{D} = \mathbf{0}, es decir, el competidor es b\mathbf{b} mismo. Los mínimos cuadrados son MELI. \blacksquare

Poniendo X=[1,x]\mathbf{X} = [\mathbf{1}, \mathbf{x}] y c=(0,1)\mathbf{c} = (0, 1)' se recupera el enunciado del Capítulo 2 de que b1b_1 es MELI (2.5 Comportamiento muestral y el teorema de Gauss-Markov); la demostración matricial hizo cada coeficiente, y cada combinación lineal de coeficientes, a la vez.

7.7 La regresión simple como caso especial

Intuición

Todo lo de los Capítulos 2 y 3 debería salir de las fórmulas matriciales cuando hay un solo predictor, y así es. Verlo ocurrir una vez convierte las fórmulas generales de abstracciones en herramientas confiables: la misma máquina que ajustó el plano de Dwaine ajusta la recta de Toluca, y devuelve los números exactos que ya conoces. La Figure 15 es toda la idea en una imagen: una fórmula, dos trabajos.

Un diagrama de flujo. Una caja gris central contiene la única fórmula matricial b igual a X-prima-X inversa por X-prima-Y. Dos flechas apuntan hacia abajo desde ella. La caja azul de la izquierda, etiquetada p igual a 2 recta de Toluca, muestra la matriz de diseño con una columna de unos y un predictor colapsando en las fórmulas escalares del Capítulo 2 b1 igual a Sxy sobre Sxx y b0 igual a Ybar menos b1 Xbar. La caja dorada de la derecha, etiquetada p igual a 3 plano de Dwaine, muestra la matriz de diseño con dos predictores y los coeficientes ajustados menos 68.86, 1.4546, 9.3655.

Figure 15:Una fórmula matricial hace dos trabajos. Pon p igual a 2 y colapsa en las fórmulas escalares exactas del Capítulo 2 para la recta de Toluca; pon p igual a 3 y ajusta el plano de Dwaine. El modelo general no reemplaza a la regresión simple, la contiene.

Derivación (las fórmulas matriciales se reducen al Capítulo 2)

Derivación (el caso p=2p = 2). Con un predictor, la matriz de diseño es X=[1,x]\mathbf{X} = [\mathbf{1}, \mathbf{x}], así que

XX=(nXiXiXi2),XY=(YiXiYi).\mathbf{X}'\mathbf{X} = \begin{pmatrix} n & \sum X_i \\ \sum X_i & \sum X_i^2 \end{pmatrix}, \qquad \mathbf{X}'\mathbf{Y} = \begin{pmatrix} \sum Y_i \\ \sum X_i Y_i \end{pmatrix} .

donde Sxx=(XiXˉ)2S_{xx} = \sum (X_i - \bar{X})^2 y Sxy=(XiXˉ)(YiYˉ)S_{xy} = \sum (X_i - \bar{X})(Y_i - \bar{Y}) son las sumas de cuadrados y productos cruzados del Capítulo 2, y Xˉ,Yˉ\bar{X}, \bar{Y} son las medias muestrales. La inversa de una matriz 2×22 \times 2 divide entre su determinante det(XX)=nXi2(Xi)2=nSxx\det(\mathbf{X}'\mathbf{X}) = n\sum X_i^2 - (\sum X_i)^2 = n\,S_{xx} (6.4 La inversa y las ecuaciones normales),

(XX)1=1nSxx(Xi2XiXin).(\mathbf{X}'\mathbf{X})^{-1} = \frac{1}{n\,S_{xx}}\begin{pmatrix} \sum X_i^2 & -\sum X_i \\ -\sum X_i & n \end{pmatrix} .

Multiplicar por XY\mathbf{X}'\mathbf{Y} y simplificar (cada entrada colapsa usando Xi=nXˉ\sum X_i = n\bar{X} y las definiciones de Sxx,SxyS_{xx}, S_{xy}) da

b=(XX)1XY=(Yˉb1XˉSxy/Sxx),\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} = \begin{pmatrix} \bar{Y} - b_1\bar{X} \\ S_{xy}/S_{xx} \end{pmatrix} ,

que son exactamente los estimadores del Capítulo 2 b0=Yˉb1Xˉb_0 = \bar{Y} - b_1\bar{X} y b1=Sxy/Sxxb_1 = S_{xy}/S_{xx}. La matriz de covarianza se reduce de la misma manera: la entrada inferior derecha de σ2(XX)1\sigma^2(\mathbf{X}'\mathbf{X})^{-1} es σ2n/(nSxx)=σ2/Sxx\sigma^2 n / (n S_{xx}) = \sigma^2/S_{xx}, que coincide con Var{b1}\operatorname{Var}\{b_1\}, y la entrada superior izquierda es σ2Xi2/(nSxx)=σ2(1/n+Xˉ2/Sxx)\sigma^2 \sum X_i^2/(n S_{xx}) = \sigma^2(1/n + \bar{X}^2/S_{xx}), que coincide con Var{b0}\operatorname{Var}\{b_0\} de 2.5 Comportamiento muestral y el teorema de Gauss-Markov. \blacksquare

El Ejemplo 7.5 ya confirmó esto numéricamente: la tubería matricial devolvió los b0=62.3659b_0 = 62.3659, b1=3.5702b_1 = 3.5702 de Toluca, y los errores estándar 26.1774 y 0.3470, las mismas cifras que el Capítulo 2 produjo a partir de las fórmulas escalares. El modelo lineal general no reemplaza a la regresión simple; la contiene.

7.8 Resumen del capítulo

Este capítulo convirtió la aritmética matricial del Capítulo 6 en una regresión múltiple completa. Una ecuación, Y=Xβ+ε\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}, lleva cualquier número de predictores. Los mínimos cuadrados proyectan Y\mathbf{Y} sobre el espacio de columnas de X\mathbf{X}, dando b=(XX)1XY\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} por cálculo y por geometría por igual. La matriz sombrero H\mathbf{H} empaqueta esa proyección, y sus dos propiedades, ser una proyección (simétrica e idempotente) con traza pp, impulsan la distribución muestral de b\mathbf{b}, el divisor npn - p en el MSE\mathrm{MSE}, y la optimalidad de Gauss-Markov. Cada fórmula del Capítulo 2 regresa como el caso especial p=2p = 2.

Resultados clave de un vistazo.

ResultadoEnunciado o fórmulaVálido cuando
Estimador de mínimos cuadrados (Teorema 7.3)b=(XX)1XY\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} minimiza Q(b)Q(\mathbf{b})X\mathbf{X} de rango de columna completo
Ecuaciones normales (Definición 7.4)XXb=XY\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y}, equivalentemente Xe=0\mathbf{X}'\mathbf{e} = \mathbf{0}cualquier ajuste de mínimos cuadrados
Propiedades de la matriz sombrero (Teorema 7.7)H\mathbf{H} simétrica, idempotente, trH=p\operatorname{tr}\mathbf{H} = p, tr(IH)=np\operatorname{tr}(\mathbf{I}-\mathbf{H}) = n-pX\mathbf{X} de rango de columna completo
Media y covarianza de b\mathbf{b} (Teorema 7.8)E{b}=βE\{\mathbf{b}\} = \boldsymbol{\beta}, Cov{b}=σ2(XX)1\operatorname{Cov}\{\mathbf{b}\} = \sigma^2(\mathbf{X}'\mathbf{X})^{-1}E{ε}=0E\{\boldsymbol{\varepsilon}\}=\mathbf{0}, Cov{ε}=σ2I\operatorname{Cov}\{\boldsymbol{\varepsilon}\}=\sigma^2\mathbf{I}
Distribución muestral (Teorema 7.8)bN(β,σ2(XX)1)\mathbf{b} \sim N(\boldsymbol{\beta}, \sigma^2(\mathbf{X}'\mathbf{X})^{-1})errores también normales
Insesgadez del MSE (Teorema 7.9)E{SSE}=(np)σ2E\{\mathrm{SSE}\} = (n-p)\sigma^2, así que E{MSE}=σ2E\{\mathrm{MSE}\} = \sigma^2Cov{ε}=σ2I\operatorname{Cov}\{\boldsymbol{\varepsilon}\}=\sigma^2\mathbf{I}
Gauss-Markov (Teorema 7.10)b\mathbf{b} es el mejor estimador lineal insesgado de β\boldsymbol{\beta}E{ε}=0E\{\boldsymbol{\varepsilon}\}=\mathbf{0}, Cov{ε}=σ2I\operatorname{Cov}\{\boldsymbol{\varepsilon}\}=\sigma^2\mathbf{I}; sin normalidad
Coeficiente de determinaciónR2=1SSE/SSTOR^2 = 1 - \mathrm{SSE}/\mathrm{SSTO} (Dwaine 0.9167)descriptivo, cualquier ajuste

Términos clave. modelo lineal general, matriz de diseño, ecuaciones normales, estimador de mínimos cuadrados, espacio de columnas, matriz sombrero, matriz idempotente, rango de columna completo, grados de libertad del error, mejor estimador lineal insesgado (MELI).

Ahora deberías poder.

Dónde encaja esto. Este capítulo es el motor general para la etapa AJUSTAR del flujo de trabajo del curso (El flujo de trabajo del modelado): estima los coeficientes y la varianza del error para un modelo de cualquier tamaño, reemplazando el álgebra predictor por predictor de los Capítulos 2 y 3 con una fórmula que una computadora puede correr para diez predictores tan fácilmente como para uno. También arma la etapa VERIFICAR, porque la matriz sombrero H\mathbf{H} es el objeto que el Capítulo 9 (9. Diagnósticos del modelo) convierte en los valores de apalancamiento y las medidas de influencia, y la etapa USAR, porque Cov{b}\operatorname{Cov}\{\mathbf{b}\} es lo que el Capítulo 8 convierte en pruebas e intervalos. El Capítulo 8 toma el ajuste de Dwaine construido aquí, interpreta cada coeficiente con cuidado, y desarrolla la maquinaria de sumas de cuadrados extra y de la prueba lineal general (8.3 Sumas de cuadrados adicionales) que decide qué predictores necesita un modelo.

7.9 Preguntas frecuentes

P1. ¿Por qué la matriz de diseño necesita una columna de unos? La columna de unos permite que el intercepto β0\beta_0 se maneje como cualquier otro coeficiente: su “valor de predictor” es 1 para cada observación, así que β01\beta_0 \cdot 1 es la misma base para cada fila. Sin ella el plano ajustado sería forzado a pasar por el origen. La primera ecuación normal, que viene de esa columna, es exactamente ei=0\sum e_i = 0.

P2. ¿Qué significa rango de columna completo, y qué se rompe sin él? Rango de columna completo significa que ninguna columna de predictor es una combinación lineal de las demás (incluida la columna de unos). Si una lo es, digamos un predictor registrado tanto en metros como en pies, entonces XX\mathbf{X}'\mathbf{X} es singular y (XX)1(\mathbf{X}'\mathbf{X})^{-1} no existe, así que no hay un b\mathbf{b} único: infinitos vectores de coeficientes ajustan igual de bien. El software entonces descarta una columna o devuelve un error. Las casi-violaciones (predictores muy correlacionados) son multicolinealidad, el tema del Capítulo 12.

P3. ¿Vale la pena calcular la matriz sombrero para datos reales? Como matriz completa n×nn \times n, por lo general no; el software obtiene los valores ajustados y los residuos de forma más barata. Pero sus entradas diagonales hiih_{ii}, los valores de apalancamiento, se calculan y usan constantemente en los diagnósticos, y su álgebra (simétrica, idempotente, traza pp) es lo que hace funcionar la teoría. Piensa en H\mathbf{H} como una herramienta de demostración y una fuente de los valores de apalancamiento, no como algo que imprimes.

P4. ¿Por qué el divisor es npn - p y no n1n - 1 o nn? Cada parámetro que estimas usa un grado de libertad antes de medir los residuos. Una varianza muestral estima una cantidad (la media) y divide entre n1n - 1; una regresión con pp parámetros divide entre npn - p. La derivación por traza de 7.5 Estimación de la varianza del error muestra E{SSE}=(np)σ2E\{\mathrm{SSE}\} = (n - p)\sigma^2 exactamente, así que npn - p es el único divisor que hace insesgado al MSE\mathrm{MSE}. Dividir entre nn (la elección de máxima verosimilitud) es sesgado hacia abajo.

P5. ¿Necesito errores normales para algo de esto? No, para la mayoría no. El estimador b\mathbf{b}, su insesgadez, su covarianza σ2(XX)1\sigma^2(\mathbf{X}'\mathbf{X})^{-1}, la insesgadez del MSE\mathrm{MSE}, y la optimalidad de Gauss-Markov se cumplen todas solo con errores de media cero, varianza constante e incorrelacionados. La normalidad es un supuesto extra, usado para obtener la distribución muestral normal multivariante exacta de b\mathbf{b} y las pruebas tt y FF del Capítulo 8.

P6. Los coeficientes de Dwaine de la fórmula matricial y de lm coincidieron exactamente. ¿Eso está siempre garantizado? Sí, salvo diferencias diminutas de punto flotante. Ambos calculan el mismo (XX)1XY(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y}; lm y statsmodels usan una rutina más estable numéricamente (una descomposición QR o SVD) en vez de formar la inversa explícitamente, lo cual importa solo para diseños mal condicionados. Para datos bien portados como estos, cada dígito impreso coincide.

P7. ¿Por qué las dos estimaciones de pendiente de Dwaine están correlacionadas negativamente en la Figure 10? Porque los dos predictores están ellos mismos correlacionados positivamente entre ciudades. Cuando una muestra hace que la pendiente de población salga alta, el ajuste compensa haciendo que la pendiente de ingreso salga baja para evitar contar dos veces la señal compartida. Ese intercambio es exactamente la entrada fuera de la diagonal de σ2(XX)1\sigma^2(\mathbf{X}'\mathbf{X})^{-1}, y es por lo que no puedes leer la incertidumbre de un coeficiente sin toda la matriz de covarianza.

7.10 Problemas de práctica

  1. (A) Escribe el modelo de Dwaine en la forma Y=Xβ+ε\mathbf{Y} = \mathbf{X}\boldsymbol{\beta} + \boldsymbol{\varepsilon}, dando las dimensiones de cada uno de los cuatro objetos y describiendo la primera columna de X\mathbf{X}.

  2. (A) Explica en una oración cada uno qué representan XX\mathbf{X}'\mathbf{X} y XY\mathbf{X}'\mathbf{Y}, y por qué las ecuaciones normales los usan.

  3. (A) Enuncia los dos supuestos de error E{ε}=0E\{\boldsymbol{\varepsilon}\} = \mathbf{0} y Cov{ε}=σ2I\operatorname{Cov}\{\boldsymbol{\varepsilon}\} = \sigma^2\mathbf{I} en palabras simples, diciendo qué codifican la diagonal y la fuera de la diagonal de σ2I\sigma^2\mathbf{I} cada una.

  4. (A) En la imagen de proyección, ¿qué es el espacio de columnas de X\mathbf{X}, dónde queda Y^\hat{\mathbf{Y}}, y en qué dirección apunta el residuo? Responde sin fórmulas.

  5. (A) Da las tres propiedades de la matriz sombrero demostradas en este capítulo y di qué significa cada una geométricamente.

  6. (A) ¿Por qué el divisor en MSE\mathrm{MSE} es igual a npn - p? Responde nombrando qué cuenta el número pp y qué cuenta npn - p.

  7. (A) Un colega dice “con normalidad el estimador de mínimos cuadrados es MELI; sin ella, no lo es”. Corrige el enunciado, nombrando exactamente qué supuestos usa el teorema de Gauss-Markov.

  8. (A) Explica por qué XX\mathbf{X}\mathbf{X}' (una matriz n×nn \times n) no puede reemplazar a XX\mathbf{X}'\mathbf{X} en las ecuaciones normales.

  9. (B) Partiendo de Q(b)=(YXb)(YXb)Q(\mathbf{b}) = (\mathbf{Y} - \mathbf{X}\mathbf{b})'(\mathbf{Y} - \mathbf{X}\mathbf{b}), expándela, toma el gradiente, y deriva las ecuaciones normales y b=(XX)1XY\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} (Teorema 7.3). Justifica por qué el punto estacionario es un mínimo.

  10. (B) Demuestra la identidad de proyección YXb2=e2+X(bb)2\|\mathbf{Y} - \mathbf{X}\mathbf{b}^{\ast}\|^2 = \|\mathbf{e}\|^2 + \|\mathbf{X}(\mathbf{b} - \mathbf{b}^{\ast})\|^2 para cualquier b\mathbf{b}^{\ast}, mostrando que el término cruzado se anula, y concluye que b\mathbf{b} minimiza de forma única el SSE.

  11. (B) Demuestra que H=X(XX)1X\mathbf{H} = \mathbf{X}(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' es simétrica e idempotente (Teorema 7.7). Luego demuestra que IH\mathbf{I} - \mathbf{H} también es simétrica e idempotente.

  12. (B) Demuestra tr(H)=p\operatorname{tr}(\mathbf{H}) = p usando la propiedad cíclica de la traza, y deduce tr(IH)=np\operatorname{tr}(\mathbf{I} - \mathbf{H}) = n - p.

  13. (B) Muestra HX=X\mathbf{H}\mathbf{X} = \mathbf{X} y úsalo para demostrar (IH)X=0(\mathbf{I} - \mathbf{H})\mathbf{X} = \mathbf{0}. Explica en palabras por qué la matriz sombrero deja sin cambio las columnas de X\mathbf{X}.

  14. (B) Deriva E{b}=βE\{\mathbf{b}\} = \boldsymbol{\beta} y Cov{b}=σ2(XX)1\operatorname{Cov}\{\mathbf{b}\} = \sigma^2(\mathbf{X}'\mathbf{X})^{-1} (Teorema 7.8), nombrando los hechos de vectores aleatorios que usas en cada paso. Luego, agregando el supuesto εN(0,σ2I)\boldsymbol{\varepsilon} \sim N(\mathbf{0}, \sigma^2\mathbf{I}), enuncia la distribución muestral completa de b\mathbf{b} y explica por qué la media y la covarianza no necesitaron normalidad pero este enunciado distribucional sí.

  15. (B) Demuestra el lema de la forma cuadrática E{YAY}=tr(AΣ)+μAμE\{\mathbf{Y}'\mathbf{A}\mathbf{Y}\} = \operatorname{tr}(\mathbf{A}\boldsymbol{\Sigma}) + \boldsymbol{\mu}'\mathbf{A}\boldsymbol{\mu}, y luego úsalo para mostrar E{SSE}=(np)σ2E\{\mathrm{SSE}\} = (n - p)\sigma^2 (Teorema 7.9).

  16. (B) Enuncia y demuestra el teorema de Gauss-Markov en forma matricial (Teorema 7.10). ¿Dónde en la demostración entra el supuesto Cov{ε}=σ2I\operatorname{Cov}\{\boldsymbol{\varepsilon}\} = \sigma^2\mathbf{I}, y dónde entra el rango de columna completo?

  17. (B) Para el diseño de regresión simple X=[1,x]\mathbf{X} = [\mathbf{1}, \mathbf{x}], calcula XX\mathbf{X}'\mathbf{X}, su determinante, y (XX)1(\mathbf{X}'\mathbf{X})^{-1}, y deriva b1=Sxy/Sxxb_1 = S_{xy}/S_{xx} y b0=Yˉb1Xˉb_0 = \bar{Y} - b_1\bar{X} a partir de la fórmula matricial.

  18. (B) Usando la reducción del problema 17, deriva Var{b1}=σ2/Sxx\operatorname{Var}\{b_1\} = \sigma^2/S_{xx} y Var{b0}=σ2(1/n+Xˉ2/Sxx)\operatorname{Var}\{b_0\} = \sigma^2(1/n + \bar{X}^2/S_{xx}) a partir de σ2(XX)1\sigma^2(\mathbf{X}'\mathbf{X})^{-1}.

  19. (B) Muestra que Cov{e,Y^}=0\operatorname{Cov}\{\mathbf{e}, \hat{\mathbf{Y}}\} = \mathbf{0} bajo el modelo, usando Y^=HY\hat{\mathbf{Y}} = \mathbf{H}\mathbf{Y}, e=(IH)Y\mathbf{e} = (\mathbf{I} - \mathbf{H})\mathbf{Y}, y H(IH)=0\mathbf{H}(\mathbf{I} - \mathbf{H}) = \mathbf{0}. ¿Por qué importa esto para los diagnósticos?

  20. (B) Demuestra que agregar un predictor (una columna nueva a X\mathbf{X}) no puede aumentar el SSE\mathrm{SSE}, usando el argumento de proyección de que agrandar el espacio de columnas solo puede acercar Y^\hat{\mathbf{Y}} a Y\mathbf{Y}.

  21. (C) Lee dwaine.csv, construye X\mathbf{X} y Y\mathbf{Y}, y calcula b\mathbf{b} a partir de (XX)1XY(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} en R o Python. Confirma que tu respuesta coincide con lm / smf.ols.

  22. (C) Para el ajuste de Dwaine, calcula el vector de residuos y verifica numéricamente que Xe=0\mathbf{X}'\mathbf{e} = \mathbf{0} (las tres entradas) y que Y^i=Yi\sum \hat{Y}_i = \sum Y_i.

  23. (C) Construye la matriz sombrero de Dwaine y verifica que es simétrica e idempotente y tiene traza 3. Luego reporta las cinco entradas diagonales hiih_{ii} más grandes y di qué indica un hiih_{ii} grande sobre los predictores de esa ciudad.

  24. (C) Calcula SSE\mathrm{SSE}, MSE\mathrm{MSE} y ss para Dwaine de dos maneras: a partir del vector de residuos, y de summary / .summary2(). Luego calcula SSE/n\mathrm{SSE}/n y reporta el porcentaje en que subestima al MSE\mathrm{MSE}.

  25. (C) Calcula la matriz de covarianza estimada MSE(XX)1\mathrm{MSE}\,(\mathbf{X}'\mathbf{X})^{-1} para Dwaine, reporta los tres errores estándar, y confirma que coinciden con el resumen incorporado. Reporta la correlación entre las dos estimaciones de pendiente a partir de la entrada fuera de la diagonal.

  26. (C) Reajusta Toluca a través de las fórmulas matriciales y confirma b0=62.3659b_0 = 62.3659, b1=3.5702b_1 = 3.5702, MSE=2383.72\mathrm{MSE} = 2383.72, y los dos errores estándar, coincidiendo con el Capítulo 2 hasta el último dígito.

  27. (C) Escribe una simulación (semilla 4210) que extraiga 2000 conjuntos de datos del modelo ajustado de Dwaine, reajuste cada uno, y reporte la media de las 2000 estimaciones de cada coeficiente (verificando la insesgadez) y la desviación estándar de la pendiente de población objetivo (verificando Cov{b}\operatorname{Cov}\{\mathbf{b}\}).

  28. (C) Haz la regresión de sales de Dwaine sobre targtpop sola, luego sobre targtpop y dispoinc juntas, y confirma numéricamente que agregar dispoinc baja el SSE\mathrm{SSE}. Relaciona la caída con el argumento de proyección del problema 20.

7.11 Práctica de examen

EP 7.1 (interpretar la salida en contexto). Un colega ajusta el modelo de Dwaine en R y lee la tabla de coeficientes.

            Estimate Std. Error t value Pr(>|t|)
(Intercept) -68.8571    60.0170 -1.1473   0.2663
targtpop      1.4546     0.2118  6.8682   0.0000
dispoinc      9.3655     4.0640  2.3045   0.0333

Interpreta el coeficiente de targtpop y su valor tt en el contexto de las ventas del estudio, siendo explícito sobre qué se mantiene fijo. Luego evalúa la conclusión del colega: “el intercepto tiene p=0.27p = 0.27, así que no es significativamente distinto de cero, lo que significa que el modelo está mal especificado y deberíamos quitar el intercepto”. Di si la conclusión es correcta y por qué.

EP 7.2 (explicar por qué, y qué cambiaría si). Explica con oraciones completas por qué el divisor en MSE=SSE/(np)\mathrm{MSE} = \mathrm{SSE}/(n - p) es npn - p y no nn. Luego responde un “qué cambiaría si”: supón que un analista siguió agregando predictores a los datos de Dwaine hasta que el modelo tuvo p=21p = 21 parámetros, uno por cada observación. Describe qué le pasa al SSE\mathrm{SSE}, al divisor, y al MSE\mathrm{MSE}, y explica por qué un ajuste con SSE=0\mathrm{SSE} = 0 es una advertencia y no un éxito.

EP 7.3 (un estudiante afirma X, evalúa). Un estudiante escribe: “Agregar un predictor nunca puede aumentar el SSE\mathrm{SSE}, y siempre sube el R2R^2. Así que la mejor estrategia es seguir agregando predictores hasta que el R2R^2 esté lo más cerca posible de 1”. Usando la imagen de proyección de los mínimos cuadrados, evalúa las dos afirmaciones factuales y la estrategia que respaldan.

EP 7.4 (interpretar salida calculada en contexto). Los valores de apalancamiento hiih_{ii} son las entradas diagonales de la matriz sombrero H=X(XX)1X\mathbf{H} = \mathbf{X}(\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}' para el ajuste de Dwaine. Los seis más grandes, y una verificación de su suma, están abajo.

row 20  targtpop=  82.7  dispoinc= 19.1  h_ii=0.2788
row 13  targtpop=  88.4  dispoinc= 17.4  h_ii=0.2390
row 15  targtpop=  52.5  dispoinc= 17.8  h_ii=0.2095
row  3  targtpop=  91.3  dispoinc= 18.2  h_ii=0.1737
row  5  targtpop=  46.9  dispoinc= 17.3  h_ii=0.1620
row 19  targtpop=  89.6  dispoinc= 18.1  h_ii=0.1611
sum(h_ii) = 3.0000     mean(targtpop)=62.02  mean(dispoinc)=17.14

Explica qué dice un hiih_{ii} grande sobre una ciudad, e interpreta por qué la fila 20 tiene el valor de apalancamiento más grande aunque su población objetivo (82.7) no es la más grande en los datos. Luego explica por qué los valores de apalancamiento suman exactamente 3, y usa el corte de regla empírica 2p/n=0.2862p/n = 0.286 para decir si alguna ciudad de Dwaine debería llamarse un punto de alto apalancamiento.

EP 7.5 (qué cambiaría si). Un analista reexpresa la población objetivo en cientos de personas en vez de miles, multiplicando cada valor de targtpop por 10, y reajusta. Las dos tablas de coeficientes están abajo.

original                              rescaled
             Estimate Std. Error       Estimate Std. Error
(Intercept)  -68.8571    60.0170       -68.8571    60.0170
targtpop       1.4546     0.2118        0.1455     0.0212
dispoinc       9.3655     4.0640        9.3655     4.0640
original  MSE=121.16  R2=0.9167     rescaled  MSE=121.16  R2=0.9167

Explica, con oraciones completas y con referencia al álgebra del modelo, por qué el coeficiente de población objetivo y su error estándar se dividen ambos entre 10 mientras que su valor tt, los valores ajustados, el MSE\mathrm{MSE}, y el R2R^2 quedan todos sin cambio. ¿Qué te dice esto sobre leer el tamaño de un coeficiente como una medida de la importancia de un predictor?

7.12 Juego del capítulo