Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

2. Regresión lineal simple

La Toluca Company fabrica equipos de refrigeración y las piezas de repuesto que los mantienen funcionando. Una pieza se había producido durante mucho tiempo en lotes, o tandas, del tamaño que en cada momento pareciera conveniente. Cuando la empresa inició una revisión para reducir costos, sus ingenieros quisieron resolver una pregunta básica: ¿qué tamaño de lote es el más barato de producir? Cada corrida de producción conlleva un costo fijo de preparación que no depende del tamaño del lote, más el trabajo de maquinado y ensamble que crece con el número de piezas. Para encontrar el punto óptimo, los ingenieros necesitaban primero un ingrediente: ¿cómo dependen las horas de trabajo que consume una corrida del tamaño del lote?

Extrajeron los registros de 25 corridas recientes realizadas bajo condiciones estables a lo largo de un periodo de seis meses. Cada registro es un par: el tamaño del lote (unidades producidas) y las horas de trabajo que tomó la corrida. Los tamaños de lote son todos múltiplos de diez, una conveniencia de programación, y van de 20 a 120 unidades. La dispersión de estos 25 puntos es la imagen inicial de todo el capítulo.

Diagrama de dispersión de las 25 corridas de producción de Toluca, con las horas de trabajo en el eje vertical frente al tamaño del lote en el eje horizontal, y una recta ascendente ajustada a través de la nube de puntos. Las horas de trabajo suben desde unas 110 con un tamaño de lote de 20 hasta más de 500 con un tamaño de lote de 120, y los puntos se dispersan de forma bastante pareja a ambos lados de la recta.

Figure 1:Las 25 corridas de Toluca con la recta de mínimos cuadrados trazada a través de ellas. Los lotes más grandes toman más horas, la tendencia parece recta, y la dispersión alrededor de la recta tiene un ancho más o menos igual en todo el rango, que es justamente la situación que modela este capítulo.

Dos cosas resaltan en la Figure 1. Los lotes más grandes toman más horas, y la nube de puntos está lo bastante cerca de una recta como para que una recta sea un resumen razonable. Pero ¿cuál recta? Un ingeniero podría poner una regla sobre el gráfico y trazar una a ojo, y un segundo ingeniero trazaría una un poco distinta. Este capítulo reemplaza la regla por una regla en el otro sentido: una receta precisa y defendible para la única mejor recta, un recuento honesto de cuánto confiar en ella, y los supuestos que hacen válida toda la empresa. Al terminar podrás ajustar esa recta, leer su pendiente en las unidades del problema (horas por unidad de tamaño de lote), decir qué tan incierta es la pendiente, y demostrar que, bajo las condiciones establecidas, ningún método competidor lo hace mejor.

El flujo de trabajo del modelado

Cada capítulo de este libro es una vuelta por el mismo ciclo de cinco etapas. Nombrar las etapas ahora te da un mapa para llevar a lo largo de todo el curso, y cada capítulo posterior comienza diciendo a qué etapa sirve.

Un anillo de cinco cajas redondeadas unidas por flechas en sentido horario: PREGUNTAR (pregunta y datos), EXPLORAR (graficar y resumir), AJUSTAR (estimar el modelo), VERIFICAR (¿confiar en el ajuste?) y USAR (interpretar y predecir). Una flecha punteada se curva desde VERIFICAR de regreso a AJUSTAR, con la etiqueta una verificación fallida te devuelve.

Figure 2:Las cinco etapas como un solo ciclo. Avanzas en sentido horario de PREGUNTAR a USAR, y una VERIFICACIÓN fallida no termina el trabajo: la flecha punteada te devuelve a AJUSTAR o EXPLORAR con un mejor modelo.

Como muestra la Figure 2, las etapas forman un ciclo, no una calle de un solo sentido: una VERIFICACIÓN fallida te devuelve a EXPLORAR o AJUSTAR con un mejor modelo. La regresión lineal simple es el viaje completo más pequeño alrededor de este ciclo, y por eso el curso empieza aquí.

2.1 El modelo de regresión lineal simple

Intuición

La regresión parte de una idea sencilla: una cosa tiende a moverse con otra, y queremos precisar esa relación en números. Aquí describimos cómo una respuesta YY (horas de trabajo de Toluca) depende de un solo predictor XX (tamaño del lote). Ningún modelo sensato afirma que las horas son una función exacta del tamaño del lote: dos corridas del mismo tamaño tomaron cantidades de tiempo distintas, por el desgaste de las herramientas, el turno de trabajadores, el clima y cientos de pequeñas cosas que nadie registró. Así que dividimos cada observación en dos piezas: una parte sistemática que el tamaño del lote explica, y una parte aleatoria que no.

La parte sistemática es una recta. En promedio, una corrida de tamaño XX toma cierta cantidad base de tiempo más un número fijo de horas extra por cada unidad adicional. La parte aleatoria es una perturbación que empuja las horas reales por encima o por debajo de ese promedio. Suponemos que la perturbación no tiene una tendencia incorporada a ser positiva o negativa, tiene el mismo tamaño típico sin importar el tamaño del lote, y no se coordina de una corrida a la siguiente.

Fórmula

El modelo de regresión lineal simple (simple linear regression model) (Definición 2.1) para las observaciones i=1,,ni = 1, \dots, n es

Yi=β0+β1Xi+εi.Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i .

Los parámetros β0\beta_0 y β1\beta_1 son números fijos que no conocemos y queremos estimar. El modelo impone cuatro condiciones sobre los errores:

E{εi}=0,Var{εi}=σ2,Cov{εi,εj}=0 (ij).E\{\varepsilon_i\} = 0, \qquad \operatorname{Var}\{\varepsilon_i\} = \sigma^2, \qquad \operatorname{Cov}\{\varepsilon_i, \varepsilon_j\} = 0 \ (i \neq j).

En palabras: cada error promedia a cero (la recta es correcta en promedio), todo error tiene la misma varianza σ2\sigma^2 (dispersión constante, llamada homocedasticidad), y errores distintos no están correlacionados (la suerte de una corrida no dice nada sobre la de otra). Nota lo que todavía no se supone: ninguna forma particular para la distribución del error. La normalidad entra solo en 2.6 Máxima verosimilitud bajo errores normales, y solo cuando queremos construir intervalos y pruebas.

Como XiX_i es una constante fija y β0+β1Xi\beta_0 + \beta_1 X_i es por lo tanto también constante, las condiciones sobre los errores se transfieren directamente a las respuestas:

E{Yi}=β0+β1Xi,Var{Yi}=σ2.E\{Y_i\} = \beta_0 + \beta_1 X_i, \qquad \operatorname{Var}\{Y_i\} = \sigma^2 .

La cantidad E{Yi}E\{Y_i\} es la respuesta media (mean response) al nivel XiX_i. La función E{Y}=β0+β1XE\{Y\} = \beta_0 + \beta_1 X que da la respuesta media en cualquier XX es la función de regresión (regression function) (Definición 2.2). Es una recta, y estimarla es todo el juego.

La Figure 3 es la imagen mental que hay que llevar a lo largo del capítulo: una recta media, con una distribución de posibles valores de YY apilados en cada XX, cada pila del mismo ancho.

Una recta ascendente etiquetada como la recta media E de Y igual a beta-cero más beta-uno X, con tres curvas de campana idénticas dibujadas de lado en tres tamaños de lote. Cada campana está centrada en la recta y tiene el mismo ancho, mostrando que la respuesta varía alrededor de la recta por la misma cantidad en cada tamaño de lote.

Figure 3:El modelo en una sola imagen: la media de Y queda exactamente sobre la recta, y en cada X la respuesta se dispersa alrededor de esa media por la misma cantidad. Las campanas se dibujan idénticas a propósito: ese es el supuesto de varianza constante.

2.2 Mínimos cuadrados desde los primeros principios

Intuición

Tenemos una nube de puntos y queremos la única recta que mejor se ajusta. “Mejor” necesita una definición. Los mínimos cuadrados la definen penalizando los fallos: para una recta candidata, mide la brecha vertical de cada punto a la recta, eleva al cuadrado las brechas para que pasarse y quedarse corto cuenten ambos como errores y los fallos grandes duelan de forma desproporcionada, y súmalas. La mejor recta es la que hace este total, la suma de los errores al cuadrado, lo más pequeño posible. La Figure 4 muestra la idea con tres rectas candidatas a través de los datos de Toluca.

El diagrama de dispersión de Toluca con tres rectas candidatas: una recta sólida de mínimos cuadrados a través del centro de la nube, una recta punteada demasiado plana que queda por encima de los puntos bajos y por debajo de los altos, y una recta de guiones demasiado empinada que hace lo contrario. Una leyenda reporta la SSE de cada recta, con el valor de la recta de mínimos cuadrados el más pequeño, de unos 54,825.

Figure 4:Tres rectas candidatas y sus sumas de errores al cuadrado. Las rectas demasiado plana y demasiado empinada dejan grandes brechas verticales y una SSE grande; la recta de mínimos cuadrados atraviesa la nube y tiene la SSE más pequeña de cualquier recta.

Fórmula

Escribe una recta candidata con intercepto b0b_0 y pendiente b1b_1. Su suma de errores al cuadrado (sum of squared errors) (Definición 2.3) es

Q(b0,b1)=i=1n(Yib0b1Xi)2.Q(b_0, b_1) = \sum_{i=1}^{n} \left( Y_i - b_0 - b_1 X_i \right)^2 .

Las estimaciones de mínimos cuadrados b0b_0 y b1b_1 son los valores que minimizan QQ. Para escribirlas de forma compacta, define las tres sumas básicas de cuadrados y productos cruzados alrededor de las medias:

Sxx=i=1n(XiXˉ)2,Sxy=i=1n(XiXˉ)(YiYˉ),Syy=i=1n(YiYˉ)2,S_{xx} = \sum_{i=1}^{n} (X_i - \bar{X})^2, \qquad S_{xy} = \sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y}), \qquad S_{yy} = \sum_{i=1}^{n} (Y_i - \bar{Y})^2,

donde Xˉ\bar{X} y Yˉ\bar{Y} son las medias muestrales del predictor y la respuesta. Las dos derivaciones siguientes establecen los minimizadores, enunciados aquí primero.

Derivación por cálculo

Demostración (por cálculo). Q(b0,b1)Q(b_0, b_1) es una suma de cuadrados, así que es suave y está acotada inferiormente por cero. En un mínimo, ambas derivadas parciales se anulan. Deriva:

Qb0=i=1n2(Yib0b1Xi)(1),Qb1=i=1n2(Yib0b1Xi)(Xi).\frac{\partial Q}{\partial b_0} = \sum_{i=1}^{n} 2\left(Y_i - b_0 - b_1 X_i\right)(-1), \qquad \frac{\partial Q}{\partial b_1} = \sum_{i=1}^{n} 2\left(Y_i - b_0 - b_1 X_i\right)(-X_i).

Igualando cada una a cero y dividiendo entre -2 se obtienen las ecuaciones normales (normal equations):

i=1n(Yib0b1Xi)=0,i=1nXi(Yib0b1Xi)=0.\sum_{i=1}^n \left(Y_i - b_0 - b_1 X_i\right) = 0, \qquad \sum_{i=1}^n X_i\left(Y_i - b_0 - b_1 X_i\right) = 0 .

Desarrolla las sumas. La primera ecuación se convierte en Yi=nb0+b1Xi\sum Y_i = n b_0 + b_1 \sum X_i, y dividiendo entre nn da Yˉ=b0+b1Xˉ\bar{Y} = b_0 + b_1 \bar{X}, de modo que

b0=Yˉb1Xˉ.b_0 = \bar{Y} - b_1 \bar{X}.

Sustituye esto en la segunda ecuación normal XiYi=b0Xi+b1Xi2\sum X_i Y_i = b_0 \sum X_i + b_1 \sum X_i^2. Reemplazando b0b_0 y agrupando los términos de b1b_1,

XiYiYˉXi=b1(Xi2XˉXi).\sum X_i Y_i - \bar{Y}\sum X_i = b_1\left(\sum X_i^2 - \bar{X}\sum X_i\right).

El lado izquierdo es igual a XiYinXˉYˉ=(XiXˉ)(YiYˉ)=Sxy\sum X_i Y_i - n \bar{X}\bar{Y} = \sum (X_i - \bar X)(Y_i - \bar Y) = S_{xy}, y el corchete del lado derecho es igual a Xi2nXˉ2=(XiXˉ)2=Sxx\sum X_i^2 - n\bar{X}^2 = \sum (X_i - \bar X)^2 = S_{xx}. Por lo tanto

b1=SxySxx.b_1 = \frac{S_{xy}}{S_{xx}} .

Este es el único punto estacionario, y es un mínimo por el criterio de las segundas derivadas para una función de dos variables (la misma prueba que usarías en cálculo para una variable, extendida a dos). Las tres segundas derivadas parciales de QQ son constantes: Qb0b0=2nQ_{b_0 b_0} = 2n, Qb1b1=2Xi2Q_{b_1 b_1} = 2\sum X_i^2 y Qb0b1=2XiQ_{b_0 b_1} = 2\sum X_i. Forma la cantidad de prueba D=Qb0b0Qb1b1(Qb0b1)2=4(nXi2(Xi)2)=4nSxxD = Q_{b_0 b_0}\,Q_{b_1 b_1} - (Q_{b_0 b_1})^2 = 4\big(n\sum X_i^2 - (\sum X_i)^2\big) = 4n\,S_{xx}. Como D>0D > 0 siempre que los XiX_i no sean todos iguales, y Qb0b0=2n>0Q_{b_0 b_0} = 2n > 0, el punto estacionario es un mínimo local. Como QQ es una suma de cuadrados (así que está acotada inferiormente por cero) y este es su único punto estacionario, ese mínimo local es también el mínimo global. (El Capítulo 7 revisita este mismo hecho en forma matricial, una vez que tengas las herramientas del Capítulo 6.) \blacksquare

Derivación por una identidad algebraica

El argumento de cálculo encuentra el minimizador pero deja la geometría un poco oculta. Aquí hay una segunda demostración que no usa derivadas y muestra directamente que ninguna recta le gana a la recta de mínimos cuadrados. Descansa sobre dos hechos que demostraremos en 2.3 Valores ajustados y las propiedades de los residuos: escribiendo los valores ajustados como Y^i=b0+b1Xi\hat{Y}_i = b_0 + b_1 X_i y los residuos como ei=YiY^ie_i = Y_i - \hat{Y}_i, los residuos cumplen ei=0\sum e_i = 0 y Xiei=0\sum X_i e_i = 0.

Demostración (por una identidad algebraica). Toma cualquier recta competidora con intercepto aa y pendiente cc. Divide la brecha de cada punto a esa recta pasándola por el valor ajustado de mínimos cuadrados:

YiacXi=(YiY^i)ei+(Y^iacXi)gi,gi=(b0a)+(b1c)Xi.Y_i - a - c X_i = \underbrace{(Y_i - \hat{Y}_i)}_{e_i} + \underbrace{(\hat{Y}_i - a - c X_i)}_{g_i}, \qquad g_i = (b_0 - a) + (b_1 - c) X_i .

Eleva al cuadrado y suma. La suma de errores al cuadrado de la recta competidora es

(YiacXi)2=ei2+gi2+2eigi.\sum \left(Y_i - a - c X_i\right)^2 = \sum e_i^2 + \sum g_i^2 + 2 \sum e_i g_i .

El término cruzado se anula:

eigi=(b0a)ei+(b1c)Xiei=(b0a)0+(b1c)0=0.\sum e_i g_i = (b_0 - a)\sum e_i + (b_1 - c)\sum X_i e_i = (b_0 - a)\cdot 0 + (b_1 - c)\cdot 0 = 0 .

Así que para toda recta competidora,

(YiacXi)2=ei2SSE de la recta MC+gi2    ei2,\sum \left(Y_i - a - c X_i\right)^2 = \underbrace{\sum e_i^2}_{\text{SSE de la recta MC}} + \sum g_i^2 \; \ge \; \sum e_i^2 ,

con igualdad solo cuando gi2=0\sum g_i^2 = 0, es decir cuando gi=0g_i = 0 para todo ii, lo cual (dado que los XiX_i no son todos iguales) fuerza a=b0a = b_0 y c=b1c = b_1. La recta de mínimos cuadrados es el minimizador único. \blacksquare

Las dos ecuaciones normales tienen una imagen limpia. Cada una es una recta en el plano (b0,b1)(b_0, b_1), y las estimaciones de mínimos cuadrados están donde se cruzan, en el fondo del tazón de SSE. La Figure 5 muestra el tazón y la Figure 6 lo muestra desde arriba.

Una gráfica de superficie tridimensional de la SSE como función del intercepto b0 y la pendiente b1, con forma de tazón o valle suave. Un punto rojo marca el único punto más bajo del tazón, etiquetado como el mínimo en b0 alrededor de 62.4 y b1 alrededor de 3.57.

Figure 5:Como la SSE es una función convexa (con forma de tazón) del intercepto y la pendiente, tiene exactamente un punto más bajo, y ese punto es la solución de mínimos cuadrados. No hay otros valles en los que quedar atrapado.

Un mapa de contorno de la SSE sobre el intercepto b0 (horizontal) y la pendiente b1 (vertical), que muestra contornos elípticos anidados. Dos rectas, una punteada para la primera ecuación normal y una de guiones para la segunda, se cruzan en una estrella roja que marca el mínimo en intercepto alrededor de 62.4 y pendiente alrededor de 3.57.

Figure 6:La misma superficie de SSE vista directamente desde arriba. Cada ecuación normal es una recta en el plano (b0, b1); las dos rectas se intersecan en la estrella, las estimaciones de mínimos cuadrados, situadas en el centro del contorno más interno.

R

Ajustar el modelo en R usa lm, que lee una fórmula response ~ predictor. Primero lee los datos y míralos.

toluca <- read.csv("data/toluca.csv")
dim(toluca)
head(toluca, 3)
[1] 25  2
  lotsize hours
1      80   399
2      30   121
3      50   221

Poder reproducir lm a partir de las sumas crudas SxxS_{xx} y SxyS_{xy} importa: significa que puedes calcular una regresión en cualquier lugar, verificar la salida del software y, más adelante, extender la idea cuando no haya un botón lm para el modelo que necesitas.

Vale la pena calcular los conjuntos de datos pequeños a mano una vez, para que las fórmulas dejen de ser cajas negras. El archivo toluca_mini.csv es un recorte de seis filas de los datos de Toluca, lo bastante pequeño para hacerlo en papel. La Figure 7 muestra sus puntos y sus desviaciones respecto a las medias, la materia prima de SxxS_{xx} y SxyS_{xy}.

Un diagrama de dispersión de seis puntos del conjunto de datos de cómputo a mano con una recta vertical de guiones en el tamaño medio del lote y una recta horizontal de guiones en las horas medias de trabajo, que dividen el plano en cuadrantes. Para cada punto, segmentos cortos horizontales y verticales muestran sus desviaciones respecto a las dos medias; los puntos en los cuadrantes superior derecho e inferior izquierdo (productos cruzados positivos) son verdes, y son la mayoría.

Figure 7:Los seis puntos de cómputo a mano con la cruz de las medias trazada. La desviación horizontal de un punto por su desviación vertical es su contribución a Sxy; la mayoría de los puntos caen en los dos cuadrantes donde ese producto es positivo, así que Sxy y la pendiente salen positivas.

Antes de aceptar las fórmulas por confianza, dedica un minuto a intentar ganarles a mano.

Dos deslizadores fijan tu propio intercepto b0b_0 y tu pendiente b1b_1 sobre las 25 corridas de Toluca. Los valores comparan la Q(b0,b1)Q(b_0, b_1) que logra tu recta contra el valor más pequeño que puede lograr cualquier recta.

Qué observar. Ningún par de posiciones lleva QQ por debajo de 54,825.554{,}825.5, y las que más se acercan marcan 62.5 y 3.57, las estimaciones de mínimos cuadrados. Prueba esto. Deja la pendiente en 3.57 y mueve solo el intercepto: la suma de residuos cruza cero justo en la posición donde QQ toca fondo, que es la primera ecuación normal ocurriendo frente a ti. Volver a la Sección 2.2.

2.3 Valores ajustados y las propiedades de los residuos

Intuición

Una vez fijada la recta, cada punto observado se divide en dos partes. El valor ajustado (fitted value) Y^i\hat{Y}_i (Definición 2.5) es donde la recta dice que debería estar el punto; el residuo (residual) ei=YiY^ie_i = Y_i - \hat{Y}_i es qué tan lejos cae el punto real de él. Los residuos son las sobras del modelo, la parte de YY que el tamaño del lote no explicó. La Figure 9 los dibuja como los palitos verticales que conectan cada punto con la recta. No son solo decoración: los mínimos cuadrados fuerzan a los residuos a cumplir identidades algebraicas exactas, y esas identidades son a la vez una herramienta de demostración y una forma práctica de atrapar un error en un ajuste.

El diagrama de dispersión de Toluca con la recta ajustada y un segmento vertical de cada punto a la recta. Los puntos por encima de la recta, con residuos positivos, se dibujan como círculos naranjas con segmentos naranjas; los puntos por debajo de la recta, con residuos negativos, se dibujan como cuadrados morados con segmentos morados. Por encima y por debajo de la recta los segmentos se ven equilibrados en longitud total.

Figure 9:Cada residuo es la distancia vertical con signo de un punto a la recta ajustada: positivo (naranja, arriba) o negativo (morado, abajo). Los mínimos cuadrados los equilibran de modo que los residuos con signo suman exactamente cero.

Fórmula

Los valores ajustados y los residuos son

Y^i=b0+b1Xi,ei=YiY^i.\hat{Y}_i = b_0 + b_1 X_i, \qquad e_i = Y_i - \hat{Y}_i .

No confundas eie_i con el error del modelo εi=Yi(β0+β1Xi)\varepsilon_i = Y_i - (\beta_0 + \beta_1 X_i). El error es la brecha a la recta verdadera y desconocida; el residuo es la brecha a nuestra recta estimada. Nunca vemos εi\varepsilon_i, pero siempre podemos calcular eie_i, y es nuestro mejor sustituto. La Figure 10 pone las dos brechas lado a lado para que la diferencia sea imposible de pasar por alto.

Dos diagramas de dispersión lado a lado de los mismos siete puntos. Panel izquierdo: una recta verdadera de guiones etiquetada como desconocida, con segmentos verticales naranjas de cada punto a esa recta, marcados como los errores epsilon i que nunca se observan. Panel derecho: una recta ajustada sólida etiquetada como calculada, con segmentos verticales rojos de cada punto a esa recta, marcados como los residuos e i que siempre se pueden calcular.

Figure 10:La única distinción que hay que tener clara: el error es la brecha a la recta verdadera que nunca podemos ver (izquierda), y el residuo es la brecha a la recta ajustada que calculamos a partir de los datos (derecha). Mismos puntos, dos rectas distintas, dos brechas distintas.

Derivación (propiedades de los residuos)

Demostración. Todas ellas se siguen de las dos ecuaciones normales de 2.2 Mínimos cuadrados desde los primeros principios.

  1. Los residuos suman cero. La primera ecuación normal es exactamente (Yib0b1Xi)=ei=0\sum (Y_i - b_0 - b_1 X_i) = \sum e_i = 0.

  2. El predictor es ortogonal a los residuos. La segunda ecuación normal es exactamente Xi(Yib0b1Xi)=Xiei=0\sum X_i (Y_i - b_0 - b_1 X_i) = \sum X_i e_i = 0.

  3. Los valores ajustados son ortogonales a los residuos. Usando las propiedades 1 y 2, Y^iei=(b0+b1Xi)ei=b0ei+b1Xiei=0\sum \hat{Y}_i e_i = \sum (b_0 + b_1 X_i) e_i = b_0 \sum e_i + b_1 \sum X_i e_i = 0.

  4. Los valores ajustados reproducen el total de YY. De la propiedad 1, ei=(YiY^i)=0\sum e_i = \sum (Y_i - \hat{Y}_i) = 0, así que Y^i=Yi\sum \hat{Y}_i = \sum Y_i, y dividiendo entre nn, el valor ajustado medio es igual a Yˉ\bar{Y}.

  5. La recta pasa por el centro de los datos. Poniendo X=XˉX = \bar{X} en la recta ajustada y usando b0=Yˉb1Xˉb_0 = \bar{Y} - b_1 \bar{X} da Y^=b0+b1Xˉ=Yˉ\hat{Y} = b_0 + b_1 \bar{X} = \bar{Y}. Así que (Xˉ,Yˉ)(\bar{X}, \bar{Y}) está siempre sobre la recta de mínimos cuadrados. \blacksquare

La propiedad 1 es por qué los palitos verticales de la Figure 9 se equilibran. Las propiedades 1 y 2 fueron los ingredientes que hicieron desaparecer el término cruzado en la demostración algebraica de 2.2 Mínimos cuadrados desde los primeros principios, así que las identidades pagan el préstamo que tomamos allí.

R y Python

Un gráfico de los residuos contra el predictor es la primera imagen que hay que trazar después de cualquier ajuste. Si se cumplen los supuestos de varianza constante y de recta del modelo, los residuos deberían moverse alrededor de cero sin tendencia y sin abanicarse, como en la Figure 11. Una curva señalaría que la relación no es recta; un embudo que se ensancha señalaría varianza no constante. El Capítulo 9 construye un juego de herramientas de diagnóstico completo sobre este único hábito.

Un diagrama de dispersión de los residuos de Toluca en el eje vertical contra el tamaño del lote en el eje horizontal, con una recta horizontal de referencia de guiones en cero. Los puntos se dispersan por encima y por debajo de cero sin una tendencia clara y con un ancho más o menos parejo en todos los tamaños de lote.

Figure 11:Los residuos de Toluca graficados contra el tamaño del lote. Quedan en una banda plana y sin patrón alrededor de cero, sin forma de embudo, que es la imagen que apoya los supuestos de recta y de varianza constante.

Las identidades del Teorema 2.6 son exactas, así que la forma más rápida de creerlas es intentar romper una.

Arrastra cualquiera de las seis corridas del cálculo a mano a donde quieras. La recta se reajusta al instante, y los cuatro valores siguen ei\sum e_i, Xiei\sum X_i e_i, la media de YY y la media de Y^\hat{Y}.

Qué observar. Por mucho que destroces los datos, ei\sum e_i y Xiei\sum X_i e_i se quedan en cero y la media de Y^\hat{Y} sigue igual a Yˉ\bar{Y}. Prueba esto. Arrastra una corrida hasta lo más alto del gráfico: los residuos se vuelven enormes, el ajuste queda inservible, y las identidades no se mueven, y por eso verifican tu aritmética y nunca tu modelo. Volver a la Sección 2.3.

2.4 Estimar la varianza del error

Intuición

La pendiente y el intercepto describen la recta, pero el modelo tiene una tercera incógnita: σ2\sigma^2, la varianza de los errores, que controla qué tan estrechamente los puntos abrazan la recta. Una σ2\sigma^2 pequeña significa que las predicciones pueden ser afiladas; una grande significa que incluso una recta perfecta deja mucha incertidumbre. No podemos ver los errores εi\varepsilon_i, pero los residuos eie_i son sus sustitutos visibles, así que estimamos σ2\sigma^2 a partir de la dispersión de los residuos. La Figure 13 muestra cómo se ve esa dispersión como una banda alrededor de la recta ajustada.

El diagrama de dispersión de Toluca con la recta ajustada y dos bandas sombreadas a su alrededor, una banda interior más oscura de más menos una desviación estándar estimada s y una banda exterior más clara de más menos dos s. La mayoría de los puntos caen dentro de la banda interior y casi todos dentro de la exterior. Un histograma incrustado en la esquina muestra los residuos dispersos de forma simétrica alrededor de cero.

Figure 13:La dispersión del error estimada s = 48.8 horas dibujada como bandas alrededor de la recta ajustada. Cerca de dos tercios de las corridas caen dentro de una s de la recta y casi todas dentro de dos s; s resume el ancho del histograma de residuos del recuadro.

Fórmula

La suma de cuadrados del error (error sum of squares) (Definición 2.7) y el estimador de σ2\sigma^2 son

SSE=i=1nei2=i=1n(YiY^i)2,s2=MSE=SSEn2,s=MSE.\mathrm{SSE} = \sum_{i=1}^{n} e_i^2 = \sum_{i=1}^{n} (Y_i - \hat{Y}_i)^2, \qquad s^2 = \mathrm{MSE} = \frac{\mathrm{SSE}}{n-2}, \qquad s = \sqrt{\mathrm{MSE}} .

El divisor es n2n-2, no nn ni n1n-1. Dos grados de libertad se gastan estimando los dos coeficientes b0b_0 y b1b_1 que definen la recta desde la que se miden los residuos. La siguiente derivación muestra que este divisor exacto, y ningún otro, hace que MSE\mathrm{MSE} sea correcto en promedio.

Derivación (por qué el divisor es n2n-2)

Demostración. Mostramos que E{SSE}=(n2)σ2E\{\mathrm{SSE}\} = (n-2)\sigma^2, de modo que dividir entre n2n-2 da un estimador que es correcto en promedio. Parte de una identidad ordenada para la SSE. Como Y^i=Yˉ+b1(XiXˉ)\hat{Y}_i = \bar{Y} + b_1(X_i - \bar{X}) (usando b0=Yˉb1Xˉb_0 = \bar{Y} - b_1 \bar X),

ei=YiY^i=(YiYˉ)b1(XiXˉ),e_i = Y_i - \hat{Y}_i = (Y_i - \bar{Y}) - b_1 (X_i - \bar{X}),

así que, desarrollando el cuadrado y usando Sxy=b1SxxS_{xy} = b_1 S_{xx},

SSE=ei2=Syy2b1Sxy+b12Sxx=Syy2b1(b1Sxx)+b12Sxx=Syyb12Sxx.\mathrm{SSE} = \sum e_i^2 = S_{yy} - 2 b_1 S_{xy} + b_1^2 S_{xx} = S_{yy} - 2 b_1 (b_1 S_{xx}) + b_1^2 S_{xx} = S_{yy} - b_1^2 S_{xx}.

Toma esperanzas de las dos piezas. Para cualquier variable aleatoria, E{W2}=Var{W}+(E{W})2E\{W^2\} = \operatorname{Var}\{W\} + (E\{W\})^2.

La pieza de la pendiente. Mostramos en 2.5 Comportamiento muestral y el teorema de Gauss-Markov que E{b1}=β1E\{b_1\} = \beta_1 y Var{b1}=σ2/Sxx\operatorname{Var}\{b_1\} = \sigma^2 / S_{xx}. Por lo tanto

E{b12Sxx}=Sxx(Var{b1}+(E{b1})2)=Sxx(σ2Sxx+β12)=σ2+β12Sxx.E\{b_1^2 S_{xx}\} = S_{xx}\left(\operatorname{Var}\{b_1\} + (E\{b_1\})^2\right) = S_{xx}\left(\frac{\sigma^2}{S_{xx}} + \beta_1^2\right) = \sigma^2 + \beta_1^2 S_{xx}.

La pieza total. Escribe Syy=Yi2nYˉ2S_{yy} = \sum Y_i^2 - n\bar{Y}^2. Cada YiY_i tiene media μi=β0+β1Xi\mu_i = \beta_0 + \beta_1 X_i y varianza σ2\sigma^2, así que E{Yi2}=σ2+μi2E\{Y_i^2\} = \sigma^2 + \mu_i^2 y E{Yi2}=nσ2+μi2E\{\sum Y_i^2\} = n\sigma^2 + \sum \mu_i^2. La media muestral Yˉ\bar{Y} tiene media μˉ=β0+β1Xˉ\bar{\mu} = \beta_0 + \beta_1 \bar{X} y varianza σ2/n\sigma^2/n, así que E{nYˉ2}=n(σ2/n+μˉ2)=σ2+nμˉ2E\{n\bar{Y}^2\} = n(\sigma^2/n + \bar{\mu}^2) = \sigma^2 + n\bar{\mu}^2. Restando,

E{Syy}=nσ2+μi2σ2nμˉ2=(n1)σ2+(μi2nμˉ2).E\{S_{yy}\} = n\sigma^2 + \sum \mu_i^2 - \sigma^2 - n\bar{\mu}^2 = (n-1)\sigma^2 + \left(\sum \mu_i^2 - n\bar{\mu}^2\right).

El corchete final es (μiμˉ)2=(β1(XiXˉ))2=β12Sxx\sum (\mu_i - \bar{\mu})^2 = \sum \big(\beta_1 (X_i - \bar{X})\big)^2 = \beta_1^2 S_{xx}. Así que E{Syy}=(n1)σ2+β12SxxE\{S_{yy}\} = (n-1)\sigma^2 + \beta_1^2 S_{xx}.

Combinar. Restando la pieza de la pendiente de la pieza total,

E{SSE}=E{Syy}E{b12Sxx}=[(n1)σ2+β12Sxx][σ2+β12Sxx]=(n2)σ2.E\{\mathrm{SSE}\} = E\{S_{yy}\} - E\{b_1^2 S_{xx}\} = \big[(n-1)\sigma^2 + \beta_1^2 S_{xx}\big] - \big[\sigma^2 + \beta_1^2 S_{xx}\big] = (n-2)\sigma^2 .

Por lo tanto E{MSE}=E{SSE}/(n2)=σ2E\{\mathrm{MSE}\} = E\{\mathrm{SSE}\}/(n-2) = \sigma^2: el divisor n2n-2 es exactamente lo que hace que MSE\mathrm{MSE} sea un estimador insesgado de σ2\sigma^2. \blacksquare

R y Python

El Teorema 2.8 dice que el divisor n2n-2 es el que acierta en promedio, y el muestreo repetido es la manera de ver cómo se asienta esa afirmación.

Cada muestra son 25 corridas nuevas de un modelo cuya varianza del error es de verdad σ2=2383.4\sigma^2 = 2383.4. El histograma reúne MSE=SSE/(n2)\mathrm{MSE} = \mathrm{SSE}/(n-2), y los valores muestran lo que da cada divisor en promedio.

Qué observar. Los valores individuales de MSE\mathrm{MSE} se dispersan mucho, la mayoría cae entre unos 1200 y unos 4000, y aun así su promedio camina firme hacia 2383.4. Prueba esto. Presiona Tomar 1000 dos veces y compara las dos medias: el divisor n2n-2 cae en σ2\sigma^2 mientras que el divisor nn se queda cerca de 8 por ciento por debajo por muchas muestras que agregues, y eso es lo que significa el sesgo. Volver a la Sección 2.4.

2.5 Comportamiento muestral y el teorema de Gauss-Markov

Intuición

Las estimaciones b0b_0 y b1b_1 se calculan a partir de una muestra particular de 25 corridas. Otras 25 corridas, hechas bajo las mismas condiciones, darían estimaciones un poco distintas. Así que b0b_0 y b1b_1 son en sí mismos aleatorios: tienen distribuciones, llamadas distribuciones muestrales, a lo largo de las muestras repetidas que podríamos haber extraído. La Figure 15 lo hace concreto simulando 60 muestras nuevas en los tamaños de lote de Toluca y ajustando cada una: las rectas ajustadas se dispersan alrededor de la recta media verdadera, y se abren más donde XX está lejos de Xˉ\bar{X}.

La región de graficado muestra sesenta rectas ajustadas azules tenues, cada una de una muestra simulada distinta usando los mismos tamaños de lote, que forman un haz angosto cerca del tamaño de lote medio y se abren hacia ambos extremos. Una recta roja gruesa, la recta media verdadera, recorre el centro del haz. Una recta vertical punteada marca el tamaño de lote medio donde el haz es más estrecho.

Figure 15:Sesenta muestras, sesenta rectas ajustadas. Se agrupan alrededor de la recta media verdadera (roja) sin ningún desplazamiento sistemático, y el haz se estrecha en el tamaño de lote medio y se ensancha en los extremos, que es exactamente lo que predicen las fórmulas de varianza.

Dos preguntas organizan esta sección. ¿Son b0b_0 y b1b_1 correctos en promedio (insesgados)? ¿Y cuánto varían de muestra a muestra (sus varianzas)? El teorema de Gauss-Markov entonces entrega una recompensa fuerte: entre todos los estimadores sensatos que uno podría inventar, los mínimos cuadrados tienen la varianza más pequeña.

Fórmula

Ambos estimadores son insesgados, y sus varianzas son

E{b1}=β1,Var{b1}=σ2Sxx;E{b0}=β0,Var{b0}=σ2(1n+Xˉ2Sxx).E\{b_1\} = \beta_1, \quad \operatorname{Var}\{b_1\} = \frac{\sigma^2}{S_{xx}}; \qquad E\{b_0\} = \beta_0, \quad \operatorname{Var}\{b_0\} = \sigma^2\left(\frac{1}{n} + \frac{\bar{X}^2}{S_{xx}}\right).

La Figure 16 hace visible el primer hecho. Cuando los tamaños de lote están apiñados, un poco de ruido inclina la pendiente descontroladamente; cuando están muy dispersos, el mismo ruido apenas la mueve.

Dos gráficos lado a lado, cada uno mostrando cuarenta rectas ajustadas azules tenues de muestras repetidas más una recta verdadera roja gruesa, con marcas verdes a lo largo de la parte inferior que muestran dónde están los tamaños de lote. Panel izquierdo, tamaños de lote apiñados cerca del centro, Sxx pequeño de 407: las rectas azules se abren en un haz ancho y tembloroso, error estándar de la pendiente 2.23. Panel derecho, tamaños de lote dispersos de 20 a 120, Sxx grande de 10185: las rectas azules se agrupan estrechamente alrededor de la recta verdadera, error estándar de la pendiente 0.45.

Figure 16:Por qué dispersar X compra precisión. Ambos paneles usan la misma recta verdadera y el mismo tamaño de error; solo difiere la dispersión de los tamaños de lote. Una dispersión amplia (derecha) hace grande a Sxx, y como la varianza de la pendiente es sigma al cuadrado sobre Sxx, la pendiente queda fijada mucho más estrechamente.

Reemplazar la desconocida σ2\sigma^2 por su estimación MSE\mathrm{MSE} da las varianzas estimadas s2{b1}=MSE/Sxxs^2\{b_1\} = \mathrm{MSE}/S_{xx} y s2{b0}=MSE(1/n+Xˉ2/Sxx)s^2\{b_0\} = \mathrm{MSE}\big(1/n + \bar{X}^2/S_{xx}\big), cuyas raíces cuadradas son los errores estándar s{b1}s\{b_1\} y s{b0}s\{b_0\} que el software imprime.

Derivación (insesgadez y varianzas)

Demostración (media y varianza de b1b_1). La clave es escribir b1b_1 como una suma ponderada de las respuestas. Como (XiXˉ)Yˉ=0\sum (X_i - \bar{X}) \bar{Y} = 0,

b1=SxySxx=(XiXˉ)(YiYˉ)Sxx=i=1nkiYi,ki=XiXˉSxx.b_1 = \frac{S_{xy}}{S_{xx}} = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{S_{xx}} = \sum_{i=1}^n k_i Y_i, \qquad k_i = \frac{X_i - \bar{X}}{S_{xx}} .

Los pesos kik_i dependen solo de los valores fijos de XX y cumplen tres hechos, cada uno un cálculo de una línea:

ki=(XiXˉ)Sxx=0,kiXi=(XiXˉ)XiSxx=SxxSxx=1,ki2=(XiXˉ)2Sxx2=1Sxx.\sum k_i = \frac{\sum (X_i - \bar X)}{S_{xx}} = 0, \qquad \sum k_i X_i = \frac{\sum (X_i - \bar X)X_i}{S_{xx}} = \frac{S_{xx}}{S_{xx}} = 1, \qquad \sum k_i^2 = \frac{\sum (X_i - \bar X)^2}{S_{xx}^2} = \frac{1}{S_{xx}} .

Insesgadez. Usando E{Yi}=β0+β1XiE\{Y_i\} = \beta_0 + \beta_1 X_i,

E{b1}=kiE{Yi}=β0ki+β1kiXi=β0(0)+β1(1)=β1.E\{b_1\} = \sum k_i E\{Y_i\} = \beta_0 \sum k_i + \beta_1 \sum k_i X_i = \beta_0 (0) + \beta_1 (1) = \beta_1 .

Varianza. Los YiY_i no están correlacionados con varianza común σ2\sigma^2, así que las varianzas de una suma ponderada se suman con pesos al cuadrado:

Var{b1}=ki2Var{Yi}=σ2ki2=σ2Sxx.\operatorname{Var}\{b_1\} = \sum k_i^2 \operatorname{Var}\{Y_i\} = \sigma^2 \sum k_i^2 = \frac{\sigma^2}{S_{xx}} . \qquad \blacksquare

Demostración (media y varianza de b0b_0). Escribe b0=Yˉb1Xˉ=miYib_0 = \bar{Y} - b_1 \bar{X} = \sum m_i Y_i con mi=1nXˉkim_i = \tfrac{1}{n} - \bar{X} k_i. Entonces mi=1\sum m_i = 1 y miXi=XˉXˉ=0\sum m_i X_i = \bar X - \bar X = 0, así que E{b0}=β0mi+β1miXi=β0E\{b_0\} = \beta_0 \sum m_i + \beta_1 \sum m_i X_i = \beta_0. Para la varianza, usando ki=0\sum k_i = 0 y ki2=1/Sxx\sum k_i^2 = 1/S_{xx},

Var{b0}=σ2mi2=σ2(1nXˉki)2=σ2(1n2Xˉnki+Xˉ2ki2)=σ2(1n+Xˉ2Sxx).\operatorname{Var}\{b_0\} = \sigma^2 \sum m_i^2 = \sigma^2 \sum \left(\frac{1}{n} - \bar{X} k_i\right)^2 = \sigma^2 \left(\frac{1}{n} - \frac{2\bar X}{n}\sum k_i + \bar{X}^2 \sum k_i^2\right) = \sigma^2 \left(\frac{1}{n} + \frac{\bar{X}^2}{S_{xx}}\right). \qquad \blacksquare

Derivación (Gauss-Markov: b1b_1 es BLUE)

Demostración. Considera cualquier estimador lineal β^1=ciYi\hat\beta_1^{\ast} = \sum c_i Y_i con pesos fijos cic_i. Su esperanza es ci(β0+β1Xi)=β0ci+β1ciXi\sum c_i(\beta_0 + \beta_1 X_i) = \beta_0 \sum c_i + \beta_1 \sum c_i X_i. Para que esto sea igual a β1\beta_1 para todo posible β0\beta_0 y β1\beta_1, los pesos deben cumplir

ci=0yciXi=1.\sum c_i = 0 \qquad \text{y} \qquad \sum c_i X_i = 1 .

Escribe ci=ki+dic_i = k_i + d_i, dividiendo cada peso en el peso de mínimos cuadrados kik_i y una desviación did_i. Como tanto cic_i como kik_i cumplen las dos restricciones de insesgadez, las desviaciones cumplen di=0\sum d_i = 0 y diXi=0\sum d_i X_i = 0. Ahora el término cruzado desaparece:

kidi=XiXˉSxxdi=1Sxx(XidiXˉdi)=1Sxx(00)=0.\sum k_i d_i = \sum \frac{X_i - \bar X}{S_{xx}} d_i = \frac{1}{S_{xx}}\left(\sum X_i d_i - \bar X \sum d_i\right) = \frac{1}{S_{xx}}(0 - 0) = 0 .

Por lo tanto

Var{β^1}=σ2ci2=σ2(ki+di)2=σ2ki2+σ2di2=Var{b1}+σ2di2.\operatorname{Var}\{\hat\beta_1^{\ast}\} = \sigma^2 \sum c_i^2 = \sigma^2 \sum (k_i + d_i)^2 = \sigma^2 \sum k_i^2 + \sigma^2 \sum d_i^2 = \operatorname{Var}\{b_1\} + \sigma^2 \sum d_i^2 .

Como σ2di20\sigma^2 \sum d_i^2 \ge 0, todo competidor lineal insesgado tiene varianza al menos la de b1b_1, con igualdad solo cuando todos los di=0d_i = 0, es decir cuando el competidor es b1b_1. La pendiente de mínimos cuadrados es BLUE. El mismo argumento con los pesos mim_i muestra que b0b_0 es BLUE. \blacksquare

R y Python

Las fórmulas de varianza no son solo álgebra; describen el haz que se abre de rectas en la Figure 15. Podemos confirmar tanto la insesgadez como la fórmula de la varianza de la pendiente por simulación, extrayendo 5000 muestras del modelo estimado y reajustando cada una. La Figure 17 muestra el histograma de las 5000 estimaciones de pendiente.

Un histograma de 5000 estimaciones de pendiente simuladas, con forma más o menos de campana y centrado cerca de 3.57. Una curva normal superpuesta con desviación estándar 0.347 coincide de cerca con el histograma. Una recta vertical roja de guiones marca la pendiente verdadera 3.5702 y una recta verde punteada marca la media de las estimaciones, y las dos rectas casi coinciden.

Figure 17:Cinco mil estimaciones de pendiente simuladas. Su promedio cae sobre la pendiente verdadera (las rectas de guiones y punteada casi coinciden), confirmando la insesgadez, y su dispersión coincide con la curva teórica sigma sobre raíz de Sxx, confirmando la fórmula de la varianza.

set.seed(4210)
beta0 <- 62.366; beta1 <- 3.5702; sigma <- 48.82
xfix <- toluca$lotsize
Sxx_fix <- sum((xfix - mean(xfix))^2)
b1_sim <- replicate(5000, {
  ysim <- beta0 + beta1 * xfix + rnorm(length(xfix), 0, sigma)
  coef(lm(ysim ~ xfix))[["xfix"]]
})
round(c(mean_of_b1_hats = mean(b1_sim),
        true_beta1 = beta1,
        sd_of_b1_hats = sd(b1_sim),
        formula_se = sqrt(sigma^2 / Sxx_fix)), 4)
mean_of_b1_hats      true_beta1   sd_of_b1_hats      formula_se
         3.5699          3.5702          0.3479          0.3469
rng = np.random.default_rng(4210)
beta0, beta1, sigma = 62.366, 3.5702, 48.82
xfix = toluca["lotsize"].to_numpy()
Sxx_fix = np.sum((xfix - xfix.mean()) ** 2)
b1_hats = np.empty(5000)
for i in range(5000):
    ysim = beta0 + beta1 * xfix + rng.normal(0, sigma, size=xfix.size)
    b1_hats[i] = np.polyfit(xfix, ysim, 1)[0]
print(round(b1_hats.mean(), 4), beta1,
      round(b1_hats.std(ddof=1), 4),
      round(np.sqrt(sigma ** 2 / Sxx_fix), 4))
3.5675 3.5702 0.352 0.3469

El promedio de las 5000 estimaciones de pendiente queda justo sobre β1=3.5702\beta_1 = 3.5702 (insesgadez), y su desviación estándar simulada, 0.348 en R y 0.352 en Python, coincide con el valor de la fórmula σ/Sxx=0.347\sigma/\sqrt{S_{xx}} = 0.347. Los dos lenguajes difieren solo en el último dígito porque usan generadores de números aleatorios distintos; la coincidencia con la teoría es lo importante.

El haz de rectas ajustadas de la Figure 15 se cree mucho mejor cuando lo construyes una muestra a la vez.

Cada muestra reutiliza los 25 tamaños de lote de Toluca con errores nuevos alrededor de la recta 62.366+3.5702X62.366 + 3.5702X. La franja de arriba es la muestra más reciente de horas de trabajo; el histograma de abajo reúne la pendiente ajustada b1b_1 de todas ellas.

Qué observar. Toma muestras de una en una y ninguna b1b_1 es igual a 3.5702, y aun así el montón que construyen queda centrado ahí. Prueba esto. Presiona Tomar 1000 y compara el valor DE de b1b_1 con σ/Sxx=0.3469\sigma/\sqrt{S_{xx}} = 0.3469 que está a su lado: la fórmula de la varianza del Teorema 2.9 no es una aproximación, es el ancho de este montón. Volver a la Sección 2.5.

2.6 Máxima verosimilitud bajo errores normales

Intuición

Hasta ahora elegimos los mínimos cuadrados porque el error al cuadrado es una penalización razonable, y Gauss-Markov premió esa elección con la propiedad de mejor-lineal-insesgado, todo sin suponer ninguna forma para la distribución del error. Ahora supón que añadimos un supuesto: los errores están distribuidos normalmente. Un principio distinto, la máxima verosimilitud, pregunta qué valores de los parámetros hacen más probables los datos que realmente observamos. De forma notable, bajo errores normales ese principio apunta a la mismísima recta. La Figure 19 muestra los dos criterios, la suma de errores al cuadrado y el logaritmo de verosimilitud negativo, tocando fondo exactamente en la misma pendiente.

Un gráfico con la pendiente b1 en el eje horizontal y dos curvas que comparten un minimizador común. Una curva azul sólida en forma de U es la SSE, leída en el eje izquierdo; una curva naranja de guiones en forma de U es el logaritmo de verosimilitud negativo, leído en el eje derecho. Una recta vertical roja punteada en pendiente alrededor de 3.57 pasa por el fondo de ambas curvas, etiquetada como el minimizador compartido.

Figure 19:Los mínimos cuadrados y la máxima verosimilitud son la misma optimización vestida de forma distinta. La curva de SSE y la curva del logaritmo de verosimilitud negativo alcanzan su mínimo en la pendiente idéntica, así que elegir la recta de máxima verosimilitud es elegir la recta de mínimos cuadrados.

Fórmula

El modelo de regresión con errores normales (normal error regression model) (Definición 2.11) conserva todo lo de 2.1 El modelo de regresión lineal simple y añade una forma:

Yi=β0+β1Xi+εi,εiiidN(0,σ2).Y_i = \beta_0 + \beta_1 X_i + \varepsilon_i, \qquad \varepsilon_i \overset{\text{iid}}{\sim} N(0, \sigma^2) .

Bajo normalidad los errores no correlacionados ahora son plenamente independientes. La verosimilitud (likelihood) es la densidad conjunta de los YiY_i observados leída como función de los parámetros:

L(β0,β1,σ2)=i=1n12πσ2exp ⁣((Yiβ0β1Xi)22σ2).L(\beta_0, \beta_1, \sigma^2) = \prod_{i=1}^n \frac{1}{\sqrt{2\pi\sigma^2}}\exp\!\left(-\frac{(Y_i - \beta_0 - \beta_1 X_i)^2}{2\sigma^2}\right) .

Derivación (la máxima verosimilitud es igual a los mínimos cuadrados)

Demostración. Maximizar LL es más fácil a través de su logaritmo, que se maximiza en el mismo lugar porque log\log es creciente:

lnL=n2ln(2π)n2lnσ212σ2i=1n(Yiβ0β1Xi)2.\ln L = -\frac{n}{2}\ln(2\pi) - \frac{n}{2}\ln \sigma^2 - \frac{1}{2\sigma^2}\sum_{i=1}^n (Y_i - \beta_0 - \beta_1 X_i)^2 .

Coeficientes. Fija cualquier σ2>0\sigma^2 > 0. Los dos primeros términos no involucran a β0\beta_0 ni a β1\beta_1, y el último término tiene 1/(2σ2)<0-1/(2\sigma^2) < 0 multiplicando a (Yiβ0β1Xi)2\sum (Y_i - \beta_0 - \beta_1 X_i)^2. Maximizar lnL\ln L sobre β0,β1\beta_0, \beta_1 por lo tanto significa minimizar esa suma de cuadrados, que es exactamente el criterio de mínimos cuadrados QQ de 2.2 Mínimos cuadrados desde los primeros principios. Así que las estimaciones de máxima verosimilitud de los coeficientes son las estimaciones de mínimos cuadrados:

β^0MLE=b0,β^1MLE=b1.\hat\beta_0^{\text{MLE}} = b_0, \qquad \hat\beta_1^{\text{MLE}} = b_1 .

Varianza. Sustituye b0,b1b_0, b_1 para que la suma de cuadrados se convierta en SSE\mathrm{SSE}, luego deriva lnL\ln L respecto a σ2\sigma^2 e iguala a cero:

lnLσ2=n2σ2+SSE2σ4=0σ^MLE2=SSEn.\frac{\partial \ln L}{\partial \sigma^2} = -\frac{n}{2\sigma^2} + \frac{\mathrm{SSE}}{2\sigma^4} = 0 \quad\Longrightarrow\quad \hat\sigma^2_{\text{MLE}} = \frac{\mathrm{SSE}}{n} .

La estimación de varianza de máxima verosimilitud divide entre nn, no entre n2n-2. De 2.4 Estimar la varianza del error sabemos que el divisor nn es sesgado bajo, subestimando σ2\sigma^2, porque ignora los dos grados de libertad gastados en b0b_0 y b1b_1. Por eso el libro, y toda la inferencia del Capítulo 3, usa el MSE=SSE/(n2)\mathrm{MSE} = \mathrm{SSE}/(n-2) insesgado en lugar del σ^MLE2\hat\sigma^2_{\text{MLE}} de máxima verosimilitud. \blacksquare

R y Python

2.7 Resumen del capítulo

Este capítulo construyó una regresión lineal simple desde cero y demostró las propiedades que la hacen confiable. Partiendo del modelo Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i y sus tres supuestos sobre los errores, definimos el criterio de mínimos cuadrados y derivamos los estimadores de dos formas independientes, por cálculo a través de las ecuaciones normales y por una identidad algebraica que muestra que ninguna otra recta tiene una SSE menor. Los residuos obedecen identidades exactas que sirven a la vez como verificación de corrección; la varianza del error se estima con MSE=SSE/(n2)\mathrm{MSE} = \mathrm{SSE}/(n-2), cuyo divisor n2n-2 es exactamente lo que la hace insesgada. Tratar b0b_0 y b1b_1 como aleatorios a lo largo de muestras repetidas dio sus medias y varianzas, el teorema de Gauss-Markov mostró que son los mejores entre los estimadores lineales insesgados sin necesidad de normalidad, y la máxima verosimilitud bajo errores normales reprodujo la mismísima recta.

Resultados clave de un vistazo

ResultadoEnunciado o fórmulaVálido cuando
Estimaciones de mínimos cuadrados (Teorema 2.4)b1=Sxy/Sxxb_1 = S_{xy}/S_{xx},  b0=Yˉb1Xˉ\ b_0 = \bar{Y} - b_1\bar{X}los XiX_i no son todos iguales
Identidades de los residuos (Teorema 2.6)ei=0\sum e_i = 0,  Xiei=0\ \sum X_i e_i = 0,  Y^iei=0\ \sum \hat{Y}_i e_i = 0,  Y^i=Yi\ \sum \hat{Y}_i = \sum Y_icualquier ajuste de mínimos cuadrados con intercepto
Estimación de la varianza del errors2=MSE=SSE/(n2)s^2 = \mathrm{MSE} = \mathrm{SSE}/(n-2), con SSE=Syyb12Sxx\mathrm{SSE} = S_{yy} - b_1^2 S_{xx}modelo RLS
Insesgadez del MSE (Teorema 2.8)E{SSE}=(n2)σ2E\{\mathrm{SSE}\} = (n-2)\sigma^2, así que E{MSE}=σ2E\{\mathrm{MSE}\} = \sigma^2errores de media cero, varianza constante, no correlacionados
Medias y varianzas (Teorema 2.9)E{b1}=β1, Var{b1}=σ2/SxxE\{b_1\}=\beta_1,\ \operatorname{Var}\{b_1\}=\sigma^2/S_{xx};  E{b0}=β0, Var{b0}=σ2(1/n+Xˉ2/Sxx)\ E\{b_0\}=\beta_0,\ \operatorname{Var}\{b_0\}=\sigma^2(1/n+\bar{X}^2/S_{xx})modelo RLS
Teorema de Gauss-Markov (Teorema 2.10)b0,b1b_0, b_1 son BLUE (varianza mínima entre los estimadores lineales insesgados)modelo RLS, sin normalidad requerida
Máxima verosimilitud (Teorema 2.12)Coeficientes MLE =b0,b1= b_0, b_1;  σ^MLE2=SSE/n\ \hat\sigma^2_{\text{MLE}} = \mathrm{SSE}/nmodelo con errores normales

Para los datos de Toluca estos dan b0=62.37b_0 = 62.37, b1=3.5702b_1 = 3.5702, SSE=54,825\mathrm{SSE} = 54{,}825, MSE=2384\mathrm{MSE} = 2384, s=48.82s = 48.82, s{b1}=0.347s\{b_1\} = 0.347, s{b0}=26.18s\{b_0\} = 26.18 y σ^MLE2=2193\hat\sigma^2_{\text{MLE}} = 2193.

Términos clave

Modelo de regresión lineal simple, función de regresión, respuesta media, error aleatorio, criterio de mínimos cuadrados, estimaciones de mínimos cuadrados, ecuaciones normales, valor ajustado, residuo, suma de cuadrados del error (SSE), cuadrado medio del error (MSE), homocedasticidad, estimador insesgado, teorema de Gauss-Markov, mejor estimador lineal insesgado (BLUE), modelo de regresión con errores normales, máxima verosimilitud.

Ahora deberías poder

Dónde encaja esto. Este capítulo es la primera vuelta completa alrededor del flujo de trabajo de El flujo de trabajo del modelado. Llevó la pregunta de Toluca por PREGUNTAR y EXPLORAR, se asentó en AJUSTAR, y dio los primeros pasos hacia VERIFICAR (las identidades de los residuos y el gráfico de residuos) y USAR (leer la pendiente en horas por unidad). El Capítulo 1 argumentó que la regresión es una forma de pensar sobre cómo una cantidad se mueve con otra; este capítulo convirtió esa idea en una recta específica y calculable y demostró las propiedades que la hacen confiable. Todo aquí es estimación puntual: conjeturas únicas y mejores para β0\beta_0, β1\beta_1 y σ2\sigma^2. Lo que todavía no hemos hecho es cuantificar la incertidumbre con intervalos y pruebas. Ese es el Capítulo 3, que toma las distribuciones muestrales bosquejadas aquí, añade el supuesto de errores normales por completo, y construye intervalos tt para la pendiente y el intercepto, la descomposición ANOVA (3.6 El enfoque del análisis de varianza), la prueba FF (3.7 La prueba F y su equivalencia con la prueba t), y la diferencia entre un intervalo de confianza para una respuesta media y un intervalo de predicción para una corrida nueva (3.5 Intervalo de predicción para una observación nueva). El ajuste exacto de Toluca fijado aquí (b1=3.5702b_1 = 3.5702, MSE=2384\mathrm{MSE} = 2384) se traslada sin cambios, ahora con inferencia adjunta. Viaja aún más lejos: el Capítulo 5 vuelve a pasar la misma pendiente por una prueba de permutación (5.2 La prueba de permutación para la pendiente) y compara su valor p con el del Capítulo 3, y en el Capítulo 7 los mismos estimadores reaparecen en forma matricial (7.1 El modelo y los mínimos cuadrados en forma matricial), donde las ecuaciones normales de dos líneas se convierten en una sola ecuación XXb=XY\mathbf{X}'\mathbf{X}\mathbf{b} = \mathbf{X}'\mathbf{Y} y la demostración de Gauss-Markov (7.6 El teorema de Gauss-Markov) se generaliza a cualquier número de predictores a la vez.

2.8 Preguntas frecuentes

P1. ¿Por qué elevar al cuadrado los residuos en lugar de tomar valores absolutos? Ambas son pérdidas razonables. Elevar al cuadrado hace que el objetivo sea suave y diferenciable, así que el cálculo da una solución limpia en forma cerrada (las ecuaciones normales), y es exactamente la pérdida para la cual se cumplen los resultados de Gauss-Markov y de verosimilitud normal. La pérdida de valor absoluto da la regresión de “mínimas desviaciones absolutas”, que es más resistente a los valores atípicos pero no tiene fórmula simple y necesita resolverse iterativamente. El curso empieza con el error al cuadrado porque es donde la teoría es más limpia.

P2. ¿El intercepto b0=62.37b_0 = 62.37 es realmente “horas para producir cero unidades”? No, no de forma significativa. Un tamaño de lote de cero está muy fuera de los datos (la corrida más pequeña fue de 20 unidades), así que el intercepto es una extrapolación. Léelo como el número que ancla la altura de la recta, calculado para que la recta pase por (Xˉ,Yˉ)(\bar{X}, \bar{Y}), no como un tiempo de preparación físico. Interpretar un intercepto literalmente solo tiene sentido cuando X=0X = 0 está dentro del rango observado o cerca de él.

P3. ¿Cuál es la diferencia entre un error εi\varepsilon_i y un residuo eie_i? El error εi=Yi(β0+β1Xi)\varepsilon_i = Y_i - (\beta_0 + \beta_1 X_i) es la brecha a la recta verdadera y desconocida, y nunca podemos observarlo. El residuo ei=YiY^ie_i = Y_i - \hat{Y}_i es la brecha a nuestra recta estimada, y lo calculamos directamente. Los residuos son nuestras estimaciones visibles de los errores invisibles, y por eso estimamos σ2\sigma^2 a partir de ellos.

P4. ¿Por qué dividir la SSE entre n2n-2 y no entre n1n-1 como una varianza muestral ordinaria? Una varianza muestral divide entre n1n-1 porque estima una cantidad, la media, a partir de los datos. La regresión estima dos, el intercepto y la pendiente, antes de medir los residuos, así que gasta dos grados de libertad, dejando n2n-2. La derivación en 2.4 Estimar la varianza del error muestra E{SSE}=(n2)σ2E\{\mathrm{SSE}\} = (n-2)\sigma^2 exactamente, así que n2n-2 es el divisor que hace insesgado a MSE\mathrm{MSE}.

P5. ¿Necesito que los errores sean normales para que los mínimos cuadrados funcionen? No. Las estimaciones de mínimos cuadrados, su insesgadez, sus fórmulas de varianza y la optimalidad de Gauss-Markov se cumplen todas sin ningún supuesto sobre la forma de la distribución del error, solo media cero, varianza constante y errores no correlacionados. La normalidad es un supuesto extra, añadido en 2.6 Máxima verosimilitud bajo errores normales y usado en el Capítulo 3 para construir intervalos y pruebas tt y FF exactos.

P6. ¿Por qué el haz de rectas ajustadas en la Figure 15 se estrecha en el medio? Toda recta de mínimos cuadrados pasa por (Xˉ,Yˉ)(\bar{X}, \bar{Y}) (propiedad 5 de los residuos), así que cerca de Xˉ\bar{X} las rectas solo pueden temblar un poco. Lejos de Xˉ\bar{X}, un pequeño cambio en la pendiente hace pivotar la recta una gran distancia vertical, así que las rectas se abren. La varianza de un valor ajustado crece con la distancia desde Xˉ\bar{X}, lo cual el Capítulo 3 convierte en la forma curva de una banda de confianza.

P7. R imprime 4.45e-10 y Python imprime 4.45e-10 para el valor p de la pendiente, pero no supusimos normalidad. ¿De dónde vino eso? Esos valores p y los valores t de los errores estándar sí usan el modelo de errores normales, y los justificaremos apropiadamente en el Capítulo 3. Este capítulo muestra los errores estándar en sí, que vienen de las fórmulas de varianza y no necesitan normalidad; las estrellas de significancia y los valores p son un adelanto de la inferencia que viene.

2.9 Problemas de práctica

  1. (A) Enuncia el modelo de regresión lineal simple y lista sus tres supuestos sobre los errores, diciendo en una frase qué garantiza cada supuesto.

  2. (A) Explica la diferencia entre la función de regresión E{Y}=β0+β1XE\{Y\} = \beta_0 + \beta_1 X y una recta ajustada Y^=b0+b1X\hat{Y} = b_0 + b_1 X. ¿Cuál involucra parámetros y cuál involucra estimaciones?

  3. (A) En el ajuste de Toluca, interpreta la pendiente 3.5702 en las unidades del problema. ¿Por qué es inseguro usar la recta para predecir horas para un lote de 500 unidades?

  4. (A) Da una interpretación de una oración de s=48.82s = 48.82 horas para un gerente que nunca ha tomado estadística.

  5. (A) ¿Por qué el intercepto de mínimos cuadrados para los datos de Toluca no es un “tiempo de preparación” significativo? ¿Qué tendría que ser cierto de los datos para que un intercepto fuera interpretable?

  6. (A) Sin calcular, enuncia los valores de ei\sum e_i y Xiei\sum X_i e_i para cualquier ajuste de mínimos cuadrados con intercepto, y di qué ecuación normal da cada uno.

  7. (A) Una recta ajustada tiene ei=0\sum e_i = 0 pero Xiei=120\sum X_i e_i = 120. ¿Puede ser un ajuste de mínimos cuadrados? Explica.

  8. (A) Explica por qué dispersar los valores del predictor más lejos entre sí (aumentar SxxS_{xx}) hace más precisa la estimación de la pendiente, refiriéndote a su fórmula de varianza.

  9. (B) Partiendo de Q(b0,b1)=(Yib0b1Xi)2Q(b_0, b_1) = \sum (Y_i - b_0 - b_1 X_i)^2, deriva ambas ecuaciones normales por derivación, y resuélvelas para b0b_0 y b1b_1 (Teorema 2.4).

  10. (B) Demuestra la identidad algebraica (YiacXi)2=SSE+gi2\sum (Y_i - a - cX_i)^2 = \mathrm{SSE} + \sum g_i^2 para una recta arbitraria (a,c)(a, c), identificando gig_i y mostrando que el término cruzado es cero. Concluye que los mínimos cuadrados son el minimizador único.

  11. (B) Muestra que la recta de mínimos cuadrados pasa por (Xˉ,Yˉ)(\bar{X}, \bar{Y}), y que Y^i=Yi\sum \hat{Y}_i = \sum Y_i (Teorema 2.6).

  12. (B) Escribiendo b1=kiYib_1 = \sum k_i Y_i con ki=(XiXˉ)/Sxxk_i = (X_i - \bar{X})/S_{xx}, demuestra ki=0\sum k_i = 0, kiXi=1\sum k_i X_i = 1 y ki2=1/Sxx\sum k_i^2 = 1/S_{xx}, luego úsalos para mostrar E{b1}=β1E\{b_1\} = \beta_1 y Var{b1}=σ2/Sxx\operatorname{Var}\{b_1\} = \sigma^2/S_{xx}.

  13. (B) Deriva Var{b0}=σ2(1/n+Xˉ2/Sxx)\operatorname{Var}\{b_0\} = \sigma^2(1/n + \bar{X}^2/S_{xx}) escribiendo b0=miYib_0 = \sum m_i Y_i con mi=1/nXˉkim_i = 1/n - \bar{X}k_i.

  14. (B) Demuestra el teorema de Gauss-Markov para la pendiente (Teorema 2.10): cualquier estimador lineal insesgado ciYi\sum c_i Y_i de β1\beta_1 tiene varianza al menos σ2/Sxx\sigma^2/S_{xx}, con igualdad solo para b1b_1.

  15. (B) Deriva E{SSE}=(n2)σ2E\{\mathrm{SSE}\} = (n-2)\sigma^2 (Teorema 2.8) usando SSE=Syyb12Sxx\mathrm{SSE} = S_{yy} - b_1^2 S_{xx} y los hechos E{b1}=β1E\{b_1\} = \beta_1, Var{b1}=σ2/Sxx\operatorname{Var}\{b_1\} = \sigma^2/S_{xx}.

  16. (B) Escribe el logaritmo de verosimilitud para el modelo con errores normales y muestra que maximizarlo sobre β0,β1\beta_0, \beta_1 es equivalente a los mínimos cuadrados (Teorema 2.12). Luego deriva σ^MLE2=SSE/n\hat\sigma^2_{\text{MLE}} = \mathrm{SSE}/n.

  17. (B) Muestra que σ^MLE2=SSE/n\hat\sigma^2_{\text{MLE}} = \mathrm{SSE}/n es sesgado para σ2\sigma^2, y calcula el sesgo exacto en términos de σ2\sigma^2 y nn.

  18. (B) Demuestra la descomposición SSE=Syyb12Sxx\mathrm{SSE} = S_{yy} - b_1^2 S_{xx} partiendo de ei=(YiYˉ)b1(XiXˉ)e_i = (Y_i - \bar{Y}) - b_1(X_i - \bar{X}).

  19. (B) Un estudiante propone estimar la pendiente por el cociente de medias Yˉ/Xˉ\bar{Y}/\bar{X} (una recta por el origen). Muestra que esto es en general sesgado para β1\beta_1, y explica qué supuesto del modelo impone implícita, y erróneamente.

  20. (C) Lee toluca.csv en R o Python, ajusta el modelo, y reproduce b0b_0, b1b_1 y ss. Confirma b1=Sxy/Sxxb_1 = S_{xy}/S_{xx} a partir de las sumas crudas.

  21. (C) Calcula los residuos en software y verifica numéricamente que ei=0\sum e_i = 0, Xiei=0\sum X_i e_i = 0 y Y^i=Yi\sum \hat{Y}_i = \sum Y_i. Reporta las tres sumas.

  22. (C) Usando toluca_mini.csv, calcula b0b_0 y b1b_1 a mano (muestra la tabla de desviaciones), luego reprodúcelos en software. Explica por qué difieren de las estimaciones de datos completos.

  23. (C) Predice las horas de trabajo medias para tamaños de lote 40, 80 y 120 usando la recta ajustada, y marca cuáles de estos son interpolación y cuáles (si alguno) son extrapolación.

  24. (C) Ajusta el modelo, extrae MSE\mathrm{MSE} de dos formas (de summary / fit.summary() y a mano como SSE/(n2)\mathrm{SSE}/(n-2)), y confirma que coinciden. Luego calcula σ^MLE2=SSE/n\hat\sigma^2_{\text{MLE}} = \mathrm{SSE}/n y reporta la diferencia porcentual.

  25. (C) Escribe una simulación corta (semilla 4210) que extraiga 2000 muestras del modelo ajustado en los tamaños de lote de Toluca, reajuste cada una, y reporte la media y la desviación estándar de las 2000 estimaciones de intercepto b0b_0. Compara la desviación estándar con la fórmula s{b0}s\{b_0\}.

  26. (C) Haz el gráfico de residuos contra tamaño de lote en R o Python. Describe cómo se vería una violación del supuesto de varianza constante en este gráfico, y di si los residuos de Toluca la muestran.

  27. (C) Invierte los papeles: regresa lotsize sobre hours. Muestra que la nueva pendiente no es el recíproco de la pendiente original, y explica por qué regresar YY sobre XX y XX sobre YY dan rectas distintas.

  28. (B) Un analista tiene solo los números de resumen Xˉ=70\bar{X} = 70, Yˉ=312.28\bar{Y} = 312.28, Sxx=19,800S_{xx} = 19{,}800 y Sxy=70,690S_{xy} = 70{,}690, con los datos crudos perdidos. ¿Pueden recuperar b0b_0 y b1b_1? ¿Pueden recuperar MSE\mathrm{MSE}? Explica qué es y qué no es reconstruible a partir de estos cuatro números.

2.10 Práctica de examen

Los problemas de abajo están escritos al estilo de los exámenes de este curso: cada uno te pide explicar en oraciones completas, no solo producir un número. En el examen real una respuesta pelada gana poco crédito, y un razonamiento correcto con un pequeño desliz gana la mayor parte, así que practica escribir el razonamiento completo. Trabaja cada uno en papel antes de abrir su respuesta modelo. Donde se muestra salida, es salida de software genuina de toluca.csv.

PE 2.1. Explica por qué la recta describe la media, no la respuesta. Un lector primerizo dice “el modelo afirma que las horas de trabajo son una función lineal del tamaño del lote”. Explica por qué eso no es lo que afirma el modelo de regresión lineal simple, y enuncia con precisión qué cantidad sí describe la recta. Luego explica qué función cumple el supuesto de varianza constante Var{εi}=σ2\operatorname{Var}\{\varepsilon_i\} = \sigma^2 que la ecuación de la recta media por sí sola no cumple.

PE 2.2. Un estudiante afirma que los mínimos cuadrados no se pueden superar. Un estudiante escribe: “El teorema de Gauss-Markov demuestra que b1b_1 tiene la varianza más pequeña de cualquier estimador de β1\beta_1, así que es imposible estimar la pendiente con más precisión que los mínimos cuadrados”. Evalúa esta afirmación. Donde se exceda, enuncia exactamente qué promete y qué no promete el teorema.

PE 2.3. Interpreta la regresión inversa en contexto. Un analista invierte el ajuste del capítulo y regresa el tamaño del lote sobre las horas de trabajo, reutilizando toluca.csv. La salida genuina de R y Python está abajo.

Coefficients:
            Estimate Std. Error t value Pr(>|t|)
(Intercept) -1.85825    7.41053  -0.251    0.804
hours        0.23011    0.02236  10.290 4.45e-10 ***
---
Residual standard error: 12.4 on 23 degrees of freedom
Multiple R-squared:  0.8215,	Adjusted R-squared:  0.8138
                 coef    std err          t      P>|t|      [0.025      0.975]
------------------------------------------------------------------------------
Intercept     -1.8583      7.411     -0.251      0.804     -17.188      13.472
hours          0.2301      0.022     10.290      0.000       0.184       0.276

(a) Interpreta la pendiente inversa 0.2301 en las unidades de este problema. (b) El ajuste directo (horas sobre tamaño de lote) tenía pendiente 3.5702, cuyo recíproco es 1/3.5702=0.2801/3.5702 = 0.280. Explica por qué la pendiente inversa 0.2301 no es ese recíproco. (c) Ambas direcciones reportan el mismo R2=0.8215R^2 = 0.8215. Explica por qué se espera esa coincidencia, y di a qué es igual el producto de las dos pendientes.

PE 2.4. ¿Qué cambiaría si los tamaños de lote estuvieran apiñados? Los ingenieros resultaron registrar tamaños de lote dispersos de 20 a 120 unidades, dando Sxx=19,800S_{xx} = 19{,}800. Supón en cambio que cada corrida se hubiera programado entre 60 y 80 unidades, de modo que las mismas 25 corridas cargaran un SxxS_{xx} mucho más pequeño, de unos 3,0003{,}000, con la recta verdadera y σ2\sigma^2 sin cambiar. Explica la dirección del cambio, y la razón, para (a) el error estándar de la pendiente, (b) la dispersión del haz de rectas ajustadas plausibles, y (c) tu capacidad de interpretar el intercepto b0b_0. Luego di qué no cambiaría.

PE 2.5. Dos errores en un argumento de ajuste a mano. Un compañero ajusta una recta a mano, reporta residuos que suman exactamente cero, y concluye: “Como ei=0\sum e_i = 0, mi ajuste debe ser la recta de mínimos cuadrados, y ahora puedo estimar σ2\sigma^2 dividiendo la SSE entre nn”. Identifica los dos errores separados en este razonamiento, y da el enunciado correcto en cada caso.

Juego del capítulo