2. Regresión lineal simple¶
La Toluca Company fabrica equipos de refrigeración y las piezas de repuesto que los mantienen funcionando. Una pieza se había producido durante mucho tiempo en lotes, o tandas, del tamaño que en cada momento pareciera conveniente. Cuando la empresa inició una revisión para reducir costos, sus ingenieros quisieron resolver una pregunta básica: ¿qué tamaño de lote es el más barato de producir? Cada corrida de producción conlleva un costo fijo de preparación que no depende del tamaño del lote, más el trabajo de maquinado y ensamble que crece con el número de piezas. Para encontrar el punto óptimo, los ingenieros necesitaban primero un ingrediente: ¿cómo dependen las horas de trabajo que consume una corrida del tamaño del lote?
Extrajeron los registros de 25 corridas recientes realizadas bajo condiciones estables a lo largo de un periodo de seis meses. Cada registro es un par: el tamaño del lote (unidades producidas) y las horas de trabajo que tomó la corrida. Los tamaños de lote son todos múltiplos de diez, una conveniencia de programación, y van de 20 a 120 unidades. La dispersión de estos 25 puntos es la imagen inicial de todo el capítulo.

Figure 1:Las 25 corridas de Toluca con la recta de mínimos cuadrados trazada a través de ellas. Los lotes más grandes toman más horas, la tendencia parece recta, y la dispersión alrededor de la recta tiene un ancho más o menos igual en todo el rango, que es justamente la situación que modela este capítulo.
Dos cosas resaltan en la Figure 1. Los lotes más grandes toman más horas, y la nube de puntos está lo bastante cerca de una recta como para que una recta sea un resumen razonable. Pero ¿cuál recta? Un ingeniero podría poner una regla sobre el gráfico y trazar una a ojo, y un segundo ingeniero trazaría una un poco distinta. Este capítulo reemplaza la regla por una regla en el otro sentido: una receta precisa y defendible para la única mejor recta, un recuento honesto de cuánto confiar en ella, y los supuestos que hacen válida toda la empresa. Al terminar podrás ajustar esa recta, leer su pendiente en las unidades del problema (horas por unidad de tamaño de lote), decir qué tan incierta es la pendiente, y demostrar que, bajo las condiciones establecidas, ningún método competidor lo hace mejor.
El flujo de trabajo del modelado¶
Cada capítulo de este libro es una vuelta por el mismo ciclo de cinco etapas. Nombrar las etapas ahora te da un mapa para llevar a lo largo de todo el curso, y cada capítulo posterior comienza diciendo a qué etapa sirve.
PREGUNTAR. Fija la pregunta y los datos que pueden responderla. Aquí: ¿cómo dependen las horas de trabajo del tamaño del lote, y qué nos pueden decir 25 corridas de producción?
EXPLORAR. Grafica y resume antes de ajustar nada. La dispersión en la Figure 1 es esta etapa; es lo que nos dice que vale la pena siquiera intentar una recta.
AJUSTAR. Estima el modelo. La mayor parte de este capítulo vive aquí, convirtiendo la recta de regla y ojo en la única recta de mínimos cuadrados.
VERIFICAR. Pregunta si el modelo ajustado es confiable, usando los residuos y los supuestos que hay detrás de ellos. Empezamos esto en la Sección 2.3 y dedicamos todo el Capítulo 9 a ello.
USAR. Interpreta las estimaciones, predice y decide. Leer la pendiente en horas por unidad de tamaño de lote es el primer sabor; la inferencia y la predicción llenan el Capítulo 3.

Figure 2:Las cinco etapas como un solo ciclo. Avanzas en sentido horario de PREGUNTAR a USAR, y una VERIFICACIÓN fallida no termina el trabajo: la flecha punteada te devuelve a AJUSTAR o EXPLORAR con un mejor modelo.
Como muestra la Figure 2, las etapas forman un ciclo, no una calle de un solo sentido: una VERIFICACIÓN fallida te devuelve a EXPLORAR o AJUSTAR con un mejor modelo. La regresión lineal simple es el viaje completo más pequeño alrededor de este ciclo, y por eso el curso empieza aquí.
2.1 El modelo de regresión lineal simple¶
Intuición¶
La regresión parte de una idea sencilla: una cosa tiende a moverse con otra, y queremos precisar esa relación en números. Aquí describimos cómo una respuesta (horas de trabajo de Toluca) depende de un solo predictor (tamaño del lote). Ningún modelo sensato afirma que las horas son una función exacta del tamaño del lote: dos corridas del mismo tamaño tomaron cantidades de tiempo distintas, por el desgaste de las herramientas, el turno de trabajadores, el clima y cientos de pequeñas cosas que nadie registró. Así que dividimos cada observación en dos piezas: una parte sistemática que el tamaño del lote explica, y una parte aleatoria que no.
La parte sistemática es una recta. En promedio, una corrida de tamaño toma cierta cantidad base de tiempo más un número fijo de horas extra por cada unidad adicional. La parte aleatoria es una perturbación que empuja las horas reales por encima o por debajo de ese promedio. Suponemos que la perturbación no tiene una tendencia incorporada a ser positiva o negativa, tiene el mismo tamaño típico sin importar el tamaño del lote, y no se coordina de una corrida a la siguiente.
Fórmula¶
El modelo de regresión lineal simple (simple linear regression model) (Definición 2.1) para las observaciones es
es la respuesta observada en el -ésimo caso (horas de trabajo de la corrida ).
es el predictor en el -ésimo caso (tamaño del lote de la corrida ), tratado como una constante conocida y fija. Algunos libros lo llaman variable independiente o variable explicativa; este libro dice predictor en todo el texto.
es el parámetro de intercepto: la respuesta media cuando .
es el parámetro de pendiente: el cambio en la respuesta media por un aumento de una unidad en .
es el error aleatorio en el -ésimo caso, la cantidad por la que se aparta de su media.
Los parámetros y son números fijos que no conocemos y queremos estimar. El modelo impone cuatro condiciones sobre los errores:
En palabras: cada error promedia a cero (la recta es correcta en promedio), todo error tiene la misma varianza (dispersión constante, llamada homocedasticidad), y errores distintos no están correlacionados (la suerte de una corrida no dice nada sobre la de otra). Nota lo que todavía no se supone: ninguna forma particular para la distribución del error. La normalidad entra solo en 2.6 Máxima verosimilitud bajo errores normales, y solo cuando queremos construir intervalos y pruebas.
Como es una constante fija y es por lo tanto también constante, las condiciones sobre los errores se transfieren directamente a las respuestas:
La cantidad es la respuesta media (mean response) al nivel . La función que da la respuesta media en cualquier es la función de regresión (regression function) (Definición 2.2). Es una recta, y estimarla es todo el juego.
La Figure 3 es la imagen mental que hay que llevar a lo largo del capítulo: una recta media, con una distribución de posibles valores de apilados en cada , cada pila del mismo ancho.

Figure 3:El modelo en una sola imagen: la media de Y queda exactamente sobre la recta, y en cada X la respuesta se dispersa alrededor de esa media por la misma cantidad. Las campanas se dibujan idénticas a propósito: ese es el supuesto de varianza constante.
2.2 Mínimos cuadrados desde los primeros principios¶
Intuición¶
Tenemos una nube de puntos y queremos la única recta que mejor se ajusta. “Mejor” necesita una definición. Los mínimos cuadrados la definen penalizando los fallos: para una recta candidata, mide la brecha vertical de cada punto a la recta, eleva al cuadrado las brechas para que pasarse y quedarse corto cuenten ambos como errores y los fallos grandes duelan de forma desproporcionada, y súmalas. La mejor recta es la que hace este total, la suma de los errores al cuadrado, lo más pequeño posible. La Figure 4 muestra la idea con tres rectas candidatas a través de los datos de Toluca.

Figure 4:Tres rectas candidatas y sus sumas de errores al cuadrado. Las rectas demasiado plana y demasiado empinada dejan grandes brechas verticales y una SSE grande; la recta de mínimos cuadrados atraviesa la nube y tiene la SSE más pequeña de cualquier recta.
Fórmula¶
Escribe una recta candidata con intercepto y pendiente . Su suma de errores al cuadrado (sum of squared errors) (Definición 2.3) es
es la brecha vertical del punto a la recta candidata.
es una función de los dos números que podemos elegir; los datos están fijos.
Las estimaciones de mínimos cuadrados y son los valores que minimizan . Para escribirlas de forma compacta, define las tres sumas básicas de cuadrados y productos cruzados alrededor de las medias:
donde y son las medias muestrales del predictor y la respuesta. Las dos derivaciones siguientes establecen los minimizadores, enunciados aquí primero.
Derivación por cálculo¶
Demostración (por cálculo). es una suma de cuadrados, así que es suave y está acotada inferiormente por cero. En un mínimo, ambas derivadas parciales se anulan. Deriva:
Igualando cada una a cero y dividiendo entre -2 se obtienen las ecuaciones normales (normal equations):
Desarrolla las sumas. La primera ecuación se convierte en , y dividiendo entre da , de modo que
Sustituye esto en la segunda ecuación normal . Reemplazando y agrupando los términos de ,
El lado izquierdo es igual a , y el corchete del lado derecho es igual a . Por lo tanto
Este es el único punto estacionario, y es un mínimo por el criterio de las segundas derivadas para una función de dos variables (la misma prueba que usarías en cálculo para una variable, extendida a dos). Las tres segundas derivadas parciales de son constantes: , y . Forma la cantidad de prueba . Como siempre que los no sean todos iguales, y , el punto estacionario es un mínimo local. Como es una suma de cuadrados (así que está acotada inferiormente por cero) y este es su único punto estacionario, ese mínimo local es también el mínimo global. (El Capítulo 7 revisita este mismo hecho en forma matricial, una vez que tengas las herramientas del Capítulo 6.)
Derivación por una identidad algebraica¶
El argumento de cálculo encuentra el minimizador pero deja la geometría un poco oculta. Aquí hay una segunda demostración que no usa derivadas y muestra directamente que ninguna recta le gana a la recta de mínimos cuadrados. Descansa sobre dos hechos que demostraremos en 2.3 Valores ajustados y las propiedades de los residuos: escribiendo los valores ajustados como y los residuos como , los residuos cumplen y .
Demostración (por una identidad algebraica). Toma cualquier recta competidora con intercepto y pendiente . Divide la brecha de cada punto a esa recta pasándola por el valor ajustado de mínimos cuadrados:
Eleva al cuadrado y suma. La suma de errores al cuadrado de la recta competidora es
El término cruzado se anula:
Así que para toda recta competidora,
con igualdad solo cuando , es decir cuando para todo , lo cual (dado que los no son todos iguales) fuerza y . La recta de mínimos cuadrados es el minimizador único.
Las dos ecuaciones normales tienen una imagen limpia. Cada una es una recta en el plano , y las estimaciones de mínimos cuadrados están donde se cruzan, en el fondo del tazón de SSE. La Figure 5 muestra el tazón y la Figure 6 lo muestra desde arriba.

Figure 5:Como la SSE es una función convexa (con forma de tazón) del intercepto y la pendiente, tiene exactamente un punto más bajo, y ese punto es la solución de mínimos cuadrados. No hay otros valles en los que quedar atrapado.

Figure 6:La misma superficie de SSE vista directamente desde arriba. Cada ecuación normal es una recta en el plano (b0, b1); las dos rectas se intersecan en la estrella, las estimaciones de mínimos cuadrados, situadas en el centro del contorno más interno.
R¶
Ajustar el modelo en R usa lm, que lee una fórmula response ~ predictor. Primero lee los datos
y míralos.
toluca <- read.csv("data/toluca.csv")
dim(toluca)
head(toluca, 3)[1] 25 2
lotsize hours
1 80 399
2 30 121
3 50 221Poder reproducir lm a partir de las sumas crudas y importa: significa que
puedes calcular una regresión en cualquier lugar, verificar la salida del software y, más adelante,
extender la idea cuando no haya un botón lm para el modelo que necesitas.
Vale la pena calcular los conjuntos de datos pequeños a mano una vez, para que las fórmulas dejen
de ser cajas negras. El archivo toluca_mini.csv es un recorte de seis filas de los datos de
Toluca, lo bastante pequeño para hacerlo en papel. La Figure 7 muestra sus puntos
y sus desviaciones respecto a las medias, la materia prima de y .

Figure 7:Los seis puntos de cómputo a mano con la cruz de las medias trazada. La desviación horizontal de un punto por su desviación vertical es su contribución a Sxy; la mayoría de los puntos caen en los dos cuadrantes donde ese producto es positivo, así que Sxy y la pendiente salen positivas.
Antes de aceptar las fórmulas por confianza, dedica un minuto a intentar ganarles a mano.
Dos deslizadores fijan tu propio intercepto y tu pendiente sobre las 25 corridas de Toluca. Los valores comparan la que logra tu recta contra el valor más pequeño que puede lograr cualquier recta.
Qué observar. Ningún par de posiciones lleva por debajo de , y las que más se acercan marcan 62.5 y 3.57, las estimaciones de mínimos cuadrados. Prueba esto. Deja la pendiente en 3.57 y mueve solo el intercepto: la suma de residuos cruza cero justo en la posición donde toca fondo, que es la primera ecuación normal ocurriendo frente a ti. Volver a la Sección 2.2.
2.3 Valores ajustados y las propiedades de los residuos¶
Intuición¶
Una vez fijada la recta, cada punto observado se divide en dos partes. El valor ajustado (fitted value) (Definición 2.5) es donde la recta dice que debería estar el punto; el residuo (residual) es qué tan lejos cae el punto real de él. Los residuos son las sobras del modelo, la parte de que el tamaño del lote no explicó. La Figure 9 los dibuja como los palitos verticales que conectan cada punto con la recta. No son solo decoración: los mínimos cuadrados fuerzan a los residuos a cumplir identidades algebraicas exactas, y esas identidades son a la vez una herramienta de demostración y una forma práctica de atrapar un error en un ajuste.

Figure 9:Cada residuo es la distancia vertical con signo de un punto a la recta ajustada: positivo (naranja, arriba) o negativo (morado, abajo). Los mínimos cuadrados los equilibran de modo que los residuos con signo suman exactamente cero.
Fórmula¶
Los valores ajustados y los residuos son
es la respuesta media estimada en , la altura de la recta ajustada allí.
es el residuo, la brecha vertical de la observada hacia abajo hasta la recta.
No confundas con el error del modelo . El error es la brecha a la recta verdadera y desconocida; el residuo es la brecha a nuestra recta estimada. Nunca vemos , pero siempre podemos calcular , y es nuestro mejor sustituto. La Figure 10 pone las dos brechas lado a lado para que la diferencia sea imposible de pasar por alto.

Figure 10:La única distinción que hay que tener clara: el error es la brecha a la recta verdadera que nunca podemos ver (izquierda), y el residuo es la brecha a la recta ajustada que calculamos a partir de los datos (derecha). Mismos puntos, dos rectas distintas, dos brechas distintas.
Derivación (propiedades de los residuos)¶
Demostración. Todas ellas se siguen de las dos ecuaciones normales de 2.2 Mínimos cuadrados desde los primeros principios.
Los residuos suman cero. La primera ecuación normal es exactamente .
El predictor es ortogonal a los residuos. La segunda ecuación normal es exactamente .
Los valores ajustados son ortogonales a los residuos. Usando las propiedades 1 y 2, .
Los valores ajustados reproducen el total de . De la propiedad 1, , así que , y dividiendo entre , el valor ajustado medio es igual a .
La recta pasa por el centro de los datos. Poniendo en la recta ajustada y usando da . Así que está siempre sobre la recta de mínimos cuadrados.
La propiedad 1 es por qué los palitos verticales de la Figure 9 se equilibran. Las propiedades 1 y 2 fueron los ingredientes que hicieron desaparecer el término cruzado en la demostración algebraica de 2.2 Mínimos cuadrados desde los primeros principios, así que las identidades pagan el préstamo que tomamos allí.
R y Python¶
Un gráfico de los residuos contra el predictor es la primera imagen que hay que trazar después de cualquier ajuste. Si se cumplen los supuestos de varianza constante y de recta del modelo, los residuos deberían moverse alrededor de cero sin tendencia y sin abanicarse, como en la Figure 11. Una curva señalaría que la relación no es recta; un embudo que se ensancha señalaría varianza no constante. El Capítulo 9 construye un juego de herramientas de diagnóstico completo sobre este único hábito.

Figure 11:Los residuos de Toluca graficados contra el tamaño del lote. Quedan en una banda plana y sin patrón alrededor de cero, sin forma de embudo, que es la imagen que apoya los supuestos de recta y de varianza constante.
Las identidades del Teorema 2.6 son exactas, así que la forma más rápida de creerlas es intentar romper una.
Arrastra cualquiera de las seis corridas del cálculo a mano a donde quieras. La recta se reajusta al instante, y los cuatro valores siguen , , la media de y la media de .
Qué observar. Por mucho que destroces los datos, y se quedan en cero y la media de sigue igual a . Prueba esto. Arrastra una corrida hasta lo más alto del gráfico: los residuos se vuelven enormes, el ajuste queda inservible, y las identidades no se mueven, y por eso verifican tu aritmética y nunca tu modelo. Volver a la Sección 2.3.
2.4 Estimar la varianza del error¶
Intuición¶
La pendiente y el intercepto describen la recta, pero el modelo tiene una tercera incógnita: , la varianza de los errores, que controla qué tan estrechamente los puntos abrazan la recta. Una pequeña significa que las predicciones pueden ser afiladas; una grande significa que incluso una recta perfecta deja mucha incertidumbre. No podemos ver los errores , pero los residuos son sus sustitutos visibles, así que estimamos a partir de la dispersión de los residuos. La Figure 13 muestra cómo se ve esa dispersión como una banda alrededor de la recta ajustada.

Figure 13:La dispersión del error estimada s = 48.8 horas dibujada como bandas alrededor de la recta ajustada. Cerca de dos tercios de las corridas caen dentro de una s de la recta y casi todas dentro de dos s; s resume el ancho del histograma de residuos del recuadro.
Fórmula¶
La suma de cuadrados del error (error sum of squares) (Definición 2.7) y el estimador de son
es el residuo total al cuadrado, la variación sobrante que la recta no explicó.
(cuadrado medio del error), también escrito , es dividido entre sus grados de libertad ; estima .
es la desviación estándar estimada de los errores, en las unidades de (horas).
El divisor es , no ni . Dos grados de libertad se gastan estimando los dos coeficientes y que definen la recta desde la que se miden los residuos. La siguiente derivación muestra que este divisor exacto, y ningún otro, hace que sea correcto en promedio.
Derivación (por qué el divisor es )¶
Demostración. Mostramos que , de modo que dividir entre da un estimador que es correcto en promedio. Parte de una identidad ordenada para la SSE. Como (usando ),
así que, desarrollando el cuadrado y usando ,
Toma esperanzas de las dos piezas. Para cualquier variable aleatoria, .
La pieza de la pendiente. Mostramos en 2.5 Comportamiento muestral y el teorema de Gauss-Markov que y . Por lo tanto
La pieza total. Escribe . Cada tiene media y varianza , así que y . La media muestral tiene media y varianza , así que . Restando,
El corchete final es . Así que .
Combinar. Restando la pieza de la pendiente de la pieza total,
Por lo tanto : el divisor es exactamente lo que hace que sea un estimador insesgado de .
R y Python¶
El Teorema 2.8 dice que el divisor es el que acierta en promedio, y el muestreo repetido es la manera de ver cómo se asienta esa afirmación.
Cada muestra son 25 corridas nuevas de un modelo cuya varianza del error es de verdad . El histograma reúne , y los valores muestran lo que da cada divisor en promedio.
Qué observar. Los valores individuales de se dispersan mucho, la mayoría cae entre unos 1200 y unos 4000, y aun así su promedio camina firme hacia 2383.4. Prueba esto. Presiona Tomar 1000 dos veces y compara las dos medias: el divisor cae en mientras que el divisor se queda cerca de 8 por ciento por debajo por muchas muestras que agregues, y eso es lo que significa el sesgo. Volver a la Sección 2.4.
2.5 Comportamiento muestral y el teorema de Gauss-Markov¶
Intuición¶
Las estimaciones y se calculan a partir de una muestra particular de 25 corridas. Otras 25 corridas, hechas bajo las mismas condiciones, darían estimaciones un poco distintas. Así que y son en sí mismos aleatorios: tienen distribuciones, llamadas distribuciones muestrales, a lo largo de las muestras repetidas que podríamos haber extraído. La Figure 15 lo hace concreto simulando 60 muestras nuevas en los tamaños de lote de Toluca y ajustando cada una: las rectas ajustadas se dispersan alrededor de la recta media verdadera, y se abren más donde está lejos de .

Figure 15:Sesenta muestras, sesenta rectas ajustadas. Se agrupan alrededor de la recta media verdadera (roja) sin ningún desplazamiento sistemático, y el haz se estrecha en el tamaño de lote medio y se ensancha en los extremos, que es exactamente lo que predicen las fórmulas de varianza.
Dos preguntas organizan esta sección. ¿Son y correctos en promedio (insesgados)? ¿Y cuánto varían de muestra a muestra (sus varianzas)? El teorema de Gauss-Markov entonces entrega una recompensa fuerte: entre todos los estimadores sensatos que uno podría inventar, los mínimos cuadrados tienen la varianza más pequeña.
Fórmula¶
Ambos estimadores son insesgados, y sus varianzas son
se encoge cuando los errores son pequeños ( bajo) o el predictor está muy disperso ( grande). Dispersar tus valores de compra precisión.
carga un término extra porque el intercepto vive lejos en , e inclinar la recta la hace pivotar allí.
La Figure 16 hace visible el primer hecho. Cuando los tamaños de lote están apiñados, un poco de ruido inclina la pendiente descontroladamente; cuando están muy dispersos, el mismo ruido apenas la mueve.

Figure 16:Por qué dispersar X compra precisión. Ambos paneles usan la misma recta verdadera y el mismo tamaño de error; solo difiere la dispersión de los tamaños de lote. Una dispersión amplia (derecha) hace grande a Sxx, y como la varianza de la pendiente es sigma al cuadrado sobre Sxx, la pendiente queda fijada mucho más estrechamente.
Reemplazar la desconocida por su estimación da las varianzas estimadas y , cuyas raíces cuadradas son los errores estándar y que el software imprime.
Derivación (insesgadez y varianzas)¶
Demostración (media y varianza de ). La clave es escribir como una suma ponderada de las respuestas. Como ,
Los pesos dependen solo de los valores fijos de y cumplen tres hechos, cada uno un cálculo de una línea:
Insesgadez. Usando ,
Varianza. Los no están correlacionados con varianza común , así que las varianzas de una suma ponderada se suman con pesos al cuadrado:
Demostración (media y varianza de ). Escribe con . Entonces y , así que . Para la varianza, usando y ,
Derivación (Gauss-Markov: es BLUE)¶
Demostración. Considera cualquier estimador lineal con pesos fijos . Su esperanza es . Para que esto sea igual a para todo posible y , los pesos deben cumplir
Escribe , dividiendo cada peso en el peso de mínimos cuadrados y una desviación . Como tanto como cumplen las dos restricciones de insesgadez, las desviaciones cumplen y . Ahora el término cruzado desaparece:
Por lo tanto
Como , todo competidor lineal insesgado tiene varianza al menos la de , con igualdad solo cuando todos los , es decir cuando el competidor es . La pendiente de mínimos cuadrados es BLUE. El mismo argumento con los pesos muestra que es BLUE.
R y Python¶
Las fórmulas de varianza no son solo álgebra; describen el haz que se abre de rectas en la Figure 15. Podemos confirmar tanto la insesgadez como la fórmula de la varianza de la pendiente por simulación, extrayendo 5000 muestras del modelo estimado y reajustando cada una. La Figure 17 muestra el histograma de las 5000 estimaciones de pendiente.

Figure 17:Cinco mil estimaciones de pendiente simuladas. Su promedio cae sobre la pendiente verdadera (las rectas de guiones y punteada casi coinciden), confirmando la insesgadez, y su dispersión coincide con la curva teórica sigma sobre raíz de Sxx, confirmando la fórmula de la varianza.
set.seed(4210)
beta0 <- 62.366; beta1 <- 3.5702; sigma <- 48.82
xfix <- toluca$lotsize
Sxx_fix <- sum((xfix - mean(xfix))^2)
b1_sim <- replicate(5000, {
ysim <- beta0 + beta1 * xfix + rnorm(length(xfix), 0, sigma)
coef(lm(ysim ~ xfix))[["xfix"]]
})
round(c(mean_of_b1_hats = mean(b1_sim),
true_beta1 = beta1,
sd_of_b1_hats = sd(b1_sim),
formula_se = sqrt(sigma^2 / Sxx_fix)), 4)mean_of_b1_hats true_beta1 sd_of_b1_hats formula_se
3.5699 3.5702 0.3479 0.3469rng = np.random.default_rng(4210)
beta0, beta1, sigma = 62.366, 3.5702, 48.82
xfix = toluca["lotsize"].to_numpy()
Sxx_fix = np.sum((xfix - xfix.mean()) ** 2)
b1_hats = np.empty(5000)
for i in range(5000):
ysim = beta0 + beta1 * xfix + rng.normal(0, sigma, size=xfix.size)
b1_hats[i] = np.polyfit(xfix, ysim, 1)[0]
print(round(b1_hats.mean(), 4), beta1,
round(b1_hats.std(ddof=1), 4),
round(np.sqrt(sigma ** 2 / Sxx_fix), 4))3.5675 3.5702 0.352 0.3469El promedio de las 5000 estimaciones de pendiente queda justo sobre (insesgadez), y su desviación estándar simulada, 0.348 en R y 0.352 en Python, coincide con el valor de la fórmula . Los dos lenguajes difieren solo en el último dígito porque usan generadores de números aleatorios distintos; la coincidencia con la teoría es lo importante.
El haz de rectas ajustadas de la Figure 15 se cree mucho mejor cuando lo construyes una muestra a la vez.
Cada muestra reutiliza los 25 tamaños de lote de Toluca con errores nuevos alrededor de la recta . La franja de arriba es la muestra más reciente de horas de trabajo; el histograma de abajo reúne la pendiente ajustada de todas ellas.
Qué observar. Toma muestras de una en una y ninguna es igual a 3.5702, y aun así el montón que construyen queda centrado ahí. Prueba esto. Presiona Tomar 1000 y compara el valor DE de con que está a su lado: la fórmula de la varianza del Teorema 2.9 no es una aproximación, es el ancho de este montón. Volver a la Sección 2.5.
2.6 Máxima verosimilitud bajo errores normales¶
Intuición¶
Hasta ahora elegimos los mínimos cuadrados porque el error al cuadrado es una penalización razonable, y Gauss-Markov premió esa elección con la propiedad de mejor-lineal-insesgado, todo sin suponer ninguna forma para la distribución del error. Ahora supón que añadimos un supuesto: los errores están distribuidos normalmente. Un principio distinto, la máxima verosimilitud, pregunta qué valores de los parámetros hacen más probables los datos que realmente observamos. De forma notable, bajo errores normales ese principio apunta a la mismísima recta. La Figure 19 muestra los dos criterios, la suma de errores al cuadrado y el logaritmo de verosimilitud negativo, tocando fondo exactamente en la misma pendiente.

Figure 19:Los mínimos cuadrados y la máxima verosimilitud son la misma optimización vestida de forma distinta. La curva de SSE y la curva del logaritmo de verosimilitud negativo alcanzan su mínimo en la pendiente idéntica, así que elegir la recta de máxima verosimilitud es elegir la recta de mínimos cuadrados.
Fórmula¶
El modelo de regresión con errores normales (normal error regression model) (Definición 2.11) conserva todo lo de 2.1 El modelo de regresión lineal simple y añade una forma:
Bajo normalidad los errores no correlacionados ahora son plenamente independientes. La verosimilitud (likelihood) es la densidad conjunta de los observados leída como función de los parámetros:
es grande para valores de parámetros que hacen que los datos observados se vean típicos, pequeña para valores que los hacen ver raros.
Las estimaciones de máxima verosimilitud son los que maximizan .
Derivación (la máxima verosimilitud es igual a los mínimos cuadrados)¶
Demostración. Maximizar es más fácil a través de su logaritmo, que se maximiza en el mismo lugar porque es creciente:
Coeficientes. Fija cualquier . Los dos primeros términos no involucran a ni a , y el último término tiene multiplicando a . Maximizar sobre por lo tanto significa minimizar esa suma de cuadrados, que es exactamente el criterio de mínimos cuadrados de 2.2 Mínimos cuadrados desde los primeros principios. Así que las estimaciones de máxima verosimilitud de los coeficientes son las estimaciones de mínimos cuadrados:
Varianza. Sustituye para que la suma de cuadrados se convierta en , luego deriva respecto a e iguala a cero:
La estimación de varianza de máxima verosimilitud divide entre , no entre . De 2.4 Estimar la varianza del error sabemos que el divisor es sesgado bajo, subestimando , porque ignora los dos grados de libertad gastados en y . Por eso el libro, y toda la inferencia del Capítulo 3, usa el insesgado en lugar del de máxima verosimilitud.
R y Python¶
2.7 Resumen del capítulo¶
Este capítulo construyó una regresión lineal simple desde cero y demostró las propiedades que la hacen confiable. Partiendo del modelo y sus tres supuestos sobre los errores, definimos el criterio de mínimos cuadrados y derivamos los estimadores de dos formas independientes, por cálculo a través de las ecuaciones normales y por una identidad algebraica que muestra que ninguna otra recta tiene una SSE menor. Los residuos obedecen identidades exactas que sirven a la vez como verificación de corrección; la varianza del error se estima con , cuyo divisor es exactamente lo que la hace insesgada. Tratar y como aleatorios a lo largo de muestras repetidas dio sus medias y varianzas, el teorema de Gauss-Markov mostró que son los mejores entre los estimadores lineales insesgados sin necesidad de normalidad, y la máxima verosimilitud bajo errores normales reprodujo la mismísima recta.
Resultados clave de un vistazo
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Estimaciones de mínimos cuadrados (Teorema 2.4) | , | los no son todos iguales |
| Identidades de los residuos (Teorema 2.6) | , , , | cualquier ajuste de mínimos cuadrados con intercepto |
| Estimación de la varianza del error | , con | modelo RLS |
| Insesgadez del MSE (Teorema 2.8) | , así que | errores de media cero, varianza constante, no correlacionados |
| Medias y varianzas (Teorema 2.9) | ; | modelo RLS |
| Teorema de Gauss-Markov (Teorema 2.10) | son BLUE (varianza mínima entre los estimadores lineales insesgados) | modelo RLS, sin normalidad requerida |
| Máxima verosimilitud (Teorema 2.12) | Coeficientes MLE ; | modelo con errores normales |
Para los datos de Toluca estos dan , , , , , , y .
Términos clave
Modelo de regresión lineal simple, función de regresión, respuesta media, error aleatorio, criterio de mínimos cuadrados, estimaciones de mínimos cuadrados, ecuaciones normales, valor ajustado, residuo, suma de cuadrados del error (SSE), cuadrado medio del error (MSE), homocedasticidad, estimador insesgado, teorema de Gauss-Markov, mejor estimador lineal insesgado (BLUE), modelo de regresión con errores normales, máxima verosimilitud.
Ahora deberías poder
Enunciar el modelo de regresión lineal simple y explicar la función que cumple cada supuesto sobre el error.
Derivar los estimadores de mínimos cuadrados de dos formas, por cálculo y por la identidad algebraica.
Calcular , , los valores ajustados y los residuos a mano y con software.
Demostrar las identidades de los residuos y usarlas como una verificación incorporada de un ajuste.
Explicar el divisor derivando , y calcular y .
Derivar las medias y varianzas de y y demostrar que es el mejor estimador lineal insesgado.
Mostrar que la máxima verosimilitud bajo errores normales reproduce las estimaciones de mínimos cuadrados.
Dónde encaja esto. Este capítulo es la primera vuelta completa alrededor del flujo de trabajo de El flujo de trabajo del modelado. Llevó la pregunta de Toluca por PREGUNTAR y EXPLORAR, se asentó en AJUSTAR, y dio los primeros pasos hacia VERIFICAR (las identidades de los residuos y el gráfico de residuos) y USAR (leer la pendiente en horas por unidad). El Capítulo 1 argumentó que la regresión es una forma de pensar sobre cómo una cantidad se mueve con otra; este capítulo convirtió esa idea en una recta específica y calculable y demostró las propiedades que la hacen confiable. Todo aquí es estimación puntual: conjeturas únicas y mejores para , y . Lo que todavía no hemos hecho es cuantificar la incertidumbre con intervalos y pruebas. Ese es el Capítulo 3, que toma las distribuciones muestrales bosquejadas aquí, añade el supuesto de errores normales por completo, y construye intervalos para la pendiente y el intercepto, la descomposición ANOVA (3.6 El enfoque del análisis de varianza), la prueba (3.7 La prueba F y su equivalencia con la prueba t), y la diferencia entre un intervalo de confianza para una respuesta media y un intervalo de predicción para una corrida nueva (3.5 Intervalo de predicción para una observación nueva). El ajuste exacto de Toluca fijado aquí (, ) se traslada sin cambios, ahora con inferencia adjunta. Viaja aún más lejos: el Capítulo 5 vuelve a pasar la misma pendiente por una prueba de permutación (5.2 La prueba de permutación para la pendiente) y compara su valor p con el del Capítulo 3, y en el Capítulo 7 los mismos estimadores reaparecen en forma matricial (7.1 El modelo y los mínimos cuadrados en forma matricial), donde las ecuaciones normales de dos líneas se convierten en una sola ecuación y la demostración de Gauss-Markov (7.6 El teorema de Gauss-Markov) se generaliza a cualquier número de predictores a la vez.
2.8 Preguntas frecuentes¶
P1. ¿Por qué elevar al cuadrado los residuos en lugar de tomar valores absolutos? Ambas son pérdidas razonables. Elevar al cuadrado hace que el objetivo sea suave y diferenciable, así que el cálculo da una solución limpia en forma cerrada (las ecuaciones normales), y es exactamente la pérdida para la cual se cumplen los resultados de Gauss-Markov y de verosimilitud normal. La pérdida de valor absoluto da la regresión de “mínimas desviaciones absolutas”, que es más resistente a los valores atípicos pero no tiene fórmula simple y necesita resolverse iterativamente. El curso empieza con el error al cuadrado porque es donde la teoría es más limpia.
P2. ¿El intercepto es realmente “horas para producir cero unidades”? No, no de forma significativa. Un tamaño de lote de cero está muy fuera de los datos (la corrida más pequeña fue de 20 unidades), así que el intercepto es una extrapolación. Léelo como el número que ancla la altura de la recta, calculado para que la recta pase por , no como un tiempo de preparación físico. Interpretar un intercepto literalmente solo tiene sentido cuando está dentro del rango observado o cerca de él.
P3. ¿Cuál es la diferencia entre un error y un residuo ? El error es la brecha a la recta verdadera y desconocida, y nunca podemos observarlo. El residuo es la brecha a nuestra recta estimada, y lo calculamos directamente. Los residuos son nuestras estimaciones visibles de los errores invisibles, y por eso estimamos a partir de ellos.
P4. ¿Por qué dividir la SSE entre y no entre como una varianza muestral ordinaria? Una varianza muestral divide entre porque estima una cantidad, la media, a partir de los datos. La regresión estima dos, el intercepto y la pendiente, antes de medir los residuos, así que gasta dos grados de libertad, dejando . La derivación en 2.4 Estimar la varianza del error muestra exactamente, así que es el divisor que hace insesgado a .
P5. ¿Necesito que los errores sean normales para que los mínimos cuadrados funcionen? No. Las estimaciones de mínimos cuadrados, su insesgadez, sus fórmulas de varianza y la optimalidad de Gauss-Markov se cumplen todas sin ningún supuesto sobre la forma de la distribución del error, solo media cero, varianza constante y errores no correlacionados. La normalidad es un supuesto extra, añadido en 2.6 Máxima verosimilitud bajo errores normales y usado en el Capítulo 3 para construir intervalos y pruebas y exactos.
P6. ¿Por qué el haz de rectas ajustadas en la Figure 15 se estrecha en el medio? Toda recta de mínimos cuadrados pasa por (propiedad 5 de los residuos), así que cerca de las rectas solo pueden temblar un poco. Lejos de , un pequeño cambio en la pendiente hace pivotar la recta una gran distancia vertical, así que las rectas se abren. La varianza de un valor ajustado crece con la distancia desde , lo cual el Capítulo 3 convierte en la forma curva de una banda de confianza.
P7. R imprime 4.45e-10 y Python imprime 4.45e-10 para el valor p de la pendiente, pero no
supusimos normalidad. ¿De dónde vino eso? Esos valores p y los valores t de los errores estándar
sí usan el modelo de errores normales, y los justificaremos apropiadamente en el Capítulo 3. Este
capítulo muestra los errores estándar en sí, que vienen de las fórmulas de varianza y no necesitan
normalidad; las estrellas de significancia y los valores p son un adelanto de la inferencia que
viene.
2.9 Problemas de práctica¶
(A) Enuncia el modelo de regresión lineal simple y lista sus tres supuestos sobre los errores, diciendo en una frase qué garantiza cada supuesto.
(A) Explica la diferencia entre la función de regresión y una recta ajustada . ¿Cuál involucra parámetros y cuál involucra estimaciones?
(A) En el ajuste de Toluca, interpreta la pendiente 3.5702 en las unidades del problema. ¿Por qué es inseguro usar la recta para predecir horas para un lote de 500 unidades?
(A) Da una interpretación de una oración de horas para un gerente que nunca ha tomado estadística.
(A) ¿Por qué el intercepto de mínimos cuadrados para los datos de Toluca no es un “tiempo de preparación” significativo? ¿Qué tendría que ser cierto de los datos para que un intercepto fuera interpretable?
(A) Sin calcular, enuncia los valores de y para cualquier ajuste de mínimos cuadrados con intercepto, y di qué ecuación normal da cada uno.
(A) Una recta ajustada tiene pero . ¿Puede ser un ajuste de mínimos cuadrados? Explica.
(A) Explica por qué dispersar los valores del predictor más lejos entre sí (aumentar ) hace más precisa la estimación de la pendiente, refiriéndote a su fórmula de varianza.
(B) Partiendo de , deriva ambas ecuaciones normales por derivación, y resuélvelas para y (Teorema 2.4).
(B) Demuestra la identidad algebraica para una recta arbitraria , identificando y mostrando que el término cruzado es cero. Concluye que los mínimos cuadrados son el minimizador único.
(B) Muestra que la recta de mínimos cuadrados pasa por , y que (Teorema 2.6).
(B) Escribiendo con , demuestra , y , luego úsalos para mostrar y .
(B) Deriva escribiendo con .
(B) Demuestra el teorema de Gauss-Markov para la pendiente (Teorema 2.10): cualquier estimador lineal insesgado de tiene varianza al menos , con igualdad solo para .
(B) Deriva (Teorema 2.8) usando y los hechos , .
(B) Escribe el logaritmo de verosimilitud para el modelo con errores normales y muestra que maximizarlo sobre es equivalente a los mínimos cuadrados (Teorema 2.12). Luego deriva .
(B) Muestra que es sesgado para , y calcula el sesgo exacto en términos de y .
(B) Demuestra la descomposición partiendo de .
(B) Un estudiante propone estimar la pendiente por el cociente de medias (una recta por el origen). Muestra que esto es en general sesgado para , y explica qué supuesto del modelo impone implícita, y erróneamente.
(C) Lee
toluca.csven R o Python, ajusta el modelo, y reproduce , y . Confirma a partir de las sumas crudas.(C) Calcula los residuos en software y verifica numéricamente que , y . Reporta las tres sumas.
(C) Usando
toluca_mini.csv, calcula y a mano (muestra la tabla de desviaciones), luego reprodúcelos en software. Explica por qué difieren de las estimaciones de datos completos.(C) Predice las horas de trabajo medias para tamaños de lote 40, 80 y 120 usando la recta ajustada, y marca cuáles de estos son interpolación y cuáles (si alguno) son extrapolación.
(C) Ajusta el modelo, extrae de dos formas (de
summary/fit.summary()y a mano como ), y confirma que coinciden. Luego calcula y reporta la diferencia porcentual.(C) Escribe una simulación corta (semilla
4210) que extraiga 2000 muestras del modelo ajustado en los tamaños de lote de Toluca, reajuste cada una, y reporte la media y la desviación estándar de las 2000 estimaciones de intercepto . Compara la desviación estándar con la fórmula .(C) Haz el gráfico de residuos contra tamaño de lote en R o Python. Describe cómo se vería una violación del supuesto de varianza constante en este gráfico, y di si los residuos de Toluca la muestran.
(C) Invierte los papeles: regresa
lotsizesobrehours. Muestra que la nueva pendiente no es el recíproco de la pendiente original, y explica por qué regresar sobre y sobre dan rectas distintas.(B) Un analista tiene solo los números de resumen , , y , con los datos crudos perdidos. ¿Pueden recuperar y ? ¿Pueden recuperar ? Explica qué es y qué no es reconstruible a partir de estos cuatro números.
2.10 Práctica de examen¶
Los problemas de abajo están escritos al estilo de los exámenes de este curso: cada uno te pide
explicar en oraciones completas, no solo producir un número. En el examen real una respuesta
pelada gana poco crédito, y un razonamiento correcto con un pequeño desliz gana la mayor parte, así
que practica escribir el razonamiento completo. Trabaja cada uno en papel antes de abrir su
respuesta modelo. Donde se muestra salida, es salida de software genuina de toluca.csv.
PE 2.1. Explica por qué la recta describe la media, no la respuesta. Un lector primerizo dice “el modelo afirma que las horas de trabajo son una función lineal del tamaño del lote”. Explica por qué eso no es lo que afirma el modelo de regresión lineal simple, y enuncia con precisión qué cantidad sí describe la recta. Luego explica qué función cumple el supuesto de varianza constante que la ecuación de la recta media por sí sola no cumple.
Respuesta modelo
La ecuación del modelo es , así que cada valor observado de horas es una pieza lineal más un error aleatorio. Lo que queda exactamente sobre la recta no es por lo tanto en sí sino su media, . Cualquier corrida individual queda por encima o por debajo de la recta por su error , que es exactamente por qué dos lotes del mismo tamaño tomaron cantidades de tiempo distintas. La ecuación de la recta media fija solo dónde queda el centro de la respuesta en cada tamaño de lote; no dice nada sobre qué tan estrechamente se agrupan las corridas alrededor de ese centro. El supuesto de varianza constante aporta esa pieza faltante: dice que las corridas se dispersan por la misma cantidad en cada tamaño de lote, así que la banda alrededor de la recta mantiene un ancho constante. Sin él la recta podría ser correcta en promedio y aun así ser mucho más confiable en algunos tamaños de lote que en otros, y cada error estándar más adelante en el capítulo necesitaría una fórmula distinta.
Una respuesta débil dice “ es lineal en ” y olvida el término de error, o nombra el supuesto de varianza constante sin decir que su función es mantener igual el ancho de la dispersión en todos los .
PE 2.2. Un estudiante afirma que los mínimos cuadrados no se pueden superar. Un estudiante escribe: “El teorema de Gauss-Markov demuestra que tiene la varianza más pequeña de cualquier estimador de , así que es imposible estimar la pendiente con más precisión que los mínimos cuadrados”. Evalúa esta afirmación. Donde se exceda, enuncia exactamente qué promete y qué no promete el teorema.
Respuesta modelo
La afirmación se excede. Gauss-Markov dice que es el mejor solo dentro de una clase específica: estimadores que son lineales en las respuestas e insesgados para . Entre esa clase su varianza es la más pequeña, y eso es todo lo que promete. El teorema no dice que le gane a todo estimador concebible. Un estimador sesgado, como una pendiente de contracción (ridge), puede tener una varianza menor e incluso un error cuadrático medio menor que , comprando eso al precio de un poco de sesgo; los estimadores no lineales quedan enteramente fuera del alcance del teorema. El resultado también descansa sobre sus hipótesis de errores de media cero, varianza constante y no correlacionados. Si los errores tienen varianzas desiguales o están correlacionados, los mínimos cuadrados ordinarios no tienen por qué ser los mejores, y un estimador de mínimos cuadrados ponderados o generalizados puede hacerlo mejor. Así que la lectura precisa es: ningún estimador lineal insesgado le gana a bajo las condiciones de error establecidas. Esa es una optimalidad real y útil, no la universal que el estudiante enunció.
Una respuesta débil acepta “la varianza más pequeña de cualquier estimador” sin restringir a los estimadores lineales e insesgados, o olvida que las hipótesis de varianza constante y de errores no correlacionados son de las que depende la garantía.
PE 2.3. Interpreta la regresión inversa en contexto. Un analista invierte el ajuste del
capítulo y regresa el tamaño del lote sobre las horas de trabajo, reutilizando toluca.csv. La
salida genuina de R y Python está abajo.
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) -1.85825 7.41053 -0.251 0.804
hours 0.23011 0.02236 10.290 4.45e-10 ***
---
Residual standard error: 12.4 on 23 degrees of freedom
Multiple R-squared: 0.8215, Adjusted R-squared: 0.8138 coef std err t P>|t| [0.025 0.975]
------------------------------------------------------------------------------
Intercept -1.8583 7.411 -0.251 0.804 -17.188 13.472
hours 0.2301 0.022 10.290 0.000 0.184 0.276(a) Interpreta la pendiente inversa 0.2301 en las unidades de este problema. (b) El ajuste directo (horas sobre tamaño de lote) tenía pendiente 3.5702, cuyo recíproco es . Explica por qué la pendiente inversa 0.2301 no es ese recíproco. (c) Ambas direcciones reportan el mismo . Explica por qué se espera esa coincidencia, y di a qué es igual el producto de las dos pendientes.
Respuesta modelo
(a) La pendiente inversa dice que dos corridas que difieren en una hora de trabajo difieren, en promedio, en unas 0.23 unidades de tamaño de lote, en unidades de unidades-de-tamaño-de-lote por hora, sobre el rango observado. Es una descripción de cómo el tamaño del lote sigue a las horas, no una tasa causal o física.
(b) Regresar sobre minimiza las brechas verticales (errores en horas), mientras que regresar sobre minimiza las brechas horizontales (errores en tamaño de lote). Estas son minimizaciones distintas que responden preguntas distintas, así que sus pendientes no son recíprocas. Algebraicamente la pendiente directa es y la pendiente inversa es . El recíproco 0.280 sería la pendiente inversa solo si el ajuste fuera perfecto (). Como el ajuste es imperfecto aquí, la pendiente inversa 0.2301 sale más pequeña que 0.280.
(c) es la correlación al cuadrado entre las dos variables, una cantidad simétrica que no le importa cuál variable se llame la respuesta, así que ambas direcciones deben reportar el mismo valor 0.8215. El producto de las dos pendientes es , lo cual también muestra por qué son recíprocas () solo cuando .
Una respuesta débil lee la pendiente inversa como “3.57 al revés” y espera el recíproco, o no puede decir por qué las dos pendientes se multiplican a en lugar de a 1.
PE 2.4. ¿Qué cambiaría si los tamaños de lote estuvieran apiñados? Los ingenieros resultaron registrar tamaños de lote dispersos de 20 a 120 unidades, dando . Supón en cambio que cada corrida se hubiera programado entre 60 y 80 unidades, de modo que las mismas 25 corridas cargaran un mucho más pequeño, de unos , con la recta verdadera y sin cambiar. Explica la dirección del cambio, y la razón, para (a) el error estándar de la pendiente, (b) la dispersión del haz de rectas ajustadas plausibles, y (c) tu capacidad de interpretar el intercepto . Luego di qué no cambiaría.
Respuesta modelo
(a) El error estándar de la pendiente crecería. Bajar de a unos encoge el denominador por un factor de aproximadamente 6.6, así que la varianza sube por ese factor y el error estándar por su raíz cuadrada, unas 2.6 veces. El mismo esfuerzo de datos, una pendiente mucho más ruidosa, porque los predictores apiñados dan poco agarre horizontal a la recta.
(b) El haz de rectas ajustadas de muestras repetidas se abriría mucho más. Cuando los valores de están cerca entre sí, una pequeña cantidad de error inclina una recta abruptamente, así que la pendiente queda fijada de forma imprecisa, exactamente el panel de dispersión estrecha en la Figure 16.
(c) Interpretar como algo físico sería aún menos defendible. El intercepto es la altura ajustada en , y con los tamaños de lote ahora confinados a 60 a 80, cero está más lejos fuera de los datos que antes, así que el intercepto es una extrapolación más extrema. Su propio error estándar, que carga el término , también se dispararía a medida que cae.
Lo que no cambiaría: los estimadores siguen siendo insesgados, ya que sin importar la dispersión del predictor, y y la recta verdadera son los mismos. En promedio la pendiente sigue siendo correcta; solo es mucho menos precisa.
Una respuesta débil dice que la precisión “empeora” sin atarla a en el denominador, o afirma erróneamente que las estimaciones se vuelven sesgadas cuando los predictores están apiñados.
PE 2.5. Dos errores en un argumento de ajuste a mano. Un compañero ajusta una recta a mano, reporta residuos que suman exactamente cero, y concluye: “Como , mi ajuste debe ser la recta de mínimos cuadrados, y ahora puedo estimar dividiendo la SSE entre ”. Identifica los dos errores separados en este razonamiento, y da el enunciado correcto en cada caso.
Respuesta modelo
Primer error: no demuestra un ajuste de mínimos cuadrados. La condición es necesaria pero no suficiente. La primera ecuación normal fuerza para la recta de mínimos cuadrados con intercepto, así que todo ajuste de mínimos cuadrados la tiene; pero también la tiene cualquier otra recta trazada por el punto de las medias , incluida una con la pendiente equivocada y un intercepto compensatorio. La identidad que en verdad distingue a los mínimos cuadrados es la segunda ecuación normal, . Para confirmar que el ajuste es de mínimos cuadrados el compañero debe verificar que los residuos son ortogonales al predictor también, no solo que se equilibran a cero.
Segundo error: dividir la SSE entre es sesgado. Se gastaron dos grados de libertad estimando y antes de medir los residuos, así que , y solo es insesgado para . Dividir entre (el divisor de máxima verosimilitud) subestima , de forma más notable cuando es pequeño. El estimador correcto es .
Una respuesta débil trata como prueba de mínimos cuadrados mientras ignora , o defiende el divisor sin reconocer que es sesgado bajo.
Juego del capítulo¶
Chapter summary (in English)
This chapter introduces simple linear regression, the model , using the Toluca Company data: work hours against production lot size across 25 runs. The model splits each observation into a systematic part, the mean line , and a random error with mean zero, constant variance , and no correlation across observations. No assumption about the shape of the distribution is needed yet.
The least-squares method chooses the line that minimizes the sum of the squared vertical distances, . We derive the estimators two ways: by calculus, obtaining the normal equations and the solutions and ; and by an algebraic identity showing that no other line has a smaller SSE. For Toluca, and : each extra unit in the lot adds about 3.57 hours.
The residuals satisfy exact identities: they sum to zero, are orthogonal to the predictor and to the fitted values, and the line passes through . The error variance is estimated with ; the divisor makes the estimator unbiased, which we prove by showing . For Toluca, , , and hours.
Finally we study the sampling behavior of the estimators: and are unbiased, with variances and . The Gauss-Markov theorem proves that is the best linear unbiased estimator (minimum variance). Under normal errors, maximum likelihood produces exactly the same least-squares estimates, with . Chapter 3 will use these sampling distributions to build confidence intervals and hypothesis tests.