3. Inferencia para la regresión lineal simple¶
En 2.2 Mínimos cuadrados desde los primeros principios ajustamos una recta a las 25 corridas de producción de la Toluca Company y obtuvimos una pendiente de horas por unidad de tamaño de lote. Los ingenieros quedaron satisfechos y enseguida hicieron las preguntas que cualquier persona cuidadosa hace sobre un número: ¿qué tan seguros están? Otras 25 corridas habrían dado una pendiente algo distinta. ¿Podría la pendiente verdadera ser realmente cero, es decir, que el tamaño del lote no afecte en nada a las horas y nos estemos engañando? Y la pregunta práctica, la razón por la que recogieron los datos: si programamos una nueva corrida de 100 unidades la próxima semana, ¿cuántas horas debemos presupuestar y qué tan lejos podríamos quedar?
El Capítulo 2 dio estimaciones puntuales: una sola mejor conjetura para el intercepto, la pendiente y la varianza del error. Una estimación puntual sin ninguna medida de su incertidumbre es media respuesta. Este capítulo aporta la otra mitad. Adjuntamos márgenes de error a la pendiente y al intercepto, probamos si la pendiente es realmente distinta de cero, y, lo más importante para la planeación, construimos dos intervalos muy diferentes alrededor de una predicción. Uno dice dónde cae la corrida promedio de un tamaño dado. El otro dice dónde cae una sola corrida nueva. La Figure 1 muestra ambos trazados alrededor de la recta de Toluca, y la brecha entre ellos es la idea más útil del capítulo.

Figure 1:La banda interior (azul) es una banda de confianza del 95% para las horas medias en cada tamaño de lote; la banda exterior (amarilla) es una banda de predicción del 95% para una sola corrida nueva. La banda de predicción debe cubrir la dispersión aleatoria propia de una corrida, por eso es mucho más ancha. Confundir las dos es el error más común y más costoso en la regresión aplicada.
Todo lo que sigue descansa sobre un supuesto adicional que el Capítulo 2 introdujo pero aún no había usado para la inferencia: los errores están distribuidos normalmente (2.6 Máxima verosimilitud bajo errores normales). Con ese supuesto las distribuciones muestrales bosquejadas en 2.5 Comportamiento muestral y el teorema de Gauss-Markov se vuelven distribuciones y exactas, y de ahí se siguen intervalos y pruebas honestos.
3.1 Las distribuciones muestrales de y ¶
Intuición¶
Ya sabemos por 2.5 Comportamiento muestral y el teorema de Gauss-Markov que la estimación de la pendiente es insesgada, con varianza , donde es la dispersión de los valores del predictor alrededor de su media . Eso nos dice dónde se centra y cuánto se dispersa, pero no la forma de su distribución. Para construir un intervalo necesitamos la forma. El truco es que es una suma ponderada de las respuestas, y una suma ponderada de variables aleatorias normales independientes es también normal. Así que, en cuanto suponemos errores normales, es exactamente normal, y podemos estandarizarla igual que la estadística introductoria estandariza una media muestral.
Hay una complicación. Estandarizar necesita la desviación estándar verdadera del error , que no conocemos. La reemplazamos por la estimación . Cambiar una constante conocida por una estimación ruidosa añade un poco de incertidumbre extra, y esa incertidumbre extra es exactamente lo que convierte la distribución normal en una distribución . La Figure 2 lo confirma: estandariza 5000 pendientes simuladas por sus propios errores estándar estimados, y el montón coincide con una curva , con colas un poco más pesadas que la normal.

Figure 2:Cinco mil estimaciones de pendiente, cada una estandarizada por su propio error estándar estimado. El montón sigue una distribución t con 23 grados de libertad (roja), cuyas colas son un poco más pesadas que la normal estándar (punteada). Usar s en lugar de sigma es lo que hace que la distribución de referencia sea t y no normal.
Fórmula¶
Bajo el modelo de errores normales con , los estimadores son exactamente normales:
En palabras: cada estimador está centrado en el parámetro que estima, con la varianza que derivamos en el Capítulo 2, y ahora con una forma normal. Para estandarizar cualquiera de los dos necesitamos la dispersión de la estimación. El error estándar estimado de la pendiente (Definición 3.1) la proporciona.
El error estándar estimado es nuestra mejor conjetura de cuánto rebota de una muestra a la siguiente. Estandarizar con él da un estadístico , el resultado que se enuncia a continuación.
En palabras: resta el valor verdadero y divide por el error estándar estimado, y el resultado sigue una distribución con grados de libertad. Los grados de libertad son porque ese es el divisor en , y los dos grados perdidos pagan por y (2.4 Estimar la varianza del error). Este único resultado alimenta cada intervalo y prueba en el resto del capítulo.
Esa última frase merece una imagen. Casi todo lo que viene es una sola idea, el estadístico de arriba, apuntado a una estimación distinta cada vez. La Figure 3 es el mapa del capítulo en una sola página: tenla presente y cada sección nueva se vuelve “el mismo movimiento, nuevo objetivo”.

Figure 3:Todo el capítulo en una página. Toma una estimación, réstale lo que intenta acertar, divide por su error estándar estimado, y lee la respuesta en una distribución t. Cada sección de adelante es ese único movimiento apuntado a un nuevo objetivo.
Derivación¶
Derivación (el estadístico para la pendiente). Armamos el resultado a partir de tres hechos.
Normalidad. De 2.5 Comportamiento muestral y el teorema de Gauss-Markov, con . Bajo el modelo de errores normales los son variables normales independientes, y cualquier combinación lineal de normales independientes es normal. Con la media y la varianza ya derivadas, . Dividir por la desviación estándar verdadera da una normal estándar:
Una chi cuadrada, independiente de la pendiente. Se puede demostrar que
y que esta cantidad es estadísticamente independiente de (de hecho de todo el vector ). La demostración limpia usa la matriz sombrero y un teorema sobre formas cuadráticas en vectores normales; la damos completa en 7.3 La matriz sombrero, una vez que tengamos las herramientas matriciales. Por ahora tomamos estos dos hechos por fe, y notamos que la simulación en la Figure 2 es una comprobación directa de que el resultado final es correcto.
Combinar en una . Una normal estándar dividida por la raíz cuadrada de una chi cuadrada independiente sobre sus grados de libertad es, por definición, una variable aleatoria :
El paso intermedio solo desarrolla el numerador y el denominador: el numerador es , y . El argumento idéntico con los pesos de 2.5 Comportamiento muestral y el teorema de Gauss-Markov da el estadístico para .
El código de preparación de abajo reajusta el modelo de Toluca y recupera los errores estándar que usaremos en todo el capítulo.
toluca <- read.csv("data/toluca.csv")
fit <- lm(hours ~ lotsize, data = toluca)
n <- nrow(toluca)
x <- toluca$lotsize
y <- toluca$hours
Sxx <- sum((x - mean(x))^2)
MSE <- sum(residuals(fit)^2) / (n - 2)
round(c(n = n, Sxx = Sxx, MSE = MSE, s = sqrt(MSE),
se_b1 = sqrt(MSE / Sxx)), 4) n Sxx MSE s se_b1
25.0000 19800.0000 2383.7156 48.8233 0.3470 import numpy as np
import pandas as pd
import statsmodels.formula.api as smf
toluca = pd.read_csv("data/toluca.csv")
fit = smf.ols("hours ~ lotsize", data=toluca).fit()
n = len(toluca)
x = toluca["lotsize"].to_numpy()
y = toluca["hours"].to_numpy()
Sxx = np.sum((x - x.mean()) ** 2)
MSE = np.sum(fit.resid ** 2) / (n - 2)
print(round(MSE, 4), round(np.sqrt(MSE), 4), round(np.sqrt(MSE / Sxx), 4))2383.7156 48.8233 0.347El error estándar estimado de la pendiente es horas por unidad, el mismo número que el Capítulo 2 calculó a partir de la fórmula de la varianza. Es la vara de medir para todo lo que sigue.
3.2 Inferencia para la pendiente¶
Intuición¶
La pendiente suele ser el número del que trata un estudio: ¿el tamaño del lote afecta a las horas, y por cuánto? Dos preguntas vienen en pareja. Un intervalo de confianza (Definición 3.3) responde “¿por cuánto?” al dar un rango de valores plausibles para . Una prueba de hipótesis responde “¿hay algún efecto en absoluto?” al preguntar si cero es un valor plausible. Ambas se construyen a partir del único estadístico de 3.1 Las distribuciones muestrales de y , así que siempre concuerdan: un intervalo del 95% excluye a cero exactamente cuando la prueba bilateral rechaza al nivel del 5%.
Fórmula¶
En palabras: toma la estimación y extiéndete un multiplicador de errores estándar a cada lado. Para probar contra , forma el estadístico de prueba
y rechaza cuando , o equivalentemente cuando el valor p bilateral está por debajo de . En palabras: si la estimación queda a muchos errores estándar de cero, cero no es creíble. Nada aquí es especial de cero; para probar para cualquier valor , pon en lugar del 0.
El 95% de “95% de confianza” es una promesa sobre muestras repetidas, no sobre el único intervalo que tienes enfrente, y eso cuesta aceptarlo de palabra. El simulador de abajo toma las muestras para que veas cómo se cumple la promesa y, de vez en cuando, cómo se rompe.
Qué observar. Cada barra es la pendiente estandarizada de una muestra, y una barra en la cola ámbar es un intervalo del 95% que falló por completo a . Prueba esto. Toma cien a la vez hasta que el porcentaje de aciertos se estabilice cerca de 95, y luego relee el intervalo de 3.2 Inferencia para la pendiente sabiendo qué cuenta ese número.
3.3 Inferencia para el intercepto¶
El intercepto es donde la recta ajustada cruza el eje vertical: las horas que el modelo predice para un lote de cero unidades. Es el mismo tipo de estimación que la pendiente, así que recibe exactamente la misma maquinaria. Sigue el mapa de Figure 3 una casilla más allá, y solo cambia el error estándar.
El intercepto recibe el mismo tratamiento, con su propio error estándar . El intervalo de confianza es , y la prueba de usa .
La razón por la que el intercepto va en segundo lugar es que suele ser menos interesante y a menudo no interpretable. Para Toluca, es las horas medias en un tamaño de lote de cero, una extrapolación muy fuera de los datos (2.2 Mínimos cuadrados desde los primeros principios), así que una prueba de responde una pregunta que nadie hizo. El intervalo aún vale la pena calcularlo, aunque solo sea para ver qué tan flojamente queda sujeto el intercepto.
confint(fit, "(Intercept)", level = 0.95) 2.5 % 97.5 %
(Intercept) 8.213711 116.518print(fit.conf_int(alpha=0.05).loc["Intercept"])0 8.213711
1 116.518006
Name: Intercept, dtype: float64El intervalo del 95% para el intercepto va de unas 8 a 117 horas, un tramo de más de 100 horas. Ese ancho enorme es el precio de extrapolar a , que queda 70 unidades por debajo del lote más pequeño observado. Compáralo con el intervalo ajustado de la pendiente: la pendiente está anclada por datos a ambos lados, el intercepto no.
3.4 Intervalo de confianza para una respuesta media¶
Intuición¶
Ahora pasamos de los coeficientes a una predicción. Pregunta: entre todas las corridas de tamaño de lote , ¿cuál es el número promedio de horas? Ese promedio es el punto sobre la recta verdadera, , y nuestra estimación de él es el valor ajustado . Como y oscilan de una muestra a otra, también lo hace , y queremos un intervalo para la media verdadera.
La característica clave es que el ancho del intervalo depende de dónde se ubica . Cerca del centro la recta ajustada queda sujeta con firmeza, así que el intervalo es angosto. Lejos de una pequeña inclinación en la pendiente hace subir o bajar mucho la recta, así que el intervalo se ensancha. Este es el estrechamiento que vimos en el haz de rectas ajustadas de Figure 15, ahora convertido en una fórmula.
Fórmula¶
La varianza estimada de la media ajustada en es
y de ahí se sigue el intervalo de confianza para la respuesta media.
En palabras: cuanto más lejos está del valor promedio del predictor , mayor es el segundo término dentro del paréntesis, y más ancho el intervalo. En el segundo término se anula y el intervalo está en su punto más angosto, con el ancho fijado solo por .
Derivación¶
Derivación (varianza de la media ajustada). Escribe el valor ajustado en su forma pivoteada, usando :
Las dos piezas y no están correlacionadas. Para verlo, recuerda y , así que, usando la independencia de los y ,
Como las dos piezas no están correlacionadas, sus varianzas se suman:
Reemplazar por da . El intervalo se sigue entonces del mismo argumento de estandarizar y dividir de 3.1 Las distribuciones muestrales de y , ya que .
La Figure 5 grafica contra : una curva que baja a su mínimo en y sube simétricamente a ambos lados. Esa curva es lo que le da a la banda de confianza de Figure 1 su suave forma de moño.

Figure 5:El error estándar de la respuesta media (azul) es más pequeño en el tamaño de lote medio y crece hacia los extremos. El error estándar de predicción (amarillo) se mantiene cerca de 49 horas en todas partes, porque está dominado por la propia dispersión de una sola corrida, que no se encoge sin importar dónde predigas.
3.5 Intervalo de predicción para una observación nueva¶
Intuición¶
Aquí está la distinción que confunde a más profesionales que ninguna otra. El intervalo de confianza de 3.4 Intervalo de confianza para una respuesta media trata sobre la corrida promedio de tamaño . Pero los ingenieros no programan una corrida promedio; programan una corrida específica la próxima semana, y quieren saber dónde caerán sus horas. Una sola corrida se dispersa alrededor de la media por su propio error aleatorio , y ninguna cantidad de datos elimina esa dispersión. Así que predecir una sola observación nueva conlleva dos fuentes de incertidumbre: nuestra incertidumbre sobre dónde está la recta (el mismo de antes), más la propia varianza irreducible de la corrida nueva . El intervalo que contempla ambas es el intervalo de predicción (Definición 3.6), y siempre es más ancho que el intervalo de confianza.
Toda la elección se reduce a una pregunta, y la Figure 6 la expone. Pregúntate qué estás acotando: el resultado promedio sobre muchos casos en , o el resultado de un caso nuevo específico. La respuesta de la izquierda es un intervalo de confianza; la de la derecha es un intervalo de predicción. Decide la pregunta primero, y la fórmula se sigue.

Figure 6:Elige el intervalo nombrando la pregunta, no por gusto. Promediar sobre muchos casos en X_h pide el intervalo de confianza (izquierda, angosto); planear para un caso nuevo pide el intervalo de predicción (derecha, ancho). La única diferencia en la fórmula es la sigma al cuadrado extra que trae el caso nuevo.
Fórmula¶
Para una observación nueva en , la varianza estimada del error de predicción es , y de ahí se sigue el intervalo de predicción.
En palabras: esta es la varianza de la respuesta media con un extra (el 1 inicial) añadido por la propia dispersión de la corrida nueva. Ese término extra suele ser el dominante, por lo cual el intervalo de predicción es mucho más ancho y por lo cual, a diferencia del intervalo de confianza, nunca se encoge a cero ni siquiera con datos infinitos.
Derivación¶
Derivación (varianza de una predicción). La cantidad que acotamos es el error de predicción , la brecha entre la corrida nueva real y nuestro pronóstico. La corrida nueva es , y su error es independiente de los datos pasados que produjeron . Dos piezas independientes, así que sus varianzas se suman:
Reemplazar por da , y estandarizar el error de predicción por produce de nuevo una distribución . El intervalo se sigue.
La brecha entre los dos intervalos no es una elección de modelado; es un hecho sobre las dos preguntas, y cada intervalo mantiene su propia promesa del 95%. Podemos comprobarlo por simulación, que es la manera más segura de ver que un intervalo de predicción realmente atrapa una observación nueva el 95% de las veces. La Figure 7 corre el experimento.

Figure 7:Para 100 conjuntos de datos simulados, el panel izquierdo construye un intervalo de confianza para la media y lo comprueba contra la media verdadera fija; el panel derecho construye un intervalo de predicción y lo comprueba contra una corrida nueva recién extraída. Ambos atrapan su objetivo unas 95 veces de 100, pero los intervalos de predicción (derecha) son mucho más anchos porque deben cubrir la propia dispersión de una corrida.
set.seed(4210)
b0_true <- 62.366; b1_true <- 3.5702; sigma <- 48.82
xh <- 100
mu_h <- b0_true + b1_true * xh
tcrit <- qt(0.975, n - 2)
ci_hits <- 0; pi_hits <- 0; N <- 5000
for (i in 1:N) {
ysim <- b0_true + b1_true * x + rnorm(n, 0, sigma)
f <- lm(ysim ~ x)
pr <- predict(f, data.frame(x = xh), se.fit = TRUE)
s_mean <- pr$se.fit
s_pred <- sqrt(pr$se.fit^2 + sum(residuals(f)^2) / (n - 2))
if (abs(pr$fit - mu_h) <= tcrit * s_mean) ci_hits <- ci_hits + 1
ynew <- mu_h + rnorm(1, 0, sigma)
if (abs(pr$fit - ynew) <= tcrit * s_pred) pi_hits <- pi_hits + 1
}
round(c(CI_covers_mean = ci_hits / N, PI_covers_new = pi_hits / N), 4)CI_covers_mean PI_covers_new
0.9496 0.9458 from scipy import stats
rng = np.random.default_rng(4210)
b0_true, b1_true, sigma = 62.366, 3.5702, 48.82
xh = 100.0
mu_h = b0_true + b1_true * xh
tcrit = stats.t.ppf(0.975, n - 2)
ci_hits = pi_hits = 0
N = 5000
for _ in range(N):
ysim = b0_true + b1_true * x + rng.normal(0, sigma, size=n)
b1s = np.sum((x - x.mean()) * (ysim - ysim.mean())) / Sxx
b0s = ysim.mean() - b1s * x.mean()
yhat = b0s + b1s * xh
mse = np.sum((ysim - (b0s + b1s * x)) ** 2) / (n - 2)
s_mean = np.sqrt(mse * (1 / n + (xh - x.mean()) ** 2 / Sxx))
s_pred = np.sqrt(mse * (1 + 1 / n + (xh - x.mean()) ** 2 / Sxx))
if abs(yhat - mu_h) <= tcrit * s_mean:
ci_hits += 1
ynew = mu_h + rng.normal(0, sigma)
if abs(yhat - ynew) <= tcrit * s_pred:
pi_hits += 1
print(round(ci_hits / N, 4), round(pi_hits / N, 4))0.9492 0.9544A lo largo de 5000 conjuntos de datos simulados, el intervalo de confianza cubre la media verdadera cerca del 95% de las veces y el intervalo de predicción cubre una corrida nueva cerca del 95% de las veces. Cada intervalo es honesto sobre su propia pregunta. El intervalo de predicción se gana su ancho extra; no está siendo cauteloso por gusto.
La separación entre los dos intervalos se cree mejor cuando puedes abrirla y cerrarla tú mismo. El simulador de abajo pone el tamaño de muestra y el punto de predicción bajo tu dedo, para que descubras cuál banda responde a más datos y cuál no.
Qué observar. Más datos colapsan la banda azul de confianza sobre la recta, mientras que la banda ámbar de predicción apenas se inmuta. Prueba esto. Lleva a 200 con en 100, luego regresa hasta 120 y observa a cuál banda le importa dónde te paras. Las fórmulas de ambas están en 3.5 Intervalo de predicción para una observación nueva.
3.6 El enfoque del análisis de varianza¶
Intuición¶
Hay una segunda manera, equivalente, de ver la misma inferencia, y escala muy bien hacia la regresión múltiple de capítulos posteriores. La idea es contabilidad de la variación. Los valores de la respuesta varían; parte de esa variación la explica la recta, y parte la deja como dispersión residual. Si podemos partir la variación total limpiamente en una parte “explicada” y una parte “sobrante”, podemos compararlas, y una parte explicada grande respecto a la sobrante es evidencia de que la pendiente es real.
La Figure 9 muestra la partición para una sola corrida: la desviación total respecto a la media, , se descompone en la parte que la recta explica, , más el residuo, . Notablemente, cuando elevas al cuadrado y sumas sobre todas las corridas, el término cruzado se anula y los totales se parten con la misma limpieza.

Figure 9:Para una corrida resaltada, la desviación total respecto a la media (violeta) es igual a la parte que la recta explica (naranja, de la media hasta la recta ajustada) más el residuo (rojo, de la recta ajustada al punto). Elevar al cuadrado y sumar sobre todas las corridas da SSTO = SSR + SSE, porque el término cruzado es cero.
Fórmula¶
Define las tres sumas de cuadrados:
En palabras: la variación total de respecto a su media (SSTO) es igual a la variación que la regresión explica (SSR, la dispersión de los valores ajustados respecto a la media) más la variación que no explica (SSE, la suma de cuadrados del error de 2.4 Estimar la varianza del error). Cada suma tiene grados de libertad: para SSTO, 1 para SSR (un predictor), y para SSE. Los grados de libertad se suman de la misma manera, . Dividir cada suma de cuadrados por sus grados de libertad da un cuadrado medio (Definición 3.8).
En palabras: un cuadrado medio es una suma de cuadrados promediada sobre sus grados de libertad, así que es un número tipo varianza. MSR y MSE son los dos que pondremos en un cociente para probar la pendiente.
Derivación¶
Derivación (). Parte cada desviación total encaminándola a través del valor ajustado:
Eleva ambos lados al cuadrado y suma sobre :
El término cruzado es cero. Escribe y desarrolla:
Ambas piezas se anulan por las identidades de residuos de 2.3 Valores ajustados y las propiedades de los residuos: (los valores ajustados son ortogonales a los residuos) y . Así que el término cruzado es cero y . Las identidades de residuos que probamos en el Capítulo 2 vuelven a hacer el trabajo.
Derivación (cuadrados medios esperados). De 2.4 Estimar la varianza del error ya tenemos . Un cálculo de esperanza similar, usando y , da
En palabras: MSE siempre estima , mientras que MSR estima más un término que es positivo exactamente cuando . Así que si la pendiente es cero, MSR y MSE estiman lo mismo y su cociente debería estar cerca de 1; si la pendiente es distinta de cero, MSR está inflado y el cociente es grande. Ese cociente es la prueba .
La tabla ANOVA reúne estas cantidades en un formato estándar. Este es el anclaje que capítulos posteriores extienden a sumas de cuadrados adicionales (8.3 Sumas de cuadrados adicionales).
3.7 La prueba F y su equivalencia con la prueba t¶
Intuición¶
La tabla ANOVA nos entrega una prueba casi gratis. Bajo , tanto MSR como MSE estiman el mismo , así que su cociente ronda 1. Bajo , MSR está inflado por y el cociente crece. Un grande es evidencia contra la nula.
Pero ya probamos con una prueba en 3.2 Inferencia para la pendiente y obtuvimos . ¿Concuerdan las dos pruebas? Sí, exacta y siempre: en la regresión lineal simple el estadístico es el cuadrado del estadístico . Esto vale la pena probarlo, porque muestra que la prueba de ANOVA no es una prueba nueva, solo la prueba con otra ropa.
Fórmula¶
La prueba de usa
y rechaza cuando . La identidad afirmada es
donde es el estadístico de la pendiente. En palabras: el estadístico y el estadístico al cuadrado son el mismo número, y las pruebas dan valores p idénticos.
Derivación¶
Derivación (). Parte de la suma de cuadrados de la regresión. Como ,
Con un grado de libertad de regresión, . Por lo tanto
Ahora escribe el estadístico y elévalo al cuadrado, usando :
Las dos expresiones son literalmente la misma. Distribucionalmente esto coincide con un hecho estándar: el cuadrado de una variable aleatoria es una variable aleatoria , así que elevar al cuadrado el estadístico de la pendiente aterriza en el estadístico de ANOVA, y los valores críticos también coinciden, .
La Figure 10 confirma la mitad distribucional: eleva al cuadrado 200,000 extracciones de una y el histograma aterriza sobre la densidad , con el valor crítico del 5% 4.28 igual a 2.0692.

Figure 10:Elevar al cuadrado una t con 23 grados de libertad produce exactamente una F con 1 y 23 grados de libertad. El valor crítico del 5% 4.28 es el cuadrado del valor crítico t 2.069, así que la prueba F y la prueba t bilateral rechazan en situaciones idénticas.
El álgebra de arriba ocupa tres líneas, pero la identidad convence mucho más cuando eres tú quien descompone los datos y los dos números siguen negándose a discrepar.
Qué observar. y salen de dos tablas distintas de la salida y coinciden en cada dígito mostrado, sin importar dónde queden los puntos. Prueba esto. Arrastra un punto hasta aplanar la recta, luego sigue hasta que se vuelva negativa, y observa qué descarta el cuadrado. La demostración está en 3.7 La prueba F y su equivalencia con la prueba t.
3.8 R cuadrada y su interpretación¶
Intuición¶
La partición ANOVA invita a un resumen natural: ¿qué fracción de la variación total explicó la recta? Esa fracción es , el coeficiente de determinación (Definición 3.12). Va de 0 (la recta no explica nada más allá de la media) a 1 (la recta pasa por cada punto). Es el número más reportado y más malinterpretado en la regresión, así que diremos con claridad qué significa y qué no.
Fórmula¶
En palabras: es la proporción de la variación total en que la regresión sobre da cuenta. En la regresión lineal simple también es igual a , el cuadrado de la correlación de Pearson entre y , un vínculo que el Capítulo 4 desarrolla (4.2 La correlación y la pendiente de regresión).
La Figure 12 muestra los dos ingredientes: la dispersión total de las horas respecto a su media (SSTO, izquierda) se encoge a la dispersión residual mucho menor respecto a la recta (SSE, derecha). es cuánto de la dispersión vertical removió la recta.

Figure 12:Izquierda: las horas varían mucho respecto a su propia media (SSTO). Derecha: una vez que el tamaño del lote está en el modelo, la dispersión sobrante respecto a la recta (SSE) es mucho menor. R cuadrada = 1 menos SSE/SSTO = 0.82 es la fracción de la dispersión vertical que la recta removió.
3.9 Una banda de confianza para toda la recta¶
Intuición¶
El intervalo de confianza de 3.4 Intervalo de confianza para una respuesta media es honesto sobre un tamaño de lote que nombras de antemano. Pero a menudo quieres trazar una banda alrededor de toda la recta ajustada y afirmar, con 95% de confianza, que la recta verdadera está dentro de ella en todas partes a la vez. Si simplemente encadenas los intervalos puntuales, la confianza simultánea es menor al 95%, porque estás haciendo muchas afirmaciones y algunas fallarán por azar. La banda de Working-Hotelling (Definición 3.13) arregla esto usando un multiplicador un poco mayor, de modo que la afirmación sobre toda la recta se cumpla al nivel enunciado.
Fórmula¶
En palabras: la banda tiene el mismo centro y el mismo error estándar que el intervalo puntual, pero el multiplicador reemplaza a . Como , la banda es un poco más ancha en todas partes, y ese ancho extra compra cobertura simultánea de la recta verdadera en todos los a la vez. El multiplicador usa una con 2 grados de libertad en el numerador porque la recta tiene dos parámetros, y , que ambos pueden variar.
W <- sqrt(2 * qf(0.95, 2, n - 2))
round(c(W = W, t = qt(0.975, n - 2)), 4) W t
2.6162 2.0687 W = np.sqrt(2 * stats.f.ppf(0.95, 2, n - 2))
print(round(W, 4), round(stats.t.ppf(0.975, n - 2), 4))2.6162 2.0687Para Toluca el multiplicador de toda la recta es contra el puntual , así que la banda simultánea es alrededor de 26% más ancha que un intervalo de un solo punto. La Figure 13 traza ambos.

Figure 13:El intervalo de confianza puntual (punteado) es honesto sobre un solo tamaño de lote elegido. La banda de Working-Hotelling (sombreada) es más ancha por el factor W/t = 2.62/2.07 y es honesta sobre toda la recta a la vez. Usa la banda más ancha cuando vayas a leer la recta ajustada en varios lugares.
3.10 Un ejemplo enfocado en la predicción: publicidad y ventas¶
Para ver la maquinaria en un conjunto de datos nuevo, pasa a los datos de publicidad: los presupuestos de publicidad televisiva de 200 mercados y las ventas de producto resultantes (miles de unidades). Un gerente quiere predecir las ventas de un mercado nuevo que recibirá un presupuesto televisivo de 150 mil dólares, y entender el efecto promedio del presupuesto.
La Figure 14 traza ambas bandas. Nota que la banda de predicción contiene cómodamente casi los 200 mercados, mientras que la banda de confianza, al ser sobre la media, no.

Figure 14:Los datos de publicidad con la recta ajustada, una banda de confianza angosta para las ventas medias (interior azul), y una banda de predicción ancha para un solo mercado nuevo (exterior amarilla). La banda de predicción contiene casi los 200 mercados; la banda de confianza es solo sobre el promedio y contiene pocos de ellos.
3.11 Resumen del capítulo¶
Ahora puedes hacer inferencia para una regresión lineal simple, no solo ajustarla. Viste por qué la pendiente y el intercepto estandarizados siguen una distribución con grados de libertad, y la usaste para construir intervalos de confianza y pruebas de hipótesis para ambos coeficientes (la pendiente de Toluca, , IC del 95% ). Aprendiste a distinguir un intervalo de confianza para una respuesta media de un intervalo de predicción para una sola observación nueva, a derivar ambas fórmulas de varianza, y, sobre todo, a decir cuál necesita una pregunta: para una corrida de 100 unidades el intervalo de la media es pero el intervalo de predicción de una sola corrida es . Derivaste la descomposición ANOVA, construiste la tabla, corriste la prueba (), y probaste que es la prueba de la pendiente al cuadrado. Puedes leer correctamente y ensanchar un intervalo puntual a una banda de Working-Hotelling () cuando necesitas toda la recta.
Resultados clave de un vistazo.
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Distribuciones muestrales de (Teorema 3.2) | , | modelo RLS con errores normales |
| Intervalo de confianza para la pendiente (Def. 3.3) | igual; prueba vía | |
| Varianza de la media ajustada (Teorema 3.5) | respuesta media en fijo | |
| Intervalo de confianza para una respuesta media (Def. 3.4) | promediar sobre muchos casos en | |
| Varianza de una predicción (Teorema 3.7) | el error del caso nuevo es independiente del ajuste | |
| Intervalo de predicción (Def. 3.6) | una sola observación nueva en | |
| Descomposición ANOVA (Teorema 3.9) | , gl | ajuste por mínimos cuadrados con intercepto |
| Cuadrados medios esperados (Teorema 3.10) | , | modelo RLS |
| Prueba y (Teorema 3.11) | , | errores normales; probar |
| Coeficiente de determinación (Def. 3.12) | describe variación explicada, no correctitud del ajuste | |
| Banda de Working-Hotelling (Def. 3.13) | , | cobertura simultánea de toda la recta |
Términos clave. Error estándar estimado, intervalo de confianza para la pendiente, prueba de hipótesis para la pendiente, intervalo de confianza para una respuesta media, intervalo de predicción, análisis de varianza, suma de cuadrados total, suma de cuadrados de la regresión, cuadrado medio, prueba , coeficiente de determinación, banda de confianza de Working-Hotelling, grados de libertad.
Ahora deberías poder:
Derivar las distribuciones muestrales de y y explicar por qué la inferencia usa .
Construir e interpretar intervalos de confianza y pruebas de hipótesis para la pendiente y el intercepto a partir de la salida del software.
Distinguir un intervalo de confianza para una respuesta media de un intervalo de predicción para una observación nueva, derivar ambos y elegir el correcto.
Derivar la descomposición ANOVA , construir la tabla ANOVA y correr la prueba para la pendiente.
Demostrar que en la regresión lineal simple.
Interpretar correctamente, y nombrar qué mide y qué no mide.
Construir una banda de confianza de Working-Hotelling para toda la recta de regresión.
Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado (PREGUNTAR, EXPLORAR, AJUSTAR, VERIFICAR, USAR), este capítulo es el corazón de la etapa USAR: convierte una recta ajustada en decisiones y pronósticos honestos con incertidumbre declarada. El Capítulo 2 dio las estimaciones puntuales; aquí adjuntamos intervalos y pruebas. El intervalo de predicción (3.5 Intervalo de predicción para una observación nueva) regresa en el Capítulo 12 cuando validamos modelos con datos apartados y en el Capítulo 15 cuando pronosticamos, donde enfrentaremos por qué los datos ordenados en el tiempo hacen más difíciles los intervalos de predicción. La tabla ANOVA (3.6 El enfoque del análisis de varianza) y la prueba (3.7 La prueba F y su equivalencia con la prueba t) se generalizan en el Capítulo 8 hacia la maquinaria de sumas de cuadrados adicionales (8.3 Sumas de cuadrados adicionales) y la prueba lineal general (8.4 La prueba lineal general), que pueden comparar modelos enteros a la vez. Y el valor p diminuto de la pendiente aquí es la referencia que el Capítulo 5 comprueba contra una prueba de permutación que no supone normalidad en absoluto (5.2 La prueba de permutación para la pendiente), preguntando si nuestra conclusión basada en sobrevive sin el modelo de errores normales.
3.12 Preguntas frecuentes¶
P1. ¿Cuál es la diferencia en una frase entre un intervalo de confianza y un intervalo de predicción? Un intervalo de confianza es para la respuesta media en , promediada sobre todos los casos en ese valor del predictor; un intervalo de predicción es para un solo caso nuevo, y es más ancho porque también debe cubrir la propia dispersión aleatoria de ese caso .
P2. ¿Por qué se ensancha el intervalo a medida que se aleja de ? Porque la varianza de la media ajustada carga un término . Lejos del centro, un pequeño cambio en la pendiente estimada hace pivotar la recta una gran distancia vertical, así que el valor ajustado ahí es menos certero. Toda recta ajustada pasa por , así que la incertidumbre es mínima ahí.
P3. ¿Por qué usar y no la distribución normal? Porque estimamos con en lugar de conocerlo. Esa estimación extra hace que la distribución de referencia sea , con colas más pesadas que la normal. Para grande las dos casi coinciden, pero para la diferencia importa.
P4. La prueba y la prueba dieron el mismo valor p. ¿Necesito ambas? En la regresión lineal simple, no: , así que son una sola prueba. Reporta la prueba para una sola pendiente porque conserva la dirección (el signo) del efecto. La prueba se gana su lugar en la regresión múltiple, donde puede probar varios coeficientes de forma simultánea.
P5. Mi es alto. ¿Significa que mi modelo es bueno? No por sí solo. Un alto puede acompañar una relación curva, varianza no constante, o valores atípicos influyentes, todo lo cual un gráfico de residuos revelaría. mide la variación explicada, no la correctitud, ni la exactitud de la predicción, ni la causalidad. Léelo junto con y los gráficos de diagnóstico (Capítulo 9).
P6. ¿Puedo usar estos intervalos para predecir las horas de un lote de 500 unidades? No. Eso es extrapolación muy fuera del rango de los datos (20 a 120 unidades). Las fórmulas producirán con gusto un intervalo, pero su confianza declarada supone que el modelo de recta se cumple allá afuera, lo cual los datos no pueden respaldar. Confía en los intervalos solo dentro, o apenas fuera, del rango observado de .
P7. ¿Qué significa exactamente “95% de confianza” para el intervalo de la pendiente? Significa que el procedimiento atrapa la pendiente verdadera en el 95% de las muestras repetidas, como muestra la Figure 15 con 100 intervalos simulados. Para tu único intervalo , la pendiente verdadera está en él o no; el 95% describe la confiabilidad a largo plazo del método, no una probabilidad sobre este intervalo en particular.

Figure 15:El significado de la confianza del 95%: a lo largo de 100 muestras simuladas, alrededor de 95 de los intervalos del 95% cubren la pendiente verdadera (azul) y unos pocos fallan (rojo). Cualquier intervalo dado cubre la verdad o no; el 95% es una propiedad del procedimiento sobre el muestreo repetido.
3.13 Problemas de práctica¶
(A) En una frase cada uno, enuncia sobre qué tratan un intervalo de confianza para la respuesta media y un intervalo de predicción para una observación nueva, y di cuál es más ancho y por qué.
(A) El intervalo de confianza del 95% de la pendiente es . Explica qué significa “95% de confianza” aquí, y qué no significa.
(A) Explica por qué el intervalo de confianza para una respuesta media es más angosto en y se ensancha a ambos lados.
(A) ¿Por qué la inferencia para la pendiente usa una distribución con grados de libertad en lugar de una normal estándar? ¿De dónde vienen los grados de libertad?
(A) Un reporte afirma “, así que el modelo es correcto”. Da dos razones distintas por las que esta conclusión no se sigue.
(A) El intervalo del 95% del intercepto es enormemente ancho comparado con el de la pendiente. Explica por qué, refiriéndote a dónde se ubica respecto a los datos.
(A) En la regresión lineal simple la prueba de ANOVA y la prueba de la pendiente siempre concuerdan. Enuncia la relación exacta entre los dos estadísticos y una razón para reportar aún la prueba .
(A) Un colega usa un intervalo de confianza del 95% para la respuesta media para presupuestar una sola corrida de producción próxima. Explica por qué esto subestima el riesgo, y cuál intervalo debería usar.
(B) Deriva el estadístico (Teorema 3.2), enunciando con claridad cuáles hechos tomas del Capítulo 2, cuáles tomas por fe hasta el Capítulo 7, y por qué la combinación es una .
(B) Deriva (Teorema 3.5), incluyendo el paso de que y no están correlacionadas.
(B) Deriva la varianza del error de predicción (Teorema 3.7), explicando de dónde viene el 1 inicial y por qué el error nuevo es independiente de .
(B) Prueba la identidad ANOVA (Teorema 3.9) mostrando que el término cruzado se anula, nombrando las identidades de residuos que usas.
(B) Prueba que en la regresión lineal simple (Teorema 3.11), partiendo de .
(B) Muestra que (Teorema 3.10), y explica por qué esto hace de un estadístico de prueba sensato para .
(B) Muestra que un intervalo de confianza del para excluye a 0 exactamente cuando la prueba bilateral de rechaza al nivel .
(B) Partiendo de y , muestra que , y por lo tanto que donde .
(B) El multiplicador de Working-Hotelling es y el multiplicador puntual es . Explica, sin una prueba completa, por qué debe exceder a y qué compra el ancho extra.
(B) Muestra que la semianchura del intervalo de predicción nunca se encoge por debajo de ni siquiera cuando , mientras que la semianchura del intervalo de confianza se encoge a 0. ¿Qué dice esto sobre los límites de la predicción?
(C) Ajusta el modelo de Toluca en R o Python. Reproduce el estadístico de la pendiente, su valor p, y su intervalo de confianza del 95%, y confirma que coinciden con los valores de este capítulo.
(C) Calcula un intervalo de confianza del 95% para las horas medias en unidades y en unidades. ¿Cuál es más ancho, y coincide la diferencia con la regla de ?
(C) Calcula tanto el intervalo de confianza del 95% para la media como el intervalo de predicción del 95% para una corrida nueva en unidades. Reporta el cociente de sus anchos y explícalo.
(C) Construye la tabla ANOVA para Toluca en software. De ella, extrae , , , , y , y verifica usando la de la pendiente del problema 19.
(C) Usando los datos de publicidad, ajusta
sales ~ TV, prueba la pendiente, y da un intervalo de predicción del 95% para un mercado nuevo con un presupuesto televisivo de 200. Interpreta el intervalo para un gerente.(C) Escribe una simulación con semilla (semilla
4210, 2000 conjuntos de datos del modelo de Toluca ajustado en los tamaños de lote observados) que comprueba la cobertura empírica del intervalo de confianza del 95% para la media en . Reporta la cobertura y compárala con 0.95.(C) Reproduce el multiplicador de Working-Hotelling y el multiplicador puntual para Toluca. Luego calcula tanto el intervalo puntual del 95% como la semianchura de la banda de Working-Hotelling en , y reporta el cociente.
(C) Haz la regresión
hours ~ lotsizey traza un gráfico de la recta ajustada con la banda de confianza del 95% y la banda de predicción del 95% (como en Figure 1). Describe cómo difieren las dos bandas en ancho y forma.(B) Un estudiante afirma que como es “enorme”, el modelo debe predecir con exactitud las corridas individuales. Explica la confusión entre la prueba (sobre la pendiente) y la exactitud de la predicción (sobre y el intervalo de predicción), usando los números de Toluca.
(C) Usando los datos de publicidad, calcula de dos maneras: a partir de las sumas de cuadrados de ANOVA y como el cuadrado de la correlación
cor(adv$TV, adv$sales). Confirma que coinciden, e interpreta el valor.
3.14 Práctica de examen¶
Los problemas de arriba construyen habilidades una a la vez. Los exámenes te piden combinarlas y, sobre todo, explicar en oraciones completas: leer la salida del software en contexto, juzgar una afirmación, y decir qué cambiaría bajo una condición nueva. Los cinco problemas de abajo están escritos en esa voz de examen. Trabaja cada uno como si fuera para la máxima calificación, en oraciones completas, antes de abrir la respuesta modelo. Un número pelado o un veredicto de una palabra gana poco crédito en el examen real; el razonamiento es la respuesta.
EP 3.1 (interpretar la salida en contexto). Un programador de producción tiene una corrida nueva específica de 80 unidades en el calendario de la próxima semana. El software ajusta el modelo de Toluca y devuelve dos intervalos en un tamaño de lote de 80.
predict(fit, data.frame(lotsize = 80), interval = "confidence")
predict(fit, data.frame(lotsize = 80), interval = "prediction") fit lwr upr
1 347.982 326.5449 369.4191
fit lwr upr
1 347.982 244.7333 451.2307pr = fit.get_prediction(pd.DataFrame({"lotsize": [80]}))
print("mean CI ", pr.conf_int(alpha=0.05))
print("pred PI ", pr.conf_int(obs=True, alpha=0.05))mean CI [[326.54493825 369.41910215]]
pred PI [[244.73334785 451.23069256]]Interpreta cada intervalo en una frase, con unidades y en el contexto de este problema. Luego el programador propone presupuestar la sola corrida de la próxima semana en “entre 327 y 369 horas, con 95% de seguridad”, usando el primer intervalo. Explica en oraciones completas si ese es el intervalo correcto a usar, cuál debería usar el programador en su lugar, y por qué los dos intervalos difieren por tanto.
Respuesta modelo
El primer intervalo, horas, es un intervalo de confianza del 95% para las horas medias a lo largo de todas las corridas de 80 unidades: tenemos un 95% de confianza de que el tiempo promedio para corridas de 80 unidades, tomado sobre muchas corridas de ese tipo, está entre unas 327 y 369 horas. El segundo intervalo, horas, es un intervalo de predicción del 95% para una sola corrida nueva de 80 unidades: tenemos un 95% de confianza de que una corrida nueva específica de ese tamaño tomará entre unas 245 y 451 horas. El plan del programador es incorrecto, y subestimará el riesgo. El intervalo de confianza describe dónde cae el promedio a largo plazo, pero el trabajo de la próxima semana es una corrida, no un promedio, y una sola corrida carga con su propia dispersión aleatoria de unas horas encima de nuestra incertidumbre sobre la recta. El programador debería presupuestar con el intervalo de predicción, horas, que mide unas 206 horas de ancho contra las 43 horas del intervalo de confianza. Los dos difieren porque el intervalo de predicción añade la propia varianza del error de la corrida nueva (el 1 inicial en ), un término que nunca desaparece sin importar cuántos datos recojamos.
Una respuesta débil rotula los dos intervalos correctamente pero no explica que una sola corrida necesita el intervalo de predicción porque carga con la dispersión extra , y así pierde por qué el intervalo de confianza haría estallar el presupuesto.
EP 3.2 (un estudiante afirma X, evalúa). Un compañero de clase escribe: “Bajo el modelo de errores normales la estimación de la pendiente es exactamente normal, así que un intervalo de confianza del 95% para la pendiente debería usar el multiplicador normal estándar 1.96”. El capítulo en cambio usa . Explica en oraciones completas qué está bien y qué está mal en el razonamiento del compañero, qué paso específico fuerza el cambio de 1.96 a 2.069, y qué le pasa a la brecha entre los dos multiplicadores a medida que crece el tamaño de la muestra.
Respuesta modelo
El compañero tiene razón en que es exactamente normal bajo el modelo de errores normales: es una combinación lineal de respuestas normales independientes, así que . Si conociéramos la desviación estándar del error , entonces sería exactamente normal estándar y 1.96 sería el multiplicador correcto. La falla es que no conocemos . Lo estimamos con y dividimos por el error estándar estimado en su lugar. Reemplazar la constante fija por la estimación ruidosa inyecta incertidumbre extra, y eso es exactamente lo que convierte la distribución de referencia de una normal a una con grados de libertad, cuyas colas más pesadas requieren el multiplicador mayor 2.069 para seguir capturando el 95% de la distribución. A medida que crece, estima cada vez con más confiabilidad, la distribución se aproxima a la normal, y el multiplicador se encoge de vuelta hacia 1.96, así que la brecha se cierra.
Una respuesta débil solo afirma “usamos porque es pequeño” sin nombrar la sustitución de por como la razón, y por eso no puede explicar por qué la brecha se desvanece cuando crece.
EP 3.3 (interpretar la salida en contexto, evaluar una afirmación). Los datos de publicidad registran los
presupuestos televisivos y las ventas de mercados. Ajustar sales ~ TV da la salida de abajo.
summary(fit_adv)$coefficients
anova(fit_adv)
c(R2 = summary(fit_adv)$r.squared, s = summary(fit_adv)$sigma) Estimate Std. Error t value Pr(>|t|)
(Intercept) 7.032594 0.45784294 15.36028 0
TV 0.047537 0.00269061 17.66763 0
Df Sum Sq Mean Sq F value Pr(>F)
TV 1 3314.6 3314.6 312.14 < 2.2e-16
Residuals 198 2102.5 10.6
R2 s
0.6119 3.2587 print(sm.stats.anova_lm(fit_adv))
print(round(fit_adv.rsquared, 4), round(np.sqrt(fit_adv.scale), 4)) df sum_sq mean_sq F PR(>F)
TV 1.0 3314.618167 3314.618167 312.144994 1.467390e-42
Residual 198.0 2102.530583 10.618841 NaN NaN
0.6119 3.2587Primero, verifica a partir de los números que el estadístico es igual al cuadrado del estadístico de la pendiente de TV, y explica en una frase por qué esa identidad debe cumplirse aquí. Luego un gerente lee y y concluye: “el modelo es tan significativo que predecirá las ventas de cualquier mercado dentro de una unidad o dos”. Explica en oraciones completas qué establece en realidad el grande, qué significa , y cuál número de la salida gobierna qué tan lejos puede caer de la recta un solo mercado nuevo.
Respuesta modelo
El estadístico de la pendiente es 17.66763, y su cuadrado es , que coincide con el valor en la tabla ANOVA en los dígitos mostrados. Esta identidad debe cumplirse porque en la regresión lineal simple : la prueba y la prueba bilateral de la pendiente son la misma prueba, así que el estadístico no lleva información que el estadístico no llevara. El grande, como el valor p diminuto de la pendiente, establece solo que la pendiente está lejos de cero en relación con su error estándar, es decir, que el presupuesto televisivo está genuinamente relacionado con las ventas; no dice nada sobre qué tan estrechamente los puntos abrazan la recta. El valor significa que el presupuesto televisivo da cuenta de alrededor del 61% de la variación en las ventas a lo largo de los mercados, dejando el 39% a otros factores, pero una proporción de variación explicada no es una promesa de predicción individual exacta. El número que gobierna qué tan lejos puede caer de la recta un mercado nuevo es el error estándar residual mil unidades, el tamaño típico de la dispersión de un solo mercado respecto a la recta; alimenta el intervalo de predicción, que el capítulo encontró que abarca aproximadamente mil unidades con un presupuesto de 150 (Ejemplo 3.7). Así que el “dentro de una unidad o dos” del gerente está errado por un orden de magnitud: un modelo significativo, de alto, aún puede predecir un solo mercado solo de forma imprecisa.
Una respuesta débil confirma pero luego trata el grande o el alto como evidencia de exactitud de la predicción, perdiendo que (y el intervalo de predicción construido a partir de él), no ni , fija qué tan lejos puede fallar un caso.
EP 3.4 (qué cambiaría si). Supón que los ingenieros de Toluca reunieran muchos más datos de producción con la misma dispersión de tamaños de lote, de modo que el tamaño de muestra crece muchísimo mientras crece en proporción y se mantiene cerca de 2384. Explica en oraciones completas qué le pasa, a medida que , a (a) el ancho del intervalo de confianza del 95% para las horas medias en , y (b) el ancho del intervalo de predicción del 95% para una sola corrida nueva de 100 unidades. Di por qué los dos se comportan de forma distinta, y qué revela esa diferencia sobre los límites de la predicción.
Respuesta modelo
El intervalo de confianza para la media usa . A medida que con creciendo en proporción, tanto como se encogen a cero, así que y el ancho del intervalo se encogen a cero: con datos ilimitados podemos fijar las horas medias en 100 unidades tan preciso como queramos, porque la recta misma se vuelve perfectamente determinada. El intervalo de predicción usa . Los mismos dos términos se desvanecen, pero el 1 inicial no, así que la varianza de predicción cae solo hasta , y la semianchura del intervalo se asienta cerca de horas en lugar de a cero. Los dos se comportan de forma distinta porque el intervalo de predicción debe cubrir la propia dispersión aleatoria de una sola corrida nueva , que ninguna cantidad de datos elimina, mientras que el intervalo de confianza solo persigue la posición de la recta. La lección es que la predicción tiene un piso duro: ni siquiera un modelo perfectamente estimado puede pronosticar una corrida nueva mejor de lo que permite la propia variabilidad irreducible de esa corrida.
Una respuesta débil dice “ambos intervalos se hacen más angostos” sin reconocer que el intervalo de confianza va a cero mientras que el intervalo de predicción se detiene en el piso irreducible .
EP 3.5 (interpretar una figura, explicar por qué). La Figure 5 grafica dos curvas de error estándar estimado contra el tamaño de lote: el error estándar de la respuesta media (azul) baja a un mínimo cerca del tamaño de lote medio de 70 y sube hacia ambos extremos, mientras que el error estándar de predicción (amarillo) se mantiene casi plano cerca de 49 horas a lo largo de todo el rango y se ubica por encima de la curva azul en todas partes. Explica en oraciones completas (a) por qué la curva azul tiene forma de U con su punto más bajo en , y (b) por qué la curva amarilla apenas se dobla aunque está por encima de la azul en cada tamaño de lote.
Respuesta modelo
La curva azul rastrea . La única parte que depende de dónde predices es , que es cero cuando y crece a medida que se aleja en cualquier dirección. Esa distancia al cuadrado hace la curva en forma de U, con su mínimo exactamente en el tamaño de lote medio, porque la recta ajustada está sujeta con más firmeza en el centro de los datos y una pequeña inclinación en la pendiente la hace oscilar más cuanto más lejos vayas. La curva amarilla rastrea , que tiene el mismo término dependiente de la posición pero añade el 1 inicial. Ese término inicial aporta a la varianza, mucho mayor que las piezas y a lo largo del rango observado, así que el total está dominado por una constante y se mantiene cerca de horas en todas partes. La curva aún se dobla ligeramente hacia arriba en los extremos por la misma razón que la azul, pero el doblez es diminuto respecto al piso plano fijado por la propia dispersión de una sola corrida.
Una respuesta débil dice que la curva de predicción es “solo más alta porque la predicción es más ancha” sin identificar el 1 inicial (la propia varianza de la corrida ) como el término grande, independiente de la posición, que aplana la curva.
3.15 Juego del capítulo¶
Chapter summary (in English)
This chapter does inference for simple linear regression, continuing with the Toluca Company data from Chapter 2 (fitted line , ). Chapter 2 gave point estimates; here we add uncertainty in the form of intervals and tests.
Under the normal-error model, the estimators and are exactly normal, and standardizing by the estimated standard error gives a t distribution with degrees of freedom. From this come the confidence interval for the slope, , and the hypothesis test of , with and a p-value of : lot size does affect hours.
The central distinction of the chapter is between the confidence interval for the mean response and the prediction interval for a new observation. The first describes the average of many runs; the second adds the new run’s own variance and so is much wider. For a lot of 100 units, the mean interval is and the prediction interval is . A seeded simulation confirms that each covers its target near 95% of the time.
The analysis of variance approach decomposes () and produces the F test, with . We prove that in simple regression : they are the same test. The coefficient of determination is the proportion of variation explained, not a measure of accuracy or causation. Finally, the Working-Hotelling band, with multiplier , gives simultaneous confidence for the whole line at once.