Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

11. Predictores categóricos e interacciones

En 2008 una universidad de Estados Unidos reunió una tabla de su profesorado: para cada uno de 397 profesores, la tabla registró el rango, la disciplina académica, los años desde el doctorado, los años de servicio, el sexo y el salario académico de nueve meses. La tabla se armó por una razón concreta, vigilar si a hombres y mujeres se les pagaba de forma distinta. Esa es una pregunta con consecuencias reales, y también una pregunta que un solo número no responde bien. El salario masculino promedio en estos datos es de unos $115,090 y el salario femenino promedio es de unos $101,002, una brecha cruda de aproximadamente $14,088. ¿Es esa brecha toda la historia?

Casi con certeza no, porque el salario depende de más de una cosa. Depende en gran medida del rango: los profesores titulares ganan mucho más que los profesores asistentes, como muestra Figure 1. Depende de la disciplina y de los años de servicio. Si la mezcla de rangos, disciplinas y experiencia difiere entre los dos grupos, entonces una diferencia cruda de promedios mezcla el efecto del sexo con los efectos de todo lo demás. Para decir algo cuidadoso, necesitamos un modelo que pueda mantener fijas esas otras variables. Pero el rango, la disciplina y el sexo no son números. Son categorías, y hasta ahora todo predictor en este libro ha sido una cantidad medida como el tamaño de un lote o los años. Este capítulo trata de meter categorías en una regresión.

Un diagrama de caja con puntos dispersos del salario académico en miles de dólares para tres rangos del profesorado, Asistente, Asociado y Titular. Los salarios suben desde un grupo compacto alrededor de 80 mil para los profesores asistentes, hasta unos 95 mil para los asociados, hasta una amplia dispersión centrada cerca de 127 mil para los titulares. Rombos rojos marcan las medias de grupo en cada rango.

Figure 1:El salario académico de nueve meses sube de forma pronunciada con el rango, desde una media cercana a 81k para los profesores asistentes hasta unos 127k para los titulares. Un predictor con tres categorías con nombre como este no puede entrar en una regresión como un solo número; este capítulo muestra cómo codificarlo.

Al terminar podrás convertir un predictor categórico en variables indicadoras y leer cada coeficiente. Combinarás una categoría con un predictor continuo para ajustar rectas paralelas o separadas, probarás cuál sostienen los datos, y modelarás la curvatura con polinomios de la manera correcta. Y verás que el análisis de varianza de una vía que quizá recuerdes de estadística básica no es más que una regresión sobre indicadores. Los datos de salarios nos llevan por la parte categórica; los clásicos datos de distancia de frenado cars nos llevan por la parte polinómica.

11.1 De categorías a números: codificación con indicadores

Intuición

Una ecuación de regresión multiplica cada predictor por un número, así que un predictor tiene que ser un número. “Rango” no lo es: sus valores son las palabras Asistente, Asociado y Titular. Podrías sentir la tentación de codificarlos como 1, 2, 3 y meter eso. Resiste. Codificar el rango como 1, 2, 3 impone a los datos una afirmación específica y probablemente falsa. Dice que el salto salarial de Asistente a Asociado es igual al salto de Asociado a Titular, porque ambos son un movimiento de una unidad en tu escala inventada. Las categorías tienen un orden, pero nada dice que las brechas sean iguales, y un predictor nominal como la disciplina o el sexo no tiene orden alguno.

La manera honesta de llevar una categoría a una regresión es con variables indicadoras (Definición 11.1), también llamadas variables ficticias: columnas de 0 o 1, cada una respondiendo una pregunta de sí o no (“¿es este profesor un titular?”). Los indicadores permiten que cada categoría tenga su propio nivel, libre de cualquier supuesto sobre el espaciado. La única sutileza es que no usas un indicador por categoría. Usas uno menos, y dejas que la categoría omitida fije la línea base. Figure 2 muestra la idea para los tres rangos: un grupo se vuelve la línea base, y los coeficientes miden cuánto se sitúa cada otro grupo por encima de él.

Tres medias de grupo para el salario por rango dibujadas como puntos, Asistente en 80.8 mil, Asociado en 93.9 y Titular en 126.8. Una línea horizontal discontinua se sitúa en la media de Asistente y está etiquetada como b-cero igual a 80.8. Flechas rojas apuntan hacia arriba desde esa línea base hasta el punto de Asociado, etiquetada b-uno igual a más 13.1, y hasta el punto de Titular, etiquetada b-dos igual a más 46.0.

Figure 2:Codificación de celda de referencia para el rango. El intercepto es la media del grupo de referencia (Asistente, 80.8k), y cada coeficiente es la brecha vertical desde esa línea base hasta la media de otro grupo: +13.1k hacia Asociado, +46.0k hacia Titular.

Fórmula

Supón que un predictor categórico (un factor, Definición 11.2) tiene kk niveles. Elige un nivel como referencia (o línea base). Para cada uno de los otros k1k-1 niveles, define una variable indicadora que vale 1 cuando un caso está en ese nivel y 0 en caso contrario. Para los tres rangos, tomando Asistente como la referencia, define

X1={1if Associate0otherwise,X2={1if Full0otherwise.X_1 = \begin{cases} 1 & \text{if Associate} \\ 0 & \text{otherwise} \end{cases}, \qquad X_2 = \begin{cases} 1 & \text{if Full} \\ 0 & \text{otherwise} \end{cases}.

Figure 3 muestra esta codificación en acción sobre los primeros profesores de los datos: la única columna de palabras del rango se vuelve dos columnas de 0 o 1, y la fila del profesor asistente es solo un par de ceros.

Una tabla con una columna a la izquierda etiquetada rango en palabras, que lista Titular, Titular, Asistente, Titular, Titular, Asociado para seis profesores, y una flecha etiquetada codificar que apunta a dos columnas indicadoras a la derecha, el indicador de Asociado X-uno y el indicador de Titular X-dos. Cada fila de Titular muestra 0 y 1, cada fila de Asociado muestra 1 y 0, y la fila de Asistente muestra 0 y 0, marcada con una nota roja que dice Asistente igual a 0 0, ambos ceros son su código.

Figure 3:Codificación de celda de referencia en acción. Una columna de palabras de categoría se vuelve k1k-1 columnas indicadoras de ceros y unos. Un profesor titular se codifica (0, 1) y un asociado (1, 0); el profesor asistente no recibe columna propia, y su par de ceros es el código del nivel de referencia.

El modelo con estos dos indicadores es

Yi=β0+β1Xi1+β2Xi2+εi.Y_i = \beta_0 + \beta_1 X_{i1} + \beta_2 X_{i2} + \varepsilon_i .

En palabras: el salario medio es una línea base β0\beta_0, más un extra β1\beta_1 si el profesor es asociado, más un extra β2\beta_2 si el profesor es titular. Lee la respuesta media un nivel a la vez sustituyendo los indicadores:

E{YAssistant}=β0,E{YAssociate}=β0+β1,E{YFull}=β0+β2.E\{Y \mid \text{Assistant}\} = \beta_0, \qquad E\{Y \mid \text{Associate}\} = \beta_0 + \beta_1, \qquad E\{Y \mid \text{Full}\} = \beta_0 + \beta_2 .

Así que β0\beta_0 es la media del grupo de referencia, β1\beta_1 es la diferencia de medias Asociado menos Asistente, y β2\beta_2 es la diferencia Titular menos Asistente. Los coeficientes son contrastes contra la línea base, nada más.

Esto es la codificación de celda de referencia (Definición 11.3; R y Python la llaman codificación de tratamiento). Es la opción por defecto en ambos lenguajes, y la que este libro usa en todo momento. El Capítulo 13 codificará los predictores de una regresión logística exactamente de la misma manera (11.1 De categorías a números: codificación con indicadores es el patrón que reutiliza).

Derivación (por qué k1k-1 indicadores, no kk)

La razón es más fácil de ver que de decir. Figure 4 dispone la matriz de diseño con la columna del intercepto y los tres indicadores de rango. En cada fila exactamente un indicador es 1, así que sumar las tres columnas indicadoras reconstruye la columna de unos del intercepto. Una columna es entonces una copia de las otras combinadas, que es la dependencia lineal que hunde el ajuste.

Una tabla con una columna de intercepto de puros unos a la izquierda, y tres columnas indicadoras a la derecha, una para Asistente, Asociado y Titular. En cada una de las seis filas exactamente uno de los tres indicadores es 1 y los otros dos son 0. Un corchete rojo bajo las tres columnas indicadoras está etiquetado suma estas tres columnas flecha una columna de puros unos, con un signo de igual que apunta de vuelta a la columna del intercepto. Un título encima dice X-Asist más X-Asoc más X-Titular igual a uno, redundante con el intercepto.

Figure 4:Conservar los kk indicadores junto al intercepto es redundante. Como cada profesor tiene exactamente un rango, las tres columnas indicadoras suman fila por fila a la columna de unos del intercepto. Esa dependencia lineal hace singular a XX\mathbf{X}'\mathbf{X}, así que eliminamos un indicador y dejamos que su nivel se vuelva la línea base.

Demostración. Supón que tercamente incluyes los kk indicadores, X1,,XkX_1, \dots, X_k, uno por nivel, junto a la columna de unos del intercepto. Cada caso pertenece a exactamente un nivel, así que exactamente uno de sus indicadores es 1 y el resto son 0. Sumar las columnas indicadoras a lo largo de todos los niveles por lo tanto reconstruye la columna de puros unos:

X1+X2++Xk=1.X_1 + X_2 + \cdots + X_k = \mathbf{1} .

Esa es una dependencia lineal entre las columnas de la matriz de diseño X\mathbf{X}. Por 7.1 El modelo y los mínimos cuadrados en forma matricial, la estimación de mínimos cuadrados b=(XX)1XY\mathbf{b} = (\mathbf{X}'\mathbf{X})^{-1}\mathbf{X}'\mathbf{Y} necesita que XX\mathbf{X}'\mathbf{X} sea invertible, lo que requiere que las columnas de X\mathbf{X} sean linealmente independientes (rango columna completo). Con el intercepto más los kk indicadores, no lo son: los coeficientes no quedan determinados de forma única, porque podrías sumar cualquier constante a β0\beta_0 y restarla del efecto de cada nivel y obtener los valores ajustados idénticos. Elimina un indicador (equivalentemente, elimina el intercepto) y la dependencia desaparece. La codificación de celda de referencia elimina el indicador del nivel de referencia, conserva el intercepto, y da un diseño de rango completo con k1k-1 indicadores. \blacksquare

Este hecho de “uno menos que el número de niveles” tiene un nombre que volverás a encontrar: un factor con kk niveles aporta k1k-1 grados de libertad al modelo.

R

R almacena las categorías como factores y construye los indicadores por ti. Lee los datos y mira las columnas categóricas.

salaries <- read.csv("data/salaries.csv")
dim(salaries)
table(salaries$rank)
table(salaries$discipline)
table(salaries$sex)
[1] 397   6

AssocProf  AsstProf      Prof
       64        67       266

  A   B
181 216

Female   Male
    39    358

Por defecto R ordena los niveles del factor alfabéticamente y hace del primero la referencia. Para el rango eso haría de AssocProf la línea base, lo cual es incómodo de leer. Reordenamos para que Asistente sea la referencia, coincidiendo con Figure 2.

Puedes ver los indicadores mismos en la matriz de diseño del modelo. La primera columna es el intercepto (puros unos), y las dos siguientes son los indicadores de Asociado y Titular.

head(model.matrix(fit_rank), 4)
  (Intercept) rankAssocProf rankProf
1           1             0        1
2           1             0        1
3           1             0        0
4           1             0        1
print(fit_rank.model.exog[:4])
[[1. 0. 1.]
 [1. 0. 1.]
 [1. 0. 0.]
 [1. 0. 1.]]

Las filas 1, 2 y 4 son profesores titulares (indicador de Titular 1); la fila 3 es un profesor asistente (ambos indicadores 0). Ninguna fila tiene jamás ambos indicadores iguales a 1, porque ningún profesor tiene dos rangos a la vez.

Los coeficientes que en realidad son diferencias de medias se entienden mejor cuando uno mueve las medias y observa cómo responden los coeficientes.

Tres deslizadores fijan la media salarial de cada rango, y los valores muestran el intercepto y los coeficientes indicadores que reportaría una regresión sobre el rango.

11.2 Un predictor categórico y uno continuo

Intuición

Una categoría por sí sola solo clasifica los casos en grupos. Los modelos interesantes mezclan una categoría con un predictor medido. El salario, por ejemplo, depende tanto de la disciplina (una categoría, teórica A o aplicada B) como de los años de servicio (un número). Ahora tenemos dos perillas, y hay tres maneras cada vez más flexibles de girarlas, dibujadas de forma esquemática en Figure 6.

Tres paneles lado a lado, cada uno mostrando una respuesta Y contra un predictor continuo X para dos grupos A y B, dibujados como una línea sólida y una línea discontinua. Panel izquierdo, línea común: las dos líneas quedan exactamente una encima de la otra. Panel central, rectas paralelas: las dos líneas tienen la misma pendiente pero la línea discontinua del grupo B está desplazada hacia arriba. Panel derecho, pendientes separadas: las dos líneas empiezan juntas pero la discontinua sube más pronunciadamente y se abren en abanico.

Figure 6:Los tres modelos para un predictor continuo y uno categórico. La línea común ignora el grupo; las rectas paralelas dan a cada grupo su propio intercepto pero una pendiente compartida; las pendientes separadas dan a cada grupo también su propia pendiente, que es lo que hace un término de interacción.

El modelo más simple ignora la categoría y ajusta una sola línea para todos. El siguiente modelo, el tema de esta sección, da a cada disciplina su propio intercepto pero las hace compartir una única pendiente: dos rectas paralelas. Leerlo es fácil: la experiencia vale el mismo número de dólares por año en ambas disciplinas, y una disciplina simplemente se sitúa una cantidad fija por encima de la otra en cada nivel de experiencia. Este modelo de rectas paralelas tiene un nombre tradicional, análisis de covarianza o ANCOVA (Definición 11.5), de los tiempos en que al predictor continuo se le llamaba covariable y a la categoría el tratamiento. El tercer modelo, pendientes separadas, es la sección siguiente.

Fórmula

Sea XX los años de servicio y sea DD el indicador de disciplina B (D=1D = 1 para aplicada, D=0D = 0 para teórica). El modelo de rectas paralelas es

Yi=β0+β1Xi+β2Di+εi.Y_i = \beta_0 + \beta_1 X_i + \beta_2 D_i + \varepsilon_i .

En palabras: el salario es una línea base, más un efecto por año de servicio que ambas disciplinas comparten, más un aumento fijo por estar en la disciplina B.

Sepáralo por disciplina para ver las dos líneas:

Theoretical (D=0):E{Y}=β0+β1X,Applied (D=1):E{Y}=(β0+β2)+β1X.\text{Theoretical } (D=0): \quad E\{Y\} = \beta_0 + \beta_1 X, \\ \text{Applied } (D=1): \quad E\{Y\} = (\beta_0 + \beta_2) + \beta_1 X .

En palabras: ambas líneas tienen pendiente β1\beta_1; la línea aplicada está desplazada hacia arriba en β2\beta_2. Las dos líneas nunca se cruzan, porque son paralelas. La lectura de β2\beta_2 es una comparación genuina “manteniendo fijos los años de servicio”: a una experiencia dada, el profesorado aplicado gana en promedio β2\beta_2 más, exactamente el tipo de comparación ajustada que el capítulo pidió al abrir.

R

Diagrama de dispersión del salario en miles contra los años de servicio, con puntos coloreados por disciplina, azul para teórica A y naranja para aplicada B. Se dibujan dos líneas ajustadas rectas con la misma pendiente, la línea naranja aplicada situándose a una distancia constante por encima de la línea azul teórica a lo largo de todo el rango de servicio.

Figure 7:El modelo de rectas paralelas. Ambas disciplinas comparten una pendiente para los años de servicio, y la línea aplicada se sitúa unos 13.2k por encima de la línea teórica en cada nivel de experiencia. Las rectas paralelas son la firma visual de un modelo sin interacción.

11.3 Interacciones: dejar que las pendientes difieran

Intuición

El modelo paralelo hace un supuesto fuerte: un año de servicio vale lo mismo en ambas disciplinas. Quizá no. Quizá el profesorado aplicado, cuyas habilidades siguen un mercado laboral externo caliente, gana más por año que el profesorado teórico. Si es así, las dos líneas deberían tener pendientes distintas, abriéndose en abanico a medida que crece el servicio en lugar de mantenerse a una distancia fija. Dejar que las pendientes difieran es lo que hace una interacción (Definición 11.6). Una interacción entre una categoría y un predictor continuo dice que el efecto del predictor continuo depende de la categoría.

La construyes añadiendo una columna más: el producto del predictor continuo y el indicador. Ese producto es cero para el grupo de referencia (así su línea queda sin cambios) e igual al predictor continuo para el otro grupo (así ese grupo obtiene un término de pendiente extra).

Fórmula

Con XX = años de servicio y DD = indicador de disciplina B, el modelo de interacción es

Yi=β0+β1Xi+β2Di+β3(XiDi)+εi.Y_i = \beta_0 + \beta_1 X_i + \beta_2 D_i + \beta_3 (X_i D_i) + \varepsilon_i .

En palabras: toma el modelo de rectas paralelas y añade un término de producto, que permite a la disciplina B tener su propia pendiente en lugar de compartir la pendiente base.

Sepáralo por disciplina otra vez:

Theoretical (D=0):E{Y}=β0+β1X,Applied (D=1):E{Y}=(β0+β2)+(β1+β3)X.\text{Theoretical } (D=0): \quad E\{Y\} = \beta_0 + \beta_1 X, \\ \text{Applied } (D=1): \quad E\{Y\} = (\beta_0 + \beta_2) + (\beta_1 + \beta_3) X .

En palabras: la línea teórica tiene intercepto β0\beta_0 y pendiente β1\beta_1; la línea aplicada tiene intercepto β0+β2\beta_0 + \beta_2 y pendiente β1+β3\beta_1 + \beta_3. Así que β2\beta_2 es la brecha entre los dos interceptos (la diferencia en X=0X = 0), y β3\beta_3 es la brecha entre las dos pendientes (los dólares extra por año que el profesorado aplicado gana sobre el teórico). Si β3=0\beta_3 = 0 las pendientes son iguales y volvemos a las rectas paralelas, por eso probar β3=0\beta_3 = 0 es la prueba de “¿difieren las pendientes?”.

La lectura incorrecta, primero

Aquí es donde la lectura cuidadosa importa, porque el modelo de interacción pone una trampa. Mira los coeficientes ajustados (el Ejemplo 11.3 más abajo los calcula): el coeficiente de disciplina β2\beta_2 resulta ser de unos $857 con un error estándar grande y un valor p de 0.86, muy lejos de ser significativo. Un lector apresurado concluye: “la disciplina no importa para el salario”. Esa lectura es errónea, y vale la pena detenerse en el error.

En el modelo de interacción, β2\beta_2 no es “el efecto de la disciplina”. Es solo la brecha entre las disciplinas en X=0X = 0, es decir, para un profesor con cero años de servicio. En cero servicio las dos líneas casi se juntan, así que por supuesto esa brecha particular es pequeña e incierta. Pero las líneas no son paralelas; la línea aplicada sube más rápido. Allá donde vive el profesorado real, a los 20 o 30 años de servicio, las disciplinas están muy separadas. Figure 8 deja claro el punto: β2\beta_2 mide la brecha en el borde izquierdo del gráfico, lo que no dice nada sobre la brecha en el cuerpo de los datos.

Dos líneas ajustadas de salario contra los años de servicio, azul para teórica A y naranja discontinua para aplicada B. En X igual a cero, en el extremo izquierdo, las dos líneas casi se tocan, y una pequeña flecha roja de doble punta etiqueta la brecha ahí como b-dos igual a 0.9k, no significativa. A los 40 años de servicio una alta flecha verde de doble punta muestra una brecha mucho mayor de 28.7k entre las líneas, calculada como 0.9 más 0.695 por 40.

Figure 8:La trampa al leer un modelo de interacción. El coeficiente de disciplina b-dos es solo la brecha vertical en X = 0 (flecha roja, minúscula y no significativa). Como las pendientes difieren, la brecha allá en los datos es grande (flecha verde, 28.7k a los 40 años). Un b-dos pequeño y no significativo no significa que los grupos sean iguales.

La afirmación correcta es: el coeficiente de interacción β3\beta_3 es significativo, así que las pendientes difieren, y la brecha de disciplina crece con el servicio. La brecha a un nivel de servicio específico XX es β2+β3X\beta_2 + \beta_3 X, no β2\beta_2 solo. Siempre que un modelo contiene una interacción, el coeficiente de un efecto principal es una afirmación condicional sobre el punto donde el otro predictor es cero, nunca un “efecto” general.

R

Diagrama de dispersión del salario en miles contra los años de servicio, puntos coloreados por disciplina, azul para teórica A y naranja para aplicada B. Dos líneas ajustadas con pendientes distintas empiezan juntas en servicio bajo y se abren en abanico a medida que aumenta el servicio, la línea naranja aplicada subiendo más pronunciadamente que la línea azul teórica.

Figure 9:El modelo de pendientes separadas. La línea aplicada es más pronunciada, así que las dos disciplinas empiezan juntas y se abren en abanico con la experiencia. La distancia entre ellas a cualquier nivel de servicio es el coeficiente de interacción por ese servicio, más la pequeña brecha de intercepto.

Probar si las pendientes realmente difieren

Ver un par de líneas abiertas en abanico no es una prueba. La interacción añadió exactamente un término al modelo paralelo, así que podemos preguntar si ese único término se gana su lugar con la prueba lineal general de 8.4 La prueba lineal general: ajusta el modelo reducido (paralelo) y el modelo completo (interacción), y compara sus sumas de cuadrados del error. Aquí el modelo reducido es fit_par del Ejemplo 11.2 y el modelo completo es fit_int.

anova(fit_par, fit_int)
Analysis of Variance Table

Model 1: salary ~ yrs.service + discipline
Model 2: salary ~ yrs.service * discipline
  Res.Df        RSS Df  Sum of Sq      F   Pr(>F)
1    394 3.0594e+11
2    393 2.9807e+11  1 7864744229 10.369 0.001388 **
from statsmodels.stats.anova import anova_lm
print(anova_lm(fit_par, fit_int))
   df_resid           ssr  df_diff       ss_diff          F    Pr(>F)
0     394.0  3.059377e+11      0.0           NaN        NaN       NaN
1     393.0  2.980729e+11      1.0  7.864744e+09  10.369424  0.001388

El estadístico FF es 10.37 en 1 y 393 grados de libertad, con un valor p de 0.0014. Ese valor p es igual al valor p de la prueba tt del coeficiente de interacción de arriba, y en efecto t2=3.222=10.37=Ft^2 = 3.22^2 = 10.37 = F, la misma equivalencia entre las pruebas tt y FF que viste para una sola pendiente en 3.7 La prueba F y su equivalencia con la prueba t. Añadir la interacción reduce de forma significativa la suma de cuadrados del error, así que los datos apoyan las pendientes separadas por encima de las rectas paralelas.

La trampa al leer β2\beta_2 es mucho más difícil de repetir después de ver crecer la brecha bajo tu propio dedo.

Mueve el coeficiente de interacción b3 y el año en que lees la brecha, y compara la brecha en cero años con la brecha donde de verdad está el profesorado.

El ajuste y la cuestión de la equidad salarial

Abrimos con una brecha cruda de hombre menos mujer de unos $14,088. Ahora podemos preguntar qué le pasa a esa brecha cuando el modelo mantiene fijos el rango, la disciplina y los años de servicio. Este es el corazón estadístico de un análisis de equidad: una diferencia cruda puede encogerse, desaparecer o crecer una vez que tienes en cuenta otras variables medidas, y un reporte honesto muestra la estimación antes y después del ajuste.

Un gráfico de punto e intervalo de la diferencia salarial estimada de hombre menos mujer en miles de dólares. La estimación sin ajustar, del salario regresado sobre el sexo solo, se sitúa en 14.1k con un intervalo del 95 por ciento claramente por encima de cero. La estimación ajustada, del modelo que también incluye rango, disciplina y servicio, se sitúa en 4.8k con un intervalo más ancho que cruza la línea discontinua del cero.

Figure 11:La diferencia de sexo estimada antes y después del ajuste. Controlar por rango, disciplina y años de servicio mueve la estimación de 14.1k (intervalo por encima de cero) a 4.8k (intervalo que cruza el cero). La estimación ajustada es una asociación entre profesorado por lo demás similar, no un efecto causal.

11.4 Regresión polinómica y centrado

Intuición

Las categorías son una manera en que una recta puede fallar en ajustar; la curvatura es otra. La distancia de frenado no crece en línea recta con la velocidad. La física dice que la distancia de frenado sube con el cuadrado de la velocidad, porque la energía cinética lo hace, y los clásicos datos cars (50 autos de la década de 1920) muestran exactamente esa curva ascendente, dibujada en Figure 12. Una recta se queda corta a las velocidades altas donde la curva se tuerce hacia arriba. Estos son los mismos datos cars cuyo embudo de residuos motivó la transformación de raíz cuadrada en 10.3 Box-Cox: dejar que los datos elijan la potencia; allí reformamos la respuesta, y aquí la dejamos en paz y dejamos que la función media se curve en su lugar.

Diagrama de dispersión de la distancia de frenado en pies contra la velocidad en millas por hora para cincuenta autos, con dos curvas ajustadas. Una línea azul recta sube de forma constante, y una curva cuadrática roja se dobla suavemente hacia arriba, situándose ligeramente por encima de la línea en las velocidades más altas y ligeramente por encima en las más bajas. La dispersión de los puntos se ensancha a medida que aumenta la velocidad.

Figure 12:Distancia de frenado contra velocidad con una recta (azul) y una curva cuadrática (roja). La cuadrática se dobla hacia arriba para coincidir con la física de que la distancia crece más rápido que linealmente con la velocidad, aunque para estos datos la mejora sobre la recta es modesta.

Podemos doblar una recta de regresión añadiendo el cuadrado del predictor como un segundo término. Una regresión polinómica (Definición 11.7) mantiene el modelo lineal en sus coeficientes (así toda la maquinaria de mínimos cuadrados sigue aplicando) mientras hace que la curva ajustada sea una parábola, o una cúbica, o superior. La única complicación práctica es que un predictor y su cuadrado suelen estar fuertemente relacionados entre sí, lo que hace los coeficientes crudos inestables y difíciles de leer. El arreglo es el centrado (Definición 11.8): resta la media del predictor antes de elevar al cuadrado.

Fórmula

El modelo polinómico de segundo orden (cuadrático) en un predictor XX es

Yi=β0+β1Xi+β2Xi2+εi.Y_i = \beta_0 + \beta_1 X_i + \beta_2 X_i^2 + \varepsilon_i .

En palabras: el modelo de recta con una columna extra, el cuadrado del predictor, que permite a la curva ajustada doblarse en lugar de quedarse recta.

La versión centrada reemplaza XX por x=XXˉx = X - \bar X:

Yi=β0+β1xi+β2xi2+εi,xi=XiXˉ.Y_i = \beta_0^{\ast} + \beta_1^{\ast} x_i + \beta_2^{\ast} x_i^2 + \varepsilon_i, \qquad x_i = X_i - \bar X .

En palabras: mide el predictor como una desviación respecto a su promedio antes de elevar al cuadrado. El centrado no cambia la forma de la curva ajustada ni ningún valor ajustado. Solo desplaza lo que significan los términos lineal y de intercepto, y reduce de forma marcada la correlación entre las columnas de primer orden y de segundo orden. Después del centrado, β0\beta_0^{\ast} es la media ajustada a la velocidad promedio y β1\beta_1^{\ast} es la pendiente de la curva a la velocidad promedio, ambos números legibles.

Por qué ayuda el centrado

El predictor crudo speed va de 4 a 25, así que speed y speed^2 aumentan juntos a lo largo de todo ese rango; su correlación en los datos cars es 0.98. Dos columnas que se mueven casi al unísono cargan casi la misma información, y la regresión batalla para repartir el crédito entre ellas: los coeficientes individuales obtienen errores estándar grandes y hasta pueden cambiar de signo. Restar la media recentra el predictor en cero, así su cuadrado se vuelve pequeño en el medio y grande en ambos extremos, una forma de U que ya no sigue al término lineal. Figure 13 muestra la correlación colapsando de 0.98 a unos -0.10 después del centrado.

Dos diagramas de dispersión lado a lado. Izquierda, velocidad cruda en el eje horizontal contra velocidad al cuadrado en el eje vertical, los puntos cayendo casi perfectamente a lo largo de una curva ascendente, etiquetado r igual a 0.98. Derecha, velocidad centrada contra velocidad centrada al cuadrado, los puntos formando una forma de U dispersa alrededor de una tendencia casi plana, etiquetado r igual a menos 0.10.

Figure 13:El centrado rompe la correlación casi perfecta entre un predictor y su cuadrado. En la escala cruda la velocidad y la velocidad al cuadrado se mueven juntas (r = 0.98); después de restar la media, el predictor centrado y su cuadrado están casi sin correlación (r = -0.10), lo que estabiliza los coeficientes del polinomio.

R

Afirmar que el centrado cambia los coeficientes pero no la curva es una cosa; deslizar el punto de centrado y ver que la curva no se mueve es otra.

La cuadrática se reajusta para cada punto de centrado c, así que puedes ver moverse EE(b1) y la correlación entre la columna lineal y la cuadrática mientras la curva y su predicción no cambian.

El principio de jerarquía y la elección del grado

Dos reglas mantienen cuerdos los modelos polinómicos.

Primero, el principio de jerarquía (Definición 11.9): si un modelo incluye un término de orden superior, conserva todos los términos de orden inferior por debajo de él, incluso si parecen no significativos. Un modelo con X2X^2 pero sin XX obliga al vértice de la parábola a situarse en X=0X = 0. Esa es una restricción arbitraria que los datos nunca pidieron, y ni siquiera se conserva si desplazas el origen del predictor. Conserva XX siempre que conserves X2X^2. La misma lógica dice conserva ambos efectos principales siempre que conserves su interacción, por lo que los modelos de interacción de la sección 11.3 siempre llevaron tanto yrs.service como discipline.

Segundo, no persigas el grado. Cada potencia extra dobla más la curva y siempre ajustará la muestra un poco mejor, pero los polinomios de grado alto se retuercen salvajemente entre y más allá de los puntos de datos. Figure 15 ajusta los grados 1, 2 y 5 a los datos cars: la cuadrática sigue la suave curva, mientras la curva de grado 5 empieza a perseguir puntos individuales y oscila en los extremos, la cara clásica del sobreajuste. Prueba si la curvatura añadida es real en lugar de leer coeficientes individuales de orden alto.

Diagrama de dispersión de la distancia de frenado contra la velocidad con tres curvas polinómicas ajustadas. La línea azul de grado 1 y la cuadrática roja de grado 2 suben ambas suavemente a través de la nube de puntos. La curva violeta discontinua de grado 5 se retuerce, bajando y subiendo para perseguir puntos individuales, y oscila bruscamente hacia arriba en las velocidades más altas.

Figure 15:Ajustar polinomios de grado 1, 2 y 5 a los mismos cincuenta puntos. La cuadrática captura la curva ascendente real; la curva de grado 5 sobreajusta, retorciéndose entre puntos y oscilando en los extremos donde los datos son escasos. Más flexibilidad no es más verdad.

Probamos la cuadrática de la misma manera que probamos la interacción, con la prueba lineal general: ¿el modelo reducido (lineal) es vencido por el modelo completo (cuadrático)?

anova(fit_lin, fit_quad)
predict(fit_quad, newdata = data.frame(speed = 20))
predict(fit_quad_c, newdata = data.frame(speed_c = 20 - mean(cars$speed)))
Analysis of Variance Table

Model 1: dist ~ speed
Model 2: dist ~ speed + I(speed^2)
  Res.Df   RSS Df Sum of Sq     F Pr(>F)
1     48 11354
2     47 10825  1    528.81 2.296 0.1364
       1
60.71961
       1
60.71961
print(anova_lm(fit_lin, fit_quad))
print(fit_quad.predict(pd.DataFrame({"speed": [20]})))
xc = 20 - cars["speed"].mean()
print(fit_quad_c.predict(pd.DataFrame({"speed_c": [xc]})))
   df_resid           ssr  df_diff     ss_diff         F    Pr(>F)
0      48.0  11353.521051      0.0         NaN       NaN       NaN
1      47.0  10824.715908      1.0  528.805143  2.296027  0.136402
0    60.719611
dtype: float64
0    60.719611
dtype: float64

Dos cosas que leer aquí. El FF para el término cuadrático es 2.30 con un valor p de 0.14: para estos 50 autos la curva ascendente es sugerente pero no decisiva, y una recta es defendible. El reporte honesto es que la curvatura va en la dirección esperada pero no está establecida a significancia convencional, exactamente el tipo de juicio que este curso te pide hacer y declarar en lugar de ocultar. Segundo, tanto el modelo crudo como el centrado predicen la distancia de frenado idéntica de 60.72 pies a 20 mph, confirmando que el centrado es un cambio de parametrización, no un cambio de modelo.

El sobreajuste se cree mejor cuando uno mismo lo provoca, un grado a la vez.

Un deslizador fija el grado del polinomio ajustado a los cincuenta autos, y los valores siguen la SCE, la R-cuadrado, la prueba lineal general contra la recta y la predicción cinco millas por hora más allá de los datos.

Una breve mirada a la regresión por tramos

Los polinomios doblan una única curva suave a lo largo de todo el rango. A veces una relación en cambio cambia de pendiente en un punto particular: una dosis que ayuda hasta un umbral y perjudica después, una tasa de impuesto que entra en vigor a un nivel de ingreso. Para estas puedes ajustar una regresión lineal por tramos (Definición 11.10), dos o más segmentos rectos unidos en puntos elegidos llamados nudos. El truco es una columna extra: para un nudo en cc, añade el predictor “bisagra” (Xc)+(X - c)_+, que vale XcX - c cuando X>cX > c y 0 en caso contrario. Su coeficiente es el cambio de pendiente en el nudo, y como la bisagra es continua los dos segmentos se juntan sin un salto. Figure 17 muestra un ajuste de dos segmentos con un nudo en X=5X = 5. Este es el miembro más simple de la familia de los splines; el curso no persigue los splines más allá, pero la idea, añadir columnas de bisagra para dejar que la pendiente cambie en los nudos, es una extensión natural de todo lo de este capítulo.

Diagrama de dispersión de datos sintéticos que suben con X, con una curva ajustada hecha de dos segmentos rectos que se juntan en una línea roja discontinua vertical que marca un nudo en X igual a 5. El primer segmento sube suavemente y el segundo segmento, después del nudo, sube más pronunciadamente. Los dos segmentos se unen de forma continua en el nudo.

Figure 17:Regresión lineal por tramos con un nudo en X = 5. Añadir una columna bisagra deja que la pendiente cambie en el nudo mientras los dos segmentos de línea permanecen unidos. Este es el spline más simple, y usa la misma idea de añadir una columna que los indicadores y los polinomios.

11.5 El análisis de varianza como regresión

Intuición

Si tomaste estadística básica probablemente conociste el análisis de varianza de una vía (ANOVA, Definición 11.11), la prueba FF de si varias medias de grupo son iguales, y quizá lo conociste como una técnica separada con sus propias fórmulas. No es separada. El ANOVA de una vía es exactamente la regresión de la respuesta sobre el factor de grupo, codificado con indicadores, que es el modelo de la sección 11.1. Ver esto colapsa dos cosas que aprendiste en una sola y deja que cada herramienta de la regresión, diagnósticos, intervalos, la prueba lineal general, funcione en problemas de comparación de grupos.

El hecho central es que cuando el único predictor es un factor, el valor ajustado para cada caso es simplemente la media muestral de su propio grupo. Así que la “curva” de regresión es un conjunto de niveles planos, uno por grupo, como muestra Figure 18 para los tres rangos. Nada más podría minimizar el error cuadrático dentro de cada grupo, porque la media es la constante de mínimos cuadrados.

Salario en miles para los tres rangos del profesorado, mostrado como puntos tenues dispersos en tres grupos verticales, con una barra horizontal roja gruesa en cada grupo que marca la media del grupo, en unos 81, 94 y 127 mil. Una línea horizontal discontinua marca la media general cerca de 114 mil. El valor ajustado para cada punto es la media de su propio grupo.

Figure 18:El ANOVA de una vía es regresión sobre indicadores de rango. El valor ajustado para cada profesor es simplemente la media de grupo de ese rango (barras rojas), así que el modelo es una función escalonada a través de los grupos. La prueba F de regresión para el factor de rango es idéntica a la prueba F del ANOVA de una vía.

Fórmula

El modelo del ANOVA de una vía suele escribirse

Yij=μ+τi+εij,Y_{ij} = \mu + \tau_i + \varepsilon_{ij},

para la observación jj en el grupo ii, donde μ\mu es una línea base y τi\tau_i es el efecto del grupo ii. Con la codificación de celda de referencia esto es precisamente Y=β0+β1X1++βk1Xk1+εY = \beta_0 + \beta_1 X_1 + \cdots + \beta_{k-1} X_{k-1} + \varepsilon de la sección 11.1: μ\mu es la media del grupo de referencia β0\beta_0, y cada τi\tau_i es un coeficiente β\beta, la diferencia de la media de un grupo respecto a la referencia. La hipótesis nula del ANOVA de que todas las medias de grupo son iguales,

H0:τ1=τ2==τk=0,H_0: \tau_1 = \tau_2 = \cdots = \tau_k = 0,

es la hipótesis de regresión de que todos los coeficientes indicadores son cero, H0:β1==βk1=0H_0: \beta_1 = \cdots = \beta_{k-1} = 0: el factor no explica nada. Eso se prueba con el estadístico FF general del modelo.

R

Este puente rinde en ambas direcciones. Todo lo que sabes sobre el ANOVA (que un FF significativo dice que las medias difieren en algún lugar, no cuál par) se transfiere a leer la prueba general de un factor en una regresión. Y todo lo que la regresión ofrece (diagnósticos de residuos, intervalos de confianza para contrastes específicos, añadir una covariable continua para obtener el ANCOVA de la sección 11.2) está ahora disponible para problemas que pudiste creer que necesitaban un conjunto de herramientas de ANOVA separado. Dos niveles del factor lo vuelven la prueba tt de dos muestras; más niveles lo vuelven el ANOVA de una vía; añade una covariable y es ANCOVA. Todo un solo modelo.

11.6 Resumen del capítulo

Ahora puedes traer categorías y curvas a una regresión. Codificas un factor de kk niveles con k1k-1 indicadores de celda de referencia, y puedes decir por qué se debe eliminar un indicador: incluir los kk más el intercepto deja el diseño con rango deficiente (Teorema 11.4). Lees cada coeficiente indicador como una diferencia de medias de grupo y el intercepto como la media del grupo de referencia. Combinas una categoría con un predictor continuo de tres maneras: una línea común, rectas paralelas (el modelo ANCOVA) y pendientes separadas (una interacción), y pruebas entre los modelos paralelo y separado con la prueba lineal general de 8.4 La prueba lineal general. Conoces la trampa de que un coeficiente de efecto principal en un modelo de interacción es solo el efecto en el cero del otro predictor. Ajustas un polinomio, lo centras para que sus coeficientes sean estables e interpretables, aplicas el principio de jerarquía, y resistes sobreajustar el grado. Y ves el ANOVA de una vía como nada más que regresión sobre indicadores, con la misma prueba FF (Teorema 11.12).

Resultados clave de un vistazo.

ResultadoEnunciado o fórmulaVálido cuando
Modelo de celda de referencia (Def 11.3)Y=β0+j=1k1βjXj+εY = \beta_0 + \sum_{j=1}^{k-1}\beta_j X_j + \varepsilonun factor de kk niveles, un nivel elegido como referencia
Coeficiente indicadorβj=E{Ylevel j}E{Yref}\beta_j = E\{Y\mid\text{level }j\} - E\{Y\mid\text{ref}\}codificación de celda de referencia
k1k-1 indicadores (Teorema 11.4)X1++Xk=1X_1+\cdots+X_k=\mathbf{1} fuerza rango deficiente; elimina unointercepto conservado en el modelo
Rectas paralelas / ANCOVA (Def 11.5)Y=β0+β1X+β2D+εY = \beta_0 + \beta_1 X + \beta_2 D + \varepsilonun continuo, un categórico, pendientes iguales
Pendientes separadas / interacción (Def 11.6)Y=β0+β1X+β2D+β3XD+εY = \beta_0 + \beta_1 X + \beta_2 D + \beta_3 X D + \varepsilonpendientes con permiso de diferir por grupo
Brecha entre grupos (interacción)gap(X)=β2+β3X\text{gap}(X) = \beta_2 + \beta_3 Xigual a β2\beta_2 solo en X=0X = 0
Prueba de pendientes igualesprueba lineal general, completo vs reducido (t2=Ft^2 = F)modelos anidados paralelo vs interacción
Modelo cuadrático (Def 11.7)Y=β0+β1X+β2X2+εY = \beta_0 + \beta_1 X + \beta_2 X^2 + \varepsiloncurvatura; todavía lineal en los coeficientes
Centrado (Def 11.8)x=XXˉx = X - \bar X; curvatura β2\beta_2 sin cambiospara reducir la correlación lineal-cuadrado, estabilizar coeficientes
Principio de jerarquía (Def 11.9)conserva XX con X2X^2; conserva efectos principales con interaccióncualquier término de orden superior presente
ANOVA de una vía = regresión (Teorema 11.12)F=MSR/MSEF = \mathrm{MSR}/\mathrm{MSE} igual al FF del ANOVAun solo factor es el único predictor

Términos clave. variable indicadora (ficticia), factor, nivel, codificación de celda de referencia, codificación de efectos, codificación de medias de celda, análisis de covarianza (ANCOVA), rectas paralelas, interacción, efecto principal, regresión polinómica, centrado, principio de jerarquía, nudo, regresión lineal por tramos, spline, análisis de varianza (ANOVA) de una vía.

Ahora deberías ser capaz de.

Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado, este capítulo es sobre todo FIT: amplía los tipos de predictores que un modelo lineal puede contener, de cantidades medidas a categorías, curvas y sus combinaciones, sin abandonar el marco de mínimos cuadrados de 7.1 El modelo y los mínimos cuadrados en forma matricial. Se apoya en la prueba lineal general de 8.4 La prueba lineal general para decidir entre modelos anidados, que es el bucle CHECK-dentro-de-FIT que el curso usa cada vez que un modelo gana un término. También sirve a USE: interpretar una interacción, o un coeficiente ajustado, es el paso de comunicación donde ocurren la mayoría de los errores reales, por lo que el capítulo dedicó tanto tiempo a las lecturas erróneas. Mirando hacia adelante, 11.1 De categorías a números: codificación con indicadores es la maquinaria exacta que el Capítulo 13 usa para meter factores en una regresión logística, y los hábitos de centrado y jerarquía se trasladan al Capítulo 12, donde los predictores correlacionados (incluido un predictor y su propio cuadrado) impulsan el estudio de la multicolinealidad.

11.7 Preguntas frecuentes

P1. ¿Qué categoría debería hacer la referencia? Cualquiera de ellas; el ajuste es idéntico, solo cambia el significado de los coeficientes. Elige la referencia que haga más fáciles de leer las comparaciones que te importan: un grupo de control, el grupo más grande, o una línea base natural como “profesor asistente”. Si el signo de un coeficiente se siente al revés, quizá solo quieras recodificar para que la otra categoría sea la referencia.

P2. ¿Alguna vez incluyo un indicador para cada nivel? Solo si eliminas el intercepto. La columna del intercepto más los kk indicadores son linealmente dependientes, así que el software o bien elimina uno automáticamente o bien (con el intercepto quitado) cambia a la codificación de medias de celda, donde cada coeficiente es una media de grupo. Nunca incluyas el intercepto y los kk indicadores; el modelo no es identificable.

P3. Mi interacción es significativa pero un efecto principal no. ¿Elimino el efecto principal? No. El principio de jerarquía dice conserva ambos efectos principales siempre que conserves su interacción. Un efecto principal no significativo en un modelo de interacción por lo general solo significa que los grupos son similares en el punto donde el otro predictor es cero, que rara vez es un lugar interesante y a menudo está fuera de los datos. Eliminarlo distorsiona el modelo.

P4. ¿Por qué no simplemente ajustar regresiones separadas a cada grupo en lugar de un modelo de interacción? Ajustar cada grupo por separado da las mismas líneas ajustadas que el modelo de interacción completo, así que para predecir está bien. Pero el modelo de interacción único te deja probar si las pendientes difieren (un coeficiente, un valor p) y agrupa los grupos para estimar una varianza de error común, lo que los ajustes separados no pueden hacer. Cuando la pregunta es “¿son distintos estos grupos?”, un modelo con una interacción es la herramienta más limpia.

P5. ¿Cambia el centrado mis predicciones o mi R2R^2? No. El centrado es un cambio de parametrización: desplaza el significado del intercepto y del coeficiente lineal pero deja cada valor ajustado, residuo, R2R^2 y estadístico FF intactos. El Ejemplo 11.5 muestra las cuadráticas cruda y centrada prediciendo los idénticos 60.72 pies a 20 mph. Centra para interpretación y estabilidad numérica, no para cambiar el ajuste.

P6. ¿Qué tan alto debería ir el grado del polinomio? Rara vez más allá de dos o tres, y solo con una prueba que lo respalde. Cada grado ajusta la muestra mejor pero generaliza peor, retorciéndose entre puntos (Figure 15). Usa la prueba lineal general para verificar si el término añadido reduce el error de forma significativa, prefiere el grado más bajo que capture la forma visible, y nunca extrapoles un polinomio de grado alto más allá de los datos, donde puede dispararse a valores absurdos.

P7. El coeficiente de sexo ajustado no es significativo. ¿Prueba eso que la paga es justa? No. Dice que en esta muestra y este modelo, una vez que el rango, la disciplina y el servicio se mantienen fijos, la diferencia restante de hombre menos mujer no se distingue de cero, con un intervalo ancho impulsado en parte por haber solo 39 mujeres. No establece la equidad, y depende de la elección de las variables de ajuste; si el rango mismo está afectado por el sexo, ajustar por él puede ocultar parte de la diferencia. Reporta los números y los supuestos, y deja que los lectores juzguen.

11.8 Problemas de práctica

  1. (A) Explica por qué codificar los tres rangos como una única columna numérica 1, 2, 3 impone un supuesto que los datos rechazan, y di cuál es ese supuesto en una oración.

  2. (A) En el modelo salary ~ rank con Asistente como referencia, di en palabras qué significan el intercepto y cada uno de los dos coeficientes.

  3. (A) Un factor tiene 5 niveles. ¿Cuántas variables indicadoras usa la codificación de celda de referencia, y cuántos grados de libertad aporta el factor? Explica.

  4. (A) Describe la diferencia entre el modelo de rectas paralelas y el modelo de pendientes separadas en términos de cómo se ven las dos líneas ajustadas.

  5. (A) En un modelo de interacción salary ~ yrs.service * discipline, un compañero dice “el coeficiente de disciplina no es significativo, así que la disciplina no afecta al salario”. Corrige esta afirmación.

  6. (A) Explica el principio de jerarquía en una o dos oraciones, y da un ejemplo de un modelo que lo viole.

  7. (A) ¿Por qué centrar un predictor antes de elevar al cuadrado deja cada valor ajustado sin cambios mientras cambia el valor y el significado del coeficiente lineal?

  8. (A) Enuncia la conexión entre el ANOVA de una vía y la regresión, y di a qué corresponden en la regresión las sumas de cuadrados entre grupos y dentro de los grupos del ANOVA.

  9. (B) Prueba que incluir un intercepto más los kk indicadores de un factor de kk niveles deja la matriz de diseño con rango deficiente (Teorema 11.4), exhibiendo la dependencia lineal entre sus columnas. Explica por qué esto hace no únicos los coeficientes de mínimos cuadrados.

  10. (B) En la codificación de celda de referencia, prueba que el intercepto es igual a la media muestral del grupo de referencia y cada coeficiente es igual a una diferencia de medias muestrales de grupo, para un modelo de un factor. Usa el hecho de que el valor ajustado de mínimos cuadrados en cada grupo es la media de ese grupo.

  11. (B) Para el modelo de rectas paralelas Y=β0+β1X+β2D+εY = \beta_0 + \beta_1 X + \beta_2 D + \varepsilon, escribe las dos líneas ajustadas para D=0D = 0 y D=1D = 1, y prueba que su distancia vertical es β2\beta_2 en cada XX.

  12. (B) Para el modelo de interacción Y=β0+β1X+β2D+β3XD+εY = \beta_0 + \beta_1 X + \beta_2 D + \beta_3 XD + \varepsilon, deduce la brecha ajustada entre los dos grupos como función de XX, y muestra que es igual a β2\beta_2 solo en X=0X = 0.

  13. (B) Muestra algebraicamente que la prueba tt del coeficiente de interacción (t=3.22t = 3.22) y la prueba lineal general de pendientes paralelas versus separadas (F=10.37F = 10.37) satisfacen t2=Ft^2 = F, y explica por qué esto debe cumplirse para un único término añadido (cita 3.7 La prueba F y su equivalencia con la prueba t).

  14. (B) Sea x=XXˉx = X - \bar X. Partiendo de Y=β0+β1X+β2X2Y = \beta_0 + \beta_1 X + \beta_2 X^2, sustituye X=x+XˉX = x + \bar X y agrupa términos para expresar β0,β1,β2\beta_0^{\ast}, \beta_1^{\ast}, \beta_2^{\ast} del modelo centrado en términos de β0,β1,β2\beta_0, \beta_1, \beta_2 y Xˉ\bar X. Confirma β2=β2\beta_2^{\ast} = \beta_2 (la curvatura no cambia).

  15. (B) Usando el resultado del problema 14, explica con precisión por qué las cuadráticas cruda y centrada dan valores ajustados idénticos y residuos idénticos, así que R2R^2 no cambia.

  16. (B) Prueba que en una regresión de un factor el valor ajustado de mínimos cuadrados para cada grupo es la media muestral del grupo, minimizando (Yijmi)2\sum (Y_{ij} - m_i)^2 sobre las constantes de grupo mim_i.

  17. (B) Un modelo con un factor de tres niveles tiene coeficientes b0,b1,b2b_0, b_1, b_2 bajo codificación de celda de referencia. Deduce en qué se convertiría el intercepto bajo la codificación de medias de celda (los tres indicadores, sin intercepto), y confirma que los valores ajustados no cambian.

  18. (B) En el modelo ANCOVA, muestra que la pendiente estimada β1\beta_1 es una pendiente dentro de grupo agrupada, y explica en palabras por qué agrupar supone que las pendientes verdaderas son iguales entre grupos (el supuesto que la prueba de interacción verifica).

  19. (C) Ajusta salary ~ discipline y confirma a partir de los coeficientes que el intercepto es el salario medio en la disciplina A y la pendiente es la diferencia B menos A. Reporta ambas medias.

  20. (C) Ajusta salary ~ rank con Titular (Prof) como referencia en lugar de Asistente. Reporta el nuevo intercepto y los coeficientes, y verifica que las medias de grupo ajustadas son idénticas a las del capítulo.

  21. (C) Ajusta el modelo paralelo salary ~ yrs.service + sex y el modelo de interacción salary ~ yrs.service * sex. Reporta el coeficiente de interacción y su valor p, corre la prueba lineal general entre los dos modelos, y di si las pendientes difieren para hombres y mujeres.

  22. (C) Reproduce el ajuste del Ejemplo 11.4: ajusta salary ~ sex y salary ~ rank + discipline + yrs.service + sex, reporta el coeficiente de sexo en cada uno, y escribe dos oraciones interpretando el cambio, con cuidado de no afirmar un efecto causal.

  23. (C) Ajusta la cuadrática cruda dist ~ speed + I(speed^2) y la cuadrática centrada en cars. Reporta la correlación entre las columnas lineal y cuadrática en cada caso, y el error estándar del coeficiente lineal en cada caso, y explica la diferencia.

  24. (C) Ajusta polinomios de grado 1, 2 y 3 a los datos cars. Usa la prueba lineal general para decidir si el grado 2 mejora sobre el grado 1 y si el grado 3 mejora sobre el grado 2. Di qué grado reportarías y por qué.

  25. (C) Usando el modelo de interacción salary ~ yrs.service * discipline, predice el salario de un profesor teórico (A) y uno aplicado (B) a 0, 15 y 30 años de servicio. Tabula las seis predicciones y la brecha A versus B en cada nivel de servicio, y comenta cómo cambia la brecha.

  26. (C) Ajusta dist ~ speed en cars y añade el predictor bisagra (speed15)+(\text{speed} - 15)_+ para ajustar un modelo por tramos de dos segmentos con un nudo en 15 mph. Reporta las dos pendientes de los segmentos (antes y después del nudo) y di si la pendiente aumenta después del nudo.

  27. (C) Verifica el puente ANOVA-regresión (Teorema 11.12) numéricamente: ajusta salary ~ rank, extrae el FF general del resumen del modelo y el FF de anova() (R) o anova_lm (Python), y confirma que son idénticos. Reporta ambos.

  28. (C) Haz un gráfico de residuos contra ajustados para el ajuste lineal dist ~ speed en cars. Describe cualquier patrón que veas (curvatura, dispersión creciente) y di qué remedio de este capítulo o de uno anterior sugeriría cada patrón.

11.9 Práctica de examen

Estas cinco preguntas coinciden con el estilo de los exámenes del curso: cada una te pide explicar en oraciones completas, no solo calcular. Lee cualquier salida dada, di qué números usaste, y escribe tu respuesta como lo harías en el examen. Luego abre la respuesta modelo y compara. Un número correcto sin razonamiento gana poco crédito aquí, así que practica decir por qué.

EP 11.1 (interpretar la salida en contexto, luego evaluar una afirmación). Un colega ajusta el salario sobre los años desde el doctorado, el sexo y su interacción, usando femenino como el nivel de referencia para el sexo.

fit <- lm(salary ~ yrs.since.phd * sex, data = salaries)
round(coef(summary(fit)), 4)
                        Estimate Std. Error t value Pr(>|t|)
(Intercept)           73840.7607  8696.7132  8.4907   0.0000
yrs.since.phd          1644.8825   454.6163  3.6182   0.0003
sexMale               20209.6135  9179.2131  2.2017   0.0283
yrs.since.phd:sexMale  -727.9822   468.0468 -1.5554   0.1207

El colega lee la tabla y concluye: “El coeficiente sexMale es de unos $20,200 y es significativo, así que a los hombres se les paga unos $20,000 más que a las mujeres”. Evalúa esta afirmación. En tu respuesta, di qué significa cada uno de los cuatro coeficientes en contexto, y enuncia cuál es en realidad la brecha de sexo a un nivel realista de experiencia.

EP 11.2 (explicar por qué). En el Ejemplo 11.5 la cuadrática cruda dist ~ speed + I(speed^2) da al coeficiente speed un error estándar de unos 2.03 (así que t=0.45t = 0.45), mientras la cuadrática centrada da al coeficiente speed_c un error estándar de unos 0.41 (así que t=9.69t = 9.69). El coeficiente de curvatura, la curva ajustada y R2R^2 son idénticos en los dos ajustes. Explica por qué el centrado encoge tan drásticamente el error estándar del coeficiente lineal, y explica por qué esto no es evidencia de que el modelo centrado “ajuste mejor”.

EP 11.3 (qué cambiaría si). El Ejemplo 11.1 ajustó salary ~ rank con Asistente como el nivel de referencia y reportó un intercepto de $80,776, un coeficiente rankAssocProf de $13,100, y un coeficiente rankProf de $45,996. Un colega reajusta el modelo idéntico pero fija a Titular (Prof) como la referencia. Describe qué cambiaría en la tabla de coeficientes y qué se mantendría exactamente igual, y explica por qué. Da los valores numéricos que mostraría la nueva tabla.

EP 11.4 (interpretar la salida en contexto, luego evaluar una afirmación). Para los datos cars un estudiante ajusta el modelo lineal y el modelo cuadrático y los compara.

fit_lin  <- lm(dist ~ speed, data = cars)
fit_quad <- lm(dist ~ speed + I(speed^2), data = cars)
round(coef(summary(fit_quad)), 4)
anova(fit_lin, fit_quad)
            Estimate Std. Error t value Pr(>|t|)
(Intercept)   2.4701    14.8172  0.1667   0.8683
speed         0.9133     2.0342  0.4490   0.6555
I(speed^2)    0.1000     0.0660  1.5153   0.1364

Analysis of Variance Table

Model 1: dist ~ speed
Model 2: dist ~ speed + I(speed^2)
  Res.Df   RSS Df Sum of Sq     F Pr(>F)
1     48 11354
2     47 10825  1    528.81 2.296 0.1364

El estudiante concluye: “El coeficiente de la velocidad al cuadrado es positivo, lo que coincide con la física de que la distancia de frenado crece más rápido que linealmente, así que deberíamos reportar el modelo cuadrático”. Evalúa esta conclusión, usando los números de la salida.

EP 11.5 (qué cambiaría si). El Ejemplo 11.4 estimó la diferencia salarial de hombre menos mujer, ajustando por rango, disciplina y años de servicio, y encontró sexMale =$4,771= \$4,771 con p=0.22p = 0.22. Supón que eliminas rank del ajuste y reajustas salary ~ discipline + yrs.service + sex.

fit_norank <- lm(salary ~ discipline + yrs.service + sex, data = salaries)
round(coef(summary(fit_norank)), 2)
            Estimate Std. Error t value Pr(>|t|)
(Intercept) 84361.06    4941.37   17.07     0.00
disciplineB 13033.85    2840.35    4.59     0.00
yrs.service   832.15     110.22    7.55     0.00
sexMale      8423.34    4744.54    1.78     0.08

Explica por qué el coeficiente de sexo cambió cuando el rango salió del modelo, y explica por qué decidir si incluir el rango es una cuestión sobre el mundo en lugar de una cuestión que la regresión pueda resolver.

Juego del capítulo