11. Predictores categóricos e interacciones¶
En 2008 una universidad de Estados Unidos reunió una tabla de su profesorado: para cada uno de 397 profesores, la tabla registró el rango, la disciplina académica, los años desde el doctorado, los años de servicio, el sexo y el salario académico de nueve meses. La tabla se armó por una razón concreta, vigilar si a hombres y mujeres se les pagaba de forma distinta. Esa es una pregunta con consecuencias reales, y también una pregunta que un solo número no responde bien. El salario masculino promedio en estos datos es de unos $115,090 y el salario femenino promedio es de unos $101,002, una brecha cruda de aproximadamente $14,088. ¿Es esa brecha toda la historia?
Casi con certeza no, porque el salario depende de más de una cosa. Depende en gran medida del rango: los profesores titulares ganan mucho más que los profesores asistentes, como muestra Figure 1. Depende de la disciplina y de los años de servicio. Si la mezcla de rangos, disciplinas y experiencia difiere entre los dos grupos, entonces una diferencia cruda de promedios mezcla el efecto del sexo con los efectos de todo lo demás. Para decir algo cuidadoso, necesitamos un modelo que pueda mantener fijas esas otras variables. Pero el rango, la disciplina y el sexo no son números. Son categorías, y hasta ahora todo predictor en este libro ha sido una cantidad medida como el tamaño de un lote o los años. Este capítulo trata de meter categorías en una regresión.

Figure 1:El salario académico de nueve meses sube de forma pronunciada con el rango, desde una media cercana a 81k para los profesores asistentes hasta unos 127k para los titulares. Un predictor con tres categorías con nombre como este no puede entrar en una regresión como un solo número; este capítulo muestra cómo codificarlo.
Al terminar podrás convertir un predictor categórico en variables indicadoras y leer cada
coeficiente. Combinarás una categoría con un predictor continuo para ajustar rectas paralelas o
separadas, probarás cuál sostienen los datos, y modelarás la curvatura con polinomios de la manera
correcta. Y verás que el análisis de varianza de una vía que quizá recuerdes de estadística básica
no es más que una regresión sobre indicadores. Los datos de salarios nos llevan por la parte
categórica; los clásicos datos de distancia de frenado cars nos llevan por la parte polinómica.
11.1 De categorías a números: codificación con indicadores¶
Intuición¶
Una ecuación de regresión multiplica cada predictor por un número, así que un predictor tiene que ser un número. “Rango” no lo es: sus valores son las palabras Asistente, Asociado y Titular. Podrías sentir la tentación de codificarlos como 1, 2, 3 y meter eso. Resiste. Codificar el rango como 1, 2, 3 impone a los datos una afirmación específica y probablemente falsa. Dice que el salto salarial de Asistente a Asociado es igual al salto de Asociado a Titular, porque ambos son un movimiento de una unidad en tu escala inventada. Las categorías tienen un orden, pero nada dice que las brechas sean iguales, y un predictor nominal como la disciplina o el sexo no tiene orden alguno.
La manera honesta de llevar una categoría a una regresión es con variables indicadoras (Definición 11.1), también llamadas variables ficticias: columnas de 0 o 1, cada una respondiendo una pregunta de sí o no (“¿es este profesor un titular?”). Los indicadores permiten que cada categoría tenga su propio nivel, libre de cualquier supuesto sobre el espaciado. La única sutileza es que no usas un indicador por categoría. Usas uno menos, y dejas que la categoría omitida fije la línea base. Figure 2 muestra la idea para los tres rangos: un grupo se vuelve la línea base, y los coeficientes miden cuánto se sitúa cada otro grupo por encima de él.

Figure 2:Codificación de celda de referencia para el rango. El intercepto es la media del grupo de referencia (Asistente, 80.8k), y cada coeficiente es la brecha vertical desde esa línea base hasta la media de otro grupo: +13.1k hacia Asociado, +46.0k hacia Titular.
Fórmula¶
Supón que un predictor categórico (un factor, Definición 11.2) tiene niveles. Elige un nivel como referencia (o línea base). Para cada uno de los otros niveles, define una variable indicadora que vale 1 cuando un caso está en ese nivel y 0 en caso contrario. Para los tres rangos, tomando Asistente como la referencia, define
es el indicador de Asociado: 1 para profesores asociados, 0 para todos los demás.
es el indicador de Titular: 1 para profesores titulares, 0 para todos los demás.
No hay indicador para Asistente. Un profesor asistente tiene ; los dos ceros son el código para el nivel de referencia.
Figure 3 muestra esta codificación en acción sobre los primeros profesores de los datos: la única columna de palabras del rango se vuelve dos columnas de 0 o 1, y la fila del profesor asistente es solo un par de ceros.

Figure 3:Codificación de celda de referencia en acción. Una columna de palabras de categoría se vuelve columnas indicadoras de ceros y unos. Un profesor titular se codifica (0, 1) y un asociado (1, 0); el profesor asistente no recibe columna propia, y su par de ceros es el código del nivel de referencia.
El modelo con estos dos indicadores es
En palabras: el salario medio es una línea base , más un extra si el profesor es asociado, más un extra si el profesor es titular. Lee la respuesta media un nivel a la vez sustituyendo los indicadores:
Así que es la media del grupo de referencia, es la diferencia de medias Asociado menos Asistente, y es la diferencia Titular menos Asistente. Los coeficientes son contrastes contra la línea base, nada más.
Esto es la codificación de celda de referencia (Definición 11.3; R y Python la llaman codificación de tratamiento). Es la opción por defecto en ambos lenguajes, y la que este libro usa en todo momento. El Capítulo 13 codificará los predictores de una regresión logística exactamente de la misma manera (11.1 De categorías a números: codificación con indicadores es el patrón que reutiliza).
Derivación (por qué indicadores, no )¶
La razón es más fácil de ver que de decir. Figure 4 dispone la matriz de diseño con la columna del intercepto y los tres indicadores de rango. En cada fila exactamente un indicador es 1, así que sumar las tres columnas indicadoras reconstruye la columna de unos del intercepto. Una columna es entonces una copia de las otras combinadas, que es la dependencia lineal que hunde el ajuste.

Figure 4:Conservar los indicadores junto al intercepto es redundante. Como cada profesor tiene exactamente un rango, las tres columnas indicadoras suman fila por fila a la columna de unos del intercepto. Esa dependencia lineal hace singular a , así que eliminamos un indicador y dejamos que su nivel se vuelva la línea base.
Demostración. Supón que tercamente incluyes los indicadores, , uno por nivel, junto a la columna de unos del intercepto. Cada caso pertenece a exactamente un nivel, así que exactamente uno de sus indicadores es 1 y el resto son 0. Sumar las columnas indicadoras a lo largo de todos los niveles por lo tanto reconstruye la columna de puros unos:
Esa es una dependencia lineal entre las columnas de la matriz de diseño . Por 7.1 El modelo y los mínimos cuadrados en forma matricial, la estimación de mínimos cuadrados necesita que sea invertible, lo que requiere que las columnas de sean linealmente independientes (rango columna completo). Con el intercepto más los indicadores, no lo son: los coeficientes no quedan determinados de forma única, porque podrías sumar cualquier constante a y restarla del efecto de cada nivel y obtener los valores ajustados idénticos. Elimina un indicador (equivalentemente, elimina el intercepto) y la dependencia desaparece. La codificación de celda de referencia elimina el indicador del nivel de referencia, conserva el intercepto, y da un diseño de rango completo con indicadores.
Este hecho de “uno menos que el número de niveles” tiene un nombre que volverás a encontrar: un factor con niveles aporta grados de libertad al modelo.
R¶
R almacena las categorías como factores y construye los indicadores por ti. Lee los datos y mira las columnas categóricas.
salaries <- read.csv("data/salaries.csv")
dim(salaries)
table(salaries$rank)
table(salaries$discipline)
table(salaries$sex)[1] 397 6
AssocProf AsstProf Prof
64 67 266
A B
181 216
Female Male
39 358Por defecto R ordena los niveles del factor alfabéticamente y hace del primero la referencia. Para el rango eso haría de AssocProf la línea base, lo cual es incómodo de leer. Reordenamos para que Asistente sea la referencia, coincidiendo con Figure 2.
Puedes ver los indicadores mismos en la matriz de diseño del modelo. La primera columna es el intercepto (puros unos), y las dos siguientes son los indicadores de Asociado y Titular.
head(model.matrix(fit_rank), 4) (Intercept) rankAssocProf rankProf
1 1 0 1
2 1 0 1
3 1 0 0
4 1 0 1print(fit_rank.model.exog[:4])[[1. 0. 1.]
[1. 0. 1.]
[1. 0. 0.]
[1. 0. 1.]]Las filas 1, 2 y 4 son profesores titulares (indicador de Titular 1); la fila 3 es un profesor asistente (ambos indicadores 0). Ninguna fila tiene jamás ambos indicadores iguales a 1, porque ningún profesor tiene dos rangos a la vez.
Los coeficientes que en realidad son diferencias de medias se entienden mejor cuando uno mueve las medias y observa cómo responden los coeficientes.
Tres deslizadores fijan la media salarial de cada rango, y los valores muestran el intercepto y los coeficientes indicadores que reportaría una regresión sobre el rango.
11.2 Un predictor categórico y uno continuo¶
Intuición¶
Una categoría por sí sola solo clasifica los casos en grupos. Los modelos interesantes mezclan una categoría con un predictor medido. El salario, por ejemplo, depende tanto de la disciplina (una categoría, teórica A o aplicada B) como de los años de servicio (un número). Ahora tenemos dos perillas, y hay tres maneras cada vez más flexibles de girarlas, dibujadas de forma esquemática en Figure 6.

Figure 6:Los tres modelos para un predictor continuo y uno categórico. La línea común ignora el grupo; las rectas paralelas dan a cada grupo su propio intercepto pero una pendiente compartida; las pendientes separadas dan a cada grupo también su propia pendiente, que es lo que hace un término de interacción.
El modelo más simple ignora la categoría y ajusta una sola línea para todos. El siguiente modelo, el tema de esta sección, da a cada disciplina su propio intercepto pero las hace compartir una única pendiente: dos rectas paralelas. Leerlo es fácil: la experiencia vale el mismo número de dólares por año en ambas disciplinas, y una disciplina simplemente se sitúa una cantidad fija por encima de la otra en cada nivel de experiencia. Este modelo de rectas paralelas tiene un nombre tradicional, análisis de covarianza o ANCOVA (Definición 11.5), de los tiempos en que al predictor continuo se le llamaba covariable y a la categoría el tratamiento. El tercer modelo, pendientes separadas, es la sección siguiente.
Fórmula¶
Sea los años de servicio y sea el indicador de disciplina B ( para aplicada, para teórica). El modelo de rectas paralelas es
En palabras: el salario es una línea base, más un efecto por año de servicio que ambas disciplinas comparten, más un aumento fijo por estar en la disciplina B.
es la pendiente sobre los años de servicio, compartida por ambas disciplinas.
es la brecha vertical entre las dos líneas de disciplina, la misma en cada .
Sepáralo por disciplina para ver las dos líneas:
En palabras: ambas líneas tienen pendiente ; la línea aplicada está desplazada hacia arriba en . Las dos líneas nunca se cruzan, porque son paralelas. La lectura de es una comparación genuina “manteniendo fijos los años de servicio”: a una experiencia dada, el profesorado aplicado gana en promedio más, exactamente el tipo de comparación ajustada que el capítulo pidió al abrir.
R¶

Figure 7:El modelo de rectas paralelas. Ambas disciplinas comparten una pendiente para los años de servicio, y la línea aplicada se sitúa unos 13.2k por encima de la línea teórica en cada nivel de experiencia. Las rectas paralelas son la firma visual de un modelo sin interacción.
11.3 Interacciones: dejar que las pendientes difieran¶
Intuición¶
El modelo paralelo hace un supuesto fuerte: un año de servicio vale lo mismo en ambas disciplinas. Quizá no. Quizá el profesorado aplicado, cuyas habilidades siguen un mercado laboral externo caliente, gana más por año que el profesorado teórico. Si es así, las dos líneas deberían tener pendientes distintas, abriéndose en abanico a medida que crece el servicio en lugar de mantenerse a una distancia fija. Dejar que las pendientes difieran es lo que hace una interacción (Definición 11.6). Una interacción entre una categoría y un predictor continuo dice que el efecto del predictor continuo depende de la categoría.
La construyes añadiendo una columna más: el producto del predictor continuo y el indicador. Ese producto es cero para el grupo de referencia (así su línea queda sin cambios) e igual al predictor continuo para el otro grupo (así ese grupo obtiene un término de pendiente extra).
Fórmula¶
Con = años de servicio y = indicador de disciplina B, el modelo de interacción es
En palabras: toma el modelo de rectas paralelas y añade un término de producto, que permite a la disciplina B tener su propia pendiente en lugar de compartir la pendiente base.
es el coeficiente de interacción, el coeficiente sobre el producto .
El término de producto es 0 cuando e igual a cuando .
Sepáralo por disciplina otra vez:
En palabras: la línea teórica tiene intercepto y pendiente ; la línea aplicada tiene intercepto y pendiente . Así que es la brecha entre los dos interceptos (la diferencia en ), y es la brecha entre las dos pendientes (los dólares extra por año que el profesorado aplicado gana sobre el teórico). Si las pendientes son iguales y volvemos a las rectas paralelas, por eso probar es la prueba de “¿difieren las pendientes?”.
La lectura incorrecta, primero¶
Aquí es donde la lectura cuidadosa importa, porque el modelo de interacción pone una trampa. Mira los coeficientes ajustados (el Ejemplo 11.3 más abajo los calcula): el coeficiente de disciplina resulta ser de unos $857 con un error estándar grande y un valor p de 0.86, muy lejos de ser significativo. Un lector apresurado concluye: “la disciplina no importa para el salario”. Esa lectura es errónea, y vale la pena detenerse en el error.
En el modelo de interacción, no es “el efecto de la disciplina”. Es solo la brecha entre las disciplinas en , es decir, para un profesor con cero años de servicio. En cero servicio las dos líneas casi se juntan, así que por supuesto esa brecha particular es pequeña e incierta. Pero las líneas no son paralelas; la línea aplicada sube más rápido. Allá donde vive el profesorado real, a los 20 o 30 años de servicio, las disciplinas están muy separadas. Figure 8 deja claro el punto: mide la brecha en el borde izquierdo del gráfico, lo que no dice nada sobre la brecha en el cuerpo de los datos.

Figure 8:La trampa al leer un modelo de interacción. El coeficiente de disciplina b-dos es solo la brecha vertical en X = 0 (flecha roja, minúscula y no significativa). Como las pendientes difieren, la brecha allá en los datos es grande (flecha verde, 28.7k a los 40 años). Un b-dos pequeño y no significativo no significa que los grupos sean iguales.
La afirmación correcta es: el coeficiente de interacción es significativo, así que las pendientes difieren, y la brecha de disciplina crece con el servicio. La brecha a un nivel de servicio específico es , no solo. Siempre que un modelo contiene una interacción, el coeficiente de un efecto principal es una afirmación condicional sobre el punto donde el otro predictor es cero, nunca un “efecto” general.
R¶

Figure 9:El modelo de pendientes separadas. La línea aplicada es más pronunciada, así que las dos disciplinas empiezan juntas y se abren en abanico con la experiencia. La distancia entre ellas a cualquier nivel de servicio es el coeficiente de interacción por ese servicio, más la pequeña brecha de intercepto.
Probar si las pendientes realmente difieren¶
Ver un par de líneas abiertas en abanico no es una prueba. La interacción añadió exactamente un
término al modelo paralelo, así que podemos preguntar si ese único término se gana su lugar con la
prueba lineal general de 8.4 La prueba lineal general: ajusta el modelo reducido (paralelo) y el
modelo completo (interacción), y compara sus sumas de cuadrados del error. Aquí el modelo reducido
es fit_par del Ejemplo 11.2 y el modelo completo es fit_int.
anova(fit_par, fit_int)Analysis of Variance Table
Model 1: salary ~ yrs.service + discipline
Model 2: salary ~ yrs.service * discipline
Res.Df RSS Df Sum of Sq F Pr(>F)
1 394 3.0594e+11
2 393 2.9807e+11 1 7864744229 10.369 0.001388 **from statsmodels.stats.anova import anova_lm
print(anova_lm(fit_par, fit_int)) df_resid ssr df_diff ss_diff F Pr(>F)
0 394.0 3.059377e+11 0.0 NaN NaN NaN
1 393.0 2.980729e+11 1.0 7.864744e+09 10.369424 0.001388El estadístico es 10.37 en 1 y 393 grados de libertad, con un valor p de 0.0014. Ese valor p es igual al valor p de la prueba del coeficiente de interacción de arriba, y en efecto , la misma equivalencia entre las pruebas y que viste para una sola pendiente en 3.7 La prueba F y su equivalencia con la prueba t. Añadir la interacción reduce de forma significativa la suma de cuadrados del error, así que los datos apoyan las pendientes separadas por encima de las rectas paralelas.
La trampa al leer es mucho más difícil de repetir después de ver crecer la brecha bajo tu propio dedo.
Mueve el coeficiente de interacción b3 y el año en que lees la brecha, y compara la brecha en cero años con la brecha donde de verdad está el profesorado.
El ajuste y la cuestión de la equidad salarial¶
Abrimos con una brecha cruda de hombre menos mujer de unos $14,088. Ahora podemos preguntar qué le pasa a esa brecha cuando el modelo mantiene fijos el rango, la disciplina y los años de servicio. Este es el corazón estadístico de un análisis de equidad: una diferencia cruda puede encogerse, desaparecer o crecer una vez que tienes en cuenta otras variables medidas, y un reporte honesto muestra la estimación antes y después del ajuste.

Figure 11:La diferencia de sexo estimada antes y después del ajuste. Controlar por rango, disciplina y años de servicio mueve la estimación de 14.1k (intervalo por encima de cero) a 4.8k (intervalo que cruza el cero). La estimación ajustada es una asociación entre profesorado por lo demás similar, no un efecto causal.
11.4 Regresión polinómica y centrado¶
Intuición¶
Las categorías son una manera en que una recta puede fallar en ajustar; la curvatura es otra. La
distancia de frenado no crece en línea recta con la velocidad. La física dice que la distancia de
frenado sube con el cuadrado de la velocidad, porque la energía cinética lo hace, y los clásicos
datos cars (50 autos de la década de 1920) muestran exactamente esa curva ascendente, dibujada
en Figure 12. Una recta se queda corta a las velocidades altas donde la curva se
tuerce hacia arriba. Estos son los mismos datos cars cuyo embudo de residuos motivó la
transformación de raíz cuadrada en 10.3 Box-Cox: dejar que los datos elijan la potencia; allí reformamos la respuesta, y aquí la
dejamos en paz y dejamos que la función media se curve en su lugar.

Figure 12:Distancia de frenado contra velocidad con una recta (azul) y una curva cuadrática (roja). La cuadrática se dobla hacia arriba para coincidir con la física de que la distancia crece más rápido que linealmente con la velocidad, aunque para estos datos la mejora sobre la recta es modesta.
Podemos doblar una recta de regresión añadiendo el cuadrado del predictor como un segundo término. Una regresión polinómica (Definición 11.7) mantiene el modelo lineal en sus coeficientes (así toda la maquinaria de mínimos cuadrados sigue aplicando) mientras hace que la curva ajustada sea una parábola, o una cúbica, o superior. La única complicación práctica es que un predictor y su cuadrado suelen estar fuertemente relacionados entre sí, lo que hace los coeficientes crudos inestables y difíciles de leer. El arreglo es el centrado (Definición 11.8): resta la media del predictor antes de elevar al cuadrado.
Fórmula¶
El modelo polinómico de segundo orden (cuadrático) en un predictor es
En palabras: el modelo de recta con una columna extra, el cuadrado del predictor, que permite a la curva ajustada doblarse en lugar de quedarse recta.
controla la curvatura: positivo dobla la parábola hacia arriba, negativo la dobla hacia abajo.
El modelo sigue siendo un modelo lineal, porque es lineal en ; el predictor es solo otra columna.
La versión centrada reemplaza por :
En palabras: mide el predictor como una desviación respecto a su promedio antes de elevar al cuadrado. El centrado no cambia la forma de la curva ajustada ni ningún valor ajustado. Solo desplaza lo que significan los términos lineal y de intercepto, y reduce de forma marcada la correlación entre las columnas de primer orden y de segundo orden. Después del centrado, es la media ajustada a la velocidad promedio y es la pendiente de la curva a la velocidad promedio, ambos números legibles.
Por qué ayuda el centrado¶
El predictor crudo speed va de 4 a 25, así que speed y speed^2 aumentan juntos a lo largo de
todo ese rango; su correlación en los datos cars es 0.98. Dos columnas que se mueven casi al
unísono cargan casi la misma información, y la regresión batalla para repartir el crédito entre
ellas: los coeficientes individuales obtienen errores estándar grandes y hasta pueden cambiar de
signo. Restar la media recentra el predictor en cero, así su cuadrado se vuelve pequeño en el medio
y grande en ambos extremos, una forma de U que ya no sigue al término lineal.
Figure 13 muestra la correlación colapsando de 0.98 a unos -0.10 después del
centrado.

Figure 13:El centrado rompe la correlación casi perfecta entre un predictor y su cuadrado. En la escala cruda la velocidad y la velocidad al cuadrado se mueven juntas (r = 0.98); después de restar la media, el predictor centrado y su cuadrado están casi sin correlación (r = -0.10), lo que estabiliza los coeficientes del polinomio.
R¶
Afirmar que el centrado cambia los coeficientes pero no la curva es una cosa; deslizar el punto de centrado y ver que la curva no se mueve es otra.
La cuadrática se reajusta para cada punto de centrado c, así que puedes ver moverse EE(b1) y la correlación entre la columna lineal y la cuadrática mientras la curva y su predicción no cambian.
El principio de jerarquía y la elección del grado¶
Dos reglas mantienen cuerdos los modelos polinómicos.
Primero, el principio de jerarquía (Definición 11.9): si un modelo incluye un término de orden
superior, conserva todos los términos de orden inferior por debajo de él, incluso si parecen no
significativos. Un modelo con pero sin obliga al vértice de la parábola a situarse en
. Esa es una restricción arbitraria que los datos nunca pidieron, y ni siquiera se conserva
si desplazas el origen del predictor. Conserva siempre que conserves . La misma lógica
dice conserva ambos efectos principales siempre que conserves su interacción, por lo que los
modelos de interacción de la sección 11.3 siempre llevaron tanto yrs.service como discipline.
Segundo, no persigas el grado. Cada potencia extra dobla más la curva y siempre ajustará la
muestra un poco mejor, pero los polinomios de grado alto se retuercen salvajemente entre y más
allá de los puntos de datos. Figure 15 ajusta los grados 1, 2 y 5 a los datos
cars: la cuadrática sigue la suave curva, mientras la curva de grado 5 empieza a perseguir puntos
individuales y oscila en los extremos, la cara clásica del sobreajuste. Prueba si la curvatura
añadida es real en lugar de leer coeficientes individuales de orden alto.

Figure 15:Ajustar polinomios de grado 1, 2 y 5 a los mismos cincuenta puntos. La cuadrática captura la curva ascendente real; la curva de grado 5 sobreajusta, retorciéndose entre puntos y oscilando en los extremos donde los datos son escasos. Más flexibilidad no es más verdad.
Probamos la cuadrática de la misma manera que probamos la interacción, con la prueba lineal general: ¿el modelo reducido (lineal) es vencido por el modelo completo (cuadrático)?
anova(fit_lin, fit_quad)
predict(fit_quad, newdata = data.frame(speed = 20))
predict(fit_quad_c, newdata = data.frame(speed_c = 20 - mean(cars$speed)))Analysis of Variance Table
Model 1: dist ~ speed
Model 2: dist ~ speed + I(speed^2)
Res.Df RSS Df Sum of Sq F Pr(>F)
1 48 11354
2 47 10825 1 528.81 2.296 0.1364
1
60.71961
1
60.71961print(anova_lm(fit_lin, fit_quad))
print(fit_quad.predict(pd.DataFrame({"speed": [20]})))
xc = 20 - cars["speed"].mean()
print(fit_quad_c.predict(pd.DataFrame({"speed_c": [xc]}))) df_resid ssr df_diff ss_diff F Pr(>F)
0 48.0 11353.521051 0.0 NaN NaN NaN
1 47.0 10824.715908 1.0 528.805143 2.296027 0.136402
0 60.719611
dtype: float64
0 60.719611
dtype: float64Dos cosas que leer aquí. El para el término cuadrático es 2.30 con un valor p de 0.14: para estos 50 autos la curva ascendente es sugerente pero no decisiva, y una recta es defendible. El reporte honesto es que la curvatura va en la dirección esperada pero no está establecida a significancia convencional, exactamente el tipo de juicio que este curso te pide hacer y declarar en lugar de ocultar. Segundo, tanto el modelo crudo como el centrado predicen la distancia de frenado idéntica de 60.72 pies a 20 mph, confirmando que el centrado es un cambio de parametrización, no un cambio de modelo.
El sobreajuste se cree mejor cuando uno mismo lo provoca, un grado a la vez.
Un deslizador fija el grado del polinomio ajustado a los cincuenta autos, y los valores siguen la SCE, la R-cuadrado, la prueba lineal general contra la recta y la predicción cinco millas por hora más allá de los datos.
Una breve mirada a la regresión por tramos¶
Los polinomios doblan una única curva suave a lo largo de todo el rango. A veces una relación en cambio cambia de pendiente en un punto particular: una dosis que ayuda hasta un umbral y perjudica después, una tasa de impuesto que entra en vigor a un nivel de ingreso. Para estas puedes ajustar una regresión lineal por tramos (Definición 11.10), dos o más segmentos rectos unidos en puntos elegidos llamados nudos. El truco es una columna extra: para un nudo en , añade el predictor “bisagra” , que vale cuando y 0 en caso contrario. Su coeficiente es el cambio de pendiente en el nudo, y como la bisagra es continua los dos segmentos se juntan sin un salto. Figure 17 muestra un ajuste de dos segmentos con un nudo en . Este es el miembro más simple de la familia de los splines; el curso no persigue los splines más allá, pero la idea, añadir columnas de bisagra para dejar que la pendiente cambie en los nudos, es una extensión natural de todo lo de este capítulo.

Figure 17:Regresión lineal por tramos con un nudo en X = 5. Añadir una columna bisagra deja que la pendiente cambie en el nudo mientras los dos segmentos de línea permanecen unidos. Este es el spline más simple, y usa la misma idea de añadir una columna que los indicadores y los polinomios.
11.5 El análisis de varianza como regresión¶
Intuición¶
Si tomaste estadística básica probablemente conociste el análisis de varianza de una vía (ANOVA, Definición 11.11), la prueba de si varias medias de grupo son iguales, y quizá lo conociste como una técnica separada con sus propias fórmulas. No es separada. El ANOVA de una vía es exactamente la regresión de la respuesta sobre el factor de grupo, codificado con indicadores, que es el modelo de la sección 11.1. Ver esto colapsa dos cosas que aprendiste en una sola y deja que cada herramienta de la regresión, diagnósticos, intervalos, la prueba lineal general, funcione en problemas de comparación de grupos.
El hecho central es que cuando el único predictor es un factor, el valor ajustado para cada caso es simplemente la media muestral de su propio grupo. Así que la “curva” de regresión es un conjunto de niveles planos, uno por grupo, como muestra Figure 18 para los tres rangos. Nada más podría minimizar el error cuadrático dentro de cada grupo, porque la media es la constante de mínimos cuadrados.

Figure 18:El ANOVA de una vía es regresión sobre indicadores de rango. El valor ajustado para cada profesor es simplemente la media de grupo de ese rango (barras rojas), así que el modelo es una función escalonada a través de los grupos. La prueba F de regresión para el factor de rango es idéntica a la prueba F del ANOVA de una vía.
Fórmula¶
El modelo del ANOVA de una vía suele escribirse
para la observación en el grupo , donde es una línea base y es el efecto del grupo . Con la codificación de celda de referencia esto es precisamente de la sección 11.1: es la media del grupo de referencia , y cada es un coeficiente , la diferencia de la media de un grupo respecto a la referencia. La hipótesis nula del ANOVA de que todas las medias de grupo son iguales,
es la hipótesis de regresión de que todos los coeficientes indicadores son cero, : el factor no explica nada. Eso se prueba con el estadístico general del modelo.
R¶
Este puente rinde en ambas direcciones. Todo lo que sabes sobre el ANOVA (que un significativo dice que las medias difieren en algún lugar, no cuál par) se transfiere a leer la prueba general de un factor en una regresión. Y todo lo que la regresión ofrece (diagnósticos de residuos, intervalos de confianza para contrastes específicos, añadir una covariable continua para obtener el ANCOVA de la sección 11.2) está ahora disponible para problemas que pudiste creer que necesitaban un conjunto de herramientas de ANOVA separado. Dos niveles del factor lo vuelven la prueba de dos muestras; más niveles lo vuelven el ANOVA de una vía; añade una covariable y es ANCOVA. Todo un solo modelo.
11.6 Resumen del capítulo¶
Ahora puedes traer categorías y curvas a una regresión. Codificas un factor de niveles con indicadores de celda de referencia, y puedes decir por qué se debe eliminar un indicador: incluir los más el intercepto deja el diseño con rango deficiente (Teorema 11.4). Lees cada coeficiente indicador como una diferencia de medias de grupo y el intercepto como la media del grupo de referencia. Combinas una categoría con un predictor continuo de tres maneras: una línea común, rectas paralelas (el modelo ANCOVA) y pendientes separadas (una interacción), y pruebas entre los modelos paralelo y separado con la prueba lineal general de 8.4 La prueba lineal general. Conoces la trampa de que un coeficiente de efecto principal en un modelo de interacción es solo el efecto en el cero del otro predictor. Ajustas un polinomio, lo centras para que sus coeficientes sean estables e interpretables, aplicas el principio de jerarquía, y resistes sobreajustar el grado. Y ves el ANOVA de una vía como nada más que regresión sobre indicadores, con la misma prueba (Teorema 11.12).
Resultados clave de un vistazo.
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Modelo de celda de referencia (Def 11.3) | un factor de niveles, un nivel elegido como referencia | |
| Coeficiente indicador | codificación de celda de referencia | |
| indicadores (Teorema 11.4) | fuerza rango deficiente; elimina uno | intercepto conservado en el modelo |
| Rectas paralelas / ANCOVA (Def 11.5) | un continuo, un categórico, pendientes iguales | |
| Pendientes separadas / interacción (Def 11.6) | pendientes con permiso de diferir por grupo | |
| Brecha entre grupos (interacción) | igual a solo en | |
| Prueba de pendientes iguales | prueba lineal general, completo vs reducido () | modelos anidados paralelo vs interacción |
| Modelo cuadrático (Def 11.7) | curvatura; todavía lineal en los coeficientes | |
| Centrado (Def 11.8) | ; curvatura sin cambios | para reducir la correlación lineal-cuadrado, estabilizar coeficientes |
| Principio de jerarquía (Def 11.9) | conserva con ; conserva efectos principales con interacción | cualquier término de orden superior presente |
| ANOVA de una vía = regresión (Teorema 11.12) | igual al del ANOVA | un solo factor es el único predictor |
Términos clave. variable indicadora (ficticia), factor, nivel, codificación de celda de referencia, codificación de efectos, codificación de medias de celda, análisis de covarianza (ANCOVA), rectas paralelas, interacción, efecto principal, regresión polinómica, centrado, principio de jerarquía, nudo, regresión lineal por tramos, spline, análisis de varianza (ANOVA) de una vía.
Ahora deberías ser capaz de.
Codificar un predictor categórico con codificación de celda de referencia, y explicar por qué un factor de niveles necesita indicadores.
Interpretar cada coeficiente indicador como una diferencia de medias de grupo y el intercepto como la media del grupo de referencia.
Ajustar e interpretar un modelo ANCOVA (rectas paralelas) con un predictor categórico y uno continuo.
Interpretar un coeficiente de interacción como una diferencia de pendientes, y evitar la lectura errónea del coeficiente de efecto principal que lo acompaña.
Probar si dos o más grupos comparten una pendiente usando la prueba lineal general.
Ajustar una regresión polinómica con un predictor centrado, explicar por qué ayuda el centrado, y aplicar el principio de jerarquía.
Mostrar que el ANOVA de una vía es regresión sobre variables indicadoras, y conectar su prueba con la prueba de la regresión.
Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado, este capítulo es sobre todo FIT: amplía los tipos de predictores que un modelo lineal puede contener, de cantidades medidas a categorías, curvas y sus combinaciones, sin abandonar el marco de mínimos cuadrados de 7.1 El modelo y los mínimos cuadrados en forma matricial. Se apoya en la prueba lineal general de 8.4 La prueba lineal general para decidir entre modelos anidados, que es el bucle CHECK-dentro-de-FIT que el curso usa cada vez que un modelo gana un término. También sirve a USE: interpretar una interacción, o un coeficiente ajustado, es el paso de comunicación donde ocurren la mayoría de los errores reales, por lo que el capítulo dedicó tanto tiempo a las lecturas erróneas. Mirando hacia adelante, 11.1 De categorías a números: codificación con indicadores es la maquinaria exacta que el Capítulo 13 usa para meter factores en una regresión logística, y los hábitos de centrado y jerarquía se trasladan al Capítulo 12, donde los predictores correlacionados (incluido un predictor y su propio cuadrado) impulsan el estudio de la multicolinealidad.
11.7 Preguntas frecuentes¶
P1. ¿Qué categoría debería hacer la referencia? Cualquiera de ellas; el ajuste es idéntico, solo cambia el significado de los coeficientes. Elige la referencia que haga más fáciles de leer las comparaciones que te importan: un grupo de control, el grupo más grande, o una línea base natural como “profesor asistente”. Si el signo de un coeficiente se siente al revés, quizá solo quieras recodificar para que la otra categoría sea la referencia.
P2. ¿Alguna vez incluyo un indicador para cada nivel? Solo si eliminas el intercepto. La columna del intercepto más los indicadores son linealmente dependientes, así que el software o bien elimina uno automáticamente o bien (con el intercepto quitado) cambia a la codificación de medias de celda, donde cada coeficiente es una media de grupo. Nunca incluyas el intercepto y los indicadores; el modelo no es identificable.
P3. Mi interacción es significativa pero un efecto principal no. ¿Elimino el efecto principal? No. El principio de jerarquía dice conserva ambos efectos principales siempre que conserves su interacción. Un efecto principal no significativo en un modelo de interacción por lo general solo significa que los grupos son similares en el punto donde el otro predictor es cero, que rara vez es un lugar interesante y a menudo está fuera de los datos. Eliminarlo distorsiona el modelo.
P4. ¿Por qué no simplemente ajustar regresiones separadas a cada grupo en lugar de un modelo de interacción? Ajustar cada grupo por separado da las mismas líneas ajustadas que el modelo de interacción completo, así que para predecir está bien. Pero el modelo de interacción único te deja probar si las pendientes difieren (un coeficiente, un valor p) y agrupa los grupos para estimar una varianza de error común, lo que los ajustes separados no pueden hacer. Cuando la pregunta es “¿son distintos estos grupos?”, un modelo con una interacción es la herramienta más limpia.
P5. ¿Cambia el centrado mis predicciones o mi ? No. El centrado es un cambio de parametrización: desplaza el significado del intercepto y del coeficiente lineal pero deja cada valor ajustado, residuo, y estadístico intactos. El Ejemplo 11.5 muestra las cuadráticas cruda y centrada prediciendo los idénticos 60.72 pies a 20 mph. Centra para interpretación y estabilidad numérica, no para cambiar el ajuste.
P6. ¿Qué tan alto debería ir el grado del polinomio? Rara vez más allá de dos o tres, y solo con una prueba que lo respalde. Cada grado ajusta la muestra mejor pero generaliza peor, retorciéndose entre puntos (Figure 15). Usa la prueba lineal general para verificar si el término añadido reduce el error de forma significativa, prefiere el grado más bajo que capture la forma visible, y nunca extrapoles un polinomio de grado alto más allá de los datos, donde puede dispararse a valores absurdos.
P7. El coeficiente de sexo ajustado no es significativo. ¿Prueba eso que la paga es justa? No. Dice que en esta muestra y este modelo, una vez que el rango, la disciplina y el servicio se mantienen fijos, la diferencia restante de hombre menos mujer no se distingue de cero, con un intervalo ancho impulsado en parte por haber solo 39 mujeres. No establece la equidad, y depende de la elección de las variables de ajuste; si el rango mismo está afectado por el sexo, ajustar por él puede ocultar parte de la diferencia. Reporta los números y los supuestos, y deja que los lectores juzguen.
11.8 Problemas de práctica¶
(A) Explica por qué codificar los tres rangos como una única columna numérica 1, 2, 3 impone un supuesto que los datos rechazan, y di cuál es ese supuesto en una oración.
(A) En el modelo
salary ~ rankcon Asistente como referencia, di en palabras qué significan el intercepto y cada uno de los dos coeficientes.(A) Un factor tiene 5 niveles. ¿Cuántas variables indicadoras usa la codificación de celda de referencia, y cuántos grados de libertad aporta el factor? Explica.
(A) Describe la diferencia entre el modelo de rectas paralelas y el modelo de pendientes separadas en términos de cómo se ven las dos líneas ajustadas.
(A) En un modelo de interacción
salary ~ yrs.service * discipline, un compañero dice “el coeficiente de disciplina no es significativo, así que la disciplina no afecta al salario”. Corrige esta afirmación.(A) Explica el principio de jerarquía en una o dos oraciones, y da un ejemplo de un modelo que lo viole.
(A) ¿Por qué centrar un predictor antes de elevar al cuadrado deja cada valor ajustado sin cambios mientras cambia el valor y el significado del coeficiente lineal?
(A) Enuncia la conexión entre el ANOVA de una vía y la regresión, y di a qué corresponden en la regresión las sumas de cuadrados entre grupos y dentro de los grupos del ANOVA.
(B) Prueba que incluir un intercepto más los indicadores de un factor de niveles deja la matriz de diseño con rango deficiente (Teorema 11.4), exhibiendo la dependencia lineal entre sus columnas. Explica por qué esto hace no únicos los coeficientes de mínimos cuadrados.
(B) En la codificación de celda de referencia, prueba que el intercepto es igual a la media muestral del grupo de referencia y cada coeficiente es igual a una diferencia de medias muestrales de grupo, para un modelo de un factor. Usa el hecho de que el valor ajustado de mínimos cuadrados en cada grupo es la media de ese grupo.
(B) Para el modelo de rectas paralelas , escribe las dos líneas ajustadas para y , y prueba que su distancia vertical es en cada .
(B) Para el modelo de interacción , deduce la brecha ajustada entre los dos grupos como función de , y muestra que es igual a solo en .
(B) Muestra algebraicamente que la prueba del coeficiente de interacción () y la prueba lineal general de pendientes paralelas versus separadas () satisfacen , y explica por qué esto debe cumplirse para un único término añadido (cita 3.7 La prueba F y su equivalencia con la prueba t).
(B) Sea . Partiendo de , sustituye y agrupa términos para expresar del modelo centrado en términos de y . Confirma (la curvatura no cambia).
(B) Usando el resultado del problema 14, explica con precisión por qué las cuadráticas cruda y centrada dan valores ajustados idénticos y residuos idénticos, así que no cambia.
(B) Prueba que en una regresión de un factor el valor ajustado de mínimos cuadrados para cada grupo es la media muestral del grupo, minimizando sobre las constantes de grupo .
(B) Un modelo con un factor de tres niveles tiene coeficientes bajo codificación de celda de referencia. Deduce en qué se convertiría el intercepto bajo la codificación de medias de celda (los tres indicadores, sin intercepto), y confirma que los valores ajustados no cambian.
(B) En el modelo ANCOVA, muestra que la pendiente estimada es una pendiente dentro de grupo agrupada, y explica en palabras por qué agrupar supone que las pendientes verdaderas son iguales entre grupos (el supuesto que la prueba de interacción verifica).
(C) Ajusta
salary ~ discipliney confirma a partir de los coeficientes que el intercepto es el salario medio en la disciplina A y la pendiente es la diferencia B menos A. Reporta ambas medias.(C) Ajusta
salary ~ rankcon Titular (Prof) como referencia en lugar de Asistente. Reporta el nuevo intercepto y los coeficientes, y verifica que las medias de grupo ajustadas son idénticas a las del capítulo.(C) Ajusta el modelo paralelo
salary ~ yrs.service + sexy el modelo de interacciónsalary ~ yrs.service * sex. Reporta el coeficiente de interacción y su valor p, corre la prueba lineal general entre los dos modelos, y di si las pendientes difieren para hombres y mujeres.(C) Reproduce el ajuste del Ejemplo 11.4: ajusta
salary ~ sexysalary ~ rank + discipline + yrs.service + sex, reporta el coeficiente de sexo en cada uno, y escribe dos oraciones interpretando el cambio, con cuidado de no afirmar un efecto causal.(C) Ajusta la cuadrática cruda
dist ~ speed + I(speed^2)y la cuadrática centrada encars. Reporta la correlación entre las columnas lineal y cuadrática en cada caso, y el error estándar del coeficiente lineal en cada caso, y explica la diferencia.(C) Ajusta polinomios de grado 1, 2 y 3 a los datos
cars. Usa la prueba lineal general para decidir si el grado 2 mejora sobre el grado 1 y si el grado 3 mejora sobre el grado 2. Di qué grado reportarías y por qué.(C) Usando el modelo de interacción
salary ~ yrs.service * discipline, predice el salario de un profesor teórico (A) y uno aplicado (B) a 0, 15 y 30 años de servicio. Tabula las seis predicciones y la brecha A versus B en cada nivel de servicio, y comenta cómo cambia la brecha.(C) Ajusta
dist ~ speedencarsy añade el predictor bisagra para ajustar un modelo por tramos de dos segmentos con un nudo en 15 mph. Reporta las dos pendientes de los segmentos (antes y después del nudo) y di si la pendiente aumenta después del nudo.(C) Verifica el puente ANOVA-regresión (Teorema 11.12) numéricamente: ajusta
salary ~ rank, extrae el general del resumen del modelo y el deanova()(R) oanova_lm(Python), y confirma que son idénticos. Reporta ambos.(C) Haz un gráfico de residuos contra ajustados para el ajuste lineal
dist ~ speedencars. Describe cualquier patrón que veas (curvatura, dispersión creciente) y di qué remedio de este capítulo o de uno anterior sugeriría cada patrón.
11.9 Práctica de examen¶
Estas cinco preguntas coinciden con el estilo de los exámenes del curso: cada una te pide explicar en oraciones completas, no solo calcular. Lee cualquier salida dada, di qué números usaste, y escribe tu respuesta como lo harías en el examen. Luego abre la respuesta modelo y compara. Un número correcto sin razonamiento gana poco crédito aquí, así que practica decir por qué.
EP 11.1 (interpretar la salida en contexto, luego evaluar una afirmación). Un colega ajusta el salario sobre los años desde el doctorado, el sexo y su interacción, usando femenino como el nivel de referencia para el sexo.
fit <- lm(salary ~ yrs.since.phd * sex, data = salaries)
round(coef(summary(fit)), 4) Estimate Std. Error t value Pr(>|t|)
(Intercept) 73840.7607 8696.7132 8.4907 0.0000
yrs.since.phd 1644.8825 454.6163 3.6182 0.0003
sexMale 20209.6135 9179.2131 2.2017 0.0283
yrs.since.phd:sexMale -727.9822 468.0468 -1.5554 0.1207El colega lee la tabla y concluye: “El coeficiente sexMale es de unos $20,200 y es significativo,
así que a los hombres se les paga unos $20,000 más que a las mujeres”. Evalúa esta afirmación. En
tu respuesta, di qué significa cada uno de los cuatro coeficientes en contexto, y enuncia cuál es en
realidad la brecha de sexo a un nivel realista de experiencia.
Respuesta modelo
La afirmación lee mal el coeficiente de efecto principal, la clásica trampa de la interacción. Como
el modelo contiene el producto yrs.since.phd:sex, el coeficiente sexMale no es la brecha global
de hombre menos mujer. Es la brecha solo donde la variable que interactúa es cero, es decir, para un
profesor con cero años desde el doctorado. Así que la lectura honesta de cada coeficiente es: el
intercepto $73,841 es el salario medio de una mujer con doctorado recién obtenido; la pendiente
yrs.since.phd $1,645 por año es qué tan rápido suben los salarios femeninos con la experiencia;
el coeficiente sexMale $20,210 es la brecha de hombre menos mujer en cero años desde el
doctorado; y la interacción es cuánto menos por año sube el salario masculino, así que la
pendiente masculina es por año.
Como la pendiente masculina es más pequeña, la brecha no se queda en $20,210, se encoge con la experiencia. La brecha a años desde el doctorado es . A un valor realista de media carrera de, digamos, 20 años, la brecha estimada es , muy por debajo de los $20,000 que el colega citó, y a unos 28 años se cierra por completo. Además de eso, la interacción no es significativa (), así que los datos no establecen con firmeza que las pendientes difieran en absoluto; la afirmación más segura es que los hombres empiezan por delante pero la brecha estimada se estrecha con la antigüedad. Una respuesta débil reporta $20,210 como “el efecto del sexo” y nunca nota que el coeficiente es condicional a cero años de experiencia.
EP 11.2 (explicar por qué). En el Ejemplo 11.5 la cuadrática cruda dist ~ speed + I(speed^2)
da al coeficiente speed un error estándar de unos 2.03 (así que ), mientras la
cuadrática centrada da al coeficiente speed_c un error estándar de unos 0.41 (así que ).
El coeficiente de curvatura, la curva ajustada y son idénticos en los dos ajustes. Explica por
qué el centrado encoge tan drásticamente el error estándar del coeficiente lineal, y explica por qué
esto no es evidencia de que el modelo centrado “ajuste mejor”.
Respuesta modelo
Los dos ajustes son la misma parábola escrita en dos sistemas de coordenadas, así que tienen valores
ajustados, residuos, SSE y idénticos; el centrado cambia la parametrización, no el modelo. Lo
que cambia es la correlación entre las dos columnas del predictor. En la escala cruda speed va de
4 a 25, así que speed y speed^2 suben ambas juntas y correlacionan unos 0.98. Cuando dos
columnas son casi colineales el ajuste de mínimos cuadrados no puede decir cuánto crédito merece
cada una, porque muchos pares de coeficientes distintos dan casi los mismos valores ajustados; esta
casi singularidad infla la diagonal de , y como
el error estándar del coeficiente lineal se
dispara. Restar la media antes de elevar al cuadrado hace la columna lineal y la columna cuadrática
casi sin correlación (su correlación cae a unos -0.10), así que cada coeficiente queda fijado por
su cuenta y su error estándar colapsa.
Esto es una ganancia en interpretabilidad y estabilidad numérica, no en ajuste. El coeficiente
speed_c centrado ahora es claramente legible como la pendiente de la curva a la velocidad media,
con un error estándar pequeño, pero el modelo predice exactamente las mismas distancias de frenado
que antes. Una respuesta débil afirma que el centrado “mejora el ajuste” o sube ; no hace
ninguna de las dos, y decirlo pierde de vista que la colinealidad daña los errores estándar mientras
deja la curva ajustada intacta.
EP 11.3 (qué cambiaría si). El Ejemplo 11.1 ajustó salary ~ rank con Asistente como el nivel
de referencia y reportó un intercepto de $80,776, un coeficiente rankAssocProf de $13,100, y un
coeficiente rankProf de $45,996. Un colega reajusta el modelo idéntico pero fija a Titular
(Prof) como la referencia. Describe qué cambiaría en la tabla de coeficientes y qué se mantendría
exactamente igual, y explica por qué. Da los valores numéricos que mostraría la nueva tabla.
Respuesta modelo
Cambiar el nivel de referencia solo reetiqueta las comparaciones; no cambia el modelo ni su ajuste. Las medias de grupo ajustadas, los residuos, y el estadístico general son todos idénticos, porque los tres salarios ajustados siguen siendo la media muestral de cada grupo (Asistente $80,776, Asociado $93,876, Titular $126,772) sin importar qué nivel se elija como línea base. Lo que cambia es lo que miden el intercepto y los dos coeficientes. Con Titular como referencia, el intercepto se vuelve la media de los titulares, y cada coeficiente se vuelve la media de un grupo menos la media de titular, así que ambos coeficientes se vuelven negativos. El reajuste produce
Estimate Std. Error t value Pr(>|t|)
(Intercept) 126772.11 1449.07 87.48 0
rankAssocProf -32895.67 3290.47 -10.00 0
rankAsstProf -45996.12 3230.54 -14.24 0El intercepto $126,772 es la media de los titulares; rankAssocProf dice que los
asociados ganan esa cantidad menos que los titulares, y rankAsstProf dice que los
asistentes ganan esa cantidad menos. Ese último número es exactamente el negativo del antiguo
coeficiente rankProf ($45,996), porque la brecha Titular menos Asistente y la brecha Asistente
menos Titular son la misma distancia con signo opuesto. Una respuesta débil dice que el ajuste
mismo cambia o que una referencia es más correcta que otra; la elección de referencia es solo una
elección de qué comparación es más fácil de leer.
EP 11.4 (interpretar la salida en contexto, luego evaluar una afirmación). Para los datos
cars un estudiante ajusta el modelo lineal y el modelo cuadrático y los compara.
fit_lin <- lm(dist ~ speed, data = cars)
fit_quad <- lm(dist ~ speed + I(speed^2), data = cars)
round(coef(summary(fit_quad)), 4)
anova(fit_lin, fit_quad) Estimate Std. Error t value Pr(>|t|)
(Intercept) 2.4701 14.8172 0.1667 0.8683
speed 0.9133 2.0342 0.4490 0.6555
I(speed^2) 0.1000 0.0660 1.5153 0.1364
Analysis of Variance Table
Model 1: dist ~ speed
Model 2: dist ~ speed + I(speed^2)
Res.Df RSS Df Sum of Sq F Pr(>F)
1 48 11354
2 47 10825 1 528.81 2.296 0.1364El estudiante concluye: “El coeficiente de la velocidad al cuadrado es positivo, lo que coincide con la física de que la distancia de frenado crece más rápido que linealmente, así que deberíamos reportar el modelo cuadrático”. Evalúa esta conclusión, usando los números de la salida.
Respuesta modelo
El estudiante tiene razón sobre la dirección y se equivoca al tratarla como resuelta. El coeficiente de la velocidad al cuadrado es +0.100, y una curvatura positiva sí coincide con la física de que la distancia de frenado sube con el cuadrado de la velocidad. Pero que un coeficiente tenga el signo esperado no es lo mismo que la curvatura estar establecida. La prueba lineal general que compara la cuadrática con la recta da en 1 y 47 grados de libertad con , muy por encima de 0.05, así que la caída en la suma de cuadrados del error (de 11,354 a 10,825) está dentro de lo que el ruido de muestreo podría producir. Para estos 50 autos la curva ascendente es sugerente pero no significativa, y una recta es defendible.
El reporte honesto es exactamente ese: la curvatura va en la dirección físicamente esperada pero no
está establecida a significancia convencional, así que cualquiera de los dos modelos es razonable y
la recta más simple es un valor por defecto justo. Nota también que el valor individual sobre
speed en la cuadrática cruda (0.45, ) no debería leerse como “la velocidad no importa”;
ese valor p grande es un artefacto de la correlación de 0.98 entre speed y speed^2, no evidencia
contra el término lineal. Una respuesta débil o bien declara la cuadrática probada solo por el signo
del coeficiente, ignorando la prueba , o lee mal el valor p de speed crudo como un
hallazgo real.
EP 11.5 (qué cambiaría si). El Ejemplo 11.4 estimó la diferencia salarial de hombre menos mujer,
ajustando por rango, disciplina y años de servicio, y encontró sexMale con .
Supón que eliminas rank del ajuste y reajustas salary ~ discipline + yrs.service + sex.
fit_norank <- lm(salary ~ discipline + yrs.service + sex, data = salaries)
round(coef(summary(fit_norank)), 2) Estimate Std. Error t value Pr(>|t|)
(Intercept) 84361.06 4941.37 17.07 0.00
disciplineB 13033.85 2840.35 4.59 0.00
yrs.service 832.15 110.22 7.55 0.00
sexMale 8423.34 4744.54 1.78 0.08Explica por qué el coeficiente de sexo cambió cuando el rango salió del modelo, y explica por qué decidir si incluir el rango es una cuestión sobre el mundo en lugar de una cuestión que la regresión pueda resolver.
Respuesta modelo
Eliminar el rango casi duplicó la brecha de sexo estimada, de $4,771 a $8,423 (y movió su valor p de 0.22 hacia la significancia en 0.08). La razón es que el rango está relacionado tanto con el salario como con el sexo. El rango es el mayor motor individual del salario, y los sexos no están distribuidos de manera uniforme entre los rangos: proporcionalmente menos mujeres tienen el rango de titular. Cuando el rango está en el modelo, absorbe la parte de la diferencia cruda de hombre menos mujer que corre a través del rango, dejando un pequeño coeficiente de sexo residual. Cuando el rango se elimina, esa diferencia acarreada por el rango no tiene a dónde ir, así que el coeficiente de sexo se hincha para recogerla. Ninguno de los dos números es un error; responden a preguntas distintas, “entre profesorado del mismo rango” versus “ignorando el rango”.
Cuál pregunta es la correcta no es algo que la aritmética pueda decidir, porque depende de cómo llegó a ser el rango. Si las prácticas de promoción mismas difieren por sexo, entonces el rango está en la ruta causal entre el sexo y el salario, y controlar por él eliminaría parte de la misma diferencia que un análisis de equidad intenta medir. Si el rango es en cambio un reflejo justo de la antigüedad y el mérito, ajustar por él es exactamente lo correcto. La regresión con gusto producirá cualquiera de los dos coeficientes con limpieza; elegir qué variables pertenecen al conjunto de ajuste es un juicio sustantivo sobre la promoción y las carreras, no sobre el modelo. Una respuesta débil solo reporta que el número subió, o trata uno de los dos coeficientes como la única estimación correcta de la discriminación sin abordar la cuestión de la ruta causal.
Juego del capítulo¶
Chapter summary (in English)
This chapter teaches how to include categorical predictors and curves in a regression, using
the salaries of 397 professors (rank, discipline, years of service, sex, and salary) and the
classic braking data (cars).
A category is not a number, so it is coded with indicator variables, columns of zeros and ones. A factor with levels uses indicators; including all plus the intercept leaves the design matrix without full rank. In reference-cell coding, the intercept is the mean of the reference group and each coefficient is the difference of means from that group. For rank: the assistant-professor mean is $80,776, and the coefficients $13,100 and $45,996 are the differences toward associate and full.
With one categorical and one continuous predictor there are three models: a common line, parallel lines (the ANCOVA model, one intercept per group and a shared slope), and separate slopes through an interaction. In the interaction model, the category coefficient measures only the difference at ; reading it as “the effect of the category” is a common mistake. The general linear test decides between the two models: here , , the slopes differ.
Polynomial regression adds the square of the predictor to bend the line. Centering the
predictor changes neither the curvature nor the predictions, but it reduces the correlation between
the linear and quadratic terms (from 0.98 to -0.10 in cars) and clarifies the coefficients. The
hierarchy principle requires keeping the lower-order terms. Finally, one-way analysis of
variance is regression on indicators: its matches the overall of the regression.
A single model contains the two-sample test, ANOVA, and ANCOVA.