1. La regresión como una forma de pensar¶
Tres personas observan tres tablas de números, y cada una de ellas tiene que decidir algo.
Una ingeniera de producción de la Toluca Company tiene registros de 25 corridas de fabricación: el tamaño de cada lote y las horas de trabajo que tomó. Debe recomendar un tamaño de lote que mantenga bajos los costos, y para hacerlo necesita saber cómo crecen las horas con el tamaño del lote. Un solo número lo resolvería: ¿cuántas horas adicionales cuesta una unidad más en el lote? La Figure 1 son sus datos.

Figure 1:Veinticinco corridas de producción en la Toluca Company. Los lotes más grandes toman más horas, y la tendencia parece recta, pero ¿cuál es la recta correcta y cuánto puedes confiar en su pendiente? El Capítulo 2 responde ambas cosas.
En la noche del 27 de enero de 1986, una tabla muy distinta estaba frente a los ingenieros que decidían si lanzar el transbordador espacial Challenger a la mañana siguiente. De 23 vuelos anteriores tenían la temperatura de lanzamiento y el número de anillos de sello (O-rings), de seis, que mostraron daño por calor. El pronóstico para el lanzamiento era de unos 31 grados Fahrenheit, más frío que cualquier vuelo registrado. ¿Podían decir cuál sería el riesgo de daño a una temperatura a la que nunca habían volado? La Figure 2 es aquello a partir de lo cual tenían que razonar.

Figure 2:Los 23 vuelos previos al Challenger. El daño fue peor en los lanzamientos más fríos, y el lanzamiento en discusión (línea discontinua, 31 grados) quedaba muy por debajo de cualquier vuelo realizado. Juzgar ese riesgo significa extender un patrón más allá del último dato. El Capítulo 13 lo aborda.
Un decano de una universidad de Estados Unidos tiene una tercera tabla: para 397 profesores, su rango, disciplina, años de experiencia, sexo y salario. La tabla se construyó para responder una pregunta concreta. Los hombres en los datos ganan, en promedio, unos catorce mil dólares al año más que las mujeres. ¿Es esa brecha evidencia de un pago desigual, o solo refleja que los dos grupos difieren en rango y experiencia? Un promedio crudo no puede distinguirlo. La Figure 3 muestra cómo sube el salario con el rango por sí solo, que es una de las cosas que hay que tener en cuenta antes de que la brecha por sexo signifique algo.

Figure 3:El salario de nueve meses sube abruptamente con el rango. Antes de que una brecha salarial cruda entre hombres y mujeres pueda significar algo, un modelo tiene que mantener fijos el rango, la disciplina y la experiencia. El Capítulo 11 construye ese modelo.
Un costo, una catástrofe y una cuestión de justicia. En la superficie no tienen nada en común. Pero cada uno es la misma clase de problema: alguien quiere saber cómo una cantidad depende de otras, para poder describirla, predecirla o actuar sobre ella. Eso es lo que hace la regresión (Definición 1.1), y es el tema de este libro. Este primer capítulo es un mapa. Dice qué es la regresión y para qué sirve, de dónde vino la palabra, cómo creció la idea a lo largo de dos siglos, dónde se ubica en la ciencia de datos y el aprendizaje automático modernos, y qué te enseñará cada uno de los quince capítulos siguientes. Aquí casi no hay matemáticas y nada que memorizar. La meta es darte la vista del terreno antes de que empieces a recorrerlo.
1.1 Qué hace la regresión¶
Las tres historias iniciales parecen no tener relación, pero cada una hace la misma pregunta, y una sola herramienta responde las tres. La regresión estudia cómo una cantidad, la respuesta, cambia con una o más de otras, los predictores (Definición 1.2). Escribe la respuesta y un predictor . La regresión ajusta una regla que dice qué valor de esperar en cada valor de . Lo hace sin fingir que el mundo es ordenado: dos lotes del mismo tamaño tomaron horas distintas, y dos vuelos a la misma temperatura tuvieron daños distintos. La regla describe el comportamiento promedio y trata con honestidad la dispersión restante.
La gente recurre a esa regla por tres razones distintas, y tenerlas claras es el primer hábito que este curso quiere construir.
Descripción. A veces solo quieres resumir una relación que ya tienes delante. ¿Cuánto suben las horas de trabajo, en promedio, por cada unidad extra de tamaño de lote? La respuesta es una pendiente, un solo número interpretable, y reportarlo es descripción. No estás prediciendo nada nuevo ni afirmando que el tamaño del lote cause las horas en algún sentido profundo; estás comprimiendo una nube de puntos en una oración que un gerente puede usar.
Predicción. A veces quieres un número para un caso que aún no has visto. La corrida de la próxima semana es de 100 unidades: ¿cuántas horas debemos presupuestar? Una predicción introduce un nuevo en la regla ajustada y lee el esperado, idealmente con un margen de error adjunto. Una buena predicción no requiere que entiendas por qué y se mueven juntas, solo que el patrón que se mantuvo en los datos siga manteniéndose. Esta es la meta que domina el aprendizaje automático moderno.
Razonamiento causal. A veces quieres saber qué pasaría si cambiaras algo. ¿Pagar a las mujeres el mismo salario inicial cerraría la brecha? ¿Un lanzamiento más cálido habría salvado el transbordador? Estas son preguntas causales, y son las más difíciles de las tres, porque una regresión ajustada a datos observados mide asociación, no causa. A veces puedes razonar sobre la causa con regresión, pero solo con supuestos adicionales e, idealmente, el tipo de datos correcto. Confundir un ajuste predictivo con una afirmación causal es el error más común y más costoso en la estadística aplicada, y este libro regresa a la advertencia una y otra vez.
La misma recta ajustada puede servir a las tres metas, pero la confianza a la que tienes derecho difiere enormemente. La Figure 4 pone las tres una al lado de la otra: una recta, tres preguntas, y un medidor de confianza que baja a medida que las preguntas se vuelven más audaces.

Figure 4:La misma recta ajustada hace los tres trabajos, pero no ganan la misma confianza. La descripción solo lee una pendiente de los datos que tienes; la predicción introduce un nuevo X; el razonamiento causal pregunta qué haría una intervención, y necesita lo más de los datos. La confianza se encoge de izquierda a derecha.
Para hacer concretos los tres usos, aquí están los tres conjuntos de datos iniciales reducidos a tres números reales.
Describir y predecir suenan como tareas distintas, pero salen de la misma recta, así que al mover los datos mueves ambas a la vez. La pendiente de la ingeniera y su presupuesto de horas están en el widget de abajo; arrastra una corrida y observa cuál de las dos es frágil.
Las 25 corridas de Toluca, con la recta de mínimos cuadrados reajustándose mientras arrastras cualquier punto. Los valores muestran la pendiente , el intercepto , las horas predichas para un lote de 100 unidades y para uno de 200, y la SCE.
Qué observar. La pendiente es la descripción y es la predicción, y una sola corrida arrastrada mueve ambas a la vez. Prueba esto. Arrastra hacia arriba la corrida del lote de 120 y compara cuánto se mueve en 100 frente a en 200, un tamaño que nadie produjo nunca: la predicción dentro de los datos apenas se inmuta mientras la que está más allá del borde se sacude con fuerza. Volver a la Sección 1.1.
1.2 La palabra “regresión”: las estaturas de Galton¶
La palabra “regresión” es más antigua que el método moderno y viene de un lugar sorprendente: un estudio de la estatura humana. En la década de 1880, Francis Galton recopiló las estaturas de 934 hijos adultos y sus padres, 205 familias en total, y se preguntó si los padres altos tienen hijos altos. Sí los tienen, pero Galton notó algo más extraño, y la rareza le dio su nombre al campo.
Para cada hijo, Galton calculó una estatura media de los padres, un promedio ponderado de las estaturas de los dos padres. Luego graficó la estatura del hijo frente a la estatura media de los padres. La Figure 6 muestra ese gráfico con dos rectas dibujadas encima. La recta roja discontinua es : donde caerían los hijos si cada uno igualara exactamente a sus padres. La recta azul es la recta real de mejor ajuste a través de los datos.

Figure 6:Los 934 hijos de Galton. La recta de mínimos cuadrados (azul) es mucho menos inclinada que la recta de estaturas iguales (roja discontinua): los padres altos tienen hijos que son altos pero más cerca del promedio, y los padres bajos tienen hijos que son bajos pero más cerca del promedio. Galton llamó a este tirón hacia el centro “regresión”.
La recta azul es claramente más plana que . Léela desde la derecha: los hijos de padres muy altos son más altos que el promedio, pero no tan altos como sus padres. Léela desde la izquierda: los hijos de padres muy bajos son más bajos que el promedio, pero no tan bajos. En ambas direcciones las estaturas de los hijos son atraídas hacia el promedio general. Galton llamó a este tirón “regresión hacia la mediocridad”, queriendo decir el centro, y el nombre se quedó con todo el método aunque el método ahora no tiene nada que ver con las estaturas. La Figure 7 hace imposible no ver el tirón promediando a los hijos dentro de bandas estrechas de estatura de los padres.

Figure 7:La estatura media del hijo en cada banda de estatura de los padres cae sobre la recta azul poco inclinada, por debajo de la recta roja de estaturas iguales a la derecha y por encima a la izquierda. Todo grupo extremo de padres produce un grupo menos extremo de hijos. Eso es regresión a la media.
Podemos ponerle un número al tirón. Ajustar la recta de mínimos cuadrados de la estatura del hijo sobre la estatura media de los padres da la pendiente y el intercepto de abajo.
Dos advertencias que este pequeño ejemplo ya enseña. Primera, la “regresión a la media” es un hecho sobre promedios, no sobre ninguna familia en particular: muchos padres altos tienen hijos más altos que ellos mismos; el hijo promedio de padres altos es más bajo que los padres. Segunda, el efecto es fácil de malinterpretar como algo causal o misterioso, y no es ninguna de las dos cosas. Ocurre siempre que dos mediciones están correlacionadas de forma menos que perfecta, por una razón puramente estadística. El siguiente Inténtalo muestra la trampa en un escenario moderno.
Leer ese jalón en un diagrama estático cuesta trabajo. Es más fácil sentirlo eligiendo tú mismo una estatura de los padres y observando cuánta de su ventaja conserva el hijo.
La recta de mínimos cuadrados de Galton frente a la recta de estaturas iguales , con un deslizador para la estatura media de los padres. Los valores muestran cuánto están los padres sobre el promedio, el hijo predicho , y cuánto queda ese hijo sobre el promedio.
Qué observar. El hijo predicho siempre cae entre la estatura de sus padres y el promedio general, tanto del lado alto como del lado bajo. Prueba esto. Desliza de 75 pulgadas hasta 65 y observa que la fracción conservada se mantiene en 0.637 todo el camino: el mismo que encoge la ventaja de una familia alta levanta el déficit de una familia baja. Volver a la Sección 1.2.
Los datos de Galton vuelven en 4. Correlación, donde la pendiente poco inclinada se convierte en una correlación y estudiamos los usos y abusos de la correlación por completo.
1.3 La anatomía de un modelo estadístico¶
Toda regresión en este libro se construye a partir de las mismas dos piezas, y nombrarlas ahora hará que todo el curso sea más fácil de seguir. Mira de nuevo cualquiera de los diagramas de dispersión hasta ahora. Los puntos no caen sobre una sola curva; se dispersan alrededor de una. Un modelo estadístico toma eso en serio (Definición 1.3) al dividir la respuesta en una parte que una regla puede explicar y una parte que no puede.
En palabras: cada respuesta observada es la suma de una señal, , el valor promedio de que el predictor explica, y un término de ruido , todo lo demás que empuja a la observación fuera de ese promedio. La Figure 9 dibuja la división para un solo conjunto de datos.

Figure 9:Un modelo divide cada observación en dos partes: la señal sistemática f(X) que el predictor explica (recta azul), y el ruido aleatorio épsilon que no explica (un error dibujado en naranja). La regresión es el oficio de estimar la señal sin dejarse engañar por el ruido.
La parte sistemática es lo que estimamos. En la mayor parte de este libro es una línea recta, , y el modelo se convierte en el modelo de regresión lineal simple que 2.1 El modelo de regresión lineal simple construye con cuidado. En palabras: la respuesta promedio sube (o baja) una cantidad fija por cada paso de una unidad en , y es donde empieza la recta. Las letras griegas y son parámetros (Definición 1.4): números fijos que describen la relación verdadera en toda la población, que nunca llegamos a ver directamente. A partir de una muestra de datos calculamos estimaciones de ellos, escritas y , que son nuestras mejores conjeturas. Es como la diferencia entre la verdadera estatura promedio de cada adulto vivo, un número fijo que nadie podría medir jamás, y la estatura promedio de las cien personas que efectivamente encuestaste, un número que puedes calcular y que está cerca de la verdad pero no es exactamente ella. La distinción entre un parámetro (la verdad que queremos) y una estimación (el número que podemos calcular) atraviesa cada capítulo, y confundirlos causa una infinidad de enredos.
La parte aleatoria no es un error ni una falla del modelo. Es la admisión honesta de que el tamaño del lote no determina las horas exactamente, de que la temperatura no determina el daño a los anillos exactamente, de que el mundo tiene variación que los predictores no capturan. Un buen modelo no finge que el ruido no existe; estima la señal y describe el tamaño del ruido, para que las predicciones vengan con barras de error y las afirmaciones con márgenes.
La división suena abstracta hasta que la aplicas a una sola fila de datos reales. Toma una corrida de Toluca y sepárala en las dos piezas que la ecuación promete.
El lugar más limpio para ver separarse las dos partes es un mecanismo sin misterio alguno. Lanza una moneda justa veinte veces: la señal está fija en diez caras y todo lo demás en pantalla es la parte aleatoria.
Veinte lanzamientos de una moneda justa, repetidos en tantas rondas como quieras. La parte sistemática está fija en diez caras, marcada en ámbar, y el histograma reúne el conteo de cada ronda.
Qué observar. El conteo casi nunca cae en exactamente diez, y aun así el montón que forma es perfectamente ordenado. Prueba esto. Corre 1000 rondas y observa que la media se asienta cerca de 10 mientras la dispersión se mantiene cerca de 2.24: el ruido nunca desaparece, solo se vuelve descriptible, y por eso un modelo lleva un en vez de fingir que la dispersión no existe. Volver a la Sección 1.3.
1.4 La asociación no es causa¶
La Sección 1.1 llamó al razonamiento causal el más difícil de los tres usos. Esta sección dice por qué. Una recta de regresión a través de datos observados mide asociación (Definición 1.5): te dice que tiende a ser más alto cuando es más alto. No te dice, por sí sola, que cambiar cambiaría . Esa brecha entre asociación y causa es la idea más importante de este capítulo, y una de las pocas que una carrera entera con datos seguirá poniéndote a prueba.
La ilustración clásica no necesita ecuaciones. A lo largo del verano, las ventas de helado y los ahogamientos suben y bajan juntos; su correlación es fuerte y real. Ninguna persona sensata concluye que el helado causa los ahogamientos, o que prohibir el helado salvaría a los nadadores. Una tercera variable, el clima caluroso, impulsa a ambos: el calor manda a la gente a comprar helado y, por separado, la manda al agua donde unos cuantos se ahogan. La Figure 11 dibuja la situación. El impulsor oculto se llama una variable de confusión o variable oculta (Definición 1.6), y siempre que hay una presente, la asociación entre y puede ser grande mientras el efecto causal de sobre es cero.

Figure 11:El clima caluroso (Z) causa tanto las ventas de helado (X) como los ahogamientos (Y), así que X e Y están fuertemente correlacionados aunque ninguno cause al otro. Una variable de confusión puede fabricar una asociación de la nada causal.
Esto es exactamente por qué el ejemplo salarial es difícil. Los hombres y las mujeres en los datos difieren no solo en el sexo, sino en la mezcla de rangos, disciplinas y años de servicio, y todos esos afectan el salario. El rango es una variable oculta para la brecha salarial cruda por sexo. Un análisis responsable tiene que mantener fijas las variables de confusión antes de que la brecha restante pueda leerse como algo sobre el sexo, e incluso entonces la lectura requiere cuidado. 11. Predictores categóricos e interacciones hace este trabajo; 16. Análisis de rutas y una mirada hacia adelante hace del razonamiento sobre efectos directos e indirectos su tema entero.
Dos cosas te ayudan a combatir la confusión, y la diferencia entre ellas organiza buena parte de la estadística.
Los datos observacionales (Definición 1.7) se recolectan observando el mundo tal como es. Galton no asignó estaturas a los padres; los ingenieros de Toluca no fijaron los tamaños de lote para estudiarlos; nadie eligió el sexo de los profesores. En los datos observacionales el predictor y las variables de confusión vienen enredados juntos, y ninguna cantidad de ajuste ingenioso los desenreda por completo. Puedes ajustar por las variables de confusión que pensaste medir, pero nunca por las que no.
Los datos experimentales se recolectan interviniendo. Si puedes asignar aleatoriamente el valor de , digamos lanzando una moneda para decidir el tratamiento de cada unidad, entonces en promedio los grupos de tratamiento coinciden en cada variable de confusión, medida o no, porque la aleatorización los equilibra. Por eso un experimento aleatorizado puede sostener una afirmación causal que los datos observacionales no pueden. La Figure 12 muestra el único cambio estructural que marca la diferencia. La mayoría de los datos que encontrarás después de este curso son observacionales, que es precisamente por qué la distinción entre asociación y causa merece el machaque que recibe aquí.

Figure 12:Los datos observacionales y experimentales difieren en una flecha. Cuando observas el mundo (izquierda), una variable de confusión Z alimenta tanto a X como a Y, así que su vínculo está enredado. Cuando asignas X al azar (derecha), el lanzamiento de moneda corta la flecha de Z hacia X, así que cualquier vínculo X-Y restante es causal.
Una disciplina más te protege tanto de la confusión como de la simple mala lectura: mira los datos antes de confiar en un resumen de ellos. La Figure 13 muestra cuatro pequeños conjuntos de datos construidos por el estadístico Frank Anscombe. Los cuatro tienen la misma media de , la misma media de , la misma correlación y la misma recta de regresión ajustada. En el papel son idénticos. Graficados, no podrían ser más diferentes.

Figure 13:El cuarteto de Anscombe: cuatro conjuntos de datos con medias, varianzas, correlación y recta ajustada idénticas, y sin embargo cuatro formas distintas. Solo uno es una relación genuina de línea recta. Los números resumen no pueden distinguirlos, pero un gráfico de dos segundos sí.
1.5 Una breve historia, de Gauss al aprendizaje estadístico¶
La regresión no llegó de una sola vez. Creció a lo largo de dos siglos a medida que la gente seguía necesitando extraer una señal de mediciones con ruido, y las herramientas que usamos hoy son la respuesta acumulada. La Figure 14 marca los hitos.

Figure 14:Dos siglos de regresión en siete pasos, desde los mínimos cuadrados para las órbitas planetarias hasta modelos que cualquiera puede ajustar ahora con una oración de código.
Mínimos cuadrados (alrededor de 1805). El método en el corazón de este libro se inventó para rastrear el cielo. Adrien-Marie Legendre publicó la receta de mínimos cuadrados en 1805, y Carl Friedrich Gauss, quien reclamó un uso anterior y aportó la teoría de probabilidad, la aplicó para predecir la órbita del planeta enano Ceres a partir de un puñado de lecturas telescópicas con ruido. El problema era el mismo que enfrenta la ingeniera de Toluca: muchas mediciones imperfectas, una recta subyacente, encontrar la recta que mejor se ajusta. 2. Regresión lineal simple deriva su respuesta desde cero.
La correlación y la palabra “regresión” (1886 a 1896). Galton, estudiando la herencia, nos dio la regresión a la media y las primeras rectas de regresión. Su colega más joven Karl Pearson convirtió las ideas de Galton en el coeficiente de correlación, la medida estandarizada de asociación que cubre 4. Correlación, y construyó buena parte de la maquinaria de la estadística moderna a su alrededor.
Fisher y el marco de la inferencia (décadas de 1920 y 1930). Ronald Fisher, trabajando en experimentos agrícolas, le dio a la regresión su columna inferencial: el análisis de varianza que divide la variación en piezas con nombre (3. Inferencia para la regresión lineal simple), la máxima verosimilitud como principio general para la estimación (2. Regresión lineal simple, 13. Regresión logística), y la teoría de los experimentos aleatorizados que fundamenta el razonamiento causal de la Sección 1.4. Buena parte de lo que un estadístico entiende por “significancia” se remonta a Fisher.
Modelos lineales generalizados (1972). Durante mucho tiempo la regresión significó una línea recta con ruido normal de varianza constante. Pero muchas respuestas no son así: resultados de sí o no, conteos, tasas. En 1972, John Nelder y Robert Wedderburn mostraron que la regresión lineal, la regresión logística para datos binarios, la regresión de Poisson para conteos y varias otras son todas casos especiales de un solo marco, el modelo lineal generalizado. 13. Regresión logística y 14. Regresión de Poisson y la idea del MLG construyen dos de estos y 14.6 Una familia: el modelo lineal generalizado muestra la idea unificadora.
Aprendizaje estadístico y aprendizaje automático (de la década de 1990 a hoy). A medida que las computadoras se abarataron, la misma idea central, ajustar una regla que predice a partir de y comprobarla con honestidad en datos nuevos, se expandió hacia un campo obsesionado con la predicción: validación cruzada, regularización, árboles y redes neuronales. La regresión es el cimiento sobre el que se construye este campo, y las ideas de sobreajuste y validación que lo dominan aparecen en este curso en 12. Multicolinealidad, selección de variables y validación. El capítulo más reciente de la historia es el que estás viviendo, y merece su propia sección.
1.6 Dónde se ubica la regresión hoy¶
Sería fácil pensar que la regresión es una reliquia pintoresca al lado de la inteligencia artificial moderna. Lo contrario es cierto: la regresión es en gran parte de lo que está hecha la IA moderna. La Figure 15 muestra cómo se anidan las piezas.

Figure 15:La regresión lineal se ubica en el centro de un conjunto de campos anidados. Los modelos lineales generalizados la extienden a otras clases de respuesta; el aprendizaje automático supervisado la extiende a señales flexibles; y sigue siendo el último paso dentro de una red neuronal. Domina el centro y el resto tiene un lugar al que adherirse.
El aprendizaje automático supervisado, la rama de la IA que aprende a predecir una salida a partir de entradas, es regresión con la señal a la que se le permite ser mucho más flexible que una línea recta. Una red neuronal dedica la mayor parte de su esfuerzo a transformar entradas crudas en características útiles, pero su paso final es casi siempre una regresión lineal ordinaria o una regresión logística sobre esas características: el mismo que ajustarás a mano en 2. Regresión lineal simple, sentado dentro de la máquina. Los modelos grandes de lenguaje, los sistemas detrás de los asistentes de IA modernos, se entrenan con una forma de este mismo juego de predicción jugado miles de millones de veces. El vocabulario cambia (“funciones de pérdida”, “descenso de gradiente”, “incrustaciones”), pero los mínimos cuadrados y la máxima verosimilitud, las dos ideas sobre las que se construye 2. Regresión lineal simple, están por debajo.
Esto tiene una consecuencia aguda para lo que vale la pena aprender, y es la tesis de este curso. Ajustar un modelo solía ser la parte difícil. Requería tablas, aritmética cuidadosa y una computadora central. Ahora cualquiera puede ajustar una regresión, un bosque aleatorio o una red neuronal en una línea de código, y un asistente de IA escribirá esa línea a pedido e incluso interpretará la salida por ti. La habilidad escasa ya no es ajustar un modelo. Es juzgarlo: saber si el modelo es apropiado, si sus supuestos se cumplen, si los datos pueden sostener la afirmación que se hace, si una variable de confusión está oculta, si la predicción de aspecto seguro es en realidad una extrapolación fuera del borde de toda experiencia, como lo fue la decisión del Challenger. Una máquina te dará una respuesta en segundos. Decidir si confiar en ella es trabajo humano, y es el trabajo que este libro entrena.
1.7 Un recorrido por el semestre¶
Aquí está el camino por delante. El libro enseña un proceso repetible, el flujo de trabajo de modelado que 2. Regresión lineal simple nombra por completo (El flujo de trabajo del modelado): PREGUNTAR una pregunta y obtener los datos, EXPLORAR con gráficos y resúmenes, AJUSTAR un modelo, COMPROBAR si se puede confiar en él, y USARLO para interpretar, predecir o decidir. Cada capítulo es un viaje alrededor de ese ciclo sobre un conjunto de datos real. La Figure 16 dibuja el ciclo para que puedas sostener el libro entero en una imagen.

Figure 16:El único flujo de trabajo que repite todo el curso: PREGUNTAR, EXPLORAR, AJUSTAR, COMPROBAR, USAR. La flecha discontinua es la parte honesta: cuando un modelo falla su comprobación, vuelves atrás e intentas de nuevo en lugar de empujar hacia adelante un modelo malo. Cada capítulo es un viaje alrededor de este ciclo.
Lo que sigue es la única pregunta que responde cada capítulo.
Parte I: La regresión desde los cimientos.
2. Regresión lineal simple, Regresión lineal simple. ¿Cuál es la única mejor recta a través de una nube de puntos, y podemos probar que ninguna otra recta la supera? Ajustarás la recta de Toluca a mano y probarás su optimalidad (2.2 Mínimos cuadrados desde los primeros principios).
3. Inferencia para la regresión lineal simple, Inferencia para la regresión lineal simple. Presupuestaste unas 419 horas para la corrida de 100 unidades de la próxima semana, pero ¿qué tan lejos podrías quedar? El capítulo separa un intervalo estrecho para la corrida promedio de un intervalo mucho más ancho para una sola corrida nueva (3.5 Intervalo de predicción para una observación nueva), la distinción en la Figure 1 que la mayoría de la gente entiende mal.
4. Correlación, Correlación. ¿Cómo pones un número honesto a la fuerza de una relación, y cómo te miente ese número cuando los datos se curvan, cuando se cuela un valor atípico, o cuando la muestra es estrecha? Las estaturas de Galton y el vínculo correlación-pendiente vuelven aquí (4.2 La correlación y la pendiente de regresión).
5. Inferencia por aleatorización y bootstrap para la regresión, Inferencia por aleatorización y bootstrap. Con solo 13 pateadores, ¿una pendiente que ves es real o una casualidad de una muestra diminuta? Cuando los supuestos usuales son inestables, dejas que la computadora baraje y remuestree los datos para averiguarlo (5.2 La prueba de permutación para la pendiente, 5.4 El bootstrap para la regresión).
Parte II: El modelo lineal en forma matricial.
6. Álgebra de matrices para la regresión, Álgebra matricial para la regresión. ¿Cómo escribes una regresión con veinte predictores sin ahogarte en veinte ecuaciones? El álgebra matricial empaca todo el conjunto de datos en dos símbolos. No se supone álgebra lineal previa; el capítulo la construye desde nada.
7. El modelo lineal general, El modelo lineal general. ¿Por qué funcionan los mínimos cuadrados para cualquier número de predictores a la vez, y cuál es la geometría elegante (una proyección) que se esconde debajo?
8. La regresión múltiple en la práctica, Regresión múltiple en la práctica. Cuando dos predictores se solapan, ¿qué significa siquiera un solo coeficiente? Aprenderás la lectura cuidadosa de “manteniendo los otros fijos” y la verás en una imagen con gráficos de variable añadida.
Parte III: Construir y comprobar modelos.
9. Diagnósticos del modelo, Diagnóstico de modelos. Un modelo puede explicar la mayor parte de la variación y aun así predecir un número negativo de especies. ¿Cómo atrapas un modelo que está mal en todas las formas que importan, y encuentras el único punto de alto apalancamiento que dirige en silencio todo el ajuste (9. Diagnósticos del modelo)?
10. Medidas correctivas y transformaciones, Medidas correctivas y transformaciones. Los pesos del cerebro y del cuerpo de 62 mamíferos se ven imposibles en un gráfico hasta que tomas logaritmos y el desorden se acomoda en una recta limpia. ¿Cuándo el problema es tu modelo, y cuándo es solo tu escala (10.2 La transformación logarítmica y la lectura de sus coeficientes)?
11. Predictores categóricos e interacciones, Predictores categóricos e interacciones. De vuelta a la brecha salarial: una vez que mantienes fijos el rango, la disciplina y la experiencia, ¿cuánto queda de los crudos, y cómo pones siquiera una categoría como el rango en una regresión (11.1 De categorías a números: codificación con indicadores, 11.2 Un predictor categórico y uno continuo)?
12. Multicolinealidad, selección de variables y validación, Multicolinealidad, selección y validación. Con trece medidas corporales enredadas prediciendo la grasa corporal, ¿cuáles conservas? ¿Y por qué un modelo elegido para ajustar tus datos siempre se verá mejor en esos datos de lo que merece (12.4 Validación: entrenar, probar y validar cruzadamente, 12.5 Un vistazo a la contracción: ridge y lasso)?
Parte IV: Regresión para otras clases de respuesta.
13. Regresión logística, Regresión logística. De vuelta al transbordador: ¿cómo pones un número al riesgo de falla de los anillos a 31 grados cuando el resultado no es una cantidad sino un sí o no (13.1 Por qué una recta falla, y qué usar en su lugar, 13.3 Leer los coeficientes como razones de momios)?
14. Regresión de Poisson y la idea del MLG, Regresión de Poisson y la idea del MLG. Los conteos de especies no pueden ser negativos ni fraccionarios, y su dispersión crece con su tamaño. ¿Qué modelo respeta eso, y cómo son la regresión lineal, logística y de Poisson todas una sola idea (14.1 Por qué los conteos rompen el modelo lineal, 14.6 Una familia: el modelo lineal generalizado)?
Parte V: Temas especiales (estudio autónomo guiado).
15. Regresion con el tiempo: autocorrelacion y pronostico, Regresión con el tiempo. Doce años de pasajeros mensuales de aerolínea tienden al alza y ciclan cada verano. ¿Cómo pronosticas el año siguiente con honestidad, y por qué los errores ordenados en el tiempo rompen las fórmulas estándar (15.5 Pronosticar con honestidad: probar en el futuro)?
16. Análisis de rutas y una mirada hacia adelante, Análisis de trayectorias y una mirada hacia adelante. ¿Una ocupación gana prestigio porque paga bien o porque requiere estudios? El análisis de trayectorias usa cadenas de regresiones para dividir un efecto en rutas directas e indirectas (16.1 Dibujar una historia causal: diagramas de rutas), y el capítulo cierra recorriendo el flujo de trabajo completo una última vez.
1.8 Cómo enseñarte a ti mismo con este libro¶
Este libro está escrito para que un estudiante que falta a clase pueda aprender un capítulo solo y aun así hacer la tarea. Unos cuantos hábitos hacen que eso funcione.
Lee en el orden en que está escrito el capítulo. Cada sección de concepto va primero la intuición, luego la fórmula, luego el mismo cálculo en R y en Python. La intuición es lo que hace que la fórmula se fije, así que no te saltes a los símbolos. Lee la viñeta inicial antes que nada; es la verdadera pregunta que el capítulo existe para responder.
Corre el código tú mismo, en ambos lenguajes si puedes. Cada ejemplo trabajado lee un CSV real de la
carpeta data/ del libro y muestra salida real. Escríbelo, córrelo y cambia algo para ver qué pasa. R es
el lenguaje principal de este curso, pero Python aparece a su lado en cada ejemplo porque probablemente lo
usarás después de graduarte, y ver la misma idea dos veces la cementa.
Haz cada Inténtalo a medida que llegas a él. Cada uno es una tarea corta con una solución completa oculta en un desplegable justo debajo. Inténtalo con honestidad antes de abrir la solución; el pequeño esfuerzo es donde está el aprendizaje. Fíjate también en las cajas de Habilidad duradera: cada una nombra un hábito que vale más que cualquier fórmula individual.
Trabaja los problemas de práctica en orden. Vienen en bandas. La Banda A comprueba que entendiste las ideas; la Banda B (en capítulos posteriores) te pide derivar y probar; la Banda C te pide analizar datos reales en R o Python. Las respuestas a los problemas impares están en el Apéndice H, así que puedes calificarte. La promesa del libro es simple: un lector que hace cada Inténtalo y cada problema impar puede resolver los problemas pares y los exámenes.
Espera releer. No tienes que entender algo la primera vez que lo ves. Relee la intuición, corre el código, duérmete pensando en ello y regresa. La comprensión suele llegar en la segunda o tercera pasada. Eso es normal, y no es señal de que estés atrasado.
Antes del primer ejemplo trabajado del Capítulo 2 necesitarás R y Python instalados y funcionando. Las instrucciones completas de instalación, la lista de paquetes y una referencia función por función para cada capítulo están en Apéndice C (R) y Apéndice D (Python). Una ficha de datos para cada conjunto de datos del libro, incluidos los que conociste en este capítulo, está en Apéndice E.
1.9 Resumen del capítulo¶
Ya tienes el mapa. La regresión estudia cómo una respuesta depende de uno o más predictores, y sirve a tres metas distintas: describir una relación, predecir un resultado nuevo y razonar sobre la causa, en orden creciente de dificultad. Viste de dónde vino la palabra en las estaturas de Galton y qué significa la regresión a la media, tanto como una pendiente ajustada por debajo de uno como una trampa que disfraza la estadística simple de una historia. Aprendiste la anatomía compartida por todo modelo del libro, una señal sistemática más ruido aleatorio, y la diferencia entre un parámetro y su estimación. Viste por qué la asociación no es causa, cómo una variable de confusión fabrica un vínculo falso, y cómo los datos observacionales y experimentales difieren en lo que pueden probar. Ubicaste la regresión en su historia, desde las órbitas de Gauss hasta la inferencia de Fisher, al modelo lineal generalizado, al aprendizaje automático moderno, y viste por qué, ahora que cualquier modelo se puede ajustar en una línea, la habilidad escasa es juzgar modelos en lugar de ajustarlos. Y tienes un recorrido por los quince capítulos por delante.
Resultados clave de un vistazo.
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Modelo estadístico (Definición 1.3) | : la respuesta es igual a la señal sistemática más el ruido aleatorio | todo modelo del libro |
| Regresión lineal simple | ; la media de es una línea recta en | se toma la señal como una recta |
| Parámetro frente a estimación (Definición 1.4) | son la verdad desconocida; se calculan de los datos | siempre |
| Tres usos de la regresión | descripción (una pendiente), predicción (un nuevo), razonamiento causal (una intervención) | la confianza decrece a lo largo de los tres |
| Regresión a la media | la recta de Galton ; pendiente por debajo de 1 | dos mediciones correlacionadas de forma imperfecta |
| La asociación no es causa (Definición 1.5) | que e se muevan juntos no tiene por qué significar que cambiar cambie | cualquier dato observacional |
| Observacional frente a experimental (Definición 1.7) | la asignación aleatoria equilibra las variables de confusión en promedio | las afirmaciones causales necesitan un experimento o supuestos fuertes |
Términos clave. regresión, respuesta, predictor, descripción, predicción, razonamiento causal, regresión a la media, modelo estadístico, parte sistemática (señal), parte aleatoria (error), parámetro, estimación, asociación, causa, variable de confusión (variable oculta), datos observacionales, datos experimentales, extrapolación, modelo lineal generalizado, aprendizaje automático supervisado, flujo de trabajo de modelado.
Ahora deberías poder:
Decir qué es la regresión y distinguir sus tres usos: describir una relación, predecir un resultado nuevo y razonar sobre la causa.
Explicar de dónde vino la palabra “regresión” en las estaturas de Galton y qué significa la regresión a la media, como una pendiente por debajo de uno y como una trampa.
Nombrar las partes de un modelo estadístico: la señal sistemática, el ruido aleatorio, los parámetros y sus estimaciones.
Distinguir la asociación de la causa, y los datos observacionales de los experimentales, y decir por qué importa la diferencia.
Ubicar la regresión dentro de la estadística, el aprendizaje automático y la ciencia de datos, y explicar por qué juzgar un modelo importa ahora más que ajustarlo.
Nombrar la pregunta que responde cada capítulo del semestre.
Configurar R y Python y usar este libro para aprender por tu cuenta.
Dónde encaja esto. Este capítulo es la etapa PREGUNTAR de todo el curso: enmarca las preguntas y la forma de pensar, y adelanta el flujo de trabajo que El flujo de trabajo del modelado nombrará por completo. Todo de aquí en adelante agrega herramientas. 2. Regresión lineal simple convierte la idea suelta de una “mejor recta” en una receta precisa y demostrable sobre los datos de Toluca (2.2 Mínimos cuadrados desde los primeros principios), y la maquinaria solo crece desde ahí. No necesitarás haber memorizado nada de este capítulo, pero si la diferencia entre descripción y predicción, entre asociación y causa, y entre un parámetro y una estimación te queda clara, el resto del libro se sentirá menos como una pila de fórmulas y más como una sola idea, extendida con cuidado.
1.10 Preguntas frecuentes¶
P1. ¿Es “regresión” lo mismo que “recta de mejor ajuste”? Para la mayor parte de este libro, sí: la parte sistemática es una línea recta y la regresión encuentra la mejor. Pero la palabra es más amplia. La regresión logística (13. Regresión logística) y la regresión de Poisson (14. Regresión de Poisson y la idea del MLG) ajustan reglas curvas para respuestas no continuas, y en el aprendizaje automático la señal ajustada puede ser muy flexible. Lo que las une a todas es la forma : estimar una parte sistemática, describir el ruido.
P2. Si la regresión solo muestra asociación, ¿por qué se usa para discutir sobre causas todo el tiempo? Porque con los datos correctos (idealmente un experimento aleatorizado) o los supuestos correctos (ajustando por las variables de confusión que puedes medir y defendiendo que has capturado las importantes), una asociación puede sostener una afirmación causal cuidadosa. El punto de la Sección 1.4 no es que la regresión nunca pueda hablar de la causa; es que lo hace solo con trabajo extra y honestidad extra, nunca de forma automática. 11. Predictores categóricos e interacciones y 16. Análisis de rutas y una mirada hacia adelante muestran cómo se ve ese trabajo.
P3. ¿Por qué enseñar esto cuando una IA puede ajustar cualquier modelo en una línea? Precisamente porque puede. Cuando ajustar es gratis, el valor se traslada al juicio: elegir el modelo correcto, comprobar sus supuestos, detectar la variable de confusión, atrapar la extrapolación y saber cuándo la salida segura está equivocada. Esas son las habilidades que este curso califica, y son las habilidades que te hacen útil al lado de una máquina en lugar de reemplazable por una.
P4. ¿De verdad necesito tanto R como Python? R es obligatorio (es el lenguaje principal del curso y un requisito del catálogo), y cada ejemplo está en R. Python corre junto a él porque es lo que usa buena parte de la industria, y ver el análisis idéntico en dos lenguajes hace que el concepto, y no la sintaxis, sea lo que recuerdas. Si vas apretado de tiempo, sigue R de cerca y trata a Python como un extra, pero sí instala ambos.
P5. No he tomado álgebra lineal. ¿Aún puedo hacer este curso? Sí. El Capítulo 6 construye cada pieza de álgebra matricial que usa el libro, desde la definición de una matriz hacia arriba, atada en cada paso a un uso de regresión. Los capítulos 2 al 5 no usan matrices en absoluto. Si has tomado álgebra lineal, el Capítulo 6 se leerá como un repaso; si no, está escrito para enseñarte.
P6. ¿Cuál es la diferencia entre el error y el residuo? El error es la brecha entre una observación y la recta verdadera, que nunca vemos porque nunca conocemos los parámetros verdaderos. El residuo es la brecha entre una observación y nuestra recta ajustada, que sí podemos calcular. Los residuos son nuestras estimaciones visibles de los errores invisibles, y el Capítulo 2 hace precisa la distinción. Importa porque usamos los residuos para estimar el tamaño del ruido.
P7. ¿Es la regresión a la media lo mismo que “las cosas siempre se emparejan”? No, y este es un enredo común. La regresión a la media trata de que a los extremos les siguen valores menos extremos, porque los extremos suelen ser en parte habilidad y en parte suerte, y la suerte no se repite. No dice que la próxima medición de una persona alta será promedio, ni que a un buen equipo le toca una derrota. Es un enunciado sobre el promedio de un grupo seleccionado por ser extremo, nada más.
1.11 Problemas de práctica¶
(A) En tus propias palabras, ¿qué hace la regresión? Responde en dos oraciones, usando las palabras “respuesta” y “predictor”.
(A) Nombra los tres usos de la regresión discutidos en la Sección 1.1, y da un ejemplo de una línea de cada uno que no esté en el capítulo.
(A) Para cada pregunta, di si es descripción, predicción o razonamiento causal: (a) “¿Cuánto sube la presión arterial promedio por año de edad en esta clínica?” (b) “Si subimos el precio un dólar, ¿cuántas unidades menos venderemos?” (c) “¿Qué ventas debemos esperar el próximo trimestre dado nuestro presupuesto de anuncios?”
(A) Explica la diferencia entre un parámetro () y una estimación () en una o dos oraciones. ¿Por qué nunca podemos conocer exactamente?
(A) Escribe la anatomía general de un modelo estadístico, , y explica en palabras simples qué representa cada una de las dos piezas.
(A) Un compañero dice que el término de error significa que el modelo cometió un error y que un mejor modelo lo eliminaría. Corrige el malentendido.
(A) Explica la “regresión a la media” en tus propias palabras, y da un ejemplo cotidiano distinto de las estaturas o los deportes.
(A) La pendiente ajustada de Galton del hijo sobre la estatura media de los padres es de aproximadamente 0.64. ¿Qué habría significado una pendiente de exactamente 1? ¿Qué habría significado una pendiente de 0?
(A) ¿Por qué una diferencia cruda en el salario promedio entre dos grupos no es, por sí sola, evidencia de un pago desigual? Nombra una variable de confusión y explica su función.
(A) Define “variable de confusión” y dibuja (en palabras o en un boceto) el diagrama del helado y los ahogamientos, etiquetando las flechas causales.
(A) Explica la diferencia entre datos observacionales y experimentales, y por qué la asignación aleatoria ayuda a establecer la causa.
(A) Los cuatro conjuntos de datos de Anscombe comparten la misma media, varianza, correlación y recta ajustada. ¿Cuál es la única lección que Anscombe quería que sacaras de esto, y qué acción de una palabra recomienda antes de confiar en cualquier resumen?
(A) Da un ejemplo de una correlación fuerte entre dos variables que estés seguro de que no es causal, y nombra la variable oculta probable.
(A) En una oración cada uno, enuncia para qué se inventó originalmente el método de mínimos cuadrados (hacia 1805) y quién le dio a la “regresión” su nombre.
(A) El capítulo afirma que la regresión es “el núcleo sobre el que se construye el aprendizaje automático moderno”. Explica qué tiene que ver el paso final de una red neuronal con la regresión de este curso.
(A) Enuncia la tesis del curso sobre la era de la IA en tus propias palabras: ¿qué habilidad se ha vuelto escasa, y por qué?
(A) Te entregan una predicción de aspecto seguro de un asistente de IA. Enumera cuatro preguntas que harías antes de confiar en ella (apóyate en la caja “Juzga un modelo que no ajustaste”).
(A) ¿Por qué el ejemplo del Challenger ilustra el peligro de la extrapolación? ¿Qué tenía de especial el lanzamiento a 31 grados respecto de los datos?
(A) Nombra las cinco etapas del flujo de trabajo de modelado en orden, y da una descripción de una frase de cada una.
(A) Para cada pregunta de capítulo de abajo, nombra el capítulo (2 al 16) que la responde: (a) cuáles de trece medidas corporales enredadas conservar; (b) si una pendiente de solo trece pateadores es real; (c) cómo pronosticar la demanda mensual de aerolínea del próximo año.
(A) Explica la diferencia entre el intervalo de confianza para una respuesta media y el intervalo de predicción para una observación nueva, usando la Figure 1 como referencia. ¿Cuál es más ancho, y por qué?
(A) Un titular dice “las personas que beben vino tinto viven más, así que bebe vino tinto”. Identifica la afirmación causal, nombra una variable de confusión plausible, y di qué tipo de estudio se necesitaría para sostener el consejo.
(A) ¿Por qué este libro muestra cada ejemplo tanto en R como en Python? Da dos razones distintas de la Sección 1.8.
(A) Explica el “bajón del segundo año” (Inténtalo 1.2) como regresión a la media, y predice qué verías si en cambio siguieras a los peores novatos en su segundo año.
(C) Lee
galton_heights.csven R o Python. Ajusta la recta que predicechildHeighta partir demidparentHeight, reporta la pendiente y confirma que está por debajo de 1. En una oración, conecta el número con la regresión a la media.(C) Usando
galton_heights.csv, predice la estatura del hijo para una estatura media de los padres de 66 pulgadas y de 72 pulgadas. Confirma que la predicción más alta está más cerca de la estatura media general del hijo (unas 66.7 pulgadas) que 72, ilustrando el tirón hacia el centro.(C) Lee
anscombe.csvy reproduce la tabla resumen del Ejemplo 1.4 para los cuatro pares x-y (medias, varianza de x, correlación y recta ajustada). Luego haz los cuatro diagramas de dispersión. ¿Cuál de los cuatro es una relación genuina de línea recta, y cuál tiene su pendiente fijada por un solo punto?(C) Lee
orings.csv. Reporta el número de vuelos, la temperatura de lanzamiento más fría en los datos y el número total de incidentes de daño. Explica por qué predecir el riesgo de daño a 31 grados es una extrapolación, refiriéndote a la temperatura más fría que encontraste.
1.12 Práctica de examen¶
Los problemas de arriba comprueban que puedes recordar y aplicar las ideas. Los exámenes piden algo más difícil: explicar tu razonamiento en oraciones completas, juzgar una afirmación que hizo otra persona, y leer salida de software real en contexto. Las cinco preguntas de aquí están escritas en ese estilo de examen. Cada una quiere prosa, no una palabra o un número aislado. Intenta una respuesta escrita completa antes de abrir la respuesta modelo, y compara no solo la conclusión sino el razonamiento. Un evaluador da la calificación completa por el razonamiento.
PE 1.1. Una recta, tres pedidos. Una analista de marketing ajusta una sola recta de mínimos cuadrados de las ventas mensuales (en miles de dólares) sobre el gasto mensual en publicidad (también en miles). Luego usa esa única recta para tres pedidos. Le dice al equipo de finanzas que cada mil dólares extra de publicidad va con unos cuatro mil dólares más en ventas. Pronostica las ventas del próximo mes a partir del presupuesto ya aprobado para el próximo mes. Y le aconseja al director general que subir el presupuesto de anuncios en diez mil dólares subirá las ventas en unos cuarenta mil dólares. Explica por qué la misma recta ajustada puede servir a los tres pedidos, y sin embargo la confianza a la que la analista tiene derecho no es la misma para cada uno. Ordena los tres pedidos de más a menos confiable y defiende el orden.
Respuesta modelo
Los tres pedidos leen de la misma regla ajustada, : el primero reporta su pendiente, el segundo introduce un nuevo valor de en ella, y el tercero pregunta qué haría mover . Una recta puede responder los tres porque la descripción, la predicción y el razonamiento causal son tres preguntas que puedes hacerle a un solo ajuste, no tres ajustes distintos.
La confianza difiere porque cada pedido le exige más a los datos que el anterior. Reportar la pendiente es descripción: solo resume el patrón que ya está en los datos, así que es el más confiable de los tres. Pronosticar las ventas del próximo mes es predicción: supone que el mismo patrón sigue manteniéndose para un mes nuevo, y es seguro solo si el presupuesto del próximo mes cae dentro del rango de presupuestos con los que se ajustó la recta, en lugar de ser una extrapolación más allá de ellos. Aconsejar al director general que más gasto causará más ventas es razonamiento causal, y es el menos confiable, porque la recta mide asociación, no causa. Si alguna tercera variable, digamos la temporada, impulsa juntos el gasto en anuncios y las ventas, entonces subir el presupuesto no tiene por qué subir las ventas en absoluto, aunque la recta se incline hacia arriba. Así que el orden, de más a menos confiable, es descripción, luego predicción, luego razonamiento causal.
Una respuesta débil nombra los tres usos pero no conecta la confianza decreciente con el supuesto extra que agrega cada uno: la estabilidad del patrón (y quedarse dentro del rango de los datos) para la predicción, y la ausencia de una variable de confusión para la afirmación causal.
PE 1.2. Una afirmación sobre la regresión a la media. Un estudiante escribe: “La regresión a la media prueba que los extremos desaparecen con el tiempo. Así que un padre muy alto debería esperar un hijo de estatura cerca del promedio, y un equipo que acaba de ganar el campeonato le toca una temporada perdedora el año siguiente.” Evalúa la afirmación. Enuncia con precisión qué afirma y qué no afirma la regresión a la media, y corrige los dos errores específicos.
Respuesta modelo
La afirmación parte de una observación verdadera, que los casos seleccionados por ser extremos en una medición tienden a ser menos extremos en una segunda, pero saca de ella dos conclusiones equivocadas.
El primer error es el tamaño del tirón. La regresión a la media no arrastra la segunda medición todo el camino de vuelta al promedio; predice un valor que es menos extremo que el primero pero por lo general aún del mismo lado del promedio. La pendiente ajustada de Galton de aproximadamente 0.64 dice que se predice que el hijo de un padre muy alto será alto, solo unos dos tercios de lo lejos por encima del promedio que su padre, no promedio. Esperar “cerca del promedio” confunde una pendiente por debajo de uno con una pendiente de cero.
El segundo error es tratar un enunciado sobre grupos como un hecho sobre casos individuales y sobre el futuro. La regresión a la media describe el promedio de un grupo seleccionado por ser extremo, y funciona porque un valor extremo suele ser en parte habilidad y en parte suerte, y la suerte no se repite. La habilidad sí se traslada. Se espera que un equipo campeón se mantenga por encima del promedio el año siguiente, solo que menos extremo, así que no le “toca” una temporada perdedora; creer que a un buen equipo el mundo le debe un mal año es la falacia del jugador, no la regresión a la media.
Una respuesta débil nombra correctamente la regresión a la media pero no capta que el valor predicho se queda del lado extremo del promedio (una pendiente por debajo de uno, no cero), y no separa la suerte que no se repite de la habilidad que sí.
PE 1.3. Interpretar una recta ajustada en contexto. Los datos de Galton sobre 934 hijos se usan para ajustar la estatura del hijo (pulgadas) sobre la estatura media de los padres (pulgadas). Aquí está la salida de R, luego los coeficientes de Python, luego las estaturas predichas del hijo en tres estaturas medias de los padres. La estatura media del hijo en los datos es de 66.75 pulgadas.
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 22.63624 4.26511 5.307 1.39e-07 ***
midparentHeight 0.63736 0.06161 10.345 < 2e-16 ***
---
Residual standard error: 3.392 on 932 degrees of freedom
Multiple R-squared: 0.103, Adjusted R-squared: 0.102Intercept 22.636241
midparentHeight 0.637361
predicted child height at midparent = 64, 68, 72:
63.42734 65.97678 68.52623(a) Interpreta la pendiente 0.637 en las unidades de este problema. (b) Explica por qué no deberías leer el intercepto 22.64 como “se predice que un hijo cuyos padres promedian cero pulgadas mide 22.64 pulgadas”. (c) Usando los tres valores predichos y la estatura media del hijo de 66.75 pulgadas, explica cómo las predicciones en estaturas medias de los padres de 64 y 72 pulgadas ilustran la regresión a la media. (d) Un compañero dice que el bajo de 0.103 significa que la regresión está mal y debería descartarse. Responde.
Respuesta modelo
(a) Cada pulgada adicional de estatura media de los padres va con unas 0.637 de pulgada más de estatura del hijo, en promedio. La relación es positiva pero poco inclinada: los padres más altos sí tienen hijos más altos, pero el aumento está muy por debajo de una pulgada por pulgada de los padres.
(b) Una estatura media de los padres de cero no está cerca de los datos, que se ubican alrededor de 64 a 72 pulgadas, así que el intercepto no es una predicción real para nadie. Es solo el número que fija la recta a la altura correcta sobre el rango que efectivamente se observó. Leerlo como una predicción en cero es extrapolar mucho más allá de todo dato, donde la relación de línea recta nunca se comprobó.
(c) Una estatura media de los padres de 64 pulgadas está por debajo del padre promedio, y el modelo predice un hijo de 63.43 pulgadas, que está por debajo de la estatura media del hijo de 66.75 pero más cerca de ella que 64. Una estatura media de los padres de 72 pulgadas está muy por encima del promedio, y el modelo predice 68.53 pulgadas, por encima de la estatura media del hijo pero más cerca de ella que 72. En ambas direcciones el hijo predicho es jalado hacia el centro respecto de los padres. Ese tirón, producido por una pendiente por debajo de uno, es exactamente la regresión a la media.
(d) Un bajo no significa que el modelo esté mal. Significa que la estatura media de los padres explica solo un 10 por ciento de la variación en la estatura del hijo, lo cual es honesto: la estatura tiene muchas causas más allá del promedio de los padres, así que la mayor parte de la dispersión queda sin explicar. La pendiente sigue siendo real y muy significativa (su valor es mayor que diez). Si conviene conservar el modelo depende de la pregunta. Para describir cómo la estatura del hijo sigue a la de los padres está bien; para predecir la estatura de un hijo con precisión es débil, y el gran error estándar residual de 3.39 pulgadas lo dice.
Una respuesta débil lee el intercepto como una predicción literal, o trata el bajo como prueba de que el ajuste está roto, y pasa por alto que el mide la variación explicada, no la corrección.
PE 1.4. La brecha salarial: qué cambiaría si. Los datos del decano muestran que los hombres ganan unos más al año que las mujeres, en promedio. Un miembro del consejo lee esta brecha cruda como prueba de que la universidad paga de menos a las mujeres. Para cada cambio de abajo, di qué le haría a la fuerza de una lectura causal de la brecha, y por qué. (a) La analista reajusta manteniendo fijos el rango, la disciplina y los años de servicio, y la brecha se encoge a una cantidad pequeña. (b) Incluso después de ese ajuste, alguna variable que nadie midió (digamos, ofertas de trabajo externas específicas del campo) todavía difiere entre los dos grupos. (c) Imagina, hipotéticamente, que el sexo se hubiera podido asignar aleatoriamente al profesorado. Cierra con una oración sobre por qué los datos salariales observacionales rara vez pueden resolver por sí solos la pregunta causal.
Respuesta modelo
(a) El rango, la disciplina y los años de servicio afectan todos el salario y pueden estar distribuidos de forma distinta entre los grupos, así que son variables de confusión para la brecha cruda. Mantenerlos fijos elimina la parte de los que en realidad era una diferencia de rango o de experiencia. Si la brecha se encoge a una cantidad pequeña, la mayor parte de la diferencia cruda era confusión, y la brecha restante más pequeña es una estimación mejor, aunque todavía imperfecta, de cualquier efecto verdadero de pago desigual.
(b) Cualquier variable de confusión que no puedas medir sigue enredada en la comparación, porque solo puedes ajustar por las variables que tienes. Así que incluso la brecha ajustada puede estar sesgada en cualquier dirección por la diferencia no medida en ofertas externas, y sigue sin ser prueba de un pago insuficiente. El ajuste refuerza el caso solo para las variables de confusión que efectivamente atrapaste.
(c) La asignación aleatoria equilibraría cada variable de confusión, medida o no, entre los grupos en promedio, así que una brecha que quedara después de la aleatorización podría leerse como causal. Pero el sexo no se puede asignar con un lanzamiento de moneda, que es precisamente por qué esta pregunta causal es difícil y por qué ninguna cantidad de ajuste sustituye por completo a un experimento.
Como los datos salariales observacionales siempre dejan sin controlar alguna variable de confusión no medida, pueden establecer que los grupos difieren en el pago, una asociación, pero rara vez que un trato desigual causó la diferencia por sí solo.
Una respuesta débil trata la brecha ajustada como prueba total o refutación total de la discriminación, y pasa por alto que las variables de confusión no medidas sobreviven al ajuste y que solo la aleatorización las equilibra todas.
PE 1.5. El lanzamiento del Challenger: leer una figura. Consulta la Figure 2, los 23 vuelos del transbordador anteriores al Challenger. Todo vuelo registrado se lanzó a 53 grados Fahrenheit o más cálido, y el lanzamiento en discusión se pronosticó a unos 31 grados. (a) Usando la figura, explica en contexto por qué pronosticar el daño de los anillos a 31 grados es una extrapolación, y por qué eso hace poco confiable la predicción incluso cuando una curva ajustada reporta un número de aspecto seguro. (b) ¿Qué cambiaría sobre la confiabilidad de la predicción a 31 grados si el vuelo anterior más frío hubiera sido a 30 grados en lugar de 53? (c) Un gerente dice: “La recta ajustada ya da una estimación de daño a 31 grados, así que hemos tenido en cuenta el frío.” Evalúa esa afirmación.
Respuesta modelo
(a) En la figura cada punto está a 53 grados o más cálido, así que 31 grados queda muy a la izquierda de todos los datos. La relación entre la temperatura y el daño solo se observó alguna vez sobre el rango cálido, y la forma de cualquier curva por debajo de 53 grados es un supuesto que los datos no pueden comprobar. Un modelo aún devolverá un número a 31 grados, y su intervalo puede incluso verse estrecho, pero esa estrechez refleja solo la incertidumbre de la recta ajustada sobre el rango observado, no la incertidumbre real y mucho mayor sobre una temperatura que ningún vuelo vio jamás. Eso es lo que hace poco confiable una predicción extrapolada.
(b) Si un vuelo se hubiera lanzado cerca de 30 grados, entonces 31 grados caería dentro del rango observado, haciendo de la predicción una interpolación en lugar de una extrapolación. Los datos hablarían entonces directamente de cómo se comportan los anillos en el frío, y la predicción a 31 grados sería mucho más confiable, porque el patrón se habría probado cerca de esa temperatura en lugar de suponerse.
(c) Ajustar una recta no “tiene en cuenta” una temperatura que nunca se observó. La recta solo resume los vuelos a 53 grados y más cálidos, así que leerla a 31 grados extiende ese resumen más allá del borde de toda experiencia. Tener una ecuación en la cual introducir el número da una falsa sensación de seguridad; el frío no se tuvo en cuenta, se supuso inexistente.
Una respuesta débil dice que la predicción es meramente incierta sin identificar que 31 grados queda fuera del rango de los datos, o cree que una vez que existe una ecuación cualquier valor de entrada es seguro de introducir.
Juego del capítulo¶
Chapter summary (in English)
This chapter is a panoramic map of regression, the tool that studies how a response depends on one or more predictors . It opens with three real problems: estimating work hours from lot size at the Toluca Company, deciding whether to launch the space shuttle Challenger from O-ring damage and temperature, and weighing a salary gap of about between men and women. All three are the same kind of question.
Regression serves three goals of rising difficulty: describe a relationship through a slope, predict a new value, and reason about cause, the hardest, because a fit measures association, not cause. The word “regression” comes from Francis Galton, who noticed that the children of very tall parents are tall but less so than their parents: regression to the mean. The fitted slope of child height on mid-parent height is about 0.64, clearly below 1.
Every model in the book shares the same anatomy, : a systematic part (the signal that explains) plus a random part (the noise). We distinguish a parameter , the unknown truth, from its estimate , what we compute. Association is not causation: a confounder such as hot weather can create a strong correlation between ice-cream sales and drownings with no causal link. Experimental data with random assignment can support a causal claim; observational data cannot. Anscombe’s quartet is a reminder that you must always plot the data.
A short history runs from the least squares of Gauss and Legendre (around 1805) to Fisher, to the generalized linear model (1972), and to today’s machine learning. The course thesis: now that any model can be fit in one line of code, the scarce skill is judging models, not fitting them. The chapter closes with a tour of the fifteen chapters ahead and advice for teaching yourself.