Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

1. La regresión como una forma de pensar

Tres personas observan tres tablas de números, y cada una de ellas tiene que decidir algo.

Una ingeniera de producción de la Toluca Company tiene registros de 25 corridas de fabricación: el tamaño de cada lote y las horas de trabajo que tomó. Debe recomendar un tamaño de lote que mantenga bajos los costos, y para hacerlo necesita saber cómo crecen las horas con el tamaño del lote. Un solo número lo resolvería: ¿cuántas horas adicionales cuesta una unidad más en el lote? La Figure 1 son sus datos.

Diagrama de dispersión de 25 corridas de producción de Toluca, con las horas de trabajo en el eje vertical frente al tamaño del lote en el eje horizontal, y una recta de pendiente positiva que atraviesa la nube. Las horas de trabajo suben desde unas 110 con un tamaño de lote de 20 hasta más de 500 con un tamaño de lote de 120.

Figure 1:Veinticinco corridas de producción en la Toluca Company. Los lotes más grandes toman más horas, y la tendencia parece recta, pero ¿cuál es la recta correcta y cuánto puedes confiar en su pendiente? El Capítulo 2 responde ambas cosas.

En la noche del 27 de enero de 1986, una tabla muy distinta estaba frente a los ingenieros que decidían si lanzar el transbordador espacial Challenger a la mañana siguiente. De 23 vuelos anteriores tenían la temperatura de lanzamiento y el número de anillos de sello (O-rings), de seis, que mostraron daño por calor. El pronóstico para el lanzamiento era de unos 31 grados Fahrenheit, más frío que cualquier vuelo registrado. ¿Podían decir cuál sería el riesgo de daño a una temperatura a la que nunca habían volado? La Figure 2 es aquello a partir de lo cual tenían que razonar.

Diagrama de dispersión de la fracción de seis anillos dañados frente a la temperatura de lanzamiento en grados Fahrenheit para 23 vuelos del transbordador. Los vuelos más fríos, cerca de 53 grados, muestran el mayor daño; los vuelos cálidos por encima de 70 grados en su mayoría no muestran ninguno. Una línea roja discontinua marca el lanzamiento a 31 grados, muy a la izquierda de toda observación.

Figure 2:Los 23 vuelos previos al Challenger. El daño fue peor en los lanzamientos más fríos, y el lanzamiento en discusión (línea discontinua, 31 grados) quedaba muy por debajo de cualquier vuelo realizado. Juzgar ese riesgo significa extender un patrón más allá del último dato. El Capítulo 13 lo aborda.

Un decano de una universidad de Estados Unidos tiene una tercera tabla: para 397 profesores, su rango, disciplina, años de experiencia, sexo y salario. La tabla se construyó para responder una pregunta concreta. Los hombres en los datos ganan, en promedio, unos catorce mil dólares al año más que las mujeres. ¿Es esa brecha evidencia de un pago desigual, o solo refleja que los dos grupos difieren en rango y experiencia? Un promedio crudo no puede distinguirlo. La Figure 3 muestra cómo sube el salario con el rango por sí solo, que es una de las cosas que hay que tener en cuenta antes de que la brecha por sexo signifique algo.

Un diagrama de caja con puntos dispersos del salario académico en miles de dólares para tres rangos del profesorado, Asistente, Asociado y Titular. Los salarios suben desde unos 80 mil para los profesores Asistentes hasta una amplia dispersión centrada cerca de 127 mil para los profesores Titulares, con rombos rojos que marcan las medias de cada grupo.

Figure 3:El salario de nueve meses sube abruptamente con el rango. Antes de que una brecha salarial cruda entre hombres y mujeres pueda significar algo, un modelo tiene que mantener fijos el rango, la disciplina y la experiencia. El Capítulo 11 construye ese modelo.

Un costo, una catástrofe y una cuestión de justicia. En la superficie no tienen nada en común. Pero cada uno es la misma clase de problema: alguien quiere saber cómo una cantidad depende de otras, para poder describirla, predecirla o actuar sobre ella. Eso es lo que hace la regresión (Definición 1.1), y es el tema de este libro. Este primer capítulo es un mapa. Dice qué es la regresión y para qué sirve, de dónde vino la palabra, cómo creció la idea a lo largo de dos siglos, dónde se ubica en la ciencia de datos y el aprendizaje automático modernos, y qué te enseñará cada uno de los quince capítulos siguientes. Aquí casi no hay matemáticas y nada que memorizar. La meta es darte la vista del terreno antes de que empieces a recorrerlo.

1.1 Qué hace la regresión

Las tres historias iniciales parecen no tener relación, pero cada una hace la misma pregunta, y una sola herramienta responde las tres. La regresión estudia cómo una cantidad, la respuesta, cambia con una o más de otras, los predictores (Definición 1.2). Escribe la respuesta YY y un predictor XX. La regresión ajusta una regla que dice qué valor de YY esperar en cada valor de XX. Lo hace sin fingir que el mundo es ordenado: dos lotes del mismo tamaño tomaron horas distintas, y dos vuelos a la misma temperatura tuvieron daños distintos. La regla describe el comportamiento promedio y trata con honestidad la dispersión restante.

La gente recurre a esa regla por tres razones distintas, y tenerlas claras es el primer hábito que este curso quiere construir.

Descripción. A veces solo quieres resumir una relación que ya tienes delante. ¿Cuánto suben las horas de trabajo, en promedio, por cada unidad extra de tamaño de lote? La respuesta es una pendiente, un solo número interpretable, y reportarlo es descripción. No estás prediciendo nada nuevo ni afirmando que el tamaño del lote cause las horas en algún sentido profundo; estás comprimiendo una nube de puntos en una oración que un gerente puede usar.

Predicción. A veces quieres un número para un caso que aún no has visto. La corrida de la próxima semana es de 100 unidades: ¿cuántas horas debemos presupuestar? Una predicción introduce un nuevo XX en la regla ajustada y lee el YY esperado, idealmente con un margen de error adjunto. Una buena predicción no requiere que entiendas por qué XX y YY se mueven juntas, solo que el patrón que se mantuvo en los datos siga manteniéndose. Esta es la meta que domina el aprendizaje automático moderno.

Razonamiento causal. A veces quieres saber qué pasaría si cambiaras algo. ¿Pagar a las mujeres el mismo salario inicial cerraría la brecha? ¿Un lanzamiento más cálido habría salvado el transbordador? Estas son preguntas causales, y son las más difíciles de las tres, porque una regresión ajustada a datos observados mide asociación, no causa. A veces puedes razonar sobre la causa con regresión, pero solo con supuestos adicionales e, idealmente, el tipo de datos correcto. Confundir un ajuste predictivo con una afirmación causal es el error más común y más costoso en la estadística aplicada, y este libro regresa a la advertencia una y otra vez.

La misma recta ajustada puede servir a las tres metas, pero la confianza a la que tienes derecho difiere enormemente. La Figure 4 pone las tres una al lado de la otra: una recta, tres preguntas, y un medidor de confianza que baja a medida que las preguntas se vuelven más audaces.

Tres copias del mismo diagrama de dispersión y recta ajustada. La primera, etiquetada Descripción, marca la pendiente con un pequeño triángulo. La segunda, etiquetada Predicción, deja caer una línea discontinua desde un nuevo valor de X hasta la recta ajustada y muestra un punto con una barra de error. La tercera, etiquetada Razonamiento causal, dibuja una flecha curva a lo largo de la recta preguntando qué haría cambiar X. Una banda de color debajo va de verde a la izquierda a rojo a la derecha, etiquetada confianza a la que tienes derecho, alta a la izquierda y baja a la derecha.

Figure 4:La misma recta ajustada hace los tres trabajos, pero no ganan la misma confianza. La descripción solo lee una pendiente de los datos que tienes; la predicción introduce un nuevo X; el razonamiento causal pregunta qué haría una intervención, y necesita lo más de los datos. La confianza se encoge de izquierda a derecha.

Para hacer concretos los tres usos, aquí están los tres conjuntos de datos iniciales reducidos a tres números reales.

Describir y predecir suenan como tareas distintas, pero salen de la misma recta, así que al mover los datos mueves ambas a la vez. La pendiente de la ingeniera y su presupuesto de horas están en el widget de abajo; arrastra una corrida y observa cuál de las dos es frágil.

Las 25 corridas de Toluca, con la recta de mínimos cuadrados reajustándose mientras arrastras cualquier punto. Los valores muestran la pendiente b1b_1, el intercepto b0b_0, las horas predichas Y^\hat{Y} para un lote de 100 unidades y para uno de 200, y la SCE.

Qué observar. La pendiente es la descripción y Y^\hat{Y} es la predicción, y una sola corrida arrastrada mueve ambas a la vez. Prueba esto. Arrastra hacia arriba la corrida del lote de 120 y compara cuánto se mueve Y^\hat{Y} en 100 frente a Y^\hat{Y} en 200, un tamaño que nadie produjo nunca: la predicción dentro de los datos apenas se inmuta mientras la que está más allá del borde se sacude con fuerza. Volver a la Sección 1.1.

1.2 La palabra “regresión”: las estaturas de Galton

La palabra “regresión” es más antigua que el método moderno y viene de un lugar sorprendente: un estudio de la estatura humana. En la década de 1880, Francis Galton recopiló las estaturas de 934 hijos adultos y sus padres, 205 familias en total, y se preguntó si los padres altos tienen hijos altos. Sí los tienen, pero Galton notó algo más extraño, y la rareza le dio su nombre al campo.

Para cada hijo, Galton calculó una estatura media de los padres, un promedio ponderado de las estaturas de los dos padres. Luego graficó la estatura del hijo frente a la estatura media de los padres. La Figure 6 muestra ese gráfico con dos rectas dibujadas encima. La recta roja discontinua es y=xy = x: donde caerían los hijos si cada uno igualara exactamente a sus padres. La recta azul es la recta real de mejor ajuste a través de los datos.

Diagrama de dispersión de la estatura del hijo frente a la estatura media de los padres para 934 hijos, con dos rectas. Una recta roja discontinua marca y igual a x (los hijos igualando a los padres), y una recta azul de mínimos cuadrados que es claramente menos inclinada, cruzando la línea discontinua cerca del centro y quedando por debajo de ella a la derecha y por encima a la izquierda.

Figure 6:Los 934 hijos de Galton. La recta de mínimos cuadrados (azul) es mucho menos inclinada que la recta de estaturas iguales (roja discontinua): los padres altos tienen hijos que son altos pero más cerca del promedio, y los padres bajos tienen hijos que son bajos pero más cerca del promedio. Galton llamó a este tirón hacia el centro “regresión”.

La recta azul es claramente más plana que y=xy = x. Léela desde la derecha: los hijos de padres muy altos son más altos que el promedio, pero no tan altos como sus padres. Léela desde la izquierda: los hijos de padres muy bajos son más bajos que el promedio, pero no tan bajos. En ambas direcciones las estaturas de los hijos son atraídas hacia el promedio general. Galton llamó a este tirón “regresión hacia la mediocridad”, queriendo decir el centro, y el nombre se quedó con todo el método aunque el método ahora no tiene nada que ver con las estaturas. La Figure 7 hace imposible no ver el tirón promediando a los hijos dentro de bandas estrechas de estatura de los padres.

Un gráfico de la estatura media del hijo por cada intervalo de estatura media de los padres frente al centro del intervalo, con la recta de estaturas iguales y igual a x discontinua en rojo por encima de los puntos y la recta de mínimos cuadrados en azul a través de ellos. Flechas en los extremos muestran los intervalos de padres altos jalados hacia abajo hacia la media y los intervalos de padres bajos jalados hacia arriba.

Figure 7:La estatura media del hijo en cada banda de estatura de los padres cae sobre la recta azul poco inclinada, por debajo de la recta roja de estaturas iguales a la derecha y por encima a la izquierda. Todo grupo extremo de padres produce un grupo menos extremo de hijos. Eso es regresión a la media.

Podemos ponerle un número al tirón. Ajustar la recta de mínimos cuadrados de la estatura del hijo sobre la estatura media de los padres da la pendiente y el intercepto de abajo.

Dos advertencias que este pequeño ejemplo ya enseña. Primera, la “regresión a la media” es un hecho sobre promedios, no sobre ninguna familia en particular: muchos padres altos tienen hijos más altos que ellos mismos; el hijo promedio de padres altos es más bajo que los padres. Segunda, el efecto es fácil de malinterpretar como algo causal o misterioso, y no es ninguna de las dos cosas. Ocurre siempre que dos mediciones están correlacionadas de forma menos que perfecta, por una razón puramente estadística. El siguiente Inténtalo muestra la trampa en un escenario moderno.

Leer ese jalón en un diagrama estático cuesta trabajo. Es más fácil sentirlo eligiendo tú mismo una estatura de los padres y observando cuánta de su ventaja conserva el hijo.

La recta de mínimos cuadrados de Galton frente a la recta de estaturas iguales y=xy = x, con un deslizador para la estatura media de los padres. Los valores muestran cuánto están los padres sobre el promedio, el hijo predicho Y^\hat{Y}, y cuánto queda ese hijo sobre el promedio.

Qué observar. El hijo predicho siempre cae entre la estatura de sus padres y el promedio general, tanto del lado alto como del lado bajo. Prueba esto. Desliza de 75 pulgadas hasta 65 y observa que la fracción conservada se mantiene en 0.637 todo el camino: el mismo b1b_1 que encoge la ventaja de una familia alta levanta el déficit de una familia baja. Volver a la Sección 1.2.

Los datos de Galton vuelven en 4. Correlación, donde la pendiente poco inclinada se convierte en una correlación y estudiamos los usos y abusos de la correlación por completo.

1.3 La anatomía de un modelo estadístico

Toda regresión en este libro se construye a partir de las mismas dos piezas, y nombrarlas ahora hará que todo el curso sea más fácil de seguir. Mira de nuevo cualquiera de los diagramas de dispersión hasta ahora. Los puntos no caen sobre una sola curva; se dispersan alrededor de una. Un modelo estadístico toma eso en serio (Definición 1.3) al dividir la respuesta en una parte que una regla puede explicar y una parte que no puede.

Y  =  f(X)parte sistemaˊtica  +  εparte aleatoria.Y \;=\; \underbrace{f(X)}_{\text{parte sistemática}} \;+\; \underbrace{\varepsilon}_{\text{parte aleatoria}} .

En palabras: cada respuesta observada es la suma de una señal, f(X)f(X), el valor promedio de YY que el predictor explica, y un término de ruido ε\varepsilon, todo lo demás que empuja a la observación fuera de ese promedio. La Figure 9 dibuja la división para un solo conjunto de datos.

Un diagrama de dispersión de puntos verdes que suben con X, una recta azul a través de su centro etiquetada la parte sistemática f de X, y un segmento vertical naranja desde la recta hasta un punto etiquetado el error aleatorio épsilon. Un pie de figura dice respuesta igual a señal más ruido.

Figure 9:Un modelo divide cada observación en dos partes: la señal sistemática f(X) que el predictor explica (recta azul), y el ruido aleatorio épsilon que no explica (un error dibujado en naranja). La regresión es el oficio de estimar la señal sin dejarse engañar por el ruido.

La parte sistemática es lo que estimamos. En la mayor parte de este libro f(X)f(X) es una línea recta, f(X)=β0+β1Xf(X) = \beta_0 + \beta_1 X, y el modelo se convierte en el modelo de regresión lineal simple Y=β0+β1X+εY = \beta_0 + \beta_1 X + \varepsilon que 2.1 El modelo de regresión lineal simple construye con cuidado. En palabras: la respuesta promedio sube (o baja) una cantidad fija β1\beta_1 por cada paso de una unidad en XX, y β0\beta_0 es donde empieza la recta. Las letras griegas β0\beta_0 y β1\beta_1 son parámetros (Definición 1.4): números fijos que describen la relación verdadera en toda la población, que nunca llegamos a ver directamente. A partir de una muestra de datos calculamos estimaciones de ellos, escritas b0b_0 y b1b_1, que son nuestras mejores conjeturas. Es como la diferencia entre la verdadera estatura promedio de cada adulto vivo, un número fijo que nadie podría medir jamás, y la estatura promedio de las cien personas que efectivamente encuestaste, un número que puedes calcular y que está cerca de la verdad pero no es exactamente ella. La distinción entre un parámetro (la verdad que queremos) y una estimación (el número que podemos calcular) atraviesa cada capítulo, y confundirlos causa una infinidad de enredos.

La parte aleatoria ε\varepsilon no es un error ni una falla del modelo. Es la admisión honesta de que el tamaño del lote no determina las horas exactamente, de que la temperatura no determina el daño a los anillos exactamente, de que el mundo tiene variación que los predictores no capturan. Un buen modelo no finge que el ruido no existe; estima la señal y describe el tamaño del ruido, para que las predicciones vengan con barras de error y las afirmaciones con márgenes.

La división suena abstracta hasta que la aplicas a una sola fila de datos reales. Toma una corrida de Toluca y sepárala en las dos piezas que la ecuación promete.

El lugar más limpio para ver separarse las dos partes es un mecanismo sin misterio alguno. Lanza una moneda justa veinte veces: la señal está fija en diez caras y todo lo demás en pantalla es la parte aleatoria.

Veinte lanzamientos de una moneda justa, repetidos en tantas rondas como quieras. La parte sistemática está fija en diez caras, marcada en ámbar, y el histograma reúne el conteo de cada ronda.

Qué observar. El conteo casi nunca cae en exactamente diez, y aun así el montón que forma es perfectamente ordenado. Prueba esto. Corre 1000 rondas y observa que la media se asienta cerca de 10 mientras la dispersión se mantiene cerca de 2.24: el ruido nunca desaparece, solo se vuelve descriptible, y por eso un modelo lleva un ε\varepsilon en vez de fingir que la dispersión no existe. Volver a la Sección 1.3.

1.4 La asociación no es causa

La Sección 1.1 llamó al razonamiento causal el más difícil de los tres usos. Esta sección dice por qué. Una recta de regresión a través de datos observados mide asociación (Definición 1.5): te dice que YY tiende a ser más alto cuando XX es más alto. No te dice, por sí sola, que cambiar XX cambiaría YY. Esa brecha entre asociación y causa es la idea más importante de este capítulo, y una de las pocas que una carrera entera con datos seguirá poniéndote a prueba.

La ilustración clásica no necesita ecuaciones. A lo largo del verano, las ventas de helado y los ahogamientos suben y bajan juntos; su correlación es fuerte y real. Ninguna persona sensata concluye que el helado causa los ahogamientos, o que prohibir el helado salvaría a los nadadores. Una tercera variable, el clima caluroso, impulsa a ambos: el calor manda a la gente a comprar helado y, por separado, la manda al agua donde unos cuantos se ahogan. La Figure 11 dibuja la situación. El impulsor oculto se llama una variable de confusión o variable oculta (Definición 1.6), y siempre que hay una presente, la asociación entre XX y YY puede ser grande mientras el efecto causal de XX sobre YY es cero.

Un diagrama con una caja "clima caluroso (variable oculta Z)" arriba, flechas hacia abajo a dos cajas, "ventas de helado X" a la izquierda y "ahogamientos Y" a la derecha, y una flecha discontinua de doble punta entre X e Y etiquetada correlación fuerte pero sin flecha causal.

Figure 11:El clima caluroso (Z) causa tanto las ventas de helado (X) como los ahogamientos (Y), así que X e Y están fuertemente correlacionados aunque ninguno cause al otro. Una variable de confusión puede fabricar una asociación de la nada causal.

Esto es exactamente por qué el ejemplo salarial es difícil. Los hombres y las mujeres en los datos difieren no solo en el sexo, sino en la mezcla de rangos, disciplinas y años de servicio, y todos esos afectan el salario. El rango es una variable oculta para la brecha salarial cruda por sexo. Un análisis responsable tiene que mantener fijas las variables de confusión antes de que la brecha restante pueda leerse como algo sobre el sexo, e incluso entonces la lectura requiere cuidado. 11. Predictores categóricos e interacciones hace este trabajo; 16. Análisis de rutas y una mirada hacia adelante hace del razonamiento sobre efectos directos e indirectos su tema entero.

Dos cosas te ayudan a combatir la confusión, y la diferencia entre ellas organiza buena parte de la estadística.

Los datos observacionales (Definición 1.7) se recolectan observando el mundo tal como es. Galton no asignó estaturas a los padres; los ingenieros de Toluca no fijaron los tamaños de lote para estudiarlos; nadie eligió el sexo de los profesores. En los datos observacionales el predictor y las variables de confusión vienen enredados juntos, y ninguna cantidad de ajuste ingenioso los desenreda por completo. Puedes ajustar por las variables de confusión que pensaste medir, pero nunca por las que no.

Los datos experimentales se recolectan interviniendo. Si puedes asignar aleatoriamente el valor de XX, digamos lanzando una moneda para decidir el tratamiento de cada unidad, entonces en promedio los grupos de tratamiento coinciden en cada variable de confusión, medida o no, porque la aleatorización los equilibra. Por eso un experimento aleatorizado puede sostener una afirmación causal que los datos observacionales no pueden. La Figure 12 muestra el único cambio estructural que marca la diferencia. La mayoría de los datos que encontrarás después de este curso son observacionales, que es precisamente por qué la distinción entre asociación y causa merece el machaque que recibe aquí.

Dos diagramas uno al lado del otro. A la izquierda, etiquetado Observacional, una variable de confusión Z tiene flechas que apuntan hacia abajo tanto al predictor X como a la respuesta Y, y una flecha discontinua de doble punta entre X e Y está etiquetada enredado, ¿es X o Z? A la derecha, etiquetado Experimental, la flecha de Z a X está atenuada y tachada con una X roja etiquetada el lanzamiento de moneda corta esto, mientras una flecha sólida va de X a Y etiquetada limpio, solo X puede impulsar Y.

Figure 12:Los datos observacionales y experimentales difieren en una flecha. Cuando observas el mundo (izquierda), una variable de confusión Z alimenta tanto a X como a Y, así que su vínculo está enredado. Cuando asignas X al azar (derecha), el lanzamiento de moneda corta la flecha de Z hacia X, así que cualquier vínculo X-Y restante es causal.

Una disciplina más te protege tanto de la confusión como de la simple mala lectura: mira los datos antes de confiar en un resumen de ellos. La Figure 13 muestra cuatro pequeños conjuntos de datos construidos por el estadístico Frank Anscombe. Los cuatro tienen la misma media de XX, la misma media de YY, la misma correlación y la misma recta de regresión ajustada. En el papel son idénticos. Graficados, no podrían ser más diferentes.

Cuatro diagramas de dispersión en una cuadrícula de dos por dos, cada uno con la misma recta ajustada. El panel uno es una recta genuina con ruido, el panel dos es una curva suave, el panel tres es una recta ajustada con un valor atípico alto, y el panel cuatro tiene todos los puntos en un valor de x más un único punto muy a la derecha que fija la pendiente.

Figure 13:El cuarteto de Anscombe: cuatro conjuntos de datos con medias, varianzas, correlación y recta ajustada idénticas, y sin embargo cuatro formas distintas. Solo uno es una relación genuina de línea recta. Los números resumen no pueden distinguirlos, pero un gráfico de dos segundos sí.

1.5 Una breve historia, de Gauss al aprendizaje estadístico

La regresión no llegó de una sola vez. Creció a lo largo de dos siglos a medida que la gente seguía necesitando extraer una señal de mediciones con ruido, y las herramientas que usamos hoy son la respuesta acumulada. La Figure 14 marca los hitos.

Una línea de tiempo horizontal con siete eventos etiquetados: 1805 Legendre y Gauss mínimos cuadrados, 1886 Galton acuña regresión, 1896 Pearson correlación, 1925 Fisher ANOVA y verosimilitud y diseño de experimentos, 1972 Nelder y Wedderburn modelos lineales generalizados, 2010 el aprendizaje estadístico y el aprendizaje automático se vuelven de uso común, y 2023 la era de los LLM.

Figure 14:Dos siglos de regresión en siete pasos, desde los mínimos cuadrados para las órbitas planetarias hasta modelos que cualquiera puede ajustar ahora con una oración de código.

Mínimos cuadrados (alrededor de 1805). El método en el corazón de este libro se inventó para rastrear el cielo. Adrien-Marie Legendre publicó la receta de mínimos cuadrados en 1805, y Carl Friedrich Gauss, quien reclamó un uso anterior y aportó la teoría de probabilidad, la aplicó para predecir la órbita del planeta enano Ceres a partir de un puñado de lecturas telescópicas con ruido. El problema era el mismo que enfrenta la ingeniera de Toluca: muchas mediciones imperfectas, una recta subyacente, encontrar la recta que mejor se ajusta. 2. Regresión lineal simple deriva su respuesta desde cero.

La correlación y la palabra “regresión” (1886 a 1896). Galton, estudiando la herencia, nos dio la regresión a la media y las primeras rectas de regresión. Su colega más joven Karl Pearson convirtió las ideas de Galton en el coeficiente de correlación, la medida estandarizada de asociación que cubre 4. Correlación, y construyó buena parte de la maquinaria de la estadística moderna a su alrededor.

Fisher y el marco de la inferencia (décadas de 1920 y 1930). Ronald Fisher, trabajando en experimentos agrícolas, le dio a la regresión su columna inferencial: el análisis de varianza que divide la variación en piezas con nombre (3. Inferencia para la regresión lineal simple), la máxima verosimilitud como principio general para la estimación (2. Regresión lineal simple, 13. Regresión logística), y la teoría de los experimentos aleatorizados que fundamenta el razonamiento causal de la Sección 1.4. Buena parte de lo que un estadístico entiende por “significancia” se remonta a Fisher.

Modelos lineales generalizados (1972). Durante mucho tiempo la regresión significó una línea recta con ruido normal de varianza constante. Pero muchas respuestas no son así: resultados de sí o no, conteos, tasas. En 1972, John Nelder y Robert Wedderburn mostraron que la regresión lineal, la regresión logística para datos binarios, la regresión de Poisson para conteos y varias otras son todas casos especiales de un solo marco, el modelo lineal generalizado. 13. Regresión logística y 14. Regresión de Poisson y la idea del MLG construyen dos de estos y 14.6 Una familia: el modelo lineal generalizado muestra la idea unificadora.

Aprendizaje estadístico y aprendizaje automático (de la década de 1990 a hoy). A medida que las computadoras se abarataron, la misma idea central, ajustar una regla que predice YY a partir de XX y comprobarla con honestidad en datos nuevos, se expandió hacia un campo obsesionado con la predicción: validación cruzada, regularización, árboles y redes neuronales. La regresión es el cimiento sobre el que se construye este campo, y las ideas de sobreajuste y validación que lo dominan aparecen en este curso en 12. Multicolinealidad, selección de variables y validación. El capítulo más reciente de la historia es el que estás viviendo, y merece su propia sección.

1.6 Dónde se ubica la regresión hoy

Sería fácil pensar que la regresión es una reliquia pintoresca al lado de la inteligencia artificial moderna. Lo contrario es cierto: la regresión es en gran parte de lo que está hecha la IA moderna. La Figure 15 muestra cómo se anidan las piezas.

Cuatro cajas redondeadas anidadas. La más externa es el aprendizaje estadístico y la ciencia de datos, dentro de ella el aprendizaje supervisado, dentro de ese los modelos lineales generalizados, y en el centro la regresión lineal, etiquetada como mínimos cuadrados, el método que este curso enseña desde los cimientos.

Figure 15:La regresión lineal se ubica en el centro de un conjunto de campos anidados. Los modelos lineales generalizados la extienden a otras clases de respuesta; el aprendizaje automático supervisado la extiende a señales flexibles; y sigue siendo el último paso dentro de una red neuronal. Domina el centro y el resto tiene un lugar al que adherirse.

El aprendizaje automático supervisado, la rama de la IA que aprende a predecir una salida a partir de entradas, es regresión con la señal f(X)f(X) a la que se le permite ser mucho más flexible que una línea recta. Una red neuronal dedica la mayor parte de su esfuerzo a transformar entradas crudas en características útiles, pero su paso final es casi siempre una regresión lineal ordinaria o una regresión logística sobre esas características: el mismo b0+b1x1+b_0 + b_1 x_1 + \dots que ajustarás a mano en 2. Regresión lineal simple, sentado dentro de la máquina. Los modelos grandes de lenguaje, los sistemas detrás de los asistentes de IA modernos, se entrenan con una forma de este mismo juego de predicción jugado miles de millones de veces. El vocabulario cambia (“funciones de pérdida”, “descenso de gradiente”, “incrustaciones”), pero los mínimos cuadrados y la máxima verosimilitud, las dos ideas sobre las que se construye 2. Regresión lineal simple, están por debajo.

Esto tiene una consecuencia aguda para lo que vale la pena aprender, y es la tesis de este curso. Ajustar un modelo solía ser la parte difícil. Requería tablas, aritmética cuidadosa y una computadora central. Ahora cualquiera puede ajustar una regresión, un bosque aleatorio o una red neuronal en una línea de código, y un asistente de IA escribirá esa línea a pedido e incluso interpretará la salida por ti. La habilidad escasa ya no es ajustar un modelo. Es juzgarlo: saber si el modelo es apropiado, si sus supuestos se cumplen, si los datos pueden sostener la afirmación que se hace, si una variable de confusión está oculta, si la predicción de aspecto seguro es en realidad una extrapolación fuera del borde de toda experiencia, como lo fue la decisión del Challenger. Una máquina te dará una respuesta en segundos. Decidir si confiar en ella es trabajo humano, y es el trabajo que este libro entrena.

1.7 Un recorrido por el semestre

Aquí está el camino por delante. El libro enseña un proceso repetible, el flujo de trabajo de modelado que 2. Regresión lineal simple nombra por completo (El flujo de trabajo del modelado): PREGUNTAR una pregunta y obtener los datos, EXPLORAR con gráficos y resúmenes, AJUSTAR un modelo, COMPROBAR si se puede confiar en él, y USARLO para interpretar, predecir o decidir. Cada capítulo es un viaje alrededor de ese ciclo sobre un conjunto de datos real. La Figure 16 dibuja el ciclo para que puedas sostener el libro entero en una imagen.

Cinco cajas etiquetadas en una fila conectadas por flechas. PREGUNTAR, obtener los datos; EXPLORAR, gráficos y resúmenes; AJUSTAR, estimar el modelo; COMPROBAR, ¿podemos confiar en él?; USAR, interpretar, predecir, decidir. Una flecha curva roja discontinua regresa de COMPROBAR a EXPLORAR, etiquetada si la comprobación falla, vuelve atrás e inténtalo de nuevo.

Figure 16:El único flujo de trabajo que repite todo el curso: PREGUNTAR, EXPLORAR, AJUSTAR, COMPROBAR, USAR. La flecha discontinua es la parte honesta: cuando un modelo falla su comprobación, vuelves atrás e intentas de nuevo en lugar de empujar hacia adelante un modelo malo. Cada capítulo es un viaje alrededor de este ciclo.

Lo que sigue es la única pregunta que responde cada capítulo.

Parte I: La regresión desde los cimientos.

Parte II: El modelo lineal en forma matricial.

Parte III: Construir y comprobar modelos.

Parte IV: Regresión para otras clases de respuesta.

Parte V: Temas especiales (estudio autónomo guiado).

1.8 Cómo enseñarte a ti mismo con este libro

Este libro está escrito para que un estudiante que falta a clase pueda aprender un capítulo solo y aun así hacer la tarea. Unos cuantos hábitos hacen que eso funcione.

Lee en el orden en que está escrito el capítulo. Cada sección de concepto va primero la intuición, luego la fórmula, luego el mismo cálculo en R y en Python. La intuición es lo que hace que la fórmula se fije, así que no te saltes a los símbolos. Lee la viñeta inicial antes que nada; es la verdadera pregunta que el capítulo existe para responder.

Corre el código tú mismo, en ambos lenguajes si puedes. Cada ejemplo trabajado lee un CSV real de la carpeta data/ del libro y muestra salida real. Escríbelo, córrelo y cambia algo para ver qué pasa. R es el lenguaje principal de este curso, pero Python aparece a su lado en cada ejemplo porque probablemente lo usarás después de graduarte, y ver la misma idea dos veces la cementa.

Haz cada Inténtalo a medida que llegas a él. Cada uno es una tarea corta con una solución completa oculta en un desplegable justo debajo. Inténtalo con honestidad antes de abrir la solución; el pequeño esfuerzo es donde está el aprendizaje. Fíjate también en las cajas de Habilidad duradera: cada una nombra un hábito que vale más que cualquier fórmula individual.

Trabaja los problemas de práctica en orden. Vienen en bandas. La Banda A comprueba que entendiste las ideas; la Banda B (en capítulos posteriores) te pide derivar y probar; la Banda C te pide analizar datos reales en R o Python. Las respuestas a los problemas impares están en el Apéndice H, así que puedes calificarte. La promesa del libro es simple: un lector que hace cada Inténtalo y cada problema impar puede resolver los problemas pares y los exámenes.

Espera releer. No tienes que entender algo la primera vez que lo ves. Relee la intuición, corre el código, duérmete pensando en ello y regresa. La comprensión suele llegar en la segunda o tercera pasada. Eso es normal, y no es señal de que estés atrasado.

Antes del primer ejemplo trabajado del Capítulo 2 necesitarás R y Python instalados y funcionando. Las instrucciones completas de instalación, la lista de paquetes y una referencia función por función para cada capítulo están en Apéndice C (R) y Apéndice D (Python). Una ficha de datos para cada conjunto de datos del libro, incluidos los que conociste en este capítulo, está en Apéndice E.

1.9 Resumen del capítulo

Ya tienes el mapa. La regresión estudia cómo una respuesta depende de uno o más predictores, y sirve a tres metas distintas: describir una relación, predecir un resultado nuevo y razonar sobre la causa, en orden creciente de dificultad. Viste de dónde vino la palabra en las estaturas de Galton y qué significa la regresión a la media, tanto como una pendiente ajustada por debajo de uno como una trampa que disfraza la estadística simple de una historia. Aprendiste la anatomía compartida por todo modelo del libro, una señal sistemática más ruido aleatorio, y la diferencia entre un parámetro y su estimación. Viste por qué la asociación no es causa, cómo una variable de confusión fabrica un vínculo falso, y cómo los datos observacionales y experimentales difieren en lo que pueden probar. Ubicaste la regresión en su historia, desde las órbitas de Gauss hasta la inferencia de Fisher, al modelo lineal generalizado, al aprendizaje automático moderno, y viste por qué, ahora que cualquier modelo se puede ajustar en una línea, la habilidad escasa es juzgar modelos en lugar de ajustarlos. Y tienes un recorrido por los quince capítulos por delante.

Resultados clave de un vistazo.

ResultadoEnunciado o fórmulaVálido cuando
Modelo estadístico (Definición 1.3)Y=f(X)+εY = f(X) + \varepsilon: la respuesta es igual a la señal sistemática más el ruido aleatoriotodo modelo del libro
Regresión lineal simplef(X)=β0+β1Xf(X) = \beta_0 + \beta_1 X; la media de YY es una línea recta en XXse toma la señal como una recta
Parámetro frente a estimación (Definición 1.4)β0,β1\beta_0, \beta_1 son la verdad desconocida; b0,b1b_0, b_1 se calculan de los datossiempre
Tres usos de la regresióndescripción (una pendiente), predicción (un YY nuevo), razonamiento causal (una intervención)la confianza decrece a lo largo de los tres
Regresión a la mediala recta de Galton child^=22.6+0.64midparent\widehat{\text{child}} = 22.6 + 0.64 \cdot \text{midparent}; pendiente por debajo de 1dos mediciones correlacionadas de forma imperfecta
La asociación no es causa (Definición 1.5)que XX e YY se muevan juntos no tiene por qué significar que cambiar XX cambie YYcualquier dato observacional
Observacional frente a experimental (Definición 1.7)la asignación aleatoria equilibra las variables de confusión en promediolas afirmaciones causales necesitan un experimento o supuestos fuertes

Términos clave. regresión, respuesta, predictor, descripción, predicción, razonamiento causal, regresión a la media, modelo estadístico, parte sistemática (señal), parte aleatoria (error), parámetro, estimación, asociación, causa, variable de confusión (variable oculta), datos observacionales, datos experimentales, extrapolación, modelo lineal generalizado, aprendizaje automático supervisado, flujo de trabajo de modelado.

Ahora deberías poder:

Dónde encaja esto. Este capítulo es la etapa PREGUNTAR de todo el curso: enmarca las preguntas y la forma de pensar, y adelanta el flujo de trabajo que El flujo de trabajo del modelado nombrará por completo. Todo de aquí en adelante agrega herramientas. 2. Regresión lineal simple convierte la idea suelta de una “mejor recta” en una receta precisa y demostrable sobre los datos de Toluca (2.2 Mínimos cuadrados desde los primeros principios), y la maquinaria solo crece desde ahí. No necesitarás haber memorizado nada de este capítulo, pero si la diferencia entre descripción y predicción, entre asociación y causa, y entre un parámetro y una estimación te queda clara, el resto del libro se sentirá menos como una pila de fórmulas y más como una sola idea, extendida con cuidado.

1.10 Preguntas frecuentes

P1. ¿Es “regresión” lo mismo que “recta de mejor ajuste”? Para la mayor parte de este libro, sí: la parte sistemática es una línea recta y la regresión encuentra la mejor. Pero la palabra es más amplia. La regresión logística (13. Regresión logística) y la regresión de Poisson (14. Regresión de Poisson y la idea del MLG) ajustan reglas curvas para respuestas no continuas, y en el aprendizaje automático la señal ajustada puede ser muy flexible. Lo que las une a todas es la forma Y=f(X)+εY = f(X) + \varepsilon: estimar una parte sistemática, describir el ruido.

P2. Si la regresión solo muestra asociación, ¿por qué se usa para discutir sobre causas todo el tiempo? Porque con los datos correctos (idealmente un experimento aleatorizado) o los supuestos correctos (ajustando por las variables de confusión que puedes medir y defendiendo que has capturado las importantes), una asociación puede sostener una afirmación causal cuidadosa. El punto de la Sección 1.4 no es que la regresión nunca pueda hablar de la causa; es que lo hace solo con trabajo extra y honestidad extra, nunca de forma automática. 11. Predictores categóricos e interacciones y 16. Análisis de rutas y una mirada hacia adelante muestran cómo se ve ese trabajo.

P3. ¿Por qué enseñar esto cuando una IA puede ajustar cualquier modelo en una línea? Precisamente porque puede. Cuando ajustar es gratis, el valor se traslada al juicio: elegir el modelo correcto, comprobar sus supuestos, detectar la variable de confusión, atrapar la extrapolación y saber cuándo la salida segura está equivocada. Esas son las habilidades que este curso califica, y son las habilidades que te hacen útil al lado de una máquina en lugar de reemplazable por una.

P4. ¿De verdad necesito tanto R como Python? R es obligatorio (es el lenguaje principal del curso y un requisito del catálogo), y cada ejemplo está en R. Python corre junto a él porque es lo que usa buena parte de la industria, y ver el análisis idéntico en dos lenguajes hace que el concepto, y no la sintaxis, sea lo que recuerdas. Si vas apretado de tiempo, sigue R de cerca y trata a Python como un extra, pero sí instala ambos.

P5. No he tomado álgebra lineal. ¿Aún puedo hacer este curso? Sí. El Capítulo 6 construye cada pieza de álgebra matricial que usa el libro, desde la definición de una matriz hacia arriba, atada en cada paso a un uso de regresión. Los capítulos 2 al 5 no usan matrices en absoluto. Si has tomado álgebra lineal, el Capítulo 6 se leerá como un repaso; si no, está escrito para enseñarte.

P6. ¿Cuál es la diferencia entre el error ε\varepsilon y el residuo? El error ε\varepsilon es la brecha entre una observación y la recta verdadera, que nunca vemos porque nunca conocemos los parámetros verdaderos. El residuo es la brecha entre una observación y nuestra recta ajustada, que sí podemos calcular. Los residuos son nuestras estimaciones visibles de los errores invisibles, y el Capítulo 2 hace precisa la distinción. Importa porque usamos los residuos para estimar el tamaño del ruido.

P7. ¿Es la regresión a la media lo mismo que “las cosas siempre se emparejan”? No, y este es un enredo común. La regresión a la media trata de que a los extremos les siguen valores menos extremos, porque los extremos suelen ser en parte habilidad y en parte suerte, y la suerte no se repite. No dice que la próxima medición de una persona alta será promedio, ni que a un buen equipo le toca una derrota. Es un enunciado sobre el promedio de un grupo seleccionado por ser extremo, nada más.

1.11 Problemas de práctica

  1. (A) En tus propias palabras, ¿qué hace la regresión? Responde en dos oraciones, usando las palabras “respuesta” y “predictor”.

  2. (A) Nombra los tres usos de la regresión discutidos en la Sección 1.1, y da un ejemplo de una línea de cada uno que no esté en el capítulo.

  3. (A) Para cada pregunta, di si es descripción, predicción o razonamiento causal: (a) “¿Cuánto sube la presión arterial promedio por año de edad en esta clínica?” (b) “Si subimos el precio un dólar, ¿cuántas unidades menos venderemos?” (c) “¿Qué ventas debemos esperar el próximo trimestre dado nuestro presupuesto de anuncios?”

  4. (A) Explica la diferencia entre un parámetro (β1\beta_1) y una estimación (b1b_1) en una o dos oraciones. ¿Por qué nunca podemos conocer β1\beta_1 exactamente?

  5. (A) Escribe la anatomía general de un modelo estadístico, Y=f(X)+εY = f(X) + \varepsilon, y explica en palabras simples qué representa cada una de las dos piezas.

  6. (A) Un compañero dice que el término de error ε\varepsilon significa que el modelo cometió un error y que un mejor modelo lo eliminaría. Corrige el malentendido.

  7. (A) Explica la “regresión a la media” en tus propias palabras, y da un ejemplo cotidiano distinto de las estaturas o los deportes.

  8. (A) La pendiente ajustada de Galton del hijo sobre la estatura media de los padres es de aproximadamente 0.64. ¿Qué habría significado una pendiente de exactamente 1? ¿Qué habría significado una pendiente de 0?

  9. (A) ¿Por qué una diferencia cruda en el salario promedio entre dos grupos no es, por sí sola, evidencia de un pago desigual? Nombra una variable de confusión y explica su función.

  10. (A) Define “variable de confusión” y dibuja (en palabras o en un boceto) el diagrama del helado y los ahogamientos, etiquetando las flechas causales.

  11. (A) Explica la diferencia entre datos observacionales y experimentales, y por qué la asignación aleatoria ayuda a establecer la causa.

  12. (A) Los cuatro conjuntos de datos de Anscombe comparten la misma media, varianza, correlación y recta ajustada. ¿Cuál es la única lección que Anscombe quería que sacaras de esto, y qué acción de una palabra recomienda antes de confiar en cualquier resumen?

  13. (A) Da un ejemplo de una correlación fuerte entre dos variables que estés seguro de que no es causal, y nombra la variable oculta probable.

  14. (A) En una oración cada uno, enuncia para qué se inventó originalmente el método de mínimos cuadrados (hacia 1805) y quién le dio a la “regresión” su nombre.

  15. (A) El capítulo afirma que la regresión es “el núcleo sobre el que se construye el aprendizaje automático moderno”. Explica qué tiene que ver el paso final de una red neuronal con la regresión de este curso.

  16. (A) Enuncia la tesis del curso sobre la era de la IA en tus propias palabras: ¿qué habilidad se ha vuelto escasa, y por qué?

  17. (A) Te entregan una predicción de aspecto seguro de un asistente de IA. Enumera cuatro preguntas que harías antes de confiar en ella (apóyate en la caja “Juzga un modelo que no ajustaste”).

  18. (A) ¿Por qué el ejemplo del Challenger ilustra el peligro de la extrapolación? ¿Qué tenía de especial el lanzamiento a 31 grados respecto de los datos?

  19. (A) Nombra las cinco etapas del flujo de trabajo de modelado en orden, y da una descripción de una frase de cada una.

  20. (A) Para cada pregunta de capítulo de abajo, nombra el capítulo (2 al 16) que la responde: (a) cuáles de trece medidas corporales enredadas conservar; (b) si una pendiente de solo trece pateadores es real; (c) cómo pronosticar la demanda mensual de aerolínea del próximo año.

  21. (A) Explica la diferencia entre el intervalo de confianza para una respuesta media y el intervalo de predicción para una observación nueva, usando la Figure 1 como referencia. ¿Cuál es más ancho, y por qué?

  22. (A) Un titular dice “las personas que beben vino tinto viven más, así que bebe vino tinto”. Identifica la afirmación causal, nombra una variable de confusión plausible, y di qué tipo de estudio se necesitaría para sostener el consejo.

  23. (A) ¿Por qué este libro muestra cada ejemplo tanto en R como en Python? Da dos razones distintas de la Sección 1.8.

  24. (A) Explica el “bajón del segundo año” (Inténtalo 1.2) como regresión a la media, y predice qué verías si en cambio siguieras a los peores novatos en su segundo año.

  25. (C) Lee galton_heights.csv en R o Python. Ajusta la recta que predice childHeight a partir de midparentHeight, reporta la pendiente y confirma que está por debajo de 1. En una oración, conecta el número con la regresión a la media.

  26. (C) Usando galton_heights.csv, predice la estatura del hijo para una estatura media de los padres de 66 pulgadas y de 72 pulgadas. Confirma que la predicción más alta está más cerca de la estatura media general del hijo (unas 66.7 pulgadas) que 72, ilustrando el tirón hacia el centro.

  27. (C) Lee anscombe.csv y reproduce la tabla resumen del Ejemplo 1.4 para los cuatro pares x-y (medias, varianza de x, correlación y recta ajustada). Luego haz los cuatro diagramas de dispersión. ¿Cuál de los cuatro es una relación genuina de línea recta, y cuál tiene su pendiente fijada por un solo punto?

  28. (C) Lee orings.csv. Reporta el número de vuelos, la temperatura de lanzamiento más fría en los datos y el número total de incidentes de daño. Explica por qué predecir el riesgo de daño a 31 grados es una extrapolación, refiriéndote a la temperatura más fría que encontraste.

1.12 Práctica de examen

Los problemas de arriba comprueban que puedes recordar y aplicar las ideas. Los exámenes piden algo más difícil: explicar tu razonamiento en oraciones completas, juzgar una afirmación que hizo otra persona, y leer salida de software real en contexto. Las cinco preguntas de aquí están escritas en ese estilo de examen. Cada una quiere prosa, no una palabra o un número aislado. Intenta una respuesta escrita completa antes de abrir la respuesta modelo, y compara no solo la conclusión sino el razonamiento. Un evaluador da la calificación completa por el razonamiento.

PE 1.1. Una recta, tres pedidos. Una analista de marketing ajusta una sola recta de mínimos cuadrados de las ventas mensuales (en miles de dólares) sobre el gasto mensual en publicidad (también en miles). Luego usa esa única recta para tres pedidos. Le dice al equipo de finanzas que cada mil dólares extra de publicidad va con unos cuatro mil dólares más en ventas. Pronostica las ventas del próximo mes a partir del presupuesto ya aprobado para el próximo mes. Y le aconseja al director general que subir el presupuesto de anuncios en diez mil dólares subirá las ventas en unos cuarenta mil dólares. Explica por qué la misma recta ajustada puede servir a los tres pedidos, y sin embargo la confianza a la que la analista tiene derecho no es la misma para cada uno. Ordena los tres pedidos de más a menos confiable y defiende el orden.

PE 1.2. Una afirmación sobre la regresión a la media. Un estudiante escribe: “La regresión a la media prueba que los extremos desaparecen con el tiempo. Así que un padre muy alto debería esperar un hijo de estatura cerca del promedio, y un equipo que acaba de ganar el campeonato le toca una temporada perdedora el año siguiente.” Evalúa la afirmación. Enuncia con precisión qué afirma y qué no afirma la regresión a la media, y corrige los dos errores específicos.

PE 1.3. Interpretar una recta ajustada en contexto. Los datos de Galton sobre 934 hijos se usan para ajustar la estatura del hijo (pulgadas) sobre la estatura media de los padres (pulgadas). Aquí está la salida de R, luego los coeficientes de Python, luego las estaturas predichas del hijo en tres estaturas medias de los padres. La estatura media del hijo en los datos es de 66.75 pulgadas.

Coefficients:
                Estimate Std. Error t value Pr(>|t|)
(Intercept)     22.63624    4.26511   5.307 1.39e-07 ***
midparentHeight  0.63736    0.06161  10.345  < 2e-16 ***
---
Residual standard error: 3.392 on 932 degrees of freedom
Multiple R-squared:  0.103,	Adjusted R-squared:  0.102
Intercept          22.636241
midparentHeight     0.637361

predicted child height at midparent = 64, 68, 72:
   63.42734   65.97678   68.52623

(a) Interpreta la pendiente 0.637 en las unidades de este problema. (b) Explica por qué no deberías leer el intercepto 22.64 como “se predice que un hijo cuyos padres promedian cero pulgadas mide 22.64 pulgadas”. (c) Usando los tres valores predichos y la estatura media del hijo de 66.75 pulgadas, explica cómo las predicciones en estaturas medias de los padres de 64 y 72 pulgadas ilustran la regresión a la media. (d) Un compañero dice que el bajo R2R^2 de 0.103 significa que la regresión está mal y debería descartarse. Responde.

PE 1.4. La brecha salarial: qué cambiaría si. Los datos del decano muestran que los hombres ganan unos $14,088\$14{,}088 más al año que las mujeres, en promedio. Un miembro del consejo lee esta brecha cruda como prueba de que la universidad paga de menos a las mujeres. Para cada cambio de abajo, di qué le haría a la fuerza de una lectura causal de la brecha, y por qué. (a) La analista reajusta manteniendo fijos el rango, la disciplina y los años de servicio, y la brecha se encoge a una cantidad pequeña. (b) Incluso después de ese ajuste, alguna variable que nadie midió (digamos, ofertas de trabajo externas específicas del campo) todavía difiere entre los dos grupos. (c) Imagina, hipotéticamente, que el sexo se hubiera podido asignar aleatoriamente al profesorado. Cierra con una oración sobre por qué los datos salariales observacionales rara vez pueden resolver por sí solos la pregunta causal.

PE 1.5. El lanzamiento del Challenger: leer una figura. Consulta la Figure 2, los 23 vuelos del transbordador anteriores al Challenger. Todo vuelo registrado se lanzó a 53 grados Fahrenheit o más cálido, y el lanzamiento en discusión se pronosticó a unos 31 grados. (a) Usando la figura, explica en contexto por qué pronosticar el daño de los anillos a 31 grados es una extrapolación, y por qué eso hace poco confiable la predicción incluso cuando una curva ajustada reporta un número de aspecto seguro. (b) ¿Qué cambiaría sobre la confiabilidad de la predicción a 31 grados si el vuelo anterior más frío hubiera sido a 30 grados en lugar de 53? (c) Un gerente dice: “La recta ajustada ya da una estimación de daño a 31 grados, así que hemos tenido en cuenta el frío.” Evalúa esa afirmación.

Juego del capítulo