13. Regresión logística¶
La noche del 27 de enero de 1986, ingenieros de Morton Thiokol y de la NASA discutían en una llamada de conferencia si debían lanzar el transbordador espacial Challenger a la mañana siguiente. El pronóstico para Cabo Cañaveral era frío, cerca del punto de congelación, más frío que cualquier lanzamiento anterior. La preocupación eran las juntas tóricas de goma (O-rings) que sellaban las uniones de los cohetes aceleradores sólidos. Con el frío la goma se endurece, y una junta tórica rígida podría no sellar a tiempo para contener el gas ardiente. Los ingenieros tenían datos de 23 vuelos anteriores: para cada uno, la temperatura en el lanzamiento y el número de juntas tóricas, de seis, que mostraron daño por calor después.
Figure 1 muestra esos datos. El daño ocurrió tanto en vuelos cálidos como fríos, pero los lanzamientos más fríos cargaron los peores incidentes, y el lanzamiento en discusión sería mucho más frío que cualquier cosa en el registro. Esa es la parte difícil. Todo vuelo que había volado alguna vez lo hizo a 53 grados Fahrenheit o más cálido. La temperatura de lanzamiento pronosticada era de unos 31 grados, fuera del borde izquierdo de toda la experiencia. Para decir algo sobre el riesgo a 31 grados, hay que extender un patrón más allá del último punto de datos, que es exactamente el movimiento que un estadístico está entrenado para desconfiar.

Figure 1:Los 23 vuelos anteriores al Challenger. El daño fue peor en los lanzamientos más fríos, y la decisión de lanzamiento a 31 grados (línea discontinua) quedó muy por debajo de cualquier temperatura a la que el programa había volado, así que juzgar su riesgo significa extrapolar.
La respuesta aquí no es un número como horas de trabajo o tasa de ahorro. Está más cerca de un sí o no: ¿falló una junta tórica o no? La regresión de recta, la herramienta de los últimos once capítulos, está construida para una respuesta continua y se rompe de maneras específicas cuando el resultado es binario. Este capítulo construye la herramienta correcta. Aprenderás el modelo de regresión logística, los momios y el logaritmo de los momios que lo hacen lineal, cómo ajustarlo por máxima verosimilitud cuando ninguna fórmula da las estimaciones, cómo leer sus coeficientes como razones de momios sin los errores habituales, cómo probarlos, y cómo juzgar qué tan bien el modelo separa los dos resultados. Al terminar podrás poner un número al riesgo sobre el que discutían los ingenieros del Challenger, y decir honestamente cuánto confiar en él.
13.1 Por qué una recta falla, y qué usar en su lugar¶
Intuición¶
Empecemos con lo que sale mal. Supón que codificas la respuesta como para un resultado positivo (una junta tórica dañada, una prueba de diabetes positiva) y en caso contrario, y ajustas la recta ordinaria . Tres cosas se rompen.
Primero, la recta ajustada no tiene cota. Una recta sigue subiendo a medida que crece, así que con el tiempo predice probabilidades por encima de 1 y, en el otro sentido, por debajo de 0. Figure 2 muestra la recta de mínimos cuadrados a través de los datos de diabetes deslizándose directamente fuera del rango donde una probabilidad tiene que vivir.
Segundo, la dispersión no es constante. Una respuesta tiene varianza , donde es la probabilidad de que . Esa varianza es mayor cerca de y se encoge hacia cero cuando se acerca a 0 o a 1, la parábola invertida de Figure 3. Una moneda cerca de 50-50 es la más difícil de predecir, así que su resultado es el más variable; una moneda que casi siempre cae cara es casi una certeza, así que apenas varía. La dispersión queda fijada por la media. Así que el supuesto de varianza constante detrás de los mínimos cuadrados (2.1 El modelo de regresión lineal simple) es falso por construcción, y la ponderación que lo arreglaría cambia con la media, una idea que vimos en los mínimos cuadrados ponderados (10.4 Mínimos cuadrados ponderados).
Tercero, los errores no pueden ser normales. Si solo es alguna vez 0 o 1, entonces para un dado el error toma solo dos valores, así que el modelo de error normal que justificó nuestra inferencia y simplemente no aplica.

Figure 2:La recta de mínimos cuadrados (roja discontinua) sale del rango en el que una probabilidad debe permanecer, cayendo por debajo de 0 y subiendo por encima de 1. La curva logística (azul) se dobla para caber dentro de la banda.

Figure 3:La varianza de un resultado de sí o no no es una constante libre: es igual a , con su máximo en y anulándose en ambos extremos. Como la dispersión está soldada a la media, el supuesto de varianza constante de los mínimos cuadrados no puede cumplirse para una respuesta binaria.
La solución es modelar la probabilidad directamente y doblar la recta para que nunca pueda salir de . La curva es la curva logística en forma de S de la figura.
De la probabilidad a los momios al logaritmo de los momios¶
El puente son los momios (Definición 13.1).
Una probabilidad de 0.5 son momios de 1 (dinero parejo). Una probabilidad de 0.75 son momios de 3 (tres a uno). A medida que sube hacia 1 los momios se disparan al infinito, y a medida que baja hacia 0 los momios caen hacia 0 pero nunca se vuelven negativos. Figure 4 dibuja este mapeo. Los momios estiran la escala acotada de probabilidad sobre la semirrecta .

Figure 4:Los momios como función de la probabilidad. Pasos iguales en probabilidad no son pasos iguales en momios: de 0.5 a 0.75 los momios se triplican, pero de 0.75 a 0.9 se triplican de nuevo, así que la escala de momios se expande a medida que te acercas a la certeza.
Dando un paso más, el logaritmo de los momios o logit (Definición 13.2) es el logaritmo natural de los momios:
En palabras: el logit es el logaritmo de los momios. El logaritmo envía sobre toda la recta real , el mismo rango que puede tomar un predictor lineal . Ese es todo el truco. No podemos igualar una probabilidad a una recta, porque una está acotada y la otra no, pero sí podemos igualar el logit de la probabilidad a una recta.
El modelo de regresión logística¶
El modelo de regresión logística (Definición 13.3) para una respuesta binaria dice que el logaritmo de los momios es lineal en los predictores:
donde es la probabilidad de que el caso tenga un resultado positivo, las son los parámetros de regresión (con de ellos contando el intercepto), y son los predictores del caso . Escribiendo para el predictor lineal, resolvemos la ecuación del logit para y obtenemos el modelo en la escala de probabilidad:
En palabras: la probabilidad es el predictor lineal pasado a través de la función logística , la curva en S de Figure 5. La función está comprimida para quedar estrictamente entre 0 y 1, así que sin importar cuáles sean los coeficientes, la probabilidad predicha es siempre una probabilidad válida.

Figure 5:Izquierda: la función logística convierte cualquier predictor lineal en una probabilidad entre 0 y 1. Derecha: en la escala del logaritmo de los momios la misma relación es una línea recta, y por eso la regresión logística es un modelo lineal disfrazado.
Los dos vínculos en el término modelo lineal generalizado son visibles aquí. Hay una parte aleatoria, siendo 0 o 1 con probabilidad , y una parte sistemática, el predictor lineal , unidas por la función de enlace logit que mapea la media sobre la escala lineal. La regresión ordinaria es la misma imagen con el enlace identidad y una respuesta normal; el Capítulo 14 hace explícita la familia y añade el miembro de Poisson (14.6 Una familia: el modelo lineal generalizado).
R y Python¶
Para los datos de las juntas tóricas la respuesta está agrupada: cada vuelo aporta seis juntas
tóricas, de las cuales resultaron dañadas. Eso es un conteo binomial, y la regresión
logística lo maneja con la misma maquinaria, modelando la probabilidad de que una sola
junta tórica esté dañada a la temperatura . En R pasas la respuesta de dos columnas
cbind(successes, failures) a glm con family = binomial; en Python le das a statsmodels los dos
conteos a la izquierda de la fórmula.

Figure 6:La curva logística ajustada extendida hasta la temperatura de lanzamiento. A 31 grados (punto rojo, región de extrapolación sombreada) el modelo predice una probabilidad de cerca de 0.99 de daño a cualquier junta tórica dada.
Ese 0.99 es más fácil de sopesar con honestidad una vez que has recorrido la curva hasta allí tú mismo.
Un deslizador mueve la temperatura de lanzamiento a lo largo de la curva ajustada a través de los 23 vuelos. Los valores dan la probabilidad ajustada, los momios, el número esperado de anillos dañados de seis, y si alguna vez se lanzó un vuelo con ese frío.
Qué observar. Dentro de los datos la curva es suave, pero en cuanto cruzas los 53 grados hacia la franja sombreada la probabilidad ajustada sube de 0.550 a 0.993 sin ninguna observación debajo. Prueba esto. Deja el deslizador en 31 grados, lee la etiqueta “ninguna: extrapolando”, y pregunta qué tendría que seguir siendo cierto en el mundo para que ese número se sostenga. Volver a la Sección 13.1.
13.2 Ajuste por máxima verosimilitud¶
Intuición¶
En la regresión simple teníamos fórmulas: y . La regresión logística no tiene tal forma cerrada. La razón es la curva en S: la probabilidad es una función no lineal de los coeficientes, así que igualar las derivadas a cero da ecuaciones que no puedes resolver con álgebra. En su lugar elegimos los coeficientes que hacen que los datos observados sean lo más probables, el principio de máxima verosimilitud que encontramos por primera vez para el modelo normal en el Capítulo 2, y los hallamos escalando la colina de verosimilitud numéricamente.
La verosimilitud y la log-verosimilitud¶
Sea el caso con ensayos y éxitos (para una respuesta binaria simple y ; para las juntas tóricas ). Dadas las probabilidades , los éxitos son conteos binomiales independientes, así que la verosimilitud, la probabilidad de los datos observados como función de los coeficientes, es
donde cada depende de a través del predictor lineal . En palabras: la verosimilitud multiplica entre sí, a través de todos los casos, la probabilidad binomial de ver exactamente los éxitos que observamos, así que valores más grandes apuntan a coeficientes que los datos favorecen. Tomar logaritmos convierte el producto en una suma, la log-verosimilitud:
donde agrupa los coeficientes binomiales , que no involucran a y por lo tanto no afectan dónde queda el máximo. En palabras: la log-verosimilitud premia a los coeficientes que ponen alta probabilidad en los éxitos que vimos y alta no-probabilidad en los fracasos que vimos.
Las ecuaciones de puntaje¶
Demostración. Queremos el que maximiza , así que diferenciamos e igualamos el resultado a cero. Dos hechos sobre el enlace logístico hacen que el álgebra se colapse. Primero, a partir de ,
Sustituyendo estos en y agrupando términos,
Segundo, diferencia con respecto a para obtener exactamente . Usando la regla de la cadena con (el valor del -ésimo predictor para el caso , con para el intercepto),
Igualar las derivadas parciales a cero da las ecuaciones de puntaje. Apilándolas con la matriz de diseño (filas ), el vector de medias ajustadas con entradas , y el vector de respuesta ,
En palabras: en la estimación de máxima verosimilitud, cada predictor es ortogonal a los residuos , exactamente la condición que las ecuaciones normales de mínimos cuadrados impusieron en 7.1 El modelo y los mínimos cuadrados en forma matricial. La diferencia es que aquí se dobla a través del enlace logístico, así que las ecuaciones son no lineales en y no pueden resolverse en forma cerrada.
Newton-Raphson e IRLS¶
Demostración. Para resolver usamos el método de Newton, que necesita la matriz de segundas derivadas. Diferenciando el puntaje una vez más, y usando ,
así que el hessiano es con la matriz diagonal de pesos . Cada peso es la varianza de , mayor para los casos cercanos a y pequeña para los casos de los que el modelo ya está seguro. Un paso de Newton desde una estimación actual es
con , evaluadas en . Ahora la parte elegante. Define la respuesta de trabajo . Entonces
usando . Multiplicar el paso de Newton por muestra que es equivalente a
Esa es la fórmula para un ajuste de mínimos cuadrados ponderados de la respuesta de trabajo sobre con pesos (10.4 Mínimos cuadrados ponderados). Como y cambian cada vez que se actualiza, recalculamos y reajustamos, y por eso el método se llama mínimos cuadrados reponderados iterativamente (IRLS). Partiendo de cualquier estimación razonable, las iteraciones escalan la log-verosimilitud cóncava hasta su único máximo.
R y Python¶
Vale la pena hacer la pieza central a mano una vez, para que IRLS deje de ser una caja negra dentro
de glm.

Figure 8:IRLS converge rápido. La devianza (izquierda) se colapsa a su mínimo y el coeficiente de temperatura (derecha) alcanza su valor de máxima verosimilitud en unos cinco pasos, porque la log-verosimilitud es cóncava con un único pico.
IRLS sube por la log-verosimilitud en seis pasadas; súbela a mano una vez y el algoritmo deja de ser una caja negra.
Dos deslizadores fijan y para diez observaciones binarias en diez dosis. El valor de la log-verosimilitud califica cada ajuste que pruebas, y es exactamente la cantidad que IRLS está escalando.
Qué observar. La log-verosimilitud siempre es negativa y tiene un solo pico, así que cualquier movimiento fuera del mejor ajuste te cuesta algo, que es la concavidad en la que se apoyó la demostración. Prueba esto. Lleva la log-verosimilitud tan cerca de cero como puedas a mano, luego pon y observa cómo la curva S se aplana y la razón de momios cae a 1. Volver a la Sección 13.2.
13.3 Leer los coeficientes como razones de momios¶
Intuición¶
Una pendiente en la regresión ordinaria es fácil de decir en voz alta: una unidad más de agrega a la respuesta predicha. La pendiente logística no es eso, y decirlo de esa manera es el error más común en la regresión logística aplicada. El coeficiente vive en la escala del logaritmo de los momios, así que antes de interpretarlo tenemos que deshacer el logaritmo.
Aquí va primero la lectura incorrecta, porque la escucharás constantemente. Para el modelo de diabetes de abajo, el coeficiente de glucosa es de cerca de 0.04. La frase tentadora es “cada unidad extra de glucosa eleva la probabilidad de una prueba positiva en 0.04”. Eso está mal dos veces. El coeficiente no es un cambio en probabilidad en absoluto, y el efecto sobre la probabilidad ni siquiera es constante: depende de dónde empieces en la curva en S, minúsculo en las colas planas y mayor en el centro empinado. Lo que es constante es el efecto sobre los momios. Figure 10 hace visible la separación: un paso fijo a lo largo de la curva da tres saltos de probabilidad diferentes pero siempre el mismo multiplicador de momios.
Fórmula¶
Exponencia el coeficiente. Como , subir en una unidad cambia el logaritmo de los momios en , así que multiplica los momios por :
La cantidad es la razón de momios (Definición 13.6) para un aumento de una unidad en . En palabras: un aumento de una unidad en multiplica los momios de un resultado positivo por , cualesquiera que fueran los momios iniciales. Una razón de momios de 1 significa que no hay efecto; por encima de 1 los momios suben, por debajo de 1 bajan. Esta es la misma lógica de “los logaritmos lo hacen multiplicativo” que la respuesta transformada por logaritmo en 10.2 La transformación logarítmica y la lectura de sus coeficientes, trasladada a la escala de los momios. Para un paso de unidades la razón de momios es , que es como reportas un efecto por 10 unidades o por década de edad.

Figure 10:El mismo paso de una unidad multiplica los momios por el mismo factor fijo en todas partes (aquí cerca de 2.72), pero el salto en la probabilidad es grande en el centro empinado y pequeño en las colas planas. Por eso la razón de momios es un solo número honesto pero “el cambio en la probabilidad” no lo es.
R y Python¶
Figure 11 muestra el ajuste de un solo predictor. La probabilidad sube suavemente con la glucosa, empinadamente a través del centro del rango y aplanándose en ambos extremos, la curva en S haciendo su trabajo.

Figure 11:El ajuste logístico de un solo predictor a los datos Pima. La probabilidad de una prueba positiva sube con la glucosa, pero el fuerte traslape de las dos bandas de resultado advierte que la glucosa sola no separará limpiamente los positivos de los negativos.
La separación entre una razón de momios constante y un cambio de probabilidad que se mueve vale la pena verla moverse bajo tu dedo.
La curva es el modelo ajustado de glucosa . Un deslizador fija dónde empieza el paso, el otro fija su tamaño , y los valores dan ambas probabilidades ajustadas, su diferencia, y la razón de momios .
Qué observar. Deja en 40 y desliza el punto de partida: el cambio de probabilidad va de unos 0.12 en glucosa 60 hasta pasar de 0.33 cerca de glucosa 100 y vuelve a bajar, mientras que la razón de momios nunca abandona 5.080. Prueba esto. Busca la glucosa inicial con el mayor salto de probabilidad, y nota que está en el centro empinado de la curva S, nunca en una cola. Volver a la Sección 13.3.
13.4 Probar coeficientes: Wald y razón de verosimilitud¶
Intuición¶
La primera sección ajustó el modelo; la siguiente pregunta obvia es cuáles predictores están cumpliendo su parte. Hay dos pruebas estándar, y responden la misma pregunta por rutas diferentes. La prueba de Wald pregunta a cuántos errores estándar de cero se sitúa un coeficiente, usando solo el modelo ajustado. La prueba de razón de verosimilitud pregunta cuánto empeora el ajuste cuando eliminas el predictor y reajustas, comparando dos modelos anidados de la manera en que la prueba lineal general los comparó para la regresión ordinaria (8.4 La prueba lineal general).
Fórmula¶
Para la prueba de Wald de , el estadístico es
En palabras: el estadístico de Wald cuenta a cuántos errores estándar de cero se sitúa la estimación , y bajo la nula esa distancia sigue una curva normal estándar. Aquí es el error estándar impreso por el ajuste. Puedes comparar con una chi-cuadrada con un grado de libertad en su lugar, lo que da la misma prueba. El intervalo de confianza de Wald para es , y exponenciar sus extremos da un intervalo de confianza para la razón de momios. Estos errores estándar y la referencia normal son aproximaciones de muestra grande, exactas solo cuando . Con una muestra pequeña o un predictor casi perfecto pueden engañar.
La prueba de razón de verosimilitud usa la devianza (Definición 13.7). Para un modelo ajustado con log-verosimilitud maximizada , la devianza es
donde es la log-verosimilitud del modelo saturado que ajusta cada observación perfectamente (), y son los conteos ajustados.
En palabras: la devianza mide qué tan lejos se sitúa el modelo ajustado de un ajuste perfecto, siendo mejor cuanto menor; es el sustituto logístico de la suma de cuadrados de los residuos. Para comparar un modelo completo con un modelo reducido anidado que elimina predictores, el estadístico de razón de verosimilitud es el aumento en la devianza,
con el número de coeficientes igualados a cero. El caso especial que compara el modelo completo con el modelo de solo intercepto usa la devianza nula como y prueba si algún predictor importa en absoluto.
R y Python¶
Figure 13 grafica las razones de momios y sus intervalos en escala logarítmica, cada una reescalada a un paso interpretable. Un intervalo que supera la línea vertical en 1 señala un predictor distinguible de ningún efecto; el intervalo de la edad la abarca.

Figure 13:Razones de momios por paso interpretable para el modelo Pima, con intervalos de Wald de 95 por ciento en escala logarítmica. El intervalo de cada predictor supera la línea de ningún efecto en 1 excepto la edad, coincidiendo con su prueba no significativa.
Las pruebas de Wald y de razón de verosimilitud suelen coincidir, pero no siempre. La prueba de razón de verosimilitud es en general la más confiable de las dos, porque usa la forma real de la log-verosimilitud en lugar de una sola aproximación cuadrática en la estimación. En el caso incómodo de un coeficiente muy grande (un predictor que casi separa los dos resultados), el error estándar de Wald puede inflarse y empujar su hacia cero, ocultando un efecto fuerte. La prueba de razón de verosimilitud no sufre esa falla. Cuando las dos discrepan, confía en la prueba de razón de verosimilitud. Figure 14 muestra la razón en una sola imagen: la prueba de Wald reemplaza la log-verosimilitud verdadera con una parábola simétrica igualada en el pico, y cuando la curva verdadera es asimétrica la parábola se aleja de ella, así que las dos pruebas miden caídas diferentes hacia la nula.

Figure 14:La prueba de Wald juzga un coeficiente por una parábola simétrica ajustada en el pico de la log-verosimilitud, mientras que la prueba de razón de verosimilitud usa la curva verdadera. Cuando la curva es sesgada, las dos se separan lejos del pico y pueden alcanzar la nula a alturas diferentes, y por eso pueden discrepar y por eso la prueba de razón de verosimilitud es la de confiar.
13.5 ¿Qué tan bueno es el ajuste? Clasificación, ROC y verificaciones de datos¶
Intuición¶
Un modelo puede tener coeficientes significativos y aun así clasificar mal, así que el último paso es preguntar qué tan bien separan realmente las probabilidades ajustadas los dos resultados. Lo mantenemos ligero: una tabla de clasificación, una curva ROC y, primero, una mirada a si los datos merecen confianza en absoluto.
Los datos primero: los ceros disfrazados¶
Recuerda los ceros imposibles de 13.3 Leer los coeficientes como razones de momios. Figure 15 los cuenta. La insulina
sérica es cero para 374 de 768 mujeres y el grosor del pliegue cutáneo para 227; una persona viva no
tiene ninguno de los dos. Estos son valores faltantes registrados como ceros, y un modelo que se los
traga enteros estimará, por ejemplo, una pendiente de insulina sin sentido impulsada por un pico de
ceros falsos. Por eso pusimos los ceros de glucosa e IMC en NA antes de ajustar y por eso dejamos
la insulina y el tríceps completamente fuera del modelo. La lección se generaliza: mira tus
predictores antes de confiar en cualquier coeficiente, porque el software ajustará lo que sea que le
des.

Figure 15:Datos faltantes disfrazados en los predictores Pima. La insulina y el tríceps son cero para cientos de mujeres, lo cual es fisiológicamente imposible, así que esos ceros son valores faltantes disfrazados y deben manejarse antes de modelar.
Tabla de clasificación y ROC¶
Para convertir probabilidades en predicciones de sí o no, elige un umbral (0.5 es el predeterminado) y predice positivo cuando lo supera. Tabular las predicciones contra la verdad da una tabla de clasificación, de la cual se siguen la sensibilidad (la fracción de verdaderos positivos capturados) y la especificidad (la fracción de verdaderos negativos correctamente descartados) (Definición 13.8). Como un umbral es una elección arbitraria, la curva ROC barre cada umbral a la vez, graficando la sensibilidad contra uno menos la especificidad; el área bajo la curva (AUC) resume todo el barrido como la probabilidad de que el modelo puntúe un positivo aleatorio por encima de un negativo aleatorio (Definición 13.9).

Figure 16:La curva ROC barre cada umbral de clasificación. La curva se arquea por encima de la diagonal (azar), con AUC 0.84; el punto rojo es el umbral predeterminado de 0.5, mostrando su alta especificidad pero modesta sensibilidad.
El 0.5 de esa tabla es una elección que hiciste tú, no algo que el modelo te entregó, así que lo justo es moverlo.
La curva ROC del modelo de cinco predictores sobre las 752 mujeres, con un punto de operación que sigue tu umbral. La sensibilidad, la especificidad, la precisión y las celdas de la tabla de clasificación se recalculan a partir de las 752 probabilidades ajustadas en cada paso.
Qué observar. Bajar el umbral de 0.50 a 0.30 sube la sensibilidad de 0.568 a 0.784 y reduce los positivos perdidos de 114 a 57, mientras las falsas alarmas suben de 57 a 140 y la precisión baja. Prueba esto. Encuentra el umbral con la precisión más alta, cuenta cuántos casos positivos sigue perdiendo, y decide si lo lanzarías como prueba de tamizaje. Volver a la Sección 13.5.
13.6 Resumen del capítulo¶
Este capítulo construyó un modelo de regresión para una respuesta binaria o binomial. Los mínimos cuadrados ordinarios fallan para un resultado de sí o no de tres maneras (ajustes sin cota, varianza no constante, errores no normales), y la regresión logística arregla las tres haciendo lineal el logaritmo de los momios. Como la curva en S hace no lineales las ecuaciones de verosimilitud, no hay estimación en forma cerrada: la máxima verosimilitud encuentra los coeficientes, e IRLS los calcula por mínimos cuadrados ponderados repetidos. Cada coeficiente se lee como una razón de momios, probada por las pruebas de Wald y de razón de verosimilitud, y las probabilidades ajustadas se juzgan por la devianza, una tabla de clasificación y una curva ROC, después de verificar en los datos los valores faltantes disfrazados.
Resultados clave de un vistazo
| Resultado | Enunciado o fórmula | Válido cuando |
|---|---|---|
| Momios (Def 13.1) | cualquier probabilidad | |
| Logit (Def 13.2) | ||
| Modelo logístico (Def 13.3) | , | respuesta binaria o binomial, casos independientes |
| Ecuaciones de puntaje (Teo 13.4) | , | en la estimación de máxima verosimilitud |
| IRLS (Teo 13.5) | cada paso de Newton; log-verosimilitud cóncava | |
| Razón de momios (Def 13.6) | (o por unidades) | logaritmo de los momios lineal en |
| Devianza (Def 13.7) | modelo ajustado vs modelo saturado | |
| Estadístico de Wald | muestra grande | |
| Razón de verosimilitud | modelos anidados, muestra grande | |
| Sensibilidad, especificidad (Def 13.8) | , | un umbral elegido |
| AUC (Def 13.9) | calidad de ordenamiento, todos los umbrales |
Términos clave
regresión logística, momios, logaritmo de los momios (logit), predictor lineal, función de enlace, máxima verosimilitud, verosimilitud, log-verosimilitud, ecuaciones de puntaje, mínimos cuadrados reponderados iterativamente (IRLS), respuesta de trabajo, razón de momios, prueba de Wald, prueba de razón de verosimilitud, devianza, modelo saturado, tabla de clasificación, sensibilidad, especificidad, curva ROC, área bajo la curva (AUC).
Ahora deberías ser capaz de
Explicar por qué los mínimos cuadrados ordinarios son el modelo equivocado para una respuesta binaria, nombrando sus tres fallas.
Enunciar el modelo de regresión logística y moverte entre probabilidad, momios y logaritmo de los momios.
Deducir las ecuaciones de puntaje (Teorema 13.4) y describir cómo IRLS (Teorema 13.5) las resuelve.
Interpretar un coeficiente logístico como una razón de momios y corregir las lecturas erróneas comunes.
Probar coeficientes con las pruebas de Wald y de razón de verosimilitud, y explicar cuándo discrepan.
Calcular la devianza y usarla para comparar modelos anidados.
Evaluar un modelo ajustado con una tabla de clasificación y una curva ROC, después de diagnosticar problemas de datos.
Dónde encaja esto. En el flujo de trabajo de El flujo de trabajo del modelado este capítulo es sobre todo FIT y USE para un nuevo tipo de respuesta: ASK una pregunta de sí o no, EXPLORE con las mismas gráficas (ahora de proporciones), FIT por máxima verosimilitud en lugar de mínimos cuadrados, CHECK con la devianza y la auditoría de ceros disfrazados, y USE las probabilidades ajustadas para interpretar razones de momios y para clasificar. La maquinaria lleva consigo los capítulos anteriores: las ecuaciones de puntaje hacen eco de las ecuaciones normales de 7.1 El modelo y los mínimos cuadrados en forma matricial, IRLS son mínimos cuadrados ponderados (10.4 Mínimos cuadrados ponderados) corridos en un bucle, la prueba de razón de verosimilitud es la prueba lineal general (8.4 La prueba lineal general) en forma de devianza, los predictores categóricos entran a través de la codificación de indicadores de 11.1 De categorías a números: codificación con indicadores, y la evaluación honesta necesita la mentalidad de validación de 12.4 Validación: entrenar, probar y validar cruzadamente. El Capítulo 14 da el último paso, manteniendo la maquinaria de máxima verosimilitud y devianza pero cambiando la familia binomial por la de Poisson para modelar conteos, y nombra la familia de modelos lineales generalizados que mantiene juntas la regresión lineal, logística y de Poisson (14.6 Una familia: el modelo lineal generalizado).
13.7 Preguntas frecuentes¶
P1. ¿Por qué máxima verosimilitud en lugar de mínimos cuadrados aquí? Los mínimos cuadrados minimizan el error al cuadrado, que es el criterio correcto cuando la respuesta es continua con ruido normal de varianza constante. Una respuesta binaria no tiene ninguno de los dos, así que el error al cuadrado ya no es la pérdida natural. La máxima verosimilitud pregunta cuáles coeficientes hacen que el patrón 0/1 observado sea el más probable bajo el modelo logístico, que es la elección de principios para esta respuesta, y para el modelo normal resulta que reproduce los mínimos cuadrados de todos modos (Capítulo 2).
P2. ¿Es una razón de momios lo mismo que un riesgo relativo? No, y confundirlos es un error común. El riesgo relativo es una razón de probabilidades; la razón de momios es una razón de momios. Cuando el resultado es raro (pequeño ) los dos están cerca, porque los momios probabilidad allí, pero para un resultado común divergen, y la razón de momios es siempre el número más extremo. Reporta una razón de momios como una razón de momios.
P3. ¿Qué significa un coeficiente negativo? Significa que el predictor baja el logaritmo de los momios, así que su razón de momios está por debajo de 1 y la probabilidad de un resultado positivo cae a medida que el predictor sube. El coeficiente de temperatura de las juntas tóricas es negativo: los lanzamientos más cálidos tienen momios de daño más bajos.
P4. ¿Por qué es la devianza la versión logística de la suma de cuadrados de los residuos? Ambas miden qué tan lejos se sitúa el modelo ajustado de los datos. En la regresión ordinaria, dos veces la brecha negativa de log-verosimilitud entre tu modelo y un ajuste perfecto es exactamente la suma de cuadrados de los residuos (salvo una constante); para la regresión logística esa misma brecha es la devianza. Menor devianza es mejor ajuste, y las diferencias de devianza entre modelos anidados siguen una distribución chi-cuadrada, tal como las diferencias en la suma de cuadrados daban estadísticos antes.
P5. ¿Puedo usar para un modelo logístico? No el ordinario, porque no hay suma de cuadrados de los residuos para dividir. Existen varias medidas de “pseudo-” (de McFadden, Cox-Snell, Nagelkerke), cada una construida a partir de log-verosimilitudes, y el software las reporta, pero no tienen el significado limpio de “fracción de varianza explicada” del lineal. Para juzgar un modelo logístico, la devianza, la prueba de razón de verosimilitud y el AUC son más informativos.
P6. Mi probabilidad predicha en un extremo es 0.999. ¿Debería creerla? Trátala como tratarías cualquier extrapolación. Si el extremo está dentro del rango de tus datos, la probabilidad es tan confiable como el ajuste. Si está fuera, como con las juntas tóricas a 31 grados, se le pide a la curva en S que siga doblándose donde no tienes evidencia sobre su forma, y el número pulcro esconde incertidumbre real. Repórtala, pero di claramente que es una extrapolación.
P7. ¿Por qué glm eliminó 16 observaciones del modelo de diabetes? Porque pusimos los ceros
imposibles en la glucosa (5 de ellos) y el IMC (11) en NA, y glm usa solo casos completos por
defecto. Esas 16 mujeres carecen de un predictor que el modelo necesita. Eliminarlas es defendible
aquí, pero para un análisis serio considerarías si la falta de datos se relaciona con el resultado,
lo que puede sesgar el ajuste, y posiblemente imputar en lugar de borrar.
13.8 Problemas de práctica¶
(A) En una frase cada una, nombra las tres maneras en que los mínimos cuadrados ordinarios fallan para una respuesta binaria.
(A) Convierte estas probabilidades a momios: 0.2, 0.5, 0.8. Luego convierte estos momios a probabilidades: 0.25, 1, 4.
(A) El coeficiente de temperatura de las juntas tóricas es -0.2162. Enuncia su razón de momios para un aumento de un grado y di en palabras qué significa ese número.
(A) Explica la diferencia entre el error con el que trabaja la regresión logística y la probabilidad ajustada . ¿Cuál se observa?
(A) Un estudiante escribe “la razón de momios de la glucosa es 1.04, así que una prueba positiva es 4 por ciento más probable por unidad”. Identifica el error conceptual y corrígelo.
(A) ¿Por qué la regresión logística no tiene fórmula en forma cerrada para sus coeficientes, a diferencia de la regresión lineal simple?
(A) El AUC de un modelo es 0.5. ¿Qué dice eso sobre la capacidad del modelo para ordenar casos?
(A) Da la sensibilidad y la especificidad de la tabla de clasificación Pima del Ejemplo 13.5, y di qué tipo de error debería querer evitar más una prueba de tamizaje de diabetes.
(A) La razón de momios del pedigrí de diabetes es 2.51 con un intervalo de 95 por ciento . ¿Es su efecto distinguible de ningún efecto? ¿Cómo puedes saberlo por el intervalo?
(A) Explica por qué el coeficiente de la edad puede ser no significativo en el modelo múltiple aunque las mujeres mayores sean, marginalmente, más propensas a dar positivo.
(B) Partiendo de y , muestra que .
(B) Diferencia la log-verosimilitud del Problema 11 para deducir las ecuaciones de puntaje (Teorema 13.4), indicando dónde usas .
(B) Muestra que la segunda derivada de la log-verosimilitud es , y concluye que el hessiano es con . Explica por qué esto hace cóncava a .
(B) Deduce la actualización de IRLS (Teorema 13.5) a partir del paso de Newton, identificando la respuesta de trabajo .
(B) Usando la ecuación de puntaje del intercepto, demuestra que un modelo logístico con intercepto tiene . Interprétalo para una respuesta binaria simple.
(B) Deduce la razón de momios para un aumento de unidades en un predictor, partiendo de .
(B) Muestra que para un resultado raro (pequeño ) la razón de momios y el riesgo relativo son aproximadamente iguales, expandiendo ambos para probabilidades pequeñas.
(B) Escribe la devianza para un modelo logístico binario () y explica por qué cada término es cero exactamente cuando es igual al observado, de modo que el modelo saturado tiene devianza 0.
(B) Explica, en términos de la forma de la log-verosimilitud, por qué la prueba de razón de verosimilitud puede discrepar de la prueba de Wald cuando un coeficiente es muy grande, y en cuál confiar.
(B) La función logística es . Muestra que , y explica por qué esto hace que el cambio de probabilidad por unidad de sea mayor en .
(C) Ajusta el modelo de las juntas tóricas en R o Python y reproduce y . Predice la probabilidad de daño a 50 y 75 grados e interpreta ambas.
(C) Reajusta el modelo de las juntas tóricas tratando cada vuelo como un solo resultado binario de “algún daño” (
damage > 0) en lugar del conteo de seis. Compara el coeficiente de temperatura con el ajuste agrupado y comenta qué cambió.(C) Sobre los datos Pima, ajusta
test ~ glucoseytest ~ glucose + bmi. Reporta la razón de momios de la glucosa en cada uno y explica por qué cambia cuando se añade el IMC.(C) Reproduce la tabla de clasificación Pima de cinco predictores en el umbral de 0.5, luego recalcula la sensibilidad y la especificidad en los umbrales 0.3 y 0.7. Describe el intercambio a medida que se mueve el umbral.
(C) Agrupa
ageen un factor con niveles “under 30”, “30 to 45” y “over 45”, añádelo atest ~ glucose + bmicomo un predictor categórico (como en 11.1 De categorías a números: codificación con indicadores), e interpreta las razones de momios de sus niveles respecto a la referencia.(C) Calcula el estadístico de razón de verosimilitud del modelo completo para
test ~ glucose + bmi + age + diabetes + pregnanta partir de sus devianzas nula y residual, y confirma tu número contradrop1o una comparación manual con el modelo nulo.(C) Realiza una validación aproximada: divide los datos Pima 70/30 (semilla 4210), ajusta el modelo de cinco predictores en la parte de entrenamiento, y calcula el AUC en la parte reservada. Compáralo con el AUC dentro de la muestra de 0.84 y explica cualquier brecha usando 12.4 Validación: entrenar, probar y validar cruzadamente.
(C) Dibuja la curva de probabilidad ajustada para
test ~ glucosey añade la tasa observada de positivos dentro de deciles de glucosa como puntos. ¿Sigue la curva a las tasas agrupadas? ¿Cómo se vería un mal ajuste aquí?
13.9 Práctica de examen¶
Estas cinco preguntas están escritas al estilo de los exámenes del curso. Cada una te pide explicar
tu razonamiento en frases completas, no reportar un número desnudo: en el examen real un número
correcto sin palabras de apoyo gana poco crédito, y un razonamiento claro con un pequeño desliz
aritmético gana la mayor parte. Donde una pregunta muestra salida de software, se produjo en la
máquina del curso (R 4.6.0) a partir de los mismos archivos CSV en data/ que usaste todo el
semestre; Python con statsmodels da los mismos números. Trabaja cada una antes de abrir su
respuesta modelo.
EP 13.1 (interpreta esta salida en contexto). Una clínica ajusta un modelo logístico para una
prueba de diabetes positiva sobre los datos pima limpios (los ceros imposibles en glucose y bmi
puestos en NA y eliminados), usando la glucosa plasmática, el índice de masa corporal y el número
de embarazos.
pima <- read.csv("data/pima.csv")
pima$glucose[pima$glucose == 0] <- NA
pima$bmi[pima$bmi == 0] <- NA
fit <- glm(test ~ glucose + bmi + pregnant, family = binomial, data = pima)
summary(fit)Coefficients:
Estimate Std. Error z value Pr(>|z|)
(Intercept) -8.780034 0.684606 -12.825 < 2e-16 ***
glucose 0.037079 0.003459 10.720 < 2e-16 ***
bmi 0.089899 0.014598 6.158 7.35e-10 ***
pregnant 0.131273 0.027299 4.809 1.52e-06 ***
---
Null deviance: 974.75 on 751 degrees of freedom
Residual deviance: 714.58 on 748 degrees of freedomInterpreta el coeficiente pregnant como una razón de momios en palabras que un clínico podría usar.
Luego, para una mujer con glucose = 150, bmi = 30 y pregnant = 4, el predictor lineal reportado
es ; calcula su probabilidad estimada de una prueba positiva, muestra la
aritmética, y di en una frase por qué esa probabilidad no es cuatro veces la historia de la razón de
momios.
Respuesta modelo
El coeficiente pregnant es 0.1313 en la escala del logaritmo de los momios, así que su razón de
momios es . En palabras que un clínico podría usar: manteniendo fijos la glucosa
plasmática y el índice de masa corporal, cada embarazo adicional multiplica los momios de una prueba
de diabetes positiva por cerca de 1.14, un aumento de aproximadamente 14 por ciento en los momios
por parto. La palabra momios importa, porque el coeficiente no agrega una cantidad fija a la
probabilidad. Para la mujer específica, el modelo pasa su predictor lineal a través de la función
logística,
así que su probabilidad estimada de una prueba positiva es de cerca de 0.50, momios parejos. Ese solo número viene de los tres predictores juntos a través de la curva en S, no de multiplicar la razón de momios del embarazo por algo: la razón de momios 1.14 describe cómo cambiarían sus momios si tuviera un embarazo más con la glucosa y el IMC fijos, mientras que 0.50 es donde ella se sitúa realmente en la curva dados todos sus valores.
Una respuesta débil reporta pero la llama una “probabilidad 14 por ciento mayor” de una prueba positiva, confundiendo el multiplicador constante de momios con un cambio en la probabilidad.
EP 13.2 (un estudiante afirma algo; evalúalo). Mirando el ajuste en EP 13.1, un estudiante escribe: “El coeficiente del IMC es 0.0899, y su razón de momios es , así que una mujer con un IMC de 45 es cerca de 9 por ciento más propensa a dar positivo que una mujer con un IMC de 44”. Evalúa la afirmación. Di con precisión qué está bien, qué está mal, y da la frase corregida.
Respuesta modelo
La aritmética está bien y una palabra está mal, y esa palabra cambia el significado. El número es correcto, y es la razón de momios para un aumento de una unidad en el IMC manteniendo fijos la glucosa y los embarazos. Lo que está mal es “9 por ciento más propensa a dar positivo”, porque “propensa” se lee como probabilidad, y el coeficiente actúa sobre los momios, no sobre la probabilidad. El efecto sobre la probabilidad no es un 9 por ciento fijo: depende de dónde se sitúe la mujer en la curva en S, mayor en el centro empinado cerca de la probabilidad 0.5 y minúsculo en las colas planas, así que ir de un IMC de 44 a 45 mueve la probabilidad en cantidades diferentes para mujeres diferentes. La cantidad constante es el multiplicador de momios. Una frase corregida: “subir el IMC en una unidad, con la glucosa y los embarazos fijos, multiplica los momios de una prueba positiva por cerca de 1.094, un aumento de 9.4 por ciento en los momios, no en la probabilidad”. Cuánto se mueve la probabilidad misma depende de sus otros valores.
Una respuesta débil solo dice “el estudiante está equivocado porque es una razón de momios” sin explicar que el cambio de probabilidad ni siquiera es constante, que es la razón más profunda por la que la afirmación engaña.
EP 13.3 (explica por qué). La regresión lineal simple tiene fórmulas en forma cerrada para sus coeficientes, y , pero la regresión logística no tiene tal fórmula y se ajusta con mínimos cuadrados reponderados iterativamente en su lugar. Explica por qué no existe forma cerrada, qué hace realmente IRLS en cada paso, y por qué el procedimiento tiene garantizado escalar hasta un único mejor conjunto de coeficientes en lugar de quedarse atascado.
Respuesta modelo
No existe forma cerrada porque la probabilidad ajustada es una función no lineal de los coeficientes. Cuando igualas a cero las derivadas de la log-verosimilitud obtienes las ecuaciones de puntaje , y como cada se dobla a través del enlace logístico, estas son no lineales en y no pueden reordenarse en una solución algebraica como sí pueden las ecuaciones normales lineales. IRLS las resuelve por aproximación repetida. En cada paso mantiene fijos los coeficientes actuales, forma los pesos y una respuesta de trabajo , y luego hace un ajuste ordinario de mínimos cuadrados ponderados de sobre los predictores para obtener coeficientes actualizados; como los pesos y la respuesta de trabajo cambian a medida que se mueven los coeficientes, reajusta hasta que los números dejan de cambiar. Tiene garantizado alcanzar una única mejor respuesta porque la log-verosimilitud es cóncava: su matriz de segundas derivadas es , que es definida negativa (los pesos son todos positivos), así que la superficie es una sola colina con un pico y sin cumbres falsas, y cada paso de Newton escala hacia él.
Una respuesta débil dice solo “las ecuaciones son no lineales” sin conectar la concavidad de la log-verosimilitud con la garantía de que IRLS encuentra el único máximo verdadero.
EP 13.4 (qué cambiaría si). El modelo Pima de cinco predictores del Ejemplo 13.4 clasifica en el corte de probabilidad predeterminado de 0.5 con la tabla de la izquierda abajo. Una clínica de tamizaje propone bajar el corte a 0.3, lo que da la tabla de la derecha.
cutoff 0.5 cutoff 0.3
actual 0 actual 1 actual 0 actual 1
predict 0 431 114 predict 0 348 57
predict 1 57 150 predict 1 140 207Explica qué cambia cuando la clínica mueve el corte de 0.5 a 0.3. Calcula la sensibilidad y la especificidad en cada corte, describe el intercambio en términos sencillos, y di si el movimiento es una buena idea para una prueba de tamizaje y por qué.
Respuesta modelo
Bajar el corte hace que el modelo llame positivas a más mujeres, porque ahora señala a cualquiera cuya probabilidad estimada supere 0.3 en lugar de 0.5. En 0.5 la sensibilidad es y la especificidad es . En 0.3 la sensibilidad sube a y la especificidad baja a . Así que el intercambio es claro: el corte más bajo captura muchos más de los verdaderos positivos (perdiendo 57 mujeres en lugar de 114) a costa de más falsas alarmas (140 mujeres sanas señaladas en lugar de 57). Para una prueba de tamizaje este movimiento es defendible y probablemente sabio. Una prueba de tamizaje existe para detectar enfermedad, así que un positivo perdido (un falso negativo) es el error costoso, porque a una mujer que tiene diabetes se le dice que está bien y pierde el cuidado de seguimiento, mientras que un falso positivo usualmente solo desencadena una prueba confirmatoria. Cambiar algo de especificidad por una gran ganancia en sensibilidad se ajusta al propósito del tamizaje. El corte correcto en última instancia depende de los costos reales de los dos errores, que es exactamente por qué uno debería mirar toda la curva ROC en lugar de cualquier corte único.
Una respuesta débil calcula los cuatro números pero no conecta la elección con el propósito del tamizaje, así que no puede decir por qué capturar más verdaderos positivos vale las falsas alarmas extra.
EP 13.5 (interpreta esta salida en contexto). Para preguntar si la edad, el pedigrí de diabetes
y el número de embarazos agregan algo más allá de la glucosa y el IMC, un analista corre una prueba
de razón de verosimilitud sobre los datos pima limpios y también reporta el AUC dentro de la
muestra del modelo más grande.
Model 1: test ~ glucose + bmi Residual deviance 738.51 on 749 df
Model 2: test ~ glucose + bmi + age + diabetes + pregnant Residual deviance 703.24 on 746 df
Likelihood-ratio test: deviance drop = 35.27 on 3 df, p-value = 1.1e-07
in-sample AUC (Model 2) = 0.843Enuncia la hipótesis nula, muestra de dónde viene el estadístico 35.27, da su distribución de referencia y conclusión, y luego explica por qué el AUC de 0.843 es probablemente optimista y qué herramienta del Capítulo 12 daría una estimación honesta.
Respuesta modelo
La hipótesis nula es que los tres coeficientes extra, sobre la edad, el pedigrí de diabetes y el número de embarazos, son todos cero, así que esos predictores no agregan nada una vez que la glucosa y el IMC están en el modelo. El estadístico de razón de verosimilitud es la caída en la devianza residual entre los modelos anidados, , y se refiere a una distribución chi-cuadrada con 3 grados de libertad, el número de coeficientes igualados a cero bajo la nula. Como una tiene media 3 y 35.27 está muy lejos en su cola (), rechazamos la nula: los tres predictores juntos cargan información real más allá de la glucosa y el IMC. (Si una prueba de Wald sobre uno de estos coeficientes hubiera discrepado con este resultado de razón de verosimilitud, la prueba de razón de verosimilitud sería la de confiar, porque usa la forma real de la log-verosimilitud en lugar de una sola aproximación cuadrática.) El AUC de 0.843 es probablemente optimista porque se calculó sobre las mismas mujeres usadas para ajustar el modelo, así que los coeficientes ajustados están afinados a las peculiaridades de esta muestra tanto como a su señal real, y el modelo se ve mejor aquí de lo que se vería con pacientes nuevos. Una estimación honesta reserva datos que el modelo nunca vio: una división de entrenamiento-prueba o, mejor, validación cruzada de pliegues (12.4 Validación: entrenar, probar y validar cruzadamente), ajustando en parte de los datos y midiendo el AUC en la parte intacta. La brecha entre el AUC dentro de la muestra y fuera de la muestra es el optimismo, y crece con el número de predictores.
Una respuesta débil resta las devianzas correctamente pero olvida que los grados de libertad son iguales al número de predictores eliminados, o trata el AUC dentro de la muestra como una medida honesta del desempeño futuro.
Juego del capítulo¶
Chapter summary (in English)
This chapter introduces logistic regression, the model for a binary (yes-or-no) response. The opening story is the 1986 Challenger shuttle launch decision: 23 prior flights, each with the launch temperature and the number of O-rings damaged out of six. The response is not continuous, so ordinary least squares fails in three ways: it predicts probabilities outside , the variance is not constant, and the errors cannot be normal.
The fix models through the odds and the log-odds (logit). The logistic model says , so that , an S-shaped curve that always stays between 0 and 1. For the O-rings, the fit gives ; at 31 degrees Fahrenheit the model predicts a damage probability near 0.99, though this is an extrapolation far from the data.
There is no closed-form formula for the coefficients: they are estimated by maximum likelihood, deriving the score equations and solving them with iteratively reweighted least squares (IRLS). Each coefficient is read as an odds ratio , not a change in probability. Coefficients are tested with the Wald test and the likelihood-ratio test, built on the deviance. Finally the model is evaluated with a classification table, the ROC curve and its area (AUC on Pima), after checking the impossible zeros that are disguised missing data. Chapter 14 extends this machinery to Poisson regression and the generalized linear model framework.