Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

14. Regresión de Poisson y la idea del MLG

En 1973 dos biólogos, Michael Johnson y Peter Raven, publicaron un conteo. Para cada una de 30 islas del archipiélago de las Galápagos registraron cuántas especies de plantas crecían allí. Junto a cada conteo anotaron un puñado de hechos geográficos: el área de la isla, su elevación máxima, su distancia a la isla vecina más cercana, su distancia a la gran isla de Santa Cruz, y el área de la isla adyacente más próxima. La pregunta era vieja y sencilla. ¿Por qué algunas islas albergan cientos de especies y otras solo una docena?

Ya te has topado con este conjunto de datos dos veces. En el Capítulo 9 fue una advertencia sobre diagnósticos. Ajusta una recta por mínimos cuadrados ordinarios, y una isla, Isabela, la más grande de la cadena, queda tan lejos en el espacio de predictores que dobla el ajuste entero hacia ella misma. En el Capítulo 10 probaste el remedio estándar, transformar la respuesta, y ayudó con las gráficas de residuos pero nunca terminó de sentirse bien. Algo en los datos se resistía al modelo lineal, y te prometimos una respuesta honesta más adelante. Más adelante es ahora.

El problema se ve en una sola imagen. Figure 1 grafica las especies contra el área de la isla con la recta de mínimos cuadrados trazada por encima. El ajuste hace algo imposible. Su banda de predicción tiene un único ancho fijo, así que empujada hacia las islas pequeñas la banda baja por debajo de cero y promete conteos negativos de especies. Y un ancho fijo no puede ajustar ambos extremos: las islas pequeñas se agrupan apretadas cerca de cero mientras las islas grandes se dispersan por cientos. Un conteo de especies no puede ser negativo, no puede ser fraccionario, y su dispersión crece con su tamaño. El modelo lineal no supone nada de eso. Este capítulo construye el modelo que sí lo hace.

Dos diagramas de dispersión lado a lado de las 30 islas Galápagos. El panel izquierdo grafica el conteo de especies contra el área de la isla con una recta de mínimos cuadrados ordinarios; la mayoría de las islas se apiñan en la esquina inferior izquierda cerca de área cero y pocas especies, un punto (Isabela) queda muy a la derecha, y la recta ajustada es arrastrada hacia arriba por él mientras pasa por encima de la mayoría de los puntos apiñados. El panel derecho grafica los mismos conteos de especies contra el área en un eje horizontal logarítmico, desplegando las islas apiñadas y mostrando una nube creciente y curvada cuya dispersión vertical se ensancha a medida que crecen los conteos de especies.

Figure 1:Los conteos de especies de las Galápagos contra el área de la isla. Izquierda: una recta de mínimos cuadrados ordinarios es distorsionada por la única isla enorme y supone una dispersión constante que los datos no tienen. Derecha: en un eje de área logarítmica las islas se despliegan y la dispersión claramente se ensancha a medida que crecen los conteos, la firma de datos de conteo que un modelo lineal no puede captar.

Al terminar este capítulo los conteos de especies tendrán un modelo que respeta lo que son, el mismo modelo manejará tasas de daño de barcos con exposiciones muy distintas, y todo ello, junto con las rectas del Capítulo 2 y las curvas logísticas del Capítulo 13, se colapsará en una sola familia con una única idea de estimación. Esa familia es el modelo lineal generalizado, y es la recompensa de toda esta parte del curso.

14.1 Por qué los conteos rompen el modelo lineal

Intuición

Un conteo es un número entero de cosas que ocurrieron: especies en una isla, incidentes de daño en un barco, clientes en una hora, convulsiones en una semana. Los conteos tienen tres rasgos tercos. Nunca son negativos. Son números enteros, no fracciones. Y su variabilidad crece con su promedio: una isla que promedia 5 especies varía en una especie o dos, mientras que una isla que promedia 200 varía en docenas. El modelo lineal de los Capítulos 2 al 8 supone una respuesta que puede vagar por cualquier punto de la recta numérica, toma cualquier valor real, y se dispersa con la misma σ2\sigma^2 en cada nivel de los predictores. Cada uno de esos supuestos es falso para un conteo.

El modelo de probabilidad natural para un conteo es la distribución de Poisson (Poisson distribution) (Definición 14.1). Describe el número de eventos que ocurren cuando cada evento es raro, los eventos ocurren de forma independiente, y llegan a una tasa promedio estable. Una distribución de Poisson tiene un solo parámetro, su media μ\mu, y una propiedad notable: su varianza es igual a su media. Figure 2 muestra tres distribuciones de Poisson. A medida que la media sube de 1 a 10, la distribución se desliza a la derecha, se dispersa, y se vuelve más simétrica, y en cada paso su dispersión queda atada a su centro.

Tres gráficas de barras de distribuciones de probabilidad de Poisson con medias 1, 4 y 10, dibujadas en tres colores. En media 1 las barras se amontonan en 0 y 1 y están fuertemente sesgadas a la derecha. En media 4 el pico se mueve a 3 y 4 y la forma está menos sesgada. En media 10 las barras forman un montículo ancho y casi simétrico centrado cerca de 10. Una nota en cada panel indica que la varianza es igual a la media.

Figure 2:Tres distribuciones de Poisson. Toda la distribución queda fijada por un solo número, la media, y su dispersión siempre es igual a esa media. Los conteos de media pequeña se amontonan cerca de cero y están fuertemente sesgados a la derecha; los conteos de media grande se dispersan ampliamente y se ven casi normales.

Ese vínculo media-igual-a-varianza es exactamente el patrón que mostró Figure 1 y exactamente lo que los mínimos cuadrados de varianza constante no pueden representar. Figure 3 lo hace explícito: el modelo lineal traza una línea de varianza plana, mientras que los datos de conteo cabalgan la diagonal donde la varianza sigue a la media.

Una gráfica con la respuesta media en el eje horizontal y la varianza en el eje vertical. Una línea horizontal plana etiquetada varianza constante sigma cuadrado representa el supuesto de mínimos cuadrados ordinarios. Una línea creciente a 45 grados etiquetada varianza igual a la media representa el supuesto de Poisson. Puntos dispersos que representan islas Galápagos agrupadas suben desde la parte inferior izquierda hacia la superior derecha, siguiendo la diagonal en vez de la línea plana.

Figure 3:El supuesto que falla. Los mínimos cuadrados ordinarios suponen varianza constante (línea plana); el modelo de Poisson supone que la varianza crece con la media (diagonal). Los conteos agrupados de las Galápagos suben por la diagonal, así que el modelo de varianza plana es simplemente la forma equivocada.

Fórmula

Un conteo aleatorio YY sigue una distribución de Poisson con media μ>0\mu > 0 cuando

P(Y=y)=eμμyy!,y=0,1,2,P(Y = y) = \frac{e^{-\mu}\,\mu^{y}}{y!}, \qquad y = 0, 1, 2, \dots

En palabras: la probabilidad de ver exactamente yy eventos queda fijada por completo por la tasa promedio μ\mu. La distribución acarrea dos hechos que usaremos constantemente,

E{Y}=μ,Var{Y}=μ.E\{Y\} = \mu, \qquad \operatorname{Var}\{Y\} = \mu .

En palabras: para un conteo de Poisson la media y la varianza son el mismo número. Esta única ecuación es lo que separa la regresión de conteo de todo lo anterior, y es el hilo que seguimos hasta el final del capítulo.

Antes de construir un modelo para conteos, dedica un minuto a la distribución misma, porque el deslizador de abajo es el único parámetro que tiene una Poisson.

Mueve el conteo medio mu y observa cómo la distribución se desliza a la derecha, se ensancha y se aplana a la vez: con una Poisson no puedes mover el centro sin mover la dispersión, porque la varianza es la media. Volver a la Sección 14.1.

14.2 El modelo log-lineal de Poisson y las razones de tasas

Intuición

Queremos que el conteo medio μi\mu_i dependa de los predictores, la misma ambición que la regresión ordinaria, pero con dos reparaciones. La media debe mantenerse positiva sin importar lo que hagan los predictores, y el modelo debería describir cómo los predictores multiplican el conteo en vez de sumarle, porque los procesos de conteo suelen ser multiplicativos: duplicar el área de una isla no suma un número fijo de especies, escala el número esperado.

Ambas reparaciones vienen de un solo movimiento: modelar el logaritmo de la media como una función lineal de los predictores. Como el logaritmo puede ser cualquier número real mientras que su inverso, la exponencial, siempre es positivo, un modelo lineal en la escala logarítmica puede variar libremente mientras la media que produce se mantiene positiva. Y como una suma en la escala logarítmica es un producto en la escala original, los coeficientes se vuelven multiplicadores. Figure 5 muestra el enlace en acción: una recta en el predictor lineal η\eta se convierte en una curva en la media μ\mu que se pega a cero para η\eta negativo y sube empinada para η\eta positivo, sin bajar ni una vez por debajo de cero.

Fórmula

El modelo de regresión log-lineal de Poisson dice que para cada caso ii,

YiPoisson(μi),logμi=ηi=β0+β1Xi1++βp1Xi,p1.Y_i \sim \text{Poisson}(\mu_i), \qquad \log \mu_i = \eta_i = \beta_0 + \beta_1 X_{i1} + \dots + \beta_{p-1} X_{i,p-1} .

Despejar la media del enlace da la forma multiplicativa

μi=eηi=eβ0eβ1Xi1eβp1Xi,p1.\mu_i = e^{\eta_i} = e^{\beta_0}\, e^{\beta_1 X_{i1}} \cdots e^{\beta_{p-1} X_{i,p-1}} .

En palabras: el conteo medio es un producto de factores, uno por predictor. Por esto los coeficientes se leen como razones de tasas (rate ratios). Aumenta XijX_{ij} en una unidad, manteniendo fijos los demás, y ηi\eta_i sube en βj\beta_j, así que μi\mu_i se multiplica por eβje^{\beta_j}:

μ(Xj+1)μ(Xj)=eβj.\frac{\mu(X_j + 1)}{\mu(X_j)} = e^{\beta_j} .

En palabras: eβje^{\beta_j} es el factor por el cual cambia el conteo esperado ante un aumento de una unidad en XjX_j. Un coeficiente de cero significa una razón de uno, sin efecto; un coeficiente positivo significa una razón mayor que uno, el conteo crece; un coeficiente negativo significa una razón menor que uno, el conteo se encoge. Este es el primo, para datos de conteo, de la razón de momios eβje^{\beta_j} que conociste para la regresión logística en 13.3 Leer los coeficientes como razones de momios, y de la lectura de cambio porcentual de un coeficiente en escala logarítmica de 10.2 La transformación logarítmica y la lectura de sus coeficientes.

Esta es la imagen que hay que tener en la cabeza. En la escala logarítmica el modelo es una recta ordinaria, así que pasos iguales en un predictor suman la misma cantidad βj\beta_j cada vez. Exponencia, y ese sumar parejo se convierte en multiplicar parejo: cada paso multiplica el conteo por el mismo factor eβje^{\beta_j}. Figure 6 muestra ambos lados a la vez, usando el efecto de la elevación del ajuste de más abajo, donde cien metros extra multiplican el conteo esperado de especies por cerca de 1.42.

Dos gráficas de líneas lado a lado que comparten un eje horizontal de elevación en cientos de metros, de 0 a 4. El panel izquierdo grafica el logaritmo del conteo medio y es una recta creciente; etiquetas naranjas igualmente espaciadas que dicen más beta marcan que cada paso hacia arriba suma la misma cantidad. El panel derecho grafica el conteo medio en sí y es una curva que sube cada vez más empinada; etiquetas naranjas que dicen por 1.42 marcan que cada paso hacia arriba multiplica el conteo por el mismo factor, así que las brechas entre puntos crecen.

Figure 6:Un coeficiente es una razón de tasas. En la escala logarítmica (izquierda) cada paso de elevación suma la misma cantidad al predictor lineal, una recta. En la escala de conteo (derecha) ese mismo paso multiplica el conteo esperado por un factor fijo de cerca de 1.42, así que el conteo sube cada vez más rápido. Sumar en la escala logarítmica es multiplicar en la escala de conteo.

Derivación (la log-verosimilitud de Poisson y sus ecuaciones de puntaje)

Los mínimos cuadrados no estimarán este modelo: la respuesta no es normal y la media no es lineal. Como en la regresión logística, estimamos por máxima verosimilitud (maximum likelihood), el principio de 13.2 Ajuste por máxima verosimilitud que elige los coeficientes que hacen más probables los conteos observados.

Demostración. Los conteos Y1,,YnY_1, \dots, Y_n son independientes dados los predictores, así que la verosimilitud es el producto de sus probabilidades de Poisson, y la log-verosimilitud es la suma de los logaritmos:

(β)=i=1n[yilogμiμilog(yi!)].\ell(\boldsymbol\beta) = \sum_{i=1}^n \Big[ y_i \log \mu_i - \mu_i - \log(y_i!) \Big] .

Sustituye el modelo logμi=xiβ\log \mu_i = \mathbf{x}_i'\boldsymbol\beta, de modo que μi=exiβ\mu_i = e^{\mathbf{x}_i'\boldsymbol\beta}, donde xi=(1,Xi1,,Xi,p1)\mathbf{x}_i = (1, X_{i1}, \dots, X_{i,p-1})' es el vector de predictores para el caso ii:

(β)=i=1n[yixiβexiβlog(yi!)].\ell(\boldsymbol\beta) = \sum_{i=1}^n \Big[ y_i\, \mathbf{x}_i'\boldsymbol\beta - e^{\mathbf{x}_i'\boldsymbol\beta} - \log(y_i!) \Big] .

Para maximizar, deriva con respecto al vector de coeficientes e iguala el resultado a cero. El último término no involucra a β\boldsymbol\beta. Para los dos primeros, usando (xiβ)/β=xi\partial (\mathbf{x}_i'\boldsymbol\beta)/\partial \boldsymbol\beta = \mathbf{x}_i y exiβ/β=exiβxi=μixi\partial e^{\mathbf{x}_i'\boldsymbol\beta}/\partial \boldsymbol\beta = e^{\mathbf{x}_i'\boldsymbol\beta}\mathbf{x}_i = \mu_i \mathbf{x}_i,

β=i=1n(yixiμixi)=i=1n(yiμi)xi=0.\frac{\partial \ell}{\partial \boldsymbol\beta} = \sum_{i=1}^n \Big( y_i \mathbf{x}_i - \mu_i \mathbf{x}_i \Big) = \sum_{i=1}^n (y_i - \mu_i)\,\mathbf{x}_i = \mathbf{0} .

Estas son las ecuaciones de puntaje (score equations) de la regresión de Poisson. Lee la primera componente (la del intercepto, donde xi\mathbf{x}_i tiene un 1): dice i(yiμ^i)=0\sum_i (y_i - \hat\mu_i) = 0, las medias ajustadas reproducen el conteo total. Cada otra componente dice i(yiμ^i)Xij=0\sum_i (y_i - \hat\mu_i) X_{ij} = 0, los residuos yiμ^iy_i - \hat\mu_i son ortogonales a cada predictor. Estos son los análogos de las ecuaciones normales de 2.2 Mínimos cuadrados desde los primeros principios, con la media ajustada μ^i\hat\mu_i desempeñando el papel del valor ajustado. La diferencia es que μ^i=exib\hat\mu_i = e^{\mathbf{x}_i'\mathbf{b}} es no lineal en los coeficientes, así que a diferencia de los mínimos cuadrados no hay solución en forma cerrada. Las ecuaciones se resuelven por los mismos mínimos cuadrados reponderados iterativamente que ajustan la regresión logística, esbozados en 13.2 Ajuste por máxima verosimilitud; el software lo ejecuta en un puñado de pasos. \blacksquare

Fíjate en lo poco que cambió respecto a la regresión logística. Allá las ecuaciones de puntaje eran i(yiπ^i)xi=0\sum_i (y_i - \hat\pi_i)\mathbf{x}_i = \mathbf{0} con π^i\hat\pi_i una probabilidad; aquí son i(yiμ^i)xi=0\sum_i (y_i - \hat\mu_i)\mathbf{x}_i = \mathbf{0} con μ^i\hat\mu_i un conteo medio. Misma forma, distinto modelo de la media. La Sección 14.6 muestra que esto no es un accidente.

R

La función de ajuste es glm, la misma que se usa para la regresión logística, con family = poisson. El enlace por defecto para la familia de Poisson es el logarítmico, así que rara vez lo nombras.

gala <- read.csv("data/gala.csv")
pois_fit <- glm(Species ~ Area + Elevation + Nearest + Scruz + Adjacent,
                family = poisson, data = gala)
summary(pois_fit)
Call:
glm(formula = Species ~ Area + Elevation + Nearest + Scruz +
    Adjacent, family = poisson, data = gala)

Coefficients:
              Estimate Std. Error z value Pr(>|z|)
(Intercept)  3.155e+00  5.175e-02  60.963  < 2e-16 ***
Area        -5.799e-04  2.627e-05 -22.074  < 2e-16 ***
Elevation    3.541e-03  8.741e-05  40.507  < 2e-16 ***
Nearest      8.826e-03  1.821e-03   4.846 1.26e-06 ***
Scruz       -5.709e-03  6.256e-04  -9.126  < 2e-16 ***
Adjacent    -6.630e-04  2.933e-05 -22.608  < 2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

(Dispersion parameter for poisson family taken to be 1)

    Null deviance: 3510.73  on 29  degrees of freedom
Residual deviance:  716.85  on 24  degrees of freedom
AIC: 889.68

Number of Fisher Scoring iterations: 5

Guiar el enlace logarítmico a mano es la forma más rápida de sentir lo que hace la máxima verosimilitud, así que toma tú los dos coeficientes y deja que la log-verosimilitud te avise cuando estés cerca.

Mueve b0 y b1 para ajustar a mano los conteos de especies de las Galápagos contra la elevación. La curva exp(b0 + b1 x) nunca puede bajar de cero, la razón de tasas que se muestra es exp(b1), el multiplicador por cada 100 metros, y la banda ámbar es la dispersión de Poisson dentro de la cual se supone que deben quedar los conteos. Volver a la Sección 14.2.

14.3 Desplazamientos: modelar una tasa en vez de un conteo

Intuición

Los conteos crudos solo son comparables cuando vienen de igualdad de oportunidad. Un buque de carga en el mar durante 40,000 meses tiene mucha más probabilidad de sufrir daño por oleaje que uno en el mar durante 100 meses, así que comparar sus conteos crudos de incidentes carece de sentido. Lo que queremos es la tasa: incidentes por mes de servicio. La exposición, meses de servicio, difiere de barco a barco y debe integrarse al modelo, no ignorarse.

El arreglo es elegante. Modela la tasa como log-lineal, luego reescríbela como un modelo del conteo con una pieza fija añadida al predictor lineal. Esa pieza fija, el logaritmo de la exposición, se llama desplazamiento (offset) (Definición 14.4): un predictor cuyo coeficiente no se estima sino que se fija en uno, porque sabemos exactamente cómo debería escalar el conteo con la exposición. Duplica los meses en el mar y, en igualdad de condiciones, esperas el doble de incidentes. Figure 8 muestra por qué los conteos crudos engañan: el tipo de barco B tiene por mucho el mayor número de incidentes, pero también por mucho el mayor servicio; por mes de servicio su tasa de daño es ordinaria.

Dos gráficas de barras de los cinco tipos de barco A a E. La gráfica izquierda muestra el total de incidentes de daño; el tipo B se eleva por encima de los demás con bastante más de cien incidentes mientras el resto son mucho más pequeños. La gráfica derecha muestra incidentes por mil meses de servicio; ahora el tipo B es poco notable e intermedio, mientras los tipos A y E muestran las tasas de daño más altas, invirtiendo el orden de la gráfica izquierda.

Figure 8:Por qué importa la exposición. Izquierda: los incidentes de daño crudos hacen que el tipo de barco B parezca por mucho el peor. Derecha: una vez que dividimos por meses de servicio para obtener una tasa, el tipo B es promedio y los tipos A y E son los preocupantes. El desplazamiento es lo que le permite al modelo comparar tasas en vez de conteos crudos.

Fórmula

Sea tit_i la exposición para el caso ii (meses de servicio, personas-año, área inspeccionada) y sea λi\lambda_i la tasa de eventos por unidad de exposición. La media del conteo es la tasa por la exposición, μi=λiti\mu_i = \lambda_i t_i. Modela el logaritmo de la tasa como lineal:

logλi=β0+β1Xi1++βp1Xi,p1.\log \lambda_i = \beta_0 + \beta_1 X_{i1} + \dots + \beta_{p-1} X_{i,p-1} .

Derivación (el desplazamiento). Como μi=λiti\mu_i = \lambda_i t_i, toma logaritmos:

logμi=logλi+logti=β0+β1Xi1++βp1Xi,p1estimado+logtidesplazamiento fijo.\log \mu_i = \log \lambda_i + \log t_i = \underbrace{\beta_0 + \beta_1 X_{i1} + \dots + \beta_{p-1} X_{i,p-1}}_{\text{estimado}} + \underbrace{\log t_i}_{\text{desplazamiento fijo}} .

En palabras: modelar el logaritmo de la tasa es lo mismo que modelar el logaritmo del conteo con logti\log t_i añadido al predictor lineal como un término con coeficiente conocido exactamente uno. Ese término extra es el desplazamiento. Desplaza el predictor lineal de cada caso por su logaritmo de exposición sin costar un parámetro, así que los coeficientes estimados describen la tasa λi\lambda_i, y eβje^{\beta_j} es ahora una razón de tasas por unidad de exposición. Si erróneamente quitaras el desplazamiento, el modelo explicaría los incidentes en parte a través de cualquier predictor que resulte correlacionado con el tiempo de servicio, confundiendo la tasa con la exposición. \blacksquare

R

Los barcos con cero servicio registrado no aportan exposición ni oportunidad de incidentes, así que logti\log t_i está indefinido para ellos; primero descartamos esas filas. El desplazamiento entra a través del argumento offset.

ships <- read.csv("data/ships.csv")
ships <- ships[ships$service > 0, ]
ships$year   <- factor(ships$year)
ships$period <- factor(ships$period)
ship_fit <- glm(incidents ~ type + year + period,
                family = poisson, offset = log(service), data = ships)
round(summary(ship_fit)$coefficients, 4)
            Estimate Std. Error  z value Pr(>|z|)
(Intercept)  -6.4059     0.2174 -29.4600   0.0000
typeB        -0.5433     0.1776  -3.0595   0.0022
typeC        -0.6874     0.3290  -2.0891   0.0367
typeD        -0.0760     0.2906  -0.2614   0.7938
typeE         0.3256     0.2359   1.3803   0.1675
year65        0.6971     0.1496   4.6587   0.0000
year70        0.8184     0.1698   4.8207   0.0000
year75        0.4534     0.2332   1.9446   0.0518
period75      0.3845     0.1183   3.2507   0.0012

Un desplazamiento se cree más fácil cuando ya probaste las alternativas, así que pon el exponente de exposición bajo tu dedo y mira qué afirma cada ajuste sobre los barcos.

Pon el exponente de exposición en 0 y el modelo ignora del todo los meses en el mar, prediciendo el mismo puñado de incidentes para un barco con 45 meses de servicio y para uno con 44,882. Ponlo en 1 y duplicar el servicio duplica el conteo esperado, que es exactamente lo que fija el desplazamiento log t. Volver a la Sección 14.3.

14.4 Sobredispersión y la corrección cuasi-Poisson

Intuición

El modelo de Poisson hace una promesa fuerte: la varianza es igual a la media. Los datos de conteo reales a menudo rompen esa promesa dispersándose más de lo que Poisson permite, una condición llamada sobredispersión (overdispersion) (Definición 14.5). Sus causas son ordinarias: predictores que no mediste, agrupamiento de eventos, diferencias de individuo a individuo en la tasa subyacente. Sea cual sea la causa, el síntoma es el mismo, los conteos se dispersan más ancho que sus medias ajustadas.

La sobredispersión rara vez cambia mucho las estimaciones de los coeficientes, pero arruina sus errores estándar. Un ajuste de Poisson que supone varianza igual a la media, cuando la varianza verdadera es varias veces mayor, reporta errores estándar varias veces demasiado pequeños, convirtiendo el ruido en falsa significancia. Así que la sobredispersión no es una molestia para encogerse de hombros; es la diferencia entre un análisis honesto y uno engañoso. Figure 10 muestra el diagnóstico para el ajuste de las Galápagos: los residuos al cuadrado, que deberían rondar la media ajustada bajo un verdadero Poisson, quedan muy por encima de la línea de varianza igual a la media.

Un diagrama de dispersión para el ajuste de Poisson de las Galápagos con la media ajustada en el eje horizontal y la desviación al cuadrado en el eje vertical, ambos en escalas logarítmicas. Una línea de referencia diagonal marca donde la desviación al cuadrado es igual a la media ajustada, la promesa de Poisson. Casi toda isla queda bastante por encima de la línea, muchas por uno o dos órdenes de magnitud, mostrando que los conteos varían mucho más de lo que Poisson permite.

Figure 10:Diagnosticar la sobredispersión en el ajuste de las Galápagos. Bajo un verdadero Poisson las desviaciones al cuadrado se dispersarían alrededor de la diagonal (varianza igual a la media). En cambio casi toda isla queda muy por encima de ella, así que los datos varían mucho más de lo que el modelo de Poisson afirma, y los errores estándar del modelo no pueden confiarse tal como están.

Fórmula

Mide la dispersión con el estadístico de Pearson (Pearson statistic) (Definición 14.6) dividido entre sus grados de libertad. Define el residuo de Pearson para el caso ii y la dispersión estimada ϕ^\hat\phi:

riP=Yiμ^iμ^i,ϕ^=1npi=1n(riP)2=X2np.r_i^{P} = \frac{Y_i - \hat\mu_i}{\sqrt{\hat\mu_i}}, \qquad \hat\phi = \frac{1}{n-p}\sum_{i=1}^n \big(r_i^{P}\big)^2 = \frac{X^2}{n-p} .

En palabras: ϕ^\hat\phi es el residuo estandarizado al cuadrado promedio. Bajo un modelo de Poisson correcto debería estar cerca de 1. Un valor bastante por encima de 1 señala sobredispersión; un valor de ϕ^\hat\phi alrededor de 2 significa que la varianza verdadera es aproximadamente el doble de la media, y así sucesivamente.

La corrección cuasi-Poisson mantiene intactos el modelo de la media de Poisson y sus estimaciones de coeficientes, porque las ecuaciones de puntaje i(yiμi)xi=0\sum_i (y_i - \mu_i)\mathbf{x}_i = \mathbf{0} no involucran la varianza. Solo reescala la varianza, suponiendo

Var{Yi}=ϕμi\operatorname{Var}\{Y_i\} = \phi\, \mu_i

para una constante desconocida ϕ>1\phi > 1, estimada por ϕ^\hat\phi. Cada error estándar se multiplica entonces por ϕ^\sqrt{\hat\phi}:

squasi{bj}=ϕ^  sPoisson{bj}.s_{\text{quasi}}\{b_j\} = \sqrt{\hat\phi}\; s_{\text{Poisson}}\{b_j\} .

En palabras: infla cada error estándar de Poisson por la raíz cuadrada de la dispersión estimada. Esta es la misma idea que viste en 10.4 Mínimos cuadrados ponderados, donde modelar la varianza no constante cambió los pesos y los errores estándar mientras dejaba intacta la historia de la media. Aquí se permite que la varianza sea un múltiplo constante de la media en vez de exactamente la media.

R

glm reporta el supuesto de dispersión crudo, así que calcula ϕ^\hat\phi directamente a partir de los residuos de Pearson, luego reajusta con family = quasipoisson, que hace el reescalado por ti.

phi_hat <- sum(residuals(pois_fit, type = "pearson")^2) / df.residual(pois_fit)
phi_hat
[1] 31.74914

Figure 11 lleva el punto a casa a lo largo de los cinco predictores: dividir cada estadístico de prueba entre ϕ^\sqrt{\hat\phi} jala dos de ellos por debajo del umbral aproximado de significancia que el Poisson ingenuo les hacía superar con holgura.

Una gráfica de barras agrupadas con los cinco predictores de las Galápagos Area, Elevation, Nearest, Scruz y Adjacent en el eje horizontal. Para cada predictor dos barras muestran el valor absoluto del estadístico de prueba, una barra de Poisson más alta y una barra cuasi-Poisson mucho más corta, cerca de 5.6 veces más pequeña. Una línea horizontal discontinua en 2 marca el umbral aproximado de significancia. Bajo Poisson las cinco barras se elevan muy por encima de la línea; bajo cuasi-Poisson, Nearest y Scruz caen por debajo de la línea mientras Area, Elevation y Adjacent se quedan por encima.

Figure 11:El costo de ignorar la sobredispersión. Los estadísticos de prueba de Poisson ingenuo (barras altas) están todos muy por encima del corte aproximado de significancia de 2 (línea discontinua). Dividir entre la raíz cuadrada de la dispersión da los estadísticos cuasi-Poisson honestos (barras cortas), y dos predictores, Nearest y Scruz, caen por debajo del corte.

Una mención al binomial negativo

El cuasi-Poisson es un parche rápido y ligero en supuestos: no nombra una distribución de probabilidad, solo reescala varianzas. Cuando quieres una verosimilitud genuina, y por lo tanto AIC, pruebas de razón de verosimilitud, e intervalos de predicción honestos, la elección estándar es el modelo binomial negativo (negative binomial). Añade un parámetro θ\theta y permite que la varianza crezca cuadráticamente, Var{Y}=μ+μ2/θ\operatorname{Var}\{Y\} = \mu + \mu^2/\theta, lo que ajusta mejor la sobredispersión fuerte que la varianza estrictamente lineal del cuasi-Poisson. En R es MASS::glm.nb; los datos de las Galápagos dan θ^=1.67\hat\theta = 1.67, lo bastante pequeño para confirmar sobredispersión severa. Para este curso, diagnostica con ϕ^\hat\phi, echa mano del cuasi-Poisson como el arreglo de todos los días, y ten presente que el binomial negativo es el siguiente paso cuando necesitas una verosimilitud completa.

La dispersión es solo un número hasta que la ves mover un valor p, así que arrástrala tú y mira qué predictores de las Galápagos sobreviven a la corrección.

Sube la dispersión hasta que la línea ámbar cuasi-Poisson por fin supere la nube de islas, cerca de 32, y observa cómo los estadísticos de prueba de Nearest y Scruz bajan de 2 mientras cada error estándar se infla por la raíz cuadrada de phi. Volver a la Sección 14.4.

14.5 El hilo de las Galápagos, resuelto

Ahora podemos cerrar la historia que ha corrido desde el Capítulo 9. Recuerda las dos visitas anteriores. El Capítulo 9 hizo de los datos de las Galápagos su lección sobre influencia: Isabela, la isla más grande, es el punto de alto apalancamiento al que apunta 9.1 Los valores de apalancamiento y la matriz sombrero, uno que un ajuste de mínimos cuadrados ordinarios no puede evitar perseguir, porque queda solo en el borde más lejano del espacio de predictores. En 10.2 La transformación logarítmica y la lectura de sus coeficientes y 10.3 Box-Cox: dejar que los datos elijan la potencia probaste el remedio clásico, transformar la respuesta, tomando logaritmos o una potencia de Box-Cox para domar el sesgo y la dispersión creciente. Mejoró las gráficas de residuos, pero nunca quitó la incomodidad, porque el problema real nunca fue la escala de una respuesta continua. La respuesta era un conteo, y ninguna transformación de un conteo lo convierte en una medición normal de varianza constante.

El modelo de Poisson corrige el defecto real. Integra la no negatividad, la estructura multiplicativa, y el vínculo media-varianza que los conteos de especies genuinamente tienen, y una vez que tomamos en cuenta la sobredispersión sus errores estándar son honestos. Figure 13 pone las dos filosofías lado a lado: la curva de log-transformar-luego-mínimos-cuadrados del Capítulo 10, y la curva de la media cuasi-Poisson de este capítulo, ambas contra los conteos crudos en un eje de área logarítmica. Coinciden en el medio y se separan en los extremos, donde el modelo de conteo mantiene las predicciones positivas y deja que la dispersión se ensanche como debe.

Un diagrama de dispersión de los conteos de especies de las Galápagos contra el área de la isla en un eje horizontal logarítmico, con dos curvas ajustadas superpuestas. Una curva discontinua etiquetada mínimos cuadrados con log-transformación del Capítulo 10 y una curva sólida etiquetada Poisson del Capítulo 14 ambas suben con el área y siguen los datos de cerca por el medio. En las islas más pequeñas la curva de mínimos cuadrados sobre logaritmos se dobla de forma distinta mientras la curva de Poisson se mantiene positiva y se pega a los conteos bajos; la dispersión de los datos es visiblemente más apretada en los conteos pequeños y más ancha en los conteos grandes.

Figure 13:La resolución. La curva de transformar-y-ajustar del Capítulo 10 y el modelo de conteo del Capítulo 14 coinciden donde los datos son densos y divergen en los extremos. El modelo de Poisson está construido para lo que la respuesta es, un conteo, así que mantiene las predicciones positivas y coincide con la forma en que la dispersión crece con la media.

La lección es más grande que un archipiélago. Las transformaciones del Capítulo 10 son la herramienta correcta cuando una respuesta continua está en una escala incómoda. Cuando la respuesta es una clase de cosa fundamentalmente distinta, un conteo, un sí o no, una tasa, no doblas la respuesta para que encaje en el modelo lineal; cambias el modelo. Ese cambio es el tema de la última sección, y es la razón por la que la regresión logística y la de Poisson pertenecen al mismo curso que los mínimos cuadrados.

Así que la primera decisión en cualquier análisis no es qué predictores usar; es qué clase de cosa es la respuesta. Figure 14 convierte esa decisión en un diagrama de flujo breve: nombra el tipo de respuesta, sigue la flecha, y aterrizas en el modelo correspondiente. La siguiente sección muestra por qué los cuatro destinos son en realidad una sola máquina.

Un diagrama de flujo de decisión. Una caja en la parte superior pregunta qué clase de cosa es la respuesta. Cuatro flechas se abren hacia abajo a cuatro cajas de tipo de respuesta: continua y aproximadamente simétrica; continua, positiva y sesgada; un conteo 0, 1, 2, 3 y así sucesivamente; y sí o no o una proporción. Cada caja de respuesta apunta hacia abajo a su modelo: regresión lineal con una distribución Normal y enlace identidad; una transformación del Capítulo 10 o un MLG gamma; regresión de Poisson con enlace logarítmico; y regresión logística con una distribución Binomial y enlace logit. Debajo de la caja de Poisson cuelgan dos cajas más: una que dice si la respuesta es una tasa, añade un desplazamiento de log t por exposición, y una que dice si los conteos están demasiado dispersos, revisa phi-sombrero y usa cuasi-Poisson.

Figure 14:Diagnostica la respuesta, luego elige el modelo. Comienza arriba, decide qué clase de cantidad es la respuesta, y el diagrama de flujo te dirige al modelo correspondiente. Los conteos llevan a la regresión de Poisson, con un desplazamiento cuando la respuesta es en realidad una tasa y una corrección cuasi-Poisson cuando los conteos están sobredispersos.

14.6 Una familia: el modelo lineal generalizado

Intuición

Da un paso atrás y mira lo que comparten los últimos tres capítulos. La regresión ordinaria modela una media continua como una recta. La regresión logística modela una probabilidad pasando una recta a través del enlace logit. La regresión de Poisson modela un conteo pasando una recta a través del enlace logarítmico. En cada caso hay un predictor lineal η=xβ\eta = \mathbf{x}'\boldsymbol\beta haciendo el mismo trabajo; lo que cambia son solo dos elecciones: qué distribución de probabilidad sigue la respuesta, y qué función de enlace conecta su media con el predictor lineal. Fija esas dos elecciones y todo lo demás, la estimación por máxima verosimilitud, la devianza, el flujo de trabajo, es maquinaria compartida. Ese es el modelo lineal generalizado (generalized linear model), o MLG (Definición 14.8).

Fórmula

Un modelo lineal generalizado tiene tres partes:

Yiuna distribucioˊn de la familia exponencialcomponente aleatorio,ηi=xiβpredictor lineal,g(μi)=ηienlace.\underbrace{Y_i \sim \text{una distribución de la familia exponencial}}_{\text{componente aleatorio}}, \qquad \underbrace{\eta_i = \mathbf{x}_i'\boldsymbol\beta}_{\text{predictor lineal}}, \qquad \underbrace{g(\mu_i) = \eta_i}_{\text{enlace}} .

En palabras: elige una distribución y un enlace, y has especificado un modelo; el mismo motor de estimación los ajusta todos. Los tres modelos de esta parte son tres filas de una sola tabla.

ModeloRespuestaDistribuciónEnlace g(μ)g(\mu)Modelo de la mediaVar{Y}\operatorname{Var}\{Y\}Capítulo
LinealcontinuaNormalidentidad μ\muμ=xβ\mu = \mathbf{x}'\boldsymbol\betaσ2\sigma^2 (constante)2 a 8
Logísticabinaria / proporciónBinomiallogit logμ1μ\log\frac{\mu}{1-\mu}μ=exβ1+exβ\mu = \dfrac{e^{\mathbf{x}'\boldsymbol\beta}}{1+e^{\mathbf{x}'\boldsymbol\beta}}μ(1μ)\mu(1-\mu)13
PoissonconteoPoissonlog logμ\log\muμ=exβ\mu = e^{\mathbf{x}'\boldsymbol\beta}μ\mu14

Figure 15 dibuja la misma idea como un diagrama: un predictor lineal alimentando tres enlaces hacia tres tipos de respuesta.

Un diagrama esquemático. A la izquierda, una sola caja etiquetada predictor lineal eta igual a x-transpuesta beta. Una flecha se abre hacia tres cajas de enlace apiladas verticalmente: identidad, logit y log. Cada caja de enlace apunta a una caja de respuesta a la derecha: identidad apunta a una respuesta continua con una distribución normal y varianza constante, logit apunta a una respuesta binaria con una distribución binomial y varianza mu por uno menos mu, log apunta a una respuesta de conteo con una distribución de Poisson y varianza igual a mu. Una franja de leyenda debajo dice un predictor lineal, un motor de estimación, tres familias.

Figure 15:El modelo lineal generalizado en una imagen. Un solo predictor lineal alimenta tres enlaces distintos hacia tres tipos de respuesta distintos. Cambia el enlace y la familia y te mueves entre la regresión lineal, la logística y la de Poisson sin cambiar la maquinaria de estimación subyacente.

R

La unificación no es solo conceptual; es literalmente cómo está construido el software. La función glm ajusta cada fila de la tabla, y elegir family = gaussian(link = "identity") reproduce los mínimos cuadrados ordinarios exactamente.

14.7 Resumen del capítulo

Ahora puedes modelar conteos. Este capítulo comenzó con por qué los mínimos cuadrados ordinarios son la herramienta equivocada para un conteo, cuyo comportamiento no negativo, de número entero, y de media-igual-a-varianza viola la respuesta no acotada de varianza constante que el modelo lineal supone. La reparación fue el modelo log-lineal de Poisson, que modela el logaritmo de la media como un predictor lineal para que la media ajustada se mantenga positiva y cada coeficiente se lea como una razón de tasas eβje^{\beta_j}. Maximizar la log-verosimilitud de Poisson dio ecuaciones de puntaje de exactamente la misma forma que las ecuaciones normales del Capítulo 2. Un desplazamiento, el logaritmo de la exposición entrando con coeficiente fijo uno, convirtió el modelo de conteo en un modelo de tasa para los datos de barcos. La dispersión de Pearson ϕ^\hat\phi diagnosticó la sobredispersión severa en los conteos de las Galápagos, y la corrección cuasi-Poisson infló los errores estándar a tamaños honestos mientras dejaba en paz las estimaciones. Eso finalmente cerró el hilo de las Galápagos de los Capítulos 9 y 10: el problema nunca fue la escala de la respuesta, era que la respuesta es un conteo. Y todo ello, junto con los modelos lineal y logístico, son tres filas de una sola tabla del modelo lineal generalizado.

Resultados clave de un vistazo

ResultadoEnunciado o fórmulaVálido cuando
Distribución de Poisson (Def 14.1)P(Y=y)=eμμy/y!P(Y=y) = e^{-\mu}\mu^y / y!,  E{Y}=Var{Y}=μ\ E\{Y\}=\operatorname{Var}\{Y\}=\murespuesta de conteo, eventos raros e independientes a una tasa estable
Modelo log-lineal de Poisson (Def 14.2)logμi=xiβ\log \mu_i = \mathbf{x}_i'\boldsymbol\beta, así que μi=exiβ\mu_i = e^{\mathbf{x}_i'\boldsymbol\beta}la media debe ser positiva y multiplicativa en los predictores
Razón de tasasμ(Xj+1)/μ(Xj)=eβj\mu(X_j+1)/\mu(X_j) = e^{\beta_j}interpretar un coeficiente log-lineal
Ecuaciones de puntaje de Poisson (Thm 14.3)i(yiμ^i)xi=0\sum_i (y_i - \hat\mu_i)\mathbf{x}_i = \mathbf{0}ajuste por máxima verosimilitud del modelo log-lineal
Desplazamiento (Def 14.4)logμi=xiβ+logti\log\mu_i = \mathbf{x}_i'\boldsymbol\beta + \log t_imodelar una tasa con exposición tit_i
Dispersión de Pearson (Def 14.6)ϕ^=X2/(np)\hat\phi = X^2/(n-p)revisar el supuesto de varianza-igual-a-media
Error estándar cuasi-Poisson (Def 14.7)squasi=ϕ^sPoissons_{\text{quasi}} = \sqrt{\hat\phi}\, s_{\text{Poisson}}sobredispersión, ϕ^>1\hat\phi > 1
Modelo lineal generalizado (Def 14.8)familia ++ enlace g(μ)=ηg(\mu)=\etacualquier respuesta de la familia exponencial

Términos clave. distribución de Poisson, modelo de regresión log-lineal de Poisson, predictor lineal, función de enlace, razón de tasas, ecuaciones de puntaje, desplazamiento, exposición, sobredispersión, dispersión de Pearson, cuasi-Poisson, binomial negativo, modelo lineal generalizado.

Ahora deberías ser capaz de

Dónde encaja esto. En la columna vertebral del flujo de trabajo de El flujo de trabajo del modelado este capítulo vive sobre todo en AJUSTAR y REVISAR, con una fuerte recompensa en USAR. El modelo log-lineal de Poisson es un paso de AJUSTAR para una respuesta que las herramientas de AJUSTAR de los capítulos anteriores no podían manejar; el diagnóstico de sobredispersión es un paso de REVISAR, el análogo para datos de conteo de las revisiones de varianza de residuos del Capítulo 9 y del modelado de varianza de 10.4 Mínimos cuadrados ponderados; y leer los coeficientes como razones de tasas es el paso de USAR, el primo para datos de conteo de las razones de momios de 13.3 Leer los coeficientes como razones de momios. Mirando atrás, este capítulo completa el arco que comenzó cuando el Capítulo 13 rompió por primera vez con la respuesta normal: la regresión logística manejó el sí o no, la regresión de Poisson maneja el cuántos, y la tabla del MLG muestra ambas como extensiones de los mínimos cuadrados que conoces desde el Capítulo 2. Mirando adelante, el mismo hábito de “elige una familia y un enlace” se lleva a los modelos gamma para datos positivos sesgados, los modelos multinomiales para varias categorías, y los modelos mixtos y jerárquicos que un segundo curso de regresión aborda.

14.8 Preguntas frecuentes

P1. ¿No puedo simplemente log-transformar los conteos y correr mínimos cuadrados ordinarios? Puedes, y la gente lo hizo durante décadas, pero tiene costos reales. Los conteos de cero hacen que log0\log 0 sea indefinido, forzando parches incómodos de “sumar 0.5”. Las predicciones retransformadas describen una mediana, no una media, así que no suman correctamente. Y el supuesto de varianza constante sigue siendo erróneo incluso después de tomar logaritmos. La regresión de Poisson esquiva los tres modelando el conteo directamente en sus propios términos.

P2. ¿Por qué el enlace logarítmico específicamente? ¿Podría usar uno distinto? El enlace logarítmico es la elección natural porque hace multiplicativos los coeficientes (razones de tasas), mantiene la media positiva, y es el enlace “canónico” que hace más limpia la matemática de Poisson. Puedes usar otros (el enlace identidad da un modelo de conteo aditivo, ocasionalmente útil), pero el enlace logarítmico es el que viene por defecto por buenas razones y es lo que significa “regresión de Poisson” a menos que se diga otra cosa.

P3. Mi dispersión es ϕ^=0.8\hat\phi = 0.8, por debajo de 1. ¿Es subdispersión, y la corrijo? Los valores modestamente por debajo de 1 son comunes y por lo general inofensivos; hacen los errores estándar de Poisson ligeramente conservadores (demasiado grandes), así que tus pruebas son, en todo caso, demasiado cautelosas. La subdispersión genuina (de, digamos, conteos que son más regulares que aleatorios, como huevos en un cartón lleno) existe pero es rara. Preocúpate por ϕ^\hat\phi bastante por encima de 1, no modestamente por debajo.

P4. ¿El cuasi-Poisson cambia mis estimaciones de coeficientes? No. Los coeficientes resuelven las ecuaciones de puntaje i(yiμi)xi=0\sum_i (y_i - \mu_i)\mathbf{x}_i = \mathbf{0}, que nunca mencionan la varianza, así que el cuasi-Poisson los deja idénticos al ajuste de Poisson. Solo cambian los errores estándar, y por lo tanto los valores p y los intervalos de confianza. Ese es todo el punto: las estimaciones estaban bien, la incertidumbre estaba subestimada.

P5. ¿Cuándo debería usar el binomial negativo en vez del cuasi-Poisson? Usa el cuasi-Poisson para una corrección rápida y libre de distribución a los errores estándar. Echa mano del binomial negativo cuando necesites una verosimilitud genuina: para comparar modelos por AIC, para correr pruebas de razón de verosimilitud, o para formar intervalos de predicción para conteos nuevos. El binomial negativo también ajusta mejor la sobredispersión muy fuerte porque su varianza crece cuadráticamente en la media.

P6. ¿Por qué descartar los barcos con cero servicio no sesgó el análisis? Un barco con cero meses de servicio no tuvo oportunidad de sufrir daño, así que no acarrea información sobre la tasa de daño, y log0\log 0 está indefinido de todas formas. Quitar filas con cero exposición es estándar y correcto; no estás descartando datos informativos, estás descartando filas que no tuvieron exposición que modelar.

P7. El Poisson y el cuasi-Poisson dieron la misma devianza residual. ¿No debería la corrección cambiar el ajuste? La devianza mide qué tan lejos quedan las medias ajustadas de los datos, y el cuasi-Poisson no mueve las medias ajustadas, así que la devianza no cambia. Lo que cambia es cómo juzgamos la devianza y los coeficientes contra el azar: el cuasi-Poisson divide entre la dispersión, así que la misma devianza ahora cuenta una historia más cautelosa.

14.9 Problemas de práctica

  1. (A) Enumera los tres rasgos de los datos de conteo que el modelo lineal ordinario no respeta, y di qué supuesto del modelo viola cada uno.

  2. (A) Enuncia la media y la varianza de una variable aleatoria de Poisson. ¿Por qué este único hecho hace de los mínimos cuadrados de varianza constante el modelo equivocado para conteos?

  3. (A) En un modelo log-lineal de Poisson un predictor tiene coeficiente b=0.5b = 0.5. Enuncia su razón de tasas e interprétala en palabras.

  4. (A) Explica en una o dos oraciones qué es un desplazamiento y por qué su coeficiente se fija en uno en vez de estimarse.

  5. (A) Un ajuste de Poisson y su reajuste cuasi-Poisson reportan coeficientes idénticos pero errores estándar distintos. Explica por qué.

  6. (A) Define la sobredispersión y nombra dos causas ordinarias de ella en datos de conteo reales.

  7. (A) Da la familia y la función de enlace para cada fila del MLG: regresión lineal, regresión logística, regresión de Poisson.

  8. (A) Un colega calcula tasas de crimen como crimes / population y ajusta mínimos cuadrados ordinarios. Da dos razones por las que un modelo de Poisson basado en un desplazamiento es mejor.

  9. (A) ¿Por qué un modelo de Poisson nunca puede predecir un conteo negativo, cualesquiera que sean los valores de los predictores? Señala la pieza del modelo que lo garantiza.

  10. (B) Partiendo de la fmp de Poisson P(Y=y)=eμμy/y!P(Y=y) = e^{-\mu}\mu^y/y!, escribe la log-verosimilitud para conteos independientes y1,,yny_1, \dots, y_n con logμi=xiβ\log\mu_i = \mathbf{x}_i'\boldsymbol\beta, y deriva las ecuaciones de puntaje i(yiμi)xi=0\sum_i (y_i - \mu_i)\mathbf{x}_i = \mathbf{0} (Teorema 14.3).

  11. (B) A partir de las ecuaciones de puntaje del problema 10, muestra que la componente del intercepto obliga a iμ^i=iyi\sum_i \hat\mu_i = \sum_i y_i: las medias ajustadas reproducen el conteo total observado.

  12. (B) Muestra que las ecuaciones de puntaje de Poisson tienen la misma forma i(yim^i)xi=0\sum_i (y_i - \hat m_i)\mathbf{x}_i = \mathbf{0} que las ecuaciones de puntaje logísticas del Capítulo 13 y las ecuaciones normales del Capítulo 2, identificando qué es m^i\hat m_i en cada caso.

  13. (B) Deriva el resultado del desplazamiento: partiendo de μi=λiti\mu_i = \lambda_i t_i y logλi=xiβ\log\lambda_i = \mathbf{x}_i'\boldsymbol\beta, muestra que logμi=xiβ+logti\log\mu_i = \mathbf{x}_i'\boldsymbol\beta + \log t_i, y explica por qué logti\log t_i entra con coeficiente uno.

  14. (B) Muestra que en un modelo log-lineal de Poisson con un solo predictor binario X{0,1}X \in \{0, 1\}, el coeficiente β1\beta_1 es igual a log(μ1/μ0)\log(\mu_1/\mu_0), el logaritmo de la razón de conteos medios entre los dos grupos. Por lo tanto eβ1e^{\beta_1} es esa razón.

  15. (B) El modelo cuasi-Poisson supone Var{Yi}=ϕμi\operatorname{Var}\{Y_i\} = \phi\mu_i. Explica por qué este reescalado multiplica cada error estándar de coeficiente por ϕ\sqrt\phi pero deja las estimaciones de los coeficientes sin cambios, refiriéndote a las ecuaciones de puntaje.

  16. (B) Escribe el estadístico de Pearson X2=i(yiμ^i)2/μ^iX^2 = \sum_i (y_i - \hat\mu_i)^2/\hat\mu_i y explica por qué E{X2}npE\{X^2\} \approx n - p bajo un modelo de Poisson correcto, de modo que ϕ^=X2/(np)\hat\phi = X^2/(n-p) debería estar cerca de 1.

  17. (B) Para dos medias de Poisson μA\mu_A y μB\mu_B con exposiciones tA,tBt_A, t_B entradas como desplazamientos, muestra que la razón de tasas ajustada λB/λA=eβ\lambda_B/\lambda_A = e^{\beta} no depende de las exposiciones, así que la comparación es una comparación justa por exposición.

  18. (B) Explica por qué se usa la máxima verosimilitud, no los mínimos cuadrados, para ajustar el modelo de Poisson, y describe en palabras cómo los mínimos cuadrados reponderados iterativamente alcanzan las estimaciones (puedes citar el esbozo del Capítulo 13).

  19. (C) Ajusta el modelo de Poisson Species ~ Area + Elevation + Nearest + Scruz + Adjacent a gala.csv en R o Python. Reporta el coeficiente de Area y su razón de tasas para un aumento de 100 km2^2.

  20. (C) Para el ajuste de Poisson de las Galápagos, calcula la dispersión de Pearson ϕ^\hat\phi a partir de los residuos de Pearson y confirma que coincide con el valor 31.7 del capítulo. Enuncia qué dice sobre el modelo.

  21. (C) Reajusta el modelo de las Galápagos con family = quasipoisson (R) o la opción scale="X2" (Python). Reporta cuáles predictores son significativos al nivel del 5% bajo cuasi-Poisson pero eran significativos bajo Poisson ingenuo, y explica el cambio.

  22. (C) Ajusta el modelo de daño de los barcos incidents ~ type + year + period con offset = log(service) en las filas de servicio positivo. Reporta la razón de tasas de period75 e interprétala.

  23. (C) Reajusta el modelo de barcos sin el desplazamiento (quita el argumento offset). Compara los coeficientes de type con el modelo con desplazamiento y explica por qué cambian, conectando el cambio con la confusión de tasa y exposición.

  24. (C) Calcula la dispersión de Pearson ϕ^\hat\phi de los barcos, reajusta como cuasi-Poisson, y reporta cómo cambia el error estándar del coeficiente typeB. ¿Están los datos de barcos tan sobredispersos como los de las Galápagos?

  25. (C) Ajusta el modelo de Toluca hours ~ lotsize de dos maneras: lm y glm con family = gaussian(link = "identity"). Muestra que los coeficientes coinciden, y explica qué dice esto sobre la relación entre los mínimos cuadrados y el MLG.

  26. (C) Usando el ajuste de Poisson de las Galápagos, predice el conteo esperado de especies para una isla con Area = 40, Elevation = 200, Nearest = 1, Scruz = 30, Adjacent = 5. Haz la predicción en la escala del predictor lineal y luego exponencia, y confirma que el software da el mismo número con type = "response".

  27. (C) Ajusta un modelo binomial negativo a los datos de las Galápagos con MASS::glm.nb (R) o NegativeBinomial de statsmodels (Python) y reporta el θ\theta estimado. Compara su coeficiente de Elevation con los ajustes de Poisson y cuasi-Poisson.

  28. (C) Haz una gráfica diagnóstica de los residuos de Pearson al cuadrado contra las medias ajustadas para el ajuste de Poisson de las Galápagos, con la línea de referencia de varianza igual a la media, y describe qué muestra sobre la sobredispersión.

  29. (A) El Capítulo 10 probó transformaciones logarítmica y de Box-Cox sobre los conteos de especies de las Galápagos, y ayudaron con las gráficas de residuos pero nunca satisficieron del todo. Explica por qué el modelo de Poisson tiene éxito donde esas transformaciones se quedaron cortas. Nombra al menos dos defectos específicos de transformar un conteo que el modelo de conteo evita.

14.10 Práctica de examen

PE 14.1. La regresión de Poisson hace dos desviaciones de los mínimos cuadrados ordinarios: modela el logaritmo de la media en vez de la media misma, y estima los coeficientes por máxima verosimilitud en vez de minimizando una suma de cuadrados. Explica por qué cada desviación nos es impuesta por la naturaleza de los datos de conteo. Ata el enlace logarítmico a una propiedad específica de los conteos, y ata la elección de la máxima verosimilitud a otra.

PE 14.2. Un biólogo ajusta un modelo de Poisson de dos predictores a los datos de las Galápagos y te entrega esta salida. Interpreta el coeficiente de Elevation como una razón de tasas para un aumento de 100 metros, di qué significa el intercepto exponenciado y si describe alguna isla real, y enuncia si confiarías en los diminutos errores estándar tal como están.

gala <- read.csv("data/gala.csv")
f <- glm(Species ~ Elevation + Nearest, family = poisson, data = gala)
summary(f)
Coefficients:
             Estimate Std. Error z value Pr(>|z|)
(Intercept) 3.574e+00  3.819e-02  93.603  < 2e-16 ***
Elevation   1.475e-03  3.341e-05  44.151  < 2e-16 ***
Nearest     6.559e-03  1.444e-03   4.541 5.59e-06 ***

(Dispersion parameter for poisson family taken to be 1)

    Null deviance: 3510.7  on 29  degrees of freedom
Residual deviance: 1806.4  on 27  degrees of freedom

PE 14.3. En el modelo de daño de los barcos, ajustado con un desplazamiento de log(service)\log(\text{service}), un estudiante ve el coeficiente period75 =0.385= 0.385 y escribe: “Los barcos operados en el periodo posterior sufren 0.385 incidentes de daño más que los del periodo anterior”. Dos cosas distintas están mal con esa oración. Identifica y corrige ambas, luego escribe la afirmación que el estudiante debió haber hecho.

PE 14.4. Los dos ajustes de abajo son el mismo modelo de barcos, una vez con el desplazamiento de exposición y una vez sin él. Los coeficientes de type cambian de forma pronunciada. Explica qué le pasa al coeficiente del tipo B cuando se quita el desplazamiento y por qué, usando las cifras de exposición, y enuncia cuál de los dos ajustes responde a la pregunta “¿qué tipo de barco es el más peligroso de operar?”.

ships <- read.csv("data/ships.csv"); ships <- ships[ships$service > 0, ]
with_offset <- glm(incidents ~ type + year + period, family = poisson,
                   offset = log(service), data = ships)
no_offset   <- glm(incidents ~ type + year + period, family = poisson, data = ships)
type coefficients WITH offset:    typeB -0.5433  typeC -0.6874  typeD -0.0760  typeE  0.3256
type coefficients NO offset:      typeB  1.7957  typeC -1.2528  typeD -0.9045  typeE -0.1463

mean months of service by type:   A 1356   B 19760   C 885   D 635   E 855
total incidents by type:          A   42   B   253   C  12   D  17   E  32

PE 14.5. Para el ajuste completo de Poisson de las Galápagos con cinco predictores la dispersión de Pearson es ϕ^=31.7\hat\phi = 31.7. (a) Explica en contexto qué dice este único número sobre los conteos de especies y sobre los errores estándar de Poisson. (b) Un colega reajusta los mismos datos con un modelo binomial negativo y reporta θ^=1.675\hat\theta = 1.675 y un coeficiente de Elevation de 0.003855, contra el valor de Poisson 0.003541. Interpreta θ^\hat\theta, y explica por qué los dos coeficientes de elevación son casi idénticos aunque sus errores estándar no lo son.

Juego del capítulo