Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

15. Regresion con el tiempo: autocorrelacion y pronostico

En 1949 una aerolinea internacional empezo a llevar un registro mensual sencillo: cuantos pasajeros volaron ese mes, contados en miles. Doce anos de esos conteos, de enero de 1949 a diciembre de 1960, se convirtieron en uno de los conjuntos de datos mas estudiados de la estadistica. El problema de la aerolinea era concreto. Para decidir cuantos aviones comprar, cuantas tripulaciones contratar y como programar el mantenimiento, los planificadores necesitaban pronosticar la demanda con uno o dos anos de anticipacion. Un buen pronostico ahorraba dinero; uno malo dejaba aviones en tierra o pasajeros varados.

Figure 1 grafica los 144 conteos mensuales en orden. Saltan a la vista tres rasgos. La serie sube de forma constante: los viajes aereos casi se triplicaron en los doce anos. Tambien tiene un ciclo anual, con un pico alto en verano (la gente vuela en vacaciones) y una caida en invierno. Y las oscilaciones se ensanchan a medida que la serie crece: la diferencia entre el pico de verano y el valle de invierno era pequena en 1949 y grande en 1960. Una sola linea recta no describira esto, pero una regresion con un termino de tendencia y un conjunto de indicadores mensuales bien podria hacerlo.

Un grafico de lineas de los pasajeros mensuales de una aerolinea internacional en miles, de 1949 a 1960. La serie sube desde unos 100 hasta mas de 600, repite un ciclo anual con un pico en verano y un valle en invierno, y el tamano de la oscilacion anual crece desde unos 30 en 1949 hasta mas de 150 para 1960.

Figure 1:La serie aerea mensual: una tendencia creciente, un ciclo anual que se repite con picos en verano, y oscilaciones estacionales que se ensanchan a medida que sube el nivel general.

Los datos ordenados en el tiempo como estos rompen una promesa en la que se apoyaron los capitulos anteriores. Toda la inferencia que has hecho hasta ahora suponia que los errores no estaban correlacionados: la suerte de una observacion no te decia nada sobre la siguiente. Cuando las observaciones llegan en orden temporal, ese supuesto suele fallar. Un mes que corre por encima de la tendencia tiende a ir seguido por otro por encima de la tendencia, porque lo que empujo la demanda hacia arriba (una economia en auge, una ruta nueva) no desaparece de la noche a la manana. Este capitulo muestra que le hace esa correlacion a tus errores estandar, como detectarla, una forma clasica de eliminarla, y como juzgar un pronostico con honestidad probandolo en el futuro en lugar de en el pasado.

15.1 Un modelo para la tendencia y la estacionalidad

Intuicion

Empezamos donde siempre empieza el flujo de trabajo: con la imagen y la pregunta. Figure 1 muestra tres ingredientes, y una regresion puede llevar un termino para cada uno. La subida constante es una tendencia, que modelamos con una linea recta en el indice de tiempo t=1,2,,144t = 1, 2, \dots, 144. El ciclo anual es estacionalidad, que modelamos con once variables indicadoras (ficticias) para los meses de febrero a diciembre, cada una midiendo como se situa ese mes respecto a una linea base de enero. Las oscilaciones crecientes son la razon por la que no modelamos los conteos crudos directamente.

Mira otra vez la serie cruda: en 1949 el pico de verano esta quiza 30 por encima del valle de invierno, pero para 1960 esa misma brecha estacional supera los 150. El efecto estacional no es un numero fijo de pasajeros; es un porcentaje fijo del nivel actual. Cuando un efecto es multiplicativo asi, tomar logaritmos lo vuelve aditivo y, como bono, empareja la varianza. Figure 2 muestra el beneficio: en la escala logaritmica las oscilaciones estacionales tienen aproximadamente el mismo ancho cada ano. Trabajar en la escala logaritmica es la idea de transformacion de 10.2 La transformación logarítmica y la lectura de sus coeficientes, y es lo que permite que un unico conjunto de efectos de mes ajuste los doce anos completos.

Dos graficos de lineas lado a lado de la serie aerea. El panel izquierdo, en la escala cruda, muestra oscilaciones estacionales que se ensanchan con el tiempo. El panel derecho, en la escala logaritmica, muestra oscilaciones estacionales de ancho aproximadamente constante en todos los anos.

Figure 2:En la escala cruda (izquierda) las oscilaciones anuales se ensanchan al subir el nivel; en la escala logaritmica (derecha) mantienen un ancho casi constante. Los logaritmos convierten un patron estacional multiplicativo en uno aditivo y estabilizan la varianza.

Formula

Sea YtY_t el conteo de pasajeros en el mes tt y trabajemos con logYt\log Y_t. El modelo lleva un termino para cada rasgo de Figure 1: una tendencia lineal, un desplazamiento fijo para cada mes, y un error.

Las piezas, termino por termino:

En palabras: el conteo logaritmico de pasajeros es una tendencia en linea recta mas un desplazamiento fijo para cada mes del ano mas una perturbacion. Por ahora ajustamos esto por minimos cuadrados ordinarios, tratando a los εt\varepsilon_t como si cumplieran los supuestos habituales. La Seccion 15.2 revisa si lo hacen.

R

Leemos el archivo mensual ordenado, construimos un indice de tiempo y una respuesta logaritmica, y hacemos de month un factor para que lm lo expanda en variables indicadoras automaticamente.

air <- read.csv("data/airpassengers.csv")
air$t <- seq_len(nrow(air))
air$logpass <- log(air$passengers)
air$month <- factor(air$month)
dim(air)
head(air, 3)
[1] 144   5
  year month passengers t  logpass
1 1949     1        112 1 4.718499
2 1949     2        118 2 4.770685
3 1949     3        132 3 4.882802

Once coeficientes son dificiles de imaginar desde una tabla, asi que Figure 3 los dibuja como barras. Cada barra es el desplazamiento de un mes respecto a enero, y la forma cuenta toda la historia estacional de un vistazo: una joroba de verano con pico en julio y agosto, una caida suave a fines del otono.

Un grafico de barras de los once desplazamientos estacionales mensuales del modelo ajustado, con enero fijo en cero como linea base. Las barras suben durante la primavera hasta un pico de verano en julio (cerca de 0.30) y agosto (cerca de 0.29), luego caen a un minimo en noviembre (cerca de menos 0.14). Las barras por encima de enero son azules, las que estan por debajo son naranjas.

Figure 3:Los coeficientes estacionales como barras, cada uno medido contra una linea base de enero. El pico de verano y el minimo de noviembre que ordenan los numeros son mucho mas faciles de ver como una forma que como una columna de decimales.

La pendiente de tendencia merece su propia lectura, porque los logaritmos la convierten en una tasa de crecimiento.

Figure 4 superpone los valores ajustados sobre la serie logaritmica observada. La tendencia recta mas doce desplazamientos mensuales reproduce de cerca la forma de sierra, que es por lo que el R2R^2 es tan alto.

Un grafico de lineas en la escala logaritmica que muestra los pasajeros logaritmicos observados y los valores ajustados del modelo de tendencia mas mes, de 1949 a 1960. La linea ajustada sigue de cerca el patron de sierra observado, capturando tanto la tendencia ascendente como la forma estacional que se repite.

Figure 4:El modelo de tendencia mas mes en la escala logaritmica. Una unica tendencia recta y once desplazamientos estacionales siguen de cerca la sierra observada, que es por lo que el modelo explica el 98 por ciento de la variacion.

15.2 Por que el tiempo rompe los minimos cuadrados ordinarios

Intuicion

Ya podemos ajustar la linea; la siguiente pregunta obvia es si deberiamos confiar en sus errores estandar. Recuerda el habito del grafico de residuos del Capitulo 2: despues de cualquier ajuste, mira los residuos. Para datos temporales, graficalos en orden temporal. Figure 5 hace exactamente eso para el modelo de tendencia mas estacionalidad, y la imagen no es la banda aleatoria que quieres. Los residuos se mueven en rachas largas: un tramo de meses por encima de cero, luego un tramo por debajo, luego por encima otra vez. Un mes que se pasa del modelo suele ir seguido por otro que tambien se pasa. Eso es autocorrelacion (Definicion 15.2): los errores estan correlacionados con su propio pasado reciente.

Un grafico de los residuos del modelo de tendencia mas mes contra el tiempo de 1949 a 1960, dibujado como tallos desde una linea de cero y coloreado por signo. Los residuos forman rachas largas del mismo color, varios anos de residuos en su mayoria positivos seguidos por tramos de residuos en su mayoria negativos, en lugar de alternar al azar.

Figure 5:Los residuos del modelo en orden temporal forman rachas largas del mismo signo en lugar de dispersarse al azar alrededor de cero. Ese agrupamiento es la firma visual de la autocorrelacion positiva.

La autocorrelacion importa porque rompe el supuesto de “errores no correlacionados” sobre el que se construyo cada formula de error estandar de este libro. Bajo las condiciones de Gauss-Markov de 2.5 Comportamiento muestral y el teorema de Gauss-Markov, los errores distintos no estaban correlacionados. Cuando no lo estan, minimos cuadrados sigue cayendo sobre una estimacion insesgada de la pendiente, pero su error estandar reportado es incorrecto. Para la autocorrelacion positiva que casi siempre ves en series de tiempo, es incorrecto en la direccion peligrosa: demasiado pequeno. El software imprime un intervalo de confianza estrecho y un valor p diminuto, y crees que la tendencia esta fijada con mucha mas precision de la que los datos sostienen.

Formula

El modelo mas simple y comun para errores correlacionados es el modelo autorregresivo de primer orden, escrito AR(1).

Leyendo las piezas:

En palabras: el error de este mes es una fraccion ρ\rho del error del mes pasado mas un choque independiente y fresco. Figure 6 contrasta errores independientes con errores AR(1) de la misma varianza. La serie independiente no tiene memoria; la serie AR(1) deambula en rachas, exactamente como los residuos de Figure 5.

Dos graficos temporales lado a lado de series de error simuladas con la misma varianza. El panel izquierdo, errores independientes, tiembla rapidamente alrededor de cero sin memoria. El panel derecho, errores AR(1) con rho igual a 0.8, deambula en rachas largas y suaves por encima y por debajo de cero.

Figure 6:Errores independientes (izquierda) y errores AR(1) positivamente autocorrelacionados (derecha) con la misma varianza. La serie AR(1) deriva en rachas largas, que es por lo que los residuos autocorrelacionados se agrupan por signo.

Derivacion

Por que la autocorrelacion positiva hace que el error estandar reportado sea demasiado pequeno? El lugar mas limpio para ver el mecanismo es el estimador mas simple, la media muestral, donde el algebra es corta y la leccion se transfiere directamente a la pendiente de regresion.

Demostracion. Supongamos Yt=μ+εtY_t = \mu + \varepsilon_t para t=1,,nt = 1, \dots, n, donde cada error tiene media cero y varianza σ2\sigma^2, y los errores vecinos tienen correlacion Corr{εt,εt+k}=ρk\operatorname{Corr}\{\varepsilon_t, \varepsilon_{t+k}\} = \rho^{\,k}, el patron AR(1). El estimador de μ\mu es Yˉ\bar Y. Su varianza verdadera es

Var{Yˉ}=1n2Var ⁣{t=1nεt}=1n2(t=1nVar{εt}+2s<tCov{εs,εt}).\operatorname{Var}\{\bar Y\} = \frac{1}{n^2}\operatorname{Var}\!\Big\{\sum_{t=1}^n \varepsilon_t\Big\} = \frac{1}{n^2}\Big(\sum_{t=1}^n \operatorname{Var}\{\varepsilon_t\} + 2\sum_{s<t}\operatorname{Cov}\{\varepsilon_s, \varepsilon_t\}\Big).

La primera suma es nσ2n\sigma^2. Cada covarianza es Cov{εs,εt}=σ2ρts\operatorname{Cov}\{\varepsilon_s,\varepsilon_t\} = \sigma^2 \rho^{\,|t-s|}, asi que recogiendo terminos por su rezago k=tsk = t - s da

Var{Yˉ}=σ2n(1+2k=1n1(1kn)ρk).\operatorname{Var}\{\bar Y\} = \frac{\sigma^2}{n}\left(1 + 2\sum_{k=1}^{n-1}\Big(1 - \frac{k}{n}\Big)\rho^{\,k}\right).

En palabras: la varianza verdadera de la media es el familiar σ2/n\sigma^2/n multiplicado por un corchete que depende de la autocorrelacion. Cuando los errores no estan correlacionados (ρ=0\rho = 0) el corchete es 1 y recuperamos σ2/n\sigma^2/n. Cuando ρ>0\rho > 0 cada termino de la suma es positivo, asi que el corchete supera a 1 y la varianza verdadera es mayor que σ2/n\sigma^2/n. Pero σ2/n\sigma^2/n es exactamente lo que estima la formula ordinaria, porque ignora las covarianzas. Asi que minimos cuadrados ordinarios divide entre muy poco y reporta una varianza, y un error estandar, que son demasiado pequenos. La misma cancelacion de covarianzas infla la varianza verdadera de la pendiente de regresion b1b_1; solo la contabilidad es mas larga. \blacksquare

Que tan fuerte muerde esto en la practica? Una simulacion lo vuelve concreto, y vale la pena correrla tu mismo, con el espiritu del habito de “comprueba una formula simulandola”.

Un histograma de 2000 estimaciones de pendiente simuladas centradas en la pendiente verdadera de 0.5, con una flecha ancha de doble punta marcando la dispersion verdadera de cerca de mas o menos 0.016 y una flecha mucho mas corta marcando el error estandar promedio reportado por MCO de cerca de mas o menos 0.005.

Figure 7:Dos mil estimaciones de pendiente bajo errores AR(1). Su dispersion real (flecha ancha) es cerca de tres veces el error estandar que reporta minimos cuadrados ordinarios (flecha corta), asi que el intervalo de confianza habitual es demasiado estrecho.

La simulacion de abajo pone todo ese argumento bajo tu dedo: mantiene fijos los datos y los choques y te deja subir la autocorrelacion, para que veas como el error estandar reportado se queda quieto mientras el verdadero se le escapa.

Desliza la autocorrelacion rho y observa como los residuos caen en rachas largas, el estadistico de Durbin-Watson baja de 2 hacia 0, y el error estandar que reportan los minimos cuadrados se aleja cada vez mas por debajo de la dispersion verdadera de la pendiente.

15.3 Deteccion de la autocorrelacion: la prueba de Durbin-Watson

Intuicion

El grafico de residuos te advierte; una prueba cuantifica la advertencia. Dos imagenes apuntan en la misma direccion. Un grafico de rezago (Definicion 15.5) grafica cada residuo ete_t contra el residuo anterior et1e_{t-1}; la autocorrelacion positiva aparece como una inclinacion hacia arriba, porque un residuo positivo tiende a sentarse junto a otro positivo. Figure 9 es ese grafico para el modelo aereo, y la inclinacion es inconfundible.

La prueba de Durbin-Watson convierte esa inclinacion en un solo numero y un valor p. Conociste esta prueba como un elemento del conjunto de herramientas de diagnostico de 9. Diagnósticos del modelo, donde marco un ordenamiento en los residuos de ahorro; aqui estan los datos ordenados en el tiempo para los que fue construida, y aqui es donde por fin derivamos por que su escala corre como corre.

Un diagrama de dispersion de cada residuo del modelo contra el residuo anterior, con una linea ajustada de pendiente positiva de cerca de 0.79 pasando por el origen. Los puntos se agrupan a lo largo de la linea ascendente, mostrando que un residuo y su antecesor tienden a tener el mismo signo.

Figure 9:Cada residuo contra el anterior. La clara inclinacion hacia arriba (pendiente cerca de 0.79) significa que un residuo suele ir seguido por otro del mismo signo, la definicion de autocorrelacion positiva.

Formula

El estadistico de Durbin-Watson mide cuanto difieren los residuos consecutivos.

El estadistico corre de 0 a 4. Cuando los residuos vecinos son casi iguales (autocorrelacion positiva fuerte) el numerador es pequeno y DD esta cerca de 0. Cuando los residuos alternan de signo (autocorrelacion negativa) los cambios son grandes y DD esta cerca de 4. Cuando los residuos no estan correlacionados, DD se situa cerca de 2. Figure 10 es la recta numerica que hay que tener en mente.

Una recta numerica horizontal de 0 a 4 sombreada en tres zonas: cerca de 0 etiquetada autocorrelacion positiva, cerca de 2 etiquetada ninguna o ideal, cerca de 4 etiquetada autocorrelacion negativa. Un marcador rojo se situa en 0.43, muy dentro de la zona de autocorrelacion positiva, etiquetado modelo airpassengers DW igual a 0.43.

Figure 10:El estadistico de Durbin-Watson corre de 0 a 4: cerca de 0 es autocorrelacion positiva fuerte, cerca de 2 es ninguna, cerca de 4 es negativa. El modelo aereo cae en 0.43, muy dentro de la zona positiva.

Derivacion

La escala no es arbitraria. El Capitulo 9 enuncio el atajo D2(1ρ^)D \approx 2(1 - \hat\rho) en su resumen y lo uso para leer el estadistico de ahorro; ahora que la autocorrelacion es toda la historia, vale la pena ver de donde viene esa identidad. El estadistico de Durbin-Watson es, salvo una correccion de muestra pequena, solo un reescalamiento de la autocorrelacion de residuos de rezago uno, lo que explica por que 2 es el valor neutral.

Demostracion. Desarrolla el cuadrado en el numerador:

t=2n(etet1)2=t=2net2+t=2net122t=2netet1.\sum_{t=2}^{n} (e_t - e_{t-1})^2 = \sum_{t=2}^{n} e_t^2 + \sum_{t=2}^{n} e_{t-1}^2 - 2\sum_{t=2}^{n} e_t e_{t-1} .

Para una serie razonablemente larga las primeras dos sumas estan cada una muy cerca de la suma de cuadrados de los residuos completa t=1net2\sum_{t=1}^n e_t^2, porque cada una deja fuera solo un termino (el ultimo o el primero). Escribe r1=(t=2netet1)/(t=1net2)r_1 = \big(\sum_{t=2}^n e_t e_{t-1}\big)\big/\big(\sum_{t=1}^n e_t^2\big) para la autocorrelacion de residuos de rezago uno. Dividiendo el desarrollo entre et2\sum e_t^2,

D=t=2net2+t=2net122t=2netet1t=1net2    1+12r1=2(1r1).D = \frac{\sum_{t=2}^{n} e_t^2 + \sum_{t=2}^{n} e_{t-1}^2 - 2\sum_{t=2}^{n} e_t e_{t-1}} {\sum_{t=1}^{n} e_t^2} \;\approx\; 1 + 1 - 2 r_1 = 2(1 - r_1) .

En palabras: el estadistico de Durbin-Watson es aproximadamente 2 menos dos veces la autocorrelacion de rezago uno. Si r1=0r_1 = 0 entonces D2D \approx 2; si r11r_1 \to 1 entonces D0D \to 0; si r11r_1 \to -1 entonces D4D \to 4. Por esto un valor cerca de 2 senala ausencia de autocorrelacion. \blacksquare

Decidir si un DD observado esta lo bastante lejos de 2 para ser sorprendente es algo incomodo. La distribucion nula de DD depende de los valores del predictor, asi que Durbin y Watson publicaron un par de cotas, dLd_L y dUd_U, que enmarcan el valor critico verdadero. El software esquiva las tablas calculando el valor p directamente. Ambos aparecen abajo.

R y Python

Un valor p menor que 2×10162\times 10^{-16} es facil de leer por encima. La simulacion de abajo lo vuelve concreto construyendo la comparacion que hace la prueba: cientos de series cuyos errores si estan de verdad no correlacionados, para que veas por ti mismo que tan lejos queda 0.43 de cualquier cosa que produzca el azar.

Simula el estadistico de Durbin-Watson con errores honestamente no correlacionados y observa como el monton se junta alrededor de 2. El 0.43 del modelo aereo, marcado en ambar, nunca recibe compania.

15.4 Un remedio: el procedimiento de Cochrane-Orcutt

Intuicion

Si los errores siguen un patron AR(1), podemos transformarlos para eliminarlos. El truco es la cuasi-diferenciacion: en lugar de la serie cruda, regresamos cada observacion menos ρ\rho veces la observacion anterior. Esa combinacion cancela la parte correlacionada del error y deja atras las innovaciones frescas e independientes. Como el modelo transformado tiene errores no correlacionados, minimos cuadrados ordinarios sobre el es valido otra vez. El unico inconveniente es que ρ\rho es desconocido, asi que lo estimamos a partir de los residuos e iteramos. Ese bucle es el procedimiento de Cochrane-Orcutt.

Formula

Parte de la regresion con errores AR(1), escrita de forma compacta con xt\mathbf{x}_t para la fila de predictores (el 1, la tendencia tt, y las indicadoras de mes) en el mes tt:

Yt=xtβ+εt,εt=ρεt1+ut.Y_t = \mathbf{x}_t' \boldsymbol\beta + \varepsilon_t, \qquad \varepsilon_t = \rho\,\varepsilon_{t-1} + u_t .

Rezaga toda la regresion un paso, multiplica por ρ\rho, y resta:

YtρYt1Yt=(xtρxt1)xtβ+(εtρεt1)ut.\underbrace{Y_t - \rho\, Y_{t-1}}_{Y_t^{\ast}} = \underbrace{(\mathbf{x}_t - \rho\,\mathbf{x}_{t-1})'}_{\mathbf{x}_t^{\ast\prime}} \boldsymbol\beta + \underbrace{(\varepsilon_t - \rho\,\varepsilon_{t-1})}_{u_t} .

El modelo transformado Yt=xtβ+utY_t^{\ast} = \mathbf{x}_t^{\ast\prime}\boldsymbol\beta + u_t tiene exactamente los mismos coeficientes β\boldsymbol\beta que el original, pero ahora satisface los supuestos de minimos cuadrados ordinarios, asi que ajustarlo da errores estandar confiables.

Derivacion

Demostracion. La definicion AR(1) dice que el error es su propio rezago escalado por ρ\rho mas un choque independiente, εt=ρεt1+ut\varepsilon_t = \rho\varepsilon_{t-1} + u_t, lo que se reordena a ut=εtρεt1u_t = \varepsilon_t - \rho\varepsilon_{t-1}. Toma la regresion original Yt=xtβ+εtY_t = \mathbf{x}_t'\boldsymbol\beta + \varepsilon_t y la misma relacion un paso atras, Yt1=xt1β+εt1Y_{t-1} = \mathbf{x}_{t-1}'\boldsymbol\beta + \varepsilon_{t-1}. Multiplica la ecuacion rezagada por ρ\rho y restala de la actual. A la izquierda, YtρYt1Y_t - \rho Y_{t-1}; a la derecha, (xtρxt1)β(\mathbf{x}_t - \rho\mathbf{x}_{t-1})'\boldsymbol\beta mas εtρεt1\varepsilon_t - \rho \varepsilon_{t-1}, y esa ultima pieza es exactamente utu_t. Asi que la serie cuasi-diferenciada obedece una regresion con el mismo β\boldsymbol\beta y con los errores independientes de varianza constante utu_t. Minimos cuadrados ordinarios esta de vuelta en terreno solido, que es todo el punto de la transformacion.

El obstaculo es que ρ\rho es desconocido. El procedimiento de Cochrane-Orcutt lo estima junto con los coeficientes, iterando:

  1. Ajusta el modelo original por minimos cuadrados ordinarios y guarda los residuos ete_t.

  2. Estima ρ\rho regresando ete_t sobre et1e_{t-1} por el origen: ρ^=t=2netet1/t=2net12\hat\rho = \sum_{t=2}^n e_t e_{t-1} / \sum_{t=2}^n e_{t-1}^2.

  3. Cuasi-diferencia YY y cada predictor usando ρ^\hat\rho, y reajusta por minimos cuadrados para obtener nuevos β\boldsymbol\beta.

  4. Recalcula los residuos del ajuste en escala original, reestima ρ\rho, y repite hasta que ρ^\hat\rho deje de cambiar.

Cada pasada reduce la autocorrelacion restante; en la practica un par de iteraciones bastan. \blacksquare

Figure 12 despliega los cuatro pasos como un bucle. Leelo de arriba a abajo, luego sigue la flecha naranja de vuelta hacia arriba siempre que el ρ\rho estimado siga moviendose: ajustar, estimar, transformar, reajustar, comprobar, y detenerse una vez que ρ^\hat\rho se asiente.

Un diagrama de flujo del procedimiento de Cochrane-Orcutt. Cuatro cajas bajan por la izquierda en orden: ajustar por minimos cuadrados ordinarios y guardar residuos, estimar rho regresando cada residuo sobre su rezago, cuasi-diferenciar la respuesta y cada predictor con el rho estimado, y reajustar por minimos cuadrados y recalcular residuos. Una flecha lleva a un rombo de decision que pregunta si rho-sombrero es estable. Una rama de no vuelve hacia arriba al paso de estimar rho; una rama de si lleva a una caja final, reportar el ajuste corregido.

Figure 12:El procedimiento de Cochrane-Orcutt como un bucle. Cada pasada estima la autocorrelacion, cuasi-diferencia con ella, y reajusta; el bucle se repite hasta que el rho estimado deja de cambiar, luego reporta los errores estandar corregidos.

R y Python

Dos graficos de rezago de residuos lado a lado. El panel izquierdo, antes de Cochrane-Orcutt, muestra una inclinacion hacia arriba con pendiente de rezago uno de cerca de 0.79. El panel derecho, tras un paso de cuasi-diferenciacion, muestra una nube redonda con pendiente de rezago uno cercana a cero.

Figure 13:Graficos de rezago de residuos antes (izquierda) y despues (derecha) de un paso de Cochrane-Orcutt. La cuasi-diferenciacion aplana la inclinacion hacia arriba a una nube redonda, asi que los errores transformados se ven no correlacionados.

El Intentalo 15.4 te pide argumentar que ρ=1\rho = 1 es demasiado. La simulacion de abajo te deja comprobar el argumento sobre el modelo aereo real eligiendo tu mismo la ρ\rho y leyendo la autocorrelacion que sobrevive.

Cuasi-diferencia el modelo aereo con la rho que elijas. Cerca de 0.71 las rachas de residuos se rompen y el estadistico de Durbin-Watson se acomoda junto a 2; empuja hacia 1 y los residuos empiezan a zigzaguear.

15.5 Pronosticar con honestidad: probar en el futuro

Intuicion

Un modelo que ajusta el pasado a la perfeccion puede aun pronosticar mal el futuro. La unica forma honesta de juzgar un pronostico es ocultar parte del futuro al modelo, pronosticarlo, y comparar. Para datos temporales eso significa una division fuera de tiempo (Definicion 15.11): entrenar en los anos anteriores, probar en los posteriores. Esta es la mentalidad de validacion del Capitulo 12 con una regla estricta anadida por el reloj. Nunca puedes entrenar con datos que llegaron despues de tu periodo de prueba, porque al momento del pronostico esos datos no existian. Dividir al azar, como lo harias para datos transversales, dejaria que el modelo espiara el futuro y se halagara a si mismo.

Entrenamos el modelo de tendencia mas estacionalidad de 1949 a 1957 y pronosticamos de 1958 a 1960, tres anos que nunca ha visto. Figure 15 muestra el resultado, y es una humildad util.

Un grafico de la serie aerea con una linea discontinua separando el periodo de entrenamiento de 1949 a 1957 del periodo de prueba de 1958 a 1960. Los valores ajustados abrazan los datos en el periodo de entrenamiento. En el periodo de prueba la linea de pronostico corre visiblemente por encima de los conteos reales, y una banda de prediccion del 95 por ciento sombreada cubre solo unos pocos de los puntos reales.

Figure 15:El modelo entrenado de 1949 a 1957 y pronosticando de 1958 a 1960. En los anos de prueba el pronostico deriva por encima de lo que realmente paso, y la banda de prediccion ingenua sombreada se pierde la mayoria de los meses reales.

Formula

Dos boletas de calificaciones honestas resumen el desempeno en el conjunto de prueba. La raiz del error cuadratico medio y el error porcentual absoluto medio sobre los meses reservados son

RMSE=1ntestttest(YtY^t)2,MAPE=100%ntestttestYtY^tYt.\mathrm{RMSE} = \sqrt{\frac{1}{n_{\text{test}}}\sum_{t \in \text{test}} (Y_t - \hat Y_t)^2}, \qquad \mathrm{MAPE} = \frac{100\%}{n_{\text{test}}}\sum_{t \in \text{test}}\frac{|Y_t - \hat Y_t|}{Y_t} .

En palabras: RMSE es el tamano tipico de un fallo de pronostico en pasajeros, y MAPE es el fallo promedio como porcentaje del conteo real.

Como el modelo esta ajustado en la escala logaritmica, exponenciamos el pronostico logaritmico para obtener un pronostico de conteo antes de calificar. Tambien llevamos el intervalo de prediccion de regresion ordinaria de 3.5 Intervalo de predicción para una observación nueva, retro-transformado de la misma manera, y revisamos con que frecuencia cubre en realidad la verdad.

R y Python

Por que falla tan feo el intervalo de prediccion? El intervalo de 3.5 Intervalo de predicción para una observación nueva se derivo bajo errores independientes, de varianza constante y normales, y tiene en cuenta solo dos fuentes de incertidumbre: la dispersion de un solo error nuevo y la incertidumbre en la media ajustada. Para un pronostico a varios anos vista, ninguna pieza es la historia real. Los errores estan fuertemente autocorrelacionados, asi que una racha de meses malos se compone en lugar de promediarse. La tendencia se extrapola mucho mas alla de los datos, asi que cualquier error en la pendiente estimada crece con el horizonte. Y la incertidumbre genuina del pronostico deberia ensancharse cuanto mas adelante mires, mientras que el intervalo de regresion ordinaria apenas se ensancha. Un intervalo que ignora todo esto esta condenado a ser demasiado estrecho, que es exactamente lo que muestra la cobertura del 19%19\%.

La division de 1957 es una eleccion entre muchas, y la simulacion de abajo te deja moverla. Ver el mismo modelo puntuar bien en los meses que vio y mal en los que no, una y otra vez con distintas divisiones, es la forma mas rapida de fijar la leccion.

Mueve el corte de entrenamiento y compara las dos casillas de error: el modelo puntua cerca de 9 en los meses con los que se entreno y cerca de 63 en los que pronostico. La banda de prediccion del 95 por ciento cubre el 19 por ciento de ellos.

15.6 Resumen del capitulo

Ahora puedes manejar la regresion sobre datos ordenados en el tiempo de principio a fin. Ajustas un modelo de tendencia mas estacionalidad en la escala logaritmica (Definicion 15.1), leyendo la tendencia como una tasa de crecimiento y cada coeficiente de mes como un desplazamiento estacional, reutilizando la transformacion logaritmica de 10.2 La transformación logarítmica y la lectura de sus coeficientes y la codificacion ficticia de 11.1 De categorías a números: codificación con indicadores. Puedes explicar por que el orden temporal suele correlacionar los errores, y demostraste, para la media muestral, que la autocorrelacion positiva hace que la formula de varianza ordinaria sea demasiado pequena (Teorema 15.4), asi que minimos cuadrados reporta errores estandar en los que no puedes confiar. Diagnosticas la autocorrelacion de tres formas, el grafico de residuos contra el tiempo, el grafico de rezago, y la prueba de Durbin-Watson, y derivaste por que D2(1r1)D \approx 2(1 - r_1) hace de 2 el valor neutral (Teorema 15.7). Aplicas el procedimiento de Cochrane-Orcutt y sabes por que la cuasi-diferenciacion restaura los errores independientes (Teorema 15.10). Y evaluas un pronostico con honestidad con una division fuera de tiempo, calculando el error de prueba y la cobertura del intervalo de prediccion, y puedes decir con claridad por que los intervalos de pronostico calibrados necesitan metodos de series de tiempo que este curso no cubre.

Resultados clave de un vistazo.

ResultadoEnunciado o formulaValido cuando
Modelo de tendencia mas estacionalidad (Def 15.1)logYt=β0+β1t+m=212γmDmt+εt\log Y_t = \beta_0 + \beta_1 t + \sum_{m=2}^{12}\gamma_m D_{mt} + \varepsilon_tla tendencia y la estacionalidad son multiplicativas; los logaritmos las vuelven aditivas y estabilizan la varianza
Crecimiento a partir de la pendiente logaritmicamensual (eβ11)×100%(e^{\beta_1}-1)\times 100\%; anual (e12β11)×100%(e^{12\beta_1}-1)\times 100\%respuesta modelada en la escala logaritmica
Modelo de error AR(1) (Def 15.3)εt=ρεt1+ut\varepsilon_t = \rho\varepsilon_{t-1} + u_t, $\rho
Varianza de la media bajo AR(1) (Thm 15.4)Var{Yˉ}=σ2n(1+2k(1kn)ρk)\operatorname{Var}\{\bar Y\}=\frac{\sigma^2}{n}\big(1 + 2\sum_{k}(1-\tfrac{k}{n})\rho^k\big)errores AR(1); supera a σ2/n\sigma^2/n cuando ρ>0\rho>0, asi que los SE de MCO son demasiado pequenos
Estadistico de Durbin-Watson (Def 15.6)D=t2(etet1)2/tet2D = \sum_{t\ge 2}(e_t - e_{t-1})^2 / \sum_t e_t^2cualquier regresion ajustada; 0 positiva, 2 ninguna, 4 negativa
Identidad de Durbin-Watson (Thm 15.7)D2(1r1)D \approx 2(1 - r_1)serie de residuos razonablemente larga
La cuasi-diferenciacion elimina AR(1) (Thm 15.10)YtρYt1=(xtρxt1)β+utY_t - \rho Y_{t-1} = (\mathbf{x}_t - \rho\mathbf{x}_{t-1})'\boldsymbol\beta + u_terrores AR(1), con ρ\rho conocido o estimado
Calificacion de pronostico fuera de tiempoRMSE y MAPE sobre los meses posteriores reservadosla division de entrenamiento y prueba respeta el orden temporal
Cobertura del intervalo de prediccionfraccion de meses de prueba dentro del intervalo del 95%95\%el intervalo es honesto solo si la cobertura 0.95\approx 0.95

Cifras aereas: R2=0.983R^2 = 0.983, ρ^=0.79\hat\rho = 0.79, DD pasa de 0.43 a 2.19 tras un paso de Cochrane-Orcutt, RMSE de prueba 63 / MAPE 14%14\%, y cobertura del intervalo de prediccion 0.19 (7 de 36).

Terminos clave. datos ordenados en el tiempo, tendencia, estacionalidad, modelo de tendencia mas estacionalidad, autocorrelacion, modelo de error autorregresivo de primer orden (AR(1)), parametro de autocorrelacion, innovacion, estadistico de Durbin-Watson, prueba de Durbin-Watson, grafico de rezago, procedimiento de Cochrane-Orcutt, cuasi-diferenciacion, division fuera de tiempo, error porcentual absoluto medio (MAPE), cobertura del intervalo de prediccion.

Ahora deberias poder.

Donde encaja esto. Este capitulo sirve a las etapas de COMPROBAR (CHECK) y USAR (USE) del flujo de trabajo de modelado introducido en El flujo de trabajo del modelado. PREGUNTAMOS (ASK) una pregunta de pronostico y EXPLORAMOS (EXPLORE) la serie, AJUSTAMOS (FIT) un modelo de tendencia y estacionalidad, luego pasamos la mayor parte del capitulo en COMPROBAR: el supuesto de errores no correlacionados en el que se apoyo toda la inferencia anterior falla sobre datos temporales, asi que diagnosticamos el fallo con la prueba de Durbin-Watson y reparamos la inferencia con Cochrane-Orcutt. La etapa de USAR, el pronostico, viene con una advertencia que los capitulos anteriores podian hacer limpiamente pero este no puede: el intervalo de prediccion de 3.5 Intervalo de predicción para una observación nueva, honesto bajo errores independientes, esta aqui mal calibrado. Esa es la costura donde un curso de regresion aplicada entrega el relevo a un curso de series de tiempo: la division fuera de tiempo y la disciplina de pronostico honesto que construiste aqui son los habitos de entrada que cualquier curso asi supone. El Capitulo 16 (16. Análisis de rutas y una mirada hacia adelante) cierra el libro apartandose de cualquier modelo individual para preguntar que puede y que no puede decir una cadena de regresiones sobre la causa, y recorriendo todo el flujo de trabajo una ultima vez.

15.7 Preguntas frecuentes

P1. Por que tomar logaritmos de los pasajeros en lugar de modelar los conteos directamente? Porque las oscilaciones estacionales y la dispersion del error crecen ambas con el nivel de la serie, que es un patron multiplicativo. Tomar logaritmos convierte el efecto estacional multiplicativo en uno aditivo, asi que un unico conjunto de coeficientes de mes ajusta los doce anos, y estabiliza la varianza de modo que el supuesto de varianza constante queda mas cerca de ser verdad. Este es el mismo razonamiento de 10.2 La transformación logarítmica y la lectura de sus coeficientes, aplicado a una serie que crece con el tiempo.

P2. Si minimos cuadrados sigue siendo insesgado bajo autocorrelacion, por que preocuparse? Insesgado significa que la estimacion es correcta en promedio, pero un solo analisis te da una estimacion, y necesitas saber que tan lejos podria estar. Ese es el trabajo del error estandar, y la autocorrelacion hace que el error estandar reportado sea incorrecto, usualmente demasiado pequeno. Terminas con una estimacion puntual que esta bien y un intervalo de confianza que miente sobre su propia confiabilidad.

P3. Mi estadistico de Durbin-Watson es 2.6. Es eso un problema? Esta del lado de la autocorrelacion negativa, ya que D>2D > 2 significa r1<0r_1 < 0. De D2(1r1)D \approx 2(1 - r_1), un DD de 2.6 implica r10.3r_1 \approx -0.3. La autocorrelacion negativa leve es menos comun que la positiva pero si ocurre, a menudo por sobre-diferenciacion o por una variable medida como un cambio. Si es “un problema” depende del valor p y de cuanto te apoyes en los errores estandar.

P4. Cambia Cochrane-Orcutt la estimacion de la tendencia o solo los errores estandar? Ambos, un poco. El ajuste cuasi-diferenciado es una estimacion de minimos cuadrados generalizados, que pondera los datos de forma distinta a minimos cuadrados ordinarios, asi que los coeficientes se desplazan un tanto. El cambio mas grande e importante es a los errores estandar, que ahora tienen en cuenta la correlacion y son los que deberias reportar.

P5. Por que no usar simplemente el intervalo de prediccion ordinario y admitir que es aproximado? Porque no es aproximadamente correcto, es gravemente incorrecto: sobre el conjunto de prueba aereo cubrio el 19%19\% de los meses en lugar del 95%95\%. Un intervalo tan alejado no comunica la incertidumbre, la tergiversa. Si no puedes producir un intervalo calibrado, reporta el error de prueba fuera de tiempo en su lugar, que es honesto sobre como se desempena en realidad el pronostico.

P6. Podria agregar mas predictores en lugar de modelar la correlacion del error? A veces. Los residuos autocorrelacionados pueden ser un sintoma de un predictor faltante, una curvatura de tendencia omitida o un termino estacional saltado, y agregar el predictor correcto puede eliminar el patron en su origen. Ese suele ser el mejor arreglo cuando puedes encontrar la estructura faltante. Cochrane-Orcutt es para la correlacion de residuos que queda despues de haber modelado la estructura que puedas.

P7. Es un R2R^2 alto como 0.983 evidencia de que el pronostico sera bueno? No. Ese R2R^2 mide el ajuste al pasado, y todo el punto de este capitulo es que el ajuste en muestra y la precision de pronostico fuera de tiempo son cosas distintas. El mismo modelo con R2=0.983R^2 = 0.983 se perdio el futuro por un 14%14\% y su intervalo cubrio un mes de prueba de cada cinco. Juzga un pronostico sobre datos reservados, nunca sobre R2R^2.

15.8 Problemas de practica

  1. (A) En una oracion cada uno, nombra los tres rasgos de la serie aerea en Figure 1 y di que termino del modelo de tendencia mas estacionalidad captura cada uno.

  2. (A) Explica por que los errores en una regresion sobre datos mensuales probablemente esten correlacionados, y da una razon concreta por la que dos meses vecinos compartirian el signo de su error.

  3. (A) La pendiente de tendencia estimada es b1=0.0101b_1 = 0.0101 en la escala logaritmica. Interpretala como una tasa de crecimiento porcentual mensual, y explica por que se necesita exponenciar.

  4. (A) Un estadistico de Durbin-Watson vale 0.43. Sin una tabla, enuncia que implica sobre la autocorrelacion de rezago uno y sobre la confiabilidad de los errores estandar ordinarios.

  5. (A) Explica, a alguien que no ha tomado este curso, por que dividir datos de series de tiempo al azar para una evaluacion de entrenamiento y prueba es hacer trampa, y cual es la division correcta.

  6. (A) El intervalo de prediccion ingenuo del 95%95\% cubrio el 19%19\% de los meses de prueba. Enuncia con claridad que se supone que significa “cobertura del 95%” y por que 19%19\% es un fracaso, no solo un pequeno fallo.

  7. (A) Da una lectura incorrecta del coeficiente de julio γ^7=0.3006\hat\gamma_7 = 0.3006 que un estudiante descuidado podria enunciar, luego corrigela. (Pista: el coeficiente esta en la escala logaritmica, respecto a enero.)

  8. (A) Por que la autocorrelacion positiva, y no la negativa, hace que minimos cuadrados ordinarios sea demasiado confiado? Senala el signo de los terminos de covarianza en la varianza de la media.

  9. (B) Partiendo de D=t=2n(etet1)2/t=1net2D = \sum_{t=2}^n (e_t - e_{t-1})^2 / \sum_{t=1}^n e_t^2, deriva la aproximacion D2(1r1)D \approx 2(1 - r_1) (Teorema 15.7), enunciando el paso donde las dos sumas truncadas se reemplazan por la suma de cuadrados de los residuos completa y por que es razonable para nn grande.

  10. (B) Para Yt=μ+εtY_t = \mu + \varepsilon_t con Var{εt}=σ2\operatorname{Var}\{\varepsilon_t\} = \sigma^2 y Cov{εs,εt}=σ2ρts\operatorname{Cov}\{\varepsilon_s, \varepsilon_t\} = \sigma^2 \rho^{|t-s|}, deriva Var{Yˉ}=σ2n(1+2k=1n1(1k/n)ρk)\operatorname{Var}\{\bar Y\} = \frac{\sigma^2}{n}\big(1 + 2\sum_{k=1}^{n-1}(1 - k/n)\rho^k\big) (Teorema 15.4), y concluye que supera a σ2/n\sigma^2/n cuando ρ>0\rho > 0.

  11. (B) Usando el modelo de error AR(1) εt=ρεt1+ut\varepsilon_t = \rho\varepsilon_{t-1} + u_t, deriva la transformacion de cuasi-diferenciacion (Teorema 15.10) y muestra que el error transformado εtρεt1\varepsilon_t - \rho\varepsilon_{t-1} es igual a la innovacion independiente utu_t.

  12. (B) Muestra que Var{εt}=σu2/(1ρ2)\operatorname{Var}\{\varepsilon_t\} = \sigma_u^2/(1 - \rho^2) para un proceso AR(1) estacionario, partiendo de εt=ρεt1+ut\varepsilon_t = \rho\varepsilon_{t-1} + u_t y usando Var{εt}=Var{εt1}\operatorname{Var}\{\varepsilon_t\} = \operatorname{Var}\{\varepsilon_{t-1}\}.

  13. (B) En el modelo AR(1), muestra que la correlacion entre errores separados kk pasos es ρk\rho^k, asi que la autocorrelacion decae geometricamente con el rezago. (Usa Cov{εt,εtk}=ρCov{εt1,εtk}\operatorname{Cov}\{\varepsilon_t, \varepsilon_{t-k}\} = \rho\,\operatorname{Cov}\{\varepsilon_{t-1}, \varepsilon_{t-k}\}.)

  14. (B) La transformacion de Cochrane-Orcutt pierde la primera observacion, ya que Y1Y_1^{\ast} no tiene antecesor. Explica por que, y describe como la variante de Prais-Winsten la recupera reescalando la primera fila por 1ρ2\sqrt{1 - \rho^2} (un argumento de un parrafo, sin derivacion completa necesaria).

  15. (B) Un estudiante afirma que como b1b_1 es insesgado bajo autocorrelacion, el intervalo de confianza b1±ts{b1}b_1 \pm t^{\ast} s\{b_1\} sigue siendo valido. Identifica el error en la afirmacion y enuncia con precision cual cantidad del intervalo es incorrecta.

  16. (B) Muestra que si los errores verdaderos no estan correlacionados (ρ=0\rho = 0), el primer paso de Cochrane-Orcutt estima ρ^0\hat\rho \approx 0 y el ajuste cuasi-diferenciado se reduce a minimos cuadrados ordinarios, asi que el procedimiento no hace dano cuando no hay autocorrelacion.

  17. (C) Lee airpassengers.csv, construye t y logpass, ajusta el modelo de tendencia mas estacionalidad, y reproduce la pendiente de tendencia, el R2R^2, y la desviacion estandar de los residuos reportados en el Ejemplo 15.1.

  18. (C) Calcula el estadistico de Durbin-Watson a partir de los residuos a mano (via (etet1)2/et2\sum (e_t - e_{t-1})^2 / \sum e_t^2) y confirmalo contra lmtest::dwtest en R o durbin_watson en Python. Reporta ambos.

  19. (C) Haz el grafico de residuos contra el tiempo y el grafico de rezago para el modelo ajustado. Describe que muestra cada uno y como concuerdan sobre el signo de la autocorrelacion.

  20. (C) Estima ρ\rho a partir de los residuos, cuasi-diferencia la respuesta y la matriz de diseno, reajusta, y reporta el estadistico de Durbin-Watson antes y despues. Confirma que pasa de cerca de 0.43 hacia 2.

  21. (C) Ajusta el modelo sin logaritmos (passengers ~ t + month) y compara su grafico de residuos contra el tiempo y su estadistico de Durbin-Watson con los del modelo logaritmico. Quitar el logaritmo mejora o empeora la autocorrelacion, y se ve constante la dispersion de los residuos?

  22. (C) Divide los datos por tiempo (entrena de 1949 a 1957, prueba de 1958 a 1960), ajusta sobre los anos de entrenamiento, pronostica los anos de prueba, retro-transforma, y reproduce el RMSE de prueba y el MAPE del Ejemplo 15.6.

  23. (C) Para la misma division, calcula la cobertura del intervalo de prediccion ingenuo del 95%95\% sobre el conjunto de prueba y confirma que esta muy por debajo de 0.95. Luego calcula la cobertura en muestra sobre el conjunto de entrenamiento y comenta la diferencia.

  24. (C) Reajusta el modelo de tendencia mas estacionalidad quitando las ficticias estacionales (solo tendencia, logpass ~ t). Reporta la caida en R2R^2 y el nuevo estadistico de Durbin-Watson, y explica como el patron estacional no modelado aparece en los residuos del ajuste de solo tendencia.

  25. (C) Agrega un termino de tendencia al cuadrado (logpass ~ t + I(t^2) + month) y reporta si el termino de curvatura es necesario y si reduce la autocorrelacion de residuos. Interpreta que significaria un coeficiente negativo sobre t2t^2 para la tasa de crecimiento.

  26. (C) Usando el ajuste de entrenamiento, pronostica diciembre de 1958, 1959, y 1960 (meses 120, 132, 144), retro-transforma, y compara cada uno con el valor real. Describe como crece el error de pronostico con el horizonte.

  27. (C) Repite la evaluacion fuera de tiempo con una division mas temprana (entrena de 1949 a 1955, prueba de 1956 a 1960). Reporta el MAPE de prueba y comparalo con el 14%14\% de la division de 1958. Explica por que una ventana de entrenamiento mas corta puede cambiar el error de pronostico.

  28. (C) Corre la simulacion del Ejemplo 15.3 para ρ=0\rho = 0, ρ=0.4\rho = 0.4, y ρ=0.8\rho = 0.8, y reporta la razon del SE promedio reportado a la desviacion estandar verdadera de b1b_1 para cada uno. Describe como cambia la razon a medida que ρ\rho crece y que significa eso para los intervalos de confianza.

  29. (A) El intervalo de prediccion de regresion ordinaria de 3.5 Intervalo de predicción para una observación nueva cubrio solo el 19%19\% de los meses de prueba aereos. Da las tres razones por las que este intervalo es estructuralmente demasiado estrecho para un pronostico a varios anos vista, y nombra una familia de metodos que construye la correlacion del error dentro del modelo de modo que su intervalo de pronostico se ensancha con el horizonte.

15.9 Practica de examen

Estas cinco preguntas estan escritas en el estilo de los examenes del curso: cada una te entrega una salida o una afirmacion y te pide explicar, en oraciones completas con unidades, que significa. Un numero correcto sin razonamiento gana poco credito aqui. Trabaja cada una antes de abrir la respuesta modelo.

EP 15.1 (interpreta esta salida en contexto). El modelo de tendencia mas estacionalidad se ajusto a los 144 meses completos de airpassengers.csv, y el software reporto lo siguiente.

Coefficients (partial):
            Estimate  Std. Error  t value  Pr(>|t|)
t          0.0100688   0.0001193   84.40    < 2e-16 ***

Durbin-Watson test:  DW = 0.4252,  p-value < 2.2e-16
alternative hypothesis: true autocorrelation is greater than 0

Interpreta el coeficiente de tendencia como una tasa de crecimiento anual (usa e12×0.01011.128e^{12 \times 0.0101} \approx 1.128), y luego explica, dado el resultado de Durbin-Watson, si reportarias el error estandar impreso de 0.00012 y el valor p diminuto sobre la tendencia al pie de la letra. Enuncia la direccion en la que esos numeros son incorrectos y por que.

EP 15.2 (un estudiante afirma X, evalua). Un estudiante escribe: “Este modelo tiene R2=0.983R^2 = 0.983, asi que explica casi toda la variacion en la serie. Eso significa que pronosticara los conteos mensuales de pasajeros del proximo ano con una precision de cerca del 2%2\%.” Usando la evaluacion fuera de tiempo de este capitulo, evalua el razonamiento del estudiante y enuncia cual es la expectativa correcta.

EP 15.3 (interpreta esta salida en contexto). Se corrio un paso de Cochrane-Orcutt sobre el modelo aereo, produciendo la salida de abajo.

rho_hat (lag-one autocorrelation of residuals):  0.7918
Durbin-Watson before quasi-differencing:  0.4252
Durbin-Watson after  quasi-differencing:  2.1891

Explica que le hizo este procedimiento al modelo, que problema muestra el estadistico “despues” que arreglo, y nombra una cosa que este paso no arregla. Escribe en oraciones completas.

EP 15.4 (que cambiaria si). Supon que hubieras ajustado el modelo a los conteos crudos de pasajeros en lugar de sus logaritmos, passengers ~ t + month. Los dos ajustes se comparan asi.

                    R^2     residual SE        DW      corr(|residual|, fitted)
raw counts        0.9559     26.33 pass       0.4502            +0.137
log counts        0.9835      0.0593 (log)    0.4252            -0.041

Explica que cambiaria, y que no, si usaras el ajuste de conteos crudos. Aborda tanto el comportamiento de la dispersion de los residuos como si el problema de la autocorrelacion queda curado, y di por que la escala logaritmica es preferible aqui.

EP 15.5 (explica por que). Sobre el conjunto de prueba de 1958 a 1960, el intervalo de prediccion nominal del 95%95\% del modelo cubrio solo 7 de los 36 meses de prueba, una cobertura real del 19%19\%.

nominal coverage:  0.95
actual coverage:   0.194   (7 of 36 test months inside the 95% interval)

Enuncia que se supone que significa “cobertura del 95%95\%”, explica por que 19%19\% es un fracaso estructural en lugar de un pequeno fallo, da las tres razones por las que el intervalo de regresion ordinaria es demasiado estrecho para un pronostico a varios anos vista, y nombra una familia de metodos construida para arreglarlo.

Juego del capitulo