15. Regresion con el tiempo: autocorrelacion y pronostico¶
En 1949 una aerolinea internacional empezo a llevar un registro mensual sencillo: cuantos pasajeros volaron ese mes, contados en miles. Doce anos de esos conteos, de enero de 1949 a diciembre de 1960, se convirtieron en uno de los conjuntos de datos mas estudiados de la estadistica. El problema de la aerolinea era concreto. Para decidir cuantos aviones comprar, cuantas tripulaciones contratar y como programar el mantenimiento, los planificadores necesitaban pronosticar la demanda con uno o dos anos de anticipacion. Un buen pronostico ahorraba dinero; uno malo dejaba aviones en tierra o pasajeros varados.
Figure 1 grafica los 144 conteos mensuales en orden. Saltan a la vista tres rasgos. La serie sube de forma constante: los viajes aereos casi se triplicaron en los doce anos. Tambien tiene un ciclo anual, con un pico alto en verano (la gente vuela en vacaciones) y una caida en invierno. Y las oscilaciones se ensanchan a medida que la serie crece: la diferencia entre el pico de verano y el valle de invierno era pequena en 1949 y grande en 1960. Una sola linea recta no describira esto, pero una regresion con un termino de tendencia y un conjunto de indicadores mensuales bien podria hacerlo.

Figure 1:La serie aerea mensual: una tendencia creciente, un ciclo anual que se repite con picos en verano, y oscilaciones estacionales que se ensanchan a medida que sube el nivel general.
Los datos ordenados en el tiempo como estos rompen una promesa en la que se apoyaron los capitulos anteriores. Toda la inferencia que has hecho hasta ahora suponia que los errores no estaban correlacionados: la suerte de una observacion no te decia nada sobre la siguiente. Cuando las observaciones llegan en orden temporal, ese supuesto suele fallar. Un mes que corre por encima de la tendencia tiende a ir seguido por otro por encima de la tendencia, porque lo que empujo la demanda hacia arriba (una economia en auge, una ruta nueva) no desaparece de la noche a la manana. Este capitulo muestra que le hace esa correlacion a tus errores estandar, como detectarla, una forma clasica de eliminarla, y como juzgar un pronostico con honestidad probandolo en el futuro en lugar de en el pasado.
15.1 Un modelo para la tendencia y la estacionalidad¶
Intuicion¶
Empezamos donde siempre empieza el flujo de trabajo: con la imagen y la pregunta. Figure 1 muestra tres ingredientes, y una regresion puede llevar un termino para cada uno. La subida constante es una tendencia, que modelamos con una linea recta en el indice de tiempo . El ciclo anual es estacionalidad, que modelamos con once variables indicadoras (ficticias) para los meses de febrero a diciembre, cada una midiendo como se situa ese mes respecto a una linea base de enero. Las oscilaciones crecientes son la razon por la que no modelamos los conteos crudos directamente.
Mira otra vez la serie cruda: en 1949 el pico de verano esta quiza 30 por encima del valle de invierno, pero para 1960 esa misma brecha estacional supera los 150. El efecto estacional no es un numero fijo de pasajeros; es un porcentaje fijo del nivel actual. Cuando un efecto es multiplicativo asi, tomar logaritmos lo vuelve aditivo y, como bono, empareja la varianza. Figure 2 muestra el beneficio: en la escala logaritmica las oscilaciones estacionales tienen aproximadamente el mismo ancho cada ano. Trabajar en la escala logaritmica es la idea de transformacion de 10.2 La transformación logarítmica y la lectura de sus coeficientes, y es lo que permite que un unico conjunto de efectos de mes ajuste los doce anos completos.

Figure 2:En la escala cruda (izquierda) las oscilaciones anuales se ensanchan al subir el nivel; en la escala logaritmica (derecha) mantienen un ancho casi constante. Los logaritmos convierten un patron estacional multiplicativo en uno aditivo y estabilizan la varianza.
Formula¶
Sea el conteo de pasajeros en el mes y trabajemos con . El modelo lleva un termino para cada rasgo de Figure 1: una tendencia lineal, un desplazamiento fijo para cada mes, y un error.
Las piezas, termino por termino:
es el indice de tiempo, 1 para enero de 1949 hasta para diciembre de 1960.
es el intercepto: el nivel logaritmico de un enero en el tiempo (un ancla de referencia).
es la pendiente de tendencia: el cambio en por mes. Como esta en logaritmos, es una tasa de crecimiento proporcional aproximada por mes (de 10.2 La transformación logarítmica y la lectura de sus coeficientes).
es la indicadora del mes : vale 1 cuando el mes es el mes calendario , y 0 en otro caso. Hay once de ellas, de febrero () a diciembre ().
es el coeficiente estacional del mes : cuanto se situa el mes por encima o por debajo de enero en la escala logaritmica, manteniendo fija la tendencia. Enero es el mes de referencia, codificado con las once indicadoras en cero, exactamente el esquema de codificacion ficticia de 11.1 De categorías a números: codificación con indicadores.
es el error en el mes .
En palabras: el conteo logaritmico de pasajeros es una tendencia en linea recta mas un desplazamiento fijo para cada mes del ano mas una perturbacion. Por ahora ajustamos esto por minimos cuadrados ordinarios, tratando a los como si cumplieran los supuestos habituales. La Seccion 15.2 revisa si lo hacen.
R¶
Leemos el archivo mensual ordenado, construimos un indice de tiempo y una respuesta logaritmica,
y hacemos de month un factor para que lm lo expanda en variables indicadoras automaticamente.
air <- read.csv("data/airpassengers.csv")
air$t <- seq_len(nrow(air))
air$logpass <- log(air$passengers)
air$month <- factor(air$month)
dim(air)
head(air, 3)[1] 144 5
year month passengers t logpass
1 1949 1 112 1 4.718499
2 1949 2 118 2 4.770685
3 1949 3 132 3 4.882802Once coeficientes son dificiles de imaginar desde una tabla, asi que Figure 3 los dibuja como barras. Cada barra es el desplazamiento de un mes respecto a enero, y la forma cuenta toda la historia estacional de un vistazo: una joroba de verano con pico en julio y agosto, una caida suave a fines del otono.

Figure 3:Los coeficientes estacionales como barras, cada uno medido contra una linea base de enero. El pico de verano y el minimo de noviembre que ordenan los numeros son mucho mas faciles de ver como una forma que como una columna de decimales.
La pendiente de tendencia merece su propia lectura, porque los logaritmos la convierten en una tasa de crecimiento.
Figure 4 superpone los valores ajustados sobre la serie logaritmica observada. La tendencia recta mas doce desplazamientos mensuales reproduce de cerca la forma de sierra, que es por lo que el es tan alto.

Figure 4:El modelo de tendencia mas mes en la escala logaritmica. Una unica tendencia recta y once desplazamientos estacionales siguen de cerca la sierra observada, que es por lo que el modelo explica el 98 por ciento de la variacion.
15.2 Por que el tiempo rompe los minimos cuadrados ordinarios¶
Intuicion¶
Ya podemos ajustar la linea; la siguiente pregunta obvia es si deberiamos confiar en sus errores estandar. Recuerda el habito del grafico de residuos del Capitulo 2: despues de cualquier ajuste, mira los residuos. Para datos temporales, graficalos en orden temporal. Figure 5 hace exactamente eso para el modelo de tendencia mas estacionalidad, y la imagen no es la banda aleatoria que quieres. Los residuos se mueven en rachas largas: un tramo de meses por encima de cero, luego un tramo por debajo, luego por encima otra vez. Un mes que se pasa del modelo suele ir seguido por otro que tambien se pasa. Eso es autocorrelacion (Definicion 15.2): los errores estan correlacionados con su propio pasado reciente.

Figure 5:Los residuos del modelo en orden temporal forman rachas largas del mismo signo en lugar de dispersarse al azar alrededor de cero. Ese agrupamiento es la firma visual de la autocorrelacion positiva.
La autocorrelacion importa porque rompe el supuesto de “errores no correlacionados” sobre el que se construyo cada formula de error estandar de este libro. Bajo las condiciones de Gauss-Markov de 2.5 Comportamiento muestral y el teorema de Gauss-Markov, los errores distintos no estaban correlacionados. Cuando no lo estan, minimos cuadrados sigue cayendo sobre una estimacion insesgada de la pendiente, pero su error estandar reportado es incorrecto. Para la autocorrelacion positiva que casi siempre ves en series de tiempo, es incorrecto en la direccion peligrosa: demasiado pequeno. El software imprime un intervalo de confianza estrecho y un valor p diminuto, y crees que la tendencia esta fijada con mucha mas precision de la que los datos sostienen.
Formula¶
El modelo mas simple y comun para errores correlacionados es el modelo autorregresivo de primer orden, escrito AR(1).
Leyendo las piezas:
es el error de regresion en el mes , lo que supusimos no correlacionado pero no lo esta.
es el parametro de autocorrelacion: la correlacion entre un error y el inmediatamente anterior. Un positivo significa que errores consecutivos tienden a compartir signo.
es la innovacion: el choque genuinamente nuevo e impredecible en el mes , y estos si son independientes con varianza constante.
mantiene estable el proceso para que los errores no se disparen.
En palabras: el error de este mes es una fraccion del error del mes pasado mas un choque independiente y fresco. Figure 6 contrasta errores independientes con errores AR(1) de la misma varianza. La serie independiente no tiene memoria; la serie AR(1) deambula en rachas, exactamente como los residuos de Figure 5.

Figure 6:Errores independientes (izquierda) y errores AR(1) positivamente autocorrelacionados (derecha) con la misma varianza. La serie AR(1) deriva en rachas largas, que es por lo que los residuos autocorrelacionados se agrupan por signo.
Derivacion¶
Por que la autocorrelacion positiva hace que el error estandar reportado sea demasiado pequeno? El lugar mas limpio para ver el mecanismo es el estimador mas simple, la media muestral, donde el algebra es corta y la leccion se transfiere directamente a la pendiente de regresion.
Demostracion. Supongamos para , donde cada error tiene media cero y varianza , y los errores vecinos tienen correlacion , el patron AR(1). El estimador de es . Su varianza verdadera es
La primera suma es . Cada covarianza es , asi que recogiendo terminos por su rezago da
En palabras: la varianza verdadera de la media es el familiar multiplicado por un corchete que depende de la autocorrelacion. Cuando los errores no estan correlacionados () el corchete es 1 y recuperamos . Cuando cada termino de la suma es positivo, asi que el corchete supera a 1 y la varianza verdadera es mayor que . Pero es exactamente lo que estima la formula ordinaria, porque ignora las covarianzas. Asi que minimos cuadrados ordinarios divide entre muy poco y reporta una varianza, y un error estandar, que son demasiado pequenos. La misma cancelacion de covarianzas infla la varianza verdadera de la pendiente de regresion ; solo la contabilidad es mas larga.
Que tan fuerte muerde esto en la practica? Una simulacion lo vuelve concreto, y vale la pena correrla tu mismo, con el espiritu del habito de “comprueba una formula simulandola”.

Figure 7:Dos mil estimaciones de pendiente bajo errores AR(1). Su dispersion real (flecha ancha) es cerca de tres veces el error estandar que reporta minimos cuadrados ordinarios (flecha corta), asi que el intervalo de confianza habitual es demasiado estrecho.
La simulacion de abajo pone todo ese argumento bajo tu dedo: mantiene fijos los datos y los choques y te deja subir la autocorrelacion, para que veas como el error estandar reportado se queda quieto mientras el verdadero se le escapa.
Desliza la autocorrelacion rho y observa como los residuos caen en rachas largas, el estadistico de Durbin-Watson baja de 2 hacia 0, y el error estandar que reportan los minimos cuadrados se aleja cada vez mas por debajo de la dispersion verdadera de la pendiente.
15.3 Deteccion de la autocorrelacion: la prueba de Durbin-Watson¶
Intuicion¶
El grafico de residuos te advierte; una prueba cuantifica la advertencia. Dos imagenes apuntan en la misma direccion. Un grafico de rezago (Definicion 15.5) grafica cada residuo contra el residuo anterior ; la autocorrelacion positiva aparece como una inclinacion hacia arriba, porque un residuo positivo tiende a sentarse junto a otro positivo. Figure 9 es ese grafico para el modelo aereo, y la inclinacion es inconfundible.
La prueba de Durbin-Watson convierte esa inclinacion en un solo numero y un valor p. Conociste esta prueba como un elemento del conjunto de herramientas de diagnostico de 9. Diagnósticos del modelo, donde marco un ordenamiento en los residuos de ahorro; aqui estan los datos ordenados en el tiempo para los que fue construida, y aqui es donde por fin derivamos por que su escala corre como corre.

Figure 9:Cada residuo contra el anterior. La clara inclinacion hacia arriba (pendiente cerca de 0.79) significa que un residuo suele ir seguido por otro del mismo signo, la definicion de autocorrelacion positiva.
Formula¶
El estadistico de Durbin-Watson mide cuanto difieren los residuos consecutivos.
es el residuo en el mes de la regresion ajustada.
El numerador suma los cambios al cuadrado entre residuos vecinos; el denominador es la suma de cuadrados de los residuos habitual.
El estadistico corre de 0 a 4. Cuando los residuos vecinos son casi iguales (autocorrelacion positiva fuerte) el numerador es pequeno y esta cerca de 0. Cuando los residuos alternan de signo (autocorrelacion negativa) los cambios son grandes y esta cerca de 4. Cuando los residuos no estan correlacionados, se situa cerca de 2. Figure 10 es la recta numerica que hay que tener en mente.

Figure 10:El estadistico de Durbin-Watson corre de 0 a 4: cerca de 0 es autocorrelacion positiva fuerte, cerca de 2 es ninguna, cerca de 4 es negativa. El modelo aereo cae en 0.43, muy dentro de la zona positiva.
Derivacion¶
La escala no es arbitraria. El Capitulo 9 enuncio el atajo en su resumen y lo uso para leer el estadistico de ahorro; ahora que la autocorrelacion es toda la historia, vale la pena ver de donde viene esa identidad. El estadistico de Durbin-Watson es, salvo una correccion de muestra pequena, solo un reescalamiento de la autocorrelacion de residuos de rezago uno, lo que explica por que 2 es el valor neutral.
Demostracion. Desarrolla el cuadrado en el numerador:
Para una serie razonablemente larga las primeras dos sumas estan cada una muy cerca de la suma de cuadrados de los residuos completa , porque cada una deja fuera solo un termino (el ultimo o el primero). Escribe para la autocorrelacion de residuos de rezago uno. Dividiendo el desarrollo entre ,
En palabras: el estadistico de Durbin-Watson es aproximadamente 2 menos dos veces la autocorrelacion de rezago uno. Si entonces ; si entonces ; si entonces . Por esto un valor cerca de 2 senala ausencia de autocorrelacion.
Decidir si un observado esta lo bastante lejos de 2 para ser sorprendente es algo incomodo. La distribucion nula de depende de los valores del predictor, asi que Durbin y Watson publicaron un par de cotas, y , que enmarcan el valor critico verdadero. El software esquiva las tablas calculando el valor p directamente. Ambos aparecen abajo.
R y Python¶
Un valor p menor que es facil de leer por encima. La simulacion de abajo lo vuelve concreto construyendo la comparacion que hace la prueba: cientos de series cuyos errores si estan de verdad no correlacionados, para que veas por ti mismo que tan lejos queda 0.43 de cualquier cosa que produzca el azar.
Simula el estadistico de Durbin-Watson con errores honestamente no correlacionados y observa como el monton se junta alrededor de 2. El 0.43 del modelo aereo, marcado en ambar, nunca recibe compania.
15.4 Un remedio: el procedimiento de Cochrane-Orcutt¶
Intuicion¶
Si los errores siguen un patron AR(1), podemos transformarlos para eliminarlos. El truco es la cuasi-diferenciacion: en lugar de la serie cruda, regresamos cada observacion menos veces la observacion anterior. Esa combinacion cancela la parte correlacionada del error y deja atras las innovaciones frescas e independientes. Como el modelo transformado tiene errores no correlacionados, minimos cuadrados ordinarios sobre el es valido otra vez. El unico inconveniente es que es desconocido, asi que lo estimamos a partir de los residuos e iteramos. Ese bucle es el procedimiento de Cochrane-Orcutt.
Formula¶
Parte de la regresion con errores AR(1), escrita de forma compacta con para la fila de predictores (el 1, la tendencia , y las indicadoras de mes) en el mes :
Rezaga toda la regresion un paso, multiplica por , y resta:
es la respuesta cuasi-diferenciada.
es la fila de predictores cuasi-diferenciada.
es la innovacion, y por la definicion AR(1) es independiente en con varianza constante.
El modelo transformado tiene exactamente los mismos coeficientes que el original, pero ahora satisface los supuestos de minimos cuadrados ordinarios, asi que ajustarlo da errores estandar confiables.
Derivacion¶
Demostracion. La definicion AR(1) dice que el error es su propio rezago escalado por mas un choque independiente, , lo que se reordena a . Toma la regresion original y la misma relacion un paso atras, . Multiplica la ecuacion rezagada por y restala de la actual. A la izquierda, ; a la derecha, mas , y esa ultima pieza es exactamente . Asi que la serie cuasi-diferenciada obedece una regresion con el mismo y con los errores independientes de varianza constante . Minimos cuadrados ordinarios esta de vuelta en terreno solido, que es todo el punto de la transformacion.
El obstaculo es que es desconocido. El procedimiento de Cochrane-Orcutt lo estima junto con los coeficientes, iterando:
Ajusta el modelo original por minimos cuadrados ordinarios y guarda los residuos .
Estima regresando sobre por el origen: .
Cuasi-diferencia y cada predictor usando , y reajusta por minimos cuadrados para obtener nuevos .
Recalcula los residuos del ajuste en escala original, reestima , y repite hasta que deje de cambiar.
Cada pasada reduce la autocorrelacion restante; en la practica un par de iteraciones bastan.
Figure 12 despliega los cuatro pasos como un bucle. Leelo de arriba a abajo, luego sigue la flecha naranja de vuelta hacia arriba siempre que el estimado siga moviendose: ajustar, estimar, transformar, reajustar, comprobar, y detenerse una vez que se asiente.

Figure 12:El procedimiento de Cochrane-Orcutt como un bucle. Cada pasada estima la autocorrelacion, cuasi-diferencia con ella, y reajusta; el bucle se repite hasta que el rho estimado deja de cambiar, luego reporta los errores estandar corregidos.
R y Python¶

Figure 13:Graficos de rezago de residuos antes (izquierda) y despues (derecha) de un paso de Cochrane-Orcutt. La cuasi-diferenciacion aplana la inclinacion hacia arriba a una nube redonda, asi que los errores transformados se ven no correlacionados.
El Intentalo 15.4 te pide argumentar que es demasiado. La simulacion de abajo te deja comprobar el argumento sobre el modelo aereo real eligiendo tu mismo la y leyendo la autocorrelacion que sobrevive.
Cuasi-diferencia el modelo aereo con la rho que elijas. Cerca de 0.71 las rachas de residuos se rompen y el estadistico de Durbin-Watson se acomoda junto a 2; empuja hacia 1 y los residuos empiezan a zigzaguear.
15.5 Pronosticar con honestidad: probar en el futuro¶
Intuicion¶
Un modelo que ajusta el pasado a la perfeccion puede aun pronosticar mal el futuro. La unica forma honesta de juzgar un pronostico es ocultar parte del futuro al modelo, pronosticarlo, y comparar. Para datos temporales eso significa una division fuera de tiempo (Definicion 15.11): entrenar en los anos anteriores, probar en los posteriores. Esta es la mentalidad de validacion del Capitulo 12 con una regla estricta anadida por el reloj. Nunca puedes entrenar con datos que llegaron despues de tu periodo de prueba, porque al momento del pronostico esos datos no existian. Dividir al azar, como lo harias para datos transversales, dejaria que el modelo espiara el futuro y se halagara a si mismo.
Entrenamos el modelo de tendencia mas estacionalidad de 1949 a 1957 y pronosticamos de 1958 a 1960, tres anos que nunca ha visto. Figure 15 muestra el resultado, y es una humildad util.

Figure 15:El modelo entrenado de 1949 a 1957 y pronosticando de 1958 a 1960. En los anos de prueba el pronostico deriva por encima de lo que realmente paso, y la banda de prediccion ingenua sombreada se pierde la mayoria de los meses reales.
Formula¶
Dos boletas de calificaciones honestas resumen el desempeno en el conjunto de prueba. La raiz del error cuadratico medio y el error porcentual absoluto medio sobre los meses reservados son
es el conteo real de pasajeros en un mes de prueba; es el pronostico del modelo, retro-transformado de la escala logaritmica exponenciando.
RMSE esta en pasajeros (miles); MAPE es un porcentaje sin unidades que es facil de explicar.
En palabras: RMSE es el tamano tipico de un fallo de pronostico en pasajeros, y MAPE es el fallo promedio como porcentaje del conteo real.
Como el modelo esta ajustado en la escala logaritmica, exponenciamos el pronostico logaritmico para obtener un pronostico de conteo antes de calificar. Tambien llevamos el intervalo de prediccion de regresion ordinaria de 3.5 Intervalo de predicción para una observación nueva, retro-transformado de la misma manera, y revisamos con que frecuencia cubre en realidad la verdad.
R y Python¶
Por que falla tan feo el intervalo de prediccion? El intervalo de 3.5 Intervalo de predicción para una observación nueva se derivo bajo errores independientes, de varianza constante y normales, y tiene en cuenta solo dos fuentes de incertidumbre: la dispersion de un solo error nuevo y la incertidumbre en la media ajustada. Para un pronostico a varios anos vista, ninguna pieza es la historia real. Los errores estan fuertemente autocorrelacionados, asi que una racha de meses malos se compone en lugar de promediarse. La tendencia se extrapola mucho mas alla de los datos, asi que cualquier error en la pendiente estimada crece con el horizonte. Y la incertidumbre genuina del pronostico deberia ensancharse cuanto mas adelante mires, mientras que el intervalo de regresion ordinaria apenas se ensancha. Un intervalo que ignora todo esto esta condenado a ser demasiado estrecho, que es exactamente lo que muestra la cobertura del .
La division de 1957 es una eleccion entre muchas, y la simulacion de abajo te deja moverla. Ver el mismo modelo puntuar bien en los meses que vio y mal en los que no, una y otra vez con distintas divisiones, es la forma mas rapida de fijar la leccion.
Mueve el corte de entrenamiento y compara las dos casillas de error: el modelo puntua cerca de 9 en los meses con los que se entreno y cerca de 63 en los que pronostico. La banda de prediccion del 95 por ciento cubre el 19 por ciento de ellos.
15.6 Resumen del capitulo¶
Ahora puedes manejar la regresion sobre datos ordenados en el tiempo de principio a fin. Ajustas un modelo de tendencia mas estacionalidad en la escala logaritmica (Definicion 15.1), leyendo la tendencia como una tasa de crecimiento y cada coeficiente de mes como un desplazamiento estacional, reutilizando la transformacion logaritmica de 10.2 La transformación logarítmica y la lectura de sus coeficientes y la codificacion ficticia de 11.1 De categorías a números: codificación con indicadores. Puedes explicar por que el orden temporal suele correlacionar los errores, y demostraste, para la media muestral, que la autocorrelacion positiva hace que la formula de varianza ordinaria sea demasiado pequena (Teorema 15.4), asi que minimos cuadrados reporta errores estandar en los que no puedes confiar. Diagnosticas la autocorrelacion de tres formas, el grafico de residuos contra el tiempo, el grafico de rezago, y la prueba de Durbin-Watson, y derivaste por que hace de 2 el valor neutral (Teorema 15.7). Aplicas el procedimiento de Cochrane-Orcutt y sabes por que la cuasi-diferenciacion restaura los errores independientes (Teorema 15.10). Y evaluas un pronostico con honestidad con una division fuera de tiempo, calculando el error de prueba y la cobertura del intervalo de prediccion, y puedes decir con claridad por que los intervalos de pronostico calibrados necesitan metodos de series de tiempo que este curso no cubre.
Resultados clave de un vistazo.
| Resultado | Enunciado o formula | Valido cuando |
|---|---|---|
| Modelo de tendencia mas estacionalidad (Def 15.1) | la tendencia y la estacionalidad son multiplicativas; los logaritmos las vuelven aditivas y estabilizan la varianza | |
| Crecimiento a partir de la pendiente logaritmica | mensual ; anual | respuesta modelada en la escala logaritmica |
| Modelo de error AR(1) (Def 15.3) | , $ | \rho |
| Varianza de la media bajo AR(1) (Thm 15.4) | errores AR(1); supera a cuando , asi que los SE de MCO son demasiado pequenos | |
| Estadistico de Durbin-Watson (Def 15.6) | cualquier regresion ajustada; 0 positiva, 2 ninguna, 4 negativa | |
| Identidad de Durbin-Watson (Thm 15.7) | serie de residuos razonablemente larga | |
| La cuasi-diferenciacion elimina AR(1) (Thm 15.10) | errores AR(1), con conocido o estimado | |
| Calificacion de pronostico fuera de tiempo | RMSE y MAPE sobre los meses posteriores reservados | la division de entrenamiento y prueba respeta el orden temporal |
| Cobertura del intervalo de prediccion | fraccion de meses de prueba dentro del intervalo del | el intervalo es honesto solo si la cobertura |
Cifras aereas: , , pasa de 0.43 a 2.19 tras un paso de Cochrane-Orcutt, RMSE de prueba 63 / MAPE , y cobertura del intervalo de prediccion 0.19 (7 de 36).
Terminos clave. datos ordenados en el tiempo, tendencia, estacionalidad, modelo de tendencia mas estacionalidad, autocorrelacion, modelo de error autorregresivo de primer orden (AR(1)), parametro de autocorrelacion, innovacion, estadistico de Durbin-Watson, prueba de Durbin-Watson, grafico de rezago, procedimiento de Cochrane-Orcutt, cuasi-diferenciacion, division fuera de tiempo, error porcentual absoluto medio (MAPE), cobertura del intervalo de prediccion.
Ahora deberias poder.
Ajustar e interpretar un modelo de tendencia mas estacionalidad en la escala logaritmica, leyendo la tendencia como una tasa de crecimiento y cada coeficiente de mes como un desplazamiento estacional.
Explicar por que el orden temporal correlaciona los errores, y mostrar que la autocorrelacion positiva hace que los errores estandar de minimos cuadrados ordinarios sean demasiado pequenos.
Diagnosticar la autocorrelacion con un grafico de residuos contra el tiempo, un grafico de rezago, y la prueba de Durbin-Watson.
Derivar y usarlo para leer la escala de Durbin-Watson.
Aplicar el procedimiento de Cochrane-Orcutt y explicar por que la cuasi-diferenciacion restaura los errores independientes.
Evaluar un pronostico con una division fuera de tiempo, calculando el RMSE de prueba, el MAPE, y la cobertura del intervalo de prediccion.
Explicar por que los intervalos de pronostico calibrados necesitan metodos de series de tiempo mas alla de la regresion ordinaria.
Donde encaja esto. Este capitulo sirve a las etapas de COMPROBAR (CHECK) y USAR (USE) del flujo de trabajo de modelado introducido en El flujo de trabajo del modelado. PREGUNTAMOS (ASK) una pregunta de pronostico y EXPLORAMOS (EXPLORE) la serie, AJUSTAMOS (FIT) un modelo de tendencia y estacionalidad, luego pasamos la mayor parte del capitulo en COMPROBAR: el supuesto de errores no correlacionados en el que se apoyo toda la inferencia anterior falla sobre datos temporales, asi que diagnosticamos el fallo con la prueba de Durbin-Watson y reparamos la inferencia con Cochrane-Orcutt. La etapa de USAR, el pronostico, viene con una advertencia que los capitulos anteriores podian hacer limpiamente pero este no puede: el intervalo de prediccion de 3.5 Intervalo de predicción para una observación nueva, honesto bajo errores independientes, esta aqui mal calibrado. Esa es la costura donde un curso de regresion aplicada entrega el relevo a un curso de series de tiempo: la division fuera de tiempo y la disciplina de pronostico honesto que construiste aqui son los habitos de entrada que cualquier curso asi supone. El Capitulo 16 (16. Análisis de rutas y una mirada hacia adelante) cierra el libro apartandose de cualquier modelo individual para preguntar que puede y que no puede decir una cadena de regresiones sobre la causa, y recorriendo todo el flujo de trabajo una ultima vez.
15.7 Preguntas frecuentes¶
P1. Por que tomar logaritmos de los pasajeros en lugar de modelar los conteos directamente? Porque las oscilaciones estacionales y la dispersion del error crecen ambas con el nivel de la serie, que es un patron multiplicativo. Tomar logaritmos convierte el efecto estacional multiplicativo en uno aditivo, asi que un unico conjunto de coeficientes de mes ajusta los doce anos, y estabiliza la varianza de modo que el supuesto de varianza constante queda mas cerca de ser verdad. Este es el mismo razonamiento de 10.2 La transformación logarítmica y la lectura de sus coeficientes, aplicado a una serie que crece con el tiempo.
P2. Si minimos cuadrados sigue siendo insesgado bajo autocorrelacion, por que preocuparse? Insesgado significa que la estimacion es correcta en promedio, pero un solo analisis te da una estimacion, y necesitas saber que tan lejos podria estar. Ese es el trabajo del error estandar, y la autocorrelacion hace que el error estandar reportado sea incorrecto, usualmente demasiado pequeno. Terminas con una estimacion puntual que esta bien y un intervalo de confianza que miente sobre su propia confiabilidad.
P3. Mi estadistico de Durbin-Watson es 2.6. Es eso un problema? Esta del lado de la autocorrelacion negativa, ya que significa . De , un de 2.6 implica . La autocorrelacion negativa leve es menos comun que la positiva pero si ocurre, a menudo por sobre-diferenciacion o por una variable medida como un cambio. Si es “un problema” depende del valor p y de cuanto te apoyes en los errores estandar.
P4. Cambia Cochrane-Orcutt la estimacion de la tendencia o solo los errores estandar? Ambos, un poco. El ajuste cuasi-diferenciado es una estimacion de minimos cuadrados generalizados, que pondera los datos de forma distinta a minimos cuadrados ordinarios, asi que los coeficientes se desplazan un tanto. El cambio mas grande e importante es a los errores estandar, que ahora tienen en cuenta la correlacion y son los que deberias reportar.
P5. Por que no usar simplemente el intervalo de prediccion ordinario y admitir que es aproximado? Porque no es aproximadamente correcto, es gravemente incorrecto: sobre el conjunto de prueba aereo cubrio el de los meses en lugar del . Un intervalo tan alejado no comunica la incertidumbre, la tergiversa. Si no puedes producir un intervalo calibrado, reporta el error de prueba fuera de tiempo en su lugar, que es honesto sobre como se desempena en realidad el pronostico.
P6. Podria agregar mas predictores en lugar de modelar la correlacion del error? A veces. Los residuos autocorrelacionados pueden ser un sintoma de un predictor faltante, una curvatura de tendencia omitida o un termino estacional saltado, y agregar el predictor correcto puede eliminar el patron en su origen. Ese suele ser el mejor arreglo cuando puedes encontrar la estructura faltante. Cochrane-Orcutt es para la correlacion de residuos que queda despues de haber modelado la estructura que puedas.
P7. Es un alto como 0.983 evidencia de que el pronostico sera bueno? No. Ese mide el ajuste al pasado, y todo el punto de este capitulo es que el ajuste en muestra y la precision de pronostico fuera de tiempo son cosas distintas. El mismo modelo con se perdio el futuro por un y su intervalo cubrio un mes de prueba de cada cinco. Juzga un pronostico sobre datos reservados, nunca sobre .
15.8 Problemas de practica¶
(A) En una oracion cada uno, nombra los tres rasgos de la serie aerea en Figure 1 y di que termino del modelo de tendencia mas estacionalidad captura cada uno.
(A) Explica por que los errores en una regresion sobre datos mensuales probablemente esten correlacionados, y da una razon concreta por la que dos meses vecinos compartirian el signo de su error.
(A) La pendiente de tendencia estimada es en la escala logaritmica. Interpretala como una tasa de crecimiento porcentual mensual, y explica por que se necesita exponenciar.
(A) Un estadistico de Durbin-Watson vale 0.43. Sin una tabla, enuncia que implica sobre la autocorrelacion de rezago uno y sobre la confiabilidad de los errores estandar ordinarios.
(A) Explica, a alguien que no ha tomado este curso, por que dividir datos de series de tiempo al azar para una evaluacion de entrenamiento y prueba es hacer trampa, y cual es la division correcta.
(A) El intervalo de prediccion ingenuo del cubrio el de los meses de prueba. Enuncia con claridad que se supone que significa “cobertura del 95%” y por que es un fracaso, no solo un pequeno fallo.
(A) Da una lectura incorrecta del coeficiente de julio que un estudiante descuidado podria enunciar, luego corrigela. (Pista: el coeficiente esta en la escala logaritmica, respecto a enero.)
(A) Por que la autocorrelacion positiva, y no la negativa, hace que minimos cuadrados ordinarios sea demasiado confiado? Senala el signo de los terminos de covarianza en la varianza de la media.
(B) Partiendo de , deriva la aproximacion (Teorema 15.7), enunciando el paso donde las dos sumas truncadas se reemplazan por la suma de cuadrados de los residuos completa y por que es razonable para grande.
(B) Para con y , deriva (Teorema 15.4), y concluye que supera a cuando .
(B) Usando el modelo de error AR(1) , deriva la transformacion de cuasi-diferenciacion (Teorema 15.10) y muestra que el error transformado es igual a la innovacion independiente .
(B) Muestra que para un proceso AR(1) estacionario, partiendo de y usando .
(B) En el modelo AR(1), muestra que la correlacion entre errores separados pasos es , asi que la autocorrelacion decae geometricamente con el rezago. (Usa .)
(B) La transformacion de Cochrane-Orcutt pierde la primera observacion, ya que no tiene antecesor. Explica por que, y describe como la variante de Prais-Winsten la recupera reescalando la primera fila por (un argumento de un parrafo, sin derivacion completa necesaria).
(B) Un estudiante afirma que como es insesgado bajo autocorrelacion, el intervalo de confianza sigue siendo valido. Identifica el error en la afirmacion y enuncia con precision cual cantidad del intervalo es incorrecta.
(B) Muestra que si los errores verdaderos no estan correlacionados (), el primer paso de Cochrane-Orcutt estima y el ajuste cuasi-diferenciado se reduce a minimos cuadrados ordinarios, asi que el procedimiento no hace dano cuando no hay autocorrelacion.
(C) Lee
airpassengers.csv, construyetylogpass, ajusta el modelo de tendencia mas estacionalidad, y reproduce la pendiente de tendencia, el , y la desviacion estandar de los residuos reportados en el Ejemplo 15.1.(C) Calcula el estadistico de Durbin-Watson a partir de los residuos a mano (via ) y confirmalo contra
lmtest::dwtesten R odurbin_watsonen Python. Reporta ambos.(C) Haz el grafico de residuos contra el tiempo y el grafico de rezago para el modelo ajustado. Describe que muestra cada uno y como concuerdan sobre el signo de la autocorrelacion.
(C) Estima a partir de los residuos, cuasi-diferencia la respuesta y la matriz de diseno, reajusta, y reporta el estadistico de Durbin-Watson antes y despues. Confirma que pasa de cerca de 0.43 hacia 2.
(C) Ajusta el modelo sin logaritmos (
passengers ~ t + month) y compara su grafico de residuos contra el tiempo y su estadistico de Durbin-Watson con los del modelo logaritmico. Quitar el logaritmo mejora o empeora la autocorrelacion, y se ve constante la dispersion de los residuos?(C) Divide los datos por tiempo (entrena de 1949 a 1957, prueba de 1958 a 1960), ajusta sobre los anos de entrenamiento, pronostica los anos de prueba, retro-transforma, y reproduce el RMSE de prueba y el MAPE del Ejemplo 15.6.
(C) Para la misma division, calcula la cobertura del intervalo de prediccion ingenuo del sobre el conjunto de prueba y confirma que esta muy por debajo de 0.95. Luego calcula la cobertura en muestra sobre el conjunto de entrenamiento y comenta la diferencia.
(C) Reajusta el modelo de tendencia mas estacionalidad quitando las ficticias estacionales (solo tendencia,
logpass ~ t). Reporta la caida en y el nuevo estadistico de Durbin-Watson, y explica como el patron estacional no modelado aparece en los residuos del ajuste de solo tendencia.(C) Agrega un termino de tendencia al cuadrado (
logpass ~ t + I(t^2) + month) y reporta si el termino de curvatura es necesario y si reduce la autocorrelacion de residuos. Interpreta que significaria un coeficiente negativo sobre para la tasa de crecimiento.(C) Usando el ajuste de entrenamiento, pronostica diciembre de 1958, 1959, y 1960 (meses 120, 132, 144), retro-transforma, y compara cada uno con el valor real. Describe como crece el error de pronostico con el horizonte.
(C) Repite la evaluacion fuera de tiempo con una division mas temprana (entrena de 1949 a 1955, prueba de 1956 a 1960). Reporta el MAPE de prueba y comparalo con el de la division de 1958. Explica por que una ventana de entrenamiento mas corta puede cambiar el error de pronostico.
(C) Corre la simulacion del Ejemplo 15.3 para , , y , y reporta la razon del SE promedio reportado a la desviacion estandar verdadera de para cada uno. Describe como cambia la razon a medida que crece y que significa eso para los intervalos de confianza.
(A) El intervalo de prediccion de regresion ordinaria de 3.5 Intervalo de predicción para una observación nueva cubrio solo el de los meses de prueba aereos. Da las tres razones por las que este intervalo es estructuralmente demasiado estrecho para un pronostico a varios anos vista, y nombra una familia de metodos que construye la correlacion del error dentro del modelo de modo que su intervalo de pronostico se ensancha con el horizonte.
15.9 Practica de examen¶
Estas cinco preguntas estan escritas en el estilo de los examenes del curso: cada una te entrega una salida o una afirmacion y te pide explicar, en oraciones completas con unidades, que significa. Un numero correcto sin razonamiento gana poco credito aqui. Trabaja cada una antes de abrir la respuesta modelo.
EP 15.1 (interpreta esta salida en contexto). El modelo de tendencia mas estacionalidad se
ajusto a los 144 meses completos de airpassengers.csv, y el software reporto lo siguiente.
Coefficients (partial):
Estimate Std. Error t value Pr(>|t|)
t 0.0100688 0.0001193 84.40 < 2e-16 ***
Durbin-Watson test: DW = 0.4252, p-value < 2.2e-16
alternative hypothesis: true autocorrelation is greater than 0Interpreta el coeficiente de tendencia como una tasa de crecimiento anual (usa ), y luego explica, dado el resultado de Durbin-Watson, si reportarias el error estandar impreso de 0.00012 y el valor p diminuto sobre la tendencia al pie de la letra. Enuncia la direccion en la que esos numeros son incorrectos y por que.
Respuesta modelo
En la escala logaritmica la tendencia de 0.0101 por mes se compone en doce meses a , asi que el trafico de pasajeros crecio cerca de por ano entre 1949 y 1960. El estadistico de Durbin-Watson de 0.43 se situa muy por debajo del valor neutral de 2, con un valor p por debajo de , asi que los residuos estan fuertemente correlacionados de forma positiva: un mes por encima de la linea ajustada suele ir seguido por otro por encima. Eso importa porque cada formula de error estandar en el modelo supone errores no correlacionados, y la autocorrelacion positiva lo viola. Bajo autocorrelacion positiva minimos cuadrados ordinarios trata los meses correlacionados como si cada uno llevara informacion independiente, asi que divide entre demasiado y reporta un error estandar que es demasiado pequeno, lo que a su vez hace que el estadistico t sea demasiado grande y el valor p demasiado diminuto. La estimacion puntual de la tendencia, 0.0101, sigue siendo insesgada y vale la pena reportarla, pero el error estandar impreso de 0.00012 y el valor p microscopico sobrestiman la precision y no deberian tomarse al pie de la letra; la inferencia honesta necesita primero una correccion como Cochrane-Orcutt.
Una respuesta debil convierte la tasa de crecimiento pero luego confia en el valor p pequeno, o dice que el error estandar es “demasiado grande”, pasando por alto que la autocorrelacion positiva encoge el error estandar reportado en lugar de inflarlo.
EP 15.2 (un estudiante afirma X, evalua). Un estudiante escribe: “Este modelo tiene , asi que explica casi toda la variacion en la serie. Eso significa que pronosticara los conteos mensuales de pasajeros del proximo ano con una precision de cerca del .” Usando la evaluacion fuera de tiempo de este capitulo, evalua el razonamiento del estudiante y enuncia cual es la expectativa correcta.
Respuesta modelo
El estudiante ha confundido el ajuste en muestra con la precision de pronostico fuera de tiempo, que es el error central contra el que advierte este capitulo. El mide solo que tan bien la linea ajustada describe los meses de 1949 a 1960 con los que se entreno el modelo; no dice nada directamente sobre meses que el modelo nunca ha visto. Cuando el modelo se entrena de 1949 a 1957 y se le pide pronosticar los meses reservados de 1958 a 1960, su error porcentual absoluto medio de prueba es cerca del , no del , y su RMSE de prueba de 63 mil pasajeros empequenece al RMSE de entrenamiento de cerca de 9. El pronostico se degrada fuera de muestra porque el modelo extrapola la tasa de crecimiento temprana hacia anos en que el crecimiento se desacelero, y porque los errores autocorrelacionados derivan todos en la misma direccion a la vez en lugar de cancelarse. Asi que la expectativa correcta es que el modelo describe el pasado muy bien pero pronostica el futuro cercano solo con una precision de cerca del , y la unica forma honesta de saberlo es probarlo sobre meses posteriores reservados, nunca leerlo del .
Una respuesta debil simplemente dice “un alto es bueno” o disputa la cifra de 0.983, sin nombrar la distincion entre en muestra y fuera de tiempo ni citar el error de prueba de aproximadamente como el numero honesto.
EP 15.3 (interpreta esta salida en contexto). Se corrio un paso de Cochrane-Orcutt sobre el modelo aereo, produciendo la salida de abajo.
rho_hat (lag-one autocorrelation of residuals): 0.7918
Durbin-Watson before quasi-differencing: 0.4252
Durbin-Watson after quasi-differencing: 2.1891Explica que le hizo este procedimiento al modelo, que problema muestra el estadistico “despues” que arreglo, y nombra una cosa que este paso no arregla. Escribe en oraciones completas.
Respuesta modelo
El procedimiento estimo la autocorrelacion de primer orden de los residuos como , luego cuasi-diferencio la respuesta y cada predictor reemplazando cada valor por si mismo menos 0.79 veces su antecesor, y reajusto. La cuasi-diferenciacion con el correcto cancela la parte correlacionada de un error AR(1) y deja atras las innovaciones independientes, asi que el modelo transformado satisface el supuesto de errores no correlacionados que el original violaba. El estadistico de Durbin-Watson confirma que esto funciono: paso de 0.43, muy dentro de la zona de autocorrelacion positiva, a 2.19, esencialmente el valor neutral de 2, asi que la autocorrelacion de primer orden desaparecio y los errores estandar del ajuste transformado ahora son confiables. Lo que Cochrane-Orcutt no arregla es el problema del pronostico: repara la inferencia sobre la tendencia y los coeficientes estacionales, pero no hace que el modelo extrapole mejor el futuro, asi que el error de prueba fuera de tiempo y el intervalo de prediccion mal calibrado quedan exactamente tan pobres como antes. Corregir los errores estandar y pronosticar bien son metas separadas.
Una respuesta debil lee “2.19 esta cerca de 2” sin explicar que la cuasi-diferenciacion elimino la correlacion AR(1), o afirma que el paso tambien mejora el pronostico, lo cual no hace.
EP 15.4 (que cambiaria si). Supon que hubieras ajustado el modelo a los conteos crudos de
pasajeros en lugar de sus logaritmos, passengers ~ t + month. Los dos ajustes se comparan asi.
R^2 residual SE DW corr(|residual|, fitted)
raw counts 0.9559 26.33 pass 0.4502 +0.137
log counts 0.9835 0.0593 (log) 0.4252 -0.041Explica que cambiaria, y que no, si usaras el ajuste de conteos crudos. Aborda tanto el comportamiento de la dispersion de los residuos como si el problema de la autocorrelacion queda curado, y di por que la escala logaritmica es preferible aqui.
Respuesta modelo
Dos cosas cambian y una no. Primero, la dispersion de los residuos deja de ser constante: en la escala cruda el tamano de los residuos crece con el nivel ajustado, mostrado por la correlacion positiva de +0.137 entre los residuos absolutos y los valores ajustados, asi que los errores se abren en abanico a medida que el trafico de pasajeros sube y el supuesto de varianza constante falla. El ajuste logaritmico elimina ese abanico, con una correlacion casi nula de -0.04, porque tomar logaritmos convierte las oscilaciones estacionales multiplicativas en aditivas y estabiliza la varianza. Segundo, un unico conjunto de coeficientes de mes ya no describe cada ano igual de bien en la escala cruda, ya que la brecha estacional en pasajeros es pequena al principio y grande al final; ese es el mismo patron multiplicativo que el logaritmo maneja. Lo que no cambia es la autocorrelacion: el estadistico de Durbin-Watson de conteos crudos es 0.45, esencialmente tan malo como el 0.43 del modelo logaritmico, asi que apagar el logaritmo no hace nada para curar la autocorrelacion positiva, que viene del orden temporal y no de la escala. La escala logaritmica es preferible porque arregla la varianza no constante y deja que un patron estacional ajuste los doce anos, mientras que la autocorrelacion aun debe manejarse por separado con Cochrane-Orcutt o un modelo de series de tiempo.
Una respuesta debil afirma que el logaritmo “arregla la autocorrelacion” (no lo hace, ambos estadisticos estan cerca de 0.45) o ignora la dispersion creciente de los residuos que el logaritmo esta realmente ahi para curar.
EP 15.5 (explica por que). Sobre el conjunto de prueba de 1958 a 1960, el intervalo de prediccion nominal del del modelo cubrio solo 7 de los 36 meses de prueba, una cobertura real del .
nominal coverage: 0.95
actual coverage: 0.194 (7 of 36 test months inside the 95% interval)Enuncia que se supone que significa “cobertura del ”, explica por que es un fracaso estructural en lugar de un pequeno fallo, da las tres razones por las que el intervalo de regresion ordinaria es demasiado estrecho para un pronostico a varios anos vista, y nombra una familia de metodos construida para arreglarlo.
Respuesta modelo
Un intervalo de prediccion del es una promesa de que, a lo largo de muchos pronosticos, cerca de 95 de cada 100 observaciones futuras caeran dentro de sus intervalos, asi que deberia estar equivocado aproximadamente una vez de cada veinte. Cubrir solo el de los meses de prueba significa que el intervalo estuvo equivocado cerca de cuatro veces de cada cinco, asi que no es un intervalo ligeramente optimista sino uno que tergiversa la incertidumbre por un amplio margen; la tasa de fallo prometida de uno de cada veinte se convirtio en una tasa de fallo de cuatro de cada cinco. El intervalo de regresion ordinaria es estructuralmente demasiado estrecho aqui por tres razones. Primero, los errores estan fuertemente correlacionados de forma positiva, asi que una racha de meses malos se compone en la misma direccion en lugar de promediarse, y el intervalo, derivado bajo errores independientes, nunca tiene en cuenta eso. Segundo, la tendencia se extrapola anos mas alla de los datos de entrenamiento, asi que cualquier error en la pendiente estimada crece con el horizonte de pronostico, pero el intervalo ordinario apenas se ensancha a medida que llega mas lejos. Tercero, la incertidumbre genuina del pronostico deberia ensancharse cuanto mas adelante mires, mientras que el intervalo de prediccion de regresion permanece casi del mismo ancho a lo largo de todo el periodo de prueba. Los metodos construidos para arreglar esto son la familia de series de tiempo, como los modelos autorregresivos integrados de media movil (ARIMA), el suavizamiento exponencial, y los modelos de espacio de estados o estructurales, que construyen la correlacion del error dentro del modelo de modo que sus intervalos de pronostico se ensanchan con el horizonte.
Una respuesta debil trata el como meramente “un poco bajo”, o lista solo una razon (usualmente la autocorrelacion) sin las razones de la pendiente extrapolada y del ensanchamiento con el horizonte, o no nombra ningun remedio propio de series de tiempo.
Juego del capitulo¶
Chapter summary (in English)
This chapter covers regression with time-ordered data, using the classic monthly airline passenger series from 1949 to 1960. The series shows three features: a rising trend, a yearly seasonality with a summer peak, and swings that grow with the level. We model $\log Y_t = \beta_0
\beta_1 t + \sum_{m=2}^{12}\gamma_m D_{mt} + \varepsilon_t98.3%b_1 = 0.01011.0%12.8%$ per year.
The central problem is autocorrelation: in time data the errors are correlated with their recent past, which violates the uncorrelated-errors assumption. With the first-order autoregressive (AR(1)) model , we show that positive autocorrelation makes the true variance of the estimator exceed the ordinary formula, so least squares reports standard errors that are too small. A simulation shows the reported standard error is barely a third of the true one.
To detect autocorrelation we use the residual-versus-time plot, the lag plot, and the Durbin-Watson test, with statistic . We derive that , so 2 signals no autocorrelation. For the airline series (strong positive autocorrelation, ). The Cochrane-Orcutt procedure transforms the model by quasi-differencing , leaving independent errors; after one iteration rises from 0.43 to 2.19.
Finally we evaluate the forecast honestly with an out-of-time split: train on 1949 to 1957, test on 1958 to 1960. The test RMSE (63) far exceeds the training one (9), with a MAPE of , and the prediction interval covers only of the months. That is why calibrated forecast intervals need time-series methods beyond this course.