Escudo de la República de Colombia Escudo de la República de Colombia
Menú
Logo FCE Blanco

Panel de Accesibilidad

Por: Samantha Alfonso Velandia y Alejandro Díaz Melo

Introducción

 

SAS University es un software que posee alto potencial en modelación estadística; sus procedimientos facilitan la estimación de técnicas econométricas básicas y avanzadas. Este documento estudia la implementación de modelos de Series de Tiempo univariadas, Paneles de Datos y componentes principales dentro del software, junto con las técnicas requeridas para que estos modelos cuenten con consistencia teórica y práctica.

 

El propósito de este documento es proporcionar una guía con la descripción de las principales utilidades del software, su interfaz, análisis en estadística descriptiva, econometría básica y avanzada. 

 

El documento se divide en la implementación de cada uno de los módulos previamente mencionados (3), sobre estos se realizará el respectivo marco teórico y un ejemplo práctico de las diferentes técnicas de análisis estadístico empleadas, adicionalmente contiene la ilustración de su aplicación dentro del software y una explicación de los resultados arrojados por el programa.

 

El estudio demuestra que SAS posibilita el desarrollo de técnicas de análisis econométrico y que se trata de un software con múltiples ventajas en la modelación estadística, con respecto a otros paquetes del campo como E-Views, RATS, SPSS, Stata y R.

 

 

Interfaz 

 

 

SAS University es la edición gratuita de SAS Studio; un software estadístico con la capacidad de procesar bases de gran tamaño “Big Data” este software permite realizar análisis cuantitativo, econométrico y predicciones con mayor facilidad respecto a otros softwares estadísticos.

SAS University es un software libre y requiere de un navegador para su correcto funcionamiento, este software soporta navegadores como internet Explorer, Safari, Firefox y Chrome. En cuanto a la importación de archivos SAS permite importar archivos. Xls,  .xlsb,  .xlsm,  .xlsx, Stata, Spss entre otros.

La interfaz de SAS University está compuesta por un panel de navegación a la izquierda y un área de trabajo a la derecha, el panel de navegación contiene los archivos y carpetas del servidor, un módulo de tareas y utilidades, fragmentos de código, librerías y acceso directos a los archivos; en la ventana de trabajo vamos a encontrar el programa, en este podemos ingresar los comandos y se encontrarán las salidas.

 

sas interfaz

 

El análisis de datos con SAS University se puede realizar mediante dos métodos: el uso de comandos o el panel de navegación, para mostrar la versatilidad del programa se darán a conocer ambas metodologías, sin embargo, la segunda es la que permite realizar los procedimientos más avanzados.

Con la pestaña tareas y utilidades, podemos realizar gráficos, análisis estadístico, econométrico y predictivo sin utilizar código ya que el programa lo va a generar automáticamente, sin embargo, en el área de trabajo podemos ingresar comandos para realizar distintos análisis que no se encuentran predeterminados.

 

 

Análisis Estadístico

 

Para el desarrollo de este módulo se utilizarán herramientas del panel de navegación para importar datos, obtener análisis de estadística descriptiva y realización de gráficos. Lo anterior puesto que para este tipo de análisis la interfaz de SAS es muy intuitiva y es más eficiente que con la utilización de comandos, pues permite modificar preferencias fácil y rápidamente. Sin embargo, se podrá observar cómo se realiza la importación de datos y estadística descriptiva con código en el módulo econométrico.

Para este ejemplo utilizaremos la base de datos Bemploy la cual está en formato Excel y cuyas variables son:

Variable Descripción 
Age Edad
Educ Nivel de educación
Employ Años en el empleo actual
Adress Años en la dirección actual
Income Ingresos familiares en miles
Creddebt Deudas tarjeta de crédito en miles
Othdebt Otras deudas en miles
Default Incumplimientos previos.

 

Importación de Datos 

 
 
 
 
 
 
 
 
 
 
 
Arrow
Arrow
 
 
Slider

Estadística Descriptiva

 
 
 
 
 
 
Arrow
Arrow
 
 
Slider

 

Gráficos

SAS Cuenta con diversos tipos de gráficos para realizar anàlisis de datos y el procedimiento para realizarlos es intuitivo, permite ajustar los datos a nuestras prefencias. Esta es una de las mayores ventajas que posee el software.  Para el análisis estadístico el panel de navegación es más útil ya que nos permite realizar gráficos con mayor versatilidad.

 
 
 
 
 
 
 
 
Arrow
Arrow
 
 
Slider

 

Análisis Econométrico:

Para este análisis utilizaremos las dos metodologías, en primer lugar, utilizaremos el panel de navegación y observaremos que limitaciones tiene esté método y luego mostraremos este análisis con código. En ambos métodos utilizaremos la misma base de datos para poder comparar el alcance de cada uno. 

Variable Descripción
Imp Importaciones
PIB Producto Interno Bruto
ITCR Índice de la Tasa de Cambio Real 
IPC Índice de Precios al Consumidor
IPI Índice de Producción Industrial 

Procedimiento con el Panel de Navegación (Sin código)

 Importación de Datos

 
 
 
 
 
 
 
 
 
Arrow
Arrow
 
 
Slider

 

Regresión Lineal Múltiple

 
 
 
 
 
 
 
Arrow
Arrow
 
Slider

 Interpretación de Salidas

 
 
 
 
 
 
 
Arrow
Arrow
 
Slider

 

El panel navegador permite realizar regresiones simples, multiples  y analizar algunas caracteristicas de los valores predichos, sin embargo por medio de estas herramientas que nos ofrece el panel no es posible realizar pruebas de los supuestos, es por esta razon que se va a realizar la misma regresión pero utilizando el panel de trabajo, donde podemos introducir código para añadir complementos al análisis econométrico.

 

Procedimiento con el Panel de Trabajo (Con Código)

 A continuación se relacionan los comandos más utilizados en SAS para la realización de estadística descriptiva y análisis econométrico.

Comando  Descripción
FILE Abrir, guardar, imprimir.
RUN Ejecutar
PROC Para que salga en el Output
PROC REG Hacer Regresión
PROC CONTENTS Más información estadística sobre la Base
PROC PRINT Información sobre las Observaciones, muestra los datos.
PROC MEANS Estadística descriptiva sobre las variables
PROC FREQ Para Variables Categóricas
PROC UNIVARIATE Resumen de estadísticas más detalladas
PRO CORR  Correlaciones
PLOT  Graficar


Importación de Datos

Para la importación de datos en SAS en primer lugar se debe tener en cuenta el tipo de archivo que vamos a importar, sus caracteristicas y su ubicación. En primer lugar ubicamos la ruta del archivo, el tipo de archivo, si esta demilitado y si la base tiene encabezados. Nuestro archivo es .xls, tiene encabezados, quedó guardado en la librería temporal WORK y su nombre es IMPORT.

1

Ahora utilizamos PROC CONTENTS para obtener datos sobre la base  que hemos importado y PROC MEANS para análisis de  estadística descriptiva, estas dos ultimas salidas   no se mostrarán ya que son los mismas que se realizaron en  el procedimiento sin código   y ya se interpretaron anteriormente. 

2

3

PROC UNIVARIATE realiza un analisis más especifico de la estadistica desciptiva y en este caso si es mejor utilizar el codigo ya que este comando realiza un anlaisis detallado por cuantiles e incluye otros fatores como la asimetria e informacion por observación. En este caso utilizar comandos es mejor que utilizar el panel de navegación.

4

 

En este caso solo se dejó el análisis que PROC UNIVARIATE le hizo a la primera variable ya que es bastante extenso, pero es importante tener en cuenta que SAS realizó estadística descriptiva por observación, histogramas y diagramas de caja para cada variable.

 

 
 
 
 
Arrow
Arrow
 
Slider

Si quermos añadir un histograma a la anetrior salida podemos utilizar el siguiente código:

8

Con el siguiente comando se evidencia la diferencia entre  trabajar con condigo ya que  este permite seleccionar cierto número de observaciones, en este caso se quiere que solo las cinco primeras observaciones sean visibles.

 
 
Arrow
Arrow
 
Slider

 

 El siguiente comando es similar al anterior solo que especifica la cantidad de observaciones que podemos ver según una caracteristica de alguna variable, en este caso las que poseen datos inferiores a once para la variable PIB.

 

 
 
Arrow
Arrow
 
Slider

 

Regresión Lineal Múltiple

 

Mediante este proceso queremos observar si el uso de código en SAS permite n probar los supuestos del modelo y realizar un análisis más detallado.

20

Este comando realiza los mismos análisis que se observaron por el otro método así que no serán explicadas estas salidas ya que es la misma base de datos. 

Supuestos Sobre el Modelo y el Término de Error

 

A continuación, realizaremos con SAS el análisis de supuestos que mediante el uso del panel e navegación no se podía realizar. Supuestos sobre el modelo: linealidad en los paramentos, muestras grandes y no multicolinealidad.  Supuestos sobre el término de error: no autocorrelación, homocedasticidad y normalidad en los errores. Con las primeras salidas ya habíamos probado linealidad y muestra suficiente, así mismo la correcta especificación del modelo ya se había revisado en las anteriores en los anteriores procedimientos. A continuación, relacionamos algunas pruebas de los supuestos que SAS permite realizar mediante el panel de trabajo.

 

Múlticolinealidad

Utilizando PROC CORR es posible verificar la correlación entre las distintas variables, con esta salida se confirma la alta correlación entre las distintas variables ya que estas son cercanas a 1 en la segunda tabla para todas las variables.

sam

 

2

 

Otro método para revisar este supuesto es mediante el comando collinoint. En este ya que el índice de condición presenta en la fila número 4 un valor superior a10 y las variables PIB e IPC son cercanas a 1, es posible afirmar que existe un alto grado de multicolinealidad en especial en estas dos variables.

 

 

 

Autocorrelación:

Prueba Durbin Watson:

 
 
Arrow
Arrow
 
Slider



Debido a que el coeficiente de Durbin Watson es inferior a 2 el modelo no presenta problemas de autocorrelación.

 

Heterocedasticidad:

 

 
 
Arrow
Arrow
 
Slider

 

Dado que el P- value es superior a 0.05 se acpta la hipótesis nula, es decir el modelo no presenta problemas de heteroscedasticidad.

 

Cuando la regresión es simple es posible realizar en SAS mayores pruebas y gráficos para determinar cada supuesto y esta es una de las limitaciones que posee el programa.

Series de tiempo univariadas

El análisis de series temporales es una de las herramientas más usadas y mayor valoradas para el economista. El ambiente de incertidumbre en los que se desenvuelven las economías requieren de elementos y herramientas eficaces que permitan discernir sobre el comportamiento que se puede observar en un horizonte temporal finito. En ese sentido, las propiedades de las series de tiempo y su tratamiento es una de las principales destrezas que debe desarrollar el econometrista, con el fin de que su labor mitigue el impacto que deja la incertidumbre.

Éste módulo tiene como objetivo aplicar las herramientas que se usan con mayor frecuencia en el análisis de series temporales en SAS University. La primera parte consiste en un marco teórico resumido, que explica ciertas propiedades de las series temporales. Partiremos del concepto de proceso estocástico, para definir el espacio en el que se encuentran las series de tiempo. Se trabajará con una clase particular de procesos estocásticos: los procesos estacionarios y se hará una breve introducción a diversas clases de procesos estacionarios: Los procesos autor regresivos, los de media móvil, los procesos integrados, etc.

La segunda parte consistirá en la aplicación de la metodología desarrollada por Box y Jenkins (1976) usando el sofwtare. Se realizarán pruebas de raíz unitaria, el proceso de estimación, la evaluación y pronóstico de los modelos ARIMA.

Marco teórico

El espacio en el que se desenvuelven las series temporales permite conocer la dependencia temporal de la serie de tiempo con la que piensa trabajarse. El objetivo de este apartado consiste en ilustrar en forma resumida las definiciones y propiedades de los procesos estocásticos, particularmente los procesos estacionarios. Cabe resaltar que el objetivo es presentar un resumen de los conceptos teóricos asociados al análisis y, por tanto, se recomienda profundizar en estos conceptos usando la bibliografía recomendada.

Definición 1: Un proceso estocástico es una sucesión de variables aleatorias {Zt} la cual se encuentra definida sobre un conjunto C, para cada valor de t. 

La serie (z1, z2, z3, ... , zT ) para t = 1, 2, 3, . . . , T es denominada una realización del proceso estocástico. 

Diremos que el proceso estocástico se encuentra caracterizado si se definen las distribuciones finito dimensionales de las variables aleatorias (z1, z2, z3, ... , zT ) para t = 1, 2, 3, ... , T. Además, si se conocen estas distribuciones, diremos que conocemos la estructura probabilística del proceso. Esto permite determinar las distribuciones marginales de cada variable zt.

Propiedades de las distribuciones marginales. 

1. Para una función de medias del proceso: diremos que el proceso es estable en la media si: 

S01

2. Para una función de varianzas del proceso: si la varianza es constante en el tiempo, diremos que el proceso es estable en varianza si:

S02

3. Función de autocovarianzas del proceso. Es definida como: 

S03

4. Función de autococorrelación del proceso. Es definida como: 

S04

Proceso estacionario 

Una clase particular de los procesos estocásticos son aquellos que son estacionarios. Asumir que la serie de tiempo tiene esta propiedad facilita la obtención de la distribución de probabilidad del proceso estocástico. En particular, esto es útil cuando solo se cuenta con una realización del proceso estocástico. 

Definición 2: Un proceso estocástico es estacionario en sentido estricto si:

1. Las distribuciones marginales de todas las variables son idénticas

2. Las distribuciones finito-dimensionales de cualquier conjunto de variables solo dependen de los retardos entre ellas.

La primera condición establece que tanto la media, la varianza, la asimetría y curtosis son iguales de todas las variables son las mismas. La segunda, que la distribución conjunta de un conjunto de variables no se modifica al trasladarlas en el tiempo: F(zi, zj , ... , zk) = F(zi+h, zj+h, ... , zk+h). 

Una condición más débil y más contrastable en la práctica, se denomina Estacionariedad débil. 

Definición 3: Un proceso estocástico es estacionario en sentido débil si:

S05

La estacionariedad estricta implica la estacionariedad débil. El reciproco de esta afirmación no es cierto. Una propiedad de estos procesos es que la combinación lineal de estos procesos también es estacionaria. Esto implica que, al aplicar transformaciones lineales, esta serie también es estacionaria.

Ruido Blanco

Un proceso estacionario muy importante es el proceso de ruido blanco. Sus características son:

S06

Procesos autorregresivos:

Diremos que una serie Zt sigue un proceso Autorregresivo de orden “p” ó AR(p) si tiene la siguiente estructura:

S07

Donde c y cada uno de los phi’s son constantes a determinar y ε_t sigue un proceso de ruido blanco. Para determinar las condiciones sobre los parámetros para que el proceso sea estacionario, definiremos el operador de rezago:

S08

El cual es una función que aplicada a una serie zt, se obtiene el valor rezagado r periodos. Usando la definición del operador de rezago, obtenemos lo siguiente:

S09

A la expresión de la izquierda del resultado anterior se le llama el polinomio característico del proceso. A su vez, la ecuación característica del proceso es:

S10

Y si asumimos que, en general, las raíces de este polinomio son reales y distintas, la ecuación característica tendrá la siguiente estructura:

S11

Y el proceso será estacionario si |Gi| < 1 

Como ejemplo se trae a colación un AR(2), que se encuentra definido de la siguiente manera:

S12

Su polinomio característico es:

S13

Y su ecuación característica es:

S14

La condición para que esta serie sea estacionaria implica que Gi < 1 si la solución es real, o si es compleja conjugada, la norma de este vector debe ser mayor que uno. En este caso, no se exige que nada sobre los parámetros phi’s.

Pruebas de raiz unitaria

Las pruebas de raíz unitaria son un criterio para identificar si una serie es estacionaria o no. El contraste más básico es la prueba aumentada de Dickey-Fuller, que consiste en decidir si una serie sigue uno de los siguientes procesos:

S15

Con 0 < p < 1. Observemos que el proceso de la hipótesis nula es un proceso no-estacionario, mientras que la hipótesis alterna sugiere estacionareidad en el proceso.

Una prueba alterna como Phillips-Perron sugiere el mismo criterio de decisión (hipótesis nula: proceso no-estacionario, hipótesis alterna: proceso estacionario), mientras una prueba como KPSS sigue un criterio de decisión inverso (hipótesis nula: proceso estacionario, hipótesis alterna: proceso no-estacionario).

Implementación dentro del software

El modelamiento de series de tiempo del tipo ARIMA y SARIMA resulta ser bastante sencillo e intuitivo en un entorno de trabajo como SAS University ya que, al no ser necesario tener conocimientos previos de un entorno de programación o de modelación estadística, no requerirá de la realización de una serie de comandos para llevar a cabo los procesos requeridos. Como se evidenciará a continuación, a partir de un primer y único proceso se podrán obtener todo tipo de datos, estadísticas, e inclusive predicciones que son requeridas por el econometrista al momento de trabajar e inferir sobre series temporales.

La serie de tiempo a modelar aludirá al desempeño de las acciones del grupo empresarial Nutresa, para el periodo comprendido entre el 1 de abril del año 2016 al 18 de junio del mismo año, que cotiza en la Bolsa de Valores de Colombia (BVC) y cuyos datos se encuentran disponibles en el sitio web de la entidad financiera. El archivo a importar tendrá, además, una variable “Date” que describirá el componente temporal de la serie.

Como primer paso, y luego de tener disponibles los datos en formato preferido por el usuario en SAS University, es necesario proceder con la importación de datos, que puede realizarse desde el apartado “Tareas y utilidades – Utilidades – Importación de datos”.

STU01

Una vez abierto el módulo de importación de datos, se procede con seleccionar el archivo que contenga los datos a modelar por medio del botón “Seleccionar archivo”, de acuerdo con la ubicación seleccionada por el usuario. Para el presente ejemplo el archivo alude a un formato .xls, sin embargo, se recuerdan los tipos de archivos aceptados por SAS University:

STU02

Seleccionado el archivo, la ventana de “Configuración” tendrá una vista como la mostrada a continuación. Es importante tener en cuenta el nombre y librería en la que se guardará el conjunto de datos a modelar; para el presente caso, el nombre aludirá al grupo empresarial “Nutresa” y la dirección destino será la librería predeterminada “WORK”.

STU03

La ventana “Código/resultados” tendrá una vista como la mostrada a continuación. En este apartado es importante tener en cuenta el uso y finalidad de los códigos empleados en el entorno de SAS, a pesar de no ser necesarios de leer e interpretar. El indicativo “FILENAME” alude a crear un nombre la ubicación donde se encuentra contenida el conjunto de datos; por defecto esta será “REFFILE”. La serie de código “PROC IMPORT DATAFILE=REFFILE” iniciará el proceso de importación de datos, correspondiente a la referencia REFFILE descrita con anterioridad; “DBMS” aludirá al formato origen de los datos, “OUT” será la nueva ubicación de los catos importados en formato SAS, “GETNAMES” será el indicativo de lectura de las primeras filas de los datos de origen como nombre de variables en el entorno SAS. “PROC CONTENTS” será la orden de desplegar los datos importados una vez finalizado el proceso. 

STU04

De no haber elementos marcados con asteriscos o de color ROJO, podrá procederse con la ejecución del proceso por medio del botón RUN o el acceso rápido con la tecla F3. Los elementos más importantes de la salida / resultado del proceso anterior serán los siguientes, donde se resalta la inexistencia de valores perdidos u omitidos:

STU05

Una vez importados los datos se procederá con el proceso de análisis de series temporales, que irá en correspondencia con la metodología Box y Jenkins (1976) que alude a 4 pasos elementales: 1) Identificación, 2) Estimación, 3) Verificación, 4) Pronóstico. Todos los procesos a realizar estarán disponibles en el apartado “Tareas y utilidades – Tareas – Predicción”. 

Identificación

El primer módulo a emplear será el de “Exploración de series temporales”, y en cuya ventana de “Configuración” será necesario realizar las siguientes consideraciones:

Para la pestaña DATOS: 1) Seleccionar la ubicación de los archivos importados, que para el presente caso corresponderá a: WORK.NUTRESA. 2) ROLES: seleccionar el vector / variable de análisis como variable dependiente. 3) ROLES ADICIONALES: Aunque no es del todo necesario, la especificación de una variable que denote el componente temporal de la serie dará lugar a análisis más robustos y completos; al seleccionar dicha variable (que se encontraba disponible en el archivo importado) SAS reconocerá automáticamente su caracterización temporal, como su periodicidad (diaria), y longitud del componente estacional (semanal / 7). Dado que se trata de un primer análisis exploratorio, no será necesario especificar elementos adicionales como: variables independientes o transformaciones.

STU07

STU08

Para la pestaña ANÁLISIS: Se deben seleccionar los elementos deseados por el econometrista para realizar su análisis exploratorio. Para el presente caso se seleccionará: gráficos de comportamiento de la serie y de ciclos estacionales (Gráficos de series), estadísticas descriptivas y estacionales (Estadísticas), análisis de autocorrelación con gráficos y número de rezagos a aplicar predeterminados, y la prueba Dickey-Fuller aumentada para determinar el orden de integración de la serie con número de rezagos traídos por defecto (Análisis de test de raíz unitaria).

STU09

STU10

La pestaña INFORMACIÓN simplemente contendrá información sobre el proceso a realizar; no requiere de tratamiento.

El código generado automáticamente por SAS tendrá las siguientes consideraciones: “proc sort” iniciará el proceso, donde se especifican los datos a analizar (data=WORK.NUTREZA), un archivo que contendrá la información del proceso realizado (out=Work.preProcessedData), y orden de la serie de tiempo, detonado por la variable temporal (by Date). “proc timeseries” iniciará el proceso de análisis, contendrá la información de los elementos especificados por el econometrísta, donde se especificará: componente estacional de la serie (seasonality=7), los gráficos de componente estacional y de comportamiento (plots=(series cycles corr) print=(descstats seasons decomp)), y tratamiento de las variables de análisis; selección y periodicidad de la variable temporal (id Date interval=day), y selección y transformaciones de la variable de análisis (var nutresa / accumulate=none transform=none dif=0 sdif=0) donde no se aplicarán diferenciaciones reculares o estacionales. “proc arima” inicia un proceso particular del análisis de series de tiempo, correspondiente a la prueba de raíz unitaria ADF (ods select StationarityTests;) y la especificidad de dicha prueba (identify var=nutresa stationarity=(adf=2);). Finalmente, “proc delete” aplinicará el archivo temporal creado para el análisis preliminar de la serie (data=Work.preProcessedData;); todo proceso se finalizará con el indicativo “run;”.

STU11

Los elementos más relevantes luego de ejecutar el proceso completo serán los siguientes:

1. Estadísticos descriptivos básicos de la serie de análisis; se mostrarán valores como: número de observaciones, datos perdidos, velores mínimos, valores másicos, media, mediana y desviación estándar. Para el proceso de análisis se resalta, únicamente, la no existencia de una media igual a cero, que sea un posible indicio de estacionareidad.

STU12

2. Gráfico de comportamiento de la serie de tiempo. Se resalta la no existencia de una tendencia o comportamiento evidente en la serie de tiempo, descartando la posible existencia de un componente estacional; así mismo, podría evidenciarse el posible incumplimiento del supuesto de estacinareidad en series de tiempo, producto de un comportamiento que evidencia varianza no constante.

STU13

3. Estadísticas básicas del componente estacional. Con el fin de analizar el comportamiento de un posible componente estacional en la serie de tiempo, SAS obtiene una serie de estadísticas básicas para cada uno de los periodos que representen algún tipo de componente estacional; dado que se tratan de series diarias (de repetición semanal), se obtendrán estadísticas para cada día de la semana en el periodo de análisis (vienes = 1, sábado = 2, domingo = 3, etc). Como resultado, no se evidencia la posible existencia de un componente estacional.

STU14

4. Gráfico de ciclos estacionales. Como complemento a las estadísticas anteriores, SAS graficará de forma conjunta cada uno de los periodos que evidencien un comportamiento estacional, es decir, cada una de las semanas que comprendan el periodo de análisis (16). Como conclusión análoga a la salida anterior, no se evidencia un componente estacional en la serie de tiempo.

STU15

5. Análisis de autocorrelación. SAS mostrará las funciones de autocorrelación parcial (PACF), funciones de autocorrelación simple (ACF), y funciones de autocorrelación inversa (IACF) de la serie de análisis, junto con un gráfico que ayuda a soportar el posible comportamiento de la serie a un ruido blanco, que sería el escenario deseable. A partir de la función de autocorrelación simple (ACF) se evidencia que la serie no cumple con el supuesto básico de estacionareidad, pues no se evidencia un decrecimiento exponencial en la significancia de los rezagos de análisis; conclusión similar se obtiene al analizar el gráfico de ruido blanco, donde no se evidencia comportamiento claro. Por tanto, la serie tiene una raíz unitaria y requiere ser diferenciada.

STU16

6. Finalmente, y como gran conclusión del análisis exploratorio, SAS realiza la prueba de raíz unitaria Dickey-Fuller aumentada para la serie de tiempo. La prueba contiene elementos de especial atención, como la posible necesidad de incluir un elemento de tendencia en la regresión de análisis, la cual no es realizada por cualquier otro software estadístico. Como conclusión, se deduce que la serie posee una raíz unitaria y requiere ser diferenciada; conclusión soportada por los resultados anteriores.

STU17

Como resultado del primer proceso de identificación se deduce que la serie no cumple con el supuesto básico de estacionareidad, lo cual impide realizar una correcta modelación de la misma. Con este resultado presente, es necesario volver a realizar el proceso de análisis aplicando una diferencia regular a la serie, la cual es especificada en la pestaña DATOS en el apartado de “Configuración” del mismo módulo (Exploración de series temporales).

STU18

SAS permite realizar transformaciones de diferentes características dependiendo de las necesidades del investigador. Inicialmente permite aplicar transformación a nivel agregado en la serie, como lo son promedios o sumas en la opción Acumulación; permite aplicar transformaciones del tipo logarítmica, logística y de raíz cuadrada; y permite realizar las diferencias regulares y estacionales de la serie. Para el presente caso se aplicará, simplemente, la primera diferencia regular de la serie, pues no se evidencia necesidades en estabilización de varianza o componentes estacionales en el análisis exploratorio.

De esta manera se vuelve a ejecutar el proceso de análisis, donde las salidas / resultados más relevantes son:

1. Estadística descriptiva básica de la serie. Se evidencia una relativa estabilidad en los valores máximos y mínimos de la serie, en contraste con los resultados anteriores; así mismo se obtiene una mediana igual a cero, junto con una media relativamente pequeña.

STU19

2. Gráfico de comportamiento. El comportamiento de la serie se asemeja aún más al patrón deseado, donde existe una media aproximadamente igual a cero y una relativa estabilidad en la varianza a lo largo del tiempo.

STU21

3. Pruebas de autocorrelación. La función de autocorrelación simple evidencia un comportamiento de decrecimiento exponencial en sus rezagos de significancia, lo cual da lugar a un síntoma positivo en cuanto al cumplimiento del supuesto de estacionareidad. Por otra parte, las funciones AC y PAC evidencian posibles niveles de significancia en los rezagos 4, 11 y 13, como posibles órdenes AR y MA de la serie a modelar. Finalmente, el gráfico de ruido blanco parece tener un comportamiento similar al deseado.

STU21

4. Prueba de raíz unitaria. La prueba ADF será exactamente igual a la realizada con anterioridad, pues se sigue realizando sobre la serie en niveles y no es diferencias.

Con el fin de corregir el error descrito previamente sobre la realización de la prueba ADF sobre la serie en niveles, SAS requiere de una variable guardad en su base de datos ya expresada en diferencias; es decir, es necesario expresar la serie en diferencias con el fin de poder realizar el mismo procedimiento anterior y obtener el resultado deseado. Para ello, es preciso dirigirse al módulo “Preparación de series temporales”, del apartado “Tareas y utilidades – Tareas – Predicción”.

Una vez abierto el módulo, debe ser definido de la siguiente manera:

Para la pestaña DATOS: simplemente seleccionar la serie a transformar junto con la variable ID temporal, de igual manera al caso representado en el módulo anterior.

En la pestaña TRANSFORMACIONES: realizar las transformaciones necesarias. En el presente caso: una diferencia regular.

En la pestaña SALIDA: guardar la nueva base de datos, que estará compuesta por la ID temporal y la serie transformada. Por simplicidad, se recomienta trabajar nombres cortos para las nuevas variables que hagan referencia a la naturalidad de la misma; si la variable original tiene el nombre de “nutresa” o “serie”, se recomienda asignar nombres como “dnutresa” o “dserie”, de tal manera que se pueda distinguir entre la serie expresada en niveles y la serie expresada en diferencias.

Realizada la creación de la nueva variable, es posible retomar el módulo “exploración de series temporales”, seleccionando ahora la serie expresada en diferencias y aplicando los cambios necesarios. De esta manera, la nueva salida a la prueba ADF para la serie en diferencias será la siguiente:

STU23

Para la salida anterior es de resaltar, simplemente, que según la columna “Pr<Rho” la serie expresada en diferencias no posee una raíz unitaria; por tanto, no requiere diferenciación y puede ser modelada mediante un proceso ARIMA.

Para finalizar con un correcto proceso de identificación, y con el fin de obtener un análisis más detallado sobre los posibles órdenes AR(P) y MA(Q) a modelar, es pertinente obtener, de manera independiente, los gráficos de las funciones ACF y PACF de la serie de análisis. Para ello, y dentro del mismo módulo “Exploración de series temporales”, es necesario editar la opción Seleccione gráficos a mostrar, e ir de “gráficos predeterminados” a “gráficos seleccionados”, y seleccionar de manera independiente la “Función de autocorrelación”, y “Función de autocorrelación parcial”, como muestra la siguiente imagen:

STU24

Las variaciones que esta especificación causa en el código generado son las siguientes:

STU25

Los códigos “ods excluite ACFNORMPlot” y  “ods excluite PACFNORMPlot” indican a SAS que, simplemente, represente los gráficos ACF y PACF de manera independiente. Las salidas asociadas a estas extensiones son las siguientes:

STU26

STU27

De las salidas anteriores se deduce que los posibles rezagos significativos en el componente autorregresivo (AR(P)) de la serie de tiempo son el 4, 11 y 13, producto de la función ACF, y que los posibles rezagos significativos en el componente de media móvil (MA(Q)) de la serie de tiempo son el 4, 11, producto de la función PACF.

De esta manera se da finalidad al proceso de identificación de la serie de tiempo. Por tanto, es posible proceder con el proceso de estimación.

Estimación, verificación y pronóstico

De manera resumida, el proceso de identificación realizado previamente arroja los siguientes resultados: 1) la serie tiene una raíz unitaria I(1), 2) La serie no tiene componentes estacionales, 3) el posible orden AR de la serie de tiempo alude a los rezagos 4, 11 y 13, de manera independiente, 4) el posible orden MA de la serie de tiempo alude a los rezagos 4 y 11, de manera independiente. Con esta información presente, es posible proceder con ejecutar el módulo “Modelación y predicciones”, contenido en la dirección “Tareas y utilidades – Tareas – Predicción”. El módulo cuenta con la particularidad de que permite realizar los procesos de estimación, verificación y pronóstico de manera conjunta, y el cual será configurado de la siguiente manera:

Para la pestaña DATOS: Se describirá, únicamente, la variable de análisis j:unto con su ID temporal, las cuales se dejarán expresadas en las configuraciones pro defecto encontradas por SAS

STU28

Para la pestaña MODELO: Se selecciona el tipo de modelo a estimar junto con cada uno de sus componentes. Para el presente caso, y como parte de un análisis exploratorio, se desea estimar un modelo ARIMA(P,D,Q) de la forma: ARIMA(4,1,4), con término independiente incluido; este apartado da la opción de elegir, además, el componente estacional del modelo ARIMA de ser necesario. Por otra parte, se solicitará mostrar los gráficos predeterminados del proceso de estimación, entre los cuales se incluye: paneles de gráficos de correlación y correlación cruzada, panel de diagnósticos de correlación residual, y gráficos de predicción.

STU29

Para la pestaña OPCIONES: se dejan los parámetros establecidos por defecto, donde únicamente se resalta la opción de seleccionar: número de periodos de predicción, nivel de confianza de la predicción, y la opción de detección de valores extremos

STU30

Para la pestaña SALIDA: se da la opción de guardar los resultados del proceso de estimación de forma independiente en la memoria de SAS. Para el presente caso, simplemente se seleccionarán las opciones: “Crear conjunto de datos de salida”, y “Crear conjunto de datos de información del modelo”, con los nombres establecidos por defecto más un número 1 (out1 y outmodel1), con el de distinguir entre la cantidad de estimaciones realizadas.

El código asociado a la configuración establecida es el siguiente:

STU31

El proceso “proc arima” contiene la especificación de la estimación a realizar, donde se realta: 1) “plots (only)=(series(corr crosscorr) residual(corr normal) forecast(forecastonly)” aludirá a los gráficos predeterminados a mostrar; a saber: paneles de gráficos de correlación cruzada, paneles de gráficos de correlación normal, panel de diagnósticos de correlación residual, y gráficos de predicción, respetivamente. 2) “identify var=nutresa(1);” alude a la variable a modelar con el orden de integración entre paréntesis. 3) “estimate p=(1 2 3 4) q=(1 2 3 4) method=ML“ alude a la estimación a realizar, donde se incluyen los rezagos 1, 2, 3 y 4 en los componentes ARMA del proceso, junto con el método de estimación a realizar; a saber: máxima verosimilitud. 4) “forecast lead=12 back=0 alpha=0.05 id=Date interval=day;” alude a la predicción a realizar; lead son la cantidad de periodos a pronosticar, back los números de periodos a conservar, alpha el nivel de significancia a trabajar, id es la selección de la variable temporal, e interval la periodicidad de dicha variable. 5) “outlier” alude a la detección de valores atípicos.

De forma previa, y dado que este es el primer modelo a estimar, la salida más relevante del proceso es la siguiente:

STU32

De la salida previa se deduce que ningún parámetro resulta ser significativo, concluyendo que el proceso de estimación carece de eficiencia. Ahora bien, del proceso de identificación realizado previamente se encontró que los rezagos 4, 11 y 13 podrían resultar significativos. Sin embargo, SAS University no permite especificar de forma particular los rezagos requeridos en su interfaz de trabajo habitual, por lo que es pertinente entrar directamente a manipular el código del proceso. 

STU33

Para incluir un número específico de parámetros en la estimación ARIMA, basta con especificar los rezagos deseados en la opción P=(   ) y Q=(   ) del comando “estimate”; para el presente caso se estiman únicamente los rezagos 4 tanto del componente autorregresivo como de media móvil, cuyo resultado será el siguiente:

STU34

En el proceso anterior se obtienen parámetros AR y MA significativos, validando la pertinencia del modelo estimado. De realizar un proceso de depuración cuidadoso, se encuentra que otro par de posibles modelos ARIMA asociado a esta serie de tiempo son los que poseen la estructura ARIMA((4), 1, (11 13)), y ARIMA((11 13), 1, (4)), correspondiendo al análisis exploratorio original. A continuación, las salidas respectivas:

STU36

STU35

A partir de los estadísticos disponibles en la segunda tabla de cada salida, entre los cuales se encuentran los errores estándar de desviación y criterios de información AIC y SBC, se deduce que el mejor modelo a trabajar es aquel que posee la estructura ARIMA((11 13), 1, (4)), pues es el que posee los valores más bajos.

De esta forma, se procede a analizar cada uno de los componentes de la salida asociada a este modelo:

1. Análisis de tendencia y correlación de la serie. Se presenta el gráfico de comportamiento junto con las funciones ACF, PACF e IACF, los cuales corresponderán al proceso de identificación realizado con anterioridad

STU37

2. Parámetros del modelo ARIMA producto del proceso de máxima verosimilitud, junto con los criterios de información y criterios de selección de modelos asociados.

STU38

3. Tabla de correlaciones entre parámetros del modelo, evidenciando no-correlación significativa entre ellos.

STU39

4. Tabla resumen de las pruebas de autocorrelación en los residuales, donde se seleccionan los rezados 6, 12, 18 y 24 con el fin de analizar indicios de autocorrelación a partir de los estadísticos Ljung-Box. El valor “Pr>ChiSq” evidencia el no-rechazo de la hipótesis nula de no autocorrelación en los residuales, validando el cumplimiento del primer supuesto que debe cumplir el modelo ARIMA.

STU40

5. Gráficos de normalidad en los residuales, donde se evidencia cumplimiento del segundo supuesto de normalidad.

STU41

6. Gráfico de dispersión de los residuos, donde se evidencia una relativa simetría en la varianza de los residuales a lo largo del tiempo, dando luces hacia el cumplimiento del tercer supuesto de homoscedasticidad. A pesar de que la versión completa de SAS posee los comandos que dan lugar a las pruebas de este supuesto, SAS University no soporta algunos de ellos, impidiendo la realización del la prueba de efecto ARCH para series de tiempo.

STU42

7. Gráfico de prueba de Portmanteau sobre Ruido Blando en los residuales, donde se valida el complimiento del cuarto y más importante supuesto sobre los errores del modelo ARIMA.

STU43

8. Tabla de resumen de valores pronosticados, donde se incluyen directamente los valores de predicción en niveles y no en diferencias, lo cual brinda eficiencia al proceso de predicción en SAS dado que no requiere re-transformar la serie de diferencias a sus niveles originales al momento de realizar predicciones. Los valores vienen acompañados de los intervalos de confianza y errores estándar.

STU44

9. Gráfico de predicción appliado, donde se evidencian no sólo los valores de predicción, sino que estos son representados de manera conjunta con el comportamiento de la serie temporal en periodos anteriores.

STU45

10. Gráfico reducido de la predicción realizada, donde se evidencian únicamente los valores de predicción.

STU46

 

Análisis de componentes principales

 

Conclusiones

A pesar de la no realización de un número reducido de pruebas, se posee una interfaz sumamente amigable, eficaz y oportuna, con herramientas y aplicaciones que satisfacen de manera óptima y oportuna las necesidades de cualquier usuario que se desempeñe en el ámbito de las ciencias económicas; el simple hecho de poder realizar toda clase de procesos sin el conocimiento, edición o comprensión de líneas de código, brinda un mayor sustento a la propuesta realizada por SAS University, posicionando al software como uno de los más potentes en las labores que desempeña

Es evidente que los temas abordados comúnmente desde cursos intermedios de econometría, como la estimación de modelos de series de tiempo univariadas, la verificación de todos sus supuestos, y el ACP ser implementados dentro de SAS University, dando lugar a la posibilidad de tener herramientas adicionales para la realización de proyectos e investigaciones.

 

Referencias

 

REALIZAR DESLIZADOR 1