‹ Volver a la ficha Doc. dt-1990-11

GUIA PARA LA ESTIMACION DE

MODELOS ARCH

Alfonso Novales

Documento 90-11

Julio 1990

El autor agradece los comentarios recibidos de

Juan Ayuso y Mª Luisa de la Torre.

CONTENIDO

1. INTRODUCCION

La creciente disponibilidad de datos

procedentes de los mercados financieros hace que

un número creciente de investigadores dediquen

parte de sus esfuerzos al análisis empírico de las

múltiples cuestiones teóricas de interés relativas

a tales mercados. Dentro de este área de trabajo,

la modelización tipo ARCH ha sido utilizada en

múltiples ocasiones, sin duda debido a los

aceptables resultados empíricos que ha venido

proporcionando.

A pesar de la existencia de software

destinado, más o menos específicamente, a la

estimación de este tipo de modelos, puede ser

preferible, en ocasiones, llevar a cabo la

programación de la estimación máximo-verosímil de

la estructura ARCH por parte del investigador.

Ello se debe a que, en algunos casos, las rutinas

de evaluación numérica de las derivadas de primer

y segundo orden incorporadas en los paquetes

estadísticos sugeridos no son suficientemente

precisas como para garantizar la convergencia del

proceso de estimación. Por todas estas razones, el

investigador puede preferir tener total control

del código de programación que utiliza en la

estimación del modelo.

En nuestra propia experiencia, hemos

comprobado que, en ocasiones, un proceso de

estimación de máxima verosimilitud que resultaba

no convergente utilizando expresiones analíticas

sólo para las primeras derivadas de la función de

verosimilitud, ha resultado rapidamente

convergente al utilizar dichas expresiones para

las primeras y segundas derivadas. También hemos

comprobado que los problemas de convergencia del

4

algoritmo de estimación cuando no se utilizan expresiones analíticas para las derivadas parecen más frecuentes en modelos con pocas variables explicativas. Por el contrario, modelos de regresión con estructura ARCH y con un cierto número de variables explicativas relevantes han alcanzado generalmente la convergencia en la estimación de máxima verosimilitud sin necesidad de recurrir a segundas derivadas analíticas.

Una segunda motivación para este artículo consiste en la utilidad de recoger en un mismo trabajo las diversas especificaciones de modelos con heterocedasticidad condicional.

El propósito de este trabajo es, por tanto, proporcionar una introducción a los modelos ARCH, desde el punto de vista de la estimación de dichos modelos, prestando especial atención a las expresiones análíticas del vector gradiente y la matriz hessiana precisas para utilizar el algoritmo iterativo numérico necesario para la estimación de máxima verosimilitud. Es en este último aspecto donde reside su contribución original, por no aparecer de forma suficientemente explícita dichas derivadas en los artículos habitualmente referidos en esta literatura. La formulación se hace de modo suficientemente genérico como para que cualquier potencial usuario pueda trasladar directamente las expresiones que aquí se proporcionan a su propia aplicación, de modo que pueda programar el algoritmo de estimación de máxima verosimilitud sin mucho esfuerzo.

Cuando se considera el modelo univariante: se tiene que la esperanza matemática del proceso estocástico es 0 y que su varianza

es , donde es la varianza de .

De modo más general, si el modelo fuese:

\[y _ {t} = \alpha + \rho y _ {t - 1} + \epsilon_ {t}, | \rho | < 1\]

\[\text { se tendría que: } \mathrm{E} (y _ {t}) = \frac {\alpha}{1 - \rho} \quad \text { y Var } (y _ {t}) = \frac {\sigma_ {\epsilon} ^ {2}}{1 - \rho^ {2}},\]

por lo que la inclusión de un término constante afecta a la esperanza, pero no a la varianza del proceso.

Los términos "esperanza" y "varianza" que acabamos de usar son incondicionales, o dicho de otro modo, corresponden a la distribución marginal de . Alternativamente, podemos preguntarnos acerca de la distribución condicional de dado el conjunto de información de que se dispone en el instante t-1 que suponemos que incluye todo el pasado de la variable : .

En tal caso:

\[E \left(y _ {t} / y _ {t - 1}\right) = \alpha + \rho y _ {t - 1}\]

por lo que:

\[\text {mientras que:} \quad \operatorname{Var} (y _ {t} / y _ {t - 1}) = E _ {t - 1} (y _ {t} - E (y _ {t} / y _ {t - 1})) ^ {2} = E _ {t - 1} \epsilon_ {t} ^ {2} = \sigma_ {\epsilon} ^ {2} < \frac {\sigma_ {\epsilon} ^ {2}}{1 - \rho^ {2}} = \operatorname{Var} (y _ {t})\]

donde estamos suponiendo que el modelo univariante está correctamente especificado y, en particular, que realmente resume toda la información contenida en acerca de . Es importante observar que, aun siendo distintas, las varianzas condicional e incondicional son ambas constantes en el tiempo.

Esta distinción puede generalizarse a todo modelo de regresión: , con variables deterministas y ruido blanco, con distribución Normal. La distribución de condicional en es, en este caso, también Normal, con esperanza y varianza: ; . Sin embargo, si tiene autocorrelación de orden 1, por ejemplo:

, donde es ruido blanco, entonces la distribución marginal de es:

, con , mientras que la

distribución condicionales:

\[\mathrm{y} _ {\mathrm{t}} / \Omega_ {\mathrm{t-1}} \sim \mathrm{N} \left(\rho \mathrm{y} _ {\mathrm{t-1}} + \left(\mathrm{x} ^ {\prime} _ {\mathrm{t}} - \rho \mathrm{x} ^ {\prime} _ {\mathrm{t-1}}\right) \beta ; \sigma_ {\epsilon} ^ {2}\right)\]

con menor varianza que la distribución marginal (recordemos que . ).

Utilizar como fórmula de previsión la esperanza condicional resulta óptimo si se quiere minimizar el error cuadrático medio (ECM) de la previsión resultante. Este tipo de mecanismo de previsión (que puede obtenerse, bajo determinados supuestos, a partir de un modelo univariante Box-Jenkins) genera buenos resultados en comparación con procedimientos más complejos, como la utilización de modelos econométricos de gran tamaño. Sin embargo, no se utiliza la varianza condicional de para tratar de mejorar estas previsiones y ésta puede ser una información relevante.

¿En qué sentido puede utilizarse la varianza de la distribución condicional para mejorar la previsión?. Si dicha varianza es constante y el objetivo es obtener la previsión con menor ECM, esta información no es relevante; sin embargo, si la varianza no es constante, ignorar tal hecho conduciría a estimadores ineficientes y por ello, con intervalos de confianza para la previsión más amplios, así como con mayor variabilidad de la propia previsión puntual, como reflejaría la mayor amplitud del rango de sus valores posibles, para un nivel de confianza dado.

Los textos habituales de Econometría describen los procedimientos para mejorar la eficiencia de las estimaciones en situaciones de heterocedasticidad, especialmente cuando ésta se hace depender explícitamente de variables de dentro o fuera del modelo. Se describen asimismo los contrastes de la hipótesis nula de ausencia de heterocedesticidad. No es tan habitual encontrar referencias a una situación especial de heterocedasticidad que puede ocurrir en datos de series temporales y cuya detección y tratamiento ha sido el objeto de diversos trabajos de investigación en los últimos años.

Existen, además, teorías que requieren la modelización y estimación numérica de variables que representan la volatilidad de (generalmente de su componente no predecible), que pueden asociarse al concepto estadístico de varianza condicional. Así, en Finanzas, las carteras de activos de inversión se escogen a partir de la media y varianza esperadas de las tasas de rendimiento. Cambios de cartera deben explicarse por estos factores; si se especifica un modelo econométrico tradicional para el rendimiento medio esperado, su varianza queda restringida a una constante y no es, por tanto, consistente con el supuesto teórico de partida.

Necesitamos, por tanto, desarrollar modelos econométricos en que se permita que la varianza del proceso de perturbación cambie en el tiempo. Una posible alternativa son los modelos ARCH, que describimos en las secciones siguientes.

Los residuos se incluyen como argumentos de f elevados al cuadrado, para hacerlos comparables con la varianza .

3. EL MODELO UNIVARIANTE ARCH: (Autoregressive Conditional Heteroskedasticity)

Consideremos la siguiente generalización de un proceso de ruido blanco:

\[y _ {t} = \epsilon_ {t} h _ {t},\]

donde es ruido blanco, con

y h es una función contenida en el conjunto de

información disponible en el instante t-1, .

En consecuencia, se tiene que , y también:

\[\text { Var } y _ {t} = \sigma_ {t} ^ {2} = E y _ {t} ^ {2} = E \left[ E _ {t - 1} \left(\epsilon_ {t} ^ {2} h _ {t} ^ {2}\right) \right] =\]

\[= \mathrm{E} \left[ \mathrm{h} _ {\mathrm{t}} ^ {2}. \mathrm{E} _ {\mathrm{t-1}} \epsilon_ {\mathrm{t}} ^ {2} \right] = \mathrm{E} \left(\mathrm{h} _ {\mathrm{t}} ^ {2} \sigma_ {\epsilon} ^ {2}\right) = \mathrm{Eh} _ {\mathrm{t}} ^ {2}\]

\[\mathrm{Var} _ {t - 1} \mathrm{y} _ {t} = \mathrm{E} _ {t - 1} (\epsilon_ {t} ^ {2} h _ {t} ^ {2}) = h _ {t} ^ {2} E _ {t - 1} \epsilon_ {t} ^ {2} = h _ {t} ^ {2}\]

Si suponemos, por ejemplo, que:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \mathrm{y} _ {\mathrm{t-1}} ^ {2}, \quad \text {con} \quad \delta_ {0} > 0, \quad \delta_ {1} \geq 0,\]

se tiene el modelo ARCH de orden 1, puesto que la varianza condicional depende de un retardo de . En términos de la distribución condicionada de , suponiendo además Normalidad, se tiene el modelo:

\[\left| \begin{array}{l} y _ {t} / \Omega_ {t - 1} \text {se distribuye N(0, h_{t} ^{2})} \\ h _ {t} ^ {2} = \delta_ {0} + \delta_ {1} y _ {t - 1} ^ {2}, \delta_ {0}, \delta_ {1} > 0 \end{array} \right.\tag{1}\]

o más generalmente: . [Modelo ARCH de orden p].

3.1 Propiedades del modelo AR(1) con estructura ARCH.

Examinemos las propiedades de un proceso univariante AR(1) con estructura ARCH(1). En particular, prestaremos especial interés a las semejanzas y diferencias que presenta con respecto a un proceso AR(1) habitual. Sea el proceso:

\[y _ {t} = \rho y _ {t - 1} + \epsilon_ {t}, | \rho | < 1, \quad d o n d e \quad E _ {t - 1} \epsilon_ {t} = 0,\]

\[\mathrm{E} _ {t - 1} \epsilon_ {t} ^ {2} = h _ {t} ^ {2}, \quad y \quad h _ {t} ^ {2} = \delta_ {0} + \delta_ {1} \epsilon_ {t - 1} ^ {2}\]

Se tiene:

\[\mathrm{E} \mathrm{y} _ {\mathrm{t}} = 0 \quad \mathrm{y} \quad \text {Var} \quad \mathrm{y} _ {\mathrm{t}} = \frac {1}{1 - \rho^ {2}} \sigma_ {\epsilon} ^ {2}\]

\[\begin{array}{l} \text {a h o r a b i e n , V a r \epsilon_ {t} = E \epsilon^ {2} _ {t} = E E _ {t - 1} \epsilon_ {t} ^ {2} = E h _ {t} ^ {2} ,} \\ \text {pero :} \end{array}\]

\[\begin{array}{l} \mathrm{Eh} _ {t} ^ {2} = \delta_ {0} + \delta_ {1}. \mathrm{E} \epsilon_ {t - 1} ^ {2} = \delta_ {0} + \delta_ {1} = \mathrm{Eh} _ {t - 1} ^ {2} \quad \text { y, bajo el } \\ \text { supuesto de estacionariedad, se tiene: } \\ \mathrm{Eh} _ {t} ^ {2} = \mathrm{Eh} _ {t - 1} ^ {2}, \text { por lo que si } | \delta_ {1} | < 1, \text { entonces: } \end{array}\]

\[\text { Var } \quad \epsilon_ {t} = E h _ {t} ^ {2} = \frac {\delta_ {0}}{1 - \delta_ {1}}, \text { por lo que: Var } y _ {t} = \frac {1}{1 - \rho^ {2}}. \frac {\delta_ {0}}{1 - \delta_ {1}}\]

\[\begin{array}{l} \text { Además: } E \epsilon_ {t} \epsilon_ {t - 1} = E [ E _ {t - 1} (\epsilon_ {t} \epsilon_ {t - 1}) ] = (E \epsilon_ {t - 1}) (E _ {t - 1} \epsilon_ {t}) = 0, \\ \text { y lo mismo ocurre para desfases mayores, por lo que } \epsilon_ {t} \text { no presenta autocorrelación. Sin embargo, las perturbaciones } \epsilon_ {t} \text { no son independientes, pues sus momentos de segundo orden están correlacionados. } \end{array}\]

El modelo ARCH(1) puede escribirse también: , por lo que la varianza condicional del término de error, , excede a su varianza incondicional, , en aquellos períodos en que el cuadrado del residuo previo excede a su varianza. Es decir, sorpresas altas (positivas o negativas) hacen que la varianza condicional de el período siguiente sea asimismo elevada.

En cualquier caso, es importante observar que tanto la esperanza como la varianza condicionales de dependen de la información disponible en cada instante y no son, por tanto, constantes.

Nótese que puesto que es la varianza condicional de , ha de ser positiva, por lo que los parámetros y deben ser positivos. Para los resultados anteriores es preciso, además, que . Una estimación de , aun pudiendo ser compatible con a lo largo de todo el intervalo muestral utilizado, debe generar sospechas de mala especificación de la estructura ARCH.

3.2 Momentos de orden superior

Si suponemos que sigue una distribución Normal, sus momentos de orden impar serán nulos. En cuanto a los momentos de orden par, ya hemos

visto que . Para obtener los de orden

superior, recordemos que el momento de orden 4, respecto al origen, de una variable Normal es igual a 3 veces el cuadrado de su varianza, es decir:

\[\begin{array}{r l} & {\mathrm{E} \epsilon_ {t} ^ {4} = 3 [ \mathrm{E} \epsilon_ {t} ^ {2} ] ^ {2} = 3 [ \mathrm{E} (\mathrm{E} _ {t - 1} \epsilon_ {t} ^ {2}) ] ^ {2} = \mathrm{E} [ 3 (\delta_ {0} + \delta_ {1} \epsilon_ {t - 1} ^ {2}) ^ {2} ] =} \\ & {= 3 \delta_ {0} ^ {2} + 6 \delta_ {0} \delta_ {1} \frac {\delta_ {0}}{1 - \delta_ {1}} + 3 \delta_ {1} ^ {2} \mathrm{E} \epsilon_ {t - 1} ^ {4}} \\ & {\qquad \text { Bajo el supuesto de estacionariedad, es }} \\ & {\text { decir, si } | \delta_ {1} | < 1, \text { se tiene: }} \end{array}\]

\[\mathrm{E} \epsilon_ {\mathrm{t}} ^ {4} = \frac {3 \delta_ {0} ^ {2} (1 + \frac {2 . \delta_ {1}}{1 - \delta_ {1}})}{1 - 3 \delta_ {1} ^ {2}} = \frac {3 \delta_ {0} ^ {2} . \frac {1 + \delta_ {1}}{1 - \delta_ {1}}}{1 - 3 \delta_ {1} ^ {2}} = 3 (\text {Var} \epsilon_ {\mathrm{t}}) ^ {2}. \frac {1 - \delta_ {1} ^ {2}}{1 - 3 \delta_ {1} ^ {2}}\]

por lo que el momento de orden 4 de satisface una relación similar al de una variable Normal independiente e idénticamente distribuida, es decir, sin heteroscedasticidad, solo que con un factor adicional que excede a la unidad. Ello quiere decir que las colas de su distribución tienen más densidad que las de la distribución Normal. En particular, los momentos de cuarto orden podrían no existir, lo que ocurrirá si . De este modo, al aumentar , se van teniendo resultados de inexistencia de momentos de order par.

Por otra parte, la cota debe satisfacerse para obtener la estacionariedad del modelo, condición que, en general, se expresa:

Teorema . - Un proceso ARCH lineal de orden p con

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \epsilon_ {\mathrm{t-1}} ^ {2} + \dots + \delta_ {\mathrm{p}} \epsilon_ {\mathrm{t-p}} ^ {2}, \quad \delta_ {0} > 0, \quad \delta_ {1} >, \quad \dots , \quad \delta_ {\mathrm{p}} > 0,\]

es estacionario en covarianza si y sólo si las raíces de la ecuación característica de caen fuera del círculo unidad.

Dicha estacionariedad se toma como una condición necesaria para aceptar como especificación correcta el modelo ARCH que se ha estimado.

3.3 Función de verosimilitud del modelo ARCH (p) univariante

\[\mathrm{L} = \frac {1}{\mathrm{T}} \ln \operatorname{lik} = \frac {1}{\mathrm{T}}. \sum_ {2} ^ {\mathrm{T}} \mathrm{l} _ {\mathrm{t}} = - \frac {1}{\mathrm{T}}. \sum_ {2} ^ {\mathrm{T}} \left[ \begin{array}{c c c} 1 & & \epsilon_ {\mathrm{t}} ^ {2} \\ \frac {1}{2} & \ln (\mathrm{h} _ {\mathrm{t}} ^ {2}) + \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}} \end{array} \right]\]

salvo constantes, donde denota el logaritmo neperiano de la contribución del período t a la función de verosimilitud.

\[\frac {\partial \mathrm{l} _ {\mathrm{t}}}{\partial \delta} = \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}}. \frac {\mathrm{pxl}}{\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}. \left[ \begin{array}{c c c} \epsilon_ {\mathrm{t}} ^ {2} & & \\ - \frac {}{} \mathrm{h} _ {\mathrm{t}} ^ {2} & - 1 \end{array} \right] \quad \text {donde} \delta \text {es un}\]

\[\frac {\partial^ {2} 1 _ {t}}{\partial \delta \partial \delta^ {\prime}} = - \frac {1}{2 h _ {t} ^ {4}} \cdot \left[ \begin{array}{l} \partial h _ {t} ^ {2} \\ \vdots \\ \partial \delta \end{array} \right] \left[ \begin{array}{l} \partial h _ {t} ^ {2} \\ \vdots \\ \partial \delta^ {\prime} \end{array} \right] + \underbrace {\left[ \begin{array}{l l} \epsilon_ {t} ^ {2} & \\ \vdots & - 1 \\ h _ {t} ^ {2} & \end{array} \right]} _ {\text {E} (. / \Omega_ {t - 1}) = 1} \underbrace {\left[ \begin{array}{l l} \epsilon_ {t} ^ {2} & \\ \vdots & - 1 \\ h _ {t} ^ {2} & \end{array} \right]} _ {\text {E} (. / \Omega_ {t - 1}) = 0} \partial^ {2} \left[ \begin{array}{c c} 1 & \partial h _ {t} ^ {2} \\ \frac {- 1}{2 h _ {t} ^ {2}} & \frac {- 1}{\partial \delta} \end{array} \right]\]

=>por lo que la matriz de información resulta:

\[\begin{array}{r c l} \text {I} _ {\delta \delta} & = & \sum_ {2} ^ {\text {T}} \frac {1}{2 \text {T}} \quad \text {E} \\ & & \left[ \begin{array}{c} 1 \\ \frac {- - -}{\text {h} _ {\text {t}} ^ {4}} \end{array} . \left[ \begin{array}{c} \partial \text {h} _ {\text {t}} ^ {2} \\ \frac {- - -}{\partial \delta} \end{array} \right]. \left[ \begin{array}{c} \partial \text {h} _ {\text {t}} ^ {2} \\ \frac {- - -}{\partial \delta} \end{array} \right] ^ {\prime} \\ & & \texttt {p x 1} \qquad \qquad \qquad \qquad \texttt {1 x p} \end{array} \right] \end{array}\]

que puede estimarse por:

\[\hat {\mathrm{I}} _ {\delta \delta} = \frac {1}{\mathrm{T}} - \frac {\mathrm{T}}{2} \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {4}}. \left[ \begin{array}{c} \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ - \frac {}{\partial \delta} \end{array} \right] \left[ \begin{array}{c} \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ - \frac {}{\partial \delta} \end{array} \right] ^ {\prime}\]

En el caso habitual en que h se supone una función lineal:

\[\begin{array}{l} \mathrm {h_ {t}} ^ {2} = \delta_ {0} + \delta_ {1} \epsilon_ {\mathrm {t- 1}} ^ {2} + \dots + \delta_ {\mathrm{p}} \epsilon_ {\mathrm {t- p}} ^ {2} = > \mathrm {h_ {t}} ^ {2} = z _ {\mathrm {t}} ^ {\prime} \delta \quad \text {donde} \\ z _ {\mathrm {t}} ^ {\prime} = (1, \epsilon_ {\mathrm {t- 1}} ^ {2}, \dots , \epsilon_ {\mathrm {t- p}} ^ {2}) \mathrm{y} \\ \delta^ {\prime} = (\delta_ {0}, \delta_ {1}, \dots , \delta_ {\mathrm{p}}), \text {entonces las expresiones} \end{array}\]

anteriores pueden escribirse:

\[\frac {\partial \mathrm{l} _ {t}}{\partial \delta} = \frac {1}{2 \mathrm{h} _ {t} ^ {2}}. z _ {t} \left[ \begin{array}{c c} \epsilon_ {t} ^ {2} & \\ \overline {{\mathrm{h} _ {t}}} ^ {2} & - 1 \end{array} \right] \quad \text {e} \quad \hat {\mathrm{I}} _ {\delta \delta} = \frac {1}{2 \mathrm{T}}. \Sigma \quad \frac {z _ {t} z _ {t} ^ {\prime}}{\mathrm{h} _ {t} ^ {4}} \tag {2}\]

que resultan útiles al programar la estimación numérica del vector gradiente y la matriz hessiana. Estos, a su vez, se utilizan en un algoritmo iterativo del tipo de "scoring" para obtener el estimador MV de los parámetros del modelo.

De este modo, el algoritmo numérico de estimación quedaría:

\[\hat {\delta} _ {i + 1} = \hat {\delta} _ {i} - [ I _ {\delta} \delta ] ^ {- 1} \frac {\partial L}{\partial \delta} = \hat {\delta} _ {i} - \left[ \begin{array}{c c c} T & z _ {t} z _ {t} ^ {\prime} \\ \Sigma & h _ {t} ^ {4} \end{array} \right] ^ {- 1} \left[ \begin{array}{c c c} T & z _ {t} & \left[ \begin{array}{c c c} \epsilon_ {t} ^ {2} & & \\ - & - & - 1 \\ h _ {t} ^ {2} & & \end{array} \right] \\ 1 & h _ {t} ^ {2} & \end{array} \right]\]

por lo que la variación a introducir en la estimación del vector δ en cada etapa del proceso iterativo, viene dada por los coeficientes MCO en

una regresión de la variable sobre el

\[z _ {t} / h _ {t} ^ {2}\]

La consideración de una estructura ARCH(P) supone estimar p+1 parámetros de dicha estructura, junto con los restantes parámetros del modelo. Para limitar la dimensionalidad del espacio paramétrico, aunque manteniendo p retardos en la estructura ARCH, en ocasiones se utiliza la parametrización de siguiente:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \Sigma_ {1} ^ {\mathrm{p}} \mathrm{w} _ {\mathrm{i}} \epsilon_ {\mathrm{t-i}} ^ {2}, \text {en cuyo caso se tiene:}\]

\[\frac {\partial h _ {t} ^ {2}}{\partial \delta} = (1, S _ {t}), \text {donde} S _ {t} = \Sigma_ {1} ^ {p} w _ {i} \epsilon_ {t - i}, y e l a l g o r i t m o\]

funciona como el de un ARCH(1), con jugando el

papel de . Sin embargo, hay que notar que la condición de estacionariedad debe comprobarse a partir de las raices del polinomio:

El modelo ARCH de regresión es la extensión natural del modelo ARCH univariante, en el sentido de que es ahora el término de error de un modelo de regresión quien acepta una estructura ARCH. Por otra parte, se contempla la posibilidad de que las variables explicativas del modelo de regresión entren también como variables explicativas del modelo de heteroscedasticidad.

Así, el modelos:

\[\mathrm{y} _ {\mathrm{t}} / \Omega_ {\mathrm{t-1}} \sim \mathrm{N} (\mathrm{x} _ {\mathrm{t}} ^ {\prime} \beta , \mathrm{h} _ {\mathrm{t}} ^ {2})\]

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \mathrm{h} (\epsilon_ {\mathrm{t-1}}, \dots , \epsilon_ {\mathrm{t-p}}, \delta)\]

\[\epsilon_ {t} = y _ {t} - x _ {t}, \beta\]

o, más generalmente:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \mathrm{h} (\epsilon_ {\mathrm{t-1}}, \dots , \epsilon_ {\mathrm{t-p}}, \mathrm{x} _ {\mathrm{t}}, \mathrm{x} _ {\mathrm{t-1}}, \dots , \mathrm{x} _ {\mathrm{t-p}}, \delta)\]

\[l _ {t} = - \frac {1}{2} \ln 2 \pi - \frac {1}{2} \ln h _ {t} ^ {2} - \frac {1}{2} \frac {\epsilon_ {t} ^ {2}}{h _ {t} ^ {2}} = - \frac {1}{2} \ln 2 \pi - \frac {1}{2} \ln h _ {t} ^ {2} - \frac {1}{2} \frac {(y _ {t} - x _ {t} ^ {\prime} \beta) ^ {2}}{h _ {t} ^ {2}}\]

Si denotamos por el vector , se tiene:

\[\frac {\partial \mathrm{L}}{\partial \theta} = \frac {1}{2} \Sigma \left[ \left(\epsilon_ {\mathrm{t}} ^ {2} - \mathrm{h} _ {\mathrm{t}} ^ {2}\right) \mathrm{h} _ {\mathrm{t}} ^ {- 4} \right] \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \theta} - \Sigma \frac {\epsilon_ {\mathrm{t}}}{\mathrm{t}} \frac {\partial \epsilon_ {\mathrm{t}}}{\partial \theta}\]

donde: .

Si no aparecen retardos de la variable endógena como variables explicativas del modelo de regresión, entonces el estimador MCO aplicado a este modelo, satisface el teorema de Gauss-Markov. Sin embargo el estimador MV es más eficiente.

4.1 Estimación de máxima verosimilitud del modelo ARCH de regresión

Para poder utilizar un algorimo del tipo Newton-Raphson en el cálculo del estimador MV precisamos de la expresión analítica del vector gradiente y la matriz hessiana. Obtendremos por separado las derivadas con respecto a los subvectores β y δ.

Las derivadas de cada término de la función de verosimilitud con respecto al vector β de coeficientes de las variables explicativas vienen dadas por:

\[\frac {\partial \mathrm{l} _ {\mathrm{t}}}{\partial \beta} = - \frac {1}{2} \frac {1}{\mathrm{h} _ {\mathrm{t}} ^ {2}}, \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \beta} + \frac {1}{2} \frac {\epsilon_ {\mathrm{t}} ^ {2}}{\mathrm{h} _ {\mathrm{t}} ^ {4}}, \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \beta} + \frac {\epsilon_ {\mathrm{t}} \mathrm{x} _ {\mathrm{t}}}{\mathrm{h} _ {\mathrm{t}} ^ {2}} =\]

\[\frac {\epsilon_ {t} x _ {t}}{h _ {t} ^ {2}} + \frac {1}{2 h _ {t} ^ {2}}. \frac {\partial h _ {t} ^ {2}}{\partial \beta} (\frac {\epsilon_ {t} ^ {2}}{h _ {t} ^ {2}} - 1)\]

y, teniendo en cuenta que:

\[\frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \beta} = \delta_ {1} \frac {\partial \epsilon_ {\mathrm{t-1}} ^ {2}}{\partial \beta} + \dots + \delta_ {\mathrm{p}} \frac {\partial \epsilon_ {\mathrm{t-p}} ^ {2}}{\partial \beta} = - 2 \Sigma_ {1} ^ {p} \delta_ {\mathrm{i}} \mathrm{x} _ {\mathrm{t-i}} \epsilon_ {\mathrm{t-i}}\]

\[\text {implica:} \frac {\partial l _ {t}}{\partial \beta} = \frac {\epsilon_ {t} x _ {t}}{h _ {t} ^ {2}} - \frac {1}{h _ {t} ^ {2}} \left(\frac {\epsilon_ {t} {} ^ {2}}{h _ {t} {} ^ {2}} - 1\right) \Sigma_ {1} ^ {p} \delta_ {i} x _ {t - i} \epsilon_ {t - i},\]

\[\text { por lo que } \frac {\partial L}{\partial \beta} = \frac {1}{T} \Sigma_ {1} ^ {T} \frac {\partial l _ {t}}{\partial \beta} \text { puede escribirse: }\]

\[\frac {\partial \mathrm{L}}{\partial \beta} = \frac {1}{\mathrm{T}} \sum_ {1} ^ {\mathrm{T}} \mathrm{x} _ {\mathrm{t}} \epsilon_ {\mathrm{t}} \left[ \left(\mathrm{h} _ {\mathrm{t}} ^ {2}\right) ^ {- 1} - \sum_ {1} ^ {\mathrm{p}} \delta_ {\mathrm{j}} \left(\mathrm{h} _ {\mathrm{t} + \mathrm{j}} ^ {2}\right) ^ {- 2} \left(\epsilon_ {\mathrm{t} + \mathrm{j}} ^ {2} - \mathrm{h} _ {\mathrm{t} + \mathrm{j}} ^ {2}\right) \right] =\]

\[= \frac {1}{T} \sum_ {t} x _ {t} \epsilon_ {t} S _ {t}\]

donde denota el corchete en la expresión

anterior.

Derivando de nuevo, se tiene:

\[\frac {\partial^ {2} L}{\partial \beta \partial \beta^ {\prime}} = \Sigma_ {1} ^ {T} \left[ - \frac {x _ {t} x _ {t} ^ {\prime}}{h _ {t} ^ {2}} - \frac {2 \epsilon_ {t} x _ {t} ^ {\prime}}{h _ {t} ^ {4}} \cdot \frac {\partial h _ {t} ^ {2}}{\partial \beta} - \frac {1}{2 h _ {t} ^ {4}} \cdot \frac {\epsilon_ {t} ^ {2}}{h _ {t} ^ {2}}. \right.\]

\[\left. \begin{array}{c c c c c} \partial \mathrm{h} _ {\mathrm{t}} ^ {2} & \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ . (\frac {- - - -}{\partial \beta}) & (\frac {- - - -}{\partial \beta}) ^ {\prime} + & (\frac {- - -}{\mathrm{h} _ {\mathrm{t}} ^ {2}}) ^ {2} - 1) & \frac {\partial}{\partial \beta} & (\frac {- - - -}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}}) ^ {2}. \\ \end{array} \right]\]

y, tomando esperanzas condicionales en y utilizando las propiedades: , es decir, , se tiene la matriz de información:

\[\begin{array}{r l} \mathrm{I} _ {\beta \beta} & = - \frac {1}{\mathrm{T}} - \mathrm{E} \sum_ {1} ^ {\mathrm{T}} \frac {\partial^ {2} \mathrm{L}}{\partial \beta \partial \beta^ {\prime}} = \\ & = \frac {1}{\mathrm{T}} \mathrm{E} \sum_ {1} ^ {\mathrm{T}} \left[ \begin{array}{c c} \mathrm{x} _ {\mathrm{t}} \mathrm{x} _ {\mathrm{t}} ^ {\prime} + 1 \\ \frac {- - - - -}{\mathrm{h} _ {\mathrm{t}} ^ {2}} + 2 \mathrm{h} _ {\mathrm{t}} ^ {4} \end{array} . \quad \left[ \begin{array}{c c} \partial & \mathrm{h} _ {\mathrm{t}} ^ {2} \\ \frac {- - - - }{\partial \beta} \end{array} \right] \left[ \begin{array}{c c} \partial & \mathrm{h} _ {\mathrm{t}} ^ {2} \\ \frac {- - - - }{\partial \beta} \end{array} \right] ^ {\prime} \right] = \end{array}\]

\[\begin{array}{r l} & {= \frac {1}{T} \sum_ {1} ^ {T} \left[ \begin{array}{c c} x _ {t} x _ {t} ^ {\prime} & 1 \\ h _ {t} ^ {2} & 2 h _ {t} ^ {4} \end{array} \left[ \begin{array}{c c c c} 2 \Sigma_ {1} ^ {p} & \delta_ {i} & x _ {t - i} & \epsilon_ {t - i} \end{array} \right] ^ {2} \right] =} \\ & {= \frac {1}{T} \sum_ {1} ^ {T} \left[ \begin{array}{c c} x _ {t} x _ {t} ^ {\prime} & 2 \Sigma_ {1} ^ {p} \delta_ {i} ^ {2} \\ h _ {t} ^ {2} & h _ {t} ^ {4} \end{array} . x _ {t - i} x _ {t - i} ^ {\prime} \right]} \end{array}\]

donde se han ignorado los términos de productos cruzados . cuando i ≠ j. Esta expresión también puede escribirse:

\[\begin{array}{r l} \mathrm{I} _ {\beta \beta} & = \frac {1}{T} \cdot \sum_ {i} x _ {t} x _ {t} ^ {\prime} \left[ (h _ {t} ^ {2}) ^ {- 1} + 2 \epsilon_ {t} ^ {2} \sum_ {j = 1} ^ {p} \delta_ {j} ^ {2} (h _ {t + j} ^ {2}) ^ {- 2} \right] = \\ & = \frac {1}{2} \sum_ {1} ^ {T} x _ {t} x _ {t} ^ {\prime} r _ {t} ^ {2} \end{array}\]

\[\begin{array}{l} \text {donde r_{t}} ^ {2} \text {denota la expresión dentro del corchete,} \\ \text {mientras que las derivadas con respecto al} \\ \text {subvector \delta :} \end{array}\]

\[\begin{array}{l l} \partial 1 _ {t} & \partial^ {2} 1 _ {t} \\ \frac {}{\partial \delta} y & \frac {}{\partial \delta \partial \delta^ {\prime}} \end{array} \text {se obtienen del mismo modo que en el}\]

modelo ARCH simple, es decir:

\[\frac {\partial \quad \mathrm{L}}{\partial \quad \delta} = \frac {1}{\mathrm{T}} \Sigma_ {1} ^ {\mathrm{T}} \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}} \left[ \begin{array}{c c c} \epsilon_ {\mathrm{t}} ^ {2} & \\ \hline \mathrm{h} _ {\mathrm{t}} ^ {2} & - 1 \end{array} \right] \frac {\partial \quad \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \quad \delta},\]

\[\text { con } \frac {\partial h _ {t} ^ {2}}{\partial \delta} = (1, \epsilon_ {t - 1} ^ {2}, \dots , \epsilon_ {t - p} ^ {2}) = e _ {t}, \text { por lo que: }\]

\[\frac {\partial \mathrm{L}}{\partial \delta} = \sum_ {1} ^ {\mathrm{T}} \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}} \left[ \begin{array}{c c} \epsilon_ {\mathrm{t}} ^ {2} & \\ \overline {{\mathrm{h} _ {\mathrm{t}} ^ {2}}} & - 1 \end{array} \right] \mathrm{e} _ {\mathrm{t}},\]

y

\[- \mathrm{E} \left[ \begin{array}{c c} \partial^ {2} & L \\ \hline - & - \\ \partial \delta & \partial \delta^ {\prime} \end{array} \right] = E \frac {1}{2 h _ {t} ^ {4}} \left[ \begin{array}{c c} \partial & h _ {t} ^ {2} \\ - & - \\ \partial & \delta \end{array} \right] \left[ \begin{array}{c c} \partial & h _ {t} ^ {2} \\ - & - \\ \partial & \delta \end{array} \right] ^ {\prime},\]

que puede estimarse por:

\[\hat {I} _ {\delta \delta} = \frac {1}{2 T} \Sigma_ {1} ^ {T} \frac {e _ {t} e _ {t}}{h _ {t} ^ {4}}\]

donde denota el vector de dimensión p+l antes definido.

Un proceso ARCH se dice simétrico si la función y su vector gradiente (respecto al vector ) son funciones reales pares en todas sus componentes , mientras que las derivadas parciales de respecto de son funciones impares en .

Lema.- Si un modelo ARCH de regresión con , es simétrico, se tiene:

\[\mathrm{I} _ {\delta \beta} = \begin{array}{c c c c} 1 & & \mathrm{T} \\ - - & . & \Sigma & \mathrm{E} \\ \mathrm{T} & & 1 \end{array} \left[ \begin{array}{c c} 1 & \left[ \begin{array}{c} \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ - - \\ 2 \mathrm{h} _ {\mathrm{t}} ^ {4} \end{array} \right] \\ \partial \delta & \left[ \begin{array}{c} \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ - - \\ \partial \beta \end{array} \right] ^ {\prime} \end{array} \right] = 0\]

21

lo que implica que la estimación de δ y β por separado es asintóticamente eficiente.

Demostración:

\[\frac {\partial^ {2} \mathrm{l} _ {\mathrm{t}}}{\partial \delta \partial \beta} = - \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {4}} \left[ \begin{array}{c c} \epsilon_ {\mathrm{t}} ^ {2} & \\ - \mathrm{h} _ {\mathrm{t}} ^ {2} & - 1 \end{array} \right] \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \beta}. \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \delta}. \frac {\epsilon_ {\mathrm{t}} \mathrm{x} _ {\mathrm{t}}}{\mathrm{h} _ {\mathrm{t}} ^ {4}}. \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \delta}\]

\[- \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}} \cdot \frac {\epsilon_ {\mathrm{t}} ^ {2}}{\mathrm{h} _ {\mathrm{t}} ^ {4}} \cdot \left[ \begin{array}{l l} \partial & \mathrm{h} _ {\mathrm{t}} ^ {2} \\ \hline \partial & \beta \end{array} \right] \cdot \left[ \begin{array}{l l} \partial & \mathrm{h} _ {\mathrm{t}} ^ {2} \\ \hline \partial & \delta \end{array} \right] + \frac {1}{2 \mathrm{h} _ {\mathrm{t}} ^ {2}} \cdot \left[ \begin{array}{l l} \epsilon_ {\mathrm{t}} ^ {2} & \\ \hline \mathrm{h} _ {\mathrm{t}} ^ {2} & - 1 \end{array} \right] \frac {\partial^ {2} \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \delta \partial \beta}\]

Como:

\[\begin{array}{c c} \partial & h _ {t} ^ {2} \\ \hline \partial & \delta \end{array} = e _ {t} = (1, \epsilon_ {t - 1} ^ {2}, \dots , \epsilon_ {t - p} ^ {2}),\]

y:

\[\frac {\partial h _ {t} ^ {2}}{\partial \beta} = - 2 \sum_ {1} ^ {p} \delta_ {i} x _ {t - i} \epsilon_ {t - i},\]

ambas derivadas forman parte de . lo mismo que ocurre con . De este modo, tomando la esperanza matemática del primer término y utilizando la descomposición: E = E , se tiene que dicha esperanza es igual a:

\[- \mathrm{E} \left[ \frac {1}{2 h _ {t} ^ {4}}, \quad \frac {\partial h _ {t} ^ {2}}{\partial \beta} - \frac {\partial h _ {t} ^ {2}}{\partial \delta}, \quad E _ {t - 1} \left[ \begin{array}{c c} \epsilon_ {t} ^ {2} & \\ \frac {}{h _ {t} ^ {2}} & - 1 \end{array} \right] \right]\]

que es igual a cero, ya que . Un razonamiento análogo puede hacerse para el segundo término. En cuanto al último término, basta

4.2 Procedimiento de estimación sugerido:

\[\theta_ {\textbf {i} + 1} = \theta_ {\textbf {i}} + \left[ \begin{array}{c c c c} & - 1 & & \\ \hat {1} _ {\theta \theta} & & & \\ & & \theta_ {\textbf {i}} \end{array} \right]. \left[ \begin{array}{c c c c} 1 & \mathrm{T} & \partial \mathrm{l} _ {\mathrm{t}} & \\ \hline - & \Sigma & - \overline {{\partial \theta}} & \\ \mathrm{T} & 1 & \partial \theta & \end{array} \right] _ {\theta_ {\textbf {i}}} \left. \begin{array}{c c c c} & & & \\ & & & \\ & & & \\ & & & \end{array} \right]\]

que sólo requiere derivadas primeras de la función de verosimilitud. La descomposición de este algoritmo en las etapas 2 y 3 anteriores, que utilizan el algoritmo para los subvectores β y δ por separado es eficiente gracias al lema anterior.

Puede verse fácilmente que el algoritmo iterativo del vector δ puede escribirse:

\[\hat {\delta} _ {i + 1} = \delta_ {i} + (Z ^ {\prime} Z) ^ {- 1} Z ^ {\prime} Y\]

donde:

\[Z _ {t} = (1, \epsilon_ {t - 1} ^ {2}, - - - - \epsilon_ {t - p} ^ {2}) / h _ {t} ^ {2}\]

\[Z ^ {\prime} = \left(Z _ {1}, Z _ {2}, - - -, Z _ {T}\right) e s p x T\]

\[y _ {t} = \left(\epsilon_ {t} ^ {2} / h _ {t} ^ {2}\right) - 1\]

\[Y = \left(y _ {1}, y _ {1}, - - -, y _ {r}\right) e s T x 1\]

donde: , y provienen de la estimación previa. De este modo, cada iteración puede obtenerse mediante una regresión de sobre el vector . La matriz de información estimada, dividida por el tamaño muestral, se toma como matriz de covarianzas del estimador MV del vector .

Dicha matriz de covarianzas no es sino: , donde Z es la matriz de observaciones de las variables explicativas. En muestras finitas, esta matriz no es la proporcionada por la rutina de estimación, pero asintóticamente es válida, ya que en dicha regresión se tiene:

\[\sigma^ {2} = \text { Var } \left[ \begin{array}{c c} 2 & \\ \epsilon_ {t} & \\ - - & - 1 \\ h _ {t} ^ {2} & \end{array} \right] \text { y como } \frac {\epsilon_ {t}}{h _ {t}} \sim N (0, 1),\]

\[\text { entonces: } \begin{array}{c} \epsilon_ {t} ^ {2} \\ \hline h _ {t} ^ {2} \end{array} \sim X _ {1} ^ {2} \quad \text { y Var } \begin{array}{c} \epsilon_ {t} ^ {2} \\ \hline h _ {t} ^ {2} \end{array} = 2\]

pueden hacerse:

\[\hat {\beta} _ {i + 1} = \hat {\beta} _ {i} + (\tilde {X} ^ {\prime} \tilde {X}) ^ {- 1} \tilde {X} ^ {\prime} \tilde {e}\]

donde se ha efectuado la transformación de

variables: y , por lo que el término de la derecha puede de nuevo interpretarse como el vector de coeficientes estimado en una regresión de sobre el vector , y la matriz de infomación estimada para el subvector dividida

por el tamaño muestral, que no es sino , se toma como matriz de covarianzas del estimador MV del vector .

Se utiliza en cada uno de los dos casos como criterio de convergencia el estadístico G:

\[G = \frac {\partial L}{\partial \theta} ^ {\prime} \left[ \begin{array}{c c} \partial^ {2} L & \\ - \frac {}{\partial \theta} \frac {}{\partial \theta^ {\prime}} & \end{array} \right] ^ {- 1} \quad \begin{array}{l l} \partial L & \\ - \frac {}{\partial \theta} & \end{array} \text {que se distribuye} X _ {p} ^ {2}, y\]

puede probarse que coincide con el de la última regresión efectuada. Si dicho estadístico toma un valor superior al de las tablas, se interpreta que el cambio en la estimación es grande, y se continúa iterando. En caso contrario, se detiene el proceso de estimación, conservando el último valor obtenido.

Con la parametrización: donde

\[S _ {t} = \sum_ {1} ^ {p} w _ {i} \epsilon_ {t - i}, \quad s e t i e n e:\]

\[\frac {\partial h _ {t} ^ {2}}{\partial \delta} = (1, S _ {t}) y \frac {\partial h _ {t} ^ {2}}{\partial \beta} = - 2 \delta_ {1} \Sigma_ {1} ^ {p} w _ {i} x _ {t - i} \epsilon_ {t - i}\]

por lo que se tiene:

\[\begin{array}{l l l} \frac {\partial L}{- - -} & = & \frac {1}{- - -} \\ \partial \beta & & T \end{array} \quad \Sigma_ {1} ^ {T} \left[ \begin{array}{c c c c c c c c c} \epsilon_ {t} x _ {t} & \delta_ {1} & \epsilon_ {t} ^ {2} & & & & & \\ \hline - - - - - & - - - - - & (\quad - - - - - & - 1) & , & \Sigma_ {1} ^ {P} & w _ {i} x _ {t - i} \epsilon_ {t - i} \\ h _ {t} ^ {2} & h _ {t} ^ {2} & h _ {t} ^ {2} & & & & \end{array} \right]\]

que puede también expresarse:

\[\begin{array}{c c c} \frac {\partial \mathrm{L}}{- - } & = & \frac {1}{- - } \\ \partial \beta & & \mathrm{T} \end{array} . \quad \Sigma_ {1} ^ {\mathrm{T}} \left[ \begin{array}{c c c} 1 & & \\ - \delta_ {1} \Sigma_ {1} ^ {\mathrm{P}} & w _ {i} & \left[ \begin{array}{c c c} & \epsilon_ {t + i} ^ {2} & \\ - \delta_ {1} \Sigma_ {1} ^ {\mathrm{P}} & - 1 & \\ h _ {t} ^ {2} & h _ {t + i} ^ {2} & \end{array} \right] \\ & h _ {t} ^ {2} & \end{array} \right] x _ {t} \epsilon_ {t}\]

que es claramente un vector kx1, y:

\[\begin{array}{r c l} \mathbb {I} _ {\beta \beta} & = & \frac {1}{- - } \Sigma_ {1} ^ {\mathrm{T}} \\ & & \mathrm{T} \\ \end{array} \left[ \begin{array}{c c c} 1 & & \\ - - - - & + 2 & \delta_ {1} ^ {2} \epsilon_ {\mathrm{t}} ^ {2} \\ \mathrm{h} _ {\mathrm{t}} ^ {2} & & \end{array} \left[ \begin{array}{c c} \Sigma_ {1} ^ {\mathrm{P}} & \mathrm{w} _ {\mathrm{i}} ^ {2} \\ \Sigma_ {1} ^ {\mathrm{P}} & - - - - - \\ & \mathrm{h} _ {\mathrm{t+i}} ^ {4} \end{array} \right] \right] \mathrm{x} _ {\mathrm{t}} \mathrm{x} _ {\mathrm{t}} ^ {\prime},\]

mientras que:

\[\partial 1 _ {t} / \partial \quad \delta = \frac {1}{2 h _ {t} ^ {2}}. \left[ \begin{array}{c c c} e _ {t} ^ {2} & & \\ - h _ {t} ^ {2} & - & 1 \end{array} \right] \left[ \begin{array}{c c c} 1 & & \\ & & \\ S _ {t} & & \end{array} \right]\]

\[\mathrm{I} _ {\delta \delta} = \begin{array}{c c c} 1 & & 1 \\ - \mathrm{T} & \Sigma_ {1} ^ {\mathrm{T}} & - \frac {}{2 h _ {t} ^ {4}} \\ & & \end{array} \left[ \begin{array}{c c} 1 & S _ {t} \\ S _ {t} & S _ {t} ^ {2} \end{array} \right]\]

con independencia de la composición del vector de variables explicativas en el modelo de regresión.

El algoritmo de estimación puede, por tanto, escribirse:

\[\left[ \begin{array}{c|c} \hat {\boldsymbol {\beta}} & = \\ \hat {\boldsymbol {\delta}} & _ {i + 1} \end{array} \right] _ {i} + \begin{array}{c c c} \hat {\boldsymbol {\beta}} & & \\ \hat {\boldsymbol {\delta}} & & \Sigma_ {1} ^ {T} \\ \end{array} \left[ \begin{array}{c c c} & & \\ & \left[ \begin{array}{cccccc} & & & & & 2 \\ 1 & & & & & \\ - - - - & + & 2 \epsilon_ {t} ^ {2} & \delta_ {1} ^ {2} & \Sigma_ {1} ^ {P} & W _ {i} \\ 2 & & & & & 4 \\ h _ {t} & & & & & h _ {t + i} \\ \end{array} \right] & x _ {t} & x _ {t}, & 0 \\ 0 & & \\ & 1 & \\ - - - - & 4 & \\ 2 h _ {t} & S _ {t} & 2 \\ \end{array} \right] - 2\]

\[\cdot \left[ \begin{array}{l} \partial \mathrm{L} / \partial \beta \\ \partial \mathrm{L} / \partial \delta \end{array} \right]\]

donde , por lo que, en particular:

\[\hat {\delta} _ {\mathrm{i+1}} = \hat {\delta} _ {\mathrm{i}} + \sum_ {1} ^ {\mathrm{T}} \left[ \begin{array}{c c} \left[ \begin{array}{c c c} 1 & & \\ & S _ {\mathrm{t}} & \\ & & \\ S _ {\mathrm{t}} & & S _ {\mathrm{t}} ^ {2} \end{array} \right] & \frac {1}{2 h _ {\mathrm{t}} ^ {4}} \\ \end{array} \right] - 1 \left[ \begin{array}{c c} \Sigma_ {1} ^ {\mathrm{T}} & \frac {1}{2 h _ {\mathrm{t}} ^ {2}} \left[ \begin{array}{c c c} \epsilon_ {\mathrm{t}} ^ {2} & & \\ - \frac {1}{2} & & \\ h _ {\mathrm{t}} & & \end{array} \right] \left[ \begin{array}{c c} 1 & \\ S _ {\mathrm{t}} & \end{array} \right] \\ \end{array} \right]\]

que puede verse como el resultado de una regresión de:

\[\left[ \begin{array}{c c} 2 & \\ \epsilon_ {t} & \\ - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - 1 & \\ 2 & \\ h _ {t} & \end{array} \right] \text {sobre el par de variables:} \quad \begin{array}{c c} 1 & \\ - - - - & , [ S _ {t} ] \\ 2 & \\ h _ {t} & \end{array}\]

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \epsilon_ {\mathrm{t-1}} ^ {2} + \dots + \delta_ {\mathrm{p}} \epsilon_ {\mathrm{t-p}} ^ {2},\]

entonces la matriz que aparece arriba no es

\[\left[ \begin{array}{c c} 1 & S _ {t} \\ S _ {t} & S _ {t} ^ {2} \end{array} \right], \qquad \text {sino} \begin{array}{c c} 1 & _ {\mathrm{T}} \\ T & ^ 1 \end{array} \qquad \left[ \begin{array}{c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c c} 1 & \epsilon_ {t - 1} & \ldots & \epsilon_ {t - p} & & & & & & & & & & & & & & & & & & & & & & & & & & & & \\ & 2 & & & & & & & & & & & & & & & & & & & & & & & & & & & & \\ & \epsilon_ {t - 1} & \ldots & \epsilon_ {t - 1} \cdot \epsilon_ {t - p} \\ & \ldots & \ldots & \ldots & \ldots & \ldots & \ldots & \ldots & \ldots & \ldots & \ldots \\ & & & 2 \\ & & & \epsilon_ {t - p} \end{array} \right]\]

\[\begin{array}{l} \text {mientras que en vez del vector} \left[ \begin{array}{c} 1 \\ S _ {t} \end{array} \right] \text {se tiene el} \\ \text {vector:} \left[ \begin{array}{c} 1 \\ \epsilon_ {t - 1} \\ . \\ . \\ \epsilon_ {t - p} \end{array} \right] \end{array}\]

de modo que la parametrización reducida puede verse como una reducción de una estructura ARCH(p) a una estructura ARCH(1), donde juega el papel de .

La idea del procedimiento de estimación consiste en comenzar del vector estimado por MCO, generar los residuos y utilizarlos del modo que acabamos de ver para iterar sobre el estimador de . La matriz de covarianzas de los coeficientes estimados se obtiene del mismo modo que en la especificación general del modelo que antes vimos.

4.3 Contrastes de estructura ARCH

Con carácter previo a la estimación, deben llevarse a cabo los contrastes de estructura de heteroscedasticidad del tipo ARCH, donde la hipótesis nula es:

\[\mathrm{H} _ {0}: \mathrm{h} _ {\mathrm{t}} ^ {2} = \mathrm{h} _ {0} \text {constante},\]

es decir, ausencia de heterocedasticidad, frente a:

\[\mathrm{H} _ {1}: \mathrm{h} _ {\mathrm{t}} ^ {2} = \mathrm{h} (\mathrm{z} _ {\mathrm{t}} ^ {\prime} \delta), \text {donde} \mathrm{z} _ {\mathrm{t}} = (1, \epsilon_ {\mathrm{t-1}} ^ {2}, \dots , \epsilon_ {\mathrm{t-p}} ^ {2})\]

El estadístico utilizado para llevar a cabo el

contraste es:

\[\text { donde } \quad y = [ ( \begin{array}{c} e _ {t} ^ {2} \\ - - 1) \\ h _ {0} ^ {2} \end{array} ] \quad \text { vector Tx1, aunque }\]

omiteremos las p primeras observaciones; y por lo que Z es de dimensión (T-p) x (p+1).

Como puede verse, el contraste es condicional en un orden p del modelo ARCH especificado en la hipótesis alternativa H , por lo que debe realizarse para varios valores de dicho parámetro.

El contraste es asintóticamente equivalente a utilizar el producto T.R donde R procede de la regresión de e sobre una constante y p retardos suyos, todos ellos obtenidos bajo la hipótesis nula; dicho producto se distribuye de acuerdo con una variable (el número de grados de libertad no incluye la constante). Por esto es que el correlograma de los residuos al cuadrado puede utilizarse en la identificación del orden p del posible modelo ARCH.

Este contraste es válido con independencia de la forma funcional de , siempre que dependa de δ tan sólo a través del producto .

Para contrastar un modelo ARCH de un determinado orden frente a una estructura ARCH de orden inferior, por ejemplo, para contrastar la hipótesis nula:

\[\mathrm{H} _ {\circ}: \delta_ {2} = 0\]

en el modelo: , se efectúa una iteración a partir de la estimación MV del modelo de orden inferior, permitiendo esta vez que sea distinto de cero, y se utiliza el estadístico de la regresión correspondiente a tal iteración. Equivalentemente, se compara con una el producto , donde proviene de la regresión de un vector de unos sobre el vector gradiente de la función de verosimilitud.

El interés de este segundo contraste estriba en que el test de los multiplicadores de Lagrange es más sencillo que el test de Wald, si el modelo ya ha sido estimado bajo la hipótesis nula : . En efecto, si denotamos por S° la matriz de observaciones del vector de las derivadas parciales calculada para el modelo más general, pero evaluada bajo la hipótesis nula, dicho vector coincide con los multiplicadores de Lagrange, y sus varianzas vienen dadas por la matriz de información, de modo que el test de los multiplicadores de Lagrange utiliza el estadístico:

\[\Phi_ {L M} = 1 ^ {\prime} S ^ {\circ} \left(S ^ {\circ^ {\prime}} S ^ {\circ}\right) ^ {- 1} S ^ {\circ^ {\prime}} 1 = T R _ {o} ^ {2}\]

donde es el coeficiente de determinación no centrado de una regresión del vector de unos sobre el vector de derivadas parciales evaluado bajo la hipótesis nula y l denota un vector de unos, de dimensión igual al número de parámetros que se pretenden estimar.

Los errores estandard que se obtienen de esta regresión son asintóticamente válidos, al igual que en los casos anteriores. En efecto, la matriz de covarianzas estimada no es sino , donde Z es la matriz de observaciones de las variables explicativas. Aunque en muestras finitas esta matriz no coincide con la proporcionada por la rutina de estimación, es asintóticamente válida, exactamente por las mismas razones antes vistas.

5. EL MODELO ARCH-M

El modelo ARCH-M (Engle, Lilien y Robins (1987)), incorpora el supuesto adicional de que la varianza del término de error influye en cada período sobre el nivel de la variable que se pretende explicar, por lo que representa un nivel superior de generalidad con respecto a los modelos que hasta ahora hemos considerado. Tal supuesto es muy apropiado en modelos financieros que traten de caracterizar la magnitud de las primas de riesgo , definidas como diferencia entre el tipo forward la expectativa actual del tipo futuro, . La idea es que siendo una medida de la incertidumbre existente en el período t acerca de , un mayor valor de supone, en el caso de los mercados financieros, un mayor riesgo, que podría aparecer reflejado en una mayor prima al riesgo. Ello generaría, una mayor diferencia entre y el tipo forward que aparece a partir de la condición de ausencia de arbitraje, por lo que la magnitud de la diferencia dependerá, en general, de .

Consideramos, por tanto, el modelo:

\[y _ {t} = \alpha + \beta . g (h _ {t} ^ {2}) + u _ {t}, u _ {t} \sim N (0, h _ {t} ^ {2})\]

donde mantenemos la parametrización reducida de antes considerada.

Según la cual , en términos contínuos, es la diferencia entre los tipos a largo y corto plazo hoy vigentes en el mercado. Véase por ejemplo el artículo: “¿Incorporan los tipos del interbancario una evaluación del riesgo? Documento de Trabajo FEDEA 90-08 J.Ayuso, A.Novales y M.L. de la Torre.

5.1 Estimación del modelo ARCH-M

El logaritmo de la función de verosimilitud es:

\[\mathrm{L} = \ln \text {lik} = - \frac {\mathrm{T}}{-} \ln 2 \pi - \frac {1}{-} \Sigma_ {1} ^ {\mathrm{T}} \ln h _ {t} ^ {2} - \frac {1}{-} \Sigma_ {1} ^ {\mathrm{T}} \frac {u _ {t}}{- - } = 2 2 2 2 h _ {t} ^ {2}\]

\[= \begin{array}{c c c c c c c c c} & - & \mathrm{T} \\ & - & 1 \mathrm{n} & 2 \pi & - & \frac {1}{- - } & \Sigma_ {1} ^ {\mathrm{T}} & 1 \mathrm{n} & h _ {t} ^ {2} \\ & 2 & & & 2 & & & 2 & & \end{array} \begin{array}{c c c c c c c c c} & - & \mathrm{T} & (\mathrm{y} _ {t} - \alpha - \beta & g (h _ {t} ^ {2})) ^ {2} \\ & - & - & - & - \\ & 2 & & h _ {t} ^ {2} \end{array}\]

donde:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \Sigma_ {1} ^ {\mathrm{p}} \quad \mathrm{w} _ {\mathrm{i}} \left(\mathrm{y} _ {\mathrm{t-i}} - \alpha - \beta \right. \left. \mathrm{g} \left(\mathrm{h} _ {\mathrm{t-i}} ^ {2}\right)\right) ^ {2}\]

Es fácil ver que:

\[\begin{array}{c c c c c c c c c c} \partial L & = & - & 1 & 1 & \partial h _ {t} ^ {2} \\ \hline \hline \partial \theta & & 2 & h _ {t} ^ {2} & \partial \theta & 2 & (h _ {t} ^ {2}) ^ {2} \end{array} + \begin{array}{c c c c c c c c c c} 1 & 1 & 1 & \Sigma_ {1} ^ {\mathrm{T}} & + & \Sigma_ {1} ^ {\mathrm{T}} & [ y _ {t} - \alpha - \beta g (h _ {t} ^ {2}) ] ^ {2} & \partial h _ {t} ^ {2} \\ \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline 2 & 2 & 2 & 2 & 2 & 2 & 2 & 2 \\ \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline \hline 2 & 2 & 2 & 2 & 2 & 2 & 2 & 2 \\ \hline \hline 2 & 2 & 2 & 2 & 2 & 2 & 2 & 2 \\ \hline \hline 2 & 2 & 2 & 2 & 2 & 2 & 2 & 2 \\ \hline \hline 2 & 2 & 2 & 2 & 2 & 2 & 2 & 2 \\ \hline \hline 2 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 \\ \hline \hline 2 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 \\ \hline \hline 2 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 & - 1 \\ \hline \hline 2 & - 1 & - 1 & - 1 & - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1, - 1. \end{array}\]

\[- \Sigma_ {1} ^ {\mathrm{T}} \frac {u _ {t}}{h _ {t} ^ {2}} \left[ \begin{array}{c} - 1 - \beta \frac {\partial g (h _ {t} ^ {2})}{\partial \alpha} \\ - g (h _ {t} ^ {2}) - \beta \frac {\partial g (h _ {t} ^ {2})}{\partial \beta} \\ - \beta \frac {\partial g (h _ {t} ^ {2})}{\partial \delta_ {0}} \\ - \beta \frac {\partial g (h _ {t} ^ {2})}{\partial \delta_ {1}} \end{array} \right]\]

\[= \begin{array}{c c c c c} & 1 & & \\ & - & \Sigma_ {1} ^ {\texttt {T}} & 1 \\ & & & 2 \\ & 2 & & \mathrm{h} _ {\texttt {t}} \end{array} . \left[ \begin{array}{c c c} & & 2 \\ 1 & - & \mathrm{u} _ {\texttt {t}} \\ & & - \\ & & 2 \\ & & \mathrm{h} _ {\texttt {t}} \end{array} \right]. \begin{array}{c c c c c c c c} & 2 & & & & 2 & & \\ \partial \mathrm{h} _ {\texttt {t}} & & \Sigma_ {1} ^ {\texttt {T}} & \mathrm{u} _ {\texttt {t}} & \partial \mathrm{g(h} _ {\texttt {t}}) & 2 & \mathrm{u} _ {\texttt {t}} \\ - - - - + \Sigma_ {1} & - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - \\ \partial \theta & & \mathrm{h} _ {\texttt {t}} \end{array} . \left[ \begin{array}{c} 1 \\ 2 \\ g (\mathrm{h} _ {\texttt {t}}) \\ 0 \\ 0 \end{array} \right]\]

donde denota el vector :

Teniendo en cuenta que ,

\[\begin{array}{l} \text {se tiene:} \\ \left[ \begin{array}{c c c} \partial L & ^ {\mathrm{T}} & 1 \\ - - - - & \Sigma_ {1} & - - - - \\ \partial \theta & & h _ {t} ^ {2} \end{array} \right] \left[ \begin{array}{c c c} \left[ \begin{array}{c c c} & & \\ - & 1 & \left[ \begin{array}{c c c} & & 2 \\ 1 & - & - - - \\ & & h _ {t} ^ {2} \end{array} \right] + & \beta u _ {t} & \frac {\partial g (h _ {t} ^ {2})}{- - - - - } \\ 2 & & \partial h _ {t} ^ {2} \end{array} \right] & \frac {\partial h _ {t} ^ {2}}{- - - - - } + \left[ \begin{array}{c c c} 1 & & \\ & g (h _ {t} ^ {2}) \\ 0 & & \\ 0 & & \end{array} \right]. u _ {t} \end{array} \right] \end{array}\]

donde hay que incorporar la derivada:

\[\frac {\partial h _ {t} ^ {2}}{\partial \theta} = \left[ \begin{array}{c c c c c} & - 2 \delta_ {1} & \Sigma_ {1} ^ {P} & w _ {i} & u _ {t - i} \\ & - 2 \delta_ {1} & \Sigma_ {1} ^ {P} & w _ {i} & g (h _ {t - i} ^ {2}) & u _ {t - i} \\ & & 1 & & \\ & & S _ {t} & & \end{array} \right]\]

5.2 Casos particulares:

5.2.1.

\[\begin{array}{r c l}\frac {\partial \mathrm{L}}{- - }&=&\Sigma_ {1} ^ {\mathrm{T}} \quad \frac {1}{- - }\\\partial \theta&&\mathrm{h} _ {\mathrm{t}} ^ {2}\\\end{array}\left[ \right.\left[\begin{array}{c c c}&1&\\-&\frac {1}{2}&\left[ \right.\begin{array}{c c c}&u _ {\mathrm{t}} ^ {2}\\1 -&-&\\&h _ {\mathrm{t}} ^ {2}\end{array}\left. \right] + \beta u _ {\mathrm{t}}\\\end{array}\right]\left[\begin{array}{c c c c c}- 2 \delta_ {1}&\Sigma_ {1} ^ {\mathrm{p}}&w _ {\mathrm{i}}&u _ {\mathrm{t-i}}&\\&&&&\\- 2 \delta_ {1}&\Sigma_ {1} ^ {\mathrm{p}}&w _ {\mathrm{i}}&u _ {\mathrm{t-i}}&h _ {\mathrm{t-i}} ^ {2}\\&1&&&\\&S _ {\mathrm{t}}&&&\\\end{array}\right] + \left[\begin{array}{c c c c c}1&&&&\\&h _ {\mathrm{t}} ^ {2}&&&\\0&0&&&\\0&&&&\\&&&&\\\end{array}\right] u _ {\mathrm{t}}\]

\[5. 2. 2. \quad g (h _ {t} ^ {2}) = h _ {t} = > \frac {\partial g (h _ {t} ^ {2})}{\partial h _ {t} ^ {2}} = \frac {1}{2 \sqrt {h _ {t} ^ {2}}}\]

\[\frac {\partial L}{\partial \theta} = \sum_ {1} ^ {T} \frac {1}{h _ {t}} \left[ \left[ - \frac {1}{2} \quad \left[ 1 - \frac {u _ {t}}{h _ {t}} \right] + \beta \frac {u _ {t}}{2 \sqrt {h _ {t}}} \right] \left[ \begin{array}{c c c c} & & & \\ - 2 \delta_ {1} & \Sigma_ {1} ^ {P} w _ {i} & u _ {t - i} & \\ & & & \\ - 2 \delta_ {1} & \Sigma_ {1} ^ {P} w _ {i} & u _ {t - i} & h _ {t - i} \\ & & & \\ & 1 & & \\ & S _ {t} & & \end{array} \right] + \left[ \begin{array}{c} 1 \\ h _ {t} \\ 0 \\ 0 \end{array} \right] u _ {t} \right]\]

\[5. 2. 3. \quad g (h _ {t} ^ {2}) = \ln h _ {t} ^ {2} \Rightarrow \begin{array}{c c} \partial g (h _ {t} ^ {2}) & = 1 \\ - \frac {}{\partial h _ {t} ^ {2}} & = h _ {t} ^ {2} \end{array}\]

\[\frac {\partial \mathrm{L}}{\partial \theta} = \sum_ {1} ^ {\mathrm{T}} \frac {1}{\mathrm{h} _ {\mathrm{t}}} \left[ \left[ - \frac {1}{2} \left[ 1 - \frac {{\mathrm{u} _ {\mathrm{t}}} ^ {2}}{\mathrm{h} _ {\mathrm{t}}} \right] + \beta \frac {2}{\mathrm{h} _ {\mathrm{t}}} \right] \left[ \begin{array}{c c c c} - 2 \delta_ {1} & \stackrel {\mathrm{p}} {\sum_ {1}} & w _ {\mathrm{i}} & u _ {\mathrm{t-i}} \\ & & & \\ - 2 \delta_ {1} & \stackrel {\mathrm{p}} {\sum_ {1}} & w _ {\mathrm{i}} & u _ {\mathrm{t-i}} \\ 1 & & & \\ S _ {\mathrm{t}} & & & \end{array} \ln h _ {\mathrm{t-i}} ^ {2} \right] + \left[ \begin{array}{c c} & 1 \\ \ln h _ {\mathrm{t}} & 0 \\ 0 & 0 \end{array} \right] u _ {\mathrm{t}} \right]\]

\[5. 2. 4. \quad g (h _ {t} ^ {2}) = \ln \sqrt {h _ {t} ^ {2}} \Rightarrow \frac {\partial g (h _ {t} ^ {2})}{\partial h _ {t} ^ {2}} = \frac {1}{2 h _ {t} ^ {2}}\]

\[\frac {\partial \mathrm{L}}{\partial \theta} = \sum_ {1} ^ {\mathrm{T}} \frac {1}{\mathrm{h} _ {\mathrm{t}}} \left[ \left[ \begin{array}{c c} - \frac {1}{2} & \left[ \begin{array}{c c} 1 - \frac {\mathrm{u} _ {\mathrm{t}} ^ {2}}{2} \\ 2 & \mathrm{h} _ {\mathrm{t}} \end{array} \right] + \beta \frac {\mathrm{u} _ {\mathrm{t}}}{2} \\ & 2 \end{array} \right] \left[ \begin{array}{c c c c} - 2 \delta_ {1} & \Sigma_ {1} ^ {\mathrm{P}} W _ {\mathrm{i}} & u _ {\mathrm{t-i}} \\ & & & - 2 \delta_ {1} & \Sigma_ {1} ^ {\mathrm{P}} W _ {\mathrm{i}} & u _ {\mathrm{t-i}} \ln \sqrt {h _ {\mathrm{t-i}}} \\ & 1 & & \\ & S _ {\mathrm{t}} & & \end{array} \right] + \left[ \begin{array}{c} 1 \\ 1 n \sqrt {h _ {\mathrm{t}}} ^ {2} \\ 0 \\ 0 \end{array} \right] u _ {\mathrm{t}} ^ {2} \right]\]

Para estimar este modelo, Engle et al. (1987) recomiendan utilizar la sugerencia de Berndt et al. (1974) para el algoritmo de Scoring:

\[\hat {\theta} _ {i + 1} = \hat {\theta} _ {i} + \lambda \left[ \Sigma_ {1} ^ {T} \left[ \begin{array}{c} \partial L _ {t} \\ - \frac {}{\partial \theta} \end{array} \right] \left[ \begin{array}{c} \partial L _ {t} \\ - \frac {}{\partial \theta} \end{array} \right] ^ {\prime} \right]. \sum_ {1} ^ {T} \frac {\partial L _ {t}}{\partial \theta}\]

El estimador resultante es consistente, con matriz de covarianzas:

\[\text {Var} \quad (\hat {\theta}) = \frac {1}{T} \left[ \Sigma_ {1} ^ {T} \left[ \begin{array}{l} \partial L \\ - \partial \theta \end{array} \right] \left[ \begin{array}{l} \partial L \\ - \partial \theta \end{array} \right] ^ {\prime} \right] ^ {- 1}\]

que, a diferencia del modelo ARCH simple, no es diagonal a bloques entre los vectores de coeficientes β y δ de las ecuaciones de y , por lo que la estimación de los vectores β y δ por separado no sería eficiente en este modelo ARCH-M.

Toda la discusión concerniente a la contrastación de hipótesis líneas, así como a los criterios de convergencia a utilizar, puede reproducirse a partir de los resultados citados al final de la sección 4.

6. EL MODELO GARCH (Generalized ARCH) (Bollerslev (1986))

6.1 El modelo GARCH (1,1)

El modelo GARCH especifica que, en cada período, la varianza condicional de , , depende de los últimos residuos, pero también de sus propios valores previos, es decir que:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \delta_ {0} + \delta_ {1} \epsilon_ {\mathrm{t-1}} ^ {2} + \theta_ {1} \mathrm{h} _ {\mathrm{t-1}} ^ {2}, \mathrm{con} \delta_ {0}, \delta_ {1}, \theta_ {1} > 0\]

representa el modelo GARCH(1,1). En este modelo GARCH (1,1) se tiene:

donde puede verse que, para que el proceso de varianza condicional sea estacionario, es preciso que: . En tal caso, la varianza incondicional de viene dada por:

\[\sigma^ {2} = \mathrm{E} \epsilon_ {\mathrm{t}} ^ {2} = \delta_ {0} / [ 1 - (\delta_ {1} + \theta_ {1}) ]\]

y al aumentar el horizonte de previsión s, puede probarse que la varianza condicional converge hacia . Bajo tal supuesto, el modelo GARCH equivale a un modelo ARCH de orden infinito, con coeficientes en los retardos que decaen hacia cero de modo exponencial.

El momento de orden 2n del modelo GARCH

(1,1) existe si:

\[\sum_ {j = 0} ^ {n} \left[ \begin{array}{c c c} & n \\ & j \end{array} \right] a _ {j} \delta_ {1} ^ {j} \theta_ {1} ^ {n - j} < 1\]

donde: ; , .

En el caso del proceso ARCH(1), por ejemplo, y esta condición se reduce a . Como otro caso particular, en el modelo GARCH(1,1), el momento de cuarto orden existe si:

\[3 \delta_ {1} ^ {2} + 2 \delta_ {1} \theta_ {1} + \theta_ {1} ^ {2} < 1, \text {en cuyo caso:}\]

\[E \epsilon_ {t} ^ {2} = \delta_ {0} (1 - \delta_ {1} - \theta_ {1}) ^ {- 1} y\]

\[E \left(\epsilon_ {t} ^ {4}\right) = 3 \delta_ {0} ^ {2} \left(1 + \delta_ {1} + \theta_ {1}\right). \left[ \left(1 - \delta_ {1} - \theta_ {1}\right) \left(1 - \theta_ {1} ^ {2} - 2 \delta_ {1} - \theta_ {1} - 3 \delta_ {1} ^ {2}\right) \right] ^ {- 1}\]

por lo que es fácil ver que el coeficiente de Kurtosis es:

\[K = \left[ E \epsilon_ {t} ^ {4} - 3 \left(E \epsilon_ {t} ^ {2}\right) ^ {2} \right] \left(E \epsilon_ {t} ^ {2}\right) ^ {- 2} = 6 \delta_ {1} ^ {2} \left(1 - \theta_ {1} ^ {2} - 2 \delta_ {1} \theta_ {1} - 3 \delta_ {1} ^ {2}\right) ^ {- 1}\]

que es positivo bajo nuestras hipótesis, por lo que el proceso GARCH(1,1) es leptocúrtico, al igual que ocurre con el modelo ARCH(q).

En las aplicaciones prácticas de este modelo, se tiene con frecuencia que es aproximadamente igual a la unidad, con lo que el

proceso es no estacionario. Tal proceso se dice que es integrado en varianza, ya que la primera diferencia de ésta sería un proceso

estacionario. En tal modelo, la previsión , s>0, no converge hacia , sino que depende explícitamente de .

El proceso GARCH (1,1) integrado se representa:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \alpha \epsilon_ {\mathrm{t-1}} ^ {2} + (1 - \alpha) \mathrm{h} _ {\mathrm{t-1}} ^ {2}\]

donde o<α<1. Este proceso de varianza satisface la condición:

\[\mathrm{E} _ {\mathrm{t}} \mathrm{h} _ {\mathrm{t+s}} ^ {2} = \mathrm{h} _ {\mathrm{t+1}} ^ {2} = \alpha \epsilon_ {\mathrm{t}} ^ {2} + (1 - \alpha) \mathrm{h} _ {\mathrm{t}} ^ {2}, \mathrm{s} \geq 1\]

por lo que guarda cierta semejanza con un proceso de camino aleatorio en la varianza. En él, las innovaciones en la varianza condicional tienen un efecto permanente. Si se incorpora una tendencia w:

\[\mathrm{h} _ {\mathrm{t}} ^ {2} = \mathrm{w} + \alpha \epsilon_ {\mathrm{t-1}} ^ {2} + (1 - \alpha) \mathrm{h} _ {\mathrm{t-1}} ^ {2}\]

Se tiene:

\[\mathrm{E} _ {\mathrm{t}} \mathrm{h} _ {\mathrm{t+s}} ^ {2} = \mathrm{sw} + \mathrm{h} _ {\mathrm{t+1}} ^ {2} = (\mathrm{s+1}) \mathrm{w} + \alpha \epsilon_ {\mathrm{t}} ^ {2} + (1 - \alpha) \mathrm{h} _ {\mathrm{t}} ^ {2}\]

similar a un paseo aleatorio con deriva. Aunque la importancia relativa de en la expresión de la varianza condicional decrece con s, su efecto es permanente.

Si definimos el proceso: , claramente no antocorrelacionado, se tiene:

\[\epsilon_ {t} ^ {2} = \delta_ {0} + \sum_ {i = 1} ^ {m} (\delta_ {i} + \theta_ {i}) \epsilon_ {t - i} ^ {2} - \sum_ {i = 1} ^ {p} \theta_ {i} \gamma_ {t - i} + \gamma_ {t}\]

donde m=máx{p, q}. Por tanto, sigue un proceso ARMA (m,p) con un término de error sin autocorrelación. Ello ha conducido a la sugerencia (ver Bollerslev (1986) de utilizar las funciones de autocorrelación simple y parcial de

\[\begin{array}{l} \epsilon_ {t} ^ {2} \text { para identificar los órdenes del proceso } \\ \text { GARCH, como enseguida veremos. } \end{array}\]

6.2. EL MODELO GARCH (p, q)

El modelo GARCH (p,q) para un proceso , queda definido por:

\[\epsilon_ {\mathrm{t}} / \Omega_ {\mathrm{t-1}} \sim \mathrm{N} (0, \mathrm{h} _ {\mathrm{t}} ^ {2})\]

\[h _ {t} ^ {2} = \delta_ {0} + \sum_ {i = 1} ^ {q} \delta_ {i} \epsilon_ {t - i} ^ {2} + \sum_ {j = 1} ^ {p} \theta_ {j} h _ {t - j} ^ {2} =\]

\[= \delta_ {0} + \delta (\mathrm{L}) \epsilon_ {\mathrm{t}} ^ {2} + \theta (\mathrm{L}) \mathrm{h} _ {\mathrm{t}} ^ {2}\]

Si todas las raíces del polinomio 1-θ(L) están fuera del círculo unidad, se tiene:

\[h _ {t} ^ {2} = \delta_ {0} (1 - \theta (1)) ^ {- 1} + \delta (L) (1 - \theta (L)) ^ {- 1} \epsilon_ {t} ^ {2} =\]

\[= \delta_ {0} (1 - \sum_ {i = 1} ^ {p} \theta_ {i}) ^ {- 1} + \sum_ {i = 1} ^ {\infty} \beta_ {i} \epsilon_ {t - i} ^ {2}\]

42

\[\begin{array}{l} \text {es decir, un modelo ARCH(\infty), donde los} \\ \text {coeficientes \beta_ {i} provienen del desarrollo de la} \\ \text {expresión: \delta (L) [1 - \theta (L)] ^ {- 1}} \end{array}\]

El retardo medio en la equación de la varianza condicional del modelo GARCH(1,1) es:

\[r = \sum_ {i = 1} ^ {\infty} i \beta_ {i} / \sum_ {i} ^ {\infty} \beta_ {i} = (1 - \theta_ {1}) ^ {- 1}\]

y el retardo mediano:

s = - log 2 /log

El proceso GARCH(p,q) es estacionario de segundo orden, con E , Var y para todo t≠s, si y sólo si .

6.3. Identificación de modelos GARCH(p,q)

Para la identificación de una estructura del tipo GARCH (p,q) resultan muy útiles las funciones de autocorrelación simple y parcial de los residuos al cuadrado: Si denotamos por la

función de autocorrelación de , se tiene

(Bollerslev (1986)):

\[\rho_ {n} = \sum_ {i = 1} ^ {m} \psi_ {i} \rho_ {n - 1}, \quad n \geq p + 1\]

donde . , para y para . Estas ecuaciones son análogas a las de Yule-Walker para el proceso ARMA(m,p). Una vez más, un procedimiento similar, con , podría utilizarse para el modelo ARCH(q).

Con , denotamos el valor numérico que resulta de sustituir L por l en los polinomios y .

Si denota la función de autocorrelación parcial se tiene:

\[\rho_ {\texttt {n}} = \sum_ {\texttt {i} = 1} ^ {\texttt {k}} \phi_ {\texttt {k i}} \rho_ {\texttt {n - i}}, \quad \texttt {n} = 1, \ldots , \texttt {k}\]

mientras que para , al igual que ocurre con un proceso AR(q). Para llevar a cabo estos contrastes, los valores de y a utilizar en las ecuaciones previas deben sustituirse por sus valores estimados, utilizando su varianza asíntótica (bajo la hipótesis nula de no existencia de estructura GARCH) de 1/T. Por supuesto, una vez que se ha estimado un modelo ARCH, el contraste de las funciones de autocorrelación de los residuos se debe hacer con los residuos normalizados.

6.4. Contraste de estructura GARCH

\[\begin{array}{l} \text {Si descomponemos la estructura de la} \\ \text {varianza condicional: h} _ {t} ^ {2} = z _ {1 t} ^ {\prime} w _ {1} + z _ {2 t} ^ {\prime} w _ {2} y \text {se} \\ \text {quiere contrastar la hipótesis nula: H} _ {0}: w _ {2} = 0, \\ \text {el estadístico de multiplicadores de Lagrange} \\ \text {correspondiente es:} \end{array}\]

\[\xi_ {M L} = \frac {1}{2} f _ {0}, Z _ {0} (Z _ {0}, Z _ {0}) ^ {- 1} Z _ {0}, f _ {0} \text { donde: }\]

\[f _ {0} ^ {\prime} = \left[ \left(\epsilon_ {1} ^ {2} / h _ {1} ^ {2}\right) - 1, \dots , \left(\epsilon_ {T} ^ {2} / h _ {T} ^ {2}\right) - 1 \right] e s 1 x T\]

y: de modo que es Txs, donde s es el número de variables en , evaluados ambos vectores bajo . El estadístico

, se tiene el logaritmo de la función de verosimilitud:

\[\mathrm{L} _ {\mathrm{T}} (\psi) = \mathrm{T} ^ {- 1} \sum_ {\mathrm{t} - 1} ^ {\mathrm{T}} \left[ - \frac {1}{2} \log \mathrm{h} _ {\mathrm{t}} ^ {2} - \frac {1}{2} \epsilon_ {\mathrm{t}} ^ {2} / \mathrm{h} _ {\mathrm{t}} ^ {2} \right] =\]

\[= T ^ {- 1} \sum_ {t = 1} ^ {T} l _ {t} (\psi)\]

\[\begin{array}{r l r} {\mathrm{con:}} & & \\ {\partial \mathrm{l} _ {\mathrm{t}} / \partial \mathrm{w}} & {=} & {\mathrm{l} _ {2} \quad \mathrm{h} _ {\mathrm{t}} ^ {- 2} \quad - \frac {\partial \quad \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \quad \mathrm{w}}} \\ & & {\left[ \begin{array}{c c c} & & \\ & {\epsilon_ {\mathrm{t}} ^ {2}} & \\ & {- \frac {\mathrm{h} _ {\mathrm{t}} ^ {2}}{\mathrm{w}}} & {- 1} \\ & & \end{array} \right]} \end{array}\tag{1}\]

\[\partial^ {2} \mathrm{l} _ {\mathrm{t}} / \partial \mathrm{w} \quad \partial \mathrm{w} ^ {\prime} = \left[ \begin{array}{c c c} & & \\ & ^ 2 _ {\epsilon_ {\mathrm{t}}} & \\ - & - & - \\ \mathrm{h} _ {\mathrm{t}} ^ {2} & & 1 \\ \end{array} \right] \left[ \begin{array}{c c c} \partial & & \\ - & - & \\ \partial \mathrm{w} ^ {\prime} & & \end{array} \right] \left[ \begin{array}{c c c} & & \\ & ^ {- 2} _ {\mathrm{h} _ {\mathrm{t}} ^ {-}} & ^ {2} _ {\mathrm{h} _ {\mathrm{t}} ^ {-}} \\ & - & - \\ & \partial & \mathrm{w} \end{array} \right]\]

\[\begin{array}{c c c} & & \\ - \frac {1}{2} & \mathrm{h} _ {\mathrm{t}} ^ {- 4} & \frac {\partial \mathrm{h} _ {\mathrm{t}} ^ {2}}{\partial \mathrm{w}} \left[ \begin{array}{c} \\ \partial \mathrm{h} _ {\mathrm{t}} ^ {2} \\ \frac {}{} \partial \mathrm{w} \end{array} \right] \frac {\epsilon_ {\mathrm{t}} ^ {2}}{\mathrm{h} _ {\mathrm{t}} ^ {2}} \end{array}\]

donde:

\[\partial h _ {t} ^ {2} / \partial w = z _ {t} + \sum_ {i = 1} ^ {p} \theta_ {i} \frac {\partial h _ {t - i} ^ {2}}{\partial w}\tag{2}\]

siendo el segundo término de la diferencia con respecto al modelo ARCH de regresión. Nótese que (2) será estable siempre que . Por otra parte, la esperanza condicional del primer término en (1) es cero, por lo que la submatriz de la matriz de información correspondiente al vector w puede estimarse consistentemente a partir tan sólo del segundo término en (2), que sólo requiere primeras derivadas.

\[\partial 1 _ {t} / \partial \beta = \epsilon_ {t} x _ {t} / h _ {t} ^ {2} + (1 / 2 h _ {t} ^ {2}) \cdot (\partial h _ {t} ^ {2} / \partial \beta) \cdot \left[ \left(\epsilon_ {t} ^ {2} / h _ {t} ^ {2}\right) - 1\right)\]

\[\partial^ {2} 1 _ {t} / \partial \beta \partial \beta^ {\prime} = \tag {3}\]

\[= - x _ {t} x _ {t} ^ {\prime} / h _ {t} ^ {2} - 1 / (2 h _ {t} ^ {4}) (\partial h _ {t} ^ {2} / \partial \beta). \left[ \partial h _ {t} ^ {2} / \partial \beta_ {t} \right] ^ {- 1} (\epsilon_ {t} ^ {2} / h ^ {2})\]

\[- 2 \left(\epsilon_ {t} x _ {t} ^ {\prime} / h _ {t} ^ {4}\right) \left(\partial h _ {t} ^ {2} / \partial \beta\right) + \left(\left(\epsilon_ {t} ^ {2} / h _ {t} ^ {2}\right) - 1\right). \partial \left[ 1 / \left(2 h _ {t} ^ {2}\right). \partial h _ {t} ^ {2} / \partial \beta \right] / \partial \beta^ {\prime}\]

donde:

\[\partial h _ {t} ^ {2} / \partial \beta = - 2 \sum_ {i = 1} ^ {q} \delta_ {i} x _ {t - i} \epsilon_ {t - i} + \sum_ {j = 1} ^ {p} \theta_ {j}. \partial h _ {t - j} / \partial \beta \tag {4}\]

donde, de nuevo, el segundo sumando es la única diferencia con el modelo ARCH de regresión. Una estimación consistente de la sumatriz de información correspondiente a β puede obtenerse a partir de los dos primeros términos de (3),

sustituyendo por su valor esperado de 1. Esta estimación también utiliza únicamente derivadas primeras. Finalmente, al igual que en el modelo ARCH de regresión, el bloque fuera de la diagonal en la matriz de información resulta ser cero, por lo que w puede estimarse por separado de sin perder eficiencia asintótica.

La presencia de términos recursivos en (2) y (4) hacen que no podamos representar el algoritmo de scoring como una regresión. Por ello, es aconsejable utilizar el algoritmo de Berndt, Hall,

Hall y Hausman (1974), incorporando un parámetro de longitud de salto. En dicho algoritmo, la dirección de salto puede obtenerse a partir de una regresión de un vector de unos sobre el vector ; además, por las razones ya vistas, el algoritmo puede aplicarse por separado a w y . Si no se parte del supuesto de normalidad condicional de , entonces la distribución asintótica del estimador que resulta de este algoritmo es Normal, pero con matriz de covarianzas:

\[\mathrm{I} (\psi) ^ {- 1}. \mathrm{B} (\psi). \mathrm{I} (\psi) ^ {- 1},\]

donde:

\[\begin{array}{r l r} \mathrm{I} (\psi) ^ {- 1} & = - \mathrm{E} [ \partial^ {2} \mathrm{l} _ {\mathrm{t}} / \partial \psi \partial \psi^ {\prime} ] ^ {- 1} \mathrm{y} \\ \mathrm{B} (\psi) & = \mathrm{E} [ (\partial \mathrm{l} _ {\mathrm{t}} / \partial \psi) (\partial \mathrm{l} _ {\mathrm{t}} / \partial \psi) ^ {\prime} ], \end{array}\]

estimándose ambas por sus respectivos momentos muestrales.

REFERENCIAS

Berndt E., B. Hall, R. Hall y J. Hausman (1974) "Estimation and inference in non linear structural models" Annals of Economic and Social Measurement, 4, 653-665.

Bollerslev, T. (1988) "On the correlation structure for the generalized autoregressive conditional heteroskedastic process", Journal of Time Series Analysis, 9, 121-131.

Bollerslev, T. (1986) "Generalized autoregressive conditional heteroskedasticity", Journal of Econometrics, 31f, p. 307-327.

Engle, R. (1982) "Autoregressive Conditional Heteroscedasticity with estimates of the variance of United Kingdom inflation", Econometrica, 50, 4, 987-1007.

Engle, R., D. Lilien, R. Robbins (1987) "Estimating time varying risk premia in the term structure: The ARCH-M model", Econometrica, 55, 2, p. 391-407.

Engle, R. y T. Bollerslev (1986) "Modelling the persistence of conditional variances", Econometric Reviews, 5, p.1-50.

COLECCION ESTUDIOS

1: "Excedente, inversión y empleo en la empresa española". Carlos Sebastián y Luis Servén.

2: "Estructura fiscal e incentivos a la inversión" Carlos Cuervo-Arango y José A. Trujillo.

3: "Análisis de simulación en la industria española". Carlos Sebastián y Luis Servén.

4: "La empresa pública industrial en España". Alfonso Novales, Carlos Sebastián, Luis Servén y José A. Trujillo.

5: "Análisis y predicción de la población española: 1910-2000". Juan del Hoyo y Antonio García Ferrer.

6: "El paro en España: Características, causas y medidas". Alfonso Novales, Carlos Sebastián y Luis Servén.

7: "Estudios sobre participación, empleo y paro en España". Varios autores.

COLECCION DEBATES

1: "La política monetaria en España".

2: "La fiscalidad de la empresa".

3: "Política monetaria e inestabilidad financiera".

COLECCION CUADERNOS DE ECONOMIA Y FINANZAS

1: "Riesgo de interés y riesgo de crédito en el contrato de swap". Xavier Freixas.

2: "El Sistema Monetario Europeo y el ECU". Juan Pérez-Campanero.