Documento 87-10
Luis Servén*
ESTIMACION ROBUSTA: UNA APLICACION
A LA DEMANDA DE EMPLEO EN LA INDUSTRIA
1. INTRODUCCION
La búsqueda de estimadores cuya eficiencia no dependa crucialmente de las características de la distribución que genera los datos es un área de activa investigación en la teoría econométrica.
Otra cuestión es si resulta conveniente restringirse a los estimadores insegados. Existen estimadores sesgados de error cuadrático medio inferior al de MCO, aún en situaciones gaussianas.
La literatura econométrica ha analizado una variada gama de estimadores robustos cuya eficiencia es superior a la del estimador de mínimos cuadrados para un amplio espectro de distribuciones (excluida, naturalmente, la gaussiana). Los más utilizados se pueden agrupar en dos clases: M y L. La clase M (denominada así por su parentesco con los estimadores de máxima verosimilitud) corresponde a los estimadores que se obtienen a partir de la maximización una función arbitraría de los parámetros, expresamente diseñada para amortiguar el efecto de las observaciones extremas; algunas de tales funciones son de hecho las funciones de verosimilitud de ciertas distribuciones poco usuales. La clase L, en la que nos centraremos, la constituyen estimadores construidos a partir de los estadísticos de orden de la muestra; entre ellos se cuentan también las llamadas "medias recortadas" (trimmed means) que resultan de eliminar de la muestra las observaciones más extremas hasta un porcentaje fijo del total .
La aplicación de los estimadores de la clase L al modelo de regresión lineal fué desarrollada por Koenker y Bassett (1978). En el modelo lineal
Una panorámica se puede encontrar en Huber (1977). Para una exposición resumida, véase Ame-miya (1985), cap. 2.
Sin embargo, son más frecuentes en la práctica los procedimientos iterativos que reestiman sucesivamente el modelo eliminando cada vez las observaciones que presentan residuos más extremos en la iteración precedente. Estos métodos plantean algunas dificultades, entre las cuales está la difícil interpretación de los contrastes de significación del modelo final.
\[y _ {i} = x _ {i} \beta + \epsilon_ {i} \quad i = 1, \dots , T\]
donde es un vector 1xK de variables independientes y es un vector Kx1 de parámetros a estimar, el -ésimo cuantil de la regresión (0< <1) se define como una solución al problema
\[\begin{array}{l} \text {(1)} \quad \min _ {b} \left[ \begin{array}{c c c c c} \sum & \theta & y _ {i} & - x _ {i} b \\ y _ {i} \geq x _ {i} b & & & \\ \hline \end{array} \right] \\ + \sum_ {y _ {i} < x _ {i} b} (1 - \theta) & | y _ {i} & - x _ {i} b | \end{array}\]
Llamando a la solución , suponiendo que converge a una matriz definida positiva, y definiendo las ponderaciones para , con , Koenker y Basset demuestran que bajo supuestos moderados (continuidad de las funciones de distribución y densidad de ) el vector
\[\int T \left[ \sum_ {i} \pi (\theta_ {i}) \beta * (\theta_ {i}) - \beta \right]\]
tiene una distribución asintótica normal K-varian-te, con media cero y matriz de covarianza , donde el elemento típico de es de la forma
\[\omega_ {i j} = \frac {\theta_ {i} (1 - \theta_ {j})}{f (F ^ {- 1} (\theta_ {i})) f (F ^ {- 1} (\theta_ {j}))} \quad i, j = 1, \dots , M\]
Este importante resultado proporciona la distribución asintótica de cualquier combinación lineal de cuantiles de la regresión. Para distintas elecciones del vector de ponderaciones π se obtienen distintos estimadores, algunos de los cuales son bien conocidos: para π(1/2) = 1 se obtiene el estimador de mínimas desviaciones absolutas (MAD) o mediana de la regresión⁴; para (π(1/4), π(1/2), π(3/4)) = (1/4, 1/2, 1/4) se obtiene el análogo en el contexto del modelo lineal de la denominada "trimedia" (trimean), etc. Los estudios empíricos disponibles muestran que la eficiencia de estos estimadores puede ser muy superior a la del estimador MCO en una amplia gama de situaciones no gaussianas⁵.
El cálculo del estimador que minimiza la función objetivo (1) se puede transformar en un sencillo problema de programación lineal (véase por ejemplor Wagner (1959)). Como alternativa, Fair (1974) proporciona un sencillo método itera-tivo de mínimos cuadrados ponderados para el caso .
Que es el estimador de máxima verosimilitud para la distribución de Laplace (o doble exponencial), la cual es simétrica pero presenta colas más gruesas que la gaussiana.
El clásico estudio de Andrews et al (1972) presenta simulaciones de Monte Carlo. Por otra parte, Fair (1974) comparó la capacidad predictiva de los estimadores MCO y MAD en un modelo macro-económico. La mediana de la regresión proporcionó los mejores resultados.
Un problema adicional en el uso práctico de los cuantiles de regresión es la necesidad de estimar el recíproco de la función de densidad de los residuos evaluada en los correspondientes cuantiles, con el fin de calcular los elementos de la matriz Ω. Un posible procedimiento sería partir de los residuos obtenidos de un ajuste preliminar del modelo. La vía alternativa utiliza un resultado de Koenker y Bassett (1982): llamando R(θ) al valor de la función objetivo del problema (1),
\[\begin{array}{r l} R (\theta) & = \min _ {b} \left[ \sum_ {y _ {i} \geq x _ {i} b} \theta | y _ {i} - x _ {i} b | \right. \\ & \quad + \sum_ {y _ {i} < x _ {i} b} (1 - \theta) \left| y _ {i} - x _ {i} b \right] \end{array}\]
es posible demostrar que una aproximación al recíproco de la función de densidad se obtiene mediante la segunda derivada de una versión alisada de R(θ). Naturalmente, ello requiere alisar R(θ) previamente, lo cual se puede conseguir mediante el ajuste de polinomios. A primera vista, ello parece exigir la formidable tarea de resolver el problema (1) para todos los valores de θ entre 0 y 1. Sin embargo, la cuestión se puede resolver fácilmente mediante el análisis paramétrico del programa lineal utilizado en el cálculo de β*(θ) para cualquier valor de θ.
2. UN EJEMPLO: LA DEMANDA DE EMPLEO EN LA INDUSTRIA
La aplicación de procedimientos robustos de estimación a los datos recogidos por la Central de Balances del Banco de España (CBBE) proporciona un ejemplo de cierto interés. Estos datos han sido utilizados en estudios econométricos de la demanda de empleo y de inversión en la industria española (Sebastián (1987), Sebastián y Servén (1986)), y en casi todos ellos han sido objeto de "limpiezas" para eliminar las observaciones excesivamente influyentes. La presencia de estas últimas es un rasgo común de los datos microeconómicos de sección cruzada, especialmente cuando -como en nuestro caso- éstos han sido obtenidos a partir de cuestionarios.
La muestra que utilizamos está compuesta por 820 empresas industriales privadas , y es idéntica a la considerada por Sebastián (1987) y Servén (1987). En ambos trabajos se trata de identificar empíricamente reglas de comportamiento de las empresas industriales españolas bajo la hipótesis mantenida de que tales reglas son idénticas en todos los sectores industriales. La validez de esa hipótesis, sin embargo, se puede verificar fácilmente mediante los habituales contrastes de igualdad de coeficientes, cuya utilización no resulta más complicada en nuestro marco de estimación robusta que en el contexto habitual de mínimos cuadrados ordinarios.
La cifra corresponde a las empresas industriales privadas que han venido respondiendo a la encuesta de la CBBE desde 1981.
Nos centraremos en una especificación simple de la demanda de trabajo, similar a la utilizada en los trabajos citados. Así pues, suponemos que el volumen de empleo de las empresas viene determinado por su nivel de actividad real -medido por el volumen de producción- y por el coste real del trabajo. Obviamente, es preciso suponer que el nivel de producción de las empresas está determinado por la demanda (que toman como un dato) de su producto, para garantizar la exogeneidad del mismo y eliminar los posibles problemas de simultaneidad en que se incurriría si las empresas fuesen libres de adoptar sus decisiones óptimas tanto de producción como de empleo.
Las empresas de la muestra se agrupan en los 17 subsectores en que desagrega el INE el sector industrial español. Los correspondientes índices de precios han sido utilizados para deflactar la producción y los costes laborales de las distintas empresas, puesto que los datos de la CBBE solamente incluyen magnitudes en términos nominales. Por otra parte, los datos solamente proporcionan información acerca del volumen total de los costes del trabajo para cada empresa, por lo que las cifras de salario por persona tuvieron que ser construidas dividiendo por el número medio de empleados de cada empresa. Este proceder introduce un posible sesgo (hacia -1) en el valor estimado de la elasticidad de la demanda de empleo con respecto al salario real, por lo que los resultados han de interpretarse con ciertas reservas .
El análisis desarrollado en Servén (1987) parece indicar que el sesgo no es importante. Un problema similar se plantea en Mairesse y Dormont (1985).
El Cuadro 1 presenta los resultados de la estimación de acuerdo con tres métodos alternativos. El primero es el de mínimas desviaciones absolutas (MAD), que proporciona como estimador la mediana de la regresión. El segundo es un estimador construido a partir de los cuantiles de la regresión (QR); en el presente caso es una combinación lineal de los tres primeros cuartiles con ponderaciones de 1/4, 1/2 y 1/4 respectivamente, por lo que se trata de la "trimedia" (trimean) a que nos referimos anteriormente. El tercer estimador es el de MCO, que incluimos a efectos comparativos.
El cálculo de los errores estándar de los estimadores MAD y QR (que sólo son válidos asintó- ticamente) merece un breve comentario. Las cifras del cuadro se obtuvieron en tres etapas: en primer lugar, se utilizó el análisis paramétrico para calcular el valor de la función objetivo del pro- grama lineal discutido anteriormente en los dis- tintos percentiles de la regresión. La función resultante fue alisada mediante el ajuste de poli- nomios de tercer grado. Los errores estándar se calcularon a partir de las derivadas segundas de
la función alisada .
La segunda parte del cuadro muestra las elasticidades sectoriales de la demanda de trabajo con respecto al salario real. Todos los valores estimados son negativos. Destaca la dispersión que presentan los coeficientes sectoriales, que podría ser un reflejo de las diferencias tecnológicas entre los distintos sectores industriales. Sin embargo, la precisión de los valores estimados es reducida. Las discrepancias de mayor magnitud entre los coeficientes obtenidos por MCO y por métodos robustos se sitúan de nuevo en torno a un error estándar.
Cabe observar también que los errores estándar calculados son muy similares para los tres estimadores. Con el grado de alisamiento elegido para los estimadores robustos, la combinación lineal de cuantiles de regresión (QR) parece proporcionar una precisión ligeramente superior.
Se experimentó con tres tipos de alisamiento (que se distinguen por el número de puntos de enlace entre los polinomios de tercer grado). Las cifras del cuadro corresponden a un grado "medio" de alisamiento (con 5 puntos de enlace en (0,1) equidistantes entre sí).
Un requisito previo para la validez de los contrastes de hipótesis que más adelante realiza-remos es la ausencia de heterocedasticidad de los residuos. El contraste de White (1980) basado en los residuos MCO da lugar en nuestro caso a un estadístico que bajo la hipótesis nula de homocedasticidad se distribuye como una chi-cuadrado con 95 grados de libertad. El valor calculado fue de 93.51, con lo que la hipótesis nula no puede ser rechazada a los niveles convencionales de significación.
Estos criterios son utilizados con relativa frecuencia para comparar la calidad de estimadores alternativos en contextos de estimación robusta. Véase, por ejemplo, Ruppert y Carroll (1980).
Sin embargo, cabe mencionar que el test de Kolmogorov-Smirnov permite rechazar la normalidad de los residuos MCO al 1% de significación. Además, el análisis de los residuos indica que 17 observaciones ejercen una influencia "excesiva" (según el estadístico D de Cook) sobre los resultados.
| Newey y Powell (1987) presentan simulaciones de Monte Carlo que bajo determinadas circunstancias atribuyen mayor eficiencia asintótica a los contrastes de heterocedasticidad basados en los cuantiles de la regresión frente a los basados en los residuos MCO. La ganancia de eficiencia es especialmente notable en muestras grandes que contengan un reducido número de valores atípicos de gran magnitud (Newey y Powell (1987)). |
| Así pues, parece conveniente realizar el constraste de heterocedasticidad propuesto por Koenker y Bassett (1982). Este se basa en la comparación de los valores estimados de las "pendientes" del modelo (es decir, los coeficientes excluida la constante) en los distintos cuantiles de la regresión. Bajo la hipótesis nula de homocedasticidad, las pendientes estimadas deben ser idénicas en todos los cuantiles. |
| Comparando los valores de los coeficientes del modelo en el primer, segundo (= mediana) y tercer cuartiles de la regresión (que son por otra parte los que intervienen en el cálculo del estimador QR del Cuadro 1) se obtiene un estadístico que bajo la hipótesis nula de homocedasticidad se distribuye asintóticamente como una chi-cuadrado con 100 grados de libertad. El valor calculado fue de 122.25, por lo que nuevamente la hipótesis nula no se puede rechazar al 5% de significación. |
| Estos resultados permiten abordar con mayor confianza el contraste de hipótesis sobre los coeficientes de la ecuación de empleo. Los resultados aparecen en el Cuadro 2. El estimador que se empleó para los contrastes fue el MAD del Cuadro 1. El estadístico utilizado fue en todos los casos la forma cuadrática construida a partir de los |
cipales responsables de este resultado parecen ser los sectores 5, 8 y 12 (Metal, Automóvil y Tex-til), cuyas elasticidades empleo-output son significativamente menores que la unidad. Si se excluyen estos tres sectores, la hipótesis de elasticidad unitaria no puede ser rechazada.
En conclusión, estos resultados indican que bajo la hipótesis de exogeneidad del output y del salario real, los parámetros de la demanda de trabajo de los 17 sectores industriales de la CBBE (excluidos los términos constantes) no son muy diferentes entre sí. La hipótesis de rendimientos constantes a escala resulta también aceptable si se excluyen los sectores del Metal, Automóvil y Textil, que parecen presentar (modestos) rendimientos crecientes con respecto al empleo.
CUADRO 1
ESTIMACION DE LA DEMANDA DE TRABAJO
| Elasticidades outputpor sectores $^{a}$ | Método de estimación | ||
| MAD $^{b}$ | QR $^{c}$ | MCO | |
| 1 Minería | 1.056 (.472) | .981 (.464) | .964 (.468) |
| 2 Siderurgia | 1.065 (.123) | 1.047 (.121) | 1.033 (.122) |
| 3 Mat. construcción | 1.008 (.077) | .997 (.076) | .995 (.076) |
| 4 Química | .900 (.043) | .880 (.042) | .878 (.042) |
| 5 Metal | .766 (.059) | .741 (.058) | .733 (.058) |
| 6 Maquinaria | .935 (.064) | .923 (.063) | .921 (.063) |
| 7 Electrónica | .921 (.061) | .915 (.060) | .917 (.060) |
| 8 Automóvil | .814 (.054) | .843 (.053) | .855 (.054) |
| 9 Mat. transporte | .822 (.147) | .867 (.145) | .991 (.146) |
| 10 Mecánica | .881 (.419) | .897 (.412) | .889 (.415) |
| 11 Alimentación | .907 (.037) | .903 (.037) | .910 (.037) |
| 12 Textil | .755 (.062) | .772 (.061) | .767 (.062) |
| 13 Cuero y calzado | .911 (.196) | .825 (.192) | .821 (.194) |
| 14 Confección | 1.087 (.142) | 1.086 (.140) | 1.145 (.141) |
| 15 Madera | .827 (.113) | .829 (.111) | .805 (.113) |
| 16 Papel | .840 (.078) | .850 (.077) | .875 (.078) |
| 17 Otras | .964 (.072) | .967 (.071) | .988 (.072) |
CUADRO 1 (continuación)
| Elasticidades salariopor sectores $^a$ | Método de estimación | ||
| MAD $^b$ | QR $^c$ | MCO | |
| 1 Mineria | -4.497 (5.067) | -4.071 (4.980) | -3.775 (5.024) |
| 2 Siderurgia | -.648 (.778) | -.847 (.764) | -.929 (.772) |
| 3 Mat. construcción | -1.541 (.299) | -1.408 (.294) | -1.452 (.297) |
| 4 Química | -.992 (.197) | -.927 (.193) | -1.003 (.195) |
| 5 Metal | -1.200 (.314) | -1.061 (.308) | -.885 (.311) |
| 6 Maquinaria | -.578 (.377) | -.631 (.371) | -.836 (.374) |
| 7 Electrónica | -.393 (.247) | -.425 (.243) | -.438 (.245) |
| 8 Automóvil | -.512 (.691) | -.454 (.679) | -.600 (.685) |
| 9 Mat. transporte | -.545 (1.000) | -.646 (.988) | -.370 (.997) |
| 10 Mecánica | -.535 (.823) | -.390 (.808) | -.203 (.816) |
| 11 Alimentación | -.125 (.140) | -.160 (.139) | -.307 (.141) |
| 12 Textil | -1.009 (.283) | -.894 (.278) | -.801 (.280) |
| 13 Cuero y calzado | -.467 (.772) | -.398 (.759) | -.496 (.766) |
| 14 Confección | -1.839 (.494) | -1.850 (.486) | -1.747 (.490) |
| 15 Madera y corcho | -.997 (.395) | -1.053 (.388) | -.756 (.392) |
| 16 Papel | -.400 (.398) | -.542 (.391) | -.621 (.395) |
| 17 Otras | -.853 (.358) | -.847 (.353) | -.946 (.356) |
| RIQ $^d$ | .583 | .604 | .605 |
| MRA $^e$ | .287 | .301 | .307 |
Notas: Errores estándar entre paréntesis. Las cifras para MAD y QR son asintóticas. La regresión incluye también una constante y 16 dummies sectoriales. Estimador de mínima desviación absoluta (mediana de la regresión). c Estimador construido como combinación lineal de los cuartiles de la regrosión: BQR ≡ .25 β(.25) + .5 β(.5) + .25 β(.25) Rango intercuartil de los residuos ( ) Mediana de los valores absolutos de los residuos.
CUADRO 2
RESULTADOS DE LOS CONTRASTES DE HIPOTESIS
| Hipótesis | Valor de $X^{2}$ | Grados de libertad | Nivel marginal de significación |
| Igualdad de las elasticiades-output | 12.4 | 16 | .716 |
| Igualdad de las elasticidades-salario | 23.9 | 16 | .092 |
| Igualdad de las elasticidades output y salario | 44.3 | 32 | .073 |
| Igualdad de las constantes sectoriales | 29.0 | 16 | .024 |
| Igualdad de las constantes y de las elasti-cidades sectoriales | 180.8 | 48 | .000 |
| Elasticidades-output unitarias | 40.7 | 17 | .001 |
| Elasticidades-output unitarias excepto sectores 5, 8 y 12 | 14.8 | 14 | .392 |
Nota: a Utilizando el estimador MAD del Cuadro 1.
3. CONCLUSIONES
Como es sabido, la eficiencia del estimador mínimo-cuadrático del modelo lineal se deteriora de forma notable a medida que la distribución de los errores se aleja de la gaussiana. Aunque existe una amplia variedad de estimadores robustos que ofrecen propiedades superiores a las del estimador mínimo-cuadrático en situaciones no normales (a cambio de una ligera pérdida de eficiencia en el caso de normalidad), su uso práctico es por desgracia muy infrecuente.
En esta nota hemos utilizado estimadores robustos de la denominada clase L, compuesta por combinaciones lineales de los estadísticos de orden, y cuyas propiedades han sido estudiadas por Koenker y Bassett (1978, 1982), para contrastar algunas hipótesis sobre la demanda de trabajo en la industria española a partir de datos de sección cruzada de la Central de Balances del Banco de España.
Los resultados que se obtienen por procedimientos robustos son en nuestro caso muy similares a los que proporciona el método de mínimos cuadrados ordinarios. Ello permite suponer que los datos aquí utilizados no presentan anomalías de gran magnitud.
Del análisis se puede concluir que las características de la demanda de trabajo de los distintos sectores industriales son muy similares. Con nuestros datos, la hipótesis de igualdad de las elasticidades de las demandas sectoriales con respecto al producto y al salario real es en principio aceptable. La hipótesis adicional de rendimientos constantes a escala parece también aceptable para la mayoría de los sectores industriales.
REFERENCIAS
Andrews, D. et al. (1972): Robust estimates of location, Princeton: Princeton University Press.
Amemiya, T. (1985): Advanced Econometrics, Oxford: Basil Blackwell.
Fair, R. (1974): "On the robust estimation of econometric models", Annals of Economic and Social Measurement 3, pp 667-667.
Huber, P. (1977): Robust Statistical Procedures, Filadelfia: Society for Industrial and Applied Mathematics.
Koenker, R. y G. Bassett (1978): "Regression quantiles", Econometrica 46, pp 33-50.
Koenker, R. y G. Bassett (1982): "Robust tests for heteroscedasticity based on regression quantiles", Econometrica 50, pp 43-61.
Mairesse, J. y B. Dormont (1985): "Labor and investment demand at the firm level", NBER Working Paper num 1554.
Newey, W. y J. Powell (1987): "Asymmetric least squares estimation and testing", Econometrica 55, pp 819-847.
Ruppert, D. y R. Carroll (1980): "Robust regression by trimmed least squares", Journal of the American Statistical Association 75, pp 328-838.
Sebastián, C. (1987): "Las empresas industriales en 1985: análisis de los datos de la CBBE", FEDEA, Documento de Trabajo 87-08.
Sebastián, C. y L. Servén (1986): "Excedente, inversión y empleo en la empresa española. Madrid. FEDEA.
Servén, L. (1987): "An econometric analysis of the demand for labor in Spanish manufacturing", FEDEA, Documento de Trabajo 87-11.
Wagner, H. (1959): "Linear programming techniques for regression analysis", Journal of the American Statistical Association 56, pp 206-212.
White, H. (1980): "A heteroscedasticity-consistent covariance matrix estimator and a direct test for heteroscedasticity", Econometrica 48, pp 817-838.