Articulo de referencia

mínimos cuadrados generalizados

En estadística , el método de mínimos cuadrados generalizados ( GLS ) se utiliza para estimar los parámetros desconocidos en un modelo de regresión lineal . Se emplea cuando exi...

En estadística , el método de mínimos cuadrados generalizados ( GLS ) se utiliza para estimar los parámetros desconocidos en un modelo de regresión lineal . Se emplea cuando existe una correlación no nula entre los residuos del modelo de regresión. El GLS se utiliza para mejorar la eficiencia estadística y reducir el riesgo de obtener inferencias erróneas, en comparación con los métodos convencionales de mínimos cuadrados y mínimos cuadrados ponderados . Fue descrito por primera vez por Alexander Aitken en 1935. [ 1 ]

Requiere conocer la matriz de covarianza de los residuos. Si se desconoce, estimar dicha matriz da lugar al método de mínimos cuadrados generalizados factibles (FGLS). Sin embargo, FGLS ofrece menos garantías de mejora.

Método

En los modelos de regresión lineal estándar , se observan datos{yi,incógnitaij}i=1,,norte,j=2,,k{\displaystyle \{y_{i},x_{ij}\}_{i=1,\dots ,n,j=2,\dots ,k}}en n unidades estadísticas con k  1 valores predictores y un valor de respuesta cada una.

Los valores de respuesta se colocan en un vector,y(y1ynorte),{\displaystyle \mathbf {y} \equiv {\begin{pmatrix}y_{1}\\\vdots \\y_{n}\end{pmatrix}},} y los valores predictivos se colocan en la matriz de diseño ,incógnita(1incógnita12incógnita13incógnita1k1incógnita22incógnita23incógnita2k1incógnitanorte2incógnitanorte3incógnitanortek),{\displaystyle \mathbf {X} \equiv {\begin{pmatrix}1&x_{12}&x_{13}&\cdots &x_{1k}\\1&x_{22}&x_{23}&\cdots &x_{2k}\\\vdots &\vdots &\vdots &\ddots &\vdots \\1&x_{n2}&x_{n3}&\cdots &x_{nk}\end{pmatrix}},} donde cada fila es un vector de losk{\displaystyle k}variables predictoras (incluida una constante) para lai{\displaystyle i}punto de datos.

El modelo supone que la media condicional dey{\displaystyle \mathbf {y} }dadoincógnita{\displaystyle \mathbf {X} }ser una función lineal deincógnita{\displaystyle \mathbf {X} }y que la varianza condicional del término de error dadoincógnita{\displaystyle \mathbf {X} }es una matriz de covarianza no singular conocida ,Ω{\displaystyle \mathbf {\Omega } }. Eso es,y=incógnitaβ+ε,mi[εincógnita]=0,Cov[εincógnita]=Ω,{\displaystyle \mathbf {y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }},\quad \operatorname {E} [{\boldsymbol {\varepsilon }}\mid \mathbf {X} ]=0,\quad \operatorname {Cov} [{\boldsymbol {\varepsilon }}\mid \mathbf {X} ]={\boldsymbol {\Omega }},} dóndeβRk{\displaystyle {\boldsymbol {\beta }}\in \mathbb {R} ^{k}}es un vector de constantes desconocidas, llamadas "coeficientes de regresión", que se estiman a partir de los datos.

Sib{\displaystyle \mathbf {b} }es una estimación candidata paraβ{\displaystyle {\boldsymbol {\beta }}}, entonces el vector residual parab{\displaystyle \mathbf {b} }esyincógnitab{\displaystyle \mathbf {y} -\mathbf {X} \mathbf {b} }El método de mínimos cuadrados generalizados estimaβ{\displaystyle {\boldsymbol {\beta }}}minimizando la longitud de Mahalanobis al cuadrado de este vector residual:β^=argininab(yincógnitab)TΩ1(yincógnitab)=argininabyTΩ1y+(incógnitab)TΩ1incógnitabyTΩ1incógnitab(incógnitab)TΩ1y,{\displaystyle {\begin{aligned}{\hat {\boldsymbol {\beta }}}&={\underset {\mathbf {b} }{\operatorname {argmin} }}\,(\mathbf {y} -\mathbf {X} \mathbf {b} )^{\mathrm {T} }\mathbf {\Omega } ^{-1}(\mathbf {y} -\mathbf {X} \mathbf {b} )\\&={\underset {\mathbf {b} }{\operatorname {argmin} }}\,\mathbf {y} ^{\mathrm {T} }\,\mathbf {\Omega } ^{-1}\mathbf {y} +(\mathbf {X} \mathbf {b} )^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {X} \mathbf {b} -\mathbf {y} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {X} \mathbf {b} -(\mathbf {X} \mathbf {b} )^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {y} \,,\end{aligned}}}lo cual es equivalente aβ^=argininabyTΩ1y+bTincógnitaTΩ1incógnitab2bTincógnitaTΩ1y,{\displaystyle {\hat {\boldsymbol {\beta }}}={\underset {\mathbf {b} }{\operatorname {argmin} }}\,\mathbf {y} ^{\mathrm {T} }\,\mathbf {\Omega } ^{-1}\mathbf {y} +\mathbf {b} ^{\mathrm {T} }\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {X} \mathbf {b} -2\mathbf {b} ^{\mathrm {T} }\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {y} ,}que es un problema de programación cuadrática . El punto estacionario de la función objetivo ocurre cuando2incógnitaTΩ1incógnitab2incógnitaTΩ1y=0,{\displaystyle 2\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {X} {\mathbf {b} }-2\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {y} =0,}por lo tanto el estimador esβ^=(incógnitaTΩ1incógnita)1incógnitaTΩ1y.{\displaystyle {\hat {\boldsymbol {\beta }}}=\left(\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {X} \right)^{-1}\mathbf {X} ^{\mathrm {T} }\mathbf {\Omega } ^{-1}\mathbf {y} .}La cantidadΩ1{\displaystyle \mathbf {\Omega } ^{-1}}se conoce como matriz de precisión (o matriz de dispersión ), una generalización de la matriz de pesos diagonal .

Propiedades

El estimador GLS es insesgado , consistente , eficiente y asintóticamente normal conmi[β^incógnita]=β,yCov[β^incógnita]=(incógnitaTΩ1incógnita)1.{\displaystyle \operatorname {E} [{\hat {\boldsymbol {\beta }}}\mid \mathbf {X} ]={\boldsymbol {\beta }},\quad {\text{and}}\quad \operatorname {Cov} [{\hat {\boldsymbol {\beta }}}\mid \mathbf {X} ]=(\mathbf {X} ^{\mathrm {T} }{\boldsymbol {\Omega }}^{-1}\mathbf {X} )^{-1}.}GLS es equivalente a aplicar mínimos cuadrados ordinarios (OLS) a una versión transformada linealmente de los datos. Esto se puede ver factorizandoΩ=dodoT{\displaystyle \mathbf {\Omega } =\mathbf {C} \mathbf {C} ^{\mathrm {T} }}utilizando un método como la descomposición de Cholesky . Multiplicando por la izquierda ambos lados dey=incógnitaβ+ε{\displaystyle \mathbf {y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}}pordo1{\displaystyle \mathbf {C} ^{-1}}produce un modelo lineal equivalente:y=incógnitaβ+ε,dóndey=do1y,incógnita=do1incógnita,ε=do1ε.{\displaystyle \mathbf {y} ^{*}=\mathbf {X} ^{*}{\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}^{*},\quad {\text{where}}\quad \mathbf {y} ^{*}=\mathbf {C} ^{-1}\mathbf {y} ,\quad \mathbf {X} ^{*}=\mathbf {C} ^{-1}\mathbf {X} ,\quad {\boldsymbol {\varepsilon }}^{*}=\mathbf {C} ^{-1}{\boldsymbol {\varepsilon }}.}En este modelo,Var[εincógnita]=do1Ω(do1)T=I{\displaystyle \operatorname {Var} [{\boldsymbol {\varepsilon }}^{*}\mid \mathbf {X} ]=\mathbf {C} ^{-1}\mathbf {\Omega } \left(\mathbf {C} ^{-1}\right)^{\mathrm {T} }=\mathbf {I} }, dóndeI{\displaystyle \mathbf {I} }es la matriz identidad . Entonces,β{\displaystyle {\boldsymbol {\beta }}}puede estimarse de manera eficiente aplicando MCO a los datos transformados, lo que requiere minimizar el objetivo,(yincógnitaβ)T(yincógnitaβ)=(yincógnitab)TΩ1(yincógnitab).{\displaystyle \left(\mathbf {y} ^{*}-\mathbf {X} ^{*}{\boldsymbol {\beta }}\right)^{\mathrm {T} }(\mathbf {y} ^{*}-\mathbf {X} ^{*}{\boldsymbol {\beta }})=(\mathbf {y} -\mathbf {X} \mathbf {b} )^{\mathrm {T} }\,\mathbf {\Omega } ^{-1}(\mathbf {y} -\mathbf {X} \mathbf {b} ).} Esta transformación estandariza eficazmente la escala y descorrelaciona los errores. Cuando se utiliza MCO en datos con errores homocedásticos , se aplica el teorema de Gauss-Markov , por lo que la estimación MLS es el mejor estimador lineal insesgado paraβ{\displaystyle {\boldsymbol {\beta }}}.

mínimos cuadrados ponderados

Un caso especial de GLS, denominado mínimos cuadrados ponderados (WLS), se produce cuando todos los elementos fuera de la diagonal de Ω son 0. Esta situación surge cuando las varianzas de los valores observados son desiguales o cuando existe heterocedasticidad , pero no hay correlaciones entre las varianzas observadas. El peso para la unidad i es proporcional al recíproco de la varianza de la respuesta para la unidad i . [ 2 ]

Derivación mediante estimación de máxima verosimilitud

Los mínimos cuadrados ordinarios pueden interpretarse como una estimación de máxima verosimilitud con la distribución a priori de que los errores son independientes y se distribuyen normalmente con media cero y varianza común. En GLS, la distribución a priori se generaliza al caso en que los errores pueden no ser independientes y pueden tener varianzas diferentes . Para parámetros de ajuste dadosb{\displaystyle \mathbf {b} }Se supone que la función de densidad de probabilidad condicional de los errores es:pag(ε|b)=1(2π)nortedetΩexp(12εTΩ1ε).{\displaystyle p({\boldsymbol {\varepsilon }}|\mathbf {b} )={\frac {1}{\sqrt {(2\pi )^{n}\det {\boldsymbol {\Omega }}}}}\exp \left(-{\frac {1}{2}}{\boldsymbol {\varepsilon }}^{\mathrm {T} }{\boldsymbol {\Omega }}^{-1}{\boldsymbol {\varepsilon }}\right).} Por el teorema de Bayes ,pag(b|ε)=pag(ε|b)pag(b)pag(ε).{\displaystyle p(\mathbf {b} |{\boldsymbol {\varepsilon }})={\frac {p({\boldsymbol {\varepsilon }}|\mathbf {b} )p(\mathbf {b} )}{p({\boldsymbol {\varepsilon }})}}.}En GLS, se toma una distribución a priori uniforme (impropia) parapag(b){\displaystyle p(\mathbf {b} )}y comopag(ε){\displaystyle p({\boldsymbol {\varepsilon }})}es una distribución marginal, no depende deb{\displaystyle \mathbf {b} }Por lo tanto, la probabilidad logarítmica esregistropag(b|ε)=registropag(ε|b)+=12εTΩ1ε+,{\displaystyle \log p(\mathbf {b} |{\boldsymbol {\varepsilon }})=\log p({\boldsymbol {\varepsilon }}|\mathbf {b} )+\cdots =-{\frac {1}{2}}{\boldsymbol {\varepsilon }}^{\mathrm {T} }{\boldsymbol {\Omega }}^{-1}{\boldsymbol {\varepsilon }}+\cdots ,}donde los términos ocultos son aquellos que no dependen deb{\displaystyle \mathbf {b} }, yregistropag(ε|b){\displaystyle \log p({\boldsymbol {\varepsilon }}|\mathbf {b} )}es la log-verosimilitud . La estimación de máxima a posteriori (MAP) es entonces la estimación de máxima verosimilitud (MLE), que es equivalente al problema de optimización anterior,β^=argmaxbpag(b|ε)=argmaxbregistropag(b|ε)=argmaxbregistropag(ε|b),{\displaystyle {\hat {\boldsymbol {\beta }}}={\underset {\mathbf {b} }{\operatorname {argmax} }}\;p(\mathbf {b} |{\boldsymbol {\varepsilon }})={\underset {\mathbf {b} }{\operatorname {argmax} }}\;\log p(\mathbf {b} |{\boldsymbol {\varepsilon }})={\underset {\mathbf {b} }{\operatorname {argmax} }}\;\log p({\boldsymbol {\varepsilon }}|\mathbf {b} ),}

donde el problema de optimización se ha reescrito utilizando el hecho de que el logaritmo es una función estrictamente creciente y la propiedad de que el argumento que resuelve un problema de optimización es independiente de los términos de la función objetivo que no involucran dichos términos. Sustituyendoyincógnitab{\displaystyle \mathbf {y} -\mathbf {X} \mathbf {b} }paraε{\displaystyle {\boldsymbol {\varepsilon }}}, β^=argininab12(yincógnitab)TΩ1(yincógnitab).{\displaystyle {\hat {\boldsymbol {\beta }}}={\underset {\mathbf {b} }{\operatorname {argmin} }}\;{\frac {1}{2}}(\mathbf {y} -\mathbf {X} \mathbf {b} )^{\mathrm {T} }{\boldsymbol {\Omega }}^{-1}(\mathbf {y} -\mathbf {X} \mathbf {b} ).}

Mínimos cuadrados generalizados factibles

Si la covarianza de los erroresΩ{\displaystyle \Omega }es desconocido, se puede obtener una estimación consistente deΩ{\displaystyle \Omega }, decirΩ^{\displaystyle {\widehat {\Omega }}}, [ 3 ] utilizando una versión implementable de GLS conocida como el estimador de mínimos cuadrados generalizados factibles ( FGLS ).

En FGLS, el modelado se lleva a cabo en dos etapas:

  1. El modelo se estima mediante MCO u otro estimador consistente (pero ineficiente), y los residuos se utilizan para construir un estimador consistente de la matriz de covarianza de los errores (para ello, a menudo es necesario examinar el modelo añadiendo restricciones adicionales; por ejemplo, si los errores siguen un proceso de series temporales, un estadístico generalmente necesita algunos supuestos teóricos sobre este proceso para garantizar que se disponga de un estimador consistente).
  2. Luego, utilizando el estimador consistente de la matriz de covarianza de los errores, se pueden implementar ideas de Mínimos Cuadrados Generalizados (MGL).

Si bien GLS es más eficiente que OLS bajo heterocedasticidad (también escrito heteroskedasticity) o autocorrelación , esto no es cierto para FGLS. El estimador factible es asintóticamente más eficiente (siempre que la matriz de covarianza de los errores se estime de forma consistente), pero para una muestra pequeña o mediana, puede ser en realidad menos eficiente que OLS. Por esta razón, algunos autores prefieren usar OLS y reformular sus inferencias simplemente considerando un estimador alternativo para la varianza del estimador robusto a la heterocedasticidad o la autocorrelación serial. Sin embargo, para muestras grandes, FGLS es preferible a OLS bajo heterocedasticidad o autocorrelación serial. [ 3 ] [ 4 ] Una advertencia es que el estimador FGLS no siempre es consistente. Un caso en el que FGLS podría ser inconsistente es si hay efectos fijos específicos de cada individuo. [ 5 ]

En general, este estimador tiene propiedades diferentes a las de GLS. Para muestras grandes (es decir, asintóticamente), todas las propiedades son (bajo condiciones apropiadas) comunes con respecto a GLS, pero para muestras finitas, las propiedades de los estimadores FGLS son desconocidas: varían drásticamente con cada modelo particular y, por regla general, sus distribuciones exactas no pueden derivarse analíticamente. Para muestras finitas, FGLS puede ser menos eficiente que OLS en algunos casos. Por lo tanto, si bien GLS puede ser factible, no siempre es prudente aplicar este método cuando la muestra es pequeña. Un método utilizado para mejorar la precisión de los estimadores en muestras finitas es iterar; es decir, tomar los residuos de FGLS para actualizar el estimador de covarianza de los errores y luego actualizar la estimación FGLS, aplicando la misma idea iterativamente hasta que los estimadores varíen menos que cierta tolerancia. Sin embargo, este método no necesariamente mejora mucho la eficiencia del estimador si la muestra original era pequeña.

Una opción razonable cuando las muestras no son demasiado grandes es aplicar MCO pero descartar el estimador de varianza clásico.

σ2(incógnitaTincógnita)1{\displaystyle \sigma ^{2}*(X^{\operatorname {T} }X)^{-1}}

(lo cual es inconsistente en este marco) y en su lugar usar un estimador HAC (consistente con heterocedasticidad y autocorrelación). En el contexto de la autocorrelación, se puede usar el estimador de Newey-West , y en contextos heterocedásticos, se puede usar el estimador de Eicker-White . Este enfoque es mucho más seguro y es el camino apropiado a seguir a menos que la muestra sea grande, donde "grande" a veces es un tema resbaladizo (por ejemplo, si la distribución del error es asimétrica, la muestra requerida será mucho mayor).

El estimador de mínimos cuadrados ordinarios (MCO) se calcula mediante:

β^MCO=(incógnitaTincógnita)1incógnitaTy{\displaystyle {\widehat {\beta }}_{\text{OLS}}=(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }y}

y estimaciones de los residuos^j=(Yincógnitaβ^MCO)j{\displaystyle {\widehat {u}}_{j}=(Y-X{\widehat {\beta }}_{\text{OLS}})_{j}}se construyen.

Para simplificar, consideremos el modelo para errores heterocedásticos y no autocorrelacionados. Supongamos que la matriz de varianza-covarianzaΩ{\displaystyle \Omega }del vector de error es diagonal, o equivalentemente que los errores de observaciones distintas no están correlacionados. Entonces cada entrada diagonal puede estimarse mediante los residuos ajustados.^j{\displaystyle {\widehat {u}}_{j}}entoncesΩ^OLS{\displaystyle {\widehat {\Omega }}_{OLS}}puede ser construido por:

Ω^MCO=diagnóstico(σ^12,σ^22,,σ^norte2).{\displaystyle {\widehat {\Omega }}_{\text{OLS}}=\operatorname {diag} ({\widehat {\sigma }}_{1}^{2},{\widehat {\sigma }}_{2}^{2},\dots ,{\widehat {\sigma }}_{n}^{2}).}

Es importante destacar que los residuos al cuadrado no pueden utilizarse en la expresión anterior; se necesita un estimador de las varianzas de los errores. Para ello, se puede emplear un modelo de heterocedasticidad paramétrico o un estimador no paramétrico.

EstimarβFGRAMOLS1{\displaystyle \beta _{FGLS1}}usandoΩ^MCO{\displaystyle {\widehat {\Omega }}_{\text{OLS}}}utilizando [ 4 ] mínimos cuadrados ponderados :

β^FGRAMOLS1=(incógnitaTΩ^MCO1incógnita)1incógnitaTΩ^MCO1y{\displaystyle {\widehat {\beta }}_{FGLS1}=(X^{\operatorname {T} }{\widehat {\Omega }}_{\text{OLS}}^{-1}X)^{-1}X^{\operatorname {T} }{\widehat {\Omega }}_{\text{OLS}}^{-1}y}

El procedimiento puede repetirse. La primera iteración viene dada por:

^FGRAMOLS1=Yincógnitaβ^FGRAMOLS1{\displaystyle {\widehat {u}}_{FGLS1}=Y-X{\widehat {\beta }}_{FGLS1}}
Ω^FGRAMOLS1=diagnóstico(σ^FGRAMOLS1,12,σ^FGRAMOLS1,22,,σ^FGRAMOLS1,norte2){\displaystyle {\widehat {\Omega }}_{FGLS1}=\operatorname {diag} ({\widehat {\sigma }}_{FGLS1,1}^{2},{\widehat {\sigma }}_{FGLS1,2}^{2},\dots ,{\widehat {\sigma }}_{FGLS1,n}^{2})}
β^FGRAMOLS2=(incógnitaTΩ^FGRAMOLS11incógnita)1incógnitaTΩ^FGRAMOLS11y{\displaystyle {\widehat {\beta }}_{FGLS2}=(X^{\operatorname {T} }{\widehat {\Omega }}_{FGLS1}^{-1}X)^{-1}X^{\operatorname {T} }{\widehat {\Omega }}_{FGLS1}^{-1}y}

Esta estimación deΩ^{\displaystyle {\widehat {\Omega }}}puede iterarse hasta la convergencia.

Bajo ciertas condiciones de regularidad, el estimador FGLS (o el estimador de sus iteraciones, si se realiza un número finito de iteraciones) se distribuye asintóticamente como:

norte(β^FGRAMOLSβ) d norte(0,V){\displaystyle {\sqrt {n}}({\hat {\beta }}_{FGLS}-\beta )\ \xrightarrow {d} \ {\mathcal {N}}\!\left(0,\,V\right)}

dóndenorte{\displaystyle n}es el tamaño de la muestra y

V=pag-limetro(incógnitaTΩ1incógnita/norte){\displaystyle V=\operatorname {p-lim} (X^{\operatorname {T} }\Omega ^{-1}X/n)}

dóndelímite p{\displaystyle {\text{p-lim}}}significa límite en probabilidad .

Véase también

Referencias

  1. Aitken, AC (1935). "Sobre mínimos cuadrados y combinaciones lineales de observaciones". Actas de la Real Sociedad de Edimburgo . 55 : 42–48 . doi : 10.1017/s0370164600014346 .
  2. Strutz, T. (2016). Ajuste de datos e incertidumbre (Una introducción práctica a los mínimos cuadrados ponderados y más allá) . Springer Vieweg. ISBN 978-3-658-11455-8.capítulo 3
  3. 1 2 Baltagi, BH (2008). Econometría (4.ª ed.). Nueva York: Springer.
  4. 1 2 Greene, WH (2003). Análisis econométrico (5.ª ed.). Upper Saddle River, NJ: Prentice Hall.
  5. Hansen, Christian B. (2007). "Inferencia generalizada de mínimos cuadrados en modelos de panel y multinivel con autocorrelación y efectos fijos". Journal of Econometrics . 140 (2): 670– 694. doi : 10.1016/j.jeconom.2006.07.011 .

Lecturas adicionales

  • Amemiya, Takeshi (1985). "Teoría generalizada de mínimos cuadrados" . Econometría avanzada . Harvard University Press. ISBN 0-674-00560-0.
  • Johnston, John (1972). "Mínimos cuadrados generalizados" . Métodos econométricos (segunda  edición). Nueva York: McGraw-Hill. págs. 208–242 . 
  • Kmenta, Jan (1986). «Modelo de regresión lineal generalizado y sus aplicaciones» . Elementos de econometría (segunda  edición). Nueva York: Macmillan. págs. 607–650 . ISBN  0-472-10886-7.
  • Beck, Nathaniel; Katz, Jonathan N. (septiembre de 1995). "Qué hacer (y qué no hacer) con datos de series temporales de sección transversal" . American Political Science Review . 89 (3): 634– 647. doi : 10.2307/2082979 . ISSN 1537-5943 . JSTOR 2082979. S2CID 63222945 .