Articulo de referencia

Teorema de Gauss-Markov

En estadística , el teorema de Gauss-Markov (o simplemente teorema de Gauss para algunos autores) [ 1 ] establece que el estimador de mínimos cuadrados ordinarios (MCO) tiene la...

En estadística , el teorema de Gauss-Markov (o simplemente teorema de Gauss para algunos autores) [ 1 ] establece que el estimador de mínimos cuadrados ordinarios (MCO) tiene la menor varianza de muestreo ( varianza del estimador entre muestras) dentro de la clase de estimadores lineales insesgados , si los errores en el modelo de regresión lineal no están correlacionados , tienen varianzas iguales y un valor esperado de cero. [ 2 ] Los errores no necesitan ser normales , ni tampoco necesitan ser independientes e idénticamente distribuidos (solo no correlacionados con media cero y homocedásticos con varianza finita). El requisito de que el estimador sea insesgado no puede eliminarse, ya que existen estimadores sesgados con menor varianza. Véase, por ejemplo, el estimador de James-Stein (que también elimina la linealidad), la regresión de cresta o simplemente cualquier estimador degenerado .

El teorema recibió su nombre en honor a Carl Friedrich Gauss y Andrey Markov , aunque el trabajo de Gauss es significativamente anterior al de Markov. [ 3 ] Pero mientras que Gauss derivó el resultado bajo el supuesto de independencia y normalidad, Markov redujo los supuestos a la forma antes mencionada. [ 4 ] Alexander Aitken proporcionó una generalización adicional a errores no esféricos . [ 5 ]

Declaración de caso escalar

Supongamos que se nos dan dos variables aleatorias.incógnita,Y{\displaystyle X,Y}y que queremos encontrar el mejor estimador lineal deY{\displaystyle Y}dadoincógnita{\displaystyle X}, utilizando el mejor estimador lineal Y^=αincógnita+μ,{\displaystyle {\sombrero {Y}}=\alpha X+\mu ,} donde los parámetrosα{\displaystyle \alpha }yμ{\displaystyle \mu }ambos son números reales.

Tal estimadorY^{\displaystyle {\hat {Y}}}tendría la misma media y desviación estándar queY{\displaystyle Y}, eso es,μY^=μY,σY^=σY{\displaystyle \mu _{\hat {Y}}=\mu _{Y},\sigma _{\hat {Y}}=\sigma _{Y}}.

Por lo tanto, si el vectorincógnita{\displaystyle X}tiene su respectiva media y desviación estándarμincógnita,σincógnita{\displaystyle \mu _{x},\sigma _{x}}, el mejor estimador lineal sería Y^=σy(incógnitaμincógnita)σincógnita+μy,{\displaystyle {\hat {Y}}=\sigma _{y}{\frac {(X-\mu _{x})}{\sigma _{x}}}+\mu _{y},} desdeY^{\displaystyle {\hat {Y}}}tiene la misma media y desviación estándar queY{\displaystyle Y}.

Declaración

Supongamos que tenemos, en notación matricial, la relación lineal y=incógnitaβ+ε,(y,εRnorte,βRK y incógnitaRnorte×K),{\displaystyle y=X\beta +\varepsilon ,\quad (y,\varepsilon \in \mathbb {R} ^{n},\beta \in \mathbb {R} ^{K}{\text{ y }}X\in \mathbb {R} ^{n\times K}),} dóndeβj{\displaystyle \beta _{j}}son parámetros no aleatorios pero no observables,incógnitaij{\displaystyle X_{ij}}son no aleatorias y observables (denominadas "variables explicativas"),εi{\displaystyle \varepsilon _ {i}}son aleatorios y por lo tantoyi{\displaystyle y_{i}}son aleatorias. Las variables aleatoriasεi{\displaystyle \varepsilon _ {i}}Se denominan "perturbación", "ruido" o simplemente "error" (que se contrastará con "residuo" más adelante en el artículo; véase errores y residuos en estadística ). Tenga en cuenta que para incluir una constante en el modelo anterior, se puede optar por introducirla como una variable.βK+1{\displaystyle \beta _{K+1}} con una columna final de reciente introducciónincógnita{\displaystyle X}ser unidad es decir,incógnitai(K+1)=1{\displaystyle X_{i(K+1)}=1}a pesar dei{\displaystyle i}. Tenga en cuenta que, sin embargoyi{\displaystyle y_{i}}Como respuestas de muestra, son observables, las siguientes afirmaciones y argumentos, incluyendo supuestos, pruebas y otros, se asumen bajo la única condición de saberincógnitaij,{\displaystyle X_{ij},}pero noyi.{\displaystyle y_{i}.}

Los supuestos de Gauss-Markov se refieren al conjunto de variables aleatorias de error.εi{\displaystyle \varepsilon _ {i}}:

  • Tienen un valor medio de cero:mi[εi]=0.{\displaystyle \operatorname {E} [\varepsilon _ {i}]=0.}
  • Son homocedásticas , es decir, todas tienen la misma varianza finita:Var(εi)=σ2<{\displaystyle \operatorname {Var} (\varepsilon _{i})=\sigma ^{2}<\infty }a pesar dei{\displaystyle i}.
  • Los distintos términos de error no están correlacionados:Cov(εi,εj)=0,ij.{\displaystyle \operatorname {Cov} (\varepsilon _{i},\varepsilon _{j})=0,\forall i\neq j.}

Un estimador lineal deβj{\displaystyle \beta _{j}}es una combinación lineal β^j=do1jy1++donortejynorte,{\displaystyle {\widehat {\beta }}_{j}=c_{1j}y_{1}+\cdots +c_{nj}y_{n},} en el que los coeficientesdoij{\displaystyle c_{ij}}No se les permite depender de los coeficientes subyacentes.βj{\displaystyle \beta _{j}}, ya que no son observables, pero se permite que dependan de los valoresincógnitaij{\displaystyle X_{ij}}, ya que estos datos son observables. (La dependencia de los coeficientes de cadaincógnitaij{\displaystyle X_{ij}}es típicamente no lineal; el estimador es lineal en cadayi{\displaystyle y_{i}}y por lo tanto en cada aleatorioε,{\displaystyle \varepsilon ,}(Por eso se trata de una regresión "lineal" ). Se dice que el estimador es insesgado si y solo simi[β^j]=βj{\displaystyle \operatorname {E} [{\hat {\beta }}_{j}]=\beta _ {j}} independientemente de los valores deincógnitaij{\displaystyle X_{ij}}Ahora, dejemos...j=1Kλjβj{\textstyle \sum _{j=1}^{K}\lambda _{j}\beta _{j}}sea ​​alguna combinación lineal de los coeficientes. Entonces, el error cuadrático medio de la estimación correspondiente es mi[(j=1Kλj(β^jβj))2],{\displaystyle \operatorname {E} \left[\left(\sum _{j=1}^{K}\lambda _{j}({\hat {\beta }}_{j}-\beta _{j})\right)^{2}\right],} En otras palabras, es la esperanza del cuadrado de la suma ponderada (a través de los parámetros) de las diferencias entre los estimadores y los parámetros correspondientes a estimar. (Dado que estamos considerando el caso en el que todas las estimaciones de los parámetros son insesgadas, este error cuadrático medio es igual a la varianza de la combinación lineal). El mejor estimador lineal insesgado (BLUE) del vectorβ{\displaystyle \beta }de parámetrosβj{\displaystyle \beta _{j}}es aquel con el menor error cuadrático medio para cada vectorλ{\displaystyle \lambda }de parámetros de combinación lineal. Esto es equivalente a la condición de que Var(β~)Var(β^){\displaystyle \operatorname {Var} ({\tilde {\beta }})-\operatorname {Var} ({\hat {\beta }})} es una matriz semidefinida positiva para cualquier otro estimador lineal insesgado.β~{\displaystyle {\widetilde {\beta }}}.

El estimador de mínimos cuadrados ordinarios (MCO) es la función β^=(incógnitaTincógnita)1incógnitaTy{\displaystyle {\widehat {\beta }}=(X^{\mathsf {T}}X)^{-1}X^{\mathsf {T}}y} dey{\displaystyle y}yincógnita{\displaystyle X}(dóndeincógnitaT{\displaystyle X^{\mathsf {T}}}denota la transpuesta deincógnita{\displaystyle X}) que minimiza la suma de los cuadrados de los residuos (cantidades de predicción errónea): i=1norte(yiy^i)2=i=1norte(yij=1Kβ^jincógnitaij)2.{\displaystyle \sum _{i=1}^{n}(y_{i}-{\hat {y}}_{i})^{2}=\sum _{i=1}^{n}\left(y_{i}-\sum _{j=1}^{K}{\hat {\beta }}_{j}X_{ij}\right)^{2}.}

El teorema ahora establece que el estimador MCO es un estimador lineal insesgado óptimo (BLUE).

La idea principal de la demostración es que el estimador de mínimos cuadrados no está correlacionado con ningún estimador lineal insesgado de cero, es decir, con ninguna combinación lineal.a1y1++anorteynorte{\displaystyle a_{1}y_{1}+\cdots +a_{n}y_{n}}cuyos coeficientes no dependen de lo no observableβ{\displaystyle \beta }pero cuyo valor esperado es siempre cero.

Observación

La demostración de que el método MCO minimiza efectivamente la suma de los cuadrados de los residuos puede procederse de la siguiente manera, calculando la matriz hessiana y demostrando que es definida positiva.

La función MSE que queremos minimizar es F(β0,β1,,βpag)=i=1norte(yiβ0β1incógnitai1βpagincógnitaipag)2{\displaystyle f(\beta _{0},\beta _{1},\dots ,\beta _{p})=\sum _{i=1}^{n}(y_{i}-\beta _{0}-\beta _{1}x_{i1}-\dots -\beta _{p}x_{ip})^{2}} para un modelo de regresión múltiple con p variables. La primera derivada es ddβF=2incógnitaT(yincógnitaβ)=2[i=1norte(yiβpagincógnitaipag)i=1norteincógnitai1(yiβpagincógnitaipag)i=1norteincógnitaipag(yiβpagincógnitaipag)]=0pag+1,{\displaystyle {\begin{aligned}{\frac {d}{d{\boldsymbol {\beta }}}}f&=-2X^{\operatorname {T} }\left(\mathbf {y} -X{\boldsymbol {\beta }}\right)\\&=-2{\begin{bmatrix}\sum _{i=1}^{n}(y_{i}-\dots -\beta _{p}x_{ip})\\\sum _{i=1}^{n}x_{i1}(y_{i}-\dots -\beta _{p}x_{ip})\\\vdots \\\sum _{i=1}^{n}x_{ip}(y_{i}-\dots -\beta _{p}x_{ip})\end{bmatrix}}\\&=\mathbf {0} _{p+1},\end{aligned}}} dóndeincógnitaT{\displaystyle X^{\operatorname {T} }}es la matriz de diseño incógnita=[1incógnita11incógnita1pag1incógnita21incógnita2pag1incógnitanorte1incógnitanortepag]Rnorte×(pag+1);nortepag+1{\displaystyle X={\begin{bmatrix}1&x_{11}&\cdots &x_{1p}\\1&x_{21}&\cdots &x_{2p}\\&&\vdots \\1&x_{n1}&\cdots &x_{np}\end{bmatrix}}\in \mathbb {R} ^{n\times (p+1)};\qquad n\geq p+1}

La matriz hessiana de segundas derivadas es H=2[nortei=1norteincógnitai1i=1norteincógnitaipagi=1norteincógnitai1i=1norteincógnitai12i=1norteincógnitai1incógnitaipagi=1norteincógnitaipagi=1norteincógnitaipagincógnitai1i=1norteincógnitaipag2]=2incógnitaTincógnita{\displaystyle {\mathcal {H}}=2{\begin{bmatrix}n&\sum _{i=1}^{n}x_{i1}&\cdots &\sum _{i=1}^{n}x_{ip}\\\sum _{i=1}^{n}x_{i1}&\sum _{i=1}^{n}x_{i1}^{2}&\cdots &\sum _{i=1}^{n}x_{i1}x_{ip}\\\vdots &\vdots &\ddots &\vdots \\\sum _{i=1}^{n}x_{ip}&\sum _{i=1}^{n}x_{ip}x_{i1}&\cdots &\sum _{i=1}^{n}x_{ip}^{2}\end{bmatrix}}=2X^{\operatorname {T} }X}

Suponiendo que las columnas deincógnita{\displaystyle X}son linealmente independientes de modo queincógnitaTincógnita{\displaystyle X^{\operatorname {T} }X}es invertible, dejemosincógnita=[v1v2vpag+1]{\displaystyle X={\begin{bmatrix}\mathbf {v_{1}} &\mathbf {v_{2}} &\cdots &\mathbf {v} _{p+1}\end{bmatrix}}}, entonces k1v1++kpag+1vpag+1=0k1==kpag+1=0{\displaystyle k_{1}\mathbf {v_{1}} +\dots +k_{p+1}\mathbf {v} _{p+1}=\mathbf {0} \iff k_{1}=\dots =k_{p+1}=0}

Ahora dejemosk=(k1,,kpag+1)TR(pag+1)×1{\displaystyle \mathbf {k} =(k_{1},\dots ,k_{p+1})^{T}\in \mathbb {R} ^{(p+1)\times 1}}ser un vector propio deH{\displaystyle {\mathcal {H}}}.

k0(k1v1++kpag+1vpag+1)2>0{\displaystyle \mathbf {k} \neq \mathbf {0} \implies \left(k_{1}\mathbf {v_{1}} +\dots +k_{p+1}\mathbf {v} _{p+1}\right)^{2}>0}

En términos de multiplicación de vectores, esto significa [k1kpag+1][v1vpag+1][v1vpag+1][k1kpag+1]=kTHk=λkTk>0{\displaystyle {\begin{bmatrix}k_{1}&\cdots &k_{p+1}\end{bmatrix}}{\begin{bmatrix}\mathbf {v_{1}} \\\vdots \\\mathbf {v} _{p+1}\end{bmatrix}}{\begin{bmatrix}\mathbf {v_{1}} &\cdots &\mathbf {v} _{p+1}\end{bmatrix}}{\begin{bmatrix}k_{1}\\\vdots \\k_{p+1}\end{bmatrix}}=\mathbf {k} ^{\operatorname {T} }{\mathcal {H}}\mathbf {k} =\lambda \mathbf {k} ^{\operatorname {T} }\mathbf {k} >0} dóndeλ{\displaystyle \lambda }es el valor propio correspondiente ak{\displaystyle \mathbf {k} }. Además, kTk=i=1pag+1ki2>0λ>0{\displaystyle \mathbf {k} ^{\operatorname {T} }\mathbf {k} =\sum _{i=1}^{p+1}k_{i}^{2}>0\implies \lambda >0}

Finalmente, como vector propiok{\displaystyle \mathbf {k} }era arbitrario, significa que todos los valores propios deH{\displaystyle {\mathcal {H}}}son positivos, por lo tantoH{\displaystyle {\mathcal {H}}}es definida positiva. Por lo tanto, β=(incógnitaTincógnita)1incógnitaTY{\displaystyle {\boldsymbol {\beta }}=\left(X^{\operatorname {T} }X\right)^{-1}X^{\operatorname {T} }Y} es, en efecto, un mínimo global.

O bien, simplemente vea que para todos los vectoresv,vTincógnitaTincógnitav=incógnitav20{\displaystyle \mathbf {v} ,\mathbf {v} ^{\operatorname {T} }X^{\operatorname {T} }X\mathbf {v} =\|\mathbf {X} \mathbf {v} \|^{2}\geq 0}. Por lo tanto, la matriz hessiana es definida positiva si tiene rango completo.

Prueba

Dejarβ~=doy{\displaystyle {\tilde {\beta }}=Cy}ser otro estimador lineal deβ{\displaystyle \beta }condo=(incógnitaTincógnita)1incógnitaT+D{\displaystyle C=(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D}dóndeD{\displaystyle D}es unK×norte{\displaystyle K\times n}matriz no nula. Como nos restringimos a estimadores insesgados , el error cuadrático medio mínimo implica la varianza mínima. Por lo tanto, el objetivo es demostrar que dicho estimador tiene una varianza no menor que la deβ^,{\displaystyle {\widehat {\beta }},}El estimador MCO. Calculamos:

mi[β~]=mi[doy]=mi[((incógnitaTincógnita)1incógnitaT+D)(incógnitaβ+ε)]=((incógnitaTincógnita)1incógnitaT+D)incógnitaβ+((incógnitaTincógnita)1incógnitaT+D)mi[ε]=((incógnitaTincógnita)1incógnitaT+D)incógnitaβmi[ε]=0=(incógnitaTincógnita)1incógnitaTincógnitaβ+Dincógnitaβ=(IK+Dincógnita)β.{\displaystyle {\begin{aligned}\operatorname {E} \left[{\tilde {\beta }}\right]&=\operatorname {E} [Cy]\\&=\operatorname {E} \left[\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D\right)(X\beta +\varepsilon )\right]\\&=\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D\right)X\beta +\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D\right)\operatorname {E} [\varepsilon ]\\&=\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D\right)X\beta &&\operatorname {E} [\varepsilon ]=0\\&=(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }X\beta +DX\beta \\&=(I_{K}+DX)\beta .\\\end{aligned}}}

Por lo tanto, dado queβ{\displaystyle \beta }es inobservable ,β~{\displaystyle {\tilde {\beta }}}es imparcial si y solo siDincógnita=0{\displaystyle DX=0}. Entonces:

Var(β~)=Var(doy)=do Var(y)doT=σ2dodoT=σ2((incógnitaTincógnita)1incógnitaT+D)(incógnita(incógnitaTincógnita)1+DT)=σ2((incógnitaTincógnita)1incógnitaTincógnita(incógnitaTincógnita)1+(incógnitaTincógnita)1incógnitaTDT+Dincógnita(incógnitaTincógnita)1+DDT)=σ2(incógnitaTincógnita)1+σ2(incógnitaTincógnita)1(Dincógnita)T+σ2Dincógnita(incógnitaTincógnita)1+σ2DDT=σ2(incógnitaTincógnita)1+σ2DDTDincógnita=0=Var(β^)+σ2DDTσ2(incógnitaTincógnita)1=Var(β^){\displaystyle {\begin{aligned}\operatorname {Var} \left({\tilde {\beta }}\right)&=\operatorname {Var} (Cy)\\&=C{\text{ Var}}(y)C^{\operatorname {T} }\\&=\sigma ^{2}CC^{\operatorname {T} }\\&=\sigma ^{2}\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D\right)\left(X(X^{\operatorname {T} }X)^{-1}+D^{\operatorname {T} }\right)\\&=\sigma ^{2}\left((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }X(X^{\operatorname {T} }X)^{-1}+(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }D^{\operatorname {T} }+DX(X^{\operatorname {T} }X)^{-1}+DD^{\operatorname {T} }\right)\\&=\sigma ^{2}(X^{\operatorname {T} }X)^{-1}+\sigma ^{2}(X^{\operatorname {T} }X)^{-1}(DX)^{\operatorname {T} }+\sigma ^{2}DX(X^{\operatorname {T} }X)^{-1}+\sigma ^{2}DD^{\operatorname {T} }\\&=\sigma ^{2}(X^{\operatorname {T} }X)^{-1}+\sigma ^{2}DD^{\operatorname {T} }&&DX=0\\&=\operatorname {Var} \left({\widehat {\beta }}\right)+\sigma ^{2}DD^{\operatorname {T} }&&\sigma ^{2}(X^{\operatorname {T} }X)^{-1}=\operatorname {Var} \left({\widehat {\beta }}\right)\end{aligned}}}

DesdeDDT{\displaystyle DD^{\operatorname {T} }}es una matriz semidefinida positiva,Var(β~){\displaystyle \operatorname {Var} \left({\tilde {\beta }}\right)}superaVar(β^){\displaystyle \operatorname {Var} \left({\widehat {\beta }}\right)}mediante una matriz semidefinida positiva.

Observaciones sobre la demostración

Como se ha indicado anteriormente, la condición deVar(β~)Var(β^){\displaystyle \operatorname {Var} \left({\tilde {\beta }}\right)-\operatorname {Var} \left({\widehat {\beta }}\right)}es una matriz semidefinida positiva es equivalente a la propiedad de que el mejor estimador lineal insesgado deTβ{\displaystyle \ell ^{\operatorname {T} }\beta }esTβ^{\displaystyle \ell ^{\operatorname {T} }{\widehat {\beta }}}(mejor en el sentido de que tiene una varianza mínima). Para ver esto, veamos:Tβ~{\displaystyle \ell ^{\operatorname {T} }{\tilde {\beta }}}otro estimador lineal insesgado deTβ{\displaystyle \ell ^{\operatorname {T} }\beta }.

Var(Tβ~)=TVar(β~)=σ2T(incógnitaTincógnita)1+TDDT=Var(Tβ^)+(DT)T(DT)Var(Tβ^){\displaystyle {\begin{aligned}\operatorname {Var} \left(\ell ^{\operatorname {T} }{\tilde {\beta }}\right)&=\ell ^{\operatorname {T} }\operatorname {Var} \left({\tilde {\beta }}\right)\ell \\&=\sigma ^{2}\ell ^{\operatorname {T} }(X^{\operatorname {T} }X)^{-1}\ell +\ell ^{\operatorname {T} }DD^{\operatorname {T} }\ell \\&=\operatorname {Var} \left(\ell ^{\operatorname {T} }{\widehat {\beta }}\right)+(D^{\operatorname {T} }\ell )^{\operatorname {T} }(D^{\operatorname {T} }\ell )\\&\geq \operatorname {Var} \left(\ell ^{\operatorname {T} }{\widehat {\beta }}\right)\end{aligned}}}

Además, la igualdad se cumple si y solo siDT=0{\displaystyle D^{\operatorname {T} }\ell =0}Calculamos.

Tβ~=T(((incógnitaTincógnita)1incógnitaT+D)Y) desde arriba=T(incógnitaTincógnita)1incógnitaTY+TDY=Tβ^+(DT)TY=Tβ^DT=0{\displaystyle {\begin{aligned}\ell ^{\operatorname {T} }{\tilde {\beta }}&=\ell ^{\operatorname {T} }\left(((X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }+D)Y\right)&&{\text{ from above}}\\&=\ell ^{\operatorname {T} }(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }Y+\ell ^{\operatorname {T} }DY\\&=\ell ^{\operatorname {T} }{\widehat {\beta }}+(D^{\operatorname {T} }\ell )^{\operatorname {T} }Y\\&=\ell ^{\operatorname {T} }{\widehat {\beta }}&&D^{\operatorname {T} }\ell =0\end{aligned}}}

Esto demuestra que la igualdad se cumple si y solo siTβ~=Tβ^{\displaystyle \ell ^{\operatorname {T} }{\tilde {\beta }}=\ell ^{\operatorname {T} }{\widehat {\beta }}}lo que confiere al estimador OLS su singularidad como un BLUE.

Estimador de mínimos cuadrados generalizados

El método de mínimos cuadrados generalizados (GLS), desarrollado por Aitken , [ 5 ] extiende el teorema de Gauss-Markov al caso en que el vector de error tiene una matriz de covarianza no escalar. [ 6 ] El estimador de Aitken también es un BLUE.

Teorema de Gauss-Markov tal como se enuncia en econometría.

En la mayoría de los tratamientos de MCO, los regresores (parámetros de interés) en la matriz de diseñoincógnita{\displaystyle \mathbf {X} }Se supone que son fijos en muestras repetidas. Esta suposición se considera inapropiada para una ciencia predominantemente no experimental como la econometría . [ 7 ] En cambio, las suposiciones del teorema de Gauss-Markov se establecen condicionalmente aincógnita{\displaystyle \mathbf {X} }.

Linealidad

Se supone que la variable dependiente es una función lineal de las variables especificadas en el modelo. La especificación debe ser lineal en sus parámetros. Esto no significa que deba existir una relación lineal entre las variables independientes y dependientes. Las variables independientes pueden adoptar formas no lineales siempre que los parámetros sean lineales. La ecuacióny=β0+β1incógnita2,{\displaystyle y=\beta _{0}+\beta _{1}x^{2},}califica como lineal mientrasy=β0+β12incógnita{\displaystyle y=\beta _{0}+\beta _{1}^{2}x}puede transformarse en lineal reemplazandoβ12{\displaystyle \beta _{1}^{2}}por otro parámetro, por ejemploγ{\displaystyle \gamma }Una ecuación con un parámetro que depende de una variable independiente no se considera lineal, por ejemploy=β0+β1(incógnita)incógnita{\displaystyle y=\beta _{0}+\beta _{1}(x)\cdot x}, dóndeβ1(incógnita){\displaystyle \beta _{1}(x)}es una función deincógnita{\displaystyle x}.

Las transformaciones de datos se utilizan a menudo para convertir una ecuación en una forma lineal. Por ejemplo, la función Cobb-Douglas —frecuentemente utilizada en economía— es no lineal:

Y=ALαK1αmiε{\displaystyle Y=AL^{\alpha }K^{1-\alpha }e^{\varepsilon }}

Pero se puede expresar en forma lineal tomando el logaritmo natural de ambos lados: [ 8 ]

lnY=lnA+αlnL+(1α)lnK+ε=β0+β1lnL+β2lnK+ε{\displaystyle \ln Y=\ln A+\alpha \ln L+(1-\alpha )\ln K+\varepsilon =\beta _{0}+\beta _{1}\ln L+\beta _{2}\ln K+\varepsilon }

Esta suposición también abarca cuestiones de especificación: suponer que se ha seleccionado la forma funcional adecuada y que no hay variables omitidas .

Sin embargo, conviene tener en cuenta que los parámetros que minimizan los residuos de la ecuación transformada no necesariamente minimizan los residuos de la ecuación original.

Exogeneidad estricta

A pesar denorte{\displaystyle n}observaciones, la esperanza —condicionada a los regresores— del término de error es cero: [ 9 ]

mi[εiincógnita]=mi[εiincógnita1,,incógnitanorte]=0.{\displaystyle \operatorname {E} [\,\varepsilon _{i}\mid \mathbf {X} ]=\operatorname {E} [\,\varepsilon _{i}\mid \mathbf {x} _{1},\dots ,\mathbf {x} _{n}]=0.}

dóndeincógnitai=[incógnitai1incógnitai2incógnitaik]T{\displaystyle \mathbf {x} _{i}={\begin{bmatrix}x_{i1}&x_{i2}&\cdots &x_{ik}\end{bmatrix}}^{\operatorname {T} }}es el vector de datos de regresores para la i- ésima observación y, en consecuencia,incógnita=[incógnita1Tincógnita2TincógnitanorteT]T{\displaystyle \mathbf {X} ={\begin{bmatrix}\mathbf {x} _{1}^{\operatorname {T} }&\mathbf {x} _{2}^{\operatorname {T} }&\cdots &\mathbf {x} _{n}^{\operatorname {T} }\end{bmatrix}}^{\operatorname {T} }}es la matriz de datos o matriz de diseño.

Geométricamente, esta suposición implica queincógnitai{\displaystyle \mathbf {x} _{i}}yεi{\displaystyle \varepsilon _{i}}son ortogonales entre sí, de modo que su producto interno (es decir, su momento cruzado) es cero.

mi[incógnitajεi]=[mi[incógnitaj1εi]mi[incógnitaj2εi]mi[incógnitajkεi]]=0a pesar de i,jnorte{\displaystyle \operatorname {E} [\,\mathbf {x} _{j}\cdot \varepsilon _{i}\,]={\begin{bmatrix}\operatorname {E} [\,{x}_{j1}\cdot \varepsilon _{i}\,]\\\operatorname {E} [\,{x}_{j2}\cdot \varepsilon _{i}\,]\\\vdots \\\operatorname {E} [\,{x}_{jk}\cdot \varepsilon _{i}\,]\end{bmatrix}}=\mathbf {0} \quad {\text{for all }}i,j\in n}

Este supuesto se incumple si las variables explicativas se miden con error o son endógenas . [ 10 ] La endogeneidad puede ser resultado de la simultaneidad , donde la causalidad fluye de un lado a otro entre la variable dependiente y la independiente. Las técnicas de variables instrumentales se utilizan comúnmente para abordar este problema.

Rango completo

La matriz de datos de muestraincógnita{\displaystyle \mathbf {X} }debe tener rango de columna completo .

rango(incógnita)=k{\displaystyle \operatorname {rank} (\mathbf {X} )=k}

De lo contrarioincógnitaTincógnita{\displaystyle \mathbf {X} ^{\operatorname {T} }\mathbf {X} }no es invertible y el estimador MCO no se puede calcular.

Una violación de este supuesto es la multicolinealidad perfecta , es decir, algunas variables explicativas son linealmente dependientes. Un escenario en el que esto ocurrirá se denomina "trampa de variable ficticia", cuando no se omite una variable ficticia base, lo que resulta en una correlación perfecta entre las variables ficticias y el término constante. [ 11 ]

Puede existir multicolinealidad (siempre que no sea "perfecta"), lo que resulta en una estimación menos eficiente, pero aún insesgada. Las estimaciones serán menos precisas y altamente sensibles a conjuntos de datos particulares. [ 12 ] La multicolinealidad puede detectarse a partir del número de condición o el factor de inflación de la varianza , entre otras pruebas.

Errores esféricos

El producto exterior del vector de error debe ser esférico.

mi[εεTincógnita]=Var[εincógnita]=[σ2000σ2000σ2]=σ2Icon σ2>0{\displaystyle \operatorname {E} [\,{\boldsymbol {\varepsilon }}{\boldsymbol {\varepsilon }}^{\operatorname {T} }\mid \mathbf {X} ]=\operatorname {Var} [\,{\boldsymbol {\varepsilon }}\mid \mathbf {X} ]={\begin{bmatrix}\sigma ^{2}&0&\cdots &0\\0&\sigma ^{2}&\cdots &0\\\vdots &\vdots &\ddots &\vdots \\0&0&\cdots &\sigma ^{2}\end{bmatrix}}=\sigma ^{2}\mathbf {I} \quad {\text{with }}\sigma ^{2}>0}

Esto implica que el término de error tiene varianza uniforme ( homocedasticidad ) y no presenta autocorrelación . [ 13 ] Si se incumple este supuesto, MCO sigue siendo insesgado, pero ineficiente . El término "errores esféricos" describirá la distribución normal multivariada : siVar[εincógnita]=σ2I{\displaystyle \operatorname {Var} [\,{\boldsymbol {\varepsilon }}\mid \mathbf {X} ]=\sigma ^{2}\mathbf {I} }en la densidad normal multivariada, entonces la ecuaciónF(ε)=do{\displaystyle f(\varepsilon )=c}es la fórmula para una bola centrada en μ con radio σ en un espacio n-dimensional. [ 14 ]

La heterocedasticidad se produce cuando la magnitud del error está correlacionada con una variable independiente. Por ejemplo, en una regresión sobre el gasto en alimentos y los ingresos, el error está correlacionado con los ingresos. Las personas de bajos ingresos generalmente gastan una cantidad similar en alimentos, mientras que las de altos ingresos pueden gastar una cantidad muy elevada o tan poca como las de bajos ingresos. La heterocedasticidad también puede deberse a cambios en las prácticas de medición. Por ejemplo, a medida que las oficinas estadísticas mejoran sus datos, el error de medición disminuye, por lo que el término de error se reduce con el tiempo.

Esta suposición se incumple cuando existe autocorrelación . La autocorrelación se puede visualizar en un gráfico de datos cuando una observación dada tiene más probabilidades de situarse por encima de una línea ajustada si las observaciones adyacentes también se sitúan por encima de la línea de regresión ajustada. La autocorrelación es común en datos de series temporales donde una serie de datos puede experimentar "inercia". Esto ocurre si una variable dependiente tarda un tiempo en absorber completamente una perturbación. También puede producirse autocorrelación espacial, ya que es probable que las áreas geográficas presenten errores similares. La autocorrelación puede ser el resultado de una especificación incorrecta, como la elección de una forma funcional errónea. En estos casos, corregir la especificación es una posible manera de abordar la autocorrelación.

Cuando se puede violar el supuesto de errores esféricos, se puede demostrar que el estimador de mínimos cuadrados generalizados es BLUE. [ 6 ]

Véase también

Otras estadísticas imparciales

Referencias

  1. Véase el capítulo 7 de Johnson, RA; Wichern, DW (2002). Análisis estadístico multivariante aplicado . Vol.  5. Prentice Hall.
  2. Theil, Henri (1971). «Mejor estimación y predicción lineal insesgada». Principios de econometría . Nueva York: John Wiley & Sons. págs. 119-124 . ISBN  0-471-85845-5.
  3. Plackett, RL (1949). "Una nota histórica sobre el método de mínimos cuadrados". Biometrika . 36 (3/4): 458– 460. doi : 10.2307/2332682 .
  4. David, FN; Neyman, J. (1938). "Extensión del teorema de Markoff sobre mínimos cuadrados". Statistical Research Memoirs . 2 : 105–116 . OCLC 4025782 . 
  5. 1 2 Aitken, AC (1935). "Sobre mínimos cuadrados y combinaciones lineales de observaciones". Actas de la Real Sociedad de Edimburgo . 55 : 42–48 . doi : 10.1017/S0370164600014346 .
  6. 1 2 Huang, David S. (1970). Regresión y métodos econométricos . Nueva York: John Wiley & Sons. págs. 127-147 . ISBN  0-471-41754-8.
  7. Hayashi, Fumio (2000). Econometría . Princeton University Press. pág. 13. ISBN  0-691-01018-8.
  8. Walters, AA (1970). Introducción a la econometría . Nueva York: WW Norton. pág. 275. ISBN  0-393-09931-8.
  9. Hayashi, Fumio (2000). Econometría . Princeton University Press. pág. 7. ISBN  0-691-01018-8.
  10. Johnston, John (1972). Métodos econométricos (Segunda edición). Nueva York: McGraw-Hill. págs. 267–291 . ISBN   0-07-032679-7.
  11. Wooldridge, Jeffrey (2012). Introducción a la econometría (Quinta edición internacional). South-Western. pág . 220. ISBN   978-1-111-53439-4.
  12. Johnston, John (1972). Métodos econométricos (Segunda edición). Nueva York: McGraw-Hill. págs. 159–168 . ISBN   0-07-032679-7.
  13. Hayashi, Fumio (2000). Econometría . Princeton University Press. pág. 10. ISBN  0-691-01018-8.
  14. Ramanathan, Ramu (1993). "Perturbaciones no esféricas". Métodos estadísticos en econometría . Academic Press. págs. 330-351 . ISBN  0-12-576830-3.

Lecturas adicionales

  • Davidson, James (2000). «Análisis estadístico del modelo de regresión». Teoría econométrica . Oxford: Blackwell. pp. 17–36 . ISBN  0-631-17837-6.
  • Goldberger, Arthur (1991). «Regresión clásica». Un curso de econometría . Cambridge: Harvard University Press. pp. 160-169 . ISBN  0-674-17544-1.
  • Theil, Henri (1971). «Mínimos cuadrados y el modelo lineal estándar». Principios de econometría . Nueva York: John Wiley & Sons. págs. 101-162 . ISBN  0-471-85845-5.
  • Primeros usos conocidos de algunas palabras de matemáticas: G (breve historia y explicación del nombre)
  • Demostración del teorema de Gauss-Markov para regresión lineal múltiple (utiliza álgebra matricial).
  • Una demostración del teorema de Gauss-Markov utilizando geometría.