Articulo de referencia

mínimos cuadrados ordinarios

La ley de Okun en macroeconomía establece que, en una economía, el crecimiento del PIB debe depender linealmente de las variaciones en la tasa de desempleo. En este trabajo, se ...

La ley de Okun en macroeconomía establece que, en una economía, el crecimiento del PIB debe depender linealmente de las variaciones en la tasa de desempleo. En este trabajo, se utiliza el método de mínimos cuadrados ordinarios para construir la línea de regresión que describe esta ley.

En estadística , el método de mínimos cuadrados ordinarios ( MCO ) es un tipo de método de mínimos cuadrados lineales para elegir los parámetros desconocidos en un modelo de regresión lineal mediante el principio de mínimos cuadrados : minimizar la suma de los cuadrados de las diferencias entre la variable dependiente observada (valores de la variable que se observa) en el conjunto de datos de entrada y la salida de la función (lineal) de la variable independiente . Algunas fuentes consideran que el MCO es una regresión lineal. [ 1 ]

Geométricamente, esto se considera como la suma de las distancias al cuadrado, paralelas al eje de la variable dependiente, entre cada punto de datos del conjunto y el punto correspondiente en la superficie de regresión; cuanto menores sean las diferencias, mejor se ajusta el modelo a los datos. El estimador resultante puede expresarse mediante una fórmula sencilla, especialmente en el caso de una regresión lineal simple , en la que hay un único regresor en el lado derecho de la ecuación de regresión.

El estimador MCO es consistente para los efectos fijos de nivel uno cuando los regresores son exógenos y forma colinealidad perfecta (condición de rango), consistente para la estimación de la varianza de los residuos cuando los regresores tienen momentos cuartos finitos [ 2 ] y —por el teorema de Gauss-Markov— óptimo en la clase de estimadores lineales insesgados cuando los errores son homocedásticos y no están correlacionados serialmente . Bajo estas condiciones, el método MCO proporciona una estimación insesgada de media de varianza mínima cuando los errores tienen varianzas finitas . Bajo el supuesto adicional de que los errores se distribuyen normalmente con media cero, MCO es el estimador de máxima verosimilitud que supera a cualquier estimador insesgado no lineal.

Modelo lineal

Supongamos que los datos consisten en:norte{\displaystyle n}observaciones{incógnitai,yi}i=1norte{\displaystyle \left\{\mathbf {x} _{i},y_{i}\right\}_{i=1}^{n}}Cada observacióni{\displaystyle i}incluye una respuesta escalaryi{\displaystyle y_{i}}y un vector columnaincógnitai{\displaystyle \mathbf {x} _ {i}}depag{\displaystyle p}parámetros (regresores), es decir,incógnitai=[incógnitai1,incógnitai2,,incógnitaipag]T{\displaystyle \mathbf {x} _{i}=\left[x_{i1},x_{i2},\dots ,x_{ip}\right]^{\operatorname {T} }}. En un modelo de regresión lineal , la variable de respuesta,yi{\displaystyle y_{i}}, es una función lineal de los regresores:

yi=β1 incógnitai1+β2 incógnitai2++βpag incógnitaipag+εi,{\displaystyle y_{i}=\beta _{1}\ x_{i1}+\beta _{2}\ x_{i2}+\cdots +\beta _{p}\ x_{ip}+\varepsilon _{i},}

o en forma vectorial ,

yi=incógnitaiTβ+εi,{\displaystyle y_{i}=\mathbf {x} _{i}^{\operatorname {T} }{\boldsymbol {\beta }}+\varepsilon _{i},\,}

dóndeincógnitai{\displaystyle \mathbf {x} _ {i}}, como se introdujo anteriormente, es un vector columna de lai{\displaystyle i}-ésima observación de todas las variables explicativas;β{\displaystyle {\boldsymbol {\beta }}}es unpag×1{\displaystyle p\times 1}vector de parámetros desconocidos; y el escalarεi{\displaystyle \varepsilon _ {i}}representa variables aleatorias no observadas ( errores ) de lai{\displaystyle i}-ésima observación.εi{\displaystyle \varepsilon _ {i}}explica las influencias sobre las respuestasyi{\displaystyle y_{i}}de fuentes distintas a las variables explicativasincógnitai{\displaystyle \mathbf {x} _ {i}}Este modelo también se puede escribir en notación matricial como

y=incógnitaβ+ε,{\displaystyle \mathbf {y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }},\,}

dóndey{\displaystyle \mathbf {y} }yε{\displaystyle {\boldsymbol {\varepsilon }}}sonnorte×1{\displaystyle n\times 1}vectores de las variables de respuesta y los errores de lanorte{\displaystyle n}observaciones yincógnita{\displaystyle \mathbf {X} }es unnorte×pag{\displaystyle n\times p}matriz de regresores, también llamada a veces matriz de diseño , cuya filai{\displaystyle i}esincógnitaiT{\displaystyle \mathbf {x} _{i}^{\operatorname {T} }}y contiene eli{\displaystyle i}-ésima observación en todas las variables explicativas.

Normalmente, se incluye un término constante en el conjunto de regresores.incógnita{\displaystyle \mathbf {X} }, digamos, tomandoincógnitai1=1{\displaystyle x_{i1}=1}a pesar dei=1,,norte{\displaystyle i=1,\dots ,n}. El coeficienteβ1{\displaystyle \beta _{1}}La coordenada correspondiente a este regresor se denomina intersección . Sin la intersección, la línea ajustada se ve obligada a cruzar el origen cuandoincógnitai=0{\displaystyle x_{i}={\vec {0}}}.

Para que la estimación sea consistente, las variables explicativas no tienen por qué ser independientes; por ejemplo, pueden presentar una dependencia no lineal. Si bien no existe multicolinealidad perfecta, las estimaciones de los parámetros pueden ser consistentes; sin embargo, a medida que aumenta la multicolinealidad, el error estándar de dichas estimaciones también aumenta, reduciendo su precisión. Cuando existe multicolinealidad perfecta, ya no es posible obtener estimaciones únicas para los coeficientes de las variables explicativas relacionadas; la estimación de estos parámetros no converge (y, por lo tanto, no puede ser consistente).

Como ejemplo concreto donde los regresores son dependientes de forma no lineal pero la estimación aún puede ser consistente, podríamos sospechar que la respuesta depende linealmente tanto de un valor como de su cuadrado; en cuyo caso incluiríamos un regresor cuyo valor es simplemente el cuadrado de otro regresor. En ese caso, el modelo sería cuadrático en el segundo regresor, pero no obstante todavía se considera un modelo lineal porque el modelo sigue siendo lineal en los parámetros (β{\displaystyle {\boldsymbol {\beta }}}).

Formulación matricial/vectorial

Considere un sistema sobredeterminado

j=1pagincógnitaijβj=yi, (i=1,2,,norte),{\displaystyle \sum _{j=1}^{p}x_{ij}\beta _{j}=y_{i},\ (i=1,2,\dots ,n),}

denorte{\displaystyle n}ecuaciones lineales enpag{\displaystyle p}coeficientes desconocidos ,β1,β2,,βpag{\displaystyle \beta _{1},\beta _{2},\dots ,\beta _{p}}, connorte>pag{\displaystyle n>p}Esto se puede escribir en forma matricial como

incógnitaβ=y,{\displaystyle \mathbf {X} {\boldsymbol {\beta }}=\mathbf {y},}

dónde

incógnita=[incógnita11incógnita12incógnita1pagincógnita21incógnita22incógnita2pagincógnitanorte1incógnitanorte2incógnitanortepag],β=[β1β2βpag],y=[y1y2ynorte].{\displaystyle \mathbf {X} ={\begin{bmatrix}X_{11}&X_{12}&\cdots &X_{1p}\\X_{21}&X_{22}&\cdots &X_{2p}\\\vdots &\vdots &\ddots &\vdots \\X_{n1}&X_{n2}&\cdots &X_{np}\end{bmatrix}},\qquad {\boldsymbol {\beta }}={\begin{bmatrix}\beta _{1}\\\beta _{2}\\\vdots \\\beta _{p}\end{bmatrix}},\qquad \mathbf {y} ={\begin{bmatrix}y_{1}\\y_{2}\\\vdots \\y_{n}\end{bmatrix}}.}

(Nota: para un modelo lineal como el anterior, no todos los elementos enincógnita{\displaystyle \mathbf {X} }contiene información sobre los puntos de datos. La primera columna está rellena con unos,incógnitai1=1{\displaystyle X_{i1}=1}. Solo las demás columnas contienen datos reales. Así que aquípag{\displaystyle p}es igual al número de regresores más uno).

Este tipo de sistema normalmente no tiene una solución exacta, por lo que el objetivo es encontrar los coeficientes.β{\displaystyle {\boldsymbol {\beta }}}que se ajustan "mejor" a las ecuaciones, en el sentido de resolver el problema de minimización cuadrática.

β^=argramometroinorteβS(β),{\displaystyle {\hat {\boldsymbol {\beta }}}={\underset {\boldsymbol {\beta }}{\operatorname {arg\,min} }}\,S({\boldsymbol {\beta }}),}donde la función objetivoS{\displaystyle S}está dado por:
S(β)=i=1norte|yij=1pagincógnitaijβj|2=yincógnitaβ2.{\displaystyle S({\boldsymbol {\beta }})=\sum _{i=1}^{n}\left|y_{i}-\sum _{j=1}^{p}X_{ij}\beta _{j}\right|^{2}=\left\|\mathbf {y} -\mathbf {X} {\boldsymbol {\beta }}\right\|^{2}.}

Una justificación para elegir este criterio se da en Propiedades a continuación. Este problema de minimización tiene una solución única, siempre que se cumpla la condición.pag{\displaystyle p}columnas de la matrizincógnita{\displaystyle \mathbf {X} }son linealmente independientes , dadas al resolver las llamadas ecuaciones normales :

(incógnitaTincógnita)β^=incógnitaTy .{\displaystyle \left(\mathbf {X} ^{\operatorname {T} }\mathbf {X} \right){\hat {\boldsymbol {\beta }}}=\mathbf {X} ^{\operatorname {T} }\mathbf {y} \ .}

La matrizincógnitaTincógnita{\displaystyle \mathbf {X} ^{\operatorname {T} }\mathbf {X} }se conoce como matriz normal o matriz de Gram y la matrizincógnitaTy{\displaystyle \mathbf {X} ^{\operatorname {T} }\mathbf {y} }se conoce como la matriz de momentos del regresonde por regresores. [ 3 ] Finalmente,β^{\displaystyle {\hat {\boldsymbol {\beta }}}}es el vector de coeficientes del hiperplano de mínimos cuadrados , expresado como

β^=(incógnitaincógnita)1incógnitay.{\displaystyle {\hat {\boldsymbol {\beta }}}=\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} .}

o

β^=β+(incógnitaincógnita)1incógnitaε.{\displaystyle {\hat {\boldsymbol {\beta }}}={\boldsymbol {\beta }}+\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }{\boldsymbol {\varepsilon }}.}

Estimación

Supongamos que b es un valor "candidato" para el vector de parámetros β . La cantidad y ix i T b , llamada residuo para la i -ésima observación, mide la distancia vertical entre el punto de datos ( x i , y i ) y el hiperplano y = x T b , y por lo tanto evalúa el grado de ajuste entre los datos reales y el modelo. La suma de los cuadrados de los residuos ( SSR ) (también llamada suma de cuadrados del error ( ESS ) o suma de cuadrados de los residuos ( RSS )) [ 4 ] es una medida del ajuste general del modelo:

S(b)=i=1norte(yiincógnitaiTb)2=(yincógnitab)T(yincógnitab),{\displaystyle S(b)=\sum _{i=1}^{n}(y_{i}-x_{i}^{\operatorname {T} }b)^{2}=(y-Xb)^{\operatorname {T} }(y-Xb),}

donde T denota la transpuesta de la matriz , y las filas de X , que denotan los valores de todas las variables independientes asociadas con un valor particular de la variable dependiente, son X i = x i T . El valor de b que minimiza esta suma se llama estimador MCO para β . La función S ( b ) es cuadrática en b con hessiano definido positivo , y por lo tanto esta función posee un único mínimo global enb=β^{\displaystyle b={\hat {\beta }}}, que puede ser dada por la fórmula explícita [ 5 ] [prueba]

β^=argininabRpagS(b)=(incógnitaTincógnita)1incógnitaTy .{\displaystyle {\hat {\beta }}=\operatorname {argmin} _{b\in \mathbb {R} ^{p}}S(b)=(X^{\operatorname {T} }X)^{-1}X^{\operatorname {T} }y\ .}

El producto N = X T X es una matriz de Gram , y su inversa, Q = N −1 , es la matriz de cofactores de β , [ 6 ] [ 7 ] [ 8 ] estrechamente relacionada con su matriz de covarianza , C β . La matriz ( X T X ) −1 X T = Q X T se denomina matriz pseudoinversa de Moore-Penrose de X . Esta formulación destaca el punto de que la estimación puede llevarse a cabo si, y solo si, no hay multicolinealidad perfecta entre las variables explicativas (lo que haría que la matriz de Gram no tuviera inversa).   

Predicción

Después de haber estimado β , los valores ajustados (o valores predichos ) de la regresión serán:

y^=incógnitaβ^=PAGy,{\displaystyle {\hat {y}}=X{\hat {\beta }}=Py,}

donde P = X ( X T X ) −1 X T es la matriz de proyección sobre el espacio V generado por las columnas de X. Esta matriz P también se denomina a veces matriz de sombrero porque "pone un sombrero" sobre la variable y . Otra matriz, estrechamente relacionada con P, es la matriz anuladora M = I nP ; esta es una matriz de proyección sobre el espacio ortogonal a V. Ambas matrices, P y M, son simétricas e idempotentes (lo que significa que P 2 = P y M 2 = M ), y se relacionan con la matriz de datos X mediante las identidades PX = X y MX = 0. [ 9 ] La matriz M crea los residuos de la regresión:

ε^=yy^=yincógnitaβ^=METROy=METRO(incógnitaβ+ε)=(METROincógnita)β+METROε=METROε.{\displaystyle {\hat {\varepsilon }}=y-{\hat {y}}=y-X{\hat {\beta }}=My=M(X\beta +\varepsilon )=(MX)\beta +M\varepsilon =M\varepsilon .}

Las varianzas de los valores predichossy^i2{\displaystyle s_{{\hat {y}}_{i}}^{2}}se encuentran en la diagonal principal de la matriz de varianza-covarianza de los valores predichos:

doy^=s2PAG,{\displaystyle C_{\hat {y}}=s^{2}P,}

donde P es la matriz de proyección y s 2 es la varianza de la muestra. [ 10 ] La matriz completa es muy grande; sus elementos diagonales se pueden calcular individualmente como:

sy^i2=s2incógnitai(incógnitaTincógnita)1incógnitaiT,{\displaystyle s_{{\hat {y}}_{i}}^{2}=s^{2}X_{i}(X^{T}X)^{-1}X_{i}^{T},}

donde X i es la i -ésima fila de la matriz X .

Estadísticas de muestra

Utilizando estos residuos podemos estimar la varianza muestral utilizando el estadístico chi-cuadrado reducido :

s2=ε^Tε^nortepag=(METROy)TMETROynortepag=yTMETROTMETROynortepag=yTMETROynortepag=S(β^)nortepag,σ^2=nortepagnortes2{\displaystyle s^{2}={\frac {{\hat {\varepsilon }}^{\mathrm {T} }{\hat {\varepsilon }}}{n-p}}={\frac {(My)^{\mathrm {T} }My}{n-p}}={\frac {y^{\mathrm {T} }M^{\mathrm {T} }My}{n-p}}={\frac {y^{\mathrm {T} }My}{n-p}}={\frac {S({\hat {\beta }})}{n-p}},\qquad {\hat {\sigma }}^{2}={\frac {n-p}{n}}\;s^{2}}

El denominador, np , son los grados de libertad estadísticos . La primera cantidad, s 2 , es la estimación MCO para σ 2 , mientras que la segunda,σ^2{\displaystyle \scriptstyle {\hat {\sigma }}^{2}}, es la estimación de máxima verosimilitud (MLE) para σ 2 . Los dos estimadores son bastante similares en muestras grandes; el primer estimador siempre es insesgado , mientras que el segundo estimador es sesgado pero tiene un error cuadrático medio menor . En la práctica, s 2 se usa con más frecuencia, ya que es más conveniente para la prueba de hipótesis. La raíz cuadrada de s 2 se llama error estándar de regresión , [ 11 ] error estándar de la regresión , [ 12 ] [ 13 ] o error estándar de la ecuación . [ 9 ]

Es común evaluar la bondad de ajuste de la regresión MCO comparando cuánto se puede reducir la variación inicial en la muestra al regresar sobre X. El coeficiente de determinación se define como una razón de la varianza "explicada" a la varianza "total" de la variable dependiente y , en los casos en que la suma de cuadrados de la regresión es igual a la suma de cuadrados de los residuos: [ 14 ]

R2=(y^iy¯)2(yiy¯)2=yTPAGTLPAGyyTLy=1yTMETROyyTLy=1RSSTSS{\displaystyle R^{2}={\frac {\sum ({\hat {y}}_{i}-{\overline {y}})^{2}}{\sum (y_{i}-{\overline {y}})^{2}}}={\frac {y^{\mathrm {T} }P^{\mathrm {T} }LPy}{y^{\mathrm {T} }Ly}}=1-{\frac {y^{\mathrm {T} }My}{y^{\mathrm {T} }Ly}}=1-{\frac {\rm {RSS}}{\rm {TSS}}}}

donde TSS es la suma total de cuadrados para la variable dependiente,L=Inorte1norteJnorte{\textstyle L=I_{n}-{\frac {1}{n}}J_{n}}, yJnorte{\textstyle J_{n}}es una matriz de unos de n × n . (L{\displaystyle L}( es una matriz de centrado equivalente a una regresión sobre una constante; simplemente resta la media a una variable). Para que sea significativo, la matriz X de datos sobre regresores debe contener un vector columna de unos que represente la constante cuyo coeficiente es la intersección de la regresión. En ese caso, siempre será un número entre 0 y 1, y los valores cercanos a 1 indican un buen grado de ajuste.

Modelo de regresión lineal simple

Si la matriz de datos X contiene solo dos variables, una constante y un regresor escalar x i , entonces se denomina "modelo de regresión simple". Este caso se suele considerar en los cursos de estadística para principiantes, ya que proporciona fórmulas mucho más sencillas, incluso aptas para el cálculo manual. Los parámetros se suelen denotar como ( α , β ) :

yi=α+βincógnitai+εi.{\displaystyle y_{i}=\alpha +\beta x_{i}+\varepsilon _{i}.}

Las estimaciones de mínimos cuadrados en este caso se obtienen mediante fórmulas sencillas.

β^=i=1norte(incógnitaiincógnita¯)(yiy¯)i=1norte(incógnitaiincógnita¯)2α^=y¯β^incógnita¯ ,{\displaystyle {\begin{aligned}{\widehat {\beta }}&={\frac {\sum _{i=1}^{n}{(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}}{\sum _{i=1}^{n}{(x_{i}-{\bar {x}})^{2}}}}\\[2pt]{\widehat {\alpha }}&={\bar {y}}-{\widehat {\beta }}\,{\bar {x}}\ ,\end{aligned}}}

Derivaciones alternativas

En la sección anterior el estimador de mínimos cuadradosβ^{\displaystyle {\hat {\beta }}}Se obtuvo como un valor que minimiza la suma de los residuos al cuadrado del modelo. Sin embargo, también es posible derivar el mismo estimador a partir de otros enfoques. En todos los casos, la fórmula para el estimador MCO sigue siendo la misma: ^ β = ( X T X ) −1 X T y ; la única diferencia radica en cómo interpretamos este resultado.

Proyección

La estimación MCO puede verse como una proyección sobre el espacio lineal generado por los regresores. (Aquí cada uno deincógnita1{\displaystyle X_{1}}yincógnita2{\displaystyle X_{2}}(se refiere a una columna de la matriz de datos.)
Mínimos cuadrados como proyección de y sobre col(X) para tres observaciones; ŷ = Xβ da valores ajustados y y − ŷ es el residuo.

Para los matemáticos, MCO es una solución aproximada a un sistema sobredeterminado de ecuaciones lineales y , donde β es la incógnita. Suponiendo que el sistema no se puede resolver exactamente (el número de ecuaciones n es mucho mayor que el número de incógnitas p ), buscamos una solución que pueda proporcionar la menor discrepancia entre los lados derecho e izquierdo. En otras palabras, buscamos la solución que satisfaga

β^=argramominβyincógnitaβ2,{\displaystyle {\hat {\beta }}={\rm {arg}}\min _{\beta }\,\lVert \mathbf {y} -\mathbf {X} {\boldsymbol {\beta }}\rVert ^{2},}

donde · es la norma L 2  estándar en el espacio euclidiano n- dimensional R n . La cantidad predicha es simplemente una cierta combinación lineal de los vectores de regresores. Por lo tanto, el vector residual y tendrá la longitud más pequeña cuando y se proyecte ortogonalmente sobre el subespacio lineal generado por las columnas de X . El estimador MCOβ^{\displaystyle {\hat {\beta }}}en este caso se puede interpretar como los coeficientes de la descomposición vectorial de ^ y = Py a lo largo de la base de X .

En otras palabras, las ecuaciones de gradiente en el mínimo se pueden escribir como:

(yincógnitaβ^)incógnita=0.{\displaystyle (\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})^{\top }\mathbf {X} =0.}

Una interpretación geométrica de estas ecuaciones es que el vector de residuos,yincógnitaβ^{\displaystyle \mathbf {y} -X{\hat {\boldsymbol {\beta }}}}es ortogonal al espacio columna de X , ya que el producto escalar(yincógnitaβ^)incógnitav{\displaystyle (\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}})\cdot \mathbf {X} \mathbf {v} }es igual a cero para cualquier vector conforme, v . Esto significa queyincógnitaβ^{\displaystyle \mathbf {y} -\mathbf {X} {\boldsymbol {\hat {\beta }}}}es el más corto de todos los vectores posiblesyincógnitaβ{\displaystyle \mathbf {y} -\mathbf {X} {\boldsymbol {\beta }}}Es decir, la varianza de los residuos es la mínima posible. Esto se ilustra a la derecha.

Presentandoγ^{\displaystyle {\hat {\boldsymbol {\gamma }}}}y una matriz K con el supuesto de que una matriz[incógnita K]{\displaystyle [\mathbf {X} \ \mathbf {K} ]}es no singular y K T X = 0 (véase Proyecciones ortogonales ), el vector residual debe satisfacer la siguiente ecuación:

r^:=yincógnitaβ^=Kγ^.{\displaystyle {\hat {\mathbf {r} }}:=\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}}=\mathbf {K} {\hat {\boldsymbol {\gamma }}}.}

La ecuación y la solución de mínimos cuadrados lineales se describen, por lo tanto, de la siguiente manera:

y=[incógnitaK][β^γ^],[β^γ^]=[incógnitaK]1y=[(incógnitaincógnita)1incógnita(KK)1K]y.{\displaystyle {\begin{aligned}\mathbf {y} &={\begin{bmatrix}\mathbf {X} &\mathbf {K} \end{bmatrix}}{\begin{bmatrix}{\hat {\boldsymbol {\beta }}}\\{\hat {\boldsymbol {\gamma }}}\end{bmatrix}},\\{}\Rightarrow {\begin{bmatrix}{\hat {\boldsymbol {\beta }}}\\{\hat {\boldsymbol {\gamma }}}\end{bmatrix}}&={\begin{bmatrix}\mathbf {X} &\mathbf {K} \end{bmatrix}}^{-1}\mathbf {y} ={\begin{bmatrix}\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\\\left(\mathbf {K} ^{\top }\mathbf {K} \right)^{-1}\mathbf {K} ^{\top }\end{bmatrix}}\mathbf {y} .\end{aligned}}}

Otra forma de verlo es considerar la línea de regresión como un promedio ponderado de las líneas que pasan por la combinación de cualquier par de puntos en el conjunto de datos. [ 15 ] Si bien este método de cálculo es computacionalmente más costoso, proporciona una mejor intuición sobre MCO.

Máxima probabilidad

El estimador MCO es idéntico al estimador de máxima verosimilitud (EMV) bajo el supuesto de normalidad para los términos de error. [ 16 ] [prueba] Este supuesto de normalidad tiene importancia histórica, ya que proporcionó la base para el trabajo inicial en análisis de regresión lineal de Yule y Pearson . A partir de las propiedades del EMV, podemos inferir que el estimador MCO es asintóticamente eficiente (en el sentido de alcanzar la cota de Cramér-Rao para la varianza) si se cumple el supuesto de normalidad. [ 17 ]

Método generalizado de momentos

En caso i.i.d. , el estimador MCO también puede considerarse un estimador GMM derivado de las condiciones de momento.

mi[incógnitai(yiincógnitaiTβ)]=0.{\displaystyle \mathrm {E} {\big [}\,x_{i}\left(y_{i}-x_{i}^{\operatorname {T} }\beta \right)\,{\big ]}=0.}

Estas condiciones de momento establecen que los regresores deben ser incorrelacionados con los errores. Dado que x i es un vector p , el número de condiciones de momento es igual a la dimensión del vector de parámetros β , y por lo tanto el sistema está exactamente identificado. Este es el llamado caso GMM clásico, en el que el estimador no depende de la elección de la matriz de ponderación.

Cabe señalar que la suposición original de exogeneidad estricta E[ ε i | x i ] = 0 implica un conjunto de condiciones de momento mucho más amplio que el indicado anteriormente. En particular, esta suposición implica que para cualquier función vectorial ƒ , se cumplirá la condición de momento E[ ƒ ( x iε i ] = 0. Sin embargo, mediante el teorema de Gauss-Markov, se puede demostrar que la elección óptima de la función ƒ es ƒ ( x ) = x , lo que resulta en la ecuación de momento presentada anteriormente.

Supuestos

Existen diversos marcos conceptuales para formular el modelo de regresión lineal y así aplicar la técnica de mínimos cuadrados ordinarios (MCO). Cada uno de estos marcos produce las mismas fórmulas y resultados. La única diferencia radica en la interpretación y los supuestos necesarios para que el método arroje resultados significativos. La elección del marco conceptual adecuado depende principalmente de la naturaleza de los datos disponibles y de la tarea de inferencia que se deba realizar.

Una de las diferencias de interpretación radica en si se deben tratar las variables explicativas como variables aleatorias o como constantes predefinidas. En el primer caso ( diseño aleatorio ) , las variables explicativas xᵢ son aleatorias y se muestrean junto con las yᵢ de una población determinada , como en un estudio observacional . Este enfoque permite un estudio más natural de las propiedades asintóticas de los estimadores. En la otra interpretación ( diseño fijo ), las variables explicativas X se tratan como constantes conocidas establecidas por un diseño , y y se muestrea condicionalmente a los valores de X, como en un experimento . Para fines prácticos, esta distinción suele ser irrelevante, ya que la estimación y la inferencia se realizan condicionando a X. Todos los resultados presentados en este artículo se enmarcan dentro del contexto del diseño aleatorio.

El modelo clásico se centra en la estimación e inferencia con "muestra finita", lo que significa que el número de observaciones n es fijo. Esto contrasta con otros enfoques, que estudian el comportamiento asintótico de MCO y en los que se analiza el comportamiento con un gran número de muestras. Para demostrar la insesgadez del estimador de MCO con muestra finita, se requieren las siguientes suposiciones.

Ejemplo de regresión polinómica cúbica, que es un tipo de regresión lineal. Aunque la regresión polinómica ajusta un modelo de curva a los datos, como problema de estimación estadística es lineal, en el sentido de que la función de esperanza condicionalmi[y|incógnita]{\displaystyle \mathbb {E} [y|x]}es lineal en los parámetros desconocidos que se estiman a partir de los datos . Por esta razón, la regresión polinómica se considera un caso especial de regresión lineal múltiple .
  • Exogeneidad . Los regresores no covarían con el término de error:mi[εiincógnitai]=0.{\displaystyle \mathbb {E} [\varepsilon _{i}x_{i}]=0.}Esto requiere, por ejemplo, que no existan variables omitidas que covarien con las variables observadas y afecten a la variable de respuesta. Una afirmación alternativa (pero más contundente) que suele ser necesaria al explicar la regresión lineal en estadística matemática es que las variables predictoras x pueden tratarse como valores fijos, en lugar de variables aleatorias . Esta formulación más contundente implica, por ejemplo, que se supone que las variables predictoras están libres de errores, es decir, que no están contaminadas por errores de medición. Si bien esta suposición no es realista en muchos contextos, su omisión conduce a modelos más complejos con errores en las variables , modelos de variables instrumentales y similares.
  • Linealidad o especificación correcta . Esto significa que la media de la variable de respuesta es una combinación lineal de los parámetros (coeficientes de regresión) y las variables predictoras. Cabe destacar que esta suposición es mucho menos restrictiva de lo que podría parecer a primera vista. Dado que las variables predictoras se tratan como valores fijos (véase más arriba), la linealidad es en realidad solo una restricción sobre los parámetros. Las variables predictoras en sí mismas pueden transformarse arbitrariamente, e incluso se pueden añadir múltiples copias de la misma variable predictora subyacente, cada una transformada de forma diferente. Esta técnica se utiliza, por ejemplo, en la regresión polinómica , que emplea la regresión lineal para ajustar la variable de respuesta como una función polinómica arbitraria (hasta un grado determinado) de una variable predictora. Con tanta flexibilidad, los modelos como la regresión polinómica suelen tener "demasiada potencia", ya que tienden a sobreajustar los datos. Por consiguiente, normalmente se debe utilizar algún tipo de regularización para evitar que el proceso de estimación dé lugar a soluciones irrazonables. Ejemplos comunes son la regresión de cresta y la regresión Lasso . También se puede utilizar la regresión lineal bayesiana , que por su naturaleza es prácticamente inmune al problema del sobreajuste. (De hecho, tanto la regresión de cresta como la regresión Lasso pueden considerarse casos especiales de la regresión lineal bayesiana, con tipos particulares de distribuciones a priori aplicadas a los coeficientes de regresión).
  • Visualización de la heterocedasticidad en un diagrama de dispersión frente a 100 valores ajustados aleatorios usando Matlab.
    Varianza constante u homocedasticidad . Esto significa que la varianza de los errores no depende de los valores de las variables predictoras:mi[εi2|incógnitai]=σ2.{\displaystyle \mathbb {E} [\varepsilon _{i}^{2}|x_{i}]=\sigma ^{2}.}Por lo tanto, la variabilidad de las respuestas para valores fijos de las variables predictoras es la misma independientemente de cuán grandes o pequeñas sean las respuestas. Sin embargo, esto no suele ser así, ya que una variable con una media grande generalmente tendrá una varianza mayor que una con una media pequeña. Por ejemplo, una persona cuyos ingresos previstos son de $100,000 puede tener fácilmente ingresos reales de $80,000 o $120,000 (es decir, una desviación estándar de alrededor de $20,000), mientras que es improbable que otra persona con ingresos previstos de $10,000 tenga la misma desviación estándar de $20,000, ya que eso implicaría que sus ingresos reales podrían variar entre -$10,000 y $30,000. (De hecho, como esto muestra, en muchos casos —a menudo los mismos casos en los que falla el supuesto de errores con distribución normal— se debería predecir que la varianza o la desviación estándar son proporcionales a la media, en lugar de constantes). La ausencia de homocedasticidad se denomina heterocedasticidad . Para comprobar este supuesto, se puede examinar un gráfico de residuos frente a valores predichos (o los valores de cada predictor individual) para detectar un "efecto abanico" (es decir, una dispersión vertical que aumenta o disminuye al moverse de izquierda a derecha en el gráfico). También se puede examinar un gráfico de los residuos absolutos o al cuadrado frente a los valores predichos (o cada predictor) para detectar una tendencia o curvatura. También se pueden utilizar pruebas formales; véase Heterocedasticidad . La presencia de heterocedasticidad dará como resultado que se utilice una estimación "promedio" general de la varianza en lugar de una que tenga en cuenta la verdadera estructura de la varianza. Esto conduce a estimaciones de parámetros menos precisas (pero en el caso de mínimos cuadrados ordinarios , no sesgadas) y errores estándar sesgados, lo que da lugar a pruebas y estimaciones de intervalo engañosas. El error cuadrático medio del modelo también será incorrecto. Diversas técnicas de estimación, como los mínimos cuadrados ponderados y el uso de errores estándar consistentes con la heterocedasticidad, permiten abordar la heterocedasticidad de forma bastante general. También se pueden utilizar técnicas de regresión lineal bayesiana cuando se supone que la varianza es una función de la media. En algunos casos, también es posible solucionar el problema aplicando una transformación a la variable de respuesta (por ejemplo, ajustando el logaritmo de la variable de respuesta mediante un modelo de regresión lineal, lo que implica que la variable de respuesta tiene una distribución log-normal en lugar de una distribución normal ).
Para comprobar si se incumplen los supuestos de linealidad, varianza constante e independencia de los errores en un modelo de regresión lineal, los residuos se suelen representar gráficamente frente a los valores predichos (o a cada uno de los predictores individuales). Una dispersión aparentemente aleatoria de puntos alrededor de la línea media horizontal en 0 es ideal, pero no descarta ciertos tipos de incumplimientos, como la autocorrelación de los errores o su correlación con una o más covariables.
  • Descorrelación de los errores . Esto supone que los errores de las variables de respuesta no están correlacionados entre sí:mi[εiεj|incógnitai,incógnitaj]=0.{\displaystyle \mathbb {E} [\varepsilon _{i}\varepsilon _{j}|x_{i},x_{j}]=0.}Algunos métodos, como el de mínimos cuadrados generalizados, son capaces de manejar errores correlacionados, aunque suelen requerir muchos más datos a menos que se utilice algún tipo de regularización para sesgar el modelo hacia la suposición de errores no correlacionados. La regresión lineal bayesiana es una forma general de abordar este problema. La independencia estadística total es una condición más fuerte que la mera ausencia de correlación y, a menudo, no es necesaria, aunque implica independencia de la media.
  • Falta de multicolinealidad perfecta en los predictores. Para los métodos de estimación de mínimos cuadrados estándar , la matriz de diseño X debe tener rango de columna completo p : [ 18 ]Pr[rango(incógnita)=pag]=1.{\displaystyle \Pr \!{\big [}\,\operatorname {rank} (X)=p\,{\big ]}=1.}Si se incumple este supuesto, existe multicolinealidad perfecta en las variables predictoras, lo que significa que existe una relación lineal entre dos o más variables predictoras. La multicolinealidad puede deberse a la duplicación accidental de una variable en los datos, al uso de una transformación lineal de una variable junto con la original (por ejemplo, las mismas mediciones de temperatura expresadas en Fahrenheit y Celsius), o a la inclusión de una combinación lineal de múltiples variables en el modelo, como su media. También puede ocurrir si hay muy pocos datos disponibles en comparación con el número de parámetros a estimar (por ejemplo, menos puntos de datos que coeficientes de regresión). Las violaciones cercanas de este supuesto, donde los predictores están altamente pero no perfectamente correlacionados, pueden reducir la precisión de las estimaciones de los parámetros (véase Factor de inflación de la varianza ). En el caso de multicolinealidad perfecta, el vector de parámetros β no será identificable ; no tiene una solución única. En tal caso, solo algunos de los parámetros pueden identificarse (es decir, sus valores solo pueden estimarse dentro de algún subespacio lineal del espacio de parámetros completo R p ). Véase regresión de mínimos cuadrados parciales . Se han desarrollado métodos para ajustar modelos lineales con multicolinealidad, [ 19 ] [ 20 ] [ 21 ] [ 22 ] algunos de los cuales requieren supuestos adicionales como la "escasez de efectos", es decir, que una gran fracción de los efectos sean exactamente cero. Cabe señalar que los algoritmos iterativos para la estimación de parámetros, que son computacionalmente más costosos, como los utilizados en los modelos lineales generalizados , no presentan este problema.

Las violaciones de estos supuestos pueden dar lugar a estimaciones sesgadas de β , errores estándar sesgados, intervalos de confianza poco fiables y pruebas de significancia erróneas. Además de estos supuestos, varias otras propiedades estadísticas de los datos influyen notablemente en el rendimiento de los diferentes métodos de estimación:

  • La relación estadística entre los términos de error y las variables explicativas desempeña un papel importante a la hora de determinar si un procedimiento de estimación posee propiedades de muestreo deseables, como ser insesgado y consistente.
  • La disposición o distribución de probabilidad de las variables predictoras x tiene una gran influencia en la precisión de las estimaciones de β . El muestreo y el diseño de experimentos son subcampos muy desarrollados de la estadística que proporcionan orientación para recopilar datos de tal manera que se logre una estimación precisa de β .

Propiedades

Propiedades de muestra finita

En primer lugar, bajo el supuesto de exogeneidad estricta, los estimadores MCOβ^{\displaystyle \scriptstyle {\hat {\beta }}}y s 2 son insesgados , lo que significa que sus valores esperados coinciden con los valores verdaderos de los parámetros: [ 23 ] [prueba]

mi[β^incógnita]=β,mi[s2incógnita]=σ2.{\displaystyle \operatorname {E} [\,{\hat {\beta }}\mid X\,]=\beta ,\quad \operatorname {E} [\,s^{2}\mid X\,]=\sigma ^{2}.}

Si no se cumple la exogeneidad estricta (como ocurre con muchos modelos de series temporales , donde la exogeneidad se asume solo con respecto a las perturbaciones pasadas, pero no a las futuras), entonces estos estimadores estarán sesgados en muestras finitas.

La matriz de varianza-covarianza (o simplemente matriz de covarianza ) deβ^{\displaystyle \scriptstyle {\hat {\beta }}}es igual a [ 24 ]

Var[β^incógnita]=σ2(incógnitaTincógnita)1=σ2Q.{\displaystyle \operatorname {Var} [\,{\hat {\beta }}\mid X\,]=\sigma ^{2}\left(X^{\operatorname {T} }X\right)^{-1}=\sigma ^{2}Q.}

En particular, el error estándar de cada coeficienteβ^j{\displaystyle \scriptstyle {\hat {\beta }}_{j}}es igual a la raíz cuadrada del j -ésimo elemento diagonal de esta matriz. La estimación de este error estándar se obtiene reemplazando la cantidad desconocida σ 2 con su estimación s 2 . Por lo tanto,

s.mi.^(β^j)=s2(incógnitaTincógnita)jj1{\displaystyle {\widehat {\operatorname {s.\!e.} }}({\hat {\beta }}_{j})={\sqrt {s^{2}\left(X^{\operatorname {T} }X\right)_{jj}^{-1}}}}

También se puede demostrar fácilmente que el estimadorβ^{\displaystyle \scriptstyle {\hat {\beta }}}no está correlacionado con los residuos del modelo: [ 24 ]

Cov[β^,ε^incógnita]=0.{\displaystyle \operatorname {Cov} [\,{\hat {\beta }},{\hat {\varepsilon }}\mid X\,]=0.}

El teorema de Gauss-Markov establece que bajo el supuesto de errores esféricos (es decir, los errores deben ser no correlacionados y homocedásticos ) el estimadorβ^{\displaystyle \scriptstyle {\hat {\beta }}}es eficiente en la clase de estimadores lineales insesgados. Esto se denomina el mejor estimador lineal insesgado (BLUE). La eficiencia debe entenderse como si fuéramos a encontrar algún otro estimador.β~{\displaystyle \scriptstyle {\tilde {\beta }}}que sería lineal en y y sin sesgo, entonces [ 24 ]

Var[β~incógnita]Var[β^incógnita]0{\displaystyle \operatorname {Var} [\,{\tilde {\beta }}\mid X\,]-\operatorname {Var} [\,{\hat {\beta }}\mid X\,]\geq 0}

En el sentido de que se trata de una matriz semidefinida positiva . Este teorema establece la optimalidad únicamente en la clase de estimadores lineales insesgados, lo cual es bastante restrictivo. Dependiendo de la distribución de los términos de error ε , otros estimadores no lineales pueden ofrecer mejores resultados que el método de mínimos cuadrados ordinarios (MCO).

Suponiendo normalidad

Las propiedades enumeradas hasta ahora son válidas independientemente de la distribución subyacente de los términos de error. Sin embargo, si se asume que se cumple el supuesto de normalidad (es decir, que ε ~ N (0, σ 2 I n ) ), entonces se pueden enunciar propiedades adicionales de los estimadores MCO.

El estimadorβ^{\displaystyle \scriptstyle {\hat {\beta }}}tiene una distribución normal, con media y varianza dadas anteriormente: [ 25 ]

β^  norte(β, σ2(incógnitaTincógnita)1).{\displaystyle {\hat {\beta }}\ \sim \ {\mathcal {N}}{\big (}\beta ,\ \sigma ^{2}(X^{\mathrm {T} }X)^{-1}{\big )}.}

Este estimador alcanza la cota de Cramér-Rao para el modelo y, por lo tanto, es óptimo en la clase de todos los estimadores insesgados. [ 17 ] Nótese que, a diferencia del teorema de Gauss-Markov , este resultado establece la optimalidad entre los estimadores lineales y no lineales, pero solo en el caso de términos de error con distribución normal.

El estimador s 2 será proporcional a la distribución chi-cuadrado : [ 26 ]

s2  σ2nortepagχnortepag2{\displaystyle s^{2}\ \sim \ {\frac {\sigma ^{2}}{n-p}}\cdot \chi _{n-p}^{2}}

La varianza de este estimador es igual a 2 σ 4 /( np ) , que no alcanza la cota de Cramér–Rao de 2 σ 4 / n . Sin embargo, se demostró que no existen estimadores insesgados de σ 2 con una varianza menor que la del estimador s 2 . [ 27 ] Si estamos dispuestos a permitir estimadores sesgados, y consideramos la clase de estimadores que son proporcionales a la suma de los residuos al cuadrado (SSR) del modelo, entonces el mejor estimador (en el sentido del error cuadrático medio ) en esta clase será ~ σ 2 = SSR / ( np + 2) , que incluso supera la cota de Cramér–Rao en el caso de que solo haya un regresor ( p = 1 ). [ 28 ]

Además, los estimadoresβ^{\displaystyle \scriptstyle {\hat {\beta }}}y s 2 son independientes , [ 29 ] hecho que resulta útil al construir las pruebas t y F para la regresión.

Observaciones influyentes

Como se mencionó anteriormente, el estimadorβ^{\displaystyle {\hat {\beta }}}es lineal en y , lo que significa que representa una combinación lineal de las variables dependientes y i . Los pesos en esta combinación lineal son funciones de los regresores X , y generalmente son desiguales. Las observaciones con pesos altos se denominan influyentes porque tienen un efecto más pronunciado en el valor del estimador.

Para analizar qué observaciones son influyentes, eliminamos una observación j específica y consideramos cuánto van a cambiar las cantidades estimadas (de forma similar al método jackknife ). Se puede demostrar que el cambio en el estimador OLS para β será igual a [ 30 ].

β^(j)β^=11hj(incógnitaTincógnita)1incógnitajTε^j,{\displaystyle {\hat {\beta }}^{(j)}-{\hat {\beta }}=-{\frac {1}{1-h_{j}}}(X^{\mathrm {T} }X)^{-1}x_{j}^{\mathrm {T} }{\hat {\varepsilon }}_{j}\,,}

donde h j = x j T ( X T X ) −1 x j es el j -ésimo elemento diagonal de la matriz sombrero P , y x j es el vector de regresores correspondiente a la j -ésima observación. De manera similar, el cambio en el valor predicho para la j -ésima observación resultante de omitir esa observación del conjunto de datos será igual a [ 30 ]

y^j(j)y^j=incógnitajTβ^(j)incógnitajTβ^=hj1hjε^j{\displaystyle {\hat {y}}_{j}^{(j)}-{\hat {y}}_{j}=x_{j}^{\mathrm {T} }{\hat {\beta }}^{(j)}-x_{j}^{\operatorname {T} }{\hat {\beta }}=-{\frac {h_{j}}{1-h_{j}}}\,{\hat {\varepsilon }}_{j}}

De las propiedades de la matriz de sombrero, 0 ≤ h j ≤ 1 , y su suma es p , de modo que en promedio h jp/n . Estas cantidades h j se denominan palancas , y las observaciones con h j alto se denominan puntos de palanca . [ 31 ] Por lo general, las observaciones con palanca alta deben examinarse con más cuidado, en caso de que sean erróneas, valores atípicos o de alguna otra manera atípicas con respecto al resto del conjunto de datos.

Regresión particionada

A veces, las variables y los parámetros correspondientes en la regresión se pueden dividir lógicamente en dos grupos, de modo que la regresión tome forma

y=incógnita1β1+incógnita2β2+ε,{\displaystyle y=X_{1}\beta _{1}+X_{2}\beta _{2}+\varepsilon ,}

donde X 1 y X 2 tienen dimensiones n × p 1 , n × p 2 , y β 1 , β 2 son vectores p 1 ×1 y p 2 ×1, con p 1 + p 2 = p .

El teorema de Frisch-Waugh-Lovell establece que en esta regresión los residuosε^{\displaystyle {\hat {\varepsilon }}}y la estimación MCOβ^2{\displaystyle \scriptstyle {\hat {\beta }}_{2}}serán numéricamente idénticos a los residuos y a la estimación MCO para β 2 en la siguiente regresión: [ 32 ]

METRO1y=METRO1incógnita2β2+η,{\displaystyle M_{1}y=M_{1}X_{2}\beta _{2}+\eta \,,}

donde M 1 es la matriz aniquiladora para los regresores X 1 .

El teorema puede utilizarse para establecer diversos resultados teóricos. Por ejemplo, realizar una regresión con una constante y otra variable explicativa equivale a restar las medias de la variable dependiente y de la variable explicativa, y luego ejecutar la regresión con las variables sin la media, pero sin el término constante.

Propiedades de muestras grandes

Los estimadores de mínimos cuadrados son estimaciones puntuales de los parámetros β del modelo de regresión lineal . Sin embargo, generalmente también queremos saber qué tan cerca pueden estar esas estimaciones de los valores reales de los parámetros. En otras palabras, queremos construir las estimaciones de intervalo .

Dado que no hemos hecho ninguna suposición sobre la distribución del término de error ε i , es imposible inferir la distribución de los estimadores.β^{\displaystyle {\hat {\beta }}}yσ^2{\displaystyle {\hat {\sigma }}^{2}}Sin embargo, podemos aplicar el teorema del límite central para derivar sus propiedades asintóticas cuando el tamaño de la muestra n tiende a infinito. Si bien el tamaño de la muestra es necesariamente finito, es habitual suponer que n es lo suficientemente grande como para que la distribución verdadera del estimador MCO se aproxime a su límite asintótico.

Podemos demostrar que, bajo los supuestos del modelo, el estimador de mínimos cuadrados para β es consistente (es decir,β^{\displaystyle {\hat {\beta }}}converge en probabilidad a β ) y asintóticamente normal: [prueba]

(β^β) d norte(0,σ2Qincógnitaincógnita1),{\displaystyle ({\hat {\beta }}-\beta )\ {\xrightarrow {d}}\ {\mathcal {N}}{\big (}0,\;\sigma ^{2}Q_{xx}^{-1}{\big )},}

dóndeQincógnitaincógnita=incógnitaTincógnita.{\displaystyle Q_{xx}=X^{\operatorname {T} }X.}

Inferencia

Utilizando esta distribución asintótica, obtenga intervalos de confianza bilaterales aproximados para el j -ésimo componente del vectorβ^{\displaystyle {\hat {\beta }}}puede construirse como

βj[ β^j±q1α2norte(0,1)σ^2[Qincógnitaincógnita1]jj ]{\displaystyle \beta _{j}\in {\bigg [}\ {\hat {\beta }}_{j}\pm q_{1-{\frac {\alpha }{2}}}^{{\mathcal {N}}(0,1)}\!{\sqrt {{\hat {\sigma }}^{2}\left[Q_{xx}^{-1}\right]_{jj}}}\ {\bigg ]}} al nivel de confianza 1  α  ,

donde q denota la función cuantil de la distribución normal estándar, y [·] jj es el j -ésimo elemento diagonal de una matriz.

De manera similar, el estimador de mínimos cuadrados para σ 2 también es consistente y asintóticamente normal (siempre que exista el cuarto momento de ε i ) con distribución límite

(σ^2σ2) d norte(0,mi[εi4]σ4).{\displaystyle ({\hat {\sigma }}^{2}-\sigma ^{2})\ {\xrightarrow {d}}\ {\mathcal {N}}\left(0,\;\operatorname {E} \left[\varepsilon _{i}^{4}\right]-\sigma ^{4}\right).}

Estas distribuciones asintóticas pueden utilizarse para predicción, prueba de hipótesis, construcción de otros estimadores, etc. Como ejemplo, consideremos el problema de la predicción. Supongamos queincógnita0{\displaystyle x_{0}}es algún punto dentro del dominio de distribución de los regresores, y se quiere saber cuál habría sido la variable de respuesta en ese punto. La respuesta media es la cantidady0=incógnita0Tβ{\displaystyle y_{0}=x_{0}^{\mathrm {T} }\beta }, mientras que la respuesta prevista esy^0=incógnita0Tβ^{\displaystyle {\hat {y}}_{0}=x_{0}^{\mathrm {T} }{\hat {\beta }}}. Claramente, la respuesta prevista es una variable aleatoria, su distribución se puede derivar de la deβ^{\displaystyle {\hat {\beta }}}:

(y^0y0) d norte(0,σ2incógnita0TQincógnitaincógnita1incógnita0),{\displaystyle \left({\hat {y}}_{0}-y_{0}\right)\ {\xrightarrow {d}}\ {\mathcal {N}}\left(0,\;\sigma ^{2}x_{0}^{\mathrm {T} }Q_{xx}^{-1}x_{0}\right),}

lo que permite construir intervalos de confianza para la respuesta media.y0{\displaystyle y_{0}}por construir:

y0[ incógnita0Tβ^±q1α2norte(0,1)σ^2incógnita0TQincógnitaincógnita1incógnita0 ]{\displaystyle y_{0}\in \left[\ x_{0}^{\mathrm {T} }{\hat {\beta }}\pm q_{1-{\frac {\alpha }{2}}}^{{\mathcal {N}}(0,1)}\!{\sqrt {{\hat {\sigma }}^{2}x_{0}^{\mathrm {T} }Q_{xx}^{-1}x_{0}}}\ \right]} con un nivel de confianza de 1  α  .

Prueba de hipótesis

Dos pruebas de hipótesis son particularmente utilizadas. En primer lugar, se busca determinar si la ecuación de regresión estimada es mejor que simplemente predecir que todos los valores de la variable de respuesta son iguales a su media muestral (de lo contrario, se dice que carece de poder explicativo). La hipótesis nula de que la regresión estimada no tiene valor explicativo se contrasta mediante una prueba F. Si el valor F calculado es lo suficientemente grande como para superar su valor crítico para el nivel de significancia preestablecido, se rechaza la hipótesis nula y se acepta la hipótesis alternativa , es decir, que la regresión tiene poder explicativo. En caso contrario, se acepta la hipótesis nula de que no tiene poder explicativo.

En segundo lugar, para cada variable explicativa de interés, se busca determinar si su coeficiente estimado difiere significativamente de cero; es decir, si dicha variable explicativa tiene poder predictivo sobre la variable de respuesta. En este caso, la hipótesis nula es que el coeficiente verdadero es cero. Esta hipótesis se contrasta calculando el estadístico t del coeficiente , como la razón entre la estimación del coeficiente y su error estándar . Si el estadístico t es mayor que un valor predeterminado, se rechaza la hipótesis nula y se concluye que la variable tiene poder explicativo, con un coeficiente significativamente distinto de cero. En caso contrario, se acepta la hipótesis nula de que el coeficiente verdadero es cero.

Además, la prueba de Chow se utiliza para comprobar si dos submuestras tienen los mismos coeficientes reales subyacentes. La suma de los residuos al cuadrado de las regresiones en cada uno de los subconjuntos y en el conjunto de datos combinado se compara calculando un estadístico F; si este supera un valor crítico, se rechaza la hipótesis nula de que no existen diferencias entre los dos subconjuntos; de lo contrario, se acepta.

Violaciones de supuestos

Modelo de series temporales

En un modelo de series temporales , requerimos que el proceso estocástico { x i , y i } sea estacionario y ergódico ; si { x i , y i } no es estacionario, los resultados de MCO suelen estar sesgados a menos que { x i , y i } sea cointegrado . [ 33 ]

Todavía requerimos que los regresores sean estrictamente exógenos : E[ x i ε i ] = 0 para todo i = 1, ..., n . Si solo están predeterminados , MCO está sesgado en una muestra finita;

Finalmente, los supuestos sobre la varianza toman la forma de requerir que { x i ε i } sea una secuencia de diferencias de martingala , con una matriz finita de segundos momentos Q xxε ² = E[ ε i 2 x i x i T ] .

Estimación restringida

Supongamos que se sabe que los coeficientes de la regresión satisfacen un sistema de ecuaciones lineales.

A:QTβ=do,{\displaystyle A\colon \quad Q^{\operatorname {T} }\beta =c,\,}

donde Q es una matriz p × q de rango completo, y c es un vector q × 1 de constantes conocidas, donde q < p . En este caso, la estimación por mínimos cuadrados es equivalente a minimizar la suma de los residuos al cuadrado del modelo sujeto a la restricción A. El estimador de mínimos cuadrados restringidos (CLS) se puede dar mediante una fórmula explícita: [ 34 ]

β^do=β^(incógnitaTincógnita)1Q(QT(incógnitaTincógnita)1Q)1(QTβ^do).{\displaystyle {\hat {\beta }}^{c}={\hat {\beta }}-(X^{\operatorname {T} }X)^{-1}Q{\Big (}Q^{\operatorname {T} }(X^{\operatorname {T} }X)^{-1}Q{\Big )}^{-1}(Q^{\operatorname {T} }{\hat {\beta }}-c).}

Esta expresión para el estimador restringido es válida siempre que la matriz X T X sea invertible. Desde el principio de este artículo se asumió que esta matriz tiene rango completo, y se observó que cuando falla la condición de rango, β no será identificable. Sin embargo, puede ocurrir que al añadir la restricción A β sea identificable, en cuyo caso se desearía encontrar la fórmula para el estimador. El estimador es igual a [ 35 ].

β^do=R(RTincógnitaTincógnitaR)1RTincógnitaTy+(IpagR(RTincógnitaTincógnitaR)1RTincógnitaTincógnita)Q(QTQ)1do,{\displaystyle {\hat {\beta }}^{c}=R(R^{\operatorname {T} }X^{\operatorname {T} }XR)^{-1}R^{\operatorname {T} }X^{\operatorname {T} }y+{\Big (}I_{p}-R(R^{\operatorname {T} }X^{\operatorname {T} }XR)^{-1}R^{\operatorname {T} }X^{\operatorname {T} }X{\Big )}Q(Q^{\operatorname {T} }Q)^{-1}c,}

donde R es una matriz p × ( p q ) tal que la matriz [ QR ] es no singular y R T Q = 0. Dicha matriz siempre se puede encontrar, aunque generalmente no es única. La segunda fórmula coincide con la primera en el caso de que X T X sea invertible. [ 35 ] 

Ejemplo con datos reales

El siguiente conjunto de datos proporciona las alturas y pesos promedio de las mujeres estadounidenses de entre 30 y 39 años (fuente: The World Almanac and Book of Facts, 1975 ).

Cuando se modela una sola variable dependiente, un diagrama de dispersión sugiere la forma y la fuerza de la relación entre la variable dependiente y los regresores. También puede revelar valores atípicos, heterocedasticidad y otros aspectos de los datos que pueden complicar la interpretación de un modelo de regresión ajustado. El diagrama de dispersión sugiere que la relación es fuerte y puede aproximarse como una función cuadrática . El método de mínimos cuadrados ordinarios ( MCO) puede manejar relaciones no lineales introduciendo el regresor ALTURA² . El modelo de regresión se convierte entonces en un modelo lineal múltiple.

wi=β1+β2hi+β3hi2+εi.{\displaystyle w_{i}=\beta _{1}+\beta _{2}h_{i}+\beta _{3}h_{i}^{2}+\varepsilon _{i}.}
Regresión ajustada

La salida de la mayoría de los paquetes estadísticos más populares se verá similar a esto:

En esta tabla:

  • La columna Valor proporciona las estimaciones de mínimos cuadrados de los parámetros β j
  • La columna "Error estándar" muestra los errores estándar de cada estimación de coeficiente:σ^j=(σ^2[Qincógnitaincógnita1]jj)12{\displaystyle {\hat {\sigma }}_{j}=\left({\hat {\sigma }}^{2}\left[Q_{xx}^{-1}\right]_{jj}\right)^{\frac {1}{2}}}
  • Las columnas de estadístico t y valor p prueban si alguno de los coeficientes puede ser igual a cero. El estadístico t se calcula simplemente comot=β^j/σ^j{\displaystyle t={\hat {\beta }}_{j}/{\hat {\sigma }}_{j}}Si los errores ε siguen una distribución normal, t sigue una distribución t de Student. En condiciones menos estrictas, t es asintóticamente normal. Valores grandes de t indican que se puede rechazar la hipótesis nula y que el coeficiente correspondiente no es cero. La segunda columna, valor p , expresa los resultados de la prueba de hipótesis como un nivel de significancia . Por convención, los valores p menores que 0,05 se consideran evidencia de que el coeficiente poblacional es distinto de cero.
  • El coeficiente de determinación (R²) indica la bondad de ajuste de la regresión. Este estadístico será igual a uno si el ajuste es perfecto y cero si las variables explicativas X no tienen ningún poder explicativo. Se trata de una estimación sesgada del poblacional , y nunca disminuirá si se añaden variables explicativas adicionales, incluso si son irrelevantes.
  • El R cuadrado ajustado es una versión ligeramente modificada deR2{\displaystyle R^{2}}, diseñado para penalizar el número excesivo de regresores que no contribuyen al poder explicativo de la regresión. Esta estadística siempre es menor queR2{\displaystyle R^{2}}, puede disminuir a medida que se agregan nuevos regresores, e incluso ser negativo para modelos que se ajustan mal:
R¯2=1norte1nortepag(1R2){\displaystyle {\overline {R}}^{2}=1-{\frac {n-1}{n-p}}(1-R^{2})}
  • La log-verosimilitud se calcula bajo el supuesto de que los errores siguen una distribución normal. Si bien este supuesto no es del todo razonable, esta estadística aún puede resultar útil para realizar pruebas de razón de verosimilitud.
  • La prueba estadística de Durbin-Watson determina si existe correlación serial entre los residuos. Como regla general, un valor menor que 2 indica una correlación positiva.
  • Tanto el criterio de información de Akaike como el criterio de Schwarz se utilizan para la selección de modelos . Generalmente, al comparar dos modelos alternativos, valores más bajos de uno de estos criterios indicarán un mejor modelo. [ 36 ]
  • El error estándar de regresión es una estimación de σ , el error estándar del término de error.
  • La suma total de cuadrados , la suma de cuadrados del modelo y la suma residual de cuadrados nos indican qué parte de la variación inicial en la muestra fue explicada por la regresión.
  • El estadístico F intenta contrastar la hipótesis de que todos los coeficientes (excepto el término independiente) son iguales a cero. Este estadístico sigue una distribución F ( p–1 , n–p ) bajo la hipótesis nula y el supuesto de normalidad, y su valor p indica la probabilidad de que la hipótesis sea verdadera. Cabe destacar que, cuando los errores no siguen una distribución normal, este estadístico deja de ser válido y deben utilizarse otras pruebas, como la prueba de Wald o la prueba de razón de verosimilitud (LR) .
Gráfico de residuos

El análisis de mínimos cuadrados ordinarios suele incluir el uso de gráficos de diagnóstico diseñados para detectar desviaciones de los datos respecto a la forma supuesta del modelo. Estos son algunos de los gráficos de diagnóstico más comunes:

  • Residuos frente a las variables explicativas del modelo. Una relación no lineal entre estas variables sugiere que la linealidad de la función de media condicional podría no cumplirse. Los diferentes niveles de variabilidad en los residuos para distintos niveles de las variables explicativas sugieren una posible heterocedasticidad.
  • Residuos frente a variables explicativas no incluidas en el modelo. Cualquier relación entre los residuos y estas variables sugeriría considerar su inclusión en el modelo.
  • Residuos frente a los valores ajustados,y^{\displaystyle {\hat {y}}}.
  • Residuos comparados con el residuo precedente. Este gráfico puede identificar correlaciones seriales en los residuos.

Un aspecto importante a considerar al realizar inferencias estadísticas mediante modelos de regresión es cómo se muestrearon los datos. En este ejemplo, los datos son promedios, no mediciones individuales de mujeres. El ajuste del modelo es muy bueno, pero esto no implica que el peso de una mujer pueda predecirse con gran precisión basándose únicamente en su estatura.

Sensibilidad al redondeo

Este ejemplo también demuestra que los coeficientes determinados por estos cálculos son sensibles a la forma en que se preparan los datos. Las alturas se dieron originalmente redondeadas a la pulgada más cercana y se convirtieron y redondearon al centímetro más cercano. Dado que el factor de conversión es de una pulgada a 2,54  cm, esta no es una conversión exacta. Las pulgadas originales se pueden recuperar con la función Round(x/0,0254) y luego reconvertir a unidades métricas sin redondear. Si se realiza esto, los resultados son:

Residuos de un ajuste cuadrático para datos convertidos correcta e incorrectamente.

Al utilizar cualquiera de estas ecuaciones para predecir el peso de una mujer de 1,6764 m (5' 6"), se obtienen valores similares: 62,94  kg con redondeo frente a 62,98  kg sin redondeo. Por lo tanto, una variación aparentemente pequeña en los datos tiene un efecto real en los coeficientes, pero un efecto mínimo en los resultados de la ecuación.

Si bien esto puede parecer inocuo en el centro del rango de datos, podría volverse significativo en los extremos o en el caso de que el modelo ajustado se utilice para proyectar fuera del rango de datos ( extrapolación ).

Esto pone de manifiesto un error común: este ejemplo constituye un abuso del método de mínimos cuadrados ordinarios (MCO), que inherentemente exige que los errores en la variable independiente (en este caso, la altura) sean cero o, al menos, insignificantes. El redondeo inicial a la pulgada más cercana, sumado a cualquier error de medición real, constituye un error finito y no insignificante. En consecuencia, los parámetros ajustados no son las mejores estimaciones que se suponen. Si bien no es totalmente erróneo, el error en la estimación dependerá de la magnitud relativa de los errores en los ejes x e y .

Otro ejemplo con menos datos reales

Planteamiento del problema

Podemos utilizar el mecanismo de mínimos cuadrados para calcular la ecuación de una órbita de dos cuerpos en coordenadas polares. La ecuación que se suele utilizar es:r(θ)=pag1miporque(θ){\displaystyle r(\theta )={\frac {p}{1-e\cos(\theta )}}}dónder(θ){\displaystyle r(\theta )}es el radio que indica la distancia del objeto a uno de los cuerpos. En la ecuación, los parámetrospag{\displaystyle p}ymi{\displaystyle e}se utilizan para determinar la trayectoria de la órbita. Hemos medido los siguientes datos.

Necesitamos encontrar la aproximación de mínimos cuadrados demi{\displaystyle e}ypag{\displaystyle p}para los datos proporcionados.

Solución

Primero necesitamos representar e y p en forma lineal. Así que vamos a reescribir la ecuación.r(θ){\displaystyle r(\theta )}como1r(θ)=1pagmipagporque(θ){\displaystyle {\frac {1}{r(\theta )}}={\frac {1}{p}}-{\frac {e}{p}}\cos(\theta )}.

Además, se podría instalar un ábside ampliandoporque(θ){\displaystyle \cos(\theta )}con un parámetro adicional comoporque(θθ0)=porque(θ)porque(θ0)+pecado(θ)pecado(θ0){\displaystyle \cos(\theta -\theta _{0})=\cos(\theta )\cos(\theta _{0})+\sin(\theta )\sin(\theta _{0})}, que es lineal en ambosporque(θ){\displaystyle \cos(\theta )}y en la función base adicionalpecado(θ){\displaystyle \sin(\theta )}.

Utilizamos la forma original de dos parámetros para representar nuestros datos de observación de la siguiente manera:

ATA(incógnitay)=ATb,{\displaystyle A^{T}A{\binom {x}{y}}=A^{T}b,}

dónde:

incógnita=1/pag{\displaystyle x=1/p\,};y=mi/pag{\displaystyle y=e/p\,};A{\displaystyle A}contiene los coeficientes de1/pag{\displaystyle 1/p}en la primera columna, que son todos 1, y los coeficientes demi/pag{\displaystyle e/p}en la segunda columna, dada porporque(θ){\displaystyle \cos(\theta )\,}; yb=1/r(θ){\displaystyle b=1/r(\theta )}, de tal manera que:

A=[10,73135410,70710710,6156611 0,05233610,30901710,438371],b=[0,212200,219580,247410,450710,528830,56820].{\displaystyle A={\begin{bmatrix}1&-0.731354\\1&-0.707107\\1&-0.615661\\1&\ 0.052336\\1&0.309017\\1&0.438371\end{bmatrix}},\quad b={\begin{bmatrix}0.21220\\0.21958\\0.24741\\0.45071\\0.52883\\0.56820\end{bmatrix}}.}

Al resolver obtenemos(incógnitay)=(0,434780,30435){\displaystyle {\binom {x}{y}}={\binom {0.43478}{0.30435}}\,},

entoncespag=1incógnita=2.3000{\displaystyle p={\frac {1}{x}}=2.3000}ymi=pagy=0,70001{\displaystyle e=p\cdot y=0.70001}

Véase también

Referencias

  1. "Los orígenes de las suposiciones de mínimos cuadrados ordinarios" . Columna de opinión . 1 de marzo de 2022. Consultado el 16 de mayo de 2024 .
  2. "¿Cuál es una lista completa de los supuestos habituales para la regresión lineal?" . Validado cruzadamente . Recuperado el 28-09-2022 .
  3. Goldberger, Arthur S. (1964). «Regresión lineal clásica» . Teoría econométrica . Nueva York: John Wiley & Sons. pp. 158. ISBN  0-471-31101-4.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  4. Hayashi, Fumio (2000). Econometría . Princeton University Press. pág. 15. ISBN  9780691010182.
  5. Hayashi (2000 , página 18) .
  6. Ghilani, Charles D.; Wolf, Paul R. (12 de junio de 2006). Adjustment Computations: Spatial Data Analysis . John Wiley & Sons. ISBN 9780471697282.
  7. Hofmann-Wellenhof, Bernhard; Lichtenegger, Herbert; Wasle, Elmar (20 de noviembre de 2007). GNSS: sistemas globales de navegación por satélite: GPS, GLONASS, Galileo y más . Saltador. ISBN 9783211730171.
  8. Xu, Guochang (5 de octubre de 2007). GPS: Teoría, algoritmos y aplicaciones . Springer. ISBN 9783540727156.
  9. 1 2 Hayashi (2000 , página 19)
  10. Hoaglin, David C.; Welsch, Roy E. (1978). "La matriz de sombrero en regresión y ANOVA" . The American Statistician . 32 (1): 17– 22. doi : 10.1080/00031305.1978.10479237 . hdl : 1721.1/1920 . ISSN 0003-1305 . 
  11. Julian Faraway (2000), Regresión práctica y ANOVA usando R
  12. Kenney, J.; Keeping, ES (1963). Matemáticas de la estadística . van Nostrand. pág. 187. 
  13. Zwillinger, Daniel (1995). Tablas y fórmulas matemáticas estándar . Chapman&Hall/CRC. pág. 626. ISBN  0-8493-2479-3.
  14. Hayashi (2000 , página 20)
  15. ^ Akbarzadeh, Vahab (7 de mayo de 2014). "Estimación de líneas" .
  16. Hayashi (2000 , página 49)
  17. 1 2 Hayashi (2000 , página 52)
  18. Hayashi (2000 , página 10)
  19. Tibshirani, Robert (1996). "Regresión, contracción y selección mediante el método Lasso". Journal of the Royal Statistical Society, Serie B. 58 ( 1): 267– 288. doi : 10.1111/j.2517-6161.1996.tb02080.x . JSTOR 2346178 . 
  20. Efron, Bradley; Hastie, Trevor; Johnstone, Iain; Tibshirani, Robert (2004). "Regresión de ángulo mínimo". The Annals of Statistics . 32 (2): 407– 451. arXiv : math/0406456 . doi : 10.1214/009053604000000067 . JSTOR 3448465 . S2CID 204004121 .  
  21. Hawkins, Douglas M. (1973). "Sobre la investigación de regresiones alternativas mediante análisis de componentes principales". Journal of the Royal Statistical Society, Serie C. 22 ( 3): 275– 286. doi : 10.2307/2346776 . JSTOR 2346776 . 
  22. Jolliffe, Ian T. (1982). "Una nota sobre el uso de componentes principales en la regresión". Journal of the Royal Statistical Society, Serie C. 31 ( 3): 300– 303. doi : 10.2307/2348005 . JSTOR 2348005 . 
  23. Hayashi (2000 , páginas 27, 30)
  24. 1 2 3 Hayashi (2000 , página 27)
  25. Amemiya, Takeshi (1985). Econometría avanzada . Harvard University Press. pág . 13. ISBN  9780674005600.
  26. Amemiya (1985 , página 14)
  27. Rao, CR (1973). Inferencia estadística lineal y sus aplicaciones (Segunda edición). Nueva York: J. Wiley & Sons. pág. 319. ISBN   0-471-70823-2.
  28. Amemiya (1985 , página 20)
  29. Amemiya (1985 , página 27)
  30. 1 2 Davidson, Russell; MacKinnon, James G. (1993). Estimación e inferencia en econometría . Nueva York: Oxford University Press. pág. 33. ISBN  0-19-506011-3.
  31. Davidson y MacKinnon (1993 , página 36)
  32. Davidson y MacKinnon (1993 , página 20)
  33. "Recuerdo sobre la salida de EViews" (PDF) . Consultado el 28 de diciembre de 2020 .
  34. Amemiya (1985 , página 21)
  35. 1 2 Amemiya (1985 , página 22)
  36. Burnham, Kenneth P.; Anderson, David R. (2002). Selección de modelos e inferencia multimodelos (2.ª ed.). Springer. ISBN  0-387-95364-7.

Lecturas adicionales

  • Dougherty, Christopher (2002). Introducción a la econometría (2.ª  ed.). Nueva York: Oxford University Press. pp. 48–113 . ISBN  0-19-877643-8.
  • Gujarati, Damodar N .; Porter, Dawn C. (2009). Econometría básica (Quinta  ed.). Boston: McGraw-Hill Irwin. pp. 55–96 . ISBN  978-0-07-337577-9.
  • Heij, Christian ; Bóer, Paul; Fransés, Philip H .; Kloek, Teun ; van Dijk, Herman K. (2004). Métodos econométricos con aplicaciones en economía y negocios (1ª  ed.). Oxford: Prensa de la Universidad de Oxford. págs. 76 a 115. ISBN  978-0-19-926801-6.
  • Hill, R. Carter; Griffiths, William E.; Lim, Guay C. (2008). Principios de econometría (3.ª  ed.). Hoboken, NJ: John Wiley & Sons. pp. 8–47 . ISBN  978-0-471-72360-8.
  • Wooldridge, Jeffrey (2008). «El modelo de regresión simple» . Econometría introductoria: un enfoque moderno (4.ª  ed.). Mason, OH: Cengage Learning. pp. 22–67 . ISBN  978-0-324-58162-1.