La ley de Okun en macroeconomía establece que, en una economía, el crecimiento del PIB debe depender linealmente de las variaciones en la tasa de desempleo. En este trabajo, se ...
Hispanopedia WikiContenido en espanolLectura gratuita
La ley de Okun en macroeconomía establece que, en una economía, el crecimiento del PIB debe depender linealmente de las variaciones en la tasa de desempleo. En este trabajo, se utiliza el método de mínimos cuadrados ordinarios para construir la línea de regresión que describe esta ley.
Geométricamente, esto se considera como la suma de las distancias al cuadrado, paralelas al eje de la variable dependiente, entre cada punto de datos del conjunto y el punto correspondiente en la superficie de regresión; cuanto menores sean las diferencias, mejor se ajusta el modelo a los datos. El estimador resultante puede expresarse mediante una fórmula sencilla, especialmente en el caso de una regresión lineal simple , en la que hay un único regresor en el lado derecho de la ecuación de regresión.
Supongamos que los datos consisten en:observacionesCada observaciónincluye una respuesta escalary un vector columnadeparámetros (regresores), es decir,. En un modelo de regresión lineal , la variable de respuesta,, es una función lineal de los regresores:
dónde, como se introdujo anteriormente, es un vector columna de la-ésima observación de todas las variables explicativas;es unvector de parámetros desconocidos; y el escalarrepresenta variables aleatorias no observadas ( errores ) de la-ésima observación.explica las influencias sobre las respuestasde fuentes distintas a las variables explicativasEste modelo también se puede escribir en notación matricial como
dóndeysonvectores de las variables de respuesta y los errores de laobservaciones yes unmatriz de regresores, también llamada a veces matriz de diseño , cuya filaesy contiene el-ésima observación en todas las variables explicativas.
Normalmente, se incluye un término constante en el conjunto de regresores., digamos, tomandoa pesar de. El coeficienteLa coordenada correspondiente a este regresor se denomina intersección . Sin la intersección, la línea ajustada se ve obligada a cruzar el origen cuando.
Para que la estimación sea consistente, las variables explicativas no tienen por qué ser independientes; por ejemplo, pueden presentar una dependencia no lineal. Si bien no existe multicolinealidad perfecta, las estimaciones de los parámetros pueden ser consistentes; sin embargo, a medida que aumenta la multicolinealidad, el error estándar de dichas estimaciones también aumenta, reduciendo su precisión. Cuando existe multicolinealidad perfecta, ya no es posible obtener estimaciones únicas para los coeficientes de las variables explicativas relacionadas; la estimación de estos parámetros no converge (y, por lo tanto, no puede ser consistente).
Como ejemplo concreto donde los regresores son dependientes de forma no lineal pero la estimación aún puede ser consistente, podríamos sospechar que la respuesta depende linealmente tanto de un valor como de su cuadrado; en cuyo caso incluiríamos un regresor cuyo valor es simplemente el cuadrado de otro regresor. En ese caso, el modelo sería cuadrático en el segundo regresor, pero no obstante todavía se considera un modelo lineal porque el modelo sigue siendo lineal en los parámetros ().
(Nota: para un modelo lineal como el anterior, no todos los elementos encontiene información sobre los puntos de datos. La primera columna está rellena con unos,. Solo las demás columnas contienen datos reales. Así que aquíes igual al número de regresores más uno).
Este tipo de sistema normalmente no tiene una solución exacta, por lo que el objetivo es encontrar los coeficientes.que se ajustan "mejor" a las ecuaciones, en el sentido de resolver el problema de minimización cuadrática.
donde la función objetivoestá dado por:
Una justificación para elegir este criterio se da en Propiedades a continuación. Este problema de minimización tiene una solución única, siempre que se cumpla la condición.columnas de la matrizson linealmente independientes , dadas al resolver las llamadas ecuaciones normales :
La matrizse conoce como matriz normal o matriz de Gram y la matrizse conoce como la matriz de momentos del regresonde por regresores. [ 3 ] Finalmente,es el vector de coeficientes del hiperplano de mínimos cuadrados , expresado como
o
Estimación
Supongamos que b es un valor "candidato" para el vector de parámetros β . La cantidad y i − x i T b , llamada residuo para la i -ésima observación, mide la distancia vertical entre el punto de datos ( x i , y i ) y el hiperplano y = x T b , y por lo tanto evalúa el grado de ajuste entre los datos reales y el modelo. La suma de los cuadrados de los residuos ( SSR ) (también llamada suma de cuadrados del error ( ESS ) o suma de cuadrados de los residuos ( RSS )) [ 4 ] es una medida del ajuste general del modelo:
donde T denota la transpuesta de la matriz , y las filas de X , que denotan los valores de todas las variables independientes asociadas con un valor particular de la variable dependiente, son X i = x i T . El valor de b que minimiza esta suma se llama estimador MCO para β . La función S ( b ) es cuadrática en b con hessiano definido positivo , y por lo tanto esta función posee un único mínimo global en, que puede ser dada por la fórmula explícita [ 5 ] [prueba]
El producto N = X T X es una matriz de Gram , y su inversa, Q = N −1 , es la matriz de cofactores de β , [ 6 ] [ 7 ] [ 8 ] estrechamente relacionada con su matriz de covarianza , C β . La matriz ( X T X ) −1 X T = Q X T se denomina matriz pseudoinversa de Moore-Penrose de X . Esta formulación destaca el punto de que la estimación puede llevarse a cabo si, y solo si, no hay multicolinealidad perfecta entre las variables explicativas (lo que haría que la matriz de Gram no tuviera inversa).
Predicción
Después de haber estimado β , los valores ajustados (o valores predichos ) de la regresión serán:
donde P = X ( X T X ) −1 X T es la matriz de proyección sobre el espacio V generado por las columnas de X. Esta matriz P también se denomina a veces matriz de sombrero porque "pone un sombrero" sobre la variable y . Otra matriz, estrechamente relacionada con P, es la matriz anuladora M = I n − P ; esta es una matriz de proyección sobre el espacio ortogonal a V. Ambas matrices, P y M, son simétricas e idempotentes (lo que significa que P 2 = P y M 2 = M ), y se relacionan con la matriz de datos X mediante las identidades PX = X y MX = 0. [ 9 ] La matriz M crea los residuos de la regresión:
donde P es la matriz de proyección y s 2 es la varianza de la muestra. [ 10 ] La matriz completa es muy grande; sus elementos diagonales se pueden calcular individualmente como:
donde X i es la i -ésima fila de la matriz X .
Estadísticas de muestra
Utilizando estos residuos podemos estimar la varianza muestral s² utilizando el estadístico chi-cuadrado reducido :
El denominador, n − p , son los grados de libertad estadísticos . La primera cantidad, s 2 , es la estimación MCO para σ 2 , mientras que la segunda,, es la estimación de máxima verosimilitud (MLE) para σ 2 . Los dos estimadores son bastante similares en muestras grandes; el primer estimador siempre es insesgado , mientras que el segundo estimador es sesgado pero tiene un error cuadrático medio menor . En la práctica, s 2 se usa con más frecuencia, ya que es más conveniente para la prueba de hipótesis. La raíz cuadrada de s 2 se llama error estándar de regresión , [ 11 ] error estándar de la regresión , [ 12 ] [ 13 ] o error estándar de la ecuación . [ 9 ]
Es común evaluar la bondad de ajuste de la regresión MCO comparando cuánto se puede reducir la variación inicial en la muestra al regresar sobre X. El coeficiente de determinación R² se define como una razón de la varianza "explicada" a la varianza "total" de la variable dependiente y , en los casos en que la suma de cuadrados de la regresión es igual a la suma de cuadrados de los residuos: [ 14 ]
donde TSS es la suma total de cuadrados para la variable dependiente,, yes una matriz de unos de n × n . (( es una matriz de centrado equivalente a una regresión sobre una constante; simplemente resta la media a una variable). Para que R² sea significativo, la matriz X de datos sobre regresores debe contener un vector columna de unos que represente la constante cuyo coeficiente es la intersección de la regresión. En ese caso, R² siempre será un número entre 0 y 1, y los valores cercanos a 1 indican un buen grado de ajuste.
Modelo de regresión lineal simple
Si la matriz de datos X contiene solo dos variables, una constante y un regresor escalar x i , entonces se denomina "modelo de regresión simple". Este caso se suele considerar en los cursos de estadística para principiantes, ya que proporciona fórmulas mucho más sencillas, incluso aptas para el cálculo manual. Los parámetros se suelen denotar como ( α , β ) :
Las estimaciones de mínimos cuadrados en este caso se obtienen mediante fórmulas sencillas.
Derivaciones alternativas
En la sección anterior el estimador de mínimos cuadradosSe obtuvo como un valor que minimiza la suma de los residuos al cuadrado del modelo. Sin embargo, también es posible derivar el mismo estimador a partir de otros enfoques. En todos los casos, la fórmula para el estimador MCO sigue siendo la misma: ^ β = ( X T X ) −1 X T y ; la única diferencia radica en cómo interpretamos este resultado.
Proyección
La estimación MCO puede verse como una proyección sobre el espacio lineal generado por los regresores. (Aquí cada uno dey(se refiere a una columna de la matriz de datos.)Mínimos cuadrados como proyección de y sobre col(X) para tres observaciones; ŷ = Xβ da valores ajustados y y − ŷ es el residuo.
Para los matemáticos, MCO es una solución aproximada a un sistema sobredeterminado de ecuaciones lineales Xβ ≈ y , donde β es la incógnita. Suponiendo que el sistema no se puede resolver exactamente (el número de ecuaciones n es mucho mayor que el número de incógnitas p ), buscamos una solución que pueda proporcionar la menor discrepancia entre los lados derecho e izquierdo. En otras palabras, buscamos la solución que satisfaga
donde ‖ · ‖ es la norma L 2 estándar en el espacio euclidiano n- dimensional R n . La cantidad predicha Xβ es simplemente una cierta combinación lineal de los vectores de regresores. Por lo tanto, el vector residual y − Xβ tendrá la longitud más pequeña cuando y se proyecte ortogonalmente sobre el subespacio lineal generado por las columnas de X . El estimador MCOen este caso se puede interpretar como los coeficientes de la descomposición vectorial de ^ y = Py a lo largo de la base de X .
En otras palabras, las ecuaciones de gradiente en el mínimo se pueden escribir como:
Una interpretación geométrica de estas ecuaciones es que el vector de residuos,es ortogonal al espacio columna de X , ya que el producto escalares igual a cero para cualquier vector conforme, v . Esto significa quees el más corto de todos los vectores posiblesEs decir, la varianza de los residuos es la mínima posible. Esto se ilustra a la derecha.
Presentandoy una matriz K con el supuesto de que una matrizes no singular y K T X = 0 (véase Proyecciones ortogonales ), el vector residual debe satisfacer la siguiente ecuación:
La ecuación y la solución de mínimos cuadrados lineales se describen, por lo tanto, de la siguiente manera:
Otra forma de verlo es considerar la línea de regresión como un promedio ponderado de las líneas que pasan por la combinación de cualquier par de puntos en el conjunto de datos. [ 15 ] Si bien este método de cálculo es computacionalmente más costoso, proporciona una mejor intuición sobre MCO.
Máxima probabilidad
El estimador MCO es idéntico al estimador de máxima verosimilitud (EMV) bajo el supuesto de normalidad para los términos de error. [ 16 ] [prueba] Este supuesto de normalidad tiene importancia histórica, ya que proporcionó la base para el trabajo inicial en análisis de regresión lineal de Yule y Pearson . A partir de las propiedades del EMV, podemos inferir que el estimador MCO es asintóticamente eficiente (en el sentido de alcanzar la cota de Cramér-Rao para la varianza) si se cumple el supuesto de normalidad. [ 17 ]
Método generalizado de momentos
En caso i.i.d. , el estimador MCO también puede considerarse un estimador GMM derivado de las condiciones de momento.
Estas condiciones de momento establecen que los regresores deben ser incorrelacionados con los errores. Dado que x i es un vector p , el número de condiciones de momento es igual a la dimensión del vector de parámetros β , y por lo tanto el sistema está exactamente identificado. Este es el llamado caso GMM clásico, en el que el estimador no depende de la elección de la matriz de ponderación.
Cabe señalar que la suposición original de exogeneidad estricta E[ ε i | x i ] = 0 implica un conjunto de condiciones de momento mucho más amplio que el indicado anteriormente. En particular, esta suposición implica que para cualquier función vectorial ƒ , se cumplirá la condición de momento E[ ƒ ( x i )· ε i ] = 0. Sin embargo, mediante el teorema de Gauss-Markov, se puede demostrar que la elección óptima de la función ƒ es ƒ ( x ) = x , lo que resulta en la ecuación de momento presentada anteriormente.
Supuestos
Existen diversos marcos conceptuales para formular el modelo de regresión lineal y así aplicar la técnica de mínimos cuadrados ordinarios (MCO). Cada uno de estos marcos produce las mismas fórmulas y resultados. La única diferencia radica en la interpretación y los supuestos necesarios para que el método arroje resultados significativos. La elección del marco conceptual adecuado depende principalmente de la naturaleza de los datos disponibles y de la tarea de inferencia que se deba realizar.
Una de las diferencias de interpretación radica en si se deben tratar las variables explicativas como variables aleatorias o como constantes predefinidas. En el primer caso ( diseño aleatorio ) , las variables explicativas xᵢ son aleatorias y se muestrean junto con las yᵢ de una población determinada , como en un estudio observacional . Este enfoque permite un estudio más natural de las propiedades asintóticas de los estimadores. En la otra interpretación ( diseño fijo ), las variables explicativas X se tratan como constantes conocidas establecidas por un diseño , y y se muestrea condicionalmente a los valores de X, como en un experimento . Para fines prácticos, esta distinción suele ser irrelevante, ya que la estimación y la inferencia se realizan condicionando a X. Todos los resultados presentados en este artículo se enmarcan dentro del contexto del diseño aleatorio.
El modelo clásico se centra en la estimación e inferencia con "muestra finita", lo que significa que el número de observaciones n es fijo. Esto contrasta con otros enfoques, que estudian el comportamiento asintótico de MCO y en los que se analiza el comportamiento con un gran número de muestras. Para demostrar la insesgadez del estimador de MCO con muestra finita, se requieren las siguientes suposiciones.
Ejemplo de regresión polinómica cúbica, que es un tipo de regresión lineal. Aunque la regresión polinómica ajusta un modelo de curva a los datos, como problema de estimación estadística es lineal, en el sentido de que la función de esperanza condicionales lineal en los parámetros desconocidos que se estiman a partir de los datos . Por esta razón, la regresión polinómica se considera un caso especial de regresión lineal múltiple .
Exogeneidad . Los regresores no covarían con el término de error:Esto requiere, por ejemplo, que no existan variables omitidas que covarien con las variables observadas y afecten a la variable de respuesta. Una afirmación alternativa (pero más contundente) que suele ser necesaria al explicar la regresión lineal en estadística matemática es que las variables predictoras x pueden tratarse como valores fijos, en lugar de variables aleatorias . Esta formulación más contundente implica, por ejemplo, que se supone que las variables predictoras están libres de errores, es decir, que no están contaminadas por errores de medición. Si bien esta suposición no es realista en muchos contextos, su omisión conduce a modelos más complejos con errores en las variables , modelos de variables instrumentales y similares.
Linealidad o especificación correcta . Esto significa que la media de la variable de respuesta es una combinación lineal de los parámetros (coeficientes de regresión) y las variables predictoras. Cabe destacar que esta suposición es mucho menos restrictiva de lo que podría parecer a primera vista. Dado que las variables predictoras se tratan como valores fijos (véase más arriba), la linealidad es en realidad solo una restricción sobre los parámetros. Las variables predictoras en sí mismas pueden transformarse arbitrariamente, e incluso se pueden añadir múltiples copias de la misma variable predictora subyacente, cada una transformada de forma diferente. Esta técnica se utiliza, por ejemplo, en la regresión polinómica , que emplea la regresión lineal para ajustar la variable de respuesta como una función polinómica arbitraria (hasta un grado determinado) de una variable predictora. Con tanta flexibilidad, los modelos como la regresión polinómica suelen tener "demasiada potencia", ya que tienden a sobreajustar los datos. Por consiguiente, normalmente se debe utilizar algún tipo de regularización para evitar que el proceso de estimación dé lugar a soluciones irrazonables. Ejemplos comunes son la regresión de cresta y la regresión Lasso . También se puede utilizar la regresión lineal bayesiana , que por su naturaleza es prácticamente inmune al problema del sobreajuste. (De hecho, tanto la regresión de cresta como la regresión Lasso pueden considerarse casos especiales de la regresión lineal bayesiana, con tipos particulares de distribuciones a priori aplicadas a los coeficientes de regresión).
Visualización de la heterocedasticidad en un diagrama de dispersión frente a 100 valores ajustados aleatorios usando Matlab.Varianza constante u homocedasticidad . Esto significa que la varianza de los errores no depende de los valores de las variables predictoras:Por lo tanto, la variabilidad de las respuestas para valores fijos de las variables predictoras es la misma independientemente de cuán grandes o pequeñas sean las respuestas. Sin embargo, esto no suele ser así, ya que una variable con una media grande generalmente tendrá una varianza mayor que una con una media pequeña. Por ejemplo, una persona cuyos ingresos previstos son de $100,000 puede tener fácilmente ingresos reales de $80,000 o $120,000 (es decir, una desviación estándar de alrededor de $20,000), mientras que es improbable que otra persona con ingresos previstos de $10,000 tenga la misma desviación estándar de $20,000, ya que eso implicaría que sus ingresos reales podrían variar entre -$10,000 y $30,000. (De hecho, como esto muestra, en muchos casos —a menudo los mismos casos en los que falla el supuesto de errores con distribución normal— se debería predecir que la varianza o la desviación estándar son proporcionales a la media, en lugar de constantes). La ausencia de homocedasticidad se denomina heterocedasticidad . Para comprobar este supuesto, se puede examinar un gráfico de residuos frente a valores predichos (o los valores de cada predictor individual) para detectar un "efecto abanico" (es decir, una dispersión vertical que aumenta o disminuye al moverse de izquierda a derecha en el gráfico). También se puede examinar un gráfico de los residuos absolutos o al cuadrado frente a los valores predichos (o cada predictor) para detectar una tendencia o curvatura. También se pueden utilizar pruebas formales; véase Heterocedasticidad . La presencia de heterocedasticidad dará como resultado que se utilice una estimación "promedio" general de la varianza en lugar de una que tenga en cuenta la verdadera estructura de la varianza. Esto conduce a estimaciones de parámetros menos precisas (pero en el caso de mínimos cuadrados ordinarios , no sesgadas) y errores estándar sesgados, lo que da lugar a pruebas y estimaciones de intervalo engañosas. El error cuadrático medio del modelo también será incorrecto. Diversas técnicas de estimación, como los mínimos cuadrados ponderados y el uso de errores estándar consistentes con la heterocedasticidad, permiten abordar la heterocedasticidad de forma bastante general. También se pueden utilizar técnicas de regresión lineal bayesiana cuando se supone que la varianza es una función de la media. En algunos casos, también es posible solucionar el problema aplicando una transformación a la variable de respuesta (por ejemplo, ajustando el logaritmo de la variable de respuesta mediante un modelo de regresión lineal, lo que implica que la variable de respuesta tiene una distribución log-normal en lugar de una distribución normal ).
Para comprobar si se incumplen los supuestos de linealidad, varianza constante e independencia de los errores en un modelo de regresión lineal, los residuos se suelen representar gráficamente frente a los valores predichos (o a cada uno de los predictores individuales). Una dispersión aparentemente aleatoria de puntos alrededor de la línea media horizontal en 0 es ideal, pero no descarta ciertos tipos de incumplimientos, como la autocorrelación de los errores o su correlación con una o más covariables.
Falta de multicolinealidad perfecta en los predictores. Para los métodos de estimación de mínimos cuadrados estándar , la matriz de diseño X debe tener rango de columna completo p : [ 18 ]Si se incumple este supuesto, existe multicolinealidad perfecta en las variables predictoras, lo que significa que existe una relación lineal entre dos o más variables predictoras. La multicolinealidad puede deberse a la duplicación accidental de una variable en los datos, al uso de una transformación lineal de una variable junto con la original (por ejemplo, las mismas mediciones de temperatura expresadas en Fahrenheit y Celsius), o a la inclusión de una combinación lineal de múltiples variables en el modelo, como su media. También puede ocurrir si hay muy pocos datos disponibles en comparación con el número de parámetros a estimar (por ejemplo, menos puntos de datos que coeficientes de regresión). Las violaciones cercanas de este supuesto, donde los predictores están altamente pero no perfectamente correlacionados, pueden reducir la precisión de las estimaciones de los parámetros (véase Factor de inflación de la varianza ). En el caso de multicolinealidad perfecta, el vector de parámetros β no será identificable ; no tiene una solución única. En tal caso, solo algunos de los parámetros pueden identificarse (es decir, sus valores solo pueden estimarse dentro de algún subespacio lineal del espacio de parámetros completo R p ). Véase regresión de mínimos cuadrados parciales . Se han desarrollado métodos para ajustar modelos lineales con multicolinealidad, [ 19 ] [ 20 ] [ 21 ] [ 22 ] algunos de los cuales requieren supuestos adicionales como la "escasez de efectos", es decir, que una gran fracción de los efectos sean exactamente cero. Cabe señalar que los algoritmos iterativos para la estimación de parámetros, que son computacionalmente más costosos, como los utilizados en los modelos lineales generalizados , no presentan este problema.
Las violaciones de estos supuestos pueden dar lugar a estimaciones sesgadas de β , errores estándar sesgados, intervalos de confianza poco fiables y pruebas de significancia erróneas. Además de estos supuestos, varias otras propiedades estadísticas de los datos influyen notablemente en el rendimiento de los diferentes métodos de estimación:
La relación estadística entre los términos de error y las variables explicativas desempeña un papel importante a la hora de determinar si un procedimiento de estimación posee propiedades de muestreo deseables, como ser insesgado y consistente.
La disposición o distribución de probabilidad de las variables predictoras x tiene una gran influencia en la precisión de las estimaciones de β . El muestreo y el diseño de experimentos son subcampos muy desarrollados de la estadística que proporcionan orientación para recopilar datos de tal manera que se logre una estimación precisa de β .
Propiedades
Propiedades de muestra finita
En primer lugar, bajo el supuesto de exogeneidad estricta, los estimadores MCOy s 2 son insesgados , lo que significa que sus valores esperados coinciden con los valores verdaderos de los parámetros: [ 23 ] [prueba]
Si no se cumple la exogeneidad estricta (como ocurre con muchos modelos de series temporales , donde la exogeneidad se asume solo con respecto a las perturbaciones pasadas, pero no a las futuras), entonces estos estimadores estarán sesgados en muestras finitas.
En particular, el error estándar de cada coeficientees igual a la raíz cuadrada del j -ésimo elemento diagonal de esta matriz. La estimación de este error estándar se obtiene reemplazando la cantidad desconocida σ 2 con su estimación s 2 . Por lo tanto,
También se puede demostrar fácilmente que el estimadorno está correlacionado con los residuos del modelo: [ 24 ]
El teorema de Gauss-Markov establece que bajo el supuesto de errores esféricos (es decir, los errores deben ser no correlacionados y homocedásticos ) el estimadores eficiente en la clase de estimadores lineales insesgados. Esto se denomina el mejor estimador lineal insesgado (BLUE). La eficiencia debe entenderse como si fuéramos a encontrar algún otro estimador.que sería lineal en y y sin sesgo, entonces [ 24 ]
En el sentido de que se trata de una matriz semidefinida positiva . Este teorema establece la optimalidad únicamente en la clase de estimadores lineales insesgados, lo cual es bastante restrictivo. Dependiendo de la distribución de los términos de error ε , otros estimadores no lineales pueden ofrecer mejores resultados que el método de mínimos cuadrados ordinarios (MCO).
Suponiendo normalidad
Las propiedades enumeradas hasta ahora son válidas independientemente de la distribución subyacente de los términos de error. Sin embargo, si se asume que se cumple el supuesto de normalidad (es decir, que ε ~ N (0, σ 2 I n ) ), entonces se pueden enunciar propiedades adicionales de los estimadores MCO.
El estimadortiene una distribución normal, con media y varianza dadas anteriormente: [ 25 ]
Este estimador alcanza la cota de Cramér-Rao para el modelo y, por lo tanto, es óptimo en la clase de todos los estimadores insesgados. [ 17 ] Nótese que, a diferencia del teorema de Gauss-Markov , este resultado establece la optimalidad entre los estimadores lineales y no lineales, pero solo en el caso de términos de error con distribución normal.
La varianza de este estimador es igual a 2 σ 4 /( n − p ) , que no alcanza la cota de Cramér–Rao de 2 σ 4 / n . Sin embargo, se demostró que no existen estimadores insesgados de σ 2 con una varianza menor que la del estimador s 2 . [ 27 ] Si estamos dispuestos a permitir estimadores sesgados, y consideramos la clase de estimadores que son proporcionales a la suma de los residuos al cuadrado (SSR) del modelo, entonces el mejor estimador (en el sentido del error cuadrático medio ) en esta clase será ~ σ 2 = SSR / ( n − p + 2) , que incluso supera la cota de Cramér–Rao en el caso de que solo haya un regresor ( p = 1 ). [ 28 ]
Además, los estimadoresy s 2 son independientes , [ 29 ] hecho que resulta útil al construir las pruebas t y F para la regresión.
Observaciones influyentes
Como se mencionó anteriormente, el estimadores lineal en y , lo que significa que representa una combinación lineal de las variables dependientes y i . Los pesos en esta combinación lineal son funciones de los regresores X , y generalmente son desiguales. Las observaciones con pesos altos se denominan influyentes porque tienen un efecto más pronunciado en el valor del estimador.
Para analizar qué observaciones son influyentes, eliminamos una observación j específica y consideramos cuánto van a cambiar las cantidades estimadas (de forma similar al método jackknife ). Se puede demostrar que el cambio en el estimador OLS para β será igual a [ 30 ].
donde h j = x j T ( X T X ) −1 x j es el j -ésimo elemento diagonal de la matriz sombrero P , y x j es el vector de regresores correspondiente a la j -ésima observación. De manera similar, el cambio en el valor predicho para la j -ésima observación resultante de omitir esa observación del conjunto de datos será igual a [ 30 ]
De las propiedades de la matriz de sombrero, 0 ≤ h j ≤ 1 , y su suma es p , de modo que en promedio h j ≈ p/n . Estas cantidades h j se denominan palancas , y las observaciones con h j alto se denominan puntos de palanca . [ 31 ] Por lo general, las observaciones con palanca alta deben examinarse con más cuidado, en caso de que sean erróneas, valores atípicos o de alguna otra manera atípicas con respecto al resto del conjunto de datos.
Regresión particionada
A veces, las variables y los parámetros correspondientes en la regresión se pueden dividir lógicamente en dos grupos, de modo que la regresión tome forma
donde X 1 y X 2 tienen dimensiones n × p 1 , n × p 2 , y β 1 , β 2 son vectores p 1 ×1 y p 2 ×1, con p 1 + p 2 = p .
El teorema de Frisch-Waugh-Lovell establece que en esta regresión los residuosy la estimación MCOserán numéricamente idénticos a los residuos y a la estimación MCO para β 2 en la siguiente regresión: [ 32 ]
El teorema puede utilizarse para establecer diversos resultados teóricos. Por ejemplo, realizar una regresión con una constante y otra variable explicativa equivale a restar las medias de la variable dependiente y de la variable explicativa, y luego ejecutar la regresión con las variables sin la media, pero sin el término constante.
Propiedades de muestras grandes
Los estimadores de mínimos cuadrados son estimaciones puntuales de los parámetros β del modelo de regresión lineal . Sin embargo, generalmente también queremos saber qué tan cerca pueden estar esas estimaciones de los valores reales de los parámetros. En otras palabras, queremos construir las estimaciones de intervalo .
Dado que no hemos hecho ninguna suposición sobre la distribución del término de error ε i , es imposible inferir la distribución de los estimadores.ySin embargo, podemos aplicar el teorema del límite central para derivar sus propiedades asintóticas cuando el tamaño de la muestra n tiende a infinito. Si bien el tamaño de la muestra es necesariamente finito, es habitual suponer que n es lo suficientemente grande como para que la distribución verdadera del estimador MCO se aproxime a su límite asintótico.
Podemos demostrar que, bajo los supuestos del modelo, el estimador de mínimos cuadrados para β es consistente (es decir,converge en probabilidad a β ) y asintóticamente normal: [prueba]
dónde
Inferencia
Utilizando esta distribución asintótica, obtenga intervalos de confianza bilaterales aproximados para el j -ésimo componente del vectorpuede construirse como
al nivel de confianza 1 − α ,
donde q denota la función cuantil de la distribución normal estándar, y [·] jj es el j -ésimo elemento diagonal de una matriz.
De manera similar, el estimador de mínimos cuadrados para σ 2 también es consistente y asintóticamente normal (siempre que exista el cuarto momento de ε i ) con distribución límite
Estas distribuciones asintóticas pueden utilizarse para predicción, prueba de hipótesis, construcción de otros estimadores, etc. Como ejemplo, consideremos el problema de la predicción. Supongamos quees algún punto dentro del dominio de distribución de los regresores, y se quiere saber cuál habría sido la variable de respuesta en ese punto. La respuesta media es la cantidad, mientras que la respuesta prevista es. Claramente, la respuesta prevista es una variable aleatoria, su distribución se puede derivar de la de:
lo que permite construir intervalos de confianza para la respuesta media.por construir:
con un nivel de confianza de 1 − α .
Prueba de hipótesis
Dos pruebas de hipótesis son particularmente utilizadas. En primer lugar, se busca determinar si la ecuación de regresión estimada es mejor que simplemente predecir que todos los valores de la variable de respuesta son iguales a su media muestral (de lo contrario, se dice que carece de poder explicativo). La hipótesis nula de que la regresión estimada no tiene valor explicativo se contrasta mediante una prueba F. Si el valor F calculado es lo suficientemente grande como para superar su valor crítico para el nivel de significancia preestablecido, se rechaza la hipótesis nula y se acepta la hipótesis alternativa , es decir, que la regresión tiene poder explicativo. En caso contrario, se acepta la hipótesis nula de que no tiene poder explicativo.
En segundo lugar, para cada variable explicativa de interés, se busca determinar si su coeficiente estimado difiere significativamente de cero; es decir, si dicha variable explicativa tiene poder predictivo sobre la variable de respuesta. En este caso, la hipótesis nula es que el coeficiente verdadero es cero. Esta hipótesis se contrasta calculando el estadístico t del coeficiente , como la razón entre la estimación del coeficiente y su error estándar . Si el estadístico t es mayor que un valor predeterminado, se rechaza la hipótesis nula y se concluye que la variable tiene poder explicativo, con un coeficiente significativamente distinto de cero. En caso contrario, se acepta la hipótesis nula de que el coeficiente verdadero es cero.
Además, la prueba de Chow se utiliza para comprobar si dos submuestras tienen los mismos coeficientes reales subyacentes. La suma de los residuos al cuadrado de las regresiones en cada uno de los subconjuntos y en el conjunto de datos combinado se compara calculando un estadístico F; si este supera un valor crítico, se rechaza la hipótesis nula de que no existen diferencias entre los dos subconjuntos; de lo contrario, se acepta.
Todavía requerimos que los regresores sean estrictamente exógenos : E[ x i ε i ] = 0 para todo i = 1, ..., n . Si solo están predeterminados , MCO está sesgado en una muestra finita;
Finalmente, los supuestos sobre la varianza toman la forma de requerir que { x i ε i } sea una secuencia de diferencias de martingala , con una matriz finita de segundos momentos Q xxε ² = E[ ε i 2 x i x i T ] .
Estimación restringida
Supongamos que se sabe que los coeficientes de la regresión satisfacen un sistema de ecuaciones lineales.
donde Q es una matriz p × q de rango completo, y c es un vector q × 1 de constantes conocidas, donde q < p . En este caso, la estimación por mínimos cuadrados es equivalente a minimizar la suma de los residuos al cuadrado del modelo sujeto a la restricción A. El estimador de mínimos cuadrados restringidos (CLS) se puede dar mediante una fórmula explícita: [ 34 ]
Esta expresión para el estimador restringido es válida siempre que la matriz X T X sea invertible. Desde el principio de este artículo se asumió que esta matriz tiene rango completo, y se observó que cuando falla la condición de rango, β no será identificable. Sin embargo, puede ocurrir que al añadir la restricción A β sea identificable, en cuyo caso se desearía encontrar la fórmula para el estimador. El estimador es igual a [ 35 ].
donde R es una matriz p × ( p − q ) tal que la matriz [ QR ] es no singular y R T Q = 0. Dicha matriz siempre se puede encontrar, aunque generalmente no es única. La segunda fórmula coincide con la primera en el caso de que X T X sea invertible. [ 35 ]
Ejemplo con datos reales
El siguiente conjunto de datos proporciona las alturas y pesos promedio de las mujeres estadounidenses de entre 30 y 39 años (fuente: The World Almanac and Book of Facts, 1975 ).
Cuando se modela una sola variable dependiente, un diagrama de dispersión sugiere la forma y la fuerza de la relación entre la variable dependiente y los regresores. También puede revelar valores atípicos, heterocedasticidad y otros aspectos de los datos que pueden complicar la interpretación de un modelo de regresión ajustado. El diagrama de dispersión sugiere que la relación es fuerte y puede aproximarse como una función cuadrática . El método de mínimos cuadrados ordinarios ( MCO) puede manejar relaciones no lineales introduciendo el regresor ALTURA² . El modelo de regresión se convierte entonces en un modelo lineal múltiple.
La columna Valor proporciona las estimaciones de mínimos cuadrados de los parámetros β j
La columna "Error estándar" muestra los errores estándar de cada estimación de coeficiente:
Las columnas de estadístico t y valor p prueban si alguno de los coeficientes puede ser igual a cero. El estadístico t se calcula simplemente comoSi los errores ε siguen una distribución normal, t sigue una distribución t de Student. En condiciones menos estrictas, t es asintóticamente normal. Valores grandes de t indican que se puede rechazar la hipótesis nula y que el coeficiente correspondiente no es cero. La segunda columna, valor p , expresa los resultados de la prueba de hipótesis como un nivel de significancia . Por convención, los valores p menores que 0,05 se consideran evidencia de que el coeficiente poblacional es distinto de cero.
El coeficiente de determinación (R²) indica la bondad de ajuste de la regresión. Este estadístico será igual a uno si el ajuste es perfecto y cero si las variables explicativas X no tienen ningún poder explicativo. Se trata de una estimación sesgada del R² poblacional , y nunca disminuirá si se añaden variables explicativas adicionales, incluso si son irrelevantes.
El R cuadrado ajustado es una versión ligeramente modificada de, diseñado para penalizar el número excesivo de regresores que no contribuyen al poder explicativo de la regresión. Esta estadística siempre es menor que, puede disminuir a medida que se agregan nuevos regresores, e incluso ser negativo para modelos que se ajustan mal:
La log-verosimilitud se calcula bajo el supuesto de que los errores siguen una distribución normal. Si bien este supuesto no es del todo razonable, esta estadística aún puede resultar útil para realizar pruebas de razón de verosimilitud.
La prueba estadística de Durbin-Watson determina si existe correlación serial entre los residuos. Como regla general, un valor menor que 2 indica una correlación positiva.
El error estándar de regresión es una estimación de σ , el error estándar del término de error.
La suma total de cuadrados , la suma de cuadrados del modelo y la suma residual de cuadrados nos indican qué parte de la variación inicial en la muestra fue explicada por la regresión.
El estadístico F intenta contrastar la hipótesis de que todos los coeficientes (excepto el término independiente) son iguales a cero. Este estadístico sigue una distribución F ( p–1 , n–p ) bajo la hipótesis nula y el supuesto de normalidad, y su valor p indica la probabilidad de que la hipótesis sea verdadera. Cabe destacar que, cuando los errores no siguen una distribución normal, este estadístico deja de ser válido y deben utilizarse otras pruebas, como la prueba de Wald o la prueba de razón de verosimilitud (LR) .
Gráfico de residuos
El análisis de mínimos cuadrados ordinarios suele incluir el uso de gráficos de diagnóstico diseñados para detectar desviaciones de los datos respecto a la forma supuesta del modelo. Estos son algunos de los gráficos de diagnóstico más comunes:
Residuos frente a las variables explicativas del modelo. Una relación no lineal entre estas variables sugiere que la linealidad de la función de media condicional podría no cumplirse. Los diferentes niveles de variabilidad en los residuos para distintos niveles de las variables explicativas sugieren una posible heterocedasticidad.
Residuos frente a variables explicativas no incluidas en el modelo. Cualquier relación entre los residuos y estas variables sugeriría considerar su inclusión en el modelo.
Residuos frente a los valores ajustados,.
Residuos comparados con el residuo precedente. Este gráfico puede identificar correlaciones seriales en los residuos.
Un aspecto importante a considerar al realizar inferencias estadísticas mediante modelos de regresión es cómo se muestrearon los datos. En este ejemplo, los datos son promedios, no mediciones individuales de mujeres. El ajuste del modelo es muy bueno, pero esto no implica que el peso de una mujer pueda predecirse con gran precisión basándose únicamente en su estatura.
Sensibilidad al redondeo
Este ejemplo también demuestra que los coeficientes determinados por estos cálculos son sensibles a la forma en que se preparan los datos. Las alturas se dieron originalmente redondeadas a la pulgada más cercana y se convirtieron y redondearon al centímetro más cercano. Dado que el factor de conversión es de una pulgada a 2,54 cm, esta no es una conversión exacta. Las pulgadas originales se pueden recuperar con la función Round(x/0,0254) y luego reconvertir a unidades métricas sin redondear. Si se realiza esto, los resultados son:
Residuos de un ajuste cuadrático para datos convertidos correcta e incorrectamente.
Al utilizar cualquiera de estas ecuaciones para predecir el peso de una mujer de 1,6764 m (5' 6"), se obtienen valores similares: 62,94 kg con redondeo frente a 62,98 kg sin redondeo. Por lo tanto, una variación aparentemente pequeña en los datos tiene un efecto real en los coeficientes, pero un efecto mínimo en los resultados de la ecuación.
Si bien esto puede parecer inocuo en el centro del rango de datos, podría volverse significativo en los extremos o en el caso de que el modelo ajustado se utilice para proyectar fuera del rango de datos ( extrapolación ).
Esto pone de manifiesto un error común: este ejemplo constituye un abuso del método de mínimos cuadrados ordinarios (MCO), que inherentemente exige que los errores en la variable independiente (en este caso, la altura) sean cero o, al menos, insignificantes. El redondeo inicial a la pulgada más cercana, sumado a cualquier error de medición real, constituye un error finito y no insignificante. En consecuencia, los parámetros ajustados no son las mejores estimaciones que se suponen. Si bien no es totalmente erróneo, el error en la estimación dependerá de la magnitud relativa de los errores en los ejes x e y .
Otro ejemplo con menos datos reales
Planteamiento del problema
Podemos utilizar el mecanismo de mínimos cuadrados para calcular la ecuación de una órbita de dos cuerpos en coordenadas polares. La ecuación que se suele utilizar es:dóndees el radio que indica la distancia del objeto a uno de los cuerpos. En la ecuación, los parámetrosyse utilizan para determinar la trayectoria de la órbita. Hemos medido los siguientes datos.
Necesitamos encontrar la aproximación de mínimos cuadrados deypara los datos proporcionados.
Solución
Primero necesitamos representar e y p en forma lineal. Así que vamos a reescribir la ecuación.como.
Además, se podría instalar un ábside ampliandocon un parámetro adicional como, que es lineal en ambosy en la función base adicional.
Utilizamos la forma original de dos parámetros para representar nuestros datos de observación de la siguiente manera:
dónde:
;;contiene los coeficientes deen la primera columna, que son todos 1, y los coeficientes deen la segunda columna, dada por; y, de tal manera que:
↑ Ghilani, Charles D.; Wolf, Paul R. (12 de junio de 2006). Adjustment Computations: Spatial Data Analysis . John Wiley & Sons. ISBN9780471697282.
↑ Hofmann-Wellenhof, Bernhard; Lichtenegger, Herbert; Wasle, Elmar (20 de noviembre de 2007). GNSS: sistemas globales de navegación por satélite: GPS, GLONASS, Galileo y más . Saltador. ISBN9783211730171.
↑ Xu, Guochang (5 de octubre de 2007). GPS: Teoría, algoritmos y aplicaciones . Springer. ISBN9783540727156.
↑ Hoaglin, David C.; Welsch, Roy E. (1978). "La matriz de sombrero en regresión y ANOVA" . The American Statistician . 32 (1): 17– 22. doi : 10.1080/00031305.1978.10479237 . hdl : 1721.1/1920 . ISSN 0003-1305 .
↑ Julian Faraway (2000), Regresión práctica y ANOVA usando R
↑ Kenney, J.; Keeping, ES (1963). Matemáticas de la estadística . van Nostrand. pág. 187.
↑ Tibshirani, Robert (1996). "Regresión, contracción y selección mediante el método Lasso". Journal of the Royal Statistical Society, Serie B. 58 ( 1): 267– 288. doi : 10.1111/j.2517-6161.1996.tb02080.x . JSTOR 2346178 .
↑ Efron, Bradley; Hastie, Trevor; Johnstone, Iain; Tibshirani, Robert (2004). "Regresión de ángulo mínimo". The Annals of Statistics . 32 (2): 407– 451. arXiv : math/0406456 . doi : 10.1214/009053604000000067 . JSTOR 3448465 . S2CID 204004121 .
↑ Hawkins, Douglas M. (1973). "Sobre la investigación de regresiones alternativas mediante análisis de componentes principales". Journal of the Royal Statistical Society, Serie C. 22 ( 3): 275– 286. doi : 10.2307/2346776 . JSTOR 2346776 .
↑ Jolliffe, Ian T. (1982). "Una nota sobre el uso de componentes principales en la regresión". Journal of the Royal Statistical Society, Serie C. 31 ( 3): 300– 303. doi : 10.2307/2348005 . JSTOR 2348005 .
1 2 Davidson, Russell; MacKinnon, James G. (1993). Estimación e inferencia en econometría . Nueva York: Oxford University Press. pág. 33. ISBN0-19-506011-3.
Hill, R. Carter; Griffiths, William E.; Lim, Guay C. (2008). Principios de econometría (3.ª ed.). Hoboken, NJ: John Wiley & Sons. pp. 8–47 . ISBN978-0-471-72360-8.
Wooldridge, Jeffrey (2008). «El modelo de regresión simple» . Econometría introductoria: un enfoque moderno (4.ª ed.). Mason, OH: Cengage Learning. pp. 22–67 . ISBN978-0-324-58162-1.
Categorías :
estadística paramétrica
Mínimos cuadrados
Categorías ocultas:
Artículos con breve descripción
La breve descripción coincide con Wikidata.
Errores de CS1: Fecha del ISBN
Todos los artículos con afirmaciones sin fuentes
Artículos con afirmaciones sin fuentes de febrero de 2010
Artículos que se ampliarán a partir de febrero de 2017.