Articulo de referencia

mínimos cuadrados ponderados

Los mínimos cuadrados ponderados ( WLS ), también conocidos como regresión lineal ponderada , [ 1 ] [ 2 ] son ​​una generalización de los mínimos cuadrados ordinarios y la regre...

Los mínimos cuadrados ponderados ( WLS ), también conocidos como regresión lineal ponderada , [ 1 ] [ 2 ] son ​​una generalización de los mínimos cuadrados ordinarios y la regresión lineal en la que se incorpora a la regresión el conocimiento de la varianza desigual de las observaciones ( heterocedasticidad ). Los WLS son también una especialización de los mínimos cuadrados generalizados , cuando todos los elementos fuera de la diagonal de la matriz de covarianza de los errores son nulos.

Formulación

El ajuste de un modelo a un punto de datos se mide por su residuo ,ri{\displaystyle r_{i}}, definida como la diferencia entre un valor medido de la variable dependiente,yi{\displaystyle y_{i}}y el valor predicho por el modelo,F(incógnitai,β){\displaystyle f(x_{i},{\boldsymbol {\beta }})}: ri(β)=yiF(incógnitai,β).{\displaystyle r_{i}({\boldsymbol {\beta }})=y_{i}-f(x_{i},{\boldsymbol {\beta }}).}

Si los errores no están correlacionados y tienen varianza igual, entonces la función S(β)=iri(β)2,{\displaystyle S({\boldsymbol {\beta }})=\sum _{i}r_{i}({\boldsymbol {\beta }})^{2},} se minimiza enβ^{\displaystyle {\boldsymbol {\sombrero {\beta }}}}, de tal manera queSβj(β^)=0{\displaystyle {\frac {\partial S}{\partial \beta _{j}}}({\hat {\boldsymbol {\beta }}})=0}.

El teorema de Gauss-Markov muestra que, cuando esto es así,β^{\displaystyle {\sombrero {\boldsymbol {\beta }}}}es un estimador lineal insesgado óptimo ( BLUE ). Sin embargo, si las mediciones no están correlacionadas pero tienen diferentes incertidumbres, se podría adoptar un enfoque modificado. Aitken demostró que cuando se minimiza una suma ponderada de residuos al cuadrado,β^{\displaystyle {\sombrero {\boldsymbol {\beta }}}}es AZUL si cada peso es igual al recíproco de la varianza de la medición S=i=1norteWiiri2,Wii=1σi2{\displaystyle {\begin{aligned}S&=\sum _{i=1}^{n}W_{ii}{r_{i}}^{2},&W_{ii}&={\frac {1}{{\sigma _{i}}^{2}}}\end{aligned}}}

Las ecuaciones de gradiente para esta suma de cuadrados son 2iWiiF(incógnitai,β)βjri=0,j=1,,metro{\displaystyle -2\sum _{i}W_{ii}{\frac {\partial f(x_{i},{\boldsymbol {\beta }})}{\partial \beta _{j}}}r_{i}=0,\quad j=1,\ldots ,m}

que, en un sistema de mínimos cuadrados lineales, dan las ecuaciones normales modificadas , i=1nortek=1metroincógnitaijWiiincógnitaikβ^k=i=1norteincógnitaijWiiyi,j=1,,metro.{\displaystyle \sum _{i=1}^{n}\sum _{k=1}^{m}X_{ij}W_{ii}X_{ik}{\hat {\beta }}_{k}=\sum _{i=1}^{n}X_{ij}W_{ii}y_{i},\quad j=1,\ldots ,m\,.} La matrizincógnita{\displaystyle X}Lo anterior se define en la discusión correspondiente sobre mínimos cuadrados lineales .

Cuando los errores de observación no están correlacionados y la matriz de ponderación , W = Ω −1 , es diagonal, estos pueden escribirse como (incógnitaTWincógnita)β^=incógnitaTWy.{\displaystyle \mathbf {\left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}Wy} .}

Si los errores están correlacionados, el estimador resultante es el BLUE si la matriz de ponderación es igual a la inversa de la matriz de varianza-covarianza de las observaciones.

Cuando los errores no están correlacionados, es conveniente simplificar los cálculos factorizando la matriz de pesos comowii=Wii{\displaystyle w_{ii}={\sqrt {W_{ii}}}}Las ecuaciones normales se pueden escribir entonces de la misma forma que los mínimos cuadrados ordinarios: (incógnitaTincógnita)β^=incógnitaTy{\displaystyle \mathbf {\left(X'^{\textsf {T}}X'\right){\hat {\boldsymbol {\beta }}}=X'^{\textsf {T}}y'} \,}

donde definimos la siguiente matriz y vector escalados: incógnita=diagnóstico(w)incógnita,y=diagnóstico(w)y=yσ.{\displaystyle {\begin{aligned}\mathbf {X'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {X} ,\\\mathbf {y'} &=\operatorname {diag} \left(\mathbf {w} \right)\mathbf {y} =\mathbf {y} \oslash \mathbf {\sigma } .\end{aligned}}}

Este es un tipo de transformación blanqueadora ; la última expresión implica una división por entradas .

Para sistemas de mínimos cuadrados no lineales, un argumento similar muestra que las ecuaciones normales deben modificarse de la siguiente manera. (JTWJ)Δβ=JTWΔy.{\displaystyle \mathbf {\left(J^{\textsf {T}}WJ\right)\,{\boldsymbol {\Delta }}\beta =J^{\textsf {T}}W\,{\boldsymbol {\Delta }}y} .\,}

Cabe señalar que, para las pruebas empíricas, el valor de W apropiado no se conoce con certeza y debe estimarse. Para ello, se pueden utilizar técnicas de mínimos cuadrados generalizados factibles (FGLS); en este caso, se especializan para una matriz de covarianza diagonal, lo que da como resultado una solución de mínimos cuadrados ponderados factibles.

Si la incertidumbre de las observaciones no se conoce a partir de fuentes externas, entonces los pesos podrían estimarse a partir de las observaciones dadas. Esto puede ser útil, por ejemplo, para identificar valores atípicos. Después de eliminar los valores atípicos del conjunto de datos, los pesos deben restablecerse a uno. [ 3 ]

Motivación

En algunos casos, las observaciones pueden estar ponderadas; por ejemplo, pueden no ser igualmente fiables. En este caso, se puede minimizar la suma ponderada de los cuadrados: argramo metroinorteβi=1nortewi|yij=1metroincógnitaijβj|2=argramo metroinorteβW12(yincógnitaβ)2.{\displaystyle {\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\sum _{i=1}^{n}w_{i}\left|y_{i}-\sum _{j=1}^{m}X_{ij}\beta _{j}\right|^{2}={\underset {\boldsymbol {\beta }}{\operatorname {arg\ min} }}\,\left\|W^{\frac {1}{2}}\left(\mathbf {y} -X{\boldsymbol {\beta }}\right)\right\|^{2}.} donde w i > 0 es el peso de la i- ésima observación, y W es la matriz diagonal de dichos pesos.

Los pesos deberían, idealmente, ser iguales al recíproco de la varianza de la medición. (Esto implica que las observaciones no están correlacionadas. Si las observaciones están correlacionadas , la expresiónS=kjrkWkjrj{\textstyle S=\sum _ {k} \ sum _ {j}r_ {k} W_ {kj} r_ {j} \,}Se aplica. En este caso, la matriz de ponderación idealmente debería ser igual a la inversa de la matriz de varianza-covarianza de las observaciones). [ 3 ] Las ecuaciones normales son entonces: (incógnitaTWincógnita)β^=incógnitaTWy.{\displaystyle \left(X^{\textsf {T}}WX\right){\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} .}

Este método se utiliza en el método de mínimos cuadrados ponderados iterativamente .

Solución

Errores de parámetros y correlación

Los valores de los parámetros estimados son combinaciones lineales de los valores observados. β^=(incógnitaTWincógnita)1incógnitaTWy.{\displaystyle {\hat {\boldsymbol {\beta }}}=(X^{\textsf {T}}WX)^{-1}X^{\textsf {T}}W\mathbf {y} .}

Por lo tanto, se puede obtener una expresión para la matriz de varianza-covarianza estimada de las estimaciones de los parámetros mediante la propagación de errores a partir de los errores en las observaciones. Sea M la matriz de varianza-covarianza para las observaciones y M β la de los parámetros estimados . Entonces METROβ=(incógnitaTWincógnita)1incógnitaTWMETROWTincógnita(incógnitaTWTincógnita)1.{\displaystyle M^{\beta }=\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}WMW^{\textsf {T}}X\left(X^{\textsf {T}}W^{\textsf {T}}X\right)^{-1}.}

Cuando W = M −1 , esto se simplifica a METROβ=(incógnitaTWincógnita)1.{\displaystyle M^{\beta }=\left(X^{\textsf {T}}WX\right)^{-1}.}

Cuando se utilizan ponderaciones unitarias ( W = I , la matriz identidad ), se sobreentiende que los errores experimentales no están correlacionados y son todos iguales: M = σ²I , donde σ² es la varianza a priori de una observación. En cualquier caso, σ² se aproxima mediante el chi -cuadrado reducido .χν2{\displaystyle \chi _{\nu }^{2}}: METROβ=χν2(incógnitaTWincógnita)1,χν2=S/ν,{\displaystyle {\begin{aligned}M^{\beta }&=\chi _{\nu }^{2}\left(X^{\textsf {T}}WX\right)^{-1},\\\chi _{\nu }^{2}&=S/\nu ,\end{aligned}}}

donde S es el valor mínimo de la función objetivo ponderada : S=rTWr=W12(yincógnitaβ^)2.{\displaystyle S=r^{\textsf {T}}Wr=\left\|W^{\frac {1}{2}}\left(\mathbf {y} -X{\hat {\boldsymbol {\beta }}}\right)\right\|^{2}.}

El denominador,ν=nortemetro{\displaystyle \nu =n-m}, es el número de grados de libertad ; véase grados de libertad efectivos para generalizaciones en el caso de observaciones correlacionadas.

En todos los casos, la varianza de la estimación del parámetroβ^i{\displaystyle {\hat {\beta }}_{i}}es dado porMETROiiβ{\displaystyle M_{ii}^{\beta }}y la covarianza entre las estimaciones de los parámetrosβ^i{\displaystyle {\hat {\beta }}_{i}}yβ^j{\displaystyle {\hat {\beta }}_{j}}es dado porMETROijβ{\displaystyle M_{ij}^{\beta }}La desviación estándar es la raíz cuadrada de la varianza.σi=METROiiβ{\displaystyle \sigma _{i}={\sqrt {M_{ii}^{\beta }}}}y el coeficiente de correlación viene dado porρij=METROijβ/(σiσj){\displaystyle \rho _{ij}=M_{ij}^{\beta }/(\sigma _{i}\sigma _{j})}Estas estimaciones de error reflejan únicamente errores aleatorios en las mediciones. La verdadera incertidumbre en los parámetros es mayor debido a la presencia de errores sistemáticos , que, por definición, no pueden cuantificarse. Cabe señalar que, si bien las observaciones pueden no estar correlacionadas, los parámetros suelen estar correlacionados .

Límites de confianza de los parámetros

A menudo se asume , a falta de evidencia concreta pero recurriendo frecuentemente al teorema del límite central —véase Distribución normal#Ocurrencia y aplicaciones— que el error en cada observación pertenece a una distribución normal con una media de cero y desviación estándarσ{\displaystyle \sigma }Bajo esa suposición, se pueden derivar las siguientes probabilidades para una estimación de un único parámetro escalar en términos de su error estándar estimado.smiβ{\displaystyle se_{\beta }}(presentado aquí ):

  • 68% que el intervaloβ^±smiβ{\displaystyle {\hat {\beta }}\pm se_{\beta }}abarca el verdadero valor del coeficiente
  • 95% de que el intervaloβ^±2smiβ{\displaystyle {\hat {\beta }}\pm 2se_{\beta }}abarca el verdadero valor del coeficiente
  • 99% de que el intervaloβ^±2.5smiβ{\displaystyle {\hat {\beta }}\pm 2.5se_{\beta }}abarca el verdadero valor del coeficiente

La suposición no es descabellada cuando n  >> m . Si los errores experimentales se distribuyen normalmente, los parámetros pertenecerán a una distribución t de Student con nm grados de libertad . Cuando nm, la distribución t de Student se aproxima a una distribución normal. Sin embargo, cabe señalar que estos límites de confianza no pueden tener en cuenta el error sistemático. Además, los errores de los parámetros deben citarse con una sola cifra significativa, ya que están sujetos a error de muestreo . [ 4 ]     

Cuando el número de observaciones es relativamente pequeño, la desigualdad de Chebyshev puede utilizarse como límite superior para las probabilidades, independientemente de cualquier suposición sobre la distribución de los errores experimentales: las probabilidades máximas de que un parámetro se desvíe más de 1, 2 o 3 desviaciones estándar de su valor esperado son del 100%, 25% y 11% respectivamente.

Valores residuales y correlación

Los residuos están relacionados con las observaciones por r^=yincógnitaβ^=yHy=(IH)y,{\displaystyle \mathbf {\hat {r}} =\mathbf {y} -X{\hat {\boldsymbol {\beta }}}=\mathbf {y} -H\mathbf {y} =(I-H)\mathbf {y} ,}

donde H es la matriz idempotente conocida como matriz sombrero : H=incógnita(incógnitaTWincógnita)1incógnitaTW,{\displaystyle H=X\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W,}

y I es la matriz identidad . La matriz de varianza-covarianza de los residuos, M r, viene dada por METROr=(IH)METRO(IH)T.{\displaystyle M^{\mathbf {r} }=(I-H)M(I-H)^{\textsf {T}}.}

Por lo tanto, los residuos están correlacionados, incluso si las observaciones no lo están.

CuandoW=METRO1{\displaystyle W=M^{-1}}, METROr=(IH)METRO.{\displaystyle M^{\mathbf {r} }=(I-H)M.}

La suma de los valores residuales ponderados es igual a cero siempre que la función del modelo contenga un término constante. Multiplique por la izquierda la expresión de los residuos por X T W T : incógnitaTWr^=incógnitaTWyincógnitaTWincógnitaβ^=incógnitaTWy(incógnitaTWincógnita)(incógnitaTWincógnita)1incógnitaTWy=0.{\displaystyle X^{\textsf {T}}W{\hat {\mathbf {r} }}=X^{\textsf {T}}W\mathbf {y} -X^{\textsf {T}}WX{\hat {\boldsymbol {\beta }}}=X^{\textsf {T}}W\mathbf {y} -\left(X^{\rm {T}}WX\right)\left(X^{\textsf {T}}WX\right)^{-1}X^{\textsf {T}}W\mathbf {y} =\mathbf {0} .}

Digamos, por ejemplo, que el primer término del modelo es una constante, de modo queincógnitai1=1{\displaystyle X_{i1}=1}para todo i . En ese caso se deduce que imetroincógnitai1Wir^i=imetroWir^i=0.{\displaystyle \sum _{i}^{m}X_{i1}W_{i}{\hat {r}}_{i}=\sum _{i}^{m}W_{i}{\hat {r}}_{i}=0.}

Así pues, en el ejemplo motivacional anterior, el hecho de que la suma de los valores residuales sea igual a cero no es accidental, sino que es consecuencia de la presencia del término constante α en el modelo.

Si el error experimental sigue una distribución normal , entonces, debido a la relación lineal entre los residuos y las observaciones, los residuos también deberían seguirla [ 5 ]. Sin embargo, dado que las observaciones son solo una muestra de la población de todas las observaciones posibles, los residuos deberían pertenecer a una distribución t de Student . Los residuos estudentizados son útiles para realizar una prueba estadística de un valor atípico cuando un residuo en particular parece ser excesivamente grande.

Véase también

Referencias

  1. "Regresión ponderada" . Archivado del original el 21/04/2022 . Consultado el 16/10/2018 .
  2. "Visualizar una regresión ponderada" .
  3. 1 2 Strutz, T. (2016). "3". Ajuste de datos e incertidumbre (Una introducción práctica a los mínimos cuadrados ponderados y más allá) . Springer Vieweg. ISBN 978-3-658-11455-8.
  4. Mandel, John (1964). El análisis estadístico de datos experimentales . Nueva York: Interscience.
  5. Mardia, KV; Kent, JT; Bibby, JM (1979). Análisis multivariante . Nueva York: Academic Press. ISBN 0-12-471250-9.