Articulo de referencia

mínimos cuadrados lineales

El método de mínimos cuadrados lineales ( LLS ) es la aproximación por mínimos cuadrados de funciones lineales a datos. Consiste en un conjunto de formulaciones para resolver pr...

El método de mínimos cuadrados lineales ( LLS ) es la aproximación por mínimos cuadrados de funciones lineales a datos. Consiste en un conjunto de formulaciones para resolver problemas estadísticos relacionados con la regresión lineal , incluyendo variantes para residuos ordinarios (no ponderados), ponderados y generalizados (correlacionados) . Los métodos numéricos para mínimos cuadrados lineales incluyen la inversión de la matriz de ecuaciones normales y métodos de descomposición ortogonal .

Formulación básica

Consideremos la ecuación lineal

dóndeARmetro×norte{\displaystyle A\in \mathbb {R} ^{m\times n}}ybRmetro{\displaystyle b\in \mathbb {R} ^{m}}se dan yincógnitaRnorte{\displaystyle x\in \mathbb {R} ^{n}}es una variable que se va a calcular. Cuandometro>norte,{\displaystyle m>n,}Generalmente es el caso que ( 1 ) no tiene solución. Por ejemplo, no hay ningún valor deincógnita{\displaystyle x}que satisface [100111]incógnita=[110],{\displaystyle {\begin{bmatrix}1&0\\0&1\\1&1\end{bmatrix}}x={\begin{bmatrix}1\\1\\0\end{bmatrix}},} porque las dos primeras filas requieren queincógnita=(1,1),{\displaystyle x=(1,1),}pero entonces la tercera fila no se satisface. Por lo tanto, parametro>norte,{\displaystyle m>n,}El objetivo de resolver ( 1 ) exactamente se reemplaza típicamente por encontrar el valor deincógnita{\displaystyle x}que minimiza algún error. Hay muchas maneras de definir el error, pero una de las más comunes es definirlo comoAincógnitab2.{\displaystyle \|Ax-b\|^{2}.} Esto genera un problema de minimización, llamado problema de mínimos cuadrados.

La solución al problema de mínimos cuadrados ( 1 ) se calcula resolviendo la ecuación normal [ 1 ].

dóndeA{\displaystyle A^{\top }}denota la transpuesta deA{\displaystyle A}.

Continuando con el ejemplo anterior, con A=[100111]yb=[110],{\displaystyle A={\begin{bmatrix}1&0\\0&1\\1&1\end{bmatrix}}\quad {\text{y}}\quad b={\begin{bmatrix}1\\1\\0\end{bmatrix}},} encontramos AA=[101011][100111]=[2112]{\displaystyle A^{\top }A={\begin{bmatrix}1&0&1\\0&1&1\end{bmatrix}}{\begin{bmatrix}1&0\\0&1\\1&1\end{bmatrix}}={\begin{bmatrix}2&1\\1&2\end{bmatrix}}} y Ab=[101011][110]=[11].{\displaystyle A^{\top }b={\begin{bmatrix}1&0&1\\0&1&1\end{bmatrix}}{\begin{bmatrix}1\\1\\0\end{bmatrix}}={\begin{bmatrix}1\\1\end{bmatrix}}.} Resolver la ecuación normal da como resultadoincógnita=(1/3,1/3).{\displaystyle x=(1/3,1/3).}

Formulaciones para la regresión lineal

Las tres principales formulaciones de mínimos cuadrados lineales son:

  • El método de mínimos cuadrados ordinarios (MCO) es el estimador más común. Las estimaciones MCO se utilizan habitualmente para analizar datos tanto experimentales como observacionales .
    El método MCO minimiza la suma de los residuos al cuadrado y conduce a una expresión de forma cerrada para el valor estimado del vector de parámetros desconocido β :β^=(incógnitaTincógnita)1incógnitaTy,{\displaystyle {\hat {\boldsymbol {\beta }}}=(\mathbf {X} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}\mathbf {y} ,}dóndey{\displaystyle \mathbf {y} }es un vector cuyo i- ésimo elemento es la i- ésima observación de la variable dependiente , yincógnita{\displaystyle \mathbf {X} }es la matriz de diseño cuyo elemento ij es la i -ésima observación de la j -ésima variable independiente . El estimador es insesgado y consistente si los errores tienen varianza finita y no están correlacionados con los regresores: [ 2 ]mi[incógnitaiεi]=0,{\displaystyle \operatorname {E} [\,\mathbf {x} _{i}\varepsilon _{i}\,]=0,}dóndeincógnitai{\displaystyle \mathbf {x} _ {i}}es la transpuesta de la fila i de la matrizincógnita.{\displaystyle \mathbf {X} .}También es eficiente bajo el supuesto de que los errores tienen varianza finita y son homocedásticos , lo que significa que E[ ε i 2 | x i ] no depende de i . La condición de que los errores no estén correlacionados con los regresores generalmente se cumplirá en un experimento, pero en el caso de datos observacionales, es difícil excluir la posibilidad de una covariable omitida z que esté relacionada tanto con las covariables observadas como con la variable de respuesta. La existencia de dicha covariable generalmente conducirá a una correlación entre los regresores y la variable de respuesta, y por lo tanto a un estimador inconsistente de β . La condición de homocedasticidad puede fallar tanto con datos experimentales como observacionales. Si el objetivo es la inferencia o el modelado predictivo, el rendimiento de las estimaciones de MCO puede ser deficiente si hay multicolinealidad presente, a menos que el tamaño de la muestra sea grande.
  • Los mínimos cuadrados ponderados (WLS, por sus siglas en inglés) se utilizan cuando existe heterocedasticidad en los términos de error del modelo.
  • Los mínimos cuadrados generalizados (GLS) son una extensión del método OLS que permite una estimación eficiente de β cuando existe heterocedasticidad , correlaciones o ambas entre los términos de error del modelo, siempre que se conozca la forma de la heterocedasticidad y la correlación independientemente de los datos. Para manejar la heterocedasticidad cuando los términos de error no están correlacionados entre sí, GLS minimiza un análogo ponderado de la suma de los residuos al cuadrado de la regresión OLS, donde el peso para el i -ésimo caso es inversamente proporcional a var( εi ) . Este caso especial de GLS se denomina "mínimos cuadrados ponderados". La solución GLS a un problema de estimación esβ^=(incógnitaTΩ1incógnita)1incógnitaTΩ1y,{\displaystyle {\hat {\boldsymbol {\beta }}}=(\mathbf {X} ^{\mathsf {T}}{\boldsymbol {\Omega }}^{-1}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}{\boldsymbol {\Omega }}^{-1}\mathbf {y} ,}donde Ω es la matriz de covarianza de los errores. El método GLS puede considerarse como la aplicación de una transformación lineal a los datos, de modo que se cumplan los supuestos del método OLS para los datos transformados. Para aplicar GLS, es necesario conocer la estructura de covarianza de los errores salvo una constante multiplicativa.

Formulaciones alternativas

Otras formulaciones incluyen:

  • El método de mínimos cuadrados ponderados iterativamente (IRLS) se utiliza cuando existe heterocedasticidad , correlaciones o ambas entre los términos de error del modelo, pero se desconoce la estructura de covarianza de los errores independientemente de los datos. [ 3 ] En la primera iteración, se realiza un método de mínimos cuadrados ordinarios (OLS) o generalizados (GLS) con una estructura de covarianza provisional, y se obtienen los residuos del ajuste. A partir de los residuos, generalmente se puede obtener una estimación mejorada de la estructura de covarianza de los errores. Posteriormente, se realiza una iteración de GLS utilizando esta estimación de la estructura de error para definir los pesos. El proceso puede iterarse hasta la convergencia, pero en muchos casos, una sola iteración es suficiente para obtener una estimación eficiente de β . [ 4 ] [ 5 ]
  • La regresión de variables instrumentales (IV) se puede realizar cuando los regresores están correlacionados con los errores. En este caso, necesitamos la existencia de algunas variables instrumentales auxiliares z i tales que E[ z i ε i ] = 0. Si Z es la matriz de instrumentos, entonces el estimador se puede expresar en forma cerrada comoβ^=(incógnitaTZ(ZTZ)1ZTincógnita)1incógnitaTZ(ZTZ)1ZTy.{\displaystyle {\hat {\boldsymbol {\beta }}}=(\mathbf {X} ^{\mathsf {T}}\mathbf {Z} (\mathbf {Z} ^{\mathsf {T}}\mathbf {Z} )^{-1}\mathbf {Z} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}\mathbf {Z} (\mathbf {Z} ^{\mathsf {T}}\mathbf {Z} )^{-1}\mathbf {Z} ^{\mathsf {T}}\mathbf {y} .}La regresión de instrumentos óptimos es una extensión de la regresión IV clásica a la situación en la que E[ ε i | z i ] = 0 .
  • El método de mínimos cuadrados totales (TLS) [ 6 ] es una técnica para la estimación por mínimos cuadrados del modelo de regresión lineal que trata las covariables y la variable de respuesta de forma más simétrica geométricamente que el método de mínimos cuadrados ordinarios (OLS). Es una forma de abordar el problema de los "errores en las variables" y, en ocasiones, se utiliza incluso cuando se supone que las covariables están libres de errores.
  • El ajuste de plantilla lineal (LTF) [ 7 ] combina una regresión lineal con mínimos cuadrados (generalizados) para determinar el mejor estimador. El ajuste de plantilla lineal aborda un problema frecuente: los residuos pueden ser imposibles de expresar analíticamente o demasiado laboriosos para evaluarlos repetidamente, como suele ocurrir en los algoritmos de minimización iterativos. En el ajuste de plantilla lineal, los residuos se estiman a partir de las variables aleatorias y de una aproximación lineal del modelo verdadero subyacente , que debe proporcionarse para al menosnorte+1{\displaystyle n+1}valores de referencia distintos β (dondenorte{\displaystyle n}es el número de estimadores). La distribución verdadera se aproxima entonces mediante una regresión lineal, y los mejores estimadores se obtienen en forma cerrada comoβ^=((YMETRO~)TΩ1YMETRO~)1(YMETRO~)TΩ1(yYmetro¯),{\displaystyle {\hat {\boldsymbol {\beta }}}=((\mathbf {Y{\tilde {M}}} )^{\mathsf {T}}{\boldsymbol {\Omega }}^{-1}\mathbf {Y{\tilde {M}}} )^{-1}(\mathbf {Y{\tilde {M}}} )^{\mathsf {T}}{\boldsymbol {\Omega }}^{-1}(\mathbf {y} -\mathbf {Y{\bar {m}})} ,}dóndeY{\displaystyle \mathbf {Y} }denota la matriz plantilla con los valores del modelo conocido o previamente determinado para cualquiera de los valores de referencia β ,y{\displaystyle \mathbf {y} }son las variables aleatorias (por ejemplo, una medición) y la matrizMETRO~{\displaystyle \mathbf {\tilde {M}} }y el vectormetro~{\displaystyle \mathbf {\tilde {m}} }se calculan a partir de los valores de β . El LTF también puede expresarse para variables aleatorias con distribución log-normal . Una generalización del LTF es el ajuste de plantilla cuadrática, que supone una regresión de segundo orden del modelo y requiere predicciones para al menosnorte2+2norte{\displaystyle n^{2}+2n}valores distintos β , y encuentra el mejor estimador utilizando el método de Newton .
  • El método de mínimos cuadrados porcentuales se centra en reducir los errores porcentuales, lo cual resulta útil en el campo de la previsión o el análisis de series temporales. También es útil en situaciones donde la variable dependiente presenta un amplio rango sin varianza constante, ya que en estos casos los residuos mayores en el extremo superior del rango predominarían si se utilizara el método de mínimos cuadrados ordinarios (MCO). Cuando el error porcentual o relativo sigue una distribución normal, la regresión porcentual por mínimos cuadrados proporciona estimaciones de máxima verosimilitud. La regresión porcentual está vinculada a un modelo de error multiplicativo, mientras que el MCO está vinculado a modelos que contienen un término de error aditivo. [ 8 ]
  • El método de mínimos cuadrados restringidos indica un problema de mínimos cuadrados lineales con restricciones adicionales en la solución.

Función objetivo

En MCO (es decir, asumiendo observaciones no ponderadas), el valor óptimo de la función objetivo se encuentra sustituyendo la expresión óptima para el vector de coeficientes: S=yT(IH)T(IH)y=yT(IH)y,{\displaystyle S=\mathbf {y} ^{\mathsf {T}}(\mathbf {I} -\mathbf {H} )^{\mathsf {T}}(\mathbf {I} -\mathbf {H} )\mathbf {y} =\mathbf {y} ^{\mathsf {T}}(\mathbf {I} -\mathbf {H} )\mathbf {y} ,} dóndeH=incógnita(incógnitaTincógnita)1incógnitaT{\displaystyle \mathbf {H} =\mathbf {X} (\mathbf {X} ^{\mathsf {T}}\mathbf {X} )^{-1}\mathbf {X} ^{\mathsf {T}}}, esta última igualdad manteniéndose desde(IH){\displaystyle (\mathbf {I} -\mathbf {H} )}es simétrico e idempotente. Se puede demostrar a partir de esto [ 9 ] que bajo una asignación apropiada de pesos el valor esperado de S esmetronorte{\textstyle mn}. Si en cambio se asumen pesos unitarios, el valor esperado de S es(metronorte)σ2{\displaystyle (mn)\sigma ^{2}}, dóndeσ2{\displaystyle \sigma ^{2}}es la varianza de cada observación.

Si se supone que los residuos pertenecen a una distribución normal, la función objetivo, al ser una suma de residuos cuadrados ponderados, pertenecerá a una distribución chi-cuadrado (χ2{\displaystyle \chi ^{2}}) distribución con m n grados de libertad . Algunos valores percentiles ilustrativos deχ2{\displaystyle \chi ^{2}}se dan en la siguiente tabla. [ 10 ]

Estos valores pueden utilizarse como criterio estadístico para evaluar la bondad del ajuste . Cuando se utilizan ponderaciones unitarias, los números deben dividirse por la varianza de una observación.

En el método WLS, la función objetivo ordinaria mencionada anteriormente se reemplaza por un promedio ponderado de los residuos.

Discusión

En estadística y matemáticas , el método de mínimos cuadrados lineales consiste en ajustar un modelo matemático o estadístico a los datos , donde el valor idealizado que proporciona el modelo para cualquier punto de datos se expresa linealmente en función de los parámetros desconocidos del modelo. El modelo ajustado resultante puede utilizarse para resumir los datos, predecir valores no observados del mismo sistema y comprender los mecanismos subyacentes.

Matemáticamente, el problema de mínimos cuadrados lineales consiste en resolver de forma aproximada un sistema sobredeterminado de ecuaciones lineales A x = b , donde b no pertenece al espacio columna de la matriz A . La solución aproximada se obtiene como una solución exacta de A x = b' , donde b' es la proyección de b sobre el espacio columna de A . La mejor aproximación es aquella que minimiza la suma de las diferencias cuadráticas entre los valores de los datos y sus correspondientes valores modelados. Este método se denomina mínimos cuadrados lineales, ya que la función supuesta es lineal en los parámetros que se van a estimar. Los problemas de mínimos cuadrados lineales son convexos y tienen una solución analítica única, siempre que el número de puntos de datos utilizados para el ajuste sea igual o superior al número de parámetros desconocidos, salvo en situaciones degeneradas especiales. En cambio, los problemas de mínimos cuadrados no lineales generalmente deben resolverse mediante un procedimiento iterativo , y pueden ser no convexos con múltiples óptimos para la función objetivo. Si se dispone de distribuciones previas, incluso un sistema subdeterminado puede resolverse utilizando el estimador MMSE bayesiano .

En estadística, los problemas de mínimos cuadrados lineales corresponden a un tipo de modelo estadístico particularmente importante llamado regresión lineal , que surge como una forma particular de análisis de regresión . Una forma básica de dicho modelo es el modelo de mínimos cuadrados ordinarios . El presente artículo se centra en los aspectos matemáticos de los problemas de mínimos cuadrados lineales, mientras que la formulación e interpretación de los modelos de regresión estadística y las inferencias estadísticas relacionadas con estos se abordan en los artículos mencionados anteriormente. Consulte el esquema del análisis de regresión para obtener una descripción general del tema.

Propiedades

Si los errores experimentales,ε{\displaystyle \varepsilon }, no están correlacionadas, tienen una media de cero y una varianza constante,σ{\displaystyle \sigma }, el teorema de Gauss-Markov establece que el estimador de mínimos cuadrados,β^{\displaystyle {\hat {\boldsymbol {\beta }}}}Tiene la varianza mínima de todos los estimadores que son combinaciones lineales de las observaciones. En este sentido, es el mejor estimador, u óptimo, de los parámetros. Cabe destacar que esta propiedad es independiente de la función de distribución estadística de los errores. En otras palabras, la función de distribución de los errores no tiene por qué ser una distribución normal . Sin embargo, para algunas distribuciones de probabilidad, no hay garantía de que la solución de mínimos cuadrados sea posible dadas las observaciones; aun así, en tales casos es el mejor estimador que es a la vez lineal e insesgado.

Por ejemplo, es fácil demostrar que la media aritmética de un conjunto de mediciones de una magnitud es el estimador de mínimos cuadrados del valor de dicha magnitud. Si se cumplen las condiciones del teorema de Gauss-Markov, la media aritmética es óptima, independientemente de la distribución de los errores de las mediciones.

Sin embargo, en el caso de que los errores experimentales pertenezcan a una distribución normal, el estimador de mínimos cuadrados también es un estimador de máxima verosimilitud . [ 11 ]

Estas propiedades sustentan el uso del método de mínimos cuadrados para todo tipo de ajuste de datos, incluso cuando las suposiciones no son estrictamente válidas.

Limitaciones

Una suposición subyacente al tratamiento descrito anteriormente es que la variable independiente, x , está libre de errores. En la práctica, los errores en las mediciones de la variable independiente suelen ser mucho menores que los errores en la variable dependiente y, por lo tanto, pueden ignorarse. Cuando esto no ocurre, deben utilizarse mínimos cuadrados totales o, más generalmente, modelos de errores en las variables o mínimos cuadrados rigurosos . Esto se puede lograr ajustando el esquema de ponderación para tener en cuenta los errores tanto en la variable dependiente como en la independiente y, a continuación, siguiendo el procedimiento estándar. [ 12 ] [ 13 ]

En algunos casos, la matriz de ecuaciones normales (ponderadas) X T X está mal condicionada . Al ajustar polinomios, la matriz de ecuaciones normales es una matriz de Vandermonde . Las matrices de Vandermonde se vuelven cada vez más mal condicionadas a medida que aumenta el orden de la matriz. En estos casos, la estimación de mínimos cuadrados amplifica el ruido de medición y puede ser muy inexacta. Se pueden aplicar varias técnicas de regularización en tales casos, la más común de las cuales se llama regresión de cresta . Si se conoce más información sobre los parámetros, por ejemplo, un rango de posibles valores deβ^{\displaystyle \mathbf {\hat {\boldsymbol {\beta }}} }, entonces se pueden utilizar diversas técnicas para aumentar la estabilidad de la solución. Por ejemplo, véase mínimos cuadrados restringidos .

Otro inconveniente del estimador de mínimos cuadrados es el hecho de que la norma de los residuos,yincógnitaβ^{\displaystyle \|\mathbf {y} -\mathbf {X} {\hat {\boldsymbol {\beta }}}\|}se minimiza, mientras que en algunos casos uno está realmente interesado en obtener un pequeño error en el parámetroβ^{\displaystyle \mathbf {\hat {\boldsymbol {\beta }}} }, por ejemplo, un valor pequeño deββ^{\displaystyle \|{\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}}\|}. Sin embargo, dado que el parámetro verdaderoβ{\displaystyle {\boldsymbol {\beta }}}es necesariamente desconocido, esta cantidad no puede minimizarse directamente. Si una probabilidad previa enβ^{\displaystyle {\hat {\boldsymbol {\beta }}}}Si se conoce, entonces se puede utilizar un estimador de Bayes para minimizar el error cuadrático medio .mi{ββ^2}{\displaystyle E\left\{\|{\boldsymbol {\beta }}-{\hat {\boldsymbol {\beta }}}\|^{2}\right\}}El método de mínimos cuadrados se aplica a menudo cuando no se conoce ninguna distribución previa. Cuando se estiman varios parámetros conjuntamente, se pueden construir mejores estimadores, un efecto conocido como el fenómeno de Stein . Por ejemplo, si el error de medición es gaussiano , se conocen varios estimadores que superan a la técnica de mínimos cuadrados; el más conocido de ellos es el estimador de James-Stein . Este es un ejemplo de estimadores de contracción más generales que se han aplicado a problemas de regresión.

Aplicaciones

Aproximación por mínimos cuadrados con polinomios lineales, cuadráticos y cúbicos.

Usos en el ajuste de datos

La principal aplicación de los mínimos cuadrados lineales es el ajuste de datos . Dado un conjunto de m puntos de datosy1,y2,,ymetro,{\displaystyle y_{1},y_{2},\dots ,y_{m},}que consiste en valores medidos experimentalmente tomados en valores mincógnita1,incógnita2,,incógnitametro{\displaystyle x_{1},x_{2},\dots ,x_{m}}de una variable independiente (incógnitai{\displaystyle x_{i}}pueden ser cantidades escalares o vectoriales), y dada una función modeloy=F(incógnita,β),{\displaystyle y=f(x,{\boldsymbol {\beta }}),}conβ=(β1,β2,,βnorte),{\displaystyle {\boldsymbol {\beta }}=(\beta _{1},\beta _{2},\dots ,\beta _{n}),}Se desea encontrar los parámetrosβj{\displaystyle \beta _{j}}de modo que la función del modelo se ajuste "mejor" a los datos. En mínimos cuadrados lineales, la linealidad se refiere a los parámetros.βj,{\displaystyle \beta _{j},}entonces F(incógnita,β)=j=1norteβjφj(incógnita).{\displaystyle f(x,{\boldsymbol {\beta }})=\sum _{j=1}^{n}\beta _{j}\varphi _{j}(x).}

Aquí están las funcionesφj{\displaystyle \varphi _{j}}puede ser no lineal con respecto a la variable x .

Idealmente, la función del modelo se ajusta exactamente a los datos, por lo que yi=F(incógnitai,β){\displaystyle y_{i}=f(x_{i},{\boldsymbol {\beta }})} a pesar dei=1,2,,metro.{\displaystyle i=1,2,\dots ,m.}En la práctica, esto no suele ser posible, ya que hay más datos que parámetros a determinar. Por lo tanto, el método elegido consiste en encontrar el valor mínimo posible de la suma de los cuadrados de los residuos.ri(β)=yiF(incógnitai,β), (i=1,2,,metro){\displaystyle r_{i}({\boldsymbol {\beta }})=y_{i}-f(x_{i},{\boldsymbol {\beta }}),\ (i=1,2,\dots ,m)} para minimizar la función S(β)=i=1metrori2(β).{\displaystyle S({\boldsymbol {\beta }})=\sum _{i=1}^{m}r_{i}^{2}({\boldsymbol {\beta }}).}

Después de sustituir porri{\displaystyle r_{i}}y luego paraF{\displaystyle f}, este problema de minimización se convierte en el problema de minimización cuadrática anterior con incógnitaij=φj(incógnitai),{\displaystyle X_{ij}=\varphi _{j}(x_{i}),} y el mejor ajuste se puede encontrar resolviendo las ecuaciones normales.

Ejemplo

Un gráfico de los puntos de datos (en rojo), la línea de mínimos cuadrados de mejor ajuste (en azul) y los residuos (en verde).

Un investigador hipotético realiza un experimento y obtiene cuatro(incógnita,y){\displaystyle (x,y)}puntos de datos:(1,6),{\displaystyle (1,6),}(2,5),{\displaystyle (2,5),}(3,7),{\displaystyle (3,7),}y(4,10){\displaystyle (4,10)}(mostrado en rojo en el diagrama de la derecha). Debido al análisis exploratorio de datos o al conocimiento previo del tema, el investigador sospecha que ely{\displaystyle y}Los valores dependen de laincógnita{\displaystyle x}-valores sistemáticamente. Elincógnita{\displaystyle x}Se supone que los valores son exactos, peroy{\displaystyle y}Los valores contienen cierta incertidumbre o " ruido " , debido al fenómeno que se está estudiando, imperfecciones en las mediciones, etc.

Ajustar una línea

Una de las relaciones más simples posibles entreincógnita{\displaystyle x}yy{\displaystyle y}es una líneay=β1+β2incógnita{\displaystyle y=\beta _{1}+\beta _{2}x}La intercepciónβ1{\displaystyle \beta _{1}}y la pendienteβ2{\displaystyle \beta _{2}}son inicialmente desconocidos. Al investigador le gustaría encontrar valores deβ1{\displaystyle \beta _{1}}yβ2{\displaystyle \beta _{2}}que hacen que la línea pase por los cuatro puntos de datos. En otras palabras, el investigador quiere resolver el sistema de ecuaciones lineales. β1+1β2=6,β1+2β2=5,β1+3β2=7,β1+4β2=10.{\displaystyle {\begin{alignedat}{3}\beta _{1}+1\beta _{2}&&\;=\;&&6,&\\\beta _{1}+2\beta _{2}&&\;=\;&&5,&\\\beta _{1}+3\beta _{2}&&\;=\;&&7,&\\\beta _{1}+4\beta _{2}&&\;=\;&&10.&\\\end{alignedat}}} Con cuatro ecuaciones y dos incógnitas, este sistema está sobredeterminado. No existe una solución exacta. Para considerar soluciones aproximadas, se introducen residuos.r1{\displaystyle r_{1}},r2{\displaystyle r_{2}},r3{\displaystyle r_{3}},r4{\displaystyle r_{4}}en las ecuaciones: β1+1β2+r1=6,β1+2β2+r2=5,β1+3β2+r3=7,β1+4β2+r4=10.{\displaystyle {\begin{alignedat}{3}\beta _{1}+1\beta _{2}+r_{1}&&\;=\;&&6,&\\\beta _{1}+2\beta _{2}+r_{2}&&\;=\;&&5,&\\\beta _{1}+3\beta _{2}+r_{3}&&\;=\;&&7,&\\\beta _{1}+4\beta _{2}+r_{4}&&\;=\;&&10.&\\\end{alignedat}}} Eli{\displaystyle i}el residuori{\displaystyle r_{i}}es el desajuste entre eli{\displaystyle i}la observaciónyi{\displaystyle y_{i}}y eli{\displaystyle i}predicciónβ1+β2incógnitai{\displaystyle \beta _{1}+\beta _{2}x_{i}}: r1=6(β1+1β2),r2=5(β1+2β2),r3=7(β1+3β2),r4=10(β1+4β2).{\displaystyle {\begin{alignedat}{3}r_{1}&&\;=\;&&6-(\beta _{1}+1\beta _{2}),&\\r_{2}&&\;=\;&&5-(\beta _{1}+2\beta _{2}),&\\r_{3}&&\;=\;&&7-(\beta _{1}+3\beta _{2}),&\\r_{4}&&\;=\;&&10-(\beta _{1}+4\beta _{2}).&\\\end{alignedat}}} Entre todas las soluciones aproximadas, el investigador quisiera encontrar la que sea " mejor " en algún sentido.

En mínimos cuadrados , uno se centra en la sumaS{\displaystyle S}de los residuos al cuadrado: S(β1,β2)=r12+r22+r32+r42=[6(β1+1β2)]2+[5(β1+2β2)]2+[7(β1+3β2)]2+[10(β1+4β2)]2=4β12+30β22+20β1β256β1154β2+210.{\displaystyle {\begin{aligned}S(\beta _{1},\beta _{2})&=r_{1}^{2}+r_{2}^{2}+r_{3}^{2}+r_{4}^{2}\\[6pt]&=[6-(\beta _{1}+1\beta _{2})]^{2}+[5-(\beta _{1}+2\beta _{2})]^{2}+[7-(\beta _{1}+3\beta _{2})]^{2}+[10-(\beta _{1}+4\beta _{2})]^{2}\\[6pt]&=4\beta _{1}^{2}+30\beta _{2}^{2}+20\beta _{1}\beta _{2}-56\beta _{1}-154\beta _{2}+210.\\[6pt]\end{aligned}}} La mejor solución se define como aquella que minimizaS{\displaystyle S}con respecto aβ1{\displaystyle \beta _{1}}yβ2{\displaystyle \beta _{2}}. El mínimo se puede calcular estableciendo las derivadas parciales deS{\displaystyle S}a cero: 0=Sβ1=8β1+20β256,{\displaystyle 0={\frac {\partial S}{\partial \beta _{1}}}=8\beta _{1}+20\beta _{2}-56,}0=Sβ2=20β1+60β2154.{\displaystyle 0={\frac {\partial S}{\partial \beta _{2}}}=20\beta _{1}+60\beta _{2}-154.} Estas ecuaciones normales constituyen un sistema de dos ecuaciones lineales con dos incógnitas. La solución esβ1=3.5{\displaystyle \beta _{1}=3.5}yβ2=1.4{\displaystyle \beta _{2}=1.4}y la línea que mejor se ajusta es, por lo tantoy=3.5+1.4incógnita{\displaystyle y=3.5+1.4x}. Los residuos son1.1,{\displaystyle 1.1,}1.3,{\displaystyle -1.3,}0,7,{\displaystyle -0.7,}y0,9{\displaystyle 0.9}(véase el diagrama de la derecha). El valor mínimo de la suma de los residuos al cuadrado es S(3.5,1.4)=1.12+(1.3)2+(0,7)2+0,92=4.2.{\displaystyle S(3.5,1.4)=1.1^{2}+(-1.3)^{2}+(-0.7)^{2}+0.9^{2}=4.2.}

Este cálculo se puede expresar en notación matricial de la siguiente manera. El sistema original de ecuaciones es:y=incógnitaβ{\displaystyle \mathbf {y} =\mathbf {X} \mathbf {\beta } }, dónde y=[65710],incógnita=[11121314],β=[β1β2].{\displaystyle \mathbf {y} =\left[{\begin{array}{c}6\\5\\7\\10\end{array}}\right],\;\;\;\;\mathbf {X} =\left[{\begin{array}{cc}1&1\\1&2\\1&3\\1&4\end{array}}\right],\;\;\;\;\mathbf {\beta } =\left[{\begin{array}{c}\beta _{1}\\\beta _{2}\end{array}}\right].} Intuitivamente, y=incógnitaβincógnitay=incógnitaincógnitaββ=(incógnitaincógnita)1incógnitay=[3.51.4].{\displaystyle \mathbf {y} =\mathbf {X} \mathbf {\beta } \;\;\;\;\Rightarrow \;\;\;\;\mathbf {X} ^{\top }\mathbf {y} =\mathbf {X} ^{\top }\mathbf {X} \mathbf {\beta } \;\;\;\;\Rightarrow \;\;\;\;\mathbf {\beta } =\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} =\left[{\begin{array}{c}3.5\\1.4\end{array}}\right].} Con mayor rigor, siincógnitaincógnita{\displaystyle \mathbf {X} ^{\top }\mathbf {X} }es invertible, entonces la matrizincógnita(incógnitaincógnita)1incógnita{\displaystyle \mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }}representa la proyección ortogonal sobre el espacio columna deincógnita{\displaystyle \mathbf {X} }. Por lo tanto, entre todos los vectores de la formaincógnitaβ{\displaystyle \mathbf {X} \mathbf {\beta } }, el más cercano ay{\displaystyle \mathbf {y} }esincógnita(incógnitaincógnita)1incógnitay{\displaystyle \mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} }. Configuración incógnita(incógnitaincógnita)1incógnitay=incógnitaβ,{\displaystyle \mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} =\mathbf {X} \mathbf {\beta } ,} es evidente queβ=(incógnitaincógnita)1incógnitay{\displaystyle \mathbf {\beta } =\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} }es una solución.

Ajustar una parábola

El resultado de ajustar una función cuadráticay=β1+β2incógnita+β3incógnita2{\displaystyle y=\beta _{1}+\beta _{2}x+\beta _{3}x^{2}\,}(en azul) a través de un conjunto de puntos de datos(incógnitai,yi){\displaystyle (x_{i},y_{i})}(en rojo). En mínimos cuadrados lineales, la función no necesita ser lineal en el argumento.incógnita,{\displaystyle x,}pero solo en los parámetrosβj{\displaystyle \beta _{j}}que están decididos a ofrecer el mejor ajuste.

Supongamos que el hipotético investigador desea ajustar una parábola de la formay=β1incógnita2{\displaystyle y=\beta _{1}x^{2}}Es importante destacar que este modelo sigue siendo lineal en los parámetros desconocidos (ahora soloβ1{\displaystyle \beta _{1}}), por lo que el método de mínimos cuadrados lineales sigue siendo aplicable. El sistema de ecuaciones que incorpora los residuos es 6=β1(1)2+r15=β1(2)2+r27=β1(3)2+r310=β1(4)2+r4{\displaystyle {\begin{alignedat}{2}6&&\;=\beta _{1}(1)^{2}+r_{1}\\5&&\;=\beta _{1}(2)^{2}+r_{2}\\7&&\;=\beta _{1}(3)^{2}+r_{3}\\10&&\;=\beta _{1}(4)^{2}+r_{4}\\\end{alignedat}}}

La suma de los residuos al cuadrado es S(β1)=(6β1)2+(54β1)2+(79β1)2+(1016β1)2.{\displaystyle S(\beta _{1})=(6-\beta _{1})^{2}+(5-4\beta _{1})^{2}+(7-9\beta _{1})^{2}+(10-16\beta _{1})^{2}.} Solo hay que establecer una derivada parcial a 0: 0=Sβ1=708β1498.{\displaystyle 0={\frac {\partial S}{\partial \beta _{1}}}=708\beta _{1}-498.} La solución esβ1=0,703{\displaystyle \beta _{1}=0.703}y el modelo de ajuste esy=0,703incógnita2{\displaystyle y=0.703x^{2}}.

En notación matricial, las ecuaciones sin residuos son nuevamentey=incógnitaβ{\displaystyle \mathbf {y} =\mathbf {X} \mathbf {\beta } }¿dónde ahora? y=[65710],incógnita=[14916],β=[β1].{\displaystyle \mathbf {y} =\left[{\begin{array}{c}6\\5\\7\\10\end{array}}\right],\;\;\;\;\mathbf {X} =\left[{\begin{array}{c}1\\4\\9\\16\end{array}}\right],\;\;\;\;\mathbf {\beta } =\left[{\begin{array}{c}\beta _{1}\end{array}}\right].} Siguiendo la misma lógica que la anterior, la solución es β=(incógnitaincógnita)1incógnitay=[0,703].{\displaystyle \mathbf {\beta } =\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\mathbf {y} =\left[{\begin{array}{c}0.703\end{array}}\right].}

La figura muestra una extensión para ajustar la parábola de tres parámetros utilizando una matriz de diseño.incógnita{\displaystyle \mathbf {X} }con tres columnas (una paraincógnita0{\displaystyle x^{0}},incógnita1{\displaystyle x^{1}}, yincógnita2{\displaystyle x^{2}}), y una fila para cada uno de los puntos de datos rojos.

Adaptación a otras curvas y superficies

En términos más generales, uno puede tenernorte{\displaystyle n}regresoresincógnitaj{\displaystyle x_{j}}y un modelo lineal y=β0+j=1norteβjincógnitaj.{\displaystyle y=\beta _{0}+\sum _{j=1}^{n}\beta _{j}x_{j}.}

Véase también

Referencias

  1. Weisstein, Eric W. "Ecuación normal" . MathWorld . Wolfram . Consultado el 18 de diciembre de 2023 .
  2. Lai, TL; Robbins, H.; Wei, CZ (1978). "Consistencia fuerte de las estimaciones de mínimos cuadrados en regresión múltiple" . PNAS . 75 ( 7): 3034– 3036. Bibcode : 1978PNAS...75.3034L . doi : 10.1073 / pnas.75.7.3034 . JSTOR 68164. PMC 392707. PMID 16592540 .   
  3. del Pino, Guido (1989). "El papel unificador de los mínimos cuadrados generalizados iterativos en los algoritmos estadísticos" . Statistical Science . 4 (4): 394– 403. doi : 10.1214/ss/1177012408 . JSTOR 2245853 . 
  4. Carroll, Raymond J. (1982). "Adaptación para la heterocedasticidad en modelos lineales" . The Annals of Statistics . 10 (4): 1224– 1233. doi : 10.1214/aos/1176345987 . JSTOR 2240725 . 
  5. Cohen, Michael; Dalal, Siddhartha R.; Tukey, John W. (1993). "Regresión de varianza heterogénea robusta y suave". Journal of the Royal Statistical Society, Serie C. 42 ( 2): 339– 353. JSTOR 2986237 . 
  6. Nievergelt, Yves (1994). "Mínimos cuadrados totales: regresión de vanguardia en análisis numérico". SIAM Review . 36 (2): 258– 264. doi : 10.1137/1036055 . JSTOR 2132463 . 
  7. Britzger, Daniel (2022). "The Linear Template Fit" . Eur. Phys. J. C. 82 ( 8): 731. arXiv : 2112.01548 . Bibcode : 2022EPJC...82..731B . doi : 10.1140/epjc/s10052-022-10581-w . S2CID 244896511 . 
  8. Tofallis, C (2009). "Regresión porcentual por mínimos cuadrados" . Journal of Modern Applied Statistical Methods . 7 : 526–534 . doi : 10.2139/ssrn.1406472 . hdl : 2299/965 . SSRN 1406472 . 
  9. Hamilton, WC (1964). Estadística en las ciencias físicas . Nueva York: Ronald Press.
  10. Spiegel, Murray R. (1975). Schaum's outline of theory and problems of probability and statistics . Nueva York: McGraw-Hill. ISBN 978-0-585-26739-5.
  11. Margenau, Henry; Murphy, George Moseley (1956). Las matemáticas de la física y la química . Princeton: Van Nostrand.
  12. 1 2 Gans, Peter (1992). Ajuste de datos en las ciencias químicas . Nueva York: Wiley. ISBN 978-0-471-93412-7.
  13. Deming, WE (1943). Ajuste estadístico de datos . Nueva York: Wiley.
  14. Acton, FS (1959). Análisis de datos de línea recta . Nueva York: Wiley.
  15. Guest, PG (1961). Métodos numéricos de ajuste de curvas . Cambridge: Cambridge University Press.

Lecturas adicionales

  • Bevington, Philip R.; Robinson, Keith D. (2003). Reducción de datos y análisis de errores para las ciencias físicas . McGraw-Hill. ISBN 978-0-07-247227-1.
  • Ajuste por mínimos cuadrados De MathWorld
  • Ajuste de mínimos cuadrados - Polinomio De MathWorld