El método de mínimos cuadrados lineales ( LLS ) es la aproximación por mínimos cuadrados de funciones lineales a datos. Consiste en un conjunto de formulaciones para resolver problemas estadísticos relacionados con la regresión lineal , incluyendo variantes para residuos ordinarios (no ponderados), ponderados y generalizados (correlacionados) . Los métodos numéricos para mínimos cuadrados lineales incluyen la inversión de la matriz de ecuaciones normales y métodos de descomposición ortogonal .
Formulación básica
Consideremos la ecuación lineal
dóndeyse dan yes una variable que se va a calcular. CuandoGeneralmente es el caso que ( 1 ) no tiene solución. Por ejemplo, no hay ningún valor deque satisface porque las dos primeras filas requieren quepero entonces la tercera fila no se satisface. Por lo tanto, paraEl objetivo de resolver ( 1 ) exactamente se reemplaza típicamente por encontrar el valor deque minimiza algún error. Hay muchas maneras de definir el error, pero una de las más comunes es definirlo como Esto genera un problema de minimización, llamado problema de mínimos cuadrados.
La solución al problema de mínimos cuadrados ( 1 ) se calcula resolviendo la ecuación normal [ 1 ].
dóndedenota la transpuesta de.
Continuando con el ejemplo anterior, con encontramos y Resolver la ecuación normal da como resultado
Formulaciones para la regresión lineal
Las tres principales formulaciones de mínimos cuadrados lineales son:
- El método de mínimos cuadrados ordinarios (MCO) es el estimador más común. Las estimaciones MCO se utilizan habitualmente para analizar datos tanto experimentales como observacionales .El método MCO minimiza la suma de los residuos al cuadrado y conduce a una expresión de forma cerrada para el valor estimado del vector de parámetros desconocido β :dóndees un vector cuyo i- ésimo elemento es la i- ésima observación de la variable dependiente , yes la matriz de diseño cuyo elemento ij es la i -ésima observación de la j -ésima variable independiente . El estimador es insesgado y consistente si los errores tienen varianza finita y no están correlacionados con los regresores: [ 2 ]dóndees la transpuesta de la fila i de la matrizTambién es eficiente bajo el supuesto de que los errores tienen varianza finita y son homocedásticos , lo que significa que E[ ε i 2 | x i ] no depende de i . La condición de que los errores no estén correlacionados con los regresores generalmente se cumplirá en un experimento, pero en el caso de datos observacionales, es difícil excluir la posibilidad de una covariable omitida z que esté relacionada tanto con las covariables observadas como con la variable de respuesta. La existencia de dicha covariable generalmente conducirá a una correlación entre los regresores y la variable de respuesta, y por lo tanto a un estimador inconsistente de β . La condición de homocedasticidad puede fallar tanto con datos experimentales como observacionales. Si el objetivo es la inferencia o el modelado predictivo, el rendimiento de las estimaciones de MCO puede ser deficiente si hay multicolinealidad presente, a menos que el tamaño de la muestra sea grande.
- Los mínimos cuadrados ponderados (WLS, por sus siglas en inglés) se utilizan cuando existe heterocedasticidad en los términos de error del modelo.
- Los mínimos cuadrados generalizados (GLS) son una extensión del método OLS que permite una estimación eficiente de β cuando existe heterocedasticidad , correlaciones o ambas entre los términos de error del modelo, siempre que se conozca la forma de la heterocedasticidad y la correlación independientemente de los datos. Para manejar la heterocedasticidad cuando los términos de error no están correlacionados entre sí, GLS minimiza un análogo ponderado de la suma de los residuos al cuadrado de la regresión OLS, donde el peso para el i -ésimo caso es inversamente proporcional a var( εi ) . Este caso especial de GLS se denomina "mínimos cuadrados ponderados". La solución GLS a un problema de estimación esdonde Ω es la matriz de covarianza de los errores. El método GLS puede considerarse como la aplicación de una transformación lineal a los datos, de modo que se cumplan los supuestos del método OLS para los datos transformados. Para aplicar GLS, es necesario conocer la estructura de covarianza de los errores salvo una constante multiplicativa.
Formulaciones alternativas
Otras formulaciones incluyen:
- El método de mínimos cuadrados ponderados iterativamente (IRLS) se utiliza cuando existe heterocedasticidad , correlaciones o ambas entre los términos de error del modelo, pero se desconoce la estructura de covarianza de los errores independientemente de los datos. [ 3 ] En la primera iteración, se realiza un método de mínimos cuadrados ordinarios (OLS) o generalizados (GLS) con una estructura de covarianza provisional, y se obtienen los residuos del ajuste. A partir de los residuos, generalmente se puede obtener una estimación mejorada de la estructura de covarianza de los errores. Posteriormente, se realiza una iteración de GLS utilizando esta estimación de la estructura de error para definir los pesos. El proceso puede iterarse hasta la convergencia, pero en muchos casos, una sola iteración es suficiente para obtener una estimación eficiente de β . [ 4 ] [ 5 ]
- La regresión de variables instrumentales (IV) se puede realizar cuando los regresores están correlacionados con los errores. En este caso, necesitamos la existencia de algunas variables instrumentales auxiliares z i tales que E[ z i ε i ] = 0. Si Z es la matriz de instrumentos, entonces el estimador se puede expresar en forma cerrada comoLa regresión de instrumentos óptimos es una extensión de la regresión IV clásica a la situación en la que E[ ε i | z i ] = 0 .
- El método de mínimos cuadrados totales (TLS) [ 6 ] es una técnica para la estimación por mínimos cuadrados del modelo de regresión lineal que trata las covariables y la variable de respuesta de forma más simétrica geométricamente que el método de mínimos cuadrados ordinarios (OLS). Es una forma de abordar el problema de los "errores en las variables" y, en ocasiones, se utiliza incluso cuando se supone que las covariables están libres de errores.
- El ajuste de plantilla lineal (LTF) [ 7 ] combina una regresión lineal con mínimos cuadrados (generalizados) para determinar el mejor estimador. El ajuste de plantilla lineal aborda un problema frecuente: los residuos pueden ser imposibles de expresar analíticamente o demasiado laboriosos para evaluarlos repetidamente, como suele ocurrir en los algoritmos de minimización iterativos. En el ajuste de plantilla lineal, los residuos se estiman a partir de las variables aleatorias y de una aproximación lineal del modelo verdadero subyacente , que debe proporcionarse para al menosvalores de referencia distintos β (dondees el número de estimadores). La distribución verdadera se aproxima entonces mediante una regresión lineal, y los mejores estimadores se obtienen en forma cerrada comodóndedenota la matriz plantilla con los valores del modelo conocido o previamente determinado para cualquiera de los valores de referencia β ,son las variables aleatorias (por ejemplo, una medición) y la matrizy el vectorse calculan a partir de los valores de β . El LTF también puede expresarse para variables aleatorias con distribución log-normal . Una generalización del LTF es el ajuste de plantilla cuadrática, que supone una regresión de segundo orden del modelo y requiere predicciones para al menosvalores distintos β , y encuentra el mejor estimador utilizando el método de Newton .
- El método de mínimos cuadrados porcentuales se centra en reducir los errores porcentuales, lo cual resulta útil en el campo de la previsión o el análisis de series temporales. También es útil en situaciones donde la variable dependiente presenta un amplio rango sin varianza constante, ya que en estos casos los residuos mayores en el extremo superior del rango predominarían si se utilizara el método de mínimos cuadrados ordinarios (MCO). Cuando el error porcentual o relativo sigue una distribución normal, la regresión porcentual por mínimos cuadrados proporciona estimaciones de máxima verosimilitud. La regresión porcentual está vinculada a un modelo de error multiplicativo, mientras que el MCO está vinculado a modelos que contienen un término de error aditivo. [ 8 ]
- El método de mínimos cuadrados restringidos indica un problema de mínimos cuadrados lineales con restricciones adicionales en la solución.
Función objetivo
En MCO (es decir, asumiendo observaciones no ponderadas), el valor óptimo de la función objetivo se encuentra sustituyendo la expresión óptima para el vector de coeficientes: dónde, esta última igualdad manteniéndose desdees simétrico e idempotente. Se puede demostrar a partir de esto [ 9 ] que bajo una asignación apropiada de pesos el valor esperado de S es. Si en cambio se asumen pesos unitarios, el valor esperado de S es, dóndees la varianza de cada observación.
Si se supone que los residuos pertenecen a una distribución normal, la función objetivo, al ser una suma de residuos cuadrados ponderados, pertenecerá a una distribución chi-cuadrado () distribución con m − n grados de libertad . Algunos valores percentiles ilustrativos dese dan en la siguiente tabla. [ 10 ]
Estos valores pueden utilizarse como criterio estadístico para evaluar la bondad del ajuste . Cuando se utilizan ponderaciones unitarias, los números deben dividirse por la varianza de una observación.
En el método WLS, la función objetivo ordinaria mencionada anteriormente se reemplaza por un promedio ponderado de los residuos.
Discusión
En estadística y matemáticas , el método de mínimos cuadrados lineales consiste en ajustar un modelo matemático o estadístico a los datos , donde el valor idealizado que proporciona el modelo para cualquier punto de datos se expresa linealmente en función de los parámetros desconocidos del modelo. El modelo ajustado resultante puede utilizarse para resumir los datos, predecir valores no observados del mismo sistema y comprender los mecanismos subyacentes.
Matemáticamente, el problema de mínimos cuadrados lineales consiste en resolver de forma aproximada un sistema sobredeterminado de ecuaciones lineales A x = b , donde b no pertenece al espacio columna de la matriz A . La solución aproximada se obtiene como una solución exacta de A x = b' , donde b' es la proyección de b sobre el espacio columna de A . La mejor aproximación es aquella que minimiza la suma de las diferencias cuadráticas entre los valores de los datos y sus correspondientes valores modelados. Este método se denomina mínimos cuadrados lineales, ya que la función supuesta es lineal en los parámetros que se van a estimar. Los problemas de mínimos cuadrados lineales son convexos y tienen una solución analítica única, siempre que el número de puntos de datos utilizados para el ajuste sea igual o superior al número de parámetros desconocidos, salvo en situaciones degeneradas especiales. En cambio, los problemas de mínimos cuadrados no lineales generalmente deben resolverse mediante un procedimiento iterativo , y pueden ser no convexos con múltiples óptimos para la función objetivo. Si se dispone de distribuciones previas, incluso un sistema subdeterminado puede resolverse utilizando el estimador MMSE bayesiano .
En estadística, los problemas de mínimos cuadrados lineales corresponden a un tipo de modelo estadístico particularmente importante llamado regresión lineal , que surge como una forma particular de análisis de regresión . Una forma básica de dicho modelo es el modelo de mínimos cuadrados ordinarios . El presente artículo se centra en los aspectos matemáticos de los problemas de mínimos cuadrados lineales, mientras que la formulación e interpretación de los modelos de regresión estadística y las inferencias estadísticas relacionadas con estos se abordan en los artículos mencionados anteriormente. Consulte el esquema del análisis de regresión para obtener una descripción general del tema.
Propiedades
Si los errores experimentales,, no están correlacionadas, tienen una media de cero y una varianza constante,, el teorema de Gauss-Markov establece que el estimador de mínimos cuadrados,Tiene la varianza mínima de todos los estimadores que son combinaciones lineales de las observaciones. En este sentido, es el mejor estimador, u óptimo, de los parámetros. Cabe destacar que esta propiedad es independiente de la función de distribución estadística de los errores. En otras palabras, la función de distribución de los errores no tiene por qué ser una distribución normal . Sin embargo, para algunas distribuciones de probabilidad, no hay garantía de que la solución de mínimos cuadrados sea posible dadas las observaciones; aun así, en tales casos es el mejor estimador que es a la vez lineal e insesgado.
Por ejemplo, es fácil demostrar que la media aritmética de un conjunto de mediciones de una magnitud es el estimador de mínimos cuadrados del valor de dicha magnitud. Si se cumplen las condiciones del teorema de Gauss-Markov, la media aritmética es óptima, independientemente de la distribución de los errores de las mediciones.
Sin embargo, en el caso de que los errores experimentales pertenezcan a una distribución normal, el estimador de mínimos cuadrados también es un estimador de máxima verosimilitud . [ 11 ]
Estas propiedades sustentan el uso del método de mínimos cuadrados para todo tipo de ajuste de datos, incluso cuando las suposiciones no son estrictamente válidas.
Limitaciones
Una suposición subyacente al tratamiento descrito anteriormente es que la variable independiente, x , está libre de errores. En la práctica, los errores en las mediciones de la variable independiente suelen ser mucho menores que los errores en la variable dependiente y, por lo tanto, pueden ignorarse. Cuando esto no ocurre, deben utilizarse mínimos cuadrados totales o, más generalmente, modelos de errores en las variables o mínimos cuadrados rigurosos . Esto se puede lograr ajustando el esquema de ponderación para tener en cuenta los errores tanto en la variable dependiente como en la independiente y, a continuación, siguiendo el procedimiento estándar. [ 12 ] [ 13 ]
En algunos casos, la matriz de ecuaciones normales (ponderadas) X T X está mal condicionada . Al ajustar polinomios, la matriz de ecuaciones normales es una matriz de Vandermonde . Las matrices de Vandermonde se vuelven cada vez más mal condicionadas a medida que aumenta el orden de la matriz. En estos casos, la estimación de mínimos cuadrados amplifica el ruido de medición y puede ser muy inexacta. Se pueden aplicar varias técnicas de regularización en tales casos, la más común de las cuales se llama regresión de cresta . Si se conoce más información sobre los parámetros, por ejemplo, un rango de posibles valores de, entonces se pueden utilizar diversas técnicas para aumentar la estabilidad de la solución. Por ejemplo, véase mínimos cuadrados restringidos .
Otro inconveniente del estimador de mínimos cuadrados es el hecho de que la norma de los residuos,se minimiza, mientras que en algunos casos uno está realmente interesado en obtener un pequeño error en el parámetro, por ejemplo, un valor pequeño de. Sin embargo, dado que el parámetro verdaderoes necesariamente desconocido, esta cantidad no puede minimizarse directamente. Si una probabilidad previa enSi se conoce, entonces se puede utilizar un estimador de Bayes para minimizar el error cuadrático medio .El método de mínimos cuadrados se aplica a menudo cuando no se conoce ninguna distribución previa. Cuando se estiman varios parámetros conjuntamente, se pueden construir mejores estimadores, un efecto conocido como el fenómeno de Stein . Por ejemplo, si el error de medición es gaussiano , se conocen varios estimadores que superan a la técnica de mínimos cuadrados; el más conocido de ellos es el estimador de James-Stein . Este es un ejemplo de estimadores de contracción más generales que se han aplicado a problemas de regresión.
Aplicaciones

- Ajuste polinomial : los modelos son polinomios en una variable independiente, x :
- Línea recta:. [ 14 ]
- Cuadrático:.
- Polinomios cúbicos, cuárticos y de orden superior. Para la regresión con polinomios de orden superior , se recomienda el uso de polinomios ortogonales . [ 15 ]
- Suavizado y diferenciación numérica : esta es una aplicación del ajuste polinómico.
- Multinomiales en más de una variable independiente, incluido el ajuste de superficies.
- Ajuste de curvas con B-splines [ 12 ]
- Quimiometría , curva de calibración , adición estándar , gráfico de Gran , análisis de mezclas
Usos en el ajuste de datos
La principal aplicación de los mínimos cuadrados lineales es el ajuste de datos . Dado un conjunto de m puntos de datosque consiste en valores medidos experimentalmente tomados en valores mde una variable independiente (pueden ser cantidades escalares o vectoriales), y dada una función modeloconSe desea encontrar los parámetrosde modo que la función del modelo se ajuste "mejor" a los datos. En mínimos cuadrados lineales, la linealidad se refiere a los parámetros.entonces
Aquí están las funcionespuede ser no lineal con respecto a la variable x .
Idealmente, la función del modelo se ajusta exactamente a los datos, por lo que a pesar deEn la práctica, esto no suele ser posible, ya que hay más datos que parámetros a determinar. Por lo tanto, el método elegido consiste en encontrar el valor mínimo posible de la suma de los cuadrados de los residuos. para minimizar la función
Después de sustituir pory luego para, este problema de minimización se convierte en el problema de minimización cuadrática anterior con y el mejor ajuste se puede encontrar resolviendo las ecuaciones normales.
Ejemplo

Un investigador hipotético realiza un experimento y obtiene cuatropuntos de datos:y(mostrado en rojo en el diagrama de la derecha). Debido al análisis exploratorio de datos o al conocimiento previo del tema, el investigador sospecha que elLos valores dependen de la-valores sistemáticamente. ElSe supone que los valores son exactos, peroLos valores contienen cierta incertidumbre o " ruido " , debido al fenómeno que se está estudiando, imperfecciones en las mediciones, etc.
Ajustar una línea
Una de las relaciones más simples posibles entreyes una líneaLa intercepcióny la pendienteson inicialmente desconocidos. Al investigador le gustaría encontrar valores deyque hacen que la línea pase por los cuatro puntos de datos. En otras palabras, el investigador quiere resolver el sistema de ecuaciones lineales. Con cuatro ecuaciones y dos incógnitas, este sistema está sobredeterminado. No existe una solución exacta. Para considerar soluciones aproximadas, se introducen residuos.,,,en las ecuaciones: Elel residuoes el desajuste entre ella observacióny elpredicción: Entre todas las soluciones aproximadas, el investigador quisiera encontrar la que sea " mejor " en algún sentido.
En mínimos cuadrados , uno se centra en la sumade los residuos al cuadrado: La mejor solución se define como aquella que minimizacon respecto ay. El mínimo se puede calcular estableciendo las derivadas parciales dea cero: Estas ecuaciones normales constituyen un sistema de dos ecuaciones lineales con dos incógnitas. La solución esyy la línea que mejor se ajusta es, por lo tanto. Los residuos sony(véase el diagrama de la derecha). El valor mínimo de la suma de los residuos al cuadrado es
Este cálculo se puede expresar en notación matricial de la siguiente manera. El sistema original de ecuaciones es:, dónde Intuitivamente, Con mayor rigor, sies invertible, entonces la matrizrepresenta la proyección ortogonal sobre el espacio columna de. Por lo tanto, entre todos los vectores de la forma, el más cercano aes. Configuración es evidente quees una solución.
Ajustar una parábola

Supongamos que el hipotético investigador desea ajustar una parábola de la formaEs importante destacar que este modelo sigue siendo lineal en los parámetros desconocidos (ahora solo), por lo que el método de mínimos cuadrados lineales sigue siendo aplicable. El sistema de ecuaciones que incorpora los residuos es
La suma de los residuos al cuadrado es Solo hay que establecer una derivada parcial a 0: La solución esy el modelo de ajuste es.
En notación matricial, las ecuaciones sin residuos son nuevamente¿dónde ahora? Siguiendo la misma lógica que la anterior, la solución es
La figura muestra una extensión para ajustar la parábola de tres parámetros utilizando una matriz de diseño.con tres columnas (una para,, y), y una fila para cada uno de los puntos de datos rojos.
Adaptación a otras curvas y superficies
En términos más generales, uno puede tenerregresoresy un modelo lineal
Véase también
Referencias
- ↑ Weisstein, Eric W. "Ecuación normal" . MathWorld . Wolfram . Consultado el 18 de diciembre de 2023 .
- ↑ Lai, TL; Robbins, H.; Wei, CZ (1978). "Consistencia fuerte de las estimaciones de mínimos cuadrados en regresión múltiple" . PNAS . 75 ( 7): 3034– 3036. Bibcode : 1978PNAS...75.3034L . doi : 10.1073 / pnas.75.7.3034 . JSTOR 68164. PMC 392707. PMID 16592540 .
- ↑ del Pino, Guido (1989). "El papel unificador de los mínimos cuadrados generalizados iterativos en los algoritmos estadísticos" . Statistical Science . 4 (4): 394– 403. doi : 10.1214/ss/1177012408 . JSTOR 2245853 .
- ↑ Carroll, Raymond J. (1982). "Adaptación para la heterocedasticidad en modelos lineales" . The Annals of Statistics . 10 (4): 1224– 1233. doi : 10.1214/aos/1176345987 . JSTOR 2240725 .
- ↑ Cohen, Michael; Dalal, Siddhartha R.; Tukey, John W. (1993). "Regresión de varianza heterogénea robusta y suave". Journal of the Royal Statistical Society, Serie C. 42 ( 2): 339– 353. JSTOR 2986237 .
- ↑ Nievergelt, Yves (1994). "Mínimos cuadrados totales: regresión de vanguardia en análisis numérico". SIAM Review . 36 (2): 258– 264. doi : 10.1137/1036055 . JSTOR 2132463 .
- ↑ Britzger, Daniel (2022). "The Linear Template Fit" . Eur. Phys. J. C. 82 ( 8): 731. arXiv : 2112.01548 . Bibcode : 2022EPJC...82..731B . doi : 10.1140/epjc/s10052-022-10581-w . S2CID 244896511 .
- ↑ Tofallis, C (2009). "Regresión porcentual por mínimos cuadrados" . Journal of Modern Applied Statistical Methods . 7 : 526–534 . doi : 10.2139/ssrn.1406472 . hdl : 2299/965 . SSRN 1406472 .
- ↑ Hamilton, WC (1964). Estadística en las ciencias físicas . Nueva York: Ronald Press.
- ↑ Spiegel, Murray R. (1975). Schaum's outline of theory and problems of probability and statistics . Nueva York: McGraw-Hill. ISBN 978-0-585-26739-5.
- ↑ Margenau, Henry; Murphy, George Moseley (1956). Las matemáticas de la física y la química . Princeton: Van Nostrand.
- 1 2 Gans, Peter (1992). Ajuste de datos en las ciencias químicas . Nueva York: Wiley. ISBN 978-0-471-93412-7.
- ↑ Deming, WE (1943). Ajuste estadístico de datos . Nueva York: Wiley.
- ↑ Acton, FS (1959). Análisis de datos de línea recta . Nueva York: Wiley.
- ↑ Guest, PG (1961). Métodos numéricos de ajuste de curvas . Cambridge: Cambridge University Press.
Lecturas adicionales
- Bevington, Philip R.; Robinson, Keith D. (2003). Reducción de datos y análisis de errores para las ciencias físicas . McGraw-Hill. ISBN 978-0-07-247227-1.
Enlaces externos
- Ajuste por mínimos cuadrados – De MathWorld
- Ajuste de mínimos cuadrados - Polinomio – De MathWorld
- Mínimos cuadrados
- estadística computacional