
En estadística aplicada , el método de mínimos cuadrados totales es un tipo de regresión con errores en las variables , una técnica de modelado de datos por mínimos cuadrados que considera los errores de observación tanto en la variable dependiente como en la independiente. Es una generalización de la regresión de Deming y también de la regresión ortogonal , y puede aplicarse tanto a modelos lineales como no lineales.
La aproximación total de mínimos cuadrados de los datos es genéricamente equivalente a la mejor aproximación de bajo rango de la matriz de datos en la norma de Frobenius . [ 1 ]
Modelo lineal
Fondo
En el método de mínimos cuadrados para el modelado de datos, la función objetivo que se debe minimizar, S , es una forma cuadrática :
donde r es el vector de residuos y W es una matriz de ponderación. En mínimos cuadrados lineales, el modelo contiene ecuaciones que son lineales en los parámetros que aparecen en el vector de parámetros., por lo que los residuos vienen dados por
Hay m observaciones en y y n parámetros en β con m > n . X es una matriz m × n cuyos elementos son constantes o funciones de las variables independientes, x . La matriz de ponderación W es, idealmente, la inversa de la matriz de varianza-covarianza.de las observaciones y . Se supone que las variables independientes no tienen error. Las estimaciones de los parámetros se obtienen igualando a cero las ecuaciones del gradiente, lo que da como resultado las ecuaciones normales [ a ].
Permitir errores de observación en todas las variables
Ahora bien, supongamos que tanto x como y se observan sujetas a error, con matrices de varianza-covarianza.yrespectivamente. En este caso, la función objetivo se puede escribir como
dóndeyson los residuos en x e y respectivamente. Claramente, estos residuos no pueden ser independientes entre sí, sino que deben estar restringidos por algún tipo de relación. Escribiendo la función del modelo como, las restricciones se expresan mediante m ecuaciones de condición. [ 2 ]
Así pues, el problema consiste en minimizar la función objetivo sujeta a las m restricciones. Se resuelve mediante el uso de multiplicadores de Lagrange . Tras algunas manipulaciones algebraicas, [ 3 ] se obtiene el resultado.
o alternativamente donde M es la matriz de varianza-covarianza relativa a las variables independientes y dependientes.
Ejemplo
Cuando los errores de los datos no están correlacionados, todas las matrices M y W son diagonales. Consideremos entonces el ejemplo del ajuste de una línea recta.
en este caso
mostrando cómo la varianza en el i -ésimo punto está determinada por las varianzas de las variables independientes y dependientes y por el modelo que se utiliza para ajustar los datos. La expresión puede generalizarse observando que el parámetroes la pendiente de la línea.
Una expresión de este tipo se utiliza para ajustar datos de titulación de pH, donde un pequeño error en x se traduce en un gran error en y cuando la pendiente es grande.
Punto de vista algebraico
Como demostraron Golub y Van Loan en 1980, el problema TLS no tiene solución en general. [ 4 ] A continuación se considera el caso simple en el que existe una solución única sin hacer suposiciones particulares.
El cálculo del TLS mediante descomposición en valores singulares (SVD) se describe en textos estándar. [ 5 ] Podemos resolver la ecuación
para B donde X es m-por - n e Y es m -por- k . [ b ]
Es decir, buscamos encontrar B que minimice las matrices de error E y F para X e Y respectivamente. Es decir,
dóndees la matriz aumentada con E y F una al lado de la otra yes la norma de Frobenius , la raíz cuadrada de la suma de los cuadrados de todas las entradas de una matriz y, por lo tanto, equivalentemente, la raíz cuadrada de la suma de los cuadrados de las longitudes de las filas o columnas de la matriz.
Esto se puede reescribir como
dóndees elmatriz identidad. El objetivo es entonces encontrarque reduce el rango depor k . Definirser la descomposición en valores singulares de la matriz aumentada.
donde V se divide en bloques que corresponden a la forma de X e Y.
Utilizando el teorema de Eckart-Young , la aproximación que minimiza la norma del error es tal que las matricesypermanecen sin cambios, mientras que los más pequeñosLos valores singulares se reemplazan por ceros. Es decir, queremos
por lo tanto, por linealidad,
Luego podemos eliminar bloques de las matrices U y Σ, simplificando a
Esto proporciona E y F de modo que
Ahora bien, sies no singular, lo cual no siempre es el caso (tenga en cuenta que el comportamiento de TLS cuandoes singular aún no se entiende bien), entonces podemos multiplicar ambos lados por la derechapara llevar el bloque inferior de la matriz derecha a la identidad negativa, dando [ 6 ]
y entonces
Una implementación sencilla de esto en GNU Octave / MATLAB es:
función B = tls ( X, Y ) [ m n ] = tamaño ( X ); % n es el ancho de X (X es m por n) Z = [ X Y ]; % Z es X aumentado con Y. [ U S V ] = svd ( Z , 0 ); % encuentra la SVD de Z. VXY = V ( 1 : n , 1 + n : fin ); % Toma el bloque de V que consta de las primeras n filas y la columna n+1 hasta la última VYY = V ( 1 + n : fin , 1 + n : fin ); % Toma el bloque inferior derecho de V. B = - VXY / VYY ; finLa forma descrita anteriormente para resolver el problema, que requiere que la matrizes no singular, puede extenderse ligeramente mediante el llamado algoritmo TLS clásico . [ 7 ]
Cálculo
La implementación estándar del algoritmo TLS clásico escrito por Van Huffel está disponible a través de Netlib , véase también. [ 8 ] [ 9 ] Todas las implementaciones modernas basadas, por ejemplo, en la resolución de una secuencia de problemas de mínimos cuadrados ordinarios, aproximan la matriz(denotadoen la literatura), [ b ] como lo introdujeron Van Huffel y Vandewalle. Vale la pena señalar que esta solución es, sin embargo, solo la solución TLS cuandoyEn otros casos representa un, una solución del problema de mínimos cuadrados totales truncados (T-TLS). [ 10 ] [ 11 ] El T-TLS tiene una propiedad de regularización que el TLS real no tiene. [ 11 ]
Modelo no lineal
Para sistemas no lineales, un razonamiento similar muestra que las ecuaciones normales para un ciclo de iteración se pueden escribir como
dóndees la matriz jacobiana .
Interpretación geométrica
Cuando la variable independiente no tiene errores, un residuo representa la distancia "vertical" entre el punto de datos observado y la curva (o superficie) ajustada. En mínimos cuadrados totales, un residuo representa la distancia entre un punto de datos y la curva ajustada medida a lo largo de alguna dirección. De hecho, si ambas variables se miden en las mismas unidades y los errores en ambas variables son iguales, entonces el residuo representa la distancia más corta entre el punto de datos y la curva ajustada , es decir, el vector residual es perpendicular a la tangente de la curva. Por esta razón, este tipo de regresión a veces se denomina regresión euclidiana bidimensional (Stein, 1983) [ 12 ] o regresión ortogonal .
métodos invariantes de escala
Surge una dificultad seria si las variables no se miden en las mismas unidades. Primero, consideremos la medición de la distancia entre un punto de datos y la línea: ¿cuáles son las unidades de medida para esta distancia? Si consideramos la medición de la distancia basada en el teorema de Pitágoras, entonces es claro que estaremos sumando cantidades medidas en diferentes unidades, lo cual no tiene sentido. En segundo lugar, si reescalamos una de las variables, por ejemplo, medir en gramos en lugar de kilogramos, entonces terminaremos con resultados diferentes (una línea diferente). Para evitar estos problemas, a veces se sugiere que convertimos a variables adimensionales; esto puede llamarse normalización o estandarización. Sin embargo, hay varias maneras de hacer esto, y estas conducen a modelos ajustados que no son equivalentes entre sí. Un enfoque es normalizar por la precisión de medición conocida (o estimada) minimizando así la distancia de Mahalanobis de los puntos a la línea, proporcionando una solución de máxima verosimilitud ; [ 13 ] las precisiones desconocidas podrían encontrarse mediante análisis de varianza .
En resumen, el método de mínimos cuadrados totales no posee la propiedad de invariancia de unidades , es decir, no es invariante de escala . Para un modelo significativo, requerimos que se cumpla esta propiedad. Una solución consiste en comprender que los residuos (distancias) medidos en diferentes unidades pueden combinarse si se utiliza la multiplicación en lugar de la suma. Consideremos el ajuste de una línea: para cada punto de datos, el producto de los residuos verticales y horizontales es igual al doble del área del triángulo formado por las líneas residuales y la línea ajustada. Elegimos la línea que minimiza la suma de estas áreas. El premio Nobel Paul Samuelson demostró en 1942 que, en dos dimensiones, es la única línea expresable únicamente en términos de las razones de las desviaciones estándar y el coeficiente de correlación que (1) se ajusta a la ecuación correcta cuando las observaciones se encuentran en una línea recta, (2) exhibe invariancia de escala y (3) exhibe invariancia bajo intercambio de variables. [ 13 ] Esta solución ha sido redescubierta en diferentes disciplinas y se conoce de diversas maneras como eje mayor estandarizado (Ricker 1975, Warton et al., 2006), [ 14 ] [ 15 ] el eje mayor reducido , la relación funcional de la media geométrica (Draper y Smith, 1998), [ 16 ] [ c ] regresión de productos mínimos , regresión diagonal , línea de correlación orgánica , línea imparcial de Strömberg , la relación de alometría, regresión de media geométrica (GM) , [ 17 ] y la línea de áreas mínimas (Tofallis, 2002). [ 18 ] GMFR ha sido recomendado para su uso en biología. [ 19 ]
Tofallis (2015, 2023) [ 20 ] [ 21 ] ha extendido este enfoque para tratar con múltiples variables. Los cálculos son más sencillos que para los mínimos cuadrados totales, ya que solo requieren el conocimiento de la matriz de covarianza y pueden calcularse utilizando funciones estándar de hoja de cálculo. El TLS invariante a escala es un ejemplo de regresión simétrica , donde cada variable se trata por igual. [ 21 ] Más concretamente, dada una matriz de covarianza M y su inversa M −1 , la regresión esPara un gran número de variables, es más eficiente calcular directamente los elementos diagonales de M −1 utilizando la positividad definida de M . [ 21 ]
Véase también
- dilución de regresión
- Regresión de Deming , un caso especial con dos predictores y errores independientes.
- modelo de errores en las variables
- modelo de Gauss-Helmert
- Regresión lineal
- Mínimos cuadrados
- Análisis de componentes principales
- regresión de componentes principales
Notas
- ↑ Una forma alternativa es, dóndees el cambio de parámetro a partir de alguna estimación inicial deyes la diferencia entre y y el valor calculado utilizando el valor inicial de
- 1 2 La notación XB ≈ Y se utiliza aquí para reflejar la notación utilizada en la parte anterior del artículo. En la literatura computacional, el problema se ha presentado más comúnmente como AX ≈ B , es decir, con la letra X utilizada para la matriz n- × -k de coeficientes de regresión desconocidos.
- ↑ Se denomina así porque la pendiente GMFR es la media geométrica de las dos pendientes OLS, lo que también facilita su cálculo utilizando las herramientas existentes.
Referencias
- ↑ I. Markovsky y S. Van Huffel , Panorama general de los métodos de mínimos cuadrados totales. Procesamiento de señales, vol. 87, págs. 2283–2302, 2007. Preimpresión
- ↑ WE Deming, Ajuste estadístico de datos, Wiley, 1943
- ↑ Gans, Peter (1992). Ajuste de datos en las ciencias químicas . Wiley. ISBN 9780471934127Consultado el 4 de diciembre de 2012 .
- ↑ GH Golub y CF Van Loan, Un análisis del problema de mínimos cuadrados totales. Numer. Anal., 17, 1980, pp. 883–893.
- ↑ Golub, Gene H. ; Van Loan, Charles F. (1996). Matrix Computations (3rd ed.). The Johns Hopkins University Press . págs. 596.
- ↑ Bjõrck, Ake (1996) Métodos numéricos para problemas de mínimos cuadrados , Sociedad de Matemáticas Industriales y Aplicadas. ISBN 978-0898713602
- ↑ S. Van Huffel y J. Vandewalle (1991) Los problemas de mínimos cuadrados totales: aspectos computacionales y análisis . SIAM Publications, Filadelfia, PA.
- ↑ S. Van Huffel , Programas documentados en Fortran 77 del algoritmo extendido de mínimos cuadrados totales clásicos, el algoritmo de descomposición en valores singulares parciales y el algoritmo de mínimos cuadrados totales parciales, Informe interno ESAT-KUL 88/1, Laboratorio ESAT, Departamento de Ingeniería Eléctrica, Universidad Católica de Lovaina, 1988.
- ↑ S. Van Huffel , El algoritmo extendido de mínimos cuadrados totales clásicos, J. Comput. Appl. Math., 25, pp. 111–119, 1989.
- ↑ M. Plešinger, El problema de mínimos cuadrados totales y la reducción de datos en AX ≈ B. Tesis doctoral, TU de Liberec e Instituto de Ciencias de la Computación, AS CR Praga, 2008. Tesis doctoral
- 1 2 Hnětynková, Iveta; Plešinger, Martin; Sima, Diana Maria; Strakoš, Zdeněk; Van Huffel, Sabine (julio de 2011). "El problema de mínimos cuadrados totales en AX≈B: una nueva clasificación con la relación con los trabajos clásicos" (PDF) . SIAM Journal on Matrix Analysis and Applications . 32 (3): 748– 770. doi : 10.1137/100813348 .
- ↑ Stein, Yaakov J. "Regresión euclidiana bidimensional" (PDF) .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - 1 2 Samuelson, Paul A. (1942). "Una nota sobre regresiones alternativas". Econometrica . 10 (1): 80– 83. doi : 10.2307/1907024 . JSTOR 1907024 .
- ↑ Ricker, WE (1975). "Una nota sobre los comentarios del profesor Jolicoeur". Journal of the Fisheries Research Board of Canada . 32 (8): 1494– 1498. Bibcode : 1975JFRBC..32.1494R . doi : 10.1139/f75-172 .
- ↑ Warton, David I.; Wright, Ian J.; Falster, Daniel S.; Westoby, Mark (2006). "Métodos de ajuste de línea bivariados para alometría". Biological Reviews . 81 (2): 259– 291. Bibcode : 2006BioRv..81..259W . CiteSeerX 10.1.1.461.9154 . doi : 10.1017/S1464793106007007 . PMID 16573844 . S2CID 16462731 .
- ↑ Draper, NR y Smith, H. Análisis de regresión aplicada , 3.ª edición, págs. 92-96. 1998
- ↑ Smith, Richard J. (noviembre de 2009). "Uso y mal uso del eje mayor reducido para el ajuste de líneas" . American Journal of Physical Anthropology . 140 (3): 476– 486. doi : 10.1002/ajpa.21090 . ISSN 0002-9483 . PMID 19425097 .
- ↑ Tofallis, Chris (2002). "Ajuste de modelos para múltiples variables minimizando la desviación media geométrica". En Van Huffel, Sabine ; Lemmerling, P. (eds.). Mínimos cuadrados totales y modelado de errores en variables: análisis, algoritmos y aplicaciones . Dordrecht: Kluwer Academic Publ. doi : 10.1007/978-94-017-3552-0 . ISBN 978-1402004766. SSRN 1077322 .
- ↑ Xu, Shaoji (2 de octubre de 2014). "Una propiedad de la regresión de media geométrica" . The American Statistician . 68 (4): 277–281 . doi : 10.1080/00031305.2014.962763 . ISSN 0003-1305 .
- ↑ Tofallis, Chris (2015). "Ajuste de ecuaciones a datos con la relación de correlación perfecta". SSRN 2707593 .
- 1 2 3 Tofallis, Chris (18 de septiembre de 2023). "Ajuste imparcial de una ecuación a datos" . Matemáticas . 11 (18): 3957. arXiv : 2409.02573 . doi : 10.3390/math11183957 . SSRN 4556739 .
Otros
- I. Hnětynková, M. Plešinger, DM Sima, Z. Strakoš y S. Van Huffel , El problema de mínimos cuadrados totales en AX ≈ B. Una nueva clasificación con la relación con los trabajos clásicos. SIMAX vol. 32 número 3 (2011), pp. 748–770. Disponible como preimpresión .
- M. Plešinger, El problema de mínimos cuadrados totales y la reducción de datos en AX ≈ B. Tesis doctoral, TU de Liberec e Instituto de Ciencias de la Computación, AS CR Praga, 2008. Tesis doctoral
- CC Paige, Z. Strakoš, Problemas fundamentales en sistemas algebraicos lineales. SIAM J. Matrix Anal. Appl. 27, 2006, pp. 861–875. doi : 10.1137/040616991
- S. Van Huffel y P. Lemmerling, Mínimos cuadrados totales y modelado de errores en variables: análisis, algoritmos y aplicaciones . Dordrecht, Países Bajos: Kluwer Academic Publishers, 2002.
- S. Jo y SW Kim, Filtrado consistente de mínimos cuadrados normalizados con matriz de datos ruidosa. IEEE Trans. Signal Process., vol. 53, n.º 6, págs. 2112–2123, junio de 2005.
- RD DeGroat y EM Dowling, El problema de los mínimos cuadrados de datos y la ecualización de canales. IEEE Trans. Signal Process., vol. 41, n.º 1, págs. 407–411, enero de 1993.
- S. Van Huffel y J. Vandewalle, Problemas de mínimos cuadrados totales: aspectos computacionales y análisis. SIAM Publications, Filadelfia, PA, 1991. doi : 10.1137/1.9781611971002
- T. Abatzoglou y J. Mendel, Mínimos cuadrados totales restringidos , en Proc. IEEE Int. Conf. Acoust., Speech, Signal Process. (ICASSP'87), abril de 1987, vol. 12, pp. 1485–1488.
- P. de Groen Una introducción a los mínimos cuadrados totales , en Nieuw Archief voor Wiskunde, Vierde serie, del 14, 1996, págs. 237–253 arxiv.org .
- GH Golub y CF Van Loan, Un análisis del problema de mínimos cuadrados totales. SIAM J. on Numer. Anal., 17, 1980, pp. 883–893. doi : 10.1137/0717073
- Regresión perpendicular de una línea en MathPages
- AR Amiri-Simkooei y S. Jazaeri, Mínimos cuadrados totales ponderados formulados mediante la teoría estándar de mínimos cuadrados , en Journal of Geodetic Science, 2 (2): 113–124, 2012.
- Matemáticas aplicadas
- Ajuste de curvas
- Mínimos cuadrados
- Modelos de regresión