

En el análisis de regresión , el método de mínimos cuadrados permite determinar el modelo que mejor se ajusta a los datos , minimizando la suma de los residuos al cuadrado , es decir, las diferencias entre los valores observados y los valores predichos por el modelo.
Los problemas de mínimos cuadrados se dividen en dos categorías: mínimos cuadrados lineales u ordinarios y mínimos cuadrados no lineales , según si las funciones del modelo son lineales o no en todas las incógnitas. El problema de mínimos cuadrados lineales se presenta en el análisis de regresión estadística y tiene una solución analítica . El problema no lineal se suele resolver mediante refinamiento iterativo ; en cada iteración, el sistema se aproxima mediante uno lineal, por lo que el cálculo fundamental es similar en ambos casos.
El método de mínimos cuadrados polinomiales describe la varianza en una predicción de la variable dependiente en función de la variable independiente y las desviaciones de la curva ajustada.
Cuando las observaciones provienen de una familia exponencial con identidad como su estadística suficiente natural y se satisfacen condiciones leves (por ejemplo, para distribuciones normales , exponenciales , de Poisson y binomiales ), las estimaciones estandarizadas de mínimos cuadrados y las estimaciones de máxima verosimilitud son idénticas. [ 1 ] El método de mínimos cuadrados también puede derivarse como un estimador del método de momentos .
Historia
El método fue la culminación de varios avances que tuvieron lugar durante el transcurso del siglo XVIII: [ 2 ]
- La combinación de diferentes observaciones como la mejor estimación del valor verdadero; los errores disminuyen con la agregación en lugar de aumentar, apareció por primera vez en la obra de Isaac Newton en 1671, aunque no se publicó, y de nuevo en 1700. [ 3 ] [ 4 ] Quizás fue expresada formalmente por primera vez por Roger Cotes en 1722.
- La combinación de diferentes observaciones tomadas bajo las mismas condiciones, en contraposición a simplemente intentar observar y registrar con precisión una sola observación, se conocía como el método de los promedios. Este método fue utilizado notablemente por Newton al estudiar los equinoccios en 1700, donde también escribió la primera de las "ecuaciones normales" conocidas a partir de los mínimos cuadrados ordinarios , [ 5 ] Tobias Mayer al estudiar las libraciones de la Luna en 1750, y Pierre-Simon Laplace en su trabajo para explicar las diferencias en el movimiento de Júpiter y Saturno en 1788.
- La combinación de diferentes observaciones tomadas bajo diferentes condiciones. Este método llegó a conocerse como el método de la mínima desviación absoluta . Fue aplicado notablemente por Roger Joseph Boscovich en su trabajo sobre la forma de la Tierra en 1757 y por Pierre-Simon Laplace para el mismo problema en 1789 y 1799.
- El desarrollo de un criterio que permita determinar cuándo se ha alcanzado la solución con el mínimo error. Laplace intentó especificar una forma matemática de la densidad de probabilidad de los errores y definir un método de estimación que minimizara el error de estimación. Para ello, utilizó una distribución exponencial simétrica bilateral, que ahora conocemos como distribución de Laplace , para modelar la distribución de errores, y empleó la suma de las desviaciones absolutas como error de estimación. Consideraba que estas eran las suposiciones más sencillas que podía hacer, y esperaba obtener la media aritmética como la mejor estimación. Sin embargo, su estimador fue la mediana posterior.
El método

La primera exposición clara y concisa del método de mínimos cuadrados fue publicada por Legendre en 1805. [ 6 ] La técnica se describe como un procedimiento algebraico para ajustar ecuaciones lineales a datos, y Legendre demuestra el nuevo método analizando los mismos datos que Laplace para la forma de la Tierra. Diez años después de la publicación de Legendre, el método de mínimos cuadrados se había adoptado como herramienta estándar en astronomía y geodesia en Francia , Italia y Prusia , lo que constituye una aceptación extraordinariamente rápida de una técnica científica. [ 2 ]
En 1809, Carl Friedrich Gauss publicó su método para calcular las órbitas de los cuerpos celestes. En esa obra, afirmó haber poseído el método de mínimos cuadrados desde 1795. [ 7 ] Esto, naturalmente, dio lugar a una disputa de prioridad con Legendre. Sin embargo, cabe destacar que Gauss fue más allá de Legendre y logró conectar el método de mínimos cuadrados con los principios de probabilidad y la distribución normal . Había conseguido completar el programa de Laplace de especificar una forma matemática de la densidad de probabilidad para las observaciones, en función de un número finito de parámetros desconocidos, y definir un método de estimación que minimiza el error de estimación. Gauss demostró que la media aritmética es, de hecho, la mejor estimación del parámetro de localización al cambiar tanto la densidad de probabilidad como el método de estimación. Luego, invirtió el problema preguntándose qué forma debería tener la densidad y qué método de estimación debería utilizarse para obtener la media aritmética como estimación del parámetro de localización. En este intento, inventó la distribución normal.
Una demostración temprana de la eficacia del método de Gauss se produjo cuando se utilizó para predecir la ubicación futura del asteroide Ceres, recientemente descubierto . El 1 de enero de 1801, el astrónomo italiano Giuseppe Piazzi descubrió Ceres y pudo seguir su trayectoria durante 40 días antes de que se perdiera en el resplandor del Sol. Con base en estos datos, los astrónomos deseaban determinar la ubicación de Ceres después de que emergiera de detrás del Sol sin resolver las complejas ecuaciones no lineales de Kepler sobre el movimiento planetario. Las únicas predicciones que permitieron al astrónomo húngaro Franz Xaver von Zach localizar Ceres fueron las realizadas por Gauss, de 24 años, mediante el análisis de mínimos cuadrados.
En 1810, tras leer la obra de Gauss, Laplace, después de demostrar el teorema del límite central , lo utilizó para justificar, mediante muestras grandes, el método de mínimos cuadrados y la distribución normal. En 1822, Gauss pudo afirmar que el método de mínimos cuadrados para el análisis de regresión es óptimo, ya que en un modelo lineal donde los errores tienen una media de cero, no están correlacionados, siguen una distribución normal y tienen varianzas iguales, el mejor estimador lineal insesgado de los coeficientes es el estimador de mínimos cuadrados. Una versión extendida de este resultado se conoce como el teorema de Gauss-Markov .
La idea del análisis de mínimos cuadrados también fue formulada independientemente por el estadounidense Robert Adrain en 1808. En los dos siglos siguientes, los investigadores en teoría de errores y estadística encontraron muchas maneras diferentes de implementar los mínimos cuadrados. [ 8 ]
Planteamiento del problema
El objetivo consiste en ajustar los parámetros de una función modelo para que se ajusten mejor a un conjunto de datos. Un conjunto de datos simple consta de n puntos (pares de datos)., i = 1, …, n , dondees una variable independiente yes una variable dependiente cuyo valor se obtiene mediante observación. La función del modelo tiene la forma, donde m parámetros ajustables se almacenan en el vectorEl objetivo es encontrar los valores de los parámetros del modelo que mejor se ajusten a los datos. El ajuste de un modelo a un punto de datos se mide mediante su residuo , definido como la diferencia entre el valor observado de la variable dependiente y el valor predicho por el modelo.

El método de mínimos cuadrados encuentra los valores óptimos de los parámetros minimizando la suma de los residuos al cuadrado .: [ 9 ]
En el caso más simple,y el resultado del método de mínimos cuadrados es la media aritmética de los datos de entrada.
Un ejemplo de modelo en dos dimensiones es el de la línea recta. Denotando la intersección con el eje y comoy la pendiente como, la función del modelo viene dada porConsulte el método de mínimos cuadrados lineales para ver un ejemplo completamente desarrollado de este modelo.
Un punto de datos puede constar de más de una variable independiente. Por ejemplo, al ajustar un plano a un conjunto de mediciones de altura, el plano es función de dos variables independientes, x y z . En el caso más general, puede haber una o más variables independientes y una o más variables dependientes en cada punto de datos.
A la derecha se muestra un gráfico de residuos que ilustra las fluctuaciones aleatorias alrededor de, lo que indica que un modelo lineales apropiado.es una variable aleatoria independiente. [ 9 ]

Si los puntos residuales tuvieran algún tipo de forma y no fluctuaran aleatoriamente, un modelo lineal no sería apropiado. Por ejemplo, si el gráfico de residuos tuviera una forma parabólica como se ve a la derecha, un modelo parabólico sería apropiado.sería apropiado para los datos. Los residuos para un modelo parabólico se pueden calcular mediante. [ 9 ]
Limitaciones
Esta formulación de regresión considera únicamente los errores de observación en la variable dependiente (pero la regresión de mínimos cuadrados totales alternativa puede tener en cuenta los errores en ambas variables). Existen dos contextos bastante diferentes con implicaciones distintas:
- Regresión para predicción. En este caso, se ajusta un modelo para obtener una regla de predicción que se puede aplicar en una situación similar a aquella a la que se refieren los datos utilizados para el ajuste. En este caso, las variables dependientes correspondientes a dicha aplicación futura estarían sujetas a los mismos tipos de error de observación que los presentes en los datos utilizados para el ajuste. Por lo tanto, resulta lógicamente coherente utilizar la regla de predicción de mínimos cuadrados para dichos datos.
- Regresión para ajustar una "relación verdadera". En el análisis de regresión estándar que lleva al ajuste por mínimos cuadrados, existe la suposición implícita de que los errores en la variable independiente son cero o están estrictamente controlados para que sean despreciables. Cuando los errores en la variable independiente no son despreciables, se pueden utilizar modelos de error de medición ; estos métodos pueden conducir a estimaciones de parámetros , pruebas de hipótesis e intervalos de confianza que tienen en cuenta la presencia de errores de observación en las variables independientes. [ 10 ] Un enfoque alternativo es ajustar un modelo por mínimos cuadrados totales ; esto puede verse como adoptar un enfoque pragmático para equilibrar los efectos de las diferentes fuentes de error al formular una función objetivo para su uso en el ajuste del modelo.
Resolver el problema de mínimos cuadrados
El mínimo de la suma de cuadrados se encuentra igualando el gradiente a cero. Dado que el modelo contiene m parámetros, hay m ecuaciones de gradiente: y desde, las ecuaciones de gradiente se convierten en
Las ecuaciones de gradiente se aplican a todos los problemas de mínimos cuadrados. Cada problema particular requiere expresiones particulares para el modelo y sus derivadas parciales . [ 11 ]
mínimos cuadrados lineales
Un modelo de regresión es lineal cuando el modelo comprende una combinación lineal de los parámetros, es decir, donde la funciónes una función de. [ 11 ]
Alquilery colocando las variables independientes y dependientes en matricesyrespectivamente, podemos calcular los mínimos cuadrados de la siguiente manera. Nótese quees el conjunto de todos los datos. [ 11 ] [ 12 ]
El gradiente de la pérdida es:
Establecer el gradiente de la pérdida a cero y resolver para, obtenemos: [ 12 ] [ 11 ]
mínimos cuadrados no lineales
En algunos casos, existe una solución analítica para un problema de mínimos cuadrados no lineales, pero en general no la hay. En caso de no existir una solución analítica, se utilizan algoritmos numéricos para hallar el valor de los parámetros.que minimiza el objetivo. La mayoría de los algoritmos implican elegir valores iniciales para los parámetros. Luego, los parámetros se refinan iterativamente, es decir, los valores se obtienen mediante aproximaciones sucesivas: donde un superíndice k es un número de iteración y el vector de incrementosse denomina vector de desplazamiento. En algunos algoritmos de uso común, en cada iteración el modelo puede linealizarse mediante una aproximación a una expansión en serie de Taylor de primer orden sobre:
El jacobiano J es una función de constantes, la variable independiente y los parámetros, por lo que cambia de una iteración a la siguiente. Los residuos vienen dados por
Para minimizar la suma de los cuadrados de, la ecuación del gradiente se iguala a cero y se resuelve para: que, al reordenarlas, se convierten en m ecuaciones lineales simultáneas, las ecuaciones normales :
Las ecuaciones normales se escriben en notación matricial como
Estas son las ecuaciones que definen el algoritmo de Gauss-Newton .
Diferencias entre mínimos cuadrados lineales y no lineales
- La función del modelo, f , en LLSQ (mínimos cuadrados lineales) es una combinación lineal de parámetros de la formaEl modelo puede representar una línea recta, una parábola o cualquier otra combinación lineal de funciones. En NLLSQ (mínimos cuadrados no lineales), los parámetros aparecen como funciones, como por ejemplo:y así sucesivamente. Si los derivadosSi los parámetros son constantes o dependen únicamente de los valores de la variable independiente, el modelo es lineal. En caso contrario, el modelo es no lineal.
- Se necesitan valores iniciales para los parámetros para encontrar la solución a un problema NLLSQ; LLSQ no los requiere.
- Los algoritmos de solución para NLLSQ a menudo requieren que el jacobiano se pueda calcular de forma similar a LLSQ. Las expresiones analíticas para las derivadas parciales pueden ser complejas. Si no es posible obtener expresiones analíticas, las derivadas parciales deben calcularse mediante aproximación numérica o se debe realizar una estimación del jacobiano, a menudo mediante diferencias finitas .
- La falta de convergencia (el fallo del algoritmo para encontrar un mínimo) es un fenómeno común en NLLSQ.
- LLSQ es globalmente cóncavo, por lo que la falta de convergencia no supone un problema.
- La resolución de problemas NLLSQ suele ser un proceso iterativo que debe finalizar cuando se cumple un criterio de convergencia. Las soluciones LLSQ pueden calcularse mediante métodos directos, aunque los problemas con un gran número de parámetros se suelen resolver con métodos iterativos, como el método de Gauss-Seidel .
- En LLSQ la solución es única, pero en NLLSQ puede haber múltiples mínimos en la suma de cuadrados.
- Si los errores no están correlacionados con las variables predictoras, LLSQ produce estimaciones insesgadas, pero incluso en esa condición, las estimaciones NLLSQ suelen estar sesgadas.
Estas diferencias deben tenerse en cuenta siempre que se busque la solución a un problema de mínimos cuadrados no lineales. [ 11 ]
Ejemplo
Consideremos un ejemplo sencillo de la física. Un resorte debe obedecer la ley de Hooke , que establece que la extensión de un resorte , y, es proporcional a la fuerza, F , que se le aplica. constituye el modelo, donde F es la variable independiente. Para estimar la constante de fuerza , k , realizamos una serie de n mediciones con diferentes fuerzas para producir un conjunto de datos,, donde y i es una extensión de resorte medida. [ 13 ] Cada observación experimental contendrá algún error,y así podemos especificar un modelo empírico para nuestras observaciones,
Hay muchos métodos que podríamos usar para estimar el parámetro desconocido k . Dado que las n ecuaciones en las m variables de nuestros datos comprenden un sistema sobredeterminado con una incógnita y n ecuaciones, estimamos k usando mínimos cuadrados. La suma de cuadrados a minimizar es [ 11 ].
La estimación por mínimos cuadrados de la constante de fuerza, k , viene dada por
Suponemos que al aplicar una fuerza se produce la expansión del resorte. Tras obtener la constante elástica mediante el método de mínimos cuadrados, predecimos la extensión a partir de la ley de Hooke.
Cuantificación de la incertidumbre
En un cálculo de mínimos cuadrados con ponderaciones unitarias, o en regresión lineal, la varianza del j -ésimo parámetro, denotada, generalmente se estima con donde la verdadera varianza del error σ 2 se reemplaza por una estimación, el estadístico chi-cuadrado reducido , basado en el valor minimizado de la suma de cuadrados residuales (función objetivo), S . El denominador, n − m , son los grados de libertad estadísticos ; véase grados de libertad efectivos para generalizaciones. [ 11 ] C es la matriz de covarianza .
Pruebas estadísticas
Si se conoce la distribución de probabilidad de los parámetros o se realiza una aproximación asintótica, se pueden hallar los límites de confianza . Del mismo modo, se pueden realizar pruebas estadísticas sobre los residuos si se conoce o se asume su distribución de probabilidad. Podemos derivar la distribución de probabilidad de cualquier combinación lineal de las variables dependientes si se conoce o se asume la distribución de probabilidad de los errores experimentales. La inferencia es sencilla cuando se asume que los errores siguen una distribución normal, lo que implica que las estimaciones de los parámetros y los residuos también seguirán una distribución normal condicionada a los valores de las variables independientes. [ 11 ]
Para realizar pruebas estadísticas de los resultados, es necesario hacer suposiciones sobre la naturaleza de los errores experimentales. Una suposición común es que los errores siguen una distribución normal. El teorema del límite central respalda la idea de que esta es una buena aproximación en muchos casos.
- El teorema de Gauss-Markov . En un modelo lineal en el que los errores tienen esperanza cero condicionada a las variables independientes, no están correlacionados y tienen varianzas iguales , el mejor estimador lineal insesgado de cualquier combinación lineal de las observaciones es su estimador de mínimos cuadrados. "Mejor" significa que los estimadores de mínimos cuadrados de los parámetros tienen varianza mínima. El supuesto de varianza igual es válido cuando todos los errores pertenecen a la misma distribución. [ 14 ]
- Si los errores siguen una distribución normal, los estimadores de mínimos cuadrados son también los estimadores de máxima verosimilitud en un modelo lineal.
Sin embargo, supongamos que los errores no siguen una distribución normal. En ese caso, el teorema del límite central suele implicar que las estimaciones de los parámetros se distribuirán aproximadamente de forma normal siempre que la muestra sea lo suficientemente grande. Por esta razón, dada la importante propiedad de que la media del error es independiente de las variables independientes, la distribución del término de error no es un aspecto importante en el análisis de regresión. En concreto, no suele ser relevante si el término de error sigue una distribución normal.
mínimos cuadrados ponderados

Un caso especial de mínimos cuadrados generalizados llamado mínimos cuadrados ponderados ocurre cuando todas las entradas fuera de la diagonal de Ω (la matriz de correlación de los residuos) son nulas; las varianzas de las observaciones (a lo largo de la diagonal de la matriz de covarianza) aún pueden ser desiguales ( heterocedasticidad ). En términos más simples, la heterocedasticidad es cuando la varianza dedepende del valor delo que provoca que el gráfico de residuos cree un efecto de "expansión" hacia valores más grandes o más pequeños.valores como se ve en el gráfico de residuos a la derecha. Por otro lado, la homocedasticidad supone que la varianza dey varianza deson iguales. [ 9 ]
Relación con los componentes principales
El primer componente principal alrededor de la media de un conjunto de puntos puede representarse mediante la línea que más se aproxima a los puntos de datos (medida por la distancia al cuadrado de la aproximación más cercana, es decir, perpendicular a la línea). En contraste, los mínimos cuadrados lineales intentan minimizar la distancia en elsolo dirección. Por lo tanto, aunque ambos utilizan una métrica de error similar, el método de mínimos cuadrados lineales trata una dimensión de los datos de forma preferencial, mientras que el PCA trata todas las dimensiones por igual.
Relación con la teoría de la medición
La destacada estadística Sara van de Geer utilizó la teoría de procesos empíricos y la dimensión de Vapnik-Chervonenkis para demostrar que un estimador de mínimos cuadrados puede interpretarse como una medida en el espacio de funciones de cuadrado integrable . [ 15 ]
Regularización
regularización de Tikhonov
En algunos contextos, puede ser preferible una versión regularizada de la solución de mínimos cuadrados. La regularización de Tikhonov (o regresión de cresta ) agrega una restricción que, el cuadradoLa norma L1 del vector de parámetros no es mayor que un valor dado en la formulación de mínimos cuadrados, lo que da lugar a un problema de minimización con restricciones. Esto es equivalente al problema de minimización sin restricciones, donde la función objetivo es la suma de los cuadrados de los residuos más un término de penalización.yes un parámetro de ajuste (esta es la forma lagrangiana del problema de minimización con restricciones). [ 16 ]
En un contexto bayesiano , esto equivale a colocar una distribución a priori normal con media cero sobre el vector de parámetros.
Método del lazo
Una versión regularizada alternativa de mínimos cuadrados es Lasso (operador de selección y contracción de mínimos absolutos), que utiliza la restricción de que, la norma L 1 del vector de parámetros, no es mayor que un valor dado. [ 17 ] [ 18 ] [ 19 ] (Se puede demostrar como arriba usando multiplicadores de Lagrange que esto es equivalente a una minimización no restringida de la penalización de mínimos cuadrados con(añadido.) En un contexto bayesiano , esto es equivalente a colocar una distribución a priori de Laplace de media cero en el vector de parámetros. [ 20 ] El problema de optimización puede resolverse utilizando programación cuadrática o métodos de optimización convexa más generales , así como mediante algoritmos específicos como el algoritmo de regresión de ángulo mínimo .
Una de las principales diferencias entre Lasso y la regresión de cresta es que en la regresión de cresta, a medida que aumenta la penalización, todos los parámetros se reducen sin dejar de ser cero, mientras que en Lasso, aumentar la penalización hará que cada vez más parámetros se conduzcan a cero. Esta es una ventaja de Lasso sobre la regresión de cresta, ya que al conducir los parámetros a cero se deseleccionan las características de la regresión. Por lo tanto, Lasso selecciona automáticamente las características más relevantes y descarta las demás, mientras que la regresión de cresta nunca descarta completamente ninguna característica. Algunas técnicas de selección de características se desarrollan basadas en LASSO, incluyendo Bolasso, que realiza el remuestreo de muestras, [ 21 ] y FeaLect, que analiza los coeficientes de regresión correspondientes a diferentes valores depara puntuar todas las características. [ 22 ]
La formulación regularizada L1 es útil en algunos contextos debido a su tendencia a preferir soluciones donde más parámetros son cero, lo que da soluciones que dependen de menos variables. [ 17 ] Por esta razón, Lasso y sus variantes son fundamentales para el campo de la detección comprimida . Una extensión de este enfoque es la regularización de red elástica .
Véase también
- Ajuste de mínimos cuadrados
- Estimador MMSE bayesiano
- Estimador lineal insesgado óptimo (BLUE)
- Mejor predicción lineal insesgada (BLUP)
- Teorema de Gauss-Markov
- norma L2
- Desviaciones absolutas mínimas
- Análisis espectral por mínimos cuadrados
- Incertidumbre de medición
- Proyección ortogonal
- Métodos de gradiente proximal para el aprendizaje
- Función de pérdida cuadrática
- raíz cuadrática media
- Desviaciones cuadráticas respecto a la media
Referencias
- ↑ Charnes, A.; Frome, EL; Yu, PL (1976). "La equivalencia de los mínimos cuadrados generalizados y las estimaciones de máxima verosimilitud en la familia exponencial". Journal of the American Statistical Association . 71 (353): 169– 171. doi : 10.1080/01621459.1976.10481508 .
- 1 2 Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Cambridge, MA: Belknap Press de Harvard University Press. ISBN 978-0-674-40340-6.
- ↑ Buchwald, Jed Z.; Feingold, Mordechai (2013). Newton y el origen de la civilización . Princeton Oxford: Princeton University Press. pp. 90–93 , 101–103 . ISBN 978-0-691-15478-7.
- ↑ Drum, Kevin (10 de mayo de 2013). "El revolucionario invento de Isaac Newton del que nunca has oído hablar" . Mother Jones . Consultado el 21 de diciembre de 2024 .
- ↑ Belenkiy, Ari; Echague, Eduardo Vila (2008). "A tientas hacia el análisis de regresión lineal: el análisis de Newton de las observaciones del equinoccio de Hiparco". arXiv : 0810.4948 [ physics.hist-ph ].
- ↑ Legendre, Adrien-Marie (1805), Nouvelles méthodes pour la détermination des orbites des comètes [ Nuevos métodos para la determinación de las órbitas de los cometas ] (en francés), París: F. Didot, hdl : 2027/nyp.33433069112559
- ↑ "El descubrimiento de la regresión estadística" . Priceonomics . 6 de noviembre de 2015. Consultado el 4 de abril de 2023 .
- ↑ Aldrich, J. (1998). "Haciendo mínimos cuadrados: perspectivas de Gauss y Yule". International Statistical Review . 66 (1): 61– 81. doi : 10.1111/j.1751-5823.1998.tb00406.x . S2CID 121471194 .
- 1 2 3 4 Dekking, Frederik Michel; Kraaikamp, Cornelis; Lopuhaä, Hendrik "Rik"; Meester, Ludolf E. (2005). Una introducción moderna a la probabilidad y la estadística: comprender por qué y cómo . Textos de Springer en estadística. Springer Publishing . ISBN 9781852338961.
- ↑ Para una buena introducción al error en las variables, consulte Fuller, WA (1987). Measurement Error Models . John Wiley & Sons. ISBN 978-0-471-86187-4.
- 1 2 3 4 5 6 7 8 Williams, Jeffrey H. (Jeffrey Huw), 1956- (noviembre de 2016). Cuantificando la medición: la tiranía de los números . Morgan & Claypool Publishers, Institute of Physics (Gran Bretaña). San Rafael [California] (40 Oak Drive, San Rafael, CA, 94903, EE. UU.). ISBN 978-1-68174-433-9OCLC 962422324 .
{{cite book}}: CS1 maint: ubicación ( enlace ) CS1 maint: ubicación falta el editor ( enlace ) CS1 maint: nombres múltiples: lista de autores ( enlace ) CS1 maint: nombres numéricos: lista de autores ( enlace ) - 1 2 Rencher, Alvin C.; Christensen, William F. (15 de agosto de 2012). Métodos de análisis multivariante . John Wiley & Sons. pág. 155. ISBN 978-1-118-39167-9.
- ↑ Gere, James M.; Goodno, Barry J. (2013). Mecánica de materiales (8.ª ed.). Stamford, Conn.: Cengage Learning. ISBN 978-1-111-57773-5OCLC 741541348
- ↑ Hallin, Marc (2012). "Teorema de Gauss-Markov" . Enciclopedia de Environmetría . Wiley. doi : 10.1002/9780470057339.vnn102 . ISBN 978-0-471-89997-6Consultado el 18 de octubre de 2023 .
- ↑ van de Geer, Sara (junio de 1987). "Un nuevo enfoque para la estimación por mínimos cuadrados, con aplicaciones" . Annals of Statistics . 15 (2): 587– 602. doi : 10.1214/aos/1176350362 . S2CID 123088844 .
- ↑ van Wieringen, Wessel N. (2021). "Apuntes de conferencias sobre regresión de crestas". arXiv : 1509.09169 [ estad.ME ].
- 1 2 Tibshirani, R. (1996). "Regresión, contracción y selección mediante el método lasso". Journal of the Royal Statistical Society, Serie B. 58 ( 1): 267– 288. doi : 10.1111/j.2517-6161.1996.tb02080.x . JSTOR 2346178 .
- ↑ Hastie, Trevor ; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico (segunda edición). Springer-Verlag. ISBN 978-0-387-84858-7Archivado del original el 10 de noviembre de 2009.
- ↑ Bühlmann, Peter; van de Geer, Sara (2011). Statistics for High-Dimensional Data: Methods, Theory and Applications . Springer. ISBN 9783642201929.
- ↑ Park, Trevor; Casella, George (2008). "The Bayesian Lasso". Journal of the American Statistical Association . 103 (482): 681– 686. doi : 10.1198/016214508000000337 . S2CID 11797924 .
- ↑ Bach, Francis R (2008). "Bolasso" . Actas de la 25.ª conferencia internacional sobre aprendizaje automático - ICML '08 . págs. 33–40 . arXiv : 0804.1302 . Bibcode : 2008arXiv0804.1302B . doi : 10.1145/1390156.1390161 . ISBN 9781605582054. S2CID 609778 .
- ↑ Zare, Habil (2013). "Puntuación de la relevancia de las características basada en el análisis combinatorio de Lasso con aplicación al diagnóstico de linfoma" . BMC Genomics . 14 (Supl. 1): S14. doi : 10.1186/1471-2164-14-S1-S14 . PMC 3549810. PMID 23369194 .
Lecturas adicionales
- Björck, Å. (1996). Métodos numéricos para problemas de mínimos cuadrados . SIAM. ISBN 978-0-89871-360-2.
- Kariya, T.; Kurata, H. (2004). Mínimos cuadrados generalizados . Hoboken: Wiley. ISBN 978-0-470-86697-9.
- Luenberger, DG (1997) [1969]. "Estimación por mínimos cuadrados" . Optimización mediante métodos de espacio vectorial . Nueva York: John Wiley & Sons. págs. 78–102 . ISBN 978-0-471-18117-0.
- Rao, CR ; Toutenburg, H .; et al. (2008). Modelos lineales: mínimos cuadrados y alternativas . Springer Series in Statistics (3.ª ed.). Berlín: Springer. ISBN 978-3-540-74226-5.
- Strutz, T. (2016). Ajuste de datos e incertidumbre: una introducción práctica a los mínimos cuadrados ponderados y más allá (2.ª ed.). Springer Vieweg. ISBN 978-3-658-11455-8.
- Van de moortel, Koen (abril de 2021). "Análisis de regresión multidireccional" .
- Wolberg, J. (2005). Análisis de datos mediante el método de mínimos cuadrados: cómo extraer la mayor cantidad de información de los experimentos . Berlín: Springer. ISBN 978-3-540-25674-8.
Enlaces externos
Contenido multimedia relacionado con el método de mínimos cuadrados en Wikimedia Commons.
- Mínimos cuadrados
- Métodos de ecuación única (econometría)
- Algoritmos y métodos de optimización