La regresión de cresta (también conocida como regularización de Tikhonov , llamada así por Andrey Tikhonov ) es un método para estimar los coeficientes de modelos de regresión múltiple en escenarios donde las variables están altamente correlacionadas. [ 1 ] Se ha utilizado en muchos campos, incluyendo econometría , química e ingeniería. [ 2 ] Es un método ampliamente utilizado para la regularización de problemas inversos mal condicionados . [ a ] Es particularmente útil para mitigar el problema de la multicolinealidad en la regresión lineal , que ocurre comúnmente en modelos con un gran número de parámetros. [ 3 ] En general, el método proporciona una mayor eficiencia en los problemas de estimación de parámetros a cambio de una cantidad tolerable de sesgo (ver compensación sesgo-varianza ). [ 4 ]
La teoría fue introducida por primera vez por Hoerl y Kennard en 1970 en sus artículos de Technometrics "Regresiones de cresta: estimación sesgada de problemas no ortogonales" y "Regresiones de cresta: aplicaciones en problemas no ortogonales". [ 5 ] [ 6 ] [ 1 ]
La regresión de cresta se desarrolló como una posible solución a la imprecisión de los estimadores de mínimos cuadrados cuando los modelos de regresión lineal tienen algunas variables independientes multicolineales (altamente correlacionadas), mediante la creación de un estimador de regresión de cresta (RR). Esto proporciona una estimación más precisa de los parámetros de cresta, ya que su varianza y el estimador de la media cuadrática suelen ser menores que los estimadores de mínimos cuadrados derivados previamente. [ 7 ] [ 2 ]
Descripción general
En la solución de mínimos cuadrados ordinarios de
el problema de una matriz de momentos casi singularse alivia añadiendo elementos positivos a las diagonales , disminuyendo así su número de condición . En comparación con el estimador de mínimos cuadrados ordinarios, el estimador de cresta simple tiene un término adicional.en el denominador: dóndees el vector de respuesta o regresonda ,es la matriz de diseño ,es la matriz identidad y el parámetro de regularización de cresta (o Tikhonov)sirve como constante desplazando las diagonales de la matriz de momentos. [ 8 ] Se puede demostrar que este estimador es la solución al problema de mínimos cuadrados sujeto a la restricción, que puede expresarse como una minimización lagrangiana: lo cual demuestra queno es más que el multiplicador de Lagrange de la restricción. [ 9 ] De hecho, existe una relación uno a uno entreyy puesto que, en la práctica, no lo sabemos, definimosDe forma heurística o mediante estrategias adicionales de ajuste de datos, véase la sección Determinación del parámetro de Tikhonov a continuación.
Tenga en cuenta que como, la restricción finalmente se vuelve no vinculante y el estimador de cresta converge al estimador de mínimos cuadrados ordinarios de norma mínima , aquí denotado como :
con que denota la pseudoinversa de.
Determinación del parámetro de Tikhonov
El parámetro de regularización óptimoPor lo general, se desconoce y, en la práctica, necesita ser estimado. Normalmente, se elige el parámetro de regularización de Tikhonov en función de los datos. Esto se logra mediante validación cruzada o mediante un procedimiento de complemento, como se describe a continuación.
Estimador de validación cruzada generalizada
Una opción común basada en datos paraes el minimizador de la pérdida de validación cruzada o sus generalizaciones. Por ejemplo, Grace Wahba demostró que el parámetro óptimo, en el sentido de la validación cruzada generalizada, minimiza [ 10 ] [ 11 ].
dóndees la suma residual de cuadrados , yes el número efectivo de grados de libertad .
Estimador enchufable
Supongamos quees un matriz y definir la matriz :=(\mathbf {X} ^{\top }\mathbf {X} /n)^{+}} . Luego, considere la siguiente elección para el parámetro de regularización de Tikhonov:
dóndees la varianza del ruido , eso es, . Se puede demostrar [ 12 ] que el estimador de crestadisfruta de un riesgo esperado dentro de la muestra menor que el estimador de mínimos cuadrados de norma mínima.. Más precisamente,
donde las expectativas tratancomo fijo yson datos de respuesta de prueba , independientes de(y por lo tanto independientes de los estimadores)y).
Por supuesto, en la práctica la fórmula para Se utiliza sustituyendo los parámetros desconocidos por estimadores estadísticos. y. CuandoLos estimadores más naturales para estos parámetros son los habituales de mínimos cuadrados:
Reemplazando lo desconocidoen la fórmula paracon el correspondientede esta forma se obtiene el llamado estimador de sustitución.para el óptimo.
Los enfoques alternativos para la selección basada en datos del parámetro de regularización de Tikhonov incluyen el principio de discrepancia , el método de la curva L , [ 13 ] máxima verosimilitud restringida .
Historia
La regularización de Tikhonov se inventó de forma independiente en muchos contextos diferentes. Se popularizó gracias a su aplicación a ecuaciones integrales en los trabajos de Andrey Tikhonov [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] y David L. Phillips. [ 19 ] Algunos autores utilizan el término regularización de Tikhonov-Phillips . El caso de dimensión finita fue expuesto por Arthur E. Hoerl , quien adoptó un enfoque estadístico, [ 20 ] y por Manus Foster, quien interpretó este método como un filtro de Wiener-Kolmogorov (Kriging) . [ 21 ] Siguiendo a Hoerl, se conoce en la literatura estadística como regresión de cresta, [ 22 ] llamada así por el análisis de cresta ("cresta" se refiere a la trayectoria desde el máximo restringido). [ 23 ]
Regularización de Tikhonov para ecuaciones lineales
Supongamos que para una matriz real conociday vector, deseamos encontrar un vectorde tal manera que dóndeypueden ser de diferentes tamaños yIncluso puede que no sea cuadrado.
El enfoque estándar es la regresión lineal por mínimos cuadrados ordinarios . Sin embargo, si nosatisface la ecuación o más de unaSi la solución no es única, se dice que el problema está mal planteado . En tales casos, la estimación por mínimos cuadrados ordinarios conduce a un sistema de ecuaciones sobredeterminado o, más a menudo, subdeterminado . La mayoría de los fenómenos del mundo real tienen el efecto de filtros de paso bajo en la dirección directa, dondemapasaPor lo tanto, al resolver el problema inverso, el mapeo inverso opera como un filtro de paso alto que tiene la tendencia indeseable de amplificar el ruido ( los valores propios /valores singulares son mayores en el mapeo inverso donde eran menores en el mapeo directo). Además, los mínimos cuadrados ordinarios anulan implícitamente cada elemento de la versión reconstruida deque está en el espacio nulo de, en lugar de permitir que un modelo se utilice como un prior para. El método de mínimos cuadrados ordinarios busca minimizar la suma de los residuos al cuadrado , que se puede escribir de forma compacta como dóndees la norma euclidiana .
Para dar preferencia a una solución particular con propiedades deseables, se puede incluir un término de regularización en esta minimización: dóndey, para alguna matriz de Tikhonov elegida adecuadamente. En muchos casos, esta matriz se elige como un múltiplo escalar de la matriz identidad (), dando preferencia a soluciones con normas más pequeñas ; esto se conoce como regularización L2. [24 ] En otros casos , se pueden usar operadores de paso alto (por ejemplo, un operador de diferencia o un operador de Fourier ponderado ) para imponer suavidad si se cree que el vector subyacente es mayoritariamente continuo. Esta regularización mejora el condicionamiento del problema, lo que permite una solución numérica directa. Tratándolo como un problema de mínimos cuadrados ordinarios con matrices aumentadasy, la solución es El efecto de la regularización puede variar según la escala de la matriz.. ParaEsto se reduce a la solución de mínimos cuadrados no regularizada, siempre que exista ( A T A ) −1 . Nótese que en el caso de una matriz compleja, como de costumbre la transpuestadebe ser reemplazado por la transposición hermitiana.
La regularización L2 se utiliza en muchos contextos además de la regresión lineal, como la clasificación con regresión logística o máquinas de vectores de soporte [ 25 ] y la factorización de matrices [ 26 ] .
Aplicación a los resultados de ajuste existentes
Dado que la regularización de Tikhonov simplemente agrega un término cuadrático a la función objetivo en problemas de optimización, es posible hacerlo después de que se haya realizado la optimización no regularizada. Por ejemplo, si el problema anterior conproporciona la solución, la solución en presencia dese puede expresar como: con la "matriz de regularización".
Si el ajuste de parámetros viene con una matriz de covarianza de las incertidumbres de los parámetros estimados, entonces la matriz de regularización será y el resultado regularizado tendrá una nueva covarianza.
En el contexto de ajustes de verosimilitud arbitrarios, esto es válido siempre que la aproximación cuadrática de la función de verosimilitud sea válida. Esto significa que, siempre que la perturbación respecto al resultado no regularizado sea pequeña, se puede regularizar cualquier resultado que se presente como un punto de mejor ajuste con una matriz de covarianza. No se requiere un conocimiento detallado de la función de verosimilitud subyacente. [ 27 ]
Regularización de Tikhonov generalizada
Para distribuciones normales multivariadas generales paray el error de datos, se puede aplicar una transformación de las variables para reducirlo al caso anterior. De manera equivalente, se puede buscar unminimizar donde hemos utilizadorepresentar la norma ponderada al cuadrado(comparar con la distancia de Mahalanobis ). En la interpretación bayesianaes la matriz de covarianza inversa de,es el valor esperado de, yes la matriz de covarianza inversa de.
La matriz de Tikhonov no se incluye explícitamente debido al término de regularización correspondiente. se reduce a lo anterior cony. Para la regularización normal dondeLa matriz de Tikhonov aparece entonces en la factorización de Cholesky.y se considera un filtro blanqueador .
Este problema generalizado tiene una solución óptima.que se puede escribir explícitamente usando la fórmula
Regularización de Lavrentyev
En algunas situaciones, se puede evitar el uso de la transposición., como propuso Mikhail Lavrentyev . [ 28 ] Por ejemplo, sies simétrica definida positiva, es decir, así también lo es su inverso, que por lo tanto puede utilizarse para establecer la norma ponderada al cuadradoen la regularización generalizada de Tikhonov, lo que lleva a minimizar o, equivalentemente salvo un término constante ,
Este problema de minimización tiene una solución óptima.que se puede escribir explícitamente usando la fórmula que no es más que la solución del problema generalizado de Tikhonov donde
La regularización de Lavrentyev, si es aplicable, es ventajosa para la regularización de Tikhonov original, ya que la matriz de Lavrentyevpuede estar mejor condicionado, es decir, tener un número de condición menor , en comparación con la matriz de Tikhonov.
Regularización en el espacio de Hilbert
Típicamente, los problemas lineales discretos mal condicionados resultan de la discretización de ecuaciones integrales , y se puede formular una regularización de Tikhonov en el contexto original de dimensión infinita. En lo anterior podemos interpretarcomo un operador compacto en espacios de Hilbert yycomo elementos en el dominio y rango deEl operadores entonces un operador invertible, acotado y autoadjunto .
Relación con la descomposición en valores singulares y el filtro de Wiener.
Con, esta solución de mínimos cuadrados puede analizarse de una manera especial utilizando la descomposición en valores singulares . Dada la descomposición en valores singulares con valores singulares, la solución regularizada de Tikhonov se puede expresar como dóndetiene valores diagonales y es cero en cualquier otro lugar. Esto demuestra el efecto del parámetro de Tikhonov en el número de condición del problema regularizado. Para el caso generalizado, se puede derivar una representación similar utilizando una descomposición en valores singulares generalizada . [ 29 ]
Finalmente, está relacionado con el filtro de Wiener : donde están los pesos de Wieneryes el rango de.
Relación con la formulación probabilística
La formulación probabilística de un problema inverso introduce (cuando todas las incertidumbres son gaussianas) una matriz de covarianza.representando las incertidumbres a priori sobre los parámetros del modelo y una matriz de covarianzarepresentando las incertidumbres en los parámetros observados. [ 30 ] En el caso especial en que estas dos matrices son diagonales e isotrópicas,yy, en este caso, las ecuaciones de la teoría inversa se reducen a las ecuaciones anteriores, con. [ 31 ] [ 32 ]
interpretación bayesiana
Aunque al principio la elección de la solución a este problema regularizado pueda parecer artificial, y de hecho la matrizParece bastante arbitrario, el proceso puede justificarse desde un punto de vista bayesiano . [ 33 ] Nótese que para un problema mal planteado es necesario introducir algunas suposiciones adicionales para obtener una solución única. Estadísticamente, la distribución de probabilidad previa deA veces se considera que es una distribución normal multivariada . [ 34 ] Para simplificar, aquí se hacen las siguientes suposiciones: las medias son cero; sus componentes son independientes; las componentes tienen la misma desviación estándar.Los datos también están sujetos a errores, y los errores enTambién se supone que son independientes con media cero y desviación estándarBajo estos supuestos, la solución regularizada de Tikhonov es la solución más probable dados los datos y la distribución a priori de, según el teorema de Bayes . [ 35 ]
Si se reemplaza el supuesto de normalidad por supuestos de homocedasticidad y no correlación de errores , y si aún se asume una media cero, entonces el teorema de Gauss-Markov implica que la solución es el estimador lineal insesgado mínimo . [ 36 ]
Véase también
- El estimador LASSO es otro método de regularización en estadística.
- Regularización de red elástica
- Regularización de matrices
- curva en L
Notas
- ↑ En estadística , el método se conoce como regresión de cresta ; en aprendizaje automático , tanto este como sus modificaciones se conocen como decaimiento de peso ; y, gracias a múltiples descubrimientos independientes, también se le conoce con diversos nombres, como método de Tikhonov-Miller , método de Phillips-Twomey ,método de inversión lineal restringida , regularización L2 y método de regularización lineal . Está relacionado con el algoritmo de Levenberg-Marquardt para problemasde mínimos cuadrados no lineales .
Referencias
- 1 2 Hilt, Donald E.; Seegrist, Donald W. (1977). Ridge, un programa informático para calcular estimaciones de regresión de Ridge . doi : 10.5962/bhl.title.68934 .
- 1 2 Gruber, Marvin (1998). Improving Efficiency by Shrinkage: The James-Stein and Ridge Regression Estimators . CRC Press. p. 2. ISBN 978-0-8247-0156-7.
- ↑ Kennedy, Peter (2003). Guía de econometría (Quinta ed.). Cambridge: The MIT Press. págs. 205–206 . ISBN 0-262-61183-X.
- ↑ Gruber, Marvin (1998). Improving Efficiency by Shrinkage: The James–Stein and Ridge Regression Estimators . Boca Raton: CRC Press. pp. 7–15 . ISBN 0-8247-0156-9.
- ↑ Hoerl, Arthur E.; Kennard, Robert W. (1970). "Regresión de cresta: estimación sesgada para problemas no ortogonales". Technometrics . 12 (1): 55– 67. doi : 10.2307/1267351 . JSTOR 1267351 .
- ↑ Hoerl, Arthur E.; Kennard, Robert W. (1970). "Regresión de cresta: aplicaciones a problemas no ortogonales". Technometrics . 12 (1): 69– 82. doi : 10.2307/1267352 . JSTOR 1267352 .
- ↑ Jolliffe, IT (2006). Análisis de componentes principales . Springer Science & Business Media. pág. 178. ISBN 978-0-387-22440-4.
- ↑ Para la elección de in practice, see Khalaf, Ghadban; Shukur, Ghazi (2005). "Choosing Ridge Parameter for Regression Problems". Communications in Statistics – Theory and Methods. 34 (5): 1177–1182. doi:10.1081/STA-200056836. S2CID 122983724.
- ↑van Wieringen, Wessel (2021-05-31). "Lecture notes on ridge regression". arXiv:1509.09169 [stat.ME].
- ↑Wahba, G. (1990). "Spline Models for Observational Data". CBMS-NSF Regional Conference Series in Applied Mathematics. Society for Industrial and Applied Mathematics. Bibcode:1990smod.conf.....W.
- ↑Golub, G.; Heath, M.; Wahba, G. (1979). "Generalized cross-validation as a method for choosing a good ridge parameter"(PDF). Technometrics. 21 (2): 215–223. doi:10.1080/00401706.1979.10489751.
- ↑Botev, Zdravko I.; Kroese, Dirk P.; Taimre, Thomas (2025). Data Science and Machine Learning: Mathematical and Statistical Methods (2nd ed.). Boca Raton ; London: CRC Press. p. 267-268. ISBN 978-1-032-48868-4.
- ↑P. C. Hansen, "The L-curve and its use in the numerical treatment of inverse problems",
- ↑Tikhonov, Andrey Nikolayevich (1943). "Об устойчивости обратных задач"[On the stability of inverse problems]. Doklady Akademii Nauk SSSR. 39 (5): 195–198. Archived from the original on 2005-02-27.
- ↑Tikhonov, A. N. (1963). "О решении некорректно поставленных задач и методе регуляризации". Doklady Akademii Nauk SSSR. 151: 501–504.. Translated in "Solution of incorrectly formulated problems and the regularization method". Soviet Mathematics. 4: 1035–1038.
- ↑Tikhonov, A. N.; V. Y. Arsenin (1977). Solution of Ill-posed Problems. Washington: Winston & Sons. ISBN 0-470-99124-0.
- ↑Tikhonov, Andrey Nikolayevich; Goncharsky, A.; Stepanov, V. V.; Yagola, Anatolij Grigorevic (30 June 1995). Numerical Methods for the Solution of Ill-Posed Problems. Netherlands: Springer Netherlands. ISBN 0-7923-3583-XConsultado el 9 de agosto de 2018 .
- ↑ Tikhonov, Andrey Nikolaevich; Leonov, Aleksandr S.; Yagola, Anatolij Grigorevic (1998). Problemas no lineales mal planteados . Londres: Chapman & Hall. ISBN 0-412-78660-5Consultado el 9 de agosto de 2018 .
- ↑ Phillips, DL (1962). "Una técnica para la solución numérica de ciertas ecuaciones integrales de primer tipo" . Journal of the ACM . 9 : 84–97 . doi : 10.1145/321105.321114 . S2CID 35368397 .
- ↑ Hoerl, Arthur E. (1962). "Aplicación del análisis de cresta a problemas de regresión". Chemical Engineering Progress . 58 (3): 54– 59.
- ↑ Foster, M. (1961). "Una aplicación de la teoría de suavizado de Wiener-Kolmogorov a la inversión de matrices". Journal of the Society for Industrial and Applied Mathematics . 9 (3): 387– 392. doi : 10.1137/0109031 .
- ↑ Hoerl, AE; RW Kennard (1970). "Regresión de cresta: estimación sesgada para problemas no ortogonales". Technometrics . 12 (1): 55– 67. doi : 10.1080/00401706.1970.10488634 .
- ↑ Hoerl, Roger W. (1 de octubre de 2020). "Regresión Ridge: un contexto histórico" . Technometrics . 62 (4): 420– 425. doi : 10.1080/00401706.2020.1742207 . ISSN 0040-1706 .
- ↑ Ng, Andrew Y. (2004). Selección de características, regularización L1 vs. L2 e invariancia rotacional (PDF) . Proc. ICML .
- ↑ R.-E. Fan; K.-W. Chang; C.-J. Hsieh; X.-R. Wang; C.-J. Lin (2008). "LIBLINEAR: Una biblioteca para la clasificación lineal a gran escala". Journal of Machine Learning Research . 9 : 1871–1874 .
- ↑ Guan, Naiyang; Tao, Dacheng; Luo, Zhigang; Yuan, Bo (2012). "Factorización de matrices no negativas en línea con aproximación estocástica robusta". IEEE Transactions on Neural Networks and Learning Systems . 23 (7): 1087– 1099. Bibcode : 2012ITNNL..23.1087G . doi : 10.1109/TNNLS.2012.2197827 . PMID 24807135. S2CID 8755408 .
- ↑ Koch, Lukas (2022). "Regularización post hoc de mediciones de secciones transversales desplegadas". Journal of Instrumentation . 17 (10) 10021. arXiv : 2207.02125 . Bibcode : 2022JInst..17P0021K . doi : 10.1088/1748-0221/17/10/P10021 .
- ↑ Lavrentiev, MM (1967). Algunos problemas mal planteados de física matemática . Nueva York: Springer.
- ↑ Hansen, Per Christian (1 de enero de 1998). Problemas mal planteados discretos y con rango deficiente: Aspectos numéricos de la inversión lineal (1.ª ed.). Filadelfia, EE. UU.: SIAM. ISBN 978-0-89871-403-6.
- ↑ Tarantola, Albert (2005). Teoría de problemas inversos y métodos para la estimación de parámetros de modelos (1.ª ed.). Filadelfia: Society for Industrial and Applied Mathematics (SIAM). ISBN 0-89871-792-2Consultado el 9 de agosto de 2018 .
- ↑ Huang, Yunfei.; et al. (2019). "Microscopía de fuerza de tracción con regularización optimizada y selección automatizada de parámetros bayesianos para comparar células" . Scientific Reports . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/s41598-018-36896- x . PMC 6345967. PMID 30679578 .
- ↑ Huang, Yunfei; Gompper, Gerhard; Sabass, Benedikt (2020). "Un método de microscopía de fuerza de tracción bayesiana con eliminación de ruido automatizada en un paquete de software fácil de usar". Computer Physics Communications . 256 107313. arXiv : 2005.01377 . Bibcode : 2020CoPhC.25607313H . doi : 10.1016/j.cpc.2020.107313 .
- ↑ Greenberg, Edward; Webster, Charles E. Jr. (1983). Econometría avanzada: Un puente hacia la literatura . Nueva York: John Wiley & Sons. págs. 207–213 . ISBN 0-471-09077-8.
- ↑ Huang, Yunfei.; et al. (2019). "Microscopía de fuerza de tracción con regularización optimizada y selección automatizada de parámetros bayesianos para comparar células" . Scientific Reports . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/s41598-018-36896- x . PMC 6345967. PMID 30679578 .
- ↑ Vogel, Curtis R. (2002). Métodos computacionales para problemas inversos . Filadelfia: Society for Industrial and Applied Mathematics. ISBN 0-89871-550-4.
- ↑ Amemiya, Takeshi (1985). Econometría avanzada . Harvard University Press. págs. 60–61 . ISBN 0-674-00560-0.
Lecturas adicionales
- Gruber, Marvin (1998). Mejora de la eficiencia mediante la reducción: Los estimadores de regresión de James-Stein y Ridge . Boca Raton: CRC Press. ISBN 0-8247-0156-9.
- Kress, Rainer (1998). «Regularización de Tikhonov» . Análisis numérico . Nueva York: Springer. págs. 86-90 . ISBN 0-387-98408-9.
- Press, WH; Teukolsky, SA; Vetterling, WT; Flannery, BP (2007). «Sección 19.5. Métodos de regularización lineal» . Numerical Recipes: The Art of Scientific Computing (3.ª ed.). Nueva York: Cambridge University Press. ISBN 978-0-521-88068-8.
- Saleh, AK Md. Ehsanes; Arashi, Mohammad; Kibria, BM Golam (2019). Teoría de la estimación de regresión de cresta con aplicaciones . Nueva York: John Wiley & Sons. ISBN 978-1-118-64461-4.
- Taddy, Matt (2019). «Regularización» . Ciencia de datos empresariales: Combinando el aprendizaje automático y la economía para optimizar, automatizar y acelerar las decisiones empresariales . Nueva York: McGraw-Hill. págs. 69-104 . ISBN 978-1-260-45277-8.
- Álgebra lineal
- Métodos de estimación
- Problemas inversos
- Análisis de regresión