Articulo de referencia

Regresión robusta

En estadística robusta , la regresión robusta busca superar algunas limitaciones del análisis de regresión tradicional . Un análisis de regresión modela la relación entre una o ...

En estadística robusta , la regresión robusta busca superar algunas limitaciones del análisis de regresión tradicional . Un análisis de regresión modela la relación entre una o más variables independientes y una variable dependiente . Los tipos estándar de regresión, como los mínimos cuadrados ordinarios , tienen propiedades favorables si sus supuestos subyacentes son verdaderos, pero pueden dar resultados engañosos en caso contrario (es decir, no son robustos ante violaciones de supuestos). Los métodos de regresión robusta están diseñados para limitar el efecto que las violaciones de supuestos por parte del proceso subyacente de generación de datos tienen sobre las estimaciones de regresión.

Por ejemplo, las estimaciones de mínimos cuadrados para modelos de regresión son muy sensibles a los valores atípicos : un valor atípico con el doble de magnitud de error que una observación típica contribuye cuatro veces (dos al cuadrado) a la pérdida por error cuadrático y, por lo tanto, tiene mayor influencia sobre las estimaciones de regresión. La función de pérdida de Huber es una alternativa robusta a la pérdida estándar por error cuadrático que reduce la contribución de los valores atípicos a dicha pérdida, limitando así su impacto en las estimaciones de regresión.

Aplicaciones

Errores heterocedásticos

Un caso en el que se debe considerar una estimación robusta es cuando existe una fuerte sospecha de heterocedasticidad . En el modelo homocedástico , se supone que la varianza del término de error es constante para todos los valores de x . La heterocedasticidad permite que la varianza dependa de x , lo cual es más preciso para muchos escenarios reales. Por ejemplo, la varianza del gasto suele ser mayor para las personas con mayores ingresos que para las personas con menores ingresos. Los paquetes de software generalmente utilizan por defecto un modelo homocedástico, aunque dicho modelo puede ser menos preciso que un modelo heterocedástico. Un enfoque simple ( Tofallis, 2008 ) es aplicar mínimos cuadrados a los errores porcentuales, ya que esto reduce la influencia de los valores mayores de la variable dependiente en comparación con los mínimos cuadrados ordinarios.

Presencia de valores atípicos

Otra situación común en la que se utiliza la estimación robusta se da cuando los datos contienen valores atípicos. En presencia de valores atípicos que no provienen del mismo proceso de generación de datos que el resto, la estimación por mínimos cuadrados resulta ineficiente y puede estar sesgada. Debido a que las predicciones de mínimos cuadrados se ven afectadas por los valores atípicos y a que la varianza de las estimaciones se infla artificialmente, estos pueden quedar enmascarados. (En muchas situaciones, incluyendo algunas áreas de la geoestadística y la estadística médica, son precisamente los valores atípicos los que resultan de interés).

Aunque a veces se afirma que los mínimos cuadrados (o los métodos estadísticos clásicos en general) son robustos, solo lo son en el sentido de que la tasa de error de tipo I no aumenta ante desviaciones del modelo. De hecho, la tasa de error de tipo I tiende a ser inferior al nivel nominal cuando hay valores atípicos, y a menudo se produce un aumento drástico en la tasa de error de tipo II . Esta reducción de la tasa de error de tipo I se ha denominado el conservadurismo de los métodos clásicos.

Historia e impopularidad de la regresión robusta

A pesar de su rendimiento superior sobre la estimación por mínimos cuadrados en muchas situaciones, los métodos robustos para la regresión aún no se utilizan ampliamente. Varias razones pueden ayudar a explicar su impopularidad ( Hampel et al. 1986, 2005 ). Una posible razón es que existen varios métodos competidores y el campo tuvo muchos comienzos fallidos. Además, las estimaciones robustas son mucho más intensivas computacionalmente que la estimación por mínimos cuadrados ; sin embargo, en los últimos años esta objeción se ha vuelto menos relevante, ya que la capacidad de cálculo ha aumentado considerablemente. Otra razón puede ser que algunos paquetes de software estadístico populares no implementaron los métodos ( Stromberg, 2004 ). Quizás la razón más importante de la impopularidad de los métodos de regresión robusta es que cuando la varianza del error es bastante grande o no existe, para cualquier conjunto de datos dado, cualquier estimación de los coeficientes de regresión, robusta o no, probablemente será prácticamente inútil a menos que la muestra sea bastante grande.

Aunque la adopción de métodos robustos ha sido lenta, los libros de texto de estadística modernos y convencionales suelen incluir discusiones sobre estos métodos (por ejemplo, los libros de Seber y Lee, y de Faraway ; para una buena descripción general de cómo se desarrollaron los diversos métodos de regresión robusta a partir de otros, véase el libro de Andersen ). Además, los paquetes de software estadístico modernos como R , SAS , Statsmodels, Stata y S-PLUS incluyen una funcionalidad considerable para la estimación robusta (véanse, por ejemplo, los libros de Venables y Ripley, y de Maronna et al. ).

Métodos para la regresión robusta

Alternativas de mínimos cuadrados

El método más sencillo para estimar parámetros en un modelo de regresión, menos sensible a los valores atípicos que las estimaciones de mínimos cuadrados, consiste en utilizar las desviaciones absolutas mínimas . Aun así, los valores atípicos importantes pueden tener un impacto considerable en el modelo, lo que motiva la investigación de enfoques aún más robustos.

En 1964, Huber introdujo la estimación M para la regresión. La M en estimación M significa "tipo de máxima verosimilitud". El método es robusto ante valores atípicos en la variable de respuesta, pero resultó no ser resistente a valores atípicos en las variables explicativas ( puntos de apalancamiento ). De hecho, cuando existen valores atípicos en las variables explicativas, el método no ofrece ninguna ventaja sobre el de mínimos cuadrados.

En la década de 1980, se propusieron varias alternativas a la estimación M para intentar superar la falta de resistencia. Véase el libro de Rousseeuw y Leroy para una revisión muy práctica. El método de mínimos cuadrados recortados (LTS) es una alternativa viable y actualmente (2007) es la opción preferida de Rousseeuw y Ryan (1997, 2008). El estimador de Theil-Sen tiene un punto de ruptura más bajo que LTS, pero es estadísticamente eficiente y popular. Otra solución propuesta fue la estimación S. Este método encuentra una línea (plano o hiperplano) que minimiza una estimación robusta de la escala (de donde el método obtiene la S en su nombre) de los residuos. Este método es altamente resistente a los puntos de influencia y es robusto a los valores atípicos en la respuesta. Sin embargo, también se encontró que este método era ineficiente.

La estimación MM busca conservar la robustez y resistencia de la estimación S, al tiempo que aprovecha la eficiencia de la estimación M. El método procede encontrando una estimación S altamente robusta y resistente que minimice una estimación M de la escala de los residuos (la primera M en el nombre del método). La escala estimada se mantiene constante mientras se localiza una estimación M cercana de los parámetros (la segunda M).

Alternativas paramétricas

Otro enfoque para la estimación robusta de modelos de regresión consiste en reemplazar la distribución normal por una distribución de cola pesada. Se ha demostrado que una distribución t con 4 a 6 grados de libertad es una buena opción en diversas situaciones prácticas. La regresión robusta bayesiana, al ser totalmente paramétrica, depende en gran medida de este tipo de distribuciones.

Bajo el supuesto de residuos distribuidos en t , la distribución es una familia de localización-escala. Es decir,incógnita(incógnitaμ)/σ{\displaystyle x\leftarrow (x-\mu )/\sigma }Los grados de libertad de la distribución t se denominan a veces parámetro de curtosis . Lange, Little y Taylor (1989) analizan este modelo con cierto detalle desde una perspectiva no bayesiana. Una explicación bayesiana aparece en Gelman et al. (2003).

Un enfoque paramétrico alternativo consiste en suponer que los residuos siguen una mezcla de distribuciones normales ( Daemi et al. 2019 ); en particular, una distribución normal contaminada en la que la mayoría de las observaciones provienen de una distribución normal específica, pero una pequeña proporción proviene de una distribución normal con una varianza mucho mayor. Es decir, los residuos tienen probabilidad1ε{\displaystyle 1-\varepsilon }de provenir de una distribución normal con varianzaσ2{\displaystyle \sigma ^{2}}, dóndeε{\displaystyle \varepsilon }es pequeño y probabilidadε{\displaystyle \varepsilon }de provenir de una distribución normal con varianzadoσ2{\displaystyle c\sigma ^{2}}para algunosdo>1{\displaystyle c>1}:

mii(1ε)norte(0,σ2)+εnorte(0,doσ2).{\displaystyle e_{i}\sim (1-\varepsilon )N(0,\sigma ^{2})+\varepsilon N(0,c\sigma ^{2}).}

Típicamente,ε<0.1{\displaystyle \varepsilon <0.1}Esto a veces se llama elε{\displaystyle \varepsilon }-modelo de contaminación.

Los enfoques paramétricos tienen la ventaja de que la teoría de la verosimilitud proporciona un enfoque "listo para usar" para la inferencia (aunque para modelos de mezcla como elε{\displaystyle \varepsilon }(modelo de contaminación, las condiciones de regularidad habituales podrían no aplicarse), y es posible construir modelos de simulación a partir del ajuste. Sin embargo, estos modelos paramétricos siguen asumiendo que el modelo subyacente es literalmente cierto. Por lo tanto, no tienen en cuenta las distribuciones residuales asimétricas ni las precisiones de observación finitas.

Pesos unitarios

Otro método robusto es el uso de ponderaciones unitarias ( Wainer y Thissen, 1976), un método que puede aplicarse cuando hay múltiples predictores de un único resultado. Ernest Burgess (1928) utilizó ponderaciones unitarias para predecir el éxito en la libertad condicional. Calificó 21 factores positivos como presentes (p. ej., "sin arresto previo" = 1) o ausentes ("arresto previo" = 0), y luego los sumó para obtener una puntuación predictiva, que demostró ser un predictor útil del éxito en la libertad condicional. Samuel S. Wilks (1938) demostró que casi todos los conjuntos de ponderaciones de regresión suman compuestos que están muy correlacionados entre sí, incluidas las ponderaciones unitarias, un resultado al que a veces se hace referencia como el teorema de Wilks (Ree, Carretta y Earles, 1998). Robyn Dawes (1979) examinó la toma de decisiones en entornos aplicados, demostrando que los modelos simples con ponderaciones unitarias a menudo superaban a los expertos humanos. Bobko, Roth y Buster (2007) revisaron la literatura sobre ponderaciones unitarias y concluyeron que décadas de estudios empíricos muestran que las ponderaciones unitarias se comportan de manera similar a las ponderaciones de regresión ordinarias en la validación cruzada.

Ejemplo: Datos hepáticos de BUPA

Los datos hepáticos de BUPA han sido estudiados por diversos autores, entre ellos Breiman (2001). Estos datos se encuentran disponibles en la página de conjuntos de datos clásicos , donde se incluye una discusión sobre la transformación de Box-Cox . A continuación, se muestra un gráfico de los logaritmos de ALT frente a los logaritmos de γGT. Las dos líneas de regresión corresponden a las estimadas mediante mínimos cuadrados ordinarios (MCO) y mediante la estimación robusta de MM. El análisis se realizó en R utilizando el software proporcionado por Venables y Ripley (2002).

Las dos líneas de regresión parecen ser muy similares (lo cual no es inusual en un conjunto de datos de este tamaño). Sin embargo, la ventaja del enfoque robusto se hace evidente al considerar las estimaciones de la escala residual. Para los mínimos cuadrados ordinarios, la estimación de la escala es 0,420, en comparación con 0,373 para el método robusto. Por lo tanto, la eficiencia relativa de los mínimos cuadrados ordinarios con respecto a la estimación MM en este ejemplo es de 1,266. Esta ineficiencia conlleva una pérdida de potencia en las pruebas de hipótesis y la obtención de intervalos de confianza innecesariamente amplios para los parámetros estimados.

detección de valores atípicos

Otra consecuencia de la ineficiencia del ajuste por mínimos cuadrados ordinarios es que varios valores atípicos quedan enmascarados debido a que la estimación de la escala residual está inflada; los residuos escalados se acercan más a cero que cuando se utiliza una estimación de escala más apropiada. A continuación se muestran los gráficos de los residuos escalados de ambos modelos. La variable en el eje x es simplemente el número de observación tal como aparece en el conjunto de datos. Rousseeuw y Leroy (1986) incluyen muchos gráficos de este tipo.

Las líneas de referencia horizontales se encuentran en 2 y -2, de modo que cualquier residuo escalado observado más allá de estos límites puede considerarse un valor atípico. Es evidente que el método de mínimos cuadrados enmascara muchas observaciones interesantes.

Si bien en una o dos dimensiones la detección de valores atípicos mediante métodos clásicos puede realizarse manualmente, con conjuntos de datos grandes y en altas dimensiones el problema del enmascaramiento puede imposibilitar la identificación de muchos valores atípicos. Los métodos robustos detectan automáticamente estas observaciones, lo que supone una ventaja significativa sobre los métodos clásicos cuando hay valores atípicos presentes.

Véase también

Referencias

  • Liu, J.; Cosman, PC; Rao, BD (2018). "Regresión lineal robusta mediante regularización L0" . IEEE Transactions on Signal Processing . 66 (3): 698–713 . doi : 10.1109/TSP.2017.2771720 .
  • Andersen, R. (2008). Métodos modernos para la regresión robusta . Serie de documentos de la Universidad Sage sobre aplicaciones cuantitativas en las ciencias sociales, 07-152.
  • Ben-Gal I., Detección de valores atípicos. Archivado el 15/12/2022 en Wayback Machine . En: Maimon O. y Rockach L. (Eds.) Manual de minería de datos y descubrimiento de conocimiento: una guía completa para profesionales e investigadores, Kluwer Academic Publishers, 2005, ISBN. 0-387-24435-2.
  • Bobko, P., Roth, PL, & Buster, MA (2007). «La utilidad de las ponderaciones unitarias en la creación de puntuaciones compuestas: una revisión de la literatura, su aplicación a la validez de contenido y un metaanálisis». Organizational Research Methods , volumen 10, páginas 689-709. doi : 10.1177/1094428106294734
  • Daemi, Atefeh, Hariprasad Kodamana y Biao Huang. «Modelado de procesos gaussianos con función de verosimilitud de mezcla gaussiana». Journal of Process Control 81 (2019): 209-220. doi : 10.1016/j.jprocont.2019.06.007
  • Breiman, L. (2001). "Modelado estadístico: las dos culturas" . Statistical Science . 16 (3): 199– 231. doi : 10.1214/ss/1009213725 . JSTOR 2676681 . 
  • Burgess, EW (1928). «Factores que determinan el éxito o el fracaso en la libertad condicional». En AA Bruce (Ed.), El funcionamiento de la ley de sentencia indeterminada y la libertad condicional en Illinois (págs.  205-249). Springfield, Illinois: Junta Estatal de Libertad Condicional de Illinois. Google Books
  • Dawes, Robyn M. (1979). «La robusta belleza de los modelos lineales impropios en la toma de decisiones». American Psychologist , volumen 34, páginas 571-582. doi : 10.1037/0003-066X.34.7.571 . PDF archivado
  • Draper, David (1988). "Análisis robusto basado en rangos de modelos lineales. I. Exposición y revisión" . Statistical Science . 3 (2): 239– 257. doi : 10.1214/ss/1177012915 . JSTOR 2245578 . 
  • Faraway, JJ (2004). Modelos lineales con R. Chapman & Hall/CRC.
  • Fornalski, KW (2015). "Aplicaciones del análisis de regresión bayesiana robusta". International Journal of Society Systems Science . 7 (4): 314– 333. doi : 10.1504/IJSSS.2015.073223 .
  • Gelman, A.; JB Carlin; HS Stern; DB Rubin (2003). Análisis de datos bayesianos (Segunda  edición). Chapman & Hall/CRC.
  • Hampel, Francia; EM Ronchetti; PJ Rousseeuw; WA Stahel (2005) [1986]. Estadísticas robustas: el enfoque basado en funciones de influencia . Wiley.
  • Lange, KL; RJA Little; JMG Taylor (1989). "Modelado estadístico robusto utilizando la distribución t " . Journal of the American Statistical Association . 84 (408): 881– 896. doi : 10.2307/2290063 . JSTOR 2290063 . 
  • Lerman, G.; McCoy, M.; Tropp, JA; Zhang T. (2012). "Cálculo robusto de modelos lineales, o cómo encontrar una aguja en un pajar" Archivado el 26 de septiembre de 2013 en Wayback Machine , arXiv : 1202.4044 .
  • Maronna, R.; D. Martin; V. Yohai (2006). Estadística robusta: teoría y métodos . Wiley.
  • McKean, Joseph W. (2004). "Análisis robusto de modelos lineales" . Statistical Science . 19 (4): 562– 570. doi : 10.1214/088342304000000549 . JSTOR 4144426 . 
  • Radchenko SG (2005). Métodos robustos para la estimación de modelos estadísticos: Monografía. (en ruso) . Kiev: РР «Sanspariel». p.  504. ISBN 978-966-96574-0-4.
  • Ree, MJ, Carretta, TR y Earles, JA (1998). «En las decisiones de arriba hacia abajo, la ponderación de variables no importa: una consecuencia del teorema de Wilk». Organizational Research Methods , volumen 1(4), páginas 407-420. doi : 10.1177/109442819814003
  • Rousseeuw, PJ ; AM Leroy (2003) [1986]. Regresión robusta y detección de valores atípicos . Wiley.
  • Ryan, TP (2008) [1997]. Métodos de regresión modernos . Wiley.
  • Seber, GAF; AJ Lee (2003). Análisis de regresión lineal (Segunda  edición). Wiley.
  • Stromberg, AJ (2004). "¿Por qué escribir software estadístico? El caso de los métodos estadísticos robustos" . Journal of Statistical Software . 10 (5). doi : 10.18637/jss.v010.i05 .
  • Strutz, T. (2016). Ajuste de datos e incertidumbre (Una introducción práctica a los mínimos cuadrados ponderados y más allá) . Springer Vieweg. ISBN 978-3-658-11455-8.
  • Tofallis, Chris (2008). "Regresión porcentual por mínimos cuadrados" . Journal of Modern Applied Statistical Methods . 7 : 526–534 . doi : 10.2139/ssrn.1406472 . hdl : 2299/965 . SSRN 1406472 . 
  • Venables, WN; BD Ripley (2002). Estadística aplicada moderna con S. Springer.
  • Wainer, H. y Thissen, D. (1976). «Tres pasos hacia la regresión robusta». Psychometrika , volumen 41(1), páginas 9-34. doi : 10.1007/BF02291695
  • Wilks, SS (1938). «Sistemas de ponderación para funciones lineales de variables correlacionadas cuando no hay variable dependiente». Psychometrika , volumen 3, páginas 23-40. doi : 10.1007/BF02287917
  • Wikilibros de programación en R
  • Los completos apuntes del curso de estadística de Brian Ripley .
  • Los apuntes del curso de Nick Fieller sobre Modelado y Computación Estadística, archivados el 3 de marzo de 2016 en la Wayback Machine, contienen material sobre regresión robusta.
  • Descripción general de Olfa Nasraoui sobre estadísticas robustas. Archivado el 1 de abril de 2022 en Wayback Machine.
  • Descripción general de Olfa Nasraoui sobre la agrupación robusta (archivada el 1 de abril de 2022 en Wayback Machine)
  • ¿Por qué escribir software estadístico? El caso de los métodos estadísticos robustos, AJ Stromberg. Archivado el 7 de febrero de 2012 en Wayback Machine.
  • Software libre (Fortran 95) para regresión con norma L1. Minimización de desviaciones absolutas en lugar de mínimos cuadrados.
  • Implementación gratuita de código abierto en Python para regresión no lineal robusta.