Articulo de referencia

regresión por pasos

En estadística , la regresión por pasos es un método para ajustar modelos de regresión en el que la selección de variables predictoras se realiza mediante un procedimiento autom...

En estadística , la regresión por pasos es un método para ajustar modelos de regresión en el que la selección de variables predictoras se realiza mediante un procedimiento automático. [ 1 ] [ 2 ] [ 3 ] [ 4 ] En cada paso, se considera una variable para agregarla o eliminarla del conjunto de variables explicativas según algún criterio preespecificado. Por lo general, esto se realiza mediante una secuencia de pruebas F o pruebas t , ya sea hacia adelante, hacia atrás o combinadas .

La práctica frecuente de ajustar el modelo final seleccionado y luego informar las estimaciones y los intervalos de confianza sin ajustarlos para tener en cuenta el proceso de construcción del modelo ha llevado a que se proponga dejar de usar la construcción de modelos por etapas por completo [ 5 ] [ 6 ] o, al menos, asegurar que la incertidumbre del modelo se refleje correctamente mediante el uso de criterios automáticos preespecificados junto con estimaciones de error estándar más complejas que permanezcan insesgadas. [ 7 ] [ 8 ]

En este ejemplo de ingeniería, la necesidad y la suficiencia se determinan generalmente mediante pruebas F. Para una consideración adicional, al planificar un experimento , una simulación por computadora o una encuesta científica para recopilar datos para este modelo , se debe tener en cuenta el número de parámetros , P , para estimar y ajustar el tamaño de la muestra en consecuencia. Para K variables , P  =  1 (Inicio)  + K (Etapa I) + ( K 2K )/2 (Etapa II) + 3 K (Etapa III) = 0.5 K 2 + 3.5 K + 1. Para K < 17, existe un diseño de experimentos eficiente para este tipo de modelo, un diseño Box-Behnken , [ 9 ] aumentado con puntos axiales positivos y negativos de longitud min(2, (int(1.5 + K /4)) 1/2 ), más punto(s) en el origen. Hay diseños más eficientes , que requieren menos ejecuciones, incluso para K > 16.                      

Enfoques principales

Los principales enfoques para la regresión por pasos son:

  • La selección progresiva consiste en comenzar sin variables en el modelo, probar la adición de cada variable utilizando un criterio de ajuste del modelo elegido, agregar la variable (si la hay) cuya inclusión proporcione la mejora estadísticamente más significativa del ajuste, y repetir este proceso hasta que ninguna mejore el modelo en una medida estadísticamente significativa.
  • La eliminación hacia atrás consiste en comenzar con todas las variables candidatas, probar la eliminación de cada variable utilizando un criterio de ajuste del modelo elegido, eliminar la variable (si la hay) cuya pérdida produce el deterioro estadísticamente menos significativo del ajuste del modelo, y repetir este proceso hasta que no se puedan eliminar más variables sin una pérdida de ajuste estadísticamente significativa.
  • Eliminación bidireccional , una combinación de lo anterior, que prueba en cada paso las variables que deben incluirse o excluirse.

Alternativas

Un algoritmo ampliamente utilizado fue propuesto por primera vez por Efroymson (1960). [ 10 ] Este es un procedimiento automático para la selección de modelos estadísticos en casos donde hay una gran cantidad de variables explicativas potenciales y no hay una teoría subyacente en la que basar la selección del modelo . El procedimiento se utiliza principalmente en el análisis de regresión , aunque el enfoque básico es aplicable en muchas formas de selección de modelos. Esta es una variación de la selección hacia adelante. En cada etapa del proceso, después de agregar una nueva variable, se realiza una prueba para verificar si algunas variables pueden eliminarse sin aumentar apreciablemente la suma de cuadrados residuales (RSS). El procedimiento termina cuando la medida se maximiza (localmente) o cuando la mejora disponible cae por debajo de algún valor crítico.

Uno de los principales problemas de la regresión escalonada es que explora un amplio espacio de modelos posibles. Por lo tanto, es propensa al sobreajuste de los datos. En otras palabras, la regresión escalonada a menudo se ajusta mucho mejor a la muestra que a nuevos datos fuera de la muestra. Se han observado casos extremos en los que los modelos han alcanzado significación estadística trabajando con números aleatorios. [ 11 ] Este problema puede mitigarse si el criterio para añadir (o eliminar) una variable es lo suficientemente estricto. El límite clave se encuentra en lo que se puede considerar el punto de Bonferroni : es decir, cuán significativa debería ser la mejor variable espuria basándose únicamente en el azar. En una escala de estadístico t , esto ocurre aproximadamente en2registropag{\displaystyle {\sqrt {2\log p}}}donde p es el número de predictores. Desafortunadamente, esto significa que muchas variables que en realidad contienen señal no se incluirán. Esta barrera resulta ser el equilibrio adecuado entre el sobreajuste y la pérdida de señal. Si observamos el riesgo de diferentes umbrales, entonces usar este límite estará dentro de un2registropag{\displaystyle 2\log p}factor del mejor riesgo posible. Cualquier otro punto de corte terminará teniendo una mayor inflación de dicho riesgo . [ 12 ] [ 13 ]

Precisión del modelo

Una forma de probar errores en modelos creados por regresión escalonada es no confiar en el estadístico F del modelo , la significancia o el R múltiple, sino evaluar el modelo con un conjunto de datos que no se usó para crear el modelo. [ 14 ] Esto se suele hacer construyendo un modelo basado en una muestra del conjunto de datos disponible (p. ej., 70 %) – el “ conjunto de entrenamiento ” – y usando el resto del conjunto de datos (p. ej., 30 %) como conjunto de validación para evaluar la precisión del modelo. La precisión se suele medir como el error estándar real (SE), el MAPE ( error porcentual absoluto medio ) o el error medio entre el valor predicho y el valor real en la muestra de prueba. [ 15 ] Este método es particularmente valioso cuando los datos se recopilan en diferentes entornos (p. ej., diferentes momentos, situaciones sociales frente a solitarias) o cuando se supone que los modelos son generalizables.

Crítica

Los procedimientos de regresión por pasos se utilizan en la minería de datos , pero son controvertidos. Se han planteado varias críticas.

  • Las pruebas en sí mismas están sesgadas, ya que se basan en los mismos datos. [ 16 ] [ 17 ] Wilkinson y Dallal (1981) [ 18 ] calcularon puntos porcentuales del coeficiente de correlación múltiple mediante simulación y demostraron que una regresión final obtenida por selección hacia adelante, que según el procedimiento F era significativa al 0,1%, en realidad solo era significativa al 5%.
  • Al estimar los grados de libertad , el número de variables independientes candidatas del mejor ajuste seleccionado puede ser menor que el número total de variables del modelo final, lo que hace que el ajuste parezca mejor de lo que realmente es al ajustar el valor de según el número de grados de libertad. Es importante considerar cuántos grados de libertad se han utilizado en todo el modelo, no solo contar el número de variables independientes en el ajuste resultante. [ 19 ]
  • Los modelos que se crean pueden ser simplificaciones excesivas de los modelos reales de los datos. [ 20 ]

Estas críticas, basadas en las limitaciones de la relación entre un modelo, un procedimiento y el conjunto de datos utilizado para ajustarlo, suelen abordarse verificando el modelo en un conjunto de datos independiente, como en el procedimiento PRESS .

Los críticos consideran el procedimiento un ejemplo paradigmático de extracción de datos , donde la computación intensiva suele ser un sustituto inadecuado de la experiencia en el área temática. Además, los resultados de la regresión por pasos se utilizan a menudo incorrectamente sin ajustarlos a la ocurrencia de la selección de modelos. En particular, la práctica de ajustar el modelo final seleccionado como si no se hubiera realizado ninguna selección de modelos y reportar estimaciones e intervalos de confianza como si la teoría de mínimos cuadrados fuera válida para ellos, se ha descrito como un escándalo. [ 7 ] El uso incorrecto generalizado y la disponibilidad de alternativas como el aprendizaje de conjuntos , dejar todas las variables en el modelo o usar el juicio de expertos para identificar variables relevantes han llevado a solicitar que se evite por completo la selección de modelos por pasos. [ 5 ]

Véase también

Referencias

  1. Efroymson, MA (1960) "Análisis de regresión múltiple", Métodos matemáticos para computadoras digitales, Ralston A. y Wilf, HS, (eds.), Wiley, Nueva York.
  2. Hocking, RR (1976) "Análisis y selección de variables en regresión lineal," Biometrics, 32.
  3. Draper, N. y Smith, H. (1981) Análisis de regresión aplicada, 2.ª edición, Nueva York: John Wiley & Sons, Inc.
  4. SAS Institute Inc. (1989) Guía del usuario de SAS/STAT, versión 6, cuarta edición, volumen 2, Cary, NC: SAS Institute Inc.
  5. 1 2 Flom, PL y Cassell, DL (2007) "Detención paso a paso: Por qué los métodos de selección paso a paso y similares son malos y qué debería usar," NESUG 2007.
  6. Harrell, FE (2001) "Estrategias de modelado de regresión: con aplicaciones a modelos lineales, regresión logística y análisis de supervivencia," Springer-Verlag, Nueva York.
  7. 1 2 Chatfield, C. (1995) "Incertidumbre del modelo, minería de datos e inferencia estadística," JR Statist. Soc. A 158, Parte 3, pp. 419–466.
  8. Efron, B. y Tibshirani, RJ (1998) "Una introducción al bootstrap", Chapman & Hall/CRC
  9. Diseños de Box-Behnken de un manual sobre estadística de ingeniería en el NIST
  10. Efroymson, MA (1960). Ralston, A.; Wilf, HS (eds.). "Análisis de regresión múltiple". Métodos matemáticos para computadoras digitales . Wiley.
  11. Knecht, WR. (2005). Disposición del piloto a despegar en condiciones meteorológicas marginales, Parte II: Sobreajuste antecedente con regresión logística escalonada hacia adelante . (Informe técnico DOT/FAA/AM-O5/15 ). Administración Federal de Aviación
  12. Foster, Dean P.; George, Edward I. (1994). "El criterio de inflación de riesgo para la regresión múltiple". Annals of Statistics . 22 (4): 1947– 1975. doi : 10.1214/aos/1176325766 .
  13. Donoho, David L.; Johnstone, Jain M. (1994). "Adaptación espacial ideal mediante contracción de ondículas". Biometrika . 81 (3): 425– 455. doi : 10.1093/biomet/81.3.425 .
  14. Mark, Jonathan y Goldberg, Michael A. (2001). Análisis de regresión múltiple y tasación masiva: una revisión de los problemas. The Appraisal Journal , enero, 89–109.
  15. Mayers, JH, & Forgy, EW (1963). El desarrollo de sistemas numéricos de evaluación crediticia. Journal of the American Statistical Association, 58 (303; septiembre), 799–806.
  16. Rencher, AC, & Pun, FC (1980). Inflación de R ² en la regresión de subconjuntos óptimos. Technometrics, 22, 49–54.
  17. Copas, JB (1983). Regresión, predicción y contracción. J. Roy. Statist. Soc. Serie B, 45, 311–354.
  18. Wilkinson, L., & Dallal, GE (1981). Pruebas de significancia en regresión de selección hacia adelante con una regla de parada F-to-enter. Technometrics, 23, 377–380.
  19. Hurvich, CM y CL Tsai. 1990. El impacto de la selección de modelos en la inferencia en regresión lineal. American Statistician 44: 214–217.
  20. Roecker, Ellen B. (1991). Error de predicción y su estimación para modelos seleccionados por subconjuntos. Technometrics, 33 , 459–468.