abess ( Adaptive Best Subset Selection , también conocido como ABESS ) es un método de aprendizaje automático diseñado para abordar el problema de la selección del mejor subconjunto . Su objetivo es determinar qué características o variables son cruciales para un rendimiento óptimo del modelo a partir de un conjunto de datos y una tarea de predicción. abess fue presentado por Zhu en 2020 [ 1 ] y selecciona dinámicamente el tamaño de modelo adecuado de forma adaptativa, eliminando la necesidad de seleccionar parámetros de regularización.
abess es aplicable en diversas tareas estadísticas y de aprendizaje automático, incluyendo regresión lineal , el modelo de índice único y otros modelos predictivos comunes. [ 1 ] [ 2 ] abess también puede aplicarse en bioestadística . [ 3 ] [ 4 ] [ 5 ] [ 6 ]
Forma básica
La forma básica de abess [ 1 ] se emplea para abordar el problema de selección de subconjuntos óptimos en la regresión lineal general . abess es unEste método se caracteriza por su complejidad temporal polinómica y por la propiedad de proporcionar estimaciones imparciales y consistentes .
En el contexto de la regresión lineal, suponiendo que tenemos conocimiento demuestras independientes, dóndey, definimosyLa siguiente ecuación representa el modelo general de regresión lineal:
Para obtener parámetros adecuados, se puede considerar la función de pérdida para la regresión lineal:
En Abess, el enfoque inicial está en optimizar la función de pérdida bajo larestricción. Es decir, consideramos el siguiente problema:
dónderepresenta el tamaño deseado del conjunto de soporte, yes elnorma del vector.
Para abordar el problema de optimización descrito anteriormente, Abess intercambia iterativamente un número igual de variables entre el conjunto activo y el conjunto inactivo. En cada iteración, se introduce el concepto de sacrificio de la siguiente manera:
- Para j en el conjunto activo ():
- Para j en el conjunto inactivo ():
Estos son los elementos clave de las ecuaciones anteriores:
- : Esto representa la estimación deobtenido en la iteración anterior.
- : Indica el conjunto activo estimado de la iteración anterior.
- : Este es un vector donde el j-ésimo elemento se establece en 0, mientras que los demás elementos son iguales a.
- : Aquí,representa un vector donde todos los elementos son 0 excepto el j-ésimo elemento.
- : Esto se calcula en base a la ecuación mencionada.
El proceso iterativo implica el intercambio de variables, con el objetivo de minimizar los sacrificios en el conjunto activo y maximizar los sacrificios en el conjunto inactivo durante cada iteración. Este enfoque permite a Abess buscar de manera eficiente el subconjunto de características óptimo.
En Abess , seleccione un apropiadoy optimizar el problema anterior para el tamaño de los conjuntos activos.utilizando el criterio de informaciónpara elegir de forma adaptativa el tamaño adecuado del conjunto activoy obtener su estimador abess correspondiente .
Generalizaciones
El algoritmo de empalme de Abess se puede emplear para la selección de subconjuntos en otros modelos.
Regresión de localización-escala no paramétrica
En 2023, Siegfried extiende abess al caso de distribución libre y localización-escala. [ 7 ] Específicamente, considera el problema de optimización
sujeto adóndees una función de pérdida,es un vector de parámetros,yson vectores yes un vector de datos.
Este enfoque, demostrado en diversas aplicaciones, permite la elaboración de modelos de regresión parsimoniosos para resultados arbitrarios, manteniendo al mismo tiempo la interpretabilidad mediante procedimientos innovadores de selección de subconjuntos.
Selección de grupos
En 2023, Zhang aplicó el algoritmo de empalme a la selección de grupos, [ 8 ] optimizando el siguiente modelo:
Estos son los símbolos involucrados:
- : Número total de grupos de características, que representan la existencia degrupos de características que no se superponen en el conjunto de datos.
- : Índice establecido para el-ésimo grupo de características, dondeva desde 1 hasta, que representa la estructura de agrupación de características en los datos.
- : Tamaño del modelo, un número entero positivo determinado a partir de los datos, que limita el número de grupos de características seleccionados.
Regresión con datos corruptos
Zhang aplicó el algoritmo de empalme para manejar datos corruptos. [ 9 ] Los datos corruptos se refieren a información que se ha visto alterada o contiene errores durante el proceso de recopilación o registro de datos. Esta interferencia puede incluir imprecisiones de los sensores, errores de registro, problemas de comunicación u otras perturbaciones externas, lo que da lugar a observaciones inexactas o distorsionadas dentro del conjunto de datos.
Modelos de índice único
En 2023, Tang aplicó el algoritmo de empalme a la selección óptima de subconjuntos en el modelo de índice único. [ 2 ]
La forma del Modelo de Índice Único (SIM) viene dada por
dóndees el vector de parámetros, es el término de error.
La función de pérdida correspondiente se define como
dóndees el vector de rango,es el rango deen.
El problema de estimación abordado por este algoritmo es
Modelo de regresión ponderado geográficamente
En 2023, Wu [ 10 ] aplicó el algoritmo de empalme a la regresión ponderada geográficamente (GWR). La GWR es un método de análisis espacial, y la investigación de Wu se centra en mejorar su rendimiento en el modelado de regresión de datos geográficos. Esto se logra mediante la aplicación de un método de selección adaptativa de variables con norma l0, que realiza simultáneamente la selección del modelo y la optimización de coeficientes, mejorando así la precisión del modelado de regresión para datos espaciales geográficos.
Sistemas distribuidos
En 2023, Chen [ 11 ] introdujo un método innovador para abordar los desafíos en sistemas distribuidos de alta dimensión , proponiendo un algoritmo eficiente para abess .
Un sistema distribuido es un modelo computacional que distribuye las tareas de computación entre múltiples nodos independientes para lograr un procesamiento de datos más eficiente, fiable y escalable . En un sistema distribuido, los nodos de computación individuales pueden trabajar simultáneamente, colaborando para completar las tareas generales y, por lo tanto, mejorando el rendimiento y la capacidad de procesamiento del sistema.
Sin embargo, en los sistemas distribuidos, existe una falta de algoritmos eficientes para la selección óptima de subconjuntos. Para abordar esta deficiencia, Chen presenta un enfoque novedoso y eficiente en términos de comunicación para gestionar la selección óptima de subconjuntos en sistemas distribuidos.
Paquete de software
La biblioteca abess [ 12 ] (versión 0.4.5) es un paquete de R y Python basado en algoritmos de C++. Es de código abierto y está disponible en GitHub . La biblioteca se puede utilizar para la selección óptima de subconjuntos en modelos de regresión lineal, (multi)clasificación y modelado de respuesta censurada. El paquete abess permite seleccionar parámetros en formato agrupado. En la página principal de abess se encuentran disponibles información y tutoriales [ 13 ] .
Solicitud
abess se puede aplicar en bioestadística, como evaluar la robustez de los pacientes con COVID-19 , [ 3 ] realizar resistencia a los antibióticos en Mycobacterium tuberculosis , [ 4 ] explorar factores pronósticos en el dolor de cuello , [ 5 ] y desarrollar modelos de predicción para el dolor intenso en pacientes después de una nefrolitotomía percutánea . [ 6 ] abess también se puede aplicar a la selección de genes. [ 14 ] En el campo del descubrimiento de ecuaciones diferenciales parciales (EDP) basadas en datos , Thanasutives [ 15 ] aplicó abess para identificar automáticamente EDP gobernantes parsimoniosas.
Referencias
- 1 2 3 Zhu, Junxian; Wen, Canhong; Zhu, Jin; Zhang, Heping; Wang, Xueqin (29 de diciembre de 2020). "Un algoritmo polinomial para el problema de selección del mejor subconjunto" . Actas de la Academia Nacional de Ciencias . 117 (52): 33117– 33123. Bibcode : 2020PNAS..11733117Z . doi : 10.1073/pnas.2014241117 . PMC 7777147. PMID 33328272 .
- 1 2 Tang, Borui; Zhu, Jin; Zhu, Junxian; Wang, Xueqin; Zhang, Heping (2023). "Un algoritmo consistente y escalable para la selección del mejor subconjunto en modelos de índice único". arXiv : 2309.06230 [ stat.ML ].
- 1 2 Kong, Weikaixin y Zhu, Jie y Bi, Suzhen y Huang, Liting y Wu, Peng y Zhu, Su-Jie (2023). "Algoritmo adaptativo de selección del mejor subconjunto y método de aprendizaje de conjunto asistido por algoritmo genético identificaron una puntuación de gravedad robusta de pacientes con COVID-19" . IMeta . 2 (3). Wiley Online Library: e126. doi : 10.1002/imt2.126 . PMC 10989835. PMID 38867930 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Reshetnikov, KO y Bykova, DI y Kuleshov, KV y Chukreev, K y Guguchkin, EP y Akimkin, VG y Neverov, AD y Fedonin, GG (2022). "Selección y agregación de características para GWAS de resistencia a antibióticos en Mycobacterium tuberculosis: un estudio comparativo". pp. 2022– 03. bioRxiv 10.1101/2022.03.16.484601 .
{{cite bioRxiv}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Liew, Bernard XW y Kovacs, Francisco M y Rugamer, David y Royuela, Ana (2023). "Algoritmos de selección automática de variables en la investigación de factores pronósticos en el dolor de cuello" . Journal of Clinical Medicine . 12 (19). MDPI: 6232. doi : 10.3390/jcm12196232 . PMC 10573798. PMID 37834877 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Wei, Yuzhi y Wu, Haotian y Qi, Ziheng y Feng, Chunyu y Yang, Bo y Yin, Haolin y Wang, Lu y Zhang, Huan (2022). "Modelo de predicción clínica para el dolor severo después de la nefrolitotomía percutánea y análisis de factores asociados: un estudio retrospectivo" . Research Square . doi : 10.21203/rs.3.rs-2388045/v1 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Siegfried, Sandra; Kook, Lucas; Hothorn, Torsten (2023). "Regresión de localización-escala libre de distribución". The American Statistician . 77 (4). Taylor & Francis: 345– 356. arXiv : 2208.05302 . doi : 10.1080/00031305.2023.2203177 .
- ↑ Zhang, Yanhang; Zhu, Junxian; Zhu, Jin; Wang, Xueqin (2023). "Un enfoque de empalme para la selección del mejor subconjunto de grupos". INFORMS Journal on Computing . 35 (1). INFORMS: 104–119 . arXiv : 2104.12576 . doi : 10.1287/ijoc.2022.1241 .
- ↑ Zhang, Jie; Li, Yang; Zhao, Ni; Zheng, Zemin (2024). "Regularización L0 para regresión de alta dimensión con datos corruptos". Communications in Statistics - Theory and Methods . 53 (1). Taylor & Francis: 215– 231. doi : 10.1080/03610926.2022.2076125 . S2CID 249106625 .
- ↑ Wu, Bo; Yan, Jinbiao; Cao, Kai (2023). "Selección adaptativa de variable de norma l0 para el modelo de regresión ponderado geográficamente". Anales de la Asociación Estadounidense de Geógrafos . 113 (5). Taylor y Francis: 1190–1206 . Bibcode : 2023AAAG..113.1190W . doi : 10.1080/24694452.2022.2161988 . S2CID 257321841 .
- ↑ Chen, Yan; Dong, Ruipeng; Wen, Canhong (2023). "Estimación eficiente en comunicación para la selección de subconjuntos distribuidos". Statistics and Computing . 33 (6). Springer: 1– 15. doi : 10.1007/s11222-023-10302-7 . S2CID 264147329 .
- ↑ Zhu, Jin; Wang, Xueqin; Hu, Liyuan; Huang, Junhao; Jiang, Kangkang; Zhang, Yanhang; Lin, Shiyun; Zhu, Junxian (2022). "abess: una biblioteca de selección rápida del mejor subconjunto en Python y R" (PDF) . La revista de investigación sobre aprendizaje automático . 23 (1). JMLRORG: 9206– 9212. arXiv : 2110.09697 .
- ↑ «Documentación ABESS 0.4.5» .
- ↑ Miao, Maoxuan; Wu, Jinran; Cai, Fengjing; Wang, You-Gan (2022). "Un algoritmo memético modificado con una aplicación a la selección de genes en un estudio de peso corporal de ovejas" . Animals . 12 ( 2). MDPI: 201. doi : 10.3390/ani12020201 . PMC 8772977. PMID 35049823 .
- ↑ Thanasutives, Pongpisit; Morita, Takashi; Numao, Masayuki; Fukui, Ken-ichi (2023-02-01). "Aprendizaje automático informado por la física y consciente del ruido para el descubrimiento robusto de EDP" . Machine Learning: Science and Technology . 4 (1): 015009. arXiv : 2206.12901 . Bibcode : 2023MLS & T...4a5009T . doi : 10.1088/2632-2153/acb1f0 . ISSN 2632-2153 .
- Análisis de regresión
- algoritmos de aprendizaje automático