Articulo de referencia

Abeja

abess ( Adaptive Best Subset Selection , también conocido como ABESS ) es un método de aprendizaje automático diseñado para abordar el problema de la selección del mejor subconj...

abess ( Adaptive Best Subset Selection , también conocido como ABESS ) es un método de aprendizaje automático diseñado para abordar el problema de la selección del mejor subconjunto . Su objetivo es determinar qué características o variables son cruciales para un rendimiento óptimo del modelo a partir de un conjunto de datos y una tarea de predicción. abess fue presentado por Zhu en 2020 [ 1 ] y selecciona dinámicamente el tamaño de modelo adecuado de forma adaptativa, eliminando la necesidad de seleccionar parámetros de regularización.

abess es aplicable en diversas tareas estadísticas y de aprendizaje automático, incluyendo regresión lineal , el modelo de índice único y otros modelos predictivos comunes. [ 1 ] [ 2 ] abess también puede aplicarse en bioestadística . [ 3 ] [ 4 ] [ 5 ] [ 6 ]

Forma básica

La forma básica de abess [ 1 ] se emplea para abordar el problema de selección de subconjuntos óptimos en la regresión lineal general . abess es unl0{\displaystyle l_{0}}Este método se caracteriza por su complejidad temporal polinómica y por la propiedad de proporcionar estimaciones imparciales y consistentes .

En el contexto de la regresión lineal, suponiendo que tenemos conocimiento denorte{\displaystyle n}muestras independientes(incógnitai,yi),i=1,,norte{\displaystyle (x_{i},y_{i}),i=1,\ldots ,n}, dóndeincógnitaiRpag×1{\displaystyle x_{i}\in \mathbb {R} ^{p\times 1}}yyiR{\displaystyle y_{i}\in \mathbb {R} }, definimosincógnita=(incógnita1,,incógnitanorte){\displaystyle X=(x_{1},\ldots ,x_{n})^{\top }}yy=(y1,,ynorte){\displaystyle y=(y_{1},\ldots ,y_{n})^{\top }}La siguiente ecuación representa el modelo general de regresión lineal:

y=incógnitaβ+ε.{\displaystyle y=X\beta +\varepsilon .}

Para obtener parámetros adecuadosβ{\displaystyle \beta }, se puede considerar la función de pérdida para la regresión lineal:

LnorteLR(β;incógnita,y)=12norteyincógnitaβ22.{\displaystyle {\mathcal {L}}_{n}^{\text{LR}}(\beta ;X,y)={\frac {1}{2n}}\|y-X\beta \|_{2}^{2}.}

En Abess, el enfoque inicial está en optimizar la función de pérdida bajo lal0{\displaystyle l_{0}}restricción. Es decir, consideramos el siguiente problema:

minβRpag×1LnorteLR(β;incógnita,y), sujeto a β0s,{\displaystyle \min _{\beta \in \mathbb {R} ^{p\times 1}}{\mathcal {L}}_{n}^{\text{LR}}(\beta ;X,y),{\text{ subject to }}\|\beta \|_{0}\leq s,}

dóndes{\displaystyle s}representa el tamaño deseado del conjunto de soporte, yβ0=i=1pagI(βi0){\displaystyle \|\beta \|_{0}=\sum _{i=1}^{p}{\mathcal {I}}_{(\beta _{i}\neq 0)}}es ell0{\displaystyle l_{0}}norma del vector.

Para abordar el problema de optimización descrito anteriormente, Abess intercambia iterativamente un número igual de variables entre el conjunto activo y el conjunto inactivo. En cada iteración, se introduce el concepto de sacrificio de la siguiente manera:

  • Para j en el conjunto activo (jA^{\displaystyle j\in {\hat {\mathcal {A}}}}):

ξj=LnorteLR(β^A{j})LnorteLR(β^A)=incógnitajincógnitaj2norte(β^j)2{\displaystyle \xi _{j}={\mathcal {L}}_{n}^{\text{LR}}\left({\hat {\boldsymbol {\beta }}}^{{\mathcal {A}}\backslash \{j\}}\right)-{\mathcal {L}}_{n}^{\text{LR}}\left({\hat {\boldsymbol {\beta }}}^{\mathcal {A}}\right)={\frac {{\boldsymbol {X}}_{j}^{\top }{\boldsymbol {X}}_{j}}{2n}}\left({\hat {\beta }}_{j}\right)^{2}}

  • Para j en el conjunto inactivo (jA^{\displaystyle j\notin {\hat {\mathcal {A}}}}):

ξj=LnorteLR(β^A)LnorteLR(β^A+t^{j})=incógnitajincógnitaj2norte(d^jincógnitajincógnitaj/norte)2{\displaystyle \xi _{j}={\mathcal {L}}_{n}^{\text{LR}}\left({\hat {\boldsymbol {\beta }}}^{\mathcal {A}}\right)-{\mathcal {L}}_{n}^{\text{LR}}\left({\hat {\boldsymbol {\beta }}}^{\mathcal {A}}+{\hat {\boldsymbol {t}}}^{\{j\}}\right)={\frac {{\boldsymbol {X}}_{j}^{\top }{\boldsymbol {X}}_{j}}{2n}}\left({\frac {{\hat {\mathrm {d} }}_{j}}{{\boldsymbol {X}}_{j}^{\top }{\boldsymbol {X}}_{j}/n}}\right)^{2}}

Estos son los elementos clave de las ecuaciones anteriores:

  • β^A{\displaystyle {\hat {\beta }}^{\mathcal {A}}}: Esto representa la estimación deβ{\displaystyle \beta }obtenido en la iteración anterior.
  • A^{\displaystyle {\hat {\mathcal {A}}}}: Indica el conjunto activo estimado de la iteración anterior.
  • β^A{j}{\displaystyle {\hat {\boldsymbol {\beta }}}^{{\mathcal {A}}\backslash \{j\}}}: Este es un vector donde el j-ésimo elemento se establece en 0, mientras que los demás elementos son iguales aβ^A{\displaystyle {\hat {\beta }}^{\mathcal {A}}}.
  • t^{j}=argmintLnorteLR(β^A+t{j}){\displaystyle {\hat {\boldsymbol {t}}}^{\{j\}}=\arg \min _{t}{\mathcal {L}}_{n}^{\text{LR}}\left({\hat {\boldsymbol {\beta }}}^{\mathcal {A}}+{\boldsymbol {t}}^{\{j\}}\right)}: Aquí,t{j}{\displaystyle t^{\{j\}}}representa un vector donde todos los elementos son 0 excepto el j-ésimo elemento.
  • d^j=incógnitaj(yincógnitaβ^)/norte{\displaystyle {\hat {d}}_{j}={\boldsymbol {X}}_{j}^{\top }({\boldsymbol {y}}-{\boldsymbol {X}}{\hat {\boldsymbol {\beta }}})/n}: Esto se calcula en base a la ecuación mencionada.

El proceso iterativo implica el intercambio de variables, con el objetivo de minimizar los sacrificios en el conjunto activo y maximizar los sacrificios en el conjunto inactivo durante cada iteración. Este enfoque permite a Abess buscar de manera eficiente el subconjunto de características óptimo.

En Abess , seleccione un apropiadosmáximo{\displaystyle s_{\max }}y optimizar el problema anterior para el tamaño de los conjuntos activos.s=1,,smáximo{\displaystyle s=1,\ldots ,s_{\max }}utilizando el criterio de informaciónGIC=norteregistroLnorteLR+sregistropagregistroregistronorte,{\displaystyle {\text{GIC}}=n\log {\mathcal {L}}_{n}^{\text{LR}}+s\log p\log \log n,}para elegir de forma adaptativa el tamaño adecuado del conjunto activos{\displaystyle s}y obtener su estimador abess correspondiente .

Generalizaciones

El algoritmo de empalme de Abess se puede emplear para la selección de subconjuntos en otros modelos.

Regresión de localización-escala no paramétrica

En 2023, Siegfried extiende abess al caso de distribución libre y localización-escala. [ 7 ] Específicamente, considera el problema de optimización

máximoϑRPAG,βRJ,γRJi=1nortei(ϑ,incógnitaiβ,exp(incógnitaiγ)1),{\displaystyle \max _{{\boldsymbol {\vartheta }}\in \mathbb {R} ^{P},{\boldsymbol {\beta }}\in \mathbb {R} ^{J},{\boldsymbol {\gamma }}\in \mathbb {R} ^{J}}\sum _{i=1}^{N}\ell _{i}\left({\boldsymbol {\vartheta }},{\boldsymbol {x}}_{i}^{\top }{\boldsymbol {\beta }},{\sqrt {\exp \left({\boldsymbol {x}}_{i}^{\top }{\boldsymbol {\gamma }}\right)}}^{-1}\right),}

sujeto a(β,γ)0s,{\displaystyle \left\|\left({\boldsymbol {\beta }}^{\top },{\boldsymbol {\gamma }}^{\top }\right)^{\top }\right\|_{0}\leq s,}dóndei{\displaystyle \ell _{i}}es una función de pérdida,ϑ{\displaystyle {\boldsymbol {\vartheta }}}es un vector de parámetros,β{\displaystyle {\boldsymbol {\beta }}}yγ{\displaystyle {\boldsymbol {\gamma }}}son vectores yincógnitai{\displaystyle {\boldsymbol {x}}_{i}}es un vector de datos.

Este enfoque, demostrado en diversas aplicaciones, permite la elaboración de modelos de regresión parsimoniosos para resultados arbitrarios, manteniendo al mismo tiempo la interpretabilidad mediante procedimientos innovadores de selección de subconjuntos.

Selección de grupos

En 2023, Zhang aplicó el algoritmo de empalme a la selección de grupos, [ 8 ] optimizando el siguiente modelo:

minβRpagLnorteLR(β;incógnita,y) sujeto a j=1JI(βGRAMOj20)s{\displaystyle \min _{{\boldsymbol {\beta }}\in \mathbb {R} ^{p}}{\mathcal {L}}_{n}^{\text{LR}}(\beta ;X,y){\text{ subject to }}\sum _{j=1}^{J}I\left(\|{\boldsymbol {\beta }}_{G_{j}}\|_{2}\neq 0\right)\leq s}

Estos son los símbolos involucrados:

  • J{\displaystyle J}: Número total de grupos de características, que representan la existencia deJ{\displaystyle J}grupos de características que no se superponen en el conjunto de datos.
  • GRAMOj{\displaystyle G_{j}}: Índice establecido para elj{\displaystyle j}-ésimo grupo de características, dondej{\displaystyle j}va desde 1 hastaJ{\displaystyle J}, que representa la estructura de agrupación de características en los datos.
  • s{\displaystyle s}: Tamaño del modelo, un número entero positivo determinado a partir de los datos, que limita el número de grupos de características seleccionados.

Regresión con datos corruptos

Zhang aplicó el algoritmo de empalme para manejar datos corruptos. [ 9 ] Los datos corruptos se refieren a información que se ha visto alterada o contiene errores durante el proceso de recopilación o registro de datos. Esta interferencia puede incluir imprecisiones de los sensores, errores de registro, problemas de comunicación u otras perturbaciones externas, lo que da lugar a observaciones inexactas o distorsionadas dentro del conjunto de datos.

Modelos de índice único

En 2023, Tang aplicó el algoritmo de empalme a la selección óptima de subconjuntos en el modelo de índice único. [ 2 ]

La forma del Modelo de Índice Único (SIM) viene dada por yi=gramo(bincógnitai,mii),i=1,,norte,{\displaystyle y_{i}=g({\boldsymbol {b}}^{\top }{\boldsymbol {x}}_{i},e_{i}),\quad i=1,\ldots ,n,}

dóndeb{\displaystyle {\boldsymbol {b}}}es el vector de parámetros, mii{\displaystyle e_{i}}es el término de error.

La función de pérdida correspondiente se define como lnorte(β)=i=1norte(rinorte12incógnitaiβ)2,{\displaystyle l_{n}({\boldsymbol {\beta }})=\sum _{i=1}^{n}\left({\frac {r_{i}}{n}}-{\frac {1}{2}}-{\boldsymbol {x}}_{i}^{\top }{\boldsymbol {\beta }}\right)^{2},}

dónder{\displaystyle {\boldsymbol {r}}}es el vector de rango,ri{\displaystyle r_{i}}es el rango deyi{\displaystyle y_{i}}eny{\displaystyle {\boldsymbol {y}}}.

El problema de estimación abordado por este algoritmo es minβlnorte(β), calle β0s.{\displaystyle \min _{\boldsymbol {\beta }}l_{n}({\boldsymbol {\beta }}),{\text{ s.t. }}\|{\boldsymbol {\beta }}\|_{0}\leq s.}

Modelo de regresión ponderado geográficamente

En 2023, Wu [ 10 ] aplicó el algoritmo de empalme a la regresión ponderada geográficamente (GWR). La GWR es un método de análisis espacial, y la investigación de Wu se centra en mejorar su rendimiento en el modelado de regresión de datos geográficos. Esto se logra mediante la aplicación de un método de selección adaptativa de variables con norma l0, que realiza simultáneamente la selección del modelo y la optimización de coeficientes, mejorando así la precisión del modelado de regresión para datos espaciales geográficos.

Sistemas distribuidos

En 2023, Chen [ 11 ] introdujo un método innovador para abordar los desafíos en sistemas distribuidos de alta dimensión , proponiendo un algoritmo eficiente para abess .

Un sistema distribuido es un modelo computacional que distribuye las tareas de computación entre múltiples nodos independientes para lograr un procesamiento de datos más eficiente, fiable y escalable . En un sistema distribuido, los nodos de computación individuales pueden trabajar simultáneamente, colaborando para completar las tareas generales y, por lo tanto, mejorando el rendimiento y la capacidad de procesamiento del sistema.

Sin embargo, en los sistemas distribuidos, existe una falta de algoritmos eficientes para la selección óptima de subconjuntos. Para abordar esta deficiencia, Chen presenta un enfoque novedoso y eficiente en términos de comunicación para gestionar la selección óptima de subconjuntos en sistemas distribuidos.

Paquete de software

La biblioteca abess [ 12 ] (versión 0.4.5) es un paquete de R y Python basado en algoritmos de C++. Es de código abierto y está disponible en GitHub . La biblioteca se puede utilizar para la selección óptima de subconjuntos en modelos de regresión lineal, (multi)clasificación y modelado de respuesta censurada. El paquete abess permite seleccionar parámetros en formato agrupado. En la página principal de abess se encuentran disponibles información y tutoriales [ 13 ] .

Solicitud

abess se puede aplicar en bioestadística, como evaluar la robustez de los pacientes con COVID-19 , [ 3 ] realizar resistencia a los antibióticos en Mycobacterium tuberculosis , [ 4 ] explorar factores pronósticos en el dolor de cuello , [ 5 ] y desarrollar modelos de predicción para el dolor intenso en pacientes después de una nefrolitotomía percutánea . [ 6 ] abess también se puede aplicar a la selección de genes. [ 14 ] En el campo del descubrimiento de ecuaciones diferenciales parciales (EDP) basadas en datos , Thanasutives [ 15 ] aplicó abess para identificar automáticamente EDP gobernantes parsimoniosas.

Referencias

  1. 1 2 3 Zhu, Junxian; Wen, Canhong; Zhu, Jin; Zhang, Heping; Wang, Xueqin (29 de diciembre de 2020). "Un algoritmo polinomial para el problema de selección del mejor subconjunto" . Actas de la Academia Nacional de Ciencias . 117 (52): 33117– 33123. Bibcode : 2020PNAS..11733117Z . doi : 10.1073/pnas.2014241117 . PMC 7777147. PMID 33328272 .  
  2. 1 2 Tang, Borui; Zhu, Jin; Zhu, Junxian; Wang, Xueqin; Zhang, Heping (2023). "Un algoritmo consistente y escalable para la selección del mejor subconjunto en modelos de índice único". arXiv : 2309.06230 [ stat.ML ].
  3. 1 2 Kong, Weikaixin y Zhu, Jie y Bi, Suzhen y Huang, Liting y Wu, Peng y Zhu, Su-Jie (2023). "Algoritmo adaptativo de selección del mejor subconjunto y método de aprendizaje de conjunto asistido por algoritmo genético identificaron una puntuación de gravedad robusta de pacientes con COVID-19" . IMeta . 2 (3). Wiley Online Library: e126. doi : 10.1002/imt2.126 . PMC 10989835. PMID 38867930 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  4. 1 2 Reshetnikov, KO y Bykova, DI y Kuleshov, KV y Chukreev, K y Guguchkin, EP y Akimkin, VG y Neverov, AD y Fedonin, GG (2022). "Selección y agregación de características para GWAS de resistencia a antibióticos en Mycobacterium tuberculosis: un estudio comparativo". pp. 2022– 03. bioRxiv 10.1101/2022.03.16.484601 .  {{cite bioRxiv}}: CS1 maint: varios nombres: lista de autores ( enlace )
  5. 1 2 Liew, Bernard XW y Kovacs, Francisco M y Rugamer, David y Royuela, Ana (2023). "Algoritmos de selección automática de variables en la investigación de factores pronósticos en el dolor de cuello" . Journal of Clinical Medicine . 12 (19). MDPI: 6232. doi : 10.3390/jcm12196232 . PMC 10573798. PMID 37834877 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  6. 1 2 Wei, Yuzhi y Wu, Haotian y Qi, Ziheng y Feng, Chunyu y Yang, Bo y Yin, Haolin y Wang, Lu y Zhang, Huan (2022). "Modelo de predicción clínica para el dolor severo después de la nefrolitotomía percutánea y análisis de factores asociados: un estudio retrospectivo" . Research Square . doi : 10.21203/rs.3.rs-2388045/v1 .{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  7. Siegfried, Sandra; Kook, Lucas; Hothorn, Torsten (2023). "Regresión de localización-escala libre de distribución". The American Statistician . 77 (4). Taylor & Francis: 345– 356. arXiv : 2208.05302 . doi : 10.1080/00031305.2023.2203177 .
  8. Zhang, Yanhang; Zhu, Junxian; Zhu, Jin; Wang, Xueqin (2023). "Un enfoque de empalme para la selección del mejor subconjunto de grupos". INFORMS Journal on Computing . 35 (1). INFORMS: 104–119 . arXiv : 2104.12576 . doi : 10.1287/ijoc.2022.1241 .
  9. Zhang, Jie; Li, Yang; Zhao, Ni; Zheng, Zemin (2024). "Regularización L0 para regresión de alta dimensión con datos corruptos". Communications in Statistics - Theory and Methods . 53 (1). Taylor & Francis: 215– 231. doi : 10.1080/03610926.2022.2076125 . S2CID 249106625 . 
  10. Wu, Bo; Yan, Jinbiao; Cao, Kai (2023). "Selección adaptativa de variable de norma l0 para el modelo de regresión ponderado geográficamente". Anales de la Asociación Estadounidense de Geógrafos . 113 (5). Taylor y Francis: 1190–1206 . Bibcode : 2023AAAG..113.1190W . doi : 10.1080/24694452.2022.2161988 . S2CID 257321841 . 
  11. Chen, Yan; Dong, Ruipeng; Wen, Canhong (2023). "Estimación eficiente en comunicación para la selección de subconjuntos distribuidos". Statistics and Computing . 33 (6). Springer: 1– 15. doi : 10.1007/s11222-023-10302-7 . S2CID 264147329 . 
  12. Zhu, Jin; Wang, Xueqin; Hu, Liyuan; Huang, Junhao; Jiang, Kangkang; Zhang, Yanhang; Lin, Shiyun; Zhu, Junxian (2022). "abess: una biblioteca de selección rápida del mejor subconjunto en Python y R" (PDF) . La revista de investigación sobre aprendizaje automático . 23 (1). JMLRORG: 9206– 9212. arXiv : 2110.09697 .
  13. «Documentación ABESS 0.4.5» .
  14. Miao, Maoxuan; Wu, Jinran; Cai, Fengjing; Wang, You-Gan (2022). "Un algoritmo memético modificado con una aplicación a la selección de genes en un estudio de peso corporal de ovejas" . Animals . 12 ( 2). MDPI: 201. doi : 10.3390/ani12020201 . PMC 8772977. PMID 35049823 .  
  15. Thanasutives, Pongpisit; Morita, Takashi; Numao, Masayuki; Fukui, Ken-ichi (2023-02-01). "Aprendizaje automático informado por la física y consciente del ruido para el descubrimiento robusto de EDP" . Machine Learning: Science and Technology . 4 (1): 015009. arXiv : 2206.12901 . Bibcode : 2023MLS & T...4a5009T . doi : 10.1088/2632-2153/acb1f0 . ISSN 2632-2153 .