Articulo de referencia

Regularización de escasez estructurada

La regularización de escasez estructurada es una clase de métodos, y un área de investigación en la teoría del aprendizaje estadístico , que extienden y generalizan los métodos ...

La regularización de escasez estructurada es una clase de métodos, y un área de investigación en la teoría del aprendizaje estadístico , que extienden y generalizan los métodos de aprendizaje de regularización de escasez. [ 1 ] Tanto los métodos de escasez como los de regularización de escasez estructurada buscan explotar el supuesto de que la variable de salidaY{\displaystyle Y}(es decir, la respuesta o variable dependiente ) que se va a aprender se puede describir mediante un número reducido de variables en el espacio de entrada.incógnita{\displaystyle X}(es decir, el dominio , espacio de características o variables explicativas ). Los métodos de regularización de escasez se centran en seleccionar las variables de entrada que mejor describen la salida. Los métodos de regularización de escasez estructurada generalizan y extienden los métodos de regularización de escasez, al permitir una selección óptima sobre estructuras como grupos o redes de variables de entrada enincógnita{\displaystyle X}. [ 2 ] [ 3 ]

La motivación común para el uso de métodos de escasez estructurada es la interpretabilidad del modelo, el aprendizaje de alta dimensión (donde la dimensionalidad deincógnita{\displaystyle X}puede ser mayor que el número de observacionesnorte{\displaystyle n}), y reducción de la complejidad computacional . [ 4 ] Además, los métodos de escasez estructurada permiten incorporar supuestos previos sobre la estructura de las variables de entrada, como grupos superpuestos, [ 2 ] grupos no superpuestos y grafos acíclicos. [ 3 ] Ejemplos de usos de los métodos de escasez estructurada incluyen el reconocimiento facial, [ 5 ] el procesamiento de imágenes de resonancia magnética (IRM) , [ 6 ] el análisis sociolingüístico en el procesamiento del lenguaje natural , [ 7 ] y el análisis de la expresión genética en el cáncer de mama. [ 8 ]

Regularización de la escasez

Consideremos el problema de minimización del riesgo empírico regularizado con núcleo lineal y una función de pérdida.V(yi,F(incógnita)){\displaystyle V(y_{i},f(x))} y el0{\displaystyle \ell _{0}}"norma" como penalización de regularización:

minwRd1nortei=1norteV(yi,w,incógnitai)+λw0,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}V(y_{i},\langle w,x_{i}\rangle )+\lambda \|w\|_{0},}

dóndeincógnita,wRd{\displaystyle x,w\in \mathbb {R^{d}} }, yw0{\displaystyle \|w\|_{0}}denota el0{\displaystyle \ell _{0}}"norma", definida como el número de entradas no nulas del vectorw{\displaystyle w}.F(incógnita)=w,incógnitai{\displaystyle f(x)=\langle w,x_{i}\rangle } Se dice que es escaso siw0=s<d{\displaystyle \|w\|_{0}=s<d}. Lo que significa que la salidaY{\displaystyle Y}puede describirse mediante un pequeño subconjunto de variables de entrada.

En términos más generales, supongamos que hay un diccionario.ϕj:incógnitaR{\displaystyle \phi _{j}:X\rightarrow \mathbb {R} }conj=1,...,pag{\displaystyle j=1,...,p} se da, de tal manera que la función objetivoF(incógnita){\displaystyle f(x)}Un problema de aprendizaje se puede escribir como:

F(incógnita)=j=1pagϕj(incógnita)wj{\displaystyle f(x)=\sum _ {j=1}^{p}\phi _ {j}(x)w_ {j}},incógnitaincógnita{\displaystyle \forall x\in X}

El0{\displaystyle \ell _{0}}normaF0=w0{\displaystyle \|f\|_{0}=\|w\|_{0}} como el número de componentes no nulos dew{\displaystyle w}se define como

w0=|{j|wj0,j{1,...,pag}}|{\displaystyle \|w\|_{0}=|\{j|w_{j}\neq 0,j\in \{1,...,p\}\}|}, dónde|A|{\displaystyle |A|}es la cardinalidad del conjuntoA{\displaystyle A}.

F{\displaystyle f}Se dice que es escaso siF0=w0=s<d{\displaystyle \|f\|_{0}=\|w\|_{0}=s<d}.

Sin embargo, al usar el0{\displaystyle \ell _{0}}La norma para la regularización favorece las soluciones más dispersas, es computacionalmente difícil de usar y además no es convexa. Una norma computacionalmente más factible que favorece las soluciones más dispersas es la1{\displaystyle \ell _{1}}norma; se ha demostrado que esto aún favorece las soluciones más dispersas y además es convexo. [ 4 ]

Regularización de escasez estructurada

La regularización de escasez estructurada extiende y generaliza el problema de selección de variables que caracteriza la regularización de escasez. [ 2 ] [ 3 ] Considere el problema de minimización de riesgo empírico regularizado anterior con un núcleo general y un mapa de características asociado.ϕj:incógnitaR{\displaystyle \phi _{j}:X\rightarrow \mathbb {R} }conj=1,...,pag{\displaystyle j=1,...,p}.

minwRd1nortei=1norteV(yi,w,Φ(incógnitai))+λw0,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}V(y_{i},\langle w,\Phi (x_{i})\rangle )+\lambda \|w\|_{0},}

El término de regularizaciónλw0{\displaystyle \lambda \|w\|_{0}}penaliza cadawj{\displaystyle w_{j}}componente de forma independiente, lo que significa que el algoritmo suprimirá las variables de entrada de forma independiente entre sí.

En ciertas situaciones, podemos querer imponer mayor estructura al proceso de regularización, de modo que, por ejemplo, las variables de entrada se supriman según grupos predefinidos. Los métodos de regularización de escasez estructurada permiten imponer dicha estructura añadiendo una estructura a las normas que definen el término de regularización.

Estructuras y normas

Grupos no superpuestos: grupo Lasso

El caso de grupos no superpuestos es la instancia más básica de escasez estructurada. En él, una partición a priori del vector de coeficientesw{\displaystyle w}enGRAMO{\displaystyle G}Se asume que los grupos no se superponen.wgramo{\displaystyle w_{g}}sea ​​el vector de coeficientes en el grupogramo{\displaystyle g}, podemos definir un término de regularización y su norma de grupo como

λR(w)=λgramo=1GRAMOwgramogramo{\displaystyle \lambda R(w)=\lambda \sum _{g=1}^{G}\|w_{g}\|_{g}},

dóndewgramogramo{\displaystyle \|w_{g}\|_{g}}es el grupo2{\displaystyle \ell _{2}}normawgramogramo=j=1|GRAMOgramo|(wgramoj)2{\displaystyle \|w_{g}\|_{g}={\sqrt {\sum _{j=1}^{|G_{g}|}(w_{g}^{j})^{2}}}}, GRAMOgramo{\displaystyle G_{g}}es grupogramo{\displaystyle g}, ywgramoj{\displaystyle w_{g}^{j}}es el j-ésimo componente del grupoGRAMOgramo{\displaystyle G_{g}}.

La norma anterior también se conoce como Lasso de grupo . [ 2 ] Este regularizador fuerza grupos de coeficientes completos a tender a cero, en lugar de coeficientes individuales. Dado que los grupos no se superponen, el conjunto de coeficientes distintos de cero se obtiene como la unión de los grupos que no se establecieron en cero, y viceversa para el conjunto de coeficientes cero.

Grupos superpuestos

Los grupos superpuestos son el caso de escasez de estructura donde una variable puede pertenecer a más de un grupo.gramo{\displaystyle g}Este caso suele ser de interés, ya que puede representar una clase de relaciones entre variables más general que la que pueden representar los grupos no superpuestos, como las estructuras de árbol u otro tipo de grafos. [ 3 ] [ 8 ]

Existen dos tipos de enfoques de regularización de escasez de grupos superpuestos, que se utilizan para modelar diferentes tipos de relaciones entre variables de entrada:

Intersección de complementos: grupo Lasso

El método de intersección de complementos se utiliza cuando queremos seleccionar únicamente aquellas variables de entrada que tienen coeficientes positivos en todos los grupos a los que pertenecen. Consideremos de nuevo el método Lasso de grupo para un problema de minimización de riesgo empírico regularizado :

λR(w)=λgramo=1GRAMOwgramogramo{\displaystyle \lambda R(w)=\lambda \sum _{g=1}^{G}\|w_{g}\|_{g}},

dóndewgramogramo{\displaystyle \|w_{g}\|_{g}}es el grupo2{\displaystyle \ell _{2}}norma, GRAMOgramo{\displaystyle G_{g}}es grupogramo{\displaystyle g}, ywgramoj{\displaystyle w_{g}^{j}}es el j-ésimo componente del grupoGRAMOgramo{\displaystyle G_{g}}.

Al igual que en el caso de grupos no superpuestos, el regularizador Lasso de grupo potencialmente establecerá grupos enteros de coeficientes en cero. Las variables seleccionadas son aquellas con coeficienteswj>0{\displaystyle w_{j}>0}Sin embargo, como en este caso los grupos pueden superponerse, tomamos la intersección de los complementos de aquellos grupos que no se establecen en cero.

Esta intersección de criterios de selección de complementos implica la elección de modelado que permitimos algunos coeficientes dentro de un grupo particular.gramo{\displaystyle g}ser establecido a cero, mientras que otros dentro del mismo grupogramo{\displaystyle g}pueden permanecer positivos. En otras palabras, los coeficientes dentro de un grupo pueden diferir dependiendo de las distintas pertenencias a grupos que pueda tener cada variable dentro del grupo.

Unión de grupos: grupo latente Lasso

Un enfoque diferente consiste en considerar la unión de grupos para la selección de variables. Este enfoque refleja la situación de modelado en la que las variables pueden seleccionarse siempre que pertenezcan al menos a un grupo con coeficientes positivos. Esta perspectiva de modelado implica que deseamos preservar la estructura de grupos.

La formulación del enfoque de unión de grupos también se conoce como Lasso de grupo latente y requiere modificar el grupo.2{\displaystyle \ell _{2}}norma considerada anteriormente e introducir el siguiente regularizador [ 3 ]

R(w)=inorteF{gramowgramogramo:w=gramo=1GRAMOw¯gramo}{\displaystyle R(w)=inf\left\{\sum _{g}\|w_{g}\|_{g}:w=\sum _{g=1}^{G}{\bar {w}}_{g}\right\}}

dóndewRd{\displaystyle w\in {\mathbb {R^{d}} }}, wgramoGRAMOgramo{\displaystyle w_{g}\in G_{g}}es el vector de coeficientes del grupo g, yw¯gramoRd{\displaystyle {\bar {w}}_{g}\in {\mathbb {R^{d}} }}es un vector con coeficienteswgramoj{\displaystyle w_{g}^{j}}para todas las variables j{\displaystyle j} en grupo gramo{\displaystyle g}, y 0{\displaystyle 0} en todos los demás, es decir,w¯gramoj=wgramoj{\displaystyle {\bar {w}}_{g}^{j}=w_{g}^{j}}si j{\displaystyle j} en grupo gramo{\displaystyle g} yw¯gramoj=0{\displaystyle {\bar {w}}_{g}^{j}=0}de lo contrario.

Este regularizador puede interpretarse como una replicación efectiva de variables que pertenecen a más de un grupo, conservando así la estructura del grupo. Como se pretende en el enfoque de unión de grupos, se requierew=gramo=1GRAMOw¯gramo{\displaystyle w=\sum _ {g=1}^{G}{\bar {w}}_{g}}produce un vector de pesos w que efectivamente suma los pesos de todas las variables en todos los grupos a los que pertenecen.

Problemas con la regularización Group Lasso y enfoques alternativos

La función objetivo que utiliza el lasso de grupo consiste en una función de error , que generalmente debe ser convexa pero no necesariamente fuertemente convexa, y un grupo1{\displaystyle \ell _{1}}término de regularización. Un problema con esta función objetivo es que es convexa pero no necesariamente fuertemente convexa, y por lo tanto, generalmente no conduce a soluciones únicas. [ 9 ]

Un ejemplo de cómo solucionar esto es introducir el cuadrado2{\displaystyle \ell _{2}}norma del vector de peso como un término de regularización adicional mientras se mantiene la1{\displaystyle \ell _{1}}término de regularización del enfoque lasso de grupo. [ 9 ] Si el coeficiente del cuadrado 2{\displaystyle \ell _{2}}El término de norma es mayor que0{\displaystyle 0}, entonces porque el cuadrado 2{\displaystyle \ell _{2}}Si el término de norma es fuertemente convexo, la función objetivo resultante también será fuertemente convexa. [ 9 ] Siempre que la 2{\displaystyle \ell _{2}}Si el coeficiente es suficientemente pequeño pero aún positivo, el vector de pesos que minimiza la función objetivo resultante es generalmente muy cercano a un vector de pesos que minimiza la función objetivo que resultaría de eliminar el grupo. 2{\displaystyle \ell _{2}}término de regularización completamente de la función objetivo original; este último escenario corresponde al enfoque Lasso de grupo. [ 9 ] Por lo tanto, este enfoque permite una optimización más simple manteniendo la escasez. [ 9 ]

Normas basadas en la estructura sobre las variables de entrada

Ver: Función de conjunto submodular

Además de las normas mencionadas anteriormente, en los métodos de escasez estructurada se utilizan otras normas, como las normas jerárquicas y las definidas en cuadrículas. Estas normas surgen de funciones submodulares y permiten incorporar supuestos previos sobre la estructura de las variables de entrada. En el contexto de las normas jerárquicas, esta estructura puede representarse como un grafo dirigido acíclico sobre las variables, mientras que en el contexto de las normas basadas en cuadrículas, la estructura puede representarse mediante una cuadrícula. [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ]

Normas jerárquicas

Véase: Aprendizaje no supervisado

Los métodos de aprendizaje no supervisado se utilizan con frecuencia para aprender los parámetros de los modelos de variables latentes . Estos modelos estadísticos incluyen, además de las variables observadas, un conjunto de variables latentes no observadas. A menudo, en dichos modelos se asumen jerarquías entre las variables del sistema; este sistema de jerarquías puede representarse mediante grafos acíclicos dirigidos.

Las jerarquías de variables latentes han surgido como una estructura natural en varias aplicaciones, especialmente para modelar documentos de texto. [ 11 ] Los modelos jerárquicos que utilizan métodos bayesianos no paramétricos se han utilizado para aprender modelos de temas , [ 10 ] que son modelos estadísticos para descubrir los "temas" abstractos que aparecen en una colección de documentos. Las jerarquías también se han considerado en el contexto de los métodos de kernel. [ 13 ] Las normas jerárquicas se han aplicado a la bioinformática, [ 12 ] la visión por computadora y los modelos de temas. [ 14 ]

Normas definidas en cuadrículas

Si la estructura asumida sobre las variables tiene la forma de una cuadrícula 1D, 2D o 3D, entonces las funciones submodulares basadas en grupos superpuestos pueden considerarse como normas, lo que da lugar a conjuntos estables iguales a formas rectangulares o convexas. [ 13 ] Estos métodos tienen aplicaciones en visión por computadora. [ 15 ]

Algoritmos para el cálculo

Problema de selección del mejor subconjunto

El problema de elegir el mejor subconjunto de variables de entrada se puede formular naturalmente bajo un marco de penalización como: [ 4 ]

minwRd1nortei=1norteV(yi,w,incógnitai)+λw0,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}V(y_{i},w,x_{i})+\lambda \|w\|_{0},}

Dóndew0{\displaystyle \|w\|_{0}}denota el0{\displaystyle \ell _{0}}"norma", definida como el número de entradas no nulas del vectorw{\displaystyle w}.

Aunque esta formulación tiene sentido desde una perspectiva de modelado, es computacionalmente inviable, ya que equivale a una búsqueda exhaustiva que evalúa todos los subconjuntos posibles de variables. [ 4 ]

Existen dos enfoques principales para resolver el problema de optimización: 1) métodos voraces, como la regresión por pasos en estadística o la búsqueda de coincidencias en el procesamiento de señales ; y 2) enfoques de formulación de relajación convexa y métodos de optimización de gradiente proximal .

Relajación convexa

Una aproximación natural para el problema de selección del mejor subconjunto es la1{\displaystyle \ell _{1}}regularización de la norma: [ 4 ]

minwRd1nortei=1norteV(yi,w,incógnitai)+λw1{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}V(y_{i},w,x_{i})+\lambda \|w\|_{1}}

Dicho esquema se llama búsqueda de base o Lasso , que sustituye la0{\displaystyle \ell _{0}}"norma" para la convexa, no diferenciable1{\displaystyle \ell _{1}}norma.

Métodos de gradiente proximal

Los métodos de gradiente proximal , también llamados división hacia adelante-hacia atrás, son métodos de optimización útiles para minimizar funciones con un componente convexo y diferenciable , y un componente convexo potencialmente no diferenciable.

Por lo tanto, los métodos de gradiente proximal son útiles para resolver problemas de regularización de escasez y escasez estructurada [ 9 ] de la siguiente forma:

minwRd1nortei=1norteV(yi,w,incógnitai)+R(w){\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}V(y_{i},w,x_{i})+R(w)}

DóndeV(yi,w,incógnitai){\displaystyle V(y_{i},w,x_{i})}es una función de pérdida convexa y diferenciable como la pérdida cuadrática , yR(w){\displaystyle R(w)}es un regularizador convexo potencialmente no diferenciable como el1{\displaystyle \ell _{1}}norma.

Conexiones con otras áreas del aprendizaje automático

Conexión con el aprendizaje de múltiples núcleos

La regularización de escasez estructurada se puede aplicar en el contexto del aprendizaje de múltiples núcleos . [ 16 ] El aprendizaje de múltiples núcleos se refiere a un conjunto de métodos de aprendizaje automático que utilizan un conjunto predefinido de núcleos y aprenden una combinación lineal o no lineal óptima de núcleos como parte del algoritmo.

En los algoritmos mencionados anteriormente, se consideró un espacio completo de una sola vez y se dividió en grupos, es decir, subespacios. Un punto de vista complementario es considerar el caso en el que se combinan espacios distintos para obtener uno nuevo. Es útil discutir esta idea considerando diccionarios finitos. Los diccionarios finitos con elementos linealmente independientes —estos elementos también se conocen como átomos— se refieren a conjuntos finitos de funciones base linealmente independientes, cuyas combinaciones lineales definen espacios de hipótesis. Los diccionarios finitos se pueden usar para definir núcleos específicos, como se mostrará. [ 16 ] Supongamos para este ejemplo que, en lugar de un solo diccionario, se consideran varios diccionarios finitos.

Para simplificar, consideremos el caso en el que solo hay dos diccionarios.A={aj:incógnitaR,j=1,...,pag}{\displaystyle A=\{a_{j}:X\rightarrow \mathbb {R} ,j=1,...,p\}}yB={bt:incógnitaR,t=1,...,q}{\displaystyle B=\{b_{t}:X\rightarrow \mathbb {R} ,t=1,...,q\}}dóndeq{\displaystyle q}ypag{\displaystyle p}son enteros, serán considerados. Los átomos enA{\displaystyle A}así como los átomos enB{\displaystyle B}Se supone que son linealmente independientes.D={dk:incógnitaR,k=1,...,pag+q}=AB{\displaystyle D=\{d_{k}:X\rightarrow \mathbb {R} ,k=1,...,p+q\}=A\cup B}Sea la unión de los dos diccionarios. Consideremos el espacio lineal de funciones.H{\displaystyle H}dadas por combinaciones lineales de la forma

F(incógnita)=i=1pag+qwjdj(incógnita)=j=1pagwAjaj(incógnita)+t=1qwBtbt(incógnita),incógnitaincógnita{\displaystyle f(x)=\sum _{i=1}^{p+q}{w^{j}d_{j}(x)}=\sum _{j=1}^{p}{w_{A}^{j}a_{j}(x)}+\sum _{t=1}^{q}{w_{B}^{t}b_{t}(x)},x\in X}

para algunos vectores de coeficienteswARpag,wBRq{\displaystyle w_{A}\in \mathbb {R} ^{p},w_{B}\in \mathbb {R} ^{q}}, dóndew=(wA,wB){\displaystyle w=(w_{A},w_{B})}. Supongamos que los átomos enD{\displaystyle D}seguir siendo linealmente independientes, o equivalentemente, que el mapaw=(wA,wB)F{\displaystyle w=(w_{A},w_{B})\mapsto f}es uno a uno. Las funciones en el espacioH{\displaystyle H}puede verse como la suma de dos componentes, uno en el espacioHA{\displaystyle H_{A}}, las combinaciones lineales de átomos en A{\displaystyle A}y uno enHB{\displaystyle H_{B}}, las combinaciones lineales de los átomos enB{\displaystyle B}.

Una opción de norma en este espacio es||F||=||wA||+||wB||{\displaystyle ||f||=||w_{A}||+||w_{B}||}. Tenga en cuenta que ahora podemos verH{\displaystyle H}como un espacio de funciones en el que HA{\displaystyle H_{A}}, HB{\displaystyle H_{B}}son subespacios. En vista del supuesto de independencia lineal,H{\displaystyle H}puede identificarse conRpag+q{\displaystyle \mathbb {R} ^{p+q}}yHA,HB{\displaystyle H_{A},H_{B}}conRpag,Rq{\displaystyle \mathbb {R} ^{p},\mathbb {R} ^{q}}respectivamente. La norma mencionada anteriormente puede considerarse como la norma del grupo en H{\displaystyle H}asociados a los subespacios HA{\displaystyle H_{A}}, HB{\displaystyle H_{B}}, proporcionando una conexión con la regularización de escasez estructurada.

Aquí,HA{\displaystyle H_{A}}, HB{\displaystyle H_{B}}yH{\displaystyle H}Se puede observar que son los espacios de Hilbert del núcleo reproductor con mapas de características correspondientes.ΦA:incógnitaRpag{\displaystyle \Phi _{A}:X\rightarrow \mathbb {R} ^{p}}, dado porΦA(incógnita)=(a1(incógnita),...,apag(incógnita)){\displaystyle \Phi _{A}(x)=(a_{1}(x),...,a_{p}(x))},ΦB:incógnitaRq{\displaystyle \Phi _{B}:X\rightarrow \mathbb {R} ^{q}}, dado porΦB(incógnita)=(b1(incógnita),...,bq(incógnita)){\displaystyle \Phi _{B}(x)=(b_{1}(x),...,b_{q}(x))}, yΦ:incógnitaRpag+q{\displaystyle \Phi :X\rightarrow \mathbb {R} ^{p+q}}, dado por la concatenación deΦA,ΦB{\displaystyle \Phi _{A},\Phi _{B}}, respectivamente.

En el enfoque de regularización de escasez estructurada para este escenario, los grupos relevantes de variables que consideran las normas de grupo corresponden a los subespaciosHA{\displaystyle H_{A}}yHB{\displaystyle H_{B}}Este enfoque promueve establecer a cero los grupos de coeficientes correspondientes a estos subespacios en lugar de solo los coeficientes individuales, lo que promueve el aprendizaje de múltiples núcleos dispersos.

El razonamiento anterior se generaliza directamente a cualquier número finito de diccionarios o mapas de características. Puede extenderse a mapas de características que inducen hipótesis de dimensión infinita.

espacios. [ 16 ]

Cuándo es útil el aprendizaje de múltiples núcleos dispersos

Considerar el aprendizaje de múltiples núcleos dispersos es útil en varias situaciones, incluidas las siguientes:

  • Fusión de datos: Cuando cada núcleo corresponde a un tipo diferente de modalidad/característica.
  • Selección de variables no lineales: Consideremos los núcleosKgramo{\displaystyle K_{g}}dependiendo únicamente de una dimensión de la entrada.

En general, el aprendizaje de múltiples núcleos dispersos es particularmente útil cuando hay muchos núcleos y la selección del modelo y la interpretabilidad son importantes. [ 16 ]

Usos y aplicaciones adicionales

Los métodos de regularización de escasez estructurada se han utilizado en diversos contextos donde se desea imponer una estructura de variables de entrada a priori al proceso de regularización. Algunas de estas aplicaciones son:

  • La detección compresiva en imágenes de resonancia magnética (IRM), que reconstruye imágenes de IRM a partir de un pequeño número de mediciones, puede generar reducciones significativas en el tiempo de exploración de IRM [ 6 ].
  • Reconocimiento facial robusto en presencia de desalineación, oclusión y variación de iluminación [ 5 ]
  • Descubrir asociaciones sociolingüísticas entre las frecuencias léxicas utilizadas por los autores de Twitter y las variables sociodemográficas de sus comunidades geográficas [ 7 ]
  • Análisis de selección de genes de datos de cáncer de mama utilizando priors de grupos superpuestos, por ejemplo, conjuntos de genes biológicamente significativos [ 8 ].

Véase también

Referencias

  1. Rosasco, Lorenzo; Poggio, Tomasso (diciembre de 2014). Un recorrido por la regularización del aprendizaje automático, notas de clase del MIT-9.520 .
  2. 1 2 3 4 Yuan, M.; Lin, Y. (2006). "Selección y estimación de modelos en regresión con variables agrupadas". JR Stat. Soc. B . 68 (1): 49– 67. CiteSeerX 10.1.1.79.2062 . doi : 10.1111/j.1467-9868.2005.00532.x . S2CID 6162124 .  
  3. 1 2 3 4 5 Obozinski, G.; Laurent, J.; Vert, J.-P. (2011). "Group lasso with overlaps: the latent group lasso approach". arXiv : 1110.0413 [ stat.ML ].
  4. 1 2 3 4 5 L. Rosasco. Lección 10 de las Notas de clase para 9.520: Teoría y aplicaciones del aprendizaje estadístico. Instituto Tecnológico de Massachusetts, otoño de 2014. Disponible en https://www.mit.edu/~9.520/fall14/slides/class18/class18_sparsity.pdf
  5. 1 2 Jia, Kui; et al. (2012). "Reconocimiento facial robusto y práctico mediante escasez estructurada". En Andrew Fitzgibbon; Svetlana Lazebnik; Pietro Perona; Yoichi Sato; Cordelia Schmid (eds.). Computer Vision – ECCV 2012: 12.ª Conferencia Europea sobre Visión por Computadora, Florencia, Italia, 7-13 de octubre de 2012 Actas, Parte IV . 
  6. 1 2 Chen, Chen; et al. (2012). "Resonancia magnética de detección compresiva con escasez de árbol de ondículas" . Actas de la 26.ª Conferencia Anual sobre Sistemas de Procesamiento de Información Neuronal . Vol. 25. Curran Associates. pp. 1115–1123 .   
  7. 1 2 Eisenstein, Jacob; et al. (2011). "Descubriendo asociaciones sociolingüísticas con escasez estructurada". Actas de la 49.ª Reunión Anual de la Asociación de Lingüística Computacional . 
  8. 1 2 3 Jacob, Laurent; et al. (2009). "Group Lasso with Overlap and Graph Lasso". Actas de la 26ª Conferencia Internacional sobre Aprendizaje Automático . 
  9. 1 2 3 4 5 6 Villa, S.; Rosasco, L.; Mosci, S.; Verri, A. (2012). "Métodos proximales para la penalización lasso de grupo latente". arXiv : 1209.0368 [ math.OC ].
  10. 1 2 Blei, D., Ng, A., y Jordan, M. Asignación latente de Dirichlet. J. Mach. Learn. Res., 3:993–1022, 2003.
  11. 1 2 Bengio, Y. "Aprendizaje de arquitecturas profundas para IA". Fundamentos y tendencias en aprendizaje automático, 2(1), 2009.
  12. 1 2 S. Kim y E. Xing. Lasso grupal guiado por árboles para regresión multitarea con escasez estructurada. En Proc. ICML, 2010.
  13. 1 2 3 Jenatton, Rodolphe; Audibert, Jean-Yves; Bach, Francis (2011). "Selección de variables estructuradas con normas que inducen escasez". Journal of Machine Learning Research . 12 (2011): 2777– 2824. arXiv : 0904.3523 . Bibcode : 2009arXiv0904.3523J .
  14. 1 2 R. Jenatton, J. Mairal, G. Obozinski y F. Bach. Métodos proximales para el aprendizaje de diccionarios jerárquicos dispersos. En Proc. ICML, 2010.
  15. 1 2 R. Jenatton, G. Obozinski y F. Bach. Análisis de componentes principales dispersos estructurados. En Proc. AISTATS , 2009.
  16. 1 2 3 4 Rosasco, Lorenzo; Poggio, Tomaso (otoño de 2015). "Capítulo 6". Apuntes del curso MIT 9.520, otoño de 2015 .