Articulo de referencia

Regularización de variedades

La regularización de variedades puede clasificar datos cuando los datos etiquetados (círculos blancos y negros) son escasos, aprovechando los datos no etiquetados (círculos gris...

La regularización de variedades puede clasificar datos cuando los datos etiquetados (círculos blancos y negros) son escasos, aprovechando los datos no etiquetados (círculos grises). Sin muchos puntos de datos etiquetados, los algoritmos de aprendizaje supervisado solo pueden aprender límites de decisión muy simples (panel superior). El aprendizaje de variedades puede trazar un límite de decisión entre las clases naturales de los datos no etiquetados, bajo el supuesto de que los puntos cercanos probablemente pertenecen a la misma clase, por lo que el límite de decisión debería evitar áreas con muchos puntos no etiquetados. Esta es una versión del aprendizaje semisupervisado .

En aprendizaje automático , la regularización de variedades es una técnica que utiliza la forma de un conjunto de datos para restringir las funciones que deben aprenderse en dicho conjunto. En muchos problemas de aprendizaje automático, los datos que se van a aprender no cubren todo el espacio de entrada. Por ejemplo, un sistema de reconocimiento facial puede no necesitar clasificar cualquier imagen posible, sino solo el subconjunto de imágenes que contienen rostros. La técnica de aprendizaje de variedades asume que el subconjunto de datos relevante proviene de una variedad , una estructura matemática con propiedades útiles. La técnica también asume que la función que se va a aprender es suave : es poco probable que los datos con diferentes etiquetas estén cerca unos de otros, por lo que la función de etiquetado no debería cambiar rápidamente en áreas donde es probable que haya muchos puntos de datos. Debido a esta suposición, un algoritmo de regularización de variedades puede utilizar datos sin etiquetar para informar dónde se permite que la función aprendida cambie rápidamente y dónde no, utilizando una extensión de la técnica de regularización de Tikhonov . Los algoritmos de regularización de variedades pueden extender los algoritmos de aprendizaje supervisado a entornos de aprendizaje semisupervisado y transductivo , donde se dispone de datos sin etiquetar. Esta técnica se ha utilizado en aplicaciones como imágenes médicas, imágenes geográficas y reconocimiento de objetos.

Regularizador de colector

Motivación

La regularización de variedades es un tipo de regularización , una familia de técnicas que reduce el sobreajuste y garantiza que un problema esté bien planteado penalizando las soluciones complejas. En particular, la regularización de variedades extiende la técnica de regularización de Tikhonov aplicada a los espacios de Hilbert con núcleo reproductor (RKHS). Bajo la regularización de Tikhonov estándar en RKHS, un algoritmo de aprendizaje intenta aprender una funciónF{\displaystyle f}de entre un espacio de hipótesis de funcionesH{\displaystyle {\mathcal {H}}}El espacio de hipótesis es un RKHS, lo que significa que está asociado con un núcleo .K{\displaystyle K}y por lo tanto cada función candidataF{\displaystyle f}tiene una normaFK{\displaystyle \left\|f\right\|_{K}}, que representa la complejidad de la función candidata en el espacio de hipótesis. Cuando el algoritmo considera una función candidata, tiene en cuenta su norma para penalizar las funciones complejas.

Formalmente, dado un conjunto de datos de entrenamiento etiquetados(incógnita1,y1),,(incógnita,y){\displaystyle (x_{1},y_{1}),\ldots ,(x_{\ell },y_{\ell })}conincógnitaiincógnita,yiY{\displaystyle x_{i}\in X,y_{i}\in Y}y una función de pérdidaV{\displaystyle V}, un algoritmo de aprendizaje que utiliza la regularización de Tikhonov intentará resolver la expresión

argminFH1i=1V(F(incógnitai),yi)+γFK2{\displaystyle {\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }V(f(x_{i}),y_{i})+\gamma \left\|f\right\|_{K}^{2}}

dóndeγ{\displaystyle \gamma }es un hiperparámetro que controla cuánto dará preferencia el algoritmo a las funciones más simples sobre las funciones que se ajustan mejor a los datos.

Una variedad bidimensional incrustada en un espacio tridimensional (izquierda). La regularización de la variedad intenta aprender una función que sea suave en la variedad desplegada (derecha).

La regularización de variedades añade un segundo término de regularización, el regularizador intrínseco , al regularizador ambiental utilizado en la regularización de Tikhonov estándar. Bajo la suposición de variedad en el aprendizaje automático, los datos en cuestión no provienen de todo el espacio de entrada.incógnita{\displaystyle X}, sino a partir de una variedad no linealMETROincógnita{\displaystyle M\subset X}. La geometría de esta variedad, el espacio intrínseco, se utiliza para determinar la norma de regularización. [ 1 ]

norma laplaciana

Existen muchas opciones posibles para el regularizador intrínseco.FI{\displaystyle \left\|f\right\|_{I}}Muchas elecciones naturales implican el gradiente en la variedad .METRO{\displaystyle \nabla _{M}}, que puede proporcionar una medida de cuán suave es una función objetivo. Una función suave debería cambiar lentamente donde los datos de entrada son densos; es decir, el gradienteMETROF(incógnita){\displaystyle \nabla _{M}f(x)}debería ser pequeño donde la densidad de probabilidad marginalPAGincógnita(incógnita){\displaystyle {\mathcal {P}}_{X}(x)}, la densidad de probabilidad de que un punto de datos extraído aleatoriamente aparezca enincógnita{\displaystyle x}, es grande. Esto proporciona una opción adecuada para el regularizador intrínseco:

FI2=incógnitaMETROMETROF(incógnita)2dPAGincógnita(incógnita){\displaystyle \left\|f\right\|_{I}^{2}=\int _{x\in M}\left\|\nabla _{M}f(x)\right\|^{2}\,d{\mathcal {P}}_{X}(x)}

En la práctica, esta norma no se puede calcular directamente debido a la distribución marginal.PAGincógnita{\displaystyle {\mathcal {P}}_{X}}Se desconoce, pero se puede estimar a partir de los datos proporcionados.

Enfoque basado en grafos de la norma laplaciana

Cuando las distancias entre los puntos de entrada se interpretan como un grafo, la matriz laplaciana del grafo puede ayudar a estimar la distribución marginal . Supongamos que los datos de entrada incluyen:{\displaystyle \ell }ejemplos etiquetados (pares de una entrada)incógnita{\displaystyle x}y una etiquetay{\displaystyle y}) y{\displaystyle u}Ejemplos sin etiquetar (entradas sin etiquetas asociadas). DefinirW{\displaystyle W}ser una matriz de pesos de aristas para un grafo, dondeWij{\displaystyle W_{ij}}es una similitud construida a partir de la medida de distancia entre los puntos de datosincógnitai{\displaystyle x_{i}}yincógnitaj{\displaystyle x_{j}}(de modo que más cerca implica mayorWij{\displaystyle W_{ij}}). DefinirD{\displaystyle D}ser una matriz diagonal conDii=j=1+Wij{\displaystyle D_{ii}=\sum _{j=1}^{\ell +u}W_{ij}}yL{\displaystyle L}ser la matriz laplacianaDW{\displaystyle D-W}. Luego, a medida que aumenta el número de puntos de datos+{\displaystyle \ell +u}aumenta,L{\displaystyle L}converge al operador de Laplace-BeltramiΔMETRO{\displaystyle \Delta _{M}}, que es la divergencia del gradienteMETRO{\displaystyle \nabla _{M}}. [ 2 ] [ 3 ] Entonces, siF{\displaystyle \mathbf {f} }es un vector de los valores deF{\displaystyle f}en los datos,F=[F(incógnita1),,F(incógnital+)]T{\displaystyle \mathbf {f} =[f(x_{1}),\ldots ,f(x_{l+u})]^{\mathrm {T} }}, la norma intrínseca puede estimarse:

FI2=1(+)2FTLF{\displaystyle \left\|f\right\|_{I}^{2}={\frac {1}{(\ell +u)^{2}}}\mathbf {f} ^{\mathrm {T} }L\mathbf {f} }

A medida que aumenta el número de puntos de datos+{\displaystyle \ell +u}aumenta, esta definición empírica deFI2{\displaystyle \left\|f\right\|_{I}^{2}}converge a la definición cuandoPAGincógnita{\displaystyle {\mathcal {P}}_{X}}es conocido. [ 1 ]

Resolución del problema de regularización mediante un enfoque basado en grafos.

Usando los pesosγA{\displaystyle \gamma _{A}}yγI{\displaystyle \gamma _{I}}Para los regularizadores ambientales e intrínsecos, la expresión final a resolver es:

argminFH1i=1V(F(incógnitai),yi)+γAFK2+γI(+)2FTLF{\displaystyle {\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }V(f(x_{i}),y_{i})+\gamma _{A}\left\|f\right\|_{K}^{2}+{\frac {\gamma _{I}}{(\ell +u)^{2}}}\mathbf {f} ^{\mathrm {T} }L\mathbf {f} }

Al igual que con otros métodos de kernel ,H{\displaystyle {\mathcal {H}}}puede ser un espacio de dimensión infinita, por lo que si la expresión de regularización no se puede resolver explícitamente, es imposible buscar una solución en todo el espacio. En cambio, un teorema del representante muestra que bajo ciertas condiciones sobre la elección de la normaFI{\displaystyle \left\|f\right\|_{I}}la solución óptimaF{\displaystyle f^{*}}debe ser una combinación lineal del núcleo centrado en cada uno de los puntos de entrada: para algunos pesosαi{\displaystyle \alpha _{i}},

F(incógnita)=i=1+αiK(incógnitai,incógnita){\displaystyle f^{*}(x)=\sum _{i=1}^{\ell +u}\alpha _{i}K(x_{i},x)}

Utilizando este resultado, es posible buscar la solución óptima.F{\displaystyle f^{*}}mediante la búsqueda en el espacio de dimensión finita definido por las posibles elecciones deαi{\displaystyle \alpha _{i}}. [ 1 ]

Enfoque funcional de la norma laplaciana

La idea más allá del laplaciano de grafos es utilizar vecinos para estimar el laplaciano. Este método es similar a los métodos de promedio local , que se sabe que escalan mal en problemas de alta dimensión. De hecho, se sabe que el laplaciano de grafos sufre la maldición de la dimensionalidad . [ 2 ] Afortunadamente, es posible aprovechar la suavidad esperada de la función para estimar gracias a un análisis funcional más avanzado. Este método consiste en estimar el operador laplaciano utilizando derivadas de la lectura del núcleo1,jK(incógnitai,incógnita){\displaystyle \partial _{1,j}K(x_{i},x)}dónde1,j{\displaystyle \partial _{1,j}}denota las derivadas parciales según la j -ésima coordenada de la primera variable. [ 4 ] Este segundo enfoque de la norma laplaciana es ponerla en relación con los métodos sin malla , que contrastan con el método de diferencias finitas en EDP.

Aplicaciones

La regularización de variedades puede extender una variedad de algoritmos que se pueden expresar utilizando la regularización de Tikhonov, eligiendo una función de pérdida apropiada.V{\displaystyle V}y espacio de hipótesisH{\displaystyle {\mathcal {H}}}Dos ejemplos comúnmente utilizados son las familias de máquinas de vectores de soporte y los algoritmos de mínimos cuadrados regularizados . (Los mínimos cuadrados regularizados incluyen el algoritmo de regresión de cresta; los algoritmos relacionados de LASSO y la regularización de red elástica pueden expresarse como máquinas de vectores de soporte. [ 5 ] [ 6 ] ) Las versiones extendidas de estos algoritmos se denominan Mínimos Cuadrados Regularizados Laplacianos (abreviado LapRLS) y Máquinas de Vectores de Soporte Laplacianas (LapSVM), respectivamente. [ 1 ]

Mínimos cuadrados regularizados laplacianos (LapRLS)

Los mínimos cuadrados regularizados (RLS) son una familia de algoritmos de regresión : algoritmos que predicen un valory=F(incógnita){\displaystyle y=f(x)}por sus insumosincógnita{\displaystyle x}con el objetivo de que los valores predichos se aproximen a las etiquetas reales de los datos. En particular, RLS está diseñado para minimizar el error cuadrático medio entre los valores predichos y las etiquetas reales, sujeto a regularización. La regresión de cresta es una forma de RLS; en general, RLS es lo mismo que la regresión de cresta combinada con el método del núcleo . El planteamiento del problema para RLS resulta de la elección de la función de pérdida.V{\displaystyle V}en la regularización de Tikhonov para ser el error cuadrático medio:

F=argminFH1i=1(F(incógnitai)yi)2+γFK2{\displaystyle f^{*}={\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }(f(x_{i})-y_{i})^{2}+\gamma \left\|f\right\|_{K}^{2}}

Gracias al teorema del representante , la solución se puede escribir como una suma ponderada del núcleo evaluado en los puntos de datos:

F(incógnita)=i=1αiK(incógnitai,incógnita){\displaystyle f^{*}(x)=\sum _{i=1}^{\ell }\alpha _{i}^{*}K(x_{i},x)}

y resolver paraα{\displaystyle \alpha ^{*}}da:

α=(K+γI)1Y{\displaystyle \alpha ^{*}=(K+\gamma \ell I)^{-1}Y}

dóndeK{\displaystyle K}se define como la matriz del núcleo, conKij=K(incógnitai,incógnitaj){\displaystyle K_{ij}=K(x_{i},x_{j})}, yY{\displaystyle Y}es el vector de etiquetas de datos.

Agregar un término laplaciano para la regularización de la variedad da como resultado la declaración RLS laplaciana:

F=argminFH1i=1(F(incógnitai)yi)2+γAFK2+γI(+)2FTLF{\displaystyle f^{*}={\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }(f(x_{i})-y_{i})^{2}+\gamma _{A}\left\|f\right\|_{K}^{2}+{\frac {\gamma _{I}}{(\ell +u)^{2}}}\mathbf {f} ^{\mathrm {T} }L\mathbf {f} }

El teorema del representante para la regularización de variedades nuevamente da

F(incógnita)=i=1+αiK(incógnitai,incógnita){\displaystyle f^{*}(x)=\sum _{i=1}^{\ell +u}\alpha _{i}^{*}K(x_{i},x)}

y esto produce una expresión para el vectorα{\displaystyle \alpha ^{*}}AlquilerK{\displaystyle K}Sea la matriz del núcleo como se indicó anteriormente,Y{\displaystyle Y}sea ​​el vector de etiquetas de datos, yJ{\displaystyle J}ser el(+)×(+){\displaystyle (\ell +u)\times (\ell +u)}matriz de bloques[I000]{\displaystyle {\begin{bmatrix}I_{\ell }&0\\0&0_{u}\end{bmatrix}}}:

α=argminαR+1(YJKα)T(YJKα)+γAαTKα+γI(+)2αTKLKα{\displaystyle \alpha ^{*}={\underset {\alpha \in \mathbf {R} ^{\ell +u}}{\arg \!\min }}{\frac {1}{\ell }}(Y-JK\alpha )^{\mathrm {T} }(Y-JK\alpha )+\gamma _{A}\alpha ^{\mathrm {T} }K\alpha +{\frac {\gamma _{I}}{(\ell +u)^{2}}}\alpha ^{\mathrm {T} }KLK\alpha }

con una solución de

α=(JK+γAI+γI(+)2LK)1Y{\displaystyle \alpha ^{*}=\left(JK+\gamma _{A}\ell I+{\frac {\gamma _{I}\ell }{(\ell +u)^{2}}}LK\right)^{-1}Y}[ 1 ]

LapRLS se ha aplicado a problemas que incluyen redes de sensores, [ 7 ] imágenes médicas , [ 8 ] [ 9 ] detección de objetos , [ 10 ] espectroscopia , [ 11 ] clasificación de documentos , [ 12 ] interacciones fármaco-proteína, [ 13 ] y compresión de imágenes y vídeos. [ 14 ]

Máquinas de vectores de soporte laplacianas (LapSVM)

Las máquinas de vectores de soporte (SVM) son una familia de algoritmos que se utilizan a menudo para clasificar datos en dos o más grupos o clases . Intuitivamente, una SVM traza un límite entre clases de manera que los ejemplos etiquetados más cercanos al límite estén lo más lejos posible. Esto se puede expresar directamente como un programa lineal , pero también es equivalente a la regularización de Tikhonov con la función de pérdida de bisagra .V(F(incógnita),y)=máximo(0,1yF(incógnita)){\displaystyle V(f(x),y)=\max(0,1-yf(x))}:

F=argminFH1i=1máximo(0,1yiF(incógnitai))+γFK2{\displaystyle f^{*}={\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }\max(0,1-y_{i}f(x_{i}))+\gamma \left\|f\right\|_{K}^{2}}[ 15 ] [ 16 ]

Al agregar el término de regularización intrínseca a esta expresión, se obtiene el enunciado del problema de LapSVM:

F=argminFH1i=1máximo(0,1yiF(incógnitai))+γAFK2+γI(+)2FTLF{\displaystyle f^{*}={\underset {f\in {\mathcal {H}}}{\arg \!\min }}{\frac {1}{\ell }}\sum _{i=1}^{\ell }\max(0,1-y_{i}f(x_{i}))+\gamma _{A}\left\|f\right\|_{K}^{2}+{\frac {\gamma _{I}}{(\ell +u)^{2}}}\mathbf {f} ^{\mathrm {T} }L\mathbf {f} }

Nuevamente, el teorema del representante permite expresar la solución en términos del núcleo evaluado en los puntos de datos:

F(incógnita)=i=1+αiK(incógnitai,incógnita){\displaystyle f^{*}(x)=\sum _{i=1}^{\ell +u}\alpha _{i}^{*}K(x_{i},x)}

α{\displaystyle \alpha }se puede encontrar escribiendo el problema como un programa lineal y resolviendo el problema dual . Nuevamente, dejandoK{\displaystyle K}sea ​​la matriz del núcleo yJ{\displaystyle J}sea ​​la matriz de bloques[I000]{\displaystyle {\begin{bmatrix}I_{\ell }&0\\0&0_{u}\end{bmatrix}}}, se puede demostrar que la solución es

α=(2γAI+2γI(+)2LK)1JTYβ{\displaystyle \alpha =\left(2\gamma _{A}I+2{\frac {\gamma _{I}}{(\ell +u)^{2}}}LK\right)^{-1}J^{\mathrm {T} }Y\beta ^{*}}

dóndeβ{\displaystyle \beta ^{*}}es la solución al problema dual

β=máximoβRi=1βi12βTQβsujeto ai=1βiyi=00βi1i=1,,{\displaystyle {\begin{aligned}&&\beta ^{*}=\max _{\beta \in \mathbf {R} ^{\ell }}&\sum _{i=1}^{\ell }\beta _{i}-{\frac {1}{2}}\beta ^{\mathrm {T} }Q\beta \\&{\text{subject to}}&&\sum _{i=1}^{\ell }\beta _{i}y_{i}=0\\&&&0\leq \beta _{i}\leq {\frac {1}{\ell }}\;i=1,\ldots ,\ell \end{aligned}}}

yQ{\displaystyle Q}se define por

Q=YJK(2γAI+2γI(+)2LK)1JTY{\displaystyle Q=YJK\left(2\gamma _{A}I+2{\frac {\gamma _{I}}{(\ell +u)^{2}}}LK\right)^{-1}J^{\mathrm {T} }Y}[ 1 ]

LapSVM se ha aplicado a problemas que incluyen imágenes geográficas, [ 17 ] [ 18 ] [ 19 ] imágenes médicas, [ 20 ] [ 21 ] [ 22 ] reconocimiento facial, [ 23 ] mantenimiento de máquinas, [ 24 ] e interfaces cerebro-computadora . [ 25 ]

Limitaciones

  • La regularización de variedades presupone que los datos con etiquetas diferentes no suelen estar cerca unos de otros. Esta suposición es la que permite a la técnica extraer información de datos sin etiquetar, pero solo se aplica a ciertos dominios de problemas. Dependiendo de la estructura de los datos, puede ser necesario utilizar un algoritmo de aprendizaje semisupervisado o transductivo diferente. [ 26 ]
  • En algunos conjuntos de datos, la norma intrínseca de una funciónFI{\displaystyle \left\|f\right\|_{I}}puede estar muy cerca de la norma ambientalFK{\displaystyle \left\|f\right\|_{K}}Por ejemplo, si los datos constan de dos clases que se encuentran en líneas perpendiculares, la norma intrínseca será igual a la norma ambiental. En este caso, los datos sin etiquetar no afectan la solución aprendida mediante la regularización de variedades, incluso si los datos cumplen con el supuesto del algoritmo de que el separador debe ser suave. Se han propuesto enfoques relacionados con el co-entrenamiento para abordar esta limitación. [ 27 ]
  • Si hay una gran cantidad de ejemplos sin etiquetar, la matriz del núcleoK{\displaystyle K}se vuelve muy grande, y un algoritmo de regularización de variedades puede volverse prohibitivamente lento de calcular. Los algoritmos en línea y las aproximaciones dispersas de la variedad pueden ser útiles en este caso. [ 28 ]

Véase también

Referencias

  1. 1 2 3 4 5 6 Belkin, Mikhail; Niyogi, Partha; Sindhwani, Vikas (2006). "Regularización de variedades: un marco geométrico para aprender de ejemplos etiquetados y no etiquetados" . The Journal of Machine Learning Research . 7 : 2399–2434 . Recuperado el 2 de diciembre de 2015 .
  2. 1 2 Hein, Matthias; Audibert, Jean-Yves; Von Luxburg, Ulrike (2005). "De grafos a variedades: consistencia puntual débil y fuerte de laplacianos de grafos". Teoría del aprendizaje . Lecture Notes in Computer Science. Vol. 3559. Springer. pp. 470–485 . CiteSeerX 10.1.1.103.82 . doi : 10.1007/11503415_32 . ISBN    978-3-540-26556-6.
  3. Belkin, Mikhail; Niyogi, Partha (2005). "Hacia una base teórica para los métodos de variedades basados ​​en el laplaciano". Teoría del aprendizaje . Lecture Notes in Computer Science. Vol. 3559. Springer. pp. 486–500 . CiteSeerX 10.1.1.127.795 . doi : 10.1007/11503415_33 . ISBN    978-3-540-26556-6.
  4. Cabannes, Vivien; Pillaud-Vivien, Loucas; Bach, Francis; Rudi, Alessandro (2021). "Superando la maldición de la dimensionalidad con regularización laplaciana en el aprendizaje semisupervisado". arXiv : 2009.04324 [ stat.ML ].
  5. Jaggi, Martin (2014). Suykens, Johan; Signoretto, Marco; Argyriou, Andreas (eds.). Una equivalencia entre Lasso y las máquinas de vectores de soporte . Chapman and Hall/CRC.
  6. Zhou, Quan; Chen, Wenlin; Song, Shiji; Gardner, Jacob; Weinberger, Kilian; Chen, Yixin. Una reducción de Elastic Net a máquinas de vectores de soporte con una aplicación a la computación GPU . Asociación para el Avance de la Inteligencia Artificial .
  7. Pan, Jeffrey Junfeng; Yang, Qiang; Chang, Hong; Yeung, Dit-Yan (2006). "Un enfoque de regularización de variedades para la reducción de calibración para el seguimiento basado en redes de sensores" (PDF) . Actas de la conferencia nacional sobre inteligencia artificial . Vol. 21. Menlo Park, CA; Cambridge, MA; Londres; AAAI Press; MIT Press; 1999. pág. 988. Recuperado el 2 de diciembre de 2015 .  
  8. Zhang, Daoqiang; Shen, Dinggang (2011). "Clasificación multimodal semisupervisada de la enfermedad de Alzheimer". Biomedical Imaging: From Nano to Macro, 2011 IEEE International Symposium on . IEEE. pp. 1628– 1631. doi : 10.1109/ISBI.2011.5872715 . 
  9. Park, Sang Hyun; Gao, Yaozong; Shi, Yinghuan; Shen, Dinggang (2014). "Segmentación interactiva de próstata basada en selección adaptativa de características y regularización de variedades". Aprendizaje automático en imágenes médicas . Notas de clase en ciencias de la computación. Vol. 8679. Springer. págs. 264–271 . doi : 10.1007/978-3-319-10581-9_33 . ISBN   978-3-319-10580-2.
  10. Pillai, Sudeep. "Aprendizaje de detector de objetos semisupervisado a partir de etiquetas mínimas" (PDF) . Archivado del original (PDF) el 30 de agosto de 2017. Recuperado el 15 de diciembre de 2015 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  11. Wan, Songjing; Wu, Di; Liu, Kangsheng (2012). "Algoritmo de aprendizaje automático semisupervisado en calibración espectral de infrarrojo cercano: un estudio de caso sobre combustibles diésel". Advanced Science Letters . 11 (1): 416– 419. doi : 10.1166/asl.2012.3044 .
  12. Wang, Ziqiang; Sun, Xia; Zhang, Lijie; Qian, Xu (2013). "Clasificación de documentos basada en LAPRL óptimos". Journal of Software . 8 (4): 1011– 1018. doi : 10.4304/jsw.8.4.1011-1018 .
  13. Xia, Zheng; Wu, Ling-Yun; Zhou, Xiaobo; Wong, Stephen TC (2010). "Predicción de interacción fármaco-proteína semisupervisada a partir de espacios biológicos heterogéneos" . BMC Systems Biology . 4 (Supl. 2): –6. CiteSeerX 10.1.1.349.7173 . doi : 10.1186/1752-0509-4-S2-S6 . PMC 2982693. PMID 20840733 .   
  14. Cheng, Li; Vishwanathan, SVN (2007). "Aprendizaje para comprimir imágenes y vídeos" . Actas de la 24.ª conferencia internacional sobre aprendizaje automático . ACM. págs. 161–168 . Recuperado el 16 de diciembre de 2015 . 
  15. Lin, Yi; Wahba, Grace; Zhang, Hao; Lee, Yoonkyung (2002). "Propiedades estadísticas y ajuste adaptativo de máquinas de vectores de soporte" . Machine Learning . 48 ( 1–3 ): 115–136 . doi : 10.1023/A:1013951620650 .
  16. Wahba, Grace; otros (1999). "Máquinas de vectores de soporte, espacios de Hilbert de núcleo reproductor y el GACV aleatorio". Avances en métodos de núcleo: aprendizaje de vectores de soporte . 6 : 69–87 . CiteSeerX 10.1.1.53.2114 . 
  17. Kim, Wonkook; Crawford, Melba M. (2010). "Clasificación adaptativa para datos de imágenes hiperespectrales utilizando máquinas de núcleo de regularización de variedades". IEEE Transactions on Geoscience and Remote Sensing . 48 (11): 4110– 4121. Bibcode : 2010ITGRS..48.4110K . doi : 10.1109/TGRS.2010.2076287 . S2CID 29580629 . 
  18. Camps-Valls, Gustavo; Tuia, Devis; Bruzzone, Lorenzo; Atli Benediktsson, Jon (2014). "Avances en la clasificación de imágenes hiperespectrales: monitoreo de la Tierra con métodos de aprendizaje estadístico". IEEE Signal Processing Magazine . 31 (1): 45– 54. arXiv : 1310.5107 . Bibcode : 2014ISPM...31...45C . doi : 10.1109/msp.2013.2279179 . S2CID 11945705 . 
  19. Gómez-Chova, Luis; Camps-Valls, Gustavo; Muñoz-Marí, Jordi; Calpe, Javier (2007). "Detección de nubes semisupervisada con Laplacian SVM". Simposio de geociencia y teledetección, 2007. IGARSS 2007. IEEE International . IEEE. págs. 1521-1524 . doi : 10.1109/IGARSS.2007.4423098 . 
  20. Cheng, Bo; Zhang, Daoqiang; Shen, Dinggang (2012). "Aprendizaje por transferencia de dominio para la predicción de la conversión de deterioro cognitivo leve". Medical Image Computing and Computer-Assisted Intervention–MICCAI 2012. Lecture Notes in Computer Science. Vol. 7510. Springer. pp. 82–90 . doi : 10.1007/978-3-642-33415-3_11 . ISBN   978-3-642-33414-6. PMC 3761352 . PMID 23285538 .  
  21. Jamieson, Andrew R.; Giger, Maryellen L.; Drukker, Karen; Pesce, Lorenzo L. (2010). "Mejora del CADx mamario con datos no etiquetadosa)" . Física Médica . 37 (8): 4155– 4172. Bibcode : 2010MedPh..37.4155J . doi : 10.1118/1.3455704 . PMC 2921421. PMID 20879576 .  
  22. Wu, Jiang; Diao, Yuan-Bo; Li, Meng-Long; Fang, Ya-Ping; Ma, Dai-Chuan (2009). "Un método basado en aprendizaje semisupervisado: máquina de vectores de soporte laplaciana utilizada en el diagnóstico de la diabetes". Ciencias Interdisciplinarias: Ciencias de la Vida Computacionales . 1 (2): 151– 155. doi : 10.1007/s12539-009-0016-2 . PMID 20640829 . S2CID 21860700 .  
  23. Wang, Ziqiang; Zhou, Zhiqiang; Sun, Xia; Qian, Xu; Sun, Lijun (2012). "Algoritmo LapSVM mejorado para el reconocimiento facial" . Revista Internacional de Avances en Tecnología Informática . 4 (17) . Recuperado el 16 de diciembre de 2015 .
  24. Zhao, Xiukuan; Li, Min; Xu, Jinwu; Song, Gangbing (2011). "Un procedimiento eficaz que aprovecha los datos no etiquetados para construir un sistema de monitorización". Expert Systems with Applications . 38 (8): 10199– 10204. doi : 10.1016/j.eswa.2011.02.078 .
  25. Zhong, Ji-Ying; Lei, Xu; Yao, D. (2009). "Aprendizaje semisupervisado basado en variedades en BCI" (PDF) . Revista de Ciencia y Tecnología Electrónica de China . 7 (1): 22– 26. Archivado del original (PDF) el 4 de marzo de 2016. Recuperado el 16 de diciembre de 2015 .
  26. Zhu, Xiaojin (2005). "Revisión de la literatura sobre aprendizaje semisupervisado". CiteSeerX 10.1.1.99.9681 . {{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  27. Sindhwani, Vikas; Rosenberg, David S. ( 2008). "Un RKHS para aprendizaje multivista y corregularización de variedades" . Actas de la 25.ª conferencia internacional sobre aprendizaje automático . ACM. págs. 976–983 . Recuperado el 2 de diciembre de 2015 . 
  28. Goldberg, Andrew; Li, Ming; Zhu, Xiaojin (2008). "Regularización de variedades en línea: un nuevo entorno de aprendizaje y un estudio empírico". Aprendizaje automático y descubrimiento de conocimiento en bases de datos . Notas de clase en ciencias de la computación. Vol. 5211. págs. 393–407 . doi : 10.1007/978-3-540-87479-9_44 . ISBN   978-3-540-87478-2.

Software

  • La biblioteca ManifoldLearn y la biblioteca Primal LapSVM implementan LapRLS y LapSVM en MATLAB .
  • La biblioteca Dlib para C++ incluye una función de regularización de variedades lineales.