Articulo de referencia

Supervisión deficiente

La supervisión débil (también conocida como aprendizaje semisupervisado ) es un paradigma del aprendizaje automático cuya relevancia y notoriedad aumentaron con la aparición de ...

La supervisión débil (también conocida como aprendizaje semisupervisado ) es un paradigma del aprendizaje automático cuya relevancia y notoriedad aumentaron con la aparición de los grandes modelos de lenguaje debido a la gran cantidad de datos necesarios para entrenarlos. Se caracteriza por utilizar una combinación de una pequeña cantidad de datos etiquetados por humanos (utilizados exclusivamente en el paradigma de aprendizaje supervisado, más costoso y que requiere más tiempo ), seguida de una gran cantidad de datos sin etiquetar (utilizados exclusivamente en el paradigma de aprendizaje no supervisado ). En otras palabras, los valores de salida deseados se proporcionan solo para un subconjunto de los datos de entrenamiento. Los datos restantes no están etiquetados o están etiquetados de forma imprecisa. Intuitivamente, puede verse como un examen y los datos etiquetados como problemas de ejemplo que el profesor resuelve para la clase como ayuda para resolver otro conjunto de problemas. En el contexto transductivo , estos problemas sin resolver actúan como preguntas de examen. En el contexto inductivo , se convierten en problemas de práctica del tipo que conformarán el examen.

Problema

Tendencia a emplear métodos supervisados ​​o no supervisados ​​en una tarea. El hecho de que los nombres de las tareas abarquen los límites de los círculos es intencional. Esto demuestra que la división clásica de las tareas imaginativas (izquierda) que emplean métodos no supervisados ​​se difumina en los esquemas de aprendizaje actuales.

La adquisición de datos etiquetados para un problema de aprendizaje suele requerir un agente humano cualificado (por ejemplo, para transcribir un segmento de audio) o un experimento físico (por ejemplo, para determinar la estructura tridimensional de una proteína o la presencia de petróleo en una ubicación específica). El coste asociado al proceso de etiquetado puede, por tanto, hacer inviables los conjuntos de entrenamiento grandes y completamente etiquetados, mientras que la adquisición de datos sin etiquetar es relativamente económica. En tales situaciones, el aprendizaje semisupervisado puede resultar de gran utilidad práctica. El aprendizaje semisupervisado también tiene interés teórico en el aprendizaje automático y como modelo para el aprendizaje humano.

Técnica

Un ejemplo de la influencia de los datos sin etiquetar en el aprendizaje semisupervisado. El panel superior muestra un límite de decisión que podríamos adoptar tras observar solo un ejemplo positivo (círculo blanco) y uno negativo (círculo negro). El panel inferior muestra un límite de decisión que podríamos adoptar si, además de los dos ejemplos etiquetados, contáramos con un conjunto de datos sin etiquetar (círculos grises).

De manera más formal, el aprendizaje semisupervisado asume un conjunto del{\displaystyle l}ejemplos distribuidos de forma idéntica e independienteincógnita1,,incógnitalincógnita{\displaystyle x_{1},\dots ,x_{l}\in X}con etiquetas correspondientesy1,,ylY{\displaystyle y_{1},\dots,y_{l}\en Y}y{\displaystyle u}ejemplos sin etiquetarincógnital+1,,incógnital+incógnita{\displaystyle x_{l+1},\dots ,x_{l+u}\in X}se procesan. El aprendizaje semisupervisado combina esta información para superar el rendimiento de clasificación que se puede obtener descartando los datos sin etiquetar y realizando un aprendizaje supervisado o descartando las etiquetas y realizando un aprendizaje no supervisado.

El aprendizaje semisupervisado puede referirse tanto al aprendizaje transductivo como al aprendizaje inductivo . [ 1 ] El objetivo del aprendizaje transductivo es inferir las etiquetas correctas para los datos no etiquetados proporcionados.incógnital+1,,incógnital+{\displaystyle x_{l+1},\dots ,x_{l+u}}solamente. El objetivo del aprendizaje inductivo es inferir el mapeo correcto a partir deincógnita{\displaystyle X}aY{\displaystyle Y}.

Resulta innecesario (y, según el principio de Vapnik , imprudente) realizar un aprendizaje transductivo mediante la inferencia de una regla de clasificación sobre todo el espacio de entrada; sin embargo, en la práctica, los algoritmos diseñados formalmente para la transducción o la inducción se utilizan a menudo indistintamente.

Supuestos

Para poder utilizar datos sin etiquetar, debe existir alguna relación con la distribución subyacente de los datos. Los algoritmos de aprendizaje semisupervisado utilizan al menos una de las siguientes suposiciones: [ 2 ]

Suposición de continuidad/suavidad

Los puntos que están cerca unos de otros tienen más probabilidades de compartir una etiqueta. Esto también se asume generalmente en el aprendizaje supervisado y produce una preferencia por límites de decisión geométricamente simples . En el caso del aprendizaje semisupervisado, la suposición de suavidad produce además una preferencia por límites de decisión en regiones de baja densidad, de modo que pocos puntos están cerca unos de otros pero pertenecen a clases diferentes. [ 3 ]

Suposición de clúster

Los datos tienden a formar grupos discretos, y es más probable que los puntos de un mismo grupo compartan una etiqueta (aunque los datos que comparten una etiqueta pueden estar distribuidos en varios grupos). Este es un caso especial del supuesto de suavidad y da lugar al aprendizaje de características mediante algoritmos de agrupamiento.

Suposición múltiple

Los datos se ubican aproximadamente en una variedad de dimensión mucho menor que el espacio de entrada. En este caso, aprender la variedad utilizando tanto los datos etiquetados como los no etiquetados permite evitar la maldición de la dimensionalidad . Posteriormente, el aprendizaje puede continuar utilizando distancias y densidades definidas en la variedad.

La suposición de variedad resulta práctica cuando se generan datos de alta dimensión mediante algún proceso que puede ser difícil de modelar directamente, pero que posee pocos grados de libertad. Por ejemplo, la voz humana está controlada por unas pocas cuerdas vocales [ 4 ] , y las imágenes de diversas expresiones faciales están controladas por unos pocos músculos. En estos casos, es preferible considerar las distancias y la suavidad en el espacio natural del problema generador, en lugar de en el espacio de todas las posibles ondas acústicas o imágenes, respectivamente.

Historia

El enfoque heurístico del autoentrenamiento (también conocido como autoaprendizaje o autoetiquetado ) es históricamente el enfoque más antiguo para el aprendizaje semisupervisado, [ 2 ] con ejemplos de aplicaciones que comienzan en la década de 1960. [ 5 ]

El marco de aprendizaje transductivo fue introducido formalmente por Vladimir Vapnik en la década de 1970. [ 6 ] El interés en el aprendizaje inductivo mediante modelos generativos también comenzó en la década de 1970. Ratsaby y Venkatesh demostraron en 1995 una cota de aprendizaje probablemente aproximada para el aprendizaje semisupervisado de una mezcla gaussiana . [ 7 ]

Métodos

Modelos generativos

Los enfoques generativos para el aprendizaje estadístico buscan primero estimarpag(incógnita|y){\displaystyle p(x|y)}, la distribución de los puntos de datos pertenecientes a cada clase. La probabilidadpag(y|incógnita){\displaystyle p(y|x)}que un punto determinadoincógnita{\displaystyle x}tiene etiquetay{\displaystyle y}es entonces proporcional apag(incógnita|y)pag(y){\displaystyle p(x|y)p(y)}por la regla de Bayes . El aprendizaje semisupervisado con modelos generativos puede verse como una extensión del aprendizaje supervisado (clasificación más información sobrepag(incógnita){\displaystyle p(x)}) o como una extensión del aprendizaje no supervisado (agrupamiento más algunas etiquetas).

Los modelos generativos suponen que las distribuciones adoptan alguna forma particular.pag(incógnita|y,θ){\displaystyle p(x|y,\theta )}parametrizado por el vectorθ{\displaystyle \theta }Si estas suposiciones son incorrectas, los datos sin etiquetar podrían disminuir la precisión de la solución en comparación con la que se habría obtenido solo con datos etiquetados. [ 8 ] Sin embargo, si las suposiciones son correctas, los datos sin etiquetar necesariamente mejoran el rendimiento. [ 7 ]

Los datos sin etiquetar se distribuyen según una mezcla de distribuciones de clases individuales. Para aprender la distribución de la mezcla a partir de los datos sin etiquetar, esta debe ser identificable; es decir, diferentes parámetros deben generar diferentes distribuciones sumadas. Las distribuciones de mezcla gaussiana son identificables y se utilizan comúnmente en modelos generativos.

La distribución conjunta parametrizada se puede escribir comopag(incógnita,y|θ)=pag(y|θ)pag(incógnita|y,θ){\displaystyle p(x,y|\theta )=p(y|\theta )p(x|y,\theta )}mediante el uso de la regla de la cadena . Cada vector de parámetrosθ{\displaystyle \theta }está asociado con una función de decisiónFθ(incógnita)=argmaxy pag(y|incógnita,θ){\displaystyle f_{\theta }(x)={\underset {y}{\operatorname {argmax} }}\ p(y|x,\theta )}El parámetro se elige entonces en función del ajuste a los datos etiquetados y no etiquetados, ponderado porλ{\displaystyle \lambda }:

argmaxΘ(registropag({incógnitai,yi}i=1l|θ)+λregistropag({incógnitai}i=l+1l+|θ)){\displaystyle {\underset {\Theta }{\operatorname {argmax} }}\left(\log p(\{x_{i},y_{i}\}_{i=1}^{l}|\theta )+\lambda \log p(\{x_{i}\}_{i=l+1}^{l+u}|\theta )\right)}[ 9 ]

Separación de baja densidad

Otra clase importante de métodos intenta colocar límites en regiones con pocos puntos de datos (etiquetados o sin etiquetar). Uno de los algoritmos más utilizados es la máquina de vectores de soporte transductiva , o TSVM (que, a pesar de su nombre, también puede utilizarse para el aprendizaje inductivo). Mientras que las máquinas de vectores de soporte para el aprendizaje supervisado buscan un límite de decisión con margen máximo sobre los datos etiquetados, el objetivo de la TSVM es etiquetar los datos sin etiquetar de tal manera que el límite de decisión tenga margen máximo sobre todos los datos. Además de la pérdida de bisagra estándar(1yF(incógnita))+{\displaystyle (1-yf(x))_{+}}para datos etiquetados, una función de pérdida(1|F(incógnita)|)+{\displaystyle (1-|f(x)|)_{+}}se introduce sobre los datos no etiquetados dejandoy=firmarF(incógnita){\displaystyle y=\operatorname {sign} {f(x)}}TSVM luego seleccionaF(incógnita)=h(incógnita)+b{\displaystyle f^{*}(x)=h^{*}(x)+b}desde un espacio de Hilbert de núcleo reproductorH{\displaystyle {\mathcal {H}}}minimizando el riesgo empírico regularizado :

F=argininaF(i=1l(1yiF(incógnitai))++λ1hH2+λ2i=l+1l+(1|F(incógnitai)|)+){\displaystyle f^{*}={\underset {f}{\operatorname {argmin} }}\left(\displaystyle \sum _{i=1}^{l}(1-y_{i}f(x_{i}))_{+}+\lambda _{1}\|h\|_{\mathcal {H}}^{2}+\lambda _{2}\sum _{i=l+1}^{l+u}(1-|f(x_{i})|)_{+}\right)}

Una solución exacta es intratable debido al término no convexo .(1|F(incógnita)|)+{\displaystyle (1-|f(x)|)_{+}}, por lo que la investigación se centra en aproximaciones útiles. [ 9 ]

Otros enfoques que implementan la separación de baja densidad incluyen modelos de procesos gaussianos, regularización de la información y minimización de la entropía (de los cuales TSVM es un caso especial).

Regularización laplaciana

La regularización laplaciana se ha abordado históricamente a través del laplaciano de grafos. Los métodos basados ​​en grafos para el aprendizaje semisupervisado utilizan una representación gráfica de los datos, con un nodo para cada ejemplo etiquetado y no etiquetado. El grafo puede construirse utilizando el conocimiento del dominio o la similitud de los ejemplos; dos métodos comunes son conectar cada punto de datos con suk{\displaystyle k}vecinos más cercanos o ejemplos a cierta distanciaϵ{\displaystyle \epsilon }El pesoWij{\displaystyle W_{ij}}de un borde entreincógnitai{\displaystyle x_{i}}yincógnitaj{\displaystyle x_{j}}entonces se establece enmiincógnitaiincógnitaj2/ϵ2{\displaystyle e^{-\|x_{i}-x_{j}\|^{2}/\epsilon ^{2}}}.

Dentro del marco de la regularización de variedades , [ 10 ] [ 11 ] el grafo sirve como una aproximación de la variedad. Se agrega un término al problema estándar de regularización de Tikhonov para imponer suavidad a la solución con respecto a la variedad (en el espacio intrínseco del problema), así como con respecto al espacio de entrada ambiental. El problema de minimización se convierte en

argininaFH(1li=1lV(F(incógnitai),yi)+λAFH2+λIMETROMETROF(incógnita)2dpag(incógnita)){\displaystyle {\underset {f\in {\mathcal {H}}}{\operatorname {argmin} }}\left({\frac {1}{l}}\displaystyle \sum _{i=1}^{l}V(f(x_{i}),y_{i})+\lambda _{A}\|f\|_{\mathcal {H}}^{2}+\lambda _{I}\int _{\mathcal {M}}\|\nabla _{\mathcal {M}}f(x)\|^{2}dp(x)\right)}[ 9 ]

dóndeH{\displaystyle {\mathcal {H}}}es un espacio de Hilbert con núcleo reproductor yMETRO{\displaystyle {\mathcal {M}}}es la variedad en la que se encuentran los datos. Los parámetros de regularizaciónλA{\displaystyle \lambda _{A}}yλI{\displaystyle \lambda _{I}}Controlar la suavidad en los espacios ambiente e intrínseco respectivamente. El gráfico se utiliza para aproximar el término de regularización intrínseca. Definición del laplaciano del gráficoL=DW{\displaystyle L=DW}dóndeDii=j=1l+Wij{\displaystyle D_{ii}=\sum _{j=1}^{l+u}W_{ij}}yF{\displaystyle \mathbf {f} }es el vector[F(incógnita1)F(incógnital+)]{\displaystyle [f(x_{1})\dots f(x_{l+u})]}, tenemos

FTLF=i,j=1l+Wij(FiFj)2METROMETROF(incógnita)2dpag(incógnita){\displaystyle \mathbf {f} ^{T}L\mathbf {f} =\displaystyle \sum _{i,j=1}^{l+u}W_{ij}(f_{i}-f_{j})^{2}\approx \int _{\mathcal {M}}\|\nabla _{\mathcal {M}}f(x)\|^{2}dp(x)}.

El enfoque basado en grafos para la regularización laplaciana consiste en relacionarlo con el método de diferencias finitas .

El laplaciano también se puede utilizar para extender los algoritmos de aprendizaje supervisado: mínimos cuadrados regularizados y máquinas de vectores de soporte (SVM) a versiones semisupervisadas: mínimos cuadrados regularizados laplacianos y SVM laplaciano.

Enfoques heurísticos

Algunos métodos de aprendizaje semisupervisado no están intrínsecamente orientados a aprender tanto de datos etiquetados como no etiquetados, sino que utilizan datos no etiquetados dentro de un marco de aprendizaje supervisado. Por ejemplo, los ejemplos etiquetados y no etiquetados.incógnita1,,incógnital+{\displaystyle x_{1},\dots ,x_{l+u}}puede informar la elección de una representación, métrica de distancia o núcleo para los datos en un primer paso no supervisado. Luego, el aprendizaje supervisado procede solo a partir de los ejemplos etiquetados. En este sentido, algunos métodos aprenden una representación de baja dimensión utilizando los datos supervisados ​​y luego aplican métodos de separación de baja densidad o basados ​​en grafos a la representación aprendida. [ 12 ] [ 13 ] Refinar iterativamente la representación y luego realizar un aprendizaje semisupervisado sobre dicha representación puede mejorar aún más el rendimiento.

El autoaprendizaje es un método de envoltura para el aprendizaje semisupervisado. [ 14 ] Primero, se entrena un algoritmo de aprendizaje supervisado basado únicamente en los datos etiquetados. Este clasificador se aplica luego a los datos no etiquetados para generar más ejemplos etiquetados como entrada para el algoritmo de aprendizaje supervisado. Generalmente, solo se agregan en cada paso las etiquetas en las que el clasificador tiene mayor confianza. [ 15 ] En el procesamiento del lenguaje natural, un algoritmo de autoaprendizaje común es el algoritmo de Yarowsky para problemas como la desambiguación del sentido de las palabras, la restauración del acento y la corrección ortográfica. [ 16 ]

El co-entrenamiento es una extensión del auto-entrenamiento en la que múltiples clasificadores se entrenan en conjuntos de características diferentes (idealmente disjuntos) y generan ejemplos etiquetados unos para otros. [ 17 ]

En la cognición humana

Las respuestas humanas a problemas de aprendizaje semisupervisado formal han dado lugar a conclusiones diversas sobre el grado de influencia de los datos no etiquetados. [ 18 ] Los problemas de aprendizaje más naturales también pueden considerarse ejemplos de aprendizaje semisupervisado. Gran parte del aprendizaje de conceptos humanos implica una pequeña cantidad de instrucción directa (por ejemplo, el etiquetado de objetos por parte de los padres durante la infancia) combinada con grandes cantidades de experiencia no etiquetada (por ejemplo, la observación de objetos sin nombrarlos ni contarlos, o al menos sin retroalimentación).

Los bebés humanos son sensibles a la estructura de categorías naturales sin etiquetar, como imágenes de perros y gatos o rostros masculinos y femeninos. [ 19 ] Los bebés y los niños toman en cuenta no solo los ejemplos sin etiquetar, sino también el proceso de muestreo a partir del cual surgen los ejemplos etiquetados. [ 20 ] [ 21 ]

Supervisión débil en el mantenimiento predictivo

La supervisión débil es un enfoque emergente de aprendizaje automático en el mantenimiento predictivo que aborda el desafío de los datos etiquetados limitados o imprecisos. Los modelos tradicionales de mantenimiento predictivo suelen depender de grandes volúmenes de datos operativos y de fallas etiquetados con precisión, cuya obtención puede resultar costosa o poco práctica. La supervisión débil mitiga este problema aprovechando fuentes de supervisión imperfectas —como etiquetas con ruido, heurísticas, reglas de expertos en el dominio o conjuntos de datos parcialmente etiquetados— para entrenar modelos predictivos. Al incorporar técnicas como la programación de datos, el modelado de etiquetas y el aprendizaje semisupervisado, la supervisión débil permite el desarrollo de sistemas robustos de mantenimiento predictivo capaces de identificar fallas o anomalías en los equipos con una menor dependencia de datos etiquetados de alta calidad. Este enfoque es particularmente valioso en entornos industriales donde las fallas de las máquinas son poco frecuentes y los datos de fallas etiquetados son escasos. [ 22 ]

Véase también

Referencias

  1. Revisión de la literatura sobre aprendizaje semisupervisado, página 5 , 2007, CiteSeerX 10.1.1.99.9681 
  2. ^ Chapelle , Schölkopf y Zien 2006 .
  3. Chawla, N., Bowyer, K., Hall, LO, & Kegelmeyer, WP (2002). SMOTE: Técnica de sobremuestreo sintético de la clase minoritaria. ArXiv, abs/1106.1813.
  4. Stevens, Kenneth N. (1998). Fonética acústica . Cambridge, Mass.: MIT Press. ISBN 0-585-08720-2OCLC 42856189 
  5. Scudder, H. (julio de 1965). "Probabilidad de error de algunas máquinas adaptativas de reconocimiento de patrones". IEEE Transactions on Information Theory . 11 (3): 363– 371. doi : 10.1109/TIT.1965.1053799 . ISSN 1557-9654 . 
  6. Vapnik, V.; Chervonenkis, A. (1974). Teoría del reconocimiento de patrones (en ruso). Moscú: Nauka.citado en Chapelle, Schölkopf & Zien 2006 , p. 3 
  7. 1 2 Ratsaby, J.; Venkatesh, S. "Aprendizaje a partir de una mezcla de ejemplos etiquetados y no etiquetados con información lateral paramétrica" ​​(PDF) .En Actas de la octava conferencia anual sobre teoría del aprendizaje computacional - COLT '95 . Nueva York, Nueva York, EE. UU.: ACM Press. 1995. págs. 412–417 . doi : 10.1145/225298.225348 . ISBN  0-89791-723-5. S2CID 17561403 . . Citado en Chapelle, Schölkopf & Zien 2006 , p. 4 
  8. Fabio, Cozman; Ira, Cohen (22 de septiembre de 2006), "Riesgos del aprendizaje semisupervisado: cómo los datos sin etiquetar pueden degradar el rendimiento de los clasificadores generativos", Aprendizaje semisupervisado , The MIT Press, págs. 56–72 , doi : 10.7551/mitpress/9780262033589.003.0004 , ISBN  978-0-262-03358-9En: Chapelle, Schölkopf y Zien 2006
  9. 1 2 3 Zhu, Xiaojin. Aprendizaje semisupervisado. Universidad de Wisconsin-Madison.
  10. M. Belkin; P. Niyogi (2004). "Aprendizaje semisupervisado en variedades riemannianas" . Machine Learning . 56 (Número especial sobre agrupamiento): 209–239 . doi : 10.1023/b:mach.0000033120.25363.1e .
  11. M. Belkin, P. Niyogi, V. Sindhwani. Sobre la regularización de variedades. AISTATS 2005.
  12. Iscen, Ahmet; Tolias, Giorgos; Avrithis, Yannis; Chum, Ondrej (2019). "Propagación de etiquetas para aprendizaje profundo semisupervisado". Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 5065–5074 . arXiv : 1904.04717 . doi : 10.1109/CVPR.2019.00521 . ISBN  978-1-7281-3293-8. S2CID 104291869 . 
  13. Burkhart, Michael C.; Shan, Kyle (2020). "Separación profunda de baja densidad para clasificación semisupervisada". Conferencia Internacional sobre Ciencias Computacionales (ICCS) . Notas de clase en Ciencias de la Computación. Vol. 12139. págs. 297–311 . arXiv : 2205.11995 . doi : 10.1007/978-3-030-50420-5_22 . ISBN   978-3-030-50419-9.
  14. Triguero, Isaac; García, Salvador; Herrera, Francisco (26-11-2013). "Técnicas autoetiquetadas para el aprendizaje semisupervisado: taxonomía, software y estudio empírico". Knowledge and Information Systems . 42 (2): 245– 284. doi : 10.1007/s10115-013-0706-y . ISSN 0219-1377 . S2CID 1955810 .  
  15. Fazakis, Nikos; Karlos, Stamatis; Kotsiantis, Sotiris; Sgarbas, Kyriakos (29 de diciembre de 2015). "LMT autodidacta para aprendizaje semisupervisado" . Inteligencia Computacional y Neurociencia . 2016 3057481.doi : 10.1155 / 2016/3057481 . PMC 4709606 . PMID 26839531 .  
  16. Yarowsky, David (1995). "Desambiguación del sentido de las palabras sin supervisión que rivaliza con los métodos supervisados" . Actas de la 33.ª Reunión Anual de la Asociación de Lingüística Computacional . Cambridge, MA: Asociación de Lingüística Computacional: 189–196 . doi : 10.3115/981658.981684 . Consultado el 1 de noviembre de 2022 .
  17. Didaci, Luca; Fumera, Giorgio; Roli, Fabio (2012-11-07). Gimel'farb, Georgy; Hancock, Edwin; Imiya, Atsushi; Kuijper, Arjan; Kudo, Mineichi; Omachi, Shinichiro; Windeatt, Terry; Yamada, Keiji (eds.). Análisis del algoritmo de co-entrenamiento con conjuntos de entrenamiento muy pequeños . Lecture Notes in Computer Science. Springer Berlin Heidelberg. pp. 719–726 . doi : 10.1007/978-3-642-34166-3_79 . ISBN  978-3-642-34165-6. S2CID 46063225 . 
  18. Zhu, Xiaojin (2009). Introducción al aprendizaje semisupervisado . Goldberg, AB (Andrew B.). [San Rafael, California]: Morgan & Claypool Publishers. ISBN 978-1-59829-548-1OCLC 428541480 
  19. Younger BA; Fearing DD (1999). "Dividiendo elementos en categorías separadas: cambio evolutivo en la categorización infantil" . Child Development . 70 (2): 291– 303. doi : 10.1111/1467-8624.00022 .
  20. Xu, F. y Tenenbaum, JB (2007). "Sensibilidad al muestreo en el aprendizaje bayesiano de palabras". Developmental Science . 10 (3): 288– 297. CiteSeerX 10.1.1.141.7505 . doi : 10.1111/j.1467-7687.2007.00590.x . PMID 17444970 .  
  21. Gweon, H., Tenenbaum JB y Schulz LE (2010). "Los bebés consideran tanto la muestra como el proceso de muestreo en la generalización inductiva" . Proc Natl Acad Sci USA . 107 (20): 9066–71 . Bibcode : 2010PNAS..107.9066G . doi : 10.1073/pnas.1003095107 . PMC 2889113. PMID 20435914 .  {{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  22. Martínez-Heredia, Antonio M.; Ventura, Sebastián (2025). "Supervisión débil: una revisión sobre mantenimiento predictivo" . WIREs Data Mining and Knowledge Discovery . 15 (2) e70022. doi : 10.1002/widm.70022 . ISSN 1942-4787 . 

Fuentes

  • Chapelle, Olivier; Schölkopf, Bernhard; Zien, Alejandro (2006). Aprendizaje semisupervisado . Cambridge, Massachusetts: MIT Press. ISBN 978-0-262-03358-9.
  • Regularización de variedades: Una implementación en MATLAB de libre acceso de los algoritmos semisupervisados ​​basados ​​en grafos, máquinas de vectores de soporte laplacianas y mínimos cuadrados regularizados laplacianos.
  • KEEL: Una herramienta de software para evaluar algoritmos evolutivos para problemas de minería de datos (regresión, clasificación, agrupamiento, minería de patrones, etc.). Módulo KEEL para aprendizaje semisupervisado.
  • Software de aprendizaje semisupervisado
  • Aprendizaje semisupervisado — documentación de scikit-learn Aprendizaje semisupervisado en scikit-learn .