La supervisión débil (también conocida como aprendizaje semisupervisado ) es un paradigma del aprendizaje automático cuya relevancia y notoriedad aumentaron con la aparición de los grandes modelos de lenguaje debido a la gran cantidad de datos necesarios para entrenarlos. Se caracteriza por utilizar una combinación de una pequeña cantidad de datos etiquetados por humanos (utilizados exclusivamente en el paradigma de aprendizaje supervisado, más costoso y que requiere más tiempo ), seguida de una gran cantidad de datos sin etiquetar (utilizados exclusivamente en el paradigma de aprendizaje no supervisado ). En otras palabras, los valores de salida deseados se proporcionan solo para un subconjunto de los datos de entrenamiento. Los datos restantes no están etiquetados o están etiquetados de forma imprecisa. Intuitivamente, puede verse como un examen y los datos etiquetados como problemas de ejemplo que el profesor resuelve para la clase como ayuda para resolver otro conjunto de problemas. En el contexto transductivo , estos problemas sin resolver actúan como preguntas de examen. En el contexto inductivo , se convierten en problemas de práctica del tipo que conformarán el examen.
Problema

La adquisición de datos etiquetados para un problema de aprendizaje suele requerir un agente humano cualificado (por ejemplo, para transcribir un segmento de audio) o un experimento físico (por ejemplo, para determinar la estructura tridimensional de una proteína o la presencia de petróleo en una ubicación específica). El coste asociado al proceso de etiquetado puede, por tanto, hacer inviables los conjuntos de entrenamiento grandes y completamente etiquetados, mientras que la adquisición de datos sin etiquetar es relativamente económica. En tales situaciones, el aprendizaje semisupervisado puede resultar de gran utilidad práctica. El aprendizaje semisupervisado también tiene interés teórico en el aprendizaje automático y como modelo para el aprendizaje humano.
Técnica

De manera más formal, el aprendizaje semisupervisado asume un conjunto deejemplos distribuidos de forma idéntica e independientecon etiquetas correspondientesyejemplos sin etiquetarse procesan. El aprendizaje semisupervisado combina esta información para superar el rendimiento de clasificación que se puede obtener descartando los datos sin etiquetar y realizando un aprendizaje supervisado o descartando las etiquetas y realizando un aprendizaje no supervisado.
El aprendizaje semisupervisado puede referirse tanto al aprendizaje transductivo como al aprendizaje inductivo . [ 1 ] El objetivo del aprendizaje transductivo es inferir las etiquetas correctas para los datos no etiquetados proporcionados.solamente. El objetivo del aprendizaje inductivo es inferir el mapeo correcto a partir dea.
Resulta innecesario (y, según el principio de Vapnik , imprudente) realizar un aprendizaje transductivo mediante la inferencia de una regla de clasificación sobre todo el espacio de entrada; sin embargo, en la práctica, los algoritmos diseñados formalmente para la transducción o la inducción se utilizan a menudo indistintamente.
Supuestos
Para poder utilizar datos sin etiquetar, debe existir alguna relación con la distribución subyacente de los datos. Los algoritmos de aprendizaje semisupervisado utilizan al menos una de las siguientes suposiciones: [ 2 ]
Suposición de continuidad/suavidad
Los puntos que están cerca unos de otros tienen más probabilidades de compartir una etiqueta. Esto también se asume generalmente en el aprendizaje supervisado y produce una preferencia por límites de decisión geométricamente simples . En el caso del aprendizaje semisupervisado, la suposición de suavidad produce además una preferencia por límites de decisión en regiones de baja densidad, de modo que pocos puntos están cerca unos de otros pero pertenecen a clases diferentes. [ 3 ]
Suposición de clúster
Los datos tienden a formar grupos discretos, y es más probable que los puntos de un mismo grupo compartan una etiqueta (aunque los datos que comparten una etiqueta pueden estar distribuidos en varios grupos). Este es un caso especial del supuesto de suavidad y da lugar al aprendizaje de características mediante algoritmos de agrupamiento.
Suposición múltiple
Los datos se ubican aproximadamente en una variedad de dimensión mucho menor que el espacio de entrada. En este caso, aprender la variedad utilizando tanto los datos etiquetados como los no etiquetados permite evitar la maldición de la dimensionalidad . Posteriormente, el aprendizaje puede continuar utilizando distancias y densidades definidas en la variedad.
La suposición de variedad resulta práctica cuando se generan datos de alta dimensión mediante algún proceso que puede ser difícil de modelar directamente, pero que posee pocos grados de libertad. Por ejemplo, la voz humana está controlada por unas pocas cuerdas vocales [ 4 ] , y las imágenes de diversas expresiones faciales están controladas por unos pocos músculos. En estos casos, es preferible considerar las distancias y la suavidad en el espacio natural del problema generador, en lugar de en el espacio de todas las posibles ondas acústicas o imágenes, respectivamente.
Historia
El enfoque heurístico del autoentrenamiento (también conocido como autoaprendizaje o autoetiquetado ) es históricamente el enfoque más antiguo para el aprendizaje semisupervisado, [ 2 ] con ejemplos de aplicaciones que comienzan en la década de 1960. [ 5 ]
El marco de aprendizaje transductivo fue introducido formalmente por Vladimir Vapnik en la década de 1970. [ 6 ] El interés en el aprendizaje inductivo mediante modelos generativos también comenzó en la década de 1970. Ratsaby y Venkatesh demostraron en 1995 una cota de aprendizaje probablemente aproximada para el aprendizaje semisupervisado de una mezcla gaussiana . [ 7 ]
Métodos
Modelos generativos
Los enfoques generativos para el aprendizaje estadístico buscan primero estimar, la distribución de los puntos de datos pertenecientes a cada clase. La probabilidadque un punto determinadotiene etiquetaes entonces proporcional apor la regla de Bayes . El aprendizaje semisupervisado con modelos generativos puede verse como una extensión del aprendizaje supervisado (clasificación más información sobre) o como una extensión del aprendizaje no supervisado (agrupamiento más algunas etiquetas).
Los modelos generativos suponen que las distribuciones adoptan alguna forma particular.parametrizado por el vectorSi estas suposiciones son incorrectas, los datos sin etiquetar podrían disminuir la precisión de la solución en comparación con la que se habría obtenido solo con datos etiquetados. [ 8 ] Sin embargo, si las suposiciones son correctas, los datos sin etiquetar necesariamente mejoran el rendimiento. [ 7 ]
Los datos sin etiquetar se distribuyen según una mezcla de distribuciones de clases individuales. Para aprender la distribución de la mezcla a partir de los datos sin etiquetar, esta debe ser identificable; es decir, diferentes parámetros deben generar diferentes distribuciones sumadas. Las distribuciones de mezcla gaussiana son identificables y se utilizan comúnmente en modelos generativos.
La distribución conjunta parametrizada se puede escribir comomediante el uso de la regla de la cadena . Cada vector de parámetrosestá asociado con una función de decisiónEl parámetro se elige entonces en función del ajuste a los datos etiquetados y no etiquetados, ponderado por:
Separación de baja densidad
Otra clase importante de métodos intenta colocar límites en regiones con pocos puntos de datos (etiquetados o sin etiquetar). Uno de los algoritmos más utilizados es la máquina de vectores de soporte transductiva , o TSVM (que, a pesar de su nombre, también puede utilizarse para el aprendizaje inductivo). Mientras que las máquinas de vectores de soporte para el aprendizaje supervisado buscan un límite de decisión con margen máximo sobre los datos etiquetados, el objetivo de la TSVM es etiquetar los datos sin etiquetar de tal manera que el límite de decisión tenga margen máximo sobre todos los datos. Además de la pérdida de bisagra estándarpara datos etiquetados, una función de pérdidase introduce sobre los datos no etiquetados dejandoTSVM luego seleccionadesde un espacio de Hilbert de núcleo reproductorminimizando el riesgo empírico regularizado :
Una solución exacta es intratable debido al término no convexo ., por lo que la investigación se centra en aproximaciones útiles. [ 9 ]
Otros enfoques que implementan la separación de baja densidad incluyen modelos de procesos gaussianos, regularización de la información y minimización de la entropía (de los cuales TSVM es un caso especial).
Regularización laplaciana
La regularización laplaciana se ha abordado históricamente a través del laplaciano de grafos. Los métodos basados en grafos para el aprendizaje semisupervisado utilizan una representación gráfica de los datos, con un nodo para cada ejemplo etiquetado y no etiquetado. El grafo puede construirse utilizando el conocimiento del dominio o la similitud de los ejemplos; dos métodos comunes son conectar cada punto de datos con suvecinos más cercanos o ejemplos a cierta distanciaEl pesode un borde entreyentonces se establece en.
Dentro del marco de la regularización de variedades , [ 10 ] [ 11 ] el grafo sirve como una aproximación de la variedad. Se agrega un término al problema estándar de regularización de Tikhonov para imponer suavidad a la solución con respecto a la variedad (en el espacio intrínseco del problema), así como con respecto al espacio de entrada ambiental. El problema de minimización se convierte en
dóndees un espacio de Hilbert con núcleo reproductor yes la variedad en la que se encuentran los datos. Los parámetros de regularizaciónyControlar la suavidad en los espacios ambiente e intrínseco respectivamente. El gráfico se utiliza para aproximar el término de regularización intrínseca. Definición del laplaciano del gráficodóndeyes el vector, tenemos
- .
El enfoque basado en grafos para la regularización laplaciana consiste en relacionarlo con el método de diferencias finitas .
El laplaciano también se puede utilizar para extender los algoritmos de aprendizaje supervisado: mínimos cuadrados regularizados y máquinas de vectores de soporte (SVM) a versiones semisupervisadas: mínimos cuadrados regularizados laplacianos y SVM laplaciano.
Enfoques heurísticos
Algunos métodos de aprendizaje semisupervisado no están intrínsecamente orientados a aprender tanto de datos etiquetados como no etiquetados, sino que utilizan datos no etiquetados dentro de un marco de aprendizaje supervisado. Por ejemplo, los ejemplos etiquetados y no etiquetados.puede informar la elección de una representación, métrica de distancia o núcleo para los datos en un primer paso no supervisado. Luego, el aprendizaje supervisado procede solo a partir de los ejemplos etiquetados. En este sentido, algunos métodos aprenden una representación de baja dimensión utilizando los datos supervisados y luego aplican métodos de separación de baja densidad o basados en grafos a la representación aprendida. [ 12 ] [ 13 ] Refinar iterativamente la representación y luego realizar un aprendizaje semisupervisado sobre dicha representación puede mejorar aún más el rendimiento.
El autoaprendizaje es un método de envoltura para el aprendizaje semisupervisado. [ 14 ] Primero, se entrena un algoritmo de aprendizaje supervisado basado únicamente en los datos etiquetados. Este clasificador se aplica luego a los datos no etiquetados para generar más ejemplos etiquetados como entrada para el algoritmo de aprendizaje supervisado. Generalmente, solo se agregan en cada paso las etiquetas en las que el clasificador tiene mayor confianza. [ 15 ] En el procesamiento del lenguaje natural, un algoritmo de autoaprendizaje común es el algoritmo de Yarowsky para problemas como la desambiguación del sentido de las palabras, la restauración del acento y la corrección ortográfica. [ 16 ]
El co-entrenamiento es una extensión del auto-entrenamiento en la que múltiples clasificadores se entrenan en conjuntos de características diferentes (idealmente disjuntos) y generan ejemplos etiquetados unos para otros. [ 17 ]
En la cognición humana
Las respuestas humanas a problemas de aprendizaje semisupervisado formal han dado lugar a conclusiones diversas sobre el grado de influencia de los datos no etiquetados. [ 18 ] Los problemas de aprendizaje más naturales también pueden considerarse ejemplos de aprendizaje semisupervisado. Gran parte del aprendizaje de conceptos humanos implica una pequeña cantidad de instrucción directa (por ejemplo, el etiquetado de objetos por parte de los padres durante la infancia) combinada con grandes cantidades de experiencia no etiquetada (por ejemplo, la observación de objetos sin nombrarlos ni contarlos, o al menos sin retroalimentación).
Los bebés humanos son sensibles a la estructura de categorías naturales sin etiquetar, como imágenes de perros y gatos o rostros masculinos y femeninos. [ 19 ] Los bebés y los niños toman en cuenta no solo los ejemplos sin etiquetar, sino también el proceso de muestreo a partir del cual surgen los ejemplos etiquetados. [ 20 ] [ 21 ]
Supervisión débil en el mantenimiento predictivo
La supervisión débil es un enfoque emergente de aprendizaje automático en el mantenimiento predictivo que aborda el desafío de los datos etiquetados limitados o imprecisos. Los modelos tradicionales de mantenimiento predictivo suelen depender de grandes volúmenes de datos operativos y de fallas etiquetados con precisión, cuya obtención puede resultar costosa o poco práctica. La supervisión débil mitiga este problema aprovechando fuentes de supervisión imperfectas —como etiquetas con ruido, heurísticas, reglas de expertos en el dominio o conjuntos de datos parcialmente etiquetados— para entrenar modelos predictivos. Al incorporar técnicas como la programación de datos, el modelado de etiquetas y el aprendizaje semisupervisado, la supervisión débil permite el desarrollo de sistemas robustos de mantenimiento predictivo capaces de identificar fallas o anomalías en los equipos con una menor dependencia de datos etiquetados de alta calidad. Este enfoque es particularmente valioso en entornos industriales donde las fallas de las máquinas son poco frecuentes y los datos de fallas etiquetados son escasos. [ 22 ]
Véase también
Referencias
- ↑ Revisión de la literatura sobre aprendizaje semisupervisado, página 5 , 2007, CiteSeerX 10.1.1.99.9681
- ^ Chapelle , Schölkopf y Zien 2006 .
- ↑ Chawla, N., Bowyer, K., Hall, LO, & Kegelmeyer, WP (2002). SMOTE: Técnica de sobremuestreo sintético de la clase minoritaria. ArXiv, abs/1106.1813.
- ↑ Stevens, Kenneth N. (1998). Fonética acústica . Cambridge, Mass.: MIT Press. ISBN 0-585-08720-2OCLC 42856189
- ↑ Scudder, H. (julio de 1965). "Probabilidad de error de algunas máquinas adaptativas de reconocimiento de patrones". IEEE Transactions on Information Theory . 11 (3): 363– 371. doi : 10.1109/TIT.1965.1053799 . ISSN 1557-9654 .
- ↑ Vapnik, V.; Chervonenkis, A. (1974). Teoría del reconocimiento de patrones (en ruso). Moscú: Nauka.citado en Chapelle, Schölkopf & Zien 2006 , p. 3
- 1 2 Ratsaby, J.; Venkatesh, S. "Aprendizaje a partir de una mezcla de ejemplos etiquetados y no etiquetados con información lateral paramétrica" (PDF) .En Actas de la octava conferencia anual sobre teoría del aprendizaje computacional - COLT '95 . Nueva York, Nueva York, EE. UU.: ACM Press. 1995. págs. 412–417 . doi : 10.1145/225298.225348 . ISBN 0-89791-723-5. S2CID 17561403 . . Citado en Chapelle, Schölkopf & Zien 2006 , p. 4
- ↑ Fabio, Cozman; Ira, Cohen (22 de septiembre de 2006), "Riesgos del aprendizaje semisupervisado: cómo los datos sin etiquetar pueden degradar el rendimiento de los clasificadores generativos", Aprendizaje semisupervisado , The MIT Press, págs. 56–72 , doi : 10.7551/mitpress/9780262033589.003.0004 , ISBN 978-0-262-03358-9En: Chapelle, Schölkopf y Zien 2006
- 1 2 3 Zhu, Xiaojin. Aprendizaje semisupervisado. Universidad de Wisconsin-Madison.
- ↑ M. Belkin; P. Niyogi (2004). "Aprendizaje semisupervisado en variedades riemannianas" . Machine Learning . 56 (Número especial sobre agrupamiento): 209–239 . doi : 10.1023/b:mach.0000033120.25363.1e .
- ↑ M. Belkin, P. Niyogi, V. Sindhwani. Sobre la regularización de variedades. AISTATS 2005.
- ↑ Iscen, Ahmet; Tolias, Giorgos; Avrithis, Yannis; Chum, Ondrej (2019). "Propagación de etiquetas para aprendizaje profundo semisupervisado". Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 5065–5074 . arXiv : 1904.04717 . doi : 10.1109/CVPR.2019.00521 . ISBN 978-1-7281-3293-8. S2CID 104291869 .
- ↑ Burkhart, Michael C.; Shan, Kyle (2020). "Separación profunda de baja densidad para clasificación semisupervisada". Conferencia Internacional sobre Ciencias Computacionales (ICCS) . Notas de clase en Ciencias de la Computación. Vol. 12139. págs. 297–311 . arXiv : 2205.11995 . doi : 10.1007/978-3-030-50420-5_22 . ISBN 978-3-030-50419-9.
- ↑ Triguero, Isaac; García, Salvador; Herrera, Francisco (26-11-2013). "Técnicas autoetiquetadas para el aprendizaje semisupervisado: taxonomía, software y estudio empírico". Knowledge and Information Systems . 42 (2): 245– 284. doi : 10.1007/s10115-013-0706-y . ISSN 0219-1377 . S2CID 1955810 .
- ↑ Fazakis, Nikos; Karlos, Stamatis; Kotsiantis, Sotiris; Sgarbas, Kyriakos (29 de diciembre de 2015). "LMT autodidacta para aprendizaje semisupervisado" . Inteligencia Computacional y Neurociencia . 2016 3057481.doi : 10.1155 / 2016/3057481 . PMC 4709606 . PMID 26839531 .
- ↑ Yarowsky, David (1995). "Desambiguación del sentido de las palabras sin supervisión que rivaliza con los métodos supervisados" . Actas de la 33.ª Reunión Anual de la Asociación de Lingüística Computacional . Cambridge, MA: Asociación de Lingüística Computacional: 189–196 . doi : 10.3115/981658.981684 . Consultado el 1 de noviembre de 2022 .
- ↑ Didaci, Luca; Fumera, Giorgio; Roli, Fabio (2012-11-07). Gimel'farb, Georgy; Hancock, Edwin; Imiya, Atsushi; Kuijper, Arjan; Kudo, Mineichi; Omachi, Shinichiro; Windeatt, Terry; Yamada, Keiji (eds.). Análisis del algoritmo de co-entrenamiento con conjuntos de entrenamiento muy pequeños . Lecture Notes in Computer Science. Springer Berlin Heidelberg. pp. 719–726 . doi : 10.1007/978-3-642-34166-3_79 . ISBN 978-3-642-34165-6. S2CID 46063225 .
- ↑ Zhu, Xiaojin (2009). Introducción al aprendizaje semisupervisado . Goldberg, AB (Andrew B.). [San Rafael, California]: Morgan & Claypool Publishers. ISBN 978-1-59829-548-1OCLC 428541480
- ↑ Younger BA; Fearing DD (1999). "Dividiendo elementos en categorías separadas: cambio evolutivo en la categorización infantil" . Child Development . 70 (2): 291– 303. doi : 10.1111/1467-8624.00022 .
- ↑ Xu, F. y Tenenbaum, JB (2007). "Sensibilidad al muestreo en el aprendizaje bayesiano de palabras". Developmental Science . 10 (3): 288– 297. CiteSeerX 10.1.1.141.7505 . doi : 10.1111/j.1467-7687.2007.00590.x . PMID 17444970 .
- ↑ Gweon, H., Tenenbaum JB y Schulz LE (2010). "Los bebés consideran tanto la muestra como el proceso de muestreo en la generalización inductiva" . Proc Natl Acad Sci USA . 107 (20): 9066–71 . Bibcode : 2010PNAS..107.9066G . doi : 10.1073/pnas.1003095107 . PMC 2889113. PMID 20435914 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Martínez-Heredia, Antonio M.; Ventura, Sebastián (2025). "Supervisión débil: una revisión sobre mantenimiento predictivo" . WIREs Data Mining and Knowledge Discovery . 15 (2) e70022. doi : 10.1002/widm.70022 . ISSN 1942-4787 .
Fuentes
- Chapelle, Olivier; Schölkopf, Bernhard; Zien, Alejandro (2006). Aprendizaje semisupervisado . Cambridge, Massachusetts: MIT Press. ISBN 978-0-262-03358-9.
Enlaces externos
- Regularización de variedades: Una implementación en MATLAB de libre acceso de los algoritmos semisupervisados basados en grafos, máquinas de vectores de soporte laplacianas y mínimos cuadrados regularizados laplacianos.
- KEEL: Una herramienta de software para evaluar algoritmos evolutivos para problemas de minería de datos (regresión, clasificación, agrupamiento, minería de patrones, etc.). Módulo KEEL para aprendizaje semisupervisado.
- Software de aprendizaje semisupervisado
- Aprendizaje semisupervisado — documentación de scikit-learn Aprendizaje semisupervisado en scikit-learn .
- Aprendizaje automático