El aprendizaje autosupervisado ( SSL ) es un paradigma en el aprendizaje automático donde un modelo se entrena en una tarea utilizando los propios datos para generar señales de supervisión, en lugar de depender de etiquetas proporcionadas externamente. En el contexto de las redes neuronales , el aprendizaje autosupervisado busca aprovechar las estructuras o relaciones inherentes dentro de los datos de entrada para crear señales de entrenamiento significativas. Las tareas de SSL están diseñadas de manera que su resolución requiere capturar características o relaciones esenciales en los datos. Los datos de entrada se aumentan o transforman típicamente de manera que se crean pares de muestras relacionadas, donde una muestra sirve como entrada y la otra se utiliza para formular la señal de supervisión. Este aumento puede implicar la introducción de ruido, recorte, rotación u otras transformaciones. El aprendizaje autosupervisado imita más fielmente la forma en que los humanos aprenden a clasificar objetos. [ 1 ]
Durante el aprendizaje supervisado (SSL), el modelo aprende en dos pasos. Primero, la tarea se resuelve basándose en una tarea de clasificación auxiliar o de pretexto utilizando pseudoetiquetas, que ayudan a inicializar los parámetros del modelo . [ 2 ] [ 3 ] A continuación, la tarea propiamente dicha se realiza con aprendizaje supervisado o no supervisado . [ 4 ] [ 5 ] [ 6 ]
El aprendizaje autosupervisado ha producido resultados prometedores en los últimos años y ha encontrado aplicación práctica en campos como el procesamiento de audio , y está siendo utilizado por Facebook y otros para el reconocimiento de voz . [ 7 ]
Pseudoetiquetas
Las pseudoetiquetas son etiquetas generadas automáticamente que un modelo asigna a datos sin etiquetar basándose en sus propias predicciones. Se utilizan ampliamente en el aprendizaje auto-supervisado y semi-supervisado, donde las anotaciones de referencia son limitadas o inexistentes. Al tratar las etiquetas predichas como referencias sustitutas, los algoritmos de aprendizaje pueden utilizar grandes cantidades de datos sin etiquetar en el proceso de entrenamiento. [ 8 ]
El pseudoetiquetado también desempeña un papel importante en sistemas que deben adaptarse a la deriva conceptual , donde las propiedades estadísticas de los datos cambian con el tiempo. En estos escenarios, el modelo puede detectar que una instancia entrante se desvía del comportamiento aprendido previamente. El sistema genera entonces un resultado de clasificación para esa instancia, y esta clase predicha se utiliza como pseudoetiqueta para actualizar o reentrenar los componentes del modelo que se están volviendo obsoletos. Este enfoque permite la adaptación continua en entornos dinámicos sin necesidad de anotación manual. [ 9 ] [ 10 ]
En muchos sistemas de aprendizaje adaptativo , se eligen pseudoetiquetas cuando el clasificador produce predicciones suficientemente fiables, lo que reduce el riesgo de propagación de errores. Estas instancias pseudoetiquetadas se incorporan al entrenamiento para actualizar o perfeccionar la comprensión del modelo sobre los patrones de datos emergentes, especialmente cuando los componentes existentes muestran signos de obsolescencia debido a la deriva o a cambios en la distribución de los datos. Esta estrategia reduce la dependencia del etiquetado manual y, al mismo tiempo, contribuye a mantener el rendimiento del modelo a largo plazo.
Tipos
aprendizaje autosupervisado autoasociativo
El aprendizaje autosupervisado autoasociativo es una categoría específica de aprendizaje autosupervisado en la que una red neuronal se entrena para reproducir o reconstruir sus propios datos de entrada. [ 11 ] En otras palabras, el modelo tiene la tarea de aprender una representación de los datos que capture sus características o estructura esenciales, lo que le permite regenerar la entrada original.
El término "autoasociativo" proviene del hecho de que el modelo asocia esencialmente los datos de entrada consigo mismo. Esto se suele lograr mediante autoencoders , un tipo de arquitectura de red neuronal utilizada para el aprendizaje de representaciones. Los autoencoders constan de una red codificadora que asigna los datos de entrada a una representación de menor dimensión (espacio latente) y una red decodificadora que reconstruye la entrada a partir de esta representación.
El proceso de entrenamiento consiste en presentar al modelo datos de entrada y exigirle que reconstruya esos mismos datos con la mayor precisión posible. La función de pérdida utilizada durante el entrenamiento suele penalizar la diferencia entre la entrada original y la salida reconstruida (por ejemplo, el error cuadrático medio ). Al minimizar este error de reconstrucción, el autoencoder aprende una representación significativa de los datos en su espacio latente .
Aprendizaje autosupervisado contrastivo
Para una tarea de clasificación binaria , los datos de entrenamiento se pueden dividir en ejemplos positivos y negativos. Los ejemplos positivos son aquellos que coinciden con el objetivo. Por ejemplo, si se entrena un clasificador para identificar aves, los datos de entrenamiento positivos incluirían imágenes que contienen aves. Los ejemplos negativos serían imágenes que no las contienen. [ 12 ] El aprendizaje autosupervisado contrastivo utiliza tanto ejemplos positivos como negativos. La función de pérdida en el aprendizaje contrastivo se utiliza para minimizar la distancia entre pares de muestras positivas, mientras que maximiza la distancia entre pares de muestras negativas. [ 12 ]
Un ejemplo temprano utiliza un par de redes neuronales convolucionales unidimensionales para procesar un par de imágenes y maximizar su concordancia. [ 13 ]
El preentrenamiento contrastivo de lenguaje e imagen (CLIP) permite el preentrenamiento conjunto de un codificador de texto y un codificador de imagen, de manera que un par imagen-texto coincidente tenga un vector de codificación de imagen y un vector de codificación de texto que abarquen un ángulo pequeño (teniendo una gran similitud de coseno ).
InfoNCE (Estimación Contrastante de Ruido) [ 14 ] es un método para optimizar dos modelos conjuntamente, basado en la Estimación Contrastante de Ruido (NCE). [ 15 ] Dado un conjuntodemuestras aleatorias que contienen una muestra positiva deymuestras negativas de la distribución de la 'propuesta', minimiza la siguiente función de pérdida:
Aprendizaje autosupervisado no contrastivo
El aprendizaje autosupervisado no contrastivo (NCSSL) utiliza únicamente ejemplos positivos. Contrariamente a lo que se podría pensar, NCSSL converge en un mínimo local útil en lugar de alcanzar una solución trivial, con pérdida cero. En el ejemplo de la clasificación binaria, aprendería trivialmente a clasificar cada ejemplo como positivo. Un NCSSL eficaz requiere un predictor adicional en el lado en línea que no retropropaga en el lado objetivo. [ 12 ]
Arquitecturas predictivas y de incrustación conjunta
Una clase importante de aprendizaje autosupervisado va más allá de los pares contrastivos, maximizando en cambio la concordancia entre las perspectivas y evitando el colapso mediante restricciones estadísticas. Con raíces en el Análisis de Correlación Canónica Profunda (Deep CCA), [ 16 ] este enfoque incluye Arquitecturas de Incrustación Conjunta (JEA) como Barlow Twins [ 17 ] y VICReg, [ 18 ] que imponen restricciones de covarianza para aprender representaciones invariantes sin muestreo negativo. El Modelado de Rutas de Variables Latentes Profundas (DLVPM) [ 19 ] generaliza esto a sistemas multimodales, utilizando modelos de ruta para imponer correlación y ortogonalidad en diversos tipos de datos.
En 2022, Yann LeCun presentó las Arquitecturas Predictivas de Incrustación Conjunta (JEPA) como un paso hacia la toma de decisiones, el razonamiento y la inteligencia humana autónoma en las máquinas, incluyendo la auto-mejora a través del aprendizaje autónomo. Fundamentadas en el aprendizaje de representaciones, LeCun incluyó el concepto de un " modelo del mundo " en JEPA, cuyo objetivo es permitir que las máquinas repliquen el intelecto humano proporcionándoles un concepto del mundo en el que existen. [ 20 ]
A diferencia de los autoencoders, los JEPA operan completamente en el espacio latente, evitando el ruido a nivel de píxel para centrarse en la estructura semántica. En lugar de simplemente aprender la invariancia, los JEPA aprenden prediciendo representaciones latentes enmascaradas a partir del contexto visible. [ 21 ] JEPA se ha aplicado a dominios como el análisis de imágenes, [ 22 ] el procesamiento de audio, [ 23 ] y el movimiento en imágenes y vídeo. [ 24 ]
Comparación con otras formas de aprendizaje automático
El aprendizaje supervisado (SSL) pertenece a los métodos de aprendizaje supervisado, ya que su objetivo es generar una salida clasificada a partir de la entrada. Sin embargo, no requiere el uso explícito de pares de entrada-salida etiquetados. En cambio, las correlaciones, los metadatos incrustados en los datos o el conocimiento del dominio presente en la entrada se extraen de forma implícita y autónoma. Estas señales de supervisión, extraídas de los datos, pueden utilizarse posteriormente para el entrenamiento. [ 1 ]
El aprendizaje seguro (SSL) es similar al aprendizaje no supervisado en el sentido de que no requiere etiquetas en los datos de muestra. Sin embargo, a diferencia del aprendizaje no supervisado, el aprendizaje no se realiza utilizando estructuras de datos inherentes.
El aprendizaje semisupervisado combina el aprendizaje supervisado y el no supervisado, requiriendo que solo una pequeña parte de los datos de aprendizaje esté etiquetada . [ 3 ]
En el aprendizaje por transferencia , un modelo diseñado para una tarea se reutiliza en una tarea diferente. [ 25 ]
El entrenamiento de un autoencoder constituye intrínsecamente un proceso autosupervisado, ya que el patrón de salida debe convertirse en una reconstrucción óptima del propio patrón de entrada. Sin embargo, en la jerga actual, el término «autosupervisado» suele referirse a tareas basadas en un sistema de entrenamiento con tareas de pretexto. Esto implica el diseño (humano) de dichas tareas de pretexto, a diferencia del caso del entrenamiento de un autoencoder completamente autónomo. [ 11 ]
En el aprendizaje por refuerzo , el aprendizaje autosupervisado a partir de una combinación de pérdidas puede crear representaciones abstractas donde solo se conserva de forma comprimida la información más importante sobre el estado. [ 26 ]
Ejemplos
El aprendizaje autosupervisado es particularmente adecuado para el reconocimiento de voz. Por ejemplo, Facebook desarrolló wav2vec , un algoritmo autosupervisado, para realizar el reconocimiento de voz utilizando dos redes neuronales convolucionales profundas que se complementan entre sí. [ 7 ]
El modelo BERT ( Bidirectional Encoder Representations from Transformers ) de Google se utiliza para comprender mejor el contexto de las consultas de búsqueda. [ 27 ]
GPT-3 de OpenAI es un modelo de lenguaje autorregresivo que se puede utilizar en el procesamiento del lenguaje. Se puede utilizar para traducir textos o responder preguntas, entre otras cosas. [ 28 ]
Bootstrap Your Own Latent (BYOL) es un NCSSL que produjo excelentes resultados en ImageNet y en conjuntos de datos de transferencia y semisupervisados. [ 29 ]
El algoritmo de Yarowsky es un ejemplo de aprendizaje autosupervisado en el procesamiento del lenguaje natural . A partir de un pequeño número de ejemplos etiquetados, aprende a predecir qué sentido de una palabra polisémica se está utilizando en un punto determinado del texto.
DirectPred es un NCSSL que establece directamente los pesos del predictor en lugar de aprenderlos mediante el descenso de gradiente típico . [ 12 ]
Self-GenomeNet es un ejemplo de aprendizaje autosupervisado en genómica. [ 30 ]
SelfAPR es un ejemplo de aprendizaje autosupervisado aplicado a la reparación automatizada de programas , donde un modelo neuronal se entrena con perturbaciones de una versión anterior del programa que se está reparando y utiliza diagnósticos de ejecución de pruebas para sintetizar parches. [ 31 ]
El aprendizaje autosupervisado sigue ganando protagonismo como un nuevo enfoque en diversos campos. Su capacidad para aprovechar eficazmente los datos sin etiquetar abre nuevas posibilidades para el avance del aprendizaje automático, especialmente en ámbitos de aplicación basados en datos.
Referencias
- 1 2 Bouchard, Louis (25 de noviembre de 2020). "¿Qué es el aprendizaje autosupervisado? | ¿Podrán las máquinas aprender alguna vez como los humanos?" . Medium . Consultado el 9 de junio de 2021 .
- ↑ Doersch, Carl; Zisserman, Andrew (octubre de 2017). "Aprendizaje visual autosupervisado multitarea" . Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2017. IEEE. págs. 2070–2079 . arXiv : 1708.07860 . doi : 10.1109/iccv.2017.226 . ISBN 978-1-5386-1032-9. S2CID 473729 .
- 1 2 Beyer, Lucas; Zhai, Xiaohua; Oliver, Avital; Kolesnikov, Alexander (octubre de 2019). "S4L: Aprendizaje semisupervisado autosupervisado" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 1476–1485 . arXiv : 1905.03670 . doi : 10.1109/iccv.2019.00156 . ISBN 978-1-7281-4803-8. S2CID 167209887 .
- ↑ Doersch, Carl; Gupta, Abhinav; Efros, Alexei A. (diciembre de 2015). "Aprendizaje de representación visual no supervisado mediante predicción de contexto" . Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2015. IEEE. págs. 1422–1430 . arXiv : 1505.05192 . doi : 10.1109/iccv.2015.167 . ISBN 978-1-4673-8391-2. S2CID 9062671 .
- ↑ Zheng, Xin; Wang, Yong; Wang, Guoyou; Liu, Jianguo (abril de 2018). "Segmentación rápida y robusta de imágenes de glóbulos blancos mediante aprendizaje autosupervisado" . Micron . 107 : 55–71 . doi : 10.1016/j.micron.2018.01.010 . ISSN 0968-4328 . PMID 29425969. S2CID 3796689 .
- ↑ Gidaris, Spyros; Bursuc, Andrei; Komodakis, Nikos; Perez, Patrick Perez; Cord, Matthieu (octubre de 2019). "Mejora del aprendizaje visual con pocos ejemplos mediante auto-supervisión" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 8058–8067 . arXiv : 1906.05186 . doi : 10.1109/iccv.2019.00815 . ISBN 978-1-7281-4803-8. S2CID 186206588 .
- 1 2 "Wav2vec: Reconocimiento de voz de última generación mediante auto-supervisión" . ai.facebook.com . Consultado el 9 de junio de 2021 .
- ↑ Lee, Dong-Hyun (2013). Pseudo-Label: El método de aprendizaje semisupervisado simple y eficiente para redes neuronales profundas . Taller ICML 2013 sobre desafíos en el aprendizaje de representaciones (WREPL).
- ↑ Gama, João (2014). "Una revisión sobre la adaptación a la deriva conceptual" . ACM Computing Surveys . 46 (4): 1– 37. doi : 10.1145/2523813 .
- ↑ Xu, K.; Li, Y.; Deng, R.; Chen, K.; Xu, J. (2019). Sistema de detección de malware Android autoevolutivo . Simposio europeo IEEE sobre seguridad y privacidad (EuroS&P). págs. 47–62 . doi : 10.1109/EuroSP.2019.00014 .
- 1 2 Kramer, Mark A. (1991). "Análisis de componentes principales no lineales mediante redes neuronales autoasociativas" (PDF) . AIChE Journal . 37 (2): 233– 243. Bibcode : 1991AIChE..37..233K . doi : 10.1002/aic.690370209 .
- 1 2 3 4 "Desmitificando una técnica clave de aprendizaje autosupervisado: Aprendizaje no contrastivo" . ai.facebook.com . Consultado el 5 de octubre de 2021 .
- ↑ Becker, Suzanna; Hinton, Geoffrey E. (enero de 1992). "Red neuronal autoorganizada que descubre superficies en estereogramas de puntos aleatorios" . Nature . 355 (6356): 161– 163. Bibcode : 1992Natur.355..161B . doi : 10.1038/355161a0 . ISSN 1476-4687 . PMID 1729650 .
- ↑ Oord, Aaron van den; Li, Yazhe; Vinyals, Oriol (22 de enero de 2019). "Representation Learning with Contrastive Predictive Coding". arXiv : 1807.03748 [ cs.LG ].
- ↑ Gutmann, Michael; Hyvärinen, Aapo (31 de marzo de 2010). "Estimación contrastiva de ruido: un nuevo principio de estimación para modelos estadísticos no normalizados" . Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística . JMLR Workshop and Conference Proceedings: 297–304 .
- ↑ Andrew, Galen; Arora, Raman; Bilmes, Jeff; Livescu, Karen (26 de mayo de 2013). "Análisis de correlación canónica profunda" . Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1247–1255 .
- ↑ Zbontar, Jure; Jing, Li; Misra, Ishan; LeCun, Yann; Deny, Stephane (1 de julio de 2021). "Barlow Twins: Aprendizaje autosupervisado mediante reducción de redundancia" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 12310–12320 .
- ↑ Bardes, Adrien; Ponce, Jean; LeCun, Yann (11 de mayo de 2021). "VICReg: Regularización de varianza-invarianza-covarianza para el aprendizaje autosupervisado". arXiv : 2105.04906v3 [ cs.CV ].
- ↑ Ing, Alex; Andrades, Alvaro; Cosenza, Marco Raffaele; Korbel, Jan O. (julio de 2025). "Integración de datos multimodales de cáncer mediante modelado de rutas de variables latentes profundas" . Nature Machine Intelligence . 7 (7): 1053– 1075. doi : 10.1038/s42256-025-01052-4 . ISSN 2522-5839 . PMC 12283373. PMID 40709098 .
- ↑ LeCun, Yann (27 de junio de 2022). "Un camino hacia la inteligencia artificial autónoma" . OpenReview .
- ↑ Assran, Mahmoud; Duval, Quentin; Misra, Ishan; Bojanowski, Piotr; Vincent, Pascal; Rabbat, Michael; LeCun, Yann; Ballas, Nicolas (13 de abril de 2023). "Aprendizaje autosupervisado a partir de imágenes con una arquitectura predictiva de incrustación conjunta". arXiv : 2301.08243 [ cs.CV ].
- ↑ Garrido, Quentin; Assran, Mahmoud; Ballas, Nicolas; Bardes, Adrien; Najman, Laurent; LeCun, Yann (2024). "Aprendizaje y aprovechamiento de modelos del mundo en el aprendizaje de representaciones visuales". arXiv : 2403.00504 [ cs.CV ].
- ^ Fei, Zhengcong; Fan, Mingyuan; Huang, Junshi (2023). "A-JEPA: la arquitectura predictiva de integración conjunta puede escuchar". arXiv : 2311.15830 [ cs.SD ].
- ↑ Bardes, Adrien; Ponce, Jean; LeCun, Yann (2023). "MC-JEPA: una arquitectura predictiva de incrustación conjunta para el aprendizaje autosupervisado de características de movimiento y contenido". arXiv : 2307.12698 [ cs.CV ].
- ↑ Littwin, Etai; Wolf, Lior (junio de 2016). "The Multiverse Loss for Robust Transfer Learning" . 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . IEEE. pp. 3957–3966 . arXiv : 1511.09033 . doi : 10.1109/cvpr.2016.429 . ISBN 978-1-4673-8851-1. S2CID 6517610 .
- ↑ Francois-Lavet, Vincent; Bengio, Yoshua; Precup, Doina; Pineau, Joelle (2019). "Aprendizaje por refuerzo combinado mediante representaciones abstractas". Actas de la Conferencia AAAI sobre Inteligencia Artificial . arXiv : 1809.04506 .
- ↑ "BERT de código abierto: Preentrenamiento de vanguardia para el procesamiento del lenguaje natural" . Blog de IA de Google . 2 de noviembre de 2018. Consultado el 9 de junio de 2021 .
- ↑ Wilcox, Ethan; Qian, Peng; Futrell, Richard; Kohita, Ryosuke; Levy, Roger; Ballesteros, Miguel (2020). "La supervisión estructural mejora el aprendizaje con pocos ejemplos y la generalización sintáctica en modelos de lenguaje neuronales" . Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . Stroudsburg, PA, EE. UU.: Asociación para la Lingüística Computacional. págs. 4640–4652 . arXiv : 2010.05725 . doi : 10.18653/v1/2020.emnlp-main.375 . S2CID 222291675 .
- ^ Parrilla, Jean-Bastien; Strub, Florián; Altché, Florent; Tallec, Corentin; Richemond, Pierre H.; Buchatskaya, Elena; Doersch, Carl; Pires, Bernardo Ávila; Guo, Zhaohan Daniel; Azar, Mohammad Gheshlaghi; Piot, Bilal (10 de septiembre de 2020). "Pon en marcha tu propio contenido latente: un nuevo enfoque para el aprendizaje autosupervisado". arXiv : 2006.07733 [ cs.LG ].
- ↑ Gündüz, Hüseyin Anil; Binder, Martin; To, Xiao-Yin; Mreches, René; Bischl, Bernd; McHardy, Alice C.; Münch, Philipp C.; Rezaei, Mina (11 de septiembre de 2023). "Un método de aprendizaje profundo auto-supervisado para el entrenamiento eficiente de datos en genómica" . Communications Biology . 6 (1): 928. doi : 10.1038/s42003-023-05310-2 . ISSN 2399-3642 . PMC 10495322. PMID 37696966 .
- ↑ Ye, He; Martinez, Matias; Luo, Xiapu; Zhang, Tao; Monperrus, Martin (2022). "SelfAPR: Reparación de programas autosupervisada con diagnóstico de ejecución de pruebas" . Actas de la 37.ª Conferencia Internacional IEEE/ACM sobre Ingeniería de Software Automatizada . págs. 1–13 . doi : 10.1145/3551349.3556926 . ISBN 978-1-4503-9475-8Consultado el 28 de mayo de 2026 .
Lecturas adicionales
- Balestriero, Randall; Ibrahim, Marcos; Sobal, Vlad; Morcos, Ari; Shekhar, Shashank; Goldstein, Tom; Bordes, Florián; Bardes, Adrián; Mialon, Gregoire; Tian, Yuandong; Schwarzschild, Avi; Wilson, Andrew Gordon; Geiping, Jonás; Garrido, Quintín; Fernández, Pierre (24 de abril de 2023). "Un libro de cocina sobre el aprendizaje autosupervisado". arXiv : 2304.12210 [ cs.LG ].
Enlaces externos
- Doersch, Carl; Zisserman, Andrew (octubre de 2017). «Aprendizaje visual autosupervisado multitarea». 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 2070–2079 . arXiv : 1708.07860 . doi : 10.1109/ICCV.2017.226 . ISBN 978-1-5386-1032-9. S2CID 473729 .
- Doersch, Carl; Gupta, Abhinav; Efros, Alexei A. (diciembre de 2015). "Aprendizaje de representación visual no supervisado mediante predicción del contexto". Conferencia internacional IEEE 2015 sobre visión por computadora (ICCV) . págs. 1422-1430 . arXiv : 1505.05192 . doi : 10.1109/ICCV.2015.167 . ISBN 978-1-4673-8391-2. S2CID 9062671 .
- Zheng, Xin; Wang, Yong; Wang, Guoyou; Liu, Jianguo (1 de abril de 2018). "Segmentación rápida y robusta de imágenes de glóbulos blancos mediante aprendizaje autosupervisado" . Micron . 107 : 55–71 . doi : 10.1016/j.micron.2018.01.010 . ISSN 0968-4328 . PMID 29425969. S2CID 3796689 .
- Yarowsky, David (1995). "Desambiguación del sentido de las palabras sin supervisión que rivaliza con los métodos supervisados" . Actas de la 33.ª Reunión Anual de la Asociación de Lingüística Computacional . Cambridge, MA: Asociación de Lingüística Computacional: 189–196 . doi : 10.3115/981658.981684 . Consultado el 1 de noviembre de 2022 .
- Aprendizaje automático
- IA generativa