Articulo de referencia

Aprendizaje no supervisado

El aprendizaje no supervisado es un marco de aprendizaje automático donde, a diferencia del aprendizaje supervisado , los algoritmos aprenden patrones exclusivamente a partir de...

El aprendizaje no supervisado es un marco de aprendizaje automático donde, a diferencia del aprendizaje supervisado , los algoritmos aprenden patrones exclusivamente a partir de datos sin etiquetar. [ 1 ] Otros marcos dentro del espectro de supervisión incluyen la supervisión débil o semisupervisión , donde se etiqueta una pequeña porción de los datos, y la autosupervisión . Algunos investigadores consideran el aprendizaje autosupervisado una forma de aprendizaje no supervisado. [ 2 ]

Conceptualmente, el aprendizaje no supervisado se divide en los aspectos de datos, entrenamiento, algoritmo y aplicaciones posteriores. Por lo general, el conjunto de datos se obtiene de forma económica "en la naturaleza", como un corpus de texto masivo obtenido mediante rastreo web , con un filtrado mínimo (como Common Crawl ). Esto resulta ventajoso en comparación con el aprendizaje supervisado, donde el conjunto de datos (como ImageNet1000 ) se construye manualmente, lo que resulta mucho más costoso.

Existen algoritmos diseñados específicamente para el aprendizaje no supervisado, como algoritmos de agrupamiento como k-means , técnicas de reducción de dimensionalidad como el análisis de componentes principales (PCA) , el aprendizaje automático de Boltzmann y los autoencoders . Tras el auge del aprendizaje profundo, la mayor parte del aprendizaje no supervisado a gran escala se ha realizado entrenando arquitecturas de redes neuronales de propósito general mediante descenso de gradiente , adaptadas para realizar aprendizaje no supervisado mediante el diseño de un procedimiento de entrenamiento apropiado.

A veces, un modelo entrenado puede usarse tal cual, pero con mayor frecuencia se modifica para aplicaciones posteriores. Por ejemplo, el método de preentrenamiento generativo entrena un modelo para generar un conjunto de datos textuales, antes de ajustarlo para otras aplicaciones, como la clasificación de texto. [ 3 ] [ 4 ] Como otro ejemplo, los autoencoders se entrenan para producir buenas características , que luego pueden usarse como un módulo para otros modelos, como en un modelo de difusión latente .

Tareas

Tendencia a emplear métodos supervisados ​​o no supervisados ​​en una tarea. El hecho de que los nombres de las tareas abarquen los límites de los círculos es intencional. Esto demuestra que la división clásica de las tareas imaginativas (izquierda) que emplean métodos no supervisados ​​se difumina en los esquemas de aprendizaje actuales.

Las tareas suelen clasificarse como discriminativas (reconocimiento) o generativas (imaginación). A menudo, aunque no siempre, las tareas discriminativas utilizan métodos supervisados ​​y las generativas, métodos no supervisados ​​(véase el diagrama de Venn ); sin embargo, la distinción es muy difusa. Por ejemplo, el reconocimiento de objetos favorece el aprendizaje supervisado, pero el aprendizaje no supervisado también puede agrupar objetos. Además, a medida que avanza el progreso, algunas tareas emplean ambos métodos y otras alternan entre uno y otro. Por ejemplo, el reconocimiento de imágenes comenzó siendo altamente supervisado, pero se volvió híbrido al emplear un preentrenamiento no supervisado, y luego volvió a la supervisión con la llegada de dropout , ReLU y tasas de aprendizaje adaptativas .

Una tarea generativa típica es la siguiente: en cada paso, se toma una muestra de un punto de datos del conjunto de datos, se elimina una parte de los datos y el modelo debe inferir la parte eliminada. Esto se observa claramente en los autoencoders de eliminación de ruido y en BERT .

Arquitecturas de redes neuronales

Capacitación

Durante la fase de aprendizaje, una red no supervisada intenta imitar los datos que recibe y utiliza el error en su salida imitada para corregirse (es decir, corregir sus pesos y sesgos). A veces, el error se expresa como una baja probabilidad de que ocurra la salida errónea, o bien como un estado de alta energía inestable en la red.

A diferencia del uso predominante de la retropropagación en los métodos supervisados , el aprendizaje no supervisado también emplea otros métodos, entre los que se incluyen: la regla de aprendizaje de Hopfield, la regla de aprendizaje de Boltzmann, la divergencia contrastiva , el método Wake Sleep , la inferencia variacional , la máxima verosimilitud , la máxima probabilidad a posteriori , el muestreo de Gibbs y la retropropagación de errores de reconstrucción o reparametrizaciones de estados ocultos. Consulte la tabla a continuación para obtener más detalles.

Energía

Una función de energía es una medida macroscópica del estado de activación de una red. En las máquinas de Boltzmann, desempeña el papel de la función de coste. Esta analogía con la física está inspirada en el análisis de Ludwig Boltzmann sobre la energía macroscópica de un gas a partir de las probabilidades microscópicas del movimiento de las partículas.pagmimi/kT{\displaystyle p\propto e^{-E/kT}}donde k es la constante de Boltzmann y T es la temperatura. En la red RBM la relación espag=mimi/Z{\displaystyle p=e^{-E}/Z}, [ 5 ] dondepag{\displaystyle p}ymi{\displaystyle E}varían en todos los posibles patrones de activación yZ=Todos los patronesmimi(patrón){\displaystyle \textstyle {Z=\sum _{\scriptscriptstyle {\text{Todos los patrones}}}e^{-E({\text{patrón}})}}}Para ser más precisos,pag(a)=mimi(a)/Z{\displaystyle p(a)=e^{-E(a)}/Z}, dóndea{\displaystyle a}es un patrón de activación de todas las neuronas (visibles y ocultas). Por lo tanto, algunas redes neuronales tempranas llevan el nombre de Máquina de Boltzmann. Paul Smolensky la llamami{\displaystyle -E\,}La armonía . Una red busca baja energía, lo que equivale a alta armonía.

Redes

Esta tabla muestra diagramas de conexión de diversas redes no supervisadas, cuyos detalles se explicarán en la sección Comparación de Redes. Los círculos representan neuronas y las aristas entre ellas, pesos de conexión. A medida que cambia el diseño de la red, se añaden características para habilitar nuevas capacidades o se eliminan para acelerar el aprendizaje. Por ejemplo, las neuronas cambian entre deterministas (Hopfield) y estocásticas (Boltzmann) para permitir una salida robusta, se eliminan pesos dentro de una capa (RBM) para acelerar el aprendizaje o se permite que las conexiones sean asimétricas (Helmholtz).

De las redes que llevan nombres de personas, solo Hopfield trabajó directamente con redes neuronales. Boltzmann y Helmholtz precedieron a las redes neuronales artificiales, pero su trabajo en física y fisiología inspiró los métodos analíticos que se utilizaron.

Historia

Redes específicas

Aquí destacamos algunas características de redes seleccionadas. Los detalles de cada una se presentan en la tabla comparativa a continuación.

Red Hopfield
Las redes de Hopfield se inspiraron en el ferromagnetismo. Una neurona corresponde a un dominio de hierro con momentos magnéticos binarios Arriba y Abajo, y las conexiones neuronales corresponden a la influencia mutua entre los dominios. Las conexiones simétricas permiten una formulación energética global. Durante la inferencia, la red actualiza cada estado mediante la función de activación estándar. Los pesos simétricos y las funciones energéticas adecuadas garantizan la convergencia a un patrón de activación estable. Los pesos asimétricos son difíciles de analizar. Las redes de Hopfield se utilizan como memorias de contenido direccionable (CAM).
Máquina de Boltzmann
Estas son redes de Hopfield estocásticas. Su valor de estado se muestrea a partir de esta pdf de la siguiente manera: supongamos que una neurona binaria se activa con la probabilidad de Bernoulli p(1) = 1/3 y se desactiva con p(0) = 2/3. Se muestrea a partir de ella tomando un número aleatorio y con distribución uniforme y sustituyéndolo en la función de distribución acumulativa inversa , que en este caso es la función escalón con un umbral de 2/3. La función inversa = { 0 si x <= 2/3, 1 si x > 2/3 }.
Red de creencias sigmoidea
Introducida por Radford Neal en 1992, esta red aplica ideas de modelos gráficos probabilísticos a redes neuronales. Una diferencia clave es que los nodos en los modelos gráficos tienen significados preasignados, mientras que las características de las neuronas de Belief Net se determinan después del entrenamiento. La red es un grafo dirigido acíclico escasamente conectado, compuesto por neuronas estocásticas binarias. La regla de aprendizaje proviene de la máxima verosimilitud en p(X): Δw ij{\displaystyle \propto }s j * (s i - p i ), donde p i = 1 / ( 1 + e entradas ponderadas en la neurona i ). Los s j son activaciones de una muestra no sesgada de la distribución posterior y esto es problemático debido al problema de la explicación errónea planteado por Judea Perl. Los métodos bayesianos variacionales utilizan una distribución posterior sustituta e ignoran flagrantemente esta complejidad.
Red de Creencias Profundas
Introducida por Hinton, esta red es un híbrido de RBM y red de creencias sigmoide. Las dos primeras capas son una RBM y la segunda capa hacia abajo forma una red de creencias sigmoide. Se entrena mediante el método RBM apilado y luego se descartan los pesos de reconocimiento por debajo de la RBM superior. En 2009, 3-4 capas parecían ser la profundidad óptima. [ 6 ]
Máquina de Helmholtz
Estas son las primeras inspiraciones para los autocodificadores variacionales. Sus 2 redes combinadas en una: los pesos hacia adelante operan el reconocimiento y los pesos hacia atrás implementan la imaginación. Es quizás la primera red en hacer ambas cosas. Helmholtz no trabajó en aprendizaje automático, pero inspiró la visión de "motor de inferencia estadística cuya función es inferir las causas probables de la entrada sensorial". [ 7 ] la neurona binaria estocástica produce una probabilidad de que su estado sea 0 o 1. La entrada de datos normalmente no se considera una capa, pero en el modo de generación de la máquina de Helmholtz, la capa de datos recibe entrada de la capa intermedia y tiene pesos separados para este propósito, por lo que se considera una capa. Por lo tanto, esta red tiene 3 capas.
autoencoder variacional
Estos sistemas se inspiran en las máquinas de Helmholtz y combinan redes de probabilidad con redes neuronales. Un autoencoder es una red CAM de tres capas, donde la capa intermedia representa internamente los patrones de entrada. La red neuronal codificadora es una distribución de probabilidad q φ (z dado x) y la red decodificadora es p θ (x dado z). Los pesos se denominan phi y theta en lugar de W y V, como en Helmholtz; una diferencia meramente estética. Estas dos redes pueden estar completamente conectadas o utilizar otro esquema de red neuronal.

Comparación de redes

Aprendizaje hebbiano, ARTE, SOM

El ejemplo clásico de aprendizaje no supervisado en el estudio de redes neuronales es el principio de Donald Hebb , es decir, las neuronas que se activan juntas se conectan entre sí. [ 8 ] En el aprendizaje hebbiano , la conexión se refuerza independientemente de un error, pero es exclusivamente una función de la coincidencia entre los potenciales de acción de las dos neuronas. [ 9 ] Una versión similar que modifica los pesos sinápticos tiene en cuenta el tiempo entre los potenciales de acción ( plasticidad dependiente del tiempo de los picos o STDP). Se ha planteado la hipótesis de que el aprendizaje hebbiano subyace a una serie de funciones cognitivas, como el reconocimiento de patrones y el aprendizaje experiencial.

Entre los modelos de redes neuronales , el mapa autoorganizado (SOM) y la teoría de resonancia adaptativa (ART) se utilizan comúnmente en algoritmos de aprendizaje no supervisado. El SOM es una organización topográfica en la que las ubicaciones cercanas en el mapa representan entradas con propiedades similares. El modelo ART permite que el número de clústeres varíe con el tamaño del problema y permite al usuario controlar el grado de similitud entre los miembros de los mismos clústeres mediante una constante definida por el usuario llamada parámetro de vigilancia. Las redes ART se utilizan para muchas tareas de reconocimiento de patrones, como el reconocimiento automático de objetivos y el procesamiento de señales sísmicas. [ 10 ]

Métodos probabilísticos

Dos de los métodos principales utilizados en el aprendizaje no supervisado son el análisis de componentes principales y el análisis de clústeres . El análisis de clústeres se utiliza en el aprendizaje no supervisado para agrupar o segmentar conjuntos de datos con atributos compartidos con el fin de extrapolar relaciones algorítmicas. [ 11 ] El análisis de clústeres es una rama del aprendizaje automático que agrupa los datos que no han sido etiquetados , clasificados o categorizados. En lugar de responder a la retroalimentación, el análisis de clústeres identifica similitudes en los datos y reacciona en función de la presencia o ausencia de dichas similitudes en cada nuevo conjunto de datos. Este enfoque ayuda a detectar puntos de datos anómalos que no encajan en ninguno de los grupos.

Una aplicación central del aprendizaje no supervisado se encuentra en el campo de la estimación de densidad en estadística , [ 12 ] aunque el aprendizaje no supervisado abarca muchos otros dominios que implican resumir y explicar las características de los datos. Se puede contrastar con el aprendizaje supervisado diciendo que, mientras que el aprendizaje supervisado pretende inferir una distribución de probabilidad condicional condicionada a la etiqueta de los datos de entrada, el aprendizaje no supervisado pretende inferir una distribución de probabilidad a priori .

Aproches

Algunos de los algoritmos más comunes utilizados en el aprendizaje no supervisado incluyen: (1) Agrupamiento, (2) Detección de anomalías, (3) Enfoques para el aprendizaje de modelos de variables latentes. Cada enfoque utiliza varios métodos, como se detalla a continuación:

Método de los momentos

Uno de los enfoques estadísticos para el aprendizaje no supervisado es el método de los momentos . En este método, los parámetros desconocidos (de interés) del modelo se relacionan con los momentos de una o más variables aleatorias, lo que permite estimar dichos parámetros a partir de los momentos. Los momentos se suelen estimar empíricamente a partir de muestras. Los momentos básicos son de primer y segundo orden. Para un vector aleatorio, el momento de primer orden es el vector de medias , y el de segundo orden es la matriz de covarianza (cuando la media es cero). Los momentos de orden superior se representan generalmente mediante tensores , que son la generalización de las matrices a órdenes superiores como arreglos multidimensionales.

En particular, se demuestra que el método de los momentos es eficaz para aprender los parámetros de los modelos de variables latentes . Los modelos de variables latentes son modelos estadísticos donde, además de las variables observadas, existe un conjunto de variables latentes que no se observan. Un ejemplo muy práctico de modelos de variables latentes en el aprendizaje automático es el modelado de temas , que es un modelo estadístico para generar las palabras (variables observadas) en un documento basándose en el tema (variable latente) del mismo. En el modelado de temas, las palabras del documento se generan según diferentes parámetros estadísticos cuando cambia el tema del documento. Se demuestra que el método de los momentos (técnicas de descomposición tensorial) recupera de forma consistente los parámetros de una gran clase de modelos de variables latentes bajo ciertas suposiciones. [ 15 ]

El algoritmo de Expectación-Maximización (EM) es uno de los métodos más prácticos para el aprendizaje de modelos de variables latentes. Sin embargo, puede quedarse atascado en óptimos locales y no se garantiza su convergencia hacia los parámetros desconocidos reales del modelo. En cambio, el método de los momentos garantiza la convergencia global bajo ciertas condiciones.

Véase también

Referencias

  1. Wu, Wei. "Aprendizaje no supervisado" (PDF) . Archivado (PDF) del original el 14 de abril de 2024. Recuperado el 26 de abril de 2024 .
  2. ^ Liu, Xiao; Zhang, Fanjin; Hou, Zhenyu; Mian, Li; Wang, Zhaoyu; Zhang, Jing; Tang, Jie (2021). "Aprendizaje autosupervisado: generativo o contrastivo". Transacciones IEEE sobre conocimiento e ingeniería de datos : 1. arXiv : 2006.08218 . doi : 10.1109/TKDE.2021.3090866 . ISSN 1041-4347 . 
  3. Radford, Alec; Narasimhan, Karthik; Salimans, Tim; Sutskever, Ilya (11 de junio de 2018). "Mejora de la comprensión del lenguaje mediante preentrenamiento generativo" (PDF) . OpenAI . pág. 12. Archivado (PDF) del original el 26 de enero de 2021. Recuperado el 23 de enero de 2021 . 
  4. Li, Zhuohan; Wallace, Eric; Shen, Sheng; Lin, Kevin; Keutzer, Kurt; Klein, Dan; Gonzalez, Joey (21 de noviembre de 2020). "Entrenar a gran escala y luego comprimir: repensando el tamaño del modelo para un entrenamiento e inferencia eficientes de transformadores" . Actas de la 37.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 5958–5968 .
  5. Hinton, G. (2012). "Una guía práctica para entrenar máquinas de Boltzmann restringidas" (PDF) . Redes neuronales: trucos del oficio . Notas de clase en informática. Vol. 7700. Springer. págs. 599–619 . doi : 10.1007/978-3-642-35289-8_32 . ISBN   978-3-642-35289-8. Archivado (PDF) del original el 03-09-2022 . Recuperado el 03-11-2022 .
  6. "Redes de creencias profundas" (vídeo). Septiembre de 2009. Archivado del original el 8 de marzo de 2022. Consultado el 27 de marzo de 2022 .
  7. Peter, Dayan ; Hinton, Geoffrey E .; Neal, Radford M .; Zemel, Richard S. (1995). "La máquina de Helmholtz" . Neural Computation . 7 (5): 889– 904. doi : 10.1162/neco.1995.7.5.889 . hdl : 21.11116/0000-0002-D6D3-E . PMID 7584891. S2CID 1890561 .  Icono de acceso cerrado
  8. Buhmann, J.; Kuhnel, H. (1992). "Agrupamiento de datos supervisado y no supervisado con redes neuronales competitivas". [ Actas de 1992 ] Conferencia Internacional Conjunta sobre Redes Neuronales IJCNN . Vol. 4. IEEE. págs. 796–801 . doi : 10.1109/ijcnn.1992.227220 . ISBN   0780305590. S2CID 62651220 . 
  9. Comesaña-Campos, Alberto; Bouza-Rodríguez, José Benito (junio de 2016). "Una aplicación del aprendizaje hebbiano en la toma de decisiones del proceso de diseño". Revista de fabricación inteligente . 27 (3): 487– 506. doi : 10.1007/s10845-014-0881-z . ISSN 0956-5515 . S2CID 207171436 .  
  10. Carpenter, GA y Grossberg, S. (1988). "El ARTE del reconocimiento adaptativo de patrones mediante una red neuronal autoorganizada" (PDF) . Computer . 21 (3): 77– 88. doi : 10.1109/2.33 . S2CID 14625094. Archivado del original (PDF) el 16 de mayo de 2018. Recuperado el 16 de septiembre de 2013 . 
  11. Roman, Victor (21 de abril de 2019). "Aprendizaje automático no supervisado: análisis de agrupamiento" . Medium . Archivado del original el 21 de agosto de 2020. Recuperado el 1 de octubre de 2019 .
  12. Jordan, Michael I.; Bishop, Christopher M. (2004). "7. Sistemas inteligentes § Redes neuronales". En Tucker, Allen B. (ed.). Manual de informática (2.ª ed.). Chapman & Hall/CRC Press. doi : 10.1201/9780203494455 . ISBN  1-58488-360-X. Archivado del original el 03-11-2022 . Consultado el 03-11-2022 .
  13. Hastie, Tibshirani y Friedman 2009 , págs. 485–586
  14. Garbade, Dr. Michael J. (12 de septiembre de 2018). "Comprendiendo el agrupamiento K-means en el aprendizaje automático" . Medium . Archivado del original el 28 de mayo de 2019. Recuperado el 31 de octubre de 2019 .
  15. Anandkumar, Animashree; Ge, Rong; Hsu, Daniel; Kakade, Sham; Telgarsky, Matus (2014). "Descomposiciones tensoriales para el aprendizaje de modelos de variables latentes" (PDF) . Journal of Machine Learning Research . 15 : 2773–2832 . arXiv : 1210.7559 . Bibcode : 2012arXiv1210.7559A . Archivado (PDF) del original el 20 de marzo de 2015. Recuperado el 10 de abril de 2015 .

Lecturas adicionales