Articulo de referencia

Colapso de modo

En el aprendizaje automático , el colapso modal es un modo de fallo observado en los modelos generativos , detectado originalmente en las redes generativas antagónicas (GAN) . O...

En el aprendizaje automático , el colapso modal es un modo de fallo observado en los modelos generativos , detectado originalmente en las redes generativas antagónicas (GAN) . Ocurre cuando el modelo produce resultados menos diversos de lo esperado, "colapsando" efectivamente para generar solo unos pocos modos de la distribución de datos e ignorando otros. Este fenómeno socava el objetivo de los modelos generativos de capturar la diversidad completa de los datos de entrenamiento.

Normalmente, un modelo puede fallar en dos momentos: durante el entrenamiento o durante el ajuste fino posterior al entrenamiento.

El colapso de modos reduce la utilidad de los modelos generativos en aplicaciones, como en

  • síntesis de imágenes (imágenes repetitivas o casi idénticas);
  • aumento de datos (diversidad limitada en datos sintéticos );
  • simulaciones científicas (falta de exploración de todos los escenarios plausibles).

Distinciones

El colapso modal es distinto del sobreajuste , también llamado memorización, en el que un modelo aprende patrones detallados en los datos de entrenamiento que no se generalizan a los datos de prueba, aunque existen similitudes entre ambos fenómenos.

En términos de aprendizaje de una distribución de probabilidad , el colapso modal corresponde al colapso de toda la distribución en uno o pocos puntos, que pueden o no corresponder a puntos con alta probabilidad en la distribución objetivo.

Por otro lado, el sobreajuste corresponde al aprendizaje de una distribución con picos muy pronunciados alrededor de los puntos de datos de entrenamiento. En cierto modo, puede considerarse una forma de colapso modal casi completo o completo, donde los modos se encuentran en todos o en la mayoría de los datos de entrenamiento. Sin embargo, esto suele deberse a la sobreparametrización del modelo, y no al procedimiento de entrenamiento en sí, como ocurre con las GAN.

Sin embargo, el subajuste no comparte características comunes con el colapso modal. En este caso, el modelo no está suficientemente parametrizado o entrenado, y la distribución aprendida está lejos de la distribución objetivo, generalmente demasiado cerca de la distribución inicial.

En las GAN

El colapso del modo de tiempo de entrenamiento se observó y estudió originalmente en las GAN, donde surge principalmente debido a desequilibrios en la dinámica de entrenamiento entre el generador y el discriminador en las GAN. En el artículo original sobre GAN, también se le denominó el "escenario Helvetica". [ 1 ] [ 2 ]

Las causas comunes incluyen: [ 3 ]

  • Si el discriminador aprende demasiado lentamente, el generador puede aprovechar las debilidades produciendo un conjunto reducido de resultados que engañen sistemáticamente al discriminador.
  • Las funciones de pérdida GAN tradicionales (por ejemplo, la divergencia de Jensen-Shannon ) pueden ser demasiado permisivas a la hora de generar resultados de aspecto similar.
  • El proceso de entrenamiento adversario puede generar un comportamiento oscilatorio, donde el generador y el discriminador no convergen a un equilibrio estable, sino que entran en un ciclo cíclico similar al de piedra, papel o tijera. El generador generaría solo "piedra" hasta que el discriminador aprenda a clasificarlo como generado; entonces, el generador pasaría a generar solo "tijera", y así sucesivamente. El generador siempre estaría en modo colapsado, aunque el modo preciso al que colapsa cambiaría durante el entrenamiento.

Se desarrollaron varias estrategias específicas para GAN con el fin de mitigar el colapso de modos:

Sintonia FINA

Los modelos de lenguaje de gran tamaño suelen entrenarse en dos etapas. En la primera etapa ("preentrenamiento"), el modelo se entrena para generar texto a partir de un gran conjunto de datos. En la segunda etapa ("ajuste fino"), el modelo se entrena para realizar tareas específicas mediante un conjunto de datos reducido que contiene únicamente los datos necesarios para la tarea. Por ejemplo, para crear un chatbot con este método, primero se preentrena un modelo transformador de gran tamaño con varios billones de palabras de texto extraídas de Internet, y luego se ajusta con varios millones de palabras de ejemplos de conversaciones que el modelo debe imitar.

El colapso modal puede ocurrir durante el ajuste fino, ya que el modelo aprende a generar texto que cumple la tarea específica, pero pierde la capacidad de generar otras formas de texto. También puede generar un subconjunto más pequeño de textos que cumplen la tarea específica. Se hipotetiza que existe una compensación entre calidad y diversidad. Dado un único modelo preentrenado, se puede ajustar para realizar una tarea específica. Un mayor ajuste fino resultaría en un mayor rendimiento promedio de la tarea, pero en salidas menos diversas. Un menor ajuste fino resultaría en un menor rendimiento promedio, pero en salidas más diversas. [ 10 ] Se ha observado una compensación similar en modelos de generación de imágenes [ 11 ] y generadores de texto basados ​​en GAN. [ 12 ]

De manera similar, el colapso del modo puede ocurrir durante RLHF , a través de la manipulación del modelo de recompensa u otros mecanismos. [ 13 ] [ 14 ]

Véase también

Referencias

  1. Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). "Generative Adversarial Nets" . Advances in Neural Information Processing Systems . 27. Curran Associates, Inc.
  2. Kossale, Youssef; Airaj, Mohammed; Darouichi, Aziz (06-10-2022). "Colapso de modos en redes generativas adversarias: una visión general". 8.ª Conferencia Internacional sobre Optimización y Aplicaciones (ICOA) de 2022. IEEE. págs. 1-6 . doi : 10.1109/ICOA55659.2022.9934291 . ISBN  978-1-6654-7681-2.
  3. Lucic, Mario; Kurach, Karol; Michalski, Marcin; Gelly, Sylvain; Bousquet, Olivier (2018). "¿Son todas las GAN iguales? Un estudio a gran escala" . Advances in Neural Information Processing Systems . 31. Curran Associates, Inc.
  4. Heusel, Martin; Ramsauer, Hubert; Unterthiner, Thomas; Nessler, Bernhard; Hochreiter, Sepp (2017). "GANs entrenadas mediante una regla de actualización de dos escalas de tiempo convergen a un equilibrio de Nash local". arXiv : 1706.08500 [ cs.LG ].
  5. Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi; Chen, Xi (2016). "Técnicas mejoradas para el entrenamiento de GANs" . Avances en sistemas de procesamiento de información neuronal . 29. Curran Associates, Inc.
  6. ^ Metz, Lucas; Poole, Ben; Pfau, David; Sohl-Dickstein, Jascha (2016). "Redes adversarias generativas desenrolladas". arXiv : 1611.02163 [ cs.LG ].
  7. Gulrajani, Ishaan; Ahmed, Faruk; Arjovsky, Martin; Dumoulin, Vincent; Courville, Aaron C (2017). "Entrenamiento mejorado de GAN de Wasserstein" . Avances en sistemas de procesamiento de información neuronal . 30. Curran Associates, Inc.
  8. Brock, Andrew; Donahue, Jeff; Simonyan, Karen (2018). "Entrenamiento de GAN a gran escala para la síntesis de imágenes naturales de alta fidelidad". arXiv : 1809.11096 [ cs.LG ].
  9. Miyato, Takeru; Kataoka, Toshiki; Koyama, Masanori; Yoshida, Yuichi (2018). "Normalización espectral para redes generativas adversarias". arXiv : 1802.05957 [ cs.LG ].
  10. Zhang, Hugh; Duckworth, Daniel; Ippolito, Daphne; Neelakantan, Arvind (2020). "Compensación entre diversidad y calidad en la generación de lenguaje natural". arXiv : 2004.10450 [ cs.CL ].
  11. Astolfi, Pietro; Careil, Marlene; Hall, Melissa; Mañas, Oscar; Muckley, Matthew; Verbeek, Jakob; Adriana Romero Soriano; Drozdzal, Michal (2024). "Consistencia-diversidad-realismo Pareto frentes de modelos generativos de imágenes condicionales". arXiv : 2406.10429 [ cs.CV ].
  12. Caccia, Massimo; Caccia, Lucas; Fedus, William; Larochelle, Hugo; Pineau, Joelle; Charlin, Laurent (2018). "Las GAN de lenguaje se quedan cortas". arXiv : 1811.02549 [ cs.CL ].
  13. Wen, Jiaxin; Zhong, Ruiqi; Khan, Akbir; Perez, Ethan; Steinhardt, Jacob; Huang, Minlie; Bowman, Samuel R.; He, He; Feng, Shi (2024). "Los modelos de lenguaje aprenden a engañar a los humanos mediante RLHF". arXiv : 2409.12822 [ cs.CL ].
  14. Casper, Stephen; et al. (2023). "Problemas abiertos y limitaciones fundamentales del aprendizaje por refuerzo a partir de la retroalimentación humana". arXiv : 2307.15217 [ cs.AI ].