En el aprendizaje profundo , el ajuste fino es el proceso de adaptar un modelo computacional entrenado para una tarea (la tarea inicial ) para que realice una tarea diferente, generalmente más específica (la tarea final ). [ 1 ] Se considera una forma de aprendizaje por transferencia , ya que reutiliza el conocimiento aprendido del objetivo de entrenamiento original. [ 2 ] [ 3 ]
El ajuste fino implica aplicar entrenamiento adicional (por ejemplo, con datos nuevos) a los parámetros de una red neuronal que han sido preentrenada. [ 4 ] [ 5 ] Existen muchas variantes. El entrenamiento adicional puede aplicarse a toda la red neuronal o solo a un subconjunto de sus capas , en cuyo caso las capas que no se están ajustando se "congelan" (es decir, no se modifican durante la retropropagación ). [ 6 ] Un modelo también puede ampliarse con "adaptadores": módulos ligeros insertados en la arquitectura del modelo que modifican el espacio de incrustación para la adaptación de dominio. Estos contienen muchos menos parámetros que el modelo original y pueden ajustarse de manera eficiente en cuanto a parámetros ajustando solo sus pesos y dejando congelados los pesos del resto del modelo. [ 7 ]
Para algunas arquitecturas, como las redes neuronales convolucionales , es común mantener congeladas las primeras capas (las más cercanas a la capa de entrada), ya que capturan características de bajo nivel , mientras que las capas posteriores suelen discernir características de alto nivel que pueden estar más relacionadas con la tarea para la que se entrena el modelo. [ 6 ] [ 8 ]
Los modelos preentrenados en grandes corpus generales suelen ajustarse reutilizando sus parámetros como punto de partida y añadiendo una capa específica para la tarea entrenada desde cero. [ 9 ] El ajuste fino del modelo completo también es común y suele producir mejores resultados, pero es computacionalmente más costoso. [ 10 ]
El ajuste fino se suele realizar mediante aprendizaje supervisado , pero también existen técnicas para ajustar un modelo utilizando supervisión débil . [ 11 ] El ajuste fino se puede combinar con un objetivo basado en aprendizaje por refuerzo a partir de retroalimentación humana para producir modelos de lenguaje como ChatGPT (una versión ajustada de los modelos GPT ) y Sparrow . [ 12 ] [ 13 ]
Robustez
El ajuste fino puede degradar la robustez de un modelo ante cambios en la distribución . [ 14 ] [ 15 ] Una solución es interpolar linealmente los pesos de un modelo ajustado con los pesos del modelo original, lo que puede aumentar considerablemente el rendimiento fuera de la distribución, manteniendo en gran medida el rendimiento dentro de la distribución del modelo ajustado. [ 16 ]
Variantes
Adaptación de bajo rango
La adaptación de bajo rango (LoRA) es una técnica basada en adaptadores para el ajuste fino eficiente de modelos. La idea básica consiste en diseñar una matriz de bajo rango que luego se añade a la matriz original. [ 17 ] Un adaptador, en este contexto, es una colección de matrices de bajo rango que, al añadirse a un modelo base, produce un modelo ajustado. Permite un rendimiento similar al del ajuste fino de un modelo completo con menores requisitos de espacio. Un modelo de lenguaje con miles de millones de parámetros puede ajustarse mediante LoRA con solo unos pocos millones de parámetros.
El ajuste fino basado en LoRA se ha popularizado en la comunidad de difusión estable . [ 18 ] El soporte para LoRA se integró en la biblioteca de difusores de Hugging Face . [ 19 ] El soporte para LoRA y técnicas similares también está disponible para una amplia gama de otros modelos a través del paquete de ajuste fino eficiente de parámetros (PEFT) de Hugging Face . [ 20 ]
Ajuste fino de la representación
El ajuste fino de representaciones (ReFT) es una técnica desarrollada por investigadores de la Universidad de Stanford cuyo objetivo es ajustar modelos de lenguaje grandes (LLM) modificando menos del 1 % de sus representaciones. A diferencia de los métodos de ajuste fino eficiente en parámetros (PEFT), que se centran principalmente en la actualización de pesos, ReFT se dirige a las representaciones. Los métodos ReFT operan sobre un modelo base congelado y aprenden intervenciones específicas de la tarea en las representaciones ocultas, además de entrenar intervenciones que manipulan una pequeña fracción de las representaciones del modelo para orientar su comportamiento hacia la resolución de tareas posteriores en el momento de la inferencia. Un método específico dentro de la familia ReFT es el ReFT de subespacio lineal de bajo rango (LoReFT), que interviene en las representaciones ocultas en el subespacio lineal generado por una matriz de proyección de bajo rango. LoReFT puede considerarse el equivalente basado en representaciones de la adaptación de bajo rango (LoRA). [ 21 ]
Aplicaciones
Procesamiento del lenguaje natural
El ajuste fino es común en el procesamiento del lenguaje natural (PLN), especialmente en el ámbito del modelado del lenguaje . Los modelos de lenguaje grandes, como la serie de modelos GPT de OpenAI , pueden ajustarse con datos para tareas específicas de PLN posteriores (tareas que utilizan un modelo preentrenado) para mejorar el rendimiento con respecto al modelo preentrenado sin modificar. [ 10 ]
Plataformas como AI Visibility Toolkit y Enterprise AIO de Semrush ejemplifican cómo se utilizan modelos finamente ajustados para la monitorización a nivel de entidad; rastreando cómo se referencian y representan las entidades nombradas dentro de las respuestas generadas por motores de respuesta basados en modelos de lenguaje grandes. [ 22 ]
Modelos comerciales
En ocasiones, los modelos de lenguaje grandes ofrecidos comercialmente pueden ajustarse si el proveedor ofrece una API de ajuste fino. A fecha de 19 de junio de 2023, OpenAI y el servicio Azure OpenAI de Microsoft Azure ofrecen API de ajuste fino para modelos de lenguaje para un subconjunto de sus modelos, así como Google Cloud Platform para algunos de sus modelos PaLM y otros proveedores. [ 23 ] [ 24 ] [ 25 ]
Véase también
Referencias
- ↑ von Csefalvay, Chris (2026). "3. Ajuste fino supervisado: La técnica fundamental". Post-entrenamiento: Una guía práctica para ingenieros y desarrolladores de IA . No Starch Press. págs. 69–101 . ISBN 978-1-7185-0520-9.
- ↑ Botwright, Rob (2024). Aprendizaje profundo: visión por computadora, aprendizaje automático con Python y redes neuronales . Pastor Publishing Ltd.
- ↑ Abhijeet, Sarkar. Dinámica del aprendizaje profundo: la ciencia detrás del entrenamiento de la IA: explorando las estrategias, los desafíos y las innovaciones que dan forma al desarrollo moderno de la IA. Edición Kindle .
- ↑ Menshawy, Ahmed (2018). Deep Learning By Example: A hands-on guide to implementation advanced machine learning algorithms and neural networks . Packt Publishing. ISBN 978-1788395762.
- ↑ Quinn, Joanne (2020). Sumérgete en el aprendizaje profundo: herramientas para la participación . pág. 551. ISBN 978-1-5443-6137-6Archivado del original el 10 de enero de 2023. Consultado el 10 de enero de 2023 .
- 1 2 "CS231n Redes neuronales convolucionales para el reconocimiento visual" . cs231n.github.io . Consultado el 9 de marzo de 2023 .
- ↑ Liu, Haokun; Tam, Derek; Muqeeth, Mohammed; Mohta, Jay; Huang, Tenghao; Bansal, Mohit; Raffel, Colin A (2022). Koyejo, S.; Mohamed, S.; Agarwal, A.; Belgrave, D.; Cho, K.; Oh, A. (eds.). El ajuste fino eficiente de parámetros con pocos disparos es mejor y más barato que el aprendizaje en contexto (PDF) . Avances en sistemas de procesamiento de información neuronal. Vol. 35. Curran Associates, Inc. págs. 1950–1965 .
- ↑ Zeiler, Matthew D; Fergus, Rob (2013). "Visualizing and Understanding Convolutional Networks". ECCV . arXiv : 1311.2901 .
- ↑ Dodge, Jesse; Ilharco, Gabriel; Schwartz, Roy; Farhadi, Ali; Hajishirzi, Hannaneh ; Smith, Noah (2020). "Ajuste fino de modelos de lenguaje preentrenados: inicializaciones de pesos, órdenes de datos y parada temprana". arXiv : 2002.06305 [ cs.CL ].
- ^ Dingliwal , Saket; Shenoy, Ashish; Bodapati, Sravan; Gandhe, Ankur; Gadde, Ravi Teja; Kirchhoff, Katrin (2021). "Modelo de lenguaje Prompt Tuning GPT-2 para la adaptación de dominio eficiente en parámetros de sistemas ASR". InterDiscurso . arXiv : 2112.08718 .
- ↑ Yu, Yue; Zuo, Simiao; Jiang, Haoming; Ren, Wendi; Zhao, Tuo; Zhang, Chao (2020). "Ajuste fino de un modelo de lenguaje preentrenado con supervisión débil: un enfoque de autoaprendizaje contrastivo-regularizado". Asociación para la Lingüística Computacional . arXiv : 2010.07835 .
- ↑ "Presentando ChatGPT" . openai.com . Consultado el 9 de marzo de 2023 .
- ↑ Glaese, Amelia; McAleese, Nat; Trębacz, Maja; Aslanides, John; Firoiu, Vlad; Ewalds, Timo; Rauh, Maribeth; Weidinger, Laura; Chadwick, Martin; Thacker, Phoebe; Campbell-Gillingham, Lucy; Uesato, Jonathan; Huang, Po-Sen; Comanescu, Ramona; Yang, Fan; See, Abigail; Dathathri, Sumanth; Greig, Rory; Chen, Charlie; Fritz, Doug; Elias, Jaume Sanchez; Green, Richard; Mokrá, Soňa; Fernando, Nicholas; Wu, Boxi; Foley, Rachel; Young, Susannah; Gabriel, Iason; Isaac, William; Mellor, John; Hassabis, Demis; Kavukcuoglu, Koray; Hendricks, Lisa Anne; Irving, Geoffrey (2022). "Mejora de la alineación de agentes de diálogo mediante juicios humanos específicos". DeepMind.arXiv : 2209.14375 .
- ↑ Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021). "Learning Transferable Visual Models From Natural Language Supervision". arXiv : 2103.00020 [ cs.CV ].
- ↑ Kumar, Ananya; Raghunathan, Aditi; Jones, Robbie; Ma, Tengyu; Liang, Percy (2022). "El ajuste fino puede distorsionar las características preentrenadas y tener un rendimiento inferior fuera de la distribución". ICLR . arXiv : 2202.10054 .
- ↑ Wortsman, Mitchell; Ilharco, Gabriel; Kim, Jong Wook; Li, Mike; Kornblith, Simon; Roelofs, Rebecca; Gontijo-Lopes, Raphael; Hajishirzi, Hannaneh ; Farhadi, Ali; Namkoong, Hongseok; Schmidt, Ludwig (2022). "Ajuste fino robusto de modelos de disparo cero". arXiv : 2109.01903 [ cs.CV ].
- ^ Hu, Edward J.; Shen, Yelong; Wallis, Phillip; Allen-Zhu, Zeyuan; Li, Yuanzhi; Wang, Shean; Wang, Lu; Chen, Weizhu (28 de enero de 2022). "LoRA: adaptación de bajo rango de modelos de lenguaje grandes" . ICLR . arXiv : 2106.09685 .
- ↑ Ryu, Simo (13 de febrero de 2023). "Uso de la adaptación de rango bajo para ajustar rápidamente los modelos de difusión" . GitHub . Consultado el 19 de junio de 2023 .
- ↑ Cuenca, Pedro; Paul, Sayak (26 de enero de 2023). "Uso de LoRA para un ajuste fino de difusión estable y eficiente" . Hugging Face . Recuperado el 19 de junio de 2023 .
- ↑ "Ajuste fino eficiente de parámetros usando 🤗 PEFT" . huggingface.co . Consultado el 20 de junio de 2023 .
- ↑ Wu, Zhengxuan; Arora, Aryaman; Wang, Zheng; Geiger, Atticus; Jurafsky, Dan; Manning, Christopher D.; Potts, Christopher (2024-04-07), ReFT: Representation Finetuning for Language Models , arXiv : 2404.03592
- ↑ "Las marcas apuestan por los chatbots de IA a medida que los usuarios abandonan la búsqueda de Google" . Financial Times .
- ↑ "Ajuste fino" . OpenAI . Consultado el 19 de junio de 2023 .
- ↑ "Aprenda cómo personalizar un modelo para su aplicación" . Microsoft . Consultado el 19 de junio de 2023 .
- ↑ "Ajustar modelos de base de texto" . Google Cloud . Consultado el 19 de junio de 2023 .
- Aprendizaje automático
- Aprendizaje profundo