Articulo de referencia

Aprendizaje por refuerzo a partir de la retroalimentación humana

Descripción general de alto nivel del aprendizaje por refuerzo a partir de la retroalimentación humana. En el aprendizaje automático , el aprendizaje por refuerzo a partir de la...

Este es un buen artículo. Haz clic aquí para obtener más información.

Descripción general de alto nivel del aprendizaje por refuerzo a partir de la retroalimentación humana.

En el aprendizaje automático , el aprendizaje por refuerzo a partir de la retroalimentación humana ( RLHF ) es una técnica para alinear un agente inteligente con las preferencias humanas . Implica entrenar un modelo de recompensa para representar las preferencias, que luego se puede usar para entrenar otros modelos a través del aprendizaje por refuerzo . [ 1 ]

En el aprendizaje por refuerzo clásico, el objetivo de un agente inteligente es aprender una función que guíe su comportamiento, llamada política . [ 2 ] La función se optimiza iterativamente para aumentar la señal de recompensa derivada del desempeño del agente en la tarea. [ 3 ] Sin embargo, definir explícitamente una función de recompensa que se aproxime con precisión a las preferencias humanas es un desafío. Por lo tanto, RLHF busca entrenar un "modelo de recompensa" directamente a partir de la retroalimentación humana . [ 4 ] El modelo de recompensa se entrena primero de manera supervisada para predecir si una respuesta a una indicación dada es buena (alta recompensa) o mala (baja recompensa) basándose en datos de clasificación recopilados de anotadores humanos . Este modelo luego sirve como una función de recompensa para mejorar la política de un agente a través de un algoritmo de optimización como la optimización de políticas proximal . [ 5 ] [ 6 ] [ 7 ]

RLHF tiene aplicaciones en varios dominios del aprendizaje automático, incluyendo tareas de procesamiento del lenguaje natural como la generación de resúmenes de texto y agentes conversacionales , tareas de visión artificial como modelos de conversión de texto a imagen , y el desarrollo de bots para videojuegos . Si bien RLHF es un método eficaz para entrenar modelos que actúen mejor de acuerdo con las preferencias humanas, también enfrenta desafíos debido a la forma en que se recopilan los datos de preferencias humanas. Aunque RLHF no requiere grandes cantidades de datos para mejorar el rendimiento, obtener datos de preferencias de alta calidad sigue siendo un proceso costoso. Además, si los datos no se recopilan cuidadosamente de una muestra representativa , el modelo resultante puede presentar sesgos no deseados .

Antecedentes y motivación

Optimizar un modelo basándose en la retroalimentación humana es deseable cuando una tarea es difícil de especificar pero fácil de evaluar. [ 8 ] Por ejemplo, se podría querer entrenar un modelo para generar texto seguro que sea a la vez útil e inofensivo (como carecer de sesgos , toxicidad o cualquier otro contenido dañino). Pedir a los humanos que creen manualmente ejemplos de texto inofensivo y dañino sería difícil y llevaría mucho tiempo. Sin embargo, los humanos son expertos en evaluar y comparar rápidamente el grado de daño de diferentes textos generados por IA. Por lo tanto, un objetivo más práctico sería permitir que el modelo utilice este tipo de retroalimentación humana para mejorar su generación de texto. [ 9 ]

A pesar de los claros beneficios de incorporar la retroalimentación humana en los modelos de entrenamiento, los esfuerzos previos, incluidos algunos que aprovechan el aprendizaje por refuerzo (RL), han encontrado desafíos significativos. La mayoría de los intentos fueron limitados y difíciles de generalizar, fallando en tareas más complejas, [ 10 ] [ 11 ] [ 12 ] [ 13 ] o enfrentaron dificultades para aprender de funciones de recompensa dispersas (que carecen de información específica y se relacionan con grandes cantidades de texto a la vez) o ruidosas (que recompensan de manera inconsistente salidas similares). [ 14 ] [ 15 ]

RLHF no fue el primer método exitoso de usar retroalimentación humana para el aprendizaje por refuerzo, pero es uno de los más utilizados. La base de RLHF se introdujo como un intento de crear un algoritmo general para aprender a partir de una cantidad práctica de retroalimentación humana. [ 8 ] [ 5 ] El algoritmo tal como se usa hoy fue introducido por OpenAI en un artículo sobre la mejora de la continuación o resumen de texto basado en la retroalimentación humana, y comenzó a ganar popularidad cuando el mismo método se reutilizó en su artículo sobre InstructGPT . [ 4 ] [ 16 ] [ 17 ] También se ha demostrado que RLHF mejora la robustez de los agentes RL y su capacidad de exploración , lo que resulta en un proceso de optimización más hábil para manejar la incertidumbre y explorar eficientemente su entorno en busca de la mayor recompensa. [ 18 ]

Recopilación de comentarios humanos

La retroalimentación humana se suele recopilar pidiendo a los usuarios que clasifiquen instancias del comportamiento del agente. [ 17 ] [ 19 ] [ 20 ] Estas clasificaciones se pueden usar para puntuar resultados, por ejemplo, usando el sistema de clasificación Elo , que es un algoritmo para calcular los niveles de habilidad relativos de los jugadores en un juego basándose únicamente en el resultado de cada partida. [ 5 ] Si bien la clasificación de resultados es la forma de retroalimentación más utilizada, investigaciones recientes han explorado otras formas, como la retroalimentación numérica, la retroalimentación en lenguaje natural y la solicitud de ediciones directas a la salida del modelo. [ 21 ]

Una motivación inicial de RLHF fue que requiere cantidades relativamente pequeñas de datos de comparación para ser efectivo. [ 8 ] Se ha demostrado que una pequeña cantidad de datos puede generar resultados comparables a los de una mayor cantidad. Además, aumentar la cantidad de datos tiende a ser menos efectivo que aumentar proporcionalmente el tamaño del modelo de recompensa. [ 16 ] Sin embargo, una cantidad de datos mayor y más diversa puede ser crucial para tareas en las que es importante evitar el sesgo de un grupo de anotadores parcialmente representativo . [ 17 ]

Al aprender de la retroalimentación humana mediante comparaciones por pares bajo el modelo de Bradley-Terry-Luce (o el modelo de Plackett-Luce para comparaciones K-a-más de dos comparaciones), se ha demostrado que el estimador de máxima verosimilitud (EMV) para funciones de recompensa lineales converge si los datos de comparación se generan bajo un modelo lineal bien especificado . Esto implica que, bajo ciertas condiciones, si un modelo se entrena para decidir qué opciones preferirían las personas entre pares (o grupos) de opciones, necesariamente mejorará en la predicción de preferencias futuras. Se espera esta mejora siempre que las comparaciones de las que aprende se basen en una regla consistente y simple. [ 22 ] [ 23 ]

Tanto los modelos de recopilación de datos fuera de línea, donde el modelo aprende interactuando con un conjunto de datos estático y actualizando su política en lotes, como los modelos de recopilación de datos en línea, donde el modelo interactúa directamente con el entorno dinámico y actualiza su política de inmediato, se han estudiado matemáticamente demostrando límites de complejidad de muestra para RLHF bajo diferentes modelos de retroalimentación. [ 22 ] [ 24 ]

En el modelo de recopilación de datos fuera de línea, cuando el objetivo es el entrenamiento de políticas, un estimador de máxima verosimilitud pesimista que incorpora un límite de confianza inferior como estimación de la recompensa es el más efectivo. Además, cuando corresponde, se ha demostrado que considerar las comparaciones K-wise directamente es asintóticamente más eficiente que convertirlas en comparaciones por pares para fines de predicción. [ 24 ] [ 25 ] [ 17 ]

En el escenario en línea, cuando se recopila retroalimentación humana mediante comparaciones por pares bajo el modelo de Bradley-Terry-Luce y el objetivo es minimizar el arrepentimiento del algoritmo (la diferencia en el rendimiento en comparación con un agente óptimo), se ha demostrado que un estimador de máxima verosimilitud optimista que incorpora un límite superior de confianza como estimación de la recompensa puede utilizarse para diseñar algoritmos eficientes de muestreo (lo que significa que requieren relativamente pocos datos de entrenamiento). Un desafío clave en RLHF al aprender de comparaciones por pares (o duelos) está asociado con la naturaleza no markoviana de sus políticas óptimas. A diferencia de escenarios más simples donde la estrategia óptima no requiere memoria de acciones pasadas, en RLHF, el mejor curso de acción a menudo depende de eventos y decisiones anteriores, lo que hace que la estrategia dependa inherentemente de la memoria. [ 23 ]

Aplicaciones

RLHF se ha aplicado a varios dominios del procesamiento del lenguaje natural (PLN), como agentes conversacionales, resumen de texto y comprensión del lenguaje natural. [ 26 ] [ 16 ] El aprendizaje por refuerzo ordinario, en el que los agentes aprenden de sus acciones basándose en una "función de recompensa" predefinida, es difícil de aplicar a las tareas de PLN porque las recompensas tienden a ser difíciles de definir o medir, especialmente cuando se trata de tareas complejas que involucran valores o preferencias humanas. [ 8 ] RLHF puede guiar a los modelos de PLN, en particular a los modelos de lenguaje , para proporcionar respuestas que se alineen con las preferencias humanas con respecto a dichas tareas al capturar sus preferencias de antemano en el modelo de recompensa. Esto da como resultado un modelo capaz de generar respuestas más relevantes y rechazar consultas inapropiadas o irrelevantes. [ 17 ] [ 27 ] Algunos ejemplos notables de modelos de lenguaje entrenados con RLHF son ChatGPT de OpenAI (y su predecesor InstructGPT ), [ 19 ] [ 28 ] [ 29 ] Sparrow de DeepMind , [ 30 ] [ 31 ] [ 32 ] Gemini de Google , [ 33 ] y Claude de Anthropic . [ 34 ]

En visión artificial, RLHF también se ha utilizado para alinear modelos de texto a imagen . Estudios que utilizaron con éxito RLHF para este fin han observado que el uso de la regularización KL en RLHF, que busca evitar que la política aprendida se aleje demasiado del modelo no alineado, ayudó a estabilizar el proceso de entrenamiento al reducir el sobreajuste al modelo de recompensa. Se observó que las imágenes finales de salida de los modelos entrenados con regularización KL eran de una calidad significativamente mayor que las entrenadas sin ella. [ 35 ] [ 36 ] Otros métodos intentaron incorporar la retroalimentación a través de un entrenamiento más directo —basado en maximizar la recompensa sin el uso de aprendizaje por refuerzo— pero admitieron que un enfoque basado en RLHF probablemente tendría un mejor rendimiento debido a la generación de muestras en línea utilizada en RLHF durante las actualizaciones, así como a la mencionada regularización KL sobre el modelo previo, que mitiga el sobreajuste a la función de recompensa. [ 37 ]

RLHF se aplicó inicialmente a otras áreas, como el desarrollo de bots para videojuegos y tareas en robótica simulada . Por ejemplo, OpenAI y DeepMind entrenaron agentes para jugar a juegos de Atari basándose en las preferencias humanas. En el entrenamiento clásico basado en RL de dichos bots, la función de recompensa simplemente se correlaciona con el rendimiento del agente en el juego, generalmente utilizando métricas como la puntuación del juego . En comparación, en RLHF, se presentan periódicamente a un humano dos clips del comportamiento del agente en el juego y debe decidir cuál se ve mejor. Este enfoque puede enseñar a los agentes a desempeñarse a un nivel competitivo sin tener acceso a su puntuación. De hecho, se demostró que RLHF a veces puede conducir a un rendimiento superior al de RL con métricas de puntuación porque las preferencias humanas pueden contener información más útil que las métricas basadas en el rendimiento. [ 8 ] [ 38 ] Los agentes lograron un alto rendimiento en muchos de los entornos probados, superando a menudo el rendimiento humano. [ 39 ]

Capacitación

En RLHF, se entrenan dos modelos diferentes: un modelo de recompensa y una política de aprendizaje por refuerzo . El modelo de recompensa aprende a determinar qué comportamiento es deseable basándose en la retroalimentación humana, mientras que la política se guía por el modelo de recompensa para determinar las acciones del agente. Ambos modelos se inicializan comúnmente utilizando un modelo de lenguaje autorregresivo preentrenado . Este modelo se entrena posteriormente de forma supervisada con un conjunto de datos relativamente pequeño de pares de indicaciones a un asistente y sus correspondientes respuestas, escritas por anotadores humanos.

Modelo de recompensa

El modelo de recompensa es una función que toma una cadena (fragmento de texto) como entrada y produce un único número, que es la "recompensa". [ 40 ]

Generalmente se inicializa con un modelo preentrenado, ya que esto le proporciona una comprensión del lenguaje y centra el entrenamiento explícitamente en el aprendizaje de las preferencias humanas. Además de utilizarse para inicializar el modelo de recompensa y la política de aprendizaje por refuerzo, el modelo también se utiliza para muestrear datos que serán comparados por los anotadores. [ 17 ] [ 16 ]

El modelo de recompensa se entrena reemplazando la capa final del modelo anterior con una capa de regresión inicializada aleatoriamente . Este cambio transforma el modelo, pasando de su tarea original de clasificación sobre su vocabulario a simplemente generar un número que corresponde a la puntuación de cualquier indicación y respuesta dadas. Este modelo se entrena con los datos de comparación de preferencias humanas recopilados previamente por el modelo supervisado. En particular, se entrena para minimizar la siguiente función de pérdida de entropía cruzada :L(θ)=1(K2)mi(incógnita,yw,yl)[registro(σ(rθ(incógnita,yw)rθ(incógnita,yl)))]=1(K2)mi(incógnita,yw,yl)registro[mirθ(incógnita,yw)mirθ(incógnita,yw)+mirθ(incógnita,yl)]{\displaystyle {\mathcal {L}}(\theta )=-{\frac {1}{K \choose 2}}E_{(x,y_{w},y_{l})}[\log(\sigma (r_{\theta }(x,y_{w})-r_{\theta }(x,y_{l})))]=-{\frac {1}{K \choose 2}}E_{(x,y_{w},y_{l})}\log \left[{\frac {e^{r_{\theta }(x,y_{w})}}{e^{r_{\theta }(x,y_{w})}+e^{r_{\theta }(x,y_{l})}}}\right]}

dóndeK{\displaystyle K}es el número de respuestas que los etiquetadores clasificaron,rθ(incógnita,y){\displaystyle r_{\theta }(x,y)}es la salida del modelo de recompensa para promptincógnita{\displaystyle x}y finalizacióny{\displaystyle y},yw{\displaystyle y_{w}}es la finalización preferida sobreyl{\displaystyle y_{l}},σ(incógnita){\displaystyle \sigma (x)}denota la función sigmoide ymi[incógnita]{\displaystyle E[X]}denota el valor esperado . [ 17 ] Esto puede pensarse como una forma de regresión logística , donde el modelo predice la probabilidad de que una respuestayw{\displaystyle y_{w}}se prefiere sobreyl{\displaystyle y_{l}}.

Esta función de pérdida mide esencialmente la diferencia entre las predicciones del modelo de recompensa y las decisiones tomadas por los humanos. El objetivo es hacer que las predicciones del modelo se acerquen lo más posible a las preferencias de los humanos minimizando la diferencia medida por esta ecuación. En el caso de comparaciones por pares únicamente,K=2{\displaystyle K=2}, por lo tanto el factor de1/(K2)=1{\displaystyle 1/{\tbinom {K}{2}}=1}. [ 16 ] En general, todos(K2){\displaystyle {\tbinom {K}{2}}}Las comparaciones de cada indicación se utilizan para el entrenamiento como un solo lote . [ 17 ]

Después del entrenamiento, las salidas del modelo se normalizan de manera que las completaciones de referencia tengan una puntuación media de 0. Es decir, [ 16 ]yrθ(incógnita,y)=0{\textstyle \sum _{y}r_{\theta }(x,y)=0} para cada par de consulta y referencia(incógnita,y){\displaystyle (x,y)}calculando la recompensa media en el conjunto de datos de entrenamiento y estableciéndola como el sesgo en el cabezal de recompensa.

Política

El modelo de política es una función que toma una cadena como entrada y produce otra. Generalmente, en el modelado del lenguaje, la cadena de salida no se produce en una sola pasada hacia adelante, sino en múltiples pasadas hacia adelante, generadas de forma autorregresiva. De manera similar al modelo de recompensa, la política de retroalimentación humana también se inicializa a partir de un modelo preentrenado. [ 16 ]

La clave reside en comprender la generación del lenguaje como si fuera un juego que aprende el aprendizaje por refuerzo (RL). En RL, una política es una función que asigna un estado del juego a una acción del juego. En RLHF, el "juego" consiste en responder a indicaciones. Una indicación y todos los tokens generados previamente constituyen el estado del juego, y generar un nuevo token es una acción del juego. [ 41 ]

El primer paso en su entrenamiento es el ajuste fino supervisado (SFT). Este paso no requiere el modelo de recompensa. En cambio, el modelo preentrenado se entrena en un conjunto de datos.DSFT{\displaystyle D_{SFT}}que contiene pares de pregunta-respuesta(incógnita,y){\displaystyle (x,y)}Luego, durante el SFT, el modelo se entrena para generar autorregresivamente la respuesta correspondiente.y{\displaystyle y}cuando se le da una indicación aleatoriaincógnita{\displaystyle x}El artículo original recomienda utilizar SFT solo durante una época, ya que un uso mayor provoca sobreajuste.

El conjunto de datosDSFT{\displaystyle D_{SFT}}Por lo general, son redactados por profesionales contratados, quienes escriben tanto las preguntas como las respuestas.

El segundo paso utiliza un método de gradiente de política para el modelo de recompensa. Utiliza un conjunto de datos.DRL{\displaystyle D_{RL}}, que contiene indicaciones, pero no respuestas. Al igual que la mayoría de los métodos de gradiente de política, este algoritmo tiene un bucle externo y dos bucles internos:

  • Inicializar la políticaπϕRL{\displaystyle \pi _{\phi }^{RL}}aπSFT{\displaystyle \pi ^{SFT}}, el resultado de la política de SFT.
  • Repetir durante muchos pasos.
    • Inicializa un nuevo conjunto de datos vacío.DπϕRL{\displaystyle D_{\pi _{\phi }^{RL}}}.
    • Repetir durante muchos pasos
      • Muestra una pregunta aleatoriaincógnita{\displaystyle x}deDRL{\displaystyle D_{RL}}.
      • Generar una respuestay{\displaystyle y}de la políticaπϕRL{\displaystyle \pi _{\phi }^{RL}}.
      • Calcular la señal de recompensarθ(incógnita,y){\displaystyle r_{\theta }(x,y)}del modelo de recompensarθ{\displaystyle r_{\theta }}.
      • Añade el triple(incógnita,y,rθ(incógnita,y)){\displaystyle (x,y,r_{\theta }(x,y))}aDπϕRL{\displaystyle D_{\pi _{\phi }^{RL}}}.
    • Actualizarϕ{\displaystyle \phi }mediante un método de gradiente de política para aumentar la función objetivoobjetivo(ϕ)=mi(incógnita,y)DπϕRL[rθ(incógnita,y)βregistro(πϕRL(y|incógnita)πSFT(y|incógnita))]{\displaystyle {\text{objective}}(\phi )=E_{(x,y)\sim D_{\pi _{\phi }^{\text{RL}}}}\left[r_{\theta }(x,y)-\beta \log \left({\frac {\pi _{\phi }^{\text{RL}}(y|x)}{\pi ^{\text{SFT}}(y|x)}}\right)\right]}

Tenga en cuenta que(incógnita,y)DπϕRL{\displaystyle (x,y)\sim D_{\pi _{\phi }^{\text{RL}}}}es equivalente aincógnitaDRL,yπϕRL(|incógnita){\displaystyle x\sim D_{RL},y\sim \pi _{\phi }^{\text{RL}}(\cdot |x)}, lo que significa "muestrear una solicitud deDRL{\displaystyle D_{RL}}, luego, seleccione una respuesta de la política".

La función objetivo tiene dos partes. La primera parte es simplemente la recompensa esperada.mi[r]{\displaystyle E[r]}y es estándar para cualquier algoritmo RL. La segunda parte es un "término de penalización" que involucra la divergencia KL . La fuerza del término de penalización está determinada por el hiperparámetro.β{\displaystyle \beta }.

Este término KL funciona penalizando la divergencia KL (una medida de distancia estadística entre distribuciones) entre el modelo que se está ajustando y el modelo supervisado inicial. Al elegir un valor apropiadoβ{\displaystyle \beta }El entrenamiento puede equilibrar el aprendizaje a partir de nuevos datos y, al mismo tiempo, conservar información útil del modelo inicial, aumentando la generalización al evitar un ajuste demasiado preciso a los nuevos datos. Además de evitar que el nuevo modelo produzca resultados demasiado diferentes a los del modelo inicial, una segunda motivación para incluir el término KL es alentar al modelo a generar texto de alta entropía , para evitar que el modelo se reduzca a un pequeño número de respuestas predefinidas . [ 16 ]

En términos más sencillos, la función objetivo calcula qué tan bien se espera que las respuestas de la política se alineen con la retroalimentación humana. La política genera respuestas a las indicaciones, y cada respuesta se evalúa tanto en función de su coincidencia con las preferencias humanas (medida por el modelo de recompensa) como de su similitud con las respuestas que el modelo generaría de forma natural. El objetivo es equilibrar la mejora de la alineación con las preferencias humanas, al tiempo que se garantiza que las respuestas del modelo sigan siendo diversas y no se alejen demasiado de lo aprendido durante su entrenamiento inicial. Esto ayuda al modelo no solo a proporcionar respuestas que las personas consideren útiles o aceptables, sino también a mantener una comprensión amplia y evitar respuestas demasiado limitadas o repetitivas.

Optimización de políticas proximales

La función de política se suele entrenar mediante el algoritmo de optimización de políticas proximales (PPO). Es decir, el parámetroϕ{\displaystyle \phi }se entrena mediante ascenso de gradiente en la función sustituta recortada. [ 17 ] [ 16 ]

Clásicamente, el algoritmo PPO emplea una estimación de ventaja generalizada , lo que significa que hay un estimador de valor adicional.Vξt(incógnita){\displaystyle V_{\xi _{t}}(x)}que se actualiza simultáneamente con la políticaπϕtRL{\displaystyle \pi _{\phi _{t}}^{RL}}durante la capacitación de PPO:πϕtRL,Vξt,πϕt+1RL,Vξt+1,{\displaystyle \pi _{\phi _{t}}^{RL},V_{\xi _{t}},\pi _{\phi _{t+1}}^{RL},V_{\xi _{t+1}},\dots }. [ 42 ] El estimador de valor se utiliza solo durante el entrenamiento, y no fuera del entrenamiento.

El PPO utiliza el descenso de gradiente en la siguiente ventaja sustituta recortada :LPPO(ϕ):=miincógnitaDRL,yπϕt(y|incógnita)[min(πϕRL(y|incógnita)πϕtRL(y|incógnita)A(incógnita,y),dolipag(πϕRL(y|incógnita)πϕtRL(y|incógnita),1ϵ,1+ϵ)A(incógnita,y))]{\displaystyle L_{\text{PPO}}(\phi ):=E_{x\sim D_{\text{RL}},y\sim \pi _{\phi _{t}}(y|x)}\left[\min \left({\frac {\pi _{\phi }^{RL}(y|x)}{\pi _{\phi _{t}}^{RL}(y|x)}}A(x,y),\mathrm {clip} \left({\frac {\pi _{\phi }^{RL}(y|x)}{\pi _{\phi _{t}}^{RL}(y|x)}},1-\epsilon ,1+\epsilon \right)A(x,y)\right)\right]}

donde el término de ventajaA(incógnita,y){\displaystyle A(x,y)}se define comorθ(incógnita,y)Vξt(incógnita){\displaystyle r_{\theta }(x,y)-V_{\xi _{t}}(x)}Es decir, la ventaja se calcula como la diferencia entre la recompensa (el retorno esperado) y la estimación del valor (el retorno esperado de la política). Esto se utiliza para entrenar la política mediante ascenso de gradiente , generalmente utilizando un optimizador de gradiente de momento estándar, como el optimizador Adam .

El artículo original inicializó el estimador de valor a partir del modelo de recompensa entrenado. [ 16 ] Dado que PPO es un algoritmo actor-crítico, el estimador de valor se actualiza simultáneamente con la política, minimizando el error TD al cuadrado, que en este caso es igual al término de ventaja al cuadrado:LTD(ξ)=mi(incógnita,y)DπϕtRL[(rθ(incógnita,y)βregistro(πϕtRL(y|incógnita)πSFT(y|incógnita))Vξ(incógnita))2]{\displaystyle L_{\text{TD}}(\xi )=\mathbb {E} _{(x,y)\sim D{\pi _{\phi _{t}}^{\text{RL}}}}\left[\left(r_{\theta }(x,y)-\beta \log \left({\frac {\pi _{\phi _{t}}^{\text{RL}}(y|x)}{\pi ^{\text{SFT}}(y|x)}}\right)-V_{\xi }(x)\right)^{2}\right]}que se minimiza mediante descenso de gradiente . Se pueden utilizar otros métodos además del error TD cuadrático. Consulte la página del algoritmo actor-crítico para obtener más detalles.

Mezcla de gradientes de preentrenamiento

Un tercer término se suele añadir a la función objetivo para evitar que el modelo olvide catastróficamente. Por ejemplo, si el modelo solo se entrena en atención al cliente, podría olvidar conocimientos generales de geografía. Para evitar esto, el proceso RLHF incorpora el objetivo de modelado de lenguaje original. Es decir, algunos textos aleatoriosincógnita{\displaystyle x}se obtienen mediante muestreo del conjunto de datos de preentrenamiento originalDpreentrenamiento{\displaystyle D_{\text{pretrain}}}y el modelo se entrena para maximizar la verosimilitud logarítmica del textoregistro(πϕRL(incógnita)){\displaystyle \log(\pi _{\phi }^{RL}(x))}La función objetivo final se escribe como:

L(ϕ)=mi(incógnita,y)DπϕRL[rθ(incógnita,y)βregistro(πϕRL(y|incógnita)πSFT(y|incógnita))]+γmiincógnitaDpreentrenamiento[registro(πϕRL(incógnita))]{\displaystyle L(\phi )=E_{(x,y)\sim D_{\pi _{\phi }^{\text{RL}}}}\left[r_{\theta }(x,y)-\beta \log \left({\frac {\pi _{\phi }^{\text{RL}}(y|x)}{\pi ^{\text{SFT}}(y|x)}}\right)\right]+\gamma E_{x\sim D_{\text{pretrain}}}[\log(\pi _{\phi }^{\text{RL}}(x))]}

dóndeγ{\displaystyle \gamma }controla la fuerza de este término de preentrenamiento. [ 17 ] Esta función objetivo combinada se llama PPO-ptx, donde "ptx" significa "Mezcla de gradientes de preentrenamiento". [ 9 ] Se utilizó por primera vez en el artículo de InstructGPT. [ 17 ]

En resumen, esta función objetivo define el método para ajustar la política de aprendizaje por refuerzo, combinando el objetivo de alinearse con la retroalimentación humana y mantener la comprensión del lenguaje original del modelo.

Así pues, escribiéndola de forma totalmente explícita, la función objetivo de PPO-ptx es:

LPPO-ptx(ϕ):=mi(incógnita,y)DπϕtRL[min(πϕRL(y|incógnita)πϕtRL(y|incógnita)A(incógnita,y),dolipag(πϕRL(y|incógnita)πϕtRL(y|incógnita),1ϵ,1+ϵ)A(incógnita,y))βregistro(πϕRL(y|incógnita)πSFT(y|incógnita))]+γmiincógnitaDpreentrenamiento[registro(πϕRL(incógnita))]{\displaystyle {\begin{aligned}L_{\text{PPO-ptx}}(\phi )&:=E_{(x,y)\sim D_{\pi _{\phi _{t}}^{\text{RL}}}}\left[\min \left({\frac {\pi _{\phi }^{RL}(y|x)}{\pi _{\phi _{t}}^{RL}(y|x)}}A(x,y),\mathrm {clip} \left({\frac {\pi _{\phi }^{RL}(y|x)}{\pi _{\phi _{t}}^{RL}(y|x)}},1-\epsilon ,1+\epsilon \right)A(x,y)\right)-\beta \log \left({\frac {\pi _{\phi }^{\text{RL}}(y|x)}{\pi ^{\text{SFT}}(y|x)}}\right)\right]\\&+\gamma E_{x\sim D_{\text{pretrain}}}[\log(\pi _{\phi }^{\text{RL}}(x))]\end{aligned}}} que se optimiza mediante ascenso de gradiente .

Limitaciones

RLHF presenta dificultades para recopilar retroalimentación humana, aprender un modelo de recompensa y optimizar la política. [ 43 ] En comparación con la recopilación de datos para técnicas como el aprendizaje no supervisado o auto-supervisado , la recopilación de datos para RLHF es menos escalable y más costosa. Su calidad y consistencia pueden variar según la tarea, la interfaz y las preferencias y sesgos de cada individuo. [ 17 ] [ 44 ]

La efectividad de RLHF depende de la calidad de la retroalimentación humana. Por ejemplo, el modelo puede volverse sesgado , favoreciendo a ciertos grupos sobre otros, si la retroalimentación carece de imparcialidad, es inconsistente o es incorrecta. [ 5 ] [ 45 ] Existe el riesgo de sobreajuste , donde el modelo memoriza ejemplos de retroalimentación específicos en lugar de aprender a generalizar . Por ejemplo, la retroalimentación predominantemente de un grupo demográfico específico podría llevar al modelo a aprender peculiaridades o ruido, junto con la alineación prevista. La alineación excesiva con la retroalimentación específica que recibió (es decir, con el sesgo en ella) puede llevar a que el modelo funcione de manera subóptima en nuevos contextos o cuando lo utilizan diferentes grupos. [ 46 ] Una sola función de recompensa no siempre puede representar las opiniones de diversos grupos de personas. Incluso con una muestra representativa, las opiniones y preferencias contradictorias pueden resultar en que el modelo de recompensa favorezca la opinión de la mayoría, lo que podría perjudicar a los grupos subrepresentados. [ 43 ]

En algunos casos, como es posible en el aprendizaje por refuerzo regular , puede existir el riesgo de que el modelo aprenda a manipular el proceso de retroalimentación o a engañar al sistema para obtener mayores recompensas en lugar de mejorar genuinamente su rendimiento. [ 47 ] En el caso de RLHF, un modelo puede aprender a explotar el hecho de que se le recompensa por lo que se evalúa positivamente y no necesariamente por lo que es realmente bueno, lo que puede llevarlo a aprender a persuadir y manipular. Por ejemplo, los modelos podrían aprender que la confianza aparente, incluso si es inexacta, genera mayores recompensas. Este comportamiento, si no se controla, no solo se incentiva, sino que también puede causar problemas de implementación significativos debido al potencial del modelo para engañar. Los estudios han encontrado que los humanos no son hábiles para identificar errores en las salidas de LLM en tareas complejas; por lo tanto, los modelos que aprenden a generar texto que suena seguro pero incorrecto pueden generar problemas significativos cuando se implementan. [ 43 ]

Alternativas

Aprendizaje por refuerzo a partir de la retroalimentación de la IA

De forma similar a RLHF, el aprendizaje por refuerzo a partir de la retroalimentación de la IA (RLAIF) se basa en el entrenamiento de un modelo de preferencias, con la diferencia de que la retroalimentación se genera automáticamente. [ 48 ] Esto se utiliza notablemente en la IA constitucional de Anthropic , donde la retroalimentación de la IA se basa en la conformidad con los principios de una constitución. [ 49 ]

Algoritmos de alineación directa

Los algoritmos de alineación directa (DAA) se han propuesto como una nueva clase de algoritmos [ 50 ] [ 51 ] que buscan optimizar directamente grandes modelos de lenguaje (LLM) en datos de retroalimentación humana de manera supervisada en lugar de los métodos tradicionales de gradiente de política.

Estos algoritmos buscan alinear los modelos con la intención humana de forma más transparente, eliminando el paso intermedio de entrenar un modelo de recompensa independiente. En lugar de predecir primero las preferencias humanas y luego optimizar en función de esas predicciones, los métodos de alineación directa entrenan los modelos de principio a fin con resultados etiquetados o seleccionados por humanos. Esto reduce los posibles riesgos de desalineación derivados de objetivos indirectos o manipulación de recompensas.

Al optimizar directamente el comportamiento preferido por los humanos, estos enfoques a menudo permiten una mayor alineación con los valores humanos, una mejor interpretabilidad y procesos de entrenamiento más sencillos en comparación con RLHF.

Optimización de preferencias directas

La optimización directa de preferencias (DPO) es una técnica para aprender las preferencias humanas. Al igual que RLHF, se ha aplicado para alinear grandes modelos de lenguaje preentrenados utilizando datos de preferencias generados por humanos. Sin embargo, a diferencia de RLHF, que primero entrena un modelo intermedio independiente para comprender cómo son los buenos resultados y luego enseña al modelo principal cómo lograrlos, DPO simplifica el proceso ajustando directamente el modelo principal según las preferencias de las personas. Utiliza un cambio de variables para definir la " pérdida de preferencia " directamente como una función de la política y usa esta pérdida para ajustar el modelo, ayudándolo a comprender y priorizar las preferencias humanas sin necesidad de un paso adicional. En esencia, este enfoque moldea directamente las decisiones del modelo basándose en la retroalimentación humana, ya sea positiva o negativa.

Recordemos que la estructura de RLHF es la siguiente:

  • Comenzamos recopilando un conjunto de datos sobre preferencias humanas.D{\displaystyle D}.
  • Luego ajustamos un modelo de recompensa.r{\displaystyle r^{*}}a los datos, mediante estimación de máxima verosimilitud utilizando el modelo de Plackett-Luce.r=argmáximormi(incógnita,y1,,ynorte)D[lnk=1nortemir(incógnita,yk)i=knortemir(incógnita,yi)]{\displaystyle r^{*}=\arg \max _{r}\mathbb {E} _{(x,y_{1},\dots ,y_{N})\sim D}\left[\ln \prod _{k=1}^{N}{\frac {e^{r(x,y_{k})}}{\sum _{i=k}^{N}e^{r(x,y_{i})}}}\right]}
  • Finalmente entrenamos una política óptimaπ{\displaystyle \pi ^{*}}que maximiza la función objetivo:π=argmáximoπRLmi(incógnita,y)DπRL[r(incógnita,y)βregistro(πRL(y|incógnita)πSFT(y|incógnita))]{\displaystyle \pi ^{*}=\arg \max _{\pi ^{\text{RL}}}\mathbb {E} _{(x,y)\sim D_{\pi ^{\text{RL}}}}\left[r^{*}(x,y)-\beta \log \left({\frac {\pi ^{\text{RL}}(y|x)}{\pi ^{\text{SFT}}(y|x)}}\right)\right]}

Sin embargo, en lugar de realizar el paso intermedio del modelo de recompensa, DPO optimiza directamente la política final.

Primero, se resuelve directamente para obtener la política óptima, lo cual se puede hacer mediante multiplicadores de Lagrange , como es habitual en mecánica estadística :π(y|incógnita)=πSFT(y|incógnita)exp(r(incógnita,y)/β)Z(incógnita),{\displaystyle \pi ^{*}(y|x)={\frac {\pi ^{\text{SFT}}(y|x)\exp(r^{*}(x,y)/\beta )}{Z(x)}},}

dóndeZ(incógnita){\displaystyle Z(x)}es la función de partición . Desafortunadamente, esto no es manejable, ya que requiere sumar sobre todas las posibles respuestas :Z(incógnita)=yπSFT(y|incógnita)exp(r(incógnita,y)/β)=miyπSFT(|incógnita)[exp(r(incógnita,y)/β)]{\displaystyle Z(x)=\sum _{y}\pi ^{\text{SFT}}(y|x)\exp(r^{*}(x,y)/\beta )=\mathbb {E} _{y\sim \pi ^{\text{SFT}}(\cdot |x)}[\exp(r^{*}(x,y)/\beta )]}

A continuación, invertimos esta relación para expresar la recompensa implícitamente en términos de la política óptima:r(incógnita,y)=βregistroπ(y|incógnita)πSFT(y|incógnita)+βregistroZ(incógnita).{\displaystyle r^{*}(x,y)=\beta \log {\frac {\pi ^{*}(y|x)}{\pi ^{\text{SFT}}(y|x)}}+\beta \log Z(x).}

Finalmente, al sustituirlo de nuevo en el estimador de máxima verosimilitud, obtenemos [ 52 ] : Apéndice Aπ=argmáximoπmi(incógnita,y1,,ynorte)D[lnk=1nortemiβregistroπ(yk|incógnita)πSFT(yk|incógnita)i=knortemiβregistroπ(yi|incógnita)πSFT(yi|incógnita)]{\displaystyle \pi ^{*}=\arg \max _{\pi }\mathbb {E} _{(x,y_{1},\dots ,y_{N})\sim D}\left[\ln \prod _{k=1}^{N}{\frac {e^{\beta \log {\frac {\pi (y_{k}|x)}{\pi ^{\text{SFT}}(y_{k}|x)}}}}{\sum _{i=k}^{N}e^{\beta \log {\frac {\pi (y_{i}|x)}{\pi ^{\text{SFT}}(y_{i}|x)}}}}}\right]}

Por lo general, DPO se utiliza para modelar la preferencia humana en comparaciones por pares, de modo quenorte=2{\displaystyle N=2}En ese caso, tenemosπ=argmáximoπmi(incógnita,yw,yl)D[registroσ(βregistroπ(yw|incógnita)πSFT(yw|incógnita)βregistroπ(yl|incógnita)πSFT(yl|incógnita))]{\displaystyle \pi ^{*}=\arg \max _{\pi }\mathbb {E} _{(x,y_{w},y_{l})\sim D}\left[\log \sigma \left(\beta \log {\frac {\pi (y_{w}|x)}{\pi ^{\text{SFT}}(y_{w}|x)}}-\beta \log {\frac {\pi (y_{l}|x)}{\pi ^{\text{SFT}}(y_{l}|x)}}\right)\right]}

DPO elimina la necesidad de un modelo de recompensa independiente o un bucle de aprendizaje por refuerzo, tratando la alineación como un problema de aprendizaje supervisado sobre datos de preferencia. Esto es más sencillo de implementar y entrenar que RLHF y se ha demostrado que produce resultados comparables y, en ocasiones, superiores. [ 52 ] Sin embargo, también se ha demostrado que RLHF supera a DPO en algunos conjuntos de datos, por ejemplo, en pruebas comparativas que intentan medir la veracidad. Por lo tanto, la elección del método puede variar según las características de los datos de preferencia humana y la naturaleza de la tarea. [ 53 ]

Optimización de preferencias de identidad

La optimización de preferencias de identidad (IPO) [ 54 ] es una modificación del objetivo DPO original que introduce un término de regularización para reducir la posibilidad de sobreajuste incluso cuando los datos de preferencia son ruidosos.

Para resolver este objetivo, IPO minimiza la función de pérdida cuadrática.miincógnita,yw,ylD[hπ(incógnita,yw,yl)12β1]2{\displaystyle {\begin{aligned}&\mathbb {E} _{x,y_{w},y_{l}\sim D}[h_{\pi }(x,y_{w},y_{l})-{\frac {1}{2}}\beta ^{-1}]^{2}\end{aligned}}}dóndehπ(incógnita,yw,yl)=registro(πθ(yw|incógnita)πárbitro(yw|incógnita)))registro(πθ(yl|incógnita)πárbitro(yl|incógnita)){\displaystyle h_{\pi }(x,y_{w},y_{l})=\log \left({\frac {\pi _{\theta }(y_{w}|x)}{\pi _{\text{ref}}(y_{w}|x))}}\right)-\log \left({\frac {\pi _{\theta }(y_{l}|x)}{\pi _{\text{ref}}(y_{l}|x)}}\right)}.

IPO puede controlar la diferencia entre las razones de verosimilitud logarítmica del modelo de política y la referencia, regularizando siempre la solución hacia el modelo de referencia. Permite aprender directamente de las preferencias sin una etapa de modelado de recompensas y sin depender del supuesto de modelado de Bradley-Terry , que asume que las preferencias por pares pueden sustituirse por recompensas puntuales. [ 54 ]

Optimización de Kahneman-Tversky

La optimización de Kahneman-Tversky (KTO) [ 55 ] es otro algoritmo de alineación directa que se basa en la teoría de la perspectiva para modelar la incertidumbre en las decisiones humanas. A diferencia de DPO, KTO solo requiere una señal de retroalimentación binaria (deseable o indeseable) en lugar de pares de preferencias explícitas.

La función de valorv(incógnita,y){\displaystyle v(x,y)}se define por partes dependiendo de siy{\displaystyle y}es deseable (λD{\displaystyle \lambda _{D}}) o indeseable (λU{\displaystyle \lambda _{U}}):

v(incógnita,y)={λDσ(β(rθ(incógnita,y)z0)),si yydmisirablmiincógnita,λUσ(β(z0rθ(incógnita,y))),si yynortedmisirablmiincógnita{\displaystyle v(x,y)\;=\;{\begin{cases}\lambda _{D}\,\sigma \!{\bigl (}\,\beta \,{\bigl (}r_{\theta }(x,y)\;-\;z_{0}{\bigr )}{\bigr )},&\quad {\text{if }}y\sim y_{\mathrm {desirable} \mid x},\\[6pt]\lambda _{U}\,\sigma \!{\bigl (}\,\beta \,{\bigl (}z_{0}\;-\;r_{\theta }(x,y){\bigr )}{\bigr )},&\quad {\text{if }}y\sim y_{\mathrm {undesirable} \mid x}\end{cases}}}

Aquí,β{\displaystyle \beta }controla cuán “aversa al riesgo” es la función de valor (mayorβ{\displaystyle \beta }= saturación más rápida en la función logísticaσ{\displaystyle \sigma })yz0=KL(πθ(yincógnita)πrmiF(yincógnita)){\textstyle z_{0}=\mathrm {KL} \!{\Bigl (}\,\pi _{\theta }(y'\mid x)\;{\big \Vert }\;\pi _{\mathrm {ref} }(y'\mid x){\Bigr )}}es una línea base dada por la divergencia de Kullback-Leibler. Dado que muchos sistemas de retroalimentación del mundo real generan datos de "me gusta/no me gusta" con mayor facilidad que las comparaciones por pares, KTO está diseñado para ser eficiente en el uso de datos y para reflejar la "aversión a las pérdidas" de forma más directa mediante el uso de una noción sencilla de "bueno vs. malo" a nivel de ejemplo.

Véase también

Referencias

  1. Kongot, Aparna (2025). IA centrada en el ser humano: una búsqueda científica ilustrada (Serie de interacción persona-ordenador) . Springer. pág.  389. ISBN 978-3031613746.
  2. Lan, Xuguang (2025). Robótica inteligente y aplicaciones: 17.ª Conferencia Internacional, ICIRA 2024, Xi'an, China, 31 de julio - 2 de agosto de 2024, Actas, Parte VIII (Lecture Notes in Computer Science Book 15208) . Springer. pág. 6. 
  3. Russell, Stuart J.; Norvig, Peter (2016). Inteligencia artificial: un enfoque moderno (Tercera edición global). Boston Columbus Indianápolis Nueva York San Francisco Upper Saddle River Ámsterdam Ciudad del Cabo Dubái Londres Madrid Milán Múnich París Montreal Toronto Delhi Ciudad de México São Paulo Sídney Hong Kong Seúl Singapur Taipéi Tokio: Pearson. págs. 830–831 . ISBN   978-0-13-604259-4.
  4. 1 2 Ziegler, Daniel M.; Stiennon, Nisan; Wu, Jeffrey; Brown, Tom B.; Radford, Alec; Amodei, Dario; Christiano, Paul; Irving, Geoffrey (2019). "Ajuste fino de modelos de lenguaje a partir de preferencias humanas". arXiv : 1909.08593 [ cs.CL ].
  5. 1 2 3 4 Lambert, Nathan; Castricato, Louis; von Werra, Leandro; Havrilla, Alex. "Ilustración del aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF)" . huggingface.co . Consultado el 4 de marzo de 2023 .
  6. Schulman, John; Wolski, Filip; Dhariwal, Prafulla; Radford, Alec; Klimov, Oleg (2017). "Algoritmos de optimización de políticas proximales". arXiv : 1707.06347 [ cs.LG ].
  7. ^ Tuan, Yi-Lin; Zhang, Jinzhi; Li, Yujia; Lee, Hung Yi (2018). "Optimización de políticas próximas y su versión dinámica para generación de secuencias". arXiv : 1808.07982 [ cs.CL ].
  8. 1 2 3 4 5 Amodei, Dario; Christiano, Paul; Ray, Alex (13 de junio de 2017). "Aprendizaje a partir de las preferencias humanas" . openai.com . Recuperado el 4 de marzo de 2023 .
  9. 1 2 Zheng, Rui; Dou, Shihan; Gao, Songyang; Hua, Yuan; Shen, Wei; Wang, Binghai; Liu, Yan; Jin, Senjie; Liu, Qin; Zhou, Yuhao; Xiong, Limao; Chen, Lu; Xi, Zhiheng; Xu, Nuo; Lai, Wenbin; Zhu, Minghao; Chang, Cheng; Yin, Zhangyue; Weng, Rongxiang; Cheng, Wensen; Huang, Haoran; Sol, Tianxiang; Yan, cuelga; Gui, Tao; Zhang, Qi; Qiu, Xipeng; Huang, Xuanjing (2023). "Secretos de RLHF en modelos de lenguaje grandes Parte I: PPO". arXiv : 2307.04964 [ cs.CL ].
  10. Knox, W. Bradley; Stone, Peter; Breazeal, Cynthia (2013). "Entrenamiento de un robot mediante retroalimentación humana: un estudio de caso" . Robótica social . Notas de clase en informática. Vol. 8239. Springer International Publishing. pp. 460–470 . doi : 10.1007/978-3-319-02675-6_46 . ISBN   978-3-319-02674-9Consultado el 26 de febrero de 2024 .
  11. Akrour, Riad; Schoenauer, Marc; Sebag, Michèle (2012). "APRIL: Aprendizaje por refuerzo basado en el aprendizaje de preferencias activas" . Aprendizaje automático y descubrimiento de conocimiento en bases de datos . Notas de clase en informática. Vol. 7524. Springer. pp. 116–131 . arXiv : 1208.0984 . doi : 10.1007/978-3-642-33486-3_8 . ISBN   978-3-642-33485-6Consultado el 26 de febrero de 2024 .
  12. Wilson, Aaron; Fern, Alan; Tadepalli, Prasad (2012). "Un enfoque bayesiano para el aprendizaje de políticas a partir de consultas de preferencias de trayectoria" . Advances in Neural Information Processing Systems . 25. Curran Associates, Inc. Recuperado el 26 de febrero de 2024 .
  13. Schoenauer, Marc; Akrour, Riad; Sebag, Michele; Souplet, Jean-Christophe (18 de junio de 2014). " Programación mediante retroalimentación" . Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1503–1511 . Consultado el 26 de febrero de 2024 .
  14. Warnell, Garrett; Waytowich, Nicholas; Lawhern, Vernon; Stone, Peter (25 de abril de 2018). "Deep TAMER: Interactive Agent Shaping in High-Dimensional State Spaces". Actas de la Conferencia AAAI sobre Inteligencia Artificial . 32 (1). arXiv : 1709.10163 . doi : 10.1609/aaai.v32i1.11485 . S2CID 4130751 . 
  15. MacGlashan, James; Ho, Mark K.; Loftin, Robert; Peng, Bei; Wang, Guan; Roberts, David L.; Taylor, Matthew E.; Littman, Michael L. (6 de agosto de 2017). "Aprendizaje interactivo a partir de retroalimentación humana dependiente de políticas" . Actas de la 34.ª Conferencia Internacional sobre Aprendizaje Automático - Volumen 70. JMLR.org: 2285–2294 . arXiv : 1701.06049 .
  16. 1 2 3 4 5 6 7 8 9 10 Nisan Stiennon; Long Ouyang; Jeffrey Wu; Daniel Ziegler; Ryan Lowe; Chelsea Voss; Alec Radford; Dario Amodei; Paul F. Christiano (2020). "Aprender a resumir con retroalimentación humana" . Avances en sistemas de procesamiento de información neuronal . 33 .
  17. 1 2 3 4 5 6 7 8 9 10 11 12 Ouyang , Long; Wu, Jeffrey; Jiang, Xu; Almeida, Diogo; Wainwright, Carroll; Mishkin, Pamela; Zhang, Chong; Agarwal, Sandhini; Slama, Katarina; Gray, Alex; Schulman, John; Hilton, Jacob; Kelton, Fraser; Miller, Luke; Simens, Maddie; Askell, Amanda; Welinder, Peter; Christiano, Paul; Leike, Jan; Lowe, Ryan (31 de octubre de 2022). Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana . Trigésimo sexta Conferencia sobre Sistemas de Procesamiento de Información Neuronal: NeurIPS 2022. arXiv : 2203.02155 .
  18. Bai, Yuntao; Jones, Andy; Ndousse, Kamal; Askell, Amanda; Chen, Anna; DasSarma, Nova; Drain, Dawn; Fort, Stanislav; Ganguli, Deep; Henighan, Tom; Joseph, Nicholas; Kadavath, Saurav; Kernion, Jackson; Conerly, Tom; El-Showk, Sheer; Elhage, Nelson; Hatfield-Dodds, Zac; Hernandez, Danny; Hume, Tristan; Johnston, Scott; Kravec, Shauna; Lovitt, Liane; Nanda, Neel; Olsson, Catherine; Amodei, Dario; Brown, Tom; Clark, Jack; McCandlish, Sam; Olah, Chris; Mann, Ben; Kaplan, Jared (2022). "Entrenamiento de un asistente útil e inofensivo con aprendizaje por refuerzo a partir de la retroalimentación humana". arXiv : 2204.05862 [ cs.CL ].
  19. 1 2 Edwards, Benj (1 de diciembre de 2022). "OpenAI invita a todos a probar ChatGPT, un nuevo chatbot impulsado por IA, con resultados divertidos" . Ars Technica . Recuperado el 4 de marzo de 2023 .
  20. Abhishek, Gupta (5 de febrero de 2023). "Lograr una participación adecuada de las partes interesadas en la IA responsable" . VentureBeat . Recuperado el 4 de marzo de 2023 .
  21. ^ Fernández, Patricio; Madaán, Amán; Liu, Emmy; Farinhas, António; Pedro Henrique Martíns; Bertsch, Amanda; de Souza, José GC; Zhou, Shuyan; Wu, Tongshuang; Neubig, Graham; Martins, André FT (2023). "Cerrando la brecha: una encuesta sobre la integración de la retroalimentación (humana) para la generación del lenguaje natural". arXiv : 2305.00955 [ cs.CL ].
  22. 1 2 Xie, Tengyang; Jiang, Nan; Wang, Huan; Xiong, Caiming; Bai, Yu (2021). "Ajuste fino de políticas: uniendo el aprendizaje por refuerzo fuera de línea y en línea eficiente en muestras" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 27395–27407 . arXiv : 2106.04895 . Recuperado el 10 de marzo de 2024 .
  23. 1 2 Pacchiano, Aldo; Saha, Aadirupa; Lee, Jonathan (2023-03-03). "Dueling RL: Reinforcement Learning with Trajectory Preferences" . Actas de la 26.ª Conferencia Internacional sobre Inteligencia Artificial y Estadística . PMLR: 6263–6289 . arXiv : 2111.04850 .
  24. 1 2 Zhu, Banghua; Jordan, Michael; Jiao, Jiantao (2023-07-03). "Aprendizaje por refuerzo basado en principios con retroalimentación humana a partir de comparaciones por pares o K" . Actas de la 40.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 43037–43067 . arXiv : 2301.11270 .
  25. Li, Zihao; Yang, Zhuoran; Wang, Mengdi (20 de junio de 2023). "Aprendizaje por refuerzo con retroalimentación humana: aprendizaje de decisiones dinámicas a través del pesimismo" . Taller ILHF ICML 2023. arXiv : 2305.18438 . Recuperado el 10 de marzo de 2024 .
  26. Ouyang, Long; Wu, Jeff; Jiang, Xu; Almeida, Diogo; Wainwright, Carroll L.; Mishkin, Pamela; Zhang, Chong; Agarwal, Sandhini; Slama, Katarina; Ray, Alex; Schulman, John; Hilton, Jacob; Kelton, Fraser; Miller, Luke; Simens, Maddie; Askell, Amanda; Welinder, Peter; Christiano, Paul; Leike, Jan; Lowe, Ryan (2022). "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana". arXiv : 2203.02155 [ cs.CL ].
  27. Wiggers, Kyle (24 de febrero de 2023). "¿Realmente se puede proteger la IA de los ataques basados ​​en texto?" . TechCrunch . Consultado el 4 de marzo de 2023 .
  28. Heikkilä, Melissa (21 de febrero de 2023). "Cómo OpenAI está tratando de hacer que ChatGPT sea más seguro y menos sesgado" . MIT Technology Review . Recuperado el 4 de marzo de 2023 .
  29. Douglas Heaven, Will (30 de noviembre de 2022). "ChatGPT es la última solución de OpenAI para GPT-3. Es elegante, pero sigue produciendo tonterías" . MIT Technology Review . Consultado el 4 de marzo de 2023 .
  30. Glaese, Amelia; McAleese, Nat; Trębacz, Maja; Aslanides, John; Firoiu, Vlad; Ewalds, Timo; Rauh, Maribeth; Weidinger, Laura; Chadwick, Martin; Thacker, Phoebe; Campbell-Gillingham, Lucy; Uesato, Jonathan; Huang, Po-Sen; Comanescu, Ramona; Yang, Fan; See, Abigail; Dathathri, Sumanth; Greig, Rory; Chen, Charlie; Fritz, Doug; Elias, Jaume Sanchez; Green, Richard; Mokrá, Soňa; Fernando, Nicholas; Wu, Boxi; Foley, Rachel; Young, Susannah; Gabriel, Iason; Isaac, William; Mellor, John; Hassabis, Demis; Kavukcuoglu, Koray; Hendricks, Lisa Anne; Irving, Geoffrey (2022). "Mejora de la alineación de agentes de diálogo mediante juicios humanos específicos". arXiv : 2209.14375 [ cs.LG ].
  31. Goldman, Sharon (23 de septiembre de 2022). "Por qué DeepMind no está implementando su nuevo chatbot de IA y qué significa para la IA responsable" . VentureBeat . Consultado el 4 de marzo de 2023 .
  32. El equipo de Sparrow (22 de septiembre de 2022). "Creando agentes de diálogo más seguros" . www.deepmind.com . Consultado el 4 de marzo de 2023 .
  33. Pinchai, Sundar; Hassabis, Demis (6 de diciembre de 2023). "Presentamos Gemini: nuestro modelo de IA más grande y capaz" . Google . Consultado el 29 de febrero de 2024 .
  34. Henshall, Will (18 de julio de 2023). "Qué debes saber sobre Claude 2, el rival de ChatGPT de Anthropic" . TIME . Consultado el 6 de marzo de 2024 .
  35. Fan, Ying; Watkins, Olivia; Du, Yuqing; Liu, Hao; Ryu, Moonkyung; Boutilier, Craig; Abbeel, Pieter; Ghavamzadeh, Mohammad; Lee, Kangwook; Lee, Kimin (2 de noviembre de 2023). "DPOK: Aprendizaje por refuerzo para el ajuste fino de modelos de difusión de texto a imagen" . NeurIPS 2023. arXiv : 2305.16381 . Consultado el 1 de marzo de 2024 .
  36. Xu, Jiazheng; Liu, Xiao; Wu, Yuchen; Tong, Yuxuan; Li, Qinkai; Ding, Ming; Tang, Jie; Dong, Yuxiao (15 de diciembre de 2023). "ImageReward: Aprendizaje y evaluación de las preferencias humanas para la generación de texto a imagen" . Advances in Neural Information Processing Systems . 36 : 15903–15935 . arXiv : 2304.05977 . Recuperado el 1 de marzo de 2024 .
  37. Lee, Kimin; Liu, Hao; Ryu, Moonkyung; Watkins, Olivia; Du, Yuqing; Boutilier, Craig; Abbeel, Pieter; Ghavamzadeh, Mohammad; Gu, Shixiang Shane (2023). "Alineación de modelos de texto a imagen mediante retroalimentación humana". arXiv : 2302.12192 [ cs.LG ].
  38. Leike, Jan; Martic, Miljan; Legg, Shane (12 de junio de 2017). "Aprendizaje a través de la retroalimentación humana" . www.deepmind.com . Recuperado el 4 de marzo de 2023 .
  39. Christiano, Paul F; Leike, Jan; Brown, Tom; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). "Aprendizaje profundo por refuerzo a partir de preferencias humanas" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. arXiv : 1706.03741 . Recuperado el 4 de marzo de 2023 .
  40. von Csefalvay, Chris (2026). "4. Aprendizaje por refuerzo: Mejor cada vez". Post-entrenamiento: Una guía práctica para ingenieros y desarrolladores de IA . No Starch Press. pp. 114–116 . ISBN  978-1-7185-0520-9.
  41. Iusztin, Paul (2024). Manual del ingeniero de LLM: Domine el arte de la ingeniería de grandes modelos de lenguaje desde el concepto hasta la producción . Packt Publishing. pág. 246. ISBN  978-1836200079.
  42. von Csefalvay, Chris (2026). "5. Optimización de preferencias: alternativas modernas a PPO". Post-Training: una guía práctica para ingenieros y desarrolladores de IA . No Starch Press. págs. 133–140 . ISBN  978-1-7185-0520-9.
  43. 1 2 3 Casper, Esteban; Davies, Xander; Shi, Claudia; Gilbert, Thomas Krendl; Scheurer, Jérémy; Rando, Javier; Liberto, Raquel; Korbak, Tomasz; Lindner, David; Freire, Pedro; Wang, Tony Tong; Marcos, Samuel; Segerie, Charbel-Raphael; Carroll, Miqueas; Peng, Andi; Christoffersen, Phillip; Damani, Mehul; Slocum, Stewart; Anwar, Usman; Siththaranjan, Anand; Nadeau, Max; Michaud, Eric J.; Pfau, Jacob; Krasheninnikov, Dmitrii; Chen, Xin; Langosco, Lauro; Hase, Pedro; Biyik, Erdem; Dragán, Anca; Krueger, David; Sadigh, Dorsa; Hadfield-Menell, Dylan (18 de septiembre de 2023). "Problemas abiertos y limitaciones fundamentales del aprendizaje por refuerzo a partir de la retroalimentación humana" . Transactions on Machine Learning Research . arXiv : 2307.15217 .
  44. Christiano, Paul (25 de enero de 2023). "Reflexiones sobre el impacto de la investigación RLHF" . Recuperado el 4 de marzo de 2023 .
  45. Belenguer, Lorenzo (2022). "Sesgo de la IA: exploración de modelos discriminatorios de toma de decisiones algorítmicas y la aplicación de posibles soluciones centradas en la máquina adaptadas de la industria farmacéutica" . IA y Ética . 2 (4). Ética de la IA: 771–787 . doi : 10.1007/s43681-022-00138-8 . PMC 8830968. PMID 35194591 .  
  46. Zhang, Chiyuan; Bengio, Samy; Hardt, Moritz; Recht, Benjamin; Vinyals, Oriol (4 de noviembre de 2016). "Comprender el aprendizaje profundo requiere repensar la generalización" . Conferencia Internacional sobre Representaciones de Aprendizaje.
  47. Clark, Jack; Amodei, Dario (21 de diciembre de 2016). "Funciones de recompensa defectuosas en entornos reales" . OpenAI.
  48. Lee, Harrison; Phatale, Samrat; Mansoor, Hassan; Lu, Kellie Ren; Mesnard, Thomas; Ferret, Johan; Bishop, Colton; Hall, Ethan; Carbune, Victor; Rastogi, Abhinav (2023-10-13). "RLAIF: Escalando el aprendizaje por refuerzo a partir de la retroalimentación humana con retroalimentación de IA" . ICLR .
  49. Edwards, Benj (09-05-2023). "La IA gana "valores" con el nuevo enfoque de chatbot de IA constitucional de Anthropic" . Ars Technica . Recuperado el 27-04-2024 .
  50. Rafailov, Rafael; Chittepu, Yaswanth; Park, Ryan; Sikchi, Harshit; Hejna, Joey; Knox, Bradley; Finn, Chelsea; Niekum, Scott (2024). "Leyes de escala para la sobreoptimización del modelo de recompensa en algoritmos de alineación directa". arXiv : 2406.02900 [ cs.LG ].
  51. Shi, Zhengyan; Land, Sander; Locatelli, Acyr; Geist, Matthieu; Bartolo, Max (2024). "Understanding Likelihood Over-optimisation in Direct Alignment Algorithms". arXiv : 2410.11677 [ cs.CL ].
  52. 1 2 Rafailov, Rafael; Sharma, Archit; Mitchell, Eric; Ermon, Stefano; Manning, Christopher D.; Finn, Chelsea (2023). "Optimización de preferencias directas: su modelo de lenguaje es secretamente un modelo de recompensa". arXiv : 2305.18290 [ cs.LG ].
  53. ^ Wang, Zhilin; Dong, Yi; Zeng, Jiaqi; Adams, Virginia; Sreedhar, Makesh Narsimhan; Egert, Daniel; Delalleau, Olivier; Scowcroft, Jane Polak; Kant, Neel; Golpe, Aidan; Kuchaiev, Oleksii (2023). "HelpSteer: conjunto de datos de utilidad de múltiples atributos para SteerLM". arXiv : 2311.09528 [ cs.CL ].
  54. 1 2 Mohammad Gheshlaghi Azar; Rowland, Mark; Piot, Bilal; Guo, Daniel; Calandriello, Daniele; Valko, Michal; Munos, Rémi (2023). "Un paradigma teórico general para comprender el aprendizaje a partir de las preferencias humanas". arXiv : 2310.12036 [ cs.AI ].
  55. ^ Ethayarajh, Kawin; Xu, Winnie; Muennighoff, Niklas; Jurafsky, Dan; Kiela, Douwe (2024). "KTO: alineación de modelos como optimización teórica de perspectivas". arXiv : 2402.01306 [ cs.LG ].

Lecturas adicionales

  • "Aprendizaje profundo por refuerzo a partir de las preferencias humanas" . NeurIPS . 2017.
  • "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana" . NeurIPS . 2022.
  • "Detalles de la implementación de RLHF con PPO" . huggingface.co . 24/10/2023.
  • "Optimización de políticas proximales: documentación de Spinning Up" . spinningup.openai.com . Consultado el 26 de enero de 2025 .
  • "Detalles de la implementación N+ de RLHF con PPO: un estudio de caso sobre la síntesis TL;DR" . COLM . 2024.