
En el aprendizaje automático y el control óptimo , el aprendizaje por refuerzo ( RL ) se centra en cómo un agente inteligente debe actuar en un entorno dinámico para maximizar una señal de recompensa. El aprendizaje por refuerzo es uno de los tres paradigmas básicos del aprendizaje automático , junto con el aprendizaje supervisado y el aprendizaje no supervisado .
Mientras que los algoritmos de aprendizaje supervisado y no supervisado intentan, respectivamente, descubrir patrones en datos etiquetados y no etiquetados, el aprendizaje por refuerzo implica entrenar a un agente mediante interacciones con su entorno. Para aprender a maximizar las recompensas de estas interacciones, el agente toma decisiones entre probar nuevas acciones para aprender más sobre el entorno (exploración) o usar el conocimiento actual del entorno para tomar la mejor acción (explotación). [ 1 ] La búsqueda del equilibrio óptimo entre estas dos estrategias se conoce como el dilema exploración-explotación .
El entorno se suele expresar en forma de un proceso de decisión de Markov , ya que muchos algoritmos de aprendizaje por refuerzo utilizan técnicas de programación dinámica . [ 2 ] La principal diferencia entre los métodos clásicos de programación dinámica y los algoritmos de aprendizaje por refuerzo es que estos últimos no presuponen el conocimiento de un modelo matemático exacto del proceso de decisión de Markov, y se centran en procesos de decisión de Markov de gran tamaño donde los métodos exactos resultan inviables. [ 3 ]
Principios
Debido a su generalidad, el aprendizaje por refuerzo se estudia en numerosas disciplinas, como la teoría de juegos , la teoría de control , la investigación operativa , la teoría de la información , la optimización basada en simulación , los sistemas multiagente , la inteligencia de enjambre y la estadística . En la literatura sobre investigación operativa y control, el aprendizaje por refuerzo se denomina programación dinámica aproximada o programación neurodinámica. Los problemas de interés en el aprendizaje por refuerzo también se han estudiado en la teoría del control óptimo , que se centra principalmente en la existencia y caracterización de soluciones óptimas y en algoritmos para su cálculo exacto, y menos en el aprendizaje o la aproximación (especialmente en ausencia de un modelo matemático del entorno).
El aprendizaje por refuerzo básico se modela como un proceso de decisión de Markov :
- Un conjunto de estados del entorno y del agente (el espacio de estados),;
- Un conjunto de acciones (el espacio de acciones),, del agente;
- , la probabilidad de transición (en el tiempo) del estadopara declararbajo acción.
- , la recompensa inmediata después de la transición deabajo acción.
El objetivo del aprendizaje por refuerzo es que el agente aprenda una política óptima (o casi óptima) que maximice la función de recompensa u otra señal de refuerzo proporcionada por el usuario que se acumula a partir de recompensas inmediatas. Esto es similar a los procesos que parecen ocurrir en la psicología animal. Por ejemplo, los cerebros biológicos están programados para interpretar señales como el dolor y el hambre como refuerzos negativos, e interpretar el placer y la ingesta de alimentos como refuerzos positivos. En algunas circunstancias, los animales aprenden a adoptar comportamientos que optimizan estas recompensas. Esto sugiere que los animales son capaces de aprender por refuerzo. [ 4 ] [ 5 ]
Un agente básico de aprendizaje por refuerzo interactúa con su entorno en pasos de tiempo discretos. En cada paso de tiempo t , el agente recibe el estado actual.y recompensaLuego elige una acción.del conjunto de acciones disponibles, que posteriormente se envía al entorno. El entorno pasa a un nuevo estado.y la recompensaasociado con la transiciónestá determinado. El objetivo de un agente de aprendizaje por refuerzo es aprender una política :
:{\mathcal {S}}\times {\mathcal {A}}\to [0,1]\\&\pi (s,a)=\Pr(A_{t}{=}a\mid S_{t}{=}s)\end{aligned}}}
que maximiza la recompensa acumulada esperada.
Formular el problema como un proceso de decisión de Markov supone que el agente observa directamente el estado ambiental actual; en este caso, se dice que el problema tiene observabilidad completa . Si el agente solo tiene acceso a un subconjunto de estados, o si los estados observados están corrompidos por ruido, se dice que el agente tiene observabilidad parcial , y formalmente el problema debe formularse como un proceso de decisión de Markov parcialmente observable . En ambos casos, el conjunto de acciones disponibles para el agente puede restringirse. Por ejemplo, el estado de un saldo de cuenta podría restringirse a ser positivo; si el valor actual del estado es 3 y la transición de estado intenta reducir el valor en 4, la transición no estará permitida.
Cuando se compara el desempeño de un agente con el de otro que actúa de forma óptima, la diferencia de desempeño da lugar al concepto de arrepentimiento . Para actuar de forma casi óptima, el agente debe reflexionar sobre las consecuencias a largo plazo de sus acciones (es decir, maximizar las recompensas futuras), aunque la recompensa inmediata asociada a ello pueda ser negativa.
Por lo tanto, el aprendizaje por refuerzo es particularmente adecuado para problemas que incluyen una compensación entre recompensas a largo y corto plazo. Se ha aplicado con éxito a diversos problemas, incluyendo almacenamiento de energía , [ 6 ] control de robots , [ 7 ] generadores fotovoltaicos , [ 8 ] backgammon , damas , [ 9 ] Go ( AlphaGo ) y sistemas de conducción autónoma . [ 10 ]
Dos elementos hacen que el aprendizaje por refuerzo sea potente: el uso de muestras para optimizar el rendimiento y el uso de la aproximación de funciones para manejar entornos grandes. Gracias a estos dos componentes clave, el aprendizaje por refuerzo se puede utilizar en entornos grandes en las siguientes situaciones:
- Se conoce un modelo del entorno, pero no se dispone de una solución analítica ;
- Solo se proporciona un modelo de simulación del entorno (el tema de la optimización basada en simulación ); [ 11 ]
- La única forma de recopilar información sobre el medio ambiente es interactuando con él.
Los dos primeros problemas podrían considerarse problemas de planificación (ya que se dispone de algún tipo de modelo), mientras que el último podría considerarse un verdadero problema de aprendizaje. Sin embargo, el aprendizaje por refuerzo transforma ambos problemas de planificación en problemas de aprendizaje automático .
Exploración
La disyuntiva entre exploración y explotación se ha estudiado más exhaustivamente a través del problema del bandido multi-brazo y para procesos de decisión de Markov con espacio de estados finito en Burnetas y Katehakis (1997). [ 12 ]
El aprendizaje por refuerzo requiere mecanismos de exploración inteligentes; la selección aleatoria de acciones, sin referencia a una distribución de probabilidad estimada, muestra un rendimiento deficiente. El caso de los procesos de decisión de Markov finitos (pequeños) se comprende relativamente bien. Sin embargo, debido a la falta de algoritmos que escalen bien con el número de estados (o que se adapten a problemas con espacios de estados infinitos), los métodos de exploración simples son los más prácticos.
Uno de esos métodos es-codicioso, dondees un parámetro que controla la cantidad de exploración frente a explotación. Con probabilidad, se elige la explotación y el agente elige la acción que cree que tiene el mejor efecto a largo plazo (los empates entre acciones se resuelven uniformemente al azar). Alternativamente, con probabilidadSe elige la exploración y la acción se elige uniformemente al azar.Suele ser un parámetro fijo, pero puede ajustarse según un cronograma (haciendo que el agente explore progresivamente menos) o de forma adaptativa basándose en heurísticas. [ 13 ]
Algoritmos para el aprendizaje del control
Incluso si se ignora la cuestión de la exploración e incluso si el estado fuera observable (lo cual se asumirá en adelante), el problema sigue siendo utilizar la experiencia pasada para descubrir qué acciones conducen a mayores recompensas acumuladas.
Criterio de optimalidad
Política
La selección de acciones del agente se modela como un mapa llamado política : :{\mathcal {A}}\times {\mathcal {S}}\to [0,1]\\&\pi (a,s)=\Pr(A_{t}{=}a\mid S_{t}{=}s)\end{aligned}}}
El mapa de políticas indica la probabilidad de tomar medidas.cuando esté en estado. [ 14 ] : 61 También existen políticas deterministas para quédenota la acción que debe jugarse en el estado.
Función de valor de estado
La función de valor de estadose define como el rendimiento descontado esperado a partir del estado, es deciry siguiendo sucesivamente la políticaPor lo tanto, en términos generales, la función de valor estima "cuán bueno" es estar en un estado dado. [ 14 ] : 60
donde la variable aleatoriadenota el rendimiento descontado y se define como la suma de las recompensas futuras descontadas:
dóndees la recompensa por la transición del estadoa,es la tasa de descuento .es menor que 1, por lo que las recompensas en el futuro lejano tienen menor peso que las recompensas en el futuro inmediato.
El algoritmo debe encontrar una política con el máximo retorno esperado descontado. Según la teoría de los procesos de decisión de Markov, se sabe que, sin pérdida de generalidad, la búsqueda puede restringirse al conjunto de las denominadas políticas estacionarias . Una política es estacionaria si la distribución de acciones que devuelve depende únicamente del último estado visitado (del historial del agente observador). La búsqueda puede restringirse aún más a políticas estacionarias deterministas . Una política estacionaria determinista selecciona acciones de forma determinista en función del estado actual. Dado que cualquier política de este tipo puede identificarse con una función que mapea el conjunto de estados al conjunto de acciones, estas políticas pueden identificarse con dichas funciones sin pérdida de generalidad.
Fuerza bruta
El método de fuerza bruta implica dos pasos:
- Para cada política posible, devuelve muestras mientras la sigue.
- Elija la póliza con el mayor retorno con descuento esperado.
Un problema es que el número de pólizas puede ser elevado, o incluso infinito. Otro es que la varianza de los rendimientos puede ser grande, lo que requiere muchas muestras para estimar con precisión el rendimiento descontado de cada póliza.
Estos problemas pueden mitigarse si asumimos cierta estructura y permitimos que las muestras generadas a partir de una política influyan en las estimaciones realizadas para otras. Los dos enfoques principales para lograr esto son la estimación de la función de valor y la búsqueda directa de políticas .
Función de valor
Los enfoques de función de valor intentan encontrar una política que maximice el rendimiento descontado manteniendo un conjunto de estimaciones de rendimientos descontados esperados.para alguna política (normalmente la "actual" [política vigente] o la óptima [política no vigente]).
Estos métodos se basan en la teoría de los procesos de decisión de Markov, donde la optimalidad se define en un sentido más estricto que el anterior: una política es óptima si logra el mejor rendimiento esperado descontado desde cualquier estado inicial (es decir, las distribuciones iniciales no influyen en esta definición). De nuevo, siempre se puede encontrar una política óptima entre las políticas estacionarias.
Para definir la optimalidad de manera formal, defina el valor de estado de una política.por
dónderepresenta el rendimiento descontado asociado con lo siguientedesde el estado inicial. Definicióncomo el máximo valor de estado posible de, dóndeestá permitido cambiar,
Una política que logra estos valores de estado óptimos en cada estado se denomina óptima . Claramente, una política que es óptima en este sentido también lo es en el sentido de que maximiza el rendimiento descontado esperado, ya que, dóndees un estado muestreado aleatoriamente de la distribuciónde estados iniciales (por lo tanto).
Aunque los valores de estado son suficientes para definir la optimalidad, es útil definir los valores de acción. Dado un estado, una accióny una política, el valor de acción del parbajose define por
dóndeahora representa el rendimiento descontado aleatorio asociado con la primera acción tomadaen el estadoy siguiente, posteriormente.
La teoría de los procesos de decisión de Markov establece que sies una política óptima, actuamos de manera óptima (tomamos la acción óptima) eligiendo la acción decon el valor de acción más alto en cada estado,. La función de valor de acción de dicha política óptima () se denomina función de valor de acción óptima y se suele denotar porEn resumen, el conocimiento de la función óptima de valor de acción es suficiente para saber cómo actuar de forma óptima.
Suponiendo un conocimiento completo del proceso de decisión de Markov, los dos enfoques básicos para calcular la función óptima de valor de acción son la iteración de valor y la iteración de política . Ambos algoritmos calculan una secuencia de funciones.() que convergen aEl cálculo de estas funciones implica calcular las expectativas sobre todo el espacio de estados, lo cual resulta impracticable salvo para los procesos de decisión de Markov más pequeños (finitos). En los métodos de aprendizaje por refuerzo, las expectativas se aproximan promediando sobre las muestras y utilizando técnicas de aproximación de funciones para abordar la necesidad de representar funciones de valor sobre grandes espacios de estados y acciones.
métodos de Monte Carlo
Los métodos de Monte Carlo [ 15 ] se utilizan para resolver problemas de aprendizaje por refuerzo promediando las respuestas de las muestras. A diferencia de los métodos que requieren un conocimiento completo de la dinámica del entorno, los métodos de Monte Carlo se basan únicamente en la experiencia real o simulada : secuencias de estados, acciones y recompensas obtenidas de la interacción con un entorno. Esto los hace aplicables en situaciones donde se desconoce la dinámica completa. Aprender de la experiencia real no requiere conocimiento previo del entorno y aún así puede conducir a un comportamiento óptimo. Al utilizar la experiencia simulada, solo se requiere un modelo capaz de generar transiciones de muestra, en lugar de una especificación completa de las probabilidades de transición , que es necesaria para los métodos de programación dinámica .
Los métodos de Monte Carlo se aplican a tareas episódicas, donde la experiencia se divide en episodios que finalmente terminan. Las actualizaciones de la política y la función de valor ocurren solo después de la finalización de un episodio, lo que hace que estos métodos sean incrementales, episodio por episodio, aunque no paso a paso (en línea). El término "Monte Carlo" generalmente se refiere a cualquier método que involucre muestreo aleatorio ; sin embargo, en este contexto, se refiere específicamente a métodos que calculan promedios a partir de rendimientos completos , en lugar de rendimientos parciales .
Estos métodos funcionan de manera similar a los algoritmos de bandidos , en los que los retornos se promedian para cada par estado-acción. La diferencia clave es que las acciones tomadas en un estado afectan los retornos de los estados subsiguientes dentro del mismo episodio, lo que hace que el problema no sea estacionario . Para abordar esta no estacionariedad, los métodos de Monte Carlo utilizan el marco de la iteración de políticas generales (GPI). Mientras que la programación dinámica calcula funciones de valor utilizando el conocimiento completo del proceso de decisión de Markov, los métodos de Monte Carlo aprenden estas funciones a través de retornos de muestra. Las funciones de valor y las políticas interactúan de manera similar a la programación dinámica para lograr la optimalidad , abordando primero el problema de predicción y luego extendiéndose a la mejora y el control de políticas, todo basado en la experiencia muestreada. [ 14 ]
Métodos de diferencia temporal
El primer problema se corrige permitiendo que el procedimiento modifique la política (en algunos o todos los estados) antes de que los valores se estabilicen. Esto también puede resultar problemático, ya que podría impedir la convergencia. La mayoría de los algoritmos actuales hacen esto, dando lugar a la clase de algoritmos de iteración de políticas generalizadas . Muchos métodos actor-crítico pertenecen a esta categoría.
El segundo problema se puede corregir permitiendo que las trayectorias contribuyan a cualquier par estado-acción en ellas. Esto también puede ayudar en cierta medida con el tercer problema, aunque una mejor solución cuando los retornos tienen alta varianza son los métodos de diferencia temporal (TD) de Sutton que se basan en la ecuación recursiva de Bellman . [ 16 ] [ 17 ] El cálculo en los métodos TD puede ser incremental (cuando después de cada transición se cambia la memoria y se descarta la transición) o por lotes (cuando las transiciones se agrupan y las estimaciones se calculan una vez basándose en el lote). Los métodos por lotes, como el método de diferencia temporal de mínimos cuadrados, [ 18 ] pueden usar mejor la información en las muestras, mientras que los métodos incrementales son la única opción cuando los métodos por lotes son inviables debido a su alta complejidad computacional o de memoria. Algunos métodos intentan combinar los dos enfoques. Los métodos basados en diferencias temporales también superan el cuarto problema.
Otro problema específico de TD proviene de su dependencia de la ecuación recursiva de Bellman. La mayoría de los métodos TD tienen una llamadaparámetroque permite interpolar continuamente entre los métodos de Monte Carlo que no dependen de las ecuaciones de Bellman y los métodos TD básicos que sí dependen completamente de dichas ecuaciones. Esto puede ser eficaz para paliar este problema.
Métodos de aproximación de funciones
Para abordar el quinto problema, se utilizan métodos de aproximación de funciones . La aproximación de funciones lineales comienza con una función de mapeo.que asigna un vector de dimensión finita a cada par estado-acción. Luego, los valores de acción de un par estado-acciónse obtienen combinando linealmente los componentes decon algunos pesos:
Los algoritmos ajustan entonces los pesos, en lugar de ajustar los valores asociados a los pares individuales estado-acción. Se han explorado métodos basados en ideas de la estadística no paramétrica (que, como se puede observar, construyen sus propias características).
La iteración de valor también puede utilizarse como punto de partida, dando lugar al algoritmo Q-learning y sus numerosas variantes. [ 19 ] Incluyendo métodos de aprendizaje profundo Q cuando se utiliza una red neuronal para representar Q, con diversas aplicaciones en problemas de búsqueda estocástica. [ 20 ]
El problema de usar valores de acción radica en que pueden requerir estimaciones muy precisas de los valores de acción en competencia, lo cual puede ser difícil de obtener cuando los retornos son ruidosos. Sin embargo, este problema se mitiga en cierta medida mediante métodos de diferencia temporal. El uso del método de aproximación de funciones compatibles compromete la generalidad y la eficiencia.
Búsqueda directa de pólizas
Un método alternativo consiste en buscar directamente en (algún subconjunto de) el espacio de políticas, en cuyo caso el problema se convierte en un caso de optimización estocástica . Los dos enfoques disponibles son los métodos basados en gradientes y los métodos sin gradientes.
Los métodos basados en gradientes ( métodos de gradiente de política ) comienzan con un mapeo de un espacio de dimensión finita (espacio de parámetros) al espacio de políticas: dado el vector de parámetros, dejardenota la política asociada a. Definiendo la función de rendimiento medianteEn condiciones suaves, esta función será diferenciable en función del vector de parámetros.. Si el gradiente deSe sabía que se podía usar el ascenso de gradiente . Dado que no se dispone de una expresión analítica para el gradiente, solo se dispone de una estimación con ruido. Dicha estimación se puede construir de muchas maneras, dando lugar a algoritmos como el método REINFORCE de Williams [ 21 ] (conocido como el método de razón de verosimilitud en la literatura de optimización basada en simulación ). [ 22 ]
Una amplia gama de métodos evita depender de la información del gradiente. Entre ellos se incluyen el recocido simulado , la búsqueda de entropía cruzada y los métodos de computación evolutiva . Muchos métodos sin gradiente pueden alcanzar (en teoría y en el límite) un óptimo global.
Los métodos de búsqueda de políticas pueden converger lentamente cuando hay datos ruidosos. Por ejemplo, esto ocurre en problemas episódicos cuando las trayectorias son largas y la varianza de los retornos es grande. Los métodos basados en funciones de valor que se basan en diferencias temporales podrían ser útiles en este caso. En los últimos años, se han propuesto métodos actor-crítico que han demostrado un buen rendimiento en diversos problemas. [ 23 ]
Los métodos de búsqueda de políticas se han utilizado en el contexto de la robótica . [ 24 ] Muchos métodos de búsqueda de políticas pueden quedarse atascados en óptimos locales (ya que se basan en la búsqueda local ).
Algoritmos basados en modelos
Finalmente, todos los métodos anteriores pueden combinarse con algoritmos que primero aprenden un modelo del proceso de decisión de Markov , la probabilidad de cada estado siguiente dada una acción tomada desde un estado existente. Por ejemplo, el algoritmo Dyna aprende un modelo a partir de la experiencia y lo utiliza para proporcionar más transiciones modeladas para una función de valor, además de las transiciones reales. [ 25 ] Dichos métodos a veces pueden extenderse al uso de modelos no paramétricos, como cuando las transiciones simplemente se almacenan y se "reproducen" en el algoritmo de aprendizaje. [ 26 ]
Los métodos basados en modelos pueden ser computacionalmente más intensivos que los enfoques sin modelos, y su utilidad puede verse limitada por el grado en que se puede aprender el proceso de decisión de Markov. [ 27 ]
Hay otras formas de usar modelos además de actualizar una función de valor. [ 28 ] Por ejemplo, en el control predictivo de modelos, el modelo se utiliza para actualizar el comportamiento directamente.
Aprendizaje por refuerzo parcialmente supervisado (ARPS)
La costosa exploración necesaria para aprender una política óptima puede reducirse si se dispone de datos supervisados. Esto puede lograrse, por ejemplo, aprendiendo una política de control básica y utilizándola para inicializar la tabla Q de forma inteligente en lugar de con ceros. [ 29 ]
Teoría
Se comprenden bien tanto el comportamiento asintótico como el de muestras finitas de la mayoría de los algoritmos. Se conocen algoritmos con un rendimiento en línea demostrablemente bueno (es decir, que se puede demostrar) (que abordan el problema de la exploración).
La exploración eficiente de los procesos de decisión de Markov se presenta en Burnetas y Katehakis (1997). [ 12 ] También han aparecido límites de rendimiento en tiempo finito para muchos algoritmos, pero se espera que estos límites sean bastante imprecisos y, por lo tanto, se necesita más trabajo para comprender mejor las ventajas y limitaciones relativas.
En el caso de los algoritmos incrementales, se han resuelto los problemas de convergencia asintótica. Los algoritmos basados en diferencias temporales convergen bajo un conjunto de condiciones más amplio que el que era posible anteriormente (por ejemplo, cuando se utilizan con aproximaciones de funciones suaves y arbitrarias).
Investigación
Los temas de investigación incluyen:
- arquitectura actor-crítico [ 30 ]
- Arquitectura actor-crítico-escenario [ 3 ]
- métodos adaptativos que funcionan con menos (o ningún) parámetro bajo un gran número de condiciones
- detección de errores en proyectos de software [ 31 ]
- aprendizaje continuo
- combinaciones con marcos basados en lógica (por ejemplo, especificaciones de lógica temporal, [ 32 ] máquinas de recompensa, [ 33 ] y argumentación probabilística). [ 34 ]
- exploración en grandes procesos de decisión de Markov
- aprendizaje por refuerzo basado en entidades [ 35 ] [ 36 ] [ 37 ]
- retroalimentación humana [ 38 ]
- Interacción entre el aprendizaje implícito y explícito en la adquisición de habilidades.
- motivación intrínseca que diferencia los comportamientos de búsqueda de información y de tipo curioso de los comportamientos orientados a objetivos dependientes de la tarea evaluaciones empíricas a gran escala
- grandes (o continuos) espacios de acción
- aprendizaje por refuerzo modular y jerárquico [ 39 ]
- El aprendizaje por refuerzo multiagente/distribuido es un tema de interés. Sus aplicaciones se están expandiendo. [ 40 ]
- control centrado en el ocupante
- optimización de los recursos informáticos [ 41 ] [ 42 ] [ 43 ]
- información parcial (por ejemplo, utilizando la representación predictiva del estado )
- función de recompensa basada en la maximización de información novedosa [ 44 ] [ 45 ] [ 46 ]
- planificación basada en muestras (por ejemplo, basada en la búsqueda en árbol de Monte Carlo ).
- negociación de valores [ 47 ]
- aprendizaje por transferencia [ 48 ]
- El aprendizaje TD modela el aprendizaje basado en la dopamina en el cerebro. Las proyecciones dopaminérgicas desde la sustancia negra a los ganglios basales funcionan como error de predicción.
- Métodos de búsqueda de políticas y funciones de valor
Comparación de algoritmos clave
La siguiente tabla enumera los algoritmos clave para aprender una política en función de varios criterios:
- El algoritmo puede ser on-policy (realiza actualizaciones de política utilizando trayectorias muestreadas a través de la política actual) [ 49 ] o off-policy.
- El espacio de acción puede ser discreto (por ejemplo, el espacio de acción podría ser "subir", "ir a la izquierda", "ir a la derecha", "bajar", "quedarse") o continuo (por ejemplo, mover el brazo con un ángulo determinado).
- El espacio de estados puede ser discreto (por ejemplo, el agente podría estar en una celda de una cuadrícula) o continuo (por ejemplo, el agente podría estar ubicado en una posición determinada en el plano).
aprendizaje por refuerzo asociativo
Las tareas de aprendizaje por refuerzo asociativo combinan aspectos de las tareas de autómatas de aprendizaje estocástico y las tareas de clasificación de patrones de aprendizaje supervisado. En las tareas de aprendizaje por refuerzo asociativo, el sistema de aprendizaje interactúa en un bucle cerrado con su entorno. [ 54 ]
aprendizaje por refuerzo profundo
Este enfoque extiende el aprendizaje por refuerzo mediante el uso de una red neuronal profunda y sin diseñar explícitamente el espacio de estados. [ 55 ] El trabajo sobre el aprendizaje de juegos ATARI realizado por Google DeepMind aumentó la atención hacia el aprendizaje profundo por refuerzo o el aprendizaje por refuerzo de extremo a extremo . [ 56 ]
aprendizaje profundo por refuerzo adversario
El aprendizaje profundo por refuerzo adversario es un área de investigación activa en el aprendizaje por refuerzo que se centra en las vulnerabilidades de las políticas aprendidas. En esta área de investigación, algunos estudios mostraron inicialmente que las políticas de aprendizaje por refuerzo son susceptibles a manipulaciones adversarias imperceptibles. [ 57 ] [ 58 ] [ 59 ] Si bien se han propuesto algunos métodos para superar estas susceptibilidades, en los estudios más recientes se ha demostrado que estas soluciones propuestas están lejos de proporcionar una representación precisa de las vulnerabilidades actuales de las políticas de aprendizaje profundo por refuerzo. [ 60 ]
aprendizaje por refuerzo difuso
Al introducir la inferencia difusa en el aprendizaje por refuerzo, [ 61 ] se hace posible aproximar la función de valor estado-acción con reglas difusas en un espacio continuo. La forma SI-ENTONCES de las reglas difusas hace que este enfoque sea adecuado para expresar los resultados en un formato cercano al lenguaje natural. Extender el FRL con interpolación de reglas difusas [ 62 ] permite el uso de bases de reglas difusas dispersas de tamaño reducido para enfatizar las reglas cardinales (los valores estado-acción más importantes).
Aprendizaje por refuerzo inverso
En el aprendizaje por refuerzo inverso (IRL), no se proporciona una función de recompensa. En cambio, la función de recompensa se infiere a partir de un comportamiento observado por un experto. La idea es imitar el comportamiento observado, que suele ser óptimo o cercano al óptimo. [ 63 ] Un paradigma popular de IRL se denomina aprendizaje por refuerzo inverso de máxima entropía (MaxEnt IRL). [ 64 ] MaxEnt IRL estima los parámetros de un modelo lineal de la función de recompensa maximizando la entropía de la distribución de probabilidad de las trayectorias observadas sujetas a restricciones relacionadas con la coincidencia de recuentos de características esperados. Recientemente se ha demostrado que MaxEnt IRL es un caso particular de un marco más general denominado aprendizaje por refuerzo inverso de utilidad aleatoria (RU-IRL). [ 65 ] RU-IRL se basa en la teoría de la utilidad aleatoria y los procesos de decisión de Markov. Si bien los enfoques previos de IRL asumen que el comportamiento aparentemente aleatorio de un agente observado se debe a que sigue una política aleatoria, RU-IRL asume que el agente observado sigue una política determinista, pero la aleatoriedad en el comportamiento observado se debe a que el observador solo tiene acceso parcial a las características que el agente observado utiliza en la toma de decisiones. La función de utilidad se modela como una variable aleatoria para tener en cuenta la ignorancia del observador respecto a las características que el agente observado considera realmente en su función de utilidad.
Aprendizaje por refuerzo multiobjetivo
El aprendizaje por refuerzo multiobjetivo (MORL) es una forma de aprendizaje por refuerzo que se ocupa de alternativas conflictivas. Se distingue de la optimización multiobjetivo en que se ocupa de agentes que actúan en entornos. [ 66 ] [ 67 ]
Aprendizaje por refuerzo seguro
El aprendizaje por refuerzo seguro (SRL) se puede definir como el proceso de aprender políticas que maximicen la expectativa del retorno en problemas en los que es importante asegurar un rendimiento razonable del sistema y/o respetar las restricciones de seguridad durante los procesos de aprendizaje y/o despliegue. [ 68 ] [ 69 ] Un enfoque alternativo es el aprendizaje por refuerzo con aversión al riesgo, donde en lugar del retorno esperado , se optimiza una medida de riesgo del retorno, como el valor condicional en riesgo (CVaR). [ 70 ] Además de mitigar el riesgo, el objetivo CVaR aumenta la robustez ante las incertidumbres del modelo. [ 71 ] [ 72 ] Sin embargo, la optimización de CVaR en el RL con aversión al riesgo requiere especial cuidado para evitar el sesgo de gradiente [ 73 ] y la ceguera al éxito. [ 74 ]
Aprendizaje por autorrefuerzo
El aprendizaje por autorrefuerzo (o autoaprendizaje) es un paradigma de aprendizaje que no utiliza el concepto de recompensa inmediata.después de la transición deacon acciónNo utiliza refuerzo externo, sino únicamente el autorrefuerzo interno del agente. Este autorrefuerzo interno se proporciona mediante mecanismos de sentimientos y emociones. En el proceso de aprendizaje, las emociones se retropropagan mediante un mecanismo de refuerzo secundario. La ecuación de aprendizaje no incluye la recompensa inmediata, sino solo la evaluación del estado.
El algoritmo de autorrefuerzo actualiza una matriz de memoria.de tal manera que en cada iteración se ejecuta la siguiente rutina de aprendizaje automático:
- En situaciónrealizar acción.
- Recibir una situación de consecuencia.
- Calcular la evaluación del estadode lo bueno que es estar en la situación de consecuencia.
- Actualizar la memoria de la barra transversal.
Las condiciones iniciales de la memoria se reciben como información del entorno genético. Es un sistema con una sola entrada (situación) y una sola salida (acción o comportamiento).
El autorrefuerzo (autoaprendizaje) se introdujo en 1982 junto con una red neuronal capaz de aprendizaje por autorrefuerzo, denominada Crossbar Adaptive Array (CAA). [ 75 ] [ 76 ] La CAA calcula, de forma transversal, tanto las decisiones sobre acciones como las emociones (sentimientos) sobre los estados de las consecuencias. El sistema se basa en la interacción entre la cognición y la emoción. [ 77 ]
Comparación estadística de algoritmos de aprendizaje por refuerzo
La comparación eficiente de algoritmos de aprendizaje por refuerzo (RL) es esencial para la investigación, el despliegue y la monitorización de sistemas RL. Para comparar diferentes algoritmos en un entorno dado, se puede entrenar un agente para cada algoritmo. Dado que el rendimiento es sensible a los detalles de implementación, todos los algoritmos deben implementarse de la forma más similar posible entre sí. [ 78 ] Una vez finalizado el entrenamiento, los agentes pueden ejecutarse en una muestra de episodios de prueba y sus puntuaciones (recompensas) pueden compararse. Dado que los episodios suelen considerarse independientes e idénticamente distribuidos ( i.i.d. ), se pueden utilizar herramientas estadísticas estándar para la comprobación de hipótesis, como la prueba t y la prueba de permutación . [ 79 ] Esto requiere acumular todas las recompensas dentro de un episodio en un único número: la recompensa episódica. Sin embargo, esto provoca una pérdida de información, ya que se promedian diferentes pasos de tiempo, posiblemente con diferentes niveles de ruido. Siempre que el nivel de ruido varíe a lo largo del episodio, la potencia estadística puede mejorarse significativamente ponderando las recompensas según su ruido estimado. [ 80 ]
Desafíos y limitaciones
A pesar de los importantes avances, el aprendizaje por refuerzo (RL) sigue enfrentándose a varios desafíos y limitaciones que dificultan su aplicación generalizada en escenarios del mundo real.
ineficiencia de la muestra
Los algoritmos de aprendizaje por refuerzo suelen requerir un gran número de interacciones con el entorno para aprender políticas efectivas, lo que conlleva altos costos computacionales y un entrenamiento del agente que consume mucho tiempo. Por ejemplo, el bot de OpenAI que juega a Dota utilizó miles de años de simulación de juego para alcanzar un rendimiento similar al humano. Se han propuesto técnicas como la repetición de experiencias y el aprendizaje curricular para reducir la ineficiencia de las muestras, pero estas técnicas añaden complejidad y no siempre son suficientes para aplicaciones del mundo real.
Problemas de estabilidad y convergencia
El entrenamiento de modelos de aprendizaje por refuerzo, especialmente de aquellos basados en redes neuronales profundas , puede ser inestable y propenso a la divergencia. Un pequeño cambio en la política o el entorno puede provocar fluctuaciones extremas en el rendimiento, dificultando la obtención de resultados consistentes. Esta inestabilidad se acentúa aún más en el caso de espacios de acción continuos o de alta dimensión, donde el proceso de aprendizaje se vuelve más complejo y menos predecible.
Generalización y transferibilidad
Los agentes de aprendizaje por refuerzo (RL) entrenados en entornos específicos suelen tener dificultades para generalizar sus estrategias aprendidas a escenarios nuevos y desconocidos. Este es el principal obstáculo que impide la aplicación del RL a entornos dinámicos del mundo real, donde la adaptabilidad es crucial. El reto consiste en desarrollar algoritmos capaces de transferir el conocimiento entre tareas y entornos sin necesidad de un reentrenamiento exhaustivo.
Problemas de sesgo y función de recompensa
En el aprendizaje por refuerzo (RL), diseñar funciones de recompensa adecuadas es fundamental, ya que un diseño deficiente puede generar comportamientos no deseados. Además, los sistemas de RL entrenados con datos sesgados pueden perpetuar los sesgos existentes y dar lugar a resultados discriminatorios o injustos. Ambos problemas requieren una cuidadosa consideración de las estructuras de recompensa y las fuentes de datos para garantizar la equidad y los comportamientos deseados.
En el procesamiento del lenguaje natural
En el procesamiento del lenguaje natural (PLN), el aprendizaje por refuerzo se ha aplicado a tareas en las que la generación de texto se trata como un problema de decisión secuencial: la política del modelo selecciona palabras o enunciados como acciones, y la recompensa mide propiedades de la salida completa que son difíciles de expresar como una pérdida supervisada por token. [ 81 ] Las primeras aplicaciones utilizaron métodos de gradiente de política como REINFORCE para optimizar métricas de evaluación a nivel de secuencia, incluyendo BLEU en traducción automática y ROUGE en resumen de texto , [ 82 ] [ 83 ] y para entrenar sistemas de diálogo . [ 84 ]
El aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) se utiliza para entrenar grandes modelos de lenguaje . En RLHF, los anotadores humanos comparan o clasifican las salidas del modelo, se entrena un modelo de recompensa con estos juicios de preferencia y, posteriormente, el modelo de lenguaje se ajusta con un algoritmo de gradiente de política, comúnmente optimización de política proximal (PPO), para producir salidas que el modelo de recompensa puntúe alto. [ 85 ] [ 86 ] El modelo de recompensa sustituye a los evaluadores humanos durante la optimización, por lo que no se requieren nuevos juicios humanos en cada paso de entrenamiento, aunque el método en su conjunto depende de un conjunto de datos de preferencias anotadas por humanos. OpenAI utilizó RLHF para entrenar InstructGPT , lanzado en enero de 2022, y ChatGPT , lanzado en noviembre de 2022. [ 87 ] La optimización directa de preferencias (DPO), publicada en 2023, ajusta el modelo de lenguaje directamente con los datos de preferencia, sin un modelo de recompensa separado ni un bucle de aprendizaje por refuerzo. [ 88 ]
Trabajos posteriores sobre modelos de lenguaje diseñados para razonamiento de múltiples pasos reemplazaron el modelo de recompensa aprendido con recompensas calculadas automáticamente a partir de la tarea, como verificar una respuesta matemática con una solución de referencia o ejecutar pruebas unitarias en el código generado. [ 89 ] OpenAI o1 , lanzado en 2024, y DeepSeek-R1 , lanzado en 2025, fueron entrenados con aprendizaje por refuerzo a gran escala de este tipo para producir una cadena de pensamiento antes de responder. [ 90 ] [ 91 ] Los desarrolladores de DeepSeek-R1 informaron que comportamientos de razonamiento como la autoverificación y la reflexión surgieron cuando el aprendizaje por refuerzo se aplicó directamente a un modelo base preentrenado, sin una etapa preliminar de ajuste fino supervisado. [ 91 ]
Véase también
- Aprendizaje activo (aprendizaje automático)
- Aprendizaje mediante aprendizaje práctico
- Aprendizaje basado en errores
- Sin modelo (aprendizaje por refuerzo)
- Aprendizaje por refuerzo multiagente
- Control óptimo
- Aprendizaje Q
- Aprendizaje por refuerzo a partir de la retroalimentación humana
- Estado-acción-recompensa-estado-acción (SARSA)
- Aprendizaje por diferencia temporal
Referencias
- ↑ Kaelbling, Leslie P. ; Littman, Michael L. ; Moore, Andrew W. (1996). "Aprendizaje por refuerzo: una revisión" . Journal of Artificial Intelligence Research . 4 : 237–285 . arXiv : cs/9605103 . doi : 10.1613/jair.301 . S2CID 1708582. Archivado del original el 20 de noviembre de 2001.
- ↑ van Otterlo, M.; Wiering, M. (2012). "Aprendizaje por refuerzo y procesos de decisión de Markov". Aprendizaje por refuerzo . Adaptación, aprendizaje y optimización. Vol. 12. pp. 3–42 . doi : 10.1007/978-3-642-27645-3_1 . ISBN 978-3-642-27644-6.
- 1 2 Li, Shengbo (2023). Aprendizaje por refuerzo para la toma de decisiones secuenciales y el control óptimo (Primera ed.). Springer Verlag, Singapur. pp. 1–460 . doi : 10.1007/978-981-19-7784-8 . ISBN 978-9-811-97783-1. S2CID 257928563 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - ↑ Russell, Stuart J.; Norvig, Peter (2010). Inteligencia artificial: un enfoque moderno (Tercera ed.). Upper Saddle River, Nueva Jersey: Prentice Hall . págs. 830, 831. ISBN 978-0-13-604259-4.
- ↑ Lee, Daeyeol; Seo, Hyojung; Jung, Min Whan (21 de julio de 2012). "Bases neuronales del aprendizaje por refuerzo y la toma de decisiones" . Annual Review of Neuroscience . 35 (1): 287– 308. doi : 10.1146/annurev-neuro-062111-150512 . PMC 3490621. PMID 22462543 .
- ↑ Salazar Duque, Édgar Mauricio; Giraldo, Juan S.; Vergara, Pedro P.; Nguyen, Phuong; Van der Molen, Anne; Slootweg, Han (2022). "Operación comunitaria de almacenamiento de energía mediante aprendizaje reforzado con trazas de elegibilidad" . Investigación de sistemas de energía eléctrica . 212 108515. Código Bib : 2022EPSR..21208515S . doi : 10.1016/j.epsr.2022.108515 . S2CID 250635151 .
- ↑ Xie, Zhaoming; Hung Yu Ling; Nam Hee Kim; Michiel van de Panne (2020). "ALLSTEPS: Aprendizaje de habilidades básicas impulsado por el currículo". arXiv : 2005.04323 [ cs.GR ].
- ↑ Vergara, Pedro P.; Salazar, Mauricio; Giraldo, Juan S.; Palensky, Peter (2022). "Despacho óptimo de inversores fotovoltaicos en sistemas de distribución desequilibrados mediante aprendizaje por refuerzo" . International Journal of Electrical Power & Energy Systems . 136 107628. Bibcode : 2022IJEPE.13607628V . doi : 10.1016/j.ijepes.2021.107628 . S2CID 244099841 .
- ↑ Sutton y Barto 2018 , Capítulo 11.
- ↑ Ren, Yangang; Jiang, Jianhua; Zhan, Guojian; Li, Shengbo Eben; Chen, Chen; Li, Keqiang; Duan, Jingliang (2026). "Inteligencia autoaprendida para la toma de decisiones y el control integrados de vehículos automatizados en intersecciones señalizadas". IEEE Transactions on Intelligent Transportation Systems . 23 (12): 24145– 24156. arXiv : 2110.12359 . Bibcode : 2022ITITr..2324145R . doi : 10.1109/TITS.2022.3196167 .
- ↑ Gosavi, Abhijit (2003). Optimización basada en simulación: técnicas de optimización paramétrica y refuerzo . Serie Interfaces de Investigación Operativa/Ciencias de la Computación. Springer. ISBN 978-1-4020-7454-7.
- 1 2 Burnetas, Apostolos N.; Katehakis, Michael N. (1997), "Políticas adaptativas óptimas para procesos de decisión de Markov", Mathematics of Operations Research , 22 (1): 222– 255, doi : 10.1287/moor.22.1.222 , JSTOR 3690147
- ↑ Tokic, Michel; Palm, Günther (2011), "Exploración basada en la diferencia de valores: control adaptativo entre Epsilon-Greedy y Softmax" (PDF) , KI 2011: Avances en Inteligencia Artificial , Lecture Notes in Computer Science, vol. 7006, Springer, pp. 335–346 , ISBN 978-3-642-24455-1
- 1 2 3 "Aprendizaje por refuerzo: una introducción" (PDF) . Archivado del original (PDF) el 12 de julio de 2017. Recuperado el 23 de julio de 2017 .
- ↑ Singh, Satinder P.; Sutton, Richard S. (1996-03-01). "Aprendizaje por refuerzo con sustitución de trazas de elegibilidad" . Machine Learning . 22 (1): 123– 158. doi : 10.1007/BF00114726 . ISSN 1573-0565 .
- ↑ Sutton, Richard S. (1984). Asignación de crédito temporal en el aprendizaje por refuerzo (tesis doctoral). Universidad de Massachusetts, Amherst, MA. Archivado del original el 30 de marzo de 2017. Consultado el 29 de marzo de 2017 .
- ↑ Sutton y Barto 2018 , §6. Aprendizaje por diferencia temporal .
- ↑ Bradtke, Steven J. ; Barto, Andrew G. (1996). "Aprendizaje para predecir mediante el método de diferencias temporales". Machine Learning . 22 : 33– 57. CiteSeerX 10.1.1.143.857 . doi : 10.1023/A:1018056104778 . S2CID 20327856 .
- ↑ Watkins, Christopher JCH (1989). Aprender de las recompensas postergadas (PDF) (tesis doctoral). King's College, Cambridge, Reino Unido.
- ↑ Matzliach, Barouch; Ben-Gal, Irad; Kagan, Evgeny (2022). "Detección de objetivos estáticos y móviles mediante un agente autónomo con capacidades de aprendizaje Q profundo" . Entropy . 24 ( 8): 1168. Bibcode : 2022Entrp..24.1168M . doi : 10.3390/e24081168 . PMC 9407070. PMID 36010832 .
- ↑ Williams, Ronald J. (1987). "Una clase de algoritmos de estimación de gradiente para el aprendizaje por refuerzo en redes neuronales". Actas de la Primera Conferencia Internacional IEEE sobre Redes Neuronales . CiteSeerX 10.1.1.129.8871 .
- ↑ Peters, Jan ; Vijayakumar, Sethu ; Schaal, Stefan (2003). Aprendizaje por refuerzo para robótica humanoide (PDF) . Conferencia internacional IEEE-RAS sobre robots humanoides. Archivado del original (PDF) el 12 de mayo de 2013. Recuperado el 8 de mayo de 2006 .
- ↑ Juliani, Arthur (17 de diciembre de 2016). "Aprendizaje por refuerzo simple con Tensorflow Parte 8: Agentes actor-crítico asíncronos (A3C)" . Medium . Consultado el 22 de febrero de 2018 .
- ↑ Deisenroth, Marc Peter ; Neumann, Gerhard; Peters, Jan (2013). Un estudio sobre la búsqueda de políticas para la robótica (PDF) . Fundamentos y tendencias en robótica. Vol. 2. NOW Publishers. págs. 1–142 . doi : 10.1561/2300000021 . hdl : 10044/1/12051 .
- ↑ Sutton, Richard (1990). "Arquitecturas integradas para el aprendizaje, la planificación y la reacción basadas en programación dinámica". Aprendizaje automático: Actas del séptimo taller internacional .
- ↑ Lin, Long-Ji (1992). "Agentes reactivos de autoaprendizaje basados en aprendizaje por refuerzo, planificación y enseñanza" (PDF) . Machine Learning . Vol. 8. doi : 10.1007/BF00992699 .
- ↑ Zou, Lan (2023-01-01), "Capítulo 7 - Aprendizaje por metarreforzamiento" , en Zou, Lan (ed.), Meta-Learning , Academic Press, pp. 267–297 , doi : 10.1016/b978-0-323-89931-4.00011-0 , ISBN 978-0-323-89931-4, consultado el 8 de noviembre de 2023
- ↑ van Hasselt, Hado; Hessel, Matteo; Aslanides, John (2019). "¿Cuándo usar modelos paramétricos en el aprendizaje por refuerzo?" (PDF) . Advances in Neural Information Processing Systems . Vol. 32.
- ↑ Khuat, Thanh Tung; Bassett, Robert; Otte, Ellen; Grevis-James, Alistair; Gabrys, Bogdan (2024-03-01). "Aplicaciones del aprendizaje automático en el descubrimiento de anticuerpos, desarrollo de procesos, fabricación y formulación: tendencias actuales, desafíos y oportunidades" . Computers & Chemical Engineering . 182 108585. doi : 10.1016/j.compchemeng.2024.108585 . ISSN 0098-1354 .
- ^ Grondman, Ivo; Vaandrager, Martín; Busoniu, Luciano; Babuska, Robert; Schuitema, Erik (1 de junio de 2012). "Métodos eficientes de aprendizaje de modelos para el control entre actores y críticos" . Transacciones IEEE sobre sistemas, hombre y cibernética - Parte B: Cibernética . 42 (3): 591– 602. Código bibliográfico : 2012ITSMC..42..591G . doi : 10.1109/TSMCB.2011.2170565 . ISSN 1083-4419 . PMID 22156998 .
- ↑ "Sobre el uso del aprendizaje por refuerzo para probar mecánicas de juego: ACM - Computers in Entertainment" . cie.acm.org . Consultado el 27 de noviembre de 2018 .
- ↑ Li, Xiao; Vasile, Cristian-Ioan; Belta, Calin (2017). "Aprendizaje por refuerzo con recompensas de lógica temporal" . 2017 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) . pp. 3834–3839 . doi : 10.1109/IROS.2017.8206234 .
- ↑ Toro Icarte, Rodrigo; Klassen, Toryn Q.; Valenzano, Richard; McIlraith, Sheila A. (2022). "Máquinas de recompensa: Explotando la estructura de la función de recompensa en el aprendizaje por refuerzo" . Journal of Artificial Intelligence Research . 73 : 173–208 . arXiv : 2010.03950 . doi : 10.1613/jair.1.12440 .
- ↑ Riveret, Régis; Gao, Yang; Governatori, Guido; Rotolo, Antonino; Pitt, Jeremy; Sartor, Giovanni (2019). "Un marco de argumentación probabilística para agentes de aprendizaje por refuerzo" . Autonomous Agents and Multi-Agent Systems . 33 ( 1–2 ): 216–274 . doi : 10.1007/s10458-019-09404-2 .
- ↑ Haramati, Dan; Daniel, Tal; Tamar, Aviv (2024). "Entity-Centric Reinforcement Learning for Object Manipulation from Pixels". arXiv : 2404.01220 [ cs.RO ].
- ↑ Thompson, Isaac Symes; Caron, Alberto; Hicks, Chris; Mavroudis, Vasilios (2024-11-07). "Entity-based Reinforcement Learning for Autonomous Cyber Defence". Proceedings of the Workshop on Autonomous Cybersecurity (AutonomousCyber '24) . ACM. pp. 56–67 . arXiv : 2410.17647 . doi : 10.1145/3689933.3690835 .
- ↑ Winter, Clemens (14 de abril de 2023). "Aprendizaje por refuerzo basado en entidades" . Blog de Clemens Winter .
- ↑ Yamagata, Taku; McConville, Ryan; Santos-Rodriguez, Raul (2021-11-16). "Aprendizaje por refuerzo con retroalimentación de múltiples humanos con habilidades diversas". arXiv : 2111.08596 [ cs.LG ].
- ↑ Kulkarni, Tejas D.; Narasimhan, Karthik R.; Saeedi, Ardavan; Tenenbaum, Joshua B. (2016). "Aprendizaje jerárquico profundo por refuerzo: integración de la abstracción temporal y la motivación intrínseca" . Actas de la 30.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'16. EE. UU.: Curran Associates Inc.: 3682–3690 . arXiv : 1604.06057 . Bibcode : 2016arXiv160406057K . ISBN 978-1-5108-3881-9.
- ↑ "Aprendizaje por refuerzo / Éxitos del aprendizaje por refuerzo" . umichrl.pbworks.com . Consultado el 6 de agosto de 2017 .
- ↑ Dey, Somdip; Singh, Amit Kumar; Wang, Xiaohang; McDonald-Maier, Klaus (marzo de 2020). "Aprendizaje por refuerzo con conciencia de la interacción del usuario para la eficiencia energética y térmica de MPSoC móviles CPU-GPU" . Conferencia y exposición de diseño, automatización y pruebas en Europa de 2020 (DATE) (PDF) . págs. 1728–1733 . doi : 10.23919/DATE48585.2020.9116294 . ISBN 978-3-9819263-4-7. S2CID 219858480 .
- ↑ Quested, Tony. "Los teléfonos inteligentes se vuelven más inteligentes con la innovación de Essex" . Business Weekly . Consultado el 17 de junio de 2021 .
- ↑ Williams, Rhiannon (21 de julio de 2020). "Los futuros teléfonos inteligentes 'prolongarán la duración de su propia batería mediante el monitoreo del comportamiento de los propietarios'"." . i . Consultado el 17 de junio de 2021 .
- ↑ Kaplan, F.; Oudeyer, P. (2004). «Maximizing Learning Progress: An Internal Reward System for Development». En Iida, F.; Pfeifer, R.; Steels, L.; Kuniyoshi, Y. (eds.). Embodied Artificial Intelligence . Lecture Notes in Computer Science. Vol. 3139. Berlín; Heidelberg: Springer. pp. 259–270 . doi : 10.1007/978-3-540-27833-7_19 . ISBN 978-3-540-22484-6. S2CID 9781221 .
- ↑ Klyubin, A.; Polani, D.; Nehaniv, C. (2008). "Mantén tus opciones abiertas: un principio de conducción basado en información para sistemas sensoriomotores" . PLOS ONE . 3 (12) e4018. Bibcode : 2008PLoSO...3.4018K . doi : 10.1371/journal.pone.0004018 . PMC 2607028. PMID 19107219 .
- ↑ Barto, AG (2013). "Motivación intrínseca y aprendizaje por refuerzo". Aprendizaje intrínsecamente motivado en sistemas naturales y artificiales (PDF) . Berlín; Heidelberg: Springer. pp. 17–47 .
- ↑ Dabérius, Kevin; Granat, Elvin; Karlsson, Patrik (2020). "Ejecución profunda: aprendizaje por refuerzo basado en valor y política para operar y superar los índices de referencia del mercado". The Journal of Machine Learning in Finance . 1. SSRN 3374766 .
- ↑ George Karimpanal, Thommen; Bouffanais, Roland (2019). "Mapas autoorganizados para el almacenamiento y la transferencia de conocimiento en el aprendizaje por refuerzo". Adaptive Behavior . 27 (2): 111– 126. arXiv : 1811.08318 . doi : 10.1177/1059712318818568 . ISSN 1059-7123 . S2CID 53774629 .
- ↑ cf. Sutton y Barto 2018 , Sección 5.4, pág. 100
- ↑ Mnih, Volodymyr; Badia, Adrià; Mirza, Mehdi; Graves, Alex; Lillicrap, Timothy; Harley, Tim; Silver, David; Kavukcuoglu, Koray (16 de junio de 2016). "Métodos asíncronos para el aprendizaje profundo por refuerzo" . Actas de la investigación en aprendizaje automático (PMLR) . 48. PMLR: 1928–1937 . Recuperado el 15 de junio de 2026 .
- ↑ J Duan; Y Guan; S Li (2021). "Distributional Soft Actor-Critic: Off-policy reinforcement learning for addressing value estimation errors". IEEE Transactions on Neural Networks and Learning Systems . 33 (11): 6584– 6598. arXiv : 2001.02811 . doi : 10.1109/TNNLS.2021.3082568 . PMID 34101599 . S2CID 211259373 .
- ↑ Y Ren; J Duan; S Li (2020). "Mejora de la generalización del aprendizaje por refuerzo con el modelo actor-crítico suave distribucional minimax". 2020 IEEE 23.ª Conferencia Internacional sobre Sistemas de Transporte Inteligentes (ITSC) . págs. 1–6 . arXiv : 2002.05502 . doi : 10.1109/ITSC45102.2020.9294300 . ISBN 978-1-7281-4149-7. S2CID 211096594 .
- ↑ Duan, J; Wang, W; Xiao, L (2025). "Distributional Soft Actor-Critic with Three Refinements". IEEE Transactions on Pattern Analysis and Machine Intelligence . PP (5): 3935– 3946. arXiv : 2310.05858 . Bibcode : 2025ITPAM..47.3935D . doi : 10.1109/TPAMI.2025.3537087 . PMID 40031258 .
- ↑ Soucek, Branko (6 de mayo de 1992). Programación dinámica, genética y caótica: la sexta generación de la serie de tecnología informática . John Wiley & Sons, Inc. pág. 38. ISBN 0-471-55717-X.
- ↑ Francois-Lavet, Vincent; et al. (2018). "Una introducción al aprendizaje profundo por refuerzo". Fundamentos y tendencias en aprendizaje automático . 11 ( 3– 4): 219– 354. arXiv : 1811.12560 . Bibcode : 2018arXiv181112560F . doi : 10.1561/2200000071 . S2CID 54434537 .
- ↑ Mnih, Volodymyr; et al. (2015). "Control a nivel humano mediante aprendizaje profundo por refuerzo". Nature . 518 (7540): 529– 533. Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . PMID 25719670 . S2CID 205242740 .
- ↑ Goodfellow, Ian; Shlens, Jonathan; Szegedy, Christian (2015). "Explicando y aprovechando ejemplos adversarios". Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1412.6572 .
- ↑ Behzadan, Vahid; Munir, Arslan (2017). "Vulnerabilidad del aprendizaje profundo por refuerzo ante ataques de inducción de políticas". Aprendizaje automático y minería de datos en el reconocimiento de patrones . Notas de clase en ciencias de la computación. Vol. 10358. pp. 262–275 . arXiv : 1701.04143 . doi : 10.1007/978-3-319-62416-7_19 . ISBN 978-3-319-62415-0. S2CID 1562290 .
- ↑ Huang, Sandy; Papernot, Nicolas; Goodfellow, Ian; Duan, Yan; Abbeel, Pieter (2017-02-07). Ataques adversarios a políticas de redes neuronales . OCLC 1106256905 .
- ↑ Korkmaz, Ezgi (2022). "Las políticas de aprendizaje por refuerzo profundo aprenden características adversarias compartidas entre MDP" . Trigésimo sexta Conferencia AAAI sobre Inteligencia Artificial (AAAI-22) . 36 (7): 7229– 7238. arXiv : 2112.09025 . doi : 10.1609/aaai.v36i7.20684 . S2CID 245219157 .
- ↑ Berenji, HR (1994). "Aprendizaje Q difuso: Un nuevo enfoque para la programación dinámica difusa". Actas de la 3.ª Conferencia Internacional de Sistemas Difusos del IEEE de 1994. Orlando, FL, EE. UU.: IEEE. págs. 486–491 . doi : 10.1109/FUZZY.1994.343737 . ISBN 0-7803-1896-X. S2CID 56694947 .
- ↑ Vincze, David (2017). "Interpolación de reglas difusas y aprendizaje por refuerzo" (PDF) . 2017 IEEE 15th International Symposium on Applied Machine Intelligence and Informatics (SAMI) . IEEE. pp. 173–178 . doi : 10.1109/SAMI.2017.7880298 . ISBN 978-1-5090-5655-2. S2CID 17590120 .
- ↑ Ng, AY; Russell, SJ (2000). "Algoritmos para el aprendizaje inverso por refuerzo" (PDF) . Actas de la ICML '00, Decimoséptima Conferencia Internacional sobre Aprendizaje Automático . Morgan Kaufmann Publishers. págs. 663–670 . ISBN 1-55860-707-2.
- ↑ Ziebart, Brian D.; Maas, Andrew; Bagnell, J. Andrew; Dey, Anind K. (13 de julio de 2008). «Aprendizaje inverso por refuerzo de máxima entropía» . Actas de la 23.ª Conferencia Nacional sobre Inteligencia Artificial - Volumen 3. AAAI'08. Chicago, Illinois: AAAI Press: 1433–1438 . ISBN 978-1-57735-368-3. S2CID 336219 .
- ^ Pitombeira-Neto, Anselmo R.; Santos, Helano P.; Coelho da Silva, Ticiana L.; de Macedo, José Antonio F. (marzo 2024). "Modelado de trayectoria mediante aprendizaje por refuerzo inverso de utilidad aleatoria". Ciencias de la Información . 660 120128. arXiv : 2105.12092 . doi : 10.1016/j.ins.2024.120128 . ISSN 0020-0255 . S2CID 235187141 .
- ↑ Hayes C, Radulescu R, Bargiacchi E, et al. (2022). "Una guía práctica para el aprendizaje por refuerzo y la planificación multiobjetivo" . Autonomous Agents and Multi-Agent Systems . 36 26. arXiv : 2103.09568 . doi : 10.1007/s10458-022-09552-y . S2CID 254235920 . ,
- ^ Tzeng, Gwo-Hshiung; Huang, Jih-Jeng (2011). Toma de decisiones sobre atributos múltiples: métodos y aplicaciones (1ª ed.). Prensa CRC. ISBN 978-1-4398-6157-8.
- ↑ Gu, Shangding; Yang, Long; Du, Yali; Chen, Guang; Walter, Florian; Wang, Jun; Knoll, Alois (10 de septiembre de 2024). "Una revisión del aprendizaje por refuerzo seguro: métodos, teorías y aplicaciones" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 46 (12): 11216– 11235. Bibcode : 2024ITPAM..4611216G . doi : 10.1109/TPAMI.2024.3457538 . PMID 39255180 .
- ↑ García, Javier; Fernández, Fernando (1 de enero de 2015). "Una revisión exhaustiva sobre el aprendizaje por refuerzo seguro" (PDF) . The Journal of Machine Learning Research . 16 (1): 1437– 1480.
- ↑ Dabney, Will; Ostrovski, Georg; Silver, David; Munos, Remi (2018-07-03). "Redes cuantiles implícitas para el aprendizaje por refuerzo distribucional" . Actas de la 35.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1096–1105 . arXiv : 1806.06923 .
- ↑ Chow, Yinlam; Tamar, Aviv; Mannor, Shie; Pavone, Marco (2015). "Toma de decisiones robusta y sensible al riesgo: un enfoque de optimización CVaR" . Advances in Neural Information Processing Systems . 28. Curran Associates, Inc. arXiv : 1506.02188 .
- ↑ "Entrena duro, lucha fácil: aprendizaje por refuerzo meta robusto" . scholar.google.com . Consultado el 21 de junio de 2024 .
- ↑ Tamar, Aviv; Glassner, Yonatan; Mannor, Shie (2015-02-21). "Optimizing the CVaR via Sampling" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 29 (1). arXiv : 1404.3862 . doi : 10.1609/aaai.v29i1.9561 . ISSN 2374-3468 .
- ↑ Greenberg, Ido; Chow, Yinlam; Ghavamzadeh, Mohammad; Mannor, Shie (2022-12-06). "Aprendizaje por refuerzo eficiente con aversión al riesgo" . Advances in Neural Information Processing Systems . 35 : 32639–32652 . arXiv : 2205.05138 .
- ↑ Bozinovski, S. (1982). «Un sistema de autoaprendizaje mediante refuerzo secundario». En Trappl, Robert (ed.). Cibernética e investigación de sistemas: Actas de la Sexta Reunión Europea sobre Cibernética e Investigación de Sistemas. North-Holland. pp. 397–402. ISBN 978-0-444-86488-8
- ↑ Bozinovski S. (1995) "Agentes neurogenéticos y teoría estructural de los sistemas de aprendizaje por autorrefuerzo". Informe técnico CMPSCI 95-107, Universidad de Massachusetts en Amherst.
- ↑ Bozinovski, S. (2014) "Modelado de mecanismos de interacción cognición-emoción en redes neuronales artificiales, desde 1981." Procedia Computer Science, págs. 255-263
- ↑ Engstrom, Logan; Ilyas, Andrew; Santurkar, Shibani; Tsipras, Dimitris; Janoos, Firdaus; Rudolph, Larry; Madry, Aleksander (2019-09-25). "La implementación importa en el aprendizaje por refuerzo profundo: un estudio de caso sobre PPO y TRPO" . ICLR .
- ↑ Colas, Cédric (2019-03-06). "Distributional Soft Actor-Critic with Three Refinements" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 47 (5): 3935– 3946. arXiv : 1904.06979 . Bibcode : 2025ITPAM..47.3935D . doi : 10.1109/TPAMI.2025.3537087 . PMID 40031258 .
- ↑ Greenberg, Ido; Mannor, Shie (2021-07-01). "Máquinas de recompensa: Explotando la estructura de la función de recompensa en el aprendizaje por refuerzo" . Journal of Artificial Intelligence Research . 73. PMLR: 3842–3853 . arXiv : 2010.11660 . doi : 10.1613/jair.1.12440 .
- ↑ Uc-Cetina, Víctor; Navarro-Guerrero, Nicolás; Martin-Gonzalez, Anabel; Weber, Cornelius; Wermter, Stefan (2022). "Revisión sobre el aprendizaje por refuerzo para el procesamiento del lenguaje". Artificial Intelligence Review . 56 : 1543–1575 . arXiv : 2104.05565 . doi : 10.1007/s10462-022-10205-5 .
- ↑ Ranzato, Marc'Aurelio; Chopra, Sumit; Auli, Michael; Zaremba, Wojciech (2015). "Entrenamiento a nivel de secuencia con redes neuronales recurrentes". arXiv : 1511.06732 [ cs.LG ].
- ↑ Paulus, Romain; Xiong, Caiming; Socher, Richard (2017). "Un modelo profundo reforzado para la síntesis abstracta". arXiv : 1705.04304 [ cs.CL ].
- ↑ Li, Jiwei; Monroe, Will; Ritter, Alan; Jurafsky, Dan; Galley, Michel; Gao, Jianfeng (2016). "Aprendizaje profundo por refuerzo para la generación de diálogos". Actas de la Conferencia de 2016 sobre métodos empíricos en el procesamiento del lenguaje natural . págs. 1192–1202 . arXiv : 1606.01541 . doi : 10.18653/v1/D16-1127 .
- ↑ Christiano, Paul F.; Leike, Jan; Brown, Tom B.; Martic, Miljan; Legg, Shane; Amodei, Dario (2017). "Aprendizaje profundo por refuerzo a partir de preferencias humanas". Advances in Neural Information Processing Systems . Vol. 30. arXiv : 1706.03741 .
- ↑ Stiennon, Nisan; Ouyang, Long; Wu, Jeffrey; Ziegler, Daniel M.; Lowe, Ryan; Voss, Chelsea; Radford, Alec; Amodei, Dario; Christiano, Paul (2020). "Aprender a resumir a partir de la retroalimentación humana". Advances in Neural Information Processing Systems . Vol. 33. pp. 3008–3021 . arXiv : 2009.01325 .
- ↑ Ouyang, Long; Wu, Jeffrey; Jiang, Xu; et al. (2022). "Entrenamiento de modelos de lenguaje para seguir instrucciones con retroalimentación humana". Advances in Neural Information Processing Systems . Vol. 35. pp. 27730–27744 . arXiv : 2203.02155 .
- ↑ Rafailov, Rafael; Sharma, Archit; Mitchell, Eric; Ermon, Stefano; Manning, Christopher D.; Finn, Chelsea (2023). "Optimización de preferencias directas: su modelo de lenguaje es secretamente un modelo de recompensa". Advances in Neural Information Processing Systems . Vol. 36. arXiv : 2305.18290 .
- ↑ Lambert, Nathan; Morrison, Jacob; Pyatkin, Valentina; et al. (2024). "Tülu 3: Pushing Frontiers in Open Language Model Post-Training". arXiv : 2411.15124 [ cs.CL ].
- ↑ OpenAI (2024). "Tarjeta del sistema OpenAI o1". arXiv : 2412.16720 [ cs.AI ].
- 1 2 DeepSeek-AI; et al. (22 de enero de 2025). "DeepSeek-R1 incentiva el razonamiento en LLMS a través del aprendizaje por refuerzo" . Nature . 645 ( 8081): 633– 638. arXiv : 2501.12948 . Bibcode : 2025Natur.645..633G . doi : 10.1038/s41586-025-09422-z . PMC 12443585. PMID 40962978 .
Lecturas adicionales
- Annaswamy, Anuradha M. (3 de mayo de 2023). "Control adaptativo e intersecciones con el aprendizaje por refuerzo" . Annual Review of Control, Robotics, and Autonomous Systems . 6 (1): 65– 93. doi : 10.1146/annurev-control-062922-090153 . ISSN 2573-5144 . S2CID 255702873 .
- Auer, Peter ; Jaksch, Thomas; Ortner, Ronald (2010). "Límites de arrepentimiento casi óptimos para el aprendizaje por refuerzo" . Journal of Machine Learning Research . 11 : 1563–1600 .
- Bertsekas, Dimitri P. (2023) [2019]. Aprendizaje por refuerzo y control óptimo (1.ª ed.). Athena Scientific. ISBN 978-1-886-52939-7.
- Busoniu, Lucian; Babuska, Robert; De Schutter, Bart ; Ernst, Damien (2010). Aprendizaje por refuerzo y programación dinámica mediante aproximadores de funciones . Taylor & Francis CRC Press. ISBN 978-1-4398-2108-4.
- François-Lavet, Vincent; Henderson, Peter; Islam, Riashat; Bellemare, Marc G.; Pineau, Joelle (2018). "Una introducción al aprendizaje profundo por refuerzo". Fundamentos y tendencias en aprendizaje automático . 11 ( 3–4 ): 219–354 . arXiv : 1811.12560 . Bibcode : 2018arXiv181112560F . doi : 10.1561/2200000071 . S2CID 54434537 .
- Li, Shengbo Eben (2023). Aprendizaje por refuerzo para la toma de decisiones secuenciales y el control óptimo (1.ª ed.). Springer Verlag, Singapur. doi : 10.1007/978-981-19-7784-8 . ISBN 978-9-811-97783-1.
- Powell, Warren (2011). Programación dinámica aproximada: resolviendo las maldiciones de la dimensionalidad . Wiley-Interscience. Archivado del original el 31 de julio de 2016. Recuperado el 8 de septiembre de 2010 .
- Sutton, Richard S. (1988). "Aprendizaje para predecir mediante el método de diferencias temporales" . Machine Learning . 3 (1): 9– 44. Bibcode : 1988MLear...3....9S . doi : 10.1007/BF00115009 .
- Sutton, Richard S.; Barto , Andrew G. (2018) [1998]. Aprendizaje por refuerzo: una introducción (2.ª ed.). MIT Press. ISBN 978-0-262-03924-6.
- Szita, Istvan; Szepesvari, Csaba (2010). "Aprendizaje por refuerzo basado en modelos con límites de complejidad de exploración casi ajustados" (PDF) . ICML 2010. Omnipress. pp. 1031–1038 . Archivado del original (PDF) el 14 de julio de 2010.
Enlaces externos
- Analizando el aprendizaje por refuerzo: Serie de publicaciones de blog sobre aprendizaje por refuerzo con código Python.
- Una mirada (larga) al aprendizaje por refuerzo
- QSMM: aprendizaje por refuerzo mediante programas ensambladores probabilísticos adaptativos
- Aprendizaje por refuerzo
- modelos de Markov
- Revisión de creencias