El algoritmo actor-crítico (AC) es una familia de algoritmos de aprendizaje por refuerzo (RL) que combinan algoritmos de RL basados en políticas, como los métodos de gradiente de políticas , y algoritmos de RL basados en valores, como la iteración de valor, el aprendizaje Q , SARSA y el aprendizaje TD . [ 1 ]
Un algoritmo AC consta de dos componentes principales: un " actor " que determina qué acciones tomar según una función de política, y un " crítico " que evalúa esas acciones según una función de valor. [ 2 ] Algunos algoritmos AC son on-policy, otros son off-policy. Algunos se aplican a espacios de acción continuos o discretos. Algunos funcionan en ambos casos.
Descripción general
Los métodos actor-crítico pueden entenderse como una mejora con respecto a los métodos de gradiente de política puros como REINFORCE, mediante la introducción de una línea base.
Actor
El actor utiliza una función de política, mientras que el crítico estima la función de valor, la función Q de valor de acciónla función de ventajao cualquier combinación de las mismas.
El actor es una función parametrizada, dóndeson los parámetros del actor. El actor toma como argumento el estado del entorno.y produce una distribución de probabilidad.
Si el espacio de acción es discreto, entonces. Si el espacio de acción es continuo, entonces.
El objetivo de la optimización de políticas es mejorar al actor. Es decir, encontrar algunaque maximiza la recompensa episódica esperada:dóndees el factor de descuento ,es la recompensa en el paso, yes el horizonte temporal (que puede ser infinito).
El objetivo del método de gradiente de política es optimizarmediante ascenso de gradiente en el gradiente de política.
Como se detalla en la página del método del gradiente de política , existen muchos estimadores insesgados del gradiente de política:dóndees una suma lineal de lo siguiente:
- .
- : el algoritmo REINFORCE .
- : el algoritmo REINFORCE con línea base . Aquíes una función arbitraria.
- : Aprendizaje TD(1) .
- .
- : Ventaja Actor-Crítico (A2C) . [ 3 ]
- : Aprendizaje TD(2).
- : Aprendizaje TD(n).
- : Aprendizaje TD(λ), también conocido como GAE (estimación de ventaja generalizada) . [ 4 ] Esto se obtiene mediante una suma que decae exponencialmente de los términos de aprendizaje TD(n).
Crítico
En los estimadores insesgados dados anteriormente, ciertas funciones comoAparecen. Estas son aproximadas por el crítico . Dado que todas estas funciones dependen del actor, el crítico debe aprender junto con el actor. El crítico se aprende mediante algoritmos de aprendizaje por refuerzo basados en valores.
Por ejemplo, si el crítico está estimando la función de valor de estado., entonces se puede aprender mediante cualquier método de aproximación de función de valor. Sea el crítico un aproximador de función.con parámetros.
El ejemplo más sencillo es el aprendizaje TD(1), que entrena al crítico para minimizar el error TD(1):Los parámetros críticos se actualizan mediante descenso de gradiente sobre el error TD al cuadrado:dóndees la tasa de aprendizaje. Tenga en cuenta que el gradiente se toma con respecto a laensolamente, ya que elenconstituye un objetivo en movimiento, y el gradiente no se toma con respecto a él. Esta es una fuente común de error en las implementaciones que utilizan diferenciación automática , y requiere "detener el gradiente" en ese punto.
De manera similar, si el crítico está estimando la función de valor de acción, entonces se puede aprender mediante Q-learning o SARSA . En SARSA, el crítico mantiene una estimación de la función Q, parametrizada por, denotado comoEl error de diferencia temporal se calcula entonces comoEl crítico es luego actualizado porEl crítico de ventaja puede ser entrenado entrenando una función Q.y una función de valor de estado, entonces dejaAunque es más común entrenar solo una función de valor de estado., luego estimar la ventaja mediante [ 3 ]Aquí,es un número entero positivo. Cuanto mayor sea el número entero positivo, mayor será el número entero positivo.Es decir, cuanto menor sea el sesgo en la estimación de la ventaja, pero a costa de una mayor varianza.
La Estimación de Ventaja Generalizada (GAE) introduce un hiperparámetroque interpola suavemente entre los retornos de Monte Carlo (, alta varianza, sin sesgo) y aprendizaje TD de 1 paso (, baja varianza, alto sesgo). Este hiperparámetro se puede ajustar para elegir el equilibrio óptimo entre sesgo y varianza en la estimación de la ventaja. Utiliza un promedio exponencialmente decreciente de los rendimientos de n pasos consiendo la fuerza de desintegración. [ 4 ]
Variantes
- Actor-Crítico de Ventaja Asíncrona (A3C) : Versión paralela y asíncrona de A2C. [ 3 ]
- Actor-Crítico Suave (SAC) : Incorpora la maximización de la entropía para una exploración mejorada. [ 5 ]
- Gradiente de política determinista profundo (DDPG) : especializado para espacios de acción continuos. [ 6 ]
Véase también
Referencias
- ↑ Arulkumaran, Kai; Deisenroth, Marc Peter; Brundage, Miles; Bharath, Anil Anthony (noviembre de 2017). "Aprendizaje profundo por refuerzo: una breve revisión". IEEE Signal Processing Magazine . 34 (6): 26– 38. arXiv : 1708.05866 . Bibcode : 2017ISPM...34...26A . doi : 10.1109/MSP.2017.2743240 . ISSN 1053-5888 .
- ↑ Konda, Vijay; Tsitsiklis, John (1999). "Algoritmos actor-crítico" . Avances en sistemas de procesamiento de información neuronal . 12. MIT Press.
- 1 2 3 Mnih, Volodymyr; Badia, Adrià Puigdomènech; Mirza, Mehdi; Graves, Alex; Lillicrap, Timothy P.; Harley, Tim; Silver, David; Kavukcuoglu, Koray (2016-06-16), Métodos asíncronos para el aprendizaje profundo por refuerzo , arXiv : 1602.01783
- 1 2 Schulman, John; Moritz, Philipp; Levine, Sergey ; Jordan, Michael; Abbeel, Pieter (2018-10-20), Control continuo de alta dimensión mediante estimación de ventaja generalizada , arXiv : 1506.02438
- ↑ Haarnoja, Tuomas; Zhou, Aurick; Hartikainen, Kristian; Tucker, George; Ja, Sehoon; Bronceado, Jie; Kumar, Vikash; Zhu, Enrique; Gupta, Abhishek (29 de enero de 2019), Algoritmos y aplicaciones de actor-crítico suave , arXiv : 1812.05905
- ^ Lillicrap, Timothy P.; Cazar, Jonathan J.; Pritzel, Alejandro; Heess, Nicolás; Erez, Tom; Tassa, Yuval; Plata, David; Wierstra, Daan (05 de julio de 2019), Control continuo con aprendizaje por refuerzo profundo , arXiv : 1509.02971
- Konda, Vijay R.; Tsitsiklis, John N. (enero de 2003). "Sobre algoritmos actor-crítico" . SIAM Journal on Control and Optimization . 42 (4): 1143– 1166. doi : 10.1137/S0363012901385691 . ISSN 0363-0129 .
- Sutton, Richard S.; Barto, Andrew G. (2018). Aprendizaje por refuerzo: una introducción . Serie de computación adaptativa y aprendizaje automático (2.ª ed.). Cambridge, Massachusetts: The MIT Press. ISBN 978-0-262-03924-6.
- Bertsekas, Dimitri P. (2019). Aprendizaje por refuerzo y control óptimo (2.ª ed.). Belmont, Massachusetts: Athena Scientific. ISBN 978-1-886529-39-7.
- Grossi, Csaba (2010). Algoritmos para el aprendizaje por refuerzo . Conferencias de síntesis sobre inteligencia artificial y aprendizaje automático (1.ª ed.). Cham: Springer International Publishing. ISBN 978-3-031-00423-0.
- Grondman, Ivo; Busoniu, Lucian; Lopes, Gabriel AD; Babuska, Robert (noviembre de 2012). "Una revisión del aprendizaje por refuerzo actor-crítico: gradientes de política estándar y naturales" . IEEE Transactions on Systems, Man, and Cybernetics - Part C: Applications and Reviews . 42 (6): 1291– 1307. Bibcode : 2012ITHMS..42.1291G . doi : 10.1109/TSMCC.2012.2218595 . ISSN 1094-6977 .
- Aprendizaje por refuerzo
- algoritmos de aprendizaje automático
- Inteligencia artificial