El algoritmo Estado-acción-recompensa-estado-acción ( SARSA ) es un método para aprender políticas de procesos de decisión de Markov , utilizado en el aprendizaje por refuerzo dentro del aprendizaje automático . Fue propuesto por Rummery y Niranjan en una nota técnica [ 1 ] con el nombre de "Modified Connectionist Q-Learning" (MCQ-L). El nombre alternativo SARSA, propuesto por Rich Sutton , solo se menciona en una nota al pie.
Este nombre refleja el hecho de que la función principal para actualizar el valor Q depende del estado actual del agente " S 1 ", la acción que el agente elige " A 1 ", la recompensa " R 2 " que el agente obtiene por elegir esta acción, el estado " S 2 " al que entra el agente después de realizar esa acción, y finalmente la siguiente acción " A 2 " que el agente elige en su nuevo estado. El acrónimo para la quíntupla (S t , A t , R t+1 , S t+1 , A t+1 ) es SARSA. [ 2 ] Algunos autores usan una convención ligeramente diferente y escriben la quíntupla (S t , A t , R t , S t+1 , A t+1 ), dependiendo de en qué paso de tiempo se asigna formalmente la recompensa. El resto del artículo usa la convención anterior.
Algoritmo
Un agente SARSA interactúa con el entorno y actualiza la política en función de las acciones realizadas; por lo tanto, se conoce como algoritmo de aprendizaje en política . El valor Q para una acción de estado se actualiza mediante un error, ajustado por la tasa de aprendizaje α. Los valores Q representan la posible recompensa recibida en el siguiente paso de tiempo por realizar la acción a en el estado s , más la recompensa futura descontada recibida de la siguiente observación de acción de estado.
El método Q-learning de Watkin actualiza una estimación de la función de valor óptimo estado-acción.basado en la recompensa máxima de las acciones disponibles. Mientras que SARSA aprende los valores Q asociados con la adopción de la política que sigue, el aprendizaje Q de Watkin aprende los valores Q asociados con la adopción de la política óptima al seguir una política de exploración/explotación .
Algunas optimizaciones del Q-learning de Watkin pueden aplicarse a SARSA. [ 3 ]
Hiperparámetros
Tasa de aprendizaje (alfa)
La tasa de aprendizaje determina en qué medida la información recién adquirida reemplaza la información antigua. Un factor de 0 hará que el agente no aprenda nada, mientras que un factor de 1 hará que el agente considere solo la información más reciente.
Factor de descuento (gamma)
El factor de descuento determina la importancia de las recompensas futuras. Un factor de descuento de 0 hace que el agente sea "oportunista" o "miope", por ejemplo, [ 4 ] al considerar únicamente las recompensas actuales, mientras que un factor cercano a 1 lo hará esforzarse por obtener una recompensa alta a largo plazo. Si el factor de descuento alcanza o supera 1,Los valores pueden divergir.
Condiciones iniciales ( Q ( S 0 , A 0 ) )
Dado que SARSA es un algoritmo iterativo, asume implícitamente una condición inicial antes de que ocurra la primera actualización. Un valor inicial alto (infinito), también conocido como "condiciones iniciales optimistas" [ 5 ] , puede fomentar la exploración: sin importar qué acción se realice, la regla de actualización hace que tenga valores más altos que la otra alternativa, aumentando así su probabilidad de elección. En 2013 se sugirió que la primera recompensapodría usarse para restablecer las condiciones iniciales. Según esta idea, la primera vez que se realiza una acción, la recompensa se utiliza para establecer el valor deEsto permite un aprendizaje inmediato en caso de recompensas deterministas fijas. Este enfoque de reinicio de las condiciones iniciales (RIC) parece ser coherente con el comportamiento humano en experimentos repetidos de elección binaria. [ 6 ]
Véase también
Referencias
- ↑ Aprendizaje Q en línea mediante sistemas conexionistas" por Rummery y Niranjan (1994)
- ↑ Aprendizaje por refuerzo: una introducción Richard S. Sutton y Andrew G. Barto (capítulo 6.4)
- ↑ Wiering, Marco; Schmidhuber, Jürgen (1 de octubre de 1998). "Q (λ) rápido en línea" (PDF) . Aprendizaje automático . 33 (1): 105– 115. doi : 10.1023/A:1007562800292 . ISSN 0885-6125 . S2CID 8358530 .
- ↑ "Argumentos en contra del entrenamiento miope" . 9 de julio de 2020. Consultado el 17 de mayo de 2023 .
- ↑ "2.7 Valores iniciales optimistas" . incompleteideas.net . Consultado el 28 de febrero de 2018 .
- ↑ Shteingart, H; Neiman, T; Loewenstein, Y (mayo de 2013). "El papel de la primera impresión en el aprendizaje operante" (PDF) . J Exp Psychol Gen. 142 ( 2): 476–88 . doi : 10.1037/a0029550 . PMID 22924882 .
- algoritmos de aprendizaje automático
- Aprendizaje por refuerzo
- 1994 en inteligencia artificial