La toma de decisiones secuencial es un concepto de la teoría de control y la investigación operativa que implica tomar una serie de decisiones a lo largo del tiempo para optimizar una función objetivo , como maximizar las recompensas acumuladas o minimizar los costos. En este marco, cada decisión influye en las elecciones subsiguientes y en los resultados del sistema, teniendo en cuenta el estado actual, las acciones disponibles y la naturaleza probabilística de las transiciones de estado . [ 1 ] Este proceso se utiliza para el modelado y la regulación de sistemas dinámicos , especialmente en condiciones de incertidumbre, y se aborda comúnmente mediante métodos como los procesos de decisión de Markov (MDP) y la programación dinámica . [ 2 ]
Referencias
- ↑ Puterman, Martin L. (1994). Procesos de decisión de Markov: programación dinámica estocástica discreta . Serie Wiley en probabilidad y estadística matemática. Sección de probabilidad y estadística aplicada. Nueva York: Wiley. pp. 1–2 . ISBN 978-0-471-61977-2.
- ↑ Bellman, Richard (1958-09-01). "Programación dinámica y procesos de control estocástico" . Information and Control . 1 (3): 228– 239. doi : 10.1016/S0019-9958(58)80003-0 . ISSN 0019-9958 .
- Aprendizaje por refuerzo
- Esbozos de aprendizaje automático