El control estocástico o control óptimo estocástico es un subcampo de la teoría de control que aborda la existencia de incertidumbre, ya sea en las observaciones o en el ruido que impulsa la evolución del sistema. El diseñador del sistema asume, de manera bayesiana y basada en la probabilidad , que el ruido aleatorio con una distribución de probabilidad conocida afecta la evolución y la observación de las variables de estado. El control estocástico tiene como objetivo diseñar la trayectoria temporal de las variables controladas que realice la tarea de control deseada con un costo mínimo, definido de alguna manera, a pesar de la presencia de este ruido. [ 1 ] El contexto puede ser de tiempo discreto o continuo .
Equivalencia de certeza
Una formulación muy estudiada en control estocástico es la del control gaussiano lineal cuadrático . Aquí, el modelo es lineal, la función objetivo es el valor esperado de una forma cuadrática y las perturbaciones son puramente aditivas. Un resultado básico para sistemas centralizados de tiempo discreto con incertidumbre únicamente aditiva es la propiedad de equivalencia de certeza : [ 2 ] que la solución de control óptimo en este caso es la misma que se obtendría en ausencia de las perturbaciones aditivas. Esta propiedad es aplicable a todos los sistemas centralizados con ecuaciones de evolución lineales, función de coste cuadrática y ruido que entra al modelo únicamente de forma aditiva; la suposición cuadrática permite que las leyes de control óptimo, que siguen la propiedad de equivalencia de certeza, sean funciones lineales de las observaciones de los controladores.
Cualquier desviación de los supuestos anteriores —una ecuación de estado no lineal, una función objetivo no cuadrática, ruido en los parámetros multiplicativos del modelo o descentralización del control— hace que la propiedad de equivalencia de certeza no se cumpla. Por ejemplo, su incumplimiento en el caso de un control descentralizado quedó demostrado en el contraejemplo de Witsenhausen .
Tiempo discreto
En un contexto de tiempo discreto, quien toma las decisiones observa la variable de estado, posiblemente con ruido de observación, en cada período de tiempo. El objetivo puede ser optimizar la suma de los valores esperados de una función objetivo no lineal (posiblemente cuadrática) en todos los períodos de tiempo desde el presente hasta el último período de interés, o bien optimizar el valor de la función objetivo solo en el último período. En cada período de tiempo se realizan nuevas observaciones y las variables de control deben ajustarse de forma óptima. Encontrar la solución óptima para el tiempo presente puede implicar iterar una ecuación matricial de Riccati hacia atrás en el tiempo desde el último período hasta el presente.
En el caso de tiempo discreto con incertidumbre sobre los valores de los parámetros en la matriz de transición (que da el efecto de los valores actuales de las variables de estado en su propia evolución) y/o la matriz de respuesta de control de la ecuación de estado, pero aún con una ecuación de estado lineal y una función objetivo cuadrática, todavía se puede obtener una ecuación de Riccati para iterar hacia atrás a la solución de cada período aunque no se aplique la equivalencia de certeza. [ 2 ] cap. 13 [ 3 ] El caso de tiempo discreto de una función de pérdida no cuadrática pero solo perturbaciones aditivas también se puede manejar, aunque con más complicaciones. [ 4 ]
Ejemplo
Una especificación típica del problema de control lineal cuadrático estocástico en tiempo discreto es minimizar [ 2 ] : cap. 13, [ 3 ] [ 5 ]
donde E 1 es el operador de valor esperado condicionado a y 0 , el superíndice T indica la transpuesta de una matriz y S es el horizonte temporal, sujeto a la ecuación de estado.
donde y es un vector n × 1 de variables de estado observables, u es un vector k × 1 de variables de control, A t es la realización en el tiempo t de la matriz estocástica de transición de estado n × n , B t es la realización en el tiempo t de la matriz estocástica n × k de multiplicadores de control, y Q ( n × n ) y R ( k × k ) son matrices de costos simétricas definidas positivas conocidas. Suponemos que cada elemento de A y B está distribuido conjunta , independientemente e idénticamente a lo largo del tiempo, por lo que las operaciones de valor esperado no necesitan ser condicionales al tiempo.
La inducción hacia atrás en el tiempo puede utilizarse para obtener la solución de control óptima en cada instante, [ 2 ] : cap. 13
con la matriz de costos restantes simétrica definida positiva X evolucionando hacia atrás en el tiempo desdede acuerdo a
Esta ecuación se conoce como la ecuación de Riccati dinámica en tiempo discreto de este problema. La única información necesaria sobre los parámetros desconocidos en las matrices A y B es el valor esperado y la varianza de cada elemento de cada matriz, así como las covarianzas entre los elementos de una misma matriz y entre los elementos de diferentes matrices.
La solución de control óptimo no se ve afectada si también aparecen choques aditivos i.i.d. de media cero en la ecuación de estado, siempre que no estén correlacionados con los parámetros de las matrices A y B. Pero si están correlacionados, la solución de control óptimo para cada período contiene un vector constante aditivo adicional. Si aparece un vector constante aditivo en la ecuación de estado, la solución de control óptimo para cada período también contiene un vector constante aditivo adicional.
La caracterización en estado estacionario de X (si existe), relevante para el problema de horizonte infinito en el que S tiende a infinito, se puede encontrar iterando repetidamente la ecuación dinámica de X hasta que converja; entonces X se caracteriza eliminando los subíndices de tiempo de su ecuación dinámica.
Tiempo continuo
Si el modelo es de tiempo continuo, el controlador conoce el estado del sistema en cada instante. El objetivo es maximizar la integral de, por ejemplo, una función cóncava de una variable de estado en un horizonte temporal desde el tiempo cero (el presente) hasta un tiempo final T , o bien una función cóncava de una variable de estado en una fecha futura T. A medida que transcurre el tiempo, se realizan continuamente nuevas observaciones y las variables de control se ajustan de forma óptima.
Control predictivo de modelo estocástico
En la literatura, existen dos tipos de MPC para sistemas estocásticos: el control predictivo robusto y el control predictivo estocástico (SMPC). El control predictivo robusto es un método más conservador que considera el peor escenario en el procedimiento de optimización. Sin embargo, este método, al igual que otros controles robustos, deteriora el rendimiento general del controlador y solo es aplicable a sistemas con incertidumbres acotadas. El método alternativo, SMPC, considera restricciones flexibles que limitan el riesgo de violación mediante una desigualdad probabilística. [ 6 ]
En finanzas
En un enfoque de tiempo continuo en un contexto financiero , la variable de estado en la ecuación diferencial estocástica suele ser la riqueza o el patrimonio neto, y los controles son las participaciones colocadas en cada momento en los diversos activos. Dada la asignación de activos elegida en cualquier momento, los determinantes del cambio en la riqueza suelen ser los rendimientos estocásticos de los activos y el tipo de interés del activo libre de riesgo. El campo del control estocástico se ha desarrollado enormemente desde la década de 1970, particularmente en sus aplicaciones a las finanzas. Robert Merton utilizó el control estocástico para estudiar carteras óptimas de activos seguros y de riesgo. [ 7 ] Su trabajo y el de Black-Scholes cambiaron la naturaleza de la literatura financiera . Los tratamientos influyentes en libros de texto matemáticos fueron los de Fleming y Rishel , [ 8 ] y los de Fleming y Soner . [ 9 ] Estas técnicas fueron aplicadas por Stein a la crisis financiera de 2008. [ 10 ]
La maximización, por ejemplo, del logaritmo esperado del patrimonio neto en una fecha final T , está sujeta a procesos estocásticos sobre los componentes de la riqueza. [ 11 ] En este caso, en tiempo continuo, la ecuación de Itô es la principal herramienta de análisis. En el caso en que la maximización sea una integral de una función cóncava de utilidad sobre un horizonte (0, T ), se utiliza la programación dinámica. No existe una equivalencia de certeza como en la literatura anterior, porque los coeficientes de las variables de control —es decir, los rendimientos recibidos por las acciones de activos elegidas— son estocásticos.
Véase también
Referencias
- ↑ Definición de Answers.com
- 1 2 3 4 Chow, Gregory P. (1976). Análisis y control de sistemas económicos dinámicos . Nueva York: Wiley. ISBN 0-471-15616-7.
- 1 2 Turnovsky, Stephen (1976). "Políticas de estabilización óptimas para sistemas lineales estocásticos: el caso de perturbaciones multiplicativas y aditivas correlacionadas". Review of Economic Studies . 43 (1): 191– 94. doi : 10.2307/2296614 . JSTOR 2296614 .
- ↑ Mitchell, Douglas W. (1990). "Control sensible al riesgo manejable basado en la utilidad esperada aproximada". Economic Modelling . 7 (2): 161– 164. doi : 10.1016/0264-9993(90)90018-Y .
- ↑ Turnovsky, Stephen (1974). "Las propiedades de estabilidad de las políticas económicas óptimas". American Economic Review . 64 (1): 136– 148. JSTOR 1814888 .
- ↑ Hashemian; Armaou (2017). "Diseño MPC estocástico para un proceso de granulación de dos componentes". Actas del IEEE : 4386–4391 . arXiv : 1704.04710 . Bibcode : 2017arXiv170404710H .
- ↑ Merton, Robert (1990). Finanzas en tiempo continuo . Blackwell.
- ↑ Fleming, W.; Rishel, R. (1975). Control óptimo determinista y estocástico . ISBN 0-387-90155-8.
- ↑ Fleming, W.; Soner, M. (2006). Procesos de Markov controlados y soluciones de viscosidad . Springer.
- ↑ Stein, JL (2012). Control óptimo estocástico y la crisis financiera de EE . UU. Springer-Science.
- ↑ Barreiro-Gomez, J.; Tembine, H. (2019). "Blockchain Token Economics: A Mean-Field-Type Game Perspective" . IEEE Access . 7 : 64603–64613 . doi : 10.1109/ACCESS.2019.2917517 . ISSN 2169-3536 .
Lecturas adicionales
- Dixit, Avinash (1991). "Un tratamiento simplificado de la teoría de la regulación óptima del movimiento browniano". Journal of Economic Dynamics and Control . 15 (4): 657– 673. doi : 10.1016/0165-1889(91)90037-2 .
- Yong, Jiongmin; Zhou, Xun Yu (1999). Controles estocásticos : sistemas hamiltonianos y ecuaciones HJB . Nueva York: Springer. ISBN 0-387-98723-1.
- Rogers, LCG (2013). Inversión óptima . Heidelberg: Springer. doi : 10.1007/978-3-642-35202-7 . ISBN 978-3-642-35201-0.
- Control estocástico
- Teoría de control
- Procesos estocásticos