El principio de separación es uno de los principios fundamentales de la teoría de control estocástico , que establece que los problemas de control óptimo y estimación de estado pueden desacoplarse bajo ciertas condiciones. En su formulación más básica, trata sobre un sistema estocástico lineal.
con un proceso estatal, un proceso de saliday un control, dóndees un proceso de Wiener con valores vectoriales ,es un vector aleatorio gaussiano de media cero independiente de,, y,,,,son funciones con valores matriciales que generalmente se consideran continuas de variación acotada . Además,es no singular en algún intervaloEl problema consiste en diseñar una ley de retroalimentación de salida. :\,y\mapsto u} que mapea el proceso observadoa la entrada de controlde manera no anticipatoria para minimizar el efecto funcional.
dóndedenota valor esperado , primo () denota transpuesta . yyson funciones matriciales continuas de variación acotada,es semidefinido positivo yes positivo definido para todos. En condiciones adecuadas, que deben ser debidamente establecidas, la política óptimapuede elegirse en el formulario
dóndees la estimación lineal de mínimos cuadrados del vector de estadoobtenido del filtro de Kalman
dóndees la ganancia del regulador lineal-cuadrático óptimo obtenido al tomarydeterminista, y dondees la ganancia de Kalman . También hay una versión no gaussiana de este problema (que se discutirá más adelante) donde el proceso de Wiener se reemplaza por una martingala de cuadrado integrable más general con posibles saltos. [ 1 ] En este caso, el filtro de Kalman debe reemplazarse por un filtro no lineal que proporcione una estimación de la media condicional (en sentido estricto).
dónde
es la filtración generada por el proceso de salida; es decir, la familia de campos sigma crecientes que representan los datos tal como se producen.
En la literatura inicial sobre el principio de separación era común permitir como controles admisiblestodos los procesos que se adaptan a la filtraciónEsto equivale a permitir que todas las funciones de Borel no anticipatorias actúen como leyes de retroalimentación, lo que plantea la cuestión de la existencia de una solución única para las ecuaciones del bucle de retroalimentación. Además, es necesario excluir la posibilidad de que un controlador no lineal extraiga más información de los datos que la que se puede obtener con una ley de control lineal. [ 2 ]
Opciones de la clase de leyes de control admisibles
Los problemas de control lineal-cuadrático a menudo se resuelven mediante un argumento de completación de cuadrados. En nuestro contexto actual tenemos
en la que el primer término toma la forma [ 3 ]
dóndees la matriz de covarianza
El principio de separación se seguiría ahora inmediatamente sieran independientes del grupo de control. Sin embargo, esto debe establecerse.
La ecuación de estado se puede integrar para tomar la forma
dóndees el proceso de estado obtenido al estableceryes la función de matriz de transición. Por linealidad,igual
dónde. Como consecuencia,
pero necesitamos establecer queno depende del control. Este sería el caso si
dóndees el proceso de salida obtenido al establecerEste tema fue tratado en detalle por Lindquist. [ 2 ] De hecho, dado que el proceso de controlSi en general es una función no lineal de los datos y, por lo tanto, no gaussiana, entonces también lo es el proceso de salida.Para evitar estos problemas, se podría comenzar por desacoplar el bucle de retroalimentación y determinar un proceso de control óptimo dentro de la clase de procesos estocásticos.que se adaptan a la familiade campos sigma. Este problema, donde se optimiza sobre la clase de todos los procesos de control adaptados a una filtración fija, se denomina problema de lazo abierto estocástico (SOL) . [ 2 ] No es infrecuente en la literatura asumir desde el principio que el control está adaptado a; véase, por ejemplo, la Sección 2.3 en Bensoussan, [ 4 ] también van Handel [ 5 ] y Willems. [ 6 ]
En Lindquist 1973 [ 2 ] se propuso un procedimiento para incrustar la clase de controles admisibles en varias clases SOL de manera dependiente del problema, y luego construir la ley de retroalimentación correspondiente. La clase más grandede leyes de retroalimentación admisiblesconsta de las funciones no anticipatoriasde tal manera que la ecuación de retroalimentación tenga una solución única y el proceso de control correspondiente.está adaptado aA continuación, presentamos algunos ejemplos de clases específicas de leyes de retroalimentación que pertenecen a esta clase general, así como otras estrategias existentes en la literatura para superar los problemas descritos anteriormente.
Leyes de control lineal
La clase admisiblede leyes de control podrían restringirse para contener solo ciertas leyes lineales como en Davis. [ 7 ] De manera más general, la clase lineal
dóndees una función determinista yes unnúcleo, garantiza quees independiente del control. [ 8 ] [ 2 ] De hecho, la propiedad gaussiana se conservará entonces, yserá generado por el filtro de Kalman. Luego el proceso de errores generado por
lo cual es claramente independiente de la elección del control, y por lo tanto también lo es..
Leyes de control continuo de Lipschitz
Wonham demostró un teorema de separación para controles en la clase :\,u(t)=\psi (t,{\hat {x}}(t))\end{aligned}}} , incluso para un funcional de costo más general que J(u). [ 9 ] Sin embargo, la demostración está lejos de ser simple y hay muchas suposiciones técnicas. Por ejemplo,debe ser cuadrado y tener un determinante acotado inferiormente por un valor distinto de cero, lo cual es una restricción importante. Una demostración posterior de Fleming y Rishel [ 10 ] es considerablemente más sencilla. También demuestran el teorema de separación con un funcional de costo cuadrático.para una clase de leyes de retroalimentación continuas de Lipschitz, a saber:, dónde :\,[0,T]\times C^{n}[0,T]\to {\mathbb {R} }^{m}} es una función no anticipatoria deque es Lipschitz continua en este argumento. Kushner [ 11 ] propuso una clase más restringidadonde el proceso de estado modificadoes dado por
conduciendo a la identidad.
Imponer retraso
Si existe un retraso en el procesamiento de los datos observados de modo que, para cada,es una función de, entonces,, véase el Ejemplo 3 en Tryphon T. Georgiou y Lindquist. [ 1 ] En consecuencia,es independiente del control. Sin embargo, la política de controldebe ser tal que las ecuaciones de retroalimentación tengan una solución única.
En consecuencia, el problema con los campos sigma posiblemente dependientes del control no se presenta en la formulación habitual de tiempo discreto. Sin embargo, un procedimiento utilizado en varios libros de texto para construir el tiempo continuocomo el límite de los cocientes de diferencias finitas del tiempo discreto, que no depende del control, es circular o, en el mejor de los casos, incompleto; véase la Observación 4 en Georgiou y Lindquist. [ 1 ]
Soluciones débiles
Un enfoque introducido por Duncan y Varaiya [ 12 ] y Davis y Varaiya, [ 13 ] ver también la Sección 2.4 en Bensoussan [ 4 ] se basa en soluciones débiles de la ecuación diferencial estocástica . Considerando tales soluciones de
podemos cambiar la medida de probabilidad (que depende de) mediante una transformación de Girsanov de modo que
Se convierte en un nuevo proceso de Wiener, que (bajo la nueva medida de probabilidad) puede considerarse inalterado por el control. Queda abierta la cuestión de cómo implementarlo en un sistema de ingeniería.
Soluciones de filtrado no lineal
Aunque una ley de control no lineal producirá un proceso de estado no gaussiano, se puede demostrar, utilizando la teoría de filtrado no lineal (Capítulos 16.1 en Lipster y Shirayev [ 14 ] ), que el proceso de estado es condicionalmente gaussiano dada la filtración.Este hecho puede utilizarse para demostrar queEn realidad, se genera mediante un filtro de Kalman (véanse los capítulos 11 y 12 de Lipster y Shirayev [ 14 ] ). Sin embargo, esto requiere un análisis bastante sofisticado y se limita al caso en que el ruido de excitaciónes un proceso de Wiener.
Se puede encontrar una perspectiva histórica adicional en Mitter. [ 15 ]
Problemas relacionados con la retroalimentación en sistemas estocásticos lineales
En este punto es conveniente considerar una clase más general de sistemas estocásticos lineales controlados que también abarque sistemas con retardos de tiempo, a saber:
conun proceso vectorial estocástico que no depende del control. [ 2 ] El sistema estocástico estándar se obtiene entonces como un caso especial donde,yUtilizaremos la notación abreviada.
para el sistema de retroalimentación, donde
es un operador de Volterra .
En esta formulación más general, el procedimiento de incrustación de Lindquist [ 2 ] define la clase.de leyes de retroalimentación admisiblescomo la clase de funciones no anticipatoriasde tal manera que la ecuación de retroalimentacióntiene una solución únicayestá adaptado a.
En Georgiou y Lindquist [ 1 ] se propuso un nuevo marco para el principio de separación. Este enfoque considera los sistemas estocásticos como mapas bien definidos entre trayectorias de muestra, en lugar de entre procesos estocásticos, y permite extender el principio de separación a sistemas impulsados por martingalas con posibles saltos. El enfoque se inspira en la ingeniería, donde los sistemas y los bucles de retroalimentación procesan señales, y no procesos estocásticos propiamente dichos ni transformaciones de medidas de probabilidad. Por lo tanto, el objetivo es crear una clase natural de leyes de control admisibles que tengan sentido desde el punto de vista de la ingeniería, incluyendo aquellas que son no lineales y discontinuas.
La ecuación de retroalimentacióntiene una solución fuerte y única si existe una función no anticipativade tal manera quesatisface la ecuación con probabilidad uno y todas las demás soluciones coinciden concon probabilidad uno. Sin embargo, en el contexto de muestreo, se requiere más, a saber, que exista una solución única y quese aplica a todosNo solo casi todos. El bucle de retroalimentación resultante está bien planteado de forma determinista en el sentido de que las ecuaciones de retroalimentación admiten una solución única que depende causalmente de la entrada para cada ruta de muestra de entrada.
En este contexto, una señal se define como una trayectoria de muestra de un proceso estocástico con posibles discontinuidades. Más precisamente, las señales pertenecerán al espacio de Skorohod., es decir, el espacio de funciones que son continuas por la derecha y tienen un límite izquierdo en todos los puntos ( funciones càdlàg ). En particular, el espaciode funciones continuas es un subespacio propio dePor lo tanto, la respuesta de una operación no lineal típica que involucra umbralización y conmutación puede modelarse como una señal. Lo mismo ocurre con las trayectorias de muestra de los procesos de conteo y otras martingalas. Un sistema se define como un mapa no anticipatorio medible.enviar rutas de muestra a rutas de muestra para que sus salidas en cualquier momentoes una función medible de valores pasados de la entrada y el tiempo. Por ejemplo, las ecuaciones diferenciales estocásticas con coeficientes de Lipschitz impulsadas por un proceso de Wiener inducen mapas entre espacios de trayectorias correspondientes, véase la página 127 en Rogers y Williams, [ 16 ] y las páginas 126-128 en Klebaner. [ 17 ] Además, bajo condiciones bastante generales (véase, por ejemplo, el Capítulo V en Protter [ 18 ] ), las ecuaciones diferenciales estocásticas impulsadas por martingalas con trayectorias de muestra entienen soluciones fuertes que son semimartingalas.
Para la configuración de la horael sistema de retroalimentaciónse puede escribir, dóndepuede interpretarse como una entrada.
Definición. Un bucle de retroalimentaciónUn problema está bien planteado de forma determinista si tiene una solución única.para todas las entradasy es un sistema.
Esto implica que los procesosydefine filtraciones idénticas. [ 1 ] En consecuencia, el bucle no crea información nueva. Sin embargo, lo que necesitamos es queparaEsto se garantiza mediante el siguiente lema (Lema 8 en Georgiou y Lindquist [ 1 ] ).
Lema clave. Si el bucle de retroalimentaciónestá bien planteado de forma determinista,es un sistema, yes un sistema lineal que tiene una inversa derechaEso también es un sistema, entonces es un sistema ypara.
La condición enen este lema se satisface claramente en el sistema estocástico lineal estándar, para el cualy por lo tantoLas condiciones restantes se recogen en la siguiente definición.
Definición. Una ley de retroalimentaciónestá bien planteado deterministamente para el sistema. sies un sistema y el sistema de retroalimentaciónbien planteado deterministamente.
En la Observación 12 de Georgiou y Lindquist se dan ejemplos de sistemas simples que no están bien planteados determinísticamente. [ 1 ]
Un principio de separación para leyes de control físicamente realizables
Al considerar únicamente leyes de retroalimentación que estén bien definidas de forma determinista, todas las leyes de control admisibles son físicamente realizables en el sentido de la ingeniería, ya que inducen una señal que viaja a través del bucle de retroalimentación. La demostración del siguiente teorema se puede encontrar en Georgiou y Lindquist 2013. [ 1 ]
Teorema de separación. Dado el sistema estocástico lineal
dóndees un proceso de Wiener con valores vectoriales,es un vector aleatorio gaussiano de media cero independiente deConsideremos el problema de minimizar el funcional cuadrático J(u) sobre la clase de todas las leyes de retroalimentación determinísticamente bien planteadas.Entonces, la ley de control óptima única viene dada por dóndese define como arriba yviene dada por el filtro de Kalman. De forma más general, sies una martingala de cuadrado integrable y es un vector aleatorio arbitrario de media cero,, dónde, es la ley de control óptima siempre que esté bien definida de forma determinista.
En el caso general no gaussiano, que puede implicar procesos de conteo, el filtro de Kalman debe ser reemplazado por un filtro no lineal.
Principio de separación para sistemas diferenciales con retardo
El control estocástico para sistemas con retardo de tiempo fue estudiado por primera vez en Lindquist, [ 19 ] [ 20 ] [ 8 ] [ 2 ] y Brooks, [ 21 ] aunque Brooks se basa en la fuerte suposición de que la observaciónes funcionalmente independiente del control, evitando así la cuestión clave de la retroalimentación.
Consideremos el sistema diferencial con retardo [ 8 ]
dóndeahora es una martingala gaussiana (vectorial) (de cuadrado integrable), y dondeyson de variación limitada en el primer argumento y continuas a la derecha en el segundo,es determinista para, y. Más precisamente,para,paray la variación total deestá acotada por una función integrable en la variabley lo mismo se aplica a.
Queremos determinar una ley de control que minimice
dóndees una medida de Stieltjes positiva. El problema determinista correspondiente se obtiene al estableceres dado por
con [ 8 ].
El siguiente principio de separación para el sistema de retardo anterior se puede encontrar en Georgiou y Lindquist 2013 [ 1 ] y generaliza el resultado correspondiente en Lindquist 1973 [ 8 ].
Teorema. Existe una ley de retroalimentación única. :\,y\mapsto u\end{aligned}}} en la clase de leyes de control determinísticamente bien planteadas que minimizay es dado por
dóndees la ganancia de control determinista yviene dado por el filtro lineal (distribuido)
dóndees el proceso de innovación
y la gananciaes como se define en la página 120 en Lindquist. [ 8 ]
Referencias
- 1 2 3 4 5 6 7 8 9 Tryphon T. Georgiou y Anders Lindquist (2013). "El principio de separación en el control estocástico, revisado". IEEE Transactions on Automatic Control . 58 (10): 2481– 2494. arXiv : 1103.3005 . doi : 10.1109/TAC.2013.2259207 . S2CID 12623187 . .
- 1 2 3 4 5 6 7 8 Anders Lindquist (1973). "Sobre el control por retroalimentación de sistemas estocásticos lineales". SIAM Journal on Control . 11 (2): 323– 343. doi : 10.1137/0311025 ..
- ↑ Karl Johan Astrom (1970). Introducción a la teoría del control estocástico . Vol. 58. Academic Press. ISBN 978-0-486-44531-1..
- 1 2 A. Bensoussan (1992). Control estocástico de sistemas parcialmente observables . Cambridge University Press..
- ↑ Ramon van Handel (2007). Cálculo estocástico, filtrado y control estocástico (PDF) . Notas inéditas.
- ^ Enero C. Willems. (1978). "Filtrado recursivo". Statistica Neerlandica . 32 (1): 1– 39. doi : 10.1111/j.1467-9574.1978.tb01382.x ..
- ↑ MHA Davis (1978). Estimación lineal y control estocástico . Chapman and Hall..
- 1 2 3 4 5 6 Anders Lindquist (1973). "Control óptimo de sistemas estocásticos lineales con aplicaciones a sistemas con retardo de tiempo". Information Sciences . 5 : 81– 126. doi : 10.1016/0020-0255(73)90005-4 ..
- ↑ Murray Wonham (1968). "Sobre el teorema de separación del control estocástico". SIAM J. Control . 6 (2): 312– 326. doi : 10.1137/0306023 .
- ↑ WH Fleming y RW Rishel (1968). Control óptimo determinista y estocástico . Springer-Verlag..
- ↑ H. Kushner (1971). Introducción al control estocástico . Holt, Rinehart and Winston..
- ↑ Tyrone Duncan y Pravin Varaiya (1971). "Sobre las soluciones de un sistema de control estocástico" (PDF) . SIAM J. Control . 9 (3): 354–371 . doi : 10.1137/0309026 . hdl : 1808/16692 ..
- ↑ MHA Davis y P. Varaiya (1972). "Estados de información para sistemas estocásticos" . J. Math. Anal. Applications . 37 : 384–402 . doi : 10.1016/0022-247X(72)90281-8 ..
- 1 2 R.S. Liptser y AN Shirayev (1978). Estadística de procesos aleatorios II, Aplicaciones . Springer-Verlag..
- ↑ S. Mitter (1996). "Filtrado y control estocástico: una perspectiva histórica". IEEE Control Systems Magazine . 13 (3): 67– 76..
- ^ Rogers, L. Chris G. y David Williams (2000). Difusiones, procesos de Markov y martingalas: Volumen 2, Cálculo de Itô . Prensa de la universidad de Cambridge.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Klebaner, Fima C. (2012). Introducción al cálculo estocástico con aplicaciones . Imperial College Press – vía World Scientific Publishing Company.
- ↑ Protter, PE (2004). Integración estocástica y ecuaciones diferenciales . Springer.
- ↑ Anders Lindquist (1968). "Sobre el control estocástico óptimo con información suavizada". Information Sciences . 1 : 55–85 . doi : 10.1016/0020-0255(68)90007-8 ..
- ↑ Anders Lindquist (1969). "Un enfoque innovador para el control óptimo de sistemas estocásticos lineales con retardo de tiempo". Information Sciences . 1 (3): 279– 295. doi : 10.1016/S0020-0255(69)80014-9 ..
- ↑ R. Brooks (1972). "Control estocástico lineal: un principio de separación extendido" . J. Math. Anal. Appl . 38 (3): 569– 587. doi : 10.1016/0022-247X(72)90069-8 ..
- Teoría de control
- Control estocástico