Articulo de referencia

Principio de separación en el control estocástico

El principio de separación es uno de los principios fundamentales de la teoría de control estocástico , que establece que los problemas de control óptimo y estimación de estado ...

El principio de separación es uno de los principios fundamentales de la teoría de control estocástico , que establece que los problemas de control óptimo y estimación de estado pueden desacoplarse bajo ciertas condiciones. En su formulación más básica, trata sobre un sistema estocástico lineal.

dincógnita=A(t)incógnita(t)dt+B1(t)(t)dt+B2(t)dwdy=do(t)incógnita(t)dt+D(t)dw{\displaystyle {\begin{aligned}dx&=A(t)x(t)\,dt+B_{1}(t)u(t)\,dt+B_{2}(t)\,dw\\dy&=C(t)x(t)\,dt+D(t)\,dw\end{aligned}}}

con un proceso estatalincógnita{\displaystyle x}, un proceso de saliday{\displaystyle y}y un control{\displaystyle u}, dóndew{\displaystyle w}es un proceso de Wiener con valores vectoriales ,incógnita(0){\displaystyle x(0)}es un vector aleatorio gaussiano de media cero independiente dew{\displaystyle w},y(0)=0{\displaystyle y(0)=0}, yA{\displaystyle A},B1{\displaystyle B_{1}},B2{\displaystyle B_{2}},do{\displaystyle C},D{\displaystyle D}son funciones con valores matriciales que generalmente se consideran continuas de variación acotada . Además,DD{\displaystyle DD'}es no singular en algún intervalo[0,T]{\displaystyle [0,T]}El problema consiste en diseñar una ley de retroalimentación de salida.π:y{\displaystyle \pi :\,y\mapsto u} que mapea el proceso observadoy{\displaystyle y}a la entrada de control{\displaystyle u}de manera no anticipatoria para minimizar el efecto funcional.

J()=mi{0Tincógnita(t)Q(t)incógnita(t)dt+0T(t)R(t)(t)dt+incógnita(T)Sincógnita(T)},{\displaystyle J(u)=\mathbb {E} \left\{\int _{0}^{T}x(t)'Q(t)x(t)\,dt+\int _{0}^{T}u(t)'R(t)u(t)\,dt+x(T)'Sx(T)\right\},}

dóndemi{\displaystyle \mathbb {E} }denota valor esperado , primo ({\displaystyle '}) denota transpuesta . yQ{\displaystyle Q}yR{\displaystyle R}son funciones matriciales continuas de variación acotada,Q(t){\displaystyle Q(t)}es semidefinido positivo yR(t){\displaystyle R(t)}es positivo definido para todost{\displaystyle t}. En condiciones adecuadas, que deben ser debidamente establecidas, la política óptimaπ{\displaystyle \pi }puede elegirse en el formulario

(t)=K(t)incógnita^(t),{\displaystyle u(t)=K(t){\hat {x}}(t),}

dóndeincógnita^(t){\displaystyle {\hat {x}}(t)}es la estimación lineal de mínimos cuadrados del vector de estadoincógnita(t){\displaystyle x(t)}obtenido del filtro de Kalman

dincógnita^=A(t)incógnita^(t)dt+B1(t)(t)dt+L(t)(dydo(t)incógnita^(t)dt),incógnita^(0)=0,{\displaystyle d{\hat {x}}=A(t){\hat {x}}(t)\,dt+B_{1}(t)u(t)\,dt+L(t)(dy-C(t){\hat {x}}(t)\,dt),\quad {\hat {x}}(0)=0,}

dóndeK{\displaystyle K}es la ganancia del regulador lineal-cuadrático óptimo obtenido al tomarB2=D=0{\displaystyle B_{2}=D=0}yincógnita(0){\displaystyle x(0)}determinista, y dondeL{\displaystyle L}es la ganancia de Kalman . También hay una versión no gaussiana de este problema (que se discutirá más adelante) donde el proceso de Wiener w{\displaystyle w}se reemplaza por una martingala de cuadrado integrable más general con posibles saltos. [ 1 ] En este caso, el filtro de Kalman debe reemplazarse por un filtro no lineal que proporcione una estimación de la media condicional (en sentido estricto).

incógnita^(t)=mi{incógnita(t)Yt},{\displaystyle {\hat {x}}(t)=\operatorname {E} \{x(t)\mid {\cal {Y}}_{t}\},}

dónde

Yt:=σ{y(τ),τ[0,t]},0tT,{\displaystyle {\cal {Y}}_{t}:=\sigma \{y(\tau ),\tau \in [0,t]\},\quad 0\leq t\leq T,}

es la filtración generada por el proceso de salida; es decir, la familia de campos sigma crecientes que representan los datos tal como se producen.

En la literatura inicial sobre el principio de separación era común permitir como controles admisibles{\displaystyle u}todos los procesos que se adaptan a la filtración{Yt,0tT}{\displaystyle \{{\cal {Y}}_{t},\,0\leq t\leq T\}}Esto equivale a permitir que todas las funciones de Borel no anticipatorias actúen como leyes de retroalimentación, lo que plantea la cuestión de la existencia de una solución única para las ecuaciones del bucle de retroalimentación. Además, es necesario excluir la posibilidad de que un controlador no lineal extraiga más información de los datos que la que se puede obtener con una ley de control lineal. [ 2 ]

Opciones de la clase de leyes de control admisibles

Los problemas de control lineal-cuadrático a menudo se resuelven mediante un argumento de completación de cuadrados. En nuestro contexto actual tenemos

J()=mi{0T(Kincógnita)R(Kincógnita)dt}+términos que no dependen de ,{\displaystyle J(u)=\operatorname {E} \left\{\int _{0}^{T}(u-Kx)'R(u-Kx)\,dt\right\}+{\text{términos que no dependen de }}u,}

en la que el primer término toma la forma [ 3 ]

mi{0T(Kincógnita)R(Kincógnita)dt}=mi{0T[(Kincógnita^)R(Kincógnita^)+tr(KRKΣ)]dt},{\displaystyle {\begin{aligned}\operatorname {E} \left\{\int _{0}^{T}(u-Kx)'R(u-Kx)\,dt\right\}=\operatorname {E} \left\{\int _{0}^{T}[(u-K{\hat {x}})'R(u-K{\hat {x}})+\operatorname {tr} (K'RK\Sigma )]\,dt\right\},\end{aligned}}}

dóndeΣ{\displaystyle \Sigma }es la matriz de covarianza

Σ(t):=mi{[incógnita(t)incógnita^(t)][incógnita(t)incógnita^(t)]}.{\displaystyle \Sigma (t):=\operatorname {E} \{[x(t)-{\hat {x}}(t)][x(t)-{\hat {x}}(t)]'\}.}

El principio de separación se seguiría ahora inmediatamente siΣ{\displaystyle {\begin{aligned}\Sigma \end{aligned}}}eran independientes del grupo de control. Sin embargo, esto debe establecerse.

La ecuación de estado se puede integrar para tomar la forma

incógnita(t)=incógnita0(t)+0tΦ(t,s)B1(s)(s)ds,{\displaystyle x(t)=x_{0}(t)+\int _{0}^{t}\Phi (t,s)B_{1}(s)u(s)\,ds,}

dóndeincógnita0{\displaystyle x_{0}}es el proceso de estado obtenido al establecer=0{\displaystyle u=0}yΦ{\displaystyle \Phi }es la función de matriz de transición. Por linealidad,incógnita^(t)=mi{incógnita(t)Yt}{\displaystyle {\hat {x}}(t)=\operatorname {E} \{x(t)\mid {\cal {Y}}_{t}\}}igual

incógnita^(t)=incógnita^0(t)+0tΦ(t,s)B1(s)(s)ds,{\displaystyle {\hat {x}}(t)={\hat {x}}_{0}(t)+\int _{0}^{t}\Phi (t,s)B_{1}(s)u(s)\,ds,}

dóndeincógnita^0(t)=mi{incógnita0(t)Yt}{\displaystyle {\hat {x}}_{0}(t)=\operatorname {E} \{x_{0}(t)\mid {\cal {Y}}_{t}\}}. Como consecuencia,

Σ(t):=mi{[incógnita0(t)incógnita^0(t)][incógnita0(t)incógnita^0(t)]},{\displaystyle \Sigma (t):=\mathbb {E} \{[x_{0}(t)-{\hat {x}}_{0}(t)][x_{0}(t)-{\hat {x}}_{0}(t)]'\},}

pero necesitamos establecer queincógnita^0{\displaystyle {\begin{aligned}{\hat {x}}_{0}\end{aligned}}}no depende del control. Este sería el caso si

Yt=Yt0:=σ{y0(τ),τ[0,t]},0tT,{\displaystyle {\cal {Y}}_{t}={\cal {Y}}_{t}^{0}:=\sigma \{y_{0}(\tau ),\tau \in [0,t]\},\quad 0\leq t\leq T,}

dóndey0{\displaystyle y_{0}}es el proceso de salida obtenido al establecer=0{\displaystyle u=0}Este tema fue tratado en detalle por Lindquist. [ 2 ] De hecho, dado que el proceso de control{\displaystyle u}Si en general es una función no lineal de los datos y, por lo tanto, no gaussiana, entonces también lo es el proceso de salida.y{\displaystyle y}Para evitar estos problemas, se podría comenzar por desacoplar el bucle de retroalimentación y determinar un proceso de control óptimo dentro de la clase de procesos estocásticos.{\displaystyle u}que se adaptan a la familia{Yt0}{\displaystyle \{{\cal {Y}}_{t}^{0}\}}de campos sigma. Este problema, donde se optimiza sobre la clase de todos los procesos de control adaptados a una filtración fija, se denomina problema de lazo abierto estocástico (SOL) . [ 2 ] No es infrecuente en la literatura asumir desde el principio que el control está adaptado a{Yt0}{\displaystyle \{{\mathcal {Y}}_{t}^{0}\}}; véase, por ejemplo, la Sección 2.3 en Bensoussan, [ 4 ] también van Handel [ 5 ] y Willems. [ 6 ]

En Lindquist 1973 [ 2 ] se propuso un procedimiento para incrustar la clase de controles admisibles en varias clases SOL de manera dependiente del problema, y ​​luego construir la ley de retroalimentación correspondiente. La clase más grandeΠ{\displaystyle \Pi }de leyes de retroalimentación admisiblesπ{\displaystyle \pi }consta de las funciones no anticipatorias:=π(y){\displaystyle u:=\pi (y)}de tal manera que la ecuación de retroalimentación tenga una solución única y el proceso de control correspondiente.π{\displaystyle u_{\pi }}está adaptado a{Yt0}{\displaystyle \{{\mathcal {Y}}_{t}^{0}\}}A continuación, presentamos algunos ejemplos de clases específicas de leyes de retroalimentación que pertenecen a esta clase general, así como otras estrategias existentes en la literatura para superar los problemas descritos anteriormente.

Leyes de control lineal

La clase admisibleΠ{\displaystyle \Pi }de leyes de control podrían restringirse para contener solo ciertas leyes lineales como en Davis. [ 7 ] De manera más general, la clase lineal

(L)(t)=¯(t)+0tF(t,τ)dy,{\displaystyle ({\mathcal {L}})\quad u(t)={\bar {u}}(t)+\int _{0}^{t}F(t,\tau )\,dy,}

dónde¯{\displaystyle {\bar {u}}}es una función determinista yF{\displaystyle F}es unL2{\displaystyle L_{2}}núcleo, garantiza queΣ{\displaystyle \Sigma }es independiente del control. [ 8 ] [ 2 ] De hecho, la propiedad gaussiana se conservará entonces, yincógnita^{\displaystyle {\hat {x}}}será generado por el filtro de Kalman. Luego el proceso de errorincógnita~:=incógnitaincógnita^{\displaystyle {\tilde {x}}:=x-{\hat {x}}}es generado por

dincógnita~=(ALdo)incógnita~dt+(B2LD)dw,incógnita~(0)=incógnita(0),{\displaystyle d{\tilde {x}}=(A-LC){\tilde {x}}\,dt+(B_{2}-LD)\,dw,\quad {\tilde {x}}(0)=x(0),}

lo cual es claramente independiente de la elección del control, y por lo tanto también lo es.Σ{\displaystyle \Sigma }.

Leyes de control continuo de Lipschitz

Wonham demostró un teorema de separación para controles en la clase π:(t)=ψ(t,incógnita^(t)){\displaystyle {\begin{aligned}\pi :\,u(t)=\psi (t,{\hat {x}}(t))\end{aligned}}} , incluso para un funcional de costo más general que J(u). [ 9 ] Sin embargo, la demostración está lejos de ser simple y hay muchas suposiciones técnicas. Por ejemplo,do(t){\displaystyle {\begin{aligned}C(t)\end{aligned}}}debe ser cuadrado y tener un determinante acotado inferiormente por un valor distinto de cero, lo cual es una restricción importante. Una demostración posterior de Fleming y Rishel [ 10 ] es considerablemente más sencilla. También demuestran el teorema de separación con un funcional de costo cuadrático.J(){\displaystyle J(u)}para una clase de leyes de retroalimentación continuas de Lipschitz, a saber:(t)=ϕ(t,y){\displaystyle u(t)=\phi (t,y)}, dóndeϕ:[0,T]×donorte[0,T]Rmetro{\displaystyle \phi :\,[0,T]\times C^{n}[0,T]\to {\mathbb {R} }^{m}} es una función no anticipatoria dey{\displaystyle y}que es Lipschitz continua en este argumento. Kushner [ 11 ] propuso una clase más restringida(t)=ψ(t,ξ^(t)){\displaystyle u(t)=\psi (t,{\hat {\xi }}(t))}donde el proceso de estado modificadoξ^{\displaystyle {\hat {\xi }}}es dado por

ξ^(t)=mi{incógnita0(t)Yt0}+0tΦ(t,s)B1(s)(s)ds,{\displaystyle {\hat {\xi }}(t)=\operatorname {E} \{x_{0}(t)\mid {\mathcal {Y}}_{t}^{0}\}+\int _{0}^{t}\Phi (t,s)B_{1}(s)u(s)\,ds,}

conduciendo a la identidadincógnita^=ξ^{\displaystyle {\begin{aligned}{\hat {x}}={\hat {\xi }}\end{aligned}}}.

Imponer retraso

Si existe un retraso en el procesamiento de los datos observados de modo que, para cadat{\displaystyle t},(t){\displaystyle u(t)}es una función dey(τ);0τtε{\displaystyle y(\tau );\,0\leq \tau \leq t-\varepsilon }, entoncesYt=Yt0{\displaystyle {\cal {Y}}_{t}={\cal {Y}}_{t}^{0}},0tT{\displaystyle 0\leq t\leq T}, véase el Ejemplo 3 en Tryphon T. Georgiou y Lindquist. [ 1 ] En consecuencia,Σ{\displaystyle \Sigma }es independiente del control. Sin embargo, la política de controlπ{\displaystyle \pi }debe ser tal que las ecuaciones de retroalimentación tengan una solución única.

En consecuencia, el problema con los campos sigma posiblemente dependientes del control no se presenta en la formulación habitual de tiempo discreto. Sin embargo, un procedimiento utilizado en varios libros de texto para construir el tiempo continuoΣ{\displaystyle \Sigma }como el límite de los cocientes de diferencias finitas del tiempo discretoΣ{\displaystyle \Sigma }, que no depende del control, es circular o, en el mejor de los casos, incompleto; véase la Observación 4 en Georgiou y Lindquist. [ 1 ]

Soluciones débiles

Un enfoque introducido por Duncan y Varaiya [ 12 ] y Davis y Varaiya, [ 13 ] ver también la Sección 2.4 en Bensoussan [ 4 ] se basa en soluciones débiles de la ecuación diferencial estocástica . Considerando tales soluciones de

dincógnita=A(t)incógnita(t)dt+B1(t)(t)dt+B2(t)dw{\displaystyle dx=A(t)x(t)\,dt+B_{1}(t)u(t)\,dt+B_{2}(t)\,dw}

podemos cambiar la medida de probabilidad (que depende de{\displaystyle {\begin{aligned}u\end{aligned}}}) mediante una transformación de Girsanov de modo que

dw~:=B1(t)(t)dt+B2(t)dw{\displaystyle d{\tilde {w}}:=B_{1}(t)u(t)\,dt+B_{2}(t)\,dw}

Se convierte en un nuevo proceso de Wiener, que (bajo la nueva medida de probabilidad) puede considerarse inalterado por el control. Queda abierta la cuestión de cómo implementarlo en un sistema de ingeniería.

Soluciones de filtrado no lineal

Aunque una ley de control no lineal producirá un proceso de estado no gaussiano, se puede demostrar, utilizando la teoría de filtrado no lineal (Capítulos 16.1 en Lipster y Shirayev [ 14 ] ), que el proceso de estado es condicionalmente gaussiano dada la filtración.{Yt}{\displaystyle {\begin{aligned}\{{\mathcal {Y}}_{t}\}\end{aligned}}}Este hecho puede utilizarse para demostrar queincógnita^{\displaystyle {\begin{aligned}{\hat {x}}\end{aligned}}}En realidad, se genera mediante un filtro de Kalman (véanse los capítulos 11 y 12 de Lipster y Shirayev [ 14 ] ). Sin embargo, esto requiere un análisis bastante sofisticado y se limita al caso en que el ruido de excitaciónw{\displaystyle {\begin{aligned}w\end{aligned}}}es un proceso de Wiener.

Se puede encontrar una perspectiva histórica adicional en Mitter. [ 15 ]

Problemas relacionados con la retroalimentación en sistemas estocásticos lineales

En este punto es conveniente considerar una clase más general de sistemas estocásticos lineales controlados que también abarque sistemas con retardos de tiempo, a saber:

z(t)=z0(t)+0tGRAMO(t,s)(s)dsy(t)=Hz(t){\displaystyle {\begin{aligned}z(t)&=z_{0}(t)+\int _{0}^{t}G(t,s)u(s)\,ds\\y(t)&=Hz(t)\end{aligned}}}

conz0{\displaystyle {\begin{aligned}z_{0}\end{aligned}}}un proceso vectorial estocástico que no depende del control. [ 2 ] El sistema estocástico estándar se obtiene entonces como un caso especial dondez=[incógnita,y]{\displaystyle z=[x',y']'},z0=[incógnita0,y0]{\displaystyle z_{0}=[x_{0}',y_{0}']'}yH=[I,0]{\displaystyle H=[I,0]}Utilizaremos la notación abreviada.

z=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}

para el sistema de retroalimentación, donde

gramo:(t,)0tGRAMO(t,τ)(τ)dτ{\displaystyle g\;:\;(t,u)\mapsto \int _{0}^{t}G(t,\tau )u(\tau )\,d\tau }

es un operador de Volterra .

En esta formulación más general, el procedimiento de incrustación de Lindquist [ 2 ] define la clase.Π{\displaystyle \Pi }de leyes de retroalimentación admisiblesπ{\displaystyle \pi }como la clase de funciones no anticipatorias:=π(y){\displaystyle u:=\pi (y)}de tal manera que la ecuación de retroalimentaciónz=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}tiene una solución únicazπ{\displaystyle z_{\pi }}y=π(Hzπ){\displaystyle u=\pi (Hz_{\pi })}está adaptado a{Yt0}{\displaystyle \{{\mathcal {Y}}_{t}^{0}\}}.

En Georgiou y Lindquist [ 1 ] se propuso un nuevo marco para el principio de separación. Este enfoque considera los sistemas estocásticos como mapas bien definidos entre trayectorias de muestra, en lugar de entre procesos estocásticos, y permite extender el principio de separación a sistemas impulsados ​​por martingalas con posibles saltos. El enfoque se inspira en la ingeniería, donde los sistemas y los bucles de retroalimentación procesan señales, y no procesos estocásticos propiamente dichos ni transformaciones de medidas de probabilidad. Por lo tanto, el objetivo es crear una clase natural de leyes de control admisibles que tengan sentido desde el punto de vista de la ingeniería, incluyendo aquellas que son no lineales y discontinuas.

La ecuación de retroalimentaciónz=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}tiene una solución fuerte y única si existe una función no anticipativaF{\displaystyle F}de tal manera quez=F(z0){\displaystyle z=F(z_{0})}satisface la ecuación con probabilidad uno y todas las demás soluciones coinciden conz{\displaystyle z}con probabilidad uno. Sin embargo, en el contexto de muestreo, se requiere más, a saber, que exista una solución única y quez=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}se aplica a todosz0{\displaystyle z_{0}}No solo casi todos. El bucle de retroalimentación resultante está bien planteado de forma determinista en el sentido de que las ecuaciones de retroalimentación admiten una solución única que depende causalmente de la entrada para cada ruta de muestra de entrada.

En este contexto, una señal se define como una trayectoria de muestra de un proceso estocástico con posibles discontinuidades. Más precisamente, las señales pertenecerán al espacio de Skorohod.D{\displaystyle D}, es decir, el espacio de funciones que son continuas por la derecha y tienen un límite izquierdo en todos los puntos ( funciones càdlàg ). En particular, el espaciodo{\displaystyle C}de funciones continuas es un subespacio propio deD{\displaystyle D}Por lo tanto, la respuesta de una operación no lineal típica que involucra umbralización y conmutación puede modelarse como una señal. Lo mismo ocurre con las trayectorias de muestra de los procesos de conteo y otras martingalas. Un sistema se define como un mapa no anticipatorio medible.DD{\displaystyle D\to D}enviar rutas de muestra a rutas de muestra para que sus salidas en cualquier momentot{\displaystyle t}es una función medible de valores pasados ​​de la entrada y el tiempo. Por ejemplo, las ecuaciones diferenciales estocásticas con coeficientes de Lipschitz impulsadas por un proceso de Wiener inducen mapas entre espacios de trayectorias correspondientes, véase la página 127 en Rogers y Williams, [ 16 ] y las páginas 126-128 en Klebaner. [ 17 ] Además, bajo condiciones bastante generales (véase, por ejemplo, el Capítulo V en Protter [ 18 ] ), las ecuaciones diferenciales estocásticas impulsadas por martingalas con trayectorias de muestra enD{\displaystyle D}tienen soluciones fuertes que son semimartingalas.

Para la configuración de la horaF(z):=gramoπHz{\displaystyle f(z):=g\pi Hz}el sistema de retroalimentaciónz=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}se puede escribirz=z0+F(z){\displaystyle z=z_{0}+f(z)}, dóndez0{\displaystyle z_{0}}puede interpretarse como una entrada.

Definición. Un bucle de retroalimentaciónz=z0+F(z){\displaystyle z=z_{0}+f(z)}Un problema está bien planteado de forma determinista si tiene una solución única.zD{\displaystyle z\in D}para todas las entradasz0D{\displaystyle z_{0}\in D}y (1F)1{\displaystyle (1-f)^{-1}}es un sistema.

Esto implica que los procesosz{\displaystyle z}yz0{\displaystyle z_{0}}define filtraciones idénticas. [ 1 ] En consecuencia, el bucle no crea información nueva. Sin embargo, lo que necesitamos es queYt=Yt0{\displaystyle {\cal {Y}}_{t}={\cal {Y}}_{t}^{0}}para0tT{\displaystyle 0\leq t\leq T}Esto se garantiza mediante el siguiente lema (Lema 8 en Georgiou y Lindquist [ 1 ] ).

Lema clave. Si el bucle de retroalimentaciónz=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}está bien planteado de forma determinista,gramoπ{\displaystyle g\pi }es un sistema, yH{\displaystyle H}es un sistema lineal que tiene una inversa derechaHR{\displaystyle H^{-R}}Eso también es un sistema, entonces(1Hgramoπ)1{\displaystyle (1-Hg\pi )^{-1}} es un sistema yYt=Yt0{\displaystyle {\cal {Y}}_{t}={\cal {Y}}_{t}^{0}}para0tT{\displaystyle 0\leq t\leq T}.

La condición enH{\displaystyle H}en este lema se satisface claramente en el sistema estocástico lineal estándar, para el cualH=[0,I]{\displaystyle H=[0,I]}y por lo tantoHR=H{\displaystyle H^{-R}=H'}Las condiciones restantes se recogen en la siguiente definición.

Definición. Una ley de retroalimentaciónπ{\displaystyle \pi }está bien planteado deterministamente para el sistema.z=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz} sigramoπ{\displaystyle g\pi }es un sistema y el sistema de retroalimentaciónz=z0+gramoπHz{\displaystyle z=z_{0}+g\pi Hz}bien planteado deterministamente.

En la Observación 12 de Georgiou y Lindquist se dan ejemplos de sistemas simples que no están bien planteados determinísticamente. [ 1 ]

Un principio de separación para leyes de control físicamente realizables

Al considerar únicamente leyes de retroalimentación que estén bien definidas de forma determinista, todas las leyes de control admisibles son físicamente realizables en el sentido de la ingeniería, ya que inducen una señal que viaja a través del bucle de retroalimentación. La demostración del siguiente teorema se puede encontrar en Georgiou y Lindquist 2013. [ 1 ]

Teorema de separación. Dado el sistema estocástico lineal

dincógnita=A(t)incógnita(t)dt+B1(t)(t)dt+B2(t)dwdy=do(t)incógnita(t)dt+D(t)dw{\displaystyle {\begin{aligned}dx&=A(t)x(t)\,dt+B_{1}(t)u(t)\,dt+B_{2}(t)\,dw\\dy&=C(t)x(t)\,dt+D(t)\,dw\end{aligned}}}

dóndew{\displaystyle w}es un proceso de Wiener con valores vectoriales,incógnita(0){\displaystyle x(0)}es un vector aleatorio gaussiano de media cero independiente dew{\displaystyle w}Consideremos el problema de minimizar el funcional cuadrático J(u) sobre la clase de todas las leyes de retroalimentación determinísticamente bien planteadas.π{\displaystyle \pi }Entonces, la ley de control óptima única viene dada por(t)=K(t)incógnita^(t){\displaystyle u(t)=K(t){\hat {x}}(t)} dóndeK{\displaystyle K}se define como arriba yincógnita^{\displaystyle {\hat {x}}}viene dada por el filtro de Kalman. De forma más general, siw{\displaystyle w}es una martingala de cuadrado integrable y incógnita(0){\displaystyle x(0)}es un vector aleatorio arbitrario de media cero,(t)=K(t)incógnita^(t){\displaystyle u(t)=K(t){\hat {x}}(t)}, dóndeincógnita^(t)=mi{incógnita(t)Yt}{\displaystyle {\hat {x}}(t)=\operatorname {E} \{x(t)\mid {\cal {Y}}_{t}\}}, es la ley de control óptima siempre que esté bien definida de forma determinista.

En el caso general no gaussiano, que puede implicar procesos de conteo, el filtro de Kalman debe ser reemplazado por un filtro no lineal.

Principio de separación para sistemas diferenciales con retardo

El control estocástico para sistemas con retardo de tiempo fue estudiado por primera vez en Lindquist, [ 19 ] [ 20 ] [ 8 ] [ 2 ] y Brooks, [ 21 ] aunque Brooks se basa en la fuerte suposición de que la observacióny{\displaystyle y}es funcionalmente independiente del control{\displaystyle u}, evitando así la cuestión clave de la retroalimentación.

Consideremos el sistema diferencial con retardo [ 8 ]

dincógnita=(thtdsA(t,s)incógnita(s))dt+B1(t)(t)dt+B2(t)dwdy=(thtdsdo(t,s)incógnita(s))dt+D(t)dw{\displaystyle {\begin{aligned}dx&=\left(\int _{t-h}^{t}d_{s}\,A(t,s)x(s)\right)\,dt+B_{1}(t)u(t)\,dt+B_{2}(t)\,dw\\dy&=\left(\int _{t-h}^{t}d_{s}\,C(t,s)x(s)\right)\,dt+D(t)\,dw\end{aligned}}}

dóndew{\displaystyle w}ahora es una martingala gaussiana (vectorial) (de cuadrado integrable), y dondeA{\displaystyle {\begin{aligned}A\end{aligned}}}ydo{\displaystyle C}son de variación limitada en el primer argumento y continuas a la derecha en el segundo,incógnita(t)=ξ(t){\displaystyle x(t)=\xi (t)}es determinista paraht0{\displaystyle -h\leq t\leq 0}, yy(0)=0{\displaystyle y(0)=0}. Más precisamente,A(t,s)=0{\displaystyle A(t,s)=0}parast{\displaystyle s\geq t},A(t,s)=A(t,th){\displaystyle A(t,s)=A(t,t-h)}paratth{\displaystyle t\leq t-h}y la variación total desA(t,s){\displaystyle s\mapsto A(t,s)}está acotada por una función integrable en la variablet{\displaystyle t}y lo mismo se aplica ado{\displaystyle C}.

Queremos determinar una ley de control que minimice

J()=mi(0Tincógnita(t)Q(t)incógnita(t)dα(t)+0T(t)R(t)(t)dt),{\displaystyle J(u)=\operatorname {E} \left(\int _{0}^{T}x(t)'Q(t)x(t)\,d\alpha (t)+\int _{0}^{T}u(t)'R(t)u(t)\,dt\right),}

dóndedα{\displaystyle {\begin{aligned}d\alpha \end{aligned}}}es una medida de Stieltjes positiva. El problema determinista correspondiente se obtiene al establecerw=0{\displaystyle {\begin{aligned}w=0\end{aligned}}}es dado por

(t)=thtdτK(t,τ)incógnita(τ),{\displaystyle u(t)=\int _{t-h}^{t}d_{\tau }\,K(t,\tau )x(\tau ),}

con [ 8 ]K{\displaystyle {\begin{aligned}K\end{aligned}}}.

El siguiente principio de separación para el sistema de retardo anterior se puede encontrar en Georgiou y Lindquist 2013 [ 1 ] y generaliza el resultado correspondiente en Lindquist 1973 [ 8 ].

Teorema. Existe una ley de retroalimentación única.π:y{\displaystyle {\begin{aligned}\pi :\,y\mapsto u\end{aligned}}} en la clase de leyes de control determinísticamente bien planteadas que minimizaJ(){\displaystyle {\begin{aligned}J(u)\end{aligned}}}y es dado por

(t)=thtdsK(t,s)incógnita^(st),{\displaystyle u(t)=\int _{t-h}^{t}d_{s}\,K(t,s){\hat {x}}(s\mid t),}

dóndeK{\displaystyle K}es la ganancia de control determinista yincógnita^(st):=mi{incógnita(s)Yt}{\displaystyle {\hat {x}}(s\mid t):=E\{x(s)\mid {\cal {Y}}_{t}\}}viene dado por el filtro lineal (distribuido)

dincógnita^(tt)=thtdsA(t,s)incógnita^(st)dt+B1dt+incógnita(t,t)dvdincógnita^(tt)=thtdsA(t,s)incógnita^(st)dt+B1dt+incógnita(t,t)dv{\displaystyle {\begin{aligned}d{\hat {x}}(t\mid t)&=\int _{t-h}^{t}d_{s}\,A(t,s){\hat {x}}(s\mid t)\,dt+B_{1}u\,dt+X(t,t)\,dv\\d{\hat {x}}(t\mid t)&=\int _{t-h}^{t}d_{s}\,A(t,s){\hat {x}}(s\mid t)\,dt+B_{1}u\,dt+X(t,t)\,dv\end{aligned}}}

dóndev{\displaystyle v}es el proceso de innovación

dv=dythtdsdo(t,s)incógnita^(st)dt,v(0)=0,{\displaystyle dv=dy-\int _{t-h}^{t}d_{s}C(t,s){\hat {x}}(s\mid t)\,dt,\quad v(0)=0,}

y la gananciaincógnita{\displaystyle x}es como se define en la página 120 en Lindquist. [ 8 ]

Referencias

  1. 1 2 3 4 5 6 7 8 9 Tryphon T. Georgiou y Anders Lindquist (2013). "El principio de separación en el control estocástico, revisado". IEEE Transactions on Automatic Control . 58 (10): 2481– 2494. arXiv : 1103.3005 . doi : 10.1109/TAC.2013.2259207 . S2CID 12623187 . .
  2. 1 2 3 4 5 6 7 8 Anders Lindquist (1973). "Sobre el control por retroalimentación de sistemas estocásticos lineales". SIAM Journal on Control . 11 (2): 323– 343. doi : 10.1137/0311025 ..
  3. Karl Johan Astrom (1970). Introducción a la teoría del control estocástico . Vol. 58. Academic Press. ISBN  978-0-486-44531-1..
  4. 1 2 A. Bensoussan (1992). Control estocástico de sistemas parcialmente observables . Cambridge University Press..
  5. Ramon van Handel (2007). Cálculo estocástico, filtrado y control estocástico (PDF) . Notas inéditas.
  6. ^ Enero C. Willems. (1978). "Filtrado recursivo". Statistica Neerlandica . 32 (1): 1– 39. doi : 10.1111/j.1467-9574.1978.tb01382.x ..
  7. MHA Davis (1978). Estimación lineal y control estocástico . Chapman and Hall..
  8. 1 2 3 4 5 6 Anders Lindquist (1973). "Control óptimo de sistemas estocásticos lineales con aplicaciones a sistemas con retardo de tiempo". Information Sciences . 5 : 81– 126. doi : 10.1016/0020-0255(73)90005-4 ..
  9. Murray Wonham (1968). "Sobre el teorema de separación del control estocástico". SIAM J. Control . 6 (2): 312– 326. doi : 10.1137/0306023 .
  10. WH Fleming y RW Rishel (1968). Control óptimo determinista y estocástico . Springer-Verlag..
  11. H. Kushner (1971). Introducción al control estocástico . Holt, Rinehart and Winston..
  12. Tyrone Duncan y Pravin Varaiya (1971). "Sobre las soluciones de un sistema de control estocástico" (PDF) . SIAM J. Control . 9 (3): 354–371 . doi : 10.1137/0309026 . hdl : 1808/16692 ..
  13. MHA Davis y P. Varaiya (1972). "Estados de información para sistemas estocásticos" . J. Math. Anal. Applications . 37 : 384–402 . doi : 10.1016/0022-247X(72)90281-8 ..
  14. 1 2 R.S. Liptser y AN Shirayev (1978). Estadística de procesos aleatorios II, Aplicaciones . Springer-Verlag..
  15. S. Mitter (1996). "Filtrado y control estocástico: una perspectiva histórica". IEEE Control Systems Magazine . 13 (3): 67– 76..
  16. ^ Rogers, L. Chris G. y David Williams (2000). Difusiones, procesos de Markov y martingalas: Volumen 2, Cálculo de Itô . Prensa de la universidad de Cambridge.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  17. Klebaner, Fima C. (2012). Introducción al cálculo estocástico con aplicaciones . Imperial College Press vía World Scientific Publishing Company.
  18. Protter, PE (2004). Integración estocástica y ecuaciones diferenciales . Springer.
  19. Anders Lindquist (1968). "Sobre el control estocástico óptimo con información suavizada". Information Sciences . 1 : 55–85 . doi : 10.1016/0020-0255(68)90007-8 ..
  20. Anders Lindquist (1969). "Un enfoque innovador para el control óptimo de sistemas estocásticos lineales con retardo de tiempo". Information Sciences . 1 (3): 279– 295. doi : 10.1016/S0020-0255(69)80014-9 ..
  21. R. Brooks (1972). "Control estocástico lineal: un principio de separación extendido" . J. Math. Anal. Appl . 38 (3): 569– 587. doi : 10.1016/0022-247X(72)90069-8 ..