Articulo de referencia

Control óptimo

Problema de control óptimo de referencia (Luus) con un objetivo integral, desigualdad y restricción diferencial. La teoría del control óptimo es una rama de la teoría del contro...

Problema de control óptimo de referencia (Luus) con un objetivo integral, desigualdad y restricción diferencial.

La teoría del control óptimo es una rama de la teoría del control que se ocupa de encontrar un control para un sistema dinámico durante un período de tiempo de manera que se optimice una función objetivo . [ 1 ] Tiene numerosas aplicaciones en ciencia, ingeniería e investigación operativa. Por ejemplo, el sistema dinámico podría ser una nave espacial con controles correspondientes a propulsores de cohete, y el objetivo podría ser llegar a la Luna con un gasto mínimo de combustible. [ 2 ] O el sistema dinámico podría ser la economía de una nación , con el objetivo de minimizar el desempleo ; los controles en este caso podrían ser la política fiscal y monetaria . [ 3 ] Un sistema dinámico también puede introducirse para integrar problemas de investigación operativa dentro del marco de la teoría del control óptimo. [ 4 ] [ 5 ]

El control óptimo es una extensión del cálculo de variaciones y es un método de optimización matemática para derivar políticas de control . [ 6 ] El método se debe en gran medida al trabajo de Lev Pontryagin y Richard Bellman en la década de 1950, después de las contribuciones al cálculo de variaciones de Edward J. McShane . [ 7 ] El control óptimo puede verse como una estrategia de control en la teoría de control . [ 1 ]

Método general

El control óptimo aborda el problema de encontrar una ley de control para un sistema dado que cumpla con un criterio de optimalidad determinado. Un problema de control incluye una función de costo que depende de las variables de estado y de control. Un control óptimo es un conjunto de ecuaciones diferenciales que describen las trayectorias de las variables de control que minimizan la función de costo. El control óptimo puede derivarse utilizando el principio del máximo de Pontryagin (una condición necesaria, también conocida como principio del mínimo de Pontryagin o simplemente principio de Pontryagin) [ 8 ] o resolviendo la ecuación de Hamilton-Jacobi-Bellman (una condición suficiente ).

Comencemos con un ejemplo sencillo. Imaginemos un automóvil que circula en línea recta por una carretera con pendiente. La pregunta es: ¿cómo debe el conductor pisar el acelerador para minimizar el tiempo total de viaje? En este ejemplo, el término ley de control se refiere específicamente a la forma en que el conductor pisa el acelerador y cambia de marcha. El sistema está compuesto por el automóvil y la carretera, y el criterio de optimización es la minimización del tiempo total de viaje. Los problemas de control suelen incluir restricciones adicionales . Por ejemplo, la cantidad de combustible disponible puede ser limitada, el pedal del acelerador no puede atravesar el piso del automóvil, existen límites de velocidad, etc.

Una función de coste adecuada será una expresión matemática que proporcione el tiempo de viaje en función de la velocidad, las consideraciones geométricas y las condiciones iniciales del sistema. Las restricciones suelen ser intercambiables con la función de coste.

Otro problema de control óptimo relacionado podría ser encontrar la mejor manera de conducir el automóvil para minimizar su consumo de combustible, dado que debe completar un recorrido determinado en un tiempo que no exceda un cierto límite. Un problema de control similar podría ser minimizar el costo monetario total de completar el viaje, dados los precios monetarios supuestos para el tiempo y el combustible.

Un marco más abstracto es el siguiente: [ 1 ] Minimizar la función de costo en tiempo continuo J[incógnita(),(),t0,tF]:=mi[incógnita(t0),t0,incógnita(tF),tF]+t0tFF[incógnita(t),(t),t]dt{\displaystyle J[{\textbf {x}}(\cdot ),{\textbf {u}}(\cdot ),t_{0},t_{f}]:=E\,[{\textbf {x}}(t_{0}),t_{0},{\textbf {x}}(t_{f}),t_{f}]+\int _{t_{0}}^{t_{f}}F\,[{\textbf {x}}(t),{\textbf {u}}(t),t]\,\mathrm {d} t} sujeto a las restricciones dinámicas de primer orden (la ecuación de estado ) incógnita˙(t)=F[incógnita(t),(t),t],{\displaystyle {\dot {\textbf {x}}}(t)={\textbf {f}}\,[\,{\textbf {x}}(t),{\textbf {u}}(t),t],} las restricciones de camino algebraicoh[incógnita(t),(t),t]0,{\displaystyle {\textbf {h}}\,[{\textbf {x}}(t),{\textbf {u}}(t),t]\leq {\textbf {0}},} y las condiciones del punto finalmi[incógnita(t0),t0,incógnita(tF),tF]=0{\displaystyle {\textbf {e}}[{\textbf {x}}(t_{0}),t_{0},{\textbf {x}}(t_{f}),t_{f}]=0} dóndeincógnita(t){\displaystyle {\textbf {x}}(t)}es el estado ,(t){\displaystyle {\textbf {u}}(t)}es el control ,t{\displaystyle t}es la variable independiente (en términos generales, el tiempo),t0{\displaystyle t_{0}}es el momento inicial, ytF{\displaystyle t_{f}}es el tiempo terminal. Los términosmi{\displaystyle E}yF{\displaystyle F}se denominan costo del punto final y costo de ejecución respectivamente. En el cálculo de variaciones,mi{\displaystyle E}yF{\displaystyle F}se denominan término de Mayer y lagrangiano , respectivamente. Además, se observa que las restricciones de trayectoria son en general restricciones de desigualdad y, por lo tanto, pueden no estar activas (es decir, ser iguales a cero) en la solución óptima. También se observa que el problema de control óptimo, como se indicó anteriormente, puede tener múltiples soluciones (es decir, la solución puede no ser única). Por lo tanto, lo más frecuente es que cualquier solución[incógnita(t),(t),t0,tF]{\displaystyle [{\textbf {x}}^{*}(t),{\textbf {u}}^{*}(t),t_{0}^{*},t_{f}^{*}]}El problema de control óptimo es minimizar localmente .

Control lineal cuadrático

Un caso especial del problema general de control óptimo no lineal presentado en la sección anterior es el problema de control óptimo lineal cuadrático (LQ) . El problema LQ se plantea de la siguiente manera: Minimizar la función de coste cuadrática en tiempo continuo. J=12incógnitaT(tF)SFincógnita(tF)+12t0tF[incógnitaT(t)Q(t)incógnita(t)+T(t)R(t)(t)]dt{\displaystyle J={\tfrac {1}{2}}\mathbf {x} ^{\mathsf {T}}(t_{f})\mathbf {S} _{f}\mathbf {x} (t_{f})+{\tfrac {1}{2}}\int _{t_{0}}^{t_{f}}[\,\mathbf {x} ^{\mathsf {T}}(t)\mathbf {Q} (t)\mathbf {x} (t)+\mathbf {u} ^{\mathsf {T}}(t)\mathbf {R} (t)\mathbf {u} (t)]\,\mathrm {d} t}

Sujeto a las restricciones dinámicas lineales de primer orden incógnita˙(t)=A(t)incógnita(t)+B(t)(t),{\displaystyle {\dot {\mathbf {x} }}(t)=\mathbf {A} (t)\mathbf {x} (t)+\mathbf {B} (t)\mathbf {u} (t),} y la condición inicial incógnita(t0)=incógnita0{\displaystyle \mathbf {x} (t_{0})=\mathbf {x} _{0}}

Una forma particular del problema LQ que surge en muchos problemas de sistemas de control es la del regulador lineal cuadrático (LQR) donde todas las matrices (es decir,A{\displaystyle \mathbf {A} },B{\displaystyle \mathbf {B} },Q{\displaystyle \mathbf {Q} }, yR{\displaystyle \mathbf {R} }) son constantes , el tiempo inicial se establece arbitrariamente en cero y el tiempo final se toma en el límitetF{\displaystyle t_{f}\rightarrow \infty }(Esta última suposición es lo que se conoce como horizonte infinito ). El problema LQR se plantea de la siguiente manera: Minimizar la función de coste cuadrática de tiempo continuo con horizonte infinito. J=120[incógnitaT(t)Qincógnita(t)+T(t)R(t)]dt{\displaystyle J={\tfrac {1}{2}}\int _{0}^{\infty }[\mathbf {x} ^{\mathsf {T}}(t)\mathbf {Q} \mathbf {x} (t)+\mathbf {u} ^{\mathsf {T}}(t)\mathbf {R} \mathbf {u} (t)]\,\mathrm {d} t}

Sujeto a las restricciones dinámicas lineales de primer orden invariantes en el tiempoincógnita˙(t)=Aincógnita(t)+B(t),{\displaystyle {\dot {\mathbf {x} }}(t)=\mathbf {A} \mathbf {x} (t)+\mathbf {B} \mathbf {u} (t),} y la condición inicial incógnita(t0)=incógnita0{\displaystyle \mathbf {x} (t_{0})=\mathbf {x} _{0}}

En el caso de horizonte finito, las matrices están restringidas en queQ{\displaystyle \mathbf {Q} }yR{\displaystyle \mathbf {R} }son semidefinidas positivas y definidas positivas, respectivamente. Sin embargo, en el caso de horizonte infinito, las matricesQ{\displaystyle \mathbf {Q} }yR{\displaystyle \mathbf {R} }no solo son semidefinidas positivas y definidas positivas, respectivamente, sino que también son constantes . Estas restricciones adicionales en Q{\displaystyle \mathbf {Q} }yR{\displaystyle \mathbf {R} }En el caso de horizonte infinito, se imponen restricciones para garantizar que la función de costo permanezca positiva. Además, para garantizar que la función de costo esté acotada , se impone la restricción adicional de que el par(A,B){\displaystyle (\mathbf {A} ,\mathbf {B} )}es controlable . Tenga en cuenta que el funcional de costo LQ o LQR puede pensarse físicamente como un intento de minimizar la energía de control (medida como una forma cuadrática ).

El problema del horizonte infinito (es decir, LQR) puede parecer demasiado restrictivo y esencialmente inútil porque supone que el operador está llevando el sistema al estado cero y, por lo tanto, llevando la salida del sistema a cero. Esto es correcto. Sin embargo, el problema de llevar la salida a un nivel distinto de cero deseado puede resolverse después de que se haya resuelto el de la salida cero. De hecho, se puede demostrar que este problema secundario de LQR puede resolverse de una manera muy directa. Se ha demostrado en la teoría clásica de control óptimo que el control óptimo LQ (o LQR) tiene la forma de retroalimentación (t)=K(t)incógnita(t){\displaystyle \mathbf {u} (t)=-\mathbf {K} (t)\mathbf {x} (t)} dóndeK(t){\displaystyle \mathbf {K} (t)}es una matriz con las dimensiones adecuadas, dada como K(t)=R1BTS(t),{\displaystyle \mathbf {K} (t)=\mathbf {R} ^{-1}\mathbf {B} ^{\mathsf {T}}\mathbf {S} (t),} yS(t){\displaystyle \mathbf {S} (t)}es la solución de la ecuación diferencial de Riccati . La ecuación diferencial de Riccati se expresa como: S˙(t)=S(t)AATS(t)+S(t)BR1BTS(t)Q{\displaystyle {\dot {\mathbf {S} }}(t)=-\mathbf {S} (t)\mathbf {A} -\mathbf {A} ^{\mathsf {T}}\mathbf {S} (t)+\mathbf {S} (t)\mathbf {B} \mathbf {R} ^{-1}\mathbf {B} ^{\mathsf {T}}\mathbf {S} (t)-\mathbf {Q} }

Para el problema LQ de horizonte finito, la ecuación de Riccati se integra hacia atrás en el tiempo utilizando la condición de contorno terminal. S(tF)=SF{\displaystyle \mathbf {S} (t_{f})=\mathbf {S} _{f}}

Para el problema LQR de horizonte infinito, la ecuación diferencial de Riccati se reemplaza por la ecuación algebraica de Riccati (ARE) dada por 0=SAATS+SBR1BTSQ{\displaystyle \mathbf {0} =-\mathbf {S} \mathbf {A} -\mathbf {A} ^{\mathsf {T}}\mathbf {S} +\mathbf {S} \mathbf {B} \mathbf {R} ^{-1}\mathbf {B} ^{\mathsf {T}}\mathbf {S} -\mathbf {Q} }

Entendiendo que el ARE surge del problema del horizonte infinito, las matricesA{\displaystyle \mathbf {A} },B{\displaystyle \mathbf {B} },Q{\displaystyle \mathbf {Q} }, yR{\displaystyle \mathbf {R} }son todas constantes . Cabe señalar que, en general, existen múltiples soluciones para la ecuación algebraica de Riccati , y la solución definida positiva (o semidefinida positiva) es la que se utiliza para calcular la ganancia de retroalimentación. El problema LQ (LQR) fue resuelto elegantemente por Rudolf E. Kálmán . [ 9 ]

Métodos numéricos para el control óptimo

Los problemas de control óptimo son generalmente no lineales y, por lo tanto, generalmente no tienen soluciones analíticas (por ejemplo, como el problema de control óptimo lineal-cuadrático). Como resultado, es necesario emplear métodos numéricos para resolver problemas de control óptimo. En los primeros años del control óptimo ( aproximadamente de la década de 1950 a la de 1980), el enfoque preferido para resolver problemas de control óptimo era el de los métodos indirectos . En un método indirecto, se emplea el cálculo de variaciones para obtener las condiciones de optimalidad de primer orden. Estas condiciones dan como resultado un problema de valores en la frontera de dos puntos (o, en el caso de un problema complejo, de múltiples puntos) . Este problema de valores en la frontera tiene una estructura especial porque surge de tomar la derivada de un hamiltoniano . Por lo tanto, el sistema dinámico resultante es un sistema hamiltoniano de la forma [ 1 ].incógnita˙=Hλλ˙=Hincógnita{\displaystyle {\begin{aligned}{\dot {\textbf {x}}}&={\frac {\partial H}{\partial {\boldsymbol {\lambda }}}}\\[1.2ex]{\dot {\boldsymbol {\lambda }}}&=-{\frac {\partial H}{\partial {\textbf {x}}}}\end{aligned}}} dónde H=F+λTFμTh{\displaystyle H=F+{\boldsymbol {\lambda }}^{\mathsf {T}}{\textbf {f}}-{\boldsymbol {\mu }}^{\mathsf {T}}{\textbf {h}}} es el hamiltoniano aumentado y en un método indirecto, el problema de valores en la frontera se resuelve (utilizando las condiciones de frontera o transversalidad apropiadas ). La belleza de utilizar un método indirecto es que el estado y el adjunto (es decir,λ{\displaystyle {\boldsymbol {\lambda }}}Se resuelven las ecuaciones y se verifica fácilmente que la solución resultante es una trayectoria extrema. La desventaja de los métodos indirectos es que el problema de valores en la frontera suele ser extremadamente difícil de resolver (en particular para problemas que abarcan grandes intervalos de tiempo o problemas con restricciones de punto interior). Un programa de software conocido que implementa métodos indirectos es BNDSCO. [ 10 ]

El enfoque que ha cobrado mayor relevancia en el control óptimo numérico desde la década de 1980 es el de los denominados métodos directos . En un método directo, el estado o el control, o ambos, se aproximan mediante una aproximación de función apropiada (por ejemplo, aproximación polinómica o parametrización constante por tramos). Simultáneamente, el funcional de coste se aproxima como una función de coste . Luego, los coeficientes de las aproximaciones de la función se tratan como variables de optimización y el problema se "transcribe" a un problema de optimización no lineal de la forma:

Minimizar F(z){\displaystyle F(\mathbf {z} )} sujeto a las restricciones algebraicas gramo(z)=0h(z)0{\displaystyle {\begin{aligned}\mathbf {g} (\mathbf {z} )&=\mathbf {0} \\\mathbf {h} (\mathbf {z} )&\leq \mathbf {0} \end{aligned}}}

Dependiendo del tipo de método directo empleado, el tamaño del problema de optimización no lineal puede ser bastante pequeño (por ejemplo, como en un método de disparo directo o cuasilinealización ), moderado (por ejemplo, control óptimo pseudoespectral [ 11 ] ) o bastante grande (por ejemplo, un método de colocación directa [ 12 ] ). En este último caso (es decir, un método de colocación), el problema de optimización no lineal puede tener literalmente miles o decenas de miles de variables y restricciones. Dado el tamaño de muchos problemas de optimización no lineal (PNL) que surgen de un método directo, puede parecer algo contraintuitivo que resolver el problema de optimización no lineal sea más fácil que resolver el problema de valores en la frontera. Sin embargo, es cierto que el PNL es más fácil de resolver que el problema de valores en la frontera. La razón de la relativa facilidad de cálculo, particularmente de un método de colocación directa, es que el PNL es disperso y existen muchos programas de software bien conocidos (por ejemplo, SNOPT [ 13 ] ) para resolver PNL dispersos de gran tamaño. Como resultado, el rango de problemas que se pueden resolver mediante métodos directos (en particular, los métodos de colocación directa , que son muy populares hoy en día) es significativamente mayor que el rango de problemas que se pueden resolver mediante métodos indirectos. De hecho, los métodos directos se han vuelto tan populares hoy en día que muchas personas han escrito programas de software elaborados que emplean estos métodos. En particular, muchos de estos programas incluyen DIRCOL , [ 14 ] SOCS, [ 15 ] OTIS, [ 16 ] GESOP/ ASTOS , [ 17 ] DITAN. [ 18 ] y PyGMO/PyKEP. [ 19 ] En los últimos años, debido a la llegada del lenguaje de programación MATLAB , el software de control óptimo en MATLAB se ha vuelto más común. Ejemplos de herramientas de software MATLAB desarrolladas académicamente que implementan métodos directos incluyen RIOTS , [ 20 ] DIDO , [ 21 ] DIRECT , [ 22 ] FALCON.m, [ 23 ] y GPOPS, [ 24 ] mientras que un ejemplo de una herramienta MATLAB desarrollada por la industria es PROPT . [ 25 ]Estas herramientas de software han aumentado significativamente la oportunidad para que las personas exploren problemas complejos de control óptimo tanto para la investigación académica como para problemas industriales. [ 26 ] Finalmente, se observa que los entornos de optimización de propósito general de MATLAB, como TOMLAB, han hecho que la codificación de problemas complejos de control óptimo sea significativamente más fácil que lo que era posible anteriormente en lenguajes como C y FORTRAN .

Control óptimo en tiempo discreto

Los ejemplos mostrados hasta ahora han presentado sistemas de tiempo continuo y soluciones de control. De hecho, dado que las soluciones de control óptimo se implementan ahora a menudo digitalmente , la teoría de control contemporánea se centra principalmente en sistemas y soluciones de tiempo discreto . La Teoría de Aproximaciones Consistentes [ 27 ] [ 28 ] proporciona condiciones bajo las cuales las soluciones a una serie de problemas de control óptimo discretizados con precisión creciente convergen a la solución del problema original de tiempo continuo. No todos los métodos de discretización poseen esta propiedad, incluso los que parecen obvios. [ 29 ] Por ejemplo, el uso de una rutina de tamaño de paso variable para integrar las ecuaciones dinámicas del problema puede generar un gradiente que no converge a cero (o no apunta en la dirección correcta) a medida que se aproxima a la solución. El método directo RIOTS se basa en la Teoría de Aproximaciones Consistentes.

Ejemplos

Una estrategia de solución común en muchos problemas de control óptimo es resolver para el coestado (a veces llamado precio sombra ).λ(t){\displaystyle \lambda (t)}El coestado resume en un número el valor marginal de expandir o contraer la variable de estado en el siguiente turno. El valor marginal no solo son las ganancias que se acumulan en el siguiente turno, sino que también está asociado con la duración del programa. Es bueno cuandoλ(t){\displaystyle \lambda (t)}Se puede resolver analíticamente, pero normalmente, lo máximo que se puede hacer es describirlo lo suficientemente bien como para que la intuición pueda captar la naturaleza de la solución y un solucionador de ecuaciones pueda calcular numéricamente los valores.

Habiendo obtenidoλ(t){\displaystyle \lambda (t)}, el valor óptimo de giro t para el control generalmente se puede resolver como una ecuación diferencial condicionada al conocimiento deλ(t){\displaystyle \lambda (t)}Nuevamente, es poco frecuente, especialmente en problemas de tiempo continuo, obtener explícitamente el valor del control o del estado. Por lo general, la estrategia consiste en calcular umbrales y regiones que caracterizan el control óptimo y utilizar un solucionador numérico para aislar los valores de elección reales en el tiempo.

Tiempo finito

Consideremos el problema de un propietario de una mina que debe decidir a qué ritmo extraer el mineral de su mina. Posee los derechos sobre el mineral desde la fecha0{\displaystyle 0}hasta la fechaT{\displaystyle T}. En la fecha0{\displaystyle 0}hayincógnita0{\displaystyle x_{0}}mineral en el subsuelo y la cantidad de mineral dependiente del tiempoincógnita(t){\displaystyle x(t)}lo que queda en el suelo disminuye a la tasa de(t){\displaystyle u(t)}que el propietario de la mina lo extrae. El propietario de la mina extrae el mineral a costo.(t)2/incógnita(t){\displaystyle u(t)^{2}/x(t)}(el costo de extracción aumenta con el cuadrado de la velocidad de extracción y el inverso de la cantidad de mineral restante) y vende el mineral a un precio constante.pag{\displaystyle p}Cualquier mineral que quede en el suelo en ese momento.T{\displaystyle T}no se puede vender y no tiene valor (no hay "valor de chatarra"). El propietario elige la tasa de extracción que varía con el tiempo.(t){\displaystyle u(t)}maximizar las ganancias durante el período de propiedad sin aplicar descuentos por tiempo.

  1. versión de tiempo discreto

    El gerente maximiza las gananciasΠ{\displaystyle \Pi }: Π=t=0T1[pagtt2incógnitat]{\displaystyle \Pi =\sum _{t=0}^{T-1}\left[pu_{t}-{\frac {u_{t}^{2}}{x_{t}}}\right]} sujeto a la ley de movimiento para la variable de estadoincógnitat{\displaystyle x_{t}}incógnitat+1incógnitat=t{\displaystyle x_{t+1}-x_{t}=-u_{t}}

    Forme el hamiltoniano y derive: H=pagtt2incógnitatλt+1tHt=pagλt+12tincógnitat=0λt+1λt=Hincógnitat=(tincógnitat)2{\displaystyle {\begin{aligned}H&=pu_{t}-{\frac {u_{t}^{2}}{x_{t}}}-\lambda _{t+1}u_{t}\\{\frac {\partial H}{\partial u_{t}}}&=p-\lambda _{t+1}-2{\frac {u_{t}}{x_{t}}}=0\\\lambda _{t+1}-\lambda _{t}&=-{\frac {\partial H}{\partial x_{t}}}=-\left({\frac {u_{t}}{x_{t}}}\right)^{2}\end{aligned}}}

    Como el propietario de la mina no valora el mineral restante en ese momentoT{\displaystyle T}, λT=0{\displaystyle \lambda _{T}=0}

    Utilizando las ecuaciones anteriores, es fácil resolver para laincógnitat{\displaystyle x_{t}}yλt{\displaystyle \lambda _{t}}serie λt=λt+1+(pagλt+1)24incógnitat+1=incógnitat2pag+λt+12{\displaystyle {\begin{aligned}\lambda _{t}&=\lambda _{t+1}+{\frac {\left(p-\lambda _{t+1}\right)^{2}}{4}}\\x_{t+1}&=x_{t}{\frac {2-p+\lambda _{t+1}}{2}}\end{aligned}}}

    y utilizando las condiciones iniciales y de giro T, elincógnitat{\displaystyle x_{t}}Las series se pueden resolver explícitamente, dando como resultadot{\displaystyle u_{t}}.
  2. Versión de tiempo continuo

    El gerente maximiza las gananciasΠ{\displaystyle \Pi }: Π=0T[pag(t)(t)2incógnita(t)]dt{\displaystyle \Pi =\int _{0}^{T}\left[pu(t)-{\frac {u(t)^{2}}{x(t)}}\right]dt} donde la variable de estadoincógnita(t){\displaystyle x(t)}evoluciona de la siguiente manera: incógnita˙(t)=(t){\displaystyle {\dot {x}}(t)=-u(t)}

    Forme el hamiltoniano y derive: H=pag(t)(t)2incógnita(t)λ(t)(t)H=pagλ(t)2(t)incógnita(t)=0λ˙(t)=Hincógnita=((t)incógnita(t))2{\displaystyle {\begin{aligned}H&=pu(t)-{\frac {u(t)^{2}}{x(t)}}-\lambda (t)u(t)\\{\frac {\partial H}{\partial u}}&=p-\lambda (t)-2{\frac {u(t)}{x(t)}}=0\\{\dot {\lambda }}(t)&=-{\frac {\partial H}{\partial x}}=-\left({\frac {u(t)}{x(t)}}\right)^{2}\end{aligned}}}

    Como el propietario de la mina no valora el mineral restante en ese momentoT{\displaystyle T}, λ(T)=0{\displaystyle \lambda (T)=0}

    Utilizando las ecuaciones anteriores, es fácil resolver las ecuaciones diferenciales que rigen(t){\displaystyle u(t)}yλ(t){\displaystyle \lambda (t)}λ˙(t)=(pagλ(t))24(t)=incógnita(t)pagλ(t)2{\displaystyle {\begin{aligned}{\dot {\lambda }}(t)&=-{\frac {(p-\lambda (t))^{2}}{4}}\\u(t)&=x(t){\frac {p-\lambda (t)}{2}}\end{aligned}}} y utilizando las condiciones iniciales y de giro T, las funciones se pueden resolver para obtener

    incógnita(t)=(4pagt+pagT)2(4+pagT)2incógnita0{\displaystyle x(t)={\frac {\left(4-pt+pT\right)^{2}}{\left(4+pT\right)^{2}}}x_{0}}

Véase también

Referencias

  1. 1 2 3 4 Ross, Isaac (2015). Introducción al principio de Pontryagin en control óptimo . San Francisco: Collegiate Publishers. ISBN 978-0-9843571-0-9OCLC 625106088 
  2. Luenberger, David G. (1979). "Control óptimo". Introducción a los sistemas dinámicos . Nueva York: John Wiley & Sons. págs. 393-435 . ISBN  0-471-02594-1.
  3. Kamien, Morton I. (2013). Optimización dinámica: el cálculo de variaciones y el control óptimo en economía y gestión . Dover Publications. ISBN 978-1-306-39299-0OCLC 869522905 
  4. Ross, IM; Proulx, RJ; Karpenko, M. (6 de mayo de 2020). "Una teoría de control óptimo para el problema del viajante y sus variantes". arXiv : 2005.03186 [ math.OC ].
  5. Ross, Isaac M.; Karpenko, Mark; Proulx, Ronald J. (1 de enero de 2016). "Un cálculo no suave para resolver algunos problemas de control basados ​​en la teoría de grafos**Esta investigación fue patrocinada por la Marina de los EE. UU." . IFAC-PapersOnLine . 10.º Simposio IFAC sobre Sistemas de Control No Lineales NOLCOS 2016. 49 (18): 462– 467. doi : 10.1016/j.ifacol.2016.10.208 . ISSN 2405-8963 . 
  6. Sargent, RWH (2000). "Control óptimo" . Journal of Computational and Applied Mathematics . 124 ( 1–2 ): 361–371 . Bibcode : 2000JCoAM.124..361S . doi : 10.1016/S0377-0427(00)00418-0 .
  7. Bryson, AE (1996). "Control óptimo: 1950 a 1985". IEEE Control Systems Magazine . 16 (3): 26– 33. doi : 10.1109/37.506395 .
  8. Ross, IM (2009). Introducción al principio de Pontryagin en el control óptimo . Collegiate Publishers. ISBN 978-0-9843571-0-9.
  9. Kalman, Rudolf. Un nuevo enfoque para problemas de filtrado y predicción lineal . Transactions of the ASME, Journal of Basic Engineering, 82:34–45, 1960
  10. Oberle, HJ y Grimm, W., "BNDSCO: un programa para la solución numérica de problemas de control óptimo", Instituto de Dinámica de Sistemas de Vuelo, DLR, Oberpfaffenhofen, 1989
  11. Ross, IM ; Karpenko, M. (2012). "Una revisión del control óptimo pseudoespectral: de la teoría al vuelo" . Annual Reviews in Control . 36 (2): 182–197 . arXiv : 2511.20843 . doi : 10.1016/j.arcontrol.2012.09.002 .
  12. Betts, JT (2010). Métodos prácticos para el control óptimo mediante programación no lineal (2.ª ed.). Filadelfia, Pensilvania: SIAM Press. ISBN  978-0-89871-688-7.
  13. Gill, PE, Murray, WM y Saunders, MA, Manual del usuario de SNOPT versión 7: Software para programación no lineal a gran escala , Informe de la Universidad de California, San Diego, 24 de abril de 2007
  14. von Stryk, O., Guía del usuario de DIRCOL (versión 2.1): un método de colocación directa para la solución numérica de problemas de control óptimo , Fachgebiet Simulation und Systemoptimierung (SIM), Technische Universität Darmstadt (2000, versión de noviembre de 1999).
  15. Betts, JT y Huffman, WP, Software de control óptimo disperso, SOCS , Boeing Information and Support Services, Seattle, Washington, julio de 1997
  16. Hargraves, CR; Paris, SW (1987). "Optimización directa de trayectorias mediante programación no lineal y colocación". Journal of Guidance, Control, and Dynamics . 10 (4): 338– 342. Bibcode : 1987JGCD...10..338H . doi : 10.2514/3.20223 .
  17. Gath, PF, Well, KH, "Optimización de trayectorias mediante una combinación de disparo múltiple directo y colocación", AIAA 2001–4047, Conferencia AIAA sobre guiado, navegación y control, Montreal, Quebec, Canadá, 6–9 de agosto de 2001
  18. Vasile M., Bernelli-Zazzera F., Fornasari N., Masarati P., "Diseño de misiones interplanetarias y lunares que combinan empuje bajo y asistencia gravitatoria", Informe final del contrato de estudio ESA/ESOC n.º 14126/00/D/CS, septiembre de 2002
  19. Izzo, Dario. "PyGMO y PyKEP: herramientas de código abierto para la optimización masivamente paralela en astrodinámica (el caso de la optimización de trayectorias interplanetarias)". Actas de la Quinta Conferencia Internacional sobre Herramientas y Técnicas de Astrodinámica, ICATT. 2012.
  20. RIOTS Archivado el 16 de julio de 2011 en Wayback Machine , basado en Schwartz, Adam (1996). Teoría e implementación de métodos basados ​​en la integración de Runge-Kutta para resolver problemas de control óptimo (Ph.D.). Universidad de California en Berkeley. OCLC 35140322 . 
  21. Ross, IM, Mejoras en la caja de herramientas de control óptimo DIDO, arXiv 2020. https://arxiv.org/abs/2004.13112
  22. Williams, P., Guía del usuario de DIRECT, Versión 2.00, Melbourne, Australia, 2008
  23. FALCON.m , descrito en Rieck, M., Bittner, M., Grüter, B., Diepolder, J. y Piprek, P., FALCON.m - Guía del usuario , Instituto de Dinámica de Sistemas de Vuelo, Universidad Técnica de Múnich, octubre de 2019.
  24. GPOPS archivado el 24 de julio de 2011 en Wayback Machine , descrito en Rao, AV, Benson, DA, Huntington, GT, Francolin, C., Darby, CL y Patterson, MA, Manual del usuario de GPOPS: un paquete de MATLAB para optimización dinámica mediante el método pseudoespectral de Gauss , Informe de la Universidad de Florida, agosto de 2008.
  25. Rutquist, P. y Edvall, M. M, PROPT – Software de control óptimo para MATLAB , 1260 SE Bishop Blvd Ste E, Pullman, WA 99163, EE. UU.: Tomlab Optimization, Inc.
  26. IM Ross, Control óptimo computacional , 3er Taller sobre cuestiones computacionales en control no lineal, 8 de octubre de 2019, Monterey, CA
  27. E. Polak, Sobre el uso de aproximaciones consistentes en la solución de problemas de optimización semiinfinita y control óptimo Math. Prog. 62 pp. 385–415 (1993).
  28. Ross, I M. (1 de diciembre de 2005). "Una hoja de ruta para el control óptimo: la forma correcta de desplazarse" . Anales de la Academia de Ciencias de Nueva York . 1065 (1): 210– 231. Bibcode : 2005NYASA1065..210R . doi : 10.1196/annals.1370.015 . ISSN 0077-8923 . PMID 16510411. S2CID 7625851 .   
  29. Fahroo, Fariba; Ross, I. Michael (septiembre de 2008). "La convergencia de los coestados no implica la convergencia del control" . Journal of Guidance, Control, and Dynamics . 31 (5): 1492– 1497. Bibcode : 2008JGCD...31.1492F . doi : 10.2514/1.37331 . hdl : 10945/57005 . ISSN 0731-5090 . S2CID 756939 .  

Lecturas adicionales

  • Bertsekas, DP (1995). Programación dinámica y control óptimo . Belmont: Athena. ISBN 1-886529-11-6.
  • Bryson, A.E .; Ho, Y.-C. (1975). Control óptimo aplicado: optimización, estimación y control (Edición revisada  ). Nueva York: John Wiley and Sons. ISBN 0-470-11481-9.
  • Fleming, WH ; Rishel, RW (1975). Control óptimo determinista y estocástico . Nueva York: Springer. ISBN 0-387-90155-8.
  • Kamien, MI ; Schwartz, NL (1991). Optimización dinámica: El cálculo de variaciones y el control óptimo en economía y administración (Segunda  edición). Nueva York: Elsevier. ISBN 0-444-01609-0.
  • Kirk, DE (1970). Teoría del control óptimo: una introducción . Englewood Cliffs: Prentice-Hall. ISBN 0-13-638098-0.
  • Victor M. Becerra, ed. (2008). "Control óptimo" . Scholarpedia . Consultado el 31 de diciembre de 2022 .
  • Control óptimo computacional
  • Dr. Benoît CHACHUAT: Laboratorio de Control Automático – Programación No Lineal, Cálculo de Variaciones y Control Óptimo.
  • DIDO - Herramienta de MATLAB para control óptimo. Archivado el 30 de marzo de 2017 en Wayback Machine.
  • GEKKO - Paquete de Python para control óptimo
  • GESOP – Entorno gráfico para simulación y optimización

  • GPOPS-II – Software de control óptimo de propósito general para MATLAB
  • CasADi – Marco simbólico gratuito y de código abierto para un control óptimo
  • PROPT – Software de control óptimo para MATLAB
  • OpenOCL – Biblioteca Abierta de Control Óptimo. Archivada el 20 de abril de 2019 en Wayback Machine.
  • acados – marco de software de código abierto para control óptimo no lineal
  • Rockit (kit de control óptimo rápido): un marco de software para prototipar rápidamente problemas de control óptimo.
  • Elmer G. Wiens: Control óptimo : aplicaciones de la teoría del control óptimo utilizando el principio del máximo de Pontryagin con modelos interactivos.
  • Sobre el control óptimo por Yu-Chi Ho
  • Control óptimo pseudoespectral: Parte 1
  • Control óptimo pseudoespectral: Parte 2
  • Grabaciones y guion de la conferencia del Prof. Moritz Diehl, de la Universidad de Friburgo, sobre Control Óptimo Numérico.