Articulo de referencia

Empoderamiento (inteligencia artificial)

El empoderamiento en el campo de la inteligencia artificial formaliza y cuantifica (mediante la teoría de la información ) el potencial que un agente percibe tener para influir ...

El empoderamiento en el campo de la inteligencia artificial formaliza y cuantifica (mediante la teoría de la información ) el potencial que un agente percibe tener para influir en su entorno. [ 1 ] [ 2 ] Un agente que sigue una política que maximiza el empoderamiento actúa para maximizar las opciones futuras (normalmente hasta un horizonte limitado). El empoderamiento puede utilizarse como una función de (pseudo)utilidad que depende únicamente de la información recopilada del entorno local para guiar la acción, en lugar de buscar un objetivo impuesto externamente; por lo tanto, es una forma de motivación intrínseca . [ 3 ]

El formalismo de empoderamiento depende de un modelo probabilístico comúnmente utilizado en inteligencia artificial. Un agente autónomo opera en el mundo tomando información sensorial y actuando para cambiar su estado, o el del entorno, en un ciclo de percepción y acción conocido como el bucle percepción-acción . El estado y las acciones del agente se modelan mediante variables aleatorias (S:sS,A:aA{\displaystyle S:s\in {\mathcal {S}},A:a\in {\mathcal {A}}}) y tiempo (t{\displaystyle t}). La elección de la acción depende del estado actual, y el estado futuro depende de la elección de la acción, por lo que el bucle percepción-acción que se desarrolla en el tiempo forma una red bayesiana causal .

Definición

Empoderamiento (mi{\displaystyle {\mathfrak {E}}}) se define como la capacidad del canal (do{\displaystyle C}) del canal de actuación del agente, y se formaliza como el flujo de información máximo posible entre las acciones del agente y el efecto de esas acciones algún tiempo después. El empoderamiento puede entenderse como el potencial futuro del agente para afectar su entorno, medido por sus sensores. [ 3 ]

mi:=do(AtSt+1)máximopag(at)I(At;St+1){\displaystyle {\mathfrak {E}}:=C(A_{t}\longrightarrow S_{t+1})\equiv \max _{p(a_{t})}I(A_{t};S_{t+1})}

En un modelo de tiempo discreto, el empoderamiento se puede calcular para un número determinado de ciclos en el futuro, lo que en la literatura se conoce como empoderamiento de "n pasos". [ 4 ]

mi(AtnorteSt+norte)=máximopag(at,...,at+norte1)I(At,...,At+norte1;St+norte){\displaystyle {\mathfrak {E}}(A_{t}^{n}\longrightarrow S_{t+n})=\max _{p(a_{t},...,a_{t+n-1})}I(A_{t},...,A_{t+n-1};S_{t+n})}

La unidad de potenciación depende de la base del logaritmo. La base 2 se usa comúnmente, en cuyo caso la unidad es bits .

Empoderamiento contextual

En general, la elección de la acción (distribución de acciones) que maximiza el empoderamiento varía de un estado a otro. Conocer el empoderamiento de un agente en un estado específico es útil, por ejemplo, para diseñar una política que lo maximice. El empoderamiento específico de cada estado puede determinarse mediante el formalismo más general del «empoderamiento contextual». [ 4 ]do{\displaystyle C}es una variable aleatoria que describe el contexto (por ejemplo, el estado).

mi(AtnorteSt+nortedo)=dodopag(do)mi(AtnorteSt+nortedo=do){\displaystyle {\mathfrak {E}}(A_{t}^{n}\longrightarrow S_{t+n}{\mid }C)=\sum _{c{\in }C}p(c){\mathfrak {E}}(A_{t}^{n}\longrightarrow S_{t+n}{\mid }C=c)}

Solicitud

La maximización del empoderamiento puede utilizarse como una pseudofunción de utilidad para permitir que los agentes exhiban un comportamiento inteligente sin necesidad de definir objetivos externos, por ejemplo, equilibrar un poste en un escenario de equilibrio de carreta-poste donde no se proporciona ninguna indicación de la tarea al agente. [ 4 ] El empoderamiento se ha aplicado en estudios de comportamiento colectivo [ 5 ] y en dominios continuos. [ 6 ] [ 7 ] Como ocurre con los métodos bayesianos en general, el cálculo del empoderamiento se vuelve computacionalmente costoso a medida que aumenta el número de acciones y el horizonte temporal , pero los enfoques para mejorar la eficiencia han llevado a su uso en el control en tiempo real. [ 8 ] El empoderamiento se ha utilizado para agentes de aprendizaje por refuerzo intrínsecamente motivados que juegan videojuegos, [ 9 ] y en el control de vehículos submarinos. [ 10 ]

Referencias

  1. Klyubin, A., Polani, D., y Nehaniv, C. (2005a). En igualdad de condiciones, ser empoderado. Avances en la vida artificial, páginas 744–753.
  2. Klyubin, A., Polani, D., y Nehaniv, C. (2005b). Empoderamiento: una medida de control universal centrada en el agente. En Computación Evolutiva, 2005. Congreso IEEE de 2005, volumen 1, páginas 128–135. IEEE.
  3. 1 2 Salge, C; Glackin, C; Polani, D (2014). "Empoderamiento: una introducción". En Prokopenko, M (ed.). Autoorganización guiada: inicio, surgimiento, complejidad y computación . Vol.  9. Springer. pp. 67–114 . arXiv : 1310.1863 . doi : 10.1007/978-3-642-53734-9_4 . ISBN  978-3-642-53733-2. S2CID 9662065 . 
  4. 1 2 3 Klyubin, A., Polani, D., y Nehaniv, C. (2008). Mantén tus opciones abiertas: un principio de conducción basado en la información para sistemas sensoriomotores. PLOS ONE, 3(12):e4018. https://dx.doi.org/10.1371%2Fjournal.pone.0004018
  5. Capdepuy, P., Polani, D., & Nehaniv, CL (2007, abril). Maximización del flujo potencial de información como utilidad universal para el comportamiento colectivo. En 2007 IEEE Symposium on Artificial Life (pp. 207-213). Ieee.
  6. Jung, T., Polani, D., & Stone, P. (2011). Empoderamiento para sistemas continuos agente-entorno. Adaptive Behavior, 19(1), 16-39.
  7. Salge, C., Glackin, C., & Polani, D. (2013). Aproximación del empoderamiento en el dominio continuo. Advances in Complex Systems, 16(02n03), 1250079.
  8. Karl, M., Soelch, M., Becker-Ehmck, P., Benbouzid, D., van der Smagt, P., & Bayer, J. (2017). Control en tiempo real no supervisado mediante el empoderamiento variacional. Preimpresión de arXiv arXiv:1710.05101.
  9. Mohamed, S., & Rezende, DJ (2015). Maximización de la información variacional para el aprendizaje por refuerzo intrínsecamente motivado. Preimpresión de arXiv arXiv:1509.08731.
  10. Volpi, NC, De Palma, D., Polani, D., & Indiveri, G. (2016). Cálculo de la autonomía para un vehículo submarino autónomo. IFAC-PapersOnLine, 49(15), 81-87.