Articulo de referencia

Red Hopfield moderna

Las redes de Hopfield modernas [ 1 ] [ 2 ] (también conocidas como memorias asociativas densas [ 3 ] ) son generalizaciones de las redes de Hopfield clásicas que rompen la relac...

Las redes de Hopfield modernas [ 1 ] [ 2 ] (también conocidas como memorias asociativas densas [ 3 ] ) son generalizaciones de las redes de Hopfield clásicas que rompen la relación de escala lineal entre el número de características de entrada y el número de memorias almacenadas. Esto se logra introduciendo no linealidades más fuertes (ya sea en la función de energía o en las funciones de activación de las neuronas) que conducen a una capacidad de almacenamiento de memoria superlineal [ 3 ] (incluso exponencial [ 4 ] ) en función del número de neuronas de características. La red aún requiere un número suficiente de neuronas ocultas. [ 5 ]

La idea teórica clave detrás de las redes de Hopfield modernas es utilizar una función de energía y una regla de actualización que presenta un pico más pronunciado alrededor de las memorias almacenadas en el espacio de configuraciones neuronales en comparación con la red de Hopfield clásica. [ 3 ]

Redes clásicas de Hopfield

Las redes de Hopfield [ 6 ] [ 7 ] son ​​redes neuronales recurrentes con trayectorias dinámicas que convergen a estados atractores de punto fijo y se describen mediante una función de energía . El estado de cada neurona del modeloi{\textstyle i}se define mediante una variable dependiente del tiempoVi{\displaystyle V_{i}}, que puede ser discreto o continuo. Un modelo completo describe matemáticamente cómo el estado futuro de actividad de cada neurona depende de la actividad presente o anterior conocida de todas las neuronas.

En el modelo original de Hopfield de memoria asociativa, [ 6 ] las variables eran binarias y la dinámica se describía mediante una actualización de una en una del estado de las neuronas. Una función de energía cuadrática en elVi{\displaystyle V_{i}}Se definió, y la dinámica consistió en cambiar la actividad de cada neurona individual.i{\displaystyle i}solo si al hacerlo se reduce la energía total del sistema. Esta misma idea se extendió al caso deVi{\displaystyle V_{i}}siendo una variable continua que representa la salida de la neuronai{\displaystyle i}, yVi{\displaystyle V_{i}}siendo una función monótona de una corriente de entrada. La dinámica se expresó como un conjunto de ecuaciones diferenciales de primer orden para las cuales la "energía" del sistema siempre disminuía. [ 7 ] La energía en el caso continuo tiene un término que es cuadrático en elVi{\displaystyle V_{i}}(como en el modelo binario), y un segundo término que depende de la función de ganancia ( función de activación de la neurona ). Si bien poseen muchas propiedades deseables de la memoria asociativa, ambos sistemas clásicos adolecen de una pequeña capacidad de almacenamiento de memoria, que aumenta linealmente con el número de características de entrada. [ 6 ]

Variables discretas

Un ejemplo sencillo [ 3 ] de la red de Hopfield moderna se puede escribir en términos de variables binarias.Vi{\displaystyle V_{i}}que representan al activoVi=+1{\displaystyle V_{i}=+1}y inactivoVi=1{\displaystyle V_{i}=-1}estado de la neurona modeloi{\displaystyle i}.mi=μ=1nortememoriaF(i=1norteFξμiVi){\displaystyle E=-\sum \limits _{\mu =1}^{N_{\text{mem}}}F{\Big (}\sum \limits _{i=1}^{N_{f}}\xi _{\mu i}V_{i}{\Big )}}En esta fórmula los pesosξμi{\textstyle \xi _{\mu i}}representar la matriz de vectores de memoria (índiceμ=1...nortememoria{\displaystyle \mu =1...N_{\text{mem}}}enumera diferentes recuerdos y el índicei=1...norteF{\displaystyle i=1...N_{f}}enumera el contenido de cada memoria correspondiente a lai{\displaystyle i}-ª característica neurona), y la funciónF(incógnita){\displaystyle F(x)}es una función no lineal de rápido crecimiento. La regla de actualización para neuronas individuales (en el caso asíncrono) se puede escribir de la siguiente formaVi(t+1)=firmar[μ=1nortememoria(F(ξμi+jiξμjVj(t))F(ξμi+jiξμjVj(t)))]{\displaystyle V_{i}^{(t+1)}=\operatorname {sign} {\bigg [}\sum \limits _{\mu =1}^{N_{\text{mem}}}{\bigg (}F{\Big (}\xi _{\mu i}+\sum \limits _{j\neq i}\xi _{\mu j}V_{j}^{(t)}{\Big )}-F{\Big (}-\xi _{\mu i}+\sum \limits _{j\neq i}\xi _{\mu j}V_{j}^{(t)}{\Big )}{\bigg )}{\bigg ]}}que establece que para calcular el estado actualizado deli{\textstyle i}-la neurona -la red compara dos energías: la energía de la red con lai{\displaystyle i}-ésima neurona en estado ON y la energía de la red con lai{\displaystyle i}-ésima neurona en estado APAGADO, dados los estados de las neuronas restantes. El estado actualizado de lai{\displaystyle i}La neurona -ésima selecciona el estado que tiene la energía más baja de las dos. [ 3 ]

En el caso límite cuando la función de energía no lineal es cuadráticaF(incógnita)=incógnita2{\displaystyle F(x)=x^{2}}Estas ecuaciones se reducen a la función de energía familiar y a la regla de actualización para la red de Hopfield binaria clásica. [ 6 ]

La capacidad de almacenamiento de memoria de estas redes se puede calcular para patrones binarios aleatorios. Para la función de energía de potenciaF(incógnita)=incógnitanorte{\displaystyle F(x)=x^{n}}El número máximo de recuerdos que se pueden almacenar y recuperar de esta red sin errores viene dado por [ 3 ].nortememoriamáximo12(2norte3)¡¡norteFnorte1ln(norteF){\displaystyle N_{\text{mem}}^{\max }\approx {\frac {1}{2(2n-3)!!}}{\frac {N_{f}^{n-1}}{\ln(N_{f})}}}Para una función de energía exponencialF(incógnita)=miincógnita{\textstyle F(x)=e^{x}}La capacidad de almacenamiento de memoria es exponencial en el número de neuronas de características [ 4 ].nortememoriamáximo2norteF/2{\displaystyle N_{\text{mem}}^{\max }\approx 2^{N_{f}/2}}

Variables continuas

Figura 1. Ejemplo de una red Hopfield moderna continua connorteF=5{\textstyle N_{f}=5} neuronas características ynortememoria=11{\displaystyle N_{\text{mem}}=11}Neuronas de memoria (ocultas) con conexiones sinápticas simétricas entre ellas.

Las redes de Hopfield modernas o memorias asociativas densas se pueden comprender mejor en variables continuas y tiempo continuo. [ 1 ] [ 5 ] Considere la arquitectura de la red, mostrada en la Fig. 1, y las ecuaciones para la evolución del estado de las neuronas [ 5 ]

donde las corrientes de las neuronas características se denotan porincógnitai{\textstyle x_{i}}y las corrientes de las neuronas de memoria se denotan porhμ{\displaystyle h_{\mu }}(h{\displaystyle h}representa neuronas ocultas). No hay conexiones sinápticas entre las neuronas de características o las neuronas de memoria. Una matrizξμi{\displaystyle \xi _{\mu i}}indica la fuerza de las sinapsis de una neurona característicai{\displaystyle i}a la neurona de la memoriaμ{\displaystyle \mu }Se supone que las sinapsis son simétricas, de modo que el mismo valor caracteriza una sinapsis física diferente de la neurona de memoria.μ{\displaystyle \mu }a la neurona de característicasi{\displaystyle i}. Las salidas de las neuronas de memoria y las neuronas de características se denotan porFμ{\displaystyle f_{\mu }}ygramoi{\displaystyle g_{i}}, que son funciones no lineales de las corrientes correspondientes. En general, estas salidas pueden depender de las corrientes de todas las neuronas en esa capa, de modo queFμ=F({hμ}){\displaystyle f_{\mu }=f(\{h_{\mu }\})}ygramoi=gramo({incógnitai}){\textstyle g_{i}=g(\{x_{i}\})}Es conveniente definir estas funciones de activación como derivadas de las funciones lagrangianas para los dos grupos de neuronas.

De esta forma, la forma específica de las ecuaciones para los estados de las neuronas queda completamente definida una vez que se especifican las funciones lagrangianas. Finalmente, las constantes de tiempo para los dos grupos de neuronas se denotan porτF{\displaystyle \tau _{f}}yτh{\displaystyle \tau _{h}},Ii{\displaystyle I_{i}}es la corriente de entrada a la red que puede ser impulsada por los datos presentados.

Fig.2 Teoría efectiva sobre las neuronas de características para varias elecciones comunes de las funciones lagrangianas. El modelo A se reduce a los modelos estudiados en [ 3 ] [ 4 ] dependiendo de la elección de la función de activación, el modelo B se reduce al modelo estudiado en, [ 1 ] el modelo C se reduce al modelo de. [ 5 ]

Los sistemas generales de ecuaciones diferenciales no lineales pueden presentar comportamientos complejos que dependen de la elección de las no linealidades y las condiciones iniciales. Sin embargo, en el caso de las redes de Hopfield, esto no ocurre: las trayectorias dinámicas siempre convergen a un estado atractor de punto fijo. Esta propiedad se logra gracias a que estas ecuaciones están diseñadas específicamente para que tengan una función de energía subyacente [ 5 ].

Los términos agrupados entre corchetes representan una transformación de Legendre de la función lagrangiana con respecto a los estados de las neuronas. Si las matrices hessianas de las funciones lagrangianas son semidefinidas positivas, se garantiza que la función de energía disminuirá en la trayectoria dinámica [ 5 ].

Esta propiedad permite demostrar que el sistema de ecuaciones dinámicas que describe la evolución temporal de la actividad neuronal acabará alcanzando un estado atractor de punto fijo.

En ciertas situaciones se puede suponer que la dinámica de las neuronas ocultas se equilibra en una escala de tiempo mucho más rápida en comparación con las neuronas de características,τhτF{\textstyle \tau _{h}\ll \tau _{f}}En este caso, la solución de estado estacionario de la segunda ecuación del sistema ( 1 ) puede usarse para expresar las corrientes de las unidades ocultas a través de las salidas de las neuronas de características. Esto permite reducir la teoría general ( 1 ) a una teoría efectiva solo para neuronas de características. Las reglas de actualización efectivas resultantes y las energías para varias elecciones comunes de las funciones lagrangianas se muestran en la Fig. 2. En el caso de la función lagrangiana log-suma-exponencial, la regla de actualización (si se aplica una vez) para los estados de las neuronas de características es el mecanismo de atención [ 1 ] comúnmente utilizado en muchos sistemas de IA modernos (ver Ref. [ 5 ] para la derivación de este resultado a partir de la formulación de tiempo continuo).

Relación con la red clásica de Hopfield con variables continuas

La formulación clásica de las redes de Hopfield continuas [ 6 ] puede entenderse [ 5 ] como un caso límite especial de las redes de Hopfield modernas con una capa oculta. Las redes de Hopfield continuas para neuronas con respuesta graduada se describen típicamente [ 6 ] mediante las ecuaciones dinámicas.

y la función de energía

dóndeVi=gramo(incógnitai){\textstyle V_{i}=g(x_{i})}, ygramo1(z){\displaystyle g^{-1}(z)}es la inversa de la función de activacióngramo(incógnita){\displaystyle g(x)}Este modelo es un límite especial de la clase de modelos que se denomina modelos A, [ 5 ] con la siguiente elección de las funciones lagrangianas.

que, según la definición ( 2 ), conduce a las funciones de activación

Si integramos las neuronas ocultas, el sistema de ecuaciones ( 1 ) se reduce a las ecuaciones sobre las neuronas de características ( 5 ) conTij=μ=1nortehξμiξμj{\displaystyle T_{ij}=\sum \limits _{\mu =1}^{N_{h}}\xi _{\mu i}\xi _{\mu j}}y la expresión general para la energía ( 3 ) se reduce a la energía efectiva

Si bien los dos primeros términos de la ecuación ( 6 ) son iguales a los de la ecuación ( 9 ), el tercer término parece superficialmente diferente. En la ecuación ( 9 ) es una transformada de Legendre del lagrangiano para las neuronas de características, mientras que en ( 6 ) el tercer término es una integral de la función de activación inversa. Sin embargo, estas dos expresiones son de hecho equivalentes, ya que las derivadas de una función y su transformada de Legendre son funciones inversas entre sí. La forma más sencilla de ver que estos dos términos son iguales explícitamente es diferenciar cada uno con respecto aincógnitai{\displaystyle x_{i}}. Los resultados de estas diferenciaciones para ambas expresiones son iguales aincógnitaigramo(incógnitai){\displaystyle x_{i}g(x_{i})'}. Por lo tanto, las dos expresiones son iguales salvo una constante aditiva. Esto completa la demostración [ 5 ] de que la red de Hopfield clásica con estados continuos [ 6 ] es un caso límite especial de la red de Hopfield moderna ( 1 ) con energía ( 3 ).

Formulación general

Figura 3. Diagrama de conectividad de la red de Hopfield moderna totalmente conectada, compuesta por cinco neuronas. Los pesos sinápticos se describen mediante una matriz simétrica.WIJ{\displaystyle W_{IJ}}.

Las redes neuronales biológicas presentan un alto grado de heterogeneidad en cuanto a los diferentes tipos de células. Esta sección describe un modelo matemático de una red de Hopfield moderna totalmente conectada, asumiendo un grado extremo de heterogeneidad: cada neurona es diferente. [ 8 ] Específicamente, se describe una función de energía y las ecuaciones dinámicas correspondientes, asumiendo que cada neurona tiene su propia función de activación y escala de tiempo cinética. Se asume que la red está totalmente conectada, de modo que cada neurona está conectada a todas las demás mediante una matriz simétrica de pesos.WIJ{\displaystyle W_{IJ}}, índicesI{\displaystyle I}yJ{\displaystyle J}Enumerar las diferentes neuronas de la red, véase la figura 3. La forma más sencilla de formular matemáticamente este problema es definir la arquitectura mediante una función lagrangiana.L({incógnitaI}){\displaystyle L(\{x_{I}\})}que depende de las actividades de todas las neuronas en la red. La función de activación para cada neurona se define como una derivada parcial del lagrangiano con respecto a la actividad de esa neurona.

Desde la perspectiva biológica se puede pensar engramoI{\displaystyle g_{I}}como una salida axonal de la neuronaI{\displaystyle I}En el caso más simple, cuando el lagrangiano es aditivo para diferentes neuronas, esta definición resulta en una activación que es una función no lineal de la actividad de esa neurona. Para lagrangianos no aditivos, esta función de activación puede depender de las actividades de un grupo de neuronas. Por ejemplo, puede contener normalización contrastiva (softmax) o divisiva. Las ecuaciones dinámicas que describen la evolución temporal de una neurona dada se presentan en [ 8 ].

Esta ecuación pertenece a la clase de modelos denominados modelos de tasa de disparo en neurociencia. Cada neuronaI{\displaystyle I}recoge las salidas axónicasgramoJ{\displaystyle g_{J}}de todas las neuronas, las pondera con los coeficientes sinápticosWIJ{\displaystyle W_{IJ}}y produce su propia actividad dependiente del tiempoincógnitaI{\displaystyle x_{I}}La evolución temporal tiene una constante de tiempo.τI{\displaystyle \tau _{I}}, que en general puede ser diferente para cada neurona. Esta red tiene una función de energía global [ 8 ]

donde los dos primeros términos representan la transformada de Legendre de la función lagrangiana con respecto a las corrientes de las neuronas.incógnitaI{\displaystyle x_{I}}. La derivada temporal de esta función de energía se puede calcular en las trayectorias dinámicas que conducen a (ver [ 8 ] para más detalles)

El último signo de desigualdad se cumple siempre que la matrizMETROIK{\displaystyle M_{IK}}(o su parte simétrica) es semidefinida positiva. Si, además, la función de energía está acotada inferiormente, se garantiza que las ecuaciones dinámicas no lineales convergerán a un estado atractor de punto fijo. La ventaja de formular esta red en términos de las funciones lagrangianas es que permite experimentar fácilmente con diferentes elecciones de las funciones de activación y diferentes configuraciones arquitectónicas de las neuronas. Para todas esas elecciones flexibles, las condiciones de convergencia están determinadas por las propiedades de la matriz.METROIJ{\displaystyle M_{IJ}}y la existencia de un límite inferior para la función de energía.

Red de memoria asociativa jerárquica

Fig. 4 Diagrama de conectividad de la red de memoria asociativa jerárquica en capas. [ 8 ] Cada capa puede tener un número diferente de neuronas, una función de activación diferente y escalas de tiempo diferentes. Los pesos de alimentación directa y los pesos de retroalimentación son iguales.

Las neuronas se pueden organizar en capas de modo que cada neurona en una capa dada tenga la misma función de activación y la misma escala de tiempo dinámica. Si asumimos que no hay conexiones horizontales entre las neuronas dentro de la capa (conexiones laterales) y no hay conexiones de salto de capa, la red general totalmente conectada ( 11 ), ( 12 ) se reduce a la arquitectura que se muestra en la Fig. 4. Tienenortecapa{\displaystyle N_{\text{layer}}}capas de neuronas conectadas recurrentemente con estados descritos por variables continuasincógnitaiA{\displaystyle x_{i}^{A}}y las funciones de activacióngramoiA{\displaystyle g_{i}^{A}}, índiceA{\displaystyle A}enumera las capas de la red y el índicei{\displaystyle i}Enumera las neuronas individuales en esa capa. Las funciones de activación pueden depender de la actividad de todas las neuronas en la capa. Cada capa puede tener un número diferente de neuronas.norteA{\displaystyle N_{A}}Estas neuronas están conectadas recurrentemente con las neuronas de las capas precedentes y subsiguientes. Las matrices de pesos que conectan las neuronas en las capasA{\displaystyle A}yB{\displaystyle B}se denotan porξij(A,B){\displaystyle \xi _{ij}^{(A,B)}}(el orden de los índices superiores para los pesos es el mismo que el orden de los índices inferiores, en el ejemplo anterior esto significa que el índicei{\displaystyle i}enumera las neuronas en la capaA{\displaystyle A}y el índicej{\displaystyle j}enumera las neuronas en la capaB{\displaystyle B}). Los pesos de alimentación directa y los pesos de retroalimentación son iguales. Las ecuaciones dinámicas para los estados de las neuronas se pueden escribir como [ 8 ]

con condiciones de contorno

La principal diferencia de estas ecuaciones con respecto a las redes de alimentación directa convencionales radica en la presencia del segundo término, responsable de la retroalimentación de las capas superiores. Estas señales descendentes ayudan a las neuronas de las capas inferiores a decidir su respuesta a los estímulos presentados. Siguiendo la receta general, resulta conveniente introducir una función lagrangiana.LA({incógnitaiA}){\displaystyle L^{A}(\{x_{i}^{A}\})}para elA{\displaystyle A}-ésima capa oculta, que depende de las actividades de todas las neuronas en esa capa. [ 8 ] Las funciones de activación en esa capa se pueden definir como derivadas parciales del lagrangiano

Con estas definiciones, la función de energía (Lyapunov) viene dada por [ 8 ].

Si las funciones lagrangianas, o equivalentemente las funciones de activación, se eligen de tal manera que los hessianos para cada capa sean semidefinidos positivos y la energía total esté acotada inferiormente, se garantiza que este sistema convergerá a un estado atractor de punto fijo. La derivada temporal de esta función de energía viene dada por [ 8 ].

Por lo tanto, la red jerárquica en capas es, en efecto, una red atractora con una función de energía global. Esta red se describe mediante un conjunto jerárquico de pesos sinápticos que se pueden aprender para cada problema específico.

Referencias

  1. 1 2 3 4 Ramsauer, Hubert; et  al. (2021). "Hopfield Networks is All You Need". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2008.02217 .
  2. "Hopfield Networks is All You Need" . hopfield-layers . 2020-08-25. Archivado del original el 26 de marzo de 2023. Consultado el 4 de mayo de 2023 .
  3. 1 2 3 4 5 6 7 Krotov, Dmitry; Hopfield, John (2016). "Memoria asociativa densa para el reconocimiento de patrones". Sistemas de procesamiento de información neuronal . 29 : 1172–1180 . arXiv : 1606.01164 .
  4. 1 2 3 Demircigil, Mete; et al. (2017). "Sobre un modelo de memoria asociativa con enorme capacidad de almacenamiento" . Journal of Statistical Physics . 168 (2): 288– 299. arXiv : 1702.01929 . Bibcode : 2017JSP...168..288D . doi : 10.1007/s10955-017-1806-y . S2CID 119317128 .  
  5. 1 2 3 4 5 6 7 8 9 10 Krotov, Dmitry; Hopfield, John (2021). "Gran problema de memoria asociativa en neurobiología y aprendizaje automático". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2008.06996 .
  6. 1 2 3 4 5 6 7 Hopfield, John (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias . 79 (8): 2554– 2558. Bibcode : 1982PNAS...79.2554H . doi : 10.1073/pnas.79.8.2554 . PMC 346238. PMID 6953413 .  
  7. 1 2 Hopfield, John (1984). "Las neuronas con respuesta graduada tienen propiedades computacionales colectivas como las de las neuronas de dos estados" . Actas de la Academia Nacional de Ciencias . 81 (10): 3088– 3092. Bibcode : 1984PNAS...81.3088H . doi : 10.1073/pnas.81.10.3088 . PMC 345226. PMID 6587342 .  
  8. ^ Krotov , Dmitry ( 2021 ) . ​"Memoria asociativa jerárquica". arXiv : 2107.06446 [ cs.NE ].