Las redes de Hopfield modernas [ 1 ] [ 2 ] (también conocidas como memorias asociativas densas [ 3 ] ) son generalizaciones de las redes de Hopfield clásicas que rompen la relación de escala lineal entre el número de características de entrada y el número de memorias almacenadas. Esto se logra introduciendo no linealidades más fuertes (ya sea en la función de energía o en las funciones de activación de las neuronas) que conducen a una capacidad de almacenamiento de memoria superlineal [ 3 ] (incluso exponencial [ 4 ] ) en función del número de neuronas de características. La red aún requiere un número suficiente de neuronas ocultas. [ 5 ]
La idea teórica clave detrás de las redes de Hopfield modernas es utilizar una función de energía y una regla de actualización que presenta un pico más pronunciado alrededor de las memorias almacenadas en el espacio de configuraciones neuronales en comparación con la red de Hopfield clásica. [ 3 ]
Redes clásicas de Hopfield
Las redes de Hopfield [ 6 ] [ 7 ] son redes neuronales recurrentes con trayectorias dinámicas que convergen a estados atractores de punto fijo y se describen mediante una función de energía . El estado de cada neurona del modelose define mediante una variable dependiente del tiempo, que puede ser discreto o continuo. Un modelo completo describe matemáticamente cómo el estado futuro de actividad de cada neurona depende de la actividad presente o anterior conocida de todas las neuronas.
En el modelo original de Hopfield de memoria asociativa, [ 6 ] las variables eran binarias y la dinámica se describía mediante una actualización de una en una del estado de las neuronas. Una función de energía cuadrática en elSe definió, y la dinámica consistió en cambiar la actividad de cada neurona individual.solo si al hacerlo se reduce la energía total del sistema. Esta misma idea se extendió al caso desiendo una variable continua que representa la salida de la neurona, ysiendo una función monótona de una corriente de entrada. La dinámica se expresó como un conjunto de ecuaciones diferenciales de primer orden para las cuales la "energía" del sistema siempre disminuía. [ 7 ] La energía en el caso continuo tiene un término que es cuadrático en el(como en el modelo binario), y un segundo término que depende de la función de ganancia ( función de activación de la neurona ). Si bien poseen muchas propiedades deseables de la memoria asociativa, ambos sistemas clásicos adolecen de una pequeña capacidad de almacenamiento de memoria, que aumenta linealmente con el número de características de entrada. [ 6 ]
Variables discretas
Un ejemplo sencillo [ 3 ] de la red de Hopfield moderna se puede escribir en términos de variables binarias.que representan al activoy inactivoestado de la neurona modelo.En esta fórmula los pesosrepresentar la matriz de vectores de memoria (índiceenumera diferentes recuerdos y el índiceenumera el contenido de cada memoria correspondiente a la-ª característica neurona), y la funciónes una función no lineal de rápido crecimiento. La regla de actualización para neuronas individuales (en el caso asíncrono) se puede escribir de la siguiente formaque establece que para calcular el estado actualizado del-la neurona -la red compara dos energías: la energía de la red con la-ésima neurona en estado ON y la energía de la red con la-ésima neurona en estado APAGADO, dados los estados de las neuronas restantes. El estado actualizado de laLa neurona -ésima selecciona el estado que tiene la energía más baja de las dos. [ 3 ]
En el caso límite cuando la función de energía no lineal es cuadráticaEstas ecuaciones se reducen a la función de energía familiar y a la regla de actualización para la red de Hopfield binaria clásica. [ 6 ]
La capacidad de almacenamiento de memoria de estas redes se puede calcular para patrones binarios aleatorios. Para la función de energía de potenciaEl número máximo de recuerdos que se pueden almacenar y recuperar de esta red sin errores viene dado por [ 3 ].Para una función de energía exponencialLa capacidad de almacenamiento de memoria es exponencial en el número de neuronas de características [ 4 ].
Variables continuas

Las redes de Hopfield modernas o memorias asociativas densas se pueden comprender mejor en variables continuas y tiempo continuo. [ 1 ] [ 5 ] Considere la arquitectura de la red, mostrada en la Fig. 1, y las ecuaciones para la evolución del estado de las neuronas [ 5 ]
donde las corrientes de las neuronas características se denotan pory las corrientes de las neuronas de memoria se denotan por(representa neuronas ocultas). No hay conexiones sinápticas entre las neuronas de características o las neuronas de memoria. Una matrizindica la fuerza de las sinapsis de una neurona característicaa la neurona de la memoriaSe supone que las sinapsis son simétricas, de modo que el mismo valor caracteriza una sinapsis física diferente de la neurona de memoria.a la neurona de características. Las salidas de las neuronas de memoria y las neuronas de características se denotan pory, que son funciones no lineales de las corrientes correspondientes. En general, estas salidas pueden depender de las corrientes de todas las neuronas en esa capa, de modo queyEs conveniente definir estas funciones de activación como derivadas de las funciones lagrangianas para los dos grupos de neuronas.
De esta forma, la forma específica de las ecuaciones para los estados de las neuronas queda completamente definida una vez que se especifican las funciones lagrangianas. Finalmente, las constantes de tiempo para los dos grupos de neuronas se denotan pory,es la corriente de entrada a la red que puede ser impulsada por los datos presentados.

Los sistemas generales de ecuaciones diferenciales no lineales pueden presentar comportamientos complejos que dependen de la elección de las no linealidades y las condiciones iniciales. Sin embargo, en el caso de las redes de Hopfield, esto no ocurre: las trayectorias dinámicas siempre convergen a un estado atractor de punto fijo. Esta propiedad se logra gracias a que estas ecuaciones están diseñadas específicamente para que tengan una función de energía subyacente [ 5 ].
Los términos agrupados entre corchetes representan una transformación de Legendre de la función lagrangiana con respecto a los estados de las neuronas. Si las matrices hessianas de las funciones lagrangianas son semidefinidas positivas, se garantiza que la función de energía disminuirá en la trayectoria dinámica [ 5 ].
Esta propiedad permite demostrar que el sistema de ecuaciones dinámicas que describe la evolución temporal de la actividad neuronal acabará alcanzando un estado atractor de punto fijo.
En ciertas situaciones se puede suponer que la dinámica de las neuronas ocultas se equilibra en una escala de tiempo mucho más rápida en comparación con las neuronas de características,En este caso, la solución de estado estacionario de la segunda ecuación del sistema ( 1 ) puede usarse para expresar las corrientes de las unidades ocultas a través de las salidas de las neuronas de características. Esto permite reducir la teoría general ( 1 ) a una teoría efectiva solo para neuronas de características. Las reglas de actualización efectivas resultantes y las energías para varias elecciones comunes de las funciones lagrangianas se muestran en la Fig. 2. En el caso de la función lagrangiana log-suma-exponencial, la regla de actualización (si se aplica una vez) para los estados de las neuronas de características es el mecanismo de atención [ 1 ] comúnmente utilizado en muchos sistemas de IA modernos (ver Ref. [ 5 ] para la derivación de este resultado a partir de la formulación de tiempo continuo).
Relación con la red clásica de Hopfield con variables continuas
La formulación clásica de las redes de Hopfield continuas [ 6 ] puede entenderse [ 5 ] como un caso límite especial de las redes de Hopfield modernas con una capa oculta. Las redes de Hopfield continuas para neuronas con respuesta graduada se describen típicamente [ 6 ] mediante las ecuaciones dinámicas.
y la función de energía
dónde, yes la inversa de la función de activaciónEste modelo es un límite especial de la clase de modelos que se denomina modelos A, [ 5 ] con la siguiente elección de las funciones lagrangianas.
que, según la definición ( 2 ), conduce a las funciones de activación
Si integramos las neuronas ocultas, el sistema de ecuaciones ( 1 ) se reduce a las ecuaciones sobre las neuronas de características ( 5 ) cony la expresión general para la energía ( 3 ) se reduce a la energía efectiva
Si bien los dos primeros términos de la ecuación ( 6 ) son iguales a los de la ecuación ( 9 ), el tercer término parece superficialmente diferente. En la ecuación ( 9 ) es una transformada de Legendre del lagrangiano para las neuronas de características, mientras que en ( 6 ) el tercer término es una integral de la función de activación inversa. Sin embargo, estas dos expresiones son de hecho equivalentes, ya que las derivadas de una función y su transformada de Legendre son funciones inversas entre sí. La forma más sencilla de ver que estos dos términos son iguales explícitamente es diferenciar cada uno con respecto a. Los resultados de estas diferenciaciones para ambas expresiones son iguales a. Por lo tanto, las dos expresiones son iguales salvo una constante aditiva. Esto completa la demostración [ 5 ] de que la red de Hopfield clásica con estados continuos [ 6 ] es un caso límite especial de la red de Hopfield moderna ( 1 ) con energía ( 3 ).
Formulación general

Las redes neuronales biológicas presentan un alto grado de heterogeneidad en cuanto a los diferentes tipos de células. Esta sección describe un modelo matemático de una red de Hopfield moderna totalmente conectada, asumiendo un grado extremo de heterogeneidad: cada neurona es diferente. [ 8 ] Específicamente, se describe una función de energía y las ecuaciones dinámicas correspondientes, asumiendo que cada neurona tiene su propia función de activación y escala de tiempo cinética. Se asume que la red está totalmente conectada, de modo que cada neurona está conectada a todas las demás mediante una matriz simétrica de pesos., índicesyEnumerar las diferentes neuronas de la red, véase la figura 3. La forma más sencilla de formular matemáticamente este problema es definir la arquitectura mediante una función lagrangiana.que depende de las actividades de todas las neuronas en la red. La función de activación para cada neurona se define como una derivada parcial del lagrangiano con respecto a la actividad de esa neurona.
Desde la perspectiva biológica se puede pensar encomo una salida axonal de la neuronaEn el caso más simple, cuando el lagrangiano es aditivo para diferentes neuronas, esta definición resulta en una activación que es una función no lineal de la actividad de esa neurona. Para lagrangianos no aditivos, esta función de activación puede depender de las actividades de un grupo de neuronas. Por ejemplo, puede contener normalización contrastiva (softmax) o divisiva. Las ecuaciones dinámicas que describen la evolución temporal de una neurona dada se presentan en [ 8 ].
Esta ecuación pertenece a la clase de modelos denominados modelos de tasa de disparo en neurociencia. Cada neuronarecoge las salidas axónicasde todas las neuronas, las pondera con los coeficientes sinápticosy produce su propia actividad dependiente del tiempoLa evolución temporal tiene una constante de tiempo., que en general puede ser diferente para cada neurona. Esta red tiene una función de energía global [ 8 ]
donde los dos primeros términos representan la transformada de Legendre de la función lagrangiana con respecto a las corrientes de las neuronas.. La derivada temporal de esta función de energía se puede calcular en las trayectorias dinámicas que conducen a (ver [ 8 ] para más detalles)
El último signo de desigualdad se cumple siempre que la matriz(o su parte simétrica) es semidefinida positiva. Si, además, la función de energía está acotada inferiormente, se garantiza que las ecuaciones dinámicas no lineales convergerán a un estado atractor de punto fijo. La ventaja de formular esta red en términos de las funciones lagrangianas es que permite experimentar fácilmente con diferentes elecciones de las funciones de activación y diferentes configuraciones arquitectónicas de las neuronas. Para todas esas elecciones flexibles, las condiciones de convergencia están determinadas por las propiedades de la matriz.y la existencia de un límite inferior para la función de energía.
Red de memoria asociativa jerárquica

Las neuronas se pueden organizar en capas de modo que cada neurona en una capa dada tenga la misma función de activación y la misma escala de tiempo dinámica. Si asumimos que no hay conexiones horizontales entre las neuronas dentro de la capa (conexiones laterales) y no hay conexiones de salto de capa, la red general totalmente conectada ( 11 ), ( 12 ) se reduce a la arquitectura que se muestra en la Fig. 4. Tienecapas de neuronas conectadas recurrentemente con estados descritos por variables continuasy las funciones de activación, índiceenumera las capas de la red y el índiceEnumera las neuronas individuales en esa capa. Las funciones de activación pueden depender de la actividad de todas las neuronas en la capa. Cada capa puede tener un número diferente de neuronas.Estas neuronas están conectadas recurrentemente con las neuronas de las capas precedentes y subsiguientes. Las matrices de pesos que conectan las neuronas en las capasyse denotan por(el orden de los índices superiores para los pesos es el mismo que el orden de los índices inferiores, en el ejemplo anterior esto significa que el índiceenumera las neuronas en la capay el índiceenumera las neuronas en la capa). Los pesos de alimentación directa y los pesos de retroalimentación son iguales. Las ecuaciones dinámicas para los estados de las neuronas se pueden escribir como [ 8 ]
con condiciones de contorno
La principal diferencia de estas ecuaciones con respecto a las redes de alimentación directa convencionales radica en la presencia del segundo término, responsable de la retroalimentación de las capas superiores. Estas señales descendentes ayudan a las neuronas de las capas inferiores a decidir su respuesta a los estímulos presentados. Siguiendo la receta general, resulta conveniente introducir una función lagrangiana.para el-ésima capa oculta, que depende de las actividades de todas las neuronas en esa capa. [ 8 ] Las funciones de activación en esa capa se pueden definir como derivadas parciales del lagrangiano
Con estas definiciones, la función de energía (Lyapunov) viene dada por [ 8 ].
Si las funciones lagrangianas, o equivalentemente las funciones de activación, se eligen de tal manera que los hessianos para cada capa sean semidefinidos positivos y la energía total esté acotada inferiormente, se garantiza que este sistema convergerá a un estado atractor de punto fijo. La derivada temporal de esta función de energía viene dada por [ 8 ].
Por lo tanto, la red jerárquica en capas es, en efecto, una red atractora con una función de energía global. Esta red se describe mediante un conjunto jerárquico de pesos sinápticos que se pueden aprender para cada problema específico.
Referencias
- 1 2 3 4 Ramsauer, Hubert; et al. (2021). "Hopfield Networks is All You Need". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2008.02217 .
- ↑ "Hopfield Networks is All You Need" . hopfield-layers . 2020-08-25. Archivado del original el 26 de marzo de 2023. Consultado el 4 de mayo de 2023 .
- 1 2 3 4 5 6 7 Krotov, Dmitry; Hopfield, John (2016). "Memoria asociativa densa para el reconocimiento de patrones". Sistemas de procesamiento de información neuronal . 29 : 1172–1180 . arXiv : 1606.01164 .
- 1 2 3 Demircigil, Mete; et al. (2017). "Sobre un modelo de memoria asociativa con enorme capacidad de almacenamiento" . Journal of Statistical Physics . 168 (2): 288– 299. arXiv : 1702.01929 . Bibcode : 2017JSP...168..288D . doi : 10.1007/s10955-017-1806-y . S2CID 119317128 .
- 1 2 3 4 5 6 7 8 9 10 Krotov, Dmitry; Hopfield, John (2021). "Gran problema de memoria asociativa en neurobiología y aprendizaje automático". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2008.06996 .
- 1 2 3 4 5 6 7 Hopfield, John (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias . 79 (8): 2554– 2558. Bibcode : 1982PNAS...79.2554H . doi : 10.1073/pnas.79.8.2554 . PMC 346238. PMID 6953413 .
- 1 2 Hopfield, John (1984). "Las neuronas con respuesta graduada tienen propiedades computacionales colectivas como las de las neuronas de dos estados" . Actas de la Academia Nacional de Ciencias . 81 (10): 3088– 3092. Bibcode : 1984PNAS...81.3088H . doi : 10.1073/pnas.81.10.3088 . PMC 345226. PMID 6587342 .
- ^ Krotov , Dmitry ( 2021 ) . "Memoria asociativa jerárquica". arXiv : 2107.06446 [ cs.NE ].
- Redes neuronales artificiales