Articulo de referencia

Máquina de Boltzmann

Representación gráfica de una máquina de Boltzmann de ejemplo. Cada arista no dirigida representa una dependencia. En este ejemplo, hay 3 unidades ocultas y 4 unidades visibles....

Representación gráfica de un ejemplo de máquina de Boltzmann.
Representación gráfica de una máquina de Boltzmann de ejemplo. Cada arista no dirigida representa una dependencia. En este ejemplo, hay 3 unidades ocultas y 4 unidades visibles. Esta no es una máquina de Boltzmann restringida.

Una máquina de Boltzmann (también llamada modelo de Sherrington-Kirkpatrick con campo externo o modelo de Ising estocástico ), nombrada en honor a Ludwig Boltzmann , es un modelo de vidrio de espín con un campo externo, es decir, un modelo de Sherrington-Kirkpatrick , [ 1 ] que es un modelo de Ising estocástico . Es una técnica de física estadística aplicada en el contexto de la ciencia cognitiva . [ 2 ] También se clasifica como un campo aleatorio de Markov . [ 3 ]

Las máquinas de Boltzmann resultan teóricamente interesantes debido a la localidad y la naturaleza hebbiana de su algoritmo de entrenamiento (se entrenan mediante la regla de Hebb), así como a su paralelismo y la semejanza de su dinámica con procesos físicos simples . Las máquinas de Boltzmann con conectividad no restringida no han demostrado ser útiles para problemas prácticos en aprendizaje automático o inferencia , pero si la conectividad se restringe adecuadamente, el aprendizaje puede ser lo suficientemente eficiente como para resultar útil en problemas prácticos. [ 4 ]

Reciben su nombre de la distribución de Boltzmann en mecánica estadística , que se utiliza en su función de muestreo . Fueron ampliamente popularizados y promovidos por Geoffrey Hinton , Terry Sejnowski y Yann LeCun en las comunidades de ciencias cognitivas, particularmente en aprendizaje automático , [ 2 ] como parte de los " modelos basados ​​en energía " (EBM), porque los hamiltonianos de vidrios de espín como energía se utilizan como punto de partida para definir la tarea de aprendizaje. [ 5 ]

Estructura

Representación gráfica de un ejemplo de máquina de Boltzmann con etiquetas de peso.
Representación gráfica de una máquina de Boltzmann con algunos pesos etiquetados. Cada arista no dirigida representa una dependencia y tiene un peso asignado.wij{\displaystyle w_{ij}}En este ejemplo hay 3 unidades ocultas (azules) y 4 unidades visibles (blancas). No se trata de una máquina de Boltzmann restringida.

Una máquina de Boltzmann, como un modelo de Sherrington-Kirkpatrick , es una red de unidades con una "energía" total ( hamiltoniano ) definida para toda la red. Sus unidades producen resultados binarios . Los pesos de la máquina de Boltzmann son estocásticos . La energía globalmi{\displaystyle E}en una máquina de Boltzmann es idéntica en forma a la de las redes de Hopfield y los modelos de Ising :

mi=(i<jwijsisj+iθisi){\displaystyle E=-\left(\sum _{i<j}w_{ij}\,s_{i}\,s_{j}+\sum _{i}\theta _{i}\,s_{i}\right)}

Dónde:

  • wij{\displaystyle w_{ij}}es la fuerza de conexión entre la unidadj{\displaystyle j}y unidadi{\displaystyle i}.
  • si{\displaystyle s_{i}}es el estado,si{0,1}{\displaystyle s_{i}\in \{0,1\}}, de unidadi{\displaystyle i}.
  • θi{\displaystyle \theta _{i}}es el sesgo de la unidadi{\displaystyle i}en la función energética global. (θi{\displaystyle -\theta _{i}}es el umbral de activación de la unidad.)

A menudo los pesoswij{\displaystyle w_{ij}}se representan como una matriz simétricaW=[wij]{\displaystyle W=[w_{ij}]}con ceros en la diagonal.

Probabilidad de estado unitario

La diferencia en la energía global que resulta de una sola unidadi{\displaystyle i}igual a 0 (apagado) frente a 1 (encendido), escritoΔmii{\displaystyle \Delta E_{i}}Suponiendo una matriz de pesos simétrica, viene dada por:

Δmii=j>iwijsj+j<iwjisj+θi{\displaystyle \Delta E_{i}=\sum _{j>i}w_{ij}\,s_{j}+\sum _{j<i}w_{ji}\,s_{j}+\theta _{i}}

Esto se puede expresar como la diferencia de energías de dos estados:

Δmii=mii=apagadomiyo=en{\displaystyle \Delta E_{i}=E_{\text{i=off}}-E_{\text{i=on}}}

Sustituyendo la energía de cada estado por su probabilidad relativa según el factor de Boltzmann (la propiedad de una distribución de Boltzmann según la cual la energía de un estado es proporcional al logaritmo negativo de la probabilidad de ese estado) se obtiene:

Δmii=kBTln(pagi=apagado)(kBTln(pagyo=en)),{\displaystyle \Delta E_{i}=-k_{B}T\ln(p_{\text{i=off}})-(-k_{B}T\ln(p_{\text{i=on}})),}

dóndekB{\displaystyle k_{B}}es la constante de Boltzmann y está absorbida en la noción artificial de temperaturaT{\displaystyle T}. Observando que las probabilidades de que la unidad esté encendida o apagada suman1{\displaystyle 1}permite la simplificación:

ΔmiikBT=ln(pagi=en)+ln(pagi=apagado)=ln(1pagi=enpagi=en)=ln(pagi=en11),{\displaystyle -{\frac {\Delta E_{i}}{k_{B}T}}=-\ln(p_{i={\text{on}}})+\ln(p_{i={\text{off}}})=\ln {\Big (}{\frac {1-p_{i={\text{on}}}}{p_{i={\text{on}}}}}{\Big )}=\ln(p_{i={\text{on}}}^{-1}-1),}

de donde la probabilidad de que eli{\displaystyle i}La -ésima unidad viene dada por

pagi=en=11+exp(ΔmiikBT),{\displaystyle p_{i={\text{on}}}={\frac {1}{1+\exp {\Big (}-{\frac {\Delta E_{i}}{k_{B}T}}{\Big )}}},}

donde el escalarT{\displaystyle T}Se la conoce como la temperatura del sistema. Esta relación es la base de la función logística que se encuentra en las expresiones de probabilidad de las variantes de la máquina de Boltzmann.

Estado de equilibrio

La red funciona seleccionando repetidamente una unidad y reiniciando su estado. Tras funcionar durante un tiempo suficiente a una temperatura determinada, la probabilidad de un estado global de la red depende únicamente de la energía de dicho estado global, según una distribución de Boltzmann , y no del estado inicial desde el que se inició el proceso. Esto significa que las probabilidades logarítmicas de los estados globales se vuelven lineales con respecto a sus energías. Esta relación se cumple cuando la máquina está en equilibrio térmico , lo que significa que la distribución de probabilidad de los estados globales ha convergido. Al ejecutar la red partiendo de una temperatura alta, su temperatura disminuye gradualmente hasta alcanzar un equilibrio térmico a una temperatura más baja. Entonces puede converger a una distribución donde el nivel de energía fluctúa alrededor del mínimo global. Este proceso se denomina recocido simulado .

Para entrenar la red de modo que converja a un estado global según una distribución externa sobre estos estados, los pesos deben ajustarse de manera que los estados globales con las probabilidades más altas reciban las energías más bajas. Esto se logra mediante el entrenamiento.

Capacitación

Las unidades en la máquina de Boltzmann se dividen en unidades 'visibles', V, y unidades 'ocultas', H. Las unidades visibles son aquellas que reciben información del 'entorno', es decir, el conjunto de entrenamiento es un conjunto de vectores binarios sobre el conjunto V. La distribución sobre el conjunto de entrenamiento se denotaPAG+(V){\displaystyle P^{+}(V)}.

La distribución sobre los estados globales converge cuando la máquina de Boltzmann alcanza el equilibrio térmico . Denotamos esta distribución, después de marginalizarla sobre las unidades ocultas, comoPAG(V){\displaystyle P^{-}(V)}.

Nuestro objetivo es aproximarnos a la distribución "real".PAG+(V){\displaystyle P^{+}(V)}usando elPAG(V){\displaystyle P^{-}(V)}producido por la máquina. La similitud de las dos distribuciones se mide mediante la divergencia de Kullback-Leibler .GRAMO{\displaystyle G}:

GRAMO=vPAG+(v)ln(PAG+(v)PAG(v)){\displaystyle G=\sum _{v}{P^{+}(v)\ln \left({\frac {P^{+}(v)}{P^{-}(v)}}\right)}}

donde la suma se realiza sobre todos los estados posibles deV{\displaystyle V}.GRAMO{\displaystyle G}es una función de los pesos, ya que determinan la energía de un estado, y la energía determinaPAG(v){\displaystyle P^{-}(v)}, como lo promete la distribución de Boltzmann. Un algoritmo de descenso de gradiente sobreGRAMO{\displaystyle G}cambia un peso determinado,wij{\displaystyle w_{ij}}, restando la derivada parcial deGRAMO{\displaystyle G}con respecto al peso.

El entrenamiento de la máquina de Boltzmann implica dos fases alternas. Una es la fase "positiva" donde los estados de las unidades visibles se fijan a un vector de estado binario particular muestreado del conjunto de entrenamiento (de acuerdo aPAG+{\displaystyle P^{+}}). La otra es la fase "negativa" donde se permite que la red funcione libremente, es decir, solo los nodos de entrada tienen su estado determinado por datos externos, pero los nodos de salida pueden flotar. El gradiente con respecto a un peso dado,wij{\displaystyle w_{ij}}, viene dada por la ecuación: [ 2 ]

GRAMOwij=1R[pagij+pagij]{\displaystyle {\frac {\partial {G}}{\partial {w_{ij}}}}=-{\frac {1}{R}}[p_{ij}^{+}-p_{ij}^{-}]}

dónde:

  • pagij+{\displaystyle p_{ij}^{+}}es la probabilidad de que las unidades i y j estén ambas encendidas cuando la máquina está en equilibrio en la fase positiva.
  • pagij{\displaystyle p_{ij}^{-}}es la probabilidad de que las unidades i y j estén ambas encendidas cuando la máquina está en equilibrio en la fase negativa.
  • R{\displaystyle R}denota la tasa de aprendizaje

Este resultado se deriva del hecho de que en equilibrio térmico la probabilidadPAG(s){\displaystyle P^{-}(s)}de cualquier estado globals{\displaystyle s}Cuando la red funciona de forma independiente, la distribución de Boltzmann da como resultado dicha distribución.

Esta regla de aprendizaje es biológicamente plausible porque la única información necesaria para modificar los pesos proviene de información "local". Es decir, la conexión ( sinapsis , biológicamente) no necesita información sobre nada más que las dos neuronas que conecta. Esto resulta más realista desde el punto de vista biológico que la información requerida por una conexión en muchos otros algoritmos de entrenamiento de redes neuronales, como la retropropagación .

El entrenamiento de una máquina de Boltzmann no utiliza el algoritmo EM , ampliamente empleado en el aprendizaje automático . Al minimizar la divergencia KL , se maximiza la verosimilitud logarítmica de los datos. Por lo tanto, el procedimiento de entrenamiento realiza un ascenso de gradiente sobre la verosimilitud logarítmica de los datos observados. Esto contrasta con el algoritmo EM, donde la distribución posterior de los nodos ocultos debe calcularse antes de maximizar el valor esperado de la verosimilitud de los datos completos durante el paso M.

El entrenamiento de los sesgos es similar, pero utiliza únicamente la actividad de un solo nodo:

GRAMOθi=1R[pagi+pagi]{\displaystyle {\frac {\partial {G}}{\partial {\theta _{i}}}}=-{\frac {1}{R}}[p_{i}^{+}-p_{i}^{-}]}

Problemas

En teoría, la máquina de Boltzmann es un medio computacional bastante general. Por ejemplo, si se entrena con fotografías, la máquina modelaría teóricamente la distribución de las mismas y podría usar ese modelo para, por ejemplo, completar una fotografía incompleta.

Desafortunadamente, las máquinas de Boltzmann presentan un grave problema práctico: parecen dejar de aprender correctamente cuando su tamaño supera un umbral trivial. Esto se debe a importantes efectos, específicamente:

  • El tiempo necesario para recopilar estadísticas de equilibrio crece exponencialmente con el tamaño de la máquina y con la magnitud de la fuerza de las conexiones.
  • La fuerza de las conexiones es más plástica cuando las unidades conectadas tienen probabilidades de activación intermedias entre cero y uno, lo que da lugar a una denominada trampa de varianza. El efecto neto es que el ruido provoca que la fuerza de las conexiones siga un recorrido aleatorio hasta que las actividades se saturan.

Tipos

Máquina de Boltzmann restringida

Representación gráfica de un ejemplo de máquina de Boltzmann restringida
Representación gráfica de una máquina de Boltzmann restringida. Las cuatro unidades azules representan unidades ocultas y las tres unidades rojas, estados visibles. En las máquinas de Boltzmann restringidas, solo existen conexiones (dependencias) entre unidades ocultas y visibles, y ninguna entre unidades del mismo tipo (no hay conexiones entre unidades ocultas ni entre unidades visibles).

Aunque el aprendizaje automático es poco práctico en las máquinas de Boltzmann generales, puede ser bastante eficiente en una máquina de Boltzmann restringida (RBM), que no permite conexiones entre unidades ocultas y visibles dentro de la misma capa; es decir, no hay conexión entre unidades visibles ni entre unidades ocultas. Tras entrenar una RBM, la actividad de sus unidades ocultas puede utilizarse como datos para entrenar una RBM de nivel superior. Este método de apilamiento de RBM permite entrenar de forma eficiente muchas capas de unidades ocultas y es una de las estrategias de aprendizaje profundo más comunes . Con cada nueva capa que se añade, el modelo generativo mejora.

Una extensión de la máquina de Boltzmann restringida permite utilizar datos de valor real en lugar de datos binarios. [ 6 ]

Un ejemplo de aplicación práctica de RBM se encuentra en el reconocimiento de voz. [ 7 ]

Máquina de Boltzmann profunda

Una máquina de Boltzmann profunda (DBM) es un tipo de campo aleatorio de Markov binario por pares ( modelo gráfico probabilístico no dirigido ) con múltiples capas de variables aleatorias ocultas . Es una red de unidades binarias estocásticas acopladas simétricamente . Comprende un conjunto de unidades visibles.ν{0,1}D{\displaystyle {\boldsymbol {\nu }}\en \{0,1\}^{D}}y capas de unidades ocultash(1){0,1}F1,h(2){0,1}F2,,h(L){0,1}FL{\displaystyle {\boldsymbol {h}}^{(1)}\in \{0,1\}^{F_{1}},{\boldsymbol {h}}^{(2)}\in \{0,1\}^{F_{2}},\ldots ,{\boldsymbol {h}}^{(L)}\in \{0,1\}^{F_{L}}}. No hay enlaces de conexión entre unidades de la misma capa (como RBM ). Para DBM , la probabilidad asignada al vector ν es

pag(ν)=1ZhmiijWij(1)νihj(1)+jlWjl(2)hj(1)hl(2)+lmetroWlmetro(3)hl(2)hmetro(3),{\displaystyle p({\boldsymbol {\nu }})={\frac {1}{Z}}\sum _{h}e^{\sum _{ij}W_{ij}^{(1)}\nu _{i}h_{j}^{(1)}+\sum _{jl}W_{jl}^{(2)}h_{j}^{(1)}h_{l}^{(2)}+\sum _{lm}W_{lm}^{(3)}h_{l}^{(2)}h_{m}^{(3)}},}

dóndeh={h(1),h(2),h(3)}{\displaystyle {\boldsymbol {h}}=\{{\boldsymbol {h}}^{(1)},{\boldsymbol {h}}^{(2)},{\boldsymbol {h}}^{(3)}\}}son el conjunto de unidades ocultas, yθ={W(1),W(2),W(3)}{\displaystyle \theta =\{{\boldsymbol {W}}^{(1)},{\boldsymbol {W}}^{(2)},{\boldsymbol {W}}^{(3)}\}}son los parámetros del modelo, que representan interacciones visible-oculto y oculto-oculto. [ 8 ] En una DBN , solo las dos capas superiores forman una máquina de Boltzmann restringida (que es un modelo gráfico no dirigido ), mientras que las capas inferiores forman un modelo generativo dirigido. En una DBM, todas las capas son simétricas y no dirigidas.

Al igual que las DBN , las DBM pueden aprender representaciones internas complejas y abstractas de la entrada en tareas como el reconocimiento de objetos o de voz , utilizando datos etiquetados limitados para ajustar las representaciones construidas a partir de un gran conjunto de datos de entrada sensoriales sin etiquetar. Sin embargo, a diferencia de las DBN y las redes neuronales convolucionales profundas , llevan a cabo el procedimiento de inferencia y entrenamiento en ambas direcciones, de abajo hacia arriba y de arriba hacia abajo, lo que permite a la DBM revelar mejor las representaciones de las estructuras de entrada. [ 9 ] [ 10 ] [ 11 ]

Sin embargo, la baja velocidad de los DBM limita su rendimiento y funcionalidad. Dado que el aprendizaje exacto de máxima verosimilitud es intratable para los DBM, solo es posible el aprendizaje aproximado de máxima verosimilitud. Otra opción es utilizar la inferencia de campo medio para estimar las expectativas dependientes de los datos y aproximar las estadísticas suficientes esperadas mediante el método de Monte Carlo de cadena de Markov (MCMC). [ 8 ] Esta inferencia aproximada, que debe realizarse para cada entrada de prueba, es entre 25 y 50 veces más lenta que una sola pasada ascendente en los DBM. Esto hace que la optimización conjunta sea impracticable para grandes conjuntos de datos y restringe el uso de los DBM para tareas como la representación de características.

RBM de tipo espiga y losa

La necesidad de aprendizaje profundo con entradas de valor real , como en las RBM gaussianas , condujo a la RBM de pico y placa ( ss RBM ), que modela entradas de valor continuo con variables latentes binarias . [ 12 ] Similar a las RBM básicas y sus variantes, una RBM de pico y placa es un grafo bipartito , mientras que, como las RBM G , las unidades visibles (entrada) son de valor real. La diferencia radica en la capa oculta, donde cada unidad oculta tiene una variable de pico binaria y una variable de placa de valor real. Un pico es una masa de probabilidad discreta en cero, mientras que una placa es una densidad sobre un dominio continuo; [ 13 ] su mezcla forma una distribución a priori . [ 14 ]

Una extensión del modelo ss RBM , denominada μ-ss RBM, proporciona capacidad de modelado adicional mediante términos adicionales en la función de energía . Uno de estos términos permite que el modelo forme una distribución condicional de las variables de pico marginalizando las variables de capa dada una observación.

En matemáticas

En un contexto matemático más general, la distribución de Boltzmann también se conoce como medida de Gibbs . En estadística y aprendizaje automático, se denomina modelo log-lineal . En aprendizaje profundo, la distribución de Boltzmann se utiliza en la distribución de muestreo de redes neuronales estocásticas , como la máquina de Boltzmann.

Historia

La máquina de Boltzmann se basa en el modelo de vidrio de espín de Sherrington-Kirkpatrick de David Sherrington y Scott Kirkpatrick . [ 15 ] La publicación fundamental de John Hopfield (1982) aplicó métodos de mecánica estadística, principalmente la teoría de vidrios de espín desarrollada recientemente (en la década de 1970), para estudiar la memoria asociativa (más tarde denominada "red de Hopfield"). [ 16 ]

La contribución original en la aplicación de tales modelos basados ​​en energía en la ciencia cognitiva apareció en artículos de Geoffrey Hinton y Terry Sejnowski . [ 17 ] [ 18 ] [ 19 ] En una entrevista de 1995, Hinton afirmó que en febrero o marzo de 1983 iba a dar una charla sobre recocido simulado en redes de Hopfield, por lo que tuvo que diseñar un algoritmo de aprendizaje para la charla, lo que dio como resultado el algoritmo de aprendizaje automático de Boltzmann. [ 20 ]

La idea de aplicar el modelo de Ising con muestreo de Gibbs recocido se utilizó en el proyecto Copycat de Douglas Hofstadter (1984). [ 21 ] [ 22 ]

La analogía explícita con la mecánica estadística en la formulación de la máquina de Boltzmann propició el uso de terminología tomada de la física (por ejemplo, "energía"), que se convirtió en estándar en el campo. La adopción generalizada de esta terminología pudo haberse visto favorecida por el hecho de que su uso conllevó la adopción de diversos conceptos y métodos de la mecánica estadística. Las distintas propuestas para utilizar el recocido simulado en la inferencia fueron aparentemente independientes.

Ideas similares (con un cambio de signo en la función de energía) se encuentran en la "Teoría de la Armonía" de Paul Smolensky . [ 23 ] Los modelos de Ising se pueden generalizar a campos aleatorios de Markov , que encuentran amplia aplicación en lingüística , robótica , visión por computadora e inteligencia artificial .

En 2024, Hopfield y Hinton fueron galardonados con el Premio Nobel de Física por sus contribuciones fundamentales al aprendizaje automático , como la máquina de Boltzmann. [ 24 ]

Véase también

Referencias

  1. Sherrington, David; Kirkpatrick, Scott (1975), "Solvable Model of a Spin-Glass", Physical Review Letters , 35 (35): 1792– 1796, Bibcode : 1975PhRvL..35.1792S , doi : 10.1103/PhysRevLett.35.1792
  2. 1 2 3 Ackley, David H.; Hinton, Geoffrey E.; Sejnowski, Terrence J. (1985). "Un algoritmo de aprendizaje para máquinas de Boltzmann" (PDF) . Cognitive Science . 9 (1): 147– 169. doi : 10.1207/s15516709cog0901_7 . Archivado del original (PDF) el 18 de julio de 2011.
  3. Hinton, Geoffrey E. (24 de mayo de 2007). "Máquina de Boltzmann" . Scholarpedia . 2 (5): 1668. Bibcode : 2007SchpJ...2.1668H . doi : 10.4249/scholarpedia.1668 . ISSN 1941-6016 . 
  4. Osborn, Thomas R. (1 de enero de 1990). «Enseñanza rápida de máquinas de Boltzmann con inhibición local» . Conferencia Internacional de Redes Neuronales . Springer Netherlands. pp. 785. doi : 10.1007 /978-94-009-0643-3_76 . ISBN  978-0-7923-0831-7.
  5. Nijkamp, ​​E.; Hill, M. E; Han, T. (2020), "Sobre la anatomía del aprendizaje de máxima verosimilitud basado en MCMC de modelos basados ​​en energía" , Actas de la Conferencia AAAI sobre Inteligencia Artificial , 4 (34): 5272– 5280, arXiv : 1903.12370 , doi : 10.1609/aaai.v34i04.5973
  6. Novedades recientes en aprendizaje profundo , 22 de marzo de 2010, archivado del original el 22 de diciembre de 2021 , consultado el 17 de febrero de 2020.
  7. Yu, Dong; Dahl, George; Acero, Alex; Deng, Li (2011). "Redes neuronales profundas preentrenadas dependientes del contexto para el reconocimiento de voz con vocabulario extenso" (PDF) . Microsoft Research . 20 .
  8. 1 2 Hinton, Geoffrey; Salakhutdinov, Ruslan (2012). "Una mejor manera de preentrenar máquinas profundas de Boltzmann" (PDF) . Advances in Neural . 3 : 1–9 . Archivado del original (PDF) el 13 de agosto de 2017. Recuperado el 18 de agosto de 2017 .
  9. Hinton, Geoffrey; Salakhutdinov, Ruslan (2009). "Aprendizaje eficiente de máquinas de Boltzmann profundas" (PDF) . Actas de la Duodécima Conferencia Internacional sobre Inteligencia Artificial y Estadística . Vol. 3. págs. 448–455 . Archivado del original (PDF) el 6 de noviembre de 2015. Consultado el 18 de agosto de 2017 .  
  10. ^ Bengio, Yoshua; LeCun, Yann (2007). "Ampliación de los algoritmos de aprendizaje hacia la IA" (PDF) . Universidad de Montreal (preimpresión).
  11. Larochelle, Hugo; Salakhutdinov, Ruslan (2010). "Aprendizaje eficiente de máquinas de Boltzmann profundas" (PDF) . Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística . págs. 693–700 . Archivado del original (PDF) el 14 de agosto de 2017. Consultado el 18 de agosto de 2017 . 
  12. Courville, Aaron; Bergstra, James; Bengio, Yoshua (2011). "Una máquina de Boltzmann restringida de punta y placa" (PDF) . JMLR: Actas de talleres y conferencias . 15 : 233–241 . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .
  13. Courville, Aaron; Bergstra, James; Bengio, Yoshua (2011). "Modelos no supervisados ​​de imágenes mediante RBM de picos y placas" (PDF) . Actas de la 28.ª Conferencia Internacional sobre Aprendizaje Automático . Vol. 10. págs. 1–8 . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .  
  14. Mitchell, T; Beauchamp, J (1988). "Selección bayesiana de variables en regresión lineal" . Journal of the American Statistical Association . 83 (404): 1023– 1032. doi : 10.1080/01621459.1988.10478694 .
  15. Sherrington, David; Kirkpatrick, Scott (1975-12-29). "Modelo soluble de un vidrio de espín". Physical Review Letters . 35 (26): 1792– 1796. Bibcode : 1975PhRvL..35.1792S . doi : 10.1103/physrevlett.35.1792 . ISSN 0031-9007 . 
  16. Hopfield, JJ (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 79 ( 8). [sn]: 2554– 8. Bibcode : 1982PNAS ...79.2554H . doi : 10.1073/pnas.79.8.2554 . OCLC 848771572. PMC 346238. PMID 6953413 .   
  17. Hinton, Geoffery; Sejnowski, Terrence J. (mayo de 1983). Analyzing Cooperative Computation . 5.º Congreso Anual de la Sociedad de Ciencias Cognitivas. Rochester, Nueva York . Recuperado el 17 de febrero de 2020 .
  18. Hinton, Geoffrey E.; Sejnowski, Terrence J. (junio de 1983). Inferencia perceptual óptima . Conferencia IEEE sobre visión por computadora y reconocimiento de patrones (CVPR). Washington, DC: IEEE Computer Society. págs. 448–453 . 
  19. Fahlman SE, Hinton GE, Sejnowski TJ. Arquitecturas masivamente paralelas para IA: NETL, Thistle y máquinas de Boltzmann. En: Genesereth MR, editor. AAAI-83. Washington, DC: AAAI; 1983. pp. 109–113
  20. Capítulo 16. Rosenfeld, Edward y James A. Anderson, eds. 2000. Talking Nets: An Oral History of Neural Networks . Edición reimpresa. The MIT Press.
  21. Hofstadter, DR (enero de 1984). El proyecto Copycat: un experimento de no determinismo y analogías creativas . Centro de Información Técnica de Defensa. OCLC 227617764 . 
  22. Hofstadter, Douglas R. (1988). «Un enfoque no determinista de la analogía, que involucra el modelo de Ising del ferromagnetismo». En Caianiello, Eduardo R. (ed.). Física de los procesos cognitivos . Teaneck, Nueva Jersey: World Scientific. ISBN 9971-5-0255-0OCLC 750950619 
  23. Smolensky, Paul. "Procesamiento de información en sistemas dinámicos: Fundamentos de la teoría de la armonía." (1986): 194-281.
  24. Johnston, Hamish (8 de octubre de 2024). "John Hopfield y Geoffrey Hinton comparten el Premio Nobel de Física 2024" . Physics World . Consultado el 18 de octubre de 2024 .

Lecturas adicionales

  • Hinton, GE ; Sejnowski, TJ (1986). DE Rumelhart; JL McClelland (eds.). "Aprendizaje y reaprendizaje en máquinas de Boltzmann" (PDF) . Procesamiento distribuido en paralelo: exploraciones en la microestructura de la cognición. Volumen 1: Fundamentos : 282–317 . Archivado del original (PDF) el 5 de julio de 2010.
  • Hinton, GE (2002). "Training Products of Experts by Minimizing Contrastive Divergence" ( PDF) . Neural Computation . 14 (8): 1771– 1800. CiteSeerX 10.1.1.35.8613 . doi : 10.1162/089976602760128018 . PMID 12180402. S2CID 207596505 .   
  • Hinton, GE ; Osindero, S.; Teh, Y. (2006). "Un algoritmo de aprendizaje rápido para redes de creencias profundas" ( PDF) . Neural Computation . 18 (7): 1527– 1554. CiteSeerX 10.1.1.76.1541 . doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513. S2CID 2309950 .   
  • Kothari P (2020): https://www.forbes.com/sites/tomtaulli/2020/02/02/coronavirus-can-ai-artificial-intelligence-make-a-difference/?sh=1eca51e55817
  • Montufar, Guido (2018). "Máquinas de Boltzmann restringidas: Introducción y revisión" (PDF) . MPI MiS (Preimpresión) . Recuperado el 1 de agosto de 2023 .
  • Artículo de Scholarpedia de Hinton sobre las máquinas de Boltzmann
  • Charla en Google por Geoffrey Hinton