Articulo de referencia

Memoria temporal jerárquica

La memoria temporal jerárquica ( HTM ) es una tecnología de inteligencia artificial con restricciones biológicas desarrollada por Numenta . Descrita originalmente en el libro de...

La memoria temporal jerárquica ( HTM ) es una tecnología de inteligencia artificial con restricciones biológicas desarrollada por Numenta . Descrita originalmente en el libro de 2004 « On Intelligence» de Jeff Hawkins y Sandra Blakeslee , la HTM se utiliza actualmente principalmente para la detección de anomalías en datos en tiempo real. Esta tecnología se basa en la neurociencia y en la fisiología e interacción de las neuronas piramidales en la neocorteza del cerebro de los mamíferos (en particular, el humano ).

En el núcleo de HTM se encuentran algoritmos de aprendizaje que pueden almacenar, aprender, inferir y recuperar secuencias de orden superior. A diferencia de la mayoría de los demás métodos de aprendizaje automático , HTM aprende constantemente (en un proceso no supervisado ) patrones basados ​​en el tiempo en datos sin etiquetar. HTM es robusto al ruido y tiene una alta capacidad (puede aprender múltiples patrones simultáneamente). Cuando se aplica a computadoras, HTM es muy adecuado para la predicción, [ 1 ] la detección de anomalías, [ 2 ] la clasificación y, en última instancia, aplicaciones sensoriomotoras. [ 3 ]

HTM ha sido probado e implementado en software a través de aplicaciones de ejemplo de Numenta y algunas aplicaciones comerciales de los socios de Numenta .

Estructura y algoritmos

Una red HTM típica es una jerarquía de niveles con forma de árbol (que no debe confundirse con las " capas " del neocórtex , como se describe más adelante ). Estos niveles están compuestos por elementos más pequeños llamados regiones (o nodos). Un solo nivel de la jerarquía puede contener varias regiones. Los niveles superiores de la jerarquía suelen tener menos regiones. Los niveles superiores de la jerarquía pueden reutilizar patrones aprendidos en los niveles inferiores combinándolos para memorizar patrones más complejos.

Cada región HTM tiene la misma función básica. En los modos de aprendizaje e inferencia, los datos sensoriales (por ejemplo, los datos de los ojos) llegan a las regiones de nivel inferior. En el modo de generación, las regiones de nivel inferior generan el patrón de una categoría determinada. El nivel superior suele tener una única región que almacena las categorías (conceptos) más generales y permanentes; estas determinan, o son determinadas por, conceptos más pequeños en niveles inferiores, conceptos que están más restringidos en el tiempo y el espacio . Cuando se configura en modo de inferencia, una región (en cada nivel) interpreta la información que proviene de sus regiones "hijas" como probabilidades de las categorías que tiene en memoria.

Cada región HTM aprende identificando y memorizando patrones espaciales: combinaciones de bits de entrada que suelen ocurrir simultáneamente. A continuación, identifica secuencias temporales de patrones espaciales que probablemente se repitan.

Como modelo en evolución

HTM es el componente algorítmico de la Teoría de los Mil Cerebros de Jeff Hawkins . Por lo tanto, los nuevos hallazgos sobre la neocorteza se incorporan progresivamente al modelo HTM, que evoluciona con el tiempo en respuesta a ellos. Estos nuevos hallazgos no invalidan necesariamente las partes anteriores del modelo, de modo que las ideas de una generación no se excluyen necesariamente en la siguiente. Debido a la naturaleza evolutiva de la teoría, han existido varias generaciones de algoritmos HTM [ 4 ] , que se describen brevemente a continuación.

Primera generación: zeta 1

La primera generación de algoritmos HTM a veces se denomina zeta 1 .

Capacitación

Durante el entrenamiento , un nodo (o región) recibe como entrada una secuencia temporal de patrones espaciales. El proceso de aprendizaje consta de dos etapas:

  1. El agrupamiento espacial identifica (en la entrada) patrones observados con frecuencia y los memoriza como "coincidencias". Los patrones que son significativamente similares entre sí se tratan como la misma coincidencia. Un gran número de posibles patrones de entrada se reduce a un número manejable de coincidencias conocidas.
  2. La agrupación temporal divide las coincidencias que probablemente se sucedan en la secuencia de entrenamiento en grupos temporales. Cada grupo de patrones representa una "causa" del patrón de entrada (o "nombre" en Sobre la inteligencia ).

Los conceptos de agrupación espacial y agrupación temporal siguen siendo muy importantes en los algoritmos HTM actuales. La agrupación temporal aún no se comprende del todo y su significado ha cambiado con el tiempo (a medida que los algoritmos HTM evolucionaban).

Inferencia

Durante la inferencia , el nodo calcula el conjunto de probabilidades de que un patrón pertenezca a cada coincidencia conocida. Luego, calcula las probabilidades de que la entrada represente cada grupo temporal. El conjunto de probabilidades asignado a los grupos se denomina la "creencia" del nodo sobre el patrón de entrada. (En una implementación simplificada, la creencia del nodo consiste en un único grupo ganador). Esta creencia es el resultado de la inferencia que se transmite a uno o más nodos "padre" en el siguiente nivel superior de la jerarquía.

Los patrones inesperados que recibe el nodo no tienen una probabilidad dominante de pertenecer a un grupo temporal específico, sino que presentan probabilidades casi iguales de pertenecer a varios grupos. Si las secuencias de patrones son similares a las secuencias de entrenamiento, las probabilidades asignadas a los grupos no cambiarán con tanta frecuencia como se reciban los patrones. La salida del nodo no variará tanto y se perderá la resolución temporal.

En un esquema más general, la creencia del nodo puede enviarse a la entrada de cualquier nodo en cualquier nivel, pero las conexiones entre los nodos permanecen fijas. El nodo de nivel superior combina esta salida con la salida de otros nodos hijos, formando así su propio patrón de entrada.

Dado que la resolución espacial y temporal se pierde en cada nodo, como se describió anteriormente, las creencias formadas por nodos de nivel superior representan un rango espacial y temporal aún mayor. Esto pretende reflejar la organización del mundo físico tal como lo percibe el cerebro humano. Los conceptos más amplios (por ejemplo, causas, acciones y objetos) se perciben como si cambiaran más lentamente y se componen de conceptos más pequeños que cambian más rápidamente. Jeff Hawkins postula que los cerebros desarrollaron este tipo de jerarquía para adaptarse, predecir e influir en la organización del mundo externo.

Se pueden encontrar más detalles sobre el funcionamiento de Zeta 1 HTM en la documentación antigua de Numenta. [ 5 ]

Segunda generación: algoritmos de aprendizaje cortical

La segunda generación de algoritmos de aprendizaje HTM, a menudo denominados algoritmos de aprendizaje cortical ( CLA ), fue drásticamente diferente de zeta 1. Se basa en una estructura de datos llamada representaciones distribuidas dispersas (es decir, una estructura de datos cuyos elementos son binarios, 1 o 0, y cuyo número de bits 1 es pequeño en comparación con el número de bits 0) para representar la actividad cerebral y un modelo neuronal biológicamente más realista (a menudo también denominado célula , en el contexto de HTM). [ 6 ] Hay dos componentes centrales en esta generación de HTM: un algoritmo de agrupación espacial , [ 7 ] que produce representaciones distribuidas dispersas (SDR), y un algoritmo de memoria de secuencia , [ 8 ] que aprende a representar y predecir secuencias complejas.

En esta nueva generación, se abordan y modelan parcialmente las capas y minicolumnas de la corteza cerebral . Cada capa HTM (que no debe confundirse con un nivel HTM de una jerarquía HTM, como se describió anteriormente ) consta de varias minicolumnas altamente interconectadas. Una capa HTM crea una representación distribuida dispersa a partir de su entrada, de modo que un porcentaje fijo de minicolumnas está activo en un momento dado . Una minicolumna se entiende como un grupo de células que tienen el mismo campo receptivo . Cada minicolumna tiene varias células que pueden recordar varios estados anteriores. Una célula puede estar en uno de tres estados: activo , inactivo y predictivo .

Agrupación espacial

El campo receptivo de cada minicolumna es un número fijo de entradas seleccionadas aleatoriamente de un número mucho mayor de entradas de nodos. Según el patrón de entrada (específico), algunas minicolumnas estarán más o menos asociadas con los valores de entrada activos. El agrupamiento espacial selecciona un número relativamente constante de las minicolumnas más activas e inactiva (inhibe) otras minicolumnas cercanas a las activas. Los patrones de entrada similares tienden a activar un conjunto estable de minicolumnas. La cantidad de memoria utilizada por cada capa puede aumentarse para aprender patrones espaciales más complejos o disminuirse para aprender patrones más simples.

Células activas, inactivas y predictivas

Como se mencionó anteriormente, una célula (o neurona) de una minicolumna, en cualquier momento, puede estar en un estado activo, inactivo o predictivo. Inicialmente, las células están inactivas.

¿Cómo se activan las células?

Si una o más celdas de la minicolumna activa se encuentran en el estado predictivo (véase más abajo), serán las únicas que se activarán en el paso de tiempo actual. Si ninguna de las celdas de la minicolumna activa se encuentra en el estado predictivo (lo que ocurre durante el paso de tiempo inicial o cuando no se esperaba la activación de esta minicolumna), todas las celdas se activan.

¿Cómo se vuelven predictivas las células?

Cuando una célula se activa, gradualmente establece conexiones con células cercanas que tienden a estar activas durante varios pasos de tiempo anteriores. De esta manera, la célula aprende a reconocer una secuencia conocida comprobando si las células conectadas están activas. Si un gran número de células conectadas están activas, esta célula cambia al estado predictivo anticipándose a una de las pocas entradas siguientes de la secuencia.

La salida de una minicolumna

La salida de una capa incluye minicolumnas en estados tanto activos como predictivos. Por lo tanto, las minicolumnas permanecen activas durante largos períodos de tiempo, lo que genera una mayor estabilidad temporal en la capa principal.

Inferencia y aprendizaje en línea

Los algoritmos de aprendizaje cortical pueden aprender continuamente de cada nuevo patrón de entrada, por lo que no se requiere un modo de inferencia independiente. Durante la inferencia, HTM intenta relacionar el flujo de entradas con fragmentos de secuencias aprendidas previamente. Esto permite que cada capa de HTM prediga constantemente la probable continuación de las secuencias reconocidas. El índice de la secuencia predicha es la salida de la capa. Dado que las predicciones tienden a cambiar con menos frecuencia que los patrones de entrada, esto conlleva una mayor estabilidad temporal de la salida en los niveles superiores de la jerarquía. La predicción también ayuda a completar los patrones faltantes en la secuencia y a interpretar datos ambiguos, sesgando al sistema para que infiera lo que predijo.

Aplicaciones de los CLA

Actualmente, Numenta ofrece algoritmos de aprendizaje cortical como SaaS comercial (como Grok [ 9 ] ).

La validez de los CLA

En septiembre de 2011, se le planteó a Jeff Hawkins la siguiente pregunta sobre algoritmos de aprendizaje cortical: "¿Cómo saber si los cambios que se realizan en el modelo son buenos o no?". A lo que Jeff respondió: "Hay dos categorías para la respuesta: una es observar la neurociencia y la otra son los métodos de inteligencia artificial. En el ámbito de la neurociencia, podemos hacer muchas predicciones, y estas pueden ser comprobadas. Si nuestras teorías explican una amplia gama de observaciones neurocientíficas, entonces sabemos que vamos por buen camino. En el mundo del aprendizaje automático, eso no importa, solo qué tan bien funciona en problemas prácticos. En nuestro caso, eso está por verse. En la medida en que se pueda resolver un problema que nadie haya podido resolver antes, la gente se dará cuenta". [ 10 ]

Tercera generación: inferencia sensoriomotora

La tercera generación se basa en la segunda y añade una teoría de inferencia sensoriomotora en la neocorteza. [ 11 ] [ 12 ] Esta teoría propone que las columnas corticales en cada nivel de la jerarquía pueden aprender modelos completos de objetos con el tiempo y que las características se aprenden en ubicaciones específicas de los objetos. La teoría se amplió en 2018 y se denominó Teoría de los Mil Cerebros. [ 13 ]

Comparación de modelos neuronales

Comparación de la red neuronal artificial (A), la neurona biológica (B) y la neurona HTM (C).

Comparación de HTM y neocorteza

HTM intenta implementar la funcionalidad característica de un grupo de regiones corticales relacionadas jerárquicamente en la neocorteza. Una región de la neocorteza corresponde a uno o más niveles en la jerarquía HTM, mientras que el hipocampo es remotamente similar al nivel más alto de HTM. Un único nodo HTM puede representar un grupo de columnas corticales dentro de una región determinada.

Aunque se trata principalmente de un modelo funcional, se han realizado varios intentos para relacionar los algoritmos del HTM con la estructura de las conexiones neuronales en las capas de la neocorteza. [ 14 ] [ 15 ] La neocorteza está organizada en columnas verticales de 6 capas horizontales. Las 6 capas de células en la neocorteza no deben confundirse con los niveles de una jerarquía HTM.

Los nodos HTM intentan modelar una porción de las columnas corticales (de 80 a 100 neuronas) con aproximadamente 20 "células" HTM por columna. Los HTM modelan únicamente las capas 2 y 3 para detectar características espaciales y temporales de la entrada, con 1 célula por columna en la capa 2 para la "agrupación" espacial y de 1 a 2 docenas por columna en la capa 3 para la agrupación temporal. Una clave para los HTM y la corteza es su capacidad para manejar el ruido y la variación en la entrada, lo cual es resultado del uso de una "representación distributiva dispersa" donde solo alrededor del 2% de las columnas están activas en un momento dado.

Un HTM intenta modelar una parte del aprendizaje y la plasticidad de la corteza como se describió anteriormente. Las diferencias entre los HTM y las neuronas incluyen: [ 16 ]

  • señales y sinapsis estrictamente binarias
  • No hay inhibición directa de las sinapsis o dendritas (pero se simula indirectamente).
  • Actualmente solo modela las capas 2/3 y 4 (no la 5 ni la 6).
  • Sin control de "motor" (capa 5)
  • No hay retroalimentación entre regiones (capa 6 de alta a capa 1 de baja).

Representaciones distribuidas dispersas

La integración del componente de memoria con redes neuronales tiene una larga historia que se remonta a las primeras investigaciones en representaciones distribuidas [ 17 ] [ 18 ] y mapas autoorganizados . Por ejemplo, en la memoria distribuida dispersa (SDM), los patrones codificados por redes neuronales se utilizan como direcciones de memoria para la memoria direccionable por contenido , donde las "neuronas" esencialmente funcionan como codificadores y decodificadores de direcciones. [ 19 ] [ 20 ]

Las computadoras almacenan información en representaciones densas , como una palabra de 32 bits , donde todas las combinaciones de 1 y 0 son posibles. Por el contrario, los cerebros utilizan representaciones distribuidas dispersas (RDS). [ 21 ] La neocorteza humana tiene aproximadamente 16 mil millones de neuronas, pero en un momento dado solo un pequeño porcentaje está activo. Las actividades de las neuronas son como bits en una computadora, por lo que la representación es dispersa. De forma similar a SDM , desarrollado por la NASA en los años 80 [ 19 ] , y a los modelos de espacio vectorial utilizados en el análisis semántico latente , HTM utiliza representaciones distribuidas dispersas. [ 22 ]

Las SDR utilizadas en HTM son representaciones binarias de datos que constan de muchos bits, con un pequeño porcentaje de ellos activos (unos); una implementación típica podría tener 2048 columnas y 64 000 neuronas artificiales, de las cuales tan solo 40 podrían estar activas a la vez. Aunque pueda parecer menos eficiente que la mayoría de los bits permanezcan "sin usar" en una representación dada, las SDR tienen dos ventajas principales sobre las representaciones densas tradicionales. En primer lugar, las SDR toleran la corrupción y la ambigüedad debido a que el significado de la representación se comparte ( distribuye ) entre un pequeño porcentaje ( disperso ) de bits activos. En una representación densa, invertir un solo bit cambia completamente el significado, mientras que en una SDR un solo bit puede no afectar mucho al significado general. Esto nos lleva a la segunda ventaja de las SDR: dado que el significado de una representación se distribuye entre todos los bits activos, la similitud entre dos representaciones puede utilizarse como medida de similitud semántica en los objetos que representan. Es decir, si dos vectores en un SDR tienen unos en la misma posición, entonces son semánticamente similares en ese atributo. Los bits en los SDR tienen significado semántico, y ese significado se distribuye entre los bits. [ 22 ]

La teoría del plegado semántico [ 23 ] se basa en estas propiedades SDR para proponer un nuevo modelo para la semántica del lenguaje, donde las palabras se codifican en word-SDR y la similitud entre términos, oraciones y textos se puede calcular con medidas de distancia simples.

Similitud con otros modelos

redes bayesianas

Similar a una red bayesiana , un HTM comprende una colección de nodos organizados en una jerarquía en forma de árbol. Cada nodo de la jerarquía descubre una serie de causas en los patrones de entrada y las secuencias temporales que recibe. Se utiliza un algoritmo de revisión de creencias bayesianas para propagar creencias de retroalimentación y anticipación desde los nodos hijos a los padres y viceversa. Sin embargo, la analogía con las redes bayesianas es limitada, ya que los HTM pueden autoentrenarse (de modo que cada nodo tenga una relación de parentesco inequívoca), manejar datos sensibles al tiempo y otorgar mecanismos para la atención encubierta .

Tai Sing Lee y David Mumford propusieron anteriormente una teoría de computación cortical jerárquica basada en la propagación de creencias bayesianas . [ 24 ] Si bien HTM es en gran medida consistente con estas ideas, agrega detalles sobre el manejo de representaciones invariantes en la corteza visual . [ 25 ]

Redes neuronales

Al igual que cualquier sistema que modela detalles de la neocorteza, la HTM puede considerarse una red neuronal artificial . La jerarquía en forma de árbol que se usa comúnmente en las HTM se asemeja a la topología habitual de las redes neuronales tradicionales. Las HTM intentan modelar columnas corticales (de 80 a 100 neuronas) y sus interacciones con un número menor de "neuronas" de la HTM. El objetivo de las HTM actuales es capturar la mayor cantidad posible de funciones de las neuronas y la red (tal como se entienden actualmente) dentro de las capacidades de las computadoras típicas y en áreas que pueden ser fácilmente útiles, como el procesamiento de imágenes. Por ejemplo, no se intenta incorporar la retroalimentación de niveles superiores ni el control motor porque aún no se comprende cómo hacerlo, y se utilizan sinapsis binarias en lugar de variables porque se determinó que eran suficientes dentro de las capacidades actuales de la HTM.

LAMINART y otras redes neuronales similares investigadas por Stephen Grossberg intentan modelar tanto la infraestructura de la corteza como el comportamiento de las neuronas en un marco temporal para explicar datos neurofisiológicos y psicofísicos. Sin embargo, estas redes son, por el momento, demasiado complejas para una aplicación práctica. [ 26 ]

HTM también está relacionado con el trabajo de Tomaso Poggio , incluyendo un enfoque para modelar la vía ventral de la corteza visual conocida como HMAX. Las similitudes de HTM con varias ideas de IA se describen en el número de diciembre de 2005 de la revista Artificial Intelligence. [ 27 ]

Neocognitrón

Neocognitron , una red neuronal jerárquica multicapa propuesta por el profesor Kunihiko Fukushima en 1987, es uno de los primeros modelos de redes neuronales de aprendizaje profundo . [ 28 ]

Véase también

Referencias

  1. Cui, Yuwei; Ahmad, Subutai; Hawkins, Jeff (2016). "Aprendizaje continuo de secuencias en línea con un modelo de red neuronal no supervisado". Neural Computation . 28 (11): 2474– 2504. arXiv : 1512.05463 . doi : 10.1162/NECO_a_00893 . PMID 27626963 . S2CID 3937908 .  
  2. Ahmad, Subutai; Lavin, Alexander; Purdy, Scott; Agha, Zuha (2017). "Detección de anomalías en tiempo real sin supervisión para datos en flujo" . Neurocomputing . 262 : 134–147 . doi : 10.1016/j.neucom.2017.04.070 .
  3. "Detalles preliminares sobre un nuevo trabajo teórico sobre inferencia sensoriomotora" . Foro HTM . 3 de junio de 2016.
  4. Retrospectiva de HTM en YouTube
  5. "Documentación antigua de Numenta" . numenta.com . Archivado del original el 27 de mayo de 2009.
  6. Conferencia de Jeff Hawkins que describe los algoritmos de aprendizaje cortical en YouTube
  7. Cui, Yuwei; Ahmad, Subutai; Hawkins, Jeff (2017). "The HTM Spatial Pooler—A Neocortical Algorithm for Online Sparse Distributed Coding" . Frontiers in Computational Neuroscience . 11 111. doi : 10.3389/fncom.2017.00111 . PMC 5712570. PMID 29238299 .  
  8. 1 2 3 Hawkins, Jeff; Ahmad, Subutai (30 de marzo de 2016). "Por qué las neuronas tienen miles de sinapsis, una teoría de la memoria de secuencia en la neocorteza" . Front . Neural Circuits . 10 : 23. doi : 10.3389/fncir.2016.00023 . PMC 4811948. PMID 27065813 .  
  9. "Página de producto Grok" . grokstream.com . Archivado del original el 26 de abril de 2019. Consultado el 12 de agosto de 2017 .
  10. Laserson, Jonathan (septiembre de 2011). "De las redes neuronales al aprendizaje profundo: Centrándonos en el cerebro humano" (PDF) . XRDS . 18 (1). doi : 10.1145/2000775.2000787 . S2CID 21496694 . 
  11. Hawkins, Jeff; Ahmad, Subutai; Cui, Yuwei (2017). "Una teoría de cómo las columnas en la neocorteza permiten aprender la estructura del mundo" . Frontiers in Neural Circuits . 11 81. doi : 10.3389/fncir.2017.00081 . PMC 5661005. PMID 29118696 .  
  12. ↑ ¿ Nos hemos perdido la mitad de lo que hace el neocórtex? La localización alocéntrica como base de la percepción en YouTube
  13. "Numenta publica una teoría revolucionaria sobre la inteligencia y el procesamiento cortical" . eurekalert.org . 14 de enero de 2019. Archivado del original el 8 de noviembre de 2020. Consultado el 22 de marzo de 2019 .
  14. Hawkins, Jeff ; Blakeslee, Sandra . Sobre la inteligencia .
  15. George, Dileep; Hawkins, Jeff (2009). "Hacia una teoría matemática de los microcircuitos corticales" . PLOS Computational Biology . 5 (10) e1000532. Bibcode : 2009PLSCB...5E0532G . doi : 10.1371/ journal.pcbi.1000532 . PMC 2749218. PMID 19816557 .  
  16. "Algoritmos de aprendizaje cortical HTM" (PDF) . numenta.org .
  17. Hinton, Geoffrey E. (1984). Representaciones distribuidas (PDF) (Informe técnico). Departamento de Ciencias de la Computación, Universidad Carnegie-Mellon. CMU-CS-84-157.
  18. Plate, Tony (1991). "Representaciones reducidas holográficas: álgebra de convolución para representaciones distribuidas compositivas" (PDF) . IJCAI .
  19. ^ Kanerva , Pentti (1988). Memoria distribuida escasa . Prensa del MIT. ISBN 978-0-262-11132-4.
  20. Snaider, Javier; Franklin, Stan (2012). Memoria distribuida dispersa entera (PDF) . Vigésimo quinta conferencia internacional flairs. S2CID 17547390. Archivado del original (PDF) el 29 de diciembre de 2017. 
  21. Olshausen, Bruno A.; Field, David J. (1997). "Codificación dispersa con un conjunto de base sobrecompleto: ¿Una estrategia empleada por V1?" . Vision Research . 37 (23): 3311– 3325. doi : 10.1016/S0042-6989(97)00169-7 . PMID 9425546 . S2CID 14208692 .  
  22. 1 2 Ahmad, Subutai; Hawkins, Jeff (2016). "Numenta NUPIC – representaciones distribuidas dispersas". arXiv : 1601.00720 [ q-bio.NC ].
  23. De Sousa Webber, Francisco (2015). "Teoría del plegado semántico y su aplicación en la huella digital semántica". arXiv : 1511.08855 [ cs.AI ].
  24. Lee, Tai Sing; Mumford, David (2002). "Inferencia bayesiana jerárquica en la corteza visual". Journal of the Optical Society of America A. 20 ( 7): 1434– 48. CiteSeerX 10.1.1.12.2565 . doi : 10.1364/josaa.20.001434 . PMID 12868647 .  
  25. George, Dileep (24 de julio de 2010). "Inferencia bayesiana jerárquica en la corteza visual" . dileepgeorge.com . Archivado del original el 1 de agosto de 2019.
  26. Grossberg, Stephen (2007). Cisek, Paul; Drew, Trevor; Kalaska, John (eds.). Hacia una teoría unificada del neocórtex: Circuitos corticales laminares para la visión y la cognición. Informe técnico CAS/CNS-TR-2006-008. Para Neurociencia Computacional: De las neuronas a la teoría y viceversa (PDF) (Informe). Ámsterdam: Elsevier. págs. 79–104 . Archivado del original (PDF) el 29 de agosto de 2017. 
  27. "Número especial de revisión" . Inteligencia artificial . 169 (2): 103– 212. Diciembre de 2005. doi : 10.1016/j.artint.2005.10.001 .
  28. Fukushima, Kunihiko (2007). "Neocognitron" . Scholarpedia . 2 (1): 1717. Bibcode : 2007SchpJ...2.1717F . doi : 10.4249/scholarpedia.1717 .

Lecturas adicionales

  • Ahmad, Subutai; Hawkins, Jeff (25 de marzo de 2015). "Propiedades de las representaciones distribuidas dispersas y su aplicación a la memoria temporal jerárquica". arXiv : 1503.07469 [ q-bio.NC ].
  • Hawkins, Jeff (abril de 2007). "Aprende como un humano" . IEEE Spectrum .
  • Maltoni, Davide (13 de abril de 2011). "Reconocimiento de patrones mediante memoria temporal jerárquica" (PDF) . Informe técnico de DEIS. Italia: Universidad de Bolonia.
  • Ratliff, Evan (marzo de 2007). "La máquina pensante" . Wired .
  • HTM en Numenta
  • Conceptos básicos de HTM con Rahul (Numenta), hablan sobre el algoritmo de aprendizaje cortical (CLA) utilizado por el modelo HTM en YouTube.