Articulo de referencia

Aprendizaje profundo

Representación de imágenes en múltiples capas de abstracción en aprendizaje profundo [ 1 ] En el aprendizaje automático , el aprendizaje profundo ( DL ) se centra en la utilizac...

Representación de imágenes en múltiples capas de abstracción en el aprendizaje profundo
Representación de imágenes en múltiples capas de abstracción en aprendizaje profundo [ 1 ]

En el aprendizaje automático , el aprendizaje profundo ( DL ) se centra en la utilización de redes neuronales multicapa para realizar tareas como clasificación , regresión y aprendizaje de representaciones . Este campo se inspira en la neurociencia biológica y gira en torno a la apilamiento de neuronas artificiales en capas y su "entrenamiento" para procesar datos. El adjetivo "profundo" se refiere al uso de múltiples capas (que van desde tres hasta varios cientos o miles) en la red. Los métodos utilizados pueden ser supervisados , semisupervisados ​​o no supervisados . [ 2 ]

Algunas arquitecturas comunes de redes de aprendizaje profundo incluyen redes totalmente conectadas , redes de creencias profundas , redes neuronales recurrentes , redes neuronales convolucionales , redes generativas antagónicas , transformadores y campos de radiación neuronal . Estas arquitecturas se han aplicado a campos como la visión artificial , el reconocimiento de voz , el procesamiento del lenguaje natural , la traducción automática , la bioinformática , el diseño de fármacos , el análisis de imágenes médicas , la ciencia climática , la inspección de materiales y los programas de juegos de mesa , donde han producido resultados comparables e incluso superiores al rendimiento de expertos humanos. [ 3 ] [ 4 ] [ 5 ]

Las primeras formas de redes neuronales se inspiraron en el procesamiento de información y los nodos de comunicación distribuidos en los sistemas biológicos , particularmente en el cerebro humano . Sin embargo, las redes neuronales actuales no pretenden modelar la función cerebral de los organismos y, en general, se consideran modelos de baja calidad para ese propósito. [ 6 ]

Descripción general

La mayoría de los modelos modernos de aprendizaje profundo se basan en redes neuronales multicapa, como las redes neuronales convolucionales y los transformadores , aunque también pueden incluir fórmulas proposicionales o variables latentes organizadas por capas en modelos generativos profundos , como los nodos en redes de creencias profundas y máquinas de Boltzmann profundas . [ 7 ]

Fundamentalmente, el aprendizaje profundo se refiere a una clase de algoritmos de aprendizaje automático en los que se utiliza una jerarquía de capas para transformar los datos de entrada en una representación cada vez más abstracta y compleja. Por ejemplo, en un modelo de reconocimiento de imágenes , la entrada original puede ser una imagen (representada como un tensor de píxeles ). La primera capa de representación puede intentar identificar formas básicas como líneas y círculos; la segunda capa puede componer y codificar la disposición de los bordes; la tercera capa puede codificar una nariz y unos ojos; y la cuarta capa puede reconocer que la imagen contiene un rostro.

Es importante destacar que un proceso de aprendizaje profundo puede aprender por sí mismo qué características colocar de forma óptima en cada nivel . Antes del aprendizaje profundo, las técnicas de aprendizaje automático a menudo implicaban la ingeniería de características manual para transformar los datos en una representación más adecuada para que un algoritmo de clasificación pudiera operar sobre ella. En el enfoque de aprendizaje profundo, las características no se diseñan manualmente y el modelo descubre automáticamente representaciones de características útiles a partir de los datos. Esto no elimina la necesidad de ajustes manuales; por ejemplo, la variación en el número de capas y el tamaño de las capas puede proporcionar diferentes grados de abstracción. [ 8 ] [ 2 ]

La palabra "profundo" en "aprendizaje profundo" se refiere al número de capas a través de las cuales se transforman los datos. Más precisamente, los sistemas de aprendizaje profundo tienen una profundidad sustancial de ruta de asignación de crédito (CAP). La CAP es la cadena de transformaciones desde la entrada hasta la salida. Las CAP describen conexiones potencialmente causales entre la entrada y la salida. Para una red neuronal de alimentación directa , la profundidad de las CAP es la de la red y es el número de capas ocultas más uno (ya que la capa de salida también está parametrizada). Para las redes neuronales recurrentes , en las que una señal puede propagarse a través de una capa más de una vez, la profundidad de la CAP es potencialmente ilimitada. [ 9 ] No existe un umbral de profundidad universalmente aceptado que divida el aprendizaje superficial del aprendizaje profundo, pero la mayoría de los investigadores coinciden en que el aprendizaje profundo implica una profundidad de CAP mayor que dos. Se ha demostrado que una CAP de profundidad dos es un aproximador universal en el sentido de que puede emular cualquier función. [ 10 ] Más allá de eso, más capas no aumentan la capacidad de aproximación de funciones de la red. Los modelos profundos (CAP > dos) son capaces de extraer mejores características que los modelos superficiales y, por lo tanto, las capas adicionales ayudan a aprender las características de manera efectiva.

Las arquitecturas de aprendizaje profundo se pueden construir con un método voraz capa por capa. [ 11 ] El aprendizaje profundo ayuda a desenredar estas abstracciones y seleccionar qué características mejoran el rendimiento. [ 8 ]

Los algoritmos de aprendizaje profundo se pueden aplicar a tareas de aprendizaje no supervisado. Esto representa una ventaja importante, ya que los datos sin etiquetar son más abundantes que los datos etiquetados. Ejemplos de estructuras profundas que se pueden entrenar de forma no supervisada son las redes de creencias profundas . [ 8 ] [ 12 ]

El término aprendizaje profundo fue introducido en la comunidad de aprendizaje automático por Rina Dechter en 1986, [ 13 ] y en las redes neuronales artificiales por Igor Aizenberg y sus colegas en 2000, en el contexto de las neuronas de umbral booleano . [ 14 ] [ 15 ] La etimología del término es más compleja. [ 16 ]

Interpretaciones

Las redes neuronales profundas generalmente se interpretan en términos del teorema de aproximación universal [ 17 ] [ 18 ] [ 19 ] [ 20 ] [ 21 ] o inferencia probabilística . [ 22 ] [ 23 ] [ 8 ] [ 9 ] [ 24 ]

El teorema clásico de aproximación universal se refiere a la capacidad de las redes neuronales de alimentación directa con una sola capa oculta de tamaño finito para aproximar funciones continuas . [ 17 ] [ 18 ] [ 19 ] [ 20 ] En 1989, George Cybenko publicó la primera demostración para funciones de activación sigmoide [ 17 ] y Kurt Hornik la generalizó a arquitecturas multicapa de alimentación directa en 1991. [ 18 ] Trabajos recientes también mostraron que la aproximación universal también se cumple para funciones de activación no acotadas, como la unidad lineal rectificada de Kunihiko Fukushima . [ 25 ] [ 26 ]

El teorema de aproximación universal para redes neuronales profundas se refiere a la capacidad de redes con ancho limitado pero con profundidad que puede crecer. Lu et al. [ 21 ] demostraron que si el ancho de una red neuronal profunda con activación ReLU es estrictamente mayor que la dimensión de entrada, entonces la red puede aproximar cualquier función integrable de Lebesgue ; si el ancho es menor o igual a la dimensión de entrada, entonces una red neuronal profunda no es un aproximador universal.

La interpretación probabilística [ 24 ] se deriva del campo del aprendizaje automático . Incluye la inferencia, [ 23 ] [ 7 ] [ 8 ] [ 9 ] [ 12 ] [ 24 ] así como los conceptos de optimización de entrenamiento y prueba , relacionados con el ajuste y la generalización , respectivamente. Más específicamente, la interpretación probabilística considera la no linealidad de activación como una función de distribución acumulativa . [ 24 ] La interpretación probabilística condujo a la introducción del dropout como regularizador en redes neuronales. La interpretación probabilística fue introducida por investigadores como Hopfield , Widrow y Narendra y popularizada en estudios como el de Bishop . [ 27 ]

Historia

Antes de 1980

Existen dos tipos de redes neuronales artificiales (RNA): redes neuronales de propagación directa (FNN) o perceptrones multicapa (MLP) y redes neuronales recurrentes (RNN). Las RNN presentan ciclos en su estructura de conectividad, mientras que las FNN no. En la década de 1920, Wilhelm Lenz y Ernst Ising crearon el modelo de Ising [ 28 ] [ 29 ] , que es esencialmente una arquitectura RNN sin aprendizaje, compuesta por elementos umbral similares a neuronas. En 1972, Shun'ichi Amari hizo que esta arquitectura fuera adaptativa. [ 30 ] [ 31 ] Su RNN de aprendizaje fue republicada por John Hopfield en 1982. [ 32 ] Otras redes neuronales recurrentes tempranas fueron publicadas por Kaoru Nakano en 1971. [ 33 ] [ 34 ] Ya en 1948, Alan Turing produjo un trabajo sobre "Máquinas Inteligentes" que no fue publicado en vida, [ 35 ] que contenía "ideas relacionadas con la evolución artificial y las RNN de aprendizaje". [ 31 ]

Frank Rosenblatt (1958) [ 36 ] propuso el perceptrón, un MLP con 3 capas: una capa de entrada, una capa oculta con pesos aleatorios que no aprendieron y una capa de salida. Posteriormente publicó un libro en 1962 que también introdujo variantes y experimentos computacionales, incluyendo una versión con perceptrones de cuatro capas "con redes preterminales adaptativas" donde las dos últimas capas han aprendido pesos (aquí atribuye el mérito a HD Block y BW Knight). [ 37 ] : sección 16 El libro cita una red anterior de RD Joseph (1960) [ 38 ] "funcionalmente equivalente a una variación de" este sistema de cuatro capas (el libro menciona a Joseph más de 30 veces). ¿Debería considerarse, por lo tanto, a Joseph el creador de perceptrones multicapa adaptativos adecuados con unidades ocultas de aprendizaje? Desafortunadamente, el algoritmo de aprendizaje no era funcional y cayó en el olvido.

El primer algoritmo de aprendizaje profundo funcional fue el método de grupo para el manejo de datos , un método para entrenar redes neuronales arbitrariamente profundas, publicado por Alexey Ivakhnenko y Lapa en 1965. Lo consideraron una forma de regresión polinómica, [ 39 ] o una generalización del perceptrón de Rosenblatt para manejar relaciones más complejas, no lineales y jerárquicas. [ 40 ] Un artículo de 1971 describió una red profunda con ocho capas entrenada con este método, [ 41 ] que se basa en el entrenamiento capa por capa a través del análisis de regresión. Las unidades ocultas superfluas se podan utilizando un conjunto de validación separado. Dado que las funciones de activación de los nodos son polinomios de Kolmogorov-Gabor, estas fueron también las primeras redes profundas con unidades multiplicativas o "compuertas". [ 31 ]

El primer perceptrón multicapa de aprendizaje profundo entrenado mediante descenso de gradiente estocástico [ 42 ] fue publicado en 1967 por Shun'ichi Amari . [ 43 ] En experimentos computacionales realizados por el estudiante de Amari, Saito, un MLP de cinco capas con dos capas modificables aprendió representaciones internas para clasificar clases de patrones no linealmente separables. [ 31 ] Los desarrollos posteriores en hardware y ajustes de hiperparámetros han convertido al descenso de gradiente estocástico de extremo a extremo en la técnica de entrenamiento dominante en la actualidad.

En 1969, Kunihiko Fukushima introdujo la función de activación ReLU (unidad lineal rectificada) . [ 25 ] [ 31 ] El rectificador se ha convertido en la función de activación más popular para el aprendizaje profundo. [ 44 ]

Las arquitecturas de aprendizaje profundo para redes neuronales convolucionales (CNN) con capas convolucionales y capas de submuestreo comenzaron con el Neocognitron introducido por Kunihiko Fukushima en 1979, aunque no fue entrenado por retropropagación. [ 45 ] [ 46 ]

La retropropagación es una aplicación eficiente de la regla de la cadena derivada por Gottfried Wilhelm Leibniz en 1673 [ 47 ] a redes de nodos diferenciables. La terminología "errores retropropagantes" fue introducida en realidad en 1962 por Rosenblatt, [ 37 ] pero no sabía cómo implementarla, aunque Henry J. Kelley tuvo un precursor continuo de la retropropagación en 1960 en el contexto de la teoría de control . [ 48 ] La forma moderna de la retropropagación fue publicada por primera vez en la tesis de maestría de Seppo Linnainmaa (1970). [ 49 ] [ 50 ] [ 31 ] GM Ostrovski et al. Lo republicó en 1971. [ 51 ] [ 52 ] Paul Werbos aplicó la retropropagación a redes neuronales en 1982 [ 53 ] (su tesis doctoral de 1974, reimpresa en un libro de 1994, [ 54 ] aún no describía el algoritmo [ 52 ] ). En 1986, David E. Rumelhart et al. popularizaron la retropropagación pero no citaron el trabajo original. [ 55 ] [ 56 ]

Décadas de 1980 a 2000

La red neuronal de retardo de tiempo (TDNN) fue introducida en 1987 por Alex Waibel para aplicar CNN al reconocimiento de fonemas. Utilizaba convoluciones, compartición de pesos y retropropagación. [ 57 ] [ 58 ] En 1988, Wei Zhang aplicó una CNN entrenada con retropropagación al reconocimiento de alfabetos. [ 59 ] En 1989, Yann LeCun et al. crearon una CNN llamada LeNet para reconocer códigos postales escritos a mano en el correo. El entrenamiento requirió 3 días. [ 60 ] En 1990, Wei Zhang implementó una CNN en hardware de computación óptica . [ 61 ] En 1991, se aplicó una CNN a la segmentación de objetos de imágenes médicas [ 62 ] y a la detección de cáncer de mama en mamografías. [ 63 ] LeNet-5 (1998), una CNN de 7 niveles de Yann LeCun et al., que clasifica dígitos, fue aplicada por varios bancos para reconocer números escritos a mano en cheques digitalizados en imágenes de 32x32 píxeles. [ 64 ]

Las redes neuronales recurrentes (RNN) [ 28 ] [ 30 ] se desarrollaron aún más en la década de 1980. La recurrencia se utiliza para el procesamiento de secuencias, y cuando una red recurrente se despliega, se asemeja matemáticamente a una capa profunda de alimentación directa. En consecuencia, tienen propiedades y problemas similares, y sus desarrollos tuvieron influencias mutuas. En RNN, dos trabajos influyentes iniciales fueron la red de Jordan (1986) [ 65 ] y la red de Elman (1990), [ 66 ] que aplicaron RNN para estudiar problemas en psicología cognitiva .

En la década de 1980, la retropropagación no funcionó bien para el aprendizaje profundo con rutas de asignación de crédito largas. Para superar este problema, en 1991, Jürgen Schmidhuber propuso una jerarquía de RNN preentrenadas un nivel a la vez por aprendizaje autosupervisado donde cada RNN intenta predecir su propia entrada siguiente, que es la siguiente entrada inesperada de la RNN inferior. [ 67 ] [ 68 ] Este "compresor de historial neuronal" utiliza codificación predictiva para aprender representaciones internas en múltiples escalas de tiempo autoorganizadas. Esto puede facilitar sustancialmente el aprendizaje profundo posterior. La jerarquía de RNN se puede colapsar en una sola RNN, destilando una red de segmentación de nivel superior en una red de automatización de nivel inferior . [ 67 ] [ 68 ] [ 31 ] En 1993, un compresor de historial neuronal resolvió una tarea de "aprendizaje muy profundo" que requería más de 1000 capas subsiguientes en una RNN desplegada en el tiempo. [ 69 ] La "P" en ChatGPT se refiere a dicho preentrenamiento.

La tesis de diploma de Sepp Hochreiter (1991) [ 70 ] implementó el compresor de historial neuronal, [ 67 ] e identificó y analizó el problema del gradiente evanescente . [ 70 ] [ 71 ] Hochreiter propuso conexiones residuales recurrentes para resolver el problema del gradiente evanescente. Esto condujo a la memoria a corto y largo plazo (LSTM), publicada en 1995. [ 72 ] LSTM puede aprender tareas de "aprendizaje muy profundo" [ 9 ] con largas rutas de asignación de crédito que requieren recuerdos de eventos que ocurrieron miles de pasos de tiempo discretos antes. Esa LSTM aún no era la arquitectura moderna, que requería una "puerta de olvido", introducida en 1999, [ 73 ] que se convirtió en la arquitectura RNN estándar.

En 1991, Jürgen Schmidhuber también publicó redes neuronales adversarias que compiten entre sí en forma de un juego de suma cero , donde la ganancia de una red es la pérdida de la otra. [ 74 ] [ 75 ] La primera red es un modelo generativo que modela una distribución de probabilidad sobre patrones de salida. La segunda red aprende mediante descenso de gradiente para predecir las reacciones del entorno a estos patrones. Esto se denominó "curiosidad artificial". En 2014, este principio se utilizó en redes generativas adversarias (GAN). [ 76 ]

Durante 1985–1995, inspirados por la mecánica estadística, Terry Sejnowski , Peter Dayan , Geoffrey Hinton , etc., desarrollaron varias arquitecturas y métodos , incluyendo la máquina de Boltzmann , [ 77 ] la máquina de Boltzmann restringida , [ 78 ] la máquina de Helmholtz , [ 79 ] y el algoritmo de vigilia-sueño . [ 80 ] Estos fueron diseñados para el aprendizaje no supervisado de modelos generativos profundos. Sin embargo, estos eran computacionalmente más costosos en comparación con la retropropagación. El algoritmo de aprendizaje de la máquina de Boltzmann, publicado en 1985, fue brevemente popular antes de ser eclipsado por el algoritmo de retropropagación en 1986. (p.  112 [ 81 ] ). Una red de 1988 se convirtió en el estado del arte en la predicción de la estructura de proteínas , una aplicación temprana del aprendizaje profundo a la bioinformática. [ 82 ]

Tanto el aprendizaje superficial como el profundo (p. ej., redes recurrentes) de las ANN para el reconocimiento de voz se han explorado durante muchos años. [ 83 ] [ 84 ] [ 85 ] Estos métodos nunca superaron la tecnología del modelo de mezcla gaussiana interna no uniforme hecha a mano / modelo oculto de Markov (GMM-HMM) basada en modelos generativos de voz entrenados de forma discriminativa. [ 86 ] Se han analizado dificultades clave, incluyendo la disminución del gradiente [ 70 ] y la débil estructura de correlación temporal en los modelos predictivos neuronales. [ 87 ] [ 88 ] Las dificultades adicionales fueron la falta de datos de entrenamiento y la potencia de cálculo limitada.

La mayoría de los investigadores en reconocimiento de voz se alejaron de las redes neuronales para dedicarse al modelado generativo. Una excepción fue SRI International a finales de la década de 1990. Financiado por la NSA y DARPA del gobierno estadounidense , SRI investigó el reconocimiento de voz y de locutores . El equipo de reconocimiento de locutores, liderado por Larry Heck, reportó un éxito significativo con redes neuronales profundas en el procesamiento de voz en la prueba de referencia de reconocimiento de locutores del NIST de 1998. [ 89 ] [ 90 ] Se implementó en el Nuance Verifier, lo que representó la primera aplicación industrial importante del aprendizaje profundo. [ 91 ]

El principio de priorizar las características "en bruto" sobre la optimización manual se exploró con éxito por primera vez en la arquitectura del autoencoder profundo sobre las características "en bruto" del espectrograma o del banco de filtros lineales a finales de la década de 1990, [ 90 ] demostrando su superioridad sobre las características Mel-Cepstral que contienen etapas de transformación fija a partir de espectrogramas. Las características en bruto del habla, las formas de onda , produjeron posteriormente excelentes resultados a mayor escala. [ 92 ]

década de 2000

Las redes neuronales entraron en un periodo de estancamiento, y los modelos más simples que utilizan características diseñadas manualmente para tareas específicas, como los filtros de Gabor y las máquinas de vectores de soporte (SVM), se convirtieron en las opciones preferidas en las décadas de 1990 y 2000, debido al coste computacional de las redes neuronales artificiales y a la falta de comprensión de cómo el cerebro conecta sus redes biológicas.

En 2003, LSTM se volvió competitivo con los reconocedores de voz tradicionales en ciertas tareas. [ 93 ] En 2006, Alex Graves , Santiago Fernández, Faustino Gomez y Schmidhuber lo combinaron con la clasificación temporal conexionista (CTC) [ 94 ] en pilas de LSTM. [ 95 ] En 2009, se convirtió en la primera RNN en ganar un concurso de reconocimiento de patrones , en reconocimiento de escritura a mano conectada . [ 96 ] [ 9 ]

En 2006, publicaciones de Geoff Hinton , Ruslan Salakhutdinov , Osindero y Teh [ 97 ] [ 98 ] desarrollaron redes de creencias profundas para el modelado generativo. Se entrenan entrenando una máquina de Boltzmann restringida, luego congelándola y entrenando otra sobre la primera, y así sucesivamente, luego opcionalmente ajustadas usando retropropagación supervisada. [ 97 ] Podían modelar distribuciones de probabilidad de alta dimensión, como la distribución de imágenes MNIST , pero la convergencia era lenta. [ 97 ] [ 99 ] [ 100 ]

El impacto del aprendizaje profundo en la industria comenzó a principios de la década de 2000, cuando las CNN ya procesaban entre el 10 % y el 20 % de todos los cheques emitidos en los EE. UU., según Yann LeCun. [ 101 ] Las aplicaciones industriales del aprendizaje profundo al reconocimiento de voz a gran escala comenzaron alrededor de 2010.

El Taller NIPS de 2009 sobre Aprendizaje Profundo para el Reconocimiento de Voz estuvo motivado por las limitaciones de los modelos generativos profundos del habla y la posibilidad de que, con un hardware más potente y conjuntos de datos a gran escala, las redes neuronales profundas pudieran volverse prácticas. Se creía que el preentrenamiento de las DNN utilizando modelos generativos de redes de creencias profundas (DBN) superaría las principales dificultades de las redes neuronales. Sin embargo, se descubrió que reemplazar el preentrenamiento con grandes cantidades de datos de entrenamiento para una retropropagación directa al usar DNN con capas de salida grandes y dependientes del contexto producía tasas de error drásticamente más bajas que el modelo de mezcla gaussiana (GMM)/modelo oculto de Markov (HMM) de última generación en ese momento y también que los sistemas basados ​​en modelos generativos más avanzados. [ 102 ] La naturaleza de los errores de reconocimiento producidos por los dos tipos de sistemas era característicamente diferente, [ 103 ] ofreciendo perspectivas técnicas sobre cómo integrar el aprendizaje profundo en el sistema de decodificación de voz en tiempo de ejecución altamente eficiente existente implementado por todos los principales sistemas de reconocimiento de voz. [ 23 ] [ 104 ] [ 105 ] El análisis realizado alrededor de 2009-2010, que contrastaba los modelos GMM (y otros modelos generativos de voz) con los modelos DNN, estimuló la inversión industrial temprana en aprendizaje profundo para el reconocimiento de voz. [ 103 ] Ese análisis se realizó con un rendimiento comparable (menos del 1,5 % de tasa de error) entre los modelos DNN discriminativos y los modelos generativos. [ 102 ] [ 103 ] [ 106 ] En 2010, los investigadores extendieron el aprendizaje profundo de TIMIT al reconocimiento de voz con vocabulario amplio, adoptando grandes capas de salida de la DNN basadas en estados HMM dependientes del contexto construidos por árboles de decisión . [ 107 ] [ 108 ] [ 109 ] [ 104 ]

La revolución del aprendizaje profundo

Cómo el aprendizaje profundo es un subconjunto del aprendizaje automático y cómo el aprendizaje automático es un subconjunto de la inteligencia artificial (IA).

La revolución del aprendizaje profundo comenzó con la visión artificial basada en redes neuronales convolucionales (CNN) y GPU.

Aunque las CNN entrenadas mediante retropropagación existían desde hacía décadas y las implementaciones de redes neuronales en GPU desde hacía años, [ 110 ] incluyendo las CNN, [ 111 ] se necesitaban implementaciones más rápidas de CNN en GPU para avanzar en la visión artificial. Posteriormente, a medida que el aprendizaje profundo se generalizó, se desarrollaron hardware especializado y optimizaciones de algoritmos específicamente para el aprendizaje profundo. [ 112 ]

Un avance clave para la revolución del aprendizaje profundo fueron los avances en hardware, especialmente en GPU. Algunos trabajos iniciales datan de 2004. [ 110 ] [ 111 ] En 2009, Raina, Madhavan y Andrew Ng informaron sobre una red neuronal profunda de 100 millones de capas entrenada en 30 GPU Nvidia GeForce GTX 280 , una demostración temprana de aprendizaje profundo basado en GPU. Informaron de un entrenamiento hasta 70 veces más rápido. [ 113 ]

En 2011, una CNN llamada DanNet [ 114 ] [ 115 ] por Dan Ciresan, Ueli Meier, Jonathan Masci, Luca Maria Gambardella y Jürgen Schmidhuber logró por primera vez un rendimiento sobrehumano en un concurso de reconocimiento de patrones visuales, superando a los métodos tradicionales por un factor de 3. [ 9 ] Luego ganó más concursos. [ 116 ] [ 117 ] También demostraron cómo las CNN de max-pooling en GPU mejoraron significativamente el rendimiento. [ 3 ]

En 2012, Andrew Ng y Jeff Dean crearon una FNN que aprendió a reconocer conceptos de nivel superior, como gatos, solo a partir de la observación de imágenes sin etiquetar tomadas de vídeos de YouTube . [ 118 ]

En octubre de 2012, AlexNet , de Alex Krizhevsky , Ilya Sutskever y Geoffrey Hinton [ 4 ], ganó la competición ImageNet a gran escala por un margen significativo frente a métodos de aprendizaje automático superficiales. Otras mejoras incrementales incluyeron la red VGG-16 de Karen Simonyan y Andrew Zisserman [ 119 ] e Inceptionv3 de Google [ 120 ] .

El éxito en la clasificación de imágenes se extendió luego a la tarea más compleja de generar descripciones (leyendas) para imágenes, a menudo como una combinación de CNN y LSTM. [ 121 ] [ 122 ] [ 123 ]

En 2014, el estado del arte era entrenar "redes neuronales muy profundas" con 20 a 30 capas. [ 124 ] Apilar demasiadas capas condujo a una fuerte reducción en la precisión del entrenamiento , [ 125 ] conocido como el problema de "degradación". [ 126 ] En 2015, se desarrollaron dos técnicas para entrenar redes muy profundas: la red Highway se publicó en mayo de 2015, y la red neuronal residual (ResNet) [ 126 ] en diciembre de 2015. ResNet se comporta como una Highway Net de compuerta abierta.

Por esa misma época, el aprendizaje profundo comenzó a impactar el campo del arte. Los primeros ejemplos incluyeron Google DeepDream (2015) y la transferencia de estilo neuronal (2015), [ 127 ] ambos basados ​​en redes neuronales de clasificación de imágenes preentrenadas, como VGG-19 .

La red generativa antagónica (GAN) de ( Ian Goodfellow et al., 2014) [ 128 ] (basada en el principio de curiosidad artificial de Jürgen Schmidhuber [ 74 ] [ 76 ] ) se convirtió en el estado del arte en el modelado generativo durante el período 2014-2018. StyleGAN de Nvidia (2018) [ 129 ] logra una excelente calidad de imagen basada en la GAN progresiva de Tero Karras et al. [ 130 ] Aquí el generador GAN crece de pequeña a gran escala de forma piramidal. La generación de imágenes por GAN alcanzó un éxito popular y provocó discusiones sobre deepfakes . [ 131 ] Los modelos de difusión (2015) [ 132 ] eclipsaron a las GAN en el modelado generativo desde entonces, con sistemas como DALL·E 2 (2022) y Stable Diffusion (2022).

En 2015, el reconocimiento de voz de Google mejoró en un 49% gracias a un modelo basado en LSTM, que pusieron a disposición a través de Google Voice Search en teléfonos inteligentes . [ 133 ] [ 134 ]

El aprendizaje profundo forma parte de sistemas de vanguardia en diversas disciplinas, en particular en visión artificial y reconocimiento automático del habla (ASR). Los resultados en conjuntos de evaluación de uso común como TIMIT (ASR) y MNIST ( clasificación de imágenes ), así como en una variedad de tareas de reconocimiento del habla con vocabulario extenso, han mejorado constantemente. [ 102 ] [ 135 ] Las redes neuronales convolucionales fueron reemplazadas en ASR por LSTM . [ 134 ] [ 136 ] [ 137 ] [ 138 ] pero tienen más éxito en visión artificial.

Yoshua Bengio , Geoffrey Hinton y Yann LeCun recibieron el Premio Turing 2018 por "avances conceptuales y de ingeniería que han convertido a las redes neuronales profundas en un componente crítico de la computación". [ 139 ]

Redes neuronales

Ejemplo simplificado de entrenamiento de una red neuronal para la detección de objetos: La red se entrena con múltiples imágenes que muestran estrellas de mar y erizos de mar , las cuales se correlacionan con "nodos" que representan características visuales . Las estrellas de mar se identifican por una textura anillada y un contorno estrellado, mientras que la mayoría de los erizos de mar se identifican por una textura rayada y una forma ovalada. Sin embargo, la presencia de un erizo de mar con textura anillada crea una asociación débil entre ellos.
Ejecución posterior de la red en una imagen de entrada (izquierda): [ 140 ] La red detecta correctamente la estrella de mar. Sin embargo, la asociación débilmente ponderada entre la textura anillada y el erizo de mar también confiere una señal débil a este último desde uno de los dos nodos intermedios. Además, una concha que no se incluyó en el entrenamiento da una señal débil para la forma ovalada, lo que también resulta en una señal débil para la salida del erizo de mar. Estas señales débiles pueden dar lugar a un resultado falso positivo para el erizo de mar. En realidad, las texturas y los contornos no estarían representados por nodos individuales, sino por patrones de ponderación asociados de múltiples nodos.

Las redes neuronales artificiales ( RNA ) o sistemas conexionistas son sistemas informáticos inspirados en las redes neuronales biológicas que conforman el cerebro animal. Estos sistemas aprenden (mejoran progresivamente su capacidad) a realizar tareas considerando ejemplos, generalmente sin programación específica para cada tarea. Por ejemplo, en el reconocimiento de imágenes, podrían aprender a identificar imágenes que contienen gatos analizando imágenes de ejemplo etiquetadas manualmente como "gato" o "sin gato" y utilizando los resultados del análisis para identificar gatos en otras imágenes. Su mayor utilidad se encuentra en aplicaciones difíciles de expresar con un algoritmo informático tradicional que utiliza programación basada en reglas .

Una red neuronal artificial (RNA) se basa en un conjunto de unidades conectadas llamadas neuronas artificiales (análogas a las neuronas biológicas del cerebro ). Cada conexión ( sinapsis ) entre neuronas puede transmitir una señal a otra neurona. La neurona receptora (postsináptica) procesa la(s) señal(es) y luego envía señales a las neuronas conectadas a ella. Las neuronas pueden tener un estado, generalmente representado por números reales , típicamente entre 0 y 1. Las neuronas y las sinapsis también pueden tener un peso que varía a medida que avanza el aprendizaje, lo que puede aumentar o disminuir la intensidad de la señal que envían.

Normalmente, las neuronas se organizan en capas. Cada capa puede realizar diferentes transformaciones en sus entradas. Las señales viajan desde la primera capa (de entrada) hasta la última (de salida), posiblemente tras recorrer las capas varias veces.

El objetivo original del enfoque de redes neuronales era resolver problemas del mismo modo que lo haría un cerebro humano. Con el tiempo, la atención se centró en la correspondencia de habilidades mentales específicas, lo que dio lugar a desviaciones de la biología, como la retropropagación , que consiste en transmitir información en sentido inverso y ajustar la red para reflejar dicha información.

Las redes neuronales se han utilizado en diversas tareas, como visión artificial, reconocimiento de voz , traducción automática , filtrado de redes sociales , juegos de mesa y videojuegos , y diagnóstico médico.

En 2017, las redes neuronales solían tener entre unos pocos miles y unos pocos millones de unidades y millones de conexiones. A pesar de que este número es varios órdenes de magnitud menor que el número de neuronas en un cerebro humano, estas redes pueden realizar muchas tareas a un nivel superior al de los humanos (por ejemplo, reconocer rostros o jugar al "Go" [ 141 ] ).

Redes neuronales profundas

Una red neuronal profunda ( DNN ) es una red neuronal artificial con múltiples capas entre las capas de entrada y salida. [ 7 ] [ 9 ] Existen diferentes tipos de redes neuronales, pero todas constan de los mismos componentes: neuronas, sinapsis, pesos, sesgos y funciones. [ 142 ] Estos componentes, en conjunto, funcionan de manera similar a las funciones del cerebro humano y pueden entrenarse como cualquier otro algoritmo de aprendizaje automático.

Por ejemplo, una red neuronal profunda (DNN) entrenada para reconocer razas de perros procesará la imagen y calculará la probabilidad de que el perro en ella pertenezca a una raza determinada. El usuario puede revisar los resultados y seleccionar qué probabilidades debe mostrar la red (por encima de un umbral determinado, etc.) y devolver la etiqueta propuesta. Cada manipulación matemática se considera una capa [ 143 ] , y las DNN complejas tienen muchas capas, de ahí el nombre de redes "profundas".

Las DNN pueden modelar relaciones no lineales complejas. Las arquitecturas de DNN generan modelos compositivos donde el objeto se expresa como una composición en capas de primitivas . [ 144 ] Las capas adicionales permiten la composición de características de capas inferiores, lo que potencialmente modela datos complejos con menos unidades que una red superficial de rendimiento similar. [ 7 ] Por ejemplo, se demostró que los polinomios multivariados dispersos son exponencialmente más fáciles de aproximar con DNN que con redes superficiales. [ 145 ]

Las arquitecturas profundas incluyen muchas variantes de algunos enfoques básicos. Cada arquitectura ha tenido éxito en dominios específicos. No siempre es posible comparar el rendimiento de múltiples arquitecturas, a menos que se hayan evaluado con los mismos conjuntos de datos. [ 143 ]

Las DNN suelen ser redes de alimentación directa en las que los datos fluyen desde la capa de entrada a la capa de salida sin retroceder. Al principio, la DNN crea un mapa de neuronas virtuales y asigna valores numéricos aleatorios, o "pesos", a las conexiones entre ellas. Los pesos y las entradas se multiplican y devuelven una salida entre 0 y 1. Si la red no reconoce con precisión un patrón en particular, un algoritmo ajusta los pesos. [ 146 ] De esta forma, el algoritmo puede hacer que ciertos parámetros sean más influyentes, hasta que determine la manipulación matemática correcta para procesar completamente los datos.

Las redes neuronales recurrentes , en las que los datos pueden fluir en cualquier dirección, se utilizan para aplicaciones como el modelado del lenguaje . [ 147 ] [ 148 ] [ 149 ] [ 150 ] [ 151 ] La memoria a corto y largo plazo es particularmente eficaz para este uso. [ 152 ] [ 153 ]

Las redes neuronales convolucionales (CNN) se utilizan en visión artificial. [ 154 ] Las CNN también se han aplicado al modelado acústico para el reconocimiento automático del habla (ASR). [ 155 ]

Desafíos

Al igual que con las redes neuronales artificiales (RNA), pueden surgir muchos problemas con las redes neuronales profundas (DNN) entrenadas de forma ingenua. Dos problemas comunes son el sobreajuste y el tiempo de cálculo.

Las DNN son propensas al sobreajuste debido a las capas de abstracción añadidas, que les permiten modelar dependencias raras en los datos de entrenamiento. Métodos de regularización como la poda de unidades de Ivakhnenko [ 41 ] o la disminución del peso (2{\displaystyle \ell _{2}}-regularización) o escasez (1{\displaystyle \ell _{1}}La regularización (-regularización) se puede aplicar durante el entrenamiento para combatir el sobreajuste. [ 156 ] Alternativamente, la regularización de abandono (dropout regularization) omite aleatoriamente unidades de las capas ocultas durante el entrenamiento. Esto ayuda a excluir dependencias raras. [ 157 ] Otro desarrollo reciente interesante es la investigación de modelos con la complejidad justa a través de una estimación de la complejidad intrínseca de la tarea que se está modelando. Este enfoque se ha aplicado con éxito a tareas de predicción de series temporales multivariadas, como la predicción de tráfico. [ 158 ] Finalmente, los datos se pueden aumentar mediante métodos como el recorte y la rotación, de modo que los conjuntos de entrenamiento más pequeños se pueden aumentar de tamaño para reducir las posibilidades de sobreajuste. [ 159 ]

Las DNN deben considerar muchos parámetros de entrenamiento, como el tamaño (número de capas y número de unidades por capa), la tasa de aprendizaje y los pesos iniciales. Recorrer el espacio de parámetros para encontrar los parámetros óptimos puede no ser factible debido al costo en tiempo y recursos computacionales. Diversas técnicas, como el procesamiento por lotes (calcular el gradiente en varios ejemplos de entrenamiento a la vez en lugar de en ejemplos individuales) [ 160 ] , aceleran el cálculo. Las grandes capacidades de procesamiento de las arquitecturas de muchos núcleos (como las GPU o el Intel Xeon Phi) han producido aceleraciones significativas en el entrenamiento, debido a la idoneidad de dichas arquitecturas de procesamiento para los cálculos de matrices y vectores. [ 161 ] [ 162 ]

Como alternativa, los ingenieros pueden buscar otros tipos de redes neuronales con algoritmos de entrenamiento más sencillos y convergentes. CMAC ( controlador de articulación del modelo cerebeloso ) es un ejemplo de este tipo de red neuronal. No requiere tasas de aprendizaje ni pesos iniciales aleatorios. Se garantiza que el proceso de entrenamiento converge en un solo paso con un nuevo lote de datos, y la complejidad computacional del algoritmo de entrenamiento es lineal con respecto al número de neuronas involucradas. [ 163 ] [ 164 ]

Hardware

Desde la década de 2010, los avances tanto en algoritmos de aprendizaje automático como en hardware informático han dado lugar a métodos más eficientes para entrenar redes neuronales profundas que contienen muchas capas de unidades ocultas no lineales y una capa de salida muy grande. [ 165 ] Para 2019, las unidades de procesamiento gráfico (GPU), a menudo con mejoras específicas para IA, habían desplazado a las CPU como el método dominante para entrenar IA en la nube comercial a gran escala. [ 166 ] OpenAI estimó la computación de hardware utilizada en los proyectos de aprendizaje profundo más grandes desde AlexNet (2012) hasta AlphaZero (2017) y encontró un aumento de 300 000 veces en la cantidad de computación requerida, con una línea de tendencia de tiempo de duplicación de 3,4 meses. [ 167 ] [ 168 ]

Se diseñaron circuitos electrónicos especiales llamados procesadores de aprendizaje profundo para acelerar los algoritmos de aprendizaje profundo. Los procesadores de aprendizaje profundo incluyen unidades de procesamiento neuronal (NPU) en teléfonos móviles Huawei [ 169 ] y servidores de computación en la nube como las unidades de procesamiento tensorial (TPU) en la plataforma Google Cloud . [ 170 ] Cerebras Systems también ha construido un sistema dedicado para manejar grandes modelos de aprendizaje profundo, el CS-2, basado en el procesador más grande de la industria, el Wafer Scale Engine (WSE-2) de segunda generación. [ 171 ] [ 172 ]

Los semiconductores de espesor atómico se consideran prometedores para el hardware de aprendizaje profundo de bajo consumo energético, donde se utiliza la misma estructura básica del dispositivo tanto para las operaciones lógicas como para el almacenamiento de datos. En 2020, Marega et al. publicaron experimentos con un material de canal activo de gran área para el desarrollo de dispositivos y circuitos de lógica en memoria basados ​​en transistores de efecto de campo de puerta flotante (FGFET). [ 173 ]

En 2021, J. Feldmann et al. propusieron un acelerador de hardware fotónico integrado para el procesamiento convolucional paralelo. [ 174 ] Los autores identifican dos ventajas clave de la fotónica integrada sobre sus contrapartes electrónicas: (1) transferencia de datos masivamente paralela mediante multiplexación por división de longitud de onda junto con peines de frecuencia , y (2) velocidades de modulación de datos extremadamente altas. [ 174 ] Su sistema puede ejecutar billones de operaciones de multiplicación y acumulación por segundo, lo que indica el potencial de la fotónica integrada en aplicaciones de IA con gran cantidad de datos. [ 174 ]

Aplicaciones

Reconocimiento automático del habla

El reconocimiento automático de voz a gran escala es el primer y más convincente caso de éxito del aprendizaje profundo. Las RNN LSTM pueden aprender tareas de "aprendizaje muy profundo" [ 9 ] que involucran intervalos de varios segundos que contienen eventos de voz separados por miles de pasos de tiempo discretos, donde un paso de tiempo corresponde a unos 10 ms. Las LSTM con puertas de olvido [ 153 ] son ​​competitivas con los reconocedores de voz tradicionales en ciertas tareas. [ 93 ]

El éxito inicial en el reconocimiento de voz se basó en tareas de reconocimiento a pequeña escala basadas en TIMIT. El conjunto de datos contiene 630 hablantes de ocho dialectos principales del inglés americano , donde cada hablante lee 10 oraciones. [ 175 ] Su pequeño tamaño permite probar muchas configuraciones. Más importante aún, la tarea TIMIT se refiere al reconocimiento de secuencias de fonemas , que, a diferencia del reconocimiento de secuencias de palabras, admite modelos de lenguaje de bigramas de fonemas débiles . Esto permite analizar más fácilmente la fuerza de los aspectos de modelado acústico del reconocimiento de voz. Las tasas de error que se enumeran a continuación, incluidos estos primeros resultados y medidos como porcentajes de errores de fonemas (PER), se han resumido desde 1991.

El debut de las DNN para el reconocimiento de locutores a finales de la década de 1990 y el reconocimiento de voz alrededor de 2009-2011 y de LSTM alrededor de 2003-2007, aceleraron el progreso en ocho áreas principales: [ 23 ] [ 106 ] [ 104 ]

  • Escalado horizontal y entrenamiento y decodificación acelerados de redes neuronales profundas
  • Entrenamiento discriminativo de secuencias
  • Procesamiento de características mediante modelos profundos con un sólido conocimiento de los mecanismos subyacentes.
  • Adaptación de redes neuronales profundas y modelos profundos relacionados.
  • Aprendizaje multitarea y por transferencia mediante redes neuronales profundas y modelos profundos relacionados.
  • Las redes neuronales convolucionales (CNN) y cómo diseñarlas para aprovechar al máximo el conocimiento del dominio del habla.
  • RNN y sus ricas variantes LSTM
  • Otros tipos de modelos profundos incluyen modelos basados ​​en tensores y modelos generativos/discriminativos profundos integrados.

Los modelos de reconocimiento de voz más recientes utilizan Transformers o redes de convolución temporal con un éxito significativo y amplias aplicaciones. [ 180 ] [ 181 ] [ 182 ] Todos los principales sistemas comerciales de reconocimiento de voz (por ejemplo, Microsoft Cortana , Xbox , Skype Translator , Amazon Alexa , Google Now , Apple Siri , búsqueda por voz de Baidu e iFlyTek , y una gama de productos de voz de Nuance , etc.) se basan en el aprendizaje profundo. [ 23 ] [ 183 ] [ 184 ]

Reconocimiento de imágenes

Richard Green explica cómo se utiliza el aprendizaje profundo con un vehículo operado a distancia en el cultivo de mejillones .

Un conjunto de datos común para la evaluación de la clasificación de imágenes es la base de datos MNIST . MNIST se compone de dígitos escritos a mano e incluye 60 000 ejemplos de entrenamiento y 10 000 ejemplos de prueba. Al igual que con TIMIT, su pequeño tamaño permite a los usuarios probar múltiples configuraciones. Se encuentra disponible una lista completa de resultados en este conjunto. [ 185 ]

El reconocimiento de imágenes basado en aprendizaje profundo se ha vuelto "sobrehumano", produciendo resultados más precisos que los de los participantes humanos. Esto ocurrió por primera vez en 2011 con el reconocimiento de señales de tráfico y, en 2014, con el reconocimiento de rostros humanos. [ 186 ] [ 187 ]

Los vehículos entrenados con aprendizaje profundo ahora interpretan vistas de cámara de 360°. [ 188 ] Otro ejemplo es el Análisis Novedoso de Dismorfología Facial (FDNA), utilizado para analizar casos de malformaciones humanas conectados a una gran base de datos de síndromes genéticos.

Procesamiento de artes visuales

Procesamiento de arte visual de Jimmy Wales en Francia, con el estilo de " El Grito " de Munch aplicado mediante transferencia de estilo neuronal.

Estrechamente relacionada con el progreso alcanzado en el reconocimiento de imágenes se encuentra la creciente aplicación de técnicas de aprendizaje profundo a diversas tareas de artes visuales. Las DNN han demostrado ser capaces, por ejemplo, de

Procesamiento del lenguaje natural

Las redes neuronales se han utilizado para implementar modelos de lenguaje desde principios de la década de 2000. [ 147 ] LSTM ayudó a mejorar la traducción automática y el modelado del lenguaje. [ 148 ] [ 149 ] [ 150 ]

Otras técnicas clave en este campo son el muestreo negativo [ 191 ] y la incrustación de palabras . La incrustación de palabras, como word2vec , puede considerarse como una capa de representación en una arquitectura de aprendizaje profundo que transforma una palabra atómica en una representación posicional de la palabra en relación con otras palabras en el conjunto de datos; la posición se representa como un punto en un espacio vectorial . El uso de la incrustación de palabras como capa de entrada de una RNN permite a la red analizar oraciones y frases utilizando una gramática vectorial compositiva eficaz. Una gramática vectorial compositiva puede considerarse como una gramática libre de contexto probabilística (PCFG) implementada por una RNN. [ 192 ] Los autoencoders recursivos construidos sobre incrustaciones de palabras pueden evaluar la similitud de oraciones y detectar paráfrasis. [ 192 ] Las arquitecturas neuronales profundas proporcionan los mejores resultados para el análisis de constituyentes, [ 193 ] análisis de sentimientos , [ 194 ] recuperación de información, [ 195 ] [ 196 ] comprensión del lenguaje hablado, [ 197 ] traducción automática, [ 148 ] [ 198 ] vinculación de entidades contextuales, [ 198 ] reconocimiento de estilo de escritura, [ 199 ] reconocimiento de entidades nombradas (clasificación de tokens), [ 200 ] clasificación de texto y otros. [ 201 ]

Los avances recientes generalizan la incrustación de palabras a la incrustación de oraciones .

Google Translate (GT) utiliza una gran red de memoria a corto y largo plazo (LSTM) de extremo a extremo . [ 202 ] [ 203 ] [ 204 ] [ 205 ] Google Neural Machine Translation (GNMT) utiliza un método de traducción automática basado en ejemplos en el que el sistema "aprende de millones de ejemplos". [ 203 ] Traduce "oraciones completas a la vez, en lugar de fragmentos". Google Translate admite más de cien idiomas. [ 203 ] La red codifica la "semántica de la oración en lugar de simplemente memorizar traducciones frase por frase". [ 203 ] [ 206 ] GT utiliza el inglés como intermedio entre la mayoría de los pares de idiomas. [ 206 ]

Descubrimiento de fármacos y toxicología

Un gran porcentaje de fármacos candidatos no logran la aprobación regulatoria. Estos fracasos se deben a una eficacia insuficiente (efecto en el objetivo), interacciones no deseadas (efectos fuera del objetivo) o efectos tóxicos imprevistos . [ 207 ] [ 208 ] La investigación ha explorado el uso del aprendizaje profundo para predecir los objetivos biomoleculares , [ 209 ] [ 210 ] los efectos fuera del objetivo y los efectos tóxicos de los químicos ambientales en nutrientes, productos domésticos y medicamentos. [ 211 ] [ 212 ] [ 213 ]

AtomNet es un sistema de aprendizaje profundo para el diseño racional de fármacos basado en la estructura . [ 214 ] AtomNet se utilizó para predecir nuevas biomoléculas candidatas para dianas de enfermedades como el virus del Ébola [ 215 ] y la esclerosis múltiple . [ 216 ] [ 215 ]

En 2017, se utilizaron por primera vez redes neuronales gráficas para predecir diversas propiedades de moléculas en un gran conjunto de datos toxicológicos. [ 217 ] En 2019, se utilizaron redes neuronales generativas para producir moléculas que fueron validadas experimentalmente hasta en ratones. [ 218 ] [ 219 ]

Sistemas de recomendación

Los sistemas de recomendación han utilizado el aprendizaje profundo para extraer características significativas para un modelo de factor latente para recomendaciones de música y revistas basadas en contenido. [ 220 ] [ 221 ] El aprendizaje profundo multivista se ha aplicado para aprender las preferencias del usuario de múltiples dominios. [ 222 ] El modelo utiliza un enfoque híbrido colaborativo y basado en contenido y mejora las recomendaciones en múltiples tareas.

Bioinformática

Se utilizó una red neuronal artificial autoencoder en bioinformática para predecir anotaciones de ontología genética y relaciones gen-función. [ 223 ]

En informática médica, el aprendizaje profundo se utilizó para predecir la calidad del sueño basándose en datos de dispositivos portátiles [ 224 ] y predicciones de complicaciones de salud a partir de datos de registros médicos electrónicos . [ 225 ]

Las redes neuronales profundas han demostrado un rendimiento sin precedentes en la predicción de la estructura de las proteínas , según la secuencia de los aminoácidos que las componen. En 2020, AlphaFold , un sistema basado en aprendizaje profundo, alcanzó un nivel de precisión significativamente superior al de todos los métodos computacionales anteriores. [ 226 ] [ 227 ]

Estimaciones de redes neuronales profundas

Las redes neuronales profundas pueden utilizarse para estimar la entropía de un proceso estocástico mediante un método denominado Estimador Conjunto de Entropía Neuronal (NJEE). [ 228 ] Esta estimación proporciona información sobre los efectos de las variables aleatorias de entrada en una variable aleatoria independiente . En la práctica, la DNN se entrena como un clasificador que asigna un vector o matriz de entrada X a una distribución de probabilidad de salida sobre las posibles clases de la variable aleatoria Y, dada la entrada X. Por ejemplo, en tareas de clasificación de imágenes , el NJEE asigna un vector de valores de color de píxeles a probabilidades sobre las posibles clases de imagen. En la práctica, la distribución de probabilidad de Y se obtiene mediante una capa Softmax con un número de nodos igual al tamaño del alfabeto de Y. El NJEE utiliza funciones de activación continuamente diferenciables , de modo que se cumplen las condiciones del teorema de aproximación universal . Se demuestra que este método proporciona un estimador fuertemente consistente y supera a otros métodos en casos de alfabetos de gran tamaño. [ 228 ]

Análisis de imágenes médicas

Se ha demostrado que el aprendizaje profundo produce resultados competitivos en aplicaciones médicas como la clasificación de células cancerosas, la detección de lesiones, la segmentación de órganos y la mejora de imágenes. [ 229 ] [ 230 ] Las herramientas modernas de aprendizaje profundo demuestran la alta precisión en la detección de diversas enfermedades y la utilidad de su uso por parte de los especialistas para mejorar la eficiencia del diagnóstico. [ 231 ] [ 232 ]

Publicidad móvil

Encontrar la audiencia móvil adecuada para la publicidad móvil siempre es un desafío, ya que se deben considerar y analizar muchos puntos de datos antes de que se pueda crear un segmento objetivo y utilizarlo en la publicación de anuncios por cualquier servidor de anuncios. [ 233 ] El aprendizaje profundo se ha utilizado para interpretar grandes conjuntos de datos publicitarios multidimensionales. Se recopilan muchos puntos de datos durante el ciclo de publicidad en internet de solicitud/publicidad/clic. Esta información puede constituir la base del aprendizaje automático para mejorar la selección de anuncios.

Restauración de imágenes

El aprendizaje profundo se ha aplicado con éxito a problemas inversos como la eliminación de ruido , la superresolución , el relleno de imágenes y la colorización de películas . [ 234 ] Estas aplicaciones incluyen métodos de aprendizaje como "Campos de contracción para la restauración efectiva de imágenes" [ 235 ] que se entrena en un conjunto de datos de imágenes, y Deep Image Prior , que se entrena en la imagen que necesita restauración.

detección de fraude financiero

El aprendizaje profundo se está aplicando a la detección de fraude financiero , detección de evasión fiscal, [ 236 ] y lucha contra el blanqueo de capitales. [ 237 ]

Ciencias de los materiales

En noviembre de 2023, investigadores de Google DeepMind y del Laboratorio Nacional Lawrence Berkeley anunciaron el desarrollo de un sistema de IA conocido como GNoME. Este sistema ha contribuido a la ciencia de los materiales al descubrir más de 2 millones de nuevos materiales en un plazo relativamente corto. GNoME emplea técnicas de aprendizaje profundo para explorar de manera eficiente posibles estructuras de materiales, logrando un aumento significativo en la identificación de estructuras cristalinas inorgánicas estables . Las predicciones del sistema se validaron mediante experimentos robóticos autónomos, demostrando una notable tasa de éxito del 71 %. Los datos de los materiales recién descubiertos están disponibles públicamente a través de la base de datos del Proyecto de Materiales , lo que ofrece a los investigadores la oportunidad de identificar materiales con las propiedades deseadas para diversas aplicaciones. Este desarrollo tiene implicaciones para el futuro del descubrimiento científico y la integración de la IA en la investigación de la ciencia de los materiales, lo que podría acelerar la innovación de materiales y reducir los costos en el desarrollo de productos. El uso de la IA y el aprendizaje profundo sugiere la posibilidad de minimizar o eliminar los experimentos manuales de laboratorio y permitir que los científicos se centren más en el diseño y análisis de compuestos únicos. [ 238 ] [ 239 ] [ 240 ]

Militar

El Departamento de Defensa de los Estados Unidos aplicó el aprendizaje profundo para entrenar robots en nuevas tareas mediante la observación. [ 241 ]

Ecuaciones diferenciales parciales

Las redes neuronales basadas en la física se han utilizado para resolver ecuaciones diferenciales parciales, tanto en problemas directos como inversos, de forma basada en datos. [ 242 ] Un ejemplo es la reconstrucción del flujo de fluidos regido por las ecuaciones de Navier-Stokes . El uso de redes neuronales basadas en la física no requiere la generación de malla, a menudo costosa, en la que se basan los métodos CFD convencionales . [ 243 ] [ 244 ] Es evidente que las restricciones geométricas y físicas tienen un efecto sinérgico en los sustitutos neuronales de EDP, lo que mejora su eficacia en la predicción de despliegues estables y de muy larga duración. [ 245 ]

método de ecuaciones diferenciales estocásticas regresivas profundas

El método de ecuaciones diferenciales estocásticas regresivas profundas es un método numérico que combina el aprendizaje profundo con ecuaciones diferenciales estocásticas regresivas (BSDE). Este método es particularmente útil para resolver problemas de alta dimensión en matemáticas financieras. Al aprovechar las potentes capacidades de aproximación de funciones de las redes neuronales profundas , BSDE profunda aborda los desafíos computacionales que enfrentan los métodos numéricos tradicionales en entornos de alta dimensión. Específicamente, los métodos tradicionales como los métodos de diferencias finitas o las simulaciones de Monte Carlo a menudo tienen problemas con la maldición de la dimensionalidad, donde el costo computacional aumenta exponencialmente con el número de dimensiones. Sin embargo, los métodos BSDE profundas emplean redes neuronales profundas para aproximar soluciones de ecuaciones diferenciales parciales (EDP) de alta dimensión, reduciendo eficazmente la carga computacional. [ 246 ]

Además, la integración de redes neuronales basadas en la física (PINN) en el marco de las ecuaciones diferenciales estocásticas profundas (BSDE) mejora su capacidad al incorporar directamente las leyes físicas subyacentes en la arquitectura de la red neuronal. Esto garantiza que las soluciones no solo se ajusten a los datos, sino que también cumplan con las ecuaciones diferenciales estocásticas que los rigen. Las PINN aprovechan el poder del aprendizaje profundo, respetando al mismo tiempo las restricciones impuestas por los modelos físicos, lo que da como resultado soluciones más precisas y fiables para problemas de matemáticas financieras.

Reconstrucción de imágenes

La reconstrucción de imágenes consiste en reconstruir las imágenes subyacentes a partir de mediciones relacionadas con ellas. Diversos estudios han demostrado el mejor rendimiento de los métodos de aprendizaje profundo en comparación con los métodos analíticos para varias aplicaciones, por ejemplo, imágenes espectrales [ 247 ] e imágenes de ultrasonido [ 248 ] .

Pronóstico del tiempo

Los sistemas tradicionales de predicción meteorológica resuelven un sistema muy complejo de ecuaciones diferenciales parciales. GraphCast es un modelo basado en aprendizaje profundo, entrenado con un amplio historial de datos meteorológicos para predecir cómo cambian los patrones climáticos con el tiempo. Es capaz de predecir las condiciones meteorológicas hasta con 10 días de antelación a nivel global, con un nivel de detalle muy alto y en menos de un minuto, con una precisión similar a la de los sistemas más avanzados. [ 249 ] [ 250 ]

Reloj epigenético

Un reloj epigenético es una prueba bioquímica que se puede utilizar para medir la edad. Galkin et al. utilizaron redes neuronales profundas para entrenar un reloj epigenético de envejecimiento con una precisión sin precedentes utilizando más de 6000 muestras de sangre. [ 251 ] El reloj utiliza información de 1000 sitios CpG y predice que las personas con ciertas afecciones serán mayores que los controles sanos: EII , demencia frontotemporal , cáncer de ovario y obesidad . Se planeó que el reloj de envejecimiento se lanzara para uso público en 2021 por Deep Longevity, una empresa derivada de Insilico Medicine .

Relación con el desarrollo cognitivo y cerebral humano

El aprendizaje profundo está estrechamente relacionado con una clase de teorías del desarrollo cerebral (específicamente, el desarrollo neocortical) propuestas por neurocientíficos cognitivos a principios de la década de 1990. [ 252 ] [ 253 ] [ 254 ] [ 255 ] Estas teorías del desarrollo se instanciaron en modelos computacionales, convirtiéndolas en predecesoras de los sistemas de aprendizaje profundo. Estos modelos de desarrollo comparten la propiedad de que varias dinámicas de aprendizaje propuestas en el cerebro (por ejemplo, una onda del factor de crecimiento nervioso ) apoyan la autoorganización de forma algo análoga a las redes neuronales utilizadas en los modelos de aprendizaje profundo. Al igual que la neocorteza , las redes neuronales emplean una jerarquía de filtros en capas en la que cada capa considera información de una capa anterior (o del entorno operativo) y luego pasa su salida (y posiblemente la entrada original) a otras capas. Este proceso produce una pila autoorganizada de transductores , bien ajustada a su entorno operativo. Una descripción de 1995 afirmaba: "...el cerebro del bebé parece organizarse bajo la influencia de ondas de los llamados factores tróficos... diferentes regiones del cerebro se conectan secuencialmente, con una capa de tejido madurando antes que otra y así sucesivamente hasta que todo el cerebro está maduro". [ 256 ]

Se han utilizado diversos enfoques para investigar la plausibilidad de los modelos de aprendizaje profundo desde una perspectiva neurobiológica. Por un lado, se han propuesto varias variantes del algoritmo de retropropagación para aumentar su realismo de procesamiento. [ 257 ] [ 258 ] Otros investigadores han argumentado que las formas no supervisadas de aprendizaje profundo, como las basadas en modelos generativos jerárquicos y redes de creencias profundas , pueden estar más cerca de la realidad biológica. [ 259 ] [ 260 ] En este sentido, los modelos de redes neuronales generativas se han relacionado con la evidencia neurobiológica sobre el procesamiento basado en el muestreo en la corteza cerebral. [ 261 ]

Aunque aún no se ha establecido una comparación sistemática entre la organización del cerebro humano y la codificación neuronal en redes profundas, se han reportado varias analogías. Por ejemplo, los cálculos realizados por las unidades de aprendizaje profundo podrían ser similares a los de las neuronas reales [ 262 ] y las poblaciones neuronales [ 263 ] . De manera similar, las representaciones desarrolladas por los modelos de aprendizaje profundo son similares a las medidas en el sistema visual de los primates [ 264 ] , tanto a nivel de unidad individual [ 265 ] como a nivel de población [ 266 ] .

Actividad comercial

El laboratorio de IA de Facebook realiza tareas como etiquetar automáticamente las fotos subidas con los nombres de las personas que aparecen en ellas. [ 267 ]

DeepMind Technologies de Google desarrolló un sistema capaz de aprender a jugar videojuegos de Atari usando solo píxeles como entrada de datos. En 2015 demostraron su sistema AlphaGo , que aprendió el juego de Go lo suficientemente bien como para vencer a un jugador profesional de Go. [ 268 ] [ 269 ] [ 270 ] Google Translate utiliza una red neuronal para traducir entre más de 100 idiomas.

En 2017, se lanzó Covariant.ai, que se centra en la integración del aprendizaje profundo en las fábricas. [ 271 ]

En 2008, [ 272 ] investigadores de la Universidad de Texas en Austin (UT) desarrollaron un marco de aprendizaje automático llamado Entrenamiento Manual de un Agente mediante Refuerzo Evaluativo, o TAMER, que proponía nuevos métodos para que los robots o programas informáticos aprendieran a realizar tareas interactuando con un instructor humano. [ 241 ] Desarrollado inicialmente como TAMER, un nuevo algoritmo llamado Deep TAMER se introdujo posteriormente en 2018 durante una colaboración entre el Laboratorio de Investigación del Ejército de los Estados Unidos (ARL) y los investigadores de la UT. Deep TAMER utilizó el aprendizaje profundo para proporcionar a un robot la capacidad de aprender nuevas tareas mediante la observación. [ 241 ] Usando Deep TAMER, un robot aprendió una tarea con un entrenador humano, viendo transmisiones de video u observando a un humano realizar una tarea en persona. Posteriormente, el robot practicó la tarea con la ayuda de la orientación del entrenador, quien proporcionó retroalimentación como "buen trabajo" y "mal trabajo". [ 273 ]

Críticas y comentarios

El aprendizaje profundo ha suscitado críticas y comentarios, en algunos casos procedentes de fuera del campo de la informática.

Teoría

Una crítica principal se refiere a la falta de teoría en torno a algunos métodos. [ 274 ] El aprendizaje en las arquitecturas profundas más comunes se implementa utilizando el bien conocido descenso de gradiente. Sin embargo, la teoría en torno a otros algoritmos, como la divergencia contrastiva, es menos clara. (p. ej., ¿converge? Si es así, ¿con qué rapidez? ¿Qué está aproximando?) Los métodos de aprendizaje profundo a menudo se consideran una caja negra , y la mayoría de las confirmaciones se realizan empíricamente, en lugar de teóricamente. [ 275 ]

En referencia adicional a la idea de que la sensibilidad artística podría ser inherente a niveles relativamente bajos de la jerarquía cognitiva, una serie publicada de representaciones gráficas de los estados internos de redes neuronales profundas (20-30 capas) que intentan discernir dentro de datos esencialmente aleatorios las imágenes con las que fueron entrenadas [ 276 ] demuestran un atractivo visual: el aviso de investigación original recibió más de 1000 comentarios y fue el tema de lo que fue durante un tiempo el artículo más consultado en el sitio web de The Guardian [ 277 ] .

Con el apoyo de la Teoría de la Difusión de la Innovación (TDI), un estudio analizó la difusión del aprendizaje profundo en los países BRICS y de la OCDE utilizando datos de Google Trends . [ 278 ]

Errores

Algunas arquitecturas de aprendizaje profundo muestran comportamientos problemáticos, [ 279 ] como clasificar con confianza imágenes irreconocibles como pertenecientes a una categoría familiar de imágenes ordinarias (2014) [ 280 ] y clasificar erróneamente perturbaciones minúsculas de imágenes clasificadas correctamente (2013). [ 281 ] Goertzel planteó la hipótesis de que estos comportamientos se deben a limitaciones en sus representaciones internas y que estas limitaciones inhibirían la integración en arquitecturas heterogéneas de inteligencia artificial general (IAG) multicomponente . [ 279 ] Estos problemas posiblemente se aborden mediante arquitecturas de aprendizaje profundo que formen internamente estados homólogos a las descomposiciones de gramática de imágenes [ 282 ] de entidades y eventos observados. [ 279 ] Aprender una gramática (visual o lingüística) a partir de datos de entrenamiento sería equivalente a restringir el sistema al razonamiento de sentido común que opera sobre conceptos en términos de reglas de producción gramatical y es un objetivo básico tanto de la adquisición del lenguaje humano [ 283 ] como de la inteligencia artificial (IA). [ 284 ]

Amenaza cibernética

A medida que el aprendizaje profundo pasa del laboratorio al mundo real, la investigación y la experiencia demuestran que las redes neuronales artificiales son vulnerables a ataques y engaños. [ 285 ] Al identificar los patrones que estos sistemas utilizan para funcionar, los atacantes pueden modificar las entradas de las RNA de tal manera que la RNA encuentre una coincidencia que los observadores humanos no reconocerían. Por ejemplo, un atacante puede realizar cambios sutiles en una imagen para que la RNA encuentre una coincidencia, aunque para un humano la imagen no se parezca en nada al objetivo de la búsqueda. Esta manipulación se denomina " ataque adversario ". [ 286 ]

En 2016, investigadores utilizaron una red neuronal artificial (RNA) para manipular imágenes mediante ensayo y error, identificar los puntos focales de otra y, de este modo, generar imágenes que la engañaban. Las imágenes modificadas no presentaban diferencias visibles para el ojo humano. Otro grupo demostró que las impresiones de imágenes manipuladas, fotografiadas posteriormente, engañaban con éxito a un sistema de clasificación de imágenes. [ 287 ] Una defensa es la búsqueda inversa de imágenes, en la que una posible imagen falsa se envía a un sitio como TinEye , que puede encontrar otras instancias de la misma. Un perfeccionamiento consiste en buscar utilizando solo partes de la imagen para identificar imágenes de las que se pudo haber tomado ese fragmento . [ 288 ]

Otro grupo demostró que ciertas gafas psicodélicas podían engañar a un sistema de reconocimiento facial haciéndole creer que personas comunes eran celebridades, lo que potencialmente permitiría que una persona suplantara la identidad de otra. En 2017, investigadores añadieron pegatinas a las señales de stop y provocaron que una red neuronal artificial las clasificara erróneamente. [ 287 ]

Sin embargo, las redes neuronales artificiales (RNA) pueden entrenarse aún más para detectar intentos de engaño , lo que podría llevar a atacantes y defensores a una carrera armamentística similar a la que ya caracteriza a la industria de la defensa contra el malware . Se han entrenado RNA para derrotar el software antimalware basado en RNA atacando repetidamente una defensa con malware que fue modificado continuamente mediante un algoritmo genético hasta engañar al antimalware sin perder su capacidad de dañar el objetivo. [ 287 ]

En 2016, otro grupo demostró que ciertos sonidos podían hacer que el sistema de comandos de voz de Google Now abriera una dirección web específica, e hipotetizó que esto podría "servir como un trampolín para ataques posteriores (por ejemplo, abrir una página web que aloje malware de descarga automática)". [ 287 ]

En el " envenenamiento de datos ", se introducen continuamente datos falsos en el conjunto de entrenamiento de un sistema de aprendizaje automático para impedir que alcance el dominio. [ 287 ]

Ética en la recopilación de datos

Los sistemas de aprendizaje profundo que se entrenan mediante aprendizaje supervisado a menudo dependen de datos creados o anotados por humanos, o ambos. [ 289 ] Se ha argumentado que no solo el trabajo de clics mal remunerado (como en Amazon Mechanical Turk ) se utiliza regularmente para este propósito, sino también formas implícitas de microtrabajo humano que a menudo no se reconocen como tales. [ 290 ] El filósofo Rainer Mühlhoff distingue cinco tipos de "captura maquínica" de microtrabajo humano para generar datos de entrenamiento: (1) gamificación (la incrustación de tareas de anotación o computación en el flujo de un juego), (2) "atrapamiento y seguimiento" (por ejemplo, CAPTCHA para el reconocimiento de imágenes o seguimiento de clics en las páginas de resultados de búsqueda de Google ), (3) explotación de motivaciones sociales (por ejemplo, etiquetar rostros en Facebook para obtener imágenes faciales etiquetadas), (4) minería de información (por ejemplo, aprovechando dispositivos de autocuantificación como los rastreadores de actividad ) y (5) trabajo de clics. [ 290 ]

Véase también

Referencias

  1. Schulz, Hannes; Behnke, Sven (noviembre de 2012). "Aprendizaje profundo: aprendizaje por capas de jerarquías de funciones". KI-Künstliche Intelligenz . 26 (4): 357– 363. doi : 10.1007/s13218-012-0198-z .
  2. 1 2 LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). "Aprendizaje profundo" . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442 . 
  3. 1 2 Ciresan, D.; Meier, U.; Schmidhuber, J. (2012). "Redes neuronales profundas multicolumna para la clasificación de imágenes". 2012 IEEE Conference on Computer Vision and Pattern Recognition . pp. 3642–3649 . arXiv : 1202.2745 . doi : 10.1109 /cvpr.2012.6248110 . ISBN  978-1-4673-1228-8.
  4. 1 2 Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E (2012). "Clasificación de ImageNet con redes neuronales convolucionales profundas" . Avances en sistemas de procesamiento de información neuronal . 25 .
  5. "La IA AlphaGo de Google gana una serie de tres partidas contra el mejor jugador de Go del mundo" . TechCrunch . 25 de mayo de 2017. Archivado del original el 17 de junio de 2018. Consultado el 17 de junio de 2018 .
  6. "Un estudio insta a la cautela al comparar las redes neuronales con el cerebro" . Noticias del MIT | Instituto Tecnológico de Massachusetts . 2 de noviembre de 2022. Consultado el 6 de diciembre de 2023 .
  7. 1 2 3 4 Bengio, Y. (2009). "Aprendizaje de arquitecturas profundas para IA". Foundations and Trends® in Machine Learning . 2 (1): 1– 127. doi : 10.1561/2200000006 .
  8. 1 2 3 4 5 Bengio, Y.; Courville, A.; Vincent, P. (2013). "Representation Learning: A Review and New Perspectives". IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (8): 1798– 1828. arXiv : 1206.5538 . Bibcode : 2013ITPAM..35.1798B . doi : 10.1109/tpami.2013.50 . PMID 23787338 . 
  9. 1 2 3 4 5 6 7 8 Schmidhuber, J. (2015). "Aprendizaje profundo en redes neuronales: una visión general". Redes neuronales . 61 : 85–117 . arXiv : 1404.7828 . Bibcode : 2015NN.....61...85S . doi : 10.1016/j.neunet.2014.09.003 . PMID 25462637 . 
  10. Shigeki, Sugiyama (12 de abril de 2019). Comportamiento humano y otro tipo de conciencia: investigación emergente y oportunidades . IGI Global. ISBN 978-1-5225-8218-2.
  11. Bengio, Yoshua; Lamblin, Pascal; Popovici, Dan; Larochelle, Hugo (2007). Entrenamiento codicioso por capas de redes neuronales profundas (PDF) . Avances en sistemas de procesamiento de información neuronal. págs. 153–160 . Archivado (PDF) del original el 20 de octubre de 2019. Recuperado el 6 de octubre de 2019 . 
  12. 1 2 Hinton, GE (2009). "Redes de creencias profundas" . Scholarpedia . 4 (5): 5947. Bibcode : 2009SchpJ...4.5947H . doi : 10.4249/scholarpedia.5947 .
  13. Rina Dechter (1986). Aprendizaje durante la búsqueda en problemas de satisfacción de restricciones. Universidad de California, Departamento de Ciencias de la Computación, Laboratorio de Sistemas Cognitivos. Archivado en línea el 19 de abril de 2016 en Wayback Machine.
  14. ^ Aizenberg, Igor N.; Aizenberg, Naum N.; Vandewalle, Joos (2000). Neuronas binarias universales y de valores múltiples . doi : 10.1007/978-1-4757-3115-6 . ISBN 978-1-4419-4978-3.
  15. Las neuronas recurrentes que coevolucionan aprenden POMDP de memoria profunda. Proc. GECCO, Washington, DC, pp. 1795–1802, ACM Press, Nueva York, NY, EE. UU., 2005.
  16. Fradkov, Alexander L. (2020-01-01). "Historia temprana del aprendizaje automático" . IFAC-PapersOnLine . XXI Congreso Mundial de la IFAC. 53 (2): 1385– 1390. doi : 10.1016/j.ifacol.2020.12.1888 .
  17. 1 2 3 Cybenko, G. (diciembre de 1989). "Aproximación por superposiciones de una función sigmoidal". Matemáticas de Control, Señales y Sistemas . 2 (4): 303– 314. Bibcode : 1989MCSS....2..303C . doi : 10.1007/bf02551274 .
  18. 1 2 3 Hornik, Kurt (1991). "Capacidades de aproximación de redes neuronales multicapa de alimentación directa". Redes neuronales . 4 (2): 251– 257. Bibcode : 1991NN......4..251H . doi : 10.1016/0893-6080(91)90009-t .
  19. 1 2 Haykin, Simon S. (1999). Redes neuronales: Una base integral . Prentice Hall. ISBN 978-0-13-273350-2.
  20. ^ Hassoun , Mohamad H. (1995). Fundamentos de las redes neuronales artificiales . Prensa del MIT. pag. 48.ISBN  978-0-262-08239-6.
  21. 1 2 Lu, Z., Pu, H., Wang, F., Hu, Z., & Wang, L. (2017). El poder expresivo de las redes neuronales: una perspectiva desde la amplitud . Archivado el 13 de febrero de 2019 en Wayback Machine . Neural Information Processing Systems, 6231-6239.
  22. Orhan, AE; Ma, WJ (2017). "Inferencia probabilística eficiente en redes neuronales genéricas entrenadas con retroalimentación no probabilística" . Nature Communications . 8 (1): 138. Bibcode : 2017NatCo...8..138O . doi : 10.1038/s41467-017-00181-8 . PMC 5527101. PMID 28743932 .  
  23. 1 2 3 4 5 Deng, L.; Yu, D. (2014). "Aprendizaje profundo: métodos y aplicaciones" (PDF) . Fundamentos y tendencias en procesamiento de señales . 7 ( 3–4 ): 1–199 . doi : 10.1561/2000000039 . Archivado (PDF) del original el 14 de marzo de 2016. Recuperado el 18 de octubre de 2014 .
  24. 1 2 3 4 Murphy, Kevin P. (24 de agosto de 2012). Aprendizaje automático: una perspectiva probabilística . MIT Press. ISBN 978-0-262-01802-9.
  25. 1 2 Fukushima, K. (1969). "Extracción de características visuales mediante una red multicapa de elementos de umbral analógicos". IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 .
  26. Sonoda, Sho; Murata, Noboru (2017). "Red neuronal con funciones de activación no acotadas es un aproximador universal". Análisis armónico aplicado y computacional . 43 (2): 233– 268. arXiv : 1505.03654 . doi : 10.1016/j.acha.2015.12.005 .
  27. Bishop, Christopher M. (2006). Reconocimiento de patrones y aprendizaje automático . Springer. ISBN 978-0-387-31073-2.
  28. 1 2 "Contribución de Ernst Ising a la teoría del ferromagnetismo" .
  29. Brush, Stephen G. (1967). "Historia del modelo de Lenz-Ising". Reviews of Modern Physics . 39 (4): 883– 893. Bibcode : 1967RvMP...39..883B . doi : 10.1103/RevModPhys.39.883 .
  30. 1 2 Amari, Shun-Ichi (1972). "Aprendizaje de patrones y secuencias de patrones mediante redes autoorganizadas de elementos umbral". IEEE Transactions . C (21): 1197– 1206.
  31. 1 2 3 4 5 6 7 Schmidhuber, Jürgen (2022). "Historia anotada de la IA moderna y el aprendizaje profundo". arXiv : 2212.11279 [ cs.NE ].
  32. Hopfield, JJ (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias . 79 ( 8): 2554– 2558. Bibcode : 1982PNAS...79.2554H . doi : 10.1073/pnas.79.8.2554 . PMC 346238. PMID 6953413 .  
  33. Nakano, Kaoru (1971). "Proceso de aprendizaje en un modelo de memoria asociativa". Reconocimiento de patrones y aprendizaje automático . págs. 172–186 . doi : 10.1007/978-1-4615-7566-5_15 . ISBN  978-1-4615-7568-9.
  34. Nakano, Kaoru (1972). "Associatron-A Model of Associative Memory". IEEE Transactions on Systems, Man, and Cybernetics . SMC-2 (3): 380– 388. Bibcode : 1972ITSMC...2..380N . doi : 10.1109/TSMC.1972.4309133 .
  35. Turing, Alan (1992) [1948]. «Máquinas inteligentes». En Ince, DC (ed.). Obras completas de A. M. Turing: Inteligencia mecánica . Vol. 1. Elsevier Science Publishers. pág. 107. ISBN   0-444-88058-5.
  36. Rosenblatt, F. (1958). "El perceptrón: un modelo probabilístico para el almacenamiento y la organización de la información en el cerebro". Psychological Review . 65 (6): 386– 408. doi : 10.1037/h0042519 . PMID 13602029 . 
  37. 1 2 Rosenblatt, Frank (1962). Principios de neurodinámica . Spartan, Nueva York.
  38. Joseph, RD (1960). Contribuciones a la teoría del perceptrón, Informe del Laboratorio Aeronáutico de Cornell n.° VG-11 96--G-7, Buffalo .
  39. Ivakhnenko, AG; Lapa, VG (1967). Cibernética y técnicas de predicción . American Elsevier Publishing Co. ISBN 978-0-444-00020-0.
  40. Ivakhnenko, AG (marzo de 1970). "Autoorganización heurística en problemas de cibernética de ingeniería" . Automatica . 6 (2): 207– 219. Bibcode : 1970Autom...6..207I . doi : 10.1016/0005-1098(70)90092-0 .
  41. 1 2 Ivakhnenko, Alexey (1971). "Teoría polinómica de sistemas complejos" (PDF) . IEEE Transactions on Systems, Man, and Cybernetics . SMC-1 (4): 364–378 . Bibcode : 1971ITSMC...1..364I . doi : 10.1109/TSMC.1971.4308320 . Archivado (PDF) del original el 29-08-2017 . Recuperado el 05-11-2019 .
  42. Robbins, H. ; Monro, S. (1951). "Un método de aproximación estocástica" . The Annals of Mathematical Statistics . 22 (3): 400. doi : 10.1214/aoms/1177729586 .
  43. Amari, Shunichi (junio de 1967). "Una teoría de clasificadores de patrones adaptativos". IEEE Transactions on Electronic Computers . EC-16 (3): 299–307 . Bibcode : 1967ITECm..16..299A . doi : 10.1109/PGEC.1967.264666 .
  44. Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (16 de octubre de 2017). "Búsqueda de funciones de activación". arXiv : 1710.05941 [ cs.NE ].
  45. Fukushima, K. (1979). "Modelo de red neuronal para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición: Neocognitron". Trans. IECE (en japonés) . J62-A (10): 658–665 . doi : 10.1007/bf00344251 . PMID 7370364 . 
  46. Fukushima, K. (1980). "Neocognitron: Un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones que no se ve afectado por el cambio de posición". Biol. Cybern . 36 (4): 193– 202. doi : 10.1007/bf00344251 . PMID 7370364 . 
  47. Leibniz, Gottfried Wilhelm Freiherr von (1920). Los primeros manuscritos matemáticos de Leibniz: traducidos de los textos latinos publicados por Carl Immanuel Gerhardt con notas críticas e históricas (Leibniz publicó la regla de la cadena en unas memorias de 1676) . Open Court Publishing Company. ISBN 978-0-598-81846-1.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  48. Kelley, Henry J. (1960). "Teoría del gradiente de las trayectorias de vuelo óptimas". ARS Journal . 30 (10): 947– 954. doi : 10.2514/8.5282 .
  49. Linnainmaa, Seppo (1970). La representación del error de redondeo acumulativo de un algoritmo como una expansión de Taylor de los errores de redondeo locales (tesis de maestría) (en finés). Universidad de Helsinki. págs. 6–7 . 
  50. Linnainmaa, Seppo (1976). "Expansión de Taylor del error de redondeo acumulado". BIT Numerical Mathematics . 16 (2): 146– 160. doi : 10.1007/bf01931367 .
  51. Ostrovski, GM, Volin, YM y Boris, WW (1971). Sobre el cálculo de derivadas. Wiss. Z. Tech. Hochschule for Chemistry, 13:382–384.
  52. 1 2 Schmidhuber, Juergen (25 de octubre de 2014). "¿Quién inventó la retropropagación?" . IDSIA, Suiza. Archivado del original el 30 de julio de 2024. Recuperado el 14 de septiembre de 2024 .
  53. Werbos, Paul (1982). "Aplicaciones de los avances en el análisis de sensibilidad no lineal" (PDF) . Modelado y optimización de sistemas . Springer. págs. 762–770 . Archivado (PDF) del original el 14 de abril de 2016. Recuperado el 2 de julio de 2017 . 
  54. Werbos, Paul J. (1994). The Roots of Backpropagation: From Ordered Derivatives to Neural Networks and Political Forecasting . Nueva York: John Wiley & Sons. ISBN 0-471-59897-6.
  55. Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. (octubre de 1986). "Aprendizaje de representaciones mediante la retropropagación de errores". Nature . 323 (6088): 533– 536. Bibcode : 1986Natur.323..533R . doi : 10.1038/323533a0 .
  56. Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. (1985). Aprendizaje de representaciones internas mediante propagación de errores (PDF) (Informe). DTIC ADA164453 . Archivado del original (PDF) el 13 de octubre de 2022.
  57. Waibel, Alex (diciembre de 1987). Reconocimiento de fonemas mediante redes neuronales con retardo temporal (PDF) . Reunión del Instituto de Ingenieros Eléctricos, de Información y de Comunicación (IEICE). Tokio, Japón.
  58. Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, KJ (marzo de 1989). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal". IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. Bibcode : 1989ITASS..37..328W . doi : 10.1109/29.21701 .
  59. Zhang, Wei (1988). "Red neuronal de reconocimiento de patrones invariante al desplazamiento y su arquitectura óptica" . Actas de la Conferencia Anual de la Sociedad Japonesa de Física Aplicada .
  60. LeCun, Y.; Boser, B.; Denker, JS; Henderson, D.; Howard, RE; Hubbard, W.; Jackel, LD (diciembre de 1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos". Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 .
  61. Zhang, Wei; Itoh, Kazuyoshi; Tanida, Jun; Ichioka, Yoshiki (10 de noviembre de 1990). "Modelo de procesamiento distribuido en paralelo con interconexiones locales invariantes en el espacio y su arquitectura óptica". Applied Optics . 29 (32): 4790– 4797. Bibcode : 1990ApOpt..29.4790Z . doi : 10.1364/AO.29.004790 . PMID 20577468 . 
  62. Zhang, Wei; Hasegawa, Akira; Itoh, Kazuyoshi; Ichioka, Yoshiki (10 de octubre de 1991). "Procesamiento de imágenes del endotelio corneal humano basado en una red de aprendizaje". Applied Optics . 30 (29): 4211– 4217. Bibcode : 1991ApOpt..30.4211Z . doi : 10.1364/AO.30.004211 . PMID 20706526 . 
  63. Zhang, Wei (1994). "Detección computarizada de microcalcificaciones agrupadas en mamografías digitales mediante una red neuronal artificial invariante a la traslación". Física Médica . 21 (4): 517– 24. Bibcode : 1994MedPh..21..517Z . doi : 10.1118/1.597177 . PMID 8058017 . 
  64. LeCun, Yann; Léon Bottou; Yoshua Bengio; Patrick Haffner (1998). "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos" (PDF) . Actas del IEEE . 86 (11): 2278– 2324. Bibcode : 1998IEEEP..86.2278L . doi : 10.1109/5.726791 .
  65. Jordan, Michael I. (1986). "Dinámica de atractores y paralelismo en una máquina secuencial conexionista" . Actas de la Reunión Anual de la Sociedad de Ciencias Cognitivas . 8 .
  66. Elman, Jeffrey L. (marzo de 1990). "Encontrando estructura en el tiempo". Cognitive Science . 14 (2): 179– 211. doi : 10.1207/s15516709cog1402_1 .
  67. 1 2 3 Schmidhuber, Jürgen (abril de 1991). "Neural Sequence Chunkers" (PDF) . TR FKI-148, TU Munich .
  68. 1 2 Schmidhuber, Jürgen (marzo de 1992). "Aprendizaje de secuencias complejas y extendidas mediante el principio de compresión de historial". Neural Computation . 4 (2): 234– 242. Bibcode : 1992NeCom...4..234S . doi : 10.1162/neco.1992.4.2.234 .
  69. Schmidhuber, Jürgen (1993). Tesis de habilitación: Modelado y optimización de sistemas (PDF) . Archivado del original (PDF) el 16 de mayo de 2022.En la página 150 y siguientes se muestra la asignación de créditos a través del equivalente a 1200 capas en una RNN desplegada.
  70. 1 2 3 S. Hochreiter., " Untersuchungen zu dynamischen neuronalen Netzen ". Archivado el 6 de marzo de 2015 en Wayback Machine . Tesis de diploma. Instituto f. Informática, Universidad Técnica. Munich. Asesor: J. Schmidhuber , 1991.
  71. Hochreiter, S.; et al. (15 de enero de 2001). «Flujo de gradiente en redes recurrentes: la dificultad de aprender dependencias a largo plazo» . En Kolen, John F.; Kremer, Stefan C. (eds.). Guía práctica de redes recurrentes dinámicas . John Wiley & Sons. ISBN  978-0-7803-5369-5.
  72. Sepp Hochreiter ; Jürgen Schmidhuber (21 de agosto de 1995), Memoria a largo plazo , Wikidata Q98967430 
  73. Gers, Felix; Schmidhuber, Jürgen; Cummins, Fred (1999). «Aprender a olvidar: predicción continua con LSTM». 9.ª Conferencia Internacional sobre Redes Neuronales Artificiales: ICANN '99 . Vol. 1999. pp. 850–855 . doi : 10.1049/cp:19991218 . ISBN   0-85296-721-7.
  74. 1 2 Schmidhuber, Juergen (1991). "Una posibilidad para implementar la curiosidad y el aburrimiento en la construcción de modelos de controladores neuronales" . De los animales a los animats . págs. 222–228 . doi : 10.7551/mitpress/3115.003.0030 . ISBN  978-0-262-25667-4.
  75. Schmidhuber, Jürgen (2010). "Teoría formal de la creatividad, la diversión y la motivación intrínseca (1990-2010)". IEEE Transactions on Autonomous Mental Development . 2 (3): 230– 247. Bibcode : 2010ITAMD...2..230S . doi : 10.1109/TAMD.2010.2056368 .
  76. 1 2 Schmidhuber, Jürgen (2020). "Las redes generativas adversarias son casos especiales de curiosidad artificial (1990) y también están estrechamente relacionadas con la minimización de la predictibilidad (1991)". Redes neuronales . 127 : 58–66 . arXiv : 1906.04493 . doi : 10.1016/j.neunet.2020.04.008 . PMID 32334341 . 
  77. Ackley, D; Hinton, G; Sejnowski, T (marzo de 1985). "Un algoritmo de aprendizaje para máquinas de Boltzmann". Cognitive Science . 9 (1): 147– 169. doi : 10.1016/S0364-0213(85)80012-4 .
  78. Smolensky, Paul (1986). «Capítulo 6: Procesamiento de la información en sistemas dinámicos: Fundamentos de la teoría de la armonía» (PDF) . En Rumelhart, David E.; McLelland, James L. (eds.). Procesamiento distribuido en paralelo: Exploraciones en la microestructura de la cognición, Volumen 1: Fundamentos . MIT Press. pp. 194–281 . ISBN  0-262-68053-X.
  79. Peter, Dayan ; Hinton, Geoffrey E .; Neal, Radford M .; Zemel, Richard S. (1995). "La máquina de Helmholtz". Neural Computation . 7 (5): 889– 904. doi : 10.1162/neco.1995.7.5.889 . hdl : 21.11116/0000-0002-D6D3-E . PMID 7584891 . Icono de acceso cerrado
  80. Hinton, Geoffrey E. ; Dayan, Peter ; Frey, Brendan J. ; Neal, Radford (1995-05-26). "El algoritmo de vigilia-sueño para redes neuronales no supervisadas". Science . 268 (5214): 1158– 1161. Bibcode : 1995Sci...268.1158H . doi : 10.1126/science.7761831 . PMID 7761831 . 
  81. Sejnowski, Terrence J. (2018). La revolución del aprendizaje profundo . Cambridge, Massachusetts: The MIT Press . ISBN 978-0-262-03803-4.
  82. Qian, Ning; Sejnowski, Terrence J. (1988-08-20). "Predicción de la estructura secundaria de proteínas globulares mediante modelos de redes neuronales". Journal of Molecular Biology . 202 (4): 865– 884. Bibcode : 1988JMBio.202..865Q . doi : 10.1016/0022-2836(88)90564-5 . ISSN 0022-2836 . PMID 3172241 .  
  83. Morgan, Nelson; Bourlard, Hervé; Renals, Steve; Cohen, Michael; Franco, Horacio (1 de agosto de 1993). "Sistemas híbridos de redes neuronales/modelos ocultos de Markov para el reconocimiento continuo del habla". International Journal of Pattern Recognition and Artificial Intelligence . 07 (4): 899– 916. doi : 10.1142/s0218001493000455 . ISSN 0218-0014 . 
  84. Robinson, T. (1992). "Un sistema de reconocimiento de palabras basado en una red de propagación de errores recurrente en tiempo real". [ Actas ] ICASSP-92: Conferencia Internacional IEEE de 1992 sobre Acústica, Habla y Procesamiento de Señales . págs. 617-620 vol. 1. doi : 10.1109/ICASSP.1992.225833 . ISBN  0-7803-0532-9.
  85. Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, KJ (marzo de 1989). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal". IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. Bibcode : 1989ITASS..37..328W . doi : 10.1109/29.21701 . hdl : 10338.dmlcz/135496 .
  86. Baker, J.; Deng, Li; Glass, Jim; Khudanpur, S.; Lee, C.-H.; Morgan, N.; O'Shaughnessy, D. (2009). "Desarrollos y direcciones de la investigación en reconocimiento y comprensión del habla, parte 1". IEEE Signal Processing Magazine . 26 (3): 75– 80. Bibcode : 2009ISPM...26...75B . doi : 10.1109/msp.2009.932166 . hdl : 1721.1/51891 .
  87. Bengio, Y. (1991). "Redes neuronales artificiales y su aplicación al reconocimiento de voz/secuencia" . Tesis doctoral de la Universidad McGill. Archivado del original el 9 de mayo de 2021. Consultado el 12 de junio de 2017 .
  88. Deng, L.; Hassanein, K.; Elmasry, M. (1994). "Análisis de la estructura de correlación para un modelo predictivo neuronal con aplicaciones al reconocimiento de voz". Redes neuronales . 7 (2): 331– 339. doi : 10.1016/0893-6080(94)90027-2 .
  89. Doddington, G.; Przybocki, M.; Martin, A.; Reynolds, D. (2000). "La evaluación del reconocimiento de locutores del NIST ± Descripción general, metodología, sistemas, resultados, perspectiva". Speech Communication . 31 (2): 225– 254. doi : 10.1016/S0167-6393(99)00080-1 .
  90. 1 2 Heck, L.; Konig, Y.; Sonmez, M.; Weintraub, M. (2000). "Robustez ante la distorsión del auricular telefónico en el reconocimiento de locutores mediante el diseño de características discriminativas". Speech Communication . 31 (2): 181– 192. doi : 10.1016/s0167-6393(99)00077-1 .
  91. LP Heck y R. Teunen. "Transacciones seguras y convenientes con Nuance Verifier". Conferencia de Usuarios de Nuance, abril de 1998.
  92. "Modelado acústico con redes neuronales profundas utilizando señales de tiempo sin procesar para LVCSR (descarga en PDF disponible)" . ResearchGate . Archivado del original el 9 de mayo de 2021. Recuperado el 14 de junio de 2017 .
  93. 1 2 Graves, Alex; Eck, Douglas; Beringer, Nicole; Schmidhuber, Jürgen (2003). "Reconocimiento de voz biológicamente plausible con redes neuronales LSTM" (PDF) . 1er Taller Internacional sobre Enfoques de Inspiración Biológica para la Tecnología Avanzada de la Información, Bio-ADIT 2004, Lausana, Suiza . págs. 175–184 . Archivado del original (PDF) el 6 de julio de 2017. Recuperado el 9 de abril de 2016 . 
  94. Graves, Alex; Fernández, Santiago; Gomez, Faustino; Schmidhuber, Jürgen (2006). "Clasificación temporal conexionista: Etiquetado de datos de secuencias no segmentadas con redes neuronales recurrentes". Actas de la 23.ª conferencia internacional sobre aprendizaje automático - ICML '06 . pp. 369–376 . doi : 10.1145/1143844.1143891 . ISBN  1-59593-383-2.
  95. Fernández, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "Una aplicación de redes neuronales recurrentes para la detección discriminativa de palabras clave" . Redes neuronales artificiales – ICANN 2007. Lecture Notes in Computer Science. Vol. 4669. pp. 220–229 . doi : 10.1007/978-3-540-74695-9_23 . ISBN   978-3-540-74693-5.
  96. Graves, Alex; Schmidhuber, Jürgen (2008). "Reconocimiento de escritura a mano fuera de línea con redes neuronales recurrentes multidimensionales" . Avances en sistemas de procesamiento de información neuronal . 21 .
  97. 1 2 3 Hinton, Geoffrey E. (octubre de 2007). "Aprendizaje de múltiples capas de representación". Trends in Cognitive Sciences . 11 (10): 428– 434. doi : 10.1016/j.tics.2007.09.004 . PMID 17921042 . 
  98. Hinton, Geoffrey E.; Osindero, Simon; Teh, Yee-Whye (julio de 2006). "Un algoritmo de aprendizaje rápido para redes neuronales profundas". Neural Computation . 18 (7): 1527– 1554. doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513 . 
  99. Hinton, Geoffrey E.; Osindero, Simon; Teh, Yee-Whye (julio de 2006). "Un algoritmo de aprendizaje rápido para redes neuronales profundas". Neural Computation . 18 (7): 1527– 1554. doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513 . 
  100. Hinton, Geoffrey (2009). "Redes de creencias profundas" . Scholarpedia . 4 (5): 5947. Bibcode : 2009SchpJ...4.5947H . doi : 10.4249/scholarpedia.5947 .
  101. LeCun, Yann (24 de marzo de 2016). Aprendizaje profundo y el futuro de la IA . Coloquio del CERN .
  102. 1 2 3 Hinton, Geoffrey; Deng, Li; Yu, Dong; Dahl, George; Mohamed, Abdel-rahman; Jaitly, Navdeep; Senior, Andrew; Vanhoucke, Vincent; Nguyen, Patrick; Sainath, Tara; Kingsbury, Brian (noviembre de 2012). "Redes neuronales profundas para el modelado acústico en el reconocimiento del habla: las perspectivas compartidas de cuatro grupos de investigación". IEEE Signal Processing Magazine . 29 (6): 82– 97. Bibcode : 2012ISPM...29...82H . doi : 10.1109/msp.2012.2205597 .
  103. 1 2 3 Deng, Li; Hinton, Geoffrey; Kingsbury, Brian (2013). "Nuevos tipos de aprendizaje de redes neuronales profundas para el reconocimiento de voz y aplicaciones relacionadas: una visión general". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 8599– 8603. doi : 10.1109/ICASSP.2013.6639344 . ISBN  978-1-4799-0356-6.
  104. 1 2 3 Yu, Dong; Deng, Li (2015). Reconocimiento automático del habla . Signals and Communication Technology. doi : 10.1007/978-1-4471-5779-3 . ISBN 978-1-4471-5778-6.
  105. "Deng recibe el prestigioso premio IEEE Technical Achievement Award - Microsoft Research" . Microsoft Research . 3 de diciembre de 2015. Archivado del original el 16 de marzo de 2018. Consultado el 16 de marzo de 2018 .
  106. 1 2 Li, Deng (septiembre de 2014). "Discurso principal: 'Logros y desafíos del aprendizaje profundo: del análisis y reconocimiento del habla al procesamiento del lenguaje y multimodal'"" . Interspeech . Archivado del original el 26-09-2017 . Recuperado el 12-06-2017 .
  107. Yu, D.; Deng, L. (2010). "Roles of Pre-Training and Fine-Tuning in Context-Dependent DBN-HMMs for Real-World Speech Recognition" . NIPS Workshop on Deep Learning and Unsupervised Feature Learning . Archivado del original el 12 de octubre de 2017. Recuperado el 14 de junio de 2017 .
  108. Seide, Frank; Li, Gang; Yu, Dong (2011). "Transcripción de habla conversacional mediante redes neuronales profundas dependientes del contexto". Interspeech 2011. pp. 437–440 . doi : 10.21437/Interspeech.2011-169 . 
  109. Deng, Li; Li, Jinyu; Huang, Jui-Ting; Yao, Kaisheng; Yu, Dong; Seide, Frank; Seltzer, Michael; Zweig, Geoff; He, Xiaodong; Williams, Jason; Gong, Yifan; Acero, Alex (2013). "Avances recientes en aprendizaje profundo para la investigación del habla en Microsoft". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 8604–8608 . doi : 10.1109/ICASSP.2013.6639345 . ISBN  978-1-4799-0356-6.
  110. 1 2 Oh, K.-S.; Jung, K. (2004). "Implementación de redes neuronales en GPU". Pattern Recognition . 37 (6): 1311– 1314. Bibcode : 2004PatRe..37.1311O . doi : 10.1016/j.patcog.2004.01.013 .
  111. 1 2 Chellapilla, Kumar; Puri, Sidd; Simard, Patrice (2006), Redes neuronales convolucionales de alto rendimiento para el procesamiento de documentos , archivado del original el 18-05-2020 , recuperado el 14-02-2021
  112. Sze, Vivienne ; Chen, Yu-Hsin; Yang, Tien-Ju; Emer, Joel (2017). "Procesamiento eficiente de redes neuronales profundas: un tutorial y una revisión". arXiv : 1703.09039 [ cs.CV ].
  113. Raina, Rajat; Madhavan, Anand; Ng, Andrew Y. (2009). «Aprendizaje profundo no supervisado a gran escala mediante procesadores gráficos». Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático . págs. 873–880 . doi : 10.1145/1553374.1553486 . ISBN  978-1-60558-516-1.
  114. Cireşan, Dan Claudiu; Meier, Ueli; Gambardella, Luca Maria; Schmidhuber, Jürgen (21 de septiembre de 2010). "Redes neuronales profundas, grandes y simples para el reconocimiento de dígitos escritos a mano". Neural Computation . 22 (12): 3207– 3220. arXiv : 1003.0358 . Bibcode : 2010NeCom..22.3207C . doi : 10.1162/neco_a_00052 . PMID 20858131 . 
  115. . doi : 10.5591/978-1-57735-516-8/ijcai11-210 .{{cite journal}}: Se requiere citar la revista |journal=( ayuda ) ; Falta o está vacío |title=( ayuda )
  116. Ciresan, Dan; Giusti, Alessandro; Gambardella, Luca M.; Schmidhuber, Jürgen (2012). Pereira, F.; Burges, CJC; Bottou, L.; Weinberger, KQ (eds.). Advances in Neural Information Processing Systems 25 (PDF) . Curran Associates, Inc. pp. 2843–2851 . Archivado (PDF) del original el 9 de agosto de 2017. Recuperado el 13 de junio de 2017 . 
  117. Ciresan, D.; Giusti, A.; Gambardella, LM; Schmidhuber, J. (2013). "Detección de mitosis en imágenes histológicas de cáncer de mama con redes neuronales profundas". Medical Image Computing and Computer-Assisted Intervention – MICCAI 2013. Lecture Notes in Computer Science. Vol. 7908. pp. 411–418 . doi : 10.1007/978-3-642-40763-5_51 . ISBN   978-3-642-38708-1. PMID 24579167 . 
  118. Ng, Andrew; Dean, Jeff (2012). "Building High-level Features Using Large Scale Unsupervised Learning". arXiv : 1112.6209 [ cs.LG ].
  119. Simonyan, Karen; Andrew, Zisserman (2014). "Redes neuronales convolucionales muy profundas para el reconocimiento de imágenes a gran escala". arXiv : 1409.1556 [ cs.CV ].
  120. Szegedy, Christian (2015). "Profundizando con convoluciones" (PDF) . Cvpr2015 . arXiv : 1409.4842 .
  121. Vinyals, Oriol; Toshev, Alexander; Bengio, Samy; Erhan, Dumitru (2014). "Show and Tell: A Neural Image Caption Generator". arXiv : 1411.4555 [ cs.CV ]..
  122. Fang, Hao; Gupta, Saurabh; Iandola, Forrest; Srivastava, Rupesh; Deng, Li; Dollár, Piotr; Gao, Jianfeng; He, Xiaodong; Mitchell, Margaret; Platt, John C; Lawrence Zitnick, C; Zweig, Geoffrey (2014). "From Captions to Visual Concepts and Back". arXiv : 1411.4952 [ cs.CV ]..
  123. Kiros, Ryan; Salakhutdinov, Ruslan; Zemel, Richard S (2014). "Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models". arXiv : 1411.2539 [ cs.LG ]..
  124. Simonyan, Karen; Zisserman, Andrew (2014). "Redes neuronales convolucionales muy profundas para el reconocimiento de imágenes a gran escala". arXiv : 1409.1556 [ cs.CV ].
  125. He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Profundizando en los rectificadores: superando el rendimiento a nivel humano en la clasificación de ImageNet". arXiv : 1502.01852 [ cs.CV ].
  126. 1 2 He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Aprendizaje residual profundo para el reconocimiento de imágenes". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 770–778 . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 . ISBN  978-1-4673-8851-1.
  127. Gatys, Leon A.; Ecker, Alexander S.; Bethge, Matthias (26 de agosto de 2015). "Un algoritmo neuronal de estilo artístico". arXiv : 1508.06576 [ cs.CV ].
  128. Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). Generative Adversarial Networks (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 . Archivado (PDF) del original el 22 de noviembre de 2019. Recuperado el 20 de agosto de 2019 . 
  129. "GAN 2.0: Generador de rostros hiperrealistas de NVIDIA" . SyncedReview.com . 14 de diciembre de 2018. Consultado el 3 de octubre de 2019 .
  130. Karras, T.; Aila, T.; Laine, S.; Lehtinen, J. (26 de febrero de 2018). "Crecimiento progresivo de GANs para mejorar la calidad, la estabilidad y la variación". arXiv : 1710.10196 [ cs.NE ].
  131. "Prepárense, no se asusten: Medios sintéticos y deepfakes" . witness.org. Archivado del original el 2 de diciembre de 2020. Consultado el 25 de noviembre de 2020 .
  132. Sohl-Dickstein, Jascha; Weiss, Eric; Maheswaranathan, Niru; Ganguli, Surya (2015-06-01). "Aprendizaje profundo no supervisado utilizando termodinámica de no equilibrio" (PDF) . Actas de la 32.ª Conferencia Internacional sobre Aprendizaje Automático . 37. PMLR: 2256–2265 . arXiv : 1503.03585 .
  133. Blog de investigación de Google. Las redes neuronales detrás de la transcripción de Google Voice. 11 de agosto de 2015. Por Françoise Beaufays http://googleresearch.blogspot.co.at/2015/08/the-neural-networks-behind-google-voice.html
  134. 1 2 Sak, Haşim; Senior, Andrew; Rao, Kanishka; Beaufays, Françoise; Schalkwyk, Johan (septiembre de 2015). "Búsqueda por voz de Google: más rápida y precisa" . Archivado del original el 9 de marzo de 2016. Recuperado el 9 de abril de 2016 .
  135. Singh, Premjeet; Saha, Goutam; Sahidullah, Md (2021). "Deformación de frecuencia no lineal mediante transformación Q constante para el reconocimiento de emociones en el habla". Conferencia Internacional de Comunicación e Informática Informática (ICCCI) de 2021. pp. 1–4 . arXiv : 2102.04029 . doi : 10.1109/ICCCI50826.2021.9402569 . ISBN  978-1-7281-5875-4.
  136. Sak, Haşim; Senior, Andrew; Beaufays, Françoise (2014). "Arquitecturas de redes neuronales recurrentes basadas en memoria a corto y largo plazo para el reconocimiento de voz con vocabulario extenso". arXiv : 1402.1128 [ cs.NE ].
  137. Li, Xiangang; Wu, Xihong (2014). "Construcción de redes neuronales recurrentes profundas basadas en memoria a corto y largo plazo para el reconocimiento de voz con vocabulario extenso". arXiv : 1410.4281 [ cs.CL ].
  138. Zen, Heiga; Sak, Hasim (2015). "Red neuronal recurrente de memoria a corto y largo plazo unidireccional con capa de salida recurrente para síntesis de voz de baja latencia". 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . pp. 4470–4474 . doi : 10.1109/ICASSP.2015.7178816 . ISBN  978-1-4673-6997-8.
  139. "Ganadores del premio ACM AM Turing 2018" . awards.acm.org . Consultado el 7 de agosto de 2024 .
  140. Ferrie, C., & Kaiser, S. (2019). Redes neuronales para bebés . Sourcebooks. ISBN 978-1-4926-7120-6.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  141. Silver, David; Huang, Aja; Maddison, Chris J.; Guez, Arthur; Sifre, Laurent; Driessche, George van den; Schrittwieser, Julian; Antonoglou, Ioannis; Panneershelvam, Veda (enero de 2016). "Dominando el juego de Go con redes neuronales profundas y búsqueda en árbol". Nature . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038/nature16961 . ISSN 1476-4687 . PMID 26819042 .  
  142. Guía de aprendizaje profundo y redes neuronales , archivada del original el 2 de noviembre de 2020 , consultada el 16 de noviembre de 2020.
  143. 1 2 Kumar, Nishant; Raubal, Martin (2021). "Aplicaciones del aprendizaje profundo en la detección, predicción y alivio de la congestión: una revisión" . Transportation Research Part C: Emerging Technologies . 133 103432. arXiv : 2102.09759 . Bibcode : 2021TRPC..13303432K . doi : 10.1016/j.trc.2021.103432 . hdl : 10230/42143 .
  144. Szegedy, Christian; Toshev, Alexander; Erhan, Dumitru (2013). "Redes neuronales profundas para la detección de objetos" . Advances in Neural Information Processing Systems : 2553–2561 . Archivado del original el 29 de junio de 2017. Consultado el 13 de junio de 2017 .
  145. Rolnick, David; Tegmark, Max (2018). "El poder de las redes más profundas para expresar funciones naturales" . Conferencia Internacional sobre Representaciones de Aprendizaje . ICLR 2018. Archivado del original el 7 de enero de 2021. Recuperado el 5 de enero de 2021 .
  146. Hof, Robert D. "¿Está la inteligencia artificial finalmente alcanzando su máximo potencial?" . MIT Technology Review . Archivado del original el 31 de marzo de 2019 . Consultado el 10 de julio de 2018 .
  147. 1 2 Gers, FA; Schmidhuber, E. (noviembre de 2001). "Las redes recurrentes LSTM aprenden lenguajes simples, libres de contexto y sensibles al contexto". IEEE Transactions on Neural Networks . 12 (6): 1333– 1340. Bibcode : 2001ITNN...12.1333G . doi : 10.1109/72.963769 . PMID 18249962 . 
  148. 1 2 3 Sutskever, L.; Vinyals, O.; Le, Q. (2014). "Aprendizaje secuencia a secuencia con redes neuronales" (PDF) . Proc. NIPS . arXiv : 1409.3215 . Bibcode : 2014arXiv1409.3215S . Archivado (PDF) del original el 09-05-2021 . Recuperado el 13-06-2017 .
  149. 1 2 Jozefowicz, Rafal; Vinyals, Oriol; Schuster, Mike; Shazeer, Noam; Wu, Yonghui (2016). "Explorando los límites del modelado del lenguaje". arXiv : 1602.02410 [ cs.CL ].
  150. 1 2 Gillick, Dan; Brunk, Cliff; Vinyals, Oriol; Subramanya, Amarnag (2015). "Procesamiento de lenguaje multilingüe a partir de bytes". arXiv : 1512.00103 [ cs.CL ].
  151. Mikolov, Tomáš; Karafiát, Martín; Burget, Lukáš; Černocký, Jan; Khudanpur, Sanjeev (2010). "Modelo de lenguaje basado en redes neuronales recurrentes". Entre discursos 2010 . págs. 1045–1048 . doi : 10.21437/Interspeech.2010-343 . 
  152. Hochreiter, Sepp; Schmidhuber, Jürgen (1 de noviembre de 1997). "Memoria a largo plazo". Computación neuronal . 9 (8): 1735–1780 . doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . 
  153. 1 2 Gers, Felix A.; Schraudolph, Nicol N.; Schmidhuber, Jürgen (2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" . Journal of Machine Learning Research . 3 (agosto): 115–143 .
  154. LeCun, Y.; et al. (1998). "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos" . Actas del IEEE . 86 (11): 2278– 2324. Bibcode : 1998IEEEP..86.2278L . doi : 10.1109/5.726791 . 
  155. Sainath, Tara N.; Mohamed, Abdel-Rahman; Kingsbury, Brian; Ramabhadran, Bhuvana (2013). "Redes neuronales convolucionales profundas para LVCSR". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 8614–8618 . doi : 10.1109/icassp.2013.6639347 . ISBN  978-1-4799-0356-6.
  156. Bengio, Yoshua; Boulanger-Lewandowski, Nicolas; Pascanu, Razvan (2013). "Avances en la optimización de redes recurrentes". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 8624–8628 . doi : 10.1109/icassp.2013.6639349 . ISBN  978-1-4799-0356-6.
  157. Dahl, G.; et al. (2013). "Mejora de las DNN para LVCSR mediante unidades lineales rectificadas y abandono" (PDF) . ICASSP . Archivado (PDF) del original el 12 de agosto de 2017. Recuperado el 13 de junio de 2017 . 
  158. Kumar, Nishant; Martin, Henry; Raubal, Martin (2024). "Mejora de los sistemas de predicción de tráfico urbano basados ​​en aprendizaje profundo mediante análisis de complejidad" . Data Science for Transportation . 6 (3) 24. doi : 10.1007/s42421-024-00109-x . hdl : 20.500.11850/695425 .
  159. "Aumento de datos - deeplearning.ai | Coursera" . Coursera . Archivado del original el 1 de diciembre de 2017. Consultado el 30 de noviembre de 2017 .
  160. Hinton, GE (2010). "Una guía práctica para el entrenamiento de máquinas de Boltzmann restringidas" . Informe técnico UTML TR 2010-003 . Archivado del original el 9 de mayo de 2021. Consultado el 13 de junio de 2017 .
  161. You, Yang; Buluç, Aydın; Demmel, James (2017). "Escalando el aprendizaje profundo en clústeres GPU y Knights Landing". Actas de la Conferencia Internacional de Computación de Alto Rendimiento, Redes, Almacenamiento y Análisis . págs. 1–12 . arXiv : 1708.02983 . doi : 10.1145/3126908.3126912 . ISBN  978-1-4503-5114-0.
  162. Viebke, André; Memeti, Suejb; Pllana, Sabri; Abraham, Ajith (2019). "CHAOS: un esquema de paralelización para entrenar redes neuronales convolucionales en Intel Xeon Phi". The Journal of Supercomputing . 75 : 197–227 . arXiv : 1702.07908 . Bibcode : 2017arXiv170207908V . doi : 10.1007/s11227-017-1994-x .
  163. Ting Qin, et al. "Un algoritmo de aprendizaje de CMAC basado en RLS". Neural Processing Letters 19.1 (2004): 49-61.
  164. Ting Qin, et al. " CMAC-QRLS continuo y su matriz sistólica ". Archivado el 18 de noviembre de 2018 en Wayback Machine . Neural Processing Letters 22.1 (2005): 1-16.
  165. Investigación, IA (23 de octubre de 2015). "Redes neuronales profundas para el modelado acústico en el reconocimiento de voz" . airesearch.com . Archivado del original el 1 de febrero de 2016. Recuperado el 23 de octubre de 2015 .
  166. "GPUs Continue to Dominate the AI Accelerator Market for Now". InformationWeek. December 2019. Archived from the original on 10 June 2020. Retrieved 11 June 2020.
  167. Ray, Tiernan (2019). "AI is changing the entire nature of computation". ZDNet. Archived from the original on 25 May 2020. Retrieved 11 June 2020.
  168. "AI and Compute". OpenAI. 16 May 2018. Archived from the original on 17 June 2020. Retrieved 11 June 2020.
  169. "HUAWEI Reveals the Future of Mobile AI at IFA 2017 | HUAWEI Latest News | HUAWEI Global". consumer.huawei.com. Archived from the original on 2021-11-10. Retrieved 2022-08-03.
  170. P, JouppiNorman; YoungCliff; PatilNishant; PattersonDavid; AgrawalGaurav; BajwaRaminder; BatesSarah; BhatiaSuresh; BodenNan; BorchersAl; BoyleRick (2017-06-24). "In-Datacenter Performance Analysis of a Tensor Processing Unit". ACM SIGARCH Computer Architecture News. 45 (2): 1–12. arXiv:1704.04760. doi:10.1145/3140659.3080246.
  171. Woodie, Alex (2021-11-01). "Cerebras Hits the Accelerator for Deep Learning Workloads". Datanami. Retrieved 2022-08-03.
  172. "Cerebras launches new AI supercomputing processor with 2.6 trillion transistors". VentureBeat. 2021-04-20. Archived from the original on 2024-09-17. Retrieved 2022-08-03.
  173. Marega, Guilherme Migliato; Zhao, Yanfei; Avsar, Ahmet; Wang, Zhenyu; Tripati, Mukesh; Radenovic, Aleksandra; Kis, Anras (2020). "Logic-in-memory based on an atomically thin semiconductor". Nature. 587 (2): 72–77. Bibcode:2020Natur.587...72M. doi:10.1038/s41586-020-2861-0. PMC 7116757. PMID 33149289.
  174. 1 2 3 Feldmann, J.; Youngblood, N.; Karpov, M.; et al. (2021). "Procesamiento convolucional paralelo mediante un tensor fotónico integrado". Nature . 589 (2): 52– 58. arXiv : 2002.00281 . doi : 10.1038/s41586-020-03070-1 . PMID 33408373 .  
  175. Garofolo, JS; Lamel, LF; Fisher, WM; Fiscus, JG; Pallett, DS; Dahlgren, NL; Zue, V. (1993). Corpus de habla continua acústico-fonética TIMIT . Linguistic Data Consortium. doi : 10.35111/17gk-bn40 . ISBN 1-58563-019-5. Consultado el 27 de diciembre de 2023 .
  176. Robinson, Tony (30 de septiembre de 1991). "Varias mejoras a un sistema de reconocimiento telefónico de red de propagación de errores recurrentes". Informe técnico del Departamento de Ingeniería de la Universidad de Cambridge . CUED/F-INFENG/TR82. doi : 10.13140/RG.2.2.15418.90567 .
  177. Abdel-Hamid, Ossama; Mohamed, Abdel-rahman; Jiang, Hui; Deng, Li; Penn, Gerald; Yu, Dong (octubre de 2014). "Redes neuronales convolucionales para el reconocimiento de voz". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 22 (10): 1533– 1545. Bibcode : 2014ITASL..22.1533A . doi : 10.1109/taslp.2014.2339736 .
  178. Deng, L.; Platt, J. (2014). "Ensemble Deep Learning for Speech Recognition". Proc. Interspeech : 1915– 1919. doi : 10.21437/Interspeech.2014-433 .
  179. Tóth, László (diciembre de 2015). "Reconocimiento de fonemas con redes jerárquicas convolucionales profundas maxout" . EURASIP Journal on Audio, Speech, and Music Processing . 2015 (1) 25. doi : 10.1186/s13636-015-0068-3 .
  180. Aaron van den Oord; Dieleman, Sander; Zen, Heiga; Simonyan, Karen; Vinyals, Oriol; Tumbas, Alex; Kalchbrenner, Nal; Mayor, Andrés; Kavukcuoglu, Koray (2016). "WaveNet: un modelo generativo para audio sin formato". arXiv : 1609.03499 [ cs.SD ].
  181. "WaveNet: Un modelo generativo para audio sin procesar" . Google DeepMind . 8 de septiembre de 2016. Consultado el 31 de julio de 2025 .
  182. ^ Latif, Siddique; Zaidi, Aun; Cuayahuitl, Heriberto; Shamshad, Fahad; Shoukat, Moazzam; Usamá, Mahoma; Qadir, Junaid (2023). "Transformadores en el procesamiento del habla: una encuesta". arXiv : 2303.11607 [ cs.CL ].
  183. McMillan, Robert (17 de diciembre de 2014). "Cómo Skype utilizó la IA para crear su increíble traductor de idiomas | WIRED" . Wired . Archivado del original el 8 de junio de 2017. Consultado el 14 de junio de 2017 .
  184. ^ Hannun, Awni; Caso, Carl; Casper, Jared; Catanzaro, Bryan; Diamos, Greg; Elsen, Erich; Prenger, Ryan; Satheesh, Sanjeev; Sengupta, Shubho; Coates, Adán; Ng, Andrew Y (2014). "Deep Speech: ampliación del reconocimiento de voz de un extremo a otro". arXiv : 1412.5567 [ cs.CL ].
  185. "Base de datos de dígitos manuscritos MNIST, Yann LeCun, Corinna Cortes y Chris Burges" . yann.lecun.com . Archivado del original el 13 de enero de 2014. Consultado el 28 de enero de 2014 .
  186. Cireşan, Dan; Meier, Ueli; Masci, Jonathan; Schmidhuber, Jürgen (agosto de 2012). "Red neuronal profunda de múltiples columnas para la clasificación de señales de tráfico". Redes neuronales . 32 : 333–338 . doi : 10.1016/j.neunet.2012.02.023 . PMID 22386783 . 
  187. Chaochao Lu; Xiaoou Tang (2014). "Superando el reconocimiento facial a nivel humano". arXiv : 1404.3840 [ cs.CV ].
  188. Nvidia presenta una computadora para automóviles entrenada con "aprendizaje profundo" (6 de enero de 2015), David Talbot, MIT Technology Review
  189. 1 2 3 G. W. Smith; Frederic Fol Leymarie (10 de abril de 2017). "La máquina como artista: una introducción" . Arts . 6 (4): 5. doi : 10.3390/arts6020005 .
  190. 1 2 3 Blaise Agüera y Arcas (29 de septiembre de 2017). "El arte en la era de la inteligencia artificial" . Arts . 6 (4): 18. doi : 10.3390/arts6040018 .
  191. Goldberg, Yoav; Levy, Omar (2014). "word2vec explicado: derivación del método de incrustación de palabras de muestreo negativo de Mikolov et al.". arXiv : 1402.3722 [ cs.CL ].
  192. 1 2 Socher, Richard; Manning, Christopher. "Aprendizaje profundo para PLN" (PDF) . Archivado (PDF) del original el 6 de julio de 2014. Recuperado el 26 de octubre de 2014 .
  193. Socher, Richard; Bauer, John; Manning, Christopher; Ng, Andrew (2013). "Análisis sintáctico con gramáticas vectoriales composicionales" (PDF) . Actas de la Conferencia ACL 2013. Archivado (PDF) del original el 27 de noviembre de 2014. Consultado el 3 de septiembre de 2014 .
  194. Socher, Richard; Perelygin, Alex; Wu, Jean; Chuang, Jason; Manning, Christopher D.; Ng, Andrew; Potts, Christopher (2013). "Modelos profundos recursivos para la composicionalidad semántica sobre un corpus de árboles de sentimiento". Actas de la Conferencia de 2013 sobre métodos empíricos en el procesamiento del lenguaje natural . págs. 1631–1642 . doi : 10.18653/v1/d13-1170 . 
  195. Shen, Yelong; He, Xiaodong; Gao, Jianfeng; Deng, Li; Mesnil, Gregoire (1 de noviembre de 2014). "Un modelo semántico latente con estructura de agrupación convolucional para la recuperación de información" . Microsoft Research . Archivado del original el 27 de octubre de 2017. Recuperado el 14 de junio de 2017 .
  196. Huang, Po-Sen; He, Xiaodong; Gao, Jianfeng; Deng, Li; Acero, Alex; Heck, Larry (1 de octubre de 2013). "Aprendizaje de modelos semánticos estructurados profundos para la búsqueda web utilizando datos de clics" . Microsoft Research . Archivado del original el 27 de octubre de 2017. Recuperado el 14 de junio de 2017 .
  197. Mesnil, G.; Dauphin, Y.; Yao, K.; Bengio, Y.; Deng, L.; Hakkani-Tur, D. ; He, X.; Heck, L.; Tur, G.; Yu, D.; Zweig, G. (2015). "Uso de redes neuronales recurrentes para el relleno de ranuras en la comprensión del lenguaje hablado". IEEE Transactions on Audio, Speech, and Language Processing . 23 (3): 530– 539. Bibcode : 2015ITASL..23..530M . doi : 10.1109/taslp.2014.2383614 .
  198. 1 2 Gao, Jianfeng; He, Xiaodong; Yih, Scott Wen-tau; Deng, Li (1 de junio de 2014). "Aprendizaje de representaciones de frases continuas para el modelado de traducción" . Microsoft Research . Archivado del original el 27 de octubre de 2017. Recuperado el 14 de junio de 2017 .
  199. Brocardo, Marcelo Luiz; Traore, Issa; Woungang, Isaac; Obaidat, Mohammad S. (2017). "Verificación de autoría mediante sistemas de redes de creencias profundas". International Journal of Communication Systems . 30 (12) e3259. doi : 10.1002/dac.3259 .
  200. Kariampuzha, William; Alyea, Gioconda; Qu, Sue; Sanjak, Jaleal; Mathé, Ewy; Sid, Eric; Chatelaine, Haley; Yadaw, Arjun; Xu, Yanji; Zhu, Qian (2023). "Extracción de información de precisión para la epidemiología de enfermedades raras a gran escala" . Journal of Translational Medicine . 21 (1): 157. doi : 10.1186/s12967-023-04011-y . PMC 9972634. PMID 36855134 .  
  201. "Aprendizaje profundo para el procesamiento del lenguaje natural: teoría y práctica (tutorial CIKM2014) - Microsoft Research" . Microsoft Research . Archivado del original el 13 de marzo de 2017. Consultado el 14 de junio de 2017 .
  202. Turovsky, Barak (15 de noviembre de 2016). "Encontrado en la traducción: oraciones más precisas y fluidas en Google Translate" . El blog de palabras clave de Google . Archivado del original el 7 de abril de 2017. Recuperado el 23 de marzo de 2017 .
  203. 1 2 3 4 Schuster, Mike; Johnson, Melvin; Thorat, Nikhil (22 de noviembre de 2016). "Traducción de cero disparos con el sistema de traducción automática neuronal multilingüe de Google" . Blog de investigación de Google . Archivado del original el 10 de julio de 2017. Recuperado el 23 de marzo de 2017 .
  204. Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin; Macherey, Klaus; Klingner, Jeff; Shah, Apurva; Johnson, Melvin; Liu, Xiaobing; Kaiser, Łukasz; Gouws, Stephan; Kato, Yoshikiyo; Kudo, Taku; Kazawa, Hideto; Stevens, Keith; Kurian, George; Patil, Nishant; Wang, Wei; Young, Cliff; Smith, Jason; Riesa, Jason; Rudnick, Alex; Vinyals, Oriol; Corrado, Greg; et al. (2016). "Sistema de traducción automática neuronal de Google: Cerrando la brecha entre la traducción humana y la automática". arXiv : 1609.08144 [ cs.CL ]. 
  205. Metz, Cade (27 de septiembre de 2016). "Una infusión de IA hace que Google Translate sea más potente que nunca" . Wired . Archivado del original el 8 de noviembre de 2020. Recuperado el 12 de octubre de 2017 .
  206. 1 2 Boitet, Christian; Blanchon, Hervé; Seligman, Mark; Bellynck, Valérie (2010). "MT en y para la Web" (PDF) . Archivado del original (PDF) el 29 de marzo de 2017. Recuperado el 1 de diciembre de 2016 .
  207. Arrowsmith, J; Miller, P (2013). "Vigilancia de ensayos clínicos: tasas de abandono de las fases II y III 2011-2012" . Nature Reviews Drug Discovery . 12 (8): 569. doi : 10.1038/nrd4090 . PMID 23903212 . 
  208. Verbist, B; Klambauer, G; Vervoort, L; Talloen, W; The Qstar, Consortium; Shkedy, Z; Thas, O; Bender, A; Göhlmann, HW; Hochreiter, S (2015). "Uso de la transcriptómica para guiar la optimización de compuestos líderes en proyectos de descubrimiento de fármacos: lecciones aprendidas del proyecto QSTAR" . Drug Discovery Today . 20 (5): 505– 513. doi : 10.1016/j.drudis.2014.12.014 . hdl : 1942/18723 . PMID 25582842 . 
  209. "Merck Molecular Activity Challenge" . kaggle.com . Archivado del original el 16 de julio de 2020. Consultado el 16 de julio de 2020 .
  210. ^ Dahl, George E.; Jaitly, Navdeep; Salakhutdinov, Ruslan (2014). "Redes neuronales multitarea para predicciones QSAR". arXiv : 1406.1231 [ estad.ML ].
  211. "Toxicología en el siglo XXI: El desafío de los datos"
  212. "NCATS anuncia a los ganadores del desafío de datos Tox21" . Archivado del original el 8 de septiembre de 2015. Consultado el 5 de marzo de 2015 .
  213. "NCATS anuncia a los ganadores del concurso de datos Tox21" . Archivado del original el 28 de febrero de 2015. Consultado el 5 de marzo de 2015 .
  214. Wallach, Izhar; Dzamba, Michael; Heifets, Abraham (9 de octubre de 2015). "AtomNet: una red neuronal convolucional profunda para la predicción de bioactividad en el descubrimiento de fármacos basado en la estructura". arXiv : 1510.02855 [ cs.LG ].
  215. 1 2 "Una startup de Toronto tiene una forma más rápida de descubrir medicamentos eficaces" . The Globe and Mail . Archivado del original el 20 de octubre de 2015. Consultado el 9 de noviembre de 2015 .
  216. "Empresa emergente utiliza supercomputadoras para buscar curas" . KQED Future of You . 27 de mayo de 2015. Archivado del original el 24 de diciembre de 2015. Consultado el 9 de noviembre de 2015 .
  217. Gilmer, Justin; Schoenholz, Samuel S.; Riley, Patrick F.; Vinyals, Oriol; Dahl, George E. (2017-06-12). "Paso de mensajes neuronales para la química cuántica". arXiv : 1704.01212 [ cs.LG ].
  218. Zhavoronkov, Alex (2019). "El aprendizaje profundo permite la identificación rápida de potentes inhibidores de la quinasa DDR1". Nature Biotechnology . 37 (9): 1038– 1040. doi : 10.1038/s41587-019-0224-x . PMID 31477924 . 
  219. Gregory, Barber. "Una molécula diseñada por IA exhibe cualidades 'similares a las de un fármaco'" . Wired . Archivado del original el 30 de abril de 2020. Consultado el 5 de septiembre de 2019 .
  220. ^ van den Oord, Aarón; Dieleman, Sander; Schrauwen, Benjamín (2013). "Recomendación musical profunda basada en contenido" . Avances en los sistemas de procesamiento de información neuronal . 26 .
  221. Feng, XY; Zhang, H.; Ren, YJ; Shang, PH; Zhu, Y.; Liang, YC; Guan, RC; Xu, D. (2019). "El sistema de recomendación basado en aprendizaje profundo "Pubmender" para elegir un lugar de publicación biomédica: estudio de desarrollo y validación" . Journal of Medical Internet Research . 21 (5) e12957. doi : 10.2196/12957 . PMC 6555124. PMID 31127715 .  
  222. Elkahky, Ali Mamdouh; Song, Yang; He, Xiaodong (1 de mayo de 2015). "Un enfoque de aprendizaje profundo multivista para el modelado de usuarios de dominio cruzado en sistemas de recomendación" . Microsoft Research . Archivado del original el 25 de enero de 2018. Recuperado el 14 de junio de 2017 .
  223. Chicco, Davide; Sadowski, Peter; Baldi, Pierre (2014). «Redes neuronales autoencoder profundas para predicciones de anotaciones de ontología genética». Actas de la 5.ª Conferencia ACM sobre Bioinformática, Biología Computacional e Informática de la Salud . págs. 533–540 . doi : 10.1145/2649387.2649442 . hdl : 11311/964622 . ISBN  978-1-4503-2894-4.
  224. Sathyanarayana, Aarti (1 de enero de 2016). "Predicción de la calidad del sueño a partir de datos de dispositivos portátiles mediante aprendizaje profundo" . JMIR mHealth and uHealth . 4 (4): e125. doi : 10.2196/mhealth.6562 . PMC 5116102. PMID 27815231 .  
  225. Choi, Edward; Schuetz, Andy; Stewart, Walter F.; Sun, Jimeng (13 de agosto de 2016). " Uso de modelos de redes neuronales recurrentes para la detección temprana del inicio de la insuficiencia cardíaca" . Journal of the American Medical Informatics Association . 24 (2): 361– 370. doi : 10.1093/jamia/ocw112 . ISSN 1067-5027 . PMC 5391725. PMID 27521897 .   
  226. "La IA de DeepMind para el plegamiento de proteínas ha resuelto un gran desafío de la biología de hace 50 años" . MIT Technology Review . Consultado el 10 de mayo de 2024 .
  227. Shead, Sam (30 de noviembre de 2020). "DeepMind resuelve un 'gran desafío' de 50 años con IA de plegamiento de proteínas" CNBC . Recuperado el 10 de mayo de 2024 .
  228. 1 2 Shalev, Yuval; Painsky, Amichai; Ben-Gal, Irad (abril de 2024). "Estimación conjunta de entropía neuronal". IEEE Transactions on Neural Networks and Learning Systems . 35 (4): 5488– 5500. arXiv : 2012.11197 . Bibcode : 2024ITNNL..35.5488S . doi : 10.1109/TNNLS.2022.3204919 . PMID 36155469 . 
  229. Litjens, Geert; Kooi, Thijs; Bejnordi, Babak Ehteshami; Setio, Arnaud Arindra Adiyoso; Ciompi, Francesco; Ghafoorian, Mohsen; van der Laak, Jeroen AWM; van Ginneken, Bram; Sánchez, Clara I. (diciembre 2017). "Una encuesta sobre aprendizaje profundo en el análisis de imágenes médicas". Análisis de Imágenes Médicas . 42 : 60–88 . arXiv : 1702.05747 . Código Bib : 2017arXiv170205747L . doi : 10.1016/j.media.2017.07.005 . PMID 28778026 . 
  230. Forslid, Gustav; Wieslander, Hakan; Bengtsson, Ewert; Wahlby, Carolina; Hirsch, Jan-Michael; Stark, Christina Runow; Sadanandan, Sajith Kecheril (2017). "Redes neuronales convolucionales profundas para la detección de cambios celulares debidos a malignidad" . 2017 IEEE International Conference on Computer Vision Workshops (ICCVW) . pp. 82–89 . doi : 10.1109/ICCVW.2017.18 . ISBN  978-1-5386-1034-3Archivado del original el 9 de mayo de 2021. Consultado el 12 de noviembre de 2019 .
  231. Dong, Xin; Zhou, Yizhao; Wang, Lantian; Peng, Jingfeng; Lou, Yanbo; Fan, Yiqun (2020). "Detección de cáncer de hígado mediante una red neuronal totalmente convolucional híbrida basada en un marco de aprendizaje profundo" . IEEE Access . 8 : 129889–129898 . Bibcode : 2020IEEEA...8l9889D . doi : 10.1109/ACCESS.2020.3006362 . ISSN 2169-3536 . 
  232. Lyakhov, Pavel Alekseevich; Lyakhova, Ulyana Alekseevna; Nagornov, Nikolay Nikolaevich (2022-04-03). "Sistema para el reconocimiento de lesiones cutáneas pigmentadas con fusión y análisis de datos heterogéneos basado en una red neuronal multimodal" . Cancers . 14 ( 7): 1819. doi : 10.3390/cancers14071819 . ISSN 2072-6694 . PMC 8997449. PMID 35406591 .   
  233. De, Shaunak; Maity, Abhishek; Goel, Vritti; Shitole, Sanjay; Bhattacharya, Avik (2017). "Predicción de la popularidad de las publicaciones de Instagram para una revista de estilo de vida mediante aprendizaje profundo". 2017 2.ª Conferencia Internacional sobre Sistemas de Comunicación, Computación y Aplicaciones de TI (CSCITA) . págs. 174–177 . doi : 10.1109/CSCITA.2017.8066548 . ISBN  978-1-5090-4381-1.
  234. "Coloreando y restaurando imágenes antiguas con aprendizaje profundo" . Blog de FloydHub . 13 de noviembre de 2018. Archivado del original el 11 de octubre de 2019. Consultado el 11 de octubre de 2019 .
  235. Schmidt, Uwe; Roth, Stefan. Campos de contracción para la restauración efectiva de imágenes (PDF) . Conferencia IEEE de 2014 sobre visión por computadora y reconocimiento de patrones (CVPR). Archivado (PDF) del original el 2 de enero de 2018. Consultado el 1 de enero de 2018 .
  236. Kleanthous, Christos; Chatzis, Sotirios (2020). "Autoencoders variacionales de mezcla con compuertas para la selección de casos de auditoría del impuesto al valor agregado". Knowledge-Based Systems . 188 105048. doi : 10.1016/j.knosys.2019.105048 .
  237. Fan, Jiani; Khin Shar, Lwin; Zhang, Ruichen; Liu, Ziyao; Yang, Wenzhuo; Niyato, Dusit; Lam, Kwok-Yan (15 de marzo de 2026). "Enfoques de aprendizaje profundo para la lucha contra el blanqueo de capitales en transacciones móviles: revisión, marco y direcciones". IEEE Internet of Things Journal . 13 (6): 10407– 10431. Bibcode : 2026IITJ...1310407F . doi : 10.1109/JIOT.2026.3653434 . ISSN 2327-4662 . 
  238. Nuñez, Michael (29 de noviembre de 2023). "La IA de materiales de Google DeepMind ya ha descubierto 2,2 millones de nuevos cristales" . VentureBeat . Recuperado el 19 de diciembre de 2023 .
  239. Merchant, Amil; Batzner, Simon; Schoenholz, Samuel S.; Aykol, Muratahan; Cheon, Gowoon; Cubuk, Ekin Dogus (diciembre de 2023). "Escalando el aprendizaje profundo para el descubrimiento de materiales" . Nature . 624 (7990): 80– 85. Bibcode : 2023Natur.624...80M . doi : 10.1038/ s41586-023-06735-9 . ISSN 1476-4687 . PMC 10700131. PMID 38030720 .   
  240. Peplow, Mark (29 de noviembre de 2023). "Google AI y los robots unen fuerzas para construir nuevos materiales". Nature . doi : 10.1038/d41586-023-03745-5 . PMID 38030771 . 
  241. 1 2 3 "Investigadores del ejército desarrollan nuevos algoritmos para entrenar robots" . EurekAlert! . Archivado del original el 28 de agosto de 2018. Recuperado el 29 de agosto de 2018 .
  242. Raissi, M.; Perdikaris, P.; Karniadakis, GE (febrero de 2019). "Redes neuronales basadas en la física: un marco de aprendizaje profundo para resolver problemas directos e inversos que involucran ecuaciones diferenciales parciales no lineales" . Journal of Computational Physics . 378 : 686–707 . Bibcode : 2019JCoPh.378..686R . doi : 10.1016/j.jcp.2018.10.045 . OSTI 1595805 . 
  243. Mao, Zhiping; Jagtap, Ameya D.; Karniadakis, George Em (marzo de 2020). "Redes neuronales basadas en la física para flujos de alta velocidad" . Computer Methods in Applied Mechanics and Engineering . 360 112789. Bibcode : 2020CMAME.36012789M . doi : 10.1016/j.cma.2019.112789 .
  244. Raissi, Maziar; Yazdani, Alireza; Karniadakis, George Em (28 de febrero de 2020). "Mecánica de fluidos oculta: aprendizaje de campos de velocidad y presión a partir de visualizaciones de flujo" . Science . 367 ( 6481): 1026– 1030. Bibcode : 2020Sci...367.1026R . doi : 10.1126/science.aaw4741 . PMC 7219083. PMID 32001523 .  
  245. Huang, Yunfei; Greenberg, David S. (2025). "Las restricciones geométricas y físicas mejoran sinérgicamente los sustitutos neuronales de EDP". arXiv : 2506.05513 [ cs.LG ].
  246. Han, J.; Jentzen, A.; E, W. (2018). "Resolución de ecuaciones diferenciales parciales de alta dimensión mediante aprendizaje profundo" . Actas de la Academia Nacional de Ciencias . 115 (34): 8505– 8510. arXiv : 1707.02568 . Bibcode : 2018PNAS..115.8505H . doi : 10.1073/pnas.1718942115 . PMC 6112690. PMID 30082389 .  
  247. Oktem, Figen S.; Kar, Oğuzhan Fatih; Bezek, Can Deniz; Kamalabadi, Farzad (2021). "Imágenes multiespectrales de alta resolución con lentes difractivas y reconstrucción aprendida". IEEE Transactions on Computational Imaging . 7 : 489–504 . arXiv : 2008.11625 . Bibcode : 2021ITCI....7..489O . doi : 10.1109/TCI.2021.3075349 .
  248. Bernhardt, Melanie; Vishnevskiy, Valery; Rau, Richard; Goksel, Orcun (diciembre de 2020). "Entrenamiento de redes variacionales con simulaciones multidominio: reconstrucción de imágenes de velocidad del sonido". IEEE Transactions on Ultrasonics, Ferroelectrics, and Frequency Control . 67 (12): 2584– 2594. arXiv : 2006.14395 . Bibcode : 2020ITUFF..67.2584B . doi : 10.1109/TUFFC.2020.3010186 . PMID 32746211 . 
  249. ^ Lam, Rémi; Sánchez-González, Álvaro; Willson, Mateo; Wirnsberger, Peter; Fortunato, Meire; Alet, Ferrán; Ravuri, Suman; Ewalds, Timo; Eaton-Rosen, Zach; Hu, Weihua; Merosa, Alejandro; Hoyer, Stephan; Holanda, George; Vinyals, Oriol; Stott, Jacklynn (22 de diciembre de 2023). "Aprender a realizar predicciones meteorológicas globales hábiles a medio plazo" . Ciencia . 382 (6677): 1416–1421 . arXiv : 2212.12794 . Código Bib : 2023Ciencia...382.1416L . doi : 10.1126/ciencia.adi2336 . ISSN 0036-8075 . PMID 37962497 .  
  250. Sivakumar, Ramakrishnan (27 de noviembre de 2023). "GraphCast: Un avance en la predicción meteorológica" . Medium . Consultado el 19 de mayo de 2024 .
  251. Galkin, F.; Mamoshina, P.; Kochetov, K.; Sidorenko, D.; Zhavoronkov, A. (2020). "DeepMAge: Un reloj de envejecimiento por metilación desarrollado con aprendizaje profundo" . Envejecimiento y enfermedad . doi : 10.14336/AD .
  252. Utgoff, PE; Stracuzzi, DJ (2002). "Aprendizaje multicapa". Neural Computation . 14 (10): 2497– 2529. doi : 10.1162/08997660260293319 . PMID 12396572 . 
  253. Elman, Jeffrey L. (1998). Repensando la innatividad: una perspectiva conexionista sobre el desarrollo . MIT Press. ISBN 978-0-262-55030-7.
  254. Shrager, J.; Johnson, MH (1996). "La plasticidad dinámica influye en la aparición de la función en una matriz cortical simple". Neural Networks . 9 (7): 1119– 1129. doi : 10.1016/0893-6080(96)00033-0 . PMID 12662587 . 
  255. Quartz, Steven R.; Sejnowski, Terrence J. (diciembre de 1997). "La base neural del desarrollo cognitivo: un manifiesto constructivista". Behavioral and Brain Sciences . 20 (4): 537– 556. doi : 10.1017/s0140525x97001581 . PMID 10097006 . 
  256. S. Blakeslee, "En el crecimiento temprano del cerebro, el cronograma puede ser crítico", The New York Times, Sección de Ciencia , págs. B5–B6, 1995.
  257. Mazzoni, P.; Andersen, RA; Jordan, MI (15 de mayo de 1991). "Una regla de aprendizaje más plausible desde el punto de vista biológico para redes neuronales" . Actas de la Academia Nacional de Ciencias . 88 (10): 4433– 4437. Bibcode : 1991PNAS...88.4433M . doi : 10.1073/pnas.88.10.4433 . ISSN 0027-8424 . PMC 51674. PMID 1903542 .   
  258. O'Reilly, Randall C. (1 de julio de 1996). "Aprendizaje biológicamente plausible basado en errores mediante diferencias de activación local: el algoritmo de recirculación generalizado". Neural Computation . 8 (5): 895– 938. doi : 10.1162/neco.1996.8.5.895 . ISSN 0899-7667 . 
  259. Testolin, Alberto; Zorzi, Marco (2016). "Modelos probabilísticos y redes neuronales generativas: hacia un marco unificado para modelar funciones neurocognitivas normales y deterioradas" . Frontiers in Computational Neuroscience . 10 : 73. doi : 10.3389/fncom.2016.00073 . ISSN 1662-5188 . PMC 4943066. PMID 27468262 .   
  260. Testolin, Alberto; Stoianov, Ivilin; Zorzi, Marco (septiembre de 2017). "La percepción de letras surge del aprendizaje profundo no supervisado y del reciclaje de características de imágenes naturales". Nature Human Behaviour . 1 (9): 657– 664. doi : 10.1038/s41562-017-0186-2 . ISSN 2397-3374 . PMID 31024135 .  
  261. Buesing, Lars; Bill, Johannes; Nessler, Bernhard; Maass, Wolfgang (3 de noviembre de 2011). "Dinámica neuronal como muestreo: un modelo para computación estocástica en redes recurrentes de neuronas de picos" . PLOS Computational Biology . 7 (11) e1002211. Bibcode : 2011PLSCB...7E2211B . doi : 10.1371/journal.pcbi.1002211 . ISSN 1553-7358 . PMC 3207943. PMID 22096452 .   
  262. Cash, S.; Yuste, R. (febrero de 1999). "Suma lineal de entradas excitatorias por neuronas piramidales CA1" . Neuron . 22 (2): 383–394 . doi : 10.1016/s0896-6273(00)81098-3 . ISSN 0896-6273 . PMID 10069343 .  
  263. Olshausen, B; Field, D (1 de agosto de 2004). "Codificación dispersa de entradas sensoriales". Current Opinion in Neurobiology . 14 (4): 481– 487. doi : 10.1016/j.conb.2004.07.007 . PMID 15321069 . 
  264. Yamins, Daniel LK; DiCarlo, James J (marzo de 2016). "Uso de modelos de aprendizaje profundo orientados a objetivos para comprender la corteza sensorial". Nature Neuroscience . 19 (3): 356– 365. doi : 10.1038/nn.4244 . ISSN 1546-1726 . PMID 26906502 .  
  265. Zorzi, Marco; Testolin, Alberto (19 de febrero de 2018). "Una perspectiva emergentista sobre el origen del sentido numérico" . Phil . Trans. R. Soc. B. 373 ( 1740) 20170043. doi : 10.1098/rstb.2017.0043 . ISSN 0962-8436 . PMC 5784047. PMID 29292348 .   
  266. Güçlü, Umut; van Gerven, Marcel AJ (8 de julio de 2015). "Las redes neuronales profundas revelan un gradiente en la complejidad de las representaciones neuronales a través de la vía ventral" . Journal of Neuroscience . 35 (27): 10005– 10014. arXiv : 1411.6422 . doi : 10.1523 / jneurosci.5023-14.2015 . PMC 6605414. PMID 26157000 .  
  267. Metz, C. (12 de diciembre de 2013). "El gurú del 'aprendizaje profundo' de Facebook revela el futuro de la IA" . Wired . Archivado del original el 28 de marzo de 2014. Recuperado el 26 de agosto de 2017 .
  268. Gibney, Elizabeth (2016). "El algoritmo de IA de Google domina el antiguo juego de Go" . Nature . 529 (7587): 445– 446. Bibcode : 2016Natur.529..445G . doi : 10.1038/529445a . PMID 26819021 . 
  269. ^ Plata, David ; Huang, Aja ; Maddison, Chris J.; Guez, Arturo; Sifré, Laurent; Driessche, George van den; Schrittwieser, Julián; Antonoglou, Ioannis; Panneershelvam, Veda; Lanctot, Marc; Dieleman, Sander; Grewe, Dominik; Nham, Juan; Kalchbrenner, Nal; Sutskever, Ilya ; Lillicrap, Timoteo; Lixiviación, Madeleine; Kavukcuoglu, Koray; Graepel, Thore; Hassabis, Demis (28 de enero de 2016). "Dominar el juego de Go con redes neuronales profundas y búsqueda de árboles". Naturaleza . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038/nature16961 . ISSN 0028-0836 . PMID 26819042 .  Icono de acceso cerrado
  270. "Un algoritmo de Google DeepMind utiliza aprendizaje profundo y más para dominar el juego de Go | MIT Technology Review" . MIT Technology Review . 27 de enero de 2016. Archivado del original el 1 de febrero de 2016. Consultado el 30 de enero de 2016 .
  271. Metz, Cade (6 de noviembre de 2017). "Investigadores de IA abandonan el laboratorio de Elon Musk para fundar una empresa emergente de robótica" . The New York Times . Archivado del original el 7 de julio de 2019. Consultado el 5 de julio de 2019 .
  272. Bradley Knox, W.; Stone, Peter (2008). "TAMER: Entrenamiento manual de un agente mediante refuerzo evaluativo". 7.ª Conferencia Internacional IEEE sobre Desarrollo y Aprendizaje de 2008. págs. 292–297 . doi : 10.1109/devlrn.2008.4640845 . ISBN  978-1-4244-2661-4.
  273. "Habla con los algoritmos: la IA aprende más rápido" . governmentciomedia.com . 16 de mayo de 2018. Archivado del original el 28 de agosto de 2018. Consultado el 29 de agosto de 2018 .
  274. Marcus, Gary (14 de enero de 2018). "En defensa del escepticismo sobre el aprendizaje profundo" . Gary Marcus . Archivado del original el 12 de octubre de 2018. Recuperado el 11 de octubre de 2018 .
  275. Knight, Will (14 de marzo de 2017). "DARPA está financiando proyectos que intentarán abrir las cajas negras de la IA" . MIT Technology Review . Archivado del original el 4 de noviembre de 2019. Recuperado el 2 de noviembre de 2017 .
  276. Alexander Mordvintsev; Christopher Olah; Mike Tyka (17 de junio de 2015). "Inceptionism: Going Deeper into Neural Networks" . Blog de investigación de Google. Archivado del original el 3 de julio de 2015. Recuperado el 20 de junio de 2015 .
  277. Alex Hern (18 de junio de 2015). "Sí, los androides sueñan con ovejas eléctricas" . The Guardian . Archivado del original el 19 de junio de 2015. Consultado el 20 de junio de 2015 .
  278. ^ Takahashi, Carlos Kazunari; Figueiredo, Julio César Bastos de; Favaretto, José Eduardo Ricciardi (24-03-2023). "Difusión del aprendizaje profundo por tendencia de búsqueda: un análisis a nivel de país" . Revista de investigación de estudios futuros: tendencias y estrategias . 15 (1): e0695. doi : 10.24023/FutureJournal/2175-5825/2023.v15i1.695 . ISSN 2175-5825 . 
  279. 1 2 3 Goertzel, Ben (2015). "¿Existen razones profundas que expliquen las patologías de los algoritmos de aprendizaje profundo actuales?". Inteligencia artificial general . Notas de clase en ciencias de la computación. Vol. 9205. págs. 70–79 . doi : 10.1007/978-3-319-21365-1_8 . ISBN   978-3-319-21364-4.
  280. Nguyen, Anh; Yosinski, Jason; Clune, Jeff (2014). "Las redes neuronales profundas se engañan fácilmente: predicciones de alta confianza para imágenes irreconocibles". arXiv : 1412.1897 [ cs.CV ].
  281. Szegedy, cristiano; Zaremba, Wojciech; Sutskever, Ilya; Bruna, Juana; Erhan, Dumitru; Buen compañero, Ian; Fergus, Rob (2013). "Propiedades intrigantes de las redes neuronales". arXiv : 1312.6199 [ cs.CV ].
  282. Zhu, Song-Chun; Mumford, David (20 de agosto de 2007). "Una gramática estocástica de imágenes". Foundations and Trends® in Computer Graphics and Vision . 2 (4): 259– 362. doi : 10.1561/0600000018 .
  283. Miller, GA y N. Chomsky. "Concepción de patrones". Ponencia presentada en la Conferencia sobre detección de patrones, Universidad de Michigan. 1957.
  284. Eisner, Jason. "Aprendizaje profundo de la estructura recursiva: inducción gramatical" . Archivado del original el 30 de diciembre de 2017. Consultado el 10 de mayo de 2015 .
  285. "Los hackers ya han comenzado a utilizar la inteligencia artificial como arma" . Gizmodo . 11 de septiembre de 2017. Archivado del original el 11 de octubre de 2019. Consultado el 11 de octubre de 2019 .
  286. "Cómo los hackers pueden obligar a la IA a cometer errores tontos" . The Daily Dot . 18 de junio de 2018. Archivado del original el 11 de octubre de 2019. Consultado el 11 de octubre de 2019 .
  287. 1 2 3 4 5 "Es fácil engañar a la IA: por qué eso debe cambiar" . Singularity Hub . 10 de octubre de 2017. Archivado del original el 11 de octubre de 2017. Recuperado el 11 de octubre de 2017 .
  288. Gibney, Elizabeth (2017). "La científica que detecta vídeos falsos" . Nature . doi : 10.1038/nature.2017.22784 . Archivado del original el 10 de octubre de 2017. Consultado el 11 de octubre de 2017 .
  289. Tubaro, Paola (2020). "¿De quién es la inteligencia artificial?" . Diálogo Global : 38– 39.
  290. 1 2 Mühlhoff, Rainer (6 de noviembre de 2019). "Inteligencia artificial asistida por humanos: o, ¿cómo realizar grandes cálculos en cerebros humanos? Hacia una sociología de los medios del aprendizaje automático" . New Media & Society . 22 (10): 1868–1884 . doi : 10.1177/1461444819885334 .

Lecturas adicionales

  • Bishop, Christopher M.; Bishop, Hugh (2024). Aprendizaje profundo: fundamentos y conceptos . Springer. ISBN 978-3-031-45467-7.
  • Chollet, François ; Watson, Matthew (2025). Aprendizaje profundo con Python . Manning. ISBN 9781633436589.
  • Prince, Simon JD (2023). Comprender el aprendizaje profundo . The MIT Press. ISBN 978-0-262-04864-4.
  • Goodfellow, Ian ; Bengio, Yoshua ; Courville, Aaron (2016). Aprendizaje profundo . MIT Press. ISBN 978-0-26203561-3. Archivado del original el 16-04-2016 . Recuperado el 09-05-2021 , libro de texto introductorio.{{cite book}}: CS1 mantenimiento: postscript ( enlace )