
En el aprendizaje automático , una red neuronal ( NN ) o red neuronal es un modelo computacional inspirado en la estructura y las funciones de las redes neuronales biológicas . [ 1 ] [ 2 ]
Una red neuronal consta de unidades o nodos conectados llamados neuronas artificiales , que modelan de forma aproximada las neuronas del cerebro. Recientemente, también se han investigado modelos de neuronas artificiales que imitan con mayor precisión las neuronas biológicas, demostrando una mejora significativa en el rendimiento. Estas se conectan mediante aristas , que modelan las sinapsis cerebrales. Cada neurona artificial recibe señales de las neuronas conectadas, las procesa y envía una señal a otras neuronas conectadas. La "señal" es un número real , y la salida de cada neurona se calcula mediante una función no lineal de la totalidad de sus entradas, denominada función de activación . La intensidad de la señal en cada conexión está determinada por un peso , que se ajusta como parte del proceso de entrenamiento.
Los grupos de neuronas se agrupan en capas. Cada capa realiza una transformación sobre sus entradas. Las señales viajan desde la primera capa (la capa de entrada ) hasta la última (la capa de salida ), pasando normalmente por varias capas intermedias ( capas ocultas ). Una red se denomina red neuronal profunda si tiene al menos dos capas ocultas. Las redes neuronales profundas son capaces de aprender representaciones jerárquicas sofisticadas. [ 3 ]
El entrenamiento de redes neuronales es un proceso que requiere mucha capacidad de cálculo, acelerado por el uso de unidades de procesamiento gráfico (GPU) y grandes conjuntos de datos.
Las innovaciones arquitectónicas, como las redes neuronales convolucionales (CNN), mejoraron significativamente el rendimiento en tareas de visión artificial , mientras que las redes neuronales recurrentes (RNN) permitieron modelar datos secuenciales como el habla y la información de series temporales. Las arquitecturas Transformer introdujeron mecanismos de atención que permiten a las redes neuronales modelar dependencias de largo alcance en los datos y han sido la base de grandes modelos de lenguaje . [ 4 ]
Las redes neuronales artificiales se utilizan para una infinidad de tareas, entre las que se incluyen chatbots, generación de texto, imágenes y vídeos a gran escala, y robótica.
Historia
Fundamentos matemáticos
Las redes neuronales profundas se basan en estadísticas desarrolladas hace más de 200 años. El tipo más simple de red neuronal de alimentación directa (FNN) es una red lineal, que consta de una sola capa de nodos de salida con funciones de activación lineales; las entradas se alimentan directamente a las salidas a través de pesos. La suma de los productos de los pesos y las entradas se calcula en cada nodo. Los errores cuadráticos medios entre estas salidas calculadas y los valores objetivo dados se minimizan ajustando los pesos. Esta técnica es el método de mínimos cuadrados o regresión lineal . Fue utilizada para encontrar un ajuste lineal aproximado a un conjunto de puntos por Legendre (1805) y Gauss (1795) para la predicción del movimiento planetario. [ 6 ] [ 7 ] [ 8 ]
Perceptrones
Las computadoras se basan en el modelo de John von Neumann . Ejecutan listas explícitas de instrucciones con acceso a la memoria para registrar su estado cambiante. Las redes neuronales, en cambio, surgieron de los esfuerzos por modelar el procesamiento de la información en sistemas biológicos mediante el conexionismo . A diferencia del modelo de von Neumann, la computación conexionista no separa la memoria del procesamiento.
Warren McCulloch y Walter Pitts [ 9 ] (1943) consideraron un modelo computacional sin aprendizaje para redes neuronales. [ 10 ] Este modelo allanó el camino para que la investigación se dividiera en una rama centrada en procesos biológicos y otra centrada en inteligencia artificial. McCulloch y Pitts también desarrollaron modelos matemáticos de neuronas artificiales capaces de representar funciones lógicas. [ 9 ]
A finales de la década de 1940, DO Hebb [ 11 ] propuso una hipótesis de aprendizaje basada en la plasticidad neuronal que se conoció como aprendizaje hebbiano . Se utilizó en muchos de los primeros experimentos con redes neuronales, como el perceptrón de Rosenblatt y la red de Hopfield . Farley y Clark [ 12 ] (1954) utilizaron máquinas computacionales para simular una red hebbiana. Otras máquinas computacionales para redes neuronales fueron creadas por Rochester , Holland, Habit y Duda (1956). [ 13 ]
En 1958, el psicólogo Frank Rosenblatt describió el perceptrón , una de las primeras redes neuronales implementadas, [ 14 ] [ 15 ] [ 16 ] [ 17 ] financiada por la Oficina de Investigación Naval de los Estados Unidos . [ 18 ] RD Joseph (1960) [ 19 ] mencionó un dispositivo anterior similar al perceptrón por BG Farley y WA Clark del Laboratorio Lincoln del MIT ; [ 7 ] sin embargo, según Joseph, "abandonaron el tema". [ 19 ]
Los primeros perceptrones no tenían unidades ocultas adaptativas. Sin embargo, Joseph (1960) [ 19 ] analizó una multicapa que sí las tenía. Rosenblatt (1962) [ 20 ] : sección 16 citó y adoptó estas ideas, reconociendo el trabajo de HD Block y BW Knight. Sin embargo, estos primeros esfuerzos no dieron como resultado un algoritmo de aprendizaje funcional para unidades ocultas, es decir, aprendizaje profundo .
El perceptrón generó gran entusiasmo público por las redes neuronales, lo que llevó al gobierno estadounidense a aumentar drásticamente su financiación. Esto contribuyó a la "Edad de Oro de la IA", impulsada por las optimistas afirmaciones de los científicos informáticos sobre la capacidad de los perceptrones para emular la inteligencia humana. [ 21 ]
Fundamentos históricos y la propuesta de Dartmouth
Las redes neuronales artificiales se identificaron como una dirección prometedora para la investigación en inteligencia artificial en la propuesta de 1955 para el Proyecto de Investigación de Verano de Dartmouth sobre Inteligencia Artificial . [ 22 ] Los modelos de redes neuronales inicialmente enfrentaron importantes limitaciones. Las restricciones de hardware limitaron el tamaño de la red y la eficiencia del entrenamiento, mientras que la comprensión teórica de los algoritmos de aprendizaje seguía siendo incompleta. Muchos modelos utilizaban perceptrones de una sola capa, que estaban restringidos a resolver problemas linealmente separables. Estas limitaciones se destacaron en el libro Perceptrons de Marvin Minsky y Seymour Papert , lo que disminuyó el interés durante finales de la década de 1960 y la década de 1970. [ 23 ]
Décadas de 1960 y 1970
En las décadas de 1960 y 1970 se llevó a cabo una investigación fundamental sobre las redes neuronales. El primer algoritmo de aprendizaje profundo funcional fue el método de agrupamiento de datos , un método para entrenar redes neuronales de profundidad arbitraria, publicado por Alexey Ivakhnenko y Valentin Lapa en la Unión Soviética (1965). Lo consideraron una forma de regresión polinómica , [ 24 ] generalizando el perceptrón de Rosenblatt. [ 25 ] Un artículo de 1971 describió una red profunda con ocho capas entrenada mediante este método, [ 26 ] entrenando capa por capa mediante análisis de regresión. Las unidades ocultas superfluas se podaron utilizando un conjunto de validación independiente. Las funciones de activación de los nodos fueron polinomios de Kolmogorov-Gabor, las primeras redes profundas con unidades multiplicativas o "compuertas". [ 7 ]
El primer perceptrón multicapa (MLP) de aprendizaje profundo entrenado mediante descenso de gradiente estocástico [ 27 ] fue publicado en 1967 por Shun'ichi Amari . [ 28 ] En experimentos computacionales realizados por el estudiante de Amari, S. Saito, un MLP de cinco capas con dos capas modificables aprendió representaciones internas para clasificar clases de patrones no linealmente separables. [ 7 ] Los desarrollos posteriores en hardware y ajuste de hiperparámetros hicieron del descenso de gradiente estocástico de extremo a extremo la técnica dominante para reducir la pérdida (error).
En 1969, Kunihiko Fukushima introdujo la función de activación ReLU (unidad lineal rectificada). [ 7 ] [ 29 ] [ 30 ] ReLU es la función de activación más común. [ 31 ]
Sin embargo, la investigación se estancó en Estados Unidos después de Minsky y Papert (1969), [ 32 ] quienes enfatizaron que los perceptrones eran incapaces de procesar el circuito exclusivo-o . No obstante, esta idea resultó irrelevante para las redes profundas de Ivakhnenko (1965) y Amari (1967).
En 1976 se introdujo el aprendizaje por transferencia . [ 33 ]
Retropropagación
El interés en las redes neuronales resurgió durante la década de 1980 debido al novedoso algoritmo de retropropagación , que permitió entrenar eficientemente redes neuronales multicapa propagando gradientes de error hacia atrás (de la salida a la entrada) a través de las capas de la red. [ 34 ] La retropropagación es una aplicación eficiente de la regla de la cadena derivada por Gottfried Wilhelm Leibniz en 1673 [ 35 ] a redes de nodos diferenciables . La terminología "errores retropropagantes" fue introducida en 1962 por Rosenblatt, [ 20 ] pero no describió cómo implementarla. Henry J. Kelley desarrolló un precursor de la retropropagación en 1960 en el contexto de la teoría de control . [ 36 ] En 1970, Seppo Linnainmaa publicó la forma moderna de retropropagación en su tesis de maestría (1970). [ 37 ] [ 38 ] [ 7 ] GM Ostrovski et al. lo republicó en 1971. [ 39 ] [ 40 ] Paul Werbos aplicó la retropropagación a redes neuronales en 1982 [ 41 ] [ 42 ] (su tesis doctoral de 1974, reimpresa en un libro de 1994, [ 43 ] no describió el algoritmo). [ 40 ] En 1986, David E. Rumelhart , et al., popularizaron la retropropagación pero no citaron el trabajo original. [ 44 ]
Redes neuronales convolucionales
Las arquitecturas de aprendizaje profundo para redes neuronales convolucionales (CNN) con capas convolucionales y capas de submuestreo y replicación de pesos comenzaron con el neocognitrón introducido por Kunihiko Fukushima en 1979. [ 45 ] [ 46 ] [ 47 ] La arquitectura CNN de Fukushima también introdujo el max pooling , [ 48 ] un procedimiento de submuestreo popular para CNN. Las CNN se han convertido en una herramienta esencial para la visión por computadora .
La red neuronal de retardo de tiempo (TDNN) fue introducida en 1987 por Alex Waibel para aplicar CNN al reconocimiento de fonemas. Utilizó convoluciones, compartición de pesos y retropropagación. [ 49 ] [ 50 ] En 1988, Wei Zhang aplicó una CNN entrenada con retropropagación para reconocer letras individuales. [ 51 ] En 1989, Yann LeCun et al. crearon una CNN llamada LeNet para reconocer códigos postales escritos a mano en el correo. El entrenamiento requirió 3 días. [ 52 ] En 1990, Wei Zhang implementó una CNN en hardware de computación óptica . [ 53 ] En 1991, se aplicó una CNN a la segmentación de objetos de imágenes médicas [ 54 ] y a la detección de cáncer de mama en mamografías. [ 55 ] LeNet-5 (1998), una CNN de 7 niveles por Yann LeCun et al. que clasifica dígitos escritos a mano, fue aplicado por los bancos para reconocer números en cheques digitalizados en imágenes de 32×32 píxeles. [ 56 ]
Desde 1988 en adelante, [ 57 ] [ 58 ] el uso de redes neuronales transformó el campo de la predicción de la estructura de proteínas , en particular cuando las primeras redes en cascada se entrenaron en perfiles (matrices) producidos por alineamientos de secuencias múltiples . [ 59 ]
Redes neuronales recurrentes
Una fuente de RNN fue la mecánica estadística . En 1972, Shun'ichi Amari propuso modificar los pesos de un modelo de Ising mediante la regla de aprendizaje hebbiana como un modelo de memoria asociativa , incorporando el aprendizaje. [ 60 ] Esto fue popularizado como la red de Hopfield por John Hopfield (1982). [ 61 ] Otro origen de RNN fue la neurociencia. La palabra "recurrente" se usa para describir estructuras en forma de bucle en anatomía. En 1901, Cajal observó "semicírculos recurrentes" en la corteza cerebelosa . [ 62 ] Hebb consideró el "circuito reverberante" como una explicación para la memoria a corto plazo. [ 63 ] El artículo de McCulloch y Pitts (1943) consideró redes neuronales que contienen ciclos y señaló que la actividad actual de dichas redes puede verse afectada por la actividad en el pasado lejano. [ 9 ]
En 1982, Crossbar Adaptive Array, una red neuronal recurrente con arquitectura de matriz (en lugar de una arquitectura de perceptrón multicapa), [ 64 ] [ 65 ] utilizó conexiones recurrentes directas desde la salida a las entradas del supervisor (enseñanza). Además de calcular acciones (decisiones), calculaba evaluaciones de estado interno (emociones) de situaciones con consecuencias. Al eliminar el supervisor externo, introdujo el método de autoaprendizaje en las redes neuronales.
En psicología cognitiva, la revista American Psychologist debatió a principios de la década de 1980 la relación entre cognición y emoción. El psicólogo social Robert Zajonc afirmó en 1980 que la emoción se procesa primero y es independiente de la cognición, mientras que Richard Lazarus afirmó en 1982 que la cognición se procesa primero y es inseparable de la emoción. [ 66 ] [ 67 ] [ 68 ] Fue un ejemplo de un debate en el que una RNN contribuyó a un tema y también abordó la psicología cognitiva.
La red de Jordan (1986) y la red de Elman (1990) aplicaron redes neuronales recurrentes (RNN) para estudiar la psicología cognitiva .
En la década de 1980, la retropropagación no funcionaba bien para las RNN profundas. En 1991, Jürgen Schmidhuber propuso el "fragmentador de secuencia neuronal" o "compresor de historial neuronal" [ 69 ] [ 70 ] , que introdujo el preentrenamiento autosupervisado (la "P" en ChatGPT ) y la destilación del conocimiento neuronal . [ 7 ] En 1993, un sistema compresor de historial neuronal resolvió una tarea de "aprendizaje muy profundo" que requería más de 1000 capas en una RNN desplegada en el tiempo. [ 71 ]
En 1991, la tesis de diploma de Sepp Hochreiter identificó y analizó el problema del gradiente evanescente [ 72 ] [ 73 ] y propuso conexiones residuales recurrentes para resolverlo. Él y Schmidhuber introdujeron la memoria a corto y largo plazo (LSTM), que estableció récords de precisión en múltiples dominios de aplicación. [ 74 ] [ 75 ] Esta no fue la versión definitiva de LSTM, que requería la puerta de olvido, y se introdujo en 1999. [ 76 ] Se convirtió en la opción predeterminada para la arquitectura RNN.
Durante 1985–1995, inspirados por la mecánica estadística, Terry Sejnowski , Peter Dayan , Geoffrey Hinton y otros desarrollaron varias arquitecturas y métodos , incluyendo la máquina de Boltzmann , [ 77 ] la máquina de Boltzmann restringida , [ 78 ] la máquina de Helmholtz , [ 79 ] y el algoritmo de vigilia-sueño . [ 80 ] Estos fueron diseñados para el aprendizaje no supervisado de modelos generativos profundos.
Aprendizaje profundo moderno
Entre 2009 y 2012, las NN comenzaron a ganar premios en concursos de reconocimiento de imágenes, acercándose al rendimiento humano en varias tareas, inicialmente en reconocimiento de patrones y reconocimiento de escritura a mano . [ 81 ] [ 82 ] En 2011, DanNet, [ 83 ] [ 84 ] una CNN de Dan Ciresan, Ueli Meier, Jonathan Masci, Luca Maria Gambardella y Schmidhuber logró por primera vez un rendimiento sobrehumano en un concurso de reconocimiento de patrones visuales, superando a los métodos tradicionales por un factor de 3. [ 47 ] Luego ganó más concursos. [ 85 ] [ 86 ] También demostraron cómo el max-pooling de CNN en GPU mejoraba el rendimiento. [ 87 ]
En octubre de 2012, AlexNet, de Alex Krizhevsky , Ilya Sutskever y Hinton [ 88 ], ganó la competición ImageNet a gran escala por un margen significativo frente a los métodos de aprendizaje automático superficiales. Otras mejoras incrementales incluyeron la red VGG-16 de Karen Simonyan y Andrew Zisserman [ 89 ] e Inceptionv3 de Google [ 90 ] .
En 2012, Ng y Dean crearon una red que aprendió a reconocer conceptos de nivel superior, como gatos, entrenándose únicamente con imágenes sin etiquetar. [ 91 ] El preentrenamiento no supervisado y el aumento de la capacidad de cómputo de las GPU y la computación distribuida permitieron el uso de redes más grandes, particularmente en problemas de reconocimiento de imágenes y visuales, lo que se conoció como "aprendizaje profundo". [ 92 ]
Las redes de funciones de base radial y de ondículas se introdujeron en 2013. Se ha demostrado que ofrecen las mejores propiedades de aproximación y se han aplicado en aplicaciones de identificación y clasificación de sistemas no lineales . [ 93 ]
Las redes generativas antagónicas (GAN) ( Ian Goodfellow et al., 2014) [ 94 ] se convirtieron en el estado del arte en el modelado generativo de 2014 a 2018. GAN fue publicado originalmente en 1991 por Schmidhuber, quien lo llamó "curiosidad artificial": dos redes neuronales compiten entre sí en forma de un juego de suma cero , donde la ganancia de una red es la pérdida de la otra. [ 95 ] [ 96 ] La primera red es un modelo generativo que modela una distribución de probabilidad sobre patrones de salida. La segunda red aprende por descenso de gradiente para predecir las reacciones del entorno a estos patrones. StyleGAN de Nvidia (2018) [ 97 ] logró una excelente calidad de imagen basada en la GAN progresiva de Tero Karras et al. [ 98 ] Aquí, el generador GAN crece de pequeña a gran escala de forma piramidal. La generación de imágenes mediante GAN alcanzó un éxito popular y provocó debates sobre los deepfakes . [ 99 ] Los modelos de difusión (2015) [ 100 ] eclipsaron a las GAN en el modelado generativo a partir de entonces, con sistemas como DALL·E 2 (2022) y Stable Diffusion (2022).
En 2014, el estado del arte era entrenar "[una] red neuronal muy profunda" con 20 a 30 capas. [ 101 ] Apilar demasiadas capas condujo a una fuerte reducción en la precisión del entrenamiento , [ 102 ] conocido como el problema de "degradación". [ 103 ] En 2015, el entrenamiento de redes muy profundas avanzó con la red Highway , publicada en mayo, [ 104 ] y la red neuronal residual (ResNet) en diciembre. [ 105 ] [ 106 ] ResNet se comporta como una Highway Net de puerta abierta.
Transformers
Durante la década de 2010, se desarrolló el modelo seq2seq y se añadieron mecanismos de atención. Esto condujo a la arquitectura transformadora moderna en 2017 en " Attention Is All You Need ". [ 4 ] Requiere un tiempo de computación que es cuadrático en el tamaño de la ventana de contexto. El controlador de peso rápido de Schmidhuber (1992) [ 107 ] escala linealmente y posteriormente se demostró que era equivalente al transformador lineal no normalizado. [ 108 ] [ 109 ] [ 7 ] Los transformadores se han convertido cada vez más en el modelo de elección para el procesamiento del lenguaje natural . [ 110 ] Muchos modelos de lenguaje grandes modernos como GPT , Gemini , Grok , DeepSeek y Qwen utilizan esta arquitectura.
Elementos

Las redes neuronales surgieron como un intento de replicar la arquitectura del cerebro en el ámbito digital. De inmediato, demostraron ser prometedoras para manejar relaciones no lineales, pero encontraron obstáculos. Pronto, los modelos se reorientaron hacia la aplicación de conocimientos matemáticos para mejorar los resultados empíricos, a expensas de la fidelidad biológica.
Neurona

Las NN están compuestas por neuronas digitales , conceptualmente derivadas de neuronas biológicas . Cada neurona tiene una o más entradas numéricas y produce una única salida numérica. [ 111 ] Una entrada (por ejemplo, una imagen) se divide típicamente entre el conjunto de neuronas de entrada (cada una recibe una parte de la imagen). Las entradas de cada neurona, ponderadas por los pesos de las conexiones de cada una de esas entradas, se suman. A esta suma se le añade un término de sesgo. [ 112 ] El resultado se pasa luego a través de una función de activación no lineal para producir la salida de la neurona. Las salidas suficientemente pequeñas pueden ser anuladas (ignoradas). [ 113 ] [ 114 ] [ 115 ]
Red
Las redes neuronales conectan neuronas entre sí, utilizando la salida de algunas neuronas como entrada de otras, de forma similar a las conexiones biológicas axón - sinapsis - dendrita . [ 116 ] La red forma un grafo dirigido y ponderado . Los pesos se aplican tanto a los nodos como a las aristas del grafo. [ 117 ]
Los nodos se organizan en capas, donde las capas inferiores acceden directamente a los datos sin procesar, mientras que las capas superiores muestran los resultados finales. Las capas intermedias aumentan gradualmente el nivel de abstracción, de modo que lo que comenzó como, por ejemplo, píxeles en una imagen, se resuelve gradualmente en elementos como los límites de los objetos y, posteriormente, en objetos del mundo real como letras y rostros. [ 117 ] [ 113 ] También se utilizan redes de una sola capa y redes sin capas.

Se han utilizado múltiples patrones de conexión. Tradicionalmente, están completamente conectados , con cada neurona de una capa conectada a cada neurona de la siguiente capa. [ 118 ] Sin embargo, en las redes neuronales convolucionales , algunas capas son convolucionales, lo que significa que cada neurona de una capa está conectada a un subconjunto de neuronas de la capa anterior, como las que representan una sección de una imagen. [ 119 ] [ 120 ]
En la mayoría de las redes neuronales, las salidas de las neuronas de una capa están conectadas únicamente a las neuronas de la capa inmediatamente siguiente ( grafo acíclico dirigido ), lo que significa que la información solo fluye hacia adelante de una capa a la siguiente. Estas se conocen como redes de alimentación directa . [ 121 ] En contraste, las redes que permiten conexiones entre neuronas de la misma capa o de capas anteriores se conocen como redes recurrentes . [ 122 ]
Aprendiendo
El entrenamiento/aprendizaje implica ajustar los pesos de la red para mejorar la precisión del resultado. Las redes neuronales suelen requerir una gran cantidad de datos de entrada (muchos más que los cerebros biológicos) para alcanzar un determinado nivel de funcionamiento. Esto se logra minimizando los errores observados entre las observaciones de muestra. El entrenamiento se realiza antes de que la red se implemente y (a diferencia de los cerebros) no continúa posteriormente. En cambio, la red puede volver a entrenarse desde cero a medida que se dispone de más datos de muestra.
La minimización del riesgo empírico ajusta los pesos de los nodos y enlaces para minimizar la diferencia (riesgo empírico) entre la salida predicha y los valores conocidos en las muestras de entrenamiento. [ 123 ] Una función de pérdida definida mide el grado de error. [ 92 ] La retropropagación distribuye el error (ajusta los pesos) desde los nodos de salida a través de la red hasta los nodos de entrada. [ 123 ] El objetivo es permitir que la red procese datos que no están incluidos en las muestras de entrenamiento.
Mientras el valor de la función de pérdida (su costo) siga disminuyendo, la red seguirá mejorando. La función generalmente produce una estadística cuyo valor es solo aproximado. Cuando el costo es bajo, la diferencia entre la salida ( por ejemplo, casi con seguridad un gato) y la respuesta correcta (un gato) es pequeña. La mayoría de los modelos de aprendizaje pueden considerarse una aplicación directa de la teoría de optimización y la estimación estadística . [ 117 ] [ 124 ]
El aprendizaje suele finalizar cuando las observaciones adicionales no reducen el coste de forma significativa. El coste generalmente se aproxima a cero, pero no llega a serlo. Si ninguna cantidad factible de datos de muestra produce un coste bajo, el entrenamiento se considera un fracaso.
Función de pérdida
Si bien es posible evaluar una función de pérdida ad hoc , normalmente debe exhibir propiedades deseables como convexidad , diferenciabilidad y robustez . [ 125 ] En un modelo probabilístico, la probabilidad posterior del modelo puede usarse como un costo inverso (valores más altos son mejores).
Retropropagación
La retropropagación es un método utilizado para ajustar los pesos de las conexiones para compensar los errores encontrados durante el aprendizaje. La cantidad de error se divide esencialmente entre las conexiones. Técnicamente, la retropropagación calcula el gradiente (la derivada) de la función de pérdida asociada a un estado dado con respecto a los pesos. Las actualizaciones de los pesos se pueden hacer mediante descenso de gradiente estocástico u otros métodos, como máquinas de aprendizaje extremo , [ 126 ] redes "sin propagación", [ 127 ] entrenamiento sin retroceso, [ 128 ] redes "sin peso", [ 129 ] y redes neuronales no conexionistas .
Hiperparámetros
Un hiperparámetro es un parámetro que define cualquier parte configurable de la red y del proceso de aprendizaje, cuyo valor se establece antes del entrenamiento. [ 130 ] Ejemplos de hiperparámetros incluyen la tasa de aprendizaje , el tamaño del lote de muestras, el número de nodos y capas, etc. [ 131 ] El rendimiento de una red neuronal está fuertemente influenciado por la elección de hiperparámetros, y por lo tanto, puede ajustarse durante el entrenamiento (normalmente entre ejecuciones de entrenamiento), un proceso llamado ajuste u optimización de hiperparámetros. [ 132 ]
Tasa de aprendizaje
La tasa de aprendizaje define el tamaño de los pasos correctivos que el modelo toma para ajustar los errores en cada observación. [ 133 ] Una tasa de aprendizaje alta acorta el tiempo de entrenamiento, pero con una precisión final menor, mientras que una tasa de aprendizaje más baja lleva más tiempo, pero con el potencial de una mayor precisión. Las optimizaciones como quickprop están dirigidas principalmente a acelerar el aprendizaje. Para evitar oscilaciones como los pesos de conexión que oscilan entre valores altos y bajos, y para mejorar la tasa de convergencia, los refinamientos utilizan una tasa de aprendizaje adaptativa que aumenta o disminuye según corresponda. [ 134 ] El concepto de momento permite que el equilibrio entre el gradiente y el cambio anterior se pondere de manera que el ajuste del peso dependa en cierto grado del cambio anterior. Un momento cercano a 0 enfatiza el gradiente, mientras que un valor cercano a 1 enfatiza el último cambio.
paradigmas de aprendizaje
El aprendizaje automático ha implicado una variedad de enfoques para entrenar modelos, incluyendo aprendizaje supervisado , [ 135 ] aprendizaje no supervisado , [ 136 ] aprendizaje por refuerzo , [ 137 ] y aprendizaje autosupervisado .
Aprendizaje supervisado
El aprendizaje supervisado empareja entradas y salidas deseadas. La tarea de aprendizaje consiste en producir la salida deseada para cada entrada. En este caso, el costo está relacionado con la eliminación de salidas incorrectas. [ 138 ] Un costo comúnmente utilizado es el error cuadrático medio , que intenta minimizar el error cuadrático medio entre la salida de la red y la salida deseada. Las tareas adecuadas para el aprendizaje supervisado incluyen el reconocimiento de patrones (clasificación) y la regresión (aproximación de funciones). El aprendizaje supervisado es aplicable a datos secuenciales (por ejemplo, para el reconocimiento de escritura a mano, voz y gestos ). Esto puede pensarse como aprender con un "maestro", en forma de una función que proporciona retroalimentación continua.
Aprendizaje no supervisado
En el aprendizaje no supervisado , se proporcionan los datos de entrada junto con la función de costo para los datos.y la salida, sin una "hoja de respuestas". La función de costo depende de la tarea (el dominio del modelo) y refleja supuestos a priori (propiedades implícitas del modelo, sus parámetros y las variables observadas). Por ejemplo, el modelotratamientoses una constante y el costo. Minimizar este costo produce un valor deque es igual a la media de los datos. La función de coste puede ser mucho más complicada. Su forma depende de la aplicación: por ejemplo, en compresión podría estar relacionada con la información mutua entreyEn cambio, en el modelado estadístico, podría estar relacionado con la probabilidad posterior (en ambos ejemplos, esas cantidades se maximizan). El aprendizaje no supervisado se aplica típicamente a problemas de estimación ; entre sus aplicaciones se incluyen la agrupación , la estimación de distribuciones estadísticas , la compresión y el filtrado .
Aprendizaje autosupervisado
El aprendizaje autosupervisado (SSL) es un paradigma en el aprendizaje automático donde un modelo se entrena en una tarea utilizando los propios datos para generar señales de supervisión, en lugar de depender de etiquetas proporcionadas externamente. En el contexto de las redes neuronales, el aprendizaje autosupervisado busca aprovechar las estructuras o relaciones inherentes dentro de los datos de entrada para crear señales de entrenamiento significativas. Las tareas de SSL están diseñadas de manera que su resolución requiere capturar características o relaciones esenciales en los datos. Los datos de entrada generalmente se aumentan o transforman de forma que se crean pares de muestras relacionadas, donde una muestra sirve como entrada y la otra se utiliza para formular la señal de supervisión. Este aumento puede implicar la introducción de ruido, recorte, rotación u otras transformaciones. El aprendizaje autosupervisado imita más fielmente la forma en que los humanos aprenden a clasificar objetos. [ 139 ]
Durante el aprendizaje supervisado (SSL), el modelo aprende en dos pasos. Primero, la tarea se resuelve basándose en una tarea de clasificación auxiliar o de pretexto utilizando pseudoetiquetas, que ayudan a inicializar los parámetros del modelo . [ 140 ] [ 141 ] A continuación, la tarea propiamente dicha se lleva a cabo con aprendizaje supervisado o no supervisado . [ 142 ] [ 143 ] [ 144 ]
El aprendizaje autosupervisado ha producido resultados prometedores en los últimos años y ha encontrado aplicación práctica en campos como el procesamiento de audio , y está siendo utilizado por Facebook y otros para el reconocimiento de voz . [ 145 ]
Aprendizaje por refuerzo
En aplicaciones como los videojuegos, un jugador realiza una serie de acciones, recibiendo una respuesta generalmente impredecible del entorno (el juego) tras cada una. El objetivo es ganar (obtener la puntuación más alta). El coste es el inverso de la puntuación. En el aprendizaje por refuerzo, el objetivo es ponderar la red para aumentar la puntuación. Tras cada acción, el juego genera una observación y un coste instantáneo , según sus reglas. Las reglas y el coste a largo plazo solo pueden estimarse. En cualquier momento, el agente decide si explorar nuevas acciones para descubrir sus costes o aprovechar el aprendizaje previo para avanzar más rápidamente.
Formalmente, el entorno se modela como un proceso de decisión de Markov (MDP) con estadosy accionesDado que las transiciones de estado (políticas) no se conocen, se utilizan distribuciones de probabilidad en su lugar: la distribución de costos instantáneos.la distribución de observacionesy la distribución de transiciónMientras que una política se define como la distribución condicional de acciones dadas las observaciones. En conjunto, ambas definen una cadena de Markov (CM). El objetivo es descubrir la CM de menor coste.
Las NN sirven como componente de aprendizaje. [ 146 ] [ 147 ] La programación dinámica acoplada con NN (dando lugar a la programación neurodinámica ) [ 148 ] se ha aplicado a problemas como el enrutamiento de vehículos , [ 149 ] videojuegos, gestión de recursos naturales [ 150 ] [ 151 ] y medicina [ 152 ] debido a la capacidad de las NN para mitigar el costo incluso cuando se reduce la densidad de la cuadrícula de discretización para aproximar numéricamente las tareas de control.
Autoaprendizaje
El autoaprendizaje se introdujo en 1982 junto con una red neuronal de matriz adaptativa de barra transversal (CAA) que podía aprender por sí misma. [ 153 ] Es un sistema con una sola entrada, situación s, y una sola salida, acción (o comportamiento) a. No tiene entrada de consejos externos ni refuerzo externo del entorno. La CAA calcula, de forma de barra transversal, tanto las decisiones sobre acciones como las emociones (sentimientos) sobre las situaciones encontradas. El sistema se basa en la interacción entre cognición y emoción. [ 154 ] Dada la matriz de memoria, W =||w(a,s)||, el algoritmo de autoaprendizaje de barra transversal en cada iteración realiza el siguiente cálculo:
En la situación s, realice la acción a; Recibir la consecuencia de la situación s'; Calcular la emoción de estar en la situación de consecuencia v(s'); Actualizar la memoria de la matriz de interconexión w'(a,s) = w(a,s) + v(s').
El valor retropropagado (refuerzo secundario) es la emoción hacia la situación de consecuencia. El CAA existe en dos entornos: su entorno conductual y su entorno genético, del cual recibe emociones iniciales (una sola vez) sobre las situaciones que encontrará en el entorno conductual. Habiendo recibido el vector genómico (vector de especie) del entorno genético, el CAA aprenderá un comportamiento de búsqueda de objetivos en el entorno conductual, que contiene situaciones tanto deseables como indeseables. [ 155 ]
Neuroevolución
La neuroevolución puede crear topologías y pesos de redes neuronales mediante computación evolutiva . Es competitiva con los métodos de descenso de gradiente. [ 156 ] [ 157 ] La neuroevolución puede ser menos propensa a quedar atrapada en "callejones sin salida". [ 158 ]
Red neuronal estocástica
Las redes neuronales estocásticas derivadas de los modelos de Sherrington-Kirkpatrick son un tipo de red neuronal construida mediante la introducción de variaciones aleatorias, ya sea asignando a las neuronas funciones de transferencia estocásticas [ 159 ] o ponderaciones estocásticas. Esto las convierte en herramientas útiles para problemas de optimización , dado que las fluctuaciones aleatorias ayudan a la red a escapar de mínimos locales [ 160 ] . Las redes neuronales estocásticas entrenadas mediante un enfoque bayesiano se conocen como redes neuronales bayesianas [ 161 ] .
aprendizaje profundo topológico
El aprendizaje profundo topológico , introducido en 2017, [ 162 ] integra la topología con redes neuronales profundas para abordar datos de alto orden. Inicialmente arraigado en la topología algebraica , el TDL evolucionó hasta convertirse en un marco versátil que incorpora herramientas de disciplinas matemáticas como la topología diferencial y la topología geométrica .
Otro
En un marco bayesiano , se elige una distribución sobre el conjunto de modelos permitidos para minimizar el costo. Los métodos evolutivos , [ 163 ] la programación de expresión genética , [ 164 ] el recocido simulado , [ 165 ] la expectativa-maximización , los métodos no paramétricos y la optimización por enjambre de partículas [ 166 ] son otros algoritmos de aprendizaje. La recursión convergente es un algoritmo de aprendizaje para redes neuronales de controlador de articulación del modelo cerebeloso (CMAC). [ 167 ] [ 168 ]
Modos
El aprendizaje puede ser estocástico o por lotes. El aprendizaje estocástico crea un ajuste de peso para cada muestra. En el aprendizaje por lotes, los pesos se ajustan en función de un lote de entradas, acumulando errores a lo largo del lote. El aprendizaje estocástico introduce "ruido" en el proceso, utilizando el gradiente local calculado a partir de un punto de datos; esto reduce la probabilidad de que la red se quede atascada en mínimos locales. Sin embargo, el aprendizaje por lotes suele producir un descenso más rápido y estable a un mínimo local, ya que cada actualización se realiza en la dirección del error promedio del lote. Una solución intermedia común es utilizar "minilotes", lotes pequeños con muestras en cada lote seleccionadas estocásticamente del conjunto de datos completo.
Tipos
Los tipos de redes neuronales (RN) comprenden una familia de técnicas. Los tipos más simples tienen componentes estáticos, como el número de unidades, el número de capas, los pesos de las unidades y la topología . Las RN dinámicas evolucionan mediante el aprendizaje. Algunos tipos permiten o requieren que el operador supervise el aprendizaje, mientras que otros operan de forma independiente. Algunos tipos operan exclusivamente en hardware, mientras que otros son puramente software y se ejecutan en ordenadores de propósito general.
Los principales tipos son:
- Transformers : estos utilizan la atención para analizar cada token en el flujo de entrada comparándolo con todos los demás tokens del mismo flujo. Esta técnica ha permitido que las redes neuronales lleguen al público general a través de chatbots, generadores de código y muchas otras formas.
- Redes neuronales convolucionales (CNN): una FNN que utiliza núcleos y regularización para evitar problemas en generaciones anteriores de NN. Se utilizan típicamente para analizar datos visuales y otros datos bidimensionales. [ 169 ] [ 170 ]
- Las redes generativas antagónicas enfrentan redes (de estructura variable) entre sí, cada una intentando presionar a la(s) otra(s) para producir mejores resultados, como ganar un juego [ 171 ] o engañar al oponente sobre la autenticidad de una entrada. [ 172 ]
Diseño de redes
La elección del modelo depende de los datos y la aplicación. Los modelos que funcionan bien con datos textuales no suelen ser la mejor opción para datos de imagen, etc. Un elemento importante es el método de entrenamiento/aprendizaje que utiliza el modelo. [ 173 ]
La búsqueda de arquitectura neuronal (NAS) utiliza aprendizaje automático para automatizar el diseño de redes neuronales. NAS ha generado redes que se comparan favorablemente con sistemas diseñados manualmente. El algoritmo básico consiste en proponer un modelo candidato, evaluarlo con un conjunto de datos y utilizar los resultados como retroalimentación para entrenar la red NAS. [ 174 ] Entre los esfuerzos realizados se incluyen AutoML y AutoKeras. [ 175 ] La biblioteca scikit-learn proporciona funciones para ayudar a construir una red profunda desde cero.
Los hiperparámetros son decisiones de diseño (no se aprenden). [ 176 ]
Propiedades teóricas
Poder computacional
El perceptrón multicapa es un aproximador de funciones universal , como lo demuestra el teorema de aproximación universal . Sin embargo, la demostración no especifica el número de neuronas necesarias, la topología de la red, los pesos ni los parámetros de aprendizaje.
Una arquitectura recurrente con pesos de valor racional (a diferencia de pesos de precisión completa con valores de números reales) tiene la potencia de una máquina de Turing universal , [ 177 ] utilizando un número finito de neuronas y conexiones lineales. Además, el uso de valores irracionales para los pesos da como resultado una máquina con potencia super-Turing . [ 178 ] [ 179 ]
Capacidad
La propiedad de "capacidad" de un modelo es su habilidad para modelar cualquier función dada. Está relacionada con la cantidad de información que se puede almacenar en la red y con la noción de complejidad. La capacidad de información y la dimensión VC son dos métricas. La capacidad de una red de neuronas estándar (no convolucionales) se puede derivar mediante cuatro reglas [ 180 ] que se derivan de considerar una neurona como un elemento eléctrico.
La capacidad de información captura las funciones que la red puede modelar a partir de cualquier dato de entrada. La dimensión VC utiliza los principios de la teoría de la medida y encuentra la capacidad máxima en circunstancias óptimas, dados los datos de entrada en un formato específico. La dimensión VC para entradas arbitrarias es la mitad de la capacidad de información de un perceptrón. La dimensión VC para puntos arbitrarios a veces se denomina capacidad de memoria. [ 181 ] [ 182 ]
Convergencia
Los modelos pueden no converger consistentemente en una única solución, ya que el sistema puede quedar atrapado en un mínimo local. Asimismo, el método de optimización utilizado podría no garantizar la convergencia si parte lejos de cualquier mínimo local. En tercer lugar, para conjuntos de datos o parámetros suficientemente grandes, algunos métodos resultan excesivamente lentos o costosos. El entrenamiento también puede cruzar algún punto de silla que impida el acceso a la solución.
Cuando el ancho de una red tiende a infinito, se describe bien mediante su expansión de Taylor de primer orden durante el entrenamiento, y por lo tanto hereda el comportamiento de convergencia de los modelos afines . [ 183 ] [ 184 ] Cuando el número de parámetros es pequeño, las NN suelen ajustar las funciones objetivo de bajas a altas frecuencias. Este comportamiento se conoce como sesgo espectral o principio de frecuencia. [ 185 ] [ 186 ] [ 187 ] Este fenómeno es opuesto al comportamiento de algunos esquemas numéricos iterativos bien estudiados, como el método de Jacobi . Las redes neuronales más profundas están más sesgadas hacia las funciones de baja frecuencia. [ 188 ]
Generalización y estadística
Las aplicaciones que deben generalizar bien a ejemplos no vistos deben evitar el sobreentrenamiento . Esto ocurre en sistemas complejos o excesivamente especificados cuando la capacidad de la red es mucho mayor de la necesaria.
Existen dos enfoques para abordar el sobreentrenamiento. La validación cruzada y técnicas similares permiten detectar el sobreentrenamiento y seleccionar los hiperparámetros adecuados para minimizar el error de generalización. La regularización en un marco probabilístico (bayesiano) se puede realizar seleccionando una probabilidad a priori mayor sobre modelos más simples; pero también en la teoría del aprendizaje estadístico, donde el objetivo es minimizar dos cantidades: el "riesgo empírico" y el "riesgo estructural", que corresponden aproximadamente al error sobre el conjunto de entrenamiento y al error predicho en datos no vistos debido al sobreajuste.

Las redes neuronales supervisadas que utilizan una función de coste de error cuadrático medio (ECM) pueden emplear métodos estadísticos formales para determinar la confianza del modelo entrenado. El ECM en un conjunto de validación puede utilizarse como estimación de la varianza. Este valor puede emplearse para calcular el intervalo de confianza de la salida de la red, asumiendo una distribución normal . Un análisis de confianza realizado de esta manera es estadísticamente válido siempre que la distribución de probabilidad de la salida permanezca invariable y la red no se modifique.
Al adoptar una función de activación softmax , una generalización de la función logística , en la capa de salida de la red neuronal (o un componente softmax en una red basada en componentes) para variables objetivo categóricas, las salidas pueden interpretarse como probabilidades posteriores. Esto resulta útil en la clasificación, ya que proporciona una medida de certeza.
La función de activación softmax es:
Aplicaciones
Las redes neuronales son compatibles con una amplia gama de aplicaciones en procesamiento de imágenes, reconocimiento de voz, procesamiento del lenguaje natural, finanzas y medicina. Gracias a su capacidad para modelar y reproducir procesos no lineales, las redes neuronales han encontrado aplicaciones en numerosas disciplinas. Entre ellas se incluyen:
- Aproximación de funciones , [ 189 ] o análisis de regresión , [ 190 ] (incluyendo predicción de series temporales , aproximación de aptitud , [ 191 ] y modelado)
- Procesamiento de datos [ 192 ] (incluyendo filtrado, agrupamiento, separación ciega de fuentes , [ 193 ] y compresión)
- Identificación de sistemas no lineales [ 93 ] y control (incluido el control de vehículos, la predicción de trayectorias, [ 194 ] el control adaptativo , el control de procesos y la gestión de recursos naturales )
- Reconocimiento de patrones (incluidos sistemas de radar, identificación facial , clasificación de señales, [ 195 ] detección de novedades , reconstrucción 3D , [ 196 ] reconocimiento de objetos y toma de decisiones secuenciales [ 197 ] )
- Reconocimiento de secuencias (incluido el reconocimiento de gestos , voz y texto manuscrito e impreso [ 198 ] )
- Análisis de datos de sensores [ 199 ] (incluido el análisis de imágenes )
- Robótica (incluyendo manipuladores y prótesis para la dirección )
- Minería de datos (incluido el descubrimiento de conocimiento en bases de datos )
- Finanzas [ 200 ] (como modelos ex ante para pronósticos financieros específicos a largo plazo y mercados financieros artificiales )
- Química cuántica [ 201 ]
- Juego general [ 202 ]
- IA generativa [ 203 ]
- Visualización de datos
- Traducción automática
- Filtrado de redes sociales [ 204 ]
- Filtrado de correo no deseado
- Diagnóstico médico [ 205 ]
- Respuesta ante desastres [ 206 ]
Las redes neuronales se han utilizado para diagnosticar cánceres [ 207 ] [ 208 ] y para distinguir líneas celulares cancerosas altamente invasivas de líneas menos invasivas utilizando únicamente datos de la forma celular. [ 209 ] [ 210 ]
Las NN se han utilizado para acelerar el análisis de confiabilidad de infraestructuras sujetas a desastres naturales [ 211 ] [ 212 ] y para predecir asentamientos en cimientos de edificios. [ 213 ] Se utilizan para mitigar inundaciones mediante el modelado de lluvia-escorrentía. [ 214 ] Las NN se han utilizado para construir modelos de caja negra en geociencias : hidrología , [ 215 ] [ 216 ] modelado oceánico e ingeniería costera , [ 217 ] [ 218 ] y geomorfología . [ 219 ] Las NN se han empleado en ciberseguridad , con el objetivo de discriminar entre actividades legítimas y maliciosas. Por ejemplo, el aprendizaje automático se ha utilizado para clasificar malware de Android , [ 220 ] para identificar dominios pertenecientes a actores de amenazas y para detectar URL que representan un riesgo de seguridad. [ 221 ] Se están realizando investigaciones sobre pruebas de penetración para detectar botnets, [ 222 ] fraudes con tarjetas de crédito, [ 223 ] e intrusiones en la red.
Las NN se han propuesto como una herramienta para resolver ecuaciones diferenciales parciales en física [ 224 ] [ 225 ] [ 226 ] y simular las propiedades de sistemas cuánticos abiertos de muchos cuerpos . [ 227 ] [ 228 ] [ 229 ] En la investigación cerebral, las NN han estudiado el comportamiento a corto plazo de neuronas individuales , [ 230 ] la dinámica de los circuitos neuronales surge de las interacciones entre neuronas individuales y cómo el comportamiento puede surgir de módulos neuronales abstractos que representan subsistemas completos. Los estudios consideraron la plasticidad a largo y corto plazo de los sistemas neuronales y su relación con el aprendizaje y la memoria desde el nivel de la neurona individual hasta el nivel del sistema.
Las redes neuronales se muestran prometedoras para perfilar los intereses de un usuario a partir de fotos [ 231 ] y descubrir nuevos materiales estables prediciendo eficientemente la energía total de los cristales. [ 232 ]
Procesamiento de imágenes
Las redes neuronales se emplean en tareas de visión artificial como la clasificación de imágenes, el reconocimiento de objetos y rostros, y la segmentación de imágenes. Se han aplicado a la obtención automatizada de imágenes médicas para el diagnóstico. [ 233 ]
Reconocimiento de voz
Las redes neuronales se utilizan para la identificación de locutores, la conversión de voz a texto y de texto a voz. Han conquistado el reconocimiento continuo del habla con un amplio vocabulario , superando a las técnicas tradicionales. [ 233 ] [ 234 ] Estos avances han permitido el desarrollo de sistemas activados por voz más precisos y eficientes, mejorando las interfaces de usuario en productos tecnológicos. [ 235 ] [ 236 ]
Procesamiento del lenguaje natural
En el procesamiento del lenguaje natural , las redes neuronales se utilizan para tareas como la clasificación de textos , el análisis de sentimientos , la traducción automática , para responder preguntas de formato libre, actuar como chatbots y resumir y analizar textos. [ 233 ] [ 234 ] Esto tiene implicaciones para el servicio al cliente automatizado, la moderación de contenido y las tecnologías de comprensión del lenguaje. [ 237 ]
Sistemas de control
Las redes neuronales se utilizan para modelar sistemas dinámicos para tareas como la identificación de sistemas, el diseño de control, los vehículos autónomos y la optimización. [ 238 ]
Finanzas
Las grandes instituciones financieras utilizan IA para optimizar sus prácticas de inversión. [ 239 ] El motor de IA de BlackRock , Aladdin , se utiliza tanto dentro de la empresa como por sus clientes para facilitar la toma de decisiones de inversión. Sus funciones incluyen el procesamiento del lenguaje natural para analizar textos como noticias, informes de corredores y publicaciones en redes sociales. Posteriormente, evalúa el sentimiento en torno a las empresas mencionadas y les asigna una puntuación. Bancos como UBS y Deutsche Bank utilizan SQREEM (Modelo de Reducción y Extracción Cuántica Secuencial) para extraer datos, desarrollar perfiles de consumidores y relacionarlos con productos de gestión patrimonial . [ 240 ]
Medicamento
Las redes neuronales analizan conjuntos de datos médicos. Mejoran la precisión diagnóstica, especialmente al interpretar imágenes médicas complejas para la detección temprana de enfermedades y al predecir los resultados de los pacientes para la planificación de tratamientos personalizados. [ 234 ] En el descubrimiento de fármacos , las redes neuronales aceleran la identificación de posibles candidatos a fármacos y predicen su eficacia y seguridad, reduciendo significativamente el tiempo y los costos de desarrollo. [ 233 ] Además, su aplicación en medicina personalizada y análisis de datos sanitarios permite terapias a medida y una gestión eficiente de la atención al paciente. [ 234 ]
Ciberseguridad
Las redes neuronales se aplican ampliamente en ciberseguridad para la detección de anomalías, la clasificación de malware y la detección de intrusiones. Al aprender patrones del comportamiento normal del sistema o la red, las redes neuronales pueden identificar desviaciones que indican actividad maliciosa. [ 241 ]
Creación de contenido
Los Transformers se utilizan para la creación de contenido en numerosas industrias. [ 242 ] Pueden analizar muestras y producir resultados que coincidan con el estilo de un artista o músico. Por ejemplo, DALL-E se entrenó con 650 millones de pares de imágenes y textos y puede crear obras de arte basadas en el texto del usuario. [ 243 ] Empresas como AIVA y Jukedeck han utilizado Transformers para crear música original. [ 244 ] Las redes neuronales se han utilizado para crear anuncios personalizados. [ 242 ] Las productoras cinematográficas han utilizado redes neuronales para analizar el éxito financiero de una película. [ 245 ] Las redes neuronales han encontrado usos en la creación de videojuegos. [ 246 ]
Asuntos
Capacitación
Las redes neuronales requieren millones de muestras de entrenamiento para ser funcionales. En 2026, entrenar un modelo de aprendizaje por lotes comercial (GPT, Grok, Gemini) generalmente requería cientos de miles de computadoras y costaba decenas de millones de dólares. [ 247 ] [ 167 ]
Teoría
Una afirmación central de las redes neuronales es que incorporan principios generales nuevos y potentes para el procesamiento de la información. Sin embargo, en esencia, utilizan métodos estadísticos desarrollados desde hace mucho tiempo.
Hardware
Las redes neuronales requieren enormes recursos informáticos para su entrenamiento. [ 248 ] Mientras que el cerebro requiere solo 20 vatios de potencia, [ 249 ] el entrenamiento de transformadores comerciales requiere (2026) centros de datos con cientos de megavatios. [ 250 ]
Desde 1991 hasta 2015, la potencia de cálculo, especialmente la proporcionada por las GPGPU (en GPU ), aumentó aproximadamente un millón de veces, lo que permitió el uso del algoritmo de retropropagación. [ 47 ]
La ingeniería neuromórfica o la construcción de redes neuronales físicas mediante chips no von Neumann permite implementar directamente redes neuronales en circuitos. Por ejemplo, Alphabet introdujo chips personalizados ( Unidad de Procesamiento Tensorial ). [ 251 ]
Desviación conceptual
Las propiedades estadísticas de los datos de entrada pueden variar con el tiempo, un fenómeno conocido como deriva conceptual o no estacionariedad . Esta deriva puede reducir la precisión predictiva y conducir a decisiones poco fiables o sesgadas si no se detecta y corrige. En la práctica, esto significa que la precisión del modelo durante su implementación puede diferir sustancialmente de los niveles observados durante el entrenamiento.
Se han desarrollado diversas estrategias para monitorizar las redes neuronales en busca de desviaciones y degradación:
- Monitorización basada en errores : compara las predicciones actuales con las etiquetas de referencia. Este enfoque cuantifica directamente el rendimiento predictivo, pero puede resultar poco práctico cuando las etiquetas se retrasan o son difíciles de obtener.
- Monitorización de la distribución de datos : detección de cambios en la distribución de los datos de entrada mediante pruebas estadísticas, medidas de divergencia o estimación de la razón de densidad.
- Monitoreo de la representación : seguimiento de la distribución de incrustaciones internas o características de la capa oculta. Los cambios en la representación latente pueden indicar no estacionariedad incluso cuando no se dispone de etiquetas. Se han adaptado métodos estadísticos, como los gráficos de control de procesos estadísticos, para este propósito. [ 252 ]
Sesgo del conjunto de datos
Las redes neuronales dependen de la calidad de sus datos de entrenamiento; los datos de baja calidad pueden llevar al modelo a producir resultados deficientes. [ 253 ] [ 254 ] Los datos sesgados producen resultados sesgados, lo que requiere que los entrenadores los detecten y corrijan. Por ejemplo, los datos que subrepresentan a algunos grupos demográficos pueden prevenir errores, por ejemplo, en el reconocimiento facial y la aplicación de la ley . [ 254 ] [ 255 ] En 2018, Amazon descartó una herramienta de reclutamiento porque el modelo favorecía a los hombres sobre las mujeres para los puestos de ingeniería de software debido a la mayor cantidad de trabajadores masculinos en el campo. [ 255 ] El sistema penalizaba los currículos con la palabra "mujer" o el nombre de una universidad femenina. Una corrección es agregar datos sintéticos para compensar el sesgo. [ 256 ]
Falta de interpretabilidad
Las redes neuronales son sistemas de "caja negra" que tienen una comprensión compleja de sus procesos de toma de decisiones. Además, son vulnerables a ejemplos adversarios ("envenenamiento"), que pueden provocar predicciones incorrectas.
Estas preocupaciones han impulsado la investigación en inteligencia artificial explicable (XAI), aprendizaje automático robusto y enfoques de IA híbrida que combinan el aprendizaje neuronal con el razonamiento simbólico. Los defensores de los modelos híbridos también afirman que dicha combinación puede capturar mejor los mecanismos de la mente humana. [ 257 ] [ 258 ]
El progreso ha incluido el aprendizaje local frente al no local y las arquitecturas superficiales frente a las profundas. [ 259 ]
Analizar el pensamiento humano (una red neuronal biológica) también ha resultado difícil.
Galería
Una red neuronal de alimentación directa de una sola capa. Flechas que parten dese omiten para mayor claridad. Hay p entradas a esta red y q salidas. En este sistema, el valor de la q -ésima salida,, se calcula como
Una red neuronal de alimentación directa de dos capas
Una red neuronal
Un grafo de dependencia NN
Una red neuronal de alimentación directa de una sola capa con 4 entradas, 6 nodos ocultos y 2 salidas. Dado el estado de posición y la dirección, genera valores de control basados en las ruedas.
Una red neuronal de dos capas con alimentación directa, 8 entradas, 2x8 nodos ocultos y 2 salidas. A partir del estado de posición, la dirección y otros valores del entorno, genera valores de control para los propulsores.
Estructura de canalización paralela de la red neuronal CMAC. Este algoritmo de aprendizaje puede converger en un solo paso.
Véase también
- ADALINE
- Autoencoder
- Computación bioinspirada
- Proyecto Cerebro Azul
- Interferencia catastrófica
- Arquitectura cognitiva
- Sistema experto conexionista
- Conectómica
- Imagen profunda previa
- Morfogénesis digital
- Red neuronal actualizable de forma eficiente
- Algoritmo evolutivo
- Familia de curvas
- Algoritmo genético
- computación hiperdimensional
- Tabulación adaptativa in situ
- Grandes límites de ancho de las redes neuronales
- Lista de conceptos de aprendizaje automático
- Memristor
- ¿Te importa subirlo?
- gas neural
- Software de redes neuronales
- Red neuronal óptica
- Procesamiento distribuido en paralelo
- Filosofía de la inteligencia artificial
- Análisis predictivo
- Red neuronal cuántica
- Máquina de vectores de soporte
- Red neuronal de impulsos
- loro estocástico
- Red de productos tensoriales
- aprendizaje profundo topológico
Notas
Referencias
- ↑ Hardesty L (14 de abril de 2017). "Explicado: Redes neuronales" . Oficina de prensa del MIT. Archivado del original el 18 de marzo de 2024. Consultado el 2 de junio de 2022 .
- ↑ Yang Z, Yang Z (2014). Física biomédica integral . Instituto Karolinska, Estocolmo, Suecia: Elsevier. pág. 1. ISBN 978-0-444-53633-4Archivado del original el 28 de julio de 2022. Consultado el 28 de julio de 2022 .
- ↑ Bishop CM (17 de agosto de 2006). Reconocimiento de patrones y aprendizaje automático (PDF) . Nueva York: Springer. ISBN 978-0-387-31073-2.
- 1 2 Vaswani A, Shazeer N, Parmar N (2017). "Attention Is All You Need" ( PDF) . Advances in Neural Information Processing Systems . 30. arXiv : 1706.03762 .
- ↑ Ferrie, C., Kaiser, S. (2019). Redes neuronales para bebés . Sourcebooks. ISBN 978-1-4926-7120-6.
- ↑ Stigler SM (1981). "Gauss y la invención de los mínimos cuadrados" . Ann. Stat . 9 (3): 465– 474. Bibcode : 1981AnSta...945451S . doi : 10.1214/aos/1176345451 .
- 1 2 3 4 5 6 7 8 Schmidhuber J (29 de diciembre de 2025). "Historia anotada de la IA moderna y el aprendizaje profundo". arXiv : 2212.11279 [ cs.NE ].
- ↑ Stigler SM (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Cambridge: Harvard. ISBN 0-674-40340-1.
- 1 2 3 McCulloch WS, Pitts W (diciembre de 1943). "Un cálculo lógico de las ideas inmanentes en la actividad nerviosa" . The Bulletin of Mathematical Biophysics . 5 (4): 115– 133. Bibcode : 1943BMaB....5..115M . doi : 10.1007/BF02478259 . ISSN 0007-4985 . Recuperado el 7 de agosto de 2024 .
{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Kleene S (1956). "Representación de eventos en redes nerviosas y autómatas finitos" . Annals of Mathematics Studies . N.° 34. Princeton University Press. págs. 3–41 . Archivado del original el 19 de mayo de 2024. Recuperado el 17 de junio de 2017 .
- ↑ Hebb D (2005) [1.ª ed. 1949]. La organización del comportamiento . Taylor & Francis. ISBN 978-1-135-63190-1.
- ↑ Farley B, WA Clark (1954). "Simulación de sistemas autoorganizados mediante ordenador digital". IRE Transactions on Information Theory . 4 (4): 76– 84. Bibcode : 1954TIPIT...4...76F . doi : 10.1109/TIT.1954.1057468 .
- ↑ Rochester N, JH Holland, LH Habit, WL Duda (1956). "Pruebas sobre una teoría de ensamblaje celular de la acción del cerebro, utilizando una gran computadora digital". IRE Transactions on Information Theory . 2 (3): 80– 93. Bibcode : 1956IRTIT...2...80R . doi : 10.1109/TIT.1956.1056810 .
- ↑ Haykin (2008) Redes neuronales y máquinas de aprendizaje, 3.ª edición
- ↑ Rosenblatt F (1958). "El perceptrón: un modelo probabilístico para el almacenamiento y la organización de la información en el cerebro" . Psychological Review . 65 (6): 386– 408. CiteSeerX 10.1.1.588.3775 . doi : 10.1037/h0042519 . PMID 13602029. S2CID 12781225 .
- ↑ Werbos P (1975). Más allá de la regresión: nuevas herramientas para la predicción y el análisis en las ciencias del comportamiento .
- ↑ Rosenblatt F (1957). "El perceptrón: un autómata que percibe y reconoce". Informe 85-460-1 . Laboratorio Aeronáutico de Cornell.
- ↑ Olazaran M (1996). "Un estudio sociológico de la historia oficial de la controversia de los perceptrones". Estudios sociales de la ciencia . 26 (3): 611– 659. doi : 10.1177/030631296026003005 . JSTOR 285702 . S2CID 16786738 .
- 1 2 3 Joseph RD (1961). Contribuciones a la teoría del perceptrón (tesis doctoral). Universidad de Cornell.
- 1 2 Rosenblatt F (1962). Principios de neurodinámica: perceptrones y la teoría de los mecanismos cerebrales . Spartan Books.
- ↑ Russel S, Norvig, Peter (2010). Inteligencia artificial: Un enfoque moderno (PDF) (3.ª ed.). Estados Unidos de América: Pearson Education. págs. 16–28 . ISBN 978-0-13-604259-4. Consultado el 9 de diciembre de 2023 .
{{cite book}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ McCarthy J, Minsky M, Rochester N, Shannon C (1955). "Una propuesta para el proyecto de investigación de verano de Dartmouth sobre inteligencia artificial" . Universidad de Stanford . Recuperado el 15 de marzo de 2026 .
- ↑ Minsky M, Papert S (1969). Perceptrones: Una introducción a la geometría computacional . MIT Press. doi : 10.7551/mitpress/11301.001.0001 . ISBN 978-0-262-34393-0.
- ↑ Ivakhnenko AG, Lapa VG (1967). Cibernética y técnicas de predicción . American Elsevier Publishing Co. ISBN 978-0-444-00020-0.
- ↑ Ivakhnenko A (marzo de 1970). "Autoorganización heurística en problemas de cibernética de ingeniería" . Automatica . 6 (2): 207– 219. Bibcode : 1970Autom...6..207I . doi : 10.1016/0005-1098(70)90092-0 . Archivado del original el 12 de agosto de 2024. Recuperado el 7 de agosto de 2024 .
- ↑ Ivakhnenko A (1971). "Teoría polinómica de sistemas complejos" (PDF) . IEEE Transactions on Systems, Man, and Cybernetics . SMC-1 (4): 364–378 . Bibcode : 1971ITSMC...1..364I . doi : 10.1109/TSMC.1971.4308320 . Archivado (PDF) del original el 29 de agosto de 2017. Recuperado el 5 de noviembre de 2019 .
- ↑ Robbins H , Monro S (1951). "Un método de aproximación estocástica" . The Annals of Mathematical Statistics . 22 (3): 400. doi : 10.1214/aoms/1177729586 .
- ↑ Amari S (1967). "Una teoría de clasificadores de patrones adaptativos" (PDF) . IEEE Transactions . EC (16): 279–307 .
- ↑ Fukushima K (1969). "Extracción de características visuales mediante una red multicapa de elementos de umbral analógicos". IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 .
- ↑ Sonoda S, Murata N (2017). "Red neuronal con funciones de activación no acotadas es un aproximador universal". Análisis armónico aplicado y computacional . 43 (2): 233– 268. arXiv : 1505.03654 . doi : 10.1016/j.acha.2015.12.005 . S2CID 12149203 .
- ↑ Ramachandran P, Barret Z, Quoc VL (16 de octubre de 2017). "Búsqueda de funciones de activación". arXiv : 1710.05941 [ cs.NE ].
- ↑ Minsky M, Papert S (1969). Perceptrones: Una introducción a la geometría computacional . MIT Press. ISBN 978-0-262-63022-1.
- ↑ Bozinovski S (15 de septiembre de 2020). "Recordatorio del primer artículo sobre aprendizaje por transferencia en redes neuronales, 1976" . Informatica . 44 (3). doi : 10.31449/inf.v44i3.2828 . ISSN 1854-3871 .
- ↑ Rumelhart D, Hinton G, Williams R (1986). "Aprendizaje de representaciones mediante la retropropagación de errores". Nature . 323 (6088): 533– 536. Bibcode : 1986Natur.323..533R . doi : 10.1038/323533a0 .
- ↑ Leibniz GW (1920). Los primeros manuscritos matemáticos de Leibniz: traducidos de los textos latinos, publicados por Carl Immanuel Gerhardt con notas críticas e históricas (Leibniz publicó la regla de la cadena en unas memorias de 1676) . Open Court Publishing Company. ISBN 978-0-598-81846-1.
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Kelley HJ (1960). "Teoría del gradiente de las trayectorias de vuelo óptimas" . ARS Journal . 30 (10): 947– 954. doi : 10.2514/8.5282 .
- ↑ Linnainmaa S (1970). La representación del error de redondeo acumulativo de un algoritmo como una expansión de Taylor de los errores de redondeo locales (tesis de maestría) (en finés). Universidad de Helsinki. págs. 6-7.
- ↑ Linnainmaa S (1976). "Expansión de Taylor del error de redondeo acumulado". BIT Numerical Mathematics . 16 (2): 146– 160. doi : 10.1007/bf01931367 . S2CID 122357351 .
- ↑ Ostrovski, GM, Volin, YM y Boris, WW (1971). Sobre el cálculo de derivadas. Wiss. Z. Tech. Hochschule for Chemistry, 13:382–384.
- 1 2 Schmidhuber J (25 de octubre de 2014). "¿Quién inventó la retropropagación?" . IDSIA, Suiza. Archivado del original el 30 de julio de 2024. Recuperado el 14 de septiembre de 2024 .
- ↑ Werbos PJ (1982), Drenick RF, Kozin F (eds.), "Aplicaciones de los avances en el análisis de sensibilidad no lineal" (PDF) , Modelado y optimización de sistemas , Notas de clase en control y ciencias de la información, vol. 38, Berlín/Heidelberg: Springer-Verlag, pp. 762–770 , doi : 10.1007/bfb0006203 , ISBN 978-3-540-11691-2Archivado desde el original (PDF) el 14 de abril de 2016 , consultado el 27 de marzo de 2026.
{{citation}}: CS1 mantenimiento: parámetro de trabajo con ISBN ( enlace ) - ↑ Anderson JA, Rosenfeld E, eds. (2000). Talking Nets: An Oral History of Neural Networks . The MIT Press. doi : 10.7551/mitpress/6626.003.0016 . ISBN 978-0-262-26715-1Consultado el 7 de agosto de 2024 .
{{cite book}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Werbos PJ (1994). The Roots of Backpropagation: From Ordered Derivatives to Neural Networks and Political Forecasting . Nueva York: John Wiley & Sons. ISBN 0-471-59897-6.
- ↑ Rumelhart DE, Hinton GE, Williams RJ (octubre de 1986). "Aprendizaje de representaciones mediante la retropropagación de errores" . Nature . 323 (6088): 533– 536. Bibcode : 1986Natur.323..533R . doi : 10.1038/323533a0 . ISSN 1476-4687 . Archivado del original el 8 de marzo de 2021. Recuperado el 17 de marzo de 2021 .
- ↑ Fukushima K (1979). "Modelo de red neuronal para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición: Neocognitron" . Trans . IECE (en japonés) . J62-A (10): 658–665 . doi : 10.1007/bf00344251 . PMID 7370364. S2CID 206775608 .
- ↑ Fukushima K (1980). "Neocognitron: Un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición" . Biol . Cybern . 36 (4): 193–202 . doi : 10.1007/bf00344251 . PMID 7370364. S2CID 206775608 .
- 1 2 3 Schmidhuber J (2015). "Aprendizaje profundo en redes neuronales: una visión general". Redes neuronales . 61 : 85–117 . arXiv : 1404.7828 . Bibcode : 2015NN.....61...85S . doi : 10.1016 / j.neunet.2014.09.003 . PMID 25462637. S2CID 11715509 .
- ↑ Fukushima K, Miyake S (1 de enero de 1982). "Neocognitron: Un nuevo algoritmo para el reconocimiento de patrones tolerante a deformaciones y cambios de posición" . Pattern Recognition . 15 (6): 455– 469. Bibcode : 1982PatRe..15..455F . doi : 10.1016/0031-3203(82)90024-3 . ISSN 0031-3203 . Consultado el 9 de septiembre de 2024 .
{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Waibel A (diciembre de 1987). Reconocimiento de fonemas mediante redes neuronales con retardo temporal (PDF) . Reunión del Instituto de Ingenieros Eléctricos, de Información y de Comunicación (IEICE). Tokio, Japón. Archivado (PDF) del original el 17 de septiembre de 2024. Consultado el 20 de septiembre de 2024 .
- ↑ Alexander Waibel et al., Reconocimiento de fonemas mediante redes neuronales con retardo temporal. Archivado el 11 de diciembre de 2024 en Wayback Machine. IEEE Transactions on Acoustics, Speech, and Signal Processing, volumen 37, n.º 3, págs. 328-339. Marzo de 1989.
- ↑ Zhang W (1988). "Red neuronal de reconocimiento de patrones invariante a desplazamientos y su arquitectura óptica" . Actas de la Conferencia Anual de la Sociedad Japonesa de Física Aplicada . Archivado del original el 23 de junio de 2020. Recuperado el 12 de abril de 2023 .
- ↑ LeCun Y, Boser B, Denker JS, Henderson D, Howard RE, Hubbard W, et al. (1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos" . Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . S2CID 41312633 .
- ↑ Zhang W (1990). " Modelo de procesamiento distribuido en paralelo con interconexiones locales invariantes en el espacio y su arquitectura óptica" . Applied Optics . 29 (32): 4790– 7. Bibcode : 1990ApOpt..29.4790Z . doi : 10.1364/AO.29.004790 . PMID 20577468. Archivado del original el 6 de febrero de 2017. Recuperado el 12 de abril de 2023 .
- ↑ Zhang W (1991). " Procesamiento de imágenes del endotelio corneal humano basado en una red de aprendizaje" . Applied Optics . 30 (29): 4211– 7. Bibcode : 1991ApOpt..30.4211Z . doi : 10.1364/AO.30.004211 . PMID 20706526. Archivado del original el 19 de junio de 2024. Recuperado el 20 de septiembre de 2024 .
- ↑ Zhang W (1994). "Detección computarizada de microcalcificaciones agrupadas en mamografías digitales mediante una red neuronal artificial invariante a la traslación" . Física Médica . 21 (4): 517– 24. Bibcode : 1994MedPh..21..517Z . doi : 10.1118/1.597177 . PMID 8058017. Archivado del original el 20 de junio de 2024. Recuperado el 20 de septiembre de 2024 .
- ^ LeCun Y, Léon Bottou, Yoshua Bengio, Patrick Haffner (1998). "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos" (PDF) . Actas del IEEE . 86 (11): 2278– 2324. Código bibliográfico : 1998IEEEP..86.2278L . CiteSeerX 10.1.1.32.9552 . doi : 10.1109/5.726791 . S2CID 14542261 . Archivado desde el original (PDF) el 30 de octubre de 2023 . Consultado el 7 de octubre de 2016 .
- ↑ Qian, Ning y Terrence J. Sejnowski. "Predicción de la estructura secundaria de proteínas globulares mediante modelos de redes neuronales". Journal of molecular biology 202, n.º 4 (1988): 865–884.
- ^ Bohr, Henrik, Jakob Bohr, Søren Brunak, Rodney MJ Cotterill, Benny Lautrup, Leif Nørskov, Ole H. Olsen y Steffen B. Petersen. "Estructura secundaria de proteínas y homología por redes neuronales. Las hélices α en rodopsina". Cartas FEBS 241, (1988): 223–228
- ↑ Rost, Burkhard y Chris Sander: "Predicción de la estructura secundaria de proteínas con una precisión superior al 70 %". Journal of molecular biology 232, n.º 2 (1993): 584–599.
- ↑ Amari SI (noviembre de 1972). "Aprendizaje de patrones y secuencias de patrones mediante redes autoorganizadas de elementos umbral" . IEEE Transactions on Computers . C-21 (11): 1197–1206 . Bibcode : 1972ITCmp.100.1197A . doi : 10.1109/TC.1972.223477 . ISSN 0018-9340 .
- ↑ Hopfield JJ (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias . 79 ( 8): 2554– 2558. Bibcode : 1982PNAS...79.2554H . doi : 10.1073/pnas.79.8.2554 . PMC 346238. PMID 6953413 .
- ↑ Espinosa-Sanchez JM, Gomez-Marin A, de Castro F (5 de julio de 2023). "La importancia de la neurociencia de Cajal y Lorente de Nó para el nacimiento de la cibernética" . The Neuroscientist . 31 (1): 14– 30. doi : 10.1177/10738584231179932 . hdl : 10261/348372 . ISSN 1073-8584 . PMID 37403768. Recuperado el 7 de agosto de 2024 .
{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ "circuito reverberante" . Oxford Reference . Consultado el 27 de julio de 2024 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Bozinovski, S. (1982). «Un sistema de autoaprendizaje mediante refuerzo secundario». En Trappl, Robert (ed.). Cibernética e investigación de sistemas: Actas de la Sexta Reunión Europea sobre Cibernética e Investigación de Sistemas. North-Holland. pp. 397–402. ISBN 978-0-444-86488-8
- ↑ Bozinovski S. (1995) "Agentes neurogenéticos y teoría estructural de los sistemas de aprendizaje por autorrefuerzo". Informe técnico CMPSCI 95-107, Universidad de Massachusetts en Amherst.Archivado el 8 de octubre de 2024 en Wayback Machine.
- ↑ Zajonc R (1980). "Sentir y pensar: las preferencias no necesitan inferencias" . American Psychologist . 35 (2): 151– 175. doi : 10.1037/0003-066X.35.2.151 .
- ↑ Lazarus RS (noviembre de 1982). "Reflexiones sobre las relaciones entre emoción y cognición" . American Psychologist . 37 (9): 1019– 1024. Bibcode : 1982AmPsy..37.1019L . doi : 10.1037/0003-066X.37.9.1019 . ISSN 1935-990X .
- ↑ Bozinovski S (2014). "Modelado de mecanismos de interacción cognición-emoción en redes neuronales artificiales desde 1981" (PDF) . Procedia Computer Science . 41 : 255–263 . doi : 10.1016/j.procs.2014.11.111 . Archivado del original el 23 de marzo de 2019.
- ↑ Schmidhuber J (abril de 1991). "Neural Sequence Chunkers" (PDF) . TR FKI-148, TU Munich . Archivado (PDF) del original el 14 de septiembre de 2024. Recuperado el 21 de septiembre de 2024 .
- ↑ Schmidhuber J (1992). "Aprendizaje de secuencias complejas y extendidas mediante el principio de compresión de historial (basado en TR FKI-148, 1991)" ( PDF) . Neural Computation . 4 (2): 234– 242. doi : 10.1162/neco.1992.4.2.234 . S2CID 18271205. Archivado (PDF) del original el 14 de septiembre de 2024. Recuperado el 21 de septiembre de 2024 .
- ↑ Schmidhuber J (1993). Tesis de habilitación: modelado y optimización de sistemas (PDF) . Archivado (PDF) del original el 7 de agosto de 2024. Recuperado el 21 de septiembre de 2024 .En la página 150 y siguientes se muestra la asignación de créditos a través del equivalente a 1200 capas en una RNN desplegada.
- ↑ S. Hochreiter., " Untersuchungen zu dynamischen neuronalen Netzen ", Archivado el 6 de marzo de 2015 en Wayback Machine , Tesis de diploma. Instituto f. Informática, Universidad Técnica. Munich. Asesor: J. Schmidhuber , 1991.
- ↑ Hochreiter S, et al. (15 de enero de 2001). «Flujo de gradiente en redes recurrentes: la dificultad de aprender dependencias a largo plazo» . En Kolen JF, Kremer SC (eds.). Guía práctica de redes recurrentes dinámicas . John Wiley & Sons. ISBN 978-0-7803-5369-5Archivado del original el 19 de mayo de 2024. Consultado el 26 de junio de 2017 .
- ↑ Sepp Hochreiter , Jürgen Schmidhuber (21 de agosto de 1995), Memoria a largo plazo , Wikidata Q98967430
- ↑ Hochreiter S , Schmidhuber J (1 de noviembre de 1997). "Memoria a corto y largo plazo". Neural Computation . 9 (8): 1735– 1780. doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .
- ↑ Gers F, Schmidhuber J, Cummins F (1999). "Aprender a olvidar: predicción continua con LSTM". 9.ª Conferencia Internacional sobre Redes Neuronales Artificiales: ICANN '99 . Vol. 1999. pp. 850–855 . doi : 10.1049/cp:19991218 . ISBN 0-85296-721-7.
- ↑ Ackley DH, Hinton GE, Sejnowski TJ (1 de enero de 1985). "Un algoritmo de aprendizaje para máquinas de Boltzmann" . Cognitive Science . 9 (1): 147–169 . doi : 10.1016/S0364-0213(85)80012-4 . ISSN 0364-0213 . Archivado del original el 17 de septiembre de 2024. Recuperado el 7 de agosto de 2024 .
- ↑ Smolensky P (1986). «Capítulo 6: Procesamiento de la información en sistemas dinámicos: Fundamentos de la teoría de la armonía» (PDF) . En Rumelhart DE, McLelland JL (eds.). Procesamiento distribuido en paralelo: Exploraciones en la microestructura de la cognición, Volumen 1: Fundamentos . MIT Press. pp. 194–281 . ISBN 0-262-68053-X. Archivado (PDF) del original el 14 de julio de 2023. Recuperado el 7 de agosto de 2024 .
- ↑ Peter D , Hinton GE , Neal RM , Zemel RS (1995). "La máquina de Helmholtz". Neural Computation . 7 (5): 889– 904. doi : 10.1162/neco.1995.7.5.889 . hdl : 21.11116/0000-0002-D6D3-E . PMID 7584891 . S2CID 1890561 .

- ↑ Hinton GE , Dayan P , Frey BJ , Neal R (26 de mayo de 1995). "El algoritmo de vigilia-sueño para redes neuronales no supervisadas". Science . 268 ( 5214): 1158–1161 . Bibcode : 1995Sci...268.1158H . doi : 10.1126/science.7761831 . PMID 7761831. S2CID 871473 .
- ↑ Schmidhuber J. «Cómo el aprendizaje profundo bioinspirado sigue ganando competiciones « la Biblioteca Kurzweil» . Archivado del original el 31 de agosto de 2018. Consultado el 19 de mayo de 2026 .
- ↑ "Cómo el aprendizaje profundo bioinspirado sigue ganando competiciones" . kurzweilai.net . Archivado del original el 31 de agosto de 2018. Consultado el 16 de junio de 2017 .
- ↑ Cireşan DC, Meier U, Gambardella LM, Schmidhuber J (21 de septiembre de 2010). "Redes neuronales profundas, grandes y simples para el reconocimiento de dígitos escritos a mano". Neural Computation . 22 (12): 3207– 3220. arXiv : 1003.0358 . Bibcode : 2010NeCom..22.3207C . doi : 10.1162/neco_a_00052 . ISSN 0899-7667 . PMID 20858131 . S2CID 1918673 .
- ↑ Ciresan DC, Meier U, Masci J, Gambardella L, Schmidhuber J (2011). "Redes neuronales convolucionales flexibles y de alto rendimiento para la clasificación de imágenes" (PDF) . Conferencia Internacional Conjunta sobre Inteligencia Artificial . doi : 10.5591/978-1-57735-516-8/ijcai11-210 . Archivado (PDF) del original el 29 de septiembre de 2014. Recuperado el 13 de junio de 2017 .
- ↑ Ciresan D, Giusti A, Gambardella LM, Schmidhuber J (2012). Pereira F, Burges CJ, Bottou L, Weinberger KQ (eds.). Advances in Neural Information Processing Systems 25 (PDF) . Curran Associates, Inc. pp. 2843–2851 . Archivado (PDF) del original el 9 de agosto de 2017. Recuperado el 13 de junio de 2017 .
- ↑ Ciresan D, Giusti A, Gambardella L, Schmidhuber J (2013). "Detección de mitosis en imágenes histológicas de cáncer de mama con redes neuronales profundas". Medical Image Computing and Computer-Assisted Intervention – MICCAI 2013. Lecture Notes in Computer Science. Vol. 7908. pp. 411–418 . doi : 10.1007/978-3-642-40763-5_51 . ISBN 978-3-642-38708-1. PMID 24579167 .
- ↑ Ciresan D, Meier U, Schmidhuber J (2012). "Redes neuronales profundas multicolumna para la clasificación de imágenes". Conferencia IEEE de 2012 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 3642–3649 . arXiv : 1202.2745 . doi : 10.1109/cvpr.2012.6248110 . ISBN 978-1-4673-1228-8. S2CID 2161592 .
- ↑ Krizhevsky A, Sutskever I, Hinton G (2012). "Clasificación de ImageNet con redes neuronales convolucionales profundas" (PDF) . NIPS 2012: Neural Information Processing Systems, Lake Tahoe, Nevada . Archivado (PDF) del original el 10 de enero de 2017. Recuperado el 24 de mayo de 2017 .
- ↑ Simonyan K, Andrew Z (2014). "Redes neuronales convolucionales muy profundas para el reconocimiento de imágenes a gran escala". arXiv : 1409.1556 [ cs.CV ].
- ↑ Szegedy C (2015). "Going deeper with convolutions" (PDF) . Cvpr2015 . arXiv : 1409.4842 . Archivado (PDF) del original el 30 de septiembre de 2024. Recuperado el 7 de agosto de 2024 .
- ↑ Ng A, Dean J (2012). "Building High-level Features Using Large Scale Unsupervised Learning". arXiv : 1112.6209 [ cs.LG ].
- 1 2 Ian Goodfellow y Yoshua Bengio y Aaron Courville (2016). Aprendizaje profundo . MIT Press. Archivado del original el 16 de abril de 2016. Recuperado el 1 de junio de 2016 .
- 1 2 Billings SA (2013). Identificación de sistemas no lineales: métodos NARMAX en los dominios del tiempo, la frecuencia y el espacio-temporal . Wiley. ISBN 978-1-119-94359-4.
- ↑ Goodfellow I, Pouget-Abadie J, Mirza M, Xu B, Warde-Farley D, Ozair S, et al. (2014). Generative Adversarial Networks (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 . Archivado (PDF) del original el 22 de noviembre de 2019. Recuperado el 20 de agosto de 2019 .
- ↑ Schmidhuber J (1991). "Una posibilidad para implementar la curiosidad y el aburrimiento en controladores neuronales de modelado". Proc. SAB'1991 . MIT Press/Bradford Books. pp. 222–227 .
- ↑ Schmidhuber J (2020). "Las redes generativas adversarias son casos especiales de curiosidad artificial (1990) y también están estrechamente relacionadas con la minimización de la predictibilidad (1991)". Redes neuronales . 127 : 58–66 . arXiv : 1906.04493 . doi : 10.1016/j.neunet.2020.04.008 . PMID 32334341. S2CID 216056336 .
- ↑ "GAN 2.0: Generador de rostros hiperrealistas de NVIDIA" . SyncedReview.com . 14 de diciembre de 2018. Archivado del original el 12 de septiembre de 2024. Consultado el 3 de octubre de 2019 .
- ↑ Karras T, Aila T, Laine S, Lehtinen J (26 de febrero de 2018). "Crecimiento progresivo de GANs para mejorar la calidad, la estabilidad y la variación". arXiv : 1710.10196 [ cs.NE ].
- ↑ "Prepárense, no se asusten: Medios sintéticos y deepfakes" . witness.org. Archivado del original el 2 de diciembre de 2020. Consultado el 25 de noviembre de 2020 .
- ↑ Sohl-Dickstein J, Weiss E, Maheswaranathan N, Ganguli S (1 de junio de 2015). "Aprendizaje profundo no supervisado mediante termodinámica de no equilibrio" (PDF) . Actas de la 32.ª Conferencia Internacional sobre Aprendizaje Automático . 37. PMLR: 2256–2265 . arXiv : 1503.03585 . Archivado (PDF) del original el 21 de septiembre de 2024. Recuperado el 7 de agosto de 2024 .
- ↑ Simonyan K, Zisserman A (10 de abril de 2015). "Redes neuronales convolucionales muy profundas para el reconocimiento de imágenes a gran escala". arXiv : 1409.1556 [ cs.CV ].
- ↑ He K, Zhang X, Ren S, Sun J (2016). "Profundizando en los rectificadores: superando el rendimiento a nivel humano en la clasificación de ImageNet". arXiv : 1502.01852 [ cs.CV ].
- ↑ He K, Zhang X, Ren S, Sun J (10 de diciembre de 2015). Aprendizaje residual profundo para el reconocimiento de imágenes . arXiv : 1512.03385 .
- ^ Srivastava RK, Greff K, Schmidhuber J (2 de mayo de 2015). "Redes de Carreteras". arXiv : 1505.00387 [ cs.LG ].
- ↑ He K, Zhang X, Ren S, Sun J (2016). "Aprendizaje residual profundo para el reconocimiento de imágenes". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 770–778 . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 . ISBN 978-1-4673-8851-1.
- ↑ Linn A (10 de diciembre de 2015). "Investigadores de Microsoft ganan el desafío de visión por computadora ImageNet" . The AI Blog . Recuperado el 29 de junio de 2024 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ Schmidhuber J (1992). "Aprendizaje para controlar memorias de peso rápido: una alternativa a las redes recurrentes" (PDF) . Neural Computation . 4 (1): 131– 139. doi : 10.1162/neco.1992.4.1.131 . S2CID 16683347 .
- ↑ Katharopoulos A, Vyas A, Pappas N, Fleuret F (2020). "Los transformadores son RNN: transformadores autorregresivos rápidos con atención lineal" . ICML 2020. PMLR. págs. 5156–5165 . Archivado del original el 11 de julio de 2023. Recuperado el 21 de septiembre de 2024 .
- ↑ Schlag I, Irie K, Schmidhuber J (2021). "Los transformadores lineales son programadores de peso secretamente rápidos". ICML 2021. Springer. pp. 9355–9366 .
- ↑ Wolf T, Debut L, Sanh V, Chaumond J, Delangue C, Moi A, et al. (2020). "Transformers: State-of-the-Art Natural Language Processing". Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural: Demostraciones de Sistemas . págs. 38–45 . doi : 10.18653/v1/2020.emnlp-demos.6 . S2CID 208117506 .
- ↑ Abbod MF (2007). "Aplicación de la inteligencia artificial al manejo del cáncer urológico". The Journal of Urology . 178 (4): 1150– 1156. doi : 10.1016/j.juro.2007.05.122 . PMID 17698099 .
- ↑ Dawson CW (1998). "Un enfoque de red neuronal artificial para la modelización de la escorrentía pluvial" . Hydrological Sciences Journal . 43 (1): 47– 66. Bibcode : 1998HydSJ..43...47D . doi : 10.1080/02626669809492102 .
- 1 2 "El diccionario de aprendizaje automático" . cse.unsw.edu.au. Archivado del original el 26 de agosto de 2018. Recuperado el 4 de noviembre de 2009 .
- ↑ Kufel J, Bargieł-Łączek K, Kocot S, Koźlik M, Bartnikowska W, Janik M, et al. (3 de agosto de 2023). "¿Qué son el aprendizaje automático, las redes neuronales artificiales y el aprendizaje profundo? - Ejemplos de aplicaciones prácticas en medicina" . Diagnostics (Basilea, Suiza) . 13 (15): 2582. doi : 10.3390/diagnostics13152582 . ISSN 2075-4418 . PMC 10417718. PMID 37568945 .
- ↑ Sazlı MH (1 de enero de 2006). "Una breve revisión de las redes neuronales de alimentación directa" . Communications Faculty of Sciences University of Ankara Series A2-A3 Physical Sciences and Engineering . 50 (1): 11– 17. Bibcode : 2006CFSAU..50...11M . doi : 10.1501/commua1-2_0000000026 . ISSN 1303-6009 .
- ↑ Inteligencia artificial (3.ª ed.). Addison-Wesley Pub. Co. 1992. ISBN 0-201-53377-4.
- ^ Zell A (2003) . "capítulo 5.2". Simulación neuronaler Netze [ Simulación de redes neuronales ] (en alemán) (1ª ed.). Addison-Wesley. ISBN 978-3-89319-554-1OCLC 249017987
- ↑ Elizondo D, Fiesler E (octubre de 1997). "Un estudio de redes neuronales parcialmente conectadas" . International Journal of Neural Systems . 08 (5n06): 535– 558. doi : 10.1142/S0129065797000513 . ISSN 0129-0657 . PMID 10065835 .
- ↑ Ciresan D, Ueli Meier, Jonathan Masci, Luca M. Gambardella, Jurgen Schmidhuber (2011). "Redes neuronales convolucionales flexibles y de alto rendimiento para la clasificación de imágenes" (PDF) . Actas de la Vigésimo Segunda Conferencia Internacional Conjunta sobre Inteligencia Artificial - Volumen Dos . 2 : 1237–1242 . Archivado (PDF) del original el 5 de abril de 2022. Recuperado el 7 de julio de 2022 .
- ↑ Herberg E (18 de abril de 2023). "Notas de clase: Arquitecturas de redes neuronales". arXiv : 2304.05133 [ cs.LG ].
- ^ Zell A (1994). Simulación Neuronaler Netze [ Simulación de redes neuronales ] (en alemán) (1ª ed.). Addison-Wesley. pag. 73 . ISBN 3-89319-554-8.
- ↑ Miljanovic M (febrero-marzo de 2012). "Análisis comparativo de redes neuronales de respuesta de impulso recurrente y finita en la predicción de series temporales" (PDF) . Indian Journal of Computer and Engineering . 3 (1). Archivado (PDF) del original el 19 de mayo de 2024. Recuperado el 21 de agosto de 2019 .
- 1 2 Vapnik VN, Vapnik VN (1998). La naturaleza de la teoría del aprendizaje estadístico (2.ª edición corregida ). Nueva York Berlín Heidelberg: Springer. ISBN 978-0-387-94559-0.
- ↑ Kelleher JD, Mac Namee B, D'Arcy A (2020). "7-8". Fundamentos del aprendizaje automático para el análisis predictivo de datos: algoritmos, ejemplos prácticos y estudios de caso (2.ª ed.). Cambridge, MA: The MIT Press. ISBN 978-0-262-36110-1OCLC 1162184998
- ^ Terven J, Cordova-Esparza DM, Romero-González JA, Ramírez-Pedraza A, Chávez-Urbiola EA (11 de abril de 2025). "Un estudio completo de métricas y funciones de pérdida en el aprendizaje profundo" . Revisión de inteligencia artificial . 58 (7) 195. doi : 10.1007/s10462-025-11198-7 . ISSN 1573-7462 .
- ↑ Huang GB, Zhu QY, Siew CK (2006). "Máquina de aprendizaje extremo: teoría y aplicaciones". Neurocomputing . 70 (1): 489– 501. CiteSeerX 10.1.1.217.3692 . doi : 10.1016/j.neucom.2005.12.126 . S2CID 116858 .
- ↑ Widrow B, et al. (2013). "El algoritmo sin prop: un nuevo algoritmo de aprendizaje para redes neuronales multicapa". Redes neuronales . 37 : 182–188 . doi : 10.1016/j.neunet.2012.09.020 . PMID 23140797 .
- ↑ Ollivier Y, Charpiat G (2015). "Entrenamiento de redes recurrentes sin retroceso". arXiv : 1507.07680 [ cs.NE ].
- ↑ Hinton GE (2010). "Guía práctica para el entrenamiento de máquinas de Boltzmann restringidas" . Informe técnico UTML TR 2010-003 . Archivado del original el 9 de mayo de 2021. Consultado el 27 de junio de 2017 .
- ↑ "¿Qué es la optimización de hiperparámetros? IBM" . www.ibm.com . 23 de julio de 2024.
- ↑ Goodfellow I, Bengio Y, Courville A (2016). "8". Aprendizaje profundo . Cambridge, Mass: The MIT Press. pp. 271–274 . ISBN 978-0-262-03561-3Consultado el 26 de octubre de 2025 .
- ↑ Bischl B, Binder M, Lang M, Pielok T, Richter J, Coors S, et al. (marzo de 2023). "Optimización de hiperparámetros: fundamentos, algoritmos, mejores prácticas y desafíos abiertos". WIREs Data Mining and Knowledge Discovery . 13 (2) e1484. doi : 10.1002/widm.1484 .
- ↑ Wei J (26 de abril de 2019). "Olvídese de la tasa de aprendizaje, pérdida de decaimiento". arXiv : 1905.00094 [ cs.LG ].
- ↑ Li Y, Fu Y, Li H, Zhang SW (1 de junio de 2009). "Algoritmo de entrenamiento mejorado de redes neuronales de retropropagación con tasa de aprendizaje auto-adaptativa". Conferencia Internacional de 2009 sobre Inteligencia Computacional y Computación Natural . Vol. 1. págs. 73–76 . doi : 10.1109/CINC.2009.111 . ISBN 978-0-7695-3645-3. S2CID 10557754 .
- ↑ Bernard E (2021). Introducción al aprendizaje automático . Champaign: Wolfram Media. pág. 9. ISBN 978-1-57955-048-6Archivado del original el 19 de mayo de 2024. Consultado el 22 de marzo de 2023 .
- ↑ Bernard E (2021). Introducción al aprendizaje automático . Champaign: Wolfram Media. pág. 12. ISBN 978-1-57955-048-6Archivado del original el 19 de mayo de 2024. Consultado el 22 de marzo de 2023 .
- ↑ Bernard E (2021). Introducción al aprendizaje automático . Wolfram Media Inc. pág. 9. ISBN 978-1-57955-048-6Archivado del original el 19 de mayo de 2024. Consultado el 28 de julio de 2022 .
- ↑ Ojha VK, Abraham A, Snášel V (1 de abril de 2017). "Diseño metaheurístico de redes neuronales de alimentación directa: una revisión de dos décadas de investigación". Aplicaciones de ingeniería de la inteligencia artificial . 60 : 97–116 . arXiv : 1705.05584 . Bibcode : 2017arXiv170505584O . doi : 10.1016/j.engappai.2017.01.013 . S2CID 27910748 .
- ↑ Bouchard L (25 de noviembre de 2020). "¿Qué es el aprendizaje autosupervisado? | ¿Podrán las máquinas aprender alguna vez como los humanos?" . Medium . Consultado el 9 de junio de 2021 .
- ↑ Doersch C, Zisserman A (octubre de 2017). "Aprendizaje visual autosupervisado multitarea" . Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2017. IEEE. págs. 2070–2079 . arXiv : 1708.07860 . doi : 10.1109/iccv.2017.226 . ISBN 978-1-5386-1032-9. S2CID 473729 .
- ↑ Beyer L, Zhai X, Oliver A, Kolesnikov A (octubre de 2019). "S4L: Aprendizaje semisupervisado auto-supervisado" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 1476–1485 . arXiv : 1905.03670 . doi : 10.1109/iccv.2019.00156 . ISBN 978-1-7281-4803-8. S2CID 167209887 .
- ↑ Doersch C, Gupta A, Efros AA (diciembre de 2015). "Aprendizaje de representación visual no supervisado mediante predicción de contexto" . Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2015. IEEE. págs. 1422–1430 . arXiv : 1505.05192 . doi : 10.1109/iccv.2015.167 . ISBN 978-1-4673-8391-2. S2CID 9062671 .
- ↑ Zheng X, Wang Y, Wang G, Liu J (abril de 2018). "Segmentación rápida y robusta de imágenes de glóbulos blancos mediante aprendizaje autosupervisado" . Micron . 107 : 55–71 . doi : 10.1016/j.micron.2018.01.010 . ISSN 0968-4328 . PMID 29425969. S2CID 3796689 .
- ↑ Gidaris S, Bursuc A, Komodakis N, Perez PP, Cord M (octubre de 2019). "Mejora del aprendizaje visual con pocos ejemplos mediante auto-supervisión" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2019. IEEE. págs. 8058–8067 . arXiv : 1906.05186 . doi : 10.1109/iccv.2019.00815 . ISBN 978-1-7281-4803-8. S2CID 186206588 .
- ↑ "Wav2vec: Reconocimiento de voz de última generación mediante auto-supervisión" . ai.facebook.com . Consultado el 9 de junio de 2021 .
- ↑ Dominic, S., Das, R., Whitley, D., Anderson, C. (julio de 1991). "Aprendizaje genético por refuerzo para redes neuronales" . IJCNN-91 - Conferencia Internacional Conjunta de Seattle sobre Redes Neuronales . IJCNN-91 - Conferencia Internacional Conjunta de Seattle sobre Redes Neuronales. Seattle, Washington, EE. UU.: IEEE. págs. 71-76 . doi : 10.1109/IJCNN.1991.155315 . ISBN 0-7803-0164-1.
- ↑ Hoskins J, Himmelblau, DM (1992). "Control de procesos mediante redes neuronales artificiales y aprendizaje por refuerzo" . Computers & Chemical Engineering . 16 (4): 241– 251. doi : 10.1016/0098-1354(92)80045-B .
- ↑ Bertsekas D, Tsitsiklis J (1996). Programación neurodinámica . Athena Scientific. pág. 512. ISBN 978-1-886529-10-6Archivado del original el 29 de junio de 2017. Consultado el 17 de junio de 2017 .
- ↑ Secomandi N (2000). "Comparación de algoritmos de programación neurodinámica para el problema de enrutamiento de vehículos con demandas estocásticas" . Computers & Operations Research . 27 ( 11–12 ): 1201–1225 . CiteSeerX 10.1.1.392.4034 . doi : 10.1016/S0305-0548(99)00146-X .
- ↑ de Rigo, D., Rizzoli, AE, Soncini-Sessa, R., Weber, E., Zenesi, P. (2001). "Programación neurodinámica para la gestión eficiente de redes de embalses" . Actas de MODSIM 2001, Congreso Internacional sobre Modelado y Simulación . MODSIM 2001, Congreso Internacional sobre Modelado y Simulación. Canberra, Australia: Sociedad de Modelado y Simulación de Australia y Nueva Zelanda. doi : 10.5281/zenodo.7481 . ISBN 0-86740-525-2Archivado del original el 7 de agosto de 2013. Consultado el 29 de julio de 2013 .
- ↑ Damas, M., Salmeron, M., Diaz, A., Ortega, J., Prieto, A., Olivares, G. (2000). "Algoritmos genéticos y programación neurodinámica: aplicación a redes de suministro de agua". Actas del Congreso de Computación Evolutiva de 2000. Congreso de Computación Evolutiva de 2000. Vol. 1. La Jolla, California, EE. UU.: IEEE. págs. 7–14 . doi : 10.1109/CEC.2000.870269 . ISBN 0-7803-6375-2.
- ↑ Deng G, Ferris, MC (2008). "Programación neurodinámica para la planificación de radioterapia fraccionada". Optimización en Medicina . Springer Optimization and Its Applications. Vol. 12. pp. 47–70 . CiteSeerX 10.1.1.137.8288 . doi : 10.1007/978-0-387-73299-2_3 . ISBN 978-0-387-73298-5.
- ↑ Bozinovski, S. (1982). «Un sistema de autoaprendizaje mediante refuerzo secundario». En R. Trappl (ed.) Cibernética e investigación de sistemas: Actas de la Sexta Reunión Europea sobre Cibernética e Investigación de Sistemas. North Holland. pp. 397–402. ISBN 978-0-444-86488-8.
- ↑ Bozinovski, S. (2014) " Modelado de mecanismos de interacción cognición-emoción en redes neuronales artificiales, desde 1981. Archivado el 23 de marzo de 2019 en Wayback Machine ". Procedia Computer Science, págs. 255-263.
- ↑ Bozinovski S, Bozinovska L (2001). "Agentes de autoaprendizaje: una teoría conexionista de la emoción basada en el juicio de valor de la barra transversal". Cibernética y Sistemas . 32 (6): 637– 669. doi : 10.1080/01969720118145 . S2CID 8944741 .
- ↑ Salimans T, Ho J, Chen X, Sidor S, Sutskever I (7 de septiembre de 2017). "Estrategias evolutivas como alternativa escalable al aprendizaje por refuerzo". arXiv : 1703.03864 [ stat.ML ].
- ↑ Such FP, Madhavan V, Conti E, Lehman J, Stanley KO, Clune J (20 de abril de 2018). "Neuroevolución profunda: los algoritmos genéticos son una alternativa competitiva para entrenar redes neuronales profundas para el aprendizaje por refuerzo". arXiv : 1712.06567 [ cs.NE ].
- ↑ "La inteligencia artificial puede 'evolucionar' para resolver problemas" . Ciencia | AAAS . 10 de enero de 2018. Archivado del original el 9 de diciembre de 2021. Consultado el 7 de febrero de 2018 .
- ↑ Ackley DH, Hinton GE, Sejnowski TJ (1985). "Un algoritmo de aprendizaje para máquinas de Boltzmann". Cognitive Science . 9 (1): 147– 169. doi : 10.1207/s15516709cog0901_7 .
- ↑ Turchetti C (2004). Modelos estocásticos de redes neuronales . Fronteras en inteligencia artificial y aplicaciones: Sistemas de ingeniería inteligente basados en el conocimiento. Vol. 102. IOS Press. ISBN 978-1-58603-388-0.
- ↑ Jospin LV, Laga H, Boussaid F, Buntine W, Bennamoun M (2022). "Redes neuronales bayesianas prácticas: un tutorial para usuarios de aprendizaje profundo". IEEE Computational Intelligence Magazine . Vol. 17, n.º 2. págs. 29–48 . arXiv : 2007.06823 . doi : 10.1109/mci.2022.3155327 . ISSN 1556-603X . S2CID 220514248 .
- ↑ Cang Z, Wei GW (27 de julio de 2017). "TopologyNet: Redes neuronales profundas convolucionales y multitarea basadas en topología para predicciones de propiedades biomoleculares" . PLOS Computational Biology . 13 (7) e1005690. arXiv : 1704.00063 . Bibcode : 2017PLSCB..13E5690C . doi : 10.1371/journal.pcbi.1005690 . ISSN 1553-7358 . PMC 5549771. PMID 28749969 .
- ↑ de Rigo, D., Castelletti, A., Rizzoli, AE, Soncini-Sessa, R., Weber, E. (enero de 2005). "Una técnica de mejora selectiva para acelerar la programación neurodinámica en la gestión de redes de recursos hídricos" . En Pavel Zítek (ed.). Actas del 16.º Congreso Mundial de la IFAC – IFAC-PapersOnLine . 16.º Congreso Mundial de la IFAC . Vol. 16. Praga, República Checa: IFAC. págs. 7–12 . doi : 10.3182/20050703-6-CZ-1902.02172 . hdl : 11311/255236 . ISBN 978-3-902661-75-3Archivado del original el 26 de abril de 2012. Consultado el 30 de diciembre de 2011 .
- ↑ Ferreira C (2006). "Diseño de redes neuronales mediante programación de expresión génica". En A. Abraham, B. de Baets, M. Köppen, B. Nickolay (eds.). Tecnologías de computación blanda aplicadas: El desafío de la complejidad (PDF) . Springer-Verlag. pp. 517–536 . Archivado (PDF) del original el 19 de diciembre de 2013. Recuperado el 8 de octubre de 2012 .
- ↑ Da, Y., Xiurun, G. (julio de 2005). "Una ANN basada en PSO mejorada con técnica de recocido simulado" . En T. Villmann (ed.). Nuevos aspectos en neurocomputación: 11.º Simposio Europeo sobre Redes Neuronales Artificiales . Vol. 63. Elsevier. págs. 527–533 . doi : 10.1016/j.neucom.2004.07.002 . Archivado del original el 25 de abril de 2012. Recuperado el 30 de diciembre de 2011 .
- ↑ Wu, J., Chen, E. (mayo de 2009). "Un novedoso conjunto de regresión no paramétrica para la predicción de lluvias mediante la técnica de optimización por enjambre de partículas acoplada con redes neuronales artificiales" . En Wang, H., Shen, Y., Huang, T., Zeng, Z. (eds.). 6.º Simposio Internacional sobre Redes Neuronales, ISNN 2009. Lecture Notes in Computer Science. Vol. 5553. Springer. pp. 49–58 . doi : 10.1007/978-3-642-01513-7_6 . ISBN 978-3-642-01215-0Archivado del original el 31 de diciembre de 2014. Consultado el 1 de enero de 2012 .
- 1 2 Ting Qin, Zonghai Chen, Haitao Zhang, Sifu Li, Wei Xiang, Ming Li (2004). "Un algoritmo de aprendizaje de CMAC basado en RLS" ( PDF) . Neural Processing Letters . 19 (1): 49– 61. doi : 10.1023/B:NEPL.0000016847.18175.60 . S2CID 6233899. Archivado (PDF) del original el 14 de abril de 2021. Recuperado el 30 de enero de 2019 .
- ↑ Ting Qin, Haitao Zhang, Zonghai Chen, Wei Xiang (2005). "CMAC-QRLS continuo y su matriz sistólica" ( PDF) . Neural Processing Letters . 22 (1): 1– 16. doi : 10.1007/s11063-004-2694-0 . S2CID 16095286. Archivado (PDF) del original el 18 de noviembre de 2018. Recuperado el 30 de enero de 2019 .
- ↑ LeCun Y, Boser B, Denker JS, Henderson D, Howard RE, Hubbard W, et al. (1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos" . Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . S2CID 41312633 .
- ↑ Yann LeCun (2016). Diapositivas sobre aprendizaje profundo en línea. Archivadas el 23 de abril de 2016 en Wayback Machine.
- ^ Silver D , Hubert T, Schrittwieser J, Antonoglou I, Lai M, Guez A, et al. (5 de diciembre de 2017). "Dominar el ajedrez y el shogi mediante el juego autónomo con un algoritmo de aprendizaje por refuerzo general". arXiv : 1712.01815 [ cs.AI ].
- ↑ Goodfellow I, Pouget-Abadie J, Mirza M, Xu B, Warde-Farley D, Ozair S, et al. (2014). Generative Adversarial Networks (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 . Archivado (PDF) del original el 22 de noviembre de 2019. Recuperado el 20 de agosto de 2019 .
- ↑ Probst P, Boulesteix AL, Bischl B (26 de febrero de 2018). "Ajustabilidad: Importancia de los hiperparámetros de los algoritmos de aprendizaje automático". J. Mach. Learn. Res . 20 : 53:1–53:32. S2CID 88515435 .
- ↑ Zoph B, Le QV (4 de noviembre de 2016). "Búsqueda de arquitectura neuronal con aprendizaje por refuerzo". arXiv : 1611.01578 [ cs.LG ].
- ↑ Haifeng Jin, Qingquan Song, Xia Hu (2019). "Auto-keras: Un sistema eficiente de búsqueda de arquitectura neuronal" . Actas de la 25.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos . ACM. arXiv : 1806.10282 . Archivado del original el 21 de agosto de 2019. Recuperado el 21 de agosto de 2019 a través de autokeras.com.
- ^ Claesen M, De Moor B (2015). "Búsqueda de hiperparámetros en aprendizaje automático". arXiv : 1502.02127 [ cs.LG ].Bibcode : 2015arXiv150202127C
- ↑ Siegelmann H, Sontag E (1991). "Turing computability with neural nets" (PDF) . Appl. Math. Lett . 4 (6): 77– 80. doi : 10.1016/0893-9659(91)90080-F . Archivado (PDF) del original el 19 de mayo de 2024. Recuperado el 10 de enero de 2017 .
- ↑ Bains S (3 de noviembre de 1998). "La computadora analógica supera al modelo de Turing" . EE Times . Archivado del original el 11 de mayo de 2023. Recuperado el 11 de mayo de 2023 .
- ↑ Balcázar J (julio de 1997). "Poder computacional de las redes neuronales: una caracterización de la complejidad de Kolmogorov" . IEEE Transactions on Information Theory . 43 (4): 1175– 1183. CiteSeerX 10.1.1.411.7782 . doi : 10.1109/18.605580 .
- ↑ Gerald F (2019). "Reproducibilidad y diseño experimental para el aprendizaje automático en datos de audio y multimedia". Actas de la 27.ª Conferencia Internacional ACM sobre Multimedia . ACM . págs. 2709–2710 . doi : 10.1145/3343031.3350545 . ISBN 978-1-4503-6889-6. S2CID 204837170 .
- ↑ "¡Deja de trastear y empieza a medir! Diseño experimental predecible de experimentos con redes neuronales" . The Tensorflow Meter . Archivado del original el 18 de abril de 2022. Consultado el 10 de marzo de 2020 .
- ↑ MacKay DJ (2003). Teoría de la información, inferencia y algoritmos de aprendizaje (PDF) . Cambridge University Press . ISBN 978-0-521-64298-9. Archivado (PDF) del original el 19 de octubre de 2016. Recuperado el 11 de junio de 2016 .
- ↑ Lee J, Xiao L, Schoenholz SS, Bahri Y, Novak R, Sohl-Dickstein J, et al. (2020). "Las redes neuronales amplias de cualquier profundidad evolucionan como modelos lineales bajo descenso de gradiente". Journal of Statistical Mechanics: Theory and Experiment . 2020 (12): 124002. arXiv : 1902.06720 . Bibcode : 2020JSMTE2020l4002L . doi : 10.1088/1742-5468/abc62b . S2CID 62841516 .
- ↑ Arthur Jacot, Franck Gabriel, Clement Hongler (2018). Neural Tangent Kernel: Convergence and Generalization in Neural Networks (PDF) . 32.ª Conferencia sobre Sistemas de Procesamiento de Información Neuronal (NeurIPS 2018), Montreal, Canadá. Archivado (PDF) del original el 22 de junio de 2022. Recuperado el 4 de junio de 2022 .
- ↑ Xu ZJ, Zhang Y, Xiao Y (2019). "Comportamiento de entrenamiento de redes neuronales profundas en el dominio de la frecuencia". En Gedeon T, Wong K, Lee M (eds.). Procesamiento de información neuronal . Lecture Notes in Computer Science. Vol. 11953. Springer, Cham. pp. 264–274 . arXiv : 1807.01251 . doi : 10.1007/978-3-030-36708-4_22 . ISBN 978-3-030-36707-7. S2CID 49562099 .
- ↑ Nasim Rahaman, Aristide Baratin, Devansh Arpit, Felix Draxler, Min Lin, Fred Hamprecht, et al. (2019). "Sobre el sesgo espectral de las redes neuronales" (PDF) . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático . 97 : 5301–5310 . arXiv : 1806.08734 . Archivado (PDF) del original el 22 de octubre de 2022. Recuperado el 4 de junio de 2022 .
- ^ Tao Luo, Zheng Ma, Zhi-Qin John Xu, Yaoyu Zhang (2019). "Teoría del principio de frecuencia para redes neuronales profundas generales". Transacciones CSIAM sobre Matemática Aplicada . 2 (3): 484– 507. arXiv : 1906.09235 . doi : 10.4208/csiam-am.SO-2020-0005 .
- ↑ Xu ZJ, Zhou H (18 de mayo de 2021). "Principio de frecuencia profunda para comprender por qué el aprendizaje profundo es más rápido" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 35 (12): 10541– 10550. arXiv : 2007.14313 . doi : 10.1609/aaai.v35i12.17261 . ISSN 2374-3468 . S2CID 220831156. Archivado del original el 5 de octubre de 2021. Recuperado el 5 de octubre de 2021 .
- ↑ Esch R (1990). "Aproximación funcional". Manual de matemáticas aplicadas ( edición de Springer US). Boston, MA: Springer US. págs. 928–987 . doi : 10.1007/978-1-4684-1423-3_17 . ISBN 978-1-4684-1423-3.
- ↑ Sarstedt M, Moo E (2019). "Análisis de regresión" . Una guía concisa para la investigación de mercado . Textos de Springer en negocios y economía. Springer Berlin Heidelberg. págs. 209–256 . doi : 10.1007/978-3-662-56707-4_7 . ISBN 978-3-662-56706-7. S2CID 240396965 . Archivado del original el 20 de marzo de 2023 . Recuperado el 20 de marzo de 2023 .
- ↑ Tian J, Tan Y, Sun C, Zeng J, Jin Y (diciembre de 2016). "Una aproximación de aptitud basada en similitud auto-adaptativa para la optimización evolutiva". 2016 IEEE Symposium Series on Computational Intelligence (SSCI) . págs. 1–8 . doi : 10.1109/SSCI.2016.7850209 . ISBN 978-1-5090-4240-1. S2CID 14948018 .
- ↑ Alaloul WS, Qureshi AH (2019). "Procesamiento de datos mediante redes neuronales artificiales" . Asimilación dinámica de datos: superando las incertidumbres . doi : 10.5772/intechopen.91935 . ISBN 978-1-83968-083-0. S2CID 219735060 . Archivado del original el 20 de marzo de 2023 . Recuperado el 20 de marzo de 2023 .
- ↑ Pal M, Roy R, Basu J, Bepari MS (2013). "Separación ciega de fuentes: una revisión y análisis". Conferencia Internacional Oriental COCOSDA 2013, celebrada conjuntamente con la Conferencia sobre Investigación y Evaluación del Lenguaje Hablado Asiático 2013 (O-COCOSDA/CASLRE) . IEEE. págs. 1–5 . doi : 10.1109/ICSDA.2013.6709849 . ISBN 978-1-4799-2378-6. S2CID 37566823 .
- ↑ Zissis D (octubre de 2015). "Una arquitectura basada en la nube capaz de percibir y predecir el comportamiento de múltiples embarcaciones" . Applied Soft Computing . 35 : 652–661 . doi : 10.1016/j.asoc.2015.07.002 . Archivado del original el 26 de julio de 2020. Recuperado el 18 de julio de 2019 .
- ↑ Sengupta N, Sahidullah, Md, Saha, Goutam (agosto de 2016). "Clasificación de sonidos pulmonares mediante características estadísticas basadas en cepstrales". Computers in Biology and Medicine . 75 (1): 118– 129. doi : 10.1016/j.compbiomed.2016.05.013 . PMID 27286184 .
- ↑ Choy CB, Xu D, Gwak J, Chen K, Savarese S (2016). "3D-R2N2: Un enfoque unificado para la reconstrucción de objetos 3D de una y varias vistas". arXiv : 1604.00449 [ cs.CV ].
- ↑ Turek, Fred D. (marzo de 2007). "Introducción a la visión artificial con redes neuronales" . Vision Systems Design . 12 (3). Archivado del original el 16 de mayo de 2013. Recuperado el 5 de marzo de 2013 .
- ↑ Maitra DS, Bhattacharya U, Parui SK (agosto de 2015). "Enfoque común basado en CNN para el reconocimiento de caracteres manuscritos de múltiples escrituras". 13.ª Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (ICDAR) de 2015. págs. 1021–1025 . doi : 10.1109/ICDAR.2015.7333916 . ISBN 978-1-4799-1805-8. S2CID 25739012 .
- ↑ Gessler J (agosto de 2021). "Sensor para análisis de alimentos mediante espectroscopia de impedancia y redes neuronales artificiales" . RiuNet UPV (1): 8–12 . Archivado del original el 21 de octubre de 2021. Consultado el 21 de octubre de 2021 .
- ↑ French J (2016). "El CAPM del viajero en el tiempo". Investment Analysts Journal . 46 (2): 81– 96. doi : 10.1080/10293523.2016.1255469 . S2CID 157962452 .
- ↑ Roman M. Balabin, Ekaterina I. Lomakina (2009). "Enfoque de redes neuronales para datos de química cuántica: predicción precisa de energías de la teoría del funcional de la densidad". J. Chem. Phys. 131 (7): 074104. Bibcode : 2009JChPh.131g4104B . doi : 10.1063/1.3206326 . PMID 19708729 .
- ↑ Silver D, et al. (2016). "Dominando el juego de Go con redes neuronales profundas y búsqueda en árbol" ( PDF) . Nature . 529 (7587): 484– 489. Bibcode : 2016Natur.529..484S . doi : 10.1038/nature16961 . PMID 26819042. S2CID 515925. Archivado (PDF) del original el 23 de noviembre de 2018. Recuperado el 31 de enero de 2019 .
- ↑ Pasick A (27 de marzo de 2023). «Glosario de inteligencia artificial: explicación de redes neuronales y otros términos» . The New York Times . ISSN 0362-4331 . Archivado del original el 1 de septiembre de 2023. Consultado el 22 de abril de 2023 .
- ↑ Schechner S (15 de junio de 2017). "Facebook impulsa la IA para bloquear la propaganda terrorista" . The Wall Street Journal . ISSN 0099-9660 . Archivado del original el 19 de mayo de 2024. Consultado el 16 de junio de 2017 .
- ↑ Ciaramella A , Ciaramella M (2024). Introducción a la inteligencia artificial: del análisis de datos a la IA generativa . Intellisemantic Editions. ISBN 978-8-8947-8760-3.
- ↑ Maity A (marzo de 2026). "CrisisSense: Transformando señales sociales en información sobre desastres en tiempo real mediante inteligencia neuronal profunda". Conferencia de la Sección de Madhya Pradesh del IEEE de 2026 (MPCON) . págs. 1501–1506 . doi : 10.1109/MPCON69668.2026.11508516 . ISBN 979-8-3315-9335-3.
- ↑ Ganesan N (2010). "Aplicación de redes neuronales en el diagnóstico de enfermedades cancerosas utilizando datos demográficos" . Revista Internacional de Aplicaciones Informáticas . 1 (26): 81– 97. Bibcode : 2010IJCA....1z..81G . doi : 10.5120/476-783 .
- ↑ Bottaci L (1997). "Redes neuronales artificiales aplicadas a la predicción de resultados para pacientes con cáncer colorrectal en instituciones separadas" (PDF) . Lancet . 350 (9076). The Lancet: 469–72 . doi : 10.1016/S0140-6736(96)11196-X . PMID 9274582. S2CID 18182063. Archivado del original (PDF) el 23 de noviembre de 2018. Recuperado el 2 de mayo de 2012 .
- ↑ Alizadeh E, Lyons SM, Castle JM, Prasad A (2016). "Medición de cambios sistemáticos en la forma de células cancerosas invasivas mediante momentos de Zernike" . Integrative Biology . 8 (11): 1183– 1193. doi : 10.1039/C6IB00100A . PMID 27735002. Archivado del original el 19 de mayo de 2024. Recuperado el 28 de marzo de 2017 .
- ↑ Lyons S (2016). " Los cambios en la forma celular se correlacionan con el potencial metastásico en ratones" . Biology Open . 5 (3): 289– 299. doi : 10.1242/bio.013409 . PMC 4810736. PMID 26873952 .
- ↑ Nabian MA, Meidani H (28 de agosto de 2017). "Aprendizaje profundo para el análisis acelerado de la fiabilidad de las redes de infraestructura". Ingeniería civil y de infraestructura asistida por ordenador . 33 (6): 443– 458. arXiv : 1708.08551 . Bibcode : 2017arXiv170808551N . doi : 10.1111/mice.12359 . S2CID 36661983 .
- ↑ Nabian MA, Meidani H (2018). "Aceleración de la evaluación estocástica de la conectividad de la red de transporte posterior a un terremoto mediante modelos sustitutos basados en aprendizaje automático" . 97.ª Reunión Anual de la Junta de Investigación del Transporte . Archivado del original el 9 de marzo de 2018. Recuperado el 14 de marzo de 2018 .
- ↑ Díaz E, Brotons V, Tomás R (septiembre de 2018). "Uso de redes neuronales artificiales para predecir el asentamiento elástico 3D de cimentaciones en suelos con lecho rocoso inclinado" . Suelos y Cimentaciones . 58 (6): 1414– 1422. Bibcode : 2018SoFou..58.1414D . doi : 10.1016/j.sandf.2018.08.001 . hdl : 10045/81208 . ISSN 0038-0806 .
- ↑ Tayebiyan A, Mohammad TA, Ghazali AH, Mashohor S. "Red neuronal artificial para modelar la escorrentía pluvial" . Pertanika Journal of Science & Technology . 24 (2): 319– 330. Archivado del original el 17 de mayo de 2023. Recuperado el 17 de mayo de 2023 .
- ↑ Govindaraju RS (1 de abril de 2000). "Redes neuronales artificiales en hidrología. I: Conceptos preliminares" . Journal of Hydrologic Engineering . 5 (2): 115– 123. doi : 10.1061/(ASCE)1084-0699(2000)5:2(115) .
- ↑ Govindaraju RS (1 de abril de 2000). "Redes neuronales artificiales en hidrología. II: Aplicaciones hidrológicas" . Journal of Hydrologic Engineering . 5 (2): 124– 137. doi : 10.1061/(ASCE)1084-0699(2000)5:2(124) .
- ↑ Peres DJ, Iuppa C, Cavallaro L, Cancelliere A, Foti E (1 de octubre de 2015). "Extensión significativa del registro de altura de olas mediante redes neuronales y datos de viento de reanálisis". Ocean Modelling . 94 : 128–140 . Bibcode : 2015OcMod..94..128P . doi : 10.1016/j.ocemod.2015.08.002 .
- ↑ Dwarakish GS, Rakshith S, Natesan U (2013). "Revisión de las aplicaciones de las redes neuronales en la ingeniería costera" . Sistemas de inteligencia artificial y aprendizaje automático . 5 (7): 324– 331. Archivado del original el 15 de agosto de 2017. Recuperado el 5 de julio de 2017 .
- ↑ Ermini L, Catani F, Casagli N (1 de marzo de 2005). "Redes neuronales artificiales aplicadas a la evaluación de la susceptibilidad a deslizamientos de tierra". Geomorphology . Geomorphological hazard and human impact in mountain environments. 66 (1): 327– 343. Bibcode : 2005Geomo..66..327E . doi : 10.1016/j.geomorph.2004.09.025 .
- ↑ Nix R, Zhang J (mayo de 2017). "Clasificación de aplicaciones y malware de Android mediante redes neuronales profundas". Conferencia Internacional Conjunta sobre Redes Neuronales (IJCNN) de 2017. págs. 1871–1878 . doi : 10.1109/IJCNN.2017.7966078 . ISBN 978-1-5090-6182-2. S2CID 8838479 .
- ↑ "Detección de URL maliciosas" . El grupo de sistemas y redes de la UCSD . Archivado del original el 14 de julio de 2019. Consultado el 15 de febrero de 2019 .
- ↑ Homayoun S, Ahmadzadeh M, Hashemi S, Dehghantanha A, Khayami R (2018). "BoTShark: Un enfoque de aprendizaje profundo para la detección de tráfico de botnets". En Dehghantanha A, Conti M, Dargahi T (eds.). Inteligencia sobre amenazas cibernéticas . Avances en seguridad de la información. Vol. 70. Springer International Publishing. pp. 137–153 . doi : 10.1007/978-3-319-73951-9_7 . ISBN 978-3-319-73951-9.
- ↑ Ghosh, Reilly (enero de 1994). «Detección de fraude con tarjetas de crédito mediante una red neuronal». Actas de la Vigésimo Séptima Conferencia Internacional de Hawái sobre Ciencias de Sistemas HICSS-94 . Vol. 3. págs. 621–630 . doi : 10.1109/HICSS.1994.323314 . ISBN 978-0-8186-5090-1. S2CID 13260377 .
- ↑ Ananthaswamy A (19 de abril de 2021). "Las redes neuronales más recientes resuelven las ecuaciones más difíciles del mundo más rápido que nunca" . Quanta Magazine . Archivado del original el 19 de mayo de 2024. Recuperado el 12 de mayo de 2021 .
- ↑ "La IA ha resuelto un enigma matemático clave para comprender nuestro mundo" . MIT Technology Review . Archivado del original el 19 de mayo de 2024. Consultado el 19 de noviembre de 2020 .
- ↑ Alford A. "Caltech publica IA de código abierto para resolver ecuaciones diferenciales parciales" . InfoQ . Archivado del original el 25 de enero de 2021. Consultado el 24 de agosto de 2025 .
- ↑ Nagy A (28 de junio de 2019). "Método de Monte Carlo cuántico variacional con un ansatz de red neuronal para sistemas cuánticos abiertos". Physical Review Letters . 122 (25) 250501. arXiv : 1902.09483 . Bibcode : 2019PhRvL.122y0501N . doi : 10.1103/PhysRevLett.122.250501 . PMID 31347886 . S2CID 119074378 .
- ↑ Yoshioka N, Hamazaki R (28 de junio de 2019). "Construcción de estados estacionarios neuronales para sistemas cuánticos abiertos de muchos cuerpos". Physical Review B . 99 (21) 214306. arXiv : 1902.07006 . Bibcode : 2019PhRvB..99u4306Y . doi : 10.1103/PhysRevB.99.214306 . S2CID 119470636 .
- ↑ Hartmann MJ, Carleo G (28 de junio de 2019). "Enfoque de redes neuronales para la dinámica cuántica disipativa de muchos cuerpos". Physical Review Letters . 122 (25) 250502. arXiv : 1902.05131 . Bibcode : 2019PhRvL.122y0502H . doi : 10.1103/PhysRevLett.122.250502 . PMID 31347862. S2CID 119357494 .
- ↑ Forrest MD (abril de 2015). "Simulación de la acción del alcohol sobre un modelo detallado de neurona de Purkinje y un modelo sustituto más simple que se ejecuta más de 400 veces más rápido" . BMC Neuroscience . 16 (27) 27. doi : 10.1186/s12868-015-0162-6 . PMC 4417229. PMID 25928094 .
- ↑ Wieczorek S, Filipiak D, Filipowska A (2018). "Perfilado semántico de intereses de usuarios basado en imágenes con redes neuronales" . Estudios sobre la Web Semántica . 36 (Temas emergentes en tecnologías semánticas). doi : 10.3233/978-1-61499-894-5-179 . Archivado del original el 19 de mayo de 2024. Recuperado el 20 de enero de 2024 .
- ↑ Merchant A, Batzner S, Schoenholz SS, Aykol M, Cheon G, Cubuk ED (diciembre de 2023). "Escalando el aprendizaje profundo para el descubrimiento de materiales" . Nature . 624 (7990): 80–85 . Bibcode : 2023Natur.624...80M . doi : 10.1038/ s41586-023-06735-9 . ISSN 1476-4687 . PMC 10700131. PMID 38030720 .
- 1 2 3 4 Huang Y (2009). "Avances en redes neuronales artificiales: desarrollo metodológico y aplicación" . Algorithms . 2 (3): 973– 1007. doi : 10.3390/algor2030973 . ISSN 1999-4893 .
- 1 2 3 4 Kariri E, Louati H, Louati A, Masmoudi F (2023). "Explorando los avances y las futuras direcciones de investigación de las redes neuronales artificiales: un enfoque de minería de texto" . Ciencias Aplicadas . 13 (5): 3186. doi : 10.3390/app13053186 . ISSN 2076-3417 .
- ↑ Natarajan S, Rahman Al-Haddad SA, Ahmad FA, Kamil R, Hassan MK, Azrad S, et al. (1 de julio de 2025). "Redes neuronales profundas para la mejora y el reconocimiento del habla: una revisión sistemática" . Ain Shams Engineering Journal . 16 (7) 103405. doi : 10.1016/j.asej.2025.103405 . ISSN 2090-4479 .
- ↑ Lv Z, Poiesi F, Dong Q, Lloret J, Song H (11 de noviembre de 2022). "Aprendizaje profundo para la interacción inteligente entre humanos y computadoras" . Ciencias Aplicadas . 12 (22) 11457. doi : 10.3390/app122211457 . ISSN 2076-3417 .
- ↑ Personal C (26 de septiembre de 2024). "¿Qué es una red neuronal artificial y por qué es importante para la IA?" . Coursera . Consultado el 7 de septiembre de 2025 .
- ^ Pillonetto G, Aravkin A, Gedon D, Ljung L, Ribeiro AH, Schön TB (1 de enero de 2025). "Redes profundas para la identificación de sistemas: una encuesta" . Automática . 171 111907. doi : 10.1016/j.automatica.2024.111907 . ISSN 0005-1098 .
- ↑ "Las implicaciones de la inteligencia artificial para la estabilidad financiera" (PDF) . FSB . Consultado el 7 de septiembre de 2025 .
- ↑ "Más allá de los robo-asesores: cómo la IA podría revolucionar la gestión patrimonial" . 5 de enero de 2017.
- ↑ Buczak A, Guven E (2016). "Una revisión de los métodos de minería de datos y aprendizaje automático para la detección de intrusiones en ciberseguridad". IEEE Communications Surveys & Tutorials . 18 (2): 1153– 1176. doi : 10.1109/COMST.2015.2494502 .
- 1 2 Fui-Hoon Nah F, Zheng R, Cai J, Siau K, Chen L (3 de julio de 2023). "IA generativa y ChatGPT: aplicaciones, desafíos y colaboración entre IA y humanos" . Journal of Information Technology Case and Application Research . 25 (3): 277– 304. doi : 10.1080/15228053.2023.2233814 . ISSN 1522-8053 .
- ↑ "Los fallos de DALL-E 2 son lo más interesante de todo esto – IEEE Spectrum" . IEEE . Archivado del original el 15 de julio de 2022. Consultado el 9 de diciembre de 2023 .
- ↑ Briot JP (enero de 2021). "De las redes neuronales artificiales al aprendizaje profundo para la generación de música: historia, conceptos y tendencias" . Neural Computing and Applications . 33 (1): 39– 65. doi : 10.1007/s00521-020-05399-0 . ISSN 0941-0643 .
- ↑ Chow PS (6 de julio de 2020). "Un fantasma en la máquina (de Hollywood): aplicaciones emergentes de la inteligencia artificial en la industria cinematográfica". NECSUS_European Journal of Media Studies . doi : 10.25969/MEDIAREP/14307 . ISSN 2213-0217 .
- ↑ Yu X, He S, Gao Y, Yang J, Sha L, Zhang Y, et al. (junio de 2010). "Ajuste dinámico de la dificultad de la IA del juego para el videojuego Dead-End". Tercera Conferencia Internacional sobre Ciencias de la Información y Ciencias de la Interacción . IEEE. págs. 583–587 . doi : 10.1109/icicis.2010.5534761 . ISBN 978-1-4244-7384-7. S2CID 17555595 .
- ↑ Parisi GI, Kemker R, Part JL, Kanan C, Wermter S (1 de mayo de 2019). "Aprendizaje continuo a lo largo de la vida con redes neuronales: una revisión" . Redes neuronales . 113 : 54–71 . arXiv : 1802.07569 . doi : 10.1016/j.neunet.2019.01.012 . ISSN 0893-6080 . PMID 30780045 .
- ↑ Edwards C (25 de junio de 2015). "Problemas de crecimiento para el aprendizaje profundo". Communications of the ACM . 58 (7): 14– 16. doi : 10.1145/2771283 . S2CID 11026540 .
- ↑ "El poder del cerebro humano: el libro de datos de física" . hypertextbook.com . Consultado el 19 de mayo de 2026 .
- ↑ "Informe sobre el uso de energía en centros de datos de Estados Unidos en 2024 | Área de tecnologías energéticas" . eta.lbl.gov . Consultado el 19 de mayo de 2026 .
- ↑ Cade Metz (18 de mayo de 2016). "Google creó sus propios chips para potenciar sus bots de IA" . Wired . Archivado del original el 13 de enero de 2018. Consultado el 5 de marzo de 2017 .
- ↑ Malinovskaya A, Mozharovskyi P, Otto P (enero de 2024). "Monitoreo estadístico de procesos de redes neuronales artificiales" . Technometrics . 66 (1): 104– 117. doi : 10.1080/00401706.2023.2239886 .
- ↑ Norori N, Hu Q, Aellen FM, Faraci FD, Tzovara A (octubre de 2021). "Abordar el sesgo en los macrodatos y la IA para la atención médica: un llamado a la ciencia abierta" . Patterns . 2 ( 10) 100347. doi : 10.1016/j.patter.2021.100347 . PMC 8515002. PMID 34693373 .
- 1 2 Carina W (27 de octubre de 2022). "Failing at Face Value: The Effect of Biased Facial Recognition Technology on Racial Discrimination in Criminal Justice" . Scientific and Social Research . 4 (10): 29– 40. doi : 10.26689/ssr.v4i10.4402 . ISSN 2661-4332 .
- 1 2 Chang X (13 de septiembre de 2023). "Sesgo de género en la contratación: un análisis del impacto del algoritmo de reclutamiento de Amazon" . Advances in Economics, Management and Political Sciences . 23 (1): 134– 140. doi : 10.54254/2754-1169/23/20230367 . ISSN 2754-1169 . Archivado del original el 9 de diciembre de 2023. Recuperado el 9 de diciembre de 2023 .
- ↑ Kortylewski A, Egger B, Schneider A, Gerig T, Morel-Forster A, Vetter T (junio de 2019). «Análisis y reducción del daño del sesgo del conjunto de datos en el reconocimiento facial con datos sintéticos». 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) (PDF) . IEEE. págs. 2261–2268 . doi : 10.1109/cvprw.2019.00279 . ISBN 978-1-7281-2506-0. S2CID 198183828 . Archivado (PDF) del original el 19 de mayo de 2024 . Recuperado el 30 de diciembre de 2023 .
- ↑ Tahmasebi, Hezarkhani (2012). "Un algoritmo híbrido de redes neuronales, lógica difusa y genética para la estimación de grados" . Computers & Geosciences . 42 : 18–27 . Bibcode : 2012CG.....42...18T . doi : 10.1016/j.cageo.2012.02.004 . PMC 4268588. PMID 25540468 .
- ↑ Sun y Bookman, 1990
- ↑ "Escalando algoritmos de aprendizaje hacia la IA" (PDF) . Archivado (PDF) del original el 12 de agosto de 2022. Consultado el 6 de julio de 2022 .
Bibliografía
- Bhadeshia HKDH (1999). "Redes neuronales en la ciencia de los materiales" (PDF) . ISIJ International . 39 (10): 966– 979. doi : 10.2355/isijinternational.39.966 .
- Bishop CM (1995). Redes neuronales para el reconocimiento de patrones . Clarendon Press. ISBN 978-0-19-853849-3OCLC 33101074 .
- Borgelt C (2003). Neuro-Fuzzy-Systeme: von den Grundlagen künstlicher Neuronaler Netze zur Kopplung mit Fuzzy-Systemen . Vereg. ISBN 978-3-528-25265-6OCLC 76538146
- Cybenko G (2006). "Aproximación mediante superposiciones de una función sigmoidal" . En van Schuppen JH (ed.). Matemáticas del control, señales y sistemas . Springer International. pp. 303–314 . PDF
- Dewdney AK (1997). Sí, no tenemos neutrones: un recorrido revelador por los giros y vueltas de la mala ciencia . Nueva York: Wiley. ISBN 978-0-471-10806-1OCLC 35558945
- Duda RO, Hart PE, Stork DG (2001). Clasificación de patrones (2.ª ed.). Wiley. ISBN 978-0-471-05669-0OCLC 41347061
- Egmont-Petersen M, de Ridder D, Handels H (2002). "Procesamiento de imágenes con redes neuronales: una revisión". Pattern Recognition . 35 (10): 2279– 2301. CiteSeerX 10.1.1.21.5444 . doi : 10.1016/S0031-3203(01)00178-9 .
- Fahlman S, Lebiere C (1991). "The Cascade-Correlation Learning Architecture" (PDF) . Archivado del original (PDF) el 3 de mayo de 2013. Recuperado el 28 de agosto de 2006 .
- Creado para la National Science Foundation , Contrato número EET-8716324, y la Defense Advanced Research Projects Agency (DOD), Orden ARPA n.° 4976 bajo el Contrato F33615-87-C-1499.
- Gurney K (1997). Introducción a las redes neuronales . UCL Press. ISBN 978-1-85728-673-1OCLC 37875698
- Haykin SS (1999). Redes neuronales: una base integral . Prentice Hall. ISBN 978-0-13-273350-2OCLC 38908586
- Hertz J, Palmer RG, Krogh AS (1991). Introducción a la teoría de la computación neuronal . Addison-Wesley. ISBN 978-0-201-51560-2OCLC 21522159
- Teoría de la información, inferencia y algoritmos de aprendizaje . Cambridge University Press. 25 de septiembre de 2003.Bibcode:2003itil.book.....M.ISBN 978-0-521-64298-9OCLC 52377690
- Kruse R, Borgelt C, Klawonn F, Moewes C, Steinbrecher M, Held P (2013). Inteligencia computacional: una introducción metodológica . Saltador. ISBN 978-1-4471-5012-1OCLC 837524179
- Lawrence J (1994). Introducción a las redes neuronales: diseño, teoría y aplicaciones . California Scientific Software. ISBN 978-1-883157-00-5OCLC 32179420
- Masters T (1994). Procesamiento de señales e imágenes con redes neuronales: un libro de referencia en C++ . J. Wiley. ISBN 978-0-471-04963-0OCLC 29877717
- Maurer H (2021). Ciencia cognitiva: mecanismos de sincronización integradora en las neuroarquitecturas cognitivas del conexionismo moderno . CRC Press. doi : 10.1201/9781351043526 . ISBN 978-1-351-04352-6. S2CID 242963768 .
- Ripley BD (2007). Reconocimiento de patrones y redes neuronales . Cambridge University Press. ISBN 978-0-521-71770-0.
- Siegelmann H, Sontag ED (1994). "Computación analógica mediante redes neuronales" . Theoretical Computer Science . 131 (2): 331– 360. doi : 10.1016/0304-3975(94)90178-3 . S2CID 2456483 .
- Smith M (1993). Redes neuronales para modelado estadístico . Van Nostrand Reinhold. ISBN 978-0-442-01310-3OCLC 27145760
- Wasserman PD (1993). Métodos avanzados en computación neuronal . Van Nostrand Reinhold. ISBN 978-0-442-00461-3OCLC 27429729
- Wilson H (2018). Inteligencia artificial . Grey House Publishing. ISBN 978-1-68217-867-6.
Enlaces externos
- Una breve introducción a las redes neuronales (D. Kriesel) – Manuscrito ilustrado y bilingüe sobre redes neuronales; Temas tratados hasta el momento: Perceptrones, Retropropagación, Funciones de base radial, Redes neuronales recurrentes, Mapas autoorganizados, Redes de Hopfield.
- Revisión de redes neuronales en ciencia de materiales. Archivado el 7 de junio de 2015 en Wayback Machine.
- Tutorial de Redes Neuronales Artificiales en tres idiomas (Univ. Politécnica de Madrid)
- Otra introducción a las redes neuronales
- La próxima generación de redes neuronales (archivado el 24 de enero de 2011 en Wayback Machine – Google Tech Talks)
- Rendimiento de las redes neuronales
- Redes neuronales e información. Archivado el 9 de julio de 2009 en Wayback Machine.
- Sanderson G (5 de octubre de 2017). "¿Pero qué es una red neuronal?" . 3Blue1Brown . Archivado del original el 7 de noviembre de 2021 – vía YouTube .
- Hakim MA, Alam MI (2025). "Capa de red neuronal de inspiración biológica con regulación homeostática y mecanismos de reparación adaptativos" . Scientific Reports . 15 (1). Nature Publishing Group: 33903. Bibcode : 2025NatSR..1533903H . doi : 10.1038/s41598-025-09114-8 . ISSN 2045-2322 . PMC 12484884. PMID 41028030 .
- estadística computacional
- Redes neuronales artificiales
- Algoritmos de clasificación
- Neurociencia computacional
- Investigación de mercado
- Psicología matemática
- Métodos matemáticos y cuantitativos (economía)
- Bioinspiración