Articulo de referencia

Red neuronal de alimentación directa

En una red neuronal de alimentación directa, la información siempre se mueve en una dirección; nunca retrocede. {{cite book | author1 = Chris Ferrie | author2 = Sarah Kaiser |ye...

En una red neuronal de alimentación directa, la información siempre se mueve en una dirección; nunca retrocede.
Ejemplo simplificado de entrenamiento de una red neuronal para la detección de objetos: La red se entrena con múltiples imágenes de estrellas de mar o erizos de mar , que se correlacionan con "nodos" que representan características visuales . Las estrellas de mar se asocian con una textura anillada y un contorno estrellado, mientras que la mayoría de los erizos de mar se asocian con una textura rayada y una forma ovalada. Sin embargo, la presencia de un erizo de mar con textura anillada crea una asociación débil entre ellos.
Ejecución posterior de la red en una imagen de entrada (izquierda): [ 1 ] La red detecta correctamente la estrella de mar. Sin embargo, la asociación débilmente ponderada entre la textura anillada y el erizo de mar también confiere una señal débil a este último desde uno de los dos nodos intermedios. Además, una concha que no se incluyó en el entrenamiento da una señal débil para la forma ovalada, lo que también resulta en una señal débil para la salida del erizo de mar. Estas señales débiles pueden dar lugar a un resultado falso positivo para el erizo de mar. En realidad, las texturas y los contornos no estarían representados por nodos individuales, sino por patrones de peso asociados de múltiples nodos.

Una red neuronal de alimentación directa es una red neuronal artificial en la que la información fluye en una sola dirección: las entradas se multiplican por pesos para obtener salidas (entradas a salida). [ 2 ] Se diferencia de una red neuronal recurrente , en la que los bucles permiten que la información de etapas de procesamiento posteriores retroalimente las etapas anteriores. [ 3 ] La multiplicación de alimentación directa es esencial para la retropropagación , [ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] porque la retroalimentación , donde las salidas retroalimentan las mismas entradas y las modifican, forma un bucle infinito que no es posible diferenciar mediante la retropropagación. Esta nomenclatura parece ser un punto de confusión entre algunos científicos informáticos y científicos de otros campos que estudian las redes cerebrales . [ 9 ]

Fundamentos matemáticos

Función de activación

Las dos funciones de activación históricamente comunes son ambas sigmoides y se describen mediante

y(vi)=tanh(vi)  y  y(vi)=(1+mivi)1.{\displaystyle y(v_{i})=\tanh(v_{i})~~{\text{y}}~~y(v_{i})=(1+e^{-v_{i}})^{-1}.}

La primera es una tangente hiperbólica que varía de -1 a 1, mientras que la otra es la función logística , que tiene una forma similar pero varía de 0 a 1. Aquíyi{\displaystyle y_{i}}es el resultado de lai{\displaystyle i}-ésimo nodo (neurona) yvi{\displaystyle v_{i}}es la suma ponderada de las conexiones de entrada. Se han propuesto funciones de activación alternativas, incluidas las funciones rectificadora y softplus . Entre las funciones de activación más especializadas se encuentran las funciones de base radial (utilizadas en redes de base radial , otra clase de modelos de redes neuronales supervisadas).

En los avances recientes del aprendizaje profundo , la unidad lineal rectificada (ReLU) se utiliza con mayor frecuencia como una de las posibles maneras de superar los problemas numéricos relacionados con las funciones sigmoides.

Aprendiendo

El aprendizaje se produce modificando los pesos de conexión tras procesar cada dato, en función de la magnitud del error en la salida en comparación con el resultado esperado. Este es un ejemplo de aprendizaje supervisado y se lleva a cabo mediante retropropagación.

Podemos representar el grado de error en un nodo de salida.j{\displaystyle j}en elnorte{\displaystyle n}-ésimo punto de datos (ejemplo de entrenamiento) pormij(norte)=dj(norte)yj(norte){\ Displaystyle e_ {j} (n) = d_ {j} (n) -y_ {j} (n)}, dóndedj(norte){\displaystyle d_{j}(n)}es el valor objetivo deseado paranorte{\displaystyle n}-ésimo punto de datos en el nodoj{\displaystyle j}, yyj(norte){\displaystyle y_{j}(n)}es el valor producido en el nodoj{\displaystyle j}cuando elnorte{\displaystyle n}El -ésimo punto de datos se proporciona como entrada.

Los pesos de los nodos se pueden ajustar en función de correcciones que minimicen el error en la salida total para elnorte{\displaystyle n}-ésimo punto de datos, dado por

mi(norte)=12nodo de salida jmij2(norte).{\displaystyle {\mathcal {E}}(n)={\frac {1}{2}}\sum _{{\text{nodo de salida }}j}e_{j}^{2}(n).}

Utilizando el descenso de gradiente , el cambio en cada pesowij{\displaystyle w_{ij}}es

Δwji(norte)=ηmi(norte)vj(norte)yi(norte){\displaystyle \Delta w_{ji}(n)=-\eta {\frac {\partial {\mathcal {E}}(n)}{\partial v_{j}(n)}}y_{i}(n)}

dóndeyi(norte){\displaystyle y_{i}(n)}es la salida de la neurona anteriori{\displaystyle i}, yη{\displaystyle \eta }es la tasa de aprendizaje , que se selecciona para asegurar que los pesos converjan rápidamente a una respuesta, sin oscilaciones. En la expresión anterior,mi(norte)vj(norte){\displaystyle {\frac {\partial {\mathcal {E}}(n)}{\partial v_{j}(n)}}}denota la derivada parcial del errormi(norte){\displaystyle {\mathcal {E}}(n)}según la suma ponderadavj(norte){\displaystyle v_{j}(n)}de las conexiones de entrada de la neuronai{\displaystyle i}.

La derivada que se debe calcular depende del campo local inducido.vj{\displaystyle v_{j}}, que a su vez varía. Es fácil demostrar que para un nodo de salida esta derivada se puede simplificar a

mi(norte)vj(norte)=mij(norte)ϕ(vj(norte)){\displaystyle -{\frac {\partial {\mathcal {E}}(n)}{\partial v_{j}(n)}}=e_{j}(n)\phi ^{\prime }(v_{j}(n))}

dóndeϕ{\displaystyle \phi ^{\prime }}es la derivada de la función de activación descrita anteriormente, que en sí misma no varía. El análisis es más difícil para el cambio en los pesos de un nodo oculto, pero se puede demostrar que la derivada relevante es

mi(norte)vj(norte)=ϕ(vj(norte))kmi(norte)vk(norte)wkj(norte).{\displaystyle -{\frac {\partial {\mathcal {E}}(n)}{\partial v_{j}(n)}}=\phi ^{\prime }(v_{j}(n))\sum _ {k}-{\frac {\partial {\mathcal {E}}(n)}{\partial v_{k}(n)}}w_{kj}(n).}

Esto depende del cambio en los pesos de losk{\displaystyle k}Los nodos representan la capa de salida. Por lo tanto, para cambiar los pesos de la capa oculta, los pesos de la capa de salida cambian según la derivada de la función de activación, y así este algoritmo representa una retropropagación de la función de activación. [ 10 ]

Historia

Cronología

Regresión lineal

Perceptrón

Si se utiliza un umbral, es decir, una función de activación lineal, la unidad de umbral lineal resultante se denomina perceptrón . (A menudo, el término se utiliza para referirse a una sola de estas unidades). Varias unidades no lineales paralelas pueden aproximar cualquier función continua de un intervalo compacto de los números reales al intervalo [−1,1], a pesar de la limitada capacidad computacional de una sola unidad con una función de umbral lineal. [ 31 ]

Red neuronal de dos capas capaz de calcular la operación XOR . Los números en las neuronas representan su umbral explícito. Los números que indican las flechas representan el peso de las entradas. Si se alcanza el umbral de 2, se utiliza un valor de 1 para la multiplicación del peso en la siguiente capa. Si no se alcanza el umbral, se utiliza 0. La capa inferior de entradas no siempre se considera una capa real de la red neuronal.

Los perceptrones se pueden entrenar mediante un algoritmo de aprendizaje sencillo que suele denominarse regla delta . Este algoritmo calcula los errores entre la salida calculada y los datos de salida de muestra, y utiliza esta información para ajustar los pesos, implementando así una forma de descenso de gradiente .

perceptrón multicapa

Un perceptrón multicapa ( MLP ) es un nombre inapropiado para una red neuronal artificial moderna de alimentación directa, que consta de neuronas totalmente conectadas (de ahí el sinónimo que a veces se usa de red totalmente conectada ( FCN )), a menudo con un tipo de función de activación no lineal, organizada en al menos tres capas, notable por ser capaz de distinguir datos que no son linealmente separables . [ 32 ]

Otras redes de retroalimentación

Ejemplo de red neuronal convolucional 1D de propagación hacia adelante

Otros ejemplos de redes de alimentación directa incluyen las redes neuronales convolucionales y las redes de funciones de base radial , que utilizan una función de activación diferente.

Véase también

Referencias

  1. Chris Ferrie; Sarah Kaiser (2019). Redes neuronales para bebés . Sourcebooks. ISBN 978-1492671206.
  2. ^ Zell, Andreas (1994). Simulación Neuronaler Netze [ Simulación de redes neuronales ] (en alemán) (1ª ed.). Addison-Wesley. pag. 73.ISBN   3-89319-554-8.
  3. Schmidhuber, Jürgen (2015-01-01). " Aprendizaje profundo en redes neuronales: una visión general". Redes neuronales . 61 : 85–117 . arXiv : 1404.7828 . doi : 10.1016/j.neunet.2014.09.003 . ISSN 0893-6080 . PMID 25462637. S2CID 11715509 .   
  4. Linnainmaa, Seppo (1970). La representación del error de redondeo acumulativo de un algoritmo como una expansión de Taylor de los errores de redondeo locales (tesis de maestría) (en finés). Universidad de Helsinki. págs. 6-7. 
  5. Kelley, Henry J. (1960). "Teoría del gradiente de las trayectorias de vuelo óptimas". ARS Journal . 30 (10): 947– 954. doi : 10.2514/8.5282 .
  6. Rosenblatt, Frank. x. Principios de neurodinámica: perceptrones y la teoría de los mecanismos cerebrales. Spartan Books, Washington D.C., 1961.
  7. 1 2 Werbos, Paul (1982). "Aplicaciones de los avances en el análisis de sensibilidad no lineal" (PDF) . Modelado y optimización de sistemas . Springer. pp. 762–770 . Archivado (PDF) del original el 14 de abril de 2016. Recuperado el 2 de julio de 2017 . 
  8. 1 2 Rumelhart, David E., Geoffrey E. Hinton y RJ Williams. " Aprendizaje de representaciones internas mediante propagación de errores. Archivado el 13 de octubre de 2022 en Wayback Machine ". David E. Rumelhart, James L. McClelland y el grupo de investigación PDP (editores), Procesamiento distribuido en paralelo: Exploraciones en la microestructura de la cognición, Volumen 1: Fundamentos. MIT Press, 1986.
  9. Achler, T. (2023). "Lo que la IA, la neurociencia y la ciencia cognitiva pueden aprender unas de otras: una perspectiva integrada". Computación cognitiva .
  10. Haykin, Simon (1998). Redes neuronales: Fundamentos integrales (2.ª ed.). Prentice Hall. ISBN  0-13-273350-1.
  11. Merriman, Mansfield. Lista de escritos relacionados con el método de mínimos cuadrados: con notas históricas y críticas . Vol. 4. Academy, 1877.
  12. Stigler, Stephen M. (1981). "Gauss y la invención de los mínimos cuadrados" . Ann. Stat . 9 (3): 465– 474. doi : 10.1214/aos/1176345451 .
  13. 1 2 3 4 5 Schmidhuber, Jürgen (2022). "Historia anotada de la IA moderna y el aprendizaje profundo". arXiv : 2212.11279 [ cs.NE ].
  14. Bretscher, Otto (1995). Álgebra lineal con aplicaciones (3.ª ed.). Upper Saddle River, NJ: Prentice Hall. 
  15. Stigler, Stephen M. (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Cambridge: Harvard. ISBN 0-674-40340-1.
  16. McCulloch, Warren S.; Pitts, Walter (1 de diciembre de 1943). "Un cálculo lógico de las ideas inmanentes en la actividad nerviosa" . The Bulletin of Mathematical Biophysics . 5 (4): 115– 133. doi : 10.1007/BF02478259 . ISSN 1522-9602 . 
  17. Rosenblatt, Frank (1958). "El perceptrón: un modelo probabilístico para el almacenamiento y la organización de la información en el cerebro". Psychological Review . 65 (6): 386– 408. CiteSeerX 10.1.1.588.3775 . doi : 10.1037/h0042519 . PMID 13602029. S2CID 12781225 .   
  18. 1 2 Joseph, RD (1960). Contribuciones a la teoría del perceptrón, Informe del Laboratorio Aeronáutico de Cornell n.° VG-11 96--G-7, Buffalo .
  19. Rosenblatt, Frank (1962). Principios de neurodinámica . Spartan, Nueva York.
  20. Ivakhnenko, AG (1973). Dispositivos de predicción cibernética . CCM Information Corporation.
  21. Ivakhnenko, AG ; Grigorʹevich Lapa, Valentin (1967). Cibernética y técnicas de pronóstico . American Elsevier Pub. Co.
  22. Amari, Shun'ichi (1967). "Una teoría del clasificador de patrones adaptativo". IEEE Transactions . EC (16): 279-307.
  23. Linnainmaa, Seppo (1970). La representación del error de redondeo acumulativo de un algoritmo como una expansión de Taylor de los errores de redondeo locales (tesis de maestría) (en finés). Universidad de Helsinki. págs. 6-7. 
  24. Linnainmaa, Seppo (1976). "Expansión de Taylor del error de redondeo acumulado". BIT Numerical Mathematics . 16 (2): 146– 160. doi : 10.1007/bf01931367 . S2CID 122357351 . 
  25. Ostrovski, GM, Volin, YM y Boris, WW (1971). Sobre el cálculo de derivadas. Wiss. Z. Tech. Hochschule for Chemistry, 13:382–384.
  26. 1 2 Schmidhuber, Juergen (25 de octubre de 2014). "¿Quién inventó la retropropagación?" . IDSIA, Suiza. Archivado del original el 30 de julio de 2024. Recuperado el 14 de septiembre de 2024 .
  27. Anderson, James A.; Rosenfeld, Edward, eds. (2000). Talking Nets: An Oral History of Neural Networks . The MIT Press. doi : 10.7551/mitpress/6626.003.0016 . ISBN 978-0-262-26715-1.
  28. Werbos, Paul J. (1994). The Roots of Backpropagation : From Ordered Derivatives to Neural Networks and Political Forecasting . Nueva York: John Wiley & Sons. ISBN  0-471-59897-6.
  29. Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. (octubre de 1986). "Aprendizaje de representaciones mediante la retropropagación de errores" . Nature . 323 (6088): 533– 536. Bibcode : 1986Natur.323..533R . doi : 10.1038/323533a0 . ISSN 1476-4687 . 
  30. Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal; Janvin, Christian (marzo de 2003). "Un modelo de lenguaje probabilístico neuronal" . The Journal of Machine Learning Research . 3 : 1137–1155 .
  31. Auer, Peter; Harald Burgsteiner; Wolfgang Maass (2008). "Una regla de aprendizaje para aproximadores universales muy simples que consisten en una sola capa de perceptrones" (PDF) . Redes neuronales . 21 (5): 786– 795. doi : 10.1016/j.neunet.2007.12.036 . PMID 18249524. Archivado del original (PDF) el 6 de julio de 2011. Recuperado el 8 de septiembre de 2009 . 
  32. Cybenko, G. 1989. Aproximación por superposiciones de una función sigmoidal. Matemáticas del control, señales y sistemas , 2(4), 303–314.
  • Tutorial sobre redes neuronales de alimentación directa
  • Red neuronal de alimentación directa: Ejemplo
  • Redes neuronales de alimentación directa: una introducción