Los operadores neuronales son una clase de arquitecturas de aprendizaje profundo diseñadas para aprender mapeos entre espacios de funciones de dimensión infinita . Representan una extensión de las redes neuronales artificiales tradicionales , diferenciándose del enfoque típico en el aprendizaje de mapeos entre espacios euclidianos de dimensión finita o conjuntos finitos. Los operadores neuronales aprenden directamente operadores entre espacios de funciones; pueden recibir funciones de entrada y la función de salida puede evaluarse en cualquier discretización. [ 1 ] [ 2 ]
La principal aplicación de los operadores neuronales es el aprendizaje de mapas sustitutos para los operadores de solución de ecuaciones diferenciales parciales (EDP), [ 1 ] [ 2 ] que son herramientas críticas en el modelado del entorno natural. [ 3 ] [ 4 ] Los solucionadores de EDP estándar pueden ser lentos y computacionalmente intensivos, especialmente para sistemas complejos. Los operadores neuronales han demostrado un rendimiento mejorado en la resolución de EDP [ 5 ] [ 6 ] en comparación con las metodologías de aprendizaje automático existentes, siendo significativamente más rápidos que los solucionadores numéricos. [ 7 ] [ 8 ] [ 9 ] Los operadores neuronales también se han aplicado a diversas disciplinas científicas y de ingeniería, como el modelado de flujo turbulento, la mecánica computacional , los datos estructurados en grafos, [ 10 ] y las geociencias. [ 11 ] En particular, se han aplicado al aprendizaje de campos de tensión-deformación en materiales, la clasificación de datos complejos como la transcriptómica espacial, la predicción del flujo multifásico en medios porosos, [ 12 ] y las simulaciones de migración de dióxido de carbono. Finalmente, el paradigma de aprendizaje de operadores permite aprender mapas entre espacios de funciones, y es diferente de las ideas paralelas de aprender mapas de espacios de dimensión finita a espacios de funciones, [ 13 ] [ 14 ] y engloba estas configuraciones como casos especiales cuando se limita a una resolución de entrada fija.
Aprendizaje del operador
La comprensión y el mapeo de relaciones entre espacios funcionales tienen numerosas aplicaciones en ingeniería y ciencias. En particular, el problema de resolver ecuaciones diferenciales parciales puede plantearse como la identificación de un mapeo entre espacios funcionales, como por ejemplo, de una condición inicial a un estado que ha evolucionado con el tiempo. En otras EDP, este mapeo toma una función de coeficiente de entrada y produce una función de solución. El aprendizaje de operadores es un paradigma de aprendizaje automático que permite aprender operadores de solución que mapean la función de entrada a la función de salida [ 15 ] [ 16 ] [ 17 ] .
Utilizando métodos tradicionales de aprendizaje automático, abordar este problema implicaría discretizar los espacios de funciones de entrada y salida de dimensión infinita en cuadrículas de dimensión finita y aplicar modelos de aprendizaje estándar, como redes neuronales. Este enfoque reduce el aprendizaje de operadores al aprendizaje de funciones de dimensión finita y presenta algunas limitaciones, como la dificultad para generalizar a discretizaciones más allá de la cuadrícula utilizada en el entrenamiento.
Las propiedades principales de los operadores neuronales que los diferencian de las redes neuronales tradicionales son la invariancia y la convergencia de la discretización. [ 1 ] A diferencia de las redes neuronales convencionales, que están fijas en la discretización de los datos de entrenamiento, los operadores neuronales pueden adaptarse a diversas discretizaciones sin necesidad de reentrenamiento. Esta propiedad mejora la robustez y la aplicabilidad de los operadores neuronales en diferentes escenarios, proporcionando un rendimiento consistente en distintas resoluciones y mallas.
Definición y formulación
Arquitectónicamente, los operadores neuronales son similares a las redes neuronales de propagación directa en el sentido de que están compuestos por transformaciones lineales alternadas y no linealidades. Dado que los operadores neuronales actúan sobre funciones y generan funciones de salida, se han formulado como una secuencia de operadores integrales lineales alternados sobre espacios de funciones y no linealidades puntuales. [ 1 ] Utilizando una arquitectura análoga a la de las redes neuronales de dimensión finita, se han demostrado teoremas de aproximación universales similares para los operadores neuronales. En particular, se ha demostrado que los operadores neuronales pueden aproximar cualquier operador continuo en un conjunto compacto . [ 1 ]
Los operadores neuronales buscan aproximar algún operador.entre espacios funcionalesymediante la construcción de un mapa paramétrico. Tales mapas paramétricosGeneralmente se puede definir de la forma
dóndeson los operadores de elevación (elevación del codominio de la función de entrada a un espacio de mayor dimensión) y proyección (proyección del codominio de la función intermedia a la dimensión de salida), respectivamente. Estos operadores actúan puntualmente sobre las funciones y suelen estar parametrizados como perceptrones multicapa .es una no linealidad puntual, como una unidad lineal rectificada (ReLU) o una unidad lineal de error gaussiano (GeLU) . Cada capatiene un operador local respectivo(generalmente parametrizado por una red neuronal puntual), un operador integral de núcleoy una función de sesgo. Dada alguna representación funcional intermediacon dominioen el-ésima capa oculta, un operador integral de núcleose define como
donde el núcleoes una red neuronal implícita entrenable, parametrizada por.
En la práctica, a menudo se proporciona la función de entrada al operador neuronal con una resolución específica. Por ejemplo, considérese el escenario en el que se proporciona la evaluación deenagujasTomando prestados métodos de aproximación de integrales de Nyström, como la integración de suma de Riemann y la cuadratura gaussiana , la operación integral anterior se puede calcular de la siguiente manera:
dóndees el volumen de subárea o peso de cuadratura asociado al puntoPor lo tanto, se puede calcular una capa simplificada como
La aproximación anterior, junto con la parametrizacióncomo red neuronal implícita, da como resultado el operador neuronal gráfico (GNO). [ 18 ]
Se han realizado diversas parametrizaciones de operadores neuronales para diferentes aplicaciones. [ 7 ] [ 18 ] Estas suelen diferir en su parametrización deLa instanciación más popular es el operador neuronal de Fourier (FNO). El FNO tomay aplicando el teorema de convolución , se llega a la siguiente parametrización del operador integral del núcleo:
dónderepresenta la transformada de Fourier yrepresenta la transformada de Fourier de alguna función periódicaEs decir, FNO parametriza la integración del núcleo directamente en el espacio de Fourier, utilizando un número predefinido de modos de Fourier. Cuando la malla en la que se presenta la función de entrada es uniforme, la transformada de Fourier se puede aproximar mediante la transformada discreta de Fourier (DFT) con frecuencias inferiores a un umbral especificado. La transformada discreta de Fourier se puede calcular mediante una implementación de la transformada rápida de Fourier (FFT) .
Capacitación
El entrenamiento de operadores neuronales es similar al proceso de entrenamiento de una red neuronal tradicional. Los operadores neuronales se entrenan típicamente en alguna norma Lp o norma Sobolev . En particular, para un conjunto de datosde tamaño, los operadores neuronales minimizan (una discretización de)
,
dóndees una norma en el espacio de la función de salidaLos operadores neuronales se pueden entrenar directamente utilizando métodos basados en retropropagación y descenso de gradiente .
Otro paradigma de entrenamiento está asociado con el aprendizaje automático informado por la física. En particular, las redes neuronales informadas por la física (PINN) utilizan leyes físicas completas para ajustar redes neuronales a soluciones de EDP. Las extensiones de este paradigma al aprendizaje de operadores se denominan ampliamente operadores neuronales informados por la física (PINO), [ 19 ] donde las funciones de pérdida pueden incluir ecuaciones físicas completas o leyes físicas parciales. A diferencia de las PINN estándar, el paradigma PINO incorpora una pérdida de datos (como se definió anteriormente) además de la pérdida física.. La pérdida físicacuantifica cuánto la solución prevista deviola la ecuación de EDP para la entrada.
Véase también
Referencias
- 1 2 3 4 5 Kovachki, Nikola; Li, Zongyi; Liu, Buriede; Azizzadenesheli, Kamyar; Bhattacharya, Kaushik; Stuart, Andrew; Anandkumar, Anima (2021). "Operador neuronal: aprendizaje de mapas entre espacios de funciones" (PDF) . Journal of Machine Learning Research . 24 : 1–97 . arXiv : 2108.08481 .
- 1 2 Azizzadenesheli, Kamyar; Kovachki, Nikola; Li, Zongyi; Liu-Schiaffini, Miguel; Kossaifi, Jean; Anandkumar, Anima (2024). "Operadores neuronales para acelerar simulaciones y diseño científicos" . Nature Reviews Physics . 6 (5): 320– 328. arXiv : 2309.15325 . Bibcode : 2024NatRP...6..320A . doi : 10.1038/s42254-024-00712-5 .
- ↑ Evans, LC (1998). Ecuaciones diferenciales parciales . Providence: American Mathematical Society. ISBN 0-8218-0772-2.
- ↑ «Cómo los modelos de IA están transformando la predicción meteorológica: una muestra de sistemas basados en datos» . phys.org (Comunicado de prensa). Centro Europeo de Previsiones Meteorológicas a Medio Plazo. 6 de septiembre de 2023.
- ↑ Russ, Dan; Abinader, Sacha (23 de agosto de 2023). "Microsoft y Accenture se asocian para abordar las emisiones de metano con tecnología de IA" . Blog de Microsoft Azure .
- ↑ Li, Zijie; Meidani, Kazem; Farimani, Amir Barati (27-04-2023), Transformer for Partial Differential Equations' Operator Learning , arXiv : 2205.13671
- 1 2 Li, Zongyi; Kovachki, Nikola; Azizzadenesheli, Kamyar; Liu, Buriede; Bhattacharya, Kaushik; Stuart, Andrew; Anima, Anandkumar (2020). "Operador neuronal de Fourier para ecuaciones diferenciales parciales paramétricas". arXiv : 2010.08895 [ cs.LG ].
- ↑ Hao, Karen (30 de octubre de 2020). "La IA ha resuelto un rompecabezas matemático clave para comprender nuestro mundo" . MIT Technology Review .
- ↑ Ananthaswamy, Anil (19 de abril de 2021). "Las últimas redes neuronales resuelven las ecuaciones más difíciles del mundo más rápido que nunca" . Quanta Magazine .
- ↑ Sharma, Anuj; Singh, Sukhdeep; Ratna, S. (15 de agosto de 2023). "Operadores de redes neuronales gráficas: una revisión". Multimedia Tools and Applications . 83 (8): 23413– 23436. doi : 10.1007/s11042-023-16440-4 .
- ↑ Wen, Gege; Li, Zongyi; Azizzadenesheli, Kamyar; Anandkumar, Anima; Benson, Sally M. (mayo de 2022). "U-FNO: un modelo de aprendizaje profundo basado en un operador neuronal de Fourier mejorado para flujo multifásico". Advances in Water Resources . 163 104180. arXiv : 2109.03697 . Bibcode : 2022AdWR..16304180W . doi : 10.1016/j.advwatres.2022.104180 .
- ↑ Choubineh, Abouzar; Chen, Jie; Wood, David A.; Coenen, Frans; Ma, Fei (2023). "Operador neuronal de Fourier para el flujo de fluidos en un conjunto de datos de medios porosos simulados en 2D de forma pequeña" . Algorithms . 16 (1): 24. doi : 10.3390/a16010024 .
- ↑ Jiang, Chiyu Lmaxr; Esmaeilzadeh, Soheil; Azizzadenesheli, Kamyar; Kashinath, Karthik; Mustafa, Mustafa; Tchelepi, Hamdi A.; Marcus, Philip; Prabhat, Mr; Anandkumar, Anima (2020). "MESHFREEFLOWNET: Un marco de superresolución espaciotemporal continuo profundo con restricciones físicas". SC20: Conferencia internacional sobre computación de alto rendimiento, redes, almacenamiento y análisis . pp. 1–15 . doi : 10.1109/SC41405.2020.00013 . ISBN 978-1-7281-9998-6.
- ↑ Lu, Lu; Jin, Pengzhan; Pang, Guofei; Zhang, Zhongqiang; Karniadakis, George Em (18 de marzo de 2021). "Aprendizaje de operadores no lineales mediante DeepONet basado en el teorema de aproximación universal de operadores". Nature Machine Intelligence . 3 (3): 218– 229. arXiv : 1910.03193 . doi : 10.1038/s42256-021-00302-5 .
- ↑ Kovachki, Nikola B.; Lanthaler, Samuel; Stuart, Andrew M. (2024). «Aprendizaje de operadores: algoritmos y análisis». En Mishra, Siddhartha; Townsend, Alex (eds.). Manual de análisis numérico . Vol. 25. Elsevier. pp. 419–467 . doi : 10.1016/bs.hna.2024.05.009 . ISBN 9780443239847ISSN 1570-8659
- ↑ Subedi, Unique; Tewari, Ambuj (2026). "Aprendizaje de operadores: una perspectiva estadística" . Annual Review of Statistics and Its Application . 13 : 123–148 . doi : 10.1146/annurev-statistics-042424-070908 .
- ↑ Boullé, Nicolas; Townsend, Alex (2024). «Una guía matemática para el aprendizaje de operadores». En Mishra, Siddhartha; Townsend, Alex (eds.). Manual de análisis numérico . Vol. 25. Elsevier. pp. 83–125 . doi : 10.1016/bs.hna.2024.05.003 . ISBN 9780443239847ISSN 1570-8659
- 1 2 Li, Zongyi; Kovachki, Nikola; Azizzadenesheli, Kamyar; Liu, Buriede; Bhattacharya, Kaushik; Stuart, Andrew; Anima, Anandkumar (2020). "Operador neuronal: red de núcleo gráfico para ecuaciones diferenciales parciales". arXiv : 2003.03485 [ cs.LG ].
- ↑ Li, Zongyi; Hongkai, Zheng; Kovachki, Nikola; Jin, David; Chen, Haoxuan; Liu, Buriede; Azizzadenesheli, Kamyar; Anima, Anandkumar (2021). "Operador neuronal basado en la física para el aprendizaje de ecuaciones diferenciales parciales". arXiv : 2111.03794 [ cs.LG ].
Enlaces externos
- neuronalop – Biblioteca de Python con diversas arquitecturas de operadores neuronales
- Aprendizaje profundo