Articulo de referencia

Operadores neuronales

Los operadores neuronales son una clase de arquitecturas de aprendizaje profundo diseñadas para aprender mapeos entre espacios de funciones de dimensión infinita . Representan u...

Los operadores neuronales son una clase de arquitecturas de aprendizaje profundo diseñadas para aprender mapeos entre espacios de funciones de dimensión infinita . Representan una extensión de las redes neuronales artificiales tradicionales , diferenciándose del enfoque típico en el aprendizaje de mapeos entre espacios euclidianos de dimensión finita o conjuntos finitos. Los operadores neuronales aprenden directamente operadores entre espacios de funciones; pueden recibir funciones de entrada y la función de salida puede evaluarse en cualquier discretización. [ 1 ] [ 2 ]

La principal aplicación de los operadores neuronales es el aprendizaje de mapas sustitutos para los operadores de solución de ecuaciones diferenciales parciales (EDP), [ 1 ] [ 2 ] que son herramientas críticas en el modelado del entorno natural. [ 3 ] [ 4 ] Los solucionadores de EDP estándar pueden ser lentos y computacionalmente intensivos, especialmente para sistemas complejos. Los operadores neuronales han demostrado un rendimiento mejorado en la resolución de EDP [ 5 ] [ 6 ] en comparación con las metodologías de aprendizaje automático existentes, siendo significativamente más rápidos que los solucionadores numéricos. [ 7 ] [ 8 ] [ 9 ] Los operadores neuronales también se han aplicado a diversas disciplinas científicas y de ingeniería, como el modelado de flujo turbulento, la mecánica computacional , los datos estructurados en grafos, [ 10 ] y las geociencias. [ 11 ] En particular, se han aplicado al aprendizaje de campos de tensión-deformación en materiales, la clasificación de datos complejos como la transcriptómica espacial, la predicción del flujo multifásico en medios porosos, [ 12 ] y las simulaciones de migración de dióxido de carbono. Finalmente, el paradigma de aprendizaje de operadores permite aprender mapas entre espacios de funciones, y es diferente de las ideas paralelas de aprender mapas de espacios de dimensión finita a espacios de funciones, [ 13 ] [ 14 ] y engloba estas configuraciones como casos especiales cuando se limita a una resolución de entrada fija.

Aprendizaje del operador

La comprensión y el mapeo de relaciones entre espacios funcionales tienen numerosas aplicaciones en ingeniería y ciencias. En particular, el problema de resolver ecuaciones diferenciales parciales puede plantearse como la identificación de un mapeo entre espacios funcionales, como por ejemplo, de una condición inicial a un estado que ha evolucionado con el tiempo. En otras EDP, este mapeo toma una función de coeficiente de entrada y produce una función de solución. El aprendizaje de operadores es un paradigma de aprendizaje automático que permite aprender operadores de solución que mapean la función de entrada a la función de salida [ 15 ] [ 16 ] [ 17 ] .

Utilizando métodos tradicionales de aprendizaje automático, abordar este problema implicaría discretizar los espacios de funciones de entrada y salida de dimensión infinita en cuadrículas de dimensión finita y aplicar modelos de aprendizaje estándar, como redes neuronales. Este enfoque reduce el aprendizaje de operadores al aprendizaje de funciones de dimensión finita y presenta algunas limitaciones, como la dificultad para generalizar a discretizaciones más allá de la cuadrícula utilizada en el entrenamiento.

Las propiedades principales de los operadores neuronales que los diferencian de las redes neuronales tradicionales son la invariancia y la convergencia de la discretización. [ 1 ] A diferencia de las redes neuronales convencionales, que están fijas en la discretización de los datos de entrenamiento, los operadores neuronales pueden adaptarse a diversas discretizaciones sin necesidad de reentrenamiento. Esta propiedad mejora la robustez y la aplicabilidad de los operadores neuronales en diferentes escenarios, proporcionando un rendimiento consistente en distintas resoluciones y mallas.

Definición y formulación

Arquitectónicamente, los operadores neuronales son similares a las redes neuronales de propagación directa en el sentido de que están compuestos por transformaciones lineales alternadas y no linealidades. Dado que los operadores neuronales actúan sobre funciones y generan funciones de salida, se han formulado como una secuencia de operadores integrales lineales alternados sobre espacios de funciones y no linealidades puntuales. [ 1 ] Utilizando una arquitectura análoga a la de las redes neuronales de dimensión finita, se han demostrado teoremas de aproximación universales similares para los operadores neuronales. En particular, se ha demostrado que los operadores neuronales pueden aproximar cualquier operador continuo en un conjunto compacto . [ 1 ]

Los operadores neuronales buscan aproximar algún operador.GRAMO:AU{\displaystyle {\mathcal {G}}:{\mathcal {A}}\to {\mathcal {U}}}entre espacios funcionalesA{\displaystyle {\mathcal {A}}}yU{\displaystyle {\mathcal {U}}}mediante la construcción de un mapa paramétricoGRAMOϕ:AU{\displaystyle {\mathcal {G}}_{\phi}:{\mathcal {A}}\to {\mathcal {U}}}. Tales mapas paramétricosGRAMOϕ{\displaystyle {\mathcal {G}}_{\phi}}Generalmente se puede definir de la forma

GRAMOϕ:=Qσ(WT+KT+bT)σ(W1+K1+b1)PAG,{\displaystyle {\mathcal {G}}_{\phi }:={\mathcal {Q}}\circ \sigma (W_{T}+{\mathcal {K}}_{T}+b_{T})\circ \cdots \circ \sigma (W_{1}+{\mathcal {K}}_{1}+b_{1})\circ {\mathcal {P}},}

dóndePAG,Q{\displaystyle {\mathcal {P}},{\mathcal {Q}}}son los operadores de elevación (elevación del codominio de la función de entrada a un espacio de mayor dimensión) y proyección (proyección del codominio de la función intermedia a la dimensión de salida), respectivamente. Estos operadores actúan puntualmente sobre las funciones y suelen estar parametrizados como perceptrones multicapa .σ{\displaystyle \sigma }es una no linealidad puntual, como una unidad lineal rectificada (ReLU) o una unidad lineal de error gaussiano (GeLU) . Cada capat=1,,T{\displaystyle t=1,\dots ,T}tiene un operador local respectivoWt{\displaystyle W_{t}}(generalmente parametrizado por una red neuronal puntual), un operador integral de núcleoKt{\displaystyle {\mathcal {K}}_{t}}y una función de sesgobt{\displaystyle b_{t}}. Dada alguna representación funcional intermediavt{\displaystyle v_{t}}con dominioD{\displaystyle D}en elt{\displaystyle t}-ésima capa oculta, un operador integral de núcleoKϕ{\displaystyle {\mathcal {K}}_{\phi }}se define como

(Kϕvt)(incógnita):=Dκϕ(incógnita,y,vt(incógnita),vt(y))vt(y)dy,{\displaystyle ({\mathcal {K}}_{\phi }v_{t})(x):=\int _{D}\kappa _{\phi }(x,y,v_{t}(x),v_{t}(y))v_{t}(y)dy,}

donde el núcleoκϕ{\displaystyle \kappa _{\phi }}es una red neuronal implícita entrenable, parametrizada porϕ{\displaystyle \phi }.

En la práctica, a menudo se proporciona la función de entrada al operador neuronal con una resolución específica. Por ejemplo, considérese el escenario en el que se proporciona la evaluación devt{\displaystyle v_{t}}ennorte{\displaystyle n}agujas{yj}jnorte{\displaystyle \{y_{j}\}_{j}^{n}}Tomando prestados métodos de aproximación de integrales de Nyström, como la integración de suma de Riemann y la cuadratura gaussiana , la operación integral anterior se puede calcular de la siguiente manera:

Dκϕ(incógnita,y,vt(incógnita),vt(y))vt(y)dyjnorteκϕ(incógnita,yj,vt(incógnita),vt(yj))vt(yj)Δyj,{\displaystyle \int _{D}\kappa _{\phi }(x,y,v_{t}(x),v_{t}(y))v_{t}(y)dy\approx \sum _{j}^{n}\kappa _{\phi }(x,y_{j},v_{t}(x),v_{t}(y_{j}))v_{t}(y_{j})\Delta _{y_{j}},}

dóndeΔyj{\displaystyle \Delta _{y_{j}}}es el volumen de subárea o peso de cuadratura asociado al puntoyj{\displaystyle y_{j}}Por lo tanto, se puede calcular una capa simplificada como

vt+1(incógnita)σ(jnorteκϕ(incógnita,yj,vt(incógnita),vt(yj))vt(yj)Δyj+Wt(vt(yj))+bt(incógnita)).{\displaystyle v_{t+1}(x)\approx \sigma \left(\sum _{j}^{n}\kappa _{\phi }(x,y_{j},v_{t}(x),v_{t}(y_{j}))v_{t}(y_{j})\Delta _{y_{j}}+W_{t}(v_{t}(y_{j}))+b_{t}(x)\right).}

La aproximación anterior, junto con la parametrizaciónκϕ{\displaystyle \kappa _{\phi }}como red neuronal implícita, da como resultado el operador neuronal gráfico (GNO). [ 18 ]

Se han realizado diversas parametrizaciones de operadores neuronales para diferentes aplicaciones. [ 7 ] [ 18 ] Estas suelen diferir en su parametrización deκ{\displaystyle \kappa }La instanciación más popular es el operador neuronal de Fourier (FNO). El FNO tomaκϕ(incógnita,y,vt(incógnita),vt(y)):=κϕ(incógnitay){\displaystyle \kappa _{\phi }(x,y,v_{t}(x),v_{t}(y)):=\kappa _{\phi }(x-y)}y aplicando el teorema de convolución , se llega a la siguiente parametrización del operador integral del núcleo:

(Kϕvt)(incógnita)=F1(Rϕ(Fvt))(incógnita),{\displaystyle ({\mathcal {K}}_{\phi }v_{t})(x)={\mathcal {F}}^{-1}(R_{\phi }\cdot ({\mathcal {F}}v_{t}))(x),}

dóndeF{\displaystyle {\mathcal {F}}}representa la transformada de Fourier yRϕ{\displaystyle R_{\phi }}representa la transformada de Fourier de alguna función periódicaκϕ{\displaystyle \kappa _{\phi }}Es decir, FNO parametriza la integración del núcleo directamente en el espacio de Fourier, utilizando un número predefinido de modos de Fourier. Cuando la malla en la que se presenta la función de entrada es uniforme, la transformada de Fourier se puede aproximar mediante la transformada discreta de Fourier (DFT) con frecuencias inferiores a un umbral especificado. La transformada discreta de Fourier se puede calcular mediante una implementación de la transformada rápida de Fourier (FFT) .

Capacitación

El entrenamiento de operadores neuronales es similar al proceso de entrenamiento de una red neuronal tradicional. Los operadores neuronales se entrenan típicamente en alguna norma Lp o norma Sobolev . En particular, para un conjunto de datos{(ai,i)}i=1norte{\displaystyle \{(a_{i},u_{i})\}_{i=1}^{N}}de tamañonorte{\displaystyle N}, los operadores neuronales minimizan (una discretización de)

LU({(ai,i)}i=1norte):=i=1norteiGRAMOθ(ai)U2{\displaystyle {\mathcal {L}}_{\mathcal {U}}(\{(a_{i},u_{i})\}_{i=1}^{N}):=\sum _{i=1}^{N}\|u_{i}-{\mathcal {G}}_{\theta }(a_{i})\|_{\mathcal {U}}^{2}},

dóndeU{\displaystyle \|\cdot \|_{\mathcal {U}}}es una norma en el espacio de la función de salidaU{\displaystyle {\mathcal {U}}}Los operadores neuronales se pueden entrenar directamente utilizando métodos basados ​​en retropropagación y descenso de gradiente .

Otro paradigma de entrenamiento está asociado con el aprendizaje automático informado por la física. En particular, las redes neuronales informadas por la física (PINN) utilizan leyes físicas completas para ajustar redes neuronales a soluciones de EDP. Las extensiones de este paradigma al aprendizaje de operadores se denominan ampliamente operadores neuronales informados por la física (PINO), [ 19 ] donde las funciones de pérdida pueden incluir ecuaciones físicas completas o leyes físicas parciales. A diferencia de las PINN estándar, el paradigma PINO incorpora una pérdida de datos (como se definió anteriormente) además de la pérdida física.LPAGDmi(a,GRAMOθ(a)){\displaystyle {\mathcal {L}}_{PDE}(a,{\mathcal {G}}_{\theta }(a))}. La pérdida físicaLPAGDmi(a,GRAMOθ(a)){\displaystyle {\mathcal {L}}_{PDE}(a,{\mathcal {G}}_{\theta }(a))}cuantifica cuánto la solución prevista deGRAMOθ(a){\displaystyle {\mathcal {G}}_{\theta }(a)}viola la ecuación de EDP para la entradaa{\displaystyle a}.

Véase también

Referencias

  1. 1 2 3 4 5 Kovachki, Nikola; Li, Zongyi; Liu, Buriede; Azizzadenesheli, Kamyar; Bhattacharya, Kaushik; Stuart, Andrew; Anandkumar, Anima (2021). "Operador neuronal: aprendizaje de mapas entre espacios de funciones" (PDF) . Journal of Machine Learning Research . 24 : 1–97 . arXiv : 2108.08481 .
  2. 1 2 Azizzadenesheli, Kamyar; Kovachki, Nikola; Li, Zongyi; Liu-Schiaffini, Miguel; Kossaifi, Jean; Anandkumar, Anima (2024). "Operadores neuronales para acelerar simulaciones y diseño científicos" . Nature Reviews Physics . 6 (5): 320– 328. arXiv : 2309.15325 . Bibcode : 2024NatRP...6..320A . doi : 10.1038/s42254-024-00712-5 .
  3. Evans, LC (1998). Ecuaciones diferenciales parciales . Providence: American Mathematical Society. ISBN 0-8218-0772-2.
  4. «Cómo los modelos de IA están transformando la predicción meteorológica: una muestra de sistemas basados ​​en datos» . phys.org (Comunicado de prensa). Centro Europeo de Previsiones Meteorológicas a Medio Plazo. 6 de septiembre de 2023.
  5. Russ, Dan; Abinader, Sacha (23 de agosto de 2023). "Microsoft y Accenture se asocian para abordar las emisiones de metano con tecnología de IA" . Blog de Microsoft Azure .
  6. Li, Zijie; Meidani, Kazem; Farimani, Amir Barati (27-04-2023), Transformer for Partial Differential Equations' Operator Learning , arXiv : 2205.13671
  7. 1 2 Li, Zongyi; Kovachki, Nikola; Azizzadenesheli, Kamyar; Liu, Buriede; Bhattacharya, Kaushik; Stuart, Andrew; Anima, Anandkumar (2020). "Operador neuronal de Fourier para ecuaciones diferenciales parciales paramétricas". arXiv : 2010.08895 [ cs.LG ].
  8. Hao, Karen (30 de octubre de 2020). "La IA ha resuelto un rompecabezas matemático clave para comprender nuestro mundo" . MIT Technology Review .
  9. Ananthaswamy, Anil (19 de abril de 2021). "Las últimas redes neuronales resuelven las ecuaciones más difíciles del mundo más rápido que nunca" . Quanta Magazine .
  10. Sharma, Anuj; Singh, Sukhdeep; Ratna, S. (15 de agosto de 2023). "Operadores de redes neuronales gráficas: una revisión". Multimedia Tools and Applications . 83 (8): 23413– 23436. doi : 10.1007/s11042-023-16440-4 .
  11. Wen, Gege; Li, Zongyi; Azizzadenesheli, Kamyar; Anandkumar, Anima; Benson, Sally M. (mayo de 2022). "U-FNO: un modelo de aprendizaje profundo basado en un operador neuronal de Fourier mejorado para flujo multifásico". Advances in Water Resources . 163 104180. arXiv : 2109.03697 . Bibcode : 2022AdWR..16304180W . doi : 10.1016/j.advwatres.2022.104180 .
  12. Choubineh, Abouzar; Chen, Jie; Wood, David A.; Coenen, Frans; Ma, Fei (2023). "Operador neuronal de Fourier para el flujo de fluidos en un conjunto de datos de medios porosos simulados en 2D de forma pequeña" . Algorithms . 16 (1): 24. doi : 10.3390/a16010024 .
  13. Jiang, Chiyu Lmaxr; Esmaeilzadeh, Soheil; Azizzadenesheli, Kamyar; Kashinath, Karthik; Mustafa, Mustafa; Tchelepi, Hamdi A.; Marcus, Philip; Prabhat, Mr; Anandkumar, Anima (2020). "MESHFREEFLOWNET: Un marco de superresolución espaciotemporal continuo profundo con restricciones físicas". SC20: Conferencia internacional sobre computación de alto rendimiento, redes, almacenamiento y análisis . pp. 1–15 . doi : 10.1109/SC41405.2020.00013 . ISBN  978-1-7281-9998-6.
  14. Lu, Lu; Jin, Pengzhan; Pang, Guofei; Zhang, Zhongqiang; Karniadakis, George Em (18 de marzo de 2021). "Aprendizaje de operadores no lineales mediante DeepONet basado en el teorema de aproximación universal de operadores". Nature Machine Intelligence . 3 (3): 218– 229. arXiv : 1910.03193 . doi : 10.1038/s42256-021-00302-5 .
  15. Kovachki, Nikola B.; Lanthaler, Samuel; Stuart, Andrew M. (2024). «Aprendizaje de operadores: algoritmos y análisis». En Mishra, Siddhartha; Townsend, Alex (eds.). Manual de análisis numérico . Vol. 25. Elsevier. pp. 419–467 . doi : 10.1016/bs.hna.2024.05.009 . ISBN   9780443239847ISSN 1570-8659 
  16. Subedi, Unique; Tewari, Ambuj (2026). "Aprendizaje de operadores: una perspectiva estadística" . Annual Review of Statistics and Its Application . 13 : 123–148 . doi : 10.1146/annurev-statistics-042424-070908 .
  17. Boullé, Nicolas; Townsend, Alex (2024). «Una guía matemática para el aprendizaje de operadores». En Mishra, Siddhartha; Townsend, Alex (eds.). Manual de análisis numérico . Vol. 25. Elsevier. pp. 83–125 . doi : 10.1016/bs.hna.2024.05.003 . ISBN   9780443239847ISSN 1570-8659 
  18. 1 2 Li, Zongyi; Kovachki, Nikola; Azizzadenesheli, Kamyar; Liu, Buriede; Bhattacharya, Kaushik; Stuart, Andrew; Anima, Anandkumar (2020). "Operador neuronal: red de núcleo gráfico para ecuaciones diferenciales parciales". arXiv : 2003.03485 [ cs.LG ].
  19. Li, Zongyi; Hongkai, Zheng; Kovachki, Nikola; Jin, David; Chen, Haoxuan; Liu, Buriede; Azizzadenesheli, Kamyar; Anima, Anandkumar (2021). "Operador neuronal basado en la física para el aprendizaje de ecuaciones diferenciales parciales". arXiv : 2111.03794 [ cs.LG ].
  • neuronalop – Biblioteca de Python con diversas arquitecturas de operadores neuronales