Articulo de referencia

Modelo basado en la energía

Un modelo basado en energía ( EBM ), también llamado aprendizaje de conjunto canónico ( CEL ) o aprendizaje mediante conjunto canónico ( LCE ), es una aplicación de la formulaci...

Un modelo basado en energía ( EBM ), también llamado aprendizaje de conjunto canónico ( CEL ) o aprendizaje mediante conjunto canónico ( LCE ), es una aplicación de la formulación de conjunto canónico de la física estadística para aprender a partir de datos . Este enfoque aparece de forma destacada en la inteligencia artificial generativa .

Los modelos basados ​​en la evidencia (EBM) proporcionan un marco unificado para muchos enfoques probabilísticos y no probabilísticos de este tipo de aprendizaje, en particular para el entrenamiento de modelos gráficos y otros modelos estructurados.

Un modelo basado en evidencia (EBM) aprende las características de un conjunto de datos objetivo y genera un conjunto de datos similar, pero de mayor tamaño. Los EBM detectan las variables latentes de un conjunto de datos y generan nuevos conjuntos de datos con una distribución similar.

Las redes neuronales generativas basadas en energía [ 1 ] [ 2 ] son ​​una clase de modelos generativos que tienen como objetivo aprender distribuciones de probabilidad explícitas de datos en forma de modelos basados ​​en energía, cuyas funciones de energía son parametrizadas por redes neuronales profundas modernas .

Las máquinas de Boltzmann son una forma especial de modelos basados ​​en energía con una parametrización específica de la energía. [ 3 ]

Descripción

Para una entrada dadaincógnita{\displaystyle x}El modelo describe una energíamiθ(incógnita){\displaystyle E_{\theta }(x)}de tal manera que la distribución de BoltzmannPAGθ(incógnita)=miβmiθ(incógnita)Z(θ){\displaystyle P_{\theta }(x)={e^{-\beta E_{\theta }(x)} \over Z(\theta )}}es una probabilidad (densidad) y, típicamente,β=1{\displaystyle \beta =1}.

Dado que la constante de normalización:

Z(θ):=incógnitaincógnitamiβmiθ(incógnita)dincógnita{\displaystyle Z(\theta ):=\int _{x\in X}e^{-\beta E_{\theta }(x)}dx}

(también conocida como función de partición ) depende de todos los factores de Boltzmann de todas las entradas posibles.incógnita{\displaystyle x}, no se puede calcular fácilmente ni estimar de forma fiable durante el entrenamiento simplemente utilizando la estimación estándar de máxima verosimilitud .

Sin embargo, para maximizar la probabilidad durante el entrenamiento, el gradiente de la log-verosimilitud de un solo ejemplo de entrenamientoincógnita{\displaystyle x}se obtiene utilizando la regla de la cadena :

θregistro(PAGθ(incógnita))=miincógnitaPAGθ[θmiθ(incógnita)]θmiθ(incógnita)(){\displaystyle \partial _{\theta }\log \left(P_{\theta }(x)\right)=\mathbb {E} _{x'\sim P_{\theta }}[\partial _{\theta }E_{\theta }(x')]-\partial _{\theta }E_{\theta }(x)\,(*)}

La expectativa en la fórmula anterior para el gradiente se puede estimar aproximadamente tomando muestras.incógnita{\displaystyle x'}de la distribuciónPAGθ{\displaystyle P_{\theta }}utilizando el método de Monte Carlo de cadena de Markov (MCMC). [ 4 ]

Los primeros modelos basados ​​en energía, como la máquina de Boltzmann de Hinton de 2003 , estimaron esta expectativa mediante muestreo de Gibbs bloqueado . Los enfoques más recientes utilizan dinámicas de Langevin de gradiente estocástico (LD) más eficientes, extrayendo muestras mediante: [ 5 ]

incógnita0PAG0,incógnitai+1=incógnitaiα2miθ(incógnitai)incógnitai+ϵ{\displaystyle x_{0}'\sim P_{0},x_{i+1}'=x_{i}'-{\frac {\alpha }{2}}{\frac {\partial E_{\theta }(x_{i}')}{\partial x_{i}'}}+\epsilon },

dóndeϵnorte(0,α){\displaystyle \epsilon \sim {\mathcal {N}}(0,\alpha )}. Un búfer de reproducción de valores anterioresincógnitai{\displaystyle x_{i}'}Se utiliza con LD para inicializar el módulo de optimización.

Los parámetrosθ{\displaystyle \theta }Por lo tanto, la red neuronal se entrena de manera generativa mediante la estimación de máxima verosimilitud basada en MCMC: [ 6 ] el proceso de aprendizaje sigue un esquema de "análisis por síntesis", donde dentro de cada iteración de aprendizaje, el algoritmo muestrea los ejemplos sintetizados del modelo actual mediante un método MCMC basado en gradiente (por ejemplo, dinámica de Langevin o Monte Carlo híbrido ) y luego actualiza los parámetros.θ{\displaystyle \theta }basado en la diferencia entre los ejemplos de entrenamiento y los sintetizados – ver ecuación(){\displaystyle (*)}Este proceso puede interpretarse como un proceso alterno de búsqueda y cambio de modo , y también tiene una interpretación adversarial. [ 7 ] [ 8 ]

Esencialmente, el modelo aprende una funciónmiθ{\displaystyle E_{\theta }}que asocia energías bajas con valores correctos y energías más altas con valores incorrectos.

Después del entrenamiento, dado un modelo de energía convergentemiθ{\displaystyle E_{\theta }}El algoritmo de Metropolis-Hastings se puede utilizar para obtener nuevas muestras. La probabilidad de aceptación viene dada por:

PAGadodo(incógnitaiincógnita)=min(1,PAGθ(incógnita)PAGθ(incógnitai)).{\displaystyle P_{acc}(x_{i}\to x^{*})=\min \left(1,{\frac {P_{\theta }(x^{*})}{P_{\theta }(x_{i})}}\right).}

Historia

El término "modelos basados ​​en energía" se acuñó por primera vez en un artículo de JMLR de 2003 [ 9 ], donde los autores definieron una generalización del análisis de componentes independientes al contexto sobrecompleto utilizando EBM. Otros trabajos iniciales sobre EBM propusieron modelos que representaban la energía como una composición de variables latentes y observables.

Características

Los EBM demuestran propiedades útiles: [ 4 ]

  • Sencillez y estabilidad. El EBM es el único objeto que necesita ser diseñado y entrenado. No es necesario entrenar redes separadas para garantizar el equilibrio.
  • Tiempo de cálculo adaptativo. Un EBM puede generar muestras nítidas y diversas o (más rápidamente) muestras menos diversas y menos precisas. Con tiempo ilimitado, este procedimiento produce muestras verdaderas.
  • Flexibilidad. En los autoencoders variacionales (VAE) y los modelos basados ​​en flujo , el generador aprende un mapeo de un espacio continuo a un espacio (posiblemente) discontinuo que contiene diferentes modos de datos. Los EBM pueden aprender a asignar energías bajas a regiones disjuntas (múltiples modos).
  • Generación adaptativa. Los generadores EBM se definen implícitamente por la distribución de probabilidad y se adaptan automáticamente a medida que la distribución cambia (sin entrenamiento), lo que permite a los EBM abordar dominios donde el entrenamiento del generador es impracticable, además de minimizar el colapso de modos y evitar modos espurios provenientes de muestras fuera de la distribución. [ 4 ]
  • Composicionalidad. Los modelos individuales son distribuciones de probabilidad no normalizadas, lo que permite combinarlos mediante el producto de expertos u otras técnicas jerárquicas.

Resultados experimentales

En conjuntos de datos de imágenes como CIFAR-10 e ImageNet 32x32, un modelo EBM generó imágenes de alta calidad con relativa rapidez. Admitió la combinación de características aprendidas de un tipo de imagen para generar otros tipos de imágenes. Fue capaz de generalizar utilizando conjuntos de datos fuera de la distribución, superando a los modelos basados ​​en flujo y autorregresivos . EBM fue relativamente resistente a perturbaciones adversarias, comportándose mejor que los modelos entrenados explícitamente contra ellas con entrenamiento para clasificación. [ 4 ]

Aplicaciones

Entre las aplicaciones a las que se dirige se incluyen el procesamiento del lenguaje natural , la robótica y la visión artificial .

La primera red neuronal generativa basada en energía es la ConvNet generativa propuesta en 2016 para patrones de imágenes, donde la red neuronal es una red neuronal convolucional . [ 10 ] [ 11 ] El modelo se ha generalizado a varios dominios para aprender distribuciones de videos, [ 7 ] [ 2 ] y vóxeles 3D. [ 12 ] Se hacen más efectivos en sus variantes. [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] Han demostrado ser útiles para la generación de datos (por ejemplo, síntesis de imágenes, síntesis de video, [ 7 ] síntesis de formas 3D, [ 4 ] etc.), recuperación de datos (por ejemplo, recuperación de videos con píxeles o fotogramas de imagen faltantes, [ 7 ] superresolución 3D, [ 4 ] etc.), reconstrucción de datos (por ejemplo, reconstrucción de imágenes e interpolación lineal [ 14 ] ).

Alternativas

Los EBM compiten con técnicas como los autoencoders variacionales (VAE), las redes generativas antagónicas (GAN) o los flujos normalizadores .

Extensiones

Modelos conjuntos basados ​​en la energía

Un clasificador puede reinterpretarse como un modelo conjunto basado en energía.

Los modelos conjuntos basados ​​en energía (JEM), propuestos en 2020 por Grathwohl et al., permiten interpretar cualquier clasificador con salida softmax como un modelo basado en energía. La observación clave es que dicho clasificador se entrena para predecir la probabilidad condicional.pagθ(y|incógnita)=miFθ(incógnita)[y]j=1KmiFθ(incógnita)[j]   para y=1,,K y Fθ=(F1,,FK)RK,{\displaystyle p_{\theta }(y|x)={\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{\sum _{j=1}^{K}e^{{\vec {f}}_{\theta }(x)[j]}}}\ \ {\text{ para }}y=1,\dotsc ,K{\text{ y }}{\vec {f}}_{\theta }=(f_{1},\dotsc ,f_{K})\in \mathbb {R} ^{K},} dóndeFθ(incógnita)[y]{\displaystyle {\vec {f}}_{\theta }(x)[y]}es el índice y de los logitsF{\displaystyle {\vec {f}}}correspondiente a la clase y. Sin ningún cambio en los logits, se propuso reinterpretar los logits para describir una densidad de probabilidad conjunta:

pagθ(y,incógnita)=miFθ(incógnita)[y]Z(θ),{\displaystyle p_{\theta }(y,x)={\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}},}

con función de partición desconocidaZ(θ){\displaystyle Z(\theta )}y energíamiθ(incógnita,y)=Fθ(incógnita)[y]{\displaystyle E_{\theta }(x,y)=-f_{\theta }(x)[y]}Mediante marginalización, obtenemos la densidad no normalizada.

pagθ(incógnita)=ypagθ(y,incógnita)=ymiFθ(incógnita)[y]Z(θ)=:mimiθ(incógnita),{\displaystyle p_{\theta }(x)=\sum _{y}p_{\theta }(y,x)=\sum _{y}{\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}}=:e^{-E_{\theta }(x)},}

por lo tanto,

miθ(incógnita)=registro(ymiFθ(incógnita)[y]Z(θ)),{\displaystyle E_{\theta }(x)=-\log \left(\sum _{y}{\frac {e^{{\vec {f}}_{\theta }(x)[y]}}{Z(\theta )}}\right),}

de modo que cualquier clasificador pueda utilizarse para definir una función de energía.miθ(incógnita){\displaystyle E_{\theta }(x)}.

Véase también

Literatura

  • Generación implícita y generalización en modelos basados ​​en energía Yilun Du, Igor Mordatch https://arxiv.org/abs/1903.08689
  • Tu clasificador es secretamente un modelo basado en energía y deberías tratarlo como tal, Will Grathwohl, Kuan-Chieh Wang, Jörn-Henrik Jacobsen, David Duvenaud , Mohammad Norouzi, Kevin Swersky https://arxiv.org/abs/1912.03263
  • Los transformadores basados ​​en energía son aprendices y pensadores escalables, Alexi Gladstone, Ganesh Nanduru, Md Mofijul Islam, Peixuan Han, Hyeonjeong Ha, Aman Chadha, Yilun Du, Heng Ji, Jundong Li, Tariq https://arxiv.org/abs/2507.02092

Referencias

  1. ^ Xie, Jianwen; Lu, Yang; Zhu, Song-Chun; Wu, Ying Nian (2016). "Una teoría de ConvNet generativa". ICML . arXiv : 1602.03264 . Código Bib : 2016arXiv160203264X .
  2. 1 2 Xie, Jianwen; Zhu, Song-Chun; Wu, Ying Nian (2019). "Aprendizaje de redes neuronales convolucionales generativas espaciotemporales basadas en energía para patrones dinámicos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (2): 516– 531. arXiv : 1909.11975 . Bibcode : 2019arXiv190911975X . doi : 10.1109/tpami.2019.2934852 . ISSN 0162-8828 . PMID 31425020 . S2CID 201098397 .   
  3. Aprendizaje de arquitecturas profundas para IA, Yoshua Bengio, página 54, https://books.google.com/books?id=cq5ewg7FniMC&pg=PA54
  4. 1 2 3 4 5 6 Du, Yilun; Mordatch, Igor (2019-03-20). "Generación implícita y generalización en modelos basados ​​en energía". arXiv : 1903.08689 [ cs.LG ].
  5. Grathwohl, Will, et al. "Tu clasificador es secretamente un modelo basado en energía y deberías tratarlo como tal." Preimpresión de arXiv arXiv:1912.03263 (2019).
  6. Barbu, Adrian; Zhu, Song-Chun (2020). Métodos de Monte Carlo . Springer.
  7. 1 2 3 4 Xie, Jianwen; Zhu, Song-Chun; Wu, Ying Nian (julio de 2017). "Síntesis de patrones dinámicos mediante redes neuronales convolucionales generativas espaciotemporales". Conferencia IEEE de 2017 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 1061–1069 . arXiv : 1606.00972 . doi : 10.1109/cvpr.2017.119 . ISBN  978-1-5386-0457-1. S2CID 763074 . 
  8. Wu, Ying Nian; Xie, Jianwen; Lu, Yang; Zhu, Song-Chun (2018). "Generalizaciones dispersas y profundas del modelo FRAME". Annals of Mathematical Sciences and Applications . 3 (1): 211– 254. doi : 10.4310/amsa.2018.v3.n1.a7 . ISSN 2380-288X . 
  9. Teh, Yee Whye; Welling, Max; Osindero, Simon; Hinton, Geoffrey E. (diciembre de 2003). "Modelos basados ​​en energía para representaciones sobrecompletas dispersas" . JMLR . 4 (dic.): 1235–1260 .
  10. Lecun, Y.; Bottou, L.; Bengio, Y.; Haffner, P. (1998). "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos". Actas del IEEE . 86 (11): 2278– 2324. doi : 10.1109/5.726791 . ISSN 0018-9219 . S2CID 14542261 .  
  11. Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey (2012). "Clasificación de ImageNet con redes neuronales convolucionales profundas" (PDF) . NIPS .
  12. Xie, Jianwen; Zheng, Zilong; Gao, Ruiqi; Wang, Wenguan; Zhu, Song-Chun; Wu, Ying Nian (junio de 2018). "Aprendizaje de redes de descriptores para la síntesis y el análisis de formas 3D". Conferencia IEEE/CVF de 2018 sobre visión por computadora y reconocimiento de patrones . IEEE. págs. 8629–8638 . arXiv : 1804.00586 . Bibcode : 2018arXiv180400586X . doi : 10.1109/cvpr.2018.00900 . ISBN  978-1-5386-6420-9. S2CID 4564025 . 
  13. Gao, Ruiqi; Lu, Yang; Zhou, Junpei; Zhu, Song-Chun; Wu, Ying Nian (junio de 2018). "Aprendizaje de redes neuronales convolucionales generativas mediante modelado y muestreo multigrid". Conferencia IEEE/CVF de 2018 sobre visión por computadora y reconocimiento de patrones . IEEE. págs. 9155–9164 . arXiv : 1709.08868 . doi : 10.1109/cvpr.2018.00954 . ISBN  978-1-5386-6420-9. S2CID 4566195 . 
  14. ^ Nijkamp , ​​Zhu, Song-Chun Wu, Ying Nian, Erik; Colina, Mitch; Zhu, Song-Chun; Wu, Ying Nian (2019). Sobre el aprendizaje de MCMC no convergentes, no persistentes y a corto plazo hacia un modelo basado en energía . NeurIPS. OCLC 1106340764 . {{cite book}}: CS1 maint: falta el editor de la ubicación ( enlace ) CS1 maint: varios nombres: lista de autores ( enlace )
  15. Cai, Xu; Wu, Yang; Li, Guanbin; Chen, Ziliang; Lin, Liang (2019-07-17). "FRAME Revisited: An Interpretation View Based on Particle Evolution" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 33 : 3256–3263 . arXiv : 1812.01186 . doi : 10.1609/aaai.v33i01.33013256 . ISSN 2374-3468 . 
  16. Xie, Jianwen; Lu, Yang; Gao, Ruiqi; Zhu, Song-Chun; Wu, Ying Nian (2020-01-01). "Entrenamiento cooperativo de redes de descriptores y generadores". IEEE Transactions on Pattern Analysis and Machine Intelligence . 42 (1): 27– 45. arXiv : 1609.09408 . Bibcode : 2020ITPAM..42...27X . doi : 10.1109/tpami.2018.2879081 . ISSN 0162-8828 . PMID 30387724 . S2CID 7759006 .   
  17. Xie, Jianwen; Lu, Yang; Gao, Ruiqi; Gao, Song-Chun (2018). " Aprendizaje cooperativo de modelos basados ​​en energía y modelos de variables latentes mediante enseñanza MCMC" . Trigésimo segunda Conferencia AAAI sobre Inteligencia Artificial . 32. doi : 10.1609/aaai.v32i1.11834 . S2CID 9212174 . 
  18. Han, Tian; Nijkamp, ​​Erik; Fang, Xiaolin; Hill, Mitch; Zhu, Song-Chun; Wu, Ying Nian (junio de 2019). «Triángulo de divergencia para el entrenamiento conjunto de modelos generadores, modelos basados ​​en energía y modelos inferenciales». Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 8662–8671 . doi : 10.1109/cvpr.2019.00887 . ISBN  978-1-7281-3293-8. S2CID 57189202 . 
  • "Escuela de Verano CIAR NCAP" . www.cs.toronto.edu . Consultado el 27 de diciembre de 2019 .
  • Dayan, Peter; Hinton, Geoffrey; Neal, Radford; Zemel, Richard S. (1999), "Máquina de Helmholtz", Aprendizaje no supervisado , The MIT Press, doi : 10.7551/mitpress/7011.003.0017 , hdl : 21.11116/0000-0002-D6D3-E , ISBN 978-0-262-28803-3
  • Hinton, Geoffrey E. (agosto de 2002). "Training Products of Experts by Minimizing Contrastive Divergence". Neural Computation . 14 (8): 1771– 1800. doi : 10.1162/089976602760128018 . ISSN 0899-7667 . PMID 12180402. S2CID 207596505 .   
  • Salakhutdinov, Ruslan; Hinton, Geoffrey (15 de abril de 2009). "Máquinas de Boltzmann profundas" . Inteligencia artificial y estadística : 448–455 .