Articulo de referencia

Límite inferior de la evidencia

En los métodos bayesianos variacionales , el límite inferior de la evidencia (a menudo abreviado ELBO , también llamado a veces límite inferior variacional [ 1 ] o energía libre...

En los métodos bayesianos variacionales , el límite inferior de la evidencia (a menudo abreviado ELBO , también llamado a veces límite inferior variacional [ 1 ] o energía libre variacional negativa ) es un límite inferior útil en la log-verosimilitud de algunos datos observados.

El ELBO es útil porque proporciona una garantía sobre el peor caso para la log-verosimilitud de alguna distribución (por ejemplopag(incógnita){\displaystyle p(X)}) que modela un conjunto de datos. La verosimilitud logarítmica real puede ser mayor (lo que indica un ajuste aún mejor a la distribución) porque el ELBO incluye un término de divergencia de Kullback-Leibler (divergencia KL) que disminuye el ELBO debido a que una parte interna del modelo es inexacta a pesar del buen ajuste general del modelo. Por lo tanto, mejorar la puntuación del ELBO indica mejorar la verosimilitud del modelo.pag(incógnita){\displaystyle p(X)}o el ajuste de un componente interno al modelo, o ambos, y la puntuación ELBO constituye una buena función de pérdida , por ejemplo, para entrenar una red neuronal profunda para mejorar tanto el modelo en general como el componente interno. (El componente interno esqϕ(|incógnita){\displaystyle q_{\phi }(\cdot |x)}(definido en detalle más adelante en este artículo).

Definición

Dejarincógnita{\displaystyle X}yZ{\displaystyle Z}sean variables aleatorias , distribuidas conjuntamente con distribuciónpagθ{\displaystyle p_{\theta }}. Por ejemplo,pagθ(incógnita){\displaystyle p_{\theta }(X)}es la distribución marginal deincógnita{\displaystyle X}, ypagθ(Zincógnita){\displaystyle p_{\theta }(Z\mid X)}es la distribución condicional deZ{\displaystyle Z}dadoincógnita{\displaystyle X}Luego, para una muestraincógnitapagdatos{\displaystyle x\sim p_{\text{datos}}}y cualquier distribuciónqϕ{\displaystyle q_{\phi }}, el ELBO se define comoL(ϕ,θ;incógnita):=mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)].{\displaystyle L(\phi ,\theta ;x):=\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right].}El ELBO se puede escribir de forma equivalente como [ 2 ]

L(ϕ,θ;incógnita)=mizqϕ(|incógnita)[lnpagθ(incógnita,z)]+H[qϕ(z|incógnita)]=lnpagθ(incógnita)DKL(qϕ(z|incógnita)||pagθ(z|incógnita)).{\displaystyle {\begin{aligned}L(\phi ,\theta ;x)=&\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {}p_{\theta }(x,z)\right]+H[q_{\phi }(z|x)]\\=&\mathbb {\ln } {}\,p_{\theta }(x)-D_{KL}(q_{\phi }(z|x)||p_{\theta }(z|x)).\\\end{aligned}}}

En la primera línea,H[qϕ(z|incógnita)]{\displaystyle H[q_{\phi}(z|x)]}es la entropía deqϕ{\displaystyle q_{\phi }}, que relaciona el ELBO con la energía libre de Helmholtz . [ 3 ] En la segunda línea,lnpagθ(incógnita){\displaystyle \ln p_{\theta }(x)}se llama la evidencia deincógnita{\displaystyle x}, yDKL(qϕ(z|incógnita)||pagθ(z|incógnita)){\displaystyle D_{KL}(q_{\phi }(z|x)||p_{\theta }(z|x))}es la divergencia de Kullback-Leibler entreqϕ{\displaystyle q_{\phi }}ypagθ{\displaystyle p_{\theta }}Dado que la divergencia de Kullback-Leibler no es negativa,L(ϕ,θ;incógnita){\displaystyle L(\phi ,\theta ;x)}forma un límite inferior en la evidencia ( desigualdad ELBO )lnpagθ(incógnita)mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)].{\displaystyle \ln p_{\theta }(x)\geq \mathbb {\mathbb {E} } _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z\vert x)}}\right].}

Motivación

Inferencia bayesiana variacional

Supongamos que tenemos una variable aleatoria observable.incógnita{\displaystyle X}y queremos encontrar su distribución verdaderapag{\displaystyle p^{*}}Esto nos permitiría generar datos mediante muestreo y estimar probabilidades de eventos futuros. En general, es imposible encontrarpag{\displaystyle p^{*}}exactamente, lo que nos obliga a buscar una buena aproximación .

Es decir, definimos una familia paramétrica suficientemente grande.{pagθ}θΘ{\displaystyle \{p_{\theta }\}_{\theta \in \Theta }}de distribuciones, luego resolver paraminθL(pagθ,pag){\displaystyle \min _{\theta }L(p_{\theta },p^{*})}para alguna función de pérdidaL{\displaystyle L}. Una posible forma de resolver esto es considerando pequeñas variaciones depagθ{\displaystyle p_{\theta }}apagθ+δθ{\displaystyle p_{\theta +\delta \theta }}y resolver paraL(pagθ,pag)L(pagθ+δθ,pag)=0{\displaystyle L(p_{\theta },p^{*})-L(p_{\theta +\delta \theta },p^{*})=0}. Este es un problema del cálculo de variaciones , por lo tanto se le llama método variacional .

Dado que no existen muchas familias de distribuciones parametrizadas explícitamente (todas las familias de distribuciones clásicas, como la distribución normal, la distribución de Gumbel , etc., son demasiado simplistas para modelar la distribución verdadera), consideramos distribuciones de probabilidad parametrizadas implícitamente :

  • Primero, definamos una distribución simple.pag(z){\displaystyle p(z)}sobre una variable aleatoria latenteZ{\displaystyle Z}Por lo general, una distribución normal o una distribución uniforme es suficiente.
  • A continuación, definamos una familia de funciones complejas.Fθ{\displaystyle f_{\theta }}(como una red neuronal profunda ) parametrizada porθ{\displaystyle \theta }.
  • Finalmente, defina una forma de convertir cualquierFθ(z){\displaystyle f_{\theta}(z)}en una distribución (en general simple también, pero no relacionado conpag(z){\displaystyle p(z)}) sobre la variable aleatoria observableincógnita{\displaystyle X}. Por ejemplo, dejemosFθ(z)=(F1(z),F2(z)){\ Displaystyle f _ {\ theta} (z) = (f_ {1} (z), f_ {2} (z))}si tenemos dos salidas, entonces podemos definir la distribución correspondiente sobreincógnita{\displaystyle X}ser la distribución normalnorte(F1(z),miF2(z)){\displaystyle {\mathcal {N}}(f_{1}(z),e^{f_{2}(z)})}.

Esto define una familia de distribuciones conjuntas.pagθ{\displaystyle p_{\theta }}encima(incógnita,Z){\displaystyle (X,Z)}Es muy fácil tomar muestras.(incógnita,z)pagθ{\displaystyle (x,z)\sim p_{\theta }}: simplemente muestrazpag{\displaystyle z\sim p}, luego calcularFθ(z){\displaystyle f_{\theta}(z)}y finalmente muestraincógnitapagθ(|z){\displaystyle x\sim p_{\theta }(\cdot |z)}usandoFθ(z){\displaystyle f_{\theta }(z)}.

En otras palabras, tenemos un modelo generativo tanto para lo observable como para lo latente. Ahora, consideramos una distribución.pagθ{\displaystyle p_{\theta }}bueno, si es una aproximación cercana depag{\displaystyle p^{*}}:pagθ(incógnita)pag(incógnita){\displaystyle p_{\theta }(X)\approx p^{*}(X)}ya que la distribución del lado derecho es mayorincógnita{\displaystyle X}solamente, la distribución del lado izquierdo debe marginalizar la variable latenteZ{\displaystyle Z}lejos. En general, es imposible realizar la integral.pagθ(incógnita)=pagθ(incógnita|z)pag(z)dz{\displaystyle p_{\theta }(x)=\int p_{\theta }(x|z)p(z)dz}lo que nos obliga a realizar otra aproximación.

Desdepagθ(incógnita)=pagθ(incógnita|z)pag(z)pagθ(z|incógnita){\displaystyle p_{\theta }(x)={\frac {p_{\theta }(x|z)p(z)}{p_{\theta }(z|x)}}}( Regla de Bayes ), basta con encontrar una buena aproximación depagθ(z|incógnita){\displaystyle p_{\theta }(z|x)}. Entonces, defina otra familia de distribuciónqϕ(z|incógnita){\displaystyle q_{\phi }(z|x)}y usarlo para aproximarpagθ(z|incógnita){\displaystyle p_{\theta }(z|x)}. Este es un modelo discriminativo para la variable latente.

La situación completa se resume en la siguiente tabla:

En lenguaje bayesiano ,incógnita{\displaystyle X}es la evidencia observada, yZ{\displaystyle Z}es lo latente/no observado. La distribuciónpag{\displaystyle p}encimaZ{\displaystyle Z}es la distribución previa sobreZ{\displaystyle Z},pagθ(incógnita|z){\displaystyle p_{\theta }(x|z)}es la función de verosimilitud ypagθ(z|incógnita){\displaystyle p_{\theta }(z|x)}es la distribución posterior sobreZ{\displaystyle Z}.

Dada una observaciónincógnita{\displaystyle x}, podemos inferir quéz{\displaystyle z}probablemente dio origen aincógnita{\displaystyle x}mediante computaciónpagθ(z|incógnita){\displaystyle p_{\theta }(z|x)}El método bayesiano habitual consiste en estimar la integral.pagθ(incógnita)=pagθ(incógnita|z)pag(z)dz{\displaystyle p_{\theta }(x)=\int p_{\theta }(x|z)p(z)dz}Luego, calcula mediante la regla de Bayes.pagθ(z|incógnita)=pagθ(incógnita|z)pag(z)pagθ(incógnita){\displaystyle p_{\theta }(z|x)={\frac {p_{\theta }(x|z)p(z)}{p_{\theta }(x)}}}Esto es costoso de realizar en general, pero si podemos encontrar una buena aproximaciónqϕ(z|incógnita)pagθ(z|incógnita){\displaystyle q_{\phi }(z|x)\approx p_{\theta }(z|x)}para la mayoríaincógnita,z{\displaystyle x,z}, entonces podemos inferirz{\displaystyle z}deincógnita{\displaystyle x}barato. Por lo tanto, la búsqueda de un buenqϕ{\displaystyle q_{\phi }}También se denomina inferencia amortizada .

En definitiva, hemos encontrado un problema de inferencia bayesiana variacional .

Derivación del ELBO

Un resultado básico en la inferencia variacional es que minimizar la divergencia de Kullback-Leibler (divergencia KL) es equivalente a maximizar la log-verosimilitud:miincógnitapag(incógnita)[lnpagθ(incógnita)]=H(pag)DKL(pag(incógnita)pagθ(incógnita)){\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]=-H(p^{*})-D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))}dóndeH(pag)=miincógnitapag[lnpag(incógnita)]{\displaystyle H(p^{*})=-\mathbb {\mathbb {E} } _{x\sim p^{*}}[\ln p^{*}(x)]}es la entropía de la distribución verdadera. Entonces, si podemos maximizarmiincógnitapag(incógnita)[lnpagθ(incógnita)]{\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]}podemos minimizarDKL(pag(incógnita)pagθ(incógnita)){\displaystyle D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))}y, en consecuencia, encontrar una aproximación precisapagθpag{\displaystyle p_{\theta }\approx p^{*}}.

Para maximizarmiincógnitapag(incógnita)[lnpagθ(incógnita)]{\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]}, simplemente tomamos muestras de muchosincógnitaipag(incógnita){\displaystyle x_{i}\sim p^{*}(x)}es decir, utilizar el muestreo por importancianortemáximoθmiincógnitapag(incógnita)[lnpagθ(incógnita)]máximoθilnpagθ(incógnitai){\displaystyle N\max _{\theta }\mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]\approx \max _{\theta }\sum _{i}\ln p_{\theta }(x_{i})}dóndenorte{\displaystyle N}es el número de muestras extraídas de la distribución verdadera. Esta aproximación puede considerarse un sobreajuste . [ nota 1 ]

Para maximizarilnpagθ(incógnitai){\displaystyle \sum _{i}\ln p_{\theta }(x_{i})}, es necesario encontrarlnpagθ(incógnita){\displaystyle \ln p_{\theta }(x)}:lnpagθ(incógnita)=lnpagθ(incógnita|z)pag(z)dz{\displaystyle \ln p_{\theta }(x)=\ln \int p_{\theta }(x|z)p(z)dz}Por lo general, esto no tiene una forma cerrada y debe estimarse. La forma habitual de estimar integrales es la integración de Monte Carlo con muestreo de importancia :pagθ(incógnita|z)pag(z)dz=mizqϕ(|incógnita)[pagθ(incógnita,z)qϕ(z|incógnita)]{\displaystyle \int p_{\theta }(x|z)p(z)dz=\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]}dóndeqϕ(z|incógnita){\displaystyle q_{\phi }(z|x)}es una distribución de muestreo sobrez{\displaystyle z}que utilizamos para realizar la integración de Monte Carlo.

Entonces vemos que si tomamos una muestrazqϕ(|incógnita){\displaystyle z\sim q_{\phi }(\cdot |x)}, entoncespagθ(incógnita,z)qϕ(z|incógnita){\displaystyle {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}}es un estimador insesgado depagθ(incógnita){\displaystyle p_{\theta }(x)}Desafortunadamente, esto no nos proporciona un estimador insesgado delnpagθ(incógnita){\displaystyle \ln p_{\theta }(x)}, porqueln{\displaystyle \ln }es no lineal. De hecho, tenemos por la desigualdad de Jensen ,lnpagθ(incógnita)=lnmizqϕ(|incógnita)[pagθ(incógnita,z)qϕ(z|incógnita)]mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)]{\displaystyle \ln p_{\theta }(x)=\ln \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]\geq \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]}De hecho, todos los estimadores obvios delnpagθ(incógnita){\displaystyle \ln p_{\theta }(x)}están sesgados a la baja, porque no importa cuántas muestras deziqϕ(|incógnita){\displaystyle z_{i}\sim q_{\phi }(\cdot |x)}tomamos, tenemos por la desigualdad de Jensen:miziqϕ(|incógnita)[ln(1norteipagθ(incógnita,zi)qϕ(zi|incógnita))]lnmiziqϕ(|incógnita)[1norteipagθ(incógnita,zi)qϕ(zi|incógnita)]=lnpagθ(incógnita){\displaystyle \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[\ln \left({\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(x,z_{i})}{q_{\phi }(z_{i}|x)}}\right)\right]\leq \ln \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[{\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(x,z_{i})}{q_{\phi }(z_{i}|x)}}\right]=\ln p_{\theta }(x)}Restando el lado derecho, vemos que el problema se reduce a un estimador sesgado de cero:miziqϕ(|incógnita)[ln(1norteipagθ(zi|incógnita)qϕ(zi|incógnita))]0{\displaystyle \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[\ln \left({\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(z_{i}|x)}{q_{\phi }(z_{i}|x)}}\right)\right]\leq 0}En este punto, podríamos desviarnos hacia el desarrollo de un autoencoder ponderado por importancia [ nota 2 ] , pero en su lugar continuaremos con el caso más simple connorte=1{\displaystyle N=1}:lnpagθ(incógnita)=lnmizqϕ(|incógnita)[pagθ(incógnita,z)qϕ(z|incógnita)]mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)]{\displaystyle \ln p_{\theta }(x)=\ln \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]\geq \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]}La rigidez de la desigualdad tiene una forma cerrada:lnpagθ(incógnita)mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)]=DKL(qϕ(|incógnita)pagθ(|incógnita))0{\displaystyle \ln p_{\theta }(x)-\mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]=D_{\mathit {KL}}(q_{\phi }(\cdot |x)\|p_{\theta }(\cdot |x))\geq 0}Hemos obtenido así la función ELBO:L(ϕ,θ;incógnita):=lnpagθ(incógnita)DKL(qϕ(|incógnita)pagθ(|incógnita)){\displaystyle L(\phi ,\theta ;x):=\ln p_{\theta }(x)-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\|p_{\theta }(\cdot |x))}

Maximizar el ELBO

Para fijoincógnita{\displaystyle x}la optimizaciónmáximoθ,ϕL(ϕ,θ;incógnita){\displaystyle \max _{\theta ,\phi }L(\phi ,\theta ;x)}Intenta simultáneamente maximizarlnpagθ(incógnita){\displaystyle \ln p_{\theta }(x)}y minimizarDKL(qϕ(|incógnita)pagθ(|incógnita)){\displaystyle D_{\mathit {KL}}(q_{\phi }(\cdot |x)\|p_{\theta }(\cdot |x))}. Si la parametrización parapagθ{\displaystyle p_{\theta }}yqϕ{\displaystyle q_{\phi }}son lo suficientemente flexibles, obtendríamos algunosϕ^,θ^{\displaystyle {\hat {\phi }},{\hat {\theta }}}, de tal manera que tengamos simultáneamente

lnpagθ^(incógnita)máximoθlnpagθ(incógnita);qϕ^(|incógnita)pagθ^(|incógnita){\displaystyle \ln p_{\hat {\theta }}(x)\approx \max _{\theta }\ln p_{\theta }(x);\quad q_{\hat {\phi }}(\cdot |x)\approx p_{\hat {\theta }}(\cdot |x)}Desdemiincógnitapag(incógnita)[lnpagθ(incógnita)]=H(pag)DKL(pag(incógnita)pagθ(incógnita)){\displaystyle \mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]=-H(p^{*})-D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))}tenemoslnpagθ^(incógnita)máximoθH(pag)DKL(pag(incógnita)pagθ(incógnita)){\displaystyle \ln p_{\hat {\theta }}(x)\approx \max _{\theta }-H(p^{*})-D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))}y entoncesθ^argminDKL(pag(incógnita)pagθ(incógnita)){\displaystyle {\hat {\theta }}\approx \arg \min D_{\mathit {KL}}(p^{*}(x)\|p_{\theta }(x))}En otras palabras, maximizar el ELBO nos permitiría simultáneamente obtener un modelo generativo preciso.pagθ^pag{\displaystyle p_{\hat {\theta }}\approx p^{*}}y un modelo discriminatorio precisoqϕ^(|incógnita)pagθ^(|incógnita){\displaystyle q_{\hat {\phi }}(\cdot |x)\approx p_{\hat {\theta }}(\cdot |x)}. [ 5 ]

Formas principales

El ELBO tiene muchas expresiones posibles, cada una con un énfasis diferente.

mizqϕ(|incógnita)[lnpagθ(incógnita,z)qϕ(z|incógnita)]=qϕ(z|incógnita)lnpagθ(incógnita,z)qϕ(z|incógnita)dz{\displaystyle \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}\left[\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}\right]=\int q_{\phi }(z|x)\ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}dz}

El formulario anterior muestra que si tomamos una muestrazqϕ(|incógnita){\displaystyle z\sim q_{\phi }(\cdot |x)}, entonceslnpagθ(incógnita,z)qϕ(z|incógnita){\displaystyle \ln {\frac {p_{\theta }(x,z)}{q_{\phi }(z|x)}}}es un estimador insesgado del ELBO.

ln pagθ(incógnita)DKL(qϕ(|incógnita)pagθ(|incógnita)){\displaystyle \ln \ p_{\theta }(x)-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\;\|\;p_{\theta }(\cdot |x))}

El formulario anterior muestra que el ELBO es un límite inferior de la evidencia.ln pagθ(incógnita){\displaystyle \ln \ p_{\theta }(x)}y que maximizar el ELBO con respecto aϕ{\displaystyle \phi }es equivalente a minimizar la divergencia KL de pagθ(|incógnita){\displaystyle p_{\theta }(\cdot |x)}aqϕ(|incógnita){\displaystyle q_{\phi }(\cdot |x)}.

mizqϕ(|incógnita)[ln pagθ(incógnita|z)]DKL(qϕ(|incógnita)pag()){\displaystyle \mathbb {E} _{z\sim q_{\phi }(\cdot |x)}[\ln \ p_{\theta }(x|z)]-D_{\mathit {KL}}(q_{\phi }(\cdot |x)\;\|\;p(\cdot ))}

donde de nuevo,{\displaystyle \cdot }abarca valores dez{\displaystyle z}. La forma anterior muestra que maximizar el ELBO intenta concentrarqϕ(|incógnita){\displaystyle q_{\phi }(\cdot |x)}en esosz{\displaystyle z}que logran un altoln pagθ(incógnita|z){\displaystyle \ln \ p_{\theta }(x|z)}(en otras palabras, explicaciones de alta probabilidad de lo observadoincógnita{\displaystyle x}) pero también para mantenerqϕ(|incógnita){\displaystyle q_{\phi }(\cdot |x)}cerca del anteriorpag(){\displaystyle p(\cdot )}En la práctica, esta forma proporciona un estimador insesgado de menor varianza del ELBO en el caso especial en que tanto la distribución posterior aproximada como la distribución a priori están parametrizadas como gaussianas, ya que entonces el término KL (aunque es en sí mismo una esperanza) tiene una expresión de forma cerrada , por lo que solo es necesario estimar el primer término de esperanza mediante muestreo.z{\displaystyle z}.

Desigualdad en el procesamiento de datos

Supongamos que tomamosnorte{\displaystyle N}muestras independientes depag{\displaystyle p^{*}}y recopilarlos en el conjunto de datos.D={incógnita1,...,incógnitanorte}{\displaystyle D=\{x_{1},...,x_{N}\}}, entonces tenemos distribución empíricaqD(incógnita)=1norteiδincógnitai{\displaystyle q_{D}(x)={\frac {1}{N}}\sum _{i}\delta _{x_{i}}}.

Adecuadopagθ(incógnita){\displaystyle p_{\theta }(x)}aqD(incógnita){\displaystyle q_{D}(x)}Esto se puede hacer, como siempre, maximizando la verosimilitud logarítmica.ln pagθ(D){\displaystyle \ln \ p_{\theta }(D)}:DKL(qD(incógnita)pagθ(incógnita))=1norteiln pagθ(incógnitai)H(qD)=1norteln pagθ(D)H(qD){\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))=-{\frac {1}{N}}\sum _{i}\ln \ p_{\theta }(x_{i})-H(q_{D})=-{\frac {1}{N}}\ln \ p_{\theta }(D)-H(q_{D})}Ahora, mediante la desigualdad ELBO, podemos acotarln pagθ(D){\displaystyle \ln \ p_{\theta }(D)}y por lo tantoDKL(qD(incógnita)pagθ(incógnita))1norteL(ϕ,θ;D)H(qD){\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))\leq -{\frac {1}{N}}L(\phi ,\theta ;D)-H(q_{D})}El lado derecho se simplifica a una divergencia KL, y así obtenemos:DKL(qD(incógnita)pagθ(incógnita))1norteiL(ϕ,θ;incógnitai)H(qD)=DKL(qD,ϕ(incógnita,z);pagθ(incógnita,z)){\displaystyle D_{\mathit {KL}}(q_{D}(x)\|p_{\theta }(x))\leq -{\frac {1}{N}}\sum _{i}L(\phi ,\theta ;x_{i})-H(q_{D})=D_{\mathit {KL}}(q_{D,\phi }(x,z);p_{\theta }(x,z))}Este resultado puede interpretarse como un caso especial de la desigualdad del procesamiento de datos .

En esta interpretación, maximizarL(ϕ,θ;D)=iL(ϕ,θ;incógnitai){\displaystyle L(\phi ,\theta ;D)=\sum _{i}L(\phi ,\theta ;x_{i})}está minimizandoDKL(qD,ϕ(incógnita,z);pagθ(incógnita,z)){\displaystyle D_{\mathit {KL}}(q_{D,\phi }(x,z);p_{\theta }(x,z))}, que limita superiormente la cantidad real de interésDKL(qD(incógnita);pagθ(incógnita)){\displaystyle D_{\mathit {KL}}(q_{D}(x);p_{\theta }(x))}mediante la desigualdad de procesamiento de datos. Es decir, añadimos un espacio latente al espacio observable, pagando el precio de una desigualdad más débil en aras de una minimización computacionalmente más eficiente de la divergencia KL. [ 6 ]

Referencias

  1. ^ Kingma, Diederik P.; Welling, Max (1 de mayo de 2014). "Bayes variacionales de codificación automática". arXiv : 1312.6114 [ estad.ML ].
  2. Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). «Capítulo 19». Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass: The MIT Press. ISBN 978-0-262-03561-3.
  3. Hinton, Geoffrey E; Zemel, Richard (1993). "Autoencoders, Minimum Description Length and Helmholtz Free Energy" . Advances in Neural Information Processing Systems . 6. Morgan-Kaufmann.
  4. Burda, Yuri; Grosse, Roger; Salakhutdinov, Ruslan (2015-09-01). "Autoencoders ponderados por importancia". arXiv : 1509.00519 [ stat.ML ].
  5. Neal, Radford M.; Hinton, Geoffrey E. (1998), "Una visión del algoritmo Em que justifica las variantes incrementales, dispersas y otras" , Aprendizaje en modelos gráficos , Dordrecht: Springer Netherlands, pp. 355–368 , doi : 10.1007/978-94-011-5014-9_12 , ISBN  978-94-010-6104-9, S2CID 17947141 
  6. Kingma, Diederik P.; Welling, Max (27-11-2019). "Una introducción a los autoencoders variacionales" . Fundamentos y tendencias en aprendizaje automático . 12 (4). Sección 2.7. arXiv : 1906.02691 . doi : 10.1561/2200000056 . ISSN 1935-8237 . S2CID 174802445 .  

Notas

  1. De hecho, según la desigualdad de Jensen , miincógnitapag(incógnita)[máximoθilnpagθ(incógnitai)]máximoθmiincógnitapag(incógnita)[ilnpagθ(incógnitai)]=nortemáximoθmiincógnitapag(incógnita)[lnpagθ(incógnita)]{\displaystyle \mathbb {E} _{x\sim p^{*}(x)}\left[\max _{\theta }\sum _{i}\ln p_{\theta }(x_{i})\right]\geq \max _{\theta }\mathbb {E} _{x\sim p^{*}(x)}\left[\sum _{i}\ln p_{\theta }(x_{i})\right]=N\max _{\theta }\mathbb {E} _{x\sim p^{*}(x)}[\ln p_{\theta }(x)]} El estimador está sesgado al alza. Esto puede verse como sobreajuste: para algún conjunto finito de datos muestreados incógnitai{\displaystyle x_{i}} , suele haber algo θ{\displaystyle \theta } que les queda mejor que todo pag{\displaystyle p^{*}} distribución.
  2. Mediante el método delta , tenemosmiziqϕ(|incógnita)[ln(1norteipagθ(zi|incógnita)qϕ(zi|incógnita))]12norteVzqϕ(|incógnita)[pagθ(z|incógnita)qϕ(z|incógnita)]=O(norte1){\displaystyle \mathbb {E} _{z_{i}\sim q_{\phi }(\cdot |x)}\left[\ln \left({\frac {1}{N}}\sum _{i}{\frac {p_{\theta }(z_{i}|x)}{q_{\phi }(z_{i}|x)}}\right)\right]\approx -{\frac {1}{2N}}\mathbb {V} _{z\sim q_{\phi }(\cdot |x)}\left[{\frac {p_{\theta }(z|x)}{q_{\phi }(z|x)}}\right]=O(N^{-1})}Si continuamos con esto, obtendríamos el autoencoder ponderado por importancia. [ 4 ]