En los métodos bayesianos variacionales , el límite inferior de la evidencia (a menudo abreviado ELBO , también llamado a veces límite inferior variacional [ 1 ] o energía libre variacional negativa ) es un límite inferior útil en la log-verosimilitud de algunos datos observados.
El ELBO es útil porque proporciona una garantía sobre el peor caso para la log-verosimilitud de alguna distribución (por ejemplo) que modela un conjunto de datos. La verosimilitud logarítmica real puede ser mayor (lo que indica un ajuste aún mejor a la distribución) porque el ELBO incluye un término de divergencia de Kullback-Leibler (divergencia KL) que disminuye el ELBO debido a que una parte interna del modelo es inexacta a pesar del buen ajuste general del modelo. Por lo tanto, mejorar la puntuación del ELBO indica mejorar la verosimilitud del modelo.o el ajuste de un componente interno al modelo, o ambos, y la puntuación ELBO constituye una buena función de pérdida , por ejemplo, para entrenar una red neuronal profunda para mejorar tanto el modelo en general como el componente interno. (El componente interno es(definido en detalle más adelante en este artículo).
Definición
Dejarysean variables aleatorias , distribuidas conjuntamente con distribución. Por ejemplo,es la distribución marginal de, yes la distribución condicional dedadoLuego, para una muestray cualquier distribución, el ELBO se define comoEl ELBO se puede escribir de forma equivalente como [ 2 ]
En la primera línea,es la entropía de, que relaciona el ELBO con la energía libre de Helmholtz . [ 3 ] En la segunda línea,se llama la evidencia de, yes la divergencia de Kullback-Leibler entreyDado que la divergencia de Kullback-Leibler no es negativa,forma un límite inferior en la evidencia ( desigualdad ELBO )
Motivación
Inferencia bayesiana variacional
Supongamos que tenemos una variable aleatoria observable.y queremos encontrar su distribución verdaderaEsto nos permitiría generar datos mediante muestreo y estimar probabilidades de eventos futuros. En general, es imposible encontrarexactamente, lo que nos obliga a buscar una buena aproximación .
Es decir, definimos una familia paramétrica suficientemente grande.de distribuciones, luego resolver parapara alguna función de pérdida. Una posible forma de resolver esto es considerando pequeñas variaciones deay resolver para. Este es un problema del cálculo de variaciones , por lo tanto se le llama método variacional .
Dado que no existen muchas familias de distribuciones parametrizadas explícitamente (todas las familias de distribuciones clásicas, como la distribución normal, la distribución de Gumbel , etc., son demasiado simplistas para modelar la distribución verdadera), consideramos distribuciones de probabilidad parametrizadas implícitamente :
- Primero, definamos una distribución simple.sobre una variable aleatoria latentePor lo general, una distribución normal o una distribución uniforme es suficiente.
- A continuación, definamos una familia de funciones complejas.(como una red neuronal profunda ) parametrizada por.
- Finalmente, defina una forma de convertir cualquieren una distribución (en general simple también, pero no relacionado con) sobre la variable aleatoria observable. Por ejemplo, dejemossi tenemos dos salidas, entonces podemos definir la distribución correspondiente sobreser la distribución normal.
Esto define una familia de distribuciones conjuntas.encimaEs muy fácil tomar muestras.: simplemente muestra, luego calculary finalmente muestrausando.
En otras palabras, tenemos un modelo generativo tanto para lo observable como para lo latente. Ahora, consideramos una distribución.bueno, si es una aproximación cercana de:ya que la distribución del lado derecho es mayorsolamente, la distribución del lado izquierdo debe marginalizar la variable latentelejos. En general, es imposible realizar la integral.lo que nos obliga a realizar otra aproximación.
Desde( Regla de Bayes ), basta con encontrar una buena aproximación de. Entonces, defina otra familia de distribucióny usarlo para aproximar. Este es un modelo discriminativo para la variable latente.
La situación completa se resume en la siguiente tabla:
En lenguaje bayesiano ,es la evidencia observada, yes lo latente/no observado. La distribuciónencimaes la distribución previa sobre,es la función de verosimilitud yes la distribución posterior sobre.
Dada una observación, podemos inferir quéprobablemente dio origen amediante computaciónEl método bayesiano habitual consiste en estimar la integral.Luego, calcula mediante la regla de Bayes.Esto es costoso de realizar en general, pero si podemos encontrar una buena aproximaciónpara la mayoría, entonces podemos inferirdebarato. Por lo tanto, la búsqueda de un buenTambién se denomina inferencia amortizada .
En definitiva, hemos encontrado un problema de inferencia bayesiana variacional .
Derivación del ELBO
Un resultado básico en la inferencia variacional es que minimizar la divergencia de Kullback-Leibler (divergencia KL) es equivalente a maximizar la log-verosimilitud:dóndees la entropía de la distribución verdadera. Entonces, si podemos maximizarpodemos minimizary, en consecuencia, encontrar una aproximación precisa.
Para maximizar, simplemente tomamos muestras de muchoses decir, utilizar el muestreo por importanciadóndees el número de muestras extraídas de la distribución verdadera. Esta aproximación puede considerarse un sobreajuste . [ nota 1 ]
Para maximizar, es necesario encontrar:Por lo general, esto no tiene una forma cerrada y debe estimarse. La forma habitual de estimar integrales es la integración de Monte Carlo con muestreo de importancia :dóndees una distribución de muestreo sobreque utilizamos para realizar la integración de Monte Carlo.
Entonces vemos que si tomamos una muestra, entonceses un estimador insesgado deDesafortunadamente, esto no nos proporciona un estimador insesgado de, porquees no lineal. De hecho, tenemos por la desigualdad de Jensen ,De hecho, todos los estimadores obvios deestán sesgados a la baja, porque no importa cuántas muestras detomamos, tenemos por la desigualdad de Jensen:Restando el lado derecho, vemos que el problema se reduce a un estimador sesgado de cero:En este punto, podríamos desviarnos hacia el desarrollo de un autoencoder ponderado por importancia [ nota 2 ] , pero en su lugar continuaremos con el caso más simple con:La rigidez de la desigualdad tiene una forma cerrada:Hemos obtenido así la función ELBO:
Maximizar el ELBO
Para fijola optimizaciónIntenta simultáneamente maximizary minimizar. Si la parametrización parayson lo suficientemente flexibles, obtendríamos algunos, de tal manera que tengamos simultáneamente
Desdetenemosy entoncesEn otras palabras, maximizar el ELBO nos permitiría simultáneamente obtener un modelo generativo preciso.y un modelo discriminatorio preciso. [ 5 ]
Formas principales
El ELBO tiene muchas expresiones posibles, cada una con un énfasis diferente.
El formulario anterior muestra que si tomamos una muestra, entonceses un estimador insesgado del ELBO.
El formulario anterior muestra que el ELBO es un límite inferior de la evidencia.y que maximizar el ELBO con respecto aes equivalente a minimizar la divergencia KL de a.
donde de nuevo,abarca valores de. La forma anterior muestra que maximizar el ELBO intenta concentraren esosque logran un alto(en otras palabras, explicaciones de alta probabilidad de lo observado) pero también para mantenercerca del anteriorEn la práctica, esta forma proporciona un estimador insesgado de menor varianza del ELBO en el caso especial en que tanto la distribución posterior aproximada como la distribución a priori están parametrizadas como gaussianas, ya que entonces el término KL (aunque es en sí mismo una esperanza) tiene una expresión de forma cerrada , por lo que solo es necesario estimar el primer término de esperanza mediante muestreo..
Desigualdad en el procesamiento de datos
Supongamos que tomamosmuestras independientes dey recopilarlos en el conjunto de datos., entonces tenemos distribución empírica.
AdecuadoaEsto se puede hacer, como siempre, maximizando la verosimilitud logarítmica.:Ahora, mediante la desigualdad ELBO, podemos acotary por lo tantoEl lado derecho se simplifica a una divergencia KL, y así obtenemos:Este resultado puede interpretarse como un caso especial de la desigualdad del procesamiento de datos .
En esta interpretación, maximizarestá minimizando, que limita superiormente la cantidad real de interésmediante la desigualdad de procesamiento de datos. Es decir, añadimos un espacio latente al espacio observable, pagando el precio de una desigualdad más débil en aras de una minimización computacionalmente más eficiente de la divergencia KL. [ 6 ]
Referencias
- ^ Kingma, Diederik P.; Welling, Max (1 de mayo de 2014). "Bayes variacionales de codificación automática". arXiv : 1312.6114 [ estad.ML ].
- ↑ Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). «Capítulo 19». Aprendizaje profundo . Computación adaptativa y aprendizaje automático. Cambridge, Mass: The MIT Press. ISBN 978-0-262-03561-3.
- ↑ Hinton, Geoffrey E; Zemel, Richard (1993). "Autoencoders, Minimum Description Length and Helmholtz Free Energy" . Advances in Neural Information Processing Systems . 6. Morgan-Kaufmann.
- ↑ Burda, Yuri; Grosse, Roger; Salakhutdinov, Ruslan (2015-09-01). "Autoencoders ponderados por importancia". arXiv : 1509.00519 [ stat.ML ].
- ↑ Neal, Radford M.; Hinton, Geoffrey E. (1998), "Una visión del algoritmo Em que justifica las variantes incrementales, dispersas y otras" , Aprendizaje en modelos gráficos , Dordrecht: Springer Netherlands, pp. 355–368 , doi : 10.1007/978-94-011-5014-9_12 , ISBN 978-94-010-6104-9, S2CID 17947141
- ↑ Kingma, Diederik P.; Welling, Max (27-11-2019). "Una introducción a los autoencoders variacionales" . Fundamentos y tendencias en aprendizaje automático . 12 (4). Sección 2.7. arXiv : 1906.02691 . doi : 10.1561/2200000056 . ISSN 1935-8237 . S2CID 174802445 .
Notas
- ↑ De hecho, según la desigualdad de Jensen , El estimador está sesgado al alza. Esto puede verse como sobreajuste: para algún conjunto finito de datos muestreados , suele haber algo que les queda mejor que todo distribución.
- ↑ Mediante el método delta , tenemosSi continuamos con esto, obtendríamos el autoencoder ponderado por importancia. [ 4 ]
- Teoría de las distribuciones de probabilidad