Un modelo generativo basado en flujo es un modelo generativo utilizado en el aprendizaje automático que modela explícitamente una distribución de probabilidad aprovechando el flujo normalizador , [ 1 ] [ 2 ] [ 3 ] que es un método estadístico que utiliza la ley de cambio de variable de las probabilidades para transformar una distribución simple en una compleja.
El modelado directo de la verosimilitud ofrece numerosas ventajas. Por ejemplo, la log-verosimilitud negativa se puede calcular directamente y minimizar como función de pérdida . Además, se pueden generar nuevas muestras a partir de la distribución inicial y aplicando la transformación de flujo.
Por el contrario, muchos métodos de modelado generativo alternativos, como los autoencoders variacionales (VAE) , las redes generativas adversarias (GAN) o los modelos de difusión , no representan explícitamente la función de verosimilitud .
Método

Dejarsea una variable aleatoria (posiblemente multivariada) con distribución.
Para, dejarser una secuencia de variables aleatorias transformadas de. Las funcionesdebe ser invertible, es decir, la función inversaexiste. El resultado finalmodela la distribución objetivo.
La probabilidad logarítmica dees (ver derivación ):
El aprendizaje de distribuciones de probabilidad mediante la diferenciación de tales jacobianos logarítmicos se originó en el enfoque Infomax (máxima verosimilitud) para ICA, [ 4 ] que forma un modelo basado en flujo de una sola capa (K=1). Relativamente, el precursor de una sola capa de flujos generativos condicionales apareció en. [ 5 ]
Para calcular eficientemente la verosimilitud logarítmica, las funcionesdeberían ser fácilmente invertibles, y los determinantes de sus jacobianos deberían ser sencillos de calcular. En la práctica, las funcionesSe modelan utilizando redes neuronales profundas y se entrenan para minimizar la log-verosimilitud negativa de las muestras de datos de la distribución objetivo. Estas arquitecturas suelen diseñarse de forma que solo se requiere el paso hacia adelante de la red neuronal tanto en los cálculos de la inversa como del determinante jacobiano. Ejemplos de dichas arquitecturas incluyen NICE, [ 6 ] RealNVP, [ 7 ] y Glow. [ 8 ]
Derivación de la verosimilitud logarítmica
Considerary. Tenga en cuenta que.
Mediante la fórmula de cambio de variable , la distribución dees:
Dóndees el determinante de la matriz jacobiana de.
Por el teorema de la función inversa :
Por la identidad(dóndees una matriz invertible ), tenemos:
La verosimilitud logarítmica es, por lo tanto:
En general, lo anterior se aplica a cualquiery. Desdees igual aRestando un término no recursivo, podemos inferir por inducción que:
Método de entrenamiento
Como se hace generalmente al entrenar un modelo de aprendizaje profundo, el objetivo de normalizar los flujos es minimizar la divergencia de Kullback-Leibler entre la verosimilitud del modelo y la distribución objetivo que se va a estimar. Denotandola probabilidad del modelo yLa distribución objetivo a aprender, la divergencia KL (hacia adelante) es:
El segundo término del lado derecho de la ecuación corresponde a la entropía de la distribución objetivo y es independiente del parámetro.Queremos que el modelo aprenda, lo que solo deja la expectativa de la log-verosimilitud negativa para minimizar bajo la distribución objetivo. Este término intratable puede aproximarse con un método de Monte Carlo mediante muestreo de importancia . De hecho, si tenemos un conjunto de datosde muestras, cada una extraída independientemente de la distribución objetivo., entonces este término puede estimarse como:
Por lo tanto, el objetivo de aprendizaje
es reemplazado por
En otras palabras, minimizar la divergencia de Kullback-Leibler entre la verosimilitud del modelo y la distribución objetivo es equivalente a maximizar la verosimilitud del modelo bajo muestras observadas de la distribución objetivo. [ 9 ]
Un pseudocódigo para entrenar flujos normalizadores es el siguiente: [ 10 ]
- ENTRADA.conjunto de datos, modelo de flujo normalizador.
- RESOLVER.por descenso de gradiente
- DEVOLVER.
Variantes
Flujo planar
El primer ejemplo. [ 11 ] Corregir alguna función de activacióny dejarcon las dimensiones apropiadas, entoncesLo contrarioEn general, no tiene una solución analítica.
El jacobiano es.
Para que sea invertible en todas partes, debe ser distinto de cero en todas partes. Por ejemplo,ySatisface el requisito.
Estimación de componentes independientes no lineales (NICE)
Dejarsean de dimensión par y divídalas por la mitad. [ 6 ] Entonces las funciones de flujo normalizadoras sondóndees cualquier red neuronal con pesos.
es soloy el jacobiano es simplemente 1, es decir, el flujo conserva el volumen.
Cuando, esto se ve como un corte curvo a lo largo de ladirección.
Real No Conservador de Volumen (Real NVP)
El modelo Real Non-Volume Preserving generaliza el modelo NICE mediante: [ 7 ]
Su inversa esy su jacobiano esEl modelo NICE se recupera estableciendoDado que el mapa NVP real conserva la primera y la segunda mitad del vectorPor separado, normalmente se requiere agregar una permutacióndespués de cada capa de NVP real.
Flujo generativo (resplandor)
En el modelo de flujo generativo, [ 8 ] cada capa tiene 3 partes:
- transformación afín por canalcon jacobino.
- convolución 1x1 invertiblecon jacobino. Aquíes cualquier matriz invertible.
- NVP real, con jacobiano como se describe en NVP real.
La idea de utilizar la convolución invertible de 1x1 es permutar todas las capas en general, en lugar de simplemente permutar la primera y la segunda mitad, como en Real NVP.
Flujo autorregresivo enmascarado (MAF)
Un modelo autorregresivo de una distribución ense define como el siguiente proceso estocástico : [ 12 ]
dóndeyson funciones fijas que definen el modelo autorregresivo.
Mediante el truco de reparametrización , el modelo autorregresivo se generaliza a un flujo normalizador:El modelo autorregresivo se recupera estableciendo.
El mapeo hacia adelante es lento (porque es secuencial), pero el mapeo hacia atrás es rápido (porque es paralelo).
La matriz jacobiana es diagonal inferior, por lo que la matriz jacobiana es.
Invirtiendo los dos mapasyde MAF da como resultado Flujo Autorregresivo Inverso (IAF), que tiene mapeo hacia adelante rápido y mapeo hacia atrás lento. [ 13 ]
Flujo Normalizado Continuo (CNF)
En lugar de construir el flujo mediante composición de funciones, otro enfoque consiste en formular el flujo como una dinámica de tiempo continuo. [ 14 ] [ 15 ] Seasea la variable latente con distribución. Asigne esta variable latente al espacio de datos con la siguiente función de flujo:
dóndees una función arbitraria y puede modelarse, por ejemplo, con redes neuronales.
La función inversa es entonces naturalmente: [ 14 ]
Y la verosimilitud logarítmica dese puede encontrar como: [ 14 ]
Dado que la traza depende únicamente de la diagonal del jacobianoEsto permite un jacobiano de "forma libre". [ 16 ] Aquí, "forma libre" significa que no hay restricciones en la forma del jacobiano. Se contrasta con los modelos discretos anteriores de flujo normalizador, donde el jacobiano se diseña cuidadosamente para que sea solo diagonal superior o inferior, de modo que pueda evaluarse de manera eficiente.
La traza se puede estimar mediante el "truco de Hutchinson": [ 17 ] [ 18 ]
Dada cualquier matrizy cualquier aleatoriocon, tenemos(Demostración: expandir la expectativa directamente.)
Por lo general, el vector aleatorio se muestrea a partir de(distribución normal) o( Distribución de Rademacher ).
CuandoSi se implementa como una red neuronal, se necesitarían métodos de EDO neuronales [ 19 ] . De hecho, CNF se propuso por primera vez en el mismo artículo que propuso EDO neuronales.
Hay dos deficiencias principales de la CNF: una es que un flujo continuo debe ser un homeomorfismo , por lo tanto, preservar la orientación y la isotopía ambiental (por ejemplo, es imposible voltear una mano izquierda a una derecha mediante la deformación continua del espacio, y es imposible dar la vuelta a una esfera o deshacer un nudo); y la otra es que el flujo aprendidopodría comportarse mal, debido a la degeneración (es decir, hay un número infinito de posiblesque todos resuelven el mismo problema).
Al agregar dimensiones adicionales, la CNF obtiene suficiente libertad para invertir la orientación e ir más allá de la isotopía ambiental (como cuando uno puede tomar un polígono de un escritorio y voltearlo en el espacio tridimensional, o desatar un nudo en el espacio tetradimensional), dando como resultado la "EDO neuronal aumentada". [ 20 ]
Cualquier homeomorfismo depuede aproximarse mediante una EDO neuronal que opera en, demostrado mediante la combinación del teorema de incrustación de Whitney para variedades y el teorema de aproximación universal para redes neuronales. [ 21 ]
Para regularizar el flujoSe pueden imponer pérdidas de regularización. El artículo [ 17 ] propuso la siguiente pérdida de regularización basada en la teoría de transporte óptimo :dóndeson hiperparámetros. El primer término penaliza al modelo por oscilar el campo de flujo en el tiempo, y el segundo término lo penaliza por oscilar el campo de flujo en el espacio. Ambos términos, en conjunto, guían al modelo hacia un flujo suave (no irregular) en el espacio y el tiempo.
Flujos en colectores
Cuando un flujo probabilístico transforma una distribución en un-variedad lisa dimensional incrustada en, dóndey donde la transformación se especifica como una función,, el factor de escala entre las PDF de origen y transformadas no viene dado por el cálculo ingenuo del determinante de laJacobiano (que es cero), pero en su lugar por el/los determinante(s) de uno o más adecuadamente definidosMatrices. Esta sección es una interpretación del tutorial del apéndice de Sorrenson et al. (2023), [ 22 ] donde también se trata el caso más general de variedades de Riemann no isométricamente incrustadas . Aquí restringimos la atención a las variedades isométricamente incrustadas.
Como ejemplos de variedades con incrustación suave e isométrica enutilizaremos:
- La hiperesfera unitaria :donde los flujos se pueden utilizar para generalizar, por ejemplo, las distribuciones de Von Mises-Fisher o las distribuciones esféricas uniformes.
- El interior simplex :, dónde-la forma en que viven las distribuciones categóricas ; y dónde se pueden usar flujos para generalizar, por ejemplo, las distribuciones de Dirichlet o las distribuciones simplex uniformes.
Como primer ejemplo de una transformación de flujo de variedad esférica, consideremos la transformación lineal normalizada , que proyecta radialmente sobre la esfera unitaria la salida de una transformación lineal invertible, parametrizada por lamatriz invertible:
- ;\mathbf {M} )={\frac {\mathbf {Mx} }{\lVert \mathbf {Mx} \rVert }}}
En el espacio euclidiano completo,no es invertible, pero si restringimos el dominio y el codominio a la esfera unitaria, entonceses invertible (más específicamente es una biyección , un homeomorfismo y un difeomorfismo ), con inversaEl jacobino de, en ;\mathbf {M} )} es, que tiene rangoy determinante de cero; mientras que , como se explica aquí , el factor (véase la subsección siguiente) que relaciona las densidades de la fuente y transformadas es:.
Relación de volumen diferencial
Para, dejarfrijolVariedad de -dimensiones con una incrustación suave e isométrica en. Dejarser una transformación de flujo suave con rango restringido a. Dejarser muestreado de una distribución con densidad. Dejar, con la densidad resultante (de empuje hacia adelante). Dejarsea una pequeña región convexa que contieney dejarsea su imagen, que contiene; entonces, por conservación de la masa de probabilidad:
donde el volumen (para regiones muy pequeñas) viene dado por la medida de Lebesgue enespacio tangente de -dimensiones . Al hacer que las regiones sean infinitesimalmente pequeñas, el factor que relaciona las dos densidades es la razón de volúmenes, que denominamos razón de volumen diferencial .
Para obtener fórmulas concretas para el volumen en elVariedad de dimensión , construimosmapeando unRectángulo de -dimensiones en el espacio de coordenadas (local) a la variedad mediante una función de incrustación suave:. A escala muy pequeña, la función de incrustación se vuelve esencialmente lineal de modo quees un paralelotopo (generalización multidimensional de un paralelogramo). De manera similar, la transformación de flujo,se vuelve lineal, de modo que la imagen,También es un paralelotopo., podemos representar unParalelotopo -dimensional con unmatriz cuyos vectores columna son un conjunto de aristas (que se encuentran en un vértice común) que abarcan el paralelotopo. El volumen viene dado por el valor absoluto del determinante de esta matriz. Si, de forma más general (como es el caso aquí), unaEl paralelotopo -dimensional está incrustado en, se puede representar con un (alto)matriz, por ejemplo. Denotando el paralelepípedo comoSu volumen viene dado entonces por la raíz cuadrada del determinante de Gram :
En las secciones siguientes, mostramos varias maneras de utilizar esta fórmula de volumen para derivar la relación de volumen diferencial.
Flujo simplex
Como primer ejemplo, desarrollamos expresiones para la relación de volumen diferencial de un flujo simplex,, dónde. Defina la función de incrustación :
que mapea un lugar convenientemente elegido,representación -dimensional,, al colector incrustado. ElJacobiano es . Para definir, el elemento de volumen diferencial en la entrada de transformación (), comenzamos con un rectángulo en-espacio, que tiene longitudes de lado diferenciales (con signo),a partir de la cual formamos la matriz diagonal cuadrada, cuyas columnas abarcan el rectángulo. A muy pequeña escala, obtenemos, con:

Para comprender la interpretación geométrica del factor, vea el ejemplo del 1-símplex en el diagrama de la derecha.
El elemento de volumen diferencial en la salida de la transformación (), es el paralelotopo,, dóndees elJacobiano deenSu volumen es:
de modo que el factorse cancela en la relación de volumen, que ahora ya puede evaluarse numéricamente. Sin embargo, puede reescribirse en una forma a veces más conveniente introduciendo también la función de representación ,, que simplemente extrae el primerocomponentes. El jacobiano es. Obsérvese que, dado queLa regla de la cadena para la composición de funciones da como resultado:Al sustituir esta expansión en el determinante de Gram anterior y luego refactorizarlo como un producto de determinantes de matrices cuadradas, podemos extraer el factor., que ahora también se cancela en la razón, que finalmente se simplifica al determinante del jacobiano de la transformación de flujo "sándwich",:
lo cual, si, puede utilizarse para derivar la densidad de empuje hacia adelante después de un cambio de variables,:
Esta fórmula es válida solo porque el simplex es plano y el jacobiano,es constante. El caso más general para variedades curvas se analiza más adelante, después de presentar dos ejemplos concretos de transformadas de flujo simplex.
Transformación de calibración simplex
Una transformación de calibración ,, que a veces se utiliza en el aprendizaje automático para el posprocesamiento de las salidas (a posteriori de la clase) de una prueba probabilísticaEl clasificador de clases [ 23 ] [ 24 ] utiliza la función softmax para renormalizar las distribuciones categóricas después del escalado y la traslación de las distribuciones de entrada en el espacio de probabilidad logarítmica. Paray con parámetros,yLa transformación se puede especificar como:
donde el logaritmo se aplica elemento a elemento. Después de algunas operaciones algebraicas, la relación de volumen diferencial se puede expresar como:
- Este resultado también se puede obtener factorizando la densidad de la distribución SGB , [ 25 ] que se obtiene enviando variables de Dirichlet a través de.
Si bien las transformaciones de calibración se entrenan con mayor frecuencia como modelos discriminativos , la reinterpretación aquí como un flujo probabilístico también permite el diseño de modelos de calibración generativos basados en esta transformación. Cuando se utiliza para calibración, la restricciónSe puede imponer para evitar la inversión de dirección en el espacio de probabilidad logarítmica. Con la restricción adicionalEsta transformación (con entrenamiento discriminativo) se conoce en el aprendizaje automático como escalado de temperatura .
Transformación de calibración generalizada
La transformación de calibración anterior se puede generalizar a, con parámetrosyinvertible: [ 26 ]
- ;\mathbf {A} ,\mathbf {c} )=\operatorname {softmax} (\mathbf {A} \log \mathbf {p} +\mathbf {c} )\,,\;{\text{sujeto a}}\;\mathbf {A1} =\lambda \mathbf {1} }
donde la condición quetienecomo vector propio garantiza la invertibilidad al evitar la pérdida de información debida a la invariancia:. Nótese en particular quees la única parametrización diagonal permitida, en cuyo caso recuperamos ;\lambda ^{-1},\mathbf {c} )} , mientras (para) La generalización es posible con matrices no diagonales. La inversa es:
- ;\mathbf {A} ,\mathbf {c} )=f_{\text{gcal}}(\mathbf {q} ;\mathbf {A} ^{-1},-\mathbf {A} ^{-1}\mathbf {c} )\,,\;{\text{donde}}\;\mathbf {A1} =\lambda \mathbf {1} \Longrightarrow \mathbf {A} ^{-1}\mathbf {1} =\lambda ^{-1}\mathbf {1} }
La relación de volumen diferencial es:
- ;\mathbf {A} ,\mathbf {c} )={\frac {\left|\operatorname {det} (\mathbf {A} )\right|}{|\lambda |}}\prod _{i=1}^{n}{\frac {q_{i}}{p_{i}}}}
SiSe va a utilizar como transformación de calibración, se podría imponer una restricción adicional, por ejemplo queser definido positivo , de modo que, que evita los cambios de dirección. (Esta es una posible generalización deen elparámetro.)
Para,ydefinido positivo, entoncesyson equivalentes en el sentido de que en ambos casos,es una línea recta, cuya pendiente (positiva) y desplazamiento son funciones de los parámetros de transformación. Parageneraliza.
Sin embargo, debe tenerse en cuenta que encadenar múltiplesLas transformaciones de flujo no proporcionan una generalización adicional, porque:
De hecho, el conjunto deLas transformaciones forman un grupo bajo la composición de funciones. El conjunto deLas transformaciones forman un subgrupo.
Véase también: Calibración de Dirichlet , [ 27 ] que generaliza, al no imponer ninguna restricción a la matriz,, por lo que la invertibilidad no está garantizada. Si bien la calibración de Dirichlet se entrena como un modelo discriminativo,También se puede entrenar como parte de un modelo de calibración generativo.
Relación de volumen diferencial para colectores curvos
Consideremos un flujo,en un colector curvo, por ejemploque equipamos con la función de incrustación,que mapea un conjunto decoordenadas esféricas angulares aEl jacobino deno es constante y tenemos que evaluarlo en ambas entradas () y salida (). Lo mismo se aplica a, la función de representación que recupera coordenadas esféricas a partir de puntos en, para lo cual necesitamos el jacobiano en la salida (). La relación de volumen diferencial ahora se generaliza a:
Para obtener información geométrica, consideredonde las coordenadas esféricas son la colatitud,y longitud,. En, obtenemos, que da el radio del círculo en esa latitud (compárese, por ejemplo, el círculo polar con el ecuador). El volumen diferencial (área de la superficie de la esfera) es:.
La derivación anterior paraes frágil en el sentido de que cuando se utilizan funciones fijas, puede haber lugares donde no estén bien definidos, por ejemplo en los polos de la 2-esfera donde la longitud es arbitraria. Este problema se elude (usando maquinaria estándar de variedades) generalizando a coordenadas locales (cartas), donde en las vecindades de, mapeamos desde localcoordenadas -dimensionales ay viceversa utilizando los pares de funciones correspondientes.y. Continuamos utilizando la misma notación para los jacobianos de estas funciones (), de modo que la fórmula anterior parasigue siendo válido.
Sin embargo, podemos elegir nuestro sistema de coordenadas local de una manera que simplifique la expresión paray de hecho también su implementación práctica. [ 22 ] Dejemos :{\mathcal {P}}\to \mathbb {R} ^{n}} sea una proyección idempotente suave () del conjunto proyectable ,, sobre la variedad incrustada. Por ejemplo:
- El ortante positivo dese proyecta sobre el simplex como:
- Vectores distintos de cero ense proyectan sobre la esfera unitaria como:
Por cada, requerimos deque suJacobiano,tiene rango(la dimensión de la variedad), en cuyo casoes una proyección lineal idempotente sobre el espacio tangente local ( ortogonal para la esfera unitaria:; oblicuo para el simplex:). Las columnas deabarcar elespacio tangente de -dimensiones en. Usamos la notación,para cualquiermatriz con columnas ortonormales () que abarcan el espacio tangente local. Tenga en cuenta también:Ahora podemos elegir nuestra función de incrustación de coordenadas locales,:
Dado que el jacobiano es inyectivo (rango completo:), una inversa izquierda local (no necesariamente única) , por ejemplocon jacobino, existe tal queyEn la práctica, no necesitamos la función inversa izquierda en sí, pero sí necesitamos su jacobiano, para el cual la ecuación anterior no proporciona una solución única. Sin embargo, podemos imponer una solución única para el jacobiano eligiendo la inversa izquierda como::
Ahora por fin podemos conectaryen nuestra expresión anterior para, la razón de volumen diferencial , que debido a los jacobianos ortonormales, se simplifica a: [ 28 ]
Implementación práctica
Para aprender los parámetros de una transformación de flujo de variedad, necesitamos acceso a la relación de volumen diferencial,, o al menos a su gradiente con respecto a los parámetros. Además, para algunas tareas de inferencia, necesitamos acceso aen sí mismo. Las soluciones prácticas incluyen:
- Sorrenson et al. (2023) [ 22 ] dan una solución para la aproximación estocástica eficiente del gradiente de parámetros computacionalmente para
- Para algunas transformaciones de flujo diseñadas a mano,Pueden derivarse analíticamente en forma cerrada, por ejemplo, las transformaciones de calibración simplex mencionadas anteriormente. Más adelante, en la sección sobre flujos esféricos simples, se ofrecen otros ejemplos.
- En una plataforma de software equipada con álgebra lineal y diferenciación automática ,puede evaluarse automáticamente, dado el acceso a solo. [ 29 ] Pero esto es costoso para datos de alta dimensión, con al menoscostos computacionales. Aun así, la lenta solución automática puede ser invaluable como herramienta para verificar numéricamente soluciones analíticas diseñadas manualmente.
Flujos esféricos simples
En la literatura sobre aprendizaje automático, se pueden encontrar diversos flujos esféricos complejos formados por arquitecturas de redes neuronales profundas. [ 22 ] En contraste, esta sección recopila de la literatura estadística los detalles de tres transformaciones de flujo esférico muy simples, con expresiones simples de forma cerrada para inversas y razones de volumen diferenciales. Estos flujos se pueden usar individualmente o encadenados para generalizar distribuciones en la esfera unitaria,Los tres flujos son composiciones de una transformación afín invertible en, seguido de una proyección radial de vuelta sobre la esfera. Los tipos que consideramos para la transformación afín son: traslación pura, lineal pura y afín general. Para que estos flujos sean totalmente funcionales para el aprendizaje, la inferencia y el muestreo, las tareas son:
- Para derivar la transformada inversa, con las restricciones adecuadas sobre los parámetros para garantizar la invertibilidad.
- Para derivar en forma cerrada simple la relación de volumen diferencial ,.
Una propiedad interesante de estos flujos esféricos simples es que no utilizan ninguna no linealidad aparte de la proyección radial. Incluso el más simple de ellos, el flujo de traslación normalizado, puede encadenarse para formar distribuciones sorprendentemente flexibles.
Flujo de traslación normalizado
El flujo de traslación normalizado,, con parámetro, viene dado por:
- ;\mathbf {c} )={\frac {\mathbf {x} +\mathbf {c} }{\lVert \mathbf {x} +\mathbf {c} \rVert }}\,,\;{\text{donde}}\;\lVert \mathbf {c} \rVert <1}
La función inversa puede derivarse considerando, para:y luego usandopara obtener una ecuación cuadrática para recuperar, lo que da como resultado:
- ;\mathbf {c} )=\ell \mathbf {y} -\mathbf {c} \,,{\text{donde}}\;\ell =\mathbf {y} '\mathbf {c} +{\sqrt {(\mathbf {y} '\mathbf {c} )^{2}+1-\mathbf {c} '\mathbf {c} }}}
de lo cual vemos que necesitamospara mantenerreal y positivo para todos. La relación de volumen diferencial viene dada (sin derivación) por Boulerice y Ducharme (1994) como: [ 30 ]
- ;\mathbf {c} )={\frac {1+\mathbf {x} '\mathbf {c} }{\lVert \mathbf {x} +\mathbf {c} \rVert ^{n}}}}
Esto, en efecto, puede verificarse analíticamente:
- Mediante una laboriosa manipulación de.
- Al estableceren ;\mathbf {M} ,\mathbf {c} )} , que se da a continuación.
Finalmente, cabe destacar queyno tienen la misma forma funcional.
Flujo lineal normalizado
El flujo lineal normalizado,, donde parámetroes un invertibleLa matriz viene dada por:
- ;\mathbf {M} )={\frac {\mathbf {Mx} }{\lVert \mathbf {Mx} \rVert }}\;\iff \;\mathbf {x} =f_{\text{lin}}^{-1}(\mathbf {y} ;\mathbf {M} )=f_{\text{lin}}(\mathbf {y} ;\mathbf {M} ^{-1})={\frac {\mathbf {M^{-1}y} }{\lVert \mathbf {M^{-1}y} \rVert }}}
La relación de volumen diferencial es:
- ;\mathbf {M} )={\frac {\left|\operatorname {det} \mathbf {M} \right|}{\lVert \mathbf {Mx} \rVert ^{n}}}}
Este resultado puede derivarse indirectamente mediante la distribución gaussiana central angular (ACG) [ 31 ] , que se obtiene mediante una transformación lineal normalizada de variables aleatorias gaussianas o esféricas uniformes. La primera relación permite derivar la densidad ACG mediante una integral de marginalización sobre el radio; posteriormente, la segunda relación permite factorizar la relación de volumen diferencial. Para más detalles, consulte la distribución ACG .
flujo afín normalizado
El flujo afín normalizado,, con parámetrosy,invertible, viene dada por:
- ;\mathbf {M} ,\mathbf {c} )={\frac {\mathbf {Mx} +\mathbf {c} }{\lVert \mathbf {Mx} +\mathbf {c} \rVert }}\,,\;{\text{donde}}\;\lVert \mathbf {M^{-1}c} \rVert <1}
La función inversa, derivada de forma similar a la inversa de la traslación normalizada, es:
- ;\mathbf {M} ,\mathbf {c} )=\mathbf {M} ^{-1}(\ell \mathbf {y} -\mathbf {c} )\,,{\text{donde}}\;\ell ={\frac {\mathbf {y} '\mathbf {Wc} +{\sqrt {(\mathbf {y} '\mathbf {Wc} )^{2}+\mathbf {y} '\mathbf {Wy} (1-\mathbf {c} '\mathbf {Wc} )}}}{\mathbf {y} '\mathbf {Wy} }}}
dóndeLa relación de volumen diferencial es:
- ;\mathbf {M} ,\mathbf {c} )=R_{\text{lin}}(\mathbf {x} ;\mathbf {M} +\mathbf {c} \mathbf {x} ')={\frac {\left|\operatorname {det} \mathbf {M} \right|(1+\mathbf {x} '\mathbf {M^{-1}c} )}{\lVert \mathbf {Mx+c} \rVert ^{n}}}}
El numerador final del lado derecho se amplió desdepor el lema del determinante de la matriz . Recordando, la igualdad entreyse sostiene porque no solo:
- ;\mathbf {M,c} )=f_{\text{lin}}(\mathbf {x} ;\mathbf {M+cx} ')}
pero también, por ortogonalidad deal espacio tangente local:
dóndees el jacobiano dediferenciado con respecto a su entrada, pero no también con respecto a su parámetro.
Desventajas
A pesar del éxito de los flujos normalizadores en la estimación de densidades de alta dimensión, aún existen algunas desventajas en su diseño. En primer lugar, su espacio latente sobre el que se proyectan los datos de entrada no es un espacio de menor dimensión y, por lo tanto, los modelos basados en flujos no permiten la compresión de datos por defecto y requieren mucha computación. Sin embargo, aún es posible realizar compresión de imágenes con ellos. [ 32 ]
Los modelos basados en flujo también son conocidos por fallar en la estimación de la probabilidad de muestras fuera de distribución (es decir, muestras que no fueron extraídas de la misma distribución que el conjunto de entrenamiento). [ 33 ] Se formularon algunas hipótesis para explicar este fenómeno, entre las cuales la hipótesis del conjunto típico , [ 34 ] problemas de estimación al entrenar modelos, [ 35 ] o problemas fundamentales debido a la entropía de las distribuciones de datos. [ 36 ]
Una de las propiedades más interesantes de los flujos normalizadores es la invertibilidad de su mapa biyectivo aprendido . Esta propiedad viene dada por las restricciones en el diseño de los modelos (cf.: RealNVP, Glow) que garantizan la invertibilidad teórica. La integridad de la inversa es importante para asegurar la aplicabilidad del teorema de cambio de variable , el cálculo del jacobiano del mapa, así como el muestreo con el modelo. Sin embargo, en la práctica esta invertibilidad se viola y el mapa inverso diverge debido a la imprecisión numérica. [ 37 ]
Aplicaciones
Los modelos generativos basados en flujo se han aplicado a diversas tareas de modelado, entre las que se incluyen:
Referencias
- ↑ Tabak, Esteban G.; Vanden-Eijnden, Eric (2010). "Estimación de densidad mediante ascenso dual de la log-verosimilitud" . Communications in Mathematical Sciences . 8 (1): 217– 233. doi : 10.4310/CMS.2010.v8.n1.a11 .
- ↑ Tabak, Esteban G.; Turner, Cristina V. (2012). "Una familia de algoritmos de estimación de densidad no paramétricos" . Communications on Pure and Applied Mathematics . 66 (2): 145– 164. doi : 10.1002/cpa.21423 . hdl : 11336/8930 . S2CID 17820269 .
- ↑ Papamakarios, George; Nalisnick, Eric; Jimenez Rezende, Danilo; Mohamed, Shakir; Bakshminarayanan, Balaji (2021). "Normalizing flows for probabilistic modeling and inference" . Journal of Machine Learning Research . 22 (1): 2617– 2680. arXiv : 1912.02762 .
- ↑ Bell, AJ; Sejnowski, TJ (1995). " Un enfoque de maximización de la información para la separación ciega y la deconvolución ciega ". Neural Computation . **7** (6): 1129–1159. doi:10.1162/neco.1995.7.6.1129.
- ↑ Roth, Z.; Baram, Y. (1996). " Conformación de densidad multidimensional mediante sigmoides ". IEEE Transactions on Neural Networks . **7** (5): 1291–1298. doi:10.1109/72.536322.
- 1 2 Dinh, Laurent; Krueger, David; Bengio, Yoshua (2014). "NICE: Estimación de componentes independientes no lineales". arXiv : 1410.8516 [ cs.LG ].
- 1 2 Dinh, Laurent; Sohl-Dickstein, Jascha; Bengio, Samy (2016). "Estimación de densidad utilizando Real NVP". arXiv : 1605.08803 [ cs.LG ].
- 1 2 3 Kingma, Diederik P.; Dhariwal, Prafulla (2018). "Glow: Flujo generativo con convoluciones 1x1 invertibles". arXiv : 1807.03039 [ stat.ML ].
- ↑ Papamakarios, George; Nalisnick, Eric; Rezende, Danilo Jimenez; Shakir, Mohamed; Balaji, Lakshminarayanan (marzo de 2021). "Normalizing Flows for Probabilistic Modeling and Inference" . Journal of Machine Learning Research . 22 (57): 1– 64. arXiv : 1912.02762 .
- ↑ Kobyzev, Ivan; Prince, Simon JD; Brubaker, Marcus A. (noviembre de 2021). "Normalizing Flows: An Introduction and Review of Current Methods". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (11): 3964– 3979. arXiv : 1908.09257 . Bibcode : 2021ITPAM..43.3964K . doi : 10.1109/TPAMI.2020.2992934 . ISSN 1939-3539 . PMID 32396070 . S2CID 208910764 .
- ↑ Danilo Jimenez Rezende; Mohamed, Shakir (2015). "Inferencia variacional con flujos normalizadores". arXiv : 1505.05770 [ stat.ML ].
- ↑ Papamakarios, George; Pavlakou, Theo; Murray, Iain (2017). "Flujo autorregresivo enmascarado para la estimación de densidad" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. arXiv : 1705.07057 .
- ↑ Kingma, Durk P; Salimans, Tim; Jozefowicz, Rafal; Chen, Xi; Sutskever, Ilya; Welling, Max (2016). "Inferencia variacional mejorada con flujo autorregresivo inverso" . Advances in Neural Information Processing Systems . 29. Curran Associates, Inc. arXiv : 1606.04934 .
- 1 2 3 Grathwohl, Will; Chen, Ricky TQ; Bettencourt, Jesse; Sutskever, Ilya; Duvenaud, David (2018). "FFJORD: Dinámica continua de forma libre para modelos generativos reversibles escalables". arXiv : 1810.01367 [ cs.LG ].
- ↑ Lipman, Yaron; Chen, Ricky TQ; Ben-Hamu, Heli; Nickel, Maximilian; Le, Matt (2022-10-01). "Flow Matching for Generative Modeling". arXiv : 2210.02747 [ cs.LG ].
- ↑ Grathwohl, Will; Chen, Ricky TQ; Bettencourt, Jesse; Sutskever, Ilya; Duvenaud, David (22 de octubre de 2018). "FFJORD: Dinámica continua de forma libre para modelos generativos reversibles escalables". arXiv : 1810.01367 [ cs.LG ].
- 1 2 Finlay, Chris; Jacobsen, Joern-Henrik; Nurbekyan, Levon; Oberman, Adam (2020-11-21). "Cómo entrenar su ODE neuronal: el mundo de la regularización jacobiana y cinética" . Conferencia internacional sobre aprendizaje automático . PMLR: 3154–3164 . arXiv : 2002.02798 .
- ↑ Hutchinson, MF (enero de 1989). "Un estimador estocástico de la traza de la matriz de influencia para splines de suavizado laplaciano" . Communications in Statistics - Simulation and Computation . 18 (3): 1059– 1076. doi : 10.1080/03610918908812806 . ISSN 0361-0918 .
- ↑ Chen, Ricky TQ; Rubanova, Yulia; Bettencourt, Jesse; Duvenaud, David K. (2018). "Ecuaciones diferenciales ordinarias neuronales" (PDF) . En Bengio, S.; Wallach, H.; Larochelle, H.; Grauman, K.; Cesa-Bianchi, N.; Garnett, R. (eds.). Avances en sistemas de procesamiento de información neuronal . Vol. 31. Curran Associates, Inc. arXiv : 1806.07366 .
- ↑ Dupont, Emilien; Doucet, Arnaud; Teh, Yee Whye (2019). "Ecuaciones diferenciales ordinarias neuronales aumentadas" . Avances en sistemas de procesamiento de información neuronal . 32. Curran Associates, Inc.
- ↑ Zhang, Han; Gao, Xi; Unterman, Jacob; Arodz, Tom (2019-07-30). "Capacidades de aproximación de EDO neuronales y redes residuales invertibles". arXiv : 1907.12998 [ cs.LG ].
- 1 2 3 4 Sorrenson, Peter; Draxler, Felix; Rousselot, Armand; Hummerich, Sander; Köthe, Ullrich (2023). "Learning Distributions on Manifolds with Free-Form Flows". arXiv : 2312.09852 [ cs.LG ].
- ↑ Brümmer, Niko; van Leeuwen, DA (2006). "Sobre la calibración de puntuaciones de reconocimiento de lenguaje". Actas de IEEE Odyssey: Taller de reconocimiento de hablantes y lenguaje . San Juan, Puerto Rico. pp. 1– 8. doi : 10.1109/ODYSSEY.2006.248106 .
- ↑ Ferrer, Luciana; Ramos, Daniel (2024). "Evaluación de probabilidades posteriores: teoría de la decisión, reglas de puntuación adecuadas y calibración". arXiv : 2408.02841 [ stat.ML ].
- ↑ Graf, Monique (2019). "La distribución Beta generalizada simplicial: paquete R SGB y aplicaciones" . Libra . Recuperado el 26 de mayo de 2025 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Brümmer, Niko (18 de octubre de 2010). Medición, refinamiento y calibración de la información del hablante y del idioma extraída del habla (tesis doctoral). Stellenbosch, Sudáfrica: Departamento de Ingeniería Eléctrica y Electrónica, Universidad de Stellenbosch.
- ↑ Meelis Kull, Miquel Perelló‑Nieto, Markus Kängsepp, Telmo Silva Filho, Hao Song, Peter A. Flach (28 de octubre de 2019). "Más allá del escalado de temperatura: obtención de probabilidades multiclase bien calibradas con calibración de Dirichlet". arXiv : 1910.12656 [ cs.LG ].
{{cite arXiv}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Las matrices tangentes no son únicas: sitiene columnas ortonormales yes una matriz ortogonal , entoncestambién tiene columnas ortonormales que abarcan el mismo subespacio; es fácil verificar quees invariante a tales transformaciones de los representantes tangentes.
- ↑ Con PyTorch :
from torch.linalg import qr from torch.func import jacrev def logRf(pi, m, f, x): y = f(x) Fx, PI = jacrev(f)(x), jacrev(pi) Tx, Ty = [qr(PI(z)).Q[:,:m] para z en (x,y)] devolver (Ty.T @ Fx @ Tx).slogdet().logabsdet
- ↑ Boulerice, Bernard; Ducharme, Gilles R. (1994). "Datos direccionales descentrados". Anales del Instituto de Matemáticas Estadísticas . 46 (3): 573– 586. doi : 10.1007/BF00773518 .
- ↑ Tyler, David E (1987). "Análisis estadístico para la distribución gaussiana central angular en la esfera". Biometrika . 74 (3): 579– 589. doi : 10.2307/2336697 . JSTOR 2336697 .
- ^ Helminger , Leonhard; Djelouah, Abdelaziz; Bruto, Markus; Schroers, Christopher (2020). "Compresión de imágenes con pérdida con flujos de normalización". arXiv : 2008.10486 [ cs.CV ].
- ↑ Nalisnick, Eric; Matsukawa, Teh; Zhao, Yee Whye; Song, Zhao (2018). "¿Saben los modelos generativos profundos lo que no saben?". arXiv : 1810.09136v3 [ stat.ML ].
- ↑ Nalisnick, Eric; Matsukawa, Teh; Zhao, Yee Whye; Song, Zhao (2019). "Detección de entradas fuera de distribución para modelos generativos profundos mediante tipicidad". arXiv : 1906.02994 [ stat.ML ].
- ↑ Zhang, Lily; Goldstein, Mark; Ranganath, Rajesh (2021). " Understanding Failures in Out-of-Distribution Detection with Deep Generative Models" . Proceedings of Machine Learning Research . 139 : 12427–12436 . PMC 9295254. PMID 35860036 .
- ↑ Caterini, Anthony L.; Loaiza-Ganem, Gabriel (2022). "Problemas entrópicos en la detección de OOD basada en verosimilitud". pp. 21– 26. arXiv : 2109.10794 [ stat.ML ].
- ↑ Behrmann, Jens; Vicol, Pablo; Wang, Kuan-Chieh; Grosse, Roger; Jacobsen, Jörn-Henrik (2020). "Comprensión y mitigación de explosiones inversas en redes neuronales invertibles". arXiv : 2006.09347 [ cs.LG ].
- ^ Ping, Wei; Peng, Kainan; Gorur, Dilan; Lakshminarayanan, Balaji (2019). "WaveFlow: un modelo compacto basado en flujo para audio sin formato". arXiv : 1912.01219 [ cs.SD ].
- ^ Shi, Chence; Xu, Minkai; Zhu, Zhaocheng; Zhang, Weinan; Zhang, Ming; Tang, Jian (2020). "GraphAF: un modelo autorregresivo basado en flujo para la generación de gráficos moleculares". arXiv : 2001.09382 [ cs.LG ].
- ↑ Yang, Guandao; Huang, Xun; Hao, Zekun; Liu, Ming-Yu; Belongie, Serge; Hariharan, Bharath (2019). "PointFlow: Generación de nubes de puntos 3D con flujos de normalización continuos". arXiv : 1906.12320 [ cs.CV ].
- ↑ Kumar, Manoj; Babaeizadeh, Mohammad; Erhan, Dumitru; Finn, Chelsea ; Levine, Sergey ; Dinh, Laurent; Kingma, Durk (2019). "VideoFlow: Un modelo condicional basado en flujo para la generación estocástica de vídeo". arXiv : 1903.01434 [ cs.CV ].
- ↑ Rudolph, Marco; Wandt, Bastian; Rosenhahn, Bodo (2021). "Same Same But DifferNet: Detección de defectos semisupervisada con flujos normalizadores". arXiv : 2008.12577 [ cs.CV ].
Enlaces externos
- Modelos generativos profundos basados en flujo
- Modelos de flujo normalizados
- Aprendizaje automático
- Modelos estadísticos
- Modelos probabilísticos