Articulo de referencia

Modelo generativo basado en flujo

Un modelo generativo basado en flujo es un modelo generativo utilizado en el aprendizaje automático que modela explícitamente una distribución de probabilidad aprovechando el fl...

Un modelo generativo basado en flujo es un modelo generativo utilizado en el aprendizaje automático que modela explícitamente una distribución de probabilidad aprovechando el flujo normalizador , [ 1 ] [ 2 ] [ 3 ] que es un método estadístico que utiliza la ley de cambio de variable de las probabilidades para transformar una distribución simple en una compleja.

El modelado directo de la verosimilitud ofrece numerosas ventajas. Por ejemplo, la log-verosimilitud negativa se puede calcular directamente y minimizar como función de pérdida . Además, se pueden generar nuevas muestras a partir de la distribución inicial y aplicando la transformación de flujo.

Por el contrario, muchos métodos de modelado generativo alternativos, como los autoencoders variacionales (VAE) , las redes generativas adversarias (GAN) o los modelos de difusión , no representan explícitamente la función de verosimilitud .

Método

Esquema para la normalización de flujos

Dejarz0{\displaystyle z_{0}}sea ​​una variable aleatoria (posiblemente multivariada) con distribuciónpag0(z0){\displaystyle p_{0}(z_{0})}.

Parai=1,...,K{\displaystyle i=1,...,K}, dejarzi=Fi(zi1){\ Displaystyle z_ {i} = f_ {i} (z_ {i-1})}ser una secuencia de variables aleatorias transformadas dez0{\displaystyle z_{0}}. Las funcionesF1,...,FK{\displaystyle f_{1},...,f_{K}}debe ser invertible, es decir, la función inversaFi1{\displaystyle f_{i}^{-1}}existe. El resultado finalzK{\displaystyle z_{K}}modela la distribución objetivo.

La probabilidad logarítmica dezK{\displaystyle z_{K}}es (ver derivación ):

registropagK(zK)=registropag0(z0)i=1Kregistro|detdFi(zi1)dzi1|{\displaystyle \log p_{K}(z_{K})=\log p_{0}(z_{0})-\sum _{i=1}^{K}\log \left|\det {\frac {df_{i}(z_{i-1})}{dz_{i-1}}}\right|}

El aprendizaje de distribuciones de probabilidad mediante la diferenciación de tales jacobianos logarítmicos se originó en el enfoque Infomax (máxima verosimilitud) para ICA, [ 4 ] que forma un modelo basado en flujo de una sola capa (K=1). Relativamente, el precursor de una sola capa de flujos generativos condicionales apareció en. [ 5 ]

Para calcular eficientemente la verosimilitud logarítmica, las funcionesF1,...,FK{\displaystyle f_{1},...,f_{K}}deberían ser fácilmente invertibles, y los determinantes de sus jacobianos deberían ser sencillos de calcular. En la práctica, las funcionesF1,...,FK{\displaystyle f_{1},...,f_{K}}Se modelan utilizando redes neuronales profundas y se entrenan para minimizar la log-verosimilitud negativa de las muestras de datos de la distribución objetivo. Estas arquitecturas suelen diseñarse de forma que solo se requiere el paso hacia adelante de la red neuronal tanto en los cálculos de la inversa como del determinante jacobiano. Ejemplos de dichas arquitecturas incluyen NICE, [ 6 ] RealNVP, [ 7 ] y Glow. [ 8 ]

Derivación de la verosimilitud logarítmica

Considerarz1{\displaystyle z_{1}}yz0{\displaystyle z_{0}}. Tenga en cuenta quez0=F11(z1){\ Displaystyle z_ {0} = f_ {1} ^ {-1} (z_ {1})}.

Mediante la fórmula de cambio de variable , la distribución dez1{\displaystyle z_{1}}es:

pag1(z1)=pag0(z0)|detdF11(z1)dz1|{\displaystyle p_{1}(z_{1})=p_{0}(z_{0})\left|\det {\frac {df_{1}^{-1}(z_{1})}{dz_{1}}}\right|}

DóndedetdF11(z1)dz1{\displaystyle \det {\frac {df_{1}^{-1}(z_{1})}{dz_{1}}}}es el determinante de la matriz jacobiana deF11{\displaystyle f_{1}^{-1}}.

Por el teorema de la función inversa :

pag1(z1)=pag0(z0)|det(dF1(z0)dz0)1|{\displaystyle p_{1}(z_{1})=p_{0}(z_{0})\left|\det \left({\frac {df_{1}(z_{0})}{dz_{0}}}\right)^{-1}\right|}

Por la identidaddet(A1)=det(A)1{\displaystyle \det(A^{-1})=\det(A)^{-1}}(dóndeA{\displaystyle A}es una matriz invertible ), tenemos:

pag1(z1)=pag0(z0)|detdF1(z0)dz0|1{\displaystyle p_{1}(z_{1})=p_{0}(z_{0})\left|\det {\frac {df_{1}(z_{0})}{dz_{0}}}\right|^{-1}}

La verosimilitud logarítmica es, por lo tanto:

registropag1(z1)=registropag0(z0)registro|detdF1(z0)dz0|{\displaystyle \log p_{1}(z_{1})=\log p_{0}(z_{0})-\log \left|\det {\frac {df_{1}(z_{0})}{dz_{0}}}\right|}

En general, lo anterior se aplica a cualquierzi{\displaystyle z_{i}}yzi1{\displaystyle z_{i-1}}. Desderegistropagi(zi){\displaystyle \log p_{i}(z_{i})}es igual aregistropagi1(zi1){\displaystyle \log p_{i-1}(z_{i-1})}Restando un término no recursivo, podemos inferir por inducción que:

registropagK(zK)=registropag0(z0)i=1Kregistro|detdFi(zi1)dzi1|{\displaystyle \log p_{K}(z_{K})=\log p_{0}(z_{0})-\sum _{i=1}^{K}\log \left|\det {\frac {df_{i}(z_{i-1})}{dz_{i-1}}}\right|}

Método de entrenamiento

Como se hace generalmente al entrenar un modelo de aprendizaje profundo, el objetivo de normalizar los flujos es minimizar la divergencia de Kullback-Leibler entre la verosimilitud del modelo y la distribución objetivo que se va a estimar. Denotandopagθ{\displaystyle p_{\theta }}la probabilidad del modelo ypag{\displaystyle p^{*}}La distribución objetivo a aprender, la divergencia KL (hacia adelante) es:

DKL[pag(incógnita)pagθ(incógnita)]=mipag(incógnita)[registropagθ(incógnita)]+mipag(incógnita)[registropag(incógnita)]{\displaystyle D_{\text{KL}}[p^{*}(x)\|p_{\theta }(x)]=-\mathop {\mathbb {E} } _{p^{*}(x)}[\log p_{\theta }(x)]+\mathop {\mathbb {E} } _{p^{*}(x)}[\log p^{*}(x)]}

El segundo término del lado derecho de la ecuación corresponde a la entropía de la distribución objetivo y es independiente del parámetro.θ{\displaystyle \theta }Queremos que el modelo aprenda, lo que solo deja la expectativa de la log-verosimilitud negativa para minimizar bajo la distribución objetivo. Este término intratable puede aproximarse con un método de Monte Carlo mediante muestreo de importancia . De hecho, si tenemos un conjunto de datos{incógnitai}i=1norte{\displaystyle \{x_{i}\}_{i=1}^{N}}de muestras, cada una extraída independientemente de la distribución objetivo.pag(incógnita){\displaystyle p^{*}(x)}, entonces este término puede estimarse como:

mi^pag(incógnita)[registropagθ(incógnita)]=1nortei=0norteregistropagθ(incógnitai){\displaystyle -{\hat {\mathop {\mathbb {E} } }}_{p^{*}(x)}[\log p_{\theta }(x)]=-{\frac {1}{N}}\sum _{i=0}^{N}\log p_{\theta }(x_{i})}

Por lo tanto, el objetivo de aprendizaje

argramometroinorteθ DKL[pag(incógnita)pagθ(incógnita)]{\displaystyle {\underset {\theta }{\operatorname {arg\,min} }}\ D_{\text{KL}}[p^{*}(x)\|p_{\theta }(x)]}

es reemplazado por

argramometroaincógnitaθ i=0norteregistropagθ(incógnitai){\displaystyle {\underset {\theta }{\operatorname {arg\,max} }}\ \sum _{i=0}^{N}\log p_{\theta }(x_{i})}

En otras palabras, minimizar la divergencia de Kullback-Leibler entre la verosimilitud del modelo y la distribución objetivo es equivalente a maximizar la verosimilitud del modelo bajo muestras observadas de la distribución objetivo. [ 9 ]

Un pseudocódigo para entrenar flujos normalizadores es el siguiente: [ 10 ]

  • ENTRADA.conjunto de datosincógnita1:norte{\displaystyle x_{1:n}}, modelo de flujo normalizadorFθ(),pag0{\displaystyle f_{\theta }(\cdot ),p_{0}}.
  • RESOLVER.máximoθjregistropagθ(incógnitaj){\displaystyle \max _{\theta }\sum _{j}\log p_{\theta }(x_{j})}por descenso de gradiente
  • DEVOLVER.θ^{\displaystyle {\hat {\theta }}}

Variantes

Flujo planar

El primer ejemplo. [ 11 ] Corregir alguna función de activaciónh{\displaystyle h}y dejarθ=(,w,b){\displaystyle \theta =(u,w,b)}con las dimensiones apropiadas, entoncesincógnita=Fθ(z)=z+h(w,z+b){\displaystyle x=f_{\theta }(z)=z+uh(\langle w,z\rangle +b)}Lo contrarioFθ1{\displaystyle f_{\theta }^{-1}}En general, no tiene una solución analítica.

El jacobiano es|det(I+h(w,z+b)wT)|=|1+h(w,z+b),w|{\displaystyle |\det(I+h'(\langle w,z\rangle +b)uw^{T})|=|1+h'(\langle w,z\rangle +b)\langle u,w\rangle |}.

Para que sea invertible en todas partes, debe ser distinto de cero en todas partes. Por ejemplo,h=tanh{\displaystyle h=\tanh }y,w>1{\displaystyle \langle u,w\rangle >-1}Satisface el requisito.

Estimación de componentes independientes no lineales (NICE)

Dejarincógnita,zR2norte{\displaystyle x,z\in \mathbb {R} ^{2n}}sean de dimensión par y divídalas por la mitad. [ 6 ] Entonces las funciones de flujo normalizadoras sonincógnita=[incógnita1incógnita2]=Fθ(z)=[z1z2]+[0metroθ(z1)]{\displaystyle x={\begin{bmatrix}x_{1}\\x_{2}\end{bmatrix}}=f_{\theta }(z)={\begin{bmatrix}z_{1}\\z_{2}\end{bmatrix}}+{\begin{bmatrix}0\\m_{\theta }(z_{1})\end{bmatrix}}}dóndemetroθ{\displaystyle m_{\theta }}es cualquier red neuronal con pesosθ{\displaystyle \theta }.

Fθ1{\displaystyle f_{\theta }^{-1}}es soloz1=incógnita1,z2=incógnita2metroθ(incógnita1){\displaystyle z_{1}=x_{1},z_{2}=x_{2}-m_{\theta }(x_{1})}y el jacobiano es simplemente 1, es decir, el flujo conserva el volumen.

Cuandonorte=1{\displaystyle n=1}, esto se ve como un corte curvo a lo largo de laincógnita2{\displaystyle x_{2}}dirección.

Real No Conservador de Volumen (Real NVP)

El modelo Real Non-Volume Preserving generaliza el modelo NICE mediante: [ 7 ]incógnita=[incógnita1incógnita2]=Fθ(z)=[z1misθ(z1)z2]+[0metroθ(z1)]{\displaystyle x={\begin{bmatrix}x_{1}\\x_{2}\end{bmatrix}}=f_{\theta }(z)={\begin{bmatrix}z_{1}\\e^{s_{\theta }(z_{1})}\odot z_{2}\end{bmatrix}}+{\begin{bmatrix}0\\m_{\theta }(z_{1})\end{bmatrix}}}

Su inversa esz1=incógnita1,z2=misθ(incógnita1)(incógnita2metroθ(incógnita1)){\displaystyle z_{1}=x_{1},z_{2}=e^{-s_{\theta }(x_{1})}\odot (x_{2}-m_{\theta }(x_{1}))}y su jacobiano esi=1nortemisθ(z1,){\displaystyle \prod _{i=1}^{n}e^{s_{\theta }(z_{1,})}}El modelo NICE se recupera estableciendosθ=0{\displaystyle s_{\theta }=0}Dado que el mapa NVP real conserva la primera y la segunda mitad del vectorincógnita{\displaystyle x}Por separado, normalmente se requiere agregar una permutación(incógnita1,incógnita2)(incógnita2,incógnita1){\displaystyle (x_{1},x_{2})\mapsto (x_{2},x_{1})}después de cada capa de NVP real.

Flujo generativo (resplandor)

En el modelo de flujo generativo, [ 8 ] cada capa tiene 3 partes:

  • transformación afín por canalydoij=sdo(incógnitadoij+bdo){\displaystyle y_{cij}=s_{c}(x_{cij}+b_{c})}con jacobinodosdoHW{\displaystyle \prod _{c}s_{c}^{HW}}.
  • convolución 1x1 invertiblezdoij=doKdodoydoij{\displaystyle z_{cij}=\sum _{c'}K_{cc'}y_{cij}}con jacobinodet(K)HW{\displaystyle \det(K)^{HW}}. AquíK{\displaystyle K}es cualquier matriz invertible.
  • NVP real, con jacobiano como se describe en NVP real.

La idea de utilizar la convolución invertible de 1x1 es permutar todas las capas en general, en lugar de simplemente permutar la primera y la segunda mitad, como en Real NVP.

Flujo autorregresivo enmascarado (MAF)

Un modelo autorregresivo de una distribución enRnorte{\displaystyle \mathbb {R} ^{n}}se define como el siguiente proceso estocástico : [ 12 ]

incógnita1norte(μ1,σ12)incógnita2norte(μ2(incógnita1),σ2(incógnita1)2)incógnitanortenorte(μnorte(incógnita1:norte1),σnorte(incógnita1:norte1)2){\displaystyle {\begin{aligned}x_{1}\sim &N(\mu _{1},\sigma _{1}^{2})\\x_{2}\sim &N(\mu _{2}(x_{1}),\sigma _{2}(x_{1})^{2})\\&\cdots \\x_{n}\sim &N(\mu _{n}(x_{1:n-1}),\sigma _{n}(x_{1:n-1})^{2})\\\end{aligned}}}dóndeμi:Ri1R{\displaystyle \mu _{i}:\mathbb {R} ^{i-1}\to \mathbb {R} }yσi:Ri1(0,){\displaystyle \sigma _{i}:\mathbb {R} ^{i-1}\to (0,\infty )}son funciones fijas que definen el modelo autorregresivo.

Mediante el truco de reparametrización , el modelo autorregresivo se generaliza a un flujo normalizador:incógnita1=μ1+σ1z1incógnita2=μ2(incógnita1)+σ2(incógnita1)z2incógnitanorte=μnorte(incógnita1:norte1)+σnorte(incógnita1:norte1)znorte{\displaystyle {\begin{aligned}x_{1}=&\mu _{1}+\sigma _{1}z_{1}\\x_{2}=&\mu _{2}(x_{1})+\sigma _{2}(x_{1})z_{2}\\&\cdots \\x_{n}=&\mu _{n}(x_{1:n-1})+\sigma _{n}(x_{1:n-1})z_{n}\\\end{aligned}}}El modelo autorregresivo se recupera estableciendoznorte(0,Inorte){\displaystyle z\sim N(0,I_{n})}.

El mapeo hacia adelante es lento (porque es secuencial), pero el mapeo hacia atrás es rápido (porque es paralelo).

La matriz jacobiana es diagonal inferior, por lo que la matriz jacobiana esσ1σ2(incógnita1)σnorte(incógnita1:norte1){\displaystyle \sigma _{1}\sigma _{2}(x_{1})\cdots \sigma _{n}(x_{1:n-1})}.

Invirtiendo los dos mapasFθ{\displaystyle f_{\theta }}yFθ1{\displaystyle f_{\theta }^{-1}}de MAF da como resultado Flujo Autorregresivo Inverso (IAF), que tiene mapeo hacia adelante rápido y mapeo hacia atrás lento. [ 13 ]

Flujo Normalizado Continuo (CNF)

En lugar de construir el flujo mediante composición de funciones, otro enfoque consiste en formular el flujo como una dinámica de tiempo continuo. [ 14 ] [ 15 ] Seaz0{\displaystyle z_{0}}sea ​​la variable latente con distribuciónpag(z0){\displaystyle p(z_{0})}. Asigne esta variable latente al espacio de datos con la siguiente función de flujo:

incógnita=F(z0)=zT=z0+0TF(zt,t)dt{\displaystyle x=F(z_{0})=z_{T}=z_{0}+\int _{0}^{T}f(z_{t},t)dt}

dóndeF{\displaystyle f}es una función arbitraria y puede modelarse, por ejemplo, con redes neuronales.

La función inversa es entonces naturalmente: [ 14 ]

z0=F1(incógnita)=zT+T0F(zt,t)dt=zT0TF(zt,t)dt{\displaystyle z_{0}=F^{-1}(x)=z_{T}+\int _{T}^{0}f(z_{t},t)dt=z_{T}-\int _{0}^{T}f(z_{t},t)dt}

Y la verosimilitud logarítmica deincógnita{\displaystyle x}se puede encontrar como: [ 14 ]

registro(pag(incógnita))=registro(pag(z0))0TTran[Fzt]dt{\displaystyle \log(p(x))=\log(p(z_{0}))-\int _{0}^{T}{\text{Tr}}\left[{\frac {\partial f}{\partial z_{t}}}\right]dt}

Dado que la traza depende únicamente de la diagonal del jacobianoztF{\displaystyle \partial _{z_{t}}f}Esto permite un jacobiano de "forma libre". [ 16 ] Aquí, "forma libre" significa que no hay restricciones en la forma del jacobiano. Se contrasta con los modelos discretos anteriores de flujo normalizador, donde el jacobiano se diseña cuidadosamente para que sea solo diagonal superior o inferior, de modo que pueda evaluarse de manera eficiente.

La traza se puede estimar mediante el "truco de Hutchinson": [ 17 ] [ 18 ]

Dada cualquier matrizWRnorte×norte{\displaystyle W\in \mathbb {R} ^{n\times n}}y cualquier aleatorioRnorte{\displaystyle u\in \mathbb {R} ^{n}}conmi[T]=I{\displaystyle E[uu^{T}]=I}, tenemosmi[TW]=tr(W){\displaystyle E[u^{T}Wu]=tr(W)}(Demostración: expandir la expectativa directamente.)

Por lo general, el vector aleatorio se muestrea a partir denorte(0,I){\displaystyle N(0,I)}(distribución normal) o{±norte1/2}norte{\displaystyle \{\pm n^{-1/2}\}^{n}}( Distribución de Rademacher ).

CuandoF{\displaystyle f}Si se implementa como una red neuronal, se necesitarían métodos de EDO neuronales [ 19 ] . De hecho, CNF se propuso por primera vez en el mismo artículo que propuso EDO neuronales.

Hay dos deficiencias principales de la CNF: una es que un flujo continuo debe ser un homeomorfismo , por lo tanto, preservar la orientación y la isotopía ambiental (por ejemplo, es imposible voltear una mano izquierda a una derecha mediante la deformación continua del espacio, y es imposible dar la vuelta a una esfera o deshacer un nudo); y la otra es que el flujo aprendidoF{\displaystyle f}podría comportarse mal, debido a la degeneración (es decir, hay un número infinito de posiblesF{\displaystyle f}que todos resuelven el mismo problema).

Al agregar dimensiones adicionales, la CNF obtiene suficiente libertad para invertir la orientación e ir más allá de la isotopía ambiental (como cuando uno puede tomar un polígono de un escritorio y voltearlo en el espacio tridimensional, o desatar un nudo en el espacio tetradimensional), dando como resultado la "EDO neuronal aumentada". [ 20 ]

Cualquier homeomorfismo deRnorte{\displaystyle \mathbb {R} ^{n}}puede aproximarse mediante una EDO neuronal que opera enR2norte+1{\displaystyle \mathbb {R} ^{2n+1}}, demostrado mediante la combinación del teorema de incrustación de Whitney para variedades y el teorema de aproximación universal para redes neuronales. [ 21 ]

Para regularizar el flujoF{\displaystyle f}Se pueden imponer pérdidas de regularización. El artículo [ 17 ] propuso la siguiente pérdida de regularización basada en la teoría de transporte óptimo :λK0TF(zt,t)2dt+λJ0TzF(zt,t)F2dt{\displaystyle \lambda _{K}\int _{0}^{T}\left\|f(z_{t},t)\right\|^{2}dt+\lambda _{J}\int _{0}^{T}\left\|\nabla _{z}f(z_{t},t)\right\|_{F}^{2}dt}dóndeλK,λJ>0{\displaystyle \lambda _{K},\lambda _{J}>0}son hiperparámetros. El primer término penaliza al modelo por oscilar el campo de flujo en el tiempo, y el segundo término lo penaliza por oscilar el campo de flujo en el espacio. Ambos términos, en conjunto, guían al modelo hacia un flujo suave (no irregular) en el espacio y el tiempo.

Flujos en colectores

Cuando un flujo probabilístico transforma una distribución en unmetro{\displaystyle m}-variedad lisa dimensional incrustada enRnorte{\displaystyle \mathbb {R} ^{n}}, dóndemetro<norte{\displaystyle m<n}y donde la transformación se especifica como una función,RnorteRnorte{\displaystyle \mathbb {R} ^{n}\to \mathbb {R} ^{n}}, el factor de escala entre las PDF de origen y transformadas no viene dado por el cálculo ingenuo del determinante de lanorte-por-norte{\displaystyle n{\text{-by-}}n}Jacobiano (que es cero), pero en su lugar por el/los determinante(s) de uno o más adecuadamente definidosmetro-por-metro{\displaystyle m{\text{-by-}}m}Matrices. Esta sección es una interpretación del tutorial del apéndice de Sorrenson et al. (2023), [ 22 ] donde también se trata el caso más general de variedades de Riemann no isométricamente incrustadas . Aquí restringimos la atención a las variedades isométricamente incrustadas.

Como ejemplos de variedades con incrustación suave e isométrica enRnorte{\displaystyle \mathbb {R} ^{n}}utilizaremos:

  • La hiperesfera unitaria :Snorte1={incógnitaRnorte:incógnitaincógnita=1}{\displaystyle \mathbb {S} ^{n-1}=\{\mathbf {x} \in \mathbb {R} ^{n}:\mathbf {x} '\mathbf {x} =1\}}donde los flujos se pueden utilizar para generalizar, por ejemplo, las distribuciones de Von Mises-Fisher o las distribuciones esféricas uniformes.
  • El interior simplex :Δnorte1={pag=(pag1,,pagnorte)Rnorte:pagi>0,ipagi=1}{\displaystyle \Delta ^{n-1}=\{\mathbf {p} =(p_{1},\dots ,p_{n})\in \mathbb {R} ^{n}:p_{i}>0,\sum _{i}p_{i}=1\}}, dóndenorte{\displaystyle n}-la forma en que viven las distribuciones categóricas ; y dónde se pueden usar flujos para generalizar, por ejemplo, las distribuciones de Dirichlet o las distribuciones simplex uniformes.

Como primer ejemplo de una transformación de flujo de variedad esférica, consideremos la transformación lineal normalizada , que proyecta radialmente sobre la esfera unitaria la salida de una transformación lineal invertible, parametrizada por lanorte-por-norte{\displaystyle n{\text{-by-}}n}matriz invertibleMETRO{\displaystyle \mathbf {M} }:

Flin(incógnita;METRO)=METROincógnitaMETROincógnita{\displaystyle f_{\text{lin}}(\mathbf {x} ;\mathbf {M} )={\frac {\mathbf {Mx} }{\lVert \mathbf {Mx} \rVert }}}

En el espacio euclidiano completo,Flin:RnorteRnorte{\displaystyle f_{\text{lin}}:\mathbb {R} ^{n}\to \mathbb {R} ^{n}}no es invertible, pero si restringimos el dominio y el codominio a la esfera unitaria, entoncesFlin:Snorte1Snorte1{\displaystyle f_{\text{lin}}:\mathbb {S} ^{n-1}\to \mathbb {S} ^{n-1}}es invertible (más específicamente es una biyección , un homeomorfismo y un difeomorfismo ), con inversaFlin(;METRO1){\displaystyle f_{\text{lin}}(\cdot \,;\mathbf {M} ^{-1})}El jacobino deFlin:RnorteRnorte{\displaystyle f_{\text{lin}}:\mathbb {R} ^{n}\to \mathbb {R} ^{n}}, eny=Flin(incógnita;METRO){\displaystyle \mathbf {y} =f_{\text{lin}}(\mathbf {x} ;\mathbf {M} )} esMETROincógnita1(Inorteyy)METRO{\displaystyle \lVert \mathbf {Mx} \rVert ^{-1}(\mathbf {I} _{n}-\mathbf {yy} ')\mathbf {M} }, que tiene rangonorte1{\displaystyle n-1}y determinante de cero; mientras que , como se explica aquí , el factor (véase la subsección siguiente) que relaciona las densidades de la fuente y transformadas es:METROincógnitanorte|detMETRO|{\displaystyle \lVert \mathbf {Mx} \rVert ^{-n}\left|\operatorname {det} \mathbf {M} \right|}.

Relación de volumen diferencial

Parametro<norte{\displaystyle m<n}, dejarMETRORnorte{\displaystyle {\mathcal {M}}\subset \mathbb {R} ^{n}}frijolmetro{\displaystyle m}Variedad de -dimensiones con una incrustación suave e isométrica enRnorte{\displaystyle \mathbb {R} ^{n}}. DejarF:RnorteRnorte{\displaystyle f:\mathbb {R} ^{n}\to \mathbb {R} ^{n}}ser una transformación de flujo suave con rango restringido aMETRO{\displaystyle {\mathcal {M}}}. DejarincógnitaMETRO{\displaystyle \mathbf {x} \in {\mathcal {M}}}ser muestreado de una distribución con densidadPAGincógnita{\displaystyle P_{X}}. Dejary=F(incógnita){\displaystyle \mathbf {y} =f(\mathbf {x} )}, con la densidad resultante (de empuje hacia adelante)PAGY{\displaystyle P_{Y}}. DejarUMETRO{\displaystyle U\subset {\mathcal {M}}}sea ​​una pequeña región convexa que contieneincógnita{\displaystyle \mathbf {x} }y dejarV=F(U){\displaystyle V=f(U)}sea ​​su imagen, que contieney{\displaystyle \mathbf {y} }; entonces, por conservación de la masa de probabilidad:

PAGincógnita(incógnita)volumen(U)PAGY(y)volumen(V){\displaystyle P_{X}(\mathbf {x} )\operatorname {volume} (U)\approx P_{Y}(\mathbf {y} )\operatorname {volume} (V)}

donde el volumen (para regiones muy pequeñas) viene dado por la medida de Lebesgue enmetro{\displaystyle m}espacio tangente de -dimensiones . Al hacer que las regiones sean infinitesimalmente pequeñas, el factor que relaciona las dos densidades es la razón de volúmenes, que denominamos razón de volumen diferencial .

Para obtener fórmulas concretas para el volumen en elmetro{\displaystyle m}Variedad de dimensión , construimosU{\displaystyle U}mapeando unmetro{\displaystyle m}Rectángulo de -dimensiones en el espacio de coordenadas (local) a la variedad mediante una función de incrustación suave:RmetroRnorte{\displaystyle \mathbb {R} ^{m}\to \mathbb {R} ^{n}}. A escala muy pequeña, la función de incrustación se vuelve esencialmente lineal de modo queU{\displaystyle U}es un paralelotopo (generalización multidimensional de un paralelogramo). De manera similar, la transformación de flujo,F{\displaystyle f}se vuelve lineal, de modo que la imagen,V=F(U){\displaystyle V=f(U)}También es un paralelotopo.Rmetro{\displaystyle \mathbb {R} ^{m}}, podemos representar unmetro{\displaystyle m}Paralelotopo -dimensional con unmetro-por-metro{\displaystyle m{\text{-by-}}m}matriz cuyos vectores columna son un conjunto de aristas (que se encuentran en un vértice común) que abarcan el paralelotopo. El volumen viene dado por el valor absoluto del determinante de esta matriz. Si, de forma más general (como es el caso aquí), unametro{\displaystyle m}El paralelotopo -dimensional está incrustado enRnorte{\displaystyle \mathbb {R} ^{n}}, se puede representar con un (alto)norte-por-metro{\displaystyle n{\text{-by-}}m}matriz, por ejemploV{\displaystyle \mathbf {V} }. Denotando el paralelepípedo como/V/{\displaystyle /\mathbf {V} \!/}Su volumen viene dado entonces por la raíz cuadrada del determinante de Gram :

volumen/V/=|det(VV)|{\displaystyle \operatorname {volume} /\mathbf {V} \!/={\sqrt {\left|\operatorname {det} (\mathbf {V} '\mathbf {V} )\right|}}}

En las secciones siguientes, mostramos varias maneras de utilizar esta fórmula de volumen para derivar la relación de volumen diferencial.

Flujo simplex

Como primer ejemplo, desarrollamos expresiones para la relación de volumen diferencial de un flujo simplex,q=F(pag){\displaystyle \mathbf {q} =f(\mathbf {p} )}, dóndepag,qMETRO=Δnorte1{\displaystyle \mathbf {p} ,\mathbf {q} \in {\mathcal {M}}=\Delta ^{n-1}}. Defina la función de incrustación :

mi:pag~=(pag1,pagnorte1)pag=(pag1,pagnorte1,1i=1norte1pagi){\displaystyle e:{\tilde {\mathbf {p} }}=(p_{1}\dots ,p_{n-1})\mapsto \mathbf {p} =(p_{1}\dots ,p_{n-1},1-\sum _{i=1}^{n-1}p_{i})}

que mapea un lugar convenientemente elegido,(norte1){\displaystyle (n-1)}representación -dimensional,pag~{\displaystyle {\tilde {\mathbf {p} }}}, al colector incrustado. Elnorte-por-(norte1){\displaystyle n{\text{-by-}}(n-1)}Jacobiano es mi=[Inorte11]{\displaystyle \mathbf {E} ={\begin{bmatrix}\mathbf {I} _{n-1}\\-{\boldsymbol {1}}'\end{bmatrix}}}. Para definirU{\displaystyle U}, el elemento de volumen diferencial en la entrada de transformación (pagΔnorte1{\displaystyle \mathbf {p} \in \Delta ^{n-1}}), comenzamos con un rectángulo enpag~{\displaystyle {\tilde {\mathbf {p} }}}-espacio, que tiene longitudes de lado diferenciales (con signo),dpag1,,dpagnorte1{\displaystyle dp_{1},\dots ,dp_{n-1}}a partir de la cual formamos la matriz diagonal cuadradaD{\displaystyle \mathbf {D} }, cuyas columnas abarcan el rectángulo. A muy pequeña escala, obtenemosU=mi(D)=/miD/{\displaystyle U=e(\mathbf {D} )=/\mathbf {ED} \!/}, con:

Para el 1-símplex (azul) incrustado enR2{\displaystyle \mathbb {R} ^{2}}, cuando retiramos la medida de Lebesgue del espacio tangente (paralelo al simplex), a través de la incrustaciónpag1(pag1,1pag1){\displaystyle p_{1}\mapsto (p_{1},1-p_{1})}, con Jacobianomi=[11]{\displaystyle \mathbf {E} ={\begin{bmatrix}1&-1\end{bmatrix}}'}, un factor de escala demimi=2{\displaystyle {\sqrt {\mathbf {E} '\mathbf {E} }}={\sqrt {2}}}resultados.
volumen(U)=|det(DmimiD)|=|det(mimi)||detD)|=nortei=1norte1|dpagi|{\displaystyle \operatorname {volume} (U)={\sqrt {\left|\operatorname {det} (\mathbf {DE} '\mathbf {ED} )\right|}}={\sqrt {\left|\operatorname {det} (\mathbf {E} '\mathbf {E} )\right|}}\,\left|\operatorname {det} \mathbf {D} )\right|={\sqrt {n}}\prod _{i=1}^{n-1}\left|dp_{i}\right|}

Para comprender la interpretación geométrica del factornorte{\displaystyle {\sqrt {n}}}, vea el ejemplo del 1-símplex en el diagrama de la derecha.

El elemento de volumen diferencial en la salida de la transformación (qΔnorte1{\displaystyle \mathbf {q} \in \Delta ^{n-1}}), es el paralelotopo,V=F(U)=/FpagmiD/{\displaystyle V=f(U)=/\mathbf {F_{p}ED} \!/}, dóndeFpag{\displaystyle \mathbf {F_{p}} }es elnorte-por-norte{\displaystyle n{\text{-by-}}n}Jacobiano deF{\displaystyle f}enpag=mi(pag~){\displaystyle \mathbf {p} =e({\tilde {\mathbf {p} }})}Su volumen es:

volumen(V)=|det(DmiFpagFpagmiD)|=|det(miFpagFpagmi)||detD)|{\displaystyle \operatorname {volume} (V)={\sqrt {\left|\operatorname {det} (\mathbf {DE} '\mathbf {F_{p}} '\mathbf {F_{p}ED} )\right|}}={\sqrt {\left|\operatorname {det} (\mathbf {E} '\mathbf {F_{p}} '\mathbf {F_{p}E} )\right|}}\,\left|\operatorname {det} \mathbf {D} )\right|}

de modo que el factor|detD)|{\displaystyle \left|\operatorname {det} \mathbf {D} )\right|}se cancela en la relación de volumen, que ahora ya puede evaluarse numéricamente. Sin embargo, puede reescribirse en una forma a veces más conveniente introduciendo también la función de representación ,r:pagpag~{\displaystyle r:\mathbf {p} \mapsto {\tilde {\mathbf {p} }}}, que simplemente extrae el primero(norte1){\displaystyle (n-1)}componentes. El jacobiano esR=[Inorte0]{\displaystyle \mathbf {R} ={\begin{bmatrix}\mathbf {I} _{n}&{\boldsymbol {0}}\end{bmatrix}}}. Obsérvese que, dado quemirF=F{\displaystyle e\circ r\circ f=f}La regla de la cadena para la composición de funciones da como resultado:miRFpag=Fpag{\displaystyle \mathbf {ERF_{p}} =\mathbf {F_{p}} }Al sustituir esta expansión en el determinante de Gram anterior y luego refactorizarlo como un producto de determinantes de matrices cuadradas, podemos extraer el factor.|det(mimi)|=norte{\displaystyle {\sqrt {\left|\operatorname {det} (\mathbf {E} '\mathbf {E} )\right|}}={\sqrt {n}}}, que ahora también se cancela en la razón, que finalmente se simplifica al determinante del jacobiano de la transformación de flujo "sándwich",rFmi{\displaystyle r\circ f\circ e}:

RFΔ(pag)=volumen(V)volumen(U)=|det(RFpagmi)|{\displaystyle R_{f}^{\Delta }(\mathbf {p} )={\frac {\operatorname {volume} (V)}{\operatorname {volume} (U)}}=\left|\operatorname {det} (\mathbf {RF_{p}E} )\right|}

lo cual, sipagPAGPAG{\displaystyle \mathbf {p} \sim P_{\mathbf {P} }}, puede utilizarse para derivar la densidad de empuje hacia adelante después de un cambio de variables,q=F(pag){\displaystyle \mathbf {q} =f(\mathbf {p} )}:

PAGQ(q)=PAGPAG(pag)RFΔ(pag),dóndepag=F1(q){\displaystyle P_{\mathbf {Q} }(\mathbf {q} )={\frac {P_{\mathbf {P} }(\mathbf {p} )}{R_{f}^{\Delta }(\mathbf {p} )}}\,,\;{\text{where}}\;\;\mathbf {p} =f^{-1}(\mathbf {q} )}

Esta fórmula es válida solo porque el simplex es plano y el jacobiano,mi{\displaystyle \mathbf {E} }es constante. El caso más general para variedades curvas se analiza más adelante, después de presentar dos ejemplos concretos de transformadas de flujo simplex.

Transformación de calibración simplex

Una transformación de calibración ,FCalifornia:Δnorte1Δnorte1{\displaystyle f_{\text{cal}}:\Delta ^{n-1}\to \Delta ^{n-1}}, que a veces se utiliza en el aprendizaje automático para el posprocesamiento de las salidas (a posteriori de la clase) de una prueba probabilísticanorte{\displaystyle n}El clasificador de clases [ 23 ] [ 24 ] utiliza la función softmax para renormalizar las distribuciones categóricas después del escalado y la traslación de las distribuciones de entrada en el espacio de probabilidad logarítmica. Parapag,qΔnorte1{\displaystyle \mathbf {p} ,\mathbf {q} \in \Delta ^{n-1}}y con parámetros,a0{\displaystyle a\neq 0}ydoRnorte{\displaystyle \mathbf {c} \in \mathbb {R} ^{n}}La transformación se puede especificar como:

q=FCalifornia(pag;a,do)=softmax(a1registropag+do)pag=FCalifornia1(q;a,do)=softmax(aregistroqado){\displaystyle \mathbf {q} =f_{\text{cal}}(\mathbf {p} ;a,\mathbf {c} )=\operatorname {softmax} (a^{-1}\log \mathbf {p} +\mathbf {c} )\;\iff \;\mathbf {p} =f_{\text{cal}}^{-1}(\mathbf {q} ;a,\mathbf {c} )=\operatorname {softmax} (a\log \mathbf {q} -a\mathbf {c} )}

donde el logaritmo se aplica elemento a elemento. Después de algunas operaciones algebraicas, la relación de volumen diferencial se puede expresar como:

RCaliforniaΔ(pag;a,do)=|det(RFpagmi)|=|a|1nortei=1norteqipagi{\displaystyle R_{\text{cal}}^{\Delta }(\mathbf {p} ;a,\mathbf {c} )=\left|\operatorname {det} (\mathbf {RF_{p}E} )\right|=\left|a\right|^{1-n}\prod _{i=1}^{n}{\frac {q_{i}}{p_{i}}}}

Si bien las transformaciones de calibración se entrenan con mayor frecuencia como modelos discriminativos , la reinterpretación aquí como un flujo probabilístico también permite el diseño de modelos de calibración generativos basados ​​en esta transformación. Cuando se utiliza para calibración, la restriccióna>0{\displaystyle a>0}Se puede imponer para evitar la inversión de dirección en el espacio de probabilidad logarítmica. Con la restricción adicionaldo=0{\displaystyle \mathbf {c} ={\boldsymbol {0}}}Esta transformación (con entrenamiento discriminativo) se conoce en el aprendizaje automático como escalado de temperatura .

Transformación de calibración generalizada

La transformación de calibración anterior se puede generalizar aFgcal:Δnorte1Δnorte1{\displaystyle f_{\text{gcal}}:\Delta ^{n-1}\to \Delta ^{n-1}}, con parámetrosdoRnorte{\displaystyle \mathbf {c} \in \mathbb {R} ^{n}}yA{\displaystyle \mathbf {A} }norte-por-norte{\displaystyle n{\text{-by-}}n}invertible: [ 26 ]

q=Fgcal(pag;A,do)=softmax(Aregistropag+do),sujeto aA1=λ1{\displaystyle \mathbf {q} =f_{\text{gcal}}(\mathbf {p} ;\mathbf {A} ,\mathbf {c} )=\operatorname {softmax} (\mathbf {A} \log \mathbf {p} +\mathbf {c} )\,,\;{\text{sujeto a}}\;\mathbf {A1} =\lambda \mathbf {1} }

donde la condición queA{\displaystyle \mathbf {A} }tiene1{\displaystyle \mathbf {1} }como vector propio garantiza la invertibilidad al evitar la pérdida de información debida a la invariancia:softmax(incógnita+α1)=softmax(incógnita){\displaystyle \operatorname {softmax} (\mathbf {x} +\alpha \mathbf {1} )=\operatorname {softmax} (\mathbf {x} )}. Nótese en particular queA=λInorte{\displaystyle \mathbf {A} =\lambda \mathbf {I} _{n}}es la única parametrización diagonal permitida, en cuyo caso recuperamosFCalifornia(pag;λ1,do){\displaystyle f_{\text{cal}}(\mathbf {p} ;\lambda ^{-1},\mathbf {c} )} , mientras (paranorte>2{\displaystyle n>2}) La generalización es posible con matrices no diagonales. La inversa es:

pag=Fgcal1(q;A,do)=Fgcal(q;A1,A1do),dóndeA1=λ1A11=λ11{\displaystyle \mathbf {p} =f_{\text{gcal}}^{-1}(\mathbf {q} ;\mathbf {A} ,\mathbf {c} )=f_{\text{gcal}}(\mathbf {q}  ;\mathbf {A} ^{-1},-\mathbf {A} ^{-1}\mathbf {c} )\,,\;{\text{donde}}\;\mathbf {A1} =\lambda \mathbf {1} \Longrightarrow \mathbf {A} ^{-1}\mathbf {1} =\lambda ^{-1}\mathbf {1} }

La relación de volumen diferencial es:

RgcalΔ(pag;A,do)=|det(A)||λ|i=1norteqipagi{\displaystyle R_{\text{gcal}}^{\Delta }(\mathbf {p} ;\mathbf {A} ,\mathbf {c} )={\frac {\left|\operatorname {det} (\mathbf {A} )\right|}{|\lambda |}}\prod _{i=1}^{n}{\frac {q_{i}}{p_{i}}}}

SiFgcal{\displaystyle f_{\text{gcal}}}Se va a utilizar como transformación de calibración, se podría imponer una restricción adicional, por ejemplo queA{\displaystyle \mathbf {A} }ser definido positivo , de modo que(Aincógnita)incógnita>0{\displaystyle (\mathbf {Ax} )'\mathbf {x} >0}, que evita los cambios de dirección. (Esta es una posible generalización dea>0{\displaystyle a>0}en elFCalifornia{\displaystyle f_{\text{cal}}}parámetro.)

Paranorte=2{\displaystyle n=2},a>0{\displaystyle a>0}yA{\displaystyle \mathbf {A} }definido positivo, entoncesFCalifornia{\displaystyle f_{\text{cal}}}yFgcal{\displaystyle f_{\text{gcal}}}son equivalentes en el sentido de que en ambos casos,registropag1pag2registroq1q2{\displaystyle \log {\frac {p_{1}}{p_{2}}}\mapsto \log {\frac {q_{1}}{q_{2}}}}es una línea recta, cuya pendiente (positiva) y desplazamiento son funciones de los parámetros de transformación. Paranorte>2,{\displaystyle n>2,}Fgcal{\displaystyle f_{\text{gcal}}}generalizaFCalifornia{\displaystyle f_{\text{cal}}}.

Sin embargo, debe tenerse en cuenta que encadenar múltiplesFgcal{\displaystyle f_{\text{gcal}}}Las transformaciones de flujo no proporcionan una generalización adicional, porque:

Fgcal(;A1,do1)Fgcal(;A2,do2)=Fgcal(;A1A2,do1+A1do2){\displaystyle f_{\text{gcal}}(\cdot \,;\mathbf {A} _{1},\mathbf {c} _{1})\circ f_{\text{gcal}}(\cdot \,;\mathbf {A} _{2},\mathbf {c} _{2})=f_{\text{gcal}}(\cdot \,;\mathbf {A} _{1}\mathbf {A} _{2},\mathbf {c} _{1}+\mathbf {A} _{1}\mathbf {c} _{2})}

De hecho, el conjunto deFgcal{\displaystyle f_{\text{gcal}}}Las transformaciones forman un grupo bajo la composición de funciones. El conjunto deFCalifornia{\displaystyle f_{\text{cal}}}Las transformaciones forman un subgrupo.

Véase también: Calibración de Dirichlet , [ 27 ] que generalizaFgcal{\displaystyle f_{\text{gcal}}}, al no imponer ninguna restricción a la matriz,A{\displaystyle \mathbf {A} }, por lo que la invertibilidad no está garantizada. Si bien la calibración de Dirichlet se entrena como un modelo discriminativo,Fgcal{\displaystyle f_{\text{gcal}}}También se puede entrenar como parte de un modelo de calibración generativo.

Relación de volumen diferencial para colectores curvos

Consideremos un flujo,y=F(incógnita){\displaystyle \mathbf {y} =f(\mathbf {x} )}en un colector curvo, por ejemploSnorte1{\displaystyle \mathbb {S} ^{n-1}}que equipamos con la función de incrustación,mi{\displaystyle e}que mapea un conjunto de(norte1){\displaystyle (n-1)}coordenadas esféricas angulares aSnorte1{\displaystyle \mathbb {S} ^{n-1}}El jacobino demi{\displaystyle e}no es constante y tenemos que evaluarlo en ambas entradas (miincógnita{\displaystyle \mathbf {E_{x}} }) y salida (miy{\displaystyle \mathbf {E_{y}} }). Lo mismo se aplica ar{\displaystyle r}, la función de representación que recupera coordenadas esféricas a partir de puntos enSnorte1{\displaystyle \mathbb {S} ^{n-1}}, para lo cual necesitamos el jacobiano en la salida (Ry{\displaystyle \mathbf {R_{y}} }). La relación de volumen diferencial ahora se generaliza a:

RF(incógnita)=|det(RyFincógnitamiincógnita)||det(miymiy)||det(miincógnitamiincógnita)|{\displaystyle R_{f}(\mathbf {x} )=\left|\operatorname {det} (\mathbf {R_{y}F_{x}E_{x}} )\right|\,{\frac {\sqrt {\left|\operatorname {det} (\mathbf {E} _{\mathbf {y} }'\mathbf {E_{y}} )\right|}}{\sqrt {\left|\operatorname {det} (\mathbf {E} _{\mathbf {x} }'\mathbf {E_{x}} )\right|}}}}

Para obtener información geométrica, considereS2{\displaystyle \mathbf {S} ^{2}}donde las coordenadas esféricas son la colatitud,θ[0,π]{\displaystyle \theta \in [0,\pi ]}y longitud,ϕ[0,2π){\displaystyle \phi \in [0,2\pi )}. Enincógnita=mi(θ,ϕ){\displaystyle \mathbf {x} =e(\theta ,\phi )}, obtenemos|det(miincógnitamiincógnita)|=pecadoθ{\displaystyle {\sqrt {\left|\operatorname {det} (\mathbf {E} _{\mathbf {x} }'\mathbf {E_{x}} )\right|}}=\sin \theta }, que da el radio del círculo en esa latitud (compárese, por ejemplo, el círculo polar con el ecuador). El volumen diferencial (área de la superficie de la esfera) es:pecadoθdθdϕ{\displaystyle \sin \theta \,d\theta \,d\phi }.

La derivación anterior paraRF{\displaystyle R_{f}}es frágil en el sentido de que cuando se utilizan funciones fijasmi,r{\displaystyle e,r}, puede haber lugares donde no estén bien definidos, por ejemplo en los polos de la 2-esfera donde la longitud es arbitraria. Este problema se elude (usando maquinaria estándar de variedades) generalizando a coordenadas locales (cartas), donde en las vecindades deincógnita,yMETRO{\displaystyle \mathbf {x} ,\mathbf {y} \in {\mathcal {M}}}, mapeamos desde localmetro{\displaystyle m}coordenadas -dimensionales aRnorte{\displaystyle \mathbb {R} ^{n}}y viceversa utilizando los pares de funciones correspondientes.miincógnita,rincógnita{\displaystyle e_{\mathbf {x} },r_{\mathbf {x} }}ymiy,ry{\displaystyle e_{\mathbf {y} },r_{\mathbf {y} }}. Continuamos utilizando la misma notación para los jacobianos de estas funciones (miincógnita,miy,Ry{\displaystyle \mathbf {E_{x}} ,\mathbf {E_{y}} ,\mathbf {R_{y}} }), de modo que la fórmula anterior paraRF{\displaystyle R_{f}}sigue siendo válido.

Sin embargo, podemos elegir nuestro sistema de coordenadas local de una manera que simplifique la expresión paraRF{\displaystyle R_{f}}y de hecho también su implementación práctica. [ 22 ] Dejemosπ:PAGRnorte{\displaystyle \pi :{\mathcal {P}}\to \mathbb {R} ^{n}} sea una proyección idempotente suave (ππ=π{\displaystyle \pi \circ \pi =\pi }) del conjunto proyectable ,PAGRnorte{\displaystyle {\mathcal {P}}\subseteq \mathbb {R} ^{n}}, sobre la variedad incrustada. Por ejemplo:

  • El ortante positivo deRnorte{\displaystyle \mathbb {R} ^{n}}se proyecta sobre el simplex como:π(z)=(i=1nortezi)1z{\displaystyle \pi (\mathbf {z} )={\bigl (}\sum _{i=1}^{n}z_{i}{\bigr )}^{-1}\mathbf {z} }
  • Vectores distintos de cero enRnorte{\displaystyle \mathbb {R} ^{n}}se proyectan sobre la esfera unitaria como:π(z)=(i=1nortezi2)12z{\displaystyle \pi (\mathbf {z} )={\bigl (}\sum _{i=1}^{n}z_{i}^{2}{\bigr )}^{-{\frac {1}{2}}}\mathbf {z} }

Por cadaincógnitaMETRO{\displaystyle \mathbf {x} \in {\mathcal {M}}}, requerimos deπ{\displaystyle \pi }que sunorte-por-norte{\displaystyle n{\text{-by-}}n}Jacobiano,Πincógnita{\displaystyle {\boldsymbol {\Pi _{x}}}}tiene rangometro{\displaystyle m}(la dimensión de la variedad), en cuyo casoΠincógnita{\displaystyle {\boldsymbol {\Pi _{x}}}}es una proyección lineal idempotente sobre el espacio tangente local ( ortogonal para la esfera unitaria:Inorteincógnitaincógnita{\displaystyle \mathbf {I} _{n}-\mathbf {xx} '}; oblicuo para el simplex:Inorteincógnita1{\displaystyle \mathbf {I} _{n}-{\boldsymbol {x1}}'}). Las columnas deΠincógnita{\displaystyle {\boldsymbol {\Pi _{x}}}}abarcar elmetro{\displaystyle m}espacio tangente de -dimensiones enincógnita{\displaystyle \mathbf {x} }. Usamos la notación,Tincógnita{\displaystyle \mathbf {T_{x}} }para cualquiernorte-por-metro{\displaystyle n{\text{-by-}}m}matriz con columnas ortonormales (TincógnitaTincógnita=Imetro{\displaystyle \mathbf {T} _{\mathbf {x} }'\mathbf {T_{x}} =\mathbf {I} _{m}}) que abarcan el espacio tangente local. Tenga en cuenta también:ΠincógnitaTincógnita=Tincógnita{\displaystyle {\boldsymbol {\Pi _{x}}}\mathbf {T_{x}} =\mathbf {T_{x}} }Ahora podemos elegir nuestra función de incrustación de coordenadas locales,miincógnita:RmetroRnorte{\displaystyle e_{\mathbf {x} }:\mathbb {R} ^{m}\to \mathbb {R} ^{n}}:

miincógnita(incógnita~)=π(incógnita+Tincógnitaincógnita~),con jacobita:miincógnita=Tincógnitaenincógnita~=0.{\displaystyle e_{\mathbf {x} }({\tilde {x}})=\pi (\mathbf {x} +\mathbf {T_{x}{\tilde {x}}} )\,,{\text{with Jacobian:}}\,\mathbf {E_{x}} =\mathbf {T_{x}} \,{\text{at}}\,{\tilde {\mathbf {x} }}=\mathbf {0} .}

Dado que el jacobiano es inyectivo (rango completo:metro{\displaystyle m}), una inversa izquierda local (no necesariamente única) , por ejemplorincógnita{\displaystyle r_{\mathbf {x} }^{*}}con jacobinoRincógnita{\displaystyle \mathbf {R} _{\mathbf {x} }^{*}}, existe tal querincógnita(miincógnita(incógnita~))=incógnita~{\displaystyle r_{\mathbf {x} }^{*}(e_{\mathbf {x} }({\tilde {x}}))={\tilde {x}}}yRincógnitaTincógnita=Imetro{\displaystyle \mathbf {R} _{\mathbf {x} }^{*}\mathbf {T_{x}} =\mathbf {I} _{m}}En la práctica, no necesitamos la función inversa izquierda en sí, pero necesitamos su jacobiano, para el cual la ecuación anterior no proporciona una solución única. Sin embargo, podemos imponer una solución única para el jacobiano eligiendo la inversa izquierda como:rincógnita:RnorteRmetro{\displaystyle r_{\mathbf {x} }:\mathbb {R} ^{n}\to \mathbb {R} ^{m}}:

rincógnita(z)=rincógnita(π(z)),con jacobita:Rincógnita=Tincógnita{\displaystyle r_{\mathbf {x} }(\mathbf {z} )=r_{\mathbf {x} }^{*}(\pi (\mathbf {z} ))\,,{\text{with Jacobian:}}\,\mathbf {R_{x}} =\mathbf {T} _{\mathbf {x} }'}

Ahora por fin podemos conectarmiincógnita=Tincógnita{\displaystyle \mathbf {E_{x}} =\mathbf {T_{x}} }yRy=Ty{\displaystyle \mathbf {R_{y}} =\mathbf {T} _{\mathbf {y} }'}en nuestra expresión anterior paraRF{\displaystyle R_{f}}, la razón de volumen diferencial , que debido a los jacobianos ortonormales, se simplifica a: [ 28 ]

RF(incógnita)=|det(TyFincógnitaTincógnita)|{\displaystyle R_{f}(\mathbf {x} )=\left|\operatorname {det} (\mathbf {T_{y}} '\mathbf {F_{x}T_{x}} )\right|}

Implementación práctica

Para aprender los parámetros de una transformación de flujo de variedad, necesitamos acceso a la relación de volumen diferencial,RF{\displaystyle R_{f}}, o al menos a su gradiente con respecto a los parámetros. Además, para algunas tareas de inferencia, necesitamos acceso aRF{\displaystyle R_{f}}en sí mismo. Las soluciones prácticas incluyen:

  • Sorrenson et al. (2023) [ 22 ] dan una solución para la aproximación estocástica eficiente del gradiente de parámetros computacionalmente pararegistroRF.{\displaystyle \log R_{f}.}
  • Para algunas transformaciones de flujo diseñadas a mano,RF{\displaystyle R_{f}}Pueden derivarse analíticamente en forma cerrada, por ejemplo, las transformaciones de calibración simplex mencionadas anteriormente. Más adelante, en la sección sobre flujos esféricos simples, se ofrecen otros ejemplos.
  • En una plataforma de software equipada con álgebra lineal y diferenciación automática ,RF(incógnita)=|det(TyFincógnitaTincógnita)|{\displaystyle R_{f}(\mathbf {x} )=\left|\operatorname {det} (\mathbf {T_{y}} '\mathbf {F_{x}T_{x}} )\right|}puede evaluarse automáticamente, dado el acceso a soloincógnita,F,π{\displaystyle \mathbf {x} ,f,\pi }. [ 29 ] Pero esto es costoso para datos de alta dimensión, con al menosO(norte3){\displaystyle {\mathcal {O}}(n^{3})}costos computacionales. Aun así, la lenta solución automática puede ser invaluable como herramienta para verificar numéricamente soluciones analíticas diseñadas manualmente.

Flujos esféricos simples

En la literatura sobre aprendizaje automático, se pueden encontrar diversos flujos esféricos complejos formados por arquitecturas de redes neuronales profundas. [ 22 ] En contraste, esta sección recopila de la literatura estadística los detalles de tres transformaciones de flujo esférico muy simples, con expresiones simples de forma cerrada para inversas y razones de volumen diferenciales. Estos flujos se pueden usar individualmente o encadenados para generalizar distribuciones en la esfera unitaria,Snorte1{\displaystyle \mathbb {S} ^{n-1}}Los tres flujos son composiciones de una transformación afín invertible enRnorte{\displaystyle \mathbb {R} ^{n}}, seguido de una proyección radial de vuelta sobre la esfera. Los tipos que consideramos para la transformación afín son: traslación pura, lineal pura y afín general. Para que estos flujos sean totalmente funcionales para el aprendizaje, la inferencia y el muestreo, las tareas son:

  • Para derivar la transformada inversa, con las restricciones adecuadas sobre los parámetros para garantizar la invertibilidad.
  • Para derivar en forma cerrada simple la relación de volumen diferencial ,RF{\displaystyle R_{f}}.

Una propiedad interesante de estos flujos esféricos simples es que no utilizan ninguna no linealidad aparte de la proyección radial. Incluso el más simple de ellos, el flujo de traslación normalizado, puede encadenarse para formar distribuciones sorprendentemente flexibles.

Flujo de traslación normalizado

El flujo de traslación normalizado,Ftrans:Snorte1Snorte1{\displaystyle f_{\text{trans}}:\mathbb {S} ^{n-1}\to \mathbb {S} ^{n-1}}, con parámetrodoRnorte{\displaystyle \mathbf {c} \in \mathbb {R} ^{n}}, viene dado por:

y=Ftrans(incógnita;do)=incógnita+doincógnita+do,dóndedo<1{\displaystyle \mathbf {y} =f_{\text{trans}}(\mathbf {x} ;\mathbf {c} )={\frac {\mathbf {x} +\mathbf {c} }{\lVert \mathbf {x} +\mathbf {c} \rVert }}\,,\;{\text{donde}}\;\lVert \mathbf {c} \rVert <1}

La función inversa puede derivarse considerando, para>0{\displaystyle \ell >0}:y=1(incógnita+do){\displaystyle \mathbf {y} =\ell ^{-1}(\mathbf {x} +\mathbf {c} )}y luego usandoincógnitaincógnita=1{\displaystyle \mathbf {x} '\mathbf {x} =1}para obtener una ecuación cuadrática para recuperar{\displaystyle \ell }, lo que da como resultado:

incógnita=Ftrans1(y;do)=ydo,dónde=ydo+(ydo)2+1dodo{\displaystyle \mathbf {x} =f_{\text{trans}}^{-1}(\mathbf {y} ;\mathbf {c} )=\ell \mathbf {y} -\mathbf {c} \,,{\text{donde}}\;\ell =\mathbf {y} '\mathbf {c} +{\sqrt {(\mathbf {y} '\mathbf {c} )^{2}+1-\mathbf {c} '\mathbf {c} }}}

de lo cual vemos que necesitamosdo<1{\displaystyle \lVert \mathbf {c} \rVert <1}para mantener{\displaystyle \ell }real y positivo para todosySnorte1{\displaystyle \mathbf {y} \in \mathbb {S} ^{n-1}}. La relación de volumen diferencial viene dada (sin derivación) por Boulerice y Ducharme (1994) como: [ 30 ]

Rtrans(incógnita;do)=1+incógnitadoincógnita+donorte{\displaystyle R_{\text{trans}}(\mathbf {x} ;\mathbf {c} )={\frac {1+\mathbf {x} '\mathbf {c} }{\lVert \mathbf {x} +\mathbf {c} \rVert ^{n}}}}

Esto, en efecto, puede verificarse analíticamente:

  • Mediante una laboriosa manipulación deRF(incógnita)=|det(TyFincógnitaTincógnita)|{\displaystyle R_{f}(\mathbf {x} )=\left|\operatorname {det} (\mathbf {T_{y}} '\mathbf {F_{x}T_{x}} )\right|}.
  • Al establecerMETRO=Inorte{\displaystyle \mathbf {M} =\mathbf {I} _{n}}enRaf(incógnita;METRO,do){\displaystyle R_{\text{aff}}(\mathbf {x} ;\mathbf {M} ,\mathbf {c} )} , que se da a continuación.

Finalmente, cabe destacar queFtrans{\displaystyle f_{\text{trans}}}yFtrans1{\displaystyle f_{\text{trans}}^{-1}}no tienen la misma forma funcional.

Flujo lineal normalizado

El flujo lineal normalizado,Flin:Snorte1Snorte1{\displaystyle f_{\text{lin}}:\mathbb {S} ^{n-1}\to \mathbb {S} ^{n-1}}, donde parámetroMETRO{\displaystyle \mathbf {M} }es un invertiblenorte-por-norte{\displaystyle n{\text{-by-}}n}La matriz viene dada por:

y=Flin(incógnita;METRO)=METROincógnitaMETROincógnitaincógnita=Flin1(y;METRO)=Flin(y;METRO1)=METRO1yMETRO1y{\displaystyle \mathbf {y} =f_{\text{lin}}(\mathbf {x} ;\mathbf {M} )={\frac {\mathbf {Mx} }{\lVert \mathbf {Mx} \rVert }}\;\iff \;\mathbf {x} =f_{\text{lin}}^{-1}(\mathbf {y}  ;\mathbf {M} )=f_{\text{lin}}(\mathbf {y}  ;\mathbf {M} ^{-1})={\frac {\mathbf {M^{-1}y} }{\lVert \mathbf {M^{-1}y} \rVert }}}

La relación de volumen diferencial es:

Rlin(incógnita;METRO)=|detMETRO|METROincógnitanorte{\displaystyle R_{\text{lin}}(\mathbf {x} ;\mathbf {M} )={\frac {\left|\operatorname {det} \mathbf {M} \right|}{\lVert \mathbf {Mx} \rVert ^{n}}}}

Este resultado puede derivarse indirectamente mediante la distribución gaussiana central angular (ACG) [ 31 ] , que se obtiene mediante una transformación lineal normalizada de variables aleatorias gaussianas o esféricas uniformes. La primera relación permite derivar la densidad ACG mediante una integral de marginalización sobre el radio; posteriormente, la segunda relación permite factorizar la relación de volumen diferencial. Para más detalles, consulte la distribución ACG .

flujo afín normalizado

El flujo afín normalizado,Faf:Snorte1Snorte1{\displaystyle f_{\text{aff}}:\mathbb {S} ^{n-1}\to \mathbb {S} ^{n-1}}, con parámetrosdoRnorte{\displaystyle \mathbf {c} \in \mathbb {R} ^{n}}yMETRO{\displaystyle \mathbf {M} },norte-por-norte{\displaystyle n{\text{-by-}}n}invertible, viene dada por:

Faf(incógnita;METRO,do)=METROincógnita+doMETROincógnita+do,dóndeMETRO1do<1{\displaystyle f_{\text{aff}}(\mathbf {x} ;\mathbf {M} ,\mathbf {c} )={\frac {\mathbf {Mx} +\mathbf {c} }{\lVert \mathbf {Mx} +\mathbf {c} \rVert }}\,,\;{\text{donde}}\;\lVert \mathbf {M^{-1}c} \rVert <1}

La función inversa, derivada de forma similar a la inversa de la traslación normalizada, es:

incógnita=Faf1(y;METRO,do)=METRO1(ydo),dónde=yWdo+(yWdo)2+yWy(1doWdo)yWy{\displaystyle \mathbf {x} =f_{\text{aff}}^{-1}(\mathbf {y} ;\mathbf {M} ,\mathbf {c} )=\mathbf {M} ^{-1}(\ell \mathbf {y} -\mathbf {c} )\,,{\text{donde}}\;\ell ={\frac {\mathbf {y} '\mathbf {Wc} +{\sqrt {(\mathbf {y} '\mathbf {Wc} )^{2}+\mathbf {y} '\mathbf {Wy} (1-\mathbf {c} '\mathbf {Wc} )}}}{\mathbf {y} '\mathbf {Wy} }}}

dóndeW=(METROMETRO)1{\displaystyle \mathbf {W} =(\mathbf {MM} ')^{-1}}La relación de volumen diferencial es:

Raf(incógnita;METRO,do)=Rlin(incógnita;METRO+doincógnita)=|detMETRO|(1+incógnitaMETRO1do)METROincógnita+donorte{\displaystyle R_{\text{aff}}(\mathbf {x} ;\mathbf {M} ,\mathbf {c} )=R_{\text{lin}}(\mathbf {x}  ;\mathbf {M} +\mathbf {c} \mathbf {x} ')={\frac {\left|\operatorname {det} \mathbf {M} \right|(1+\mathbf {x} '\mathbf {M^{-1}c} )}{\lVert \mathbf {Mx+c} \rVert ^{n}}}}

El numerador final del lado derecho se amplió desdedet(METRO+doincógnita){\displaystyle \operatorname {det} (\mathbf {M} +\mathbf {cx} ')}por el lema del determinante de la matriz . RecordandoRF(incógnita)=|det(TyFincógnitaTincógnita)|{\displaystyle R_{f}(\mathbf {x} )=\left|\operatorname {det} (\mathbf {T} _{\mathbf {y} }'\mathbf {F_{x}T_{x}} )\right|}, la igualdad entreRaf{\displaystyle R_{\text{aff}}}yRlin{\displaystyle R_{\text{lin}}}se sostiene porque no solo:

incógnitaincógnita=1y=Faf(incógnita;METRO,do)=Flin(incógnita;METRO+doincógnita){\displaystyle \mathbf {x} '\mathbf {x} =1\;\Longrightarrow \;\mathbf {y} =f_{\text{aff}}(\mathbf {x} ;\mathbf {M,c} )=f_{\text{lin}}(\mathbf {x}  ;\mathbf {M+cx} ')}

pero también, por ortogonalidad deincógnita{\displaystyle \mathbf {x} }al espacio tangente local:

incógnitaTincógnita=0FincógnitaafTincógnita=FincógnitalinTincógnita{\displaystyle \mathbf {x} '\mathbf {T_{x}} ={\boldsymbol {0}}\;\Longrightarrow \;\mathbf {F} _{\mathbf {x} }^{\text{aff}}\mathbf {T_{x}} =\mathbf {F} _{\mathbf {x} }^{\text{lin}}\mathbf {T_{x}} }

dóndeFincógnitalin=METROincógnita+do1(Inorteyy)(METRO+doincógnita){\displaystyle \mathbf {F} _{\mathbf {x} }^{\text{lin}}=\lVert \mathbf {Mx} +\mathbf {c} \rVert ^{-1}(\mathbf {I} _{n}-\mathbf {yy} ')(\mathbf {M+cx} ')}es el jacobiano deFlin{\displaystyle f_{\text{lin}}}diferenciado con respecto a su entrada, pero no también con respecto a su parámetro.

Desventajas

A pesar del éxito de los flujos normalizadores en la estimación de densidades de alta dimensión, aún existen algunas desventajas en su diseño. En primer lugar, su espacio latente sobre el que se proyectan los datos de entrada no es un espacio de menor dimensión y, por lo tanto, los modelos basados ​​en flujos no permiten la compresión de datos por defecto y requieren mucha computación. Sin embargo, aún es posible realizar compresión de imágenes con ellos. [ 32 ]

Los modelos basados ​​en flujo también son conocidos por fallar en la estimación de la probabilidad de muestras fuera de distribución (es decir, muestras que no fueron extraídas de la misma distribución que el conjunto de entrenamiento). [ 33 ] Se formularon algunas hipótesis para explicar este fenómeno, entre las cuales la hipótesis del conjunto típico , [ 34 ] problemas de estimación al entrenar modelos, [ 35 ] o problemas fundamentales debido a la entropía de las distribuciones de datos. [ 36 ]

Una de las propiedades más interesantes de los flujos normalizadores es la invertibilidad de su mapa biyectivo aprendido . Esta propiedad viene dada por las restricciones en el diseño de los modelos (cf.: RealNVP, Glow) que garantizan la invertibilidad teórica. La integridad de la inversa es importante para asegurar la aplicabilidad del teorema de cambio de variable , el cálculo del jacobiano del mapa, así como el muestreo con el modelo. Sin embargo, en la práctica esta invertibilidad se viola y el mapa inverso diverge debido a la imprecisión numérica. [ 37 ]

Aplicaciones

Los modelos generativos basados ​​en flujo se han aplicado a diversas tareas de modelado, entre las que se incluyen:

  • Generación de audio [ 38 ]
  • Generación de imágenes [ 8 ]
  • Generación de grafos moleculares [ 39 ]
  • Modelado de nube de puntos [ 40 ]
  • Generación de vídeo [ 41 ]
  • Compresión de imágenes con pérdida [ 32 ]
  • Detección de anomalías [ 42 ]

Referencias

  1. Tabak, Esteban G.; Vanden-Eijnden, Eric (2010). "Estimación de densidad mediante ascenso dual de la log-verosimilitud" . Communications in Mathematical Sciences . 8 (1): 217– 233. doi : 10.4310/CMS.2010.v8.n1.a11 .
  2. Tabak, Esteban G.; Turner, Cristina V. (2012). "Una familia de algoritmos de estimación de densidad no paramétricos" . Communications on Pure and Applied Mathematics . 66 (2): 145– 164. doi : 10.1002/cpa.21423 . hdl : 11336/8930 . S2CID 17820269 . 
  3. Papamakarios, George; Nalisnick, Eric; Jimenez Rezende, Danilo; Mohamed, Shakir; Bakshminarayanan, Balaji (2021). "Normalizing flows for probabilistic modeling and inference" . Journal of Machine Learning Research . 22 (1): 2617– 2680. arXiv : 1912.02762 .
  4. Bell, AJ; Sejnowski, TJ (1995). " Un enfoque de maximización de la información para la separación ciega y la deconvolución ciega ". Neural Computation . **7** (6): 1129–1159. doi:10.1162/neco.1995.7.6.1129.
  5. Roth, Z.; Baram, Y. (1996). " Conformación de densidad multidimensional mediante sigmoides ". IEEE Transactions on Neural Networks . **7** (5): 1291–1298. doi:10.1109/72.536322.
  6. 1 2 Dinh, Laurent; Krueger, David; Bengio, Yoshua (2014). "NICE: Estimación de componentes independientes no lineales". arXiv : 1410.8516 [ cs.LG ].
  7. 1 2 Dinh, Laurent; Sohl-Dickstein, Jascha; Bengio, Samy (2016). "Estimación de densidad utilizando Real NVP". arXiv : 1605.08803 [ cs.LG ].
  8. 1 2 3 Kingma, Diederik P.; Dhariwal, Prafulla (2018). "Glow: Flujo generativo con convoluciones 1x1 invertibles". arXiv : 1807.03039 [ stat.ML ].
  9. Papamakarios, George; Nalisnick, Eric; Rezende, Danilo Jimenez; Shakir, Mohamed; Balaji, Lakshminarayanan (marzo de 2021). "Normalizing Flows for Probabilistic Modeling and Inference" . Journal of Machine Learning Research . 22 (57): 1– 64. arXiv : 1912.02762 .
  10. Kobyzev, Ivan; Prince, Simon JD; Brubaker, Marcus A. (noviembre de 2021). "Normalizing Flows: An Introduction and Review of Current Methods". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (11): 3964– 3979. arXiv : 1908.09257 . Bibcode : 2021ITPAM..43.3964K . doi : 10.1109/TPAMI.2020.2992934 . ISSN 1939-3539 . PMID 32396070 . S2CID 208910764 .   
  11. Danilo Jimenez Rezende; Mohamed, Shakir (2015). "Inferencia variacional con flujos normalizadores". arXiv : 1505.05770 [ stat.ML ].
  12. Papamakarios, George; Pavlakou, Theo; Murray, Iain (2017). "Flujo autorregresivo enmascarado para la estimación de densidad" . Advances in Neural Information Processing Systems . 30. Curran Associates, Inc. arXiv : 1705.07057 .
  13. Kingma, Durk P; Salimans, Tim; Jozefowicz, Rafal; Chen, Xi; Sutskever, Ilya; Welling, Max (2016). "Inferencia variacional mejorada con flujo autorregresivo inverso" . Advances in Neural Information Processing Systems . 29. Curran Associates, Inc. arXiv : 1606.04934 .
  14. 1 2 3 Grathwohl, Will; Chen, Ricky TQ; Bettencourt, Jesse; Sutskever, Ilya; Duvenaud, David (2018). "FFJORD: Dinámica continua de forma libre para modelos generativos reversibles escalables". arXiv : 1810.01367 [ cs.LG ].
  15. Lipman, Yaron; Chen, Ricky TQ; Ben-Hamu, Heli; Nickel, Maximilian; Le, Matt (2022-10-01). "Flow Matching for Generative Modeling". arXiv : 2210.02747 [ cs.LG ].
  16. Grathwohl, Will; Chen, Ricky TQ; Bettencourt, Jesse; Sutskever, Ilya; Duvenaud, David (22 de octubre de 2018). "FFJORD: Dinámica continua de forma libre para modelos generativos reversibles escalables". arXiv : 1810.01367 [ cs.LG ].
  17. 1 2 Finlay, Chris; Jacobsen, Joern-Henrik; Nurbekyan, Levon; Oberman, Adam (2020-11-21). "Cómo entrenar su ODE neuronal: el mundo de la regularización jacobiana y cinética" . Conferencia internacional sobre aprendizaje automático . PMLR: 3154–3164 . arXiv : 2002.02798 .
  18. Hutchinson, MF (enero de 1989). "Un estimador estocástico de la traza de la matriz de influencia para splines de suavizado laplaciano" . Communications in Statistics - Simulation and Computation . 18 (3): 1059– 1076. doi : 10.1080/03610918908812806 . ISSN 0361-0918 . 
  19. Chen, Ricky TQ; Rubanova, Yulia; Bettencourt, Jesse; Duvenaud, David K. (2018). "Ecuaciones diferenciales ordinarias neuronales" (PDF) . En Bengio, S.; Wallach, H.; Larochelle, H.; Grauman, K.; Cesa-Bianchi, N.; Garnett, R. (eds.). Avances en sistemas de procesamiento de información neuronal . Vol. 31. Curran Associates, Inc. arXiv : 1806.07366 . 
  20. Dupont, Emilien; Doucet, Arnaud; Teh, Yee Whye (2019). "Ecuaciones diferenciales ordinarias neuronales aumentadas" . Avances en sistemas de procesamiento de información neuronal . 32. Curran Associates, Inc.
  21. Zhang, Han; Gao, Xi; Unterman, Jacob; Arodz, Tom (2019-07-30). "Capacidades de aproximación de EDO neuronales y redes residuales invertibles". arXiv : 1907.12998 [ cs.LG ].
  22. 1 2 3 4 Sorrenson, Peter; Draxler, Felix; Rousselot, Armand; Hummerich, Sander; Köthe, Ullrich (2023). "Learning Distributions on Manifolds with Free-Form Flows". arXiv : 2312.09852 [ cs.LG ].
  23. Brümmer, Niko; van Leeuwen, DA (2006). "Sobre la calibración de puntuaciones de reconocimiento de lenguaje". Actas de IEEE Odyssey: Taller de reconocimiento de hablantes y lenguaje . San Juan, Puerto Rico. pp. 1– 8. doi : 10.1109/ODYSSEY.2006.248106 . 
  24. Ferrer, Luciana; Ramos, Daniel (2024). "Evaluación de probabilidades posteriores: teoría de la decisión, reglas de puntuación adecuadas y calibración". arXiv : 2408.02841 [ stat.ML ].
  25. Graf, Monique (2019). "La distribución Beta generalizada simplicial: paquete R SGB y aplicaciones" . Libra . Recuperado el 26 de mayo de 2025 .{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace )
  26. Brümmer, Niko (18 de octubre de 2010). Medición, refinamiento y calibración de la información del hablante y del idioma extraída del habla (tesis doctoral). Stellenbosch, Sudáfrica: Departamento de Ingeniería Eléctrica y Electrónica, Universidad de Stellenbosch.
  27. Meelis Kull, Miquel Perelló‑Nieto, Markus Kängsepp, Telmo Silva Filho, Hao Song, Peter A. Flach (28 de octubre de 2019). "Más allá del escalado de temperatura: obtención de probabilidades multiclase bien calibradas con calibración de Dirichlet". arXiv : 1910.12656 [ cs.LG ].{{cite arXiv}}: CS1 maint: varios nombres: lista de autores ( enlace )
  28. Las matrices tangentes no son únicas: siT{\displaystyle \mathbf {T} }tiene columnas ortonormales yQ{\displaystyle \mathbf {Q} }es una matriz ortogonal , entoncesTQ{\displaystyle \mathbf {TQ} }también tiene columnas ortonormales que abarcan el mismo subespacio; es fácil verificar que|det(TyFincógnitaTincógnita)|{\displaystyle \left|\operatorname {det} (\mathbf {T_{y}} '\mathbf {F_{x}T_{x}} )\right|}es invariante a tales transformaciones de los representantes tangentes.
  29. Con PyTorch :
    from torch.linalg import qr from torch.func import jacrev def logRf(pi, m, f, x): y = f(x) Fx, PI = jacrev(f)(x), jacrev(pi) Tx, Ty = [qr(PI(z)).Q[:,:m] para z en (x,y)] devolver (Ty.T @ Fx @ Tx).slogdet().logabsdet 
  30. Boulerice, Bernard; Ducharme, Gilles R. (1994). "Datos direccionales descentrados". Anales del Instituto de Matemáticas Estadísticas . 46 (3): 573– 586. doi : 10.1007/BF00773518 .
  31. Tyler, David E (1987). "Análisis estadístico para la distribución gaussiana central angular en la esfera". Biometrika . 74 (3): 579– 589. doi : 10.2307/2336697 . JSTOR 2336697 . 
  32. ^ Helminger , Leonhard; Djelouah, Abdelaziz; Bruto, Markus; Schroers, Christopher (2020). "Compresión de imágenes con pérdida con flujos de normalización". arXiv : 2008.10486 [ cs.CV ].
  33. Nalisnick, Eric; Matsukawa, Teh; Zhao, Yee Whye; Song, Zhao (2018). "¿Saben los modelos generativos profundos lo que no saben?". arXiv : 1810.09136v3 [ stat.ML ].
  34. Nalisnick, Eric; Matsukawa, Teh; Zhao, Yee Whye; Song, Zhao (2019). "Detección de entradas fuera de distribución para modelos generativos profundos mediante tipicidad". arXiv : 1906.02994 [ stat.ML ].
  35. Zhang, Lily; Goldstein, Mark; Ranganath, Rajesh (2021). " Understanding Failures in Out-of-Distribution Detection with Deep Generative Models" . Proceedings of Machine Learning Research . 139 : 12427–12436 . PMC 9295254. PMID 35860036 .  
  36. Caterini, Anthony L.; Loaiza-Ganem, Gabriel (2022). "Problemas entrópicos en la detección de OOD basada en verosimilitud". pp. 21– 26. arXiv : 2109.10794 [ stat.ML ]. 
  37. Behrmann, Jens; Vicol, Pablo; Wang, Kuan-Chieh; Grosse, Roger; Jacobsen, Jörn-Henrik (2020). "Comprensión y mitigación de explosiones inversas en redes neuronales invertibles". arXiv : 2006.09347 [ cs.LG ].
  38. ^ Ping, Wei; Peng, Kainan; Gorur, Dilan; Lakshminarayanan, Balaji (2019). "WaveFlow: un modelo compacto basado en flujo para audio sin formato". arXiv : 1912.01219 [ cs.SD ].
  39. ^ Shi, Chence; Xu, Minkai; Zhu, Zhaocheng; Zhang, Weinan; Zhang, Ming; Tang, Jian (2020). "GraphAF: un modelo autorregresivo basado en flujo para la generación de gráficos moleculares". arXiv : 2001.09382 [ cs.LG ].
  40. Yang, Guandao; Huang, Xun; Hao, Zekun; Liu, Ming-Yu; Belongie, Serge; Hariharan, Bharath (2019). "PointFlow: Generación de nubes de puntos 3D con flujos de normalización continuos". arXiv : 1906.12320 [ cs.CV ].
  41. Kumar, Manoj; Babaeizadeh, Mohammad; Erhan, Dumitru; Finn, Chelsea ; Levine, Sergey ; Dinh, Laurent; Kingma, Durk (2019). "VideoFlow: Un modelo condicional basado en flujo para la generación estocástica de vídeo". arXiv : 1903.01434 [ cs.CV ].
  42. Rudolph, Marco; Wandt, Bastian; Rosenhahn, Bodo (2021). "Same Same But DifferNet: Detección de defectos semisupervisada con flujos normalizadores". arXiv : 2008.12577 [ cs.CV ].
  • Modelos generativos profundos basados ​​en flujo
  • Modelos de flujo normalizados