Articulo de referencia

Distancia de inicio de Fréchet

La distancia de inicio de Fréchet (FID) es una métrica utilizada para evaluar la calidad de las imágenes creadas por un modelo generativo , como una red generativa antagónica (G...

La distancia de inicio de Fréchet (FID) es una métrica utilizada para evaluar la calidad de las imágenes creadas por un modelo generativo , como una red generativa antagónica (GAN) [ 1 ] o un modelo de difusión . [ 2 ] [ 3 ]

La distancia de Fréchet-Inception (FID) compara la distribución de las imágenes generadas con la distribución de un conjunto de imágenes reales (un conjunto de referencia). En lugar de comparar imágenes individuales, se comparan las estadísticas de media y covarianza de muchas imágenes generadas por el modelo con las mismas estadísticas generadas a partir de las imágenes del conjunto de referencia. Se utiliza una red neuronal convolucional, como una arquitectura Inception , para producir características de nivel superior que describen las imágenes, de ahí el nombre de distancia de Fréchet- Inception .

El FID se inspira en la métrica anterior de puntuación de inicio (IS), que evalúa únicamente la distribución de las imágenes generadas. [ 1 ] La métrica FID no reemplaza a la métrica IS; los clasificadores que alcanzan la mejor (más baja) puntuación FID tienden a tener una mayor variedad de muestras, mientras que los clasificadores que alcanzan la mejor (más alta) puntuación IS tienden a tener una mejor calidad dentro de las imágenes individuales. [ 2 ]

La métrica FID se introdujo en 2017, [ 1 ] y es la métrica estándar actual para evaluar la calidad de los modelos que generan imágenes sintéticas a partir de 2024. Se ha utilizado para medir la calidad de muchos modelos recientes, incluidas las redes de alta resolución StyleGAN1 [ 4 ] y StyleGAN2 [ 5 ] , y los modelos de difusión. [ 2 ] [ 3 ]

El FID intenta comparar imágenes visualmente a través de capas profundas de una red Inception. Trabajos más recientes van más allá al comparar las incrustaciones CLIP de las imágenes. [ 6 ] [ 7 ]

Descripción general

El objetivo del índice FID es medir la diversidad de imágenes creadas por un modelo generativo con imágenes de un conjunto de datos de referencia. Este conjunto de datos de referencia podría ser ImageNet o COCO-2014. [ 3 ] [ 8 ] Es importante utilizar un conjunto de datos extenso como referencia, ya que el conjunto de imágenes de referencia debe representar la diversidad total de imágenes que el modelo intenta crear.

Los modelos generativos, como los modelos de difusión, producen imágenes novedosas que tienen características del conjunto de referencia, pero que son bastante diferentes de cualquier imagen del conjunto de entrenamiento. Por lo tanto, la calidad de estos modelos no se puede evaluar simplemente comparando cada imagen con una imagen del conjunto de entrenamiento píxel a píxel, como se hace, por ejemplo, con la norma L2 .

En cambio, el FID modela los dos conjuntos de imágenes como si se hubieran extraído de dos distribuciones gaussianas multidimensionales.norte(μ,Σ){\displaystyle {\mathcal {N}}(\mu,\Sigma)}ynorte(μ,Σ){\displaystyle {\mathcal {N}}(\mu ',\Sigma ')}La distancia entre las dos distribuciones se calcula como la distancia de Wasserstein 2 entre las dos distribuciones gaussianas.

En lugar de comparar directamente las imágenes píxel a píxel (por ejemplo, como lo hace la norma L2 ), el FID compara la media y la desviación estándar de la capa más profunda en Inception v3 (el vector de activación de 2048 dimensiones de su última capa de agrupación ). Estas capas están más cerca de los nodos de salida que corresponden a objetos del mundo real, como una raza específica de perro o un avión, y más lejos de las capas superficiales cercanas a la imagen de entrada. Por lo tanto, el FID compara con qué frecuencia se encuentran las mismas características de alto nivel dentro de los dos conjuntos de imágenes. Después de que cada imagen se ha procesado a través de la arquitectura Inception, las medias y covarianzas de la activación de la última capa en los dos conjuntos de datos se comparan con la distanciadF(norte(μ,Σ),norte(μ,Σ))2=μμ22+tr(Σ+Σ2(ΣΣ)12){\displaystyle d_{F}({\mathcal {N}}(\mu ,\Sigma ),{\mathcal {N}}(\mu ',\Sigma '))^{2}=\lVert \mu -\mu '\rVert _{2}^{2}+\operatorname {tr} \left(\Sigma +\Sigma '-2\left(\Sigma \Sigma '\right)^{\frac {1}{2}}\right)}Las distancias mayores indican un modelo generativo de menor calidad. Una puntuación de 0 indica un modelo perfecto.

Definición formal

Para cualesquiera dos distribuciones de probabilidadμ,ν{\displaystyle \mu ,\nu }encimaRnorte{\displaystyle \mathbb {R} ^{n}}Al tener media y varianza finitas, su distancia de Fréchet es [ 9 ].dF(μ,ν):=(infγΓ(μ,ν)Rnorte×Rnorteincógnitay2dγ(incógnita,y))1/2,{\displaystyle d_{F}(\mu ,\nu ):=\left(\inf _{\gamma \in \Gamma (\mu ,\nu )}\int _{\mathbb {R} ^{n}\times \mathbb {R} ^{n}}\|xy\|^{2}\,\mathrm {d} \gamma (x,y)\right)^{1/2},}dóndeΓ(μ,ν){\displaystyle \Gamma (\mu,\nu)}es el conjunto de todas las medidas enRnorte×Rnorte{\displaystyle \mathbb {R} ^{n}\times \mathbb {R} ^{n}}con márgenesμ{\displaystyle \mu }yν{\displaystyle \nu }en el primer y segundo factor respectivamente. (El conjuntoΓ(μ,ν){\displaystyle \Gamma (\mu,\nu)}también se le llama el conjunto de todos los acoplamientos deμ{\displaystyle \mu }yν{\displaystyle \nu }.).

Para dos distribuciones gaussianas multidimensionalesnorte(μ,Σ){\displaystyle {\mathcal {N}}(\mu,\Sigma)}ynorte(μ,Σ){\displaystyle {\mathcal {N}}(\mu ',\Sigma ')}, se expresa en forma cerrada como [ 10 ]dF(norte(μ,Σ),norte(μ,Σ))2=μμ22+tr(Σ+Σ2(ΣΣ)12){\displaystyle d_{F}({\mathcal {N}}(\mu ,\Sigma ),{\mathcal {N}}(\mu ',\Sigma '))^{2}=\lVert \mu -\mu '\rVert _{2}^{2}+\operatorname {tr} \left(\Sigma +\Sigma '-2\left(\Sigma \Sigma '\right)^{\frac {1}{2}}\right)}Esto nos permite definir el FID en forma de pseudocódigo :

INTRODUZCA una funciónF:ΩincógnitaRnorte{\displaystyle f:\Omega _{X}\to \mathbb {R} ^{n}}.

INTRODUZCA dos conjuntos de datosS,SΩincógnita{\displaystyle S,S'\subset \Omega _{X}}.

CalcularF(S),F(S)Rnorte{\displaystyle f(S),f(S')\subset \mathbb {R} ^{n}}.

Ajustar dos distribuciones gaussianasnorte(μ,Σ),norte(μ,Σ){\displaystyle {\mathcal {N}}(\mu ,\Sigma ),{\mathcal {N}}(\mu ',\Sigma ')}, respectivamente paraF(S),F(S){\displaystyle f(S),f(S')}.

DEVOLVERdF(norte(μ,Σ),norte(μ,Σ))2{\displaystyle d_{F}({\mathcal {N}}(\mu ,\Sigma ),{\mathcal {N}}(\mu ',\Sigma '))^{2}}.

En la mayoría de los usos prácticos del FID,Ωincógnita{\displaystyle \Omega _{X}}es el espacio de las imágenes, yF{\displaystyle f}es un modelo Inception v3 entrenado en ImageNet , pero sin su capa de clasificación final. Técnicamente, es el vector de activación de 2048 dimensiones de su última capa de agrupación . De los dos conjuntos de datosS,S{\displaystyle S,S'}, uno de ellos es un conjunto de datos de referencia, que podría ser ImageNet en sí mismo, y el otro es un conjunto de imágenes generadas por un modelo generativo , como GAN , o un modelo de difusión . [ 1 ]

Variantes

Se han sugerido variantes especializadas de FID como métrica de evaluación para algoritmos de mejora musical como Fréchet Audio Distance (FAD) , [ 11 ] para modelos generativos de vídeo como Fréchet Video Distance (FVD) , [ 12 ] y para moléculas generadas por IA como Fréchet ChemNet Distance (FCD) . [ 13 ]

Limitaciones

Chong y Forsyth [ 14 ] demostraron que el FID presenta un sesgo estadístico, en el sentido de que su valor esperado sobre un conjunto finito de datos no coincide con su valor real. Además, dado que el FID mide la distancia de Wasserstein hacia la distribución de referencia, resulta inadecuado para evaluar la calidad de los generadores en configuraciones de adaptación de dominio o en la generación de cero disparos. Finalmente, si bien el FID es más consistente con el juicio humano que la puntuación Inception utilizada anteriormente, existen casos en los que el FID es inconsistente con dicho juicio. [ 15 ] En Liu et al., el FID calificó la pixelación o el intercambio de parches de imágenes con mayor puntuación que la adición de ruido aleatorio, [ 15 ] : 10 y podría incrementarse mediante ruido adversario . [ 15 ] : 14

Referencias

  1. 1 2 3 4 Heusel, Martin; Ramsauer, Hubert; Unterthiner, Thomas; Nessler, Bernhard; Hochreiter, Sepp (2017). "GANs entrenadas mediante una regla de actualización de dos escalas de tiempo convergen a un equilibrio de Nash local" . Advances in Neural Information Processing Systems . 30. arXiv : 1706.08500 .
  2. 1 2 3 Ho, Jonathan; Salimans, Tim (2022). "Guía de difusión sin clasificadores". arXiv : 2207.12598 [ cs.LG ].
  3. 1 2 3 Esser, Patrick; Kulal, Sumith; Blattmann, Andreas; Entezari, Rahim; Müller, Jonas; Saini, Harry; Levi, Yam; Lorenz, Dominik; Sauer, Axel (2024-03-05). "Escalado de transformadores de flujo rectificados para síntesis de imágenes de alta resolución". arXiv : 2403.03206 [ cs.CV ].
  4. Karras, Tero; Laine, Samuli; Aila, Timo (2020). "Una arquitectura de generador basada en estilos para redes generativas adversarias". IEEE Transactions on Pattern Analysis and Machine Intelligence . PP (12): 4217– 4228. arXiv : 1812.04948 . doi : 10.1109/TPAMI.2020.2970919 . PMID 32012000. S2CID 211022860 .  
  5. Karras, Tero; Laine, Samuli; Aittala, Miika; Hellsten, Janne; Lehtinen, Jaakko; Aila, Timo (23 de marzo de 2020). "Análisis y mejora de la calidad de imagen de StyleGAN". arXiv : 1912.04958 [ cs.CV ].
  6. ^ Jayasumana, Sadeep; Ramalingam, Srikumar; Veit, Andreas; Glasner, Daniel; Chakrabarti, Ayan; Kumar, Sanjiv (2024). "Repensar la FID: hacia una mejor métrica de evaluación para la generación de imágenes" . Conferencia IEEE/CVF sobre visión por computadora y reconocimiento de patrones, CVPR 2024, Seattle, WA, EE. UU., 16 al 22 de junio de 2024 . IEEE. págs. 9307–9315 . arXiv : 2401.09603 . doi : 10.1109/CVPR52733.2024.00889 . ISBN  979-8-3503-5300-6.
  7. Hessel, Jack; Holtzman, Ari; Forbes, Maxwell; Bras, Ronan Le; Choi, Yejin (2021). "CLIPScore: una métrica de evaluación sin referencia para la generación de subtítulos de imágenes". En Moens, Marie-Francine; Huang, Xuanjing; Specia, Lucia; Yih, Scott Wen-tau (eds.). Actas de la Conferencia de 2021 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural, EMNLP 2021, Evento Virtual / Punta Cana, República Dominicana, 7–11 de noviembre de 2021. Asociación para la Lingüística Computacional. pp. 7514–7528 . arXiv : 2104.08718 . doi : 10.18653 /V1/2021.EMNLP-MAIN.595 . 
  8. Lin, Tsung-Yi; Maire, Michael; Belongie, Serge; Bourdev, Lubomir; Girshick, Ross; Hays, James; Perona, Pietro; Ramanan, Deva; Zitnick, C. Lawrence (2015-02-20). "Microsoft COCO: Objetos comunes en contexto". arXiv : 1405.0312 [ cs.CV ].
  9. Fréchet, M. (1957). "Sur la distance de deux lois de probabilité." ("Sobre la distancia entre dos leyes de probabilidad"). CR Acad. Sci. Paris . 244 : 689–692 . Resumen traducido: El autor indica una expresión explícita de la distancia entre dos leyes de probabilidad, según la primera definición de Paul Lévy. También indica una modificación conveniente de esta definición.
  10. Dowson, D. C; Landau, B. V (1 de septiembre de 1982). "La distancia de Fréchet entre distribuciones normales multivariadas" . Journal of Multivariate Analysis . 12 (3): 450– 455. doi : 10.1016/0047-259X(82)90077-X . ISSN 0047-259X . 
  11. ^ Kilgour, Kevin; Zuluaga, Mauricio; Roblek, Dominik; Sharifi, Mateo (15 de septiembre de 2019). "Distancia de audio Fréchet: una métrica sin referencias para evaluar algoritmos de mejora de la música". Interspeech 2019 : 2350– 2354. doi : 10.21437/Interspeech.2019-2219 . S2CID 202725406 . 
  12. ^ Unterthiner, Thomas; Steenkiste, Sjoerd van; Kurach, Karol; Marinier, Rafael; Michalski, Marcin; Gelly, Sylvain (27 de marzo de 2019). "FVD: Una nueva métrica para la generación de vídeos" . Abrir revisión .
  13. ^ Preuer, Kristina; Renz, Philipp; Unterthiner, Thomas; Hochreiter, Sepp; Klambauer, Günter (24 de septiembre de 2018). "Distancia Fréchet ChemNet: una métrica para modelos generativos de moléculas en el descubrimiento de fármacos". Revista de información y modelado químico . 58 (9): 1736-1741 . arXiv : 1803.09518 . doi : 10.1021/acs.jcim.8b00234 . PMID 30118593 . S2CID 51892387 .  
  14. Chong, Min Jin; Forsyth, David (2020-06-15). "FID y puntuación Inception efectivamente imparciales y dónde encontrarlos". arXiv : 1911.07023 [ cs.CV ].
  15. 1 2 3 Liu, Shaohui; Wei, Yi; Lu, Jiwen; Zhou, Jie (19 de julio de 2018). "Un marco de evaluación mejorado para redes generativas adversas". arXiv : 1803.07474 [ cs.CV ].
Obtenido de " https://en.wikipedia.org/w/index.php?title=Fréchet_inception_distance&oldid=1320465187 "