Articulo de referencia

Puntuación de Inception

El Inception Score (IS) es un algoritmo utilizado para evaluar la calidad de las imágenes creadas por un modelo generativo de imágenes, como una red generativa antagónica (GAN)....

El Inception Score (IS) es un algoritmo utilizado para evaluar la calidad de las imágenes creadas por un modelo generativo de imágenes, como una red generativa antagónica (GAN). [ 1 ] El puntaje se calcula en función de la salida de un modelo de clasificación de imágenes Inception v3 preentrenado e independiente, aplicado a una muestra de (normalmente alrededor de 30 000) imágenes generadas por el modelo generativo. El Inception Score se maximiza cuando se cumplen las siguientes condiciones:

  1. Se minimiza la entropía de la distribución de etiquetas predicha por el modelo Inceptionv3 para las imágenes generadas. En otras palabras, el modelo de clasificación predice con confianza una única etiqueta para cada imagen. Intuitivamente, esto se corresponde con el ideal de que las imágenes generadas sean nítidas y definidas.
  2. Las predicciones del modelo de clasificación se distribuyen uniformemente entre todas las etiquetas posibles. Esto corresponde al requisito de que la salida del modelo generativo sea "diversa". [ 2 ]

Ha sido parcialmente reemplazado por la distancia de inicio de Fréchet relacionada . [ 3 ] Mientras que la puntuación de inicio solo evalúa la distribución de imágenes generadas, la FID compara la distribución de imágenes generadas con la distribución de un conjunto de imágenes reales ("verdad fundamental").

Definición

Supongamos que hay dos espacios, el espacio de las imágenes.Ωincógnita{\displaystyle \Omega _{X}}y el espacio de etiquetasΩY{\displaystyle \Omega _{Y}}El espacio de etiquetas es finito.

Dejarpaggramominorte{\displaystyle p_{gen}}sea ​​una distribución de probabilidad sobreΩincógnita{\displaystyle \Omega _{X}}que deseamos juzgar.

Sea un discriminador una función de tipopagdis:ΩincógnitaMETRO(ΩY){\displaystyle p_{dis}:\Omega _{X}\to M(\Omega _{Y})}dóndeMETRO(ΩY){\displaystyle M(\Omega _{Y})}es el conjunto de todas las distribuciones de probabilidad sobreΩY{\displaystyle \Omega _{Y}}Para cualquier imagenincógnita{\displaystyle x}y cualquier etiquetay{\displaystyle y}, dejarpagdis(y|incógnita){\displaystyle p_{dis}(y|x)}sea ​​la probabilidad de que la imagenincógnita{\displaystyle x}tiene etiquetay{\displaystyle y}, según el discriminador. Normalmente se implementa como una red Inception-v3 entrenada en ImageNet.

La puntuación de Inception depaggramominorte{\displaystyle p_{gen}}relativo apagdis{\displaystyle p_{dis}}esIS(paggramominorte,pagdis):=exp(miincógnitapaggramominorte[DKL(pagdis(|incógnita)pagdis(|incógnita)paggramominorte(incógnita)dincógnita)]){\displaystyle IS(p_{gen},p_{dis}):=\exp \left(\mathbb {E} _{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot |x)\|\int p_{dis}(\cdot |x)p_{gen}(x)dx\right)\right]\right)}Las reescrituras equivalentes incluyen:lnIS(paggramominorte,pagdis):=miincógnitapaggramominorte[DKL(pagdis(|incógnita)miincógnitapaggramominorte[pagdis(|incógnita)])]{\displaystyle \ln IS(p_{gen},p_{dis}):=\mathbb {E} _{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot |x)\|\mathbb {E} _{x\sim p_{gen}}[p_{dis}(\cdot |x)]\right)\right]}lnIS(paggramominorte,pagdis):=H[miincógnitapaggramominorte[pagdis(|incógnita)]]miincógnitapaggramominorte[H[pagdis(|incógnita)]]{\displaystyle \ln IS(p_{gen},p_{dis}):=H[\mathbb {E} _{x\sim p_{gen}}[p_{dis}(\cdot |x)]]-\mathbb {E} _{x\sim p_{gen}}[H[p_{dis}(\cdot |x)]]}lnIS{\displaystyle \ln IS}es no negativo según la desigualdad de Jensen .

Pseudocódigo:

discriminador de ENTRADApagdis{\displaystyle p_{dis}}.

generador de ENTRADAgramo{\displaystyle g}.

Imágenes de muestraincógnitai{\displaystyle x_{i}}del generador.

Calcularpagdis(|incógnitai){\displaystyle p_{dis}(\cdot |x_{i})}, la distribución de probabilidad sobre las etiquetas condicionada a la imagenincógnitai{\displaystyle x_{i}}.

Resumir los resultados para obtenerpag^{\displaystyle {\hat {p}}}, una estimación empírica depagdis(|incógnita)paggramominorte(incógnita)dincógnita{\displaystyle \int p_{dis}(\cdot |x)p_{gen}(x)dx}.

Ver más imágenesincógnitai{\displaystyle x_{i}}desde el generador, y para cada uno, calcularDKL(pagdis(|incógnitai)pag^){\displaystyle D_{KL}\left(p_{dis}(\cdot |x_{i})\|{\hat {p}}\right)}.

Calcula el promedio de los resultados y aplica la función exponencial.

DEVUELVE el resultado.

Interpretación

Una puntuación de inicio más alta se interpreta como "mejor", ya que significa quepaggramominorte{\displaystyle p_{gen}}Es una colección de imágenes "nítidas y distintivas".

lnIS(paggramominorte,pagdis)[0,lnnorte]{\displaystyle \ln IS(p_{gen},p_{dis})\in [0,\ln N]}, dóndenorte{\displaystyle N}es el número total de etiquetas posibles.

lnIS(paggramominorte,pagdis)=0{\displaystyle \ln IS(p_{gen},p_{dis})=0}si y solo si para casi todosincógnitapaggramominorte{\displaystyle x\sim p_{gen}}pagdis(|incógnita)=pagdis(|incógnita)paggramominorte(incógnita)dincógnita{\displaystyle p_{dis}(\cdot |x)=\int p_{dis}(\cdot |x)p_{gen}(x)dx}Eso significapaggramominorte{\displaystyle p_{gen}}es completamente "indistinto". Es decir, para cualquier imagenincógnita{\displaystyle x}muestreado depaggramominorte{\displaystyle p_{gen}}, el discriminador devuelve exactamente las mismas predicciones de etiquetaspagdis(|incógnita){\displaystyle p_{dis}(\cdot |x)}.

La puntuación más alta de inicionorte{\displaystyle N}se logra si y solo si ambas condiciones son verdaderas:

  • Para casi todosincógnitapaggramominorte{\displaystyle x\sim p_{gen}}la distribuciónpagdis(y|incógnita){\displaystyle p_{dis}(y|x)}está concentrado en una etiqueta. Es decir,Hy[pagdis(y|incógnita)]=0{\displaystyle H_{y}[p_{dis}(y|x)]=0}. Es decir, cada imagen muestreada depaggramominorte{\displaystyle p_{gen}}es clasificado exactamente por el discriminador.
  • Para cada etiquetay{\displaystyle y}, la proporción de imágenes generadas etiquetadas comoy{\displaystyle y}es exactamentemiincógnitapaggramominorte[pagdis(y|incógnita)]=1norte{\displaystyle \mathbb {E} _{x\sim p_{gen}}[p_{dis}(y|x)]={\frac {1}{N}}}Es decir, las imágenes generadas se distribuyen de manera uniforme entre todas las etiquetas.

Referencias

  1. Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi; Chen, Xi (2016). "Técnicas mejoradas para el entrenamiento de GANs" . Avances en sistemas de procesamiento de información neuronal . 29. Curran Associates, Inc. arXiv : 1606.03498 .
  2. Frolov, Stanislav; Hinz, Tobias; Raue, Federico; Hees, Jörn; Dengel, Andreas (diciembre de 2021). " Síntesis adversaria de texto a imagen: una revisión" . Redes neuronales . 144 : 187–209 . arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782 .  
  3. Borji, Ali (2022). "Ventajas y desventajas de las medidas de evaluación de GAN: Nuevos desarrollos" . Computer Vision and Image Understanding . 215 103329. arXiv : 2103.09396 . doi : 10.1016/j.cviu.2021.103329 . S2CID 232257836 .