El Inception Score (IS) es un algoritmo utilizado para evaluar la calidad de las imágenes creadas por un modelo generativo de imágenes, como una red generativa antagónica (GAN). [ 1 ] El puntaje se calcula en función de la salida de un modelo de clasificación de imágenes Inception v3 preentrenado e independiente, aplicado a una muestra de (normalmente alrededor de 30 000) imágenes generadas por el modelo generativo. El Inception Score se maximiza cuando se cumplen las siguientes condiciones:
- Se minimiza la entropía de la distribución de etiquetas predicha por el modelo Inceptionv3 para las imágenes generadas. En otras palabras, el modelo de clasificación predice con confianza una única etiqueta para cada imagen. Intuitivamente, esto se corresponde con el ideal de que las imágenes generadas sean nítidas y definidas.
- Las predicciones del modelo de clasificación se distribuyen uniformemente entre todas las etiquetas posibles. Esto corresponde al requisito de que la salida del modelo generativo sea "diversa". [ 2 ]
Ha sido parcialmente reemplazado por la distancia de inicio de Fréchet relacionada . [ 3 ] Mientras que la puntuación de inicio solo evalúa la distribución de imágenes generadas, la FID compara la distribución de imágenes generadas con la distribución de un conjunto de imágenes reales ("verdad fundamental").
Definición
Supongamos que hay dos espacios, el espacio de las imágenes.y el espacio de etiquetasEl espacio de etiquetas es finito.
Dejarsea una distribución de probabilidad sobreque deseamos juzgar.
Sea un discriminador una función de tipodóndees el conjunto de todas las distribuciones de probabilidad sobrePara cualquier imageny cualquier etiqueta, dejarsea la probabilidad de que la imagentiene etiqueta, según el discriminador. Normalmente se implementa como una red Inception-v3 entrenada en ImageNet.
La puntuación de Inception derelativo aesLas reescrituras equivalentes incluyen:es no negativo según la desigualdad de Jensen .
Pseudocódigo:
discriminador de ENTRADA.
generador de ENTRADA.
Imágenes de muestradel generador.
Calcular, la distribución de probabilidad sobre las etiquetas condicionada a la imagen.
Resumir los resultados para obtener, una estimación empírica de.
Ver más imágenesdesde el generador, y para cada uno, calcular.
Calcula el promedio de los resultados y aplica la función exponencial.
DEVUELVE el resultado.
Interpretación
Una puntuación de inicio más alta se interpreta como "mejor", ya que significa queEs una colección de imágenes "nítidas y distintivas".
, dóndees el número total de etiquetas posibles.
si y solo si para casi todosEso significaes completamente "indistinto". Es decir, para cualquier imagenmuestreado de, el discriminador devuelve exactamente las mismas predicciones de etiquetas.
La puntuación más alta de iniciose logra si y solo si ambas condiciones son verdaderas:
- Para casi todosla distribuciónestá concentrado en una etiqueta. Es decir,. Es decir, cada imagen muestreada dees clasificado exactamente por el discriminador.
- Para cada etiqueta, la proporción de imágenes generadas etiquetadas comoes exactamenteEs decir, las imágenes generadas se distribuyen de manera uniforme entre todas las etiquetas.
Referencias
- ↑ Salimans, Tim; Goodfellow, Ian; Zaremba, Wojciech; Cheung, Vicki; Radford, Alec; Chen, Xi; Chen, Xi (2016). "Técnicas mejoradas para el entrenamiento de GANs" . Avances en sistemas de procesamiento de información neuronal . 29. Curran Associates, Inc. arXiv : 1606.03498 .
- ↑ Frolov, Stanislav; Hinz, Tobias; Raue, Federico; Hees, Jörn; Dengel, Andreas (diciembre de 2021). " Síntesis adversaria de texto a imagen: una revisión" . Redes neuronales . 144 : 187–209 . arXiv : 2101.09983 . doi : 10.1016/j.neunet.2021.07.019 . PMID 34500257. S2CID 231698782 .
- ↑ Borji, Ali (2022). "Ventajas y desventajas de las medidas de evaluación de GAN: Nuevos desarrollos" . Computer Vision and Image Understanding . 215 103329. arXiv : 2103.09396 . doi : 10.1016/j.cviu.2021.103329 . S2CID 232257836 .
- Aprendizaje automático
- Gráficos por computadora