La red generativa antagónica de Wasserstein (WGAN) es una variante de la red generativa antagónica (GAN) propuesta en 2017 que tiene como objetivo "mejorar la estabilidad del aprendizaje, eliminar problemas como el colapso de modos y proporcionar curvas de aprendizaje significativas útiles para la depuración y la búsqueda de hiperparámetros". [ 1 ] [ 2 ]
En comparación con el discriminador GAN original, el discriminador GAN de Wasserstein proporciona una mejor señal de aprendizaje al generador. Esto permite que el entrenamiento sea más estable cuando el generador aprende distribuciones en espacios de muy alta dimensionalidad.
Motivación
El juego GAN
El método GAN original se basa en el juego GAN, un juego de suma cero con 2 jugadores: generador y discriminador. El juego se define sobre un espacio de probabilidad.El conjunto de estrategias del generador es el conjunto de todas las medidas de probabilidad.eny el conjunto de estrategias del discriminador es el conjunto de funciones medibles..
El objetivo del juego es El generador pretende minimizarlo, y el discriminador pretende maximizarlo.
Un teorema básico del juego GAN establece que
Teorema (el discriminador óptimo calcula la divergencia de Jensen-Shannon) — Para cualquier estrategia de generador fijo , sea la respuesta óptima, entonces
donde la derivada es la derivada de Radon-Nikodym , yes la divergencia de Jensen-Shannon .
Repite el juego GAN muchas veces, cada vez con el generador moviéndose primero y el discriminador moviéndose segundo. Cada vez el generadorcambios, el discriminador debe adaptarse acercándose al ideal Dado que estamos realmente interesados en, la función discriminadoraes en sí mismo bastante poco interesante. Simplemente registra la razón de verosimilitud entre la distribución del generador y la distribución de referencia. En equilibrio, el discriminador simplemente está generandoconstantemente, habiendo renunciado a intentar percibir alguna diferencia. [ nota 1 ]
Concretamente, en el juego GAN, vamos a arreglar un generador.y mejorar el discriminador paso a paso, conser el discriminador en el pasoEntonces (idealmente) tenemosAsí vemos que el discriminador en realidad está limitando por debajo..
Distancia de Wasserstein
Así, vemos que la función del discriminador es principalmente la de un crítico que proporciona retroalimentación al generador sobre "cuán lejos está de la perfección", donde "lejos" se define como la divergencia de Jensen-Shannon.
Naturalmente, esto abre la posibilidad de utilizar un criterio de lejanía diferente. Hay muchas divergencias posibles para elegir, como la familia de divergencias f , que daría lugar a la f-GAN. [ 3 ]
La GAN de Wasserstein se obtiene utilizando la métrica de Wasserstein , que satisface un "teorema de representación dual" que la hace altamente eficiente para calcular:
Teorema (dualidad de Kantorovich-Rubenstein) — Cuando el espacio de probabilidad es un espacio métrico, entonces para cualquier fijo, dóndees la norma de Lipschitz .
La demostración se puede encontrar en la página principal sobre la métrica de Wasserstein .
Definición
Según la dualidad de Kantorovich-Rubenstein, la definición de Wasserstein GAN es clara:
Un juego GAN de Wasserstein se define mediante un espacio de probabilidad, dóndees un espacio métrico y una constante.
Hay dos jugadores: el generador y el discriminador (también llamado "crítico").
El conjunto de estrategias del generador es el conjunto de todas las medidas de probabilidad.en.
El conjunto de estrategias del discriminador es el conjunto de funciones medibles de tipocon norma de Lipschitz acotada:.
El juego GAN de Wasserstein es un juego de suma cero , con función objetivo
El generador actúa primero y el discriminador después. El generador busca minimizar la función objetivo, y el discriminador busca maximizarla:
Por la dualidad de Kantorovich-Rubenstein, para cualquier estrategia generadoraLa respuesta óptima del discriminador es, de tal manera queEn consecuencia, si el discriminador es bueno, el generador se vería constantemente presionado para minimizary la estrategia óptima para el generador es simplemente, como debe ser.
Comparación con GAN
En el juego GAN de Wasserstein, el discriminador proporciona un gradiente mejor que en el juego GAN.
Consideremos, por ejemplo, un juego en la recta real donde ambosyson gaussianas. Entonces el crítico de Wasserstein óptimoy el discriminador GAN óptimose representan gráficamente como se muestra a continuación:

Para un discriminador fijo, el generador necesita minimizar los siguientes objetivos:
- Para GAN,.
- Para Wasserstein GAN,.
Dejarser parametrizado por, entonces podemos realizar un descenso de gradiente estocástico utilizando dos estimadores insesgados del gradiente:donde utilizamos el truco de reparametrización . [ nota 2 ]

Como se muestra, el generador en GAN está motivado para dejar que su"deslizarse por la cima" de. Lo mismo ocurre con el generador en Wasserstein GAN.
Para Wasserstein GAN,tiene gradiente 1 en casi todas partes, mientras que para GAN,tiene un gradiente plano en el medio y un gradiente pronunciado en el resto. Como resultado, la varianza del estimador en GAN suele ser mucho mayor que la de Wasserstein GAN. Véase también la Figura 3 de [ 1 ] .
El problema cones mucho más severo en situaciones reales de aprendizaje automático. Consideremos entrenar una GAN para generar ImageNet , una colección de fotos de tamaño 256 por 256. El espacio de todas esas fotos esy la distribución de imágenes de ImageNet,, se concentra en una variedad de dimensión mucho menor en ella. En consecuencia, cualquier estrategia generadoracasi con toda seguridad estaría completamente desvinculado de, haciendoPor lo tanto, un buen discriminador puede distinguir casi perfectamente.de, así como cualquiercerca dePor lo tanto, el gradiente, sin generar ninguna señal de aprendizaje para el generador.
Los teoremas detallados se pueden encontrar en [ 4 ] .
Entrenamiento de GANs de Wasserstein
El entrenamiento del generador en Wasserstein GAN se basa simplemente en el descenso de gradiente , al igual que en GAN (o en la mayoría de los métodos de aprendizaje profundo), pero el entrenamiento del discriminador es diferente, ya que este último ahora está restringido a tener una norma de Lipschitz limitada. Existen varios métodos para ello.
Límite superior de la norma de Lipschitz
Sea la función discriminadoraque se implementará mediante un perceptrón multicapa :dónde, yes una función de activación fija conPor ejemplo, la función tangente hiperbólicaSatisface el requisito.
Entonces, para cualquier, dejar, tenemos por la regla de la cadena :Así, la norma de Lipschitz deestá limitado superiormente pordóndees la norma del operador de la matriz, es decir, el mayor valor singular de la matriz, es decir, el radio espectral de la matriz (estos conceptos son los mismos para matrices, pero diferentes para operadores lineales generales ).
Desde, tenemosy, en consecuencia, el límite superior:Por lo tanto, si podemos acotar superiormente las normas de los operadoresde cada matriz, podemos acotar superiormente la norma de Lipschitz de.
Recorte de peso
Dado que para cualquiermatriz, dejar, tenemosrecortando todas las entradas dedentro de algún intervalo, podemos vincularnos.
Este es el método de recorte de peso propuesto en el artículo original. [ 1 ]
Normalización espectral
El radio espectral se puede calcular de manera eficiente mediante el siguiente algoritmo:
Matriz de ENTRADAy suposición inicial
Iterara la convergenciaEste es el vector propio decon valor propio.
DEVOLVER
Al reasignarDespués de cada actualización del discriminador, podemos establecer un límite superior.y por lo tanto límite superior.
El algoritmo puede acelerarse aún más mediante la memorización : En el paso, almacenar. Luego en el paso, usarcomo la suposición inicial para el algoritmo. Dado queestá muy cerca de, así escerca de, por lo que esto permite una rápida convergencia.
Este es el método de normalización espectral. [ 5 ]
penalización de gradiente
En lugar de limitar estrictamente, podemos simplemente agregar un término de "penalización de gradiente" para el discriminador, de la formadóndees una distribución fija que se utiliza para estimar cuánto ha violado el discriminador el requisito de la norma de Lipschitz. El discriminador, al intentar minimizar la nueva función de pérdida, naturalmente traeríacerca deen todas partes, haciendo así.
Este es el método de penalización de gradiente. [ 6 ]
Lecturas adicionales
- De GAN a WGAN
- La GAN de Wasserstein y la dualidad de Kantorovich-Rubinstein
- Aprendizaje en profundidad: GAN de Wasserstein
Véase también
Referencias
- 1 2 3 Arjovsky, Martin; Chintala, Soumith; Bottou, Léon (17 de julio de 2017). "Redes generativas adversarias de Wasserstein" . Conferencia internacional sobre aprendizaje automático . PMLR: 214–223 .
- ^ Weng, Lilian (18 de abril de 2019). "De GAN a WGAN". arXiv : 1904.08994 [ cs.LG ].
- ↑ Nowozin, Sebastian; Cseke, Botond; Tomioka, Ryota (2016). "f-GAN: Entrenamiento de muestreadores neuronales generativos mediante minimización de la divergencia variacional" . Advances in Neural Information Processing Systems . 29. Curran Associates, Inc. arXiv : 1606.00709 .
- ↑ Arjovsky, Martin; Bottou, Léon (2017-01-01). "Hacia métodos basados en principios para el entrenamiento de redes generativas adversarias" . arXiv : 1701.04862 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Miyato, Takeru; Kataoka, Toshiki; Koyama, Masanori; Yoshida, Yuichi (16 de febrero de 2018). "Normalización espectral para redes generativas adversarias". arXiv : 1802.05957 [ cs.LG ].
- ↑ Gulrajani, Ishaan; Ahmed, Faruk; Arjovsky, Martin; Dumoulin, Vincent; Courville, Aaron C (2017). "Entrenamiento mejorado de GAN de Wasserstein" . Avances en sistemas de procesamiento de información neuronal . 30. Curran Associates, Inc.
Notas
- ↑ En la práctica, el generador nunca podría alcanzar una imitación perfecta, por lo que el discriminador tendría motivación para percibir la diferencia, lo que le permite ser utilizado para otras tareas, como realizar la clasificación de ImageNet sin supervisión .
- ↑ En realidad, no es así como se hace en la práctica, ya que En general es un problema intratable, pero teóricamente resulta esclarecedor.
- Arquitecturas de redes neuronales
- Ciencia cognitiva
- Aprendizaje no supervisado