Articulo de referencia

Imagen profunda previa

El modelo de imágenes profundas (Deep Image Prior) es un tipo de red neuronal convolucional que se utiliza para mejorar una imagen dada sin datos de entrenamiento previos, salvo...

El modelo de imágenes profundas (Deep Image Prior) es un tipo de red neuronal convolucional que se utiliza para mejorar una imagen dada sin datos de entrenamiento previos, salvo la propia imagen. Una red neuronal se inicializa aleatoriamente y se utiliza como modelo previo para resolver problemas inversos como la reducción de ruido , la superresolución y el relleno de imágenes . Las estadísticas de la imagen se capturan mediante la estructura de un generador de imágenes convolucional, en lugar de mediante capacidades aprendidas previamente.

Método

Fondo

Los problemas inversos, como la reducción de ruido , la superresolución y el relleno de imágenes , pueden formularse como una tarea de optimización.incógnita=metroinorteincógnitami(incógnita;incógnita0)+R(incógnita){\displaystyle x^{*}=min_{x}E(x;x_{0})+R(x)}, dóndeincógnita{\displaystyle x}es una imagen,incógnita0{\displaystyle x_{0}}una representación corrupta de esa imagen,mi(incógnita;incógnita0){\displaystyle E(x;x_{0})}es un término de datos dependiente de la tarea, y R(x) es el regularizador .

Las redes neuronales profundas aprenden un generador/decodificador.incógnita=Fθ(z){\displaystyle x=f_{\theta}(z)}que mapea un vector de código aleatorioz{\displaystyle z}a una imagenincógnita{\displaystyle x}.

El método de corrupción de imágenes utilizado para generarincógnita0{\displaystyle x_{0}}se selecciona para la aplicación específica.

Detalles específicos

En este enfoque, elR(incógnita){\displaystyle R(x)}El prior se reemplaza con el prior implícito capturado por la red neuronal (dondeR(incógnita)=0{\displaystyle R(x)=0}para imágenes que pueden ser producidas por redes neuronales profundas yR(incógnita)=+{\displaystyle R(x)=+\infty }de lo contrario). Esto produce la ecuación para el minimizadorθ=argramometroinorteθmi(Fθ(z);incógnita0){\displaystyle \theta ^{*}=argmin_{\theta }E(f_{\theta }(z);x_{0})}y el resultado del proceso de optimizaciónincógnita=Fθ(z){\displaystyle x^{*}=f_{\theta ^{*}}(z)}.

El minimizadorθ{\displaystyle \theta ^{*}}(típicamente un descenso de gradiente ) comienza con parámetros inicializados aleatoriamente y desciende hacia un mejor resultado local para producir elincógnita{\displaystyle x^{*}}función de restauración.

Sobreajuste

El parámetro θ puede utilizarse para recuperar cualquier imagen, incluso con ruido. Sin embargo, la red neuronal tiende a detectar el ruido debido a su alta impedancia, mientras que la señal útil presenta una baja impedancia. Esto provoca que el parámetro θ se aproxime a un óptimo local aceptable siempre que el número de iteraciones en el proceso de optimización sea lo suficientemente bajo como para evitar el sobreajuste de los datos.

Modelo de red neuronal profunda

Por lo general, el modelo de red neuronal profunda para el prior de imágenes profundas utiliza un modelo similar a U-Net sin las conexiones de salto que conectan los bloques del codificador con los del decodificador. Los autores mencionan en su artículo que "Nuestros hallazgos aquí (y en otras comparaciones similares) parecen sugerir que tener una arquitectura más profunda es beneficioso, y que tener conexiones de salto que funcionan tan bien para tareas de reconocimiento (como la segmentación semántica) es altamente perjudicial". [ 1 ]

Aplicaciones

Eliminación de ruido

El principio de eliminación de ruido es recuperar una imagenincógnita{\displaystyle x}a partir de una observación ruidosaincógnita0{\displaystyle x_{0}}, dóndeincógnita0=incógnita+ϵ{\displaystyle x_{0}=x+\epsilon }La distribuciónϵ{\displaystyle \epsilon }A veces se conoce (por ejemplo, el perfilado del sensor y el ruido de fotones [ 2 ] ) y puede incorporarse opcionalmente al modelo, aunque este proceso funciona bien en la eliminación ciega de ruido.

La función de energía cuadráticami(incógnita,incógnita0)=||incógnitaincógnita0||2{\displaystyle E(x,x_{0})=||x-x_{0}||^{2}}se utiliza como término de datos, insertándolo en la ecuación paraθ{\displaystyle \theta ^{*}}da como resultado el problema de optimizaciónmetroinorteθ||Fθ(z)incógnita0||2{\displaystyle min_{\theta }||f_{\theta }(z)-x_{0}||^{2}}.

Superresolución

La superresolución se utiliza para generar una versión de mayor resolución de la imagen x. El término de datos se establece enmi(incógnita;incógnita0)=||d(incógnita)incógnita0||2{\displaystyle E(x;x_{0})=||d(x)-x_{0}||^{2}}donde d(·) es un operador de submuestreo como Lanczos que diezma la imagen por un factor t.

Repintado

El relleno de imágenes se utiliza para reconstruir un área faltante en una imagen.incógnita0{\displaystyle x_{0}}Estos píxeles faltantes se definen como la máscara binaria.metro{0,1}H×V{\displaystyle m\in \{0,1\}^{H\times V}}El término de datos se define comomi(incógnita;incógnita0)=||(incógnitaincógnita0)metro||2{\displaystyle E(x;x_{0})=||(x-x_{0})\odot m||^{2}}(dónde{\displaystyle \odot }es el producto Hadamard ).

La idea subyacente es que la pérdida se calcula únicamente sobre los píxeles conocidos de la imagen, y la red neuronal aprenderá lo suficiente sobre la imagen para completar las partes desconocidas, aunque la pérdida calculada no incluya esos píxeles. Esta estrategia se utiliza para eliminar marcas de agua de imágenes, tratándolas como píxeles faltantes.

Reconstrucción con y sin flash

Este enfoque puede extenderse a múltiples imágenes. Un ejemplo sencillo mencionado por el autor es la reconstrucción de una imagen para obtener luz y nitidez naturales a partir de un par de imágenes con y sin flash. La reconstrucción de vídeo es posible, pero requiere optimizaciones para tener en cuenta las diferencias espaciales.

Implementaciones

Ejemplo

Ver la Imagen Astronómica del Día (APOD) del 18 de febrero de 2024 [ 4 ]

Referencias

  1. Ulyanov, Dmitry; Vedaldi, Andrea; Lempitsky, Victor (julio de 2020). "Deep Image Prior" (PDF) . International Journal of Computer Vision . 128 (7): 1867–1888 . arXiv : 1711.10925 . doi : 10.1007/s11263-020-01303-4 . ISSN 0920-5691 . 
  2. jo (11-12-2012). "Perfilado de sensores y ruido de fotones... y cómo eliminarlo" . darktable.
  3. "DmitryUlyanov/Deep-image-prior" . GitHub . 3 de junio de 2021.
  4. "Imagen astronómica del día" .
  • Ulyanov, Dmitry; Vedaldi, Andrea; Lempitsky, Victor (30 de noviembre de 2017). "Deep Image Prior". arXiv : 1711.10925v2 [ cs.CV ].