
La superresolución de vídeo ( VSR ) es el proceso de generar fotogramas de vídeo de alta resolución a partir de fotogramas de vídeo de baja resolución. A diferencia de la superresolución de imagen única (SISR), el objetivo principal no es solo restaurar los detalles más finos conservando los menos nítidos, sino también mantener la coherencia del movimiento.
Existen muchos enfoques para esta tarea, pero este problema sigue siendo popular y desafiante.
Explicación matemática
La mayoría de las investigaciones consideran el proceso de degradación de los marcos como
dónde:
- — secuencia de fotogramas original de alta resolución,
- — núcleo de desenfoque,
- — operación de convolución,
- — operación de reducción de escala,
- — ruido aditivo,
- — secuencia de fotogramas de baja resolución.
La superresolución es una operación inversa, por lo que su problema es estimar la secuencia de fotogramas.de la secuencia de fotogramasde modo queestá cerca del originalPara obtener mejores resultados, se debe estimar el núcleo de desenfoque , la operación de reducción de escala y el ruido aditivo para una entrada dada .
Los métodos de superresolución de vídeo tienden a tener más componentes que sus contrapartes de imagen, ya que necesitan aprovechar la dimensión temporal adicional. Los diseños complejos no son infrecuentes. Algunos de los componentes más esenciales para la superresolución de vídeo se rigen por cuatro funcionalidades básicas: propagación, alineación, agregación y sobremuestreo. [ 1 ]
- La propagación se refiere a la forma en que las características se propagan temporalmente.
- Problemas de alineación en la transformación espacial aplicada a imágenes/características desalineadas.
- La agregación define los pasos para combinar características alineadas.
- El sobremuestreo describe el método para transformar las características agregadas en la imagen de salida final.
Métodos
Al trabajar con vídeo, la información temporal puede utilizarse para mejorar la calidad del escalado. También se pueden emplear métodos de superresolución de imagen única , que generan fotogramas de alta resolución independientemente de los adyacentes, pero resultan menos eficaces e introducen inestabilidad temporal. Existen algunos métodos tradicionales que consideran la superresolución de vídeo como un problema de optimización. En los últimos años, los métodos de escalado de vídeo basados en aprendizaje profundo han superado a los tradicionales.
Métodos tradicionales
Existen varios métodos tradicionales para mejorar la resolución de vídeo. Estos métodos intentan aprovechar las preferencias naturales y estimar eficazmente el movimiento entre fotogramas. El fotograma de alta resolución se reconstruye basándose tanto en las preferencias naturales como en el movimiento estimado.
dominio de frecuencia
En primer lugar, el fotograma de baja resolución se transforma al dominio de la frecuencia . El fotograma de alta resolución se estima en este dominio. Finalmente, este fotograma resultante se transforma al dominio espacial. Algunos métodos utilizan la transformada de Fourier , que ayuda a extender el espectro de la señal capturada y, a su vez, a aumentar la resolución. Existen diferentes enfoques para estos métodos: utilizando la teoría de mínimos cuadrados ponderados , [ 2 ] el algoritmo de mínimos cuadrados totales (TLS) , [ 3 ] el filtrado variable espacialmente [ 4 ] o espaciotemporalmente [ 5 ] . Otros métodos utilizan la transformada wavelet , que ayuda a encontrar similitudes en áreas locales vecinas. [ 6 ] Posteriormente, la transformada wavelet de segunda generación se utilizó para la superresolución de vídeo. [ 7 ]
Dominio espacial
Los métodos iterativos de retroproyección asumen alguna función entre fotogramas de baja y alta resolución e intentan mejorar su función estimada en cada paso de un proceso iterativo. [ 8 ] Las proyecciones sobre conjuntos convexos (POCS), que definen una función de coste específica, también pueden utilizarse para métodos iterativos. [ 9 ]
Los algoritmos de filtrado adaptativo iterativo utilizan el filtro de Kalman para estimar la transformación de un fotograma de baja resolución a uno de alta resolución. [ 10 ] Para mejorar el resultado final, estos métodos consideran la correlación temporal entre secuencias de baja resolución. Algunos enfoques también consideran la correlación temporal entre secuencias de alta resolución. [ 11 ] Para aproximar el filtro de Kalman, una forma común es utilizar mínimos cuadrados medios (LMS) . [ 12 ] También se puede utilizar el descenso más pronunciado , [ 13 ] mínimos cuadrados (LS), [ 14 ] mínimos cuadrados recursivos (RLS) . [ 14 ]
Los métodos directos estiman el movimiento entre fotogramas, amplían un fotograma de referencia y deforman los fotogramas vecinos para que coincidan con el fotograma de referencia de alta resolución. Para construir el resultado, estos fotogramas ampliados se fusionan mediante un filtro de mediana , [ 15 ] un filtro de mediana ponderada, [ 16 ] un promedio normalizado adaptativo, un clasificador AdaBoost [ 17 ] o filtros basados en SVD . [ 18 ]
Los algoritmos no paramétricos combinan la estimación de movimiento y la fusión de fotogramas en un solo paso. Esto se realiza considerando las similitudes de los parches. Los pesos para la fusión se pueden calcular mediante filtros de medias no locales . [ 19 ] Para fortalecer la búsqueda de parches similares, se puede usar una medida de similitud de invariancia rotacional [ 20 ] o un tamaño de parche adaptativo. [ 21 ] El cálculo de la similitud intra-fotograma ayuda a preservar pequeños detalles y bordes. [ 22 ] Los parámetros para la fusión también se pueden calcular mediante regresión de kernel . [ 23 ]
Los métodos probabilísticos utilizan la teoría estadística para resolver la tarea. Los métodos de máxima verosimilitud (ML) estiman la imagen más probable. [ 24 ] [ 25 ] Otro grupo de métodos utiliza la estimación de máxima probabilidad a posteriori (MAP) . El parámetro de regularización para MAP se puede estimar mediante la regularización de Tikhonov . [ 26 ] Los campos aleatorios de Markov (MRF) se utilizan a menudo junto con MAP y ayudan a preservar la similitud en parches vecinos. [ 27 ] Los MRF de Huber se utilizan para preservar los bordes nítidos. [ 28 ] Los MRF gaussianos pueden suavizar algunos bordes, pero eliminan el ruido. [ 29 ]
Métodos basados en aprendizaje profundo
Alineado mediante estimación de movimiento y compensación de movimiento
En los métodos de alineación, los fotogramas vecinos se alinean primero con el fotograma objetivo. La alineación de fotogramas se puede realizar mediante estimación y compensación de movimiento (MEMC) o mediante convolución deformable (DC). La estimación de movimiento proporciona información sobre el movimiento de los píxeles entre fotogramas. La compensación de movimiento es una operación de deformación que alinea un fotograma con otro basándose en la información de movimiento. Ejemplos de estos métodos:
- Deep-DE [ 30 ] (aprendizaje profundo de conjuntos de borradores) genera una serie de mapas de características SR y luego los procesa juntos para estimar el fotograma final.
- VSRnet [ 31 ] se basa en SRCNN (modelo para superresolución de imagen única ), pero toma múltiples fotogramas como entrada. Los fotogramas de entrada se alinean primero mediante el algoritmo Druleas.
- VESPCN [ 32 ] utiliza un módulo transformador de compensación de movimiento espacial (MCT), que estima y compensa el movimiento. Luego se realiza una serie de convoluciones para extraer características y fusionarlas.
- DRVSR [ 33 ] (superresolución de vídeo profunda que revela detalles) consta de tres pasos principales: estimación de movimiento , compensación de movimiento y fusión . El transformador de compensación de movimiento (MCT) se utiliza para la estimación de movimiento. La capa de compensación de movimiento subpíxel (SPMC) compensa el movimiento. El paso de fusión utiliza una arquitectura codificador-decodificador y un módulo ConvLSTM para unificar la información de las dimensiones espaciales y temporales.
- RVSR [ 34 ] (superresolución de vídeo robusta) tiene dos ramas: una para la alineación espacial y otra para la adaptación temporal. El fotograma final es una suma ponderada de la salida de las ramas.
- FRVSR [ 35 ] (superresolución de vídeo recurrente de fotogramas) estima el flujo óptico de baja resolución , lo aumenta a alta resolución y deforma el fotograma de salida anterior utilizando este flujo óptico de alta resolución.
- STTN [ 36 ] (la red transformadora espacio-temporal) estima el flujo óptico mediante una red de estilo U basada en Unet y compensa el movimiento mediante un método de interpolación trilineal.
- SOF-VSR [ 37 ] (flujo óptico de superresolución para superresolución de vídeo) calcula el flujo óptico de alta resolución de forma progresiva. A continuación, el flujo óptico de baja resolución se estima mediante una transformación de espacio a profundidad. El resultado final de superresolución se obtiene a partir de fotogramas de baja resolución alineados.
- TecoGAN [ 38 ] (la GAN temporalmente coherente ) consta de un generador y un discriminador . El generador estima el flujo óptico LR entre fotogramas consecutivos y, a partir de este flujo óptico HR aproximado, genera el fotograma de salida. El discriminador evalúa la calidad del generador.
- TOFlow [ 39 ] (flujo orientado a tareas) es una combinación de red de flujo óptico y red de reconstrucción. El flujo óptico estimado es adecuado para una tarea particular, como la superresolución de vídeo.
- MMCNN [ 40 ] (la red neuronal convolucional de memoria múltiple) alinea los fotogramas con el objetivo y luego genera el resultado final de alta resolución a través de los módulos de extracción de características, fusión de detalles y reconstrucción de características.
- RBPN [ 41 ] (la red de retroproyección recurrente ). La entrada de cada módulo de proyección recurrente son las características del fotograma anterior, las características de la consecuencia de los fotogramas y el flujo óptico entre fotogramas vecinos.
- MEMC-Net [ 42 ] (la red de estimación y compensación de movimiento) utiliza tanto una red de estimación de movimiento como una red de estimación de núcleo para deformar los fotogramas de forma adaptativa.
- RTVSR [ 43 ] (superresolución de vídeo en tiempo real) alinea los fotogramas con el núcleo convolucional estimado.
- MultiBoot VSR [ 44 ] (el método de arranque multietapa multirreferencia) alinea los fotogramas y luego tiene una reconstrucción SR de dos etapas para mejorar la calidad.
- BasicVSR [ 45 ] alinea los fotogramas con el flujo óptico y luego fusiona sus características en un esquema bidireccional recurrente.
- IconVSR [ 45 ] es una versión refinada de BasicVSR con un esquema de propagación acoplada recurrente.
- UVSR [ 46 ] (red desplegada para superresolución de vídeo) adaptó algoritmos de optimización desplegada para resolver el problema VSR.
Alineado mediante convolución deformable
Otra forma de alinear fotogramas vecinos con el fotograma objetivo es mediante la convolución deformable. Mientras que la convolución convencional tiene un núcleo fijo, la convolución deformable estima primero los desplazamientos del núcleo y luego realiza la convolución. Ejemplos de estos métodos:
- EDVR [ 47 ] (Restauración de vídeo deformable mejorada) se puede dividir en dos módulos principales: el módulo piramidal, en cascada y deformable (PCD) para la alineación y el módulo de atención espacio-temporal (TSA) para la fusión.
- DNLN [ 48 ] (La red no local deformable) tiene un módulo de alineación, basado en convolución deformable con el módulo de fusión de características jerárquicas (HFFB) para una mejor calidad) y un módulo de atención no local.
- TDAN [ 49 ] (Red de alineación temporalmente deformable) consta de un módulo de alineación y un módulo de reconstrucción. La alineación se realiza mediante convolución deformable basada en la extracción de características y la alineación.
- La red de fusión de características multietapa [ 50 ] para superresolución de vídeo utiliza la convolución deformable dilatada multiescala para la alineación de fotogramas y la rama de fusión de características modulativa para integrar los fotogramas alineados.
Alineado por homografía
Algunos métodos alinean los fotogramas mediante la homografía calculada entre ellos.
- TGA [ 51 ] ( Atención de Grupo Temporal ) divide los fotogramas de entrada en N grupos dependiendo de la diferencia de tiempo y extrae información de cada grupo de forma independiente. Módulo de alineación espacial rápida basado en homografía utilizado para alinear fotogramas
No alineado espacialmente
Los métodos sin alineación no realizan la alineación como primer paso y simplemente procesan los fotogramas de entrada.
- VSRResNet [ 52 ] , al igual que GAN, consta de un generador y un discriminador . El generador aumenta la resolución de los fotogramas de entrada, extrae características y las fusiona. El discriminador evalúa la calidad de los fotogramas de alta resolución resultantes.
- FFCVSR [ 53 ] (superresolución de vídeo con contexto de fotogramas y características) toma fotogramas de baja resolución no alineados y genera fotogramas anteriores de alta resolución para restaurar simultáneamente los detalles de alta frecuencia y mantener la coherencia temporal.
- MRMNet [ 54 ] (la red de mezcla multirresolución) consta de tres módulos: cuello de botella, intercambio y residual. La unidad de cuello de botella extrae características que tienen la misma resolución que los fotogramas de entrada. El módulo de intercambio intercambia características entre fotogramas vecinos y amplía los mapas de características. El módulo residual extrae características después del intercambio.
- STMN [ 55 ] (la red de correspondencia espacio-temporal) utiliza la transformada wavelet discreta para fusionar características temporales. El bloque de correspondencia no local integra superresolución y eliminación de ruido . En el paso final, el resultado de SR se obtiene en el dominio wavelet global.
- MuCAN [ 56 ] (la red de agregación de múltiples correspondencias ) utiliza una estrategia de múltiples correspondencias temporales para fusionar características temporales y correspondencias no locales entre escalas para extraer autosimilitudes en los fotogramas.
convoluciones 3D
Mientras que las convoluciones 2D operan en el dominio espacial, las convoluciones 3D utilizan información tanto espacial como temporal. Realizan compensación de movimiento y mantienen la consistencia temporal.
- DUF [ 57 ] (filtros de sobremuestreo dinámico) utiliza convolución 3D deformable para la compensación de movimiento . El modelo estima núcleos para fotogramas de entrada específicos.
- FSTRN [ 58 ] (La red residual espacio-temporal rápida) incluye algunos módulos: red de extracción de características superficiales de vídeo LR (LFENet), módulo de fusión de características LR y sobremuestreo (LSRNet) y dos módulos residuales: espacio-temporal y global
- 3DSRnet [ 59 ] (la red de superresolución 3D) utiliza convoluciones 3D para extraer información espacio-temporal. El modelo también tiene un enfoque especial para fotogramas, donde se detecta un cambio de escena.
- MP3D [ 60 ] (la red convolucional 3D de pirámide multiescala ) utiliza convolución 3D para extraer características espaciales y temporales simultáneamente, que luego pasan a través de un módulo de reconstrucción con convolución subpíxel 3D para el sobremuestreo.
- DMBN [ 61 ] (la red dinámica de múltiples ramas) tiene tres ramas para explotar información de múltiples resoluciones. Finalmente, la información de las ramas se fusiona dinámicamente.
Redes neuronales recurrentes
Las redes neuronales convolucionales recurrentes realizan superresolución de vídeo almacenando dependencias temporales.
- STCN [ 62 ] (la red convolucional espacio-temporal) extrae características en el módulo espacial, las pasa a través del módulo temporal recurrente y el módulo de reconstrucción final. La consistencia temporal se mantiene mediante el mecanismo de memoria a corto y largo plazo (LSTM).
- BRCN [ 63 ] (la red convolucional recurrente bidireccional) tiene dos subredes: una con fusión hacia adelante y otra con fusión hacia atrás . El resultado de la red es una composición de la salida de dos ramas.
- RISTN [ 64 ] (la red espacio-temporal residual invertible) consta de un módulo espacial, un módulo temporal y un módulo de reconstrucción. El módulo espacial está compuesto por bloques residuales invertibles (RIB), que extraen características espaciales de manera efectiva. La salida del módulo espacial es procesada por el módulo temporal, que extrae información espacio-temporal y luego fusiona las características importantes. El resultado final se calcula en el módulo de reconstrucción mediante una operación de deconvolución.
- RRCN [ 65 ] (la red convolucional recurrente residual) es una red recurrente bidireccional que calcula una imagen residual. Luego, el resultado final se obtiene agregando un fotograma de entrada sobremuestreado bicúbicamente.
- RRN [ 66 ] (la red residual recurrente) utiliza una secuencia recurrente de bloques residuales para extraer información espacial y temporal.
- BTRPN [ 67 ] (la red de propagación recurrente temporal bidireccional) utiliza un esquema recurrente bidireccional. El resultado final se combina a partir de dos ramas con un mecanismo de atención de canal.
- RLSP [ 68 ] (propagación recurrente de estado latente) celda de red totalmente convolucional con propagación altamente eficiente de información temporal a través de un estado oculto
- RSDN [ 69 ] (la red recurrente de estructura-detalle) divide el fotograma de entrada en componentes de estructura y detalle y los procesa en dos flujos paralelos.
Vídeos
Los métodos no locales extraen información tanto espacial como temporal. La idea clave es utilizar todas las posiciones posibles como una suma ponderada . Esta estrategia puede ser más efectiva que los enfoques locales (el método no local de fusión progresiva ) extrae características espaciotemporales mediante bloques residuales no locales y luego los fusiona mediante un bloque residual de fusión progresiva (PFRB). El resultado de estos bloques es una imagen residual. El resultado final se obtiene añadiendo el fotograma de entrada sobremuestreado bicúbicamente.
- NLVSR [ 70 ] (la novedosa red de superresolución de vídeo) alinea los fotogramas con el objetivo mediante una operación no local espacio-temporal. Para integrar la información de los fotogramas alineados se utiliza un mecanismo basado en la atención.
- MSHPFNL [ 71 ] también incorpora una estructura multiescala y convoluciones híbridas para extraer dependencias de amplio rango. Para evitar algunos artefactos como el parpadeo o el efecto fantasma , utilizan entrenamiento generativo adversario.
Métrica

La forma habitual de estimar el rendimiento de los algoritmos de superresolución de vídeo es utilizar algunas métricas:
- La PSNR (relación pico señal-ruido) calcula la diferencia entre dos fotogramas correspondientes basándose en el error cuadrático medio ( MSE ).
- El SSIM (Índice de similitud estructural) mide la similitud de estructura entre dos fotogramas correspondientes.
- El IFC (Criterio de Fidelidad de la Información) muestra la similitud de la información con el marco de referencia.
- MOVIE (Índice de evaluación de la integridad del vídeo basado en el movimiento) integra información de movimiento explícita mediante la estimación de distorsiones a lo largo de las trayectorias de movimiento.
- VMAF (Video Multimethod Assessment Fusion) predice la calidad subjetiva del vídeo basándose en una secuencia de vídeo de referencia y otra distorsionada.
- VIF (Visual Information Fidelity) es un índice de evaluación de la calidad de la imagen de referencia completa basado en estadísticas de escenas naturales y en la noción de información de la imagen extraída por el sistema visual humano.
- LPIPS (Learned Perceptual Image Patch Similarity) compara la similitud perceptual de los fotogramas basándose en la estructura de la imagen de orden superior.
- tOF mide la similitud de movimiento píxel a píxel con el marco de referencia basándose en el flujo óptico.
- tLP calcula cómo cambia LPIPS de fotograma a fotograma en comparación con la secuencia de referencia.
- FSIM (Índice de similitud de características para la calidad de la imagen) utiliza la congruencia de fase como característica principal para medir la similitud entre dos fotogramas correspondientes.
Actualmente, no existen muchas métricas objetivas para verificar la capacidad del método de superresolución de vídeo para restaurar detalles reales. Se están realizando investigaciones en este ámbito.
Otra forma de evaluar el rendimiento del algoritmo de superresolución de vídeo es mediante la evaluación subjetiva . Se pide a los participantes que comparen los fotogramas correspondientes, y la puntuación media de opinión final (MOS) se calcula como la media aritmética de las calificaciones generales.
conjuntos de datos
Si bien los métodos de aprendizaje profundo para la superresolución de video superan a los tradicionales, es fundamental crear un conjunto de datos de alta calidad para su evaluación. Es importante verificar la capacidad de los modelos para restaurar pequeños detalles, texto y objetos con estructuras complejas, así como para gestionar grandes movimientos y ruido.
Puntos de referencia
Varias empresas y conferencias organizaron pruebas de rendimiento en superresolución de vídeo. El objetivo de estos desafíos es comparar diversos algoritmos y determinar el estado del arte en esta área.
Desafío NTIRE 2019
El desafío NTIRE 2019 fue organizado por CVPR y propuso dos modalidades para la superresolución de vídeo: limpia (solo degradación bicúbica) y desenfoque (desenfoque aplicado previamente). Cada modalidad contó con más de 100 participantes y se presentaron 14 resultados finales. Para este desafío se utilizó el conjunto de datos REDS, compuesto por 30 vídeos de 100 fotogramas cada uno. La resolución de los fotogramas de referencia es de 1280 × 720. El factor de escala probado es 4. Para evaluar el rendimiento de los modelos se utilizaron PSNR y SSIM. Los mejores resultados de los participantes se muestran en la tabla:
Desafío Youku-VESR 2019
El desafío Youku-VESR se organizó para comprobar la capacidad de los modelos para hacer frente a la degradación y el ruido, condiciones reales de la aplicación de visualización de vídeos en línea Youku. El conjunto de datos propuesto consta de 1000 vídeos, cada uno con una duración de entre 4 y 6 segundos. La resolución de los fotogramas de referencia es de 1920 × 1080. El factor de escala probado es 4. Se utilizaron las métricas PSNR y VMAF para la evaluación del rendimiento. Los mejores métodos se muestran en la tabla:
Desafío AIM 2019
El desafío fue organizado por ECCV y constó de dos pruebas de superresolución extrema de vídeo: la primera prueba verifica la fidelidad con el fotograma de referencia (medida mediante PSNR y SSIM ). La segunda prueba verifica la calidad perceptual de los vídeos ( MOS ). El conjunto de datos consta de 328 secuencias de vídeo de 120 fotogramas cada una. La resolución de los fotogramas de referencia es de 1920 × 1080. El factor de escala probado es 16. Los mejores métodos se muestran en la tabla:
Desafío AIM 2020
Las condiciones del desafío son las mismas que las del desafío AIM 2019. Los métodos principales se muestran en la tabla:
Prueba de referencia de superresolución de vídeo de MSU
El MSU Video Super-Resolution Benchmark fue organizado por MSU y propuso tres tipos de movimiento, dos formas de reducir la resolución y ocho tipos de contenido en el conjunto de datos. La resolución de los fotogramas de referencia es de 1920 × 1280. El factor de escala probado es 4. Se probaron 14 modelos. Para evaluar el rendimiento de los modelos se utilizaron PSNR y SSIM con compensación de desplazamiento. También se propusieron algunas métricas nuevas: ERQAv1.0, QRCRv1.0 y CRRMv1.0. [ 72 ] Los mejores métodos se muestran en la tabla:
Evaluación comparativa de superresolución de MSU para compresión de vídeo
La prueba comparativa de superresolución para compresión de vídeo de la MSU fue organizada por la MSU. Esta prueba evalúa la capacidad de los modelos para trabajar con vídeos comprimidos. El conjunto de datos consta de 9 vídeos, comprimidos con diferentes estándares de códecs de vídeo y diferentes tasas de bits . Los modelos se clasifican según la tasa BSQ [ 73 ] en lugar de una puntuación subjetiva. La resolución de los fotogramas de referencia es de 1920 × 1080. El factor de escala probado es 4. Se probaron 17 modelos. Se utilizaron 5 códecs de vídeo para comprimir los vídeos de referencia. Las mejores combinaciones de métodos de superresolución y códecs de vídeo se muestran en la tabla:
Solicitud
En muchas áreas, al trabajar con video, nos enfrentamos a diferentes tipos de degradación de video, incluyendo la reducción de escala. La resolución del video puede degradarse debido a imperfecciones de los dispositivos de medición, como degradaciones ópticas y el tamaño limitado de los sensores de la cámara . Las malas condiciones de luz y climáticas añaden ruido al video. El movimiento de los objetos y de la cámara también disminuye la calidad del video. Las técnicas de superresolución ayudan a restaurar el video original. Es útil en una amplia gama de aplicaciones, como:
- Videovigilancia (para mejorar la calidad de las imágenes capturadas por la cámara y reconocer matrículas de coches y rostros).
- Imágenes médicas (para descubrir mejor algunos órganos o tejidos para análisis clínicos e intervención médica)
- ciencia forense (para ayudar en la investigación durante el procedimiento penal)
- astronomía (para mejorar la calidad de los vídeos de estrellas y planetas)
- teledetección (para facilitar la observación de un objeto)
- microscopía (para fortalecer la capacidad de los microscopios)
También ayuda a resolver tareas de detección de objetos , reconocimiento facial y de caracteres (como paso de preprocesamiento). El interés por la superresolución crece con el desarrollo de pantallas de ordenador y televisores de alta definición .

La superresolución de vídeo encuentra su aplicación práctica en algunos teléfonos inteligentes y cámaras modernas, donde se utiliza para reconstruir fotografías digitales.
Reconstruir detalles en fotografías digitales es una tarea difícil, ya que estas fotografías están incompletas: los elementos del sensor de la cámara solo miden la intensidad de la luz, no directamente su color. Para reconstruir las fotos a partir de información de color parcial, se utiliza un proceso llamado demosaico . Un solo fotograma no proporciona datos suficientes para completar los colores que faltan; sin embargo, podemos obtener parte de la información faltante a partir de varias imágenes tomadas consecutivamente. Este proceso se conoce como fotografía en ráfaga y permite restaurar una sola imagen de buena calidad a partir de múltiples fotogramas secuenciales.
Cuando tomamos varias fotos consecutivas con un teléfono inteligente o una cámara de mano, siempre hay cierto movimiento entre las imágenes debido al movimiento de la mano. Podemos aprovechar este temblor combinando la información de esas imágenes. Elegimos una sola imagen como fotograma base o de referencia y alineamos todos los demás fotogramas con respecto a ella.
Hay situaciones en las que el movimiento de la mano simplemente no está presente porque el dispositivo está estabilizado (por ejemplo, colocado sobre un trípode). Existe una forma de simular el movimiento natural de la mano moviendo la cámara ligeramente de forma intencionada. Los movimientos son extremadamente pequeños, por lo que no interfieren con las fotos normales. Puedes observar estos movimientos en el teléfono Google Pixel 3 [ 74 ] manteniéndolo completamente inmóvil (por ejemplo, presionándolo contra la ventana) y haciendo zoom con los dedos al máximo en el visor.
Véase también
Referencias
- ↑ Chan, Kelvin CK, et al. "BasicVSR: La búsqueda de componentes esenciales en superresolución de vídeo y más allá." Actas de la Conferencia IEEE/CVF sobre Visión por Computadora y Reconocimiento de Patrones . 2021.
- ↑ Kim, SP; Bose, NK; Valenzuela, HM (1989). "Reconstrucción de imágenes de alta resolución a partir de fotogramas submuestreados con ruido". Lecture Notes in Control and Information Sciences . Vol. 129. Berlín/Heidelberg: Springer-Verlag. pp. 315–326 . doi : 10.1007/bfb0042742 . ISBN 3-540-51424-4.
- ↑ Bose, NK; Kim, HC; Zhou, B. (1994). "Análisis de rendimiento del algoritmo TLS para la reconstrucción de imágenes a partir de una secuencia de fotogramas ruidosos y borrosos submuestreados". Actas de la 1.ª Conferencia Internacional sobre Procesamiento de Imágenes . Vol. 3. IEEE Comput. Soc. Press. págs. 571–574 . doi : 10.1109/icip.1994.413741 . ISBN 0-8186-6952-7.
- ↑ Tekalp, AM; Ozkan, MK; Sezan, MI (1992). "Reconstrucción de imágenes de alta resolución a partir de secuencias de imágenes de menor resolución y restauración de imágenes con variación espacial". [ Actas ] ICASSP-92: Conferencia Internacional IEEE de 1992 sobre Acústica, Habla y Procesamiento de Señales . IEEE. págs. 169–172 vol.3. doi : 10.1109/icassp.1992.226249 . ISBN 0-7803-0532-9.
- ↑ Goldberg, N.; Feuer, A.; Goodwin, GC (2003). "Reconstrucción de superresolución mediante filtrado espacio-temporal". Journal of Visual Communication and Image Representation . 14 (4). Elsevier BV: 508– 525. doi : 10.1016/s1047-3203(03)00042-7 . ISSN 1047-3203 .
- ↑ Mallat, S (2010). "Super-Resolution With Sparse Mixing Estimators". IEEE Transactions on Image Processing . 19 (11). Institute of Electrical and Electronics Engineers (IEEE): 2889– 2900. Bibcode : 2010ITIP...19.2889M . doi : 10.1109/tip.2010.2049927 . ISSN 1057-7149 . PMID 20457549 . S2CID 856101 .
- ↑ Bose, NK; Lertrattanapanich, S.; Chappalli, MB (2004). "Superresolución con wavelets de segunda generación". Procesamiento de señales: Comunicación de imágenes . 19 (5). Elsevier BV: 387– 391. doi : 10.1016/j.image.2004.02.001 . ISSN 0923-5965 .
- ↑ Cohen, B.; Avrin, V.; Dinstein, I. (2000). "Filtrado de retroproyección polifásica para la mejora de la resolución de secuencias de imágenes". 2000 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings (Cat. No.00CH37100) . Vol. 4. IEEE. pp. 2171–2174 . doi : 10.1109/icassp.2000.859267 . ISBN 0-7803-6293-4.
- ↑ Katsaggelos, AK (1997). "Un algoritmo iterativo ponderado regularizado para mejorar la resolución de secuencias de vídeo". Actas de la Conferencia Internacional sobre Procesamiento de Imágenes . IEEE Comput. Soc. pp. 474–477 . doi : 10.1109/icip.1997.638811 . ISBN 0-8186-8183-7.
- ↑ Farsiu, Sina; Elad, Michael; Milanfar, Peyman (15 de enero de 2006). "Un enfoque práctico para la superresolución". En Apostolopoulos, John G.; Said, Amir (eds.). Visual Communications and Image Processing 2006. Vol. 6077. SPIE. p. 607703. doi : 10.1117/12.644391 .
- ↑ Jing Tian; Kai-Kuang Ma (2005). "Un nuevo enfoque de espacio de estados para la reconstrucción de secuencias de imágenes de superresolución". Conferencia Internacional IEEE sobre Procesamiento de Imágenes 2005. IEEE. págs. I-881. doi : 10.1109/icip.2005.1529892 . ISBN 0-7803-9134-9.
- ↑ Costa, Guilherme Holsbach; Bermudez, Jos Carlos Moreira (2007). "Análisis estadístico del algoritmo LMS aplicado a la reconstrucción de imágenes de superresolución". IEEE Transactions on Signal Processing . 55 (5). Instituto de Ingenieros Eléctricos y Electrónicos (IEEE): 2084– 2095. Bibcode : 2007ITSP...55.2084C . doi : 10.1109/tsp.2007.892704 . ISSN 1053-587X . S2CID 52857681 .
- ↑ Elad, M.; Feuer, A. (1999). "Reconstrucción de superresolución de secuencias de imágenes continuas". Actas de la Conferencia Internacional de Procesamiento de Imágenes de 1999 (Cat. 99CH36348) . Vol. 3. IEEE. págs. 459–463 . doi : 10.1109/icip.1999.817156 . ISBN 0-7803-5467-2.
- 1 2 Elad, M.; Feuer, A. (1999). "Restauración de superresolución de una secuencia de imágenes: enfoque de filtrado adaptativo". IEEE Transactions on Image Processing . 8 (3). Institute of Electrical and Electronics Engineers (IEEE): 387– 395. Bibcode : 1999ITIP....8..387E . doi : 10.1109/83.748893 . ISSN 1057-7149 . PMID 18262881 .
- ↑ Pickering, M.; Frater, M.; Arnold, J. (2005). "Enfoque robusto para la generación de sprites de superresolución". Conferencia Internacional IEEE sobre Procesamiento de Imágenes 2005. IEEE. págs. I-897. doi : 10.1109/icip.2005.1529896 . ISBN 0-7803-9134-9.
- ↑ Nasonov, Andrey V.; Krylov, Andrey S. (2010). "Superresolución rápida mediante filtrado de mediana ponderada". 2010 20.ª Conferencia Internacional sobre Reconocimiento de Patrones . IEEE. pp. 2230–2233 . doi : 10.1109/icpr.2010.546 . ISBN 978-1-4244-7542-1.
- ↑ Simonyan, K.; Grishin, S.; Vatolin, D.; Popov, D. (2008). "Superresolución rápida de vídeo mediante clasificación". 15.ª Conferencia Internacional IEEE de Procesamiento de Imágenes de 2008. IEEE. págs. 349–352 . doi : 10.1109/icip.2008.4711763 . ISBN 978-1-4244-1765-0.
- ↑ Nasir, Haidawati; Stankovic, Vladimir; Marshall, Stephen (2011). "Fusión basada en la descomposición en valores singulares para la reconstrucción de imágenes de superresolución". 2011 IEEE International Conference on Signal and Image Processing Applications (ICSIPA) . IEEE. pp. 393–398 . doi : 10.1109/icsipa.2011.6144138 . ISBN 978-1-4577-0242-6.
- ↑ Protter, M.; Elad, M.; Takeda, H.; Milanfar, P. (2009). "Generalizing the Nonlocal-Means to Super-Resolution Reconstruction". IEEE Transactions on Image Processing . 18 (1). Institute of Electrical and Electronics Engineers (IEEE): 36– 51. Bibcode : 2009ITIP...18...36P . doi : 10.1109/tip.2008.2008067 . ISSN 1057-7149 . PMID 19095517 . S2CID 2142115 .
- ↑ Zhuo, Yue; Liu, Jiaying ; Ren, Jie; Guo, Zongming (2012). "Superresolución basada en no local con invariancia de rotación y reubicación de la ventana de búsqueda". 2012 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . IEEE. pp. 853–856 . doi : 10.1109/icassp.2012.6288018 . ISBN 978-1-4673-0046-9.
- ↑ Cheng, Ming-Hui; Chen, Hsuan-Ying; Leou, Jin-Jang (2011). "Reconstrucción de superresolución de vídeo mediante una estrategia de búsqueda móvil y tamaño de parche adaptativo". Procesamiento de señales . 91 (5). Elsevier BV: 1284– 1297. Bibcode : 2011SigPr..91.1284C . doi : 10.1016/j.sigpro.2010.12.016 . ISSN 0165-1684 . S2CID 17920263 .
- ↑ Huhle, Benjamin; Schairer, Timo; Jenke, Philipp; Straßer, Wolfgang (2010). "Fusión de imágenes de rango y color para la reducción de ruido y la mejora de la resolución con un filtro no local". Computer Vision and Image Understanding . 114 (12). Elsevier BV: 1336– 1345. doi : 10.1016/j.cviu.2009.11.004 . ISSN 1077-3142 .
- ↑ Takeda, Hiroyuki; Farsiu, Sina; Milanfar, Peyman (2007). "Regresión de kernel para procesamiento y reconstrucción de imágenes". IEEE Transactions on Image Processing . 16 (2). Institute of Electrical and Electronics Engineers (IEEE): 349– 366. Bibcode : 2007ITIP...16..349T . doi : 10.1109/tip.2006.888330 . ISSN 1057-7149 . PMID 17269630 . S2CID 12116009 .
- ↑ Elad, M.; Feuer, A. (1997). "Restauración de una sola imagen de superresolución a partir de varias imágenes medidas borrosas, ruidosas y submuestreadas". IEEE Transactions on Image Processing . 6 (12). Institute of Electrical and Electronics Engineers (IEEE): 1646– 1658. Bibcode : 1997ITIP....6.1646E . doi : 10.1109/83.650118 . ISSN 1057-7149 . PMID 18285235 .
- ↑ Farsiu, Sina; Robinson, Dirk; Elad, Michael; Milanfar, Peyman (2003-11-20). "Enfoque robusto de desplazamiento y adición para la superresolución". En Tescher, Andrew G. (ed.). Aplicaciones del procesamiento de imágenes digitales XXVI . Vol. 5203. SPIE. p. 121. doi : 10.1117/12.507194 .
- ↑ Chantas, GK; Galatsanos, NP; Woods, NA (2007). "Super-Resolution Based on Fast Registration and Maximum a Posteriori Reconstruction". IEEE Transactions on Image Processing . 16 (7). Institute of Electrical and Electronics Engineers (IEEE): 1821– 1830. Bibcode : 2007ITIP...16.1821C . doi : 10.1109/tip.2007.896664 . ISSN 1057-7149 . PMID 17605380 . S2CID 1811280 .
- ↑ Rajan, D.; Chaudhuri, S. (2001). "Generación de imágenes de superresolución a partir de observaciones borrosas mediante campos aleatorios de Markov". 2001 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings (Cat. No.01CH37221) . Vol. 3. IEEE. pp. 1837–1840 . doi : 10.1109/icassp.2001.941300 . ISBN 0-7803-7041-4.
- ↑ Zibetti, Marcelo Victor Wust; Mayer, Joceli (2006). "Superresolución simultánea robusta frente a valores atípicos y que preserva los bordes". Conferencia Internacional de Procesamiento de Imágenes de 2006. IEEE. pp. 1741–1744 . doi : 10.1109/icip.2006.312718 . ISBN 1-4244-0480-0.
- ↑ Joshi, MV; Chaudhuri, S.; Panuganti, R. (2005). "Un método basado en aprendizaje para la superresolución de imágenes a partir de observaciones ampliadas". IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 35 (3). Institute of Electrical and Electronics Engineers (IEEE): 527– 537. Bibcode : 2005ITSMB..35..527J . doi : 10.1109/tsmcb.2005.846647 . ISSN 1083-4419 . PMID 15971920 . S2CID 3162908 .
- ↑ Liao, Renjie; Tao, Xin; Li, Ruiyu; Ma, Ziyang; Jia, Jiaya (2015). "Superresolución de vídeo mediante aprendizaje profundo de conjuntos de borradores". Conferencia Internacional IEEE de Visión por Computadora (ICCV) de 2015. IEEE. págs. 531–539 . doi : 10.1109/iccv.2015.68 . ISBN 978-1-4673-8391-2.
- ↑ Kappeler, Armin; Yoo, Seunghwan; Dai, Qiqin; Katsaggelos, Aggelos K. (2016). "Video Super-Resolution With Convolutional Neural Networks". IEEE Transactions on Computational Imaging . 2 (2). Institute of Electrical and Electronics Engineers (IEEE): 109– 122. Bibcode : 2016ITCI....2..109K . doi : 10.1109/tci.2016.2532323 . ISSN 2333-9403 . S2CID 9356783 .
- ↑ Caballero, Jose; Ledig, Christian; Aitken, Andrew; Acosta, Alejandro; Totz, Johannes; Wang, Zehan; Shi, Wenzhe (2016-11-16). "Superresolución de vídeo en tiempo real con redes espaciotemporales y compensación de movimiento". arXiv : 1611.05250v2 [ cs.CV ].
- ^ Tao, Xin; Gao, Hongyun; Liao, Renjie; Wang, Jue; Jia, Jiaya (2017). "Superresolución de vídeo profundo que revela detalles". Conferencia Internacional IEEE 2017 sobre Visión por Computadora (ICCV) . IEEE. págs. 4482–4490 . arXiv : 1704.02738 . doi : 10.1109/iccv.2017.479 . ISBN 978-1-5386-1032-9.
- ↑ Liu, Ding; Wang, Zhaowen; Fan, Yuchen; Liu, Xianming; Wang, Zhangyang; Chang, Shiyu; Huang, Thomas (2017). "Superresolución de vídeo robusta con dinámica temporal aprendida". 2017 IEEE International Conference on Computer Vision (ICCV) . IEEE. pp. 2526–2534 . doi : 10.1109/iccv.2017.274 . ISBN 978-1-5386-1032-9.
- ↑ Sajjadi, Mehdi SM; Vemulapalli, Raviteja; Brown, Matthew (2018). "Superresolución de vídeo recurrente por fotogramas". Conferencia IEEE/CVF de 2018 sobre visión por computadora y reconocimiento de patrones . IEEE. págs. 6626–6634 . arXiv : 1801.04590 . doi : 10.1109/cvpr.2018.00693 . ISBN 978-1-5386-6420-9.
- ↑ Kim, Tae Hyun; Sajjadi, Mehdi SM; Hirsch, Michael; Schölkopf, Bernhard (2018). "Red de transformadores espaciotemporales para la restauración de vídeo". Visión por computadora – ECCV 2018. Notas de clase en ciencias de la computación. Vol. 11207. Cham: Springer International Publishing. pp. 111–127 . doi : 10.1007/978-3-030-01219-9_7 . ISBN 978-3-030-01218-2ISSN 0302-9743
- ↑ Wang, Longguang; Guo, Yulan; Liu, Li; Lin, Zaiping; Deng, Xinpu; An, Wei (2020). "Superresolución de vídeo profunda mediante estimación de flujo óptico HR". IEEE Transactions on Image Processing . 29 . Institute of Electrical and Electronics Engineers (IEEE): 4323– 4336. arXiv : 2001.02129 . Bibcode : 2020ITIP...29.4323W . doi : 10.1109/tip.2020.2967596 . ISSN 1057-7149 . PMID 31995491 . S2CID 210023539 .
- ↑ Chu, Mengyu; Xie, You; Mayer, Jonas; Leal-Taixé, Laura; Thuerey, Nils (2020-07-08). "Aprendizaje de coherencia temporal mediante auto-supervisión para la generación de vídeo basada en GAN". ACM Transactions on Graphics . 39 (4). Association for Computing Machinery (ACM). arXiv : 1811.09393 . doi : 10.1145/3386569.3392457 . ISSN 0730-0301 . S2CID 209460786 .
- ↑ Xue, Tianfan; Chen, Baian; Wu, Jiajun; Wei, Donglai; Freeman, William T. (2019-02-12). "Mejora de vídeo con flujo orientado a tareas". Revista Internacional de Visión por Computadora . 127 (8). Springer Science and Business Media LLC: 1106– 1125. arXiv : 1711.09078 . doi : 10.1007/s11263-018-01144-2 . ISSN 0920-5691 . S2CID 40412298 .
- ↑ Wang, Zhongyuan; Yi, Peng; Jiang, Kui; Jiang, Junjun; Han, Zhen; Lu, Tao; Ma, Jiayi (2019). "Red neuronal convolucional de memoria múltiple para superresolución de vídeo". IEEE Transactions on Image Processing . 28 (5). Instituto de Ingenieros Eléctricos y Electrónicos (IEEE): 2530– 2544. Bibcode : 2019ITIP...28.2530W . doi : 10.1109/tip.2018.2887017 . ISSN 1057-7149 . PMID 30571634 . S2CID 58595890 .
- ↑ Haris, Muhammad; Shakhnarovich, Gregory; Ukita, Norimichi (2019). "Red neuronal recurrente de retroproyección para superresolución de vídeo". Conferencia IEEE/CVF de 2019 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 3892–3901 . arXiv : 1903.10128 . doi : 10.1109/cvpr.2019.00402 . ISBN 978-1-7281-3293-8.
- ↑ Bao, Wenbo; Lai, Wei-Sheng; Zhang, Xiaoyun; Gao, Zhiyong; Yang, Ming-Hsuan (2021-03-01). "MEMC-Net: Red neuronal impulsada por estimación y compensación de movimiento para interpolación y mejora de video". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (3). Institute of Electrical and Electronics Engineers (IEEE): 933– 948. arXiv : 1810.08768 . Bibcode : 2021ITPAM..43..933B . doi : 10.1109/tpami.2019.2941941 . ISSN 0162-8828 . PMID 31722471 . S2CID 53046739 .
- ↑ Bare, Bahetiyaer; Yan, Bo; Ma, Chenxi; Li, Ke (2019). "Superresolución de vídeo en tiempo real mediante estimación del núcleo de convolución de movimiento". Neurocomputing . 367. Elsevier BV: 236–245 . doi : 10.1016/j.neucom.2019.07.089 . ISSN 0925-2312 . S2CID 201264266 .
- ↑ Kalarot, Ratheesh; Porikli, Fatih (2019). "MultiBoot Vsr: Arranque multietapa multireferencia para superresolución de vídeo". 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) . IEEE. pp. 2060–2069 . doi : 10.1109/cvprw.2019.00258 . ISBN 978-1-7281-2506-0.
- 1 2 Chan, Kelvin CK; Wang, Xintao; Yu, Ke; Dong, Chao; Loy, Chen Change (2020-12-03). "BasicVSR: La búsqueda de componentes esenciales en la superresolución de vídeo y más allá". arXiv : 2012.02181v1 [ cs.CV ].
- ↑ Naoto Chiche, Benjamin; Frontera-Pons, Joana; Woiselle, Arnaud; Starck, Jean-Luc (09-11-2020). "Red neuronal profunda desplegada para superresolución de vídeo". Décima Conferencia Internacional sobre Teoría, Herramientas y Aplicaciones del Procesamiento de Imágenes (IPTA) de 2020. IEEE. págs. 1–6 . arXiv : 2102.11720 . doi : 10.1109/ipta50016.2020.9286636 . ISBN 978-1-7281-8750-1.
- ↑ Wang, Xintao; Chan, Kelvin CK; Yu, Ke; Dong, Chao; Loy, Chen Change (2019-05-07). "EDVR: Restauración de vídeo con redes neuronales convolucionales deformables mejoradas". arXiv : 1905.02716v1 [ cs.CV ].
- ↑ Wang, Hua; Su, Dewei; Liu, Chuangchuang; Jin, Longcun; Sun, Xianfang; Peng, Xinyi (2019). "Red no local deformable para superresolución de vídeo" . Acceso IEEE . 7. Instituto de Ingenieros Eléctricos y Electrónicos (IEEE): 177734–177744 . arXiv : 1909.10692 . Bibcode : 2019IEEEA...7q7734W . doi : 10.1109/access.2019.2958030 . ISSN 2169-3536 .
- ↑ Tian, Yapeng; Zhang, Yulun; Fu, Yun; Xu, Chenliang (2020). "TDAN: Red de alineación temporalmente deformable para superresolución de vídeo". Conferencia IEEE/CVF 2020 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 3357–3366 . arXiv : 1812.02898 . doi : 10.1109/cvpr42600.2020.00342 . ISBN 978-1-7281-7168-5.
- ↑ Song, Huihui; Xu, Wenjie; Liu, Dong; Liua, Bo; Liub, Qingshan; Metaxas, Dimitris N. (2021). "Red de fusión de características multietapa para superresolución de vídeo". IEEE Transactions on Image Processing . 30 . Instituto de Ingenieros Eléctricos y Electrónicos (IEEE): 2923– 2934. Bibcode : 2021ITIP...30.2923S . doi : 10.1109/tip.2021.3056868 . ISSN 1057-7149 . PMID 33560986 . S2CID 231864067 .
- ^ Isobe, Takashi; Li, Songjiang; Jia, Xu; Yuan, Shanxin; Slabaugh, Gregorio; Xu, Chunjing; Li, Ya-Li; Wang, Shengjin; Tian, Qi (2020). "Vídeo de superresolución con atención de grupo temporal". Conferencia IEEE/CVF 2020 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 8005–8014 . arXiv : 2007.10595 . doi : 10.1109/cvpr42600.2020.00803 . ISBN 978-1-7281-7168-5.
- ↑ Lucas, Alice; Lopez-Tapia, Santiago; Molina, Rafael; Katsaggelos, Aggelos K. (2019). "Generative Adversarial Networks and Perceptual Losses for Video Super-Resolution". IEEE Transactions on Image Processing . 28 (7). Institute of Electrical and Electronics Engineers (IEEE): 3312– 3327. arXiv : 1806.05764 . Bibcode : 2019ITIP...28.3312L . doi : 10.1109/tip.2019.2895768 . ISSN 1057-7149 . PMID 30714918 . S2CID 73415655 .
- ↑ Yan, Bo; Lin, Chuming; Tan, Weimin (2019-09-28). "Superresolución de vídeo de contexto de fotogramas y características". arXiv : 1909.13057v1 [ cs.CV ].
- ↑ Tian, Zhiqiang; Wang, Yudiao; Du, Shaoyi; Lan, Xuguang (10 de julio de 2020). Yang, You (ed.). "Una red generativa adversaria de mezcla multirresolución para superresolución de vídeo" . PLOS ONE . 15 (7) e0235352. Public Library of Science (PLoS). Bibcode : 2020PLoSO..1535352T . doi : 10.1371 / journal.pone.0235352 . ISSN 1932-6203 . PMC 7351143. PMID 32649694 .
- ↑ Zhu, Xiaobin; Li, Zhuangzi; Lou, Jungang; Shen, Qing (2021). "Superresolución de vídeo basada en una red de coincidencia espacio-temporal". Pattern Recognition . 110 107619. Bibcode : 2021PatRe.11007619Z . doi : 10.1016/j.patcog.2020.107619 . ISSN 0031-3203 . S2CID 225285804 .
- ^ Li, Wenbo; Tao, Xin; Guo, Taian; Qi, Lu; Lu, Jiangbo; Jia, Jiaya (23 de julio de 2020). "MuCAN: red de agregación de correspondencia múltiple para superresolución de vídeo". arXiv : 2007.11803v1 [ cs.CV ].
- ↑ Jo, Younghyun; Oh, Seoung Wug; Kang, Jaeyeon; Kim, Seon Joo (2018). "Red neuronal profunda de superresolución de vídeo mediante filtros de sobremuestreo dinámico sin compensación explícita de movimiento". Conferencia IEEE/CVF de 2018 sobre visión por ordenador y reconocimiento de patrones . IEEE. págs. 3224–3232 . doi : 10.1109/cvpr.2018.00340 . ISBN 978-1-5386-6420-9.
- ^ Li, Sheng; Él, Fengxiang; Du, Bo; Zhang, Lefei; Xu, Yonghao; Tao, Dacheng (5 de abril de 2019). "Red residual espacio-temporal rápida para superresolución de vídeo". arXiv : 1904.02870v1 [ cs.CV ].
- ↑ Kim, Soo Ye; Lim, Jeongyeon; Na, Taeyoung; Kim, Munchurl (2019). "Superresolución de vídeo basada en 3D-CNNS con consideración del cambio de escena". 2019 IEEE International Conference on Image Processing (ICIP) . pp. 2831–2835 . doi : 10.1109/ICIP.2019.8803297 . ISBN 978-1-5386-6249-6. S2CID 202763112 .
- ↑ Luo, Jianping; Huang, Shaofei; Yuan, Yuan (2020). "Superresolución de vídeo mediante redes neuronales convolucionales 3D piramidales multiescala". Actas de la 28.ª Conferencia Internacional ACM sobre Multimedia . págs. 1882–1890 . doi : 10.1145/3394171.3413587 . ISBN 978-1-4503-7988-5. S2CID 222278621 .
- ↑ Zhang, Dongyang; Shao, Jie; Liang, Zhenwen; Liu, Xueliang; Shen, Heng Tao (2020). "Redes multiramificadas para superresolución de vídeo con estrategia de reconstrucción dinámica". IEEE Transactions on Circuits and Systems for Video Technology . 31 (10): 3954– 3966. doi : 10.1109/TCSVT.2020.3044451 . ISSN 1051-8215 . S2CID 235057646 .
- ↑ Aksan, Emre; Hilliges, Otmar (2019-02-18). "STCN: Stochastic Temporal Convolutional Networks". arXiv : 1902.06568v1 [ cs.LG ].
- ↑ Huang, Yan; Wang, Wei; Wang, Liang (2018). "Superresolución de vídeo mediante redes neuronales convolucionales recurrentes bidireccionales". IEEE Transactions on Pattern Analysis and Machine Intelligence . 40 (4): 1015– 1028. Bibcode : 2018ITPAM..40.1015H . doi : 10.1109/TPAMI.2017.2701380 . ISSN 0162-8828 . PMID 28489532. S2CID 136582 .
- ^ Zhu, Xiaobin; Li, Zhuangzi; Zhang, Xiao-Yu; Li, Changsheng; Liu, Yaqi; Xue, Ziyu (2019). "Red espacio-temporal invertible residual para superresolución de vídeo" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 33 : 5981– 5988. doi : 10.1609/aaai.v33i01.33015981 . ISSN 2374-3468 .
- ↑ Li, Dingyi; Liu, Yu; Wang, Zengfu (2019). "Video Super-Resolution Using Non-Simultaneous Fully Recurrent Convolutional Network". IEEE Transactions on Image Processing . 28 (3): 1342– 1355. Bibcode : 2019ITIP...28.1342L . doi : 10.1109/TIP.2018.2877334 . ISSN 1057-7149 . PMID 30346282 . S2CID 53044490 .
- ^ Isobe, Takashi; Zhu, colmillo; Jia, Xu; Wang, Shengjin (13 de agosto de 2020). "Revisando el modelado temporal para vídeo de superresolución". arXiv : 2008.05765v2 [ eess.IV ].
- ↑ Han, Lei; Fan, Cien; Yang, Ye; Zou, Lian (2020). "Redes de propagación recurrente temporal bidireccionales para superresolución de vídeo" . Electronics . 9 (12): 2085. doi : 10.3390/electronics9122085 . ISSN 2079-9292 .
- ↑ Fuoli, Dario; Gu, Shuhang; Timofte, Radu (2019-09-17). "Superresolución de vídeo eficiente mediante propagación recurrente del espacio latente". arXiv : 1909.08080 [ eess.IV ].
- ^ Isobe, Takashi; Jia, Xu; Gu, Shuhang; Li, Songjiang; Wang, Shengjin; Tian, Qi (2 de agosto de 2020). "Vídeo de superresolución con red recurrente de detalles de estructura". arXiv : 2008.00455v1 [ cs.CV ].
- ↑ Zhou, Chao; Chen, Can; Ding, Fei; Zhang, Dengyin (2021). "Superresolución de vídeo con red de alineación no local" . IET Image Processing . 15 (8): 1655– 1667. doi : 10.1049/ipr2.12134 . ISSN 1751-9659 .
- ↑ Yi, Peng; Wang, Zhongyuan; Jiang, Kui; Jiang, Junjun; Lu, Tao; Ma, Jiayi (2020). "Una red generativa adversaria de fusión progresiva para superresolución de vídeo realista y consistente". IEEE Transactions on Pattern Analysis and Machine Intelligence . PP (5): 2264– 2280. doi : 10.1109 / TPAMI.2020.3042298 . ISSN 0162-8828 . PMID 33270559. S2CID 227282569 .
- ↑ "Metodología de referencia VSR de MSU" . Procesamiento de vídeo . 26 de abril de 2021. Consultado el 12 de mayo de 2021 .
- ↑ Zvezdakova, AV; Kulikov, DL; Zvezdakov, SV; Vatolin, DS (2020). "BSQ-rate: un nuevo enfoque para la comparación del rendimiento de los códecs de vídeo y las desventajas de las soluciones actuales". Programming and Computer Software . 46 (3): 183– 194. doi : 10.1134/S0361768820030111 . S2CID 219157416 .
- ↑ "Vea mejor y más lejos con el zoom de superresolución del Pixel 3" . Blog de IA de Google . 15 de octubre de 2018.
- Procesamiento de señales
- Tecnología cinematográfica y de vídeo
- Procesamiento de imágenes
