La conversión de vídeo de 2D a 3D (también llamada conversión de 2D a 3D estéreo y conversión estéreo ) es el proceso de transformar una película 2D ("plana") a 3D , que en casi todos los casos es estéreo , por lo que es el proceso de crear imágenes para cada ojo a partir de una imagen 2D.
Descripción general
La conversión de 2D a 3D añade la señal de profundidad de disparidad binocular a las imágenes digitales percibidas por el cerebro, lo que, si se realiza correctamente, mejora considerablemente el efecto de inmersión al ver vídeo estéreo en comparación con el vídeo 2D. Sin embargo, para que la conversión sea exitosa, debe realizarse con suficiente precisión y corrección: la calidad de las imágenes 2D originales no debe deteriorarse y la señal de disparidad introducida no debe contradecir otras señales utilizadas por el cerebro para la percepción de profundidad . Si se realiza de forma adecuada y exhaustiva, la conversión produce vídeo estéreo de calidad similar al vídeo estéreo "nativo", que se graba en estéreo y se ajusta y alinea con precisión en la postproducción. [ 1 ]
Se pueden definir, a grandes rasgos, dos enfoques para la conversión estéreo: la conversión semiautomática de calidad para cine y televisión 3D de alta calidad, y la conversión automática de baja calidad para televisión 3D económica , vídeo bajo demanda y aplicaciones similares.
Re-renderizado de películas de animación por computadora
Las películas de animación por computadora en 2D realizadas con modelos 3D pueden renderizarse nuevamente en 3D estereoscópico agregando una segunda cámara virtual si los datos originales aún están disponibles. Técnicamente, esto no es una conversión; por lo tanto, dichas películas renderizadas nuevamente tienen la misma calidad que las películas producidas originalmente en 3D estereoscópico. Ejemplos de esta técnica incluyen el relanzamiento de Toy Story y Toy Story 2. Revisar los datos informáticos originales para las dos películas tomó cuatro meses, así como seis meses adicionales para agregar el 3D. [ 2 ] Sin embargo, no todas las películas CGI se renderizan nuevamente para el relanzamiento en 3D debido a los costos, el tiempo requerido, la falta de recursos calificados o la pérdida de datos informáticos.
Importancia y aplicabilidad
Con el aumento de películas estrenadas en 3D, la conversión de 2D a 3D se ha vuelto más común. La mayoría de los éxitos de taquilla en 3D estereoscópico que no utilizan CGI se convierten total o parcialmente a partir de metraje en 2D. Incluso Avatar , notable por su extenso rodaje en estereoscópico, contiene varias escenas filmadas en 2D y convertidas a estereoscópico en la postproducción. [ 3 ] Las razones para filmar en 2D en lugar de estereoscópico pueden ser financieras, técnicas y, a veces, artísticas: [ 1 ] [ 4 ]
- El flujo de trabajo de postproducción estéreo es mucho más complejo y no está tan consolidado como el flujo de trabajo 2D, lo que requiere más trabajo y renderizado.
- Los sistemas estereoscópicos profesionales son mucho más caros y voluminosos que las cámaras monoculares convencionales. Algunas tomas, sobre todo las de acción, solo se pueden grabar con cámaras 2D relativamente pequeñas.
- Las cámaras estéreo pueden introducir diversas distorsiones en la imagen estéreo (como paralaje vertical , inclinación, cambio de color, reflejos y destellos en diferentes posiciones) que deben corregirse en la postproducción, ya que arruinan el efecto 3D. Esta corrección a veces puede tener una complejidad comparable a la de la conversión estéreo.
- Las cámaras estereoscópicas pueden revelar los efectos prácticos utilizados durante el rodaje. Por ejemplo, algunas escenas de la trilogía de El Señor de los Anillos se filmaron con perspectiva forzada para que dos actores parecieran tener tamaños físicos diferentes. La misma escena filmada en estereoscópico revelaría que los actores no estaban a la misma distancia de la cámara.
- Por su propia naturaleza, las cámaras estereoscópicas tienen limitaciones en cuanto a la distancia a la que pueden estar del sujeto filmado sin comprometer la calidad de la imagen. Por ejemplo, la forma más sencilla de filmar una escena en la fachada de un edificio sería usar una cámara montada en un edificio vecino, al otro lado de la calle, con un objetivo zoom. Sin embargo, si bien el objetivo zoom proporcionaría una calidad de imagen aceptable, la separación estéreo sería prácticamente nula a esa distancia.
Incluso en el caso de la grabación estereoscópica, la conversión suele ser necesaria. Además de las escenas difíciles de grabar, pueden existir desajustes en las vistas estereoscópicas demasiado grandes para corregir, y resulta más sencillo realizar una conversión de 2D a estereoscópica, utilizando una de las vistas estereoscópicas como fuente 2D original.
Problemas generales
Sin tener en cuenta algoritmos particulares, todos los flujos de trabajo de conversión deben resolver las siguientes tareas: [ 4 ] [ 5 ]
- Asignación del "presupuesto de profundidad" : define el rango de disparidad o profundidad permitida, qué valor de profundidad corresponde a la posición en pantalla (el llamado "punto de convergencia"), los rangos de distancia permitidos para los efectos fuera de la pantalla y los objetos de fondo detrás de la pantalla. Si un objeto en un par estéreo está exactamente en el mismo lugar para ambos ojos, aparecerá en la superficie de la pantalla y tendrá paralaje cero. Se dice que los objetos delante de la pantalla tienen paralaje negativo, y las imágenes de fondo detrás de la pantalla tienen paralaje positivo. Existen los desplazamientos negativos o positivos correspondientes en las posiciones de los objetos para las imágenes del ojo izquierdo y derecho.
- Control de la disparidad cómoda según el tipo de escena y el movimiento: un exceso de paralaje o señales de profundidad contradictorias pueden provocar fatiga visual y náuseas.
- Relleno de áreas no cubiertas : las imágenes de vista izquierda o derecha muestran una escena desde un ángulo diferente, y partes de objetos u objetos completos que quedan ocultos por el primer plano en la imagen 2D original deberían hacerse visibles en un par estereoscópico. A veces, las superficies del fondo son conocidas o se pueden estimar, por lo que deben usarse para rellenar las áreas no cubiertas. De lo contrario, las áreas desconocidas deben ser rellenadas por un artista o mediante pintura digital , ya que la reconstrucción exacta no es posible.
Los métodos de conversión de alta calidad también deberían abordar muchos problemas típicos, entre ellos:
- Objetos translúcidos
- Reflexiones
- Bordes de objetos semitransparentes y borrosos, como cabello, pelaje, objetos desenfocados en primer plano, objetos delgados.
- Granulado de película (real o artificial) y efectos de ruido similares
- Escenas con movimiento rápido e irregular
- Partículas pequeñas: lluvia, nieve, explosiones, etc.
Conversión semiautomática de calidad
Conversión basada en profundidad
La mayoría de los métodos semiautomáticos de conversión estéreo utilizan mapas de profundidad y renderizado basado en imágenes de profundidad. [ 4 ] [ 5 ]
La idea es que se cree una imagen auxiliar separada, conocida como " mapa de profundidad ", para cada fotograma o para una serie de fotogramas homogéneos, para indicar las profundidades de los objetos presentes en la escena. El mapa de profundidad es una imagen en escala de grises separada con las mismas dimensiones que la imagen 2D original, con varios tonos de gris para indicar la profundidad de cada parte del fotograma. Si bien el mapeo de profundidad puede producir una ilusión bastante potente de objetos 3D en el video, inherentemente no admite objetos o áreas semitransparentes, ni representa superficies ocluidas; para enfatizar esta limitación, las representaciones 3D basadas en profundidad a menudo se denominan explícitamente 2.5D . [ 6 ] [ 7 ] Estos y otros problemas similares deben tratarse mediante un método separado. [ 6 ] [ 8 ] [ 9 ]


Los pasos principales de los métodos de conversión basados en la profundidad son:
- Asignación del presupuesto de profundidad: cuánta profundidad total hay en la escena y dónde estará el plano de la pantalla.
- Segmentación de imágenes , creación de máscaras o fondos, generalmente mediante rotoscopia . Cada superficie importante debe aislarse. El nivel de detalle depende de la calidad de conversión requerida y del presupuesto.
- Creación de mapas de profundidad. A cada superficie aislada se le debe asignar un mapa de profundidad. Estos mapas se combinan para formar un mapa de profundidad de escena. Este es un proceso iterativo que requiere ajustar objetos, formas, profundidad y visualizar los resultados intermedios en estéreo. Se añade un microrrelieve de profundidad y una forma 3D a las superficies más importantes para evitar el efecto de "cartón" que se produce cuando las imágenes estéreo parecen una combinación de imágenes planas simplemente colocadas a diferentes profundidades.
- Generación estéreo basada en 2D+Profundidad con cualquier información suplementaria como placas limpias, fondo restaurado, mapas de transparencia, etc. Cuando el proceso se completa, se habrá creado una imagen izquierda y una derecha. Normalmente, la imagen 2D original se trata como la imagen central, de modo que se generan dos vistas estéreo. Sin embargo, algunos métodos proponen usar la imagen original como la imagen de un ojo y generar solo la imagen del otro ojo para minimizar el costo de conversión. [ 4 ] Durante la generación estéreo, los píxeles de la imagen original se desplazan hacia la izquierda o hacia la derecha dependiendo del mapa de profundidad, la paralaje máxima seleccionada y la posición de la superficie de la pantalla.
- Reconstrucción y pintura de las áreas no cubiertas por el generador estéreo.
Las imágenes estéreo se pueden presentar en cualquier formato para fines de previsualización, incluido el formato anaglifo .
Los pasos que consumen más tiempo son la segmentación/rotoscopia de imágenes, la creación del mapa de profundidad y el relleno de las áreas no cubiertas. Este último paso es especialmente importante para lograr la máxima calidad de conversión.
Existen diversas técnicas de automatización para la creación de mapas de profundidad y la reconstrucción del fondo. Por ejemplo, la estimación automática de profundidad puede utilizarse para generar mapas de profundidad iniciales para ciertos fotogramas y tomas. [ 11 ]
A las personas que se dedican a este tipo de trabajo se les puede llamar artistas de profundidad. [ 12 ]
Multicapa
Como evolución del mapeo de profundidad, el multicapa supera las limitaciones de este método mediante la introducción de varias capas de máscaras de profundidad en escala de grises para lograr una semitransparencia limitada. De forma similar a una técnica sencilla, [ 13 ] el multicapa implica la aplicación de un mapa de profundidad a más de una "sección" de la imagen plana, lo que resulta en una aproximación mucho mejor de la profundidad y la protrusión. Cuantas más capas se procesen por separado en cada fotograma, mayor será la calidad de la ilusión 3D.
Otros enfoques
La reconstrucción y reproyección 3D se puede utilizar para la conversión estéreo. Implica la creación de un modelo 3D de la escena, la extracción de las superficies de la imagen original como texturas para los objetos 3D y, finalmente, la renderización de la escena 3D desde dos cámaras virtuales para obtener vídeo estéreo. El método funciona bastante bien en el caso de escenas con objetos rígidos estáticos, como tomas urbanas con edificios o tomas de interiores, pero presenta problemas con cuerpos no rígidos y bordes suaves y difusos. [ 3 ]
Otro método consiste en configurar cámaras virtuales, tanto a la izquierda como a la derecha, con un desplazamiento respecto a la cámara original, dividiendo la diferencia entre ambos. A continuación, se eliminan los bordes de oclusión de los objetos y personajes aislados. Básicamente, se limpian varios elementos del fondo, del plano medio y del primer plano.
La disparidad binocular también puede derivarse de la geometría simple. [ 14 ]
Conversión automática
Profundidad a partir del movimiento
Es posible estimar automáticamente la profundidad utilizando diferentes tipos de movimiento. En caso de movimiento de la cámara, se puede calcular un mapa de profundidad de toda la escena. Además, se puede detectar el movimiento de los objetos y asignar a las áreas en movimiento valores de profundidad menores que los del fondo. Las oclusiones proporcionan información sobre la posición relativa de las superficies en movimiento. [ 15 ] [ 16 ]
Profundidad desde el enfoque
Los enfoques de este tipo también se denominan "profundidad a partir del desenfoque" y "profundidad a partir del desenfoque". [ 15 ] [ 17 ] En los enfoques de "profundidad a partir del desenfoque" (DFD), la información de profundidad se estima en función de la cantidad de desenfoque del objeto considerado, mientras que los enfoques de "profundidad a partir del enfoque" (DFF) tienden a comparar la nitidez de un objeto en un rango de imágenes tomadas con diferentes distancias de enfoque para determinar su distancia a la cámara. DFD solo necesita dos o tres con diferentes enfoques para funcionar correctamente, mientras que DFF necesita al menos de 10 a 15 imágenes, pero es más preciso que el método anterior.
Si se detecta el cielo en la imagen procesada, también se puede tener en cuenta que los objetos más distantes, además de estar borrosos, deberían estar más desaturados y más azulados debido a una gruesa capa de aire. [ 17 ]
Profundidad desde la perspectiva
La idea del método se basa en el hecho de que las líneas paralelas, como las vías del tren y los arcenes de las carreteras, parecen converger con la distancia, hasta alcanzar finalmente un punto de fuga en el horizonte. Encontrar este punto de fuga proporciona el punto más lejano de toda la imagen. [ 15 ] [ 17 ]
Cuanto más convergen las líneas, más lejos parecen estar. Por lo tanto, para un mapa de profundidad, el área entre dos líneas de fuga vecinas se puede aproximar con un plano de gradiente.
Artefactos de conversión
- El efecto cartón es un fenómeno en el que los objetos 3D ubicados a diferentes profundidades parecen planos para el espectador, como si estuvieran hechos de cartón, mientras que la profundidad relativa entre los objetos se conserva.
- Desajuste de nitidez de bordes : este artefacto puede aparecer debido a un mapa de profundidad borroso en los límites de los objetos. El borde se ve nítido en una vista y borroso en otra. El artefacto de desajuste de nitidez de bordes suele deberse a lo siguiente:
- Se utiliza una técnica de “lámina elástica”, que consiste en deformar los píxeles que rodean las regiones de oclusión para evitar el relleno explícito de la misma. En estos casos, los bordes del mapa de desplazamiento se difuminan y la transición entre las regiones de primer plano y fondo se suaviza. La región ocupada por el desenfoque de borde/movimiento se “estira” o se “comprime”, según la dirección del desplazamiento del objeto. Naturalmente, este enfoque genera discrepancias en la nitidez de los bordes entre las distintas vistas.
- Falta de un tratamiento adecuado de los bordes semitransparentes, lo que puede provocar duplicación o efecto fantasma en los bordes.
- Técnicas sencillas de relleno de oclusiones que provocan artefactos de estiramiento cerca de los bordes de los objetos.
- Pegado a objetos de fondo : este error de "pegar" objetos de primer plano al fondo.
Métricas de calidad 3D
PQM
El PQM [ 18 ] imita al HVS, ya que los resultados obtenidos se alinean muy estrechamente con la Puntuación Media de Opinión (MOS) obtenida en pruebas subjetivas. El PQM cuantifica la distorsión en la luminancia y la distorsión del contraste mediante una aproximación (varianzas) ponderada por la media de cada bloque de píxeles para obtener la distorsión en una imagen. Esta distorsión se resta de 1 para obtener la puntuación de calidad objetiva.
HV3D
La métrica de calidad HV3D [ 19 ] se ha diseñado teniendo en cuenta la percepción visual 3D humana. Toma en cuenta la calidad de las vistas derecha e izquierda individuales, la calidad de la vista ciclópea (la fusión de la vista derecha e izquierda, lo que percibe el espectador), así como la calidad de la información de profundidad.
VQMT3D
El proyecto VQMT3D [ 20 ] incluye varias métricas desarrolladas para evaluar la calidad de la conversión de 2D a 3D basadas en el efecto de cartón, la discrepancia en la nitidez de los bordes, los objetos pegados al fondo y la comparación con la versión 2D.
Véase también
- Autoestereoscopia
- Diafonía (electrónica)
- 3D digital
- Colorización de películas : muchos de los problemas que surgen en la conversión 3D, como la identificación/reconocimiento de los bordes de los objetos, también se presentan en la colorización.
- Leyenda3D
- Listas de películas en 3D
- Videojuegos estereoscópicos : muchos videojuegos S-3D no renderizan dos imágenes, sino que también emplean técnicas de conversión de renderizado 2D + profundidad.
- Estructura a partir del movimiento
- 2D más profundidad
- Pantalla 3D
- Reconstrucción 3D a partir de múltiples imágenes
Referencias
- 1 2 Barry Sandrew. "La conversión de 2D a 3D puede ser mejor que el 3D nativo"
- ↑ Murphy, Mekado (1 de octubre de 2009). "Buzz y Woody añaden una dimensión" . The New York Times . Consultado el 18 de febrero de 2010 .
- 1 2 Seymour, Mike (2012-05-08). "El arte de la conversión estéreo: de 2D a 3D – 2012" . fxguide . Recuperado el 2024-07-11 .
- 1 2 3 4 Scott Squires. Conversiones de 2D a 3D
- 1 2 Jon Karafin. Conversión de 2D a 3D de última generación y efectos visuales estéreo. Archivado el 26 de abril de 2012 en la Wayback Machine de la International 3D Society University. Presentación del evento 3DU-Japan del 21 de octubre de 2011 en Tokio.
- 1 2 Wu, Jiajun; et al. (2017). MarrNet: Reconstrucción de formas 3D a través de bocetos 2.5D (PDF) . Conferencia sobre sistemas de procesamiento de información neuronal (NeurIPS) . págs. 540–550 .
- ↑ Tateno, Keisuke; et al. (2016). Cuando 2.5D no es suficiente: reconstrucción, segmentación y reconocimiento simultáneos en SLAM denso (PDF) . Conferencia Internacional IEEE sobre Robótica y Automatización (ICRA) . págs. 2295–2302 .
- ↑ Rock, Jason; et al. (2015). Completando la forma de un objeto 3D a partir de una imagen de profundidad (PDF) . Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . págs. 2484–2493 .
- ↑ Shin, Daeyun; et al. (2019). Reconstrucción de escenas 3D con transformadores epipolares y de profundidad multicapa (PDF) . Conferencia Internacional IEEE sobre Visión por Computadora (ICCV) . págs. 2172–2182 .
- ↑ "Soltani, AA, Huang, H., Wu, J., Kulkarni, TD, & Tenenbaum, JB Síntesis de formas 3D mediante el modelado de mapas de profundidad multivista y siluetas con redes generativas profundas. En Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (págs. 1511-1519)" . GitHub . 11 de julio de 2019.
- ↑ YUVsoft. Proceso de conversión de 2D a 3D estéreo.
- ↑ Mike Eisenberg (31 de octubre de 2011). "Entrevista con el artista 3D Adam Hlavac" . Screen Rant . Consultado el 28 de diciembre de 2015 .
- ↑ Cutler, James. "Enmascaramiento de múltiples capas en Adobe Photoshop" . Archivado del original el 18 de enero de 2012.
- ↑ Conversión de una imagen 2D a una impresión lenticular 3D
- 1 2 3 Dr. Lai-Man Po. Técnicas automáticas de conversión de vídeo 2D a 3D para 3DTV. Departamento de Ingeniería Electrónica, Universidad de la Ciudad de Hong Kong . 13 de abril de 2010.
- ↑ Ejemplo de conversión automática de 2D a 2D más profundidad para una escena de movimiento de cámara.
- 1 2 3 Qingqing We. "Conversión de 2D a 3D: una revisión" (PDF) . Facultad de Ingeniería Eléctrica, Matemáticas e Informática, Universidad Tecnológica de Delft. Archivado del original (PDF) el 15 de abril de 2012.
- ↑ Joveluro, P.; Malekmohamadi, H.; Fernando, WA C; Kondoz, AM (2010). "Métrica de calidad de vídeo perceptual para la evaluación de la calidad de vídeo 3D". 2010 3DTV-Conference: The True Vision - Capture, Transmission and Display of 3D Video . IEEE. pp. 1– 4. doi : 10.1109/3dtv.2010.5506331 . ISBN 978-1-4244-6377-0.
- ↑ Banitalebi-Dehkordi, Amin; Pourazad, Mahsa T.; Nasiopoulos, Panos (2013). "Métrica de calidad de vídeo 3D para compresión de vídeo 3D". Ivmsp 2013. IEEE. pp. 1–4 . arXiv : 1803.04629 . doi : 10.1109/ivmspw.2013.6611930 . ISBN 978-1-4673-5858-3.
- ↑ VQMT3D
Fuentes
- Mansi Sharma; Santanu Chaudhury; Brejesh Lall (2014). Kinect-Variety Fusion: Un nuevo enfoque híbrido para la generación de contenido 3DTV sin artefactos . En 22.ª Conferencia Internacional sobre Reconocimiento de Patrones (ICPR), Estocolmo, 2014. doi : 10.1109/ICPR.2014.395 .
- Imágenes 3D
- Software de gráficos 3D
- Cine 3D
- Películas en 3D
- Estereoscopia