La obtención de imágenes de rango es el nombre que recibe un conjunto de técnicas que se utilizan para producir una imagen 2D que muestra la distancia a los puntos de una escena desde un punto específico, normalmente asociado con algún tipo de dispositivo sensor.
La imagen de rango resultante tiene valores de píxeles que corresponden a la distancia. Si el sensor utilizado para producir la imagen de rango está correctamente calibrado, los valores de los píxeles se pueden expresar directamente en unidades físicas, como metros.
Tipos de cámaras de alcance
El sensor que se utiliza para generar la imagen de profundidad se conoce a veces como cámara de profundidad o cámara de alcance . Las cámaras de profundidad pueden funcionar mediante diversas técnicas, algunas de las cuales se describen a continuación.
Triangulación estéreo
La triangulación estéreo es una aplicación de la estereofotogrametría en la que los datos de profundidad de los píxeles se determinan a partir de datos adquiridos mediante un sistema estéreo o de cámaras múltiples . De esta forma, es posible determinar la profundidad de puntos en la escena, por ejemplo, desde el centro de la línea que une sus focos. Para resolver el problema de medición de profundidad con un sistema de cámaras estéreo, es necesario primero encontrar puntos correspondientes en las diferentes imágenes. Resolver el problema de correspondencia es uno de los principales desafíos al utilizar este tipo de técnica. Por ejemplo, es difícil resolver el problema de correspondencia para puntos de imagen que se encuentran dentro de regiones de intensidad o color homogéneos. En consecuencia, la obtención de imágenes de rango basada en la triangulación estéreo generalmente solo puede producir estimaciones de profundidad fiables para un subconjunto de todos los puntos visibles en las cámaras múltiples.
La ventaja de esta técnica radica en que la medición es prácticamente pasiva; no requiere condiciones especiales de iluminación de la escena. Las demás técnicas mencionadas aquí no tienen que resolver el problema de correspondencia, sino que dependen de condiciones específicas de iluminación de la escena.
Triangulación de lámina de luz
Si la escena se ilumina con una lámina de luz, se crea una línea reflejada vista desde la fuente de luz. Desde cualquier punto fuera del plano de la lámina, la línea suele aparecer como una curva, cuya forma exacta depende tanto de la distancia entre el observador y la fuente de luz como de la distancia entre la fuente de luz y los puntos reflejados. Al observar la lámina de luz reflejada con una cámara (a menudo de alta resolución) y conociendo la posición y la orientación tanto de la cámara como de la fuente de luz, es posible determinar las distancias entre los puntos reflejados y la fuente de luz o la cámara.
Al mover la fuente de luz (y normalmente también la cámara) o la escena que se encuentra frente a ella, se puede generar una secuencia de perfiles de profundidad de la escena. Estos se pueden representar como una imagen de rango 2D.
Luz estructurada
Al iluminar la escena con un patrón de luz especialmente diseñado, la luz estructurada permite determinar la profundidad a partir de una sola imagen de la luz reflejada. La luz estructurada puede presentarse en forma de líneas horizontales y verticales, puntos o patrones de tablero de ajedrez. Un platina de luz es básicamente un dispositivo genérico de imagen de rango de luz estructurada, creado originalmente para la captura de reflectancia .
Tiempo de vuelo
La profundidad también se puede medir utilizando la técnica estándar de tiempo de vuelo (ToF), similar a un radar , ya que produce una imagen de rango parecida a la de un radar, pero utilizando un pulso de luz en lugar de un pulso de radiofrecuencia (RF). También se asemeja a un LIDAR , con la diferencia de que ToF no utiliza escáner; es decir, toda la escena se captura con un único pulso de luz, en lugar de punto por punto con un haz láser giratorio. Las cámaras de tiempo de vuelo son dispositivos relativamente nuevos que capturan una escena completa en tres dimensiones con un sensor de imagen dedicado, por lo que no requieren partes móviles. Un radar láser de tiempo de vuelo con una cámara CCD intensificada de obturador rápido alcanza una resolución de profundidad submilimétrica. Con esta técnica, un pulso láser corto ilumina una escena y la cámara CCD intensificada abre su obturador de alta velocidad solo durante unos cientos de picosegundos . La información 3D se calcula a partir de una serie de imágenes 2D recopiladas con un retardo creciente entre el pulso láser y la apertura del obturador. [ 1 ]
Interferometría
Iluminando puntos con luz coherente y midiendo el desfase de la luz reflejada con respecto a la fuente de luz, es posible determinar la profundidad. Suponiendo que la imagen de rango real es una función más o menos continua de las coordenadas de la imagen, se puede obtener la profundidad correcta mediante una técnica denominada desenrollado de fase. Véase interferometría SAR terrestre .
Apertura codificada
La información de profundidad puede inferirse parcial o totalmente junto con la intensidad mediante la convolución inversa de una imagen capturada con un patrón de apertura codificado especialmente diseñado, con una disposición compleja de orificios a través de los cuales se permite o se bloquea la luz incidente. La forma compleja de la apertura crea un desenfoque no uniforme de la imagen en aquellas partes de la escena que no se encuentran en el plano focal de la lente. El grado de desenfoque en la escena, que está relacionado con el desplazamiento desde el plano focal, puede utilizarse para inferir la profundidad. [ 2 ]
Para identificar el tamaño del desenfoque (necesario para decodificar la información de profundidad) en la imagen capturada, se pueden utilizar dos enfoques: 1) eliminar el desenfoque de la imagen capturada con diferentes desenfoques, o 2) aprender algunos filtros lineales que identifiquen el tipo de desenfoque.
El primer método utiliza una deconvolución matemática precisa que tiene en cuenta el patrón de diseño de apertura conocido; esta deconvolución permite identificar dónde y en qué medida la escena se ha distorsionado por la luz desenfocada que incide selectivamente sobre la superficie de captura, y revertir el proceso. [ 3 ] De este modo, se puede recuperar la escena sin desenfoque junto con la magnitud del mismo.
El segundo enfoque, en cambio, extrae la extensión del desenfoque sin recuperar la imagen sin desenfoque y, por lo tanto, sin realizar una convolución inversa. Utilizando una técnica basada en el análisis de componentes principales (PCA), el método aprende fuera de línea un banco de filtros que identifican de forma única cada tamaño de desenfoque; estos filtros se aplican directamente a la imagen capturada, como una convolución normal. [ 4 ] La ventaja más importante de este enfoque es que no se requiere información sobre el patrón de apertura codificado. Debido a su eficiencia, este algoritmo también se ha extendido a secuencias de vídeo con objetos en movimiento y deformables. [ 5 ]
Dado que la profundidad de un punto se infiere a partir del grado de desenfoque causado por la luz que se propaga desde el punto correspondiente en la escena, llegando a través de toda la superficie de la apertura y distorsionándose según esta propagación, se trata de una forma compleja de triangulación estéreo. Cada punto de la imagen se muestrea espacialmente a lo largo del ancho de la apertura.
Esta tecnología se ha utilizado recientemente en el iPhone X. Muchos otros teléfonos de Samsung y ordenadores de Microsoft han intentado utilizarla, pero no emplean el mapeo 3D.
Véase también
- Escáner 3D
- Mapa de profundidad
- Cámara CCD intensificada
- Kinect
- Generador de imágenes de rango dinámico láser
- telémetro láser
- Lidar
- Cámara de campo de luz (cámara plenóptica)
- La técnica de flujo óptico desarrollada para la franquicia Matrix proporciona una solución eficaz al problema de la correspondencia para posibilitar la cinematografía virtual .
- Fotogrametría
- Estructura a partir del movimiento
- Cámara de tiempo de vuelo
Referencias
- ^ Radar láser 3D de alta precisión Jens Busck y Henning Heiselberg, Universidad Danmarks Tekniske, 2004
- ↑ Martinello, Manuel (2012). Imágenes de apertura codificada (PDF) . Universidad Heriot-Watt. Archivado del original (PDF) el 20 de marzo de 2022. Recuperado el 2 de abril de 2017 .
- ↑ Imagen y profundidad de una cámara convencional con apertura codificada. Anat Levin, Rob Fergus, Fredo Durand, William T. Freeman, MIT
- ↑ Martinello, Manuel; Favaro, Paolo (2011). "Deconvolución ciega de una sola imagen con estadísticas de textura de orden superior" (PDF) . Procesamiento de vídeo y vídeo computacional . Notas de clase en informática. Vol. 7082. Springer-Verlag. págs. 124–151 . doi : 10.1007/978-3-642-24870-2_6 . ISBN 978-3-642-24869-6.
- ↑ Martinello, Manuel; Favaro, Paolo (2012). "Estimación de profundidad a partir de una secuencia de vídeo con objetos móviles y deformables". Conferencia IET sobre Procesamiento de Imágenes (IPR 2012) (PDF) . pág. 131. doi : 10.1049/cp.2012.0425 . ISBN 978-1-84919-632-1.
- Bernd Jähne (1997). Manual práctico de procesamiento de imágenes para aplicaciones científicas . CRC Press. ISBN 0-8493-8906-2.
- Linda G. Shapiro y George C. Stockman (2001). Visión por computadora . Prentice Hall. ISBN 0-13-030796-3.
- David A. Forsyth y Jean Ponce (2003). Visión por computadora: un enfoque moderno . Prentice Hall. ISBN 0-12-379777-2.
- Tecnología de sensores de imagen en visión artificial
- Cámaras
- Imágenes 3D