La obtención de imágenes de rango es el nombre que recibe un conjunto de técnicas que se utilizan para producir una imagen 2D que muestra la distancia a los puntos de una escena desde un punto específico, normalmente asociado con algún tipo de dispositivo sensor.
La imagen de rango resultante tiene valores de píxeles que corresponden a la distancia. Si el sensor utilizado para producir la imagen de rango está correctamente calibrado, los valores de los píxeles se pueden expresar directamente en unidades físicas, como metros.
Tipos de cámaras de alcance
El sensor que se utiliza para generar la imagen de profundidad se conoce a veces como cámara de profundidad o cámara de alcance . Las cámaras de profundidad pueden funcionar mediante diversas técnicas, algunas de las cuales se describen a continuación.
Triangulación estéreo
La triangulación estéreo es una aplicación de la estereofotogrametría en la que los datos de profundidad de los píxeles se determinan a partir de datos adquiridos mediante un sistema estéreo o de cámaras múltiples . De esta forma, es posible determinar la profundidad de puntos en la escena, por ejemplo, desde el centro de la línea que une sus focos. Para resolver el problema de medición de profundidad con un sistema de cámaras estéreo, es necesario primero encontrar puntos correspondientes en las diferentes imágenes. Resolver el problema de correspondencia es uno de los principales desafíos al utilizar este tipo de técnica. Por ejemplo, es difícil resolver el problema de correspondencia para puntos de imagen que se encuentran dentro de regiones de intensidad o color homogéneos. En consecuencia, la obtención de imágenes de rango basada en la triangulación estéreo generalmente solo puede producir estimaciones de profundidad fiables para un subconjunto de todos los puntos visibles en las cámaras múltiples.
La ventaja de esta técnica radica en que la medición es prácticamente pasiva; no requiere condiciones especiales de iluminación de la escena. Las demás técnicas mencionadas aquí no tienen que resolver el problema de correspondencia, sino que dependen de condiciones específicas de iluminación de la escena.
Triangulación de lámina de luz
Si la escena se ilumina con una lámina de luz, se crea una línea reflejada vista desde la fuente de luz. Desde cualquier punto fuera del plano de la lámina, la línea suele aparecer como una curva, cuya forma exacta depende tanto de la distancia entre el observador y la fuente de luz como de la distancia entre la fuente de luz y los puntos reflejados. Al observar la lámina de luz reflejada con una cámara (a menudo de alta resolución) y conociendo la posición y la orientación tanto de la cámara como de la fuente de luz, es posible determinar las distancias entre los puntos reflejados y la fuente de luz o la cámara.
By moving either the light source (and normally also the camera) or the scene in front of the camera, a sequence of depth profiles of the scene can be generated. These can be represented as a 2D range image.
Structured light
By illuminating the scene with a specially designed light pattern, structured light, depth can be determined using only a single image of the reflected light. The structured light can be in the form of horizontal and vertical lines, points or checker board patterns. A light stage is basically a generic structured light range imaging device originally created for the job of reflectance capture.
Time-of-flight
The depth can also be measured using the standard time-of-flight (ToF) technique, more or less like a radar, in that a range image similar to a radar image is produced, except that a light pulse is used instead of an RF pulse. It is also not unlike a LIDAR, except that ToF is scannerless, i.e., the entire scene is captured with a single light pulse, as opposed to point-by-point with a rotating laser beam. Time-of-flight cameras are relatively new devices that capture a whole scene in three dimensions with a dedicated image sensor, and therefore have no need for moving parts. A time-of-flight laser radar with a fast gating intensified CCD camera achieves sub-millimeter depth resolution. With this technique a short laser pulse illuminates a scene, and the intensified CCD camera opens its high speed shutter only for a few hundred picoseconds. The 3D information is calculated from a 2D image series that was gathered with increasing delay between the laser pulse and the shutter opening.[1]
Interferometry
By illuminating points with coherent light and measuring the phase shift of the reflected light relative to the light source it is possible to determine depth. Under the assumption that the true range image is a more or less continuous function of the image coordinates, the correct depth can be obtained using a technique called phase-unwrapping. See terrestrial SAR interferometry.
Coded aperture
Depth information may be partially or wholly inferred alongside intensity through reverse convolution of an image captured with a specially designed coded aperture pattern with a specific complex arrangement of holes through which the incoming light is either allowed through or blocked. The complex shape of the aperture creates a non-uniform blurring of the image for those parts of the scene not at the focal plane of the lens. The extent of blurring across the scene, which is related to the displacement from the focal plane, may be used to infer the depth.[2]
Para identificar el tamaño del desenfoque (necesario para decodificar la información de profundidad) en la imagen capturada, se pueden utilizar dos enfoques: 1) eliminar el desenfoque de la imagen capturada con diferentes desenfoques, o 2) aprender algunos filtros lineales que identifiquen el tipo de desenfoque.
El primer método utiliza una deconvolución matemática precisa que tiene en cuenta el patrón de diseño de apertura conocido; esta deconvolución permite identificar dónde y en qué medida la escena se ha distorsionado por la luz desenfocada que incide selectivamente sobre la superficie de captura, y revertir el proceso. [ 3 ] De este modo, se puede recuperar la escena sin desenfoque junto con la magnitud del mismo.
El segundo enfoque, en cambio, extrae la extensión del desenfoque sin recuperar la imagen sin desenfoque y, por lo tanto, sin realizar una convolución inversa. Utilizando una técnica basada en el análisis de componentes principales (PCA), el método aprende fuera de línea un banco de filtros que identifican de forma única cada tamaño de desenfoque; estos filtros se aplican directamente a la imagen capturada, como una convolución normal. [ 4 ] La ventaja más importante de este enfoque es que no se requiere información sobre el patrón de apertura codificado. Debido a su eficiencia, este algoritmo también se ha extendido a secuencias de vídeo con objetos en movimiento y deformables. [ 5 ]
Dado que la profundidad de un punto se infiere a partir del grado de desenfoque causado por la luz que se propaga desde el punto correspondiente en la escena, llegando a través de toda la superficie de la apertura y distorsionándose según esta propagación, se trata de una forma compleja de triangulación estéreo. Cada punto de la imagen se muestrea espacialmente a lo largo del ancho de la apertura.
Esta tecnología se ha utilizado recientemente en el iPhone X. Muchos otros teléfonos de Samsung y ordenadores de Microsoft han intentado utilizarla, pero no emplean el mapeo 3D.
Véase también
- Escáner 3D
- Mapa de profundidad
- Cámara CCD intensificada
- Kinect
- Generador de imágenes de rango dinámico láser
- telémetro láser
- Lidar
- Cámara de campo de luz (cámara plenóptica)
- La técnica de flujo óptico desarrollada para la franquicia Matrix proporciona una solución eficaz al problema de la correspondencia para posibilitar la cinematografía virtual .
- Fotogrametría
- Estructura a partir del movimiento
- Cámara de tiempo de vuelo
Referencias
- ^ Radar láser 3D de alta precisión Jens Busck y Henning Heiselberg, Universidad Danmarks Tekniske, 2004
- ↑ Martinello, Manuel (2012). Imágenes de apertura codificada (PDF) . Universidad Heriot-Watt. Archivado del original (PDF) el 20 de marzo de 2022. Recuperado el 2 de abril de 2017 .
- ↑ Imagen y profundidad de una cámara convencional con apertura codificada. Anat Levin, Rob Fergus, Fredo Durand, William T. Freeman, MIT
- ↑ Martinello, Manuel; Favaro, Paolo (2011). "Deconvolución ciega de una sola imagen con estadísticas de textura de orden superior" (PDF) . Procesamiento de vídeo y vídeo computacional . Notas de clase en informática. Vol. 7082. Springer-Verlag. págs. 124–151 . doi : 10.1007/978-3-642-24870-2_6 . ISBN 978-3-642-24869-6.
- ↑ Martinello, Manuel; Favaro, Paolo (2012). "Estimación de profundidad a partir de una secuencia de vídeo con objetos móviles y deformables". Conferencia IET sobre Procesamiento de Imágenes (IPR 2012) (PDF) . pág. 131. doi : 10.1049/cp.2012.0425 . ISBN 978-1-84919-632-1.
- Bernd Jähne (1997). Manual práctico de procesamiento de imágenes para aplicaciones científicas . CRC Press. ISBN 0-8493-8906-2.
- Linda G. Shapiro y George C. Stockman (2001). Visión por computadora . Prentice Hall. ISBN 0-13-030796-3.
- David A. Forsyth y Jean Ponce (2003). Visión por computadora: un enfoque moderno . Prentice Hall. ISBN 0-12-379777-2.
- Tecnología de sensores de imagen en visión artificial
- Cámaras
- Imágenes 3D