El problema de correspondencia , como base para el cálculo del flujo óptico y la correspondencia estéreo, es un problema fundamental en el procesamiento de imágenes . [ 1 ] Se refiere al problema en visión por computadora de determinar qué partes de una imagen corresponden a qué partes de otra imagen, [ 2 ] donde las diferencias se deben al movimiento de la cámara, el transcurso del tiempo y/o el movimiento de los objetos en las fotos. Está relacionado con el registro de imágenes , que consiste en encontrar una transformación geométrica que alinee los puntos correspondientes uno encima del otro.
La correspondencia es, sin duda, el elemento fundamental en muchas aplicaciones relacionadas: flujo óptico (en el que las dos imágenes son consecutivas en el tiempo), visión estéreo densa (en la que las dos imágenes provienen de un par de cámaras estéreo), reconstrucción 3D a partir del movimiento (SfM) y SLAM visual (en el que las imágenes provienen de vistas diferentes pero parcialmente superpuestas de una escena), y correspondencia entre escenas (en la que las imágenes provienen de escenas completamente diferentes).
Un método sencillo para encontrar correspondencias es PatchMatch . Los algoritmos de correspondencia modernos utilizan redes neuronales para encontrar correspondencias de forma rápida y con alta precisión. El influyente investigador de visión artificial Takeo Kanade afirmó en una ocasión que los tres problemas fundamentales de la visión artificial son: «¡Correspondencia, correspondencia y correspondencia!». [ 3 ] Sin embargo, el problema se considera ahora resuelto.
Lo esencial
Dadas dos o más imágenes de la misma escena 3D, tomadas desde diferentes puntos de vista, el problema de correspondencia se refiere a la tarea de encontrar un conjunto de puntos en una imagen que puedan identificarse como los mismos puntos en otra imagen. Para ello, se comparan los puntos o características de una imagen con los puntos o características de otra imagen, estableciendo así puntos o características correspondientes , también conocidos como puntos homólogos o características homólogas . Las imágenes pueden tomarse desde diferentes puntos de vista, en diferentes momentos o con objetos en la escena en movimiento general con respecto a la(s) cámara(s). Encontrar píxeles correspondientes en imágenes estéreo se conoce como el problema de correspondencia. El resultado suele ser un mapa de disparidad, en el que se determina un vector de desplazamiento al píxel correspondiente de la otra imagen para cada píxel de una imagen. Para este propósito, debe establecerse una correspondencia única entre los puntos de las imágenes individuales. Dado que la asignación de los píxeles puede ser muy ambigua y no siempre es posible, el problema de correspondencia también se denomina problema "mal condicionado", según la definición de Hadamard . [ 4 ] Además, la solución del problema de correspondencia se dificulta por las distorsiones de perspectiva, el ruido y las diferencias de iluminación y contraste entre las imágenes.
El problema de correspondencia puede presentarse en una situación estereoscópica cuando se utilizan dos imágenes de la misma escena, o puede generalizarse al problema de correspondencia de N vistas. En este último caso, las imágenes pueden provenir de N cámaras diferentes que fotografían simultáneamente o de una sola cámara que se mueve con respecto a la escena. El problema se complica cuando los objetos de la escena se mueven con respecto a la(s) cámara(s).
Una aplicación típica del problema de correspondencia se da en la creación de panoramas o en el ensamblaje de imágenes , cuando se van a unir dos o más imágenes con una pequeña superposición para formar una imagen compuesta de mayor tamaño. En este caso, es necesario identificar un conjunto de puntos correspondientes en un par de imágenes para calcular la transformación de una de ellas y unirla a la otra.
oclusiones

Una de las fuentes de error más significativas en la determinación de la correspondencia estereoscópica es la presencia de áreas en una escena que solo son visibles desde la perspectiva de una cámara. Para las áreas de la imagen en las que se mapean estas regiones de la escena, no existen elementos correspondientes en la otra imagen estéreo. Estas áreas de la imagen se denominan oclusiones. Si las oclusiones no se tienen en cuenta adecuadamente durante la determinación de la correspondencia, se producen errores de corrección más o menos pronunciados, según el método empleado, lo que resulta en una reconstrucción de profundidad inexacta. Por lo tanto, las oclusiones representan un problema grave en el procesamiento de imágenes estéreo. [ 6 ]
Problema de apertura

En una geometría estéreo con ejes ópticos paralelos, el desplazamiento de los puntos de imagen correspondientes en un par de imágenes estéreo siempre es paralelo a la base estéreo. Conociendo con precisión la geometría de la cámara, se puede determinar de antemano la dirección de la disparidad, simplificando así significativamente la búsqueda de los puntos de imagen correspondientes. Sin embargo, las regiones de la imagen donde no se producen estructuras ni cambios de intensidad en la dirección de la base estéreo plantean un problema. En este caso, no se puede detectar el desplazamiento de los puntos de imagen correspondientes. Dado que la detección del desplazamiento en estereoscopía suele ser realizada por un operador local, ignorando el resto de la escena, este problema también se considera un caso especial del llamado problema de apertura, que es de particular importancia en el análisis de movimiento (flujo óptico). [ 7 ]
Limitaciones en el procesamiento de imágenes estéreo
Debido a su naturaleza específica, el problema de correspondencia, al igual que muchos otros problemas mal condicionados, solo puede resolverse de forma única aprovechando el conocimiento previo apropiado. Con la ayuda de este conocimiento previo, el espacio de soluciones se reduce adecuadamente y el problema se transforma en un problema "bien condicionado". [ 4 ] Las restricciones del espacio de soluciones se relacionan, por un lado, con el proceso de imagen y la geometría de las cámaras utilizadas (restricción epipolar y de unicidad) y, por otro lado, con propiedades postuladas de la escena observada (restricciones de continuidad, orden y gradiente).
Algoritmos
La asignación de elementos de imagen correspondientes en el procesamiento digital de imágenes se puede realizar mediante diversos algoritmos y métodos matemáticos. Estos métodos difieren, a veces considerablemente, en su susceptibilidad a errores y en el esfuerzo computacional requerido.
Basado en el área
En los métodos basados en áreas, las áreas individuales de las imágenes estéreo se asignan en función de los valores de escala de grises o del entorno local de un píxel. La correspondencia de las áreas de la imagen se determina generalmente calculando una medida de similitud, como una correlación cruzada local. En el caso más simple, la disparidad surge del desplazamiento de las regiones de la imagen entre las imágenes izquierda y derecha que presentan el mayor grado de correspondencia. Algunos de estos métodos utilizan un operador de interés para seleccionar primero áreas con propiedades específicas de cada imagen antes de determinar la correspondencia; estas áreas se combinan posteriormente. [ 8 ]
Basado en características
La mayoría de los métodos estereoscópicos existentes se pueden clasificar como métodos basados en características. Esta técnica implica extraer primero características de los datos de la imagen que la describen a un nivel más abstracto. Posteriormente, se realiza un análisis de correspondencia a nivel de características. Las características más utilizadas son los bordes, los puntos de línea o vértice y los segmentos de borde o línea. Los filtros de diferenciación, que extraen variaciones de escala de grises como bordes o líneas de las señales de la imagen, tienen una importancia fundamental en estos métodos. [ 9 ]
Basado en fases
La base de los métodos denominados basados en fase para medir la disparidad es el teorema de desplazamiento de la transformada de Fourier . Sin embargo, en el procesamiento de imágenes estéreo, un desplazamiento puramente global entre las imágenes generalmente no es posible, ya que los objetos a diferentes distancias del sistema de cámara presentan diferentes valores de disparidad en las imágenes estéreo. En consecuencia, los desplazamientos de las áreas de imagen correspondientes en el par de imágenes estéreo deben determinarse mediante operadores locales, de modo que la correlación de fase generalmente solo tiene sentido en combinación con una transformada de Fourier limitada a áreas de imagen más pequeñas. Los métodos basados en fase más importantes son los denominados métodos de diferencia de fase. Con estas técnicas, la información de fase se deriva de la respuesta de pares de filtros complejos utilizados para filtrar las imágenes de entrada. Un requisito clave para este método es que la fase de las respuestas del filtro sea aproximadamente una función lineal de la posición. Esta propiedad se puede lograr si la función de transferencia del filtro no tiene desplazamiento y se anula para frecuencias negativas. Esta propiedad se denomina comportamiento de cuadratura. [ 10 ] Dado que la información de fase es invariante con respecto a la amplitud de las respuestas del filtro, los métodos basados en fase también son relativamente robustos con respecto a las diferencias de iluminación y contraste interoculares. Sin embargo, debido a la ambigüedad en el cálculo de la fase, solo se pueden medir valores de disparidad de hasta la mitad de la longitud de onda de modulación del filtro utilizado. Al igual que muchos otros enfoques, los métodos basados en fase también son muy sensibles a las oclusiones. [ 6 ]
Eliminar las ambigüedades
Según la restricción de unicidad, a cada píxel solo se le puede asignar una disparidad y, por lo tanto, como máximo una ubicación en el espacio considerado (esto excluye las superficies semitransparentes). Sin embargo, no se pueden descartar ambigüedades con ningún método local o basado en características (las áreas más similares en las imágenes estéreo no necesariamente pertenecen juntas). Se utilizan diferentes métodos para resolver este problema, según el enfoque: en los llamados métodos de regularización, se formulan funciones de costo o energía, teniendo en cuenta las restricciones (ver fundamentos), y luego se busca el mínimo global dentro de estas funciones. Otro enfoque está representado por los métodos de relajación. En la mayoría de los enfoques que aplican este método en estereoscopía, primero se extraen características o regiones de la imagen con propiedades especiales de los datos de la imagen. Luego se asignan los llamados nodos a las coordenadas de la imagen donde aparecen estos elementos. Cada uno de estos nodos está además equipado con un conjunto de variables, cada una de las cuales representa una correspondencia entre el nodo respectivo y diferentes elementos en la otra imagen. Estas variables se interpretan como probabilidades [ 1 ] o como actividad neuronal [ 4 ] (redes neuronales), según el enfoque. Al inicio del proceso de relajación, las variables se inicializan en función de la similitud de las características o valores de píxeles correspondientes. Posteriormente, los valores de las variables se actualizan iterativamente en un proceso dinámico, donde las violaciones de las restricciones tienen un efecto inhibidor o reductor y el cumplimiento de las restricciones tiene un efecto reforzador. Se obtiene un mapa de disparidad claro cuando se alcanza un estado estacionario. Mediante un acoplamiento adecuado, también se pueden suprimir las atribuciones erróneas causadas por oclusiones. [ 5 ]
Usar
En visión artificial, el problema de correspondencia se estudia cuando un ordenador debe resolverlo automáticamente utilizando únicamente imágenes como entrada. Una vez resuelto el problema de correspondencia, obteniendo un conjunto de puntos de imagen que se corresponden, se pueden aplicar otros métodos a este conjunto para reconstruir la posición, el movimiento y/o la rotación de los puntos 3D correspondientes en la escena.
El problema de correspondencia es también la base de la técnica de medición de velocimetría de imágenes de partículas , que hoy en día se utiliza ampliamente en el campo de la mecánica de fluidos para medir cuantitativamente el movimiento de los fluidos.
Véase también
- Estereoscopia
- Paralaje
- Fotogrametría
- Percepción de profundidad
- Estereopsis
- visión por computadora
- Matriz fundamental
- Algoritmo de ramificación y acotación de compatibilidad conjunta
- Geometría epipolar
- Registro de imágenes
- Disimilitud Birchfield-Tomasi
- Transformación de características invariantes a la escala (SIFT)
Referencias
- 1 2 Ramin Zabih, John Woodfill (1994), "Transformaciones locales no paramétricas para el cálculo de correspondencias visuales", Visión por computadora — ECCV '94 , Notas de clase en ciencias de la computación, vol. 801, Springer, Berlín, Heidelberg, pp. 151–158 , doi : 10.1007/bfb0028345 , ISBN 3-540-57957-5
- ↑ W. Bach; JK Aggarwal (29 de febrero de 1988). Comprensión del movimiento: visión robótica y humana . Springer Science & Business Media. ISBN 978-0-89838-258-7.
- ↑ X. Wang (septiembre de 2019). Aprendizaje y razonamiento con correspondencia visual en el tiempo .
- 1 2 3 Bertero, M.; Poggio, TA; Torre, V. (agosto de 1988). "Problemas mal planteados en la visión temprana". Actas del IEEE . 76 (8): 869– 889. Bibcode : 1988IEEEP..76..869B . doi : 10.1109/5.5962 . hdl : 1721.1/5596 .
- ^ Ralph Trapp (1998), "Stereoskopische Korrespondenzbestimmung mit impliziter Detektion von Okklusionen.", HNI - Verlagsschriftenreihe , vol. 43, HNI-Verlag, ISBN 3-931466-42-6
- 1 2 Trapp, Ralph; Druee, Siegbert; Hartmann, Georg (mayo de 1998). "Coincidencia estéreo con detección implícita de oclusiones". En Burkhardt, H.; Neumann, B. (eds.). Lecture Notes in Computer Science-ECCV 1998. Vol. 1407. Berlín/Heidelberg/Nueva York: Springer. pp. 17–33 . doi : 10.1007/BFb0054731 . ISBN 978-3-540-69235-5.
- ↑ Bernd Jähne (1993), Digitale Bildverarbeitung , Berlín: Springer, doi : 10.1007/978-3-662-22662-9 , ISBN 3-662-22662-6
- ↑ Stephen T. Barnard, William B. Thompson (julio de 1980), "Análisis de disparidad de imágenes", Transactions on Pattern Analysis and Machine Intelligence , vol. PAMI-2, n.º 4, págs. 333–340 , Bibcode : 1980ITPAM...2..333B , doi : 10.1109/TPAMI.1980.4767032
- ↑ D. Marr, E. Hildreth (1980), "Teoría de la detección de bordes", Actas de la Royal Society de Londres , vol. B 207, n.º 1167, págs. 187–217 , Bibcode : 1980RSPSB.207..187M , doi : 10.1098/rspb.1980.0020 , PMID 6102765
- ↑ Westelius, C.; Knutson, H.; Wiklund, J.; Westin, C. (diciembre de 1994). Crowley, L.; Christensen, HI (eds.). "Estimación de disparidad basada en fase". Vision as Process: Basic Research on Computer Vision Systems . Springer: 157–178 . ISBN 978-3-540-58143-7.
Enlaces externos
- Página de Middlebury Stereo Vision
- Geometría en visión por computadora
- Estereoscopia