En visión artificial , el reconocimiento de objetos 3D implica reconocer y determinar información tridimensional, como la pose , el volumen o la forma, de objetos 3D seleccionados por el usuario en una fotografía o escaneo de rango . Normalmente, se presenta un ejemplo del objeto a reconocer a un sistema de visión en un entorno controlado, y luego, para una entrada arbitraria, como una secuencia de vídeo , el sistema localiza el objeto presentado previamente. Esto puede hacerse fuera de línea o en tiempo real . Los algoritmos para resolver este problema están especializados en la localización de un único objeto preidentificado, y se diferencian de los algoritmos que operan con clases generales de objetos, como los sistemas de reconocimiento facial o el reconocimiento genérico de objetos 3D. Debido al bajo coste y la facilidad de adquisición de fotografías, se ha dedicado una cantidad significativa de investigación al reconocimiento de objetos 3D en fotografías.
Reconocimiento de objetos individuales en 3D en fotografías
El método de reconocimiento de un objeto 3D depende de sus propiedades. Para simplificar, muchos algoritmos existentes se han centrado en el reconocimiento de objetos rígidos compuestos por una sola parte, es decir, objetos cuya transformación espacial es un movimiento euclidiano . Se han adoptado dos enfoques generales para abordar este problema: los enfoques de reconocimiento de patrones utilizan información de apariencia de la imagen de bajo nivel para localizar un objeto, mientras que los enfoques geométricos basados en características construyen un modelo del objeto a reconocer y lo comparan con la fotografía.
Enfoques de reconocimiento de patrones
Estos métodos utilizan información de apariencia obtenida a partir de proyecciones precapturadas o precalculadas de un objeto para identificarlo en una escena potencialmente compleja. Sin embargo, no consideran las restricciones geométricas tridimensionales del objeto durante el proceso de identificación y, por lo general, tampoco manejan la oclusión tan bien como los métodos basados en características. Véanse [Murase y Nayar 1995] y [Selinger y Nelson 1999].
Enfoques geométricos basados en características

Los métodos basados en características funcionan bien para objetos con rasgos distintivos. Hasta ahora, se han reconocido con éxito objetos con buenas características de borde o de contorno ; por ejemplo, los algoritmos de detección Harris affine region detector y SIFT , respectivamente. Debido a la falta de detectores de características adecuados, este método no permite actualmente el procesamiento de objetos sin superficies lisas ni texturizadas.
Los reconocedores de objetos basados en características generalmente funcionan capturando previamente una serie de vistas fijas del objeto que se va a reconocer, extrayendo características de estas vistas y, luego, en el proceso de reconocimiento, comparando estas características con la escena e imponiendo restricciones geométricas.
Como ejemplo de un sistema prototípico que adopta este enfoque, presentaremos un resumen del método utilizado por [Rothganger et al. 2004], omitiendo algunos detalles. El método parte de la suposición de que los objetos experimentan transformaciones globalmente rígidas. Dado que las superficies lisas son localmente planas, las características invariantes afines son apropiadas para la coincidencia: el artículo detecta regiones de interés con forma de elipse utilizando características tanto de borde como de mancha, y, como en [Lowe 2004], encuentra la dirección del gradiente dominante de la elipse, la convierte en un paralelogramo y aplica un descriptor SIFT al paralelogramo resultante. La información de color también se utiliza para mejorar la discriminación con respecto a las características SIFT por sí solas.

A continuación, dado un número de vistas de cámara del objeto (24 en el artículo), el método construye un modelo 3D para el objeto, que contiene la posición espacial 3D y la orientación de cada característica. Debido a que el número de vistas del objeto es grande, normalmente cada característica está presente en varias vistas adyacentes. Los puntos centrales de dichas características coincidentes se corresponden, y las características detectadas están alineadas a lo largo de la dirección del gradiente dominante, por lo que los puntos en (1, 0) en el sistema de coordenadas local del paralelogramo de características también se corresponden, al igual que los puntos (0, 1) en las coordenadas locales del paralelogramo. Por lo tanto, para cada par de características coincidentes en vistas cercanas, se conocen tres correspondencias de pares de puntos. Dado al menos dos características coincidentes, se puede utilizar un algoritmo de estructura afín a partir del movimiento de múltiples vistas (véase [Tomasi y Kanade 1992]) para construir una estimación de las posiciones de los puntos (hasta una transformación afín arbitraria). El artículo de Rothganger et al. Por lo tanto, selecciona dos vistas adyacentes, utiliza un método similar a RANSAC para seleccionar dos pares de características correspondientes y agrega nuevas características al modelo parcial construido por RANSAC siempre que estén bajo un término de error. Así, para cualquier par de vistas adyacentes, el algoritmo crea un modelo parcial con todas las características visibles en ambas vistas.

Para generar un modelo unificado, el artículo toma el modelo parcial más grande y alinea incrementalmente todos los modelos parciales más pequeños con él. Se utiliza la minimización global para reducir el error, y luego se aplica una actualización euclidiana para cambiar las posiciones de las características del modelo, pasando de coordenadas 3D únicas salvo transformación afín a coordenadas 3D únicas salvo movimiento euclidiano . Al final de este paso, se obtiene un modelo del objeto objetivo, compuesto por características proyectadas en un espacio 3D común.
Para reconocer un objeto en una imagen de entrada arbitraria, el artículo detecta características y luego utiliza RANSAC para encontrar la matriz de proyección afín que mejor se ajusta al modelo de objeto unificado en la escena 2D. Si este enfoque RANSAC tiene un margen de error suficientemente bajo, entonces, en caso de éxito, el algoritmo reconoce el objeto y proporciona su pose en términos de una proyección afín. Bajo las condiciones supuestas, el método suele alcanzar tasas de reconocimiento de alrededor del 95 %.
Referencias
- Murase, H. y SK Nayar: 1995, Aprendizaje visual y reconocimiento de objetos 3D a partir de su apariencia . International Journal of Computer Vision 14, 5–24.
- Selinger, A. y R. Nelson: 1999, Una jerarquía de agrupamiento perceptivo para el reconocimiento de objetos 3D basado en la apariencia. Computer Vision and Image Understanding 76(1), 83–92.
- Rothganger, F; S. Lazebnik, C. Schmid y J. Ponce: 2004. Modelado y reconocimiento de objetos 3D utilizando descriptores de imagen invariantes afines locales y restricciones espaciales multivista , ICCV.
- Lowe, D.: 2004, Características distintivas de imágenes a partir de puntos clave invariantes a la escala. International Journal of Computer Vision. En prensa.
- Tomasi, C. y T. Kanade: 1992, Forma y movimiento a partir de secuencias de imágenes: un método de factorización. International Journal of Computer Vision 9(2), 137–154.
Véase también
- Reconocimiento y categorización de objetos
- Imágenes 3D