En los campos de la informática y la visión por computadora , la pose (o pose espacial ) representa la posición y la orientación de un objeto, generalmente en tres dimensiones . [ 1 ] Las poses suelen almacenarse internamente como matrices de transformación . [ 2 ] [ 3 ] El término «pose» es en gran medida sinónimo del término «transformación», pero una transformación a menudo puede incluir la escala , mientras que la pose no. [ 4 ] [ 5 ]
En visión artificial, la pose de un objeto se estima a menudo a partir de la información de la cámara mediante el proceso de estimación de pose . Esta información se puede utilizar, por ejemplo, para permitir que un robot manipule un objeto o evite chocar con él en función de su posición y orientación percibidas en el entorno. Otras aplicaciones incluyen el reconocimiento de acciones esqueléticas.
Estimación de la pose
La tarea específica de determinar la pose de un objeto en una imagen (o imágenes estéreo, secuencia de imágenes) se denomina estimación de pose . Los problemas de estimación de pose se pueden resolver de diferentes maneras según la configuración del sensor de imagen y la metodología elegida. Se pueden distinguir tres clases de metodologías:
- Métodos analíticos o geométricos: Dado que el sensor de imagen (cámara) está calibrado y se conoce la correspondencia entre los puntos 3D de la escena y los puntos 2D de la imagen, y si además se conoce la geometría del objeto, la imagen proyectada del objeto sobre la imagen de la cámara es una función bien conocida de su pose. Una vez identificados un conjunto de puntos de control en el objeto, generalmente esquinas u otros puntos característicos, es posible resolver la transformación de pose a partir de un conjunto de ecuaciones que relacionan las coordenadas 3D de los puntos con sus coordenadas 2D en la imagen. Los algoritmos que determinan la pose de una nube de puntos con respecto a otra se denominan algoritmos de registro de conjuntos de puntos , si no se conocen previamente las correspondencias entre los puntos.
- Métodos de algoritmos genéticos : Si no es necesario calcular la pose de un objeto en tiempo real, se puede utilizar un algoritmo genético . Este enfoque es robusto, especialmente cuando las imágenes no están perfectamente calibradas. En este caso particular, la pose representa la representación genética y el error entre la proyección de los puntos de control del objeto y la imagen es la función de aptitud .
- Métodos basados en aprendizaje: Estos métodos utilizan un sistema de aprendizaje automático que aprende la correspondencia entre las características de la imagen 2D y la transformación de la pose. En resumen, esto significa que se debe presentar al sistema un conjunto suficientemente grande de imágenes del objeto, en diferentes poses, durante una fase de aprendizaje. Una vez completada la fase de aprendizaje, el sistema debería ser capaz de proporcionar una estimación de la pose del objeto a partir de una imagen del mismo.
Pose de cámara
La reconstrucción de la cámara es el proceso de estimar los parámetros de un modelo de cámara estenopeica que se aproxima a la cámara que produjo una fotografía o video determinado; determina qué rayo de luz incidente se asocia con cada píxel de la imagen resultante. Básicamente, el proceso determina la posición de la cámara estenopeica.
Por lo general, los parámetros de la cámara se representan en una matriz de proyección de 3 × 4 llamada matriz de la cámara . Los parámetros extrínsecos definen la pose de la cámara (posición y orientación), mientras que los parámetros intrínsecos especifican el formato de imagen de la cámara (distancia focal, tamaño de píxel y origen de la imagen).
Este proceso se suele denominar calibración geométrica de la cámara o simplemente calibración de la cámara, aunque este término también puede referirse a la calibración fotométrica o limitarse a la estimación de los parámetros intrínsecos. La orientación exterior y la orientación interior se refieren a la determinación de los parámetros extrínsecos e intrínsecos, respectivamente.
La calibración clásica de la cámara requiere objetos especiales en la escena, algo que no es necesario en la autocalibración . El seccionamiento de la cámara se utiliza a menudo en la visión estéreo, donde las matrices de proyección de dos cámaras se emplean para calcular las coordenadas 3D de un punto visto por ambas.
Véase también
Referencias
- ↑ Hoff, William A.; Nguyen, Khoi; Lyon, Torsten (1996-10-29). "Técnicas de registro basadas en visión por computadora para realidad aumentada". En Casasent, David P. (ed.). Robots inteligentes y visión por computadora XV: algoritmos, técnicas, visión activa y manejo de materiales . Actas de SPIE. Vol. 2904. SPIE. págs. 538–548 . Bibcode : 1996SPIE.2904..538H . doi : 10.1117/12.256311 . S2CID 6587175 .
- ↑ "Pose (Posición y Orientación)" .
- ↑ "Matrices de transformación a geometry_msgs/Pose - ROS Answers: Foro de preguntas y respuestas de código abierto" . 27 de mayo de 2021.
- ↑ "Drake: Pose espacial y transformación" .
- ↑ "Documentación para desarrolladores de Apple" .
- visión por computadora
- Geometría en visión por computadora
- Control de robots