En el análisis de imágenes , el tensor de estructura generalizada (GST) es una extensión del tensor de estructura cartesiana a coordenadas curvilíneas . [ 1 ] Se utiliza principalmente para detectar y representar los parámetros de "dirección" de las curvas, al igual que el tensor de estructura cartesiana detecta y representa la dirección en coordenadas cartesianas. Las familias de curvas generadas por pares de funciones localmente ortogonales han sido las más estudiadas.
Es un método ampliamente conocido en aplicaciones de procesamiento de imágenes y video, incluyendo visión por computadora, como la identificación biométrica por huellas dactilares, [ 2 ] y estudios de secciones de tejido humano. [ 3 ] [ 4 ]
GST en 2D y bases localmente ortogonales
Sea el término imagen una funcióndóndeson variables reales y, yson funciones de valor real. GST representa la dirección a lo largo de la cual la imagenpuede sufrir una traslación infinitesimal con un error mínimo ( de mínimos cuadrados totales ), a lo largo de las "líneas" que cumplen las siguientes condiciones:
1. Las "líneas" son líneas ordinarias en el sistema de coordenadas curvilíneas.
que son curvas en coordenadas cartesianas como se muestra en la ecuación anterior. El error se mide en elEl sentido y la minimalidad del error se refieren, por lo tanto, a la norma L2 .
2. Las funcionesconstituyen un par armónico, es decir, cumplen las ecuaciones de Cauchy-Riemann ,
En consecuencia, tales coordenadas curvilíneasson localmente ortogonales.
Entonces, el GST consiste en
dóndeson errores de traslación (infinitesimal) en la mejor dirección (designada por el ángulo) y la peor dirección (designada por). La funciónes la función de ventana que define la "escala exterior" en la que la detección dese llevará a cabo, lo cual puede omitirse si ya está incluido eno sies la imagen completa (en lugar de local). La matrizes la matriz identidad . Usando la regla de la cadena , se puede demostrar que la integración anterior se puede implementar como convoluciones en coordenadas cartesianas aplicadas al tensor de estructura ordinaria cuandoEmparejar las partes real e imaginaria de una función analítica,
dónde. [ 5 ] Ejemplos de funciones analíticas incluyen, así como los monomios,, dóndees un número entero positivo o negativo arbitrario. Los monomiosEn visión artificial y procesamiento de imágenes, también se las conoce como funciones armónicas .
Por lo tanto, el tensor de estructura cartesiana es un caso especial de GST donde, y, es decir, la función armónica es simplementePor lo tanto, al elegir una función armónica, se pueden detectar todas las curvas que son combinaciones lineales de sus partes real e imaginaria mediante convoluciones solo en cuadrículas de imágenes (rectangulares), incluso sino son cartesianos. Además, los cálculos de convolución se pueden realizar utilizando filtros complejos aplicados a la versión compleja del tensor de estructura. Por lo tanto, las implementaciones de GST se han realizado frecuentemente utilizando la versión compleja del tensor de estructura, en lugar del tensor (1,1).
Versión compleja del GST
Así como existe una versión compleja del tensor de estructura ordinaria , también existe una versión compleja del GST.
que es idéntico a su primo con la diferencia de quees un filtro complejo. Cabe recordar que el tensor de estructura ordinariaes un filtro real, generalmente definido por una gaussiana muestreada y escalada para delimitar el vecindario, también conocido como escala exterior. Esta simplicidad es una razón por la que las implementaciones de GST han utilizado predominantemente la versión compleja anterior. Para familias de curvasdefinido por funciones analíticas, se puede demostrar que, [ 1 ] la función que define el vecindario es de valor complejo,
- ,
una denominada derivada simétrica de una gaussiana. De este modo, la variación en función de la orientación del patrón que se busca se incorpora directamente a la función que define el vecindario, y la detección se produce en el espacio del tensor de estructura (ordinario).
Concepto básico para su uso en el procesamiento de imágenes y la visión por computadora.
Detección eficiente deen imágenes es posible mediante el procesamiento de imágenes para un par,Las convoluciones complejas (o las operaciones matriciales correspondientes) y las aplicaciones no lineales puntuales son los elementos computacionales básicos de las implementaciones de GST. Una estimación de mínimos cuadrados totales dese obtiene entonces junto con los dos errores,y. En analogía con el tensor de estructura cartesiana , el ángulo estimado está en representación de ángulo doble, es decirse entrega mediante cálculos y puede utilizarse como una característica de forma, mientras quesolo o en combinación conpuede utilizarse como medida de calidad (confianza, certeza) para la estimación del ángulo.
Las espirales logarítmicas, incluidos los círculos, pueden detectarse, por ejemplo, mediante convoluciones (complejas) y mapeos no lineales. [ 1 ] Las espirales pueden estar en imágenes en escala de grises (con valores) o en una imagen binaria , es decir, las ubicaciones de los elementos de borde de los patrones en cuestión, como los contornos de círculos o espirales, no deben conocerse ni marcarse de otra manera.
El tensor de estructura generalizada puede utilizarse como alternativa a la transformada de Hough en el procesamiento de imágenes y la visión artificial para detectar patrones cuyas orientaciones locales pueden modelarse, por ejemplo, puntos de unión. Las principales diferencias son:
- Se permiten tanto el voto negativo como el voto complejo;
- Con una sola plantilla se pueden detectar múltiples patrones pertenecientes a la misma familia;
- No es necesaria la binarización de la imagen.
Interpretación física y matemática
Las coordenadas curvilíneas de GST pueden explicar los procesos físicos aplicados a las imágenes. Un par de procesos bien conocidos consisten en la rotación y el zoom. Estos están relacionados con la transformación de coordenadas.y.
Si una imagenconsiste en isocurvas que pueden explicarse únicamentees decir, sus isocurvas consisten en círculos, dóndeSi se define una función diferenciable de valor real en 1D, la imagen es invariante a las rotaciones (alrededor del origen).
La operación de zoom (que incluye el deszoom) se modela de manera similar. Si la imagen tiene isocurvas que parecen una "estrella" o radios de bicicleta, es decirpara alguna función 1D diferenciableentonces, la imagenes invariante a la escala (con respecto al origen).
En combinación,
es invariante a una cierta cantidad de rotación combinada con escalado, donde la cantidad se precisa mediante el parámetro.
De forma análoga, el tensor de estructura cartesiana también es una representación de una traslación . Aquí, el proceso físico consiste en una traslación ordinaria de cierta cantidad a lo largo del eje y.combinado con la traducción a lo largo,
donde la cantidad se especifica mediante el parámetroEvidentementeAquí se representa la dirección de la línea.
En general, la estimaciónrepresenta la dirección (encoordenadas) a lo largo de las cuales las traslaciones infinitesimales dejan la imagen invariante, en la práctica la menos variante. Con cada par de base de coordenadas curvilíneas, hay así un par de traslaciones infinitesimales, una combinación lineal de las cuales es un operador diferencial . Estos últimos están relacionados con el álgebra de Lie .
Misceláneas
En el contexto de la GST, "imagen" puede referirse tanto a una imagen ordinaria como a un entorno de imagen (imagen local), según el contexto. Por ejemplo, una fotografía es una imagen, al igual que cualquier entorno de imagen que contenga.
Véase también
Referencias
- 1 2 3 Bigun, J.; Bigun, T.; Nilsson, K. (diciembre de 2004). "Reconocimiento mediante derivadas de simetría y el tensor de estructura generalizada" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 26 (12): 1590– 1605. Bibcode : 2004ITPAM..26.1590B . doi : 10.1109/TPAMI.2004.126 . PMID 15573820. S2CID 602221 .
- ↑ Fronthaler, H.; Kollreider, K.; Bigun, J. (2008). "Características locales para la mejora y extracción de minucias en huellas dactilares" . IEEE Transactions on Image Processing . 17 (3): 354– 363. Bibcode : 2008ITIP...17..354F . CiteSeerX 10.1.1.160.6312 . doi : 10.1109/TIP.2007.916155 . PMID 18270124. S2CID 7119251 .
- ↑ O. Schmitt; H. Birkholz (2010). "Mejora en el mapeo citoarquitectónico mediante la combinación de modelado electrodinámico con orientación local en imágenes de alta resolución de la corteza cerebral" . IEEE Transactions on Image Processing . 74 (3): 225– 243. doi : 10.1109/TIP.2007.916155 . PMID 18270124. S2CID 7119251 .
- ↑ O. Schmitt; M. Pakura; T. Aach; L. Homke; M. Bohme; S. Bock; S. Preusse (2004). "Análisis de las fibras nerviosas y su distribución en secciones histológicas del cerebro humano". Microscopy Research and Technique . 63 (4): 220– 243. doi : 10.1002/jemt.20033 . PMID 14988920 . S2CID 28746142 .
- ↑ Bigun, Josef (diciembre de 1997). "Reconocimiento de patrones en imágenes mediante simetrías y transformaciones de coordenadas". Computer Vision and Image Understanding . 68 (3): 290– 307. doi : 10.1006/cviu.1997.0556 .
- tensores
- Detección de características (visión por computadora)