En matemáticas, el tensor de estructura , también conocido como matriz de segundo momento , es una matriz derivada del gradiente de una función . Describe la distribución del gradiente en un entorno específico alrededor de un punto y hace que la información sea invariante a las coordenadas de observación . El tensor de estructura se utiliza frecuentemente en el procesamiento de imágenes y la visión por computadora . [ 1 ] [ 2 ] [ 3 ]
El tensor de estructura 2D
Versión continua
Para una funciónde dos variables p = ( x , y ) , el tensor de estructura es la matriz 2×2
dóndeyson las derivadas parciales decon respecto a x e y ; las integrales se extienden sobre el plano; y w es alguna " función de ventana " fija (como un desenfoque gaussiano ), una distribución en dos variables. Nótese que la matrizes en sí misma una función de p = ( x , y ) .
La fórmula anterior también se puede escribir como, dóndees la función con valores matriciales definida por
Si el gradientedese considera como una matriz de 2×1 (de una sola columna), dondedenota la operación de transposición , que convierte un vector fila en un vector columna, la matrizse puede escribir como el producto matricialo tensor o producto exterior. Sin embargo, tenga en cuenta que el tensor de estructurano se puede tener en cuenta de esta manera en general, excepto sies una función delta de Dirac .
Versión discreta
En el procesamiento de imágenes y otras aplicaciones similares, la funciónGeneralmente se presenta como una matriz discreta de muestras.donde p es un par de índices enteros. El tensor de estructura 2D en un píxel dado generalmente se toma como la suma discreta
Aquí, el índice de suma r abarca un conjunto finito de pares de índices (la "ventana", típicamentepara algún m ), y w [ r ] es un "peso de ventana" fijo que depende de r , de modo que la suma de todos los pesos es 1. Los valoresson las derivadas parciales muestreadas en el píxel p ; que, por ejemplo, pueden estimarse a partir demediante fórmulas de diferencias finitas .
La fórmula del tensor de estructura también se puede escribir como, dóndees la matriz de valores tal que
Interpretación
La importancia del tensor de estructura 2Dse deriva del hecho de que los valores propios(que se puede ordenar de manera que) y los vectores propios correspondientesresumir la distribución del gradientededentro de la ventana definida porcentrado en. [ 1 ] [ 2 ] [ 3 ]
Es decir, si, entonces(o) es la dirección que está alineada al máximo con el gradiente dentro de la ventana.
En particular, sientonces el gradiente siempre es un múltiplo de(positivo, negativo o cero); este es el caso si y solo sidentro de la ventana varía a lo largo de la direcciónpero es constante a lo largo de. Esta condición de autovalores también se denomina condición de simetría lineal porque entonces las isocurvas deconsisten en líneas paralelas, es decir, existe una función unidimensionalque puede generar la función bidimensionalcomopara algún vector constantey las coordenadas.
SiPor otro lado, el gradiente en la ventana no tiene una dirección predominante; esto ocurre, por ejemplo, cuando la imagen presenta simetría rotacional dentro de dicha ventana. Esta condición de autovalores también se denomina condición de equilibrio direccional o de cuerpo equilibrado, ya que se cumple cuando todas las direcciones del gradiente en la ventana son igualmente frecuentes o probables.
Además, la condiciónsucede si y solo si la funciónes constante () dentro.
En términos más generales, el valor de, para k =1 o k =2, es elpromedio ponderado, en la vecindad de p , del cuadrado de la derivada direccional dea lo largo de. La discrepancia relativa entre los dos autovalores dees un indicador del grado de anisotropía del gradiente en la ventana, es decir, cuán fuertemente sesgado está hacia una dirección particular (y su opuesta). [ 4 ] [ 5 ] Este atributo puede cuantificarse mediante la coherencia , definida como
si. Esta cantidad es 1 cuando el gradiente está totalmente alineado y 0 cuando no tiene una dirección preferida. La fórmula no está definida, incluso en el límite , cuando la imagen es constante en la ventana (). Algunos autores lo definen como 0 en ese caso.
Nótese que el promedio del gradienteDentro de la ventana no es un buen indicador de anisotropía. Los vectores de gradiente alineados pero orientados en sentido opuesto se cancelarían en este promedio, mientras que en el tensor de estructura se suman correctamente. [ 6 ] Esta es una razón por la cualse utiliza en el promedio del tensor de estructura para optimizar la dirección en lugar de.
Al expandir el radio efectivo de la función de ventana(es decir, aumentando su varianza), se puede hacer que el tensor de estructura sea más robusto frente al ruido, a costa de una resolución espacial disminuida. [ 5 ] [ 7 ] La base formal de esta propiedad se describe con más detalle a continuación, donde se muestra que una formulación multiescala del tensor de estructura, denominada tensor de estructura multiescala , constituye una verdadera representación multiescala de datos direccionales bajo variaciones de la extensión espacial de la función de ventana .
Versión compleja
La interpretación e implementación del tensor de estructura 2D se vuelve particularmente accesible utilizando números complejos . [ 2 ] El tensor de estructura consta de 3 números reales.
dónde,yen la que las integrales pueden ser reemplazadas por sumas para la representación discreta. Usando la identidad de Parseval, es claro que los tres números reales son los momentos de segundo orden del espectro de potencia de. El siguiente momento complejo de segundo orden del espectro de potencia deentonces se puede escribir como
dóndeyes el ángulo de dirección del vector propio más significativo del tensor de estructuramientrasyson los autovalores más y menos significativos. De esto se deduce quecontiene tanto una certeza comoy la dirección óptima en la representación de ángulo doble, ya que es un número complejo compuesto por dos números reales. De ello se deduce también que si el gradiente se representa como un número complejo y se remapea elevándolo al cuadrado (es decir, los ángulos del argumento del gradiente complejo se duplican), entonces el promedio actúa como un optimizador en el dominio mapeado, ya que proporciona directamente tanto la dirección óptima (en la representación de ángulo doble) como la certeza asociada. El número complejo representa, por lo tanto, cuánta estructura lineal (simetría lineal) hay en la imagen.y el número complejo se obtiene directamente promediando el gradiente en su representación de ángulo doble (complejo) sin calcular explícitamente los valores propios y los vectores propios.
Asimismo, el siguiente momento complejo de segundo orden del espectro de potencia de, que resulta ser siempre real porquees real,
se puede obtener, conysiendo los autovalores como antes. Nótese que esta vez la magnitud del gradiente complejo está al cuadrado (que siempre es real).
Sin embargo, al descomponer el tensor de estructura en sus autovectores se obtienen sus componentes tensoriales como
dóndees la matriz identidad en 2D porque los dos vectores propios son siempre ortogonales (y suman la unidad). El primer término en la última expresión de la descomposición,, representa el componente de simetría lineal del tensor de estructura que contiene toda la información direccional (como una matriz de rango 1), mientras que el segundo término representa el componente de cuerpo equilibrado del tensor, que carece de información direccional (que contiene una matriz identidad).). Para saber cuánta información direccional hay enes entonces lo mismo que comprobar qué tan grandese compara con.
Evidentemente,es el equivalente complejo del primer término en la descomposición tensorial, mientras quees el equivalente del segundo término. Por lo tanto, los dos escalares, que comprenden tres números reales,
dóndees el filtro de gradiente (complejo), yLa convolución constituye una representación compleja del tensor de estructura 2D. Como se discute aquí y en otros lugares.define la imagen local, que suele ser una gaussiana (con una cierta varianza que define la escala exterior), yes el parámetro (de escala interna) que determina el rango de frecuencia efectivo en el que la orientaciónestá por estimarse.
La elegancia de la representación compleja proviene de que los dos componentes del tensor de estructura se pueden obtener como promedios y de forma independiente. A su vez, esto significa queyPuede utilizarse en una representación de espacio de escala para describir la evidencia de la presencia de una orientación única y la evidencia de la hipótesis alternativa, la presencia de múltiples orientaciones equilibradas, sin calcular los autovectores y autovalores. Hasta la fecha, no se ha demostrado la existencia de un funcional, como elevar al cuadrado los números complejos, para tensores de estructura con dimensiones superiores a dos. En Bigun 91, se ha planteado con argumentos suficientes que esto se debe a que los números complejos son álgebras conmutativas, mientras que los cuaterniones, el posible candidato para construir dicho funcional, constituyen un álgebra no conmutativa. [ 8 ]
La representación compleja del tensor de estructura se utiliza con frecuencia en el análisis de huellas dactilares para obtener mapas de dirección que contienen certezas, las cuales, a su vez, se utilizan para mejorarlas, para encontrar las ubicaciones de las singularidades globales (núcleos y deltas) y locales (minucias), así como para evaluar automáticamente la calidad de las huellas dactilares.
El tensor de estructura 3D
Definición
El tensor de estructura también puede definirse para una función.de tres variables p = ( x , y , z ) de una manera completamente análoga. Es decir, en la versión continua tenemos, dónde dóndeson las tres derivadas parciales dey los rangos integrales sobre.
En la versión discreta,, dónde y la suma abarca un conjunto finito de índices 3D, generalmentepara algunos m .
Interpretación
Al igual que en el caso bidimensional, los valores propiosdey los vectores propios correspondientes, resumir la distribución de las direcciones del gradiente dentro del vecindario de p definido por la ventanaEsta información puede visualizarse como un elipsoide cuyos semiejes son iguales a los autovalores y están dirigidos a lo largo de sus autovectores correspondientes. [ 9 ] [ 10 ]

En particular, si el elipsoide se estira a lo largo de un solo eje, como un cigarro (es decir, sies mucho más grande que ambosy), significa que el gradiente en la ventana está predominantemente alineado con la dirección, de modo que las isosuperficies deSuelen ser planos y perpendiculares a ese vector. Esta situación se da, por ejemplo, cuando p se encuentra sobre una característica delgada en forma de placa, o sobre el límite suave entre dos regiones con valores contrastantes.
Si el elipsoide se aplana en una sola dirección, como un panqueque (es decir, sies mucho más pequeño que ambosy), significa que las direcciones del gradiente están esparcidas pero son perpendiculares aDe modo que las isosuperficies tienden a ser como tubos paralelos a ese vector. Esta situación se da, por ejemplo, cuando p se encuentra sobre una línea delgada o sobre una esquina pronunciada del límite entre dos regiones con valores contrastantes.
Finalmente, si el elipsoide es aproximadamente esférico (es decir, si), significa que las direcciones del gradiente en la ventana están distribuidas de manera más o menos uniforme, sin una marcada preferencia; de modo que la funciónes mayormente isotrópico en ese entorno. Esto sucede, por ejemplo, cuando la función tiene simetría esférica en el entorno de p . En particular, si el elipsoide degenera en un punto (es decir, si los tres autovalores son cero), significa quees constante (tiene gradiente cero) dentro de la ventana.
El tensor de estructura multiescala
El tensor de estructura es una herramienta importante en el análisis del espacio de escalas . El tensor de estructura multiescala (o matriz de segundo momento multiescala ) de una funcióna diferencia de otras características de espacio de escala de un parámetro, es un descriptor de imagen que se define sobre dos parámetros de escala. Un parámetro de escala, denominado escala locales necesario para determinar la cantidad de pre-suavizado al calcular el gradiente de la imagen.Otro parámetro de escala, denominado escala de integración, es necesario para especificar la extensión espacial de la función de ventana.que determina los pesos para la región en el espacio sobre la cual los componentes del producto exterior del gradiente por sí mismose acumulan.
Más precisamente, supongamos quees una señal de valor real definida sobrePara cualquier escala local, dejemos una representación multiescalade esta señal será dada pordónderepresenta un núcleo de pre-suavizado. Además, dejemosdenotamos el gradiente de la representación del espacio de escalas . Entonces, el tensor de estructura multiescala/matriz de segundo momento se define por [ 7 ] [ 11 ] [ 12 ] Conceptualmente, cabe preguntarse si sería suficiente utilizar cualquier familia autosimilar de funciones de suavizado.ySin embargo, si uno aplicara ingenuamente, por ejemplo, un filtro de caja, podrían aparecer fácilmente artefactos no deseados. Si se desea que el tensor de estructura multiescala se comporte bien en escalas locales crecientesy escalas de integración cada vez mayores, entonces se puede demostrar que tanto la función de suavizado como la función de ventana deben ser gaussianas. [ 7 ] Las condiciones que especifican esta unicidad son similares a los axiomas del espacio de escala que se utilizan para derivar la unicidad del núcleo gaussiano para un espacio de escala gaussiano regular de intensidades de imagen.
Existen diferentes maneras de manejar las variaciones de escala de dos parámetros en esta familia de descriptores de imagen. Si mantenemos el parámetro de escala localSe fijan y aplican versiones cada vez más amplias de la función de ventana aumentando el parámetro de escala de integración.Solo entonces obtenemos una verdadera representación formal del espacio de escalas de los datos direccionales calculados a la escala local dada.. [ 7 ] Si acoplamos la escala local y la escala de integración mediante una escala de integración relativa, de tal manera queentonces para cualquier valor fijo de, obtenemos una variación reducida de un parámetro autosimilar, que se utiliza frecuentemente para simplificar algoritmos computacionales, por ejemplo, en detección de esquinas , detección de puntos de interés , análisis de texturas y coincidencia de imágenes . Al variar la escala de integración relativaEn una variación de escala autosimilar como esta, obtenemos otra forma alternativa de parametrizar la naturaleza multiescala de los datos direccionales obtenidos al aumentar la escala de integración.
Se puede realizar una construcción conceptualmente similar para señales discretas, reemplazando la integral de convolución por una suma de convolución y utilizando el núcleo gaussiano continuo.reemplazado por el núcleo gaussiano discreto: Al cuantificar los parámetros de escalayEn una implementación real, una progresión geométrica finita.Se suele utilizar, con i variando de 0 a un índice de escala máximo m . Por lo tanto, los niveles de escala discretos tendrán ciertas similitudes con la pirámide de imágenes , aunque el submuestreo espacial no necesariamente se utilice para preservar datos más precisos para las etapas de procesamiento posteriores.
Aplicaciones
Los valores propios del tensor de estructura juegan un papel significativo en muchos algoritmos de procesamiento de imágenes, para problemas como detección de esquinas , detección de puntos de interés y seguimiento de características . [ 9 ] [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] El tensor de estructura también juega un papel central en el algoritmo de flujo óptico de Lucas-Kanade y en sus extensiones para estimar la adaptación de forma afín ; [ 11 ] donde la magnitud dees un indicador de la fiabilidad del resultado calculado. El tensor se ha utilizado para el análisis del espacio de escalas , [ 7 ] la estimación de la orientación de la superficie local a partir de señales monoculares o binoculares, [ 12 ] la mejora de huellas dactilares no lineales , [ 19 ] el procesamiento de imágenes basado en difusión , [ 20 ] [ 21 ] [ 22 ] [ 23 ] y varios otros problemas de procesamiento de imágenes. El tensor de estructura también se puede aplicar en geología para filtrar datos sísmicos . [ 24 ]
Procesamiento de datos de vídeo espacio-temporales con el tensor de estructura
El tensor de estructura tridimensional se ha utilizado para analizar datos de vídeo tridimensionales (vistos como una función de x , y y tiempo t ). [ 4 ] Si en este contexto se buscan descriptores de imagen que sean invariantes bajo transformaciones galileanas , para que sea posible comparar mediciones de imagen que se han obtenido bajo variaciones de velocidades de imagen a priori desconocidas Sin embargo, desde un punto de vista computacional, es preferible parametrizar los componentes en la matriz tensorial/de segundo momento de estructura.utilizando la noción de diagonalización galileana [ 25 ] dóndedenota una transformación galileana del espacio-tiempo yuna rotación bidimensional sobre el dominio espacial, en comparación con el uso mencionado anteriormente de los valores propios de un tensor de estructura 3D, que corresponde a una descomposición en valores propios y una rotación tridimensional (no física) del espaciotiempo. Para obtener una verdadera invariancia galileana, sin embargo, también es necesario adaptar la forma de la función de ventana espacio-temporal, [ 25 ] [ 26 ] correspondiente a la transferencia de la adaptación de forma afín [ 11 ] de datos de imagen espaciales a espacio-temporales. En combinación con descriptores de histograma espacio-temporales locales, [ 27 ] estos conceptos permiten el reconocimiento invariante galileano de eventos espacio-temporales. [ 28 ]
Véase también
Referencias
- 1 2 J. Bigun y G. Granlund (1986), Detección de orientación óptima de simetría lineal . Informe técnico LiTH-ISY-I-0828, Laboratorio de Visión por Computadora, Universidad de Linkoping, Suecia 1986; Informe de tesis, Estudios de Linkoping en ciencia y tecnología No. 85, 1986.
- 1 2 3 J. Bigun y G. Granlund (1987). "Detección óptima de orientación de simetría lineal". Primera Conferencia Internacional sobre Visión por Computadora, ICCV, (Londres) . Piscataway: IEEE Computer Society Press, Piscataway. págs. 433–438 .
- 1 2 H. Knutsson (1989). "Representación de la estructura local mediante tensores". Actas de la 6.ª Conferencia Escandinava sobre Análisis de Imágenes . Oulu: Universidad de Oulu. págs. 244–251 .
- 1 2 B. Jahne (1993). Procesamiento de imágenes espaciotemporales: teoría y aplicaciones científicas . Vol. 751. Berlín: Springer-Verlag.
- 1 2 G. Medioni, M. Lee y C. Tang (marzo de 2000). Un marco computacional para la extracción de características y la segmentación . Elsevier Science.
- ^ T. Brox; J. Weickert; B. Burgeth y P. Mrazek (2004). Tensores de estructura no lineal (Informe técnico). Universität des Saarlandes. 113.
- 1 2 3 4 5 T. Lindeberg (1993), Teoría del espacio de escalas en visión por computadora . Kluwer Academic Publishers, (véanse las secciones 14.4.1 y 14.2.3 en las páginas 359-360 y 355-356 para obtener declaraciones detalladas sobre cómo la matriz/tensor de estructura de segundo momento multiescala define una representación multiescala verdadera y determinada de forma única de los datos direccionales).
- ↑ J. Bigun; G. Granlund y J. Wiklund (1991). "Estimación de orientación multidimensional con aplicaciones al análisis de texturas y flujo óptico" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 13 (8): 775–790 . Bibcode : 1991ITPAM..13..775B . doi : 10.1109/34.85668 .
- 1 2 M. Nicolescu y G. Medioni (2003). "Segmentación de movimiento con límites precisos: un enfoque de votación tensorial". Actas de IEEE Computer Vision and Pattern Recognition . Vol. 1. págs. 382–389 .
- ↑ Westin, C.-F.; Maier, SE; Mamata, H.; Nabavi, A.; Jolesz, FA; Kikinis, R. (junio de 2002). "Procesamiento y visualización para resonancia magnética de tensor de difusión" . Medical Image Analysis . 6 (2): 93– 108. doi : 10.1016/S1361-8415(02)00053-1 . PMID 12044998 .
- 1 2 3 T. Lindeberg y J. Garding (1997). "Suavizado adaptado a la forma en la estimación de señales de profundidad 3D a partir de distorsiones afines de la estructura 2D local" . Image and Vision Computing . 15 (6): 415– 434. doi : 10.1016/S0262-8856(97)01144-X .
- 1 2 J. Garding y T. Lindeberg (1996). "Cálculo directo de señales de forma utilizando operadores de derivada espacial adaptados a la escala" , International Journal of Computer Vision, volumen 17, número 2, páginas 163–191.
- ↑ W. Förstner (1986). "Un algoritmo de correspondencia basado en características para el procesamiento de imágenes". Archivos Internacionales de Fotogrametría y Teledetección . 26 : 150–166 .
- ↑ C. Harris y M. Stephens (1988). "Un detector combinado de esquinas y bordes". Actas de la 4.ª Conferencia ALVEY Vision . págs. 147–151 .
- ↑ K. Rohr (1997). "Sobre operadores diferenciales 3D para la detección de puntos de referencia" . Image and Vision Computing . 15 (3): 219– 233. doi : 10.1016/S0262-8856(96)01127-4 .
- ↑ I. Laptev y T. Lindeberg (2003). "Puntos de interés espacio-temporales" . Conferencia Internacional sobre Visión por Computadora ICCV'03 . Vol. I. págs. 432–439 . doi : 10.1109/ICCV.2003.1238378 .
- ↑ B. Triggs (2004). "Detección de puntos clave con posición, orientación y escala estables ante cambios de iluminación". Actas de la Conferencia Europea de Visión por Computadora . Vol. 4. págs. 100–113 .
- ↑ C. Kenney, M. Zuliani y B. Manjunath (2005). "Un enfoque axiomático para la detección de esquinas". Actas de IEEE Computer Vision and Pattern Recognition . págs. 191–197 .
- ↑ A. Almansa y T. Lindeberg (2000), Mejora de imágenes de huellas dactilares mediante operadores de espacio de escala adaptados a la forma . IEEE Transactions on Image Processing, volumen 9, número 12, páginas 2027–2042.
- ↑ J. Weickert (1998), Difusión anisotrópica en el procesamiento de imágenes, Teuber Verlag, Stuttgart.
- ↑ D. Tschumperle y R. Deriche (septiembre de 2002). "Ecuaciones diferenciales parciales de difusión en imágenes vectoriales". IEEE Signal Processing Magazine . 19 (5): 16– 25. Bibcode : 2002ISPM...19...16T . doi : 10.1109/MSP.2002.1028349 .
- ↑ S. Arseneau y J. Cooperstock (septiembre de 2006). "Un marco de difusión asimétrico para el análisis de uniones". Conferencia Británica de Visión por Computadora . Vol. 2. págs. 689–698 .
- ↑ S. Arseneau y J. Cooperstock (noviembre de 2006). "Una representación mejorada de uniones a través de la difusión tensorial asimétrica". Simposio internacional sobre computación visual .
- ↑ Yang, Shuai; Chen, Anqing; Chen, Hongde (2017-05-25). "Filtrado de datos sísmicos mediante algoritmo de medias no locales basado en tensor de estructura" . Open Geosciences . 9 (1): 151– 160. Bibcode : 2017OGeo....9...13Y . doi : 10.1515/geo-2017-0013 . ISSN 2391-5447 . S2CID 134392619 .
- 1 2 T. Lindeberg; A. Akbarzadeh e I. Laptev (agosto de 2004). "Operadores de interés espaciotemporales corregidos galileanos" . Conferencia Internacional sobre Reconocimiento de Patrones ICPR'04 . Vol. I. págs. 57–62 . doi : 10.1109/ICPR.2004.1334004 .
- ↑ I. Laptev y T. Lindeberg (agosto de 2004). Adaptación de la velocidad de los puntos de interés espacio-temporales . Conferencia Internacional sobre Reconocimiento de Patrones ICPR'04. Vol. I. págs. 52–56 . doi : 10.1109/ICPR.2004.971 .
- ↑ I. Laptev y T. Lindeberg (mayo de 2004). Descriptores locales para el reconocimiento espacio-temporal . Taller ECCV'04 sobre coherencia espacial para el análisis del movimiento visual (Praga, República Checa). Springer Lecture Notes in Computer Science. Vol. 3667. pp. 91–103 . doi : 10.1007/11676959 .
- ↑ I. Laptev; B. Caputo; C. Schuldt y T. Lindeberg (2007). "Eventos de movimiento adaptados a la velocidad local para el reconocimiento espacio-temporal" . Computer Vision and Image Understanding . Vol. 108. pp. 207–229 . doi : 10.1016/j.cviu.2006.11.023 .
Recursos
- Descargar el código fuente de MATLAB
- Tutorial de tensores de estructura (original)
- tensores
- Detección de características (visión por computadora)