Articulo de referencia

Tensor de estructura

En matemáticas, el tensor de estructura , también conocido como matriz de segundo momento , es una matriz derivada del gradiente de una función . Describe la distribución del gr...

En matemáticas, el tensor de estructura , también conocido como matriz de segundo momento , es una matriz derivada del gradiente de una función . Describe la distribución del gradiente en un entorno específico alrededor de un punto y hace que la información sea invariante a las coordenadas de observación . El tensor de estructura se utiliza frecuentemente en el procesamiento de imágenes y la visión por computadora . [ 1 ] [ 2 ] [ 3 ]

El tensor de estructura 2D

Versión continua

Para una funciónI{\displaystyle I}de dos variables p = ( x , y ) , el tensor de estructura es la matriz 2×2

Sw(pag)=[w(r)(Iincógnita(pagr))2drw(r)Iincógnita(pagr)Iy(pagr)drw(r)Iincógnita(pagr)Iy(pagr)drw(r)(Iy(pagr))2dr]{\displaystyle S_{w}(p)={\begin{bmatrix}\int w(r)(I_{x}(pr))^{2}\,dr&\int w(r)I_{x}(pr)I_{y}(pr)\,dr\\[10pt]\int w(r)I_{x}(pr)I_{y}(pr)\,dr&\int w(r)(I_{y}(pr))^{2}\,dr\end{bmatrix}}} dóndeIincógnita{\displaystyle I_{x}}yIy{\displaystyle I_{y}}son las derivadas parciales deI{\displaystyle I}con respecto a x e y ; las integrales se extienden sobre el planoR2{\displaystyle \mathbb {R} ^{2}}; y w es alguna " función de ventana " fija (como un desenfoque gaussiano ), una distribución en dos variables. Nótese que la matrizSw{\displaystyle S_{w}}es en sí misma una función de p = ( x , y ) .

La fórmula anterior también se puede escribir comoSw(pag)=w(r)S0(pagr)dr{\textstyle S_{w}(p)=\int w(r)S_{0}(pr)\,dr}, dóndeS0{\displaystyle S_{0}}es la función con valores matriciales definida por S0(pag)=[(Iincógnita(pag))2Iincógnita(pag)Iy(pag)Iincógnita(pag)Iy(pag)(Iy(pag))2]{\displaystyle S_{0}(p)={\begin{bmatrix}(I_{x}(p))^{2}&I_{x}(p)I_{y}(p)\\[10pt]I_{x}(p)I_{y}(p)&(I_{y}(p))^{2}\end{bmatrix}}}

Si el gradienteI=(Iincógnita,Iy)T{\displaystyle \nabla I=(I_{x},I_{y})^{\text{T}}}deI{\displaystyle I}se considera como una matriz de 2×1 (de una sola columna), donde()T{\displaystyle (\cdot )^{\text{T}}}denota la operación de transposición , que convierte un vector fila en un vector columna, la matrizS0{\displaystyle S_{0}}se puede escribir como el producto matricial(I)(I)T{\displaystyle (\nabla I)(\nabla I)^{\text{T}}}o tensor o producto exteriorII{\displaystyle \nabla I\otimes \nabla I}. Sin embargo, tenga en cuenta que el tensor de estructuraSw(pag){\displaystyle S_{w}(p)}no se puede tener en cuenta de esta manera en general, excepto siw{\displaystyle w}es una función delta de Dirac .

Versión discreta

En el procesamiento de imágenes y otras aplicaciones similares, la funciónI{\displaystyle I}Generalmente se presenta como una matriz discreta de muestras.I[pag]{\displaystyle I[p]}donde p es un par de índices enteros. El tensor de estructura 2D en un píxel dado generalmente se toma como la suma discreta

Sw[pag]=[rw[r](Iincógnita[pagr])2rw[r]Iincógnita[pagr]Iy[pagr]rw[r]Iincógnita[pagr]Iy[pagr]rw[r](Iy[pagr])2]{\displaystyle S_{w}[p]={\begin{bmatrix}\sum _{r}w[r](I_{x}[pr])^{2}&\sum _{r}w[r]I_{x}[pr]I_{y}[pr]\\[10pt]\sum _{r}w[r]I_{x}[pr]I_{y}[pr]&\sum _{r}w[r](I_{y}[pr])^{2}\end{bmatrix}}}

Aquí, el índice de suma r abarca un conjunto finito de pares de índices (la "ventana", típicamente{metro+metro}×{metro+metro}{\displaystyle \{-m\ldots +m\}\times \{-m\ldots +m\}}para algún m ), y w [ r ] es un "peso de ventana" fijo que depende de r , de modo que la suma de todos los pesos es 1. Los valoresIincógnita[pag],Iy[pag]{\displaystyle I_{x}[p],I_{y}[p]}son las derivadas parciales muestreadas en el píxel p ; que, por ejemplo, pueden estimarse a partir deI{\displaystyle I}mediante fórmulas de diferencias finitas .

La fórmula del tensor de estructura también se puede escribir comoSw[pag]=rw[r]S0[pagr]{\textstyle S_{w}[p]=\sum _{r}w[r]S_{0}[pr]}, dóndeS0{\displaystyle S_{0}}es la matriz de valores tal que S0[pag]=[(Iincógnita[pag])2Iincógnita[pag]Iy[pag]Iincógnita[pag]Iy[pag](Iy[pag])2]{\displaystyle S_{0}[p]={\begin{bmatrix}(I_{x}[p])^{2}&I_{x}[p]I_{y}[p]\\[10pt]I_{x}[p]I_{y}[p]&(I_{y}[p])^{2}\end{bmatrix}}}

Interpretación

La importancia del tensor de estructura 2DSw{\displaystyle S_{w}}se deriva del hecho de que los valores propiosλ1,λ2{\displaystyle \lambda _{1},\lambda _{2}}(que se puede ordenar de manera queλ1λ20{\displaystyle \lambda _{1}\geq \lambda _{2}\geq 0}) y los vectores propios correspondientesmi1,mi2{\displaystyle e_{1},e_{2}}resumir la distribución del gradienteI=(Iincógnita,Iy){\displaystyle \nabla I=(I_{x},I_{y})}deI{\displaystyle I}dentro de la ventana definida porw{\displaystyle w}centrado enpag{\displaystyle p}. [ 1 ] [ 2 ] [ 3 ]

Es decir, siλ1>λ2{\displaystyle \lambda _ {1}> \ lambda _ {2}}, entoncesmi1{\displaystyle e_{1}}(omi1{\displaystyle -e_{1}}) es la dirección que está alineada al máximo con el gradiente dentro de la ventana.

En particular, siλ1>0,λ2=0{\displaystyle \lambda _ {1}>0, \lambda _ {2}=0}entonces el gradiente siempre es un múltiplo demi1{\displaystyle e_{1}}(positivo, negativo o cero); este es el caso si y solo siI{\displaystyle I}dentro de la ventana varía a lo largo de la direcciónmi1{\displaystyle e_{1}}pero es constante a lo largo demi2{\displaystyle e_{2}}. Esta condición de autovalores también se denomina condición de simetría lineal porque entonces las isocurvas deI{\displaystyle I}consisten en líneas paralelas, es decir, existe una función unidimensionalgramo{\displaystyle g}que puede generar la función bidimensionalI{\displaystyle I}comoI(incógnita,y)=gramo(dTpag){\displaystyle I(x,y)=g(d^{\text{T}}p)}para algún vector constanted=(dincógnita,dy)T{\displaystyle d=(d_{x},d_{y})^{T}}y las coordenadaspag=(incógnita,y)T{\displaystyle p=(x,y)^{T}}.

Siλ1=λ2{\displaystyle \lambda _ {1} = \ lambda _ {2}}Por otro lado, el gradiente en la ventana no tiene una dirección predominante; esto ocurre, por ejemplo, cuando la imagen presenta simetría rotacional dentro de dicha ventana. Esta condición de autovalores también se denomina condición de equilibrio direccional o de cuerpo equilibrado, ya que se cumple cuando todas las direcciones del gradiente en la ventana son igualmente frecuentes o probables.

Además, la condiciónλ1=λ2=0{\displaystyle \lambda _ {1} = \ lambda _ {2} = 0}sucede si y solo si la funciónI{\displaystyle I}es constante (I=(0,0){\displaystyle \nabla I=(0,0)}) dentroW{\displaystyle W}.

En términos más generales, el valor deλk{\displaystyle \lambda _{k}}, para k =1 o k =2, es elw{\displaystyle w}promedio ponderado, en la vecindad de p , del cuadrado de la derivada direccional deI{\displaystyle I}a lo largo demik{\displaystyle e_{k}}. La discrepancia relativa entre los dos autovalores deSw{\displaystyle S_{w}}es un indicador del grado de anisotropía del gradiente en la ventana, es decir, cuán fuertemente sesgado está hacia una dirección particular (y su opuesta). [ 4 ] [ 5 ] Este atributo puede cuantificarse mediante la coherencia , definida como

dow=(λ1λ2λ1+λ2)2{\displaystyle c_{w}=\left({\frac {\lambda _{1}-\lambda _{2}}{\lambda _{1}+\lambda _{2}}}\right)^{2}}

siλ2>0{\displaystyle \lambda _ {2}>0}. Esta cantidad es 1 cuando el gradiente está totalmente alineado y 0 cuando no tiene una dirección preferida. La fórmula no está definida, incluso en el límite , cuando la imagen es constante en la ventana (λ1=λ2=0{\displaystyle \lambda _ {1} = \ lambda _ {2} = 0}). Algunos autores lo definen como 0 en ese caso.

Nótese que el promedio del gradienteI{\displaystyle \nabla I}Dentro de la ventana no es un buen indicador de anisotropía. Los vectores de gradiente alineados pero orientados en sentido opuesto se cancelarían en este promedio, mientras que en el tensor de estructura se suman correctamente. [ 6 ] Esta es una razón por la cual(I)(I)T{\displaystyle (\nabla I)(\nabla I)^{\text{T}}}se utiliza en el promedio del tensor de estructura para optimizar la dirección en lugar deI{\displaystyle \nabla I}.

Al expandir el radio efectivo de la función de ventanaw{\displaystyle w}(es decir, aumentando su varianza), se puede hacer que el tensor de estructura sea más robusto frente al ruido, a costa de una resolución espacial disminuida. [ 5 ] [ 7 ] La base formal de esta propiedad se describe con más detalle a continuación, donde se muestra que una formulación multiescala del tensor de estructura, denominada tensor de estructura multiescala , constituye una verdadera representación multiescala de datos direccionales bajo variaciones de la extensión espacial de la función de ventana .

Versión compleja

La interpretación e implementación del tensor de estructura 2D se vuelve particularmente accesible utilizando números complejos . [ 2 ] El tensor de estructura consta de 3 números reales.

Sw(pag)=[μ20μ11μ11μ02]{\displaystyle S_{w}(p)={\begin{bmatrix}\mu _{20}&\mu _{11}\\[10pt]\mu _{11}&\mu _{02}\end{bmatrix}}}

dóndeμ20=(w(r)(Iincógnita(pagr))2dr{\textstyle \mu _{20}=\int (w(r)(I_{x}(pr))^{2}\,dr},μ02=(w(r)(Iy(pagr))2dr{\textstyle \mu _{02}=\int (w(r)(I_{y}(p-r))^{2}\,dr}yμ11=w(r)Iincógnita(pagr)Iy(pagr)dr{\textstyle \mu _{11}=\int w(r)I_{x}(p-r)I_{y}(p-r)\,dr}en la que las integrales pueden ser reemplazadas por sumas para la representación discreta. Usando la identidad de Parseval, es claro que los tres números reales son los momentos de segundo orden del espectro de potencia deI{\displaystyle I}. El siguiente momento complejo de segundo orden del espectro de potencia deI{\displaystyle I}entonces se puede escribir como

κ20=μ20μ02+i2μ11=w(r)(Iincógnita(pagr)+iIy(pagr))2dr=(λ1λ2)exp(i2ϕ){\displaystyle \kappa _{20}=\mu _{20}-\mu _{02}+i2\mu _{11}=\int w(r)(I_{x}(p-r)+iI_{y}(p-r))^{2}\,dr=(\lambda _{1}-\lambda _{2})\exp(i2\phi )}

dóndei=1{\displaystyle i={\sqrt {-1}}}yϕ{\displaystyle \phi }es el ángulo de dirección del vector propio más significativo del tensor de estructuraϕ=mi1{\displaystyle \phi =\angle {e_{1}}}mientrasλ1{\displaystyle \lambda _{1}}yλ2{\displaystyle \lambda _{2}}son los autovalores más y menos significativos. De esto se deduce queκ20{\displaystyle \kappa _{20}}contiene tanto una certeza como|κ20|=λ1λ2{\displaystyle |\kappa _{20}|=\lambda _{1}-\lambda _{2}}y la dirección óptima en la representación de ángulo doble, ya que es un número complejo compuesto por dos números reales. De ello se deduce también que si el gradiente se representa como un número complejo y se remapea elevándolo al cuadrado (es decir, los ángulos del argumento del gradiente complejo se duplican), entonces el promedio actúa como un optimizador en el dominio mapeado, ya que proporciona directamente tanto la dirección óptima (en la representación de ángulo doble) como la certeza asociada. El número complejo representa, por lo tanto, cuánta estructura lineal (simetría lineal) hay en la imagen.I{\displaystyle I}y el número complejo se obtiene directamente promediando el gradiente en su representación de ángulo doble (complejo) sin calcular explícitamente los valores propios y los vectores propios.

Asimismo, el siguiente momento complejo de segundo orden del espectro de potencia deI{\displaystyle I}, que resulta ser siempre real porqueI{\displaystyle I}es real,

κ11=μ20+μ02=w(r)|Iincógnita(pagr)+iIy(pagr)|2dr=λ1+λ2{\displaystyle \kappa _{11}=\mu _{20}+\mu _{02}=\int w(r)|I_{x}(p-r)+iI_{y}(p-r)|^{2}\,dr=\lambda _{1}+\lambda _{2}}

se puede obtener, conλ1{\displaystyle \lambda _{1}}yλ2{\displaystyle \lambda _{2}}siendo los autovalores como antes. Nótese que esta vez la magnitud del gradiente complejo está al cuadrado (que siempre es real).

Sin embargo, al descomponer el tensor de estructura en sus autovectores se obtienen sus componentes tensoriales como

Sw(pag)=λ1mi1mi1T+λ2mi2mi2T=(λ1λ2)mi1mi1T+λ2(mi1mi1T+mi2mi2T)=(λ1λ2)mi1mi1T+λ2mi{\displaystyle S_{w}(p)=\lambda _{1}e_{1}e_{1}^{\text{T}}+\lambda _{2}e_{2}e_{2}^{\text{T}}=(\lambda _{1}-\lambda _{2})e_{1}e_{1}^{\text{T}}+\lambda _{2}(e_{1}e_{1}^{\text{T}}+e_{2}e_{2}^{\text{T}})=(\lambda _{1}-\lambda _{2})e_{1}e_{1}^{\text{T}}+\lambda _{2}E}

dóndemi{\displaystyle E}es la matriz identidad en 2D porque los dos vectores propios son siempre ortogonales (y suman la unidad). El primer término en la última expresión de la descomposición,(λ1λ2)mi1mi1T{\displaystyle (\lambda _{1}-\lambda _{2})e_{1}e_{1}^{\text{T}}}, representa el componente de simetría lineal del tensor de estructura que contiene toda la información direccional (como una matriz de rango 1), mientras que el segundo término representa el componente de cuerpo equilibrado del tensor, que carece de información direccional (que contiene una matriz identidad).mi{\displaystyle E}). Para saber cuánta información direccional hay enI{\displaystyle I}es entonces lo mismo que comprobar qué tan grandeλ1λ2{\displaystyle \lambda _{1}-\lambda _{2}}se compara conλ2{\displaystyle \lambda _{2}}.

Evidentemente,κ20{\displaystyle \kappa _{20}}es el equivalente complejo del primer término en la descomposición tensorial, mientras que12(|κ20|κ11)=λ2{\displaystyle {\tfrac {1}{2}}(|\kappa _{20}|-\kappa _{11})=\lambda _{2}}es el equivalente del segundo término. Por lo tanto, los dos escalares, que comprenden tres números reales,

κ20=(λ1λ2)exp(i2ϕ)=w(hI)2κ11=λ1+λ2=w|hI|2{\displaystyle {\begin{aligned}\kappa _{20}&=&(\lambda _{1}-\lambda _{2})\exp(i2\phi )&=w*(h*I)^{2}\\\kappa _{11}&=&\lambda _{1}+\lambda _{2}&=w*|h*I|^{2}\\\end{aligned}}} dóndeh(incógnita,y)=(incógnita+iy)exp((incógnita2+y2)/(2σ2)){\displaystyle h(x,y)=(x+iy)\exp(-(x^{2}+y^{2})/(2\sigma ^{2}))}es el filtro de gradiente (complejo), y{\displaystyle *}La convolución constituye una representación compleja del tensor de estructura 2D. Como se discute aquí y en otros lugares.w{\displaystyle w}define la imagen local, que suele ser una gaussiana (con una cierta varianza que define la escala exterior), yσ{\displaystyle \sigma }es el parámetro (de escala interna) que determina el rango de frecuencia efectivo en el que la orientación2ϕ{\displaystyle 2\phi }está por estimarse.

La elegancia de la representación compleja proviene de que los dos componentes del tensor de estructura se pueden obtener como promedios y de forma independiente. A su vez, esto significa queκ20{\displaystyle \kappa _{20}}yκ11{\displaystyle \kappa _{11}}Puede utilizarse en una representación de espacio de escala para describir la evidencia de la presencia de una orientación única y la evidencia de la hipótesis alternativa, la presencia de múltiples orientaciones equilibradas, sin calcular los autovectores y autovalores. Hasta la fecha, no se ha demostrado la existencia de un funcional, como elevar al cuadrado los números complejos, para tensores de estructura con dimensiones superiores a dos. En Bigun 91, se ha planteado con argumentos suficientes que esto se debe a que los números complejos son álgebras conmutativas, mientras que los cuaterniones, el posible candidato para construir dicho funcional, constituyen un álgebra no conmutativa. [ 8 ]

La representación compleja del tensor de estructura se utiliza con frecuencia en el análisis de huellas dactilares para obtener mapas de dirección que contienen certezas, las cuales, a su vez, se utilizan para mejorarlas, para encontrar las ubicaciones de las singularidades globales (núcleos y deltas) y locales (minucias), así como para evaluar automáticamente la calidad de las huellas dactilares.

El tensor de estructura 3D

Definición

El tensor de estructura también puede definirse para una función.I{\displaystyle I}de tres variables p = ( x , y , z ) de una manera completamente análoga. Es decir, en la versión continua tenemosSw(pag)=w(r)S0(pagr)dr{\textstyle S_{w}(p)=\int w(r)S_{0}(p-r)\,dr}, dónde S0(pag)=[(Iincógnita(pag))2Iincógnita(pag)Iy(pag)Iincógnita(pag)Iz(pag)Iincógnita(pag)Iy(pag)(Iy(pag))2Iy(pag)Iz(pag)Iincógnita(pag)Iz(pag)Iy(pag)Iz(pag)(Iz(pag))2]{\displaystyle S_{0}(p)={\begin{bmatrix}(I_{x}(p))^{2}&I_{x}(p)I_{y}(p)&I_{x}(p)I_{z}(p)\\[10pt]I_{x}(p)I_{y}(p)&(I_{y}(p))^{2}&I_{y}(p)I_{z}(p)\\[10pt]I_{x}(p)I_{z}(p)&I_{y}(p)I_{z}(p)&(I_{z}(p))^{2}\end{bmatrix}}} dóndeIincógnita,Iy,Iz{\displaystyle I_{x},I_{y},I_{z}}son las tres derivadas parciales deI{\displaystyle I}y los rangos integrales sobreR3{\displaystyle \mathbb {R} ^{3}}.

En la versión discreta,Sw[pag]=rw[r]S0[pagr]{\textstyle S_{w}[p]=\sum _{r}w[r]S_{0}[p-r]}, dónde S0[pag]=[(Iincógnita[pag])2Iincógnita[pag]Iy[pag]Iincógnita[pag]Iz[pag]Iincógnita[pag]Iy[pag](Iy[pag])2Iy[pag]Iz[pag]Iincógnita[pag]Iz[pag]Iy[pag]Iz[pag](Iz[pag])2]{\displaystyle S_{0}[p]={\begin{bmatrix}(I_{x}[p])^{2}&I_{x}[p]I_{y}[p]&I_{x}[p]I_{z}[p]\\[10pt]I_{x}[p]I_{y}[p]&(I_{y}[p])^{2}&I_{y}[p]I_{z}[p]\\[10pt]I_{x}[p]I_{z}[p]&I_{y}[p]I_{z}[p]&(I_{z}[p])^{2}\end{bmatrix}}} y la suma abarca un conjunto finito de índices 3D, generalmente{metro+metro}×{metro+metro}×{metro+metro}{\displaystyle \{-m\ldots +m\}\times \{-m\ldots +m\}\times \{-m\ldots +m\}}para algunos m .

Interpretación

Al igual que en el caso bidimensional, los valores propiosλ1,λ2,λ3{\displaystyle \lambda _{1},\lambda _{2},\lambda _{3}}deSw[pag]{\displaystyle S_{w}[p]}y los vectores propios correspondientesmi^1,mi^2,mi^3{\displaystyle {\hat {e}}_{1},{\hat {e}}_{2},{\hat {e}}_{3}}, resumir la distribución de las direcciones del gradiente dentro del vecindario de p definido por la ventanaw{\displaystyle w}Esta información puede visualizarse como un elipsoide cuyos semiejes son iguales a los autovalores y están dirigidos a lo largo de sus autovectores correspondientes. [ 9 ] [ 10 ]

Representación elipsoidal del tensor de estructura 3D.

En particular, si el elipsoide se estira a lo largo de un solo eje, como un cigarro (es decir, siλ1{\displaystyle \lambda _{1}}es mucho más grande que ambosλ2{\displaystyle \lambda _{2}}yλ3{\displaystyle \lambda _{3}}), significa que el gradiente en la ventana está predominantemente alineado con la direcciónmi1{\displaystyle e_{1}}, de modo que las isosuperficies deI{\displaystyle I}Suelen ser planos y perpendiculares a ese vector. Esta situación se da, por ejemplo, cuando p se encuentra sobre una característica delgada en forma de placa, o sobre el límite suave entre dos regiones con valores contrastantes.

Si el elipsoide se aplana en una sola dirección, como un panqueque (es decir, siλ3{\displaystyle \lambda _{3}}es mucho más pequeño que ambosλ1{\displaystyle \lambda _{1}}yλ2{\displaystyle \lambda _{2}}), significa que las direcciones del gradiente están esparcidas pero son perpendiculares ami3{\displaystyle e_{3}}De modo que las isosuperficies tienden a ser como tubos paralelos a ese vector. Esta situación se da, por ejemplo, cuando p se encuentra sobre una línea delgada o sobre una esquina pronunciada del límite entre dos regiones con valores contrastantes.

Finalmente, si el elipsoide es aproximadamente esférico (es decir, siλ1λ2λ3{\displaystyle \lambda _{1}\approx \lambda _{2}\approx \lambda _{3}}), significa que las direcciones del gradiente en la ventana están distribuidas de manera más o menos uniforme, sin una marcada preferencia; de modo que la funciónI{\displaystyle I}es mayormente isotrópico en ese entorno. Esto sucede, por ejemplo, cuando la función tiene simetría esférica en el entorno de p . En particular, si el elipsoide degenera en un punto (es decir, si los tres autovalores son cero), significa queI{\displaystyle I}es constante (tiene gradiente cero) dentro de la ventana.

El tensor de estructura multiescala

El tensor de estructura es una herramienta importante en el análisis del espacio de escalas . El tensor de estructura multiescala (o matriz de segundo momento multiescala ) de una funciónI{\displaystyle I}a diferencia de otras características de espacio de escala de un parámetro, es un descriptor de imagen que se define sobre dos parámetros de escala. Un parámetro de escala, denominado escala localt{\displaystyle t}es necesario para determinar la cantidad de pre-suavizado al calcular el gradiente de la imagen.(I)(incógnita;t){\displaystyle (\nabla I)(x;t)}Otro parámetro de escala, denominado escala de integracións{\displaystyle s}, es necesario para especificar la extensión espacial de la función de ventana.w(ξ;s){\displaystyle w(\xi ;s)}que determina los pesos para la región en el espacio sobre la cual los componentes del producto exterior del gradiente por sí mismo(I)(I)T{\displaystyle (\nabla I)(\nabla I)^{\text{T}}}se acumulan.

Más precisamente, supongamos queI{\displaystyle I}es una señal de valor real definida sobreRk{\displaystyle \mathbb {R} ^{k}}Para cualquier escala localt>0{\displaystyle t>0}, dejemos una representación multiescalaI(incógnita;t){\displaystyle I(x;t)}de esta señal será dada porI(incógnita;t)=h(incógnita;t)I(incógnita){\displaystyle I(x;t)=h(x;t)*I(x)}dóndeh(incógnita;t){\displaystyle h(x;t)}representa un núcleo de pre-suavizado. Además, dejemos(I)(incógnita;t){\displaystyle (\nabla I)(x;t)}denotamos el gradiente de la representación del espacio de escalas . Entonces, el tensor de estructura multiescala/matriz de segundo momento se define por [ 7 ] [ 11 ] [ 12 ]μ(incógnita;t,s)=ξRk(I)(incógnitaξ;t)(I)T(incógnitaξ;t)w(ξ;s)dξ{\displaystyle \mu (x;t,s)=\int _{\xi \in \mathbb {R} ^{k}}(\nabla I)(x-\xi ;t)\,(\nabla I)^{\text{T}}(x-\xi ;t)\,w(\xi ;s)\,d\xi } Conceptualmente, cabe preguntarse si sería suficiente utilizar cualquier familia autosimilar de funciones de suavizado.h(incógnita;t){\displaystyle h(x;t)}yw(ξ;s){\displaystyle w(\xi ;s)}Sin embargo, si uno aplicara ingenuamente, por ejemplo, un filtro de caja, podrían aparecer fácilmente artefactos no deseados. Si se desea que el tensor de estructura multiescala se comporte bien en escalas locales crecientest{\displaystyle t}y escalas de integración cada vez mayoress{\displaystyle s}, entonces se puede demostrar que tanto la función de suavizado como la función de ventana deben ser gaussianas. [ 7 ] Las condiciones que especifican esta unicidad son similares a los axiomas del espacio de escala que se utilizan para derivar la unicidad del núcleo gaussiano para un espacio de escala gaussiano regular de intensidades de imagen.

Existen diferentes maneras de manejar las variaciones de escala de dos parámetros en esta familia de descriptores de imagen. Si mantenemos el parámetro de escala localt{\displaystyle t}Se fijan y aplican versiones cada vez más amplias de la función de ventana aumentando el parámetro de escala de integración.s{\displaystyle s}Solo entonces obtenemos una verdadera representación formal del espacio de escalas de los datos direccionales calculados a la escala local dada.t{\displaystyle t}. [ 7 ] Si acoplamos la escala local y la escala de integración mediante una escala de integración relativar1{\displaystyle r\geq 1}, de tal manera ques=rt{\displaystyle s=rt}entonces para cualquier valor fijo der{\displaystyle r}, obtenemos una variación reducida de un parámetro autosimilar, que se utiliza frecuentemente para simplificar algoritmos computacionales, por ejemplo, en detección de esquinas , detección de puntos de interés , análisis de texturas y coincidencia de imágenes . Al variar la escala de integración relativar1{\displaystyle r\geq 1}En una variación de escala autosimilar como esta, obtenemos otra forma alternativa de parametrizar la naturaleza multiescala de los datos direccionales obtenidos al aumentar la escala de integración.

Se puede realizar una construcción conceptualmente similar para señales discretas, reemplazando la integral de convolución por una suma de convolución y utilizando el núcleo gaussiano continuo.gramo(incógnita;t){\displaystyle g(x;t)}reemplazado por el núcleo gaussiano discretoT(norte;t){\displaystyle T(n;t)}: μ(incógnita;t,s)=norteZk(I)(incógnitanorte;t)(I)T(incógnitanorte;t)w(norte;s){\displaystyle \mu (x;t,s)=\sum _{n\in \mathbb {Z} ^{k}}(\nabla I)(x-n;t)\,(\nabla I)^{\text{T}}(x-n;t)\,w(n;s)} Al cuantificar los parámetros de escalat{\displaystyle t}ys{\displaystyle s}En una implementación real, una progresión geométrica finita.αi{\displaystyle \alpha ^{i}}Se suele utilizar, con i variando de 0 a un índice de escala máximo m . Por lo tanto, los niveles de escala discretos tendrán ciertas similitudes con la pirámide de imágenes , aunque el submuestreo espacial no necesariamente se utilice para preservar datos más precisos para las etapas de procesamiento posteriores.

Aplicaciones

Los valores propios del tensor de estructura juegan un papel significativo en muchos algoritmos de procesamiento de imágenes, para problemas como detección de esquinas , detección de puntos de interés y seguimiento de características . [ 9 ] [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] El tensor de estructura también juega un papel central en el algoritmo de flujo óptico de Lucas-Kanade y en sus extensiones para estimar la adaptación de forma afín ; [ 11 ] donde la magnitud deλ2{\displaystyle \lambda _{2}}es un indicador de la fiabilidad del resultado calculado. El tensor se ha utilizado para el análisis del espacio de escalas , [ 7 ] la estimación de la orientación de la superficie local a partir de señales monoculares o binoculares, [ 12 ] la mejora de huellas dactilares no lineales , [ 19 ] el procesamiento de imágenes basado en difusión , [ 20 ] [ 21 ] [ 22 ] [ 23 ] y varios otros problemas de procesamiento de imágenes. El tensor de estructura también se puede aplicar en geología para filtrar datos sísmicos . [ 24 ]

Procesamiento de datos de vídeo espacio-temporales con el tensor de estructura

El tensor de estructura tridimensional se ha utilizado para analizar datos de vídeo tridimensionales (vistos como una función de x , y y tiempo t ). [ 4 ] Si en este contexto se buscan descriptores de imagen que sean invariantes bajo transformaciones galileanas , para que sea posible comparar mediciones de imagen que se han obtenido bajo variaciones de velocidades de imagen a priori desconocidasv=(vincógnita,vy)T{\displaystyle v=(v_{x},v_{y})^{\text{T}}}[incógnitayt]=GRAMO[incógnitayt]=[incógnitavincógnitatyvytt],{\displaystyle {\begin{bmatrix}x'\\y'\\t'\end{bmatrix}}=G{\begin{bmatrix}x\\y\\t\end{bmatrix}}={\begin{bmatrix}x-v_{x}\,t\\y-v_{y}\,t\\t\end{bmatrix}},} Sin embargo, desde un punto de vista computacional, es preferible parametrizar los componentes en la matriz tensorial/de segundo momento de estructura.S{\displaystyle S}utilizando la noción de diagonalización galileana [ 25 ]S=RespacioTGRAMOTSGRAMO1Respacio1=[ν1ν2ν3]{\displaystyle S'=R_{\text{space}}^{-{\text{T}}}\,G^{-{\text{T}}}\,S\,G^{-1}\,R_{\text{space}}^{-1}={\begin{bmatrix}\nu _{1}&\,&\,\\\,&\nu _{2}&\,\\\,&\,&\nu _{3}\end{bmatrix}}} dóndeGRAMO{\displaystyle G}denota una transformación galileana del espacio-tiempo yRespacio{\displaystyle R_{\text{space}}}una rotación bidimensional sobre el dominio espacial, en comparación con el uso mencionado anteriormente de los valores propios de un tensor de estructura 3D, que corresponde a una descomposición en valores propios y una rotación tridimensional (no física) del espaciotiempo. S=RespaciotiempoTSRespaciotiempo1=[λ1λ2λ3].{\displaystyle S''=R_{\text{spacetime}}^{-{\text{T}}}\,S\,R_{\text{spacetime}}^{-1}={\begin{bmatrix}\lambda _{1}&&\\&\lambda _{2}&\\&&\lambda _{3}\end{bmatrix}}.} Para obtener una verdadera invariancia galileana, sin embargo, también es necesario adaptar la forma de la función de ventana espacio-temporal, [ 25 ] [ 26 ] correspondiente a la transferencia de la adaptación de forma afín [ 11 ] de datos de imagen espaciales a espacio-temporales. En combinación con descriptores de histograma espacio-temporales locales, [ 27 ] estos conceptos permiten el reconocimiento invariante galileano de eventos espacio-temporales. [ 28 ]

Véase también

Referencias

  1. 1 2 J. Bigun y G. Granlund (1986), Detección de orientación óptima de simetría lineal . Informe técnico LiTH-ISY-I-0828, Laboratorio de Visión por Computadora, Universidad de Linkoping, Suecia 1986; Informe de tesis, Estudios de Linkoping en ciencia y tecnología No. 85, 1986.
  2. 1 2 3 J. Bigun y G. Granlund (1987). "Detección óptima de orientación de simetría lineal". Primera Conferencia Internacional sobre Visión por Computadora, ICCV, (Londres) . Piscataway: IEEE Computer Society Press, Piscataway. págs. 433–438 . 
  3. 1 2 H. Knutsson (1989). "Representación de la estructura local mediante tensores". Actas de la 6.ª Conferencia Escandinava sobre Análisis de Imágenes . Oulu: Universidad de Oulu. págs. 244–251 . 
  4. 1 2 B. Jahne (1993). Procesamiento de imágenes espaciotemporales: teoría y aplicaciones científicas . Vol. 751. Berlín: Springer-Verlag. 
  5. 1 2 G. Medioni, M. Lee y C. Tang (marzo de 2000). Un marco computacional para la extracción de características y la segmentación . Elsevier Science.
  6. ^ T. Brox; J. Weickert; B. Burgeth y P. Mrazek (2004). Tensores de estructura no lineal (Informe técnico). Universität des Saarlandes. 113.
  7. 1 2 3 4 5 T. Lindeberg (1993), Teoría del espacio de escalas en visión por computadora . Kluwer Academic Publishers, (véanse las secciones 14.4.1 y 14.2.3 en las páginas 359-360 y 355-356 para obtener declaraciones detalladas sobre cómo la matriz/tensor de estructura de segundo momento multiescala define una representación multiescala verdadera y determinada de forma única de los datos direccionales).
  8. J. Bigun; G. Granlund y J. Wiklund (1991). "Estimación de orientación multidimensional con aplicaciones al análisis de texturas y flujo óptico" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 13 (8): 775–790 . Bibcode : 1991ITPAM..13..775B . doi : 10.1109/34.85668 .
  9. 1 2 M. Nicolescu y G. Medioni (2003). "Segmentación de movimiento con límites precisos: un enfoque de votación tensorial". Actas de IEEE Computer Vision and Pattern Recognition . Vol. 1. págs. 382–389 .  
  10. Westin, C.-F.; Maier, SE; Mamata, H.; Nabavi, A.; Jolesz, FA; Kikinis, R. (junio de 2002). "Procesamiento y visualización para resonancia magnética de tensor de difusión" . Medical Image Analysis . 6 (2): 93– 108. doi : 10.1016/S1361-8415(02)00053-1 . PMID 12044998 . 
  11. 1 2 3 T. Lindeberg y J. Garding (1997). "Suavizado adaptado a la forma en la estimación de señales de profundidad 3D a partir de distorsiones afines de la estructura 2D local" . Image and Vision Computing . 15 (6): 415– 434. doi : 10.1016/S0262-8856(97)01144-X .
  12. 1 2 J. Garding y T. Lindeberg (1996). "Cálculo directo de señales de forma utilizando operadores de derivada espacial adaptados a la escala" , International Journal of Computer Vision, volumen 17, número 2, páginas 163–191.
  13. W. Förstner (1986). "Un algoritmo de correspondencia basado en características para el procesamiento de imágenes". Archivos Internacionales de Fotogrametría y Teledetección . 26 : 150–166 .
  14. C. Harris y M. Stephens (1988). "Un detector combinado de esquinas y bordes". Actas de la 4.ª Conferencia ALVEY Vision . págs. 147–151 . 
  15. K. Rohr (1997). "Sobre operadores diferenciales 3D para la detección de puntos de referencia" . Image and Vision Computing . 15 (3): 219– 233. doi : 10.1016/S0262-8856(96)01127-4 .
  16. I. Laptev y T. Lindeberg (2003). "Puntos de interés espacio-temporales" . Conferencia Internacional sobre Visión por Computadora ICCV'03 . Vol. I. págs. 432–439 . doi : 10.1109/ICCV.2003.1238378 .  
  17. B. Triggs (2004). "Detección de puntos clave con posición, orientación y escala estables ante cambios de iluminación". Actas de la Conferencia Europea de Visión por Computadora . Vol. 4. págs. 100–113 .  
  18. C. Kenney, M. Zuliani y B. Manjunath (2005). "Un enfoque axiomático para la detección de esquinas". Actas de IEEE Computer Vision and Pattern Recognition . págs. 191–197 . 
  19. A. Almansa y T. Lindeberg (2000), Mejora de imágenes de huellas dactilares mediante operadores de espacio de escala adaptados a la forma . IEEE Transactions on Image Processing, volumen 9, número 12, páginas 2027–2042.
  20. J. Weickert (1998), Difusión anisotrópica en el procesamiento de imágenes, Teuber Verlag, Stuttgart.
  21. D. Tschumperle y R. Deriche (septiembre de 2002). "Ecuaciones diferenciales parciales de difusión en imágenes vectoriales". IEEE Signal Processing Magazine . 19 (5): 16– 25. Bibcode : 2002ISPM...19...16T . doi : 10.1109/MSP.2002.1028349 .
  22. S. Arseneau y J. Cooperstock (septiembre de 2006). "Un marco de difusión asimétrico para el análisis de uniones". Conferencia Británica de Visión por Computadora . Vol. 2. págs. 689–698 .  
  23. S. Arseneau y J. Cooperstock (noviembre de 2006). "Una representación mejorada de uniones a través de la difusión tensorial asimétrica". Simposio internacional sobre computación visual .
  24. Yang, Shuai; Chen, Anqing; Chen, Hongde (2017-05-25). "Filtrado de datos sísmicos mediante algoritmo de medias no locales basado en tensor de estructura" . Open Geosciences . 9 (1): 151– 160. Bibcode : 2017OGeo....9...13Y . doi : 10.1515/geo-2017-0013 . ISSN 2391-5447 . S2CID 134392619 .  
  25. 1 2 T. Lindeberg; A. Akbarzadeh e I. Laptev (agosto de 2004). "Operadores de interés espaciotemporales corregidos galileanos" . Conferencia Internacional sobre Reconocimiento de Patrones ICPR'04 . Vol. I. págs. 57–62 . doi : 10.1109/ICPR.2004.1334004 .  
  26. I. Laptev y T. Lindeberg (agosto de 2004). Adaptación de la velocidad de los puntos de interés espacio-temporales . Conferencia Internacional sobre Reconocimiento de Patrones ICPR'04. Vol. I. págs. 52–56 . doi : 10.1109/ICPR.2004.971 .  
  27. I. Laptev y T. Lindeberg (mayo de 2004). Descriptores locales para el reconocimiento espacio-temporal . Taller ECCV'04 sobre coherencia espacial para el análisis del movimiento visual (Praga, República Checa). Springer Lecture Notes in Computer Science. Vol. 3667. pp. 91–103 . doi : 10.1007/11676959 .  
  28. I. Laptev; B. Caputo; C. Schuldt y T. Lindeberg (2007). "Eventos de movimiento adaptados a la velocidad local para el reconocimiento espacio-temporal" . Computer Vision and Image Understanding . Vol. 108. pp. 207–229 . doi : 10.1016/j.cviu.2006.11.023 .  

Recursos

  • Descargar el código fuente de MATLAB
  • Tutorial de tensores de estructura (original)