

La detección de esquinas es una técnica utilizada en sistemas de visión artificial para extraer características específicas e inferir el contenido de una imagen. Se emplea frecuentemente en detección de movimiento , registro de imágenes , seguimiento de vídeo , creación de mosaicos de imágenes , composición de panoramas , reconstrucción 3D y reconocimiento de objetos . La detección de esquinas guarda relación con la detección de puntos de interés .
Formalización
Una esquina se puede definir como la intersección de dos aristas. También se puede definir como un punto para el cual existen dos direcciones de aristas dominantes y diferentes en un entorno local del punto.
Un punto de interés es un punto en una imagen que tiene una posición bien definida y puede detectarse con precisión. Esto significa que un punto de interés puede ser una esquina, pero también puede ser, por ejemplo, un punto aislado de intensidad máxima o mínima local, el final de una línea o un punto en una curva donde la curvatura es máxima localmente.
En la práctica, la mayoría de los métodos denominados de detección de esquinas detectan puntos de interés en general, y de hecho, los términos "esquina" y "punto de interés" se utilizan de forma más o menos intercambiable en la literatura. [ 1 ] En consecuencia, si solo se van a detectar esquinas, es necesario realizar un análisis local de los puntos de interés detectados para determinar cuáles de ellos son esquinas reales. Ejemplos de detección de bordes que se pueden utilizar con posprocesamiento para detectar esquinas son el operador de Kirsch y el conjunto de máscaras de Frei-Chen. [ 2 ]
En la literatura, los términos "esquina", "punto de interés" y "característica" se usan indistintamente, lo que genera confusión. En concreto, existen varios detectores de manchas que pueden denominarse "operadores de puntos de interés", pero que a veces se denominan erróneamente "detectores de esquinas". Además, existe el concepto de detección de crestas para capturar la presencia de objetos alargados.
Los detectores de esquinas no suelen ser muy robustos y a menudo requieren la introducción de grandes redundancias para evitar que el efecto de los errores individuales domine la tarea de reconocimiento.
Una forma de determinar la calidad de un detector de esquinas es su capacidad para detectar la misma esquina en múltiples imágenes similares, bajo condiciones de iluminación, traslación, rotación y otras transformaciones diferentes.
Un método sencillo para la detección de esquinas en imágenes consiste en utilizar la correlación , pero resulta computacionalmente muy costoso y poco óptimo. Un método alternativo de uso frecuente se basa en una propuesta de Harris y Stephens (que se describe a continuación), la cual, a su vez, mejora un método de Moravec.
Algoritmo de detección de esquinas de Moravec
Este es uno de los primeros algoritmos de detección de esquinas y define una esquina como un punto con baja autosimilitud. [ 3 ] El algoritmo analiza cada píxel de la imagen para determinar si hay una esquina presente, considerando la similitud entre un parche centrado en dicho píxel y parches cercanos que se superponen en gran medida. La similitud se mide sumando las diferencias al cuadrado (SSD) entre los píxeles correspondientes de dos parches. Un valor menor indica mayor similitud.
Si el píxel se encuentra en una región de intensidad uniforme, las zonas cercanas tendrán un aspecto similar. Si el píxel está en un borde, las zonas cercanas perpendiculares a este tendrán un aspecto muy diferente, mientras que las zonas cercanas paralelas al borde solo presentarán una pequeña variación. Si el píxel se encuentra en una zona con variación en todas las direcciones, ninguna de las zonas cercanas tendrá un aspecto similar.
La fuerza de la esquina se define como la menor desviación estándar de la superficie (SSD, por sus siglas en inglés) entre el parche y sus vecinos (horizontal, vertical y en las dos diagonales). Esto se debe a que, si este valor es alto, la variación en todos los desplazamientos es igual o mayor, lo que indica que todos los parches cercanos se ven diferentes.
Si se calcula el valor de la fuerza de la esquina para todas las ubicaciones, el hecho de que sea localmente máximo en una ubicación indica que en ella está presente una característica de interés.
Como señaló Moravec, uno de los principales problemas de este operador es que no es isotrópico : si hay una arista que no está en la dirección de los vecinos (horizontal, vertical o diagonal), entonces el SSD más pequeño será grande y la arista se elegirá incorrectamente como punto de interés. [ 4 ]
Los algoritmos de detección de esquinas de Harris & Stephens / Shi–Tomasi
Harris y Stephens [ 5 ] mejoraron el detector de esquinas de Moravec al considerar directamente la diferencial de la puntuación de esquina con respecto a la dirección, en lugar de utilizar parches desplazados. (Esta puntuación de esquina se suele denominar autocorrelación , ya que el término se utiliza en el artículo donde se describe este detector. Sin embargo, las fórmulas matemáticas del artículo indican claramente que se utiliza la suma de las diferencias al cuadrado).
Sin pérdida de generalidad , asumiremos que se utiliza una imagen bidimensional en escala de grises. Sea esta imagen dada porConsidere tomar un parche de imagen sobre el áreay desplazándolo por. La suma ponderada de las diferencias al cuadrado (SSD) entre estos dos parches, denotada, se da por puede aproximarse mediante una expansión de Taylor . Seaysean las derivadas parciales de, de tal manera que
Esto produce la aproximación que se puede escribir en forma matricial: donde A es el tensor de estructura ,
En otras palabras, encontramos la covarianza de la derivada parcial de la intensidad de la imagen.con respecto a layejes.
Los corchetes angulares denotan promedio (es decir, suma sobre), yindica el tipo de ventana que se desliza sobre la imagen. Si se utiliza un filtro de caja , la respuesta será anisotrópica , pero si se utiliza un filtro gaussiano , la respuesta será isotrópica .
Una esquina (o en general un punto de interés) se caracteriza por una gran variación deen todas las direcciones del vector. Analizando los valores propios deEsta caracterización puede expresarse de la siguiente manera:Un punto de interés debería tener dos autovalores "grandes". Basándonos en las magnitudes de los autovalores, se pueden realizar las siguientes inferencias a partir de este argumento:
- Siyentonces este píxelNo tiene características de interés.
- SiySi tiene algún valor positivo grande, entonces se encuentra una arista.
- SiySi hay valores positivos grandes, entonces se encuentra una esquina.
Harris y Stephens señalan que el cálculo exacto de los valores propios es computacionalmente costoso, ya que requiere el cálculo de una raíz cuadrada , y en su lugar sugieren la función dóndees un parámetro de sensibilidad ajustable.
Por lo tanto, el algoritmo [ 6 ] no tiene que calcular realmente la descomposición en valores propios de la matriz.y en su lugar basta con evaluar el determinante y la traza depara encontrar rincones, o mejor dicho, puntos de interés en general.
El detector de esquinas de Shi–Tomasi [ 7 ] calcula directamentePorque, bajo ciertas suposiciones, las esquinas son más estables para el seguimiento. Cabe señalar que este método también se conoce a veces como detector de esquinas de Kanade-Tomasi.
El valor deDebe determinarse empíricamente, y en la bibliografía se han reportado valores en el rango de 0,04 a 0,15 como factibles.
Se puede evitar configurar el parámetroutilizando la medida de esquina de Noble [ 8 ]lo cual equivale a la media armónica de los valores propios: dóndees una pequeña constante positiva.
Sipuede interpretarse como la matriz de precisión para la posición de la esquina, la matriz de covarianza para la posición de la esquina es, es decir
La suma de los valores propios de, que en ese caso puede interpretarse como una varianza generalizada (o una "incertidumbre total") de la posición de la esquina, está relacionada con la medida de esquina de Noble.como
El detector de esquinas de Förstner

En algunos casos, puede ser necesario calcular la ubicación de una esquina con precisión subpíxel. Para obtener una solución aproximada, el algoritmo de Förstner [ 9 ] busca el punto más cercano a todas las líneas tangentes de la esquina en una ventana dada y es una solución de mínimos cuadrados. El algoritmo se basa en el hecho de que, para una esquina ideal, las líneas tangentes se cruzan en un único punto.
La ecuación de una línea tangenteen píxelesestá dado por:
dóndees el vector gradiente de la imagenen.
El puntomás cercano a todas las líneas tangentes en la ventanaes:
La distancia desdea las líneas tangentesSe pondera según la magnitud del gradiente, dando así mayor importancia a las tangentes que pasan por píxeles con gradientes fuertes.
Resolver para:
se definen como:
La minimización de esta ecuación se puede realizar derivando con respecto ay estableciéndolo igual a 0:
Tenga en cuenta quees el tensor de estructura . Para que la ecuación tenga una solución,debe ser invertible, lo que implica quedebe ser de rango completo (rango 2). Por lo tanto, la solución
Solo existe donde hay una esquina real en la ventana..
Lindeberg [ 10 ] [ 11 ] presentó una metodología para realizar la selección automática de escala para este método de localización de esquinas , minimizando el residuo normalizado.
sobre escalas. De este modo, el método tiene la capacidad de adaptar automáticamente los niveles de escala para calcular los gradientes de la imagen al nivel de ruido en los datos de la imagen, eligiendo niveles de escala más gruesos para datos de imagen ruidosos y niveles de escala más finos para estructuras casi ideales similares a esquinas.
Notas:
- puede considerarse como un residuo en el cálculo de la solución de mínimos cuadrados: si, entonces no hubo ningún error.
- Este algoritmo se puede modificar para calcular los centros de elementos circulares cambiando las líneas tangentes por líneas normales.
El operador Harris multiescala
El cálculo de la matriz de segundo momento (a veces también denominada tensor de estructura )En el operador de Harris, se requiere el cálculo de derivadas de la imagen.en el dominio de la imagen, así como la suma de combinaciones no lineales de estas derivadas sobre vecindarios locales. Dado que el cálculo de derivadas generalmente implica una etapa de suavizado del espacio de escalas, una definición operativa del operador de Harris requiere dos parámetros de escala: (i) una escala local para el suavizado previo al cálculo de las derivadas de la imagen , y (ii) una escala de integración para acumular las operaciones no lineales sobre los operadores de derivadas en un descriptor de imagen integrado.
Condenotando la intensidad de la imagen original, seadenota la representación del espacio de escalas deobtenido por convolución con un núcleo gaussiano
con parámetro de escala local:
y dejarydenotamos las derivadas parciales deAdemás, introduzca una función de ventana gaussiana.con parámetro de escala de integraciónEntonces, la matriz de segundo momento multiescala [ 12 ] [ 13 ] [ 14 ] se puede definir como
Entonces, podemos calcular los valores propios dede manera similar a los valores propios dey definir la medida de esquina de Harris multiescala como
En cuanto a la elección del parámetro de escala localy el parámetro de escala de integraciónEstos parámetros de escala suelen estar acoplados mediante un parámetro de escala de integración relativo.de tal manera que, dóndese suele elegir en el intervalo. [ 12 ] [ 13 ] Por lo tanto, podemos calcular la medida de esquina de Harris multiescalaa cualquier escalaen el espacio de escalas para obtener un detector de esquinas multiescala, que responde a estructuras de esquina de tamaños variables en el dominio de la imagen.
En la práctica, este detector de esquinas multiescala a menudo se complementa con un paso de selección de escala , donde el operador laplaciano normalizado a escala [ 11 ] [ 12 ]
se calcula en cada escala en el espacio de escalas y los puntos de esquina adaptados a la escala con selección automática de escala (el "operador Harris-Laplace") se calculan a partir de los puntos que son simultáneamente: [ 15 ]
- Máximos espaciales de la medida de esquina multiescala
- máximos o mínimos locales sobre escalas del operador laplaciano normalizado a escala [ 11 ]:
El enfoque de curvatura de la curva de nivel
Un enfoque anterior para la detección de esquinas consiste en detectar puntos donde la curvatura de las curvas de nivel y la magnitud del gradiente son simultáneamente altas. [ 16 ] [ 17 ] Una forma diferencial de detectar dichos puntos es calculando la curvatura de la curva de nivel reescalada (el producto de la curvatura de la curva de nivel y la magnitud del gradiente elevada a la tercera potencia).
y detectar máximos positivos y mínimos negativos de esta expresión diferencial a cierta escala.en la representación del espacio de escalade la imagen original. [ 10 ] [ 11 ] Sin embargo, un problema principal al calcular la entidad de curvatura de la curva de nivel reescalada a una sola escala es que puede ser sensible al ruido y a la elección del nivel de escala. Un método mejor es calcular la-curvatura de la curva de nivel reescalada normalizada
cony para detectar extremos de escala-espacio con signo de esta expresión, que son puntos y escalas que son máximos positivos y mínimos negativos con respecto al espacio y la escala.
en combinación con un paso de localización complementario para manejar el aumento en el error de localización en escalas más gruesas. [ 10 ] [ 11 ] [ 12 ] De esta manera, los valores de escala más grandes se asociarán con esquinas redondeadas de gran extensión espacial, mientras que los valores de escala más pequeños se asociarán con esquinas afiladas de pequeña extensión espacial. Este enfoque es el primer detector de esquinas con selección automática de escala (anterior al "operador de Harris-Laplace" mencionado anteriormente) y se ha utilizado para rastrear esquinas bajo grandes variaciones de escala en el dominio de la imagen [ 18 ] y para hacer coincidir las respuestas de las esquinas con los bordes para calcular características estructurales de la imagen para el reconocimiento de objetos basado en geon . [ 19 ]
Laplaciano de Gauss, diferencias de Gauss y determinante de los puntos de interés del espacio de escalas de la matriz hessiana
LoG [ 11 ] [ 12 ] [ 15 ] es un acrónimo que significa Laplaciano de Gaussiano , DoG [ 20 ] es un acrónimo que significa Diferencia de Gaussianos (DoG es una aproximación de LoG), y DoH es un acrónimo que significa Determinante del Hessiano . [ 11 ] Todos estos puntos de interés invariantes a la escala se extraen detectando extremos en el espacio de escalas de expresiones diferenciales normalizadas a la escala, es decir, puntos en el espacio de escalas donde las expresiones diferenciales normalizadas a la escala correspondientes asumen extremos locales con respecto al espacio y a la escala [ 11 ]
dóndedenota la entidad diferencial normalizada a escala apropiada (definida a continuación).
Estos detectores se describen más completamente en la detección de blobs . El laplaciano normalizado a escala de la gaussiana y las características de diferencia de gaussianas (Lindeberg 1994, 1998; Lowe 2004) [ 11 ] [ 12 ] [ 20 ]
No necesariamente crean características altamente selectivas, ya que estos operadores también pueden generar respuestas cerca de los bordes. Para mejorar la capacidad de detección de esquinas del detector de diferencias de gaussianas, el detector de características utilizado en el sistema SIFT [ 20 ] emplea una etapa de posprocesamiento adicional, donde los valores propios del hessiano de la imagen en la escala de detección se examinan de forma similar al operador de Harris. Si la relación de los valores propios es demasiado alta, la imagen local se considera demasiado parecida a un borde, por lo que la característica se rechaza. Asimismo, el detector de características del laplaciano de Lindeberg de la gaussiana puede definirse para incluir un umbral complementario en un invariante diferencial complementario para suprimir las respuestas cerca de los bordes. [ 21 ]
El determinante normalizado a escala del operador hessiano (Lindeberg 1994, 1998) [ 11 ] [ 12 ]
Por otro lado, es altamente selectivo a características de imagen bien localizadas y solo responde cuando hay variaciones significativas de nivel de gris en dos direcciones de la imagen [ 11 ] [ 14 ] y es en este y otros aspectos un mejor detector de puntos de interés que el Laplaciano de la Gaussiana. El determinante del Hessiano es una expresión diferencial covariante afín y tiene mejores propiedades de selección de escala bajo transformaciones de imagen afines que el operador Laplaciano (Lindeberg 2013, 2015). [ 21 ] [ 22 ] Experimentalmente, esto implica que los puntos de interés del determinante del Hessiano tienen mejores propiedades de repetibilidad bajo deformación local de la imagen que los puntos de interés del Laplaciano, lo que a su vez conduce a un mejor rendimiento de la coincidencia basada en imágenes en términos de puntuaciones de eficiencia más altas y puntuaciones de 1 − precisión más bajas . [ 21 ]
Las propiedades de selección de escala, las propiedades de transformación afín y las propiedades experimentales de estos y otros detectores de puntos de interés en el espacio de escalas se analizan en detalle en (Lindeberg 2013, 2015). [ 21 ] [ 22 ]
Puntos de interés en el espacio de escalas basados en las medidas de fuerza de las características de la matriz hessiana de Lindeberg.
Inspirado en las propiedades estructuralmente similares de la matriz hessiana.de una funcióny la matriz de segundo momento (tensor de estructura), como puede manifestarse, por ejemplo, en términos de sus propiedades de transformación similares bajo deformaciones de imagen afines [ 13 ] [ 21 ]
- ,
- ,
Lindeberg (2013, 2015) [ 21 ] [ 22 ] propuso definir cuatro medidas de fuerza de características a partir de la matriz hessiana de forma similar a como se definen los operadores de Harris y Shi-y-Tomasi a partir del tensor de estructura (matriz de segundo momento). Específicamente, definió las siguientes medidas de fuerza de características hessianas sin signo y con signo:
- la medida de fuerza de la característica hessiana sin signo I:
- la medida de fuerza de la característica Hessiana con signo I:
- la medida de fuerza de características hessianas sin signo II:
- la medida de fuerza de la característica hessiana con signo II:
dóndey denotan la traza y el determinante de la matriz hessiana.de la representación del espacio de escalasa cualquier escala, mientras
denotan los valores propios de la matriz hessiana. [ 23 ]
La medida de fuerza de las características hessianas sin signoresponde a extremos locales con valores positivos y no es sensible a puntos de silla, mientras que la medida de fuerza de la característica Hessiana con signoAdemás, responde a los puntos de silla con valores negativos. La medida de fuerza de la característica Hessiana sin signoes insensible a la polaridad local de la señal, mientras que la medida de fuerza de la característica Hessiana con signoResponde a la polaridad local de la señal mediante el signo de su salida.
En Lindeberg (2015) [ 21 ] estas cuatro entidades diferenciales se combinaron con la selección de escala local basada en la detección de extremos del espacio de escalas
o vinculación de escala. Además, las medidas de fuerza de las características del Hessiano con y sin signoyse combinaron con umbralización complementaria en.
Mediante experimentos de coincidencia de imágenes bajo transformaciones de escala en un conjunto de datos de pósteres con 12 pósteres con coincidencia de múltiples vistas sobre transformaciones de escala hasta un factor de escala de 6 y variaciones de la dirección de visualización hasta un ángulo de inclinación de 45 grados con descriptores de imagen locales definidos a partir de reformulaciones de los descriptores de imagen puros en los operadores SIFT y SURF a mediciones de imagen en términos de operadores de derivada gaussiana (Gauss-SIFT y Gauss-SURF) en lugar del SIFT original definido a partir de una pirámide de imágenes o el SURF original definido a partir de ondículas de Haar, se demostró que la detección de puntos de interés en el espacio de escala basada en la medida de fuerza de características hessianas sin signopermitió el mejor rendimiento y un rendimiento superior al de los puntos de interés del espacio de escalas obtenidos a partir del determinante del hessiano.. Tanto la medida de fuerza de la característica Hessiana sin signo, la medida de fuerza de la característica hessiana con signoy el determinante de la matriz hessianapermitió un mejor rendimiento que el Laplaciano de la GaussianaCuando se combina con la vinculación de escalas y el umbral complementario en, la medida de fuerza de la característica hessiana con signoAdemás, permitió un mejor rendimiento que el Laplaciano de la Gaussiana..
Además, se demostró que todos estos detectores de puntos de interés en el espacio de escalas diferenciales definidos a partir de la matriz hessiana permiten la detección de un mayor número de puntos de interés y un mejor rendimiento de coincidencia en comparación con los operadores de Harris y Shi-and-Tomasi definidos a partir del tensor de estructura (matriz de segundo momento).
En Lindeberg (2013) [ 22 ] se presenta un análisis teórico de las propiedades de selección de escala de estas cuatro medidas de fuerza de características hessianas y otras entidades diferenciales para detectar puntos de interés en el espacio de escalas, incluyendo el laplaciano de la gaussiana y el determinante de la hessiana, y en Lindeberg (2015) [ 21 ] se analizan sus propiedades de transformación afín y sus propiedades experimentales.
Operadores de puntos de interés adaptados a la afinidad
Los puntos de interés obtenidos mediante el operador de Harris multiescala con selección automática de escala son invariantes a traslaciones, rotaciones y reescalados uniformes en el dominio espacial. Sin embargo, las imágenes que constituyen la entrada a un sistema de visión artificial también están sujetas a distorsiones de perspectiva. Para obtener un operador de puntos de interés más robusto a las transformaciones de perspectiva, un enfoque natural consiste en diseñar un detector de características invariante a las transformaciones afines . En la práctica, los puntos de interés invariantes afines se pueden obtener aplicando una adaptación de forma afín, donde la forma del núcleo de suavizado se deforma iterativamente para coincidir con la estructura local de la imagen alrededor del punto de interés o, equivalentemente, un parche de imagen local se deforma iterativamente mientras la forma del núcleo de suavizado permanece simétrica rotacionalmente (Lindeberg 1993, 2008; Lindeberg y Garding 1997; Mikolajzcyk y Schmid 2004). [ 12 ] [ 13 ] [ 14 ] [ 15 ] Por lo tanto, además del operador de Harris multiescala comúnmente utilizado, la adaptación de forma afín se puede aplicar a otros detectores de esquinas como se enumeran en este artículo, así como a detectores de blobs diferenciales como el operador laplaciano/diferencia de gaussianas, el determinante del hessiano [ 14 ] y el operador hessiano-laplaciano.
El algoritmo de detección de esquinas de Wang y Brady
El detector de Wang y Brady [ 24 ] considera la imagen como una superficie y busca lugares donde haya una gran curvatura a lo largo de un borde de la imagen. En otras palabras, el algoritmo busca lugares donde el borde cambia de dirección rápidamente. La puntuación de la esquina,, viene dado por:
dóndees el vector unitario perpendicular al gradiente, ydetermina cuán sensible es el detector a los bordes. Los autores también señalan que se requiere un suavizado (se sugiere el suavizado gaussiano) para reducir el ruido.
El suavizado también provoca el desplazamiento de las esquinas, por lo que los autores derivan una expresión para el desplazamiento de una esquina de 90 grados y la aplican como factor de corrección a las esquinas detectadas.
El detector de esquinas SUSAN
SUSAN [ 25 ] es un acrónimo que significa núcleo asimilador de segmento univalor más pequeño . Este método es objeto de una patente británica de 1994 que ya no está vigente. [ 26 ]
Para la detección de características, SUSAN coloca una máscara circular sobre el píxel que se va a analizar (el núcleo). La región de la máscara esy un píxel en esta máscara está representado porEl núcleo está enCada píxel se compara con el núcleo utilizando la función de comparación:
dóndees el umbral de diferencia de brillo, [ 27 ]es el brillo del píxel y la potencia del exponente se ha determinado empíricamente. Esta función tiene la apariencia de una función rectangular o de sombrero de copa suavizada . El área de la SUSAN viene dada por:
Sies la función rectangular, entonceses el número de píxeles en la máscara que están dentrodel núcleo. La respuesta del operador SUSAN viene dada por:
dóndeSe denomina «umbral geométrico». En otras palabras, el operador SUSAN solo tiene una puntuación positiva si el área es lo suficientemente pequeña. El SUSAN localmente más pequeño se puede encontrar mediante la supresión no máxima, y este es el operador SUSAN completo.
El valordetermina cuán similares deben ser los puntos al núcleo antes de que se consideren parte del segmento univalor. El valor dedetermina el tamaño mínimo del segmento univalor. SiSi es lo suficientemente grande, entonces se convierte en un detector de bordes .
Para la detección de esquinas, se utilizan dos pasos adicionales. Primero, se encuentra el centroide de la SUSAN. Una esquina correcta tendrá el centroide lejos del núcleo. El segundo paso exige que todos los puntos de la línea que va desde el núcleo, pasando por el centroide, hasta el borde de la máscara, se encuentren dentro de la SUSAN.
El detector de esquinas de Trajkovic y Hedley
De manera similar a SUSAN, este detector [ 28 ] prueba directamente si un parche debajo de un píxel es autosimilar examinando los píxeles cercanos.es el píxel a considerar, yes un punto en un círculocentrado enEl puntoes el punto opuesto aa lo largo del diámetro.
La función de respuesta se define como:
Esto será grande cuando no haya ninguna dirección en la que el píxel central sea similar a dos píxeles cercanos a lo largo de un diámetro.es un círculo discretizado (un círculo de Bresenham ), por lo que se utiliza la interpolación para diámetros intermedios para dar una respuesta más isotrópica. Dado que cualquier cálculo da un límite superior en el, primero se comprueban las direcciones horizontal y vertical para ver si vale la pena proceder con el cálculo completo de.
Detectores de características basados en AST
AST es un acrónimo que significa prueba de segmento acelerada . Esta prueba es una versión relajada del criterio de esquina SUSAN. En lugar de evaluar el disco circular, solo se evalúan los píxeles en un círculo de Bresenham de radioSe consideran los puntos alrededor del candidato. SiLos píxeles contiguos son todos más brillantes que el núcleo por al menoso todos más oscuros que el núcleo porEntonces, el píxel debajo del núcleo se considera una característica. Se informa que esta prueba produce características muy estables. [ 29 ] La elección del orden en que se prueban los píxeles es un problema conocido como el problema de las Veinte Preguntas . La construcción de árboles de decisión cortos para este problema da como resultado los detectores de características computacionalmente más eficientes disponibles.
El primer algoritmo de detección de esquinas basado en AST es FAST ( características de la prueba de segmento acelerada ). [ 29 ] AunqueEn principio puede tomar cualquier valor, FAST utiliza solo un valor de 3 (correspondiente a un círculo de 16 píxeles de circunferencia), y las pruebas muestran que los mejores resultados se logran consiendo 9. Este valor dees el valor más bajo en el que no se detectan bordes. El orden en que se prueban los píxeles lo determina el algoritmo ID3 a partir de un conjunto de imágenes de entrenamiento. Curiosamente, el nombre del detector es algo similar al del artículo que describe el detector de Trajkovic y Hedley.
Síntesis automática de detectores
Trujillo y Olague [ 30 ] introdujeron un método que utiliza programación genética para sintetizar automáticamente operadores de imagen capaces de detectar puntos de interés. Los conjuntos de terminales y funciones contienen operaciones primitivas comunes en muchos diseños previos propuestos por el hombre. La aptitud mide la estabilidad de cada operador mediante la tasa de repetibilidad y promueve una distribución uniforme de los puntos detectados en el plano de la imagen. El rendimiento de los operadores evolucionados se ha confirmado experimentalmente mediante secuencias de entrenamiento y prueba de imágenes transformadas progresivamente. Por lo tanto, el algoritmo GP propuesto se considera competitivo con el rendimiento humano en el problema de la detección de puntos de interés.
Detectores de puntos de interés espacio-temporales
El operador de Harris ha sido extendido al espacio-tiempo por Laptev y Lindeberg. [ 31 ] Seadenotamos la matriz de segundo momento espacio-temporal definida por
Luego, para una elección adecuada deLos puntos de interés espaciotemporales se detectan a partir de los extremos espaciotemporales de la siguiente medida espaciotemporal de Harris:
El determinante del operador hessiano ha sido extendido al espacio-tiempo conjunto por Willems et al [ 32 ] y Lindeberg, [ 33 ] dando lugar a la siguiente expresión diferencial normalizada a escala:
En el trabajo de Willems et al, [ 32 ] una expresión más simple correspondiente ayse utilizó. En Lindeberg, [ 33 ] se demostró queyimplica mejores propiedades de selección de escala en el sentido de que los niveles de escala seleccionados se obtienen a partir de una mancha gaussiana espacio-temporal con extensión espacial.y duración temporalcoincidirá perfectamente con la extensión espacial y la duración temporal del blob, y la selección de escala se realizará detectando los extremos del espacio de escalas espacio-temporales de la expresión diferencial.
El operador laplaciano ha sido extendido a datos de vídeo espaciotemporales por Lindeberg, [ 33 ] dando lugar a los siguientes dos operadores espaciotemporales, que también constituyen modelos de campos receptivos de neuronas no retardadas frente a neuronas retardadas en el LGN :
Para el primer operador, las propiedades de selección de escala requieren el uso dey, si queremos que este operador asuma su valor máximo sobre escalas espacio-temporales en un nivel de escala espacio-temporal que refleje la extensión espacial y la duración temporal de una mancha gaussiana de inicio. Para el segundo operador, las propiedades de selección de escala requieren el uso dey, si queremos que este operador asuma su valor máximo en escalas espacio-temporales a un nivel de escala espacio-temporal que refleje la extensión espacial y la duración temporal de una mancha gaussiana parpadeante.
Everts et al. [ 34 ] han investigado las extensiones de color de los detectores de puntos de interés espaciotemporales.
Bibliografía
- ↑ Andrew Willis y Yunfeng Sui (2009). «Un modelo algebraico para la detección rápida de esquinas». 12.ª Conferencia Internacional IEEE de Visión por Computadora de 2009. IEEE. págs. 2296–2302 . doi : 10.1109/ICCV.2009.5459443 . ISBN 978-1-4244-4420-5.
- ↑ Shapiro, Linda y George C. Stockman (2001). Visión por computadora , pág. 257. Prentice Books, Upper Saddle River. ISBN 0-13-030796-3.
- ↑ H. Moravec (1980). "Evitación de obstáculos y navegación en el mundo real mediante un robot explorador con visión" . Informe técnico CMU-RI-TR-3 Universidad Carnegie-Mellon, Instituto de Robótica .
- ↑ Evitación de obstáculos y navegación en el mundo real mediante un robot explorador con capacidad de visión, Hans Moravec, marzo de 1980, Departamento de Ciencias de la Computación, Universidad de Stanford (tesis doctoral).
- ↑ C. Harris y M. Stephens (1988). "Un detector combinado de esquinas y bordes" (PDF) . Actas de la 4.ª Conferencia Alvey Vision . págs. 147–151 . Archivado del original (PDF) el 1 de abril de 2022. Consultado el 30 de diciembre de 2010 .
- ↑ Javier Sánchez, Nelson Monzón y Agustín Salgado (2018). "Análisis e implementación del detector de esquinas de Harris" . Procesamiento de imágenes en línea . 8 : 305–328 . doi : 10.5201/ipol.2018.229 . hdl : 10553/43499 . Archivado del original el 11 de mayo de 2020. Consultado el 6 de mayo de 2020 .
{{cite journal}}: CS1 maint: bot: estado de la URL original desconocido ( enlace ) - ↑ J. Shi y C. Tomasi (junio de 1994). "Buenas características para rastrear". 9.ª Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones . Springer. págs. 593–600 . CiteSeerX 10.1.1.36.2669 . doi : 10.1109/CVPR.1994.323794 . C. Tomasi y T. Kanade (1991). Detección y seguimiento de características puntuales (Informe técnico). Escuela de Ciencias de la Computación, Universidad Carnegie Mellon. CiteSeerX 10.1.1.45.5770 . CMU-CS-91-132.
- ↑ A. Noble (1989). Descripciones de superficies de imagen (Tesis doctoral). Departamento de Ciencias de la Ingeniería, Universidad de Oxford. pág. 45.
- ↑ Förstner, W; Gülch (1987). "Un operador rápido para la detección y localización precisa de puntos, esquinas y centros distintos de características circulares" (PDF) . ISPRS .
- 1 2 3 T. Lindeberg (1994). "Detección de uniones con selección automática de escalas de detección y escalas de localización" . Actas de la 1.ª Conferencia Internacional sobre Procesamiento de Imágenes . Vol. I. Austin, Texas. págs. 924–928 .
- 1 2 3 4 5 6 7 8 9 10 11 Tony Lindeberg (1998). "Detección de características con selección automática de escala" . Revista Internacional de Visión por Computadora . Vol. 30, n.° 2, págs. 77–116 .
- 1 2 3 4 5 6 7 8 T. Lindeberg (1994). Teoría del espacio de escalas en visión por computadora . Springer. ISBN 978-0-7923-9418-1.
- 1 2 3 4 T. Lindeberg y J. Garding "Suavizado adaptado a la forma en la estimación de señales de profundidad 3D a partir de distorsiones afines de la estructura 2D local". Image and Vision Computing 15 (6): pp 415–434, 1997.
- 1 2 3 4 T. Lindeberg (2008). "Espacio de escalas" . En Benjamin Wah (ed.). Enciclopedia Wiley de Ciencias de la Computación e Ingeniería . Vol. IV. John Wiley and Sons. págs. 2495–2504 . doi : 10.1002/9780470050118.ecse609 . ISBN 978-0-470-05011-8.
- 1 2 3 K. Mikolajczyk, K. y C. Schmid (2004). "Detectores de puntos de interés invariantes a escala y afines" (PDF) . International Journal of Computer Vision . 60 (1): 63– 86. doi : 10.1023/B:VISI.0000027790.02288.f2 . S2CID 1704741 .
- ↑ L. Kitchen y A. Rosenfeld (1982). "Detección de esquinas en escala de grises". Pattern Recognition Letters . Vol. 1, n.º 2, págs. 95–102 .
- ↑ JJ Koenderink y W. Richards (1988). "Operadores de curvatura bidimensionales" . Journal of the Optical Society of America A. Vol. 5, n.º 7, págs. 1136–1141 .
- ↑ L. Bretzner y T. Lindeberg (1998). "Seguimiento de características con selección automática de escalas espaciales" . Computer Vision and Image Understanding . Vol. 71. pp. 385–392 .
- ↑ T. Lindeberg y M.-X. Li (1997). "Segmentación y clasificación de bordes mediante aproximación de longitud de descripción mínima y señales de unión complementarias" . Computer Vision and Image Understanding . Vol. 67, n.º 1, págs. 88-98 .
- 1 2 3 D. Lowe (2004). "Características distintivas de imágenes a partir de puntos clave invariantes a la escala" . International Journal of Computer Vision . 60 (2): 91. CiteSeerX 10.1.1.73.2924 . doi : 10.1023/B:VISI.0000029664.99615.94 . S2CID 221242327 .
- 1 2 3 4 5 6 7 8 T. Lindeberg "Coincidencia de imágenes mediante puntos de interés generalizados en el espacio de escalas", Journal of Mathematical Imaging and Vision, volumen 52, número 1, páginas 3-36, 2015.
- 1 2 3 4 T. Lindeberg "Propiedades de selección de escala de detectores de puntos de interés en el espacio de escala generalizado", Journal of Mathematical Imaging and Vision, Volumen 46, Número 2, páginas 177-210, 2013.
- ↑ Lindeberg, T. (1998). "Detección de bordes y detección de crestas con selección automática de escala" . International Journal of Computer Vision . 30 (2): 117– 154. doi : 10.1023/A:1008097225773 . S2CID 35328443 .
- ↑ H. Wang y M. Brady (1995). "Algoritmo de detección de esquinas en tiempo real para la estimación de movimiento". Image and Vision Computing . 13 (9): 695– 703. doi : 10.1016/0262-8856(95)98864-P .
- ↑ SM Smith y JM Brady (mayo de 1997). "SUSAN: un nuevo enfoque para el procesamiento de imágenes de bajo nivel" . International Journal of Computer Vision . 23 (1): 45–78 . doi : 10.1023/A:1007963824710 . S2CID 15033310 . SM Smith y JM Brady (enero de 1997), «Método para el procesamiento digital de imágenes con el fin de determinar la posición de los bordes y/o esquinas para la guía de vehículos no tripulados». Patente británica n.º 2272285. Titular: Secretario de Estado de Defensa del Reino Unido.
- ↑ Patente GB 2272285 , Smith, Stephen Mark, "Determinación de la posición de bordes y esquinas en imágenes", publicada el 11 de mayo de 1994, emitida el 11 de mayo de 1994, asignada al Secretario de Defensa.
- ↑ "El detector de bordes SUSAN en detalle" .
- ↑ M. Trajkovic y M. Hedley (1998). "Detección rápida de esquinas". Image and Vision Computing . 16 (2): 75– 87. doi : 10.1016/S0262-8856(97)00056-5 .
- 1 2 E. Rosten y T. Drummond (mayo de 2006). "Aprendizaje automático para la detección de esquinas a alta velocidad" . Conferencia Europea sobre Visión por Computadora .
- ↑ Leonardo Trujillo y Gustavo Olague (2008). «Diseño automatizado de operadores de imagen que detectan puntos de interés» ( PDF) . Evolutionary Computation . 16 (4): 483–507 . doi : 10.1162/evco.2008.16.4.483 . PMID 19053496. S2CID 17704640. Archivado del original (PDF) el 17 de julio de 2011.
- ↑ Ivan Laptev y Tony Lindeberg (2003). "Puntos de interés espacio-temporales" . Conferencia Internacional sobre Visión por Computadora . IEEE. págs. 432–439 .
- 1 2 Geert Willems, Tinne Tuytelaars y Luc van Gool (2008). "Un detector de puntos de interés espaciotemporales-temporales denso, eficiente e invariante a la escala". Conferencia Europea sobre Visión por Computadora . Springer Lecture Notes in Computer Science. Vol. 5303. pp. 650– 663. doi : 10.1007/978-3-540-88688-4_48 .
- 1 2 3 Tony Lindeberg (2018). "Selección de escala espacio-temporal en datos de vídeo" . Journal of Mathematical Imaging and Vision . 60 (4): 525– 562. Bibcode : 2018JMIV...60..525L . doi : 10.1007/s10851-017-0766-9 . S2CID 254649837 .
- ↑ I. Everts, J. van Gemert y T. Gevers (2014). "Evaluación de puntos de interés espaciotemporales de color para el reconocimiento de acciones humanas". IEEE Transactions on Image Processing . 23 (4): 1569– 1589. Bibcode : 2014ITIP...23.1569E . doi : 10.1109/TIP.2014.2302677 . PMID 24577192. S2CID 1999196 .
Implementaciones de referencia
Esta sección proporciona enlaces externos a implementaciones de referencia de algunos de los detectores descritos anteriormente. Estas implementaciones de referencia son proporcionadas por los autores del artículo donde se describe el detector por primera vez. Pueden contener detalles que no aparecen o no se mencionan explícitamente en los artículos que describen las características.
- Detección de DoG (como parte del sistema SIFT ), ejecutables para Windows y Linux x86.
- Harris-Laplace , ejecutables estáticos para Linux . También incluye detectores DoG y LoG, así como adaptación afín para todos los detectores.
- Detector FAST , código fuente en C, C++ y MATLAB, y archivos ejecutables para diversos sistemas operativos y arquitecturas.
- lip-vireo Archivado el 11/05/2017 en Wayback Machine , [LoG, DoG, Harris-Laplacian, Hessian y Hessian-Laplacian], [SIFT, flip invariant SIFT, PCA-SIFT, PSIFT, Steerable Filters, SPIN][Linux, Windows y SunOS] ejecutables.
- SUSAN Procesamiento de imágenes de bajo nivel , código fuente en C.
- Implementación en línea del detector de esquinas de Harris - IPOL
Véase también
Enlaces externos
- Lindeberg, Tony (2001) [1994], "Detección de esquinas" , Enciclopedia de Matemáticas , EMS Press
- Brostow, "Detección de esquinas - Ciencias de la Computación de la UCL"
- Detección de características (visión por computadora)