Articulo de referencia

Descriptor visual

En visión artificial , los descriptores visuales o descriptores de imagen son descripciones de las características visuales del contenido de imágenes , vídeos , algoritmos o apl...

En visión artificial , los descriptores visuales o descriptores de imagen son descripciones de las características visuales del contenido de imágenes , vídeos , algoritmos o aplicaciones que generan dichas descripciones. Describen características elementales como la forma , el color , la textura o el movimiento , entre otras.

Introducción

Como consecuencia de las nuevas tecnologías de la comunicación y el uso masivo de internet en nuestra sociedad, la cantidad de información audiovisual disponible en formato digital está aumentando considerablemente. Por ello, ha sido necesario diseñar sistemas que permitan describir el contenido de diversos tipos de información multimedia para su búsqueda y clasificación.

Los descriptores audiovisuales se encargan de la descripción del contenido. Estos descriptores poseen un buen conocimiento de los objetos y eventos presentes en un vídeo, imagen o audio , y permiten realizar búsquedas rápidas y eficientes del contenido audiovisual.

Este sistema se puede comparar con los motores de búsqueda de contenido textual. Si bien es relativamente fácil encontrar texto con una computadora, es mucho más difícil encontrar fragmentos de audio y video concretos. Por ejemplo, imaginemos a alguien buscando una escena de una persona feliz. La felicidad es un sentimiento y su forma, color y textura no se pueden describir fácilmente en imágenes.

La descripción del contenido audiovisual no es una tarea superficial y resulta esencial para el uso eficaz de este tipo de archivos. El sistema de estandarización que se ocupa de los descriptores audiovisuales es el MPEG-7 ( Motion Picture Expert Group - 7 ).

Tipos

Los descriptores son el primer paso para descubrir la conexión entre los píxeles que contiene una imagen digital y lo que los humanos recuerdan después de haber observado una imagen o un grupo de imágenes tras unos minutos.

Los descriptores visuales se dividen en dos grupos principales:

  • Descriptores de información general: contienen descriptores de bajo nivel que proporcionan una descripción sobre el color, la forma, las regiones , las texturas y el movimiento.
  • Descriptores de información de dominio específico: proporcionan información sobre objetos y eventos en la escena. Un ejemplo concreto sería el reconocimiento facial .

Descriptores de información general

Los descriptores de información general consisten en un conjunto de descriptores que abarcan diferentes características básicas y elementales como: color, textura, forma, movimiento, ubicación y otras. Esta descripción se genera automáticamente mediante el procesamiento de señales .

Color

Es la cualidad más básica del contenido visual. Se definen cinco herramientas para describir el color. Las tres primeras herramientas representan la distribución del color y las últimas describen la relación de color entre secuencias o grupos de imágenes :

  • Descriptor de color dominante (DCD)
  • Descriptor de color escalable (SCD)
  • Descriptor de estructura de color (CSD)
  • Descriptor de diseño de color (CLD)
  • Grupo de imágenes (GdI) o grupo de fotografías (GdP)

Textura

Es una cualidad importante para describir una imagen. Los descriptores de textura caracterizan las texturas o regiones de la imagen. Observan la homogeneidad de la región y los histogramas de los bordes de estas regiones. El conjunto de descriptores está formado por:

Forma

Contiene información semántica importante debido a la capacidad humana de reconocer objetos por su forma. Sin embargo, esta información solo puede extraerse mediante una segmentación similar a la que implementa el sistema visual humano. Actualmente, aún no se dispone de un sistema de segmentación de este tipo; no obstante, existen varios algoritmos que se consideran una buena aproximación. Estos descriptores describen regiones, contornos y formas para imágenes 2D y volúmenes 3D . Los descriptores de forma son los siguientes:

  • Descriptor de forma basado en regiones (RSD)
  • Descriptor de forma basado en contornos (CSD)
  • Descriptor de forma 3D (SD 3D)

Movimiento

Se define mediante cuatro descriptores diferentes que describen el movimiento en una secuencia de vídeo . El movimiento está relacionado con el movimiento de los objetos en la secuencia y con el movimiento de la cámara . Esta última información la proporciona el dispositivo de captura, mientras que el resto se implementa mediante el procesamiento de imágenes . El conjunto de descriptores es el siguiente:

  • descriptor de actividad de movimiento (MAD)
  • descriptor de movimiento de la cámara (CMD)
  • Descriptor de trayectoria de movimiento (MTD)
  • Deformación y descriptor de movimiento paramétrico (WMD y PMD)

Ubicación

La ubicación de los elementos en la imagen se utiliza para describirlos en el dominio espacial. Además, los elementos también pueden ubicarse en el dominio temporal:

  • Descriptor localizador de región (RLD)
  • Descriptor de localización espaciotemporal (STLD)

descriptores de información de dominio específicos

Estos descriptores, que proporcionan información sobre objetos y eventos en la escena, no son fáciles de extraer, y menos aún cuando la extracción debe realizarse automáticamente. Sin embargo, pueden procesarse manualmente.

Como ya se ha mencionado, el reconocimiento facial es un ejemplo concreto de una aplicación que intenta obtener esta información automáticamente.

Aplicaciones de descriptores

Entre todas las aplicaciones, las más importantes son:

  • Motores de búsqueda y clasificadores de documentos multimedia .
  • Biblioteca digital : los descriptores visuales permiten una búsqueda muy detallada y concreta de cualquier vídeo o imagen mediante diferentes parámetros de búsqueda. Por ejemplo, la búsqueda de películas en las que aparece un actor conocido, la búsqueda de vídeos que contienen la montaña Everest, etc.
  • Servicio de noticias electrónicas personalizado.
  • Posibilidad de conexión automática a un canal de televisión que esté retransmitiendo un partido de fútbol, ​​por ejemplo, cada vez que un jugador se acerque al área de gol.
  • Control y filtrado de contenido audiovisual específico, como material violento o pornográfico. Asimismo, autorización para ciertos contenidos multimedia .

Véase también

Referencias

  • BS Manjunath (Editor), Philippe Salembier (Editor) y Thomas Sikora (Editor): Introducción a MPEG-7: Interfaz de descripción de contenido multimedia . Wiley & Sons, abril de 2002 - ISBN 0-471-48678-7