Articulo de referencia

Recuperación de información multimedia

La recuperación de información multimedia ( MMIR o MIR ) es una disciplina de investigación de la informática que tiene como objetivo extraer información semántica de fuentes de...

La recuperación de información multimedia ( MMIR o MIR ) es una disciplina de investigación de la informática que tiene como objetivo extraer información semántica de fuentes de datos multimedia . [ 1 ] Las fuentes de datos incluyen medios directamente perceptibles como audio , imagen y video , fuentes indirectamente perceptibles como texto , descripciones semánticas, [ 2 ] bioseñales, así como fuentes no perceptibles como bioinformación, precios de acciones, etc. La metodología de MMIR se puede organizar en tres grupos:

  1. Métodos para la síntesis de contenido multimedia ( extracción de características ). El resultado de la extracción de características es una descripción.
  2. Métodos para el filtrado de descripciones de medios (por ejemplo, eliminación de redundancias )
  3. Métodos para la categorización de descripciones de medios en clases.

La búsqueda multimedia permite buscar información mediante consultas en múltiples tipos de datos, incluyendo texto y otros formatos multimedia . La búsqueda multimedia se puede implementar a través de interfaces de búsqueda multimodales , es decir, interfaces que permiten enviar consultas de búsqueda no solo como solicitudes de texto, sino también a través de otros medios. Podemos distinguir dos metodologías en la búsqueda multimedia:

  • Búsqueda de metadatos: la búsqueda se realiza en las capas de metadatos .
  • Consulta por ejemplo : La interacción consiste en enviar una pieza de información (por ejemplo, un vídeo, una imagen o un archivo de audio) con el fin de encontrar elementos multimedia similares.

Métodos de extracción de características

La extracción de características está motivada por el gran tamaño de los objetos multimedia, así como por su redundancia y, posiblemente, su ruido. [ 1 ] : 2 En general, se pueden lograr dos objetivos posibles mediante la extracción de características:

  • Resumen de contenido multimedia. En el ámbito del audio, los métodos de resumen incluyen, por ejemplo, los coeficientes cepstrales de frecuencia Mel , la tasa de cruces por cero y la energía de corto tiempo. En el ámbito visual, se pueden utilizar histogramas de color [ 3 ], como el descriptor de color escalable MPEG-7, para la generación de resúmenes.
  • Detección de patrones mediante autocorrelación y/o correlación cruzada . Los patrones son fragmentos multimedia recurrentes que pueden detectarse comparando fragmentos en las dimensiones multimedia (tiempo, espacio, etc.) o comparándolos con plantillas (por ejemplo, plantillas faciales, frases). Los métodos típicos incluyen la codificación predictiva lineal en el dominio de audio/bioseñales, [ 4 ] la descripción de texturas en el dominio visual y los n-gramas en la recuperación de información textual.

Métodos de fusión y filtrado

La recuperación de información multimedia implica el uso de múltiples canales para la comprensión del contenido multimedia. [ 5 ] Cada uno de estos canales se describe mediante transformaciones de características específicas del medio. Las descripciones resultantes deben combinarse en una sola descripción por objeto multimedia. La combinación puede realizarse mediante una simple concatenación si las descripciones tienen un tamaño fijo. Las descripciones de tamaño variable, como las que se presentan frecuentemente en la descripción de movimiento, deben normalizarse primero a una longitud fija.

Entre los métodos más utilizados para filtrar descripciones se incluyen el análisis factorial (por ejemplo, mediante PCA), la descomposición en valores singulares (por ejemplo, como indexación semántica latente en la recuperación de texto) y la extracción y prueba de momentos estadísticos. Conceptos avanzados como el filtro de Kalman se utilizan para la fusión de descripciones.

Métodos de categorización

En general, todas las formas de aprendizaje automático pueden emplearse para la categorización de descripciones multimedia [ 1 ] : 125 aunque algunos métodos se utilizan con mayor frecuencia en un área que en otra. Por ejemplo, los modelos ocultos de Markov son de última generación en el reconocimiento de voz , mientras que la deformación temporal dinámica (un método semánticamente relacionado) es de última generación en la alineación de secuencias genéticas. La lista de clasificadores aplicables incluye los siguientes:

La selección del mejor clasificador para un problema determinado (conjunto de prueba con descripciones y etiquetas de clase, lo que se conoce como verdad fundamental ) puede realizarse automáticamente, por ejemplo, utilizando Weka Data Miner.

Modelos de recuperación de información multimedia: Recuperación de audio en lenguaje hablado. La recuperación de audio en lenguaje hablado se centra en el contenido de audio que contiene palabras habladas. Implica la transcripción del contenido hablado a texto mediante el reconocimiento automático del habla (ASR) y la indexación de las transcripciones para la búsqueda basada en texto.

Características clave: Técnicas: ASR para transcripción e indexación de texto. Tipos de consulta: Consultas basadas en texto. Aplicaciones: Búsqueda de transcripciones de podcasts. Análisis de registros de llamadas de servicio al cliente. Búsqueda de frases específicas en grabaciones de reuniones. Desafíos: Los errores en ASR pueden reducir la precisión de la recuperación. La variabilidad multilingüe y de acento requiere sistemas robustos. Recuperación de audio sin voz La recuperación de audio sin voz maneja contenido de audio sin palabras habladas, como música, sonidos ambientales o efectos de sonido. Este modelo se basa en la extracción de características de audio como tono, ritmo y timbre para identificar audio relevante.

Características clave: Técnicas: Extracción de características acústicas (p. ej., espectrogramas, MFCC). Tipos de consulta: Muestras de audio o descripciones textuales. Aplicaciones: Sistemas de recomendación musical. Detección de sonidos ambientales (p. ej., disparos, llamadas de animales). Recuperación de efectos de sonido en la producción multimedia. Desafíos: Dificultad para salvar la brecha semántica entre las consultas del usuario y las características de audio de bajo nivel. Indexación eficiente de grandes conjuntos de datos. Recuperación de grafos La recuperación de grafos recupera información representada como grafos, que consisten en nodos (entidades) y aristas (relaciones). Se utiliza ampliamente en redes sociales, grafos de conocimiento y bioinformática.

Características clave: Técnicas: Coincidencia de grafos, almacenamiento de listas/matrices de adyacencia y bases de datos de grafos (p. ej., Neo4j). Tipos de consulta: Subgrafos, patrones o consultas textuales. Aplicaciones: Análisis de redes sociales. Búsqueda en grafos de conocimiento. Recuperación de estructuras moleculares. Desafíos: Coincidencia de subgrafos computacionalmente intensiva. Escalabilidad para grafos grandes y complejos. Recuperación de imágenes La recuperación de imágenes recupera imágenes basadas en la entrada del usuario, como descripciones textuales o muestras visuales. Aprovecha tanto las características de bajo nivel como el análisis semántico para la búsqueda.

Características clave: Técnicas: Recuperación de imágenes basada en contenido (CBIR), extracción de características visuales, análisis semántico. Tipos de consulta: Texto, bocetos o imágenes de ejemplo. Aplicaciones: Búsqueda de imágenes de archivo. Coincidencia de productos de comercio electrónico. Análisis de imágenes médicas. Desafíos: Cerrar la brecha semántica entre las consultas del usuario y el contenido de la imagen. Indexación eficiente de conjuntos de datos de imágenes a gran escala. Recuperación de vídeo La recuperación de vídeo es el proceso de encontrar contenido de vídeo específico basado en las consultas del usuario. Implica analizar tanto las características visuales como temporales de los vídeos.

Características clave: Técnicas: Extracción de fotogramas clave, análisis de patrones de movimiento, indexación temporal. Tipos de consulta: Descripciones textuales, clips de muestra o consultas temporales. Aplicaciones: Recomendaciones de servicios de streaming. Análisis de grabaciones de vigilancia. Análisis deportivo. Desafíos: Gestionar los grandes tamaños de archivo del contenido de vídeo. Análisis eficiente de secuencias temporales y características multimodales. Comparación de modelos de recuperación Modelo Tipo de datos Tipos de consulta Aplicaciones Lenguaje hablado Audio Grabaciones de voz Consultas de texto Podcasts, registros de reuniones, centros de llamadas Audio no verbal Música, efectos de sonido Muestras de audio o texto Aplicaciones de música, sonidos ambientales Recuperación de grafos Estructuras de grafos Subgrafos, patrones Grafos de conocimiento, bioinformática Recuperación de imágenes Imágenes Texto, bocetos o imágenes Comercio electrónico, imágenes médicas Recuperación de vídeo Vídeos (visuales + temporales) Texto, clips o consultas de tiempo Vigilancia, análisis deportivo Conclusión La recuperación de información multimedia desempeña un papel crucial en la organización y el acceso a vastos repositorios de datos multimedia. La variedad de modelos de recuperación garantiza que los usuarios puedan interactuar eficazmente con conjuntos de datos multimedia complejos y extraer información valiosa de ellos. Se espera que los futuros avances en inteligencia artificial y aprendizaje automático mejoren la precisión y la escalabilidad de los sistemas MIR.

MMIR ofrece una visión general de los métodos empleados en las áreas de recuperación de información. [ 6 ] [ 7 ] Los métodos de un área se adaptan y se emplean en otros tipos de medios. El contenido multimedia se fusiona antes de realizar la clasificación. Por lo tanto, los métodos de MMIR suelen reutilizarse de otras áreas, tales como:

La Revista Internacional de Recuperación de Información Multimedia [ 8 ] documenta el desarrollo de la Recuperación de Información Multimedia como una disciplina de investigación independiente de estas áreas. Véase también el Manual de Recuperación de Información Multimedia [ 9 ] para una visión general completa de esta disciplina de investigación.

Referencias

  1. 1 2 3 H Eidenberger. Comprensión fundamental de los medios , atpress, 2011, pág. 1.
  2. Sikos, LF (2016). "Herramientas de anotación de vídeo semántico basadas en RDF con mapeo de conceptos a Linked Data para la indexación de vídeo de próxima generación: una revisión exhaustiva" . Multimedia Tools and Applications . 76 (12): 14437– 14460. doi : 10.1007/s11042-016-3705-7 . S2CID 254832794 . 
  3. A Del Bimbo. Recuperación de información visual , Morgan Kaufmann, 1999.
  4. HG Kim, N Moreau, T Sikora. Audio MPEG-7 y más allá , Wiley, 2005.
  5. MS Lew (Ed.). Principios de recuperación de información visual , Springer, 2001.
  6. H Eidenberger. Comprensión de los medios profesionales , atpress, 2012.
  7. Raieli, Roberto (2016). "Introducción a la recuperación de información multimedia en las bibliotecas" . JLIS.it. 7 (3): 9– 42. doi : 10.4403/jlis.it-11530 . S2CID 56652314 . 
  8. " Revista Internacional de Recuperación de Información Multimedia ", Springer, 2011, consultado el 21 de octubre de 2011.
  9. H Eidenberger. Manual de recuperación de información multimedia , atpress, 2012.