Articulo de referencia

Anotación automática de imágenes

Resultado del software de "subtitulado denso" DenseCap, que analiza una fotografía de un hombre montando un elefante. La anotación automática de imágenes (también conocida como ...

Resultado del software de "subtitulado denso" DenseCap, que analiza una fotografía de un hombre montando un elefante.

La anotación automática de imágenes (también conocida como etiquetado automático de imágenes o indexación lingüística ) es el proceso mediante el cual un sistema informático asigna automáticamente metadatos, como subtítulos o palabras clave, a una imagen digital . Esta aplicación de técnicas de visión artificial se utiliza en sistemas de recuperación de imágenes para organizar y localizar imágenes de interés en una base de datos .

Este método puede considerarse un tipo de clasificación de imágenes multiclase con un número muy grande de clases, tan grande como el tamaño del vocabulario. Normalmente, las técnicas de aprendizaje automático utilizan el análisis de imágenes en forma de vectores de características extraídos y palabras de anotación de entrenamiento para intentar aplicar automáticamente anotaciones a nuevas imágenes. [ 1 ] Los primeros métodos aprendieron las correlaciones entre las características de la imagen y las anotaciones de entrenamiento. Posteriormente, se desarrollaron técnicas que utilizaban la traducción automática para intentar traducir el vocabulario textual al «vocabulario visual», representado por regiones agrupadas conocidas como blobs. El trabajo posterior ha incluido enfoques de clasificación, modelos de relevancia y otros métodos relacionados.

Las ventajas de la anotación automática de imágenes frente a la recuperación de imágenes basada en contenido (CBIR) radican en que las consultas pueden ser especificadas de forma más natural por el usuario. [ 2 ] Actualmente, la recuperación de imágenes basada en contenido (CBIR) generalmente requiere que los usuarios busquen por conceptos de imagen como color y textura o mediante consultas de ejemplo. Sin embargo, ciertas características de las imágenes de ejemplo pueden eclipsar el concepto en el que el usuario se centra realmente. Los métodos tradicionales de recuperación de imágenes, como los utilizados por las bibliotecas, se han basado en imágenes anotadas manualmente, lo cual es costoso y requiere mucho tiempo, especialmente dada la gran cantidad de bases de datos de imágenes existentes, que además están en constante crecimiento.

Véase también

Referencias

  1. Barrat, Sabine; Tabbone, Salvatore (1 de mayo de 2010). "Modelado, clasificación y anotación de imágenes débilmente anotadas mediante redes bayesianas" . Journal of Visual Communication and Image Representation . 21 (4): 355– 363. doi : 10.1016/j.jvcir.2010.02.010 . ISSN 1047-3203 . 
  2. "Copia archivada" (PDF) . i.yz.yamagata-u.ac.jp . Archivado del original (PDF) el 8 de agosto de 2014 . Recuperado el 13 de enero de 2022 .{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace )
  • Datta, Ritendra; Dhiraj Joshi; Jia Li ; James Z. Wang (2008). "Recuperación de imágenes: ideas, influencias y tendencias de la nueva era" . ACM Computing Surveys . 40 (2): 1– 60. doi : 10.1145/1348246.1348248 . S2CID 7060187 . 
  • Nicolas Hervé; Nozha Boujemaa (2007). "Anotación de imágenes  : ¿qué enfoque para bases de datos realistas  ?" (PDF) . Conferencia Internacional ACM sobre Recuperación de Imágenes y Vídeo . Archivado del original (PDF) el 20 de mayo de 2011.
  • M. Inoue (2004). "Sobre la necesidad de recuperación de imágenes basada en anotaciones" (PDF) . Taller sobre recuperación de información en contexto . págs. 44-46 . Archivado del original (PDF) el 8 de agosto de 2014. 

Lecturas adicionales

  • Modelo de coocurrencia de palabras
Y. Mori; H. Takahashi y R. Oka (1999). "Transformación de imagen a palabra basada en la división y cuantificación vectorial de imágenes con palabras". Actas del Taller Internacional sobre Gestión Inteligente de Almacenamiento y Recuperación Multimedia . CiteSeerX 10.1.1.31.1704 . 
  • Anotación como traducción automática
P. Duygulu, K. Barnard, N. de Fretias y D. Forsyth (2002). «Reconocimiento de objetos como traducción automática: Aprendizaje de un léxico para un vocabulario de imágenes fijo» . Actas de la Conferencia Europea sobre Visión por Computadora . págs. 97-112 . Archivado del original el 5 de marzo de 2005. 
  • Modelos estadísticos
J Li y JZ Wang (2006). "Anotación computarizada en tiempo real de imágenes" . Actas de ACM Multimedia . págs. 911–920 . 
JZ Wang y J Li (2002). "Indexación lingüística de imágenes basada en aprendizaje con MHMM 2D" . Actas de ACM Multimedia . págs. 436–445 . 
  • Indexación lingüística automática de imágenes
J Li y JZ Wang (2008). "Anotación computarizada en tiempo real de imágenes" . IEEE Transactions on Pattern Analysis and Machine Intelligence .
J Li y JZ Wang (2003). "Indexación lingüística automática de imágenes mediante un enfoque de modelado estadístico" . IEEE Transactions on Pattern Analysis and Machine Intelligence . págs. 1075–1088 . 
  • Modelo de agrupamiento de aspectos jerárquicos
K. Barnard; D.A. Forsyth (2001). "Aprendizaje de la semántica de palabras e imágenes" . Actas de la Conferencia Internacional sobre Visión por Computadora . págs. 408-415 . Archivado del original el 28 de septiembre de 2007. 
  • Modelo de asignación de Dirichlet latente
D. Blei; A. Ng y M. Jordan (2003). "Asignación latente de Dirichlet" (PDF) . Journal of Machine Learning Research . págs.  3:993–1022. Archivado del original (PDF) el 16 de marzo de 2005.
G Carneiro; AB Chan; P Moreno y N Vasconcelos (2006). "Aprendizaje supervisado de clases semánticas para la anotación y recuperación de imágenes" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . págs. 394–410 . 
  • similitud de texturas
RW Picard y TP Minka (1995). "Textura visual para anotación" . Sistemas multimedia .
  • Máquinas de vectores de soporte
C Cusano; G Ciocca y R Scettini (2004). Santini, Simone y Schettini, Raimondo (eds.). "Anotación de imágenes mediante SVM". Imágenes de Internet V. 5304 : 330– 338. Código bibliográfico : 2003SPIE.5304..330C . doi : 10.1117/12.526746 . S2CID 16246057 . 
  • Conjunto de árboles de decisión y subventanas aleatorias
R Maree; P Geurts; J Piater y L Wehenkel (2005). "Subventanas aleatorias para la clasificación robusta de imágenes" . Actas de la Conferencia Internacional IEEE sobre Visión por Computadora y Reconocimiento de Patrones . págs.  1:34–30.
  • Máxima entropía
J Jeon; R Manmatha (2004). "Uso de la entropía máxima para la anotación automática de imágenes" (PDF) . Conferencia Internacional sobre Recuperación de Imágenes y Vídeos (CIVR 2004) . págs. 24–32 . 
  • Modelos de relevancia
J Jeon; V Lavrenko y R Manmatha (2003). "Anotación y recuperación automática de imágenes mediante modelos de relevancia multimedia" (PDF) . Actas de la Conferencia ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . págs. 119–126 . 
  • Modelos de relevancia que utilizan funciones de densidad de probabilidad continuas
V Lavrenko; R Manmatha y J Jeon (2003). "Un modelo para aprender la semántica de las imágenes" (PDF) . Actas de la 16.ª Conferencia sobre Avances en Sistemas de Procesamiento de Información Neuronal NIPS .
  • Modelo de lenguaje coherente
R Jin; JY Chai; L Si (2004). "Anotación automática eficaz de imágenes mediante un modelo de lenguaje coherente y aprendizaje activo" (PDF) . Actas de MM'04 .
  • Redes de inferencia
D. Metzler y R. Manmatha (2004). "Un enfoque de red de inferencia para la recuperación de imágenes" (PDF) . Actas de la Conferencia Internacional sobre Recuperación de Imágenes y Vídeo . págs. 42–50 . 
  • Distribución de Bernoulli múltiple
S Feng; R Manmatha y V Lavrenko (2004). "Modelos de relevancia de Bernoulli múltiples para la anotación de imágenes y vídeos" (PDF) . Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones . págs. 1002–1009 . 
  • Múltiples alternativas de diseño
JY Pan; HJ Yang; P Duygulu; C Faloutsos (2004). "Generación automática de subtítulos para imágenes" (PDF) . Actas de la Conferencia Internacional IEEE de Multimedia y Exposición de 2004 (ICME'04) . Archivado del original (PDF) el 9 de diciembre de 2004.
  • Subtítulos de imágenes
Quan Hoang Lam; Quang Duy Le; Kiet Van Nguyen; Ngan Luu-Thuy Nguyen (2020). "UIT-ViIC: Un conjunto de datos para la primera evaluación de la generación de subtítulos de imágenes en vietnamita" . Actas de la Conferencia Internacional de Inteligencia Colectiva Computacional de 2020 (ICCCI 2020) . arXiv : 2002.00175 . doi : 10.1007/978-3-030-63007-2_57 .
  • Anotación de escenas naturales
J Fan; Y Gao; H Luo; G Xu (2004). "Anotación automática de imágenes mediante el uso de objetos prominentes sensibles al concepto para la representación del contenido de la imagen" . Actas de la 27.ª conferencia internacional anual sobre investigación y desarrollo en recuperación de información . págs. 361–368 . 
  • Filtros globales de bajo nivel relevantes
A Oliva y A Torralba (2001). "Modelado de la forma de la escena: una representación holística de la envoltura espacial" (PDF) . Revista Internacional de Visión por Computadora . págs.  42:145–175.
  • Características globales de la imagen y estimación de densidad no paramétrica
A. Yavlinsky, E. Schofield y S. Rüger (2005). "Anotación automatizada de imágenes mediante características globales y estimación robusta de densidad no paramétrica" ​​(PDF) . Conferencia Internacional sobre Recuperación de Imágenes y Vídeos (CIVR, Singapur, julio de 2005) . Archivado del original (PDF) el 20 de diciembre de 2005.
  • semántica de vídeo
N Vasconcelos y A Lippman (2001). "Modelos estadísticos de estructura de video para análisis y caracterización de contenido" (PDF) . IEEE Transactions on Image Processing . págs. 1–17 . 
Ilaria Bartolini; Marco Patella y Corrado Romani (2010). "Shiatsu: Etiquetado automático jerárquico basado en semántica de vídeos mediante segmentación con cortes" . 3er Taller Internacional Multimedia de ACM sobre Extracción Automatizada de Información en la Producción Multimedia (AIEMPro10) .
  • Refinamiento de la anotación de imágenes
Yohan Jin; Latifur Khan ; Lei Wang y Mamoun Awad (2005). "Anotaciones de imágenes mediante la combinación de múltiples evidencias y wordNet" . XIII Conferencia Internacional Anual de la ACM sobre Multimedia (MM 05) . págs. 706–715 . 
Changhu Wang; Feng Jing; Lei Zhang y Hong-Jiang Zhang (2006). "Refinamiento de anotaciones de imágenes mediante paseo aleatorio con reinicios" . 14.ª Conferencia Internacional Anual de ACM sobre Multimedia (MM 06) .
Changhu Wang; Feng Jing; Lei Zhang y Hong-Jiang Zhang (2007). "Refinamiento de anotaciones de imágenes basado en contenido". Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR 07) . doi : 10.1109/CVPR.2007.383221 .
Ilaria Bartolini y Paolo Ciaccia (2007). "Imaginación: Aprovechamiento del análisis de enlaces para una anotación precisa de imágenes". Springer Adaptive Multimedia Retrieval . doi : 10.1007/978-3-540-79860-6_3 .
Ilaria Bartolini y Paolo Ciaccia (2010). "Anotación y búsqueda de imágenes multidimensionales basadas en palabras clave" . 2.º Taller Internacional de ACM sobre Búsqueda de Palabras Clave en Datos Estructurados (KEYS 2010) .
  • Anotación automática de imágenes mediante un conjunto de descriptores visuales.
Emre Akbas y Fatos Y. Vural (2007). "Anotación automática de imágenes mediante un conjunto de descriptores visuales". Conferencia Internacional sobre Visión por Computadora (CVPR) 2007, Taller sobre Aplicaciones de Aprendizaje Semántico en Multimedia . doi : 10.1109/CVPR.2007.383484 . hdl : 11511/16027 .
  • Un nuevo punto de partida para la anotación de imágenes
Ameesh Makadia y Vladimir Pavlovic y Sanjiv Kumar (2008). "Una nueva línea base para la anotación de imágenes" (PDF) . Conferencia Europea sobre Visión por Computadora (ECCV) .

Clasificación y anotación simultánea de imágenes

Chong Wang y David Blei y Li Fei-Fei (2009). "Clasificación y anotación simultánea de imágenes" (PDF) . Conf. on Computer Vision and Pattern Recognition (CVPR) .
  • TagProp: Aprendizaje métrico discriminativo en modelos de vecinos más cercanos para la autoanotación de imágenes
Matthieu Guillaumin y Thomas Mensink y Jakob Verbeek y Cordelia Schmid (2009). "TagProp: Aprendizaje métrico discriminativo en modelos de vecinos más cercanos para la autoanotación de imágenes" (PDF) . Conferencia Internacional sobre Visión por Computadora (ICCV) .
  • Anotación de imágenes mediante aprendizaje métrico en vecindarios semánticos
Yashaswi Verma y CV Jawahar (2012). "Anotación de imágenes mediante aprendizaje métrico en vecindarios semánticos" (PDF) . Conferencia Europea de Visión por Computadora (ECCV) . Archivado del original (PDF) el 14 de mayo de 2013. Consultado el 26 de febrero de 2014 .
  • Anotación automática de imágenes mediante representaciones de aprendizaje profundo.
Venkatesh N. Murthy, Subhransu Maji y R. Manmatha (2015). "Anotación automática de imágenes mediante representaciones de aprendizaje profundo" (PDF) . Conferencia Internacional sobre Multimedia (ICMR) .
  • Anotación holística de imágenes mediante regiones prominentes e información de la imagen de fondo.
Sarin, Supheakmungkol; Fahrmair, Michael; Wagner, Matthias y Kameyama, Wataru (2012). Aprovechamiento de características del fondo y regiones prominentes para la anotación automática de imágenes . Journal of Information Processing. Vol.  20. pp. 250–266 . 
  • Anotación de imágenes médicas mediante redes bayesianas y aprendizaje activo.
NB Marvasti & E. Yörük y B. Acar (2018). "Anotación de imágenes médicas asistida por computadora: resultados preliminares con lesiones hepáticas en TC" . IEEE Journal of Biomedical and Health Informatics .