Articulo de referencia

Modelo de bolsa de palabras en visión artificial

En visión artificial , el modelo de bolsa de palabras ( BoW ) , a veces llamado modelo de bolsa de palabras visuales ( BoVW ), [ 1 ] [ 2 ] se puede aplicar a la clasificación o ...

En visión artificial , el modelo de bolsa de palabras ( BoW ) , a veces llamado modelo de bolsa de palabras visuales ( BoVW ), [ 1 ] [ 2 ] se puede aplicar a la clasificación o recuperación de imágenes , tratando las características de la imagen como palabras. En la clasificación de documentos , una bolsa de palabras es un vector disperso de recuentos de ocurrencia de palabras; es decir, un histograma disperso sobre el vocabulario. En visión artificial , una bolsa de palabras visuales es un vector de recuentos de ocurrencia de un vocabulario de características locales de la imagen.

Representación de imágenes basada en el modelo BoW

Para representar una imagen utilizando el modelo BoW, una imagen puede tratarse como un documento. De manera similar, también es necesario definir las "palabras" en las imágenes. Para lograr esto, generalmente se incluyen los siguientes tres pasos: detección de características , descripción de características y generación de diccionario de códigos. [ 1 ] [ 2 ] [ 3 ] Una definición del modelo BoW puede ser la "representación de histograma basada en características independientes". [ 4 ] La indexación y recuperación de imágenes basada en contenido (CBIR) parece ser la primera en adoptar esta técnica de representación de imágenes. [ 5 ]

Representación de características

Tras la detección de características, cada imagen se abstrae mediante varios parches locales. Los métodos de representación de características se ocupan de cómo representar los parches como vectores numéricos. Estos vectores se denominan descriptores de características. Un buen descriptor debe ser capaz de manejar variaciones de intensidad, rotación, escala y afines hasta cierto punto. Uno de los descriptores más conocidos es la transformada de características invariante a la escala (SIFT). [ 6 ] SIFT convierte cada parche en un vector de 128 dimensiones. Después de este paso, cada imagen es una colección de vectores de la misma dimensión (128 para SIFT), donde el orden de los diferentes vectores no tiene importancia.

Generación de libros de códigos

El paso final del modelo BoW consiste en convertir parches representados por vectores en "palabras clave" (análogas a las palabras en documentos de texto), lo que también genera un "libro de códigos" (análogo a un diccionario). Una palabra clave puede considerarse como un representante de varios parches similares. Un método sencillo consiste en realizar un agrupamiento k-means sobre todos los vectores. [ 7 ] Las palabras clave se definen entonces como los centros de los clústeres aprendidos. El número de clústeres es el tamaño del libro de códigos (análogo al tamaño del diccionario).

De este modo, cada fragmento de una imagen se asigna a una determinada palabra clave mediante el proceso de agrupamiento, y la imagen puede representarse mediante el histograma de dichas palabras clave.

Aprendizaje y reconocimiento basados ​​en el modelo BoW

Los investigadores en visión artificial han desarrollado diversos métodos de aprendizaje para aprovechar el modelo BoW en tareas relacionadas con imágenes, como la categorización de objetos . Estos métodos se pueden dividir, a grandes rasgos, en dos categorías: modelos no supervisados ​​y supervisados. Para problemas de categorización de múltiples etiquetas, la matriz de confusión puede utilizarse como métrica de evaluación.

Modelos no supervisados

Aquí hay algunas notaciones para esta sección. Supongamos que el tamaño del libro de códigos esV{\displaystyle V}.

  • w{\displaystyle w}: cada parchew{\displaystyle w}es un vector V-dimensional que tiene un único componente igual a uno y todos los demás componentes iguales a cero (Para la configuración de agrupamiento k-means, el único componente igual a uno indica el clúster quew{\displaystyle w}pertenece a). Elv{\displaystyle v}La palabra clave en el libro de códigos se puede representar comowv=1{\displaystyle w^{v}=1}yw=0{\displaystyle w^{u}=0}parav{\displaystyle u\neq v}.
  • w{\displaystyle \mathbf {w} }: cada imagen está representada porw=[w1,w2,,wnorte]{\displaystyle \mathbf {w} =[w_{1},w_{2},\cdots ,w_{N}]}, todos los parches en una imagen
  • dj{\displaystyle d_{j}}: elj{\displaystyle j}la imagen en una colección de imágenes
  • do{\displaystyle c}: categoría de la imagen
  • z{\displaystyle z}: tema o asunto del parche
  • π{\displaystyle \pi }: proporción de la mezcla

Dado que el modelo BoW es análogo al modelo BoW en PLN, los modelos generativos desarrollados en el ámbito del texto también pueden adaptarse a la visión por computadora. Se analizan el modelo Naive Bayes simple y los modelos bayesianos jerárquicos.

Bayes ingenuo

El más simple es el clasificador Naive Bayes . [ 2 ] Utilizando el lenguaje de los modelos gráficos , el clasificador Naive Bayes se describe mediante la siguiente ecuación. La idea básica (o suposición) de este modelo es que cada categoría tiene su propia distribución sobre los diccionarios de códigos, y que las distribuciones de cada categoría son observablemente diferentes. Tomemos como ejemplo una categoría de cara y una categoría de coche. La categoría de cara puede enfatizar las palabras clave que representan "nariz", "ojo" y "boca", mientras que la categoría de coche puede enfatizar las palabras clave que representan "rueda" y "ventana". Dado un conjunto de ejemplos de entrenamiento, el clasificador aprende diferentes distribuciones para diferentes categorías. La decisión de categorización se toma mediante

do=argmáximodopag(do|w)=argmáximodopag(do)pag(w|do)=argmáximodopag(do)norte=1nortepag(wnorte|do){\displaystyle c^{*}=\arg \max _{c}p(c|\mathbf {w} )=\arg \max _{c}p(c)p(\mathbf {w} |c)=\arg \max _{c}p(c)\prod _{n=1}^{N}p(w_{n}|c)}

Dado que el clasificador Naive Bayes es simple pero efectivo, se suele utilizar como método de referencia para la comparación.

Modelos bayesianos jerárquicos

La suposición básica del modelo Naive Bayes no siempre se cumple. Por ejemplo, una imagen de una escena natural puede contener varios temas diferentes. El análisis semántico latente probabilístico (pLSA) [ 8 ] [ 9 ] y la asignación latente de Dirichlet (LDA) [ 10 ] son ​​dos modelos de temas populares en el ámbito del texto que abordan el problema de los múltiples "temas". Tomemos LDA como ejemplo. Para modelar imágenes de escenas naturales mediante LDA, se establece una analogía con el análisis de documentos:

  • La categoría de imagen está asignada a la categoría de documento;
  • La proporción de mezcla de temas representa la proporción de mezcla de temas;
  • El índice de temas está vinculado al índice de temas;
  • La palabra clave se asigna a la palabra.

Este método muestra resultados muy prometedores en la categorización de escenas naturales en 13 categorías de escenas naturales . [ 3 ]

Modelos supervisados

Dado que las imágenes se representan en función del modelo BoW, se puede probar cualquier modelo discriminativo adecuado para la categorización de documentos de texto, como la máquina de vectores de soporte (SVM) [ 2 ] y AdaBoost . [ 11 ] El truco del kernel también es aplicable cuando se utiliza un clasificador basado en kernel, como SVM. El kernel de coincidencia piramidal es uno de reciente desarrollo basado en el modelo BoW. El enfoque de características locales de utilizar la representación del modelo BoW aprendida por clasificadores de aprendizaje automático con diferentes kernels (por ejemplo, EMD-kernel yincógnita2{\displaystyle X^{2}}El kernel) ha sido ampliamente probado en el área de reconocimiento de texturas y objetos. [ 12 ] Se han reportado resultados muy prometedores en varios conjuntos de datos. Este enfoque [ 12 ] ha logrado resultados muy impresionantes en el PASCAL Visual Object Classes Challenge .

núcleo de coincidencia de pirámide

El kernel de coincidencia piramidal [ 13 ] es un algoritmo rápido (complejidad lineal en lugar de la clásica complejidad cuadrática) que utiliza una función kernel (que satisface la condición de Mercer ) para mapear las características BoW, o conjuntos de características en alta dimensión, a histogramas multidimensionales de multirresolución. Una ventaja de estos histogramas de multirresolución es su capacidad para capturar características coocurrentes. El kernel de coincidencia piramidal construye histogramas de multirresolución agrupando los puntos de datos en regiones discretas de tamaño creciente. De esta manera, los puntos que no coinciden en resoluciones altas tienen la posibilidad de coincidir en resoluciones bajas. El kernel de coincidencia piramidal realiza una coincidencia de similitud aproximada, sin búsqueda explícita ni cálculo de distancia. En cambio, interseca los histogramas para aproximar la coincidencia óptima. Por consiguiente, el tiempo de cálculo es lineal con respecto al número de características. En comparación con otros enfoques de kernel, el kernel de coincidencia piramidal es mucho más rápido, pero proporciona una precisión equivalente. El kernel de coincidencia piramidal se aplicó a las bases de datos ETH-80 y Caltech 101 con resultados prometedores. [ 13 ] [ 14 ]

Limitaciones y novedades recientes

Una de las desventajas más notorias de BoW es que ignora las relaciones espaciales entre los parches, que son muy importantes en la representación de imágenes. Los investigadores han propuesto varios métodos para incorporar la información espacial. Para mejoras a nivel de características, las características de correlograma pueden capturar coocurrencias espaciales de características. [ 15 ] Para modelos generativos, también se toman en cuenta las posiciones relativas [ 16 ] [ 17 ] de las palabras clave. El modelo jerárquico de forma y apariencia para la acción humana [ 18 ] introduce una nueva capa de partes ( modelo de constelación ) entre la proporción de mezcla y las características BoW, que captura las relaciones espaciales entre las partes en la capa. Para modelos discriminativos, la coincidencia de pirámide espacial [ 19 ] realiza la coincidencia de pirámide dividiendo la imagen en subregiones cada vez más finas y calculando histogramas de características locales dentro de cada subregión. Recientemente, una ampliación de los descriptores de imágenes locales (es decir, SIFT ) mediante sus coordenadas espaciales normalizadas por el ancho y la altura de la imagen ha demostrado ser un enfoque de codificación de coordenadas espaciales robusto y simple [ 20 ] [ 21 ] que introduce información espacial al modelo BoW.

El modelo BoW aún no se ha probado exhaustivamente en cuanto a invariancia de punto de vista e invariancia de escala, y su rendimiento no está claro. Además, el modelo BoW para la segmentación y localización de objetos no se comprende bien. [ 4 ]

Una comparación sistemática de pipelines de clasificación encontró que la codificación de estadísticas de primer y segundo orden (Vector de descriptores agregados localmente (VLAD) [ 22 ] y vector de Fisher (FV) ) aumentó considerablemente la precisión de la clasificación en comparación con BoW, al tiempo que disminuyó el tamaño del libro de códigos, reduciendo así el esfuerzo computacional para la generación del libro de códigos. [ 23 ] Además, una comparación detallada de 2017 de métodos de codificación y agrupación [ 21 ] para BoW ha demostrado que las estadísticas de segundo orden combinadas con codificación dispersa y una agrupación apropiada como la normalización de potencia pueden superar aún más a los vectores de Fisher e incluso acercarse a los resultados de modelos simples de redes neuronales convolucionales en algunos conjuntos de datos de reconocimiento de objetos como Oxford Flower Dataset 102 .

Véase también

Referencias

  1. 1 2 Video Google: Un enfoque de recuperación de texto para la coincidencia de objetos en videos . 13-16 de octubre de 2003. 2003. doi : 10.1109/ICCV.2003.1238663 .
  2. 1 2 3 4 G. Csurka; C. Dance; LX Fan; J. Willamowski y C. Bray (2004). "Categorización visual con bolsas de puntos clave" . Actas del Taller Internacional ECCV sobre Aprendizaje Estadístico en Visión por Computadora .
  3. 1 2 Fei-Fei Li; Perona, P. (2005). "Un modelo jerárquico bayesiano para el aprendizaje de categorías de escenas naturales". Conferencia de la Sociedad de Computación IEEE de 2005 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR'05) . Vol. 2. págs. 524–531 . doi : 10.1109/CVPR.2005.16 . ISBN   978-0-7695-2372-9. S2CID 6387937 . 
  4. 1 2 L. Fei-Fei; R. Fergus y A. Torralba. "Reconocimiento y aprendizaje de categorías de objetos, curso corto CVPR 2007" .
  5. Qiu, G. (2002). "Indexación de patrones cromáticos y acromáticos para la recuperación de imágenes en color basada en contenido" (PDF) . Pattern Recognition . 35 (8): 1675– 1686. Bibcode : 2002PatRe..35.1675Q . doi : 10.1016/S0031-3203(01)00162-5 .
  6. Vidal-Naquet; Ullman (1999). " Reconocimiento de objetos con características informativas y clasificación lineal" (PDF) . Actas de la Novena Conferencia Internacional IEEE sobre Visión por Computadora . págs. 1150–1157 . CiteSeerX 10.1.1.131.1283 . doi : 10.1109/ICCV.2003.1238356 . ISBN   978-0-7695-1950-0. S2CID 15620181 . 
  7. T. Leung; J. Malik (2001). "Representación y reconocimiento de la apariencia visual de materiales mediante textones tridimensionales" (PDF) . International Journal of Computer Vision . 43 (1): 29– 44. doi : 10.1023/A:1011126920638 . S2CID 14915716 . 
  8. T. Hoffman (1999). "Análisis semántico latente probabilístico" (PDF) . Actas de la decimoquinta conferencia sobre incertidumbre en inteligencia artificial . Archivado del original (PDF) el 10 de julio de 2007. Consultado el 10 de diciembre de 2007 .
  9. ^ Sivic, J.; Russell, antes de Cristo; Efros, AA; Zisserman, A.; Freeman, Peso (2005). «Descubriendo objetos y su ubicación en imágenes» (PDF) . Décima Conferencia Internacional IEEE sobre Visión por Computadora (ICCV'05) Volumen 1 . pag. 370. CiteSeerX 10.1.1.184.1253 . doi : 10.1109/ICCV.2005.77 . ISBN   978-0-7695-2334-7. S2CID 206769491 . Archivado del original (PDF) el 31-01-2020 . Recuperado el 10-12-2007 . 
  10. D. Blei; A. Ng y M. Jordan (2003). Lafferty, John (ed.). "Asignación latente de Dirichlet" (PDF) . Journal of Machine Learning Research . 3 ( 4–5 ): 993–1022 . doi : 10.1162/jmlr.2003.3.4-5.993 . Archivado del original (PDF) el 22 de agosto de 2008. Recuperado el 10 de diciembre de 2007 .
  11. Serre, T.; Wolf, L.; Poggio, T. (2005). "Reconocimiento de objetos con características inspiradas en la corteza visual" (PDF) . Conferencia de la Sociedad de Computación IEEE de 2005 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR'05) . Vol. 2. pág. 994. CiteSeerX 10.1.1.71.5276 . doi : 10.1109/CVPR.2005.254 . ISBN    978-0-7695-2372-9. S2CID 260426 . Archivado del original (PDF) el 06-07-2017 . Recuperado el 10-12-2007 . 
  12. 1 2 Jianguo Zhang; Marcin Marszałek; Svetlana Lazebnik ; Cordelia Schmid (2007). "Características locales y núcleos para la clasificación de texturas y categorías de objetos: un estudio exhaustivo" (PDF) . International Journal of Computer Vision . 73 (2): 213–238 . doi : 10.1007/s11263-006-9794-4 . S2CID 1486613. Archivado del original (PDF) el 13 de abril de 2018. Recuperado el 16 de enero de 2008 . 
  13. 1 2 Grauman, K.; Darrell, T. (2005). "The pyramid match kernel: discriminative classification with sets of image features" (PDF) . Décima Conferencia Internacional IEEE sobre Visión por Computadora (ICCV'05) Volumen 1. pág. 1458. CiteSeerX 10.1.1.644.6159 . doi : 10.1109/ICCV.2005.239 . ISBN   978-0-7695-2334-7. S2CID 13036203 . 
  14. Jianchao Yang; Kai Yu; Yihong Gong; Huang, T. (2009). "Coincidencia piramidal espacial lineal mediante codificación dispersa para la clasificación de imágenes" . Conferencia IEEE de 2009 sobre Visión por Computadora y Reconocimiento de Patrones . pág. 1794. doi : 10.1109/CVPR.2009.5206757 . ISBN  978-1-4244-3992-8. S2CID 440212 . Archivado del original el 2019-03-20 . Recuperado el 2011-09-09 . 
  15. Savarese, S.; Winn, J.; Criminisi, A. (2006). "Modelos discriminativos de clase de objetos de apariencia y forma mediante correlaciones" (PDF) . Conferencia de la Sociedad de Computación IEEE de 2006 sobre Visión por Computadora y Reconocimiento de Patrones - Volumen 2 (CVPR'06) . Vol. 2. pág. 2033. CiteSeerX 10.1.1.587.8853 . doi : 10.1109/CVPR.2006.102 . ISBN    978-0-7695-2597-6. S2CID 1457124 . Archivado del original (PDF) el 29-10-2013 . Recuperado el 10-12-2007 . 
  16. Sudderth, EB; Torralba, A.; Freeman, WT; Willsky, AS (2005). "Aprendizaje de modelos jerárquicos de escenas, objetos y partes" (PDF) . Décima Conferencia Internacional IEEE sobre Visión por Computadora (ICCV'05), Volumen 1. pág. 1331. CiteSeerX 10.1.1.128.7259 . doi : 10.1109/ICCV.2005.137 . ISBN   978-0-7695-2334-7. S2CID 6153430 . Archivado del original (PDF) el 03-02-2019 . Recuperado el 10-12-2007 . 
  17. E. Sudderth; A. Torralba; W. Freeman y A. Willsky (2005). "Descripción de escenas visuales mediante procesos de Dirichlet transformados" (PDF) . Actas de Sistemas de Procesamiento de Información Neuronal .
  18. Niebles, Juan Carlos; Li Fei-Fei (2007). "Un modelo jerárquico de forma y apariencia para la clasificación de acciones humanas" (PDF) . Conferencia IEEE de 2007 sobre visión por computadora y reconocimiento de patrones . pág. 1. CiteSeerX 10.1.1.173.2667 . doi : 10.1109/CVPR.2007.383132 . ISBN   978-1-4244-1179-5. S2CID 9213242 . 
  19. Lazebnik, S. ; Schmid, C. ; Ponce, J. (2006). "Más allá de las bolsas de características: coincidencia de pirámide espacial para el reconocimiento de categorías de escenas naturales" (PDF) . Conferencia de la Sociedad de Computación IEEE de 2006 sobre Visión por Computadora y Reconocimiento de Patrones - Volumen 2 (CVPR'06) . Vol. 2. pág. 2169. CiteSeerX 10.1.1.651.9183 . doi : 10.1109/CVPR.2006.68 . ISBN    978-0-7695-2597-6. S2CID 2421251 . Archivado del original (PDF) el 08-05-2018 . Recuperado el 10-12-2007 . 
  20. Koniusz, Piotr; Yan, Fei; Mikolajczyk, Krystian (2013-05-01). "Comparación de enfoques de codificación de características de nivel medio y estrategias de agrupación en la detección de conceptos visuales". Computer Vision and Image Understanding . 117 (5): 479– 492. doi : 10.1016/j.cviu.2012.10.010 . ISSN 1077-3142 . 
  21. 1 2 Koniusz, Piotr; Yan, Fei; Gosselin, Philippe Henri; Mikolajczyk, Krystian (2017-02-24). "Agrupación de ocurrencias de orden superior para bolsas de palabras: detección de conceptos visuales" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 39 (2): 313– 326. doi : 10.1109/TPAMI.2016.2545667 . hdl : 10044/1/39814 . ISSN 0162-8828 . PMID 27019477 .  
  22. Jégou, H.; Douze, M.; Schmid, C.; Pérez, P. (1 de junio de 2010). «Agregación de descriptores locales en una representación compacta de imágenes». Conferencia de la Sociedad de Computación IEEE de 2010 sobre Visión por Computadora y Reconocimiento de Patrones (PDF) . págs. 3304–3311 . doi : 10.1109/CVPR.2010.5540039 . ISBN  978-1-4244-6984-0. S2CID 1912782 . 
  23. Seeland, Marco; Rzanny, Michael; Alaqraa, Nedal; Wäldchen, Jana; Mäder, Patrick (2017-02-24). "Clasificación de especies vegetales mediante imágenes de flores: un estudio comparativo de representaciones de características locales" . PLOS ONE . 12 (2) e0170629. Bibcode : 2017PLoSO..1270629S . doi : 10.1371/ journal.pone.0170629 . ISSN 1932-6203 . PMC 5325198. PMID 28234999 .   
  • Una demostración de dos clasificadores de bolsa de palabras por L. Fei-Fei, R. Fergus y A. Torralba.
  • Caltech Large Scale Image Search Toolbox : una caja de herramientas de Matlab/C++ que implementa la búsqueda de archivos invertidos para el modelo Bag of Words. También contiene implementaciones para la búsqueda rápida y aproximada del vecino más cercano mediante un árbol kd aleatorio , un hash sensible a la localidad y k-means jerárquico .