La detección de primer plano es una de las tareas principales en el campo de la visión artificial y el procesamiento de imágenes , cuyo objetivo es detectar cambios en secuencias de imágenes. La sustracción de fondo es cualquier técnica que permite extraer el primer plano de una imagen para su posterior procesamiento (reconocimiento de objetos, etc.).
Muchas aplicaciones no necesitan conocer todos los detalles de la evolución del movimiento en una secuencia de vídeo, sino que solo requieren información sobre los cambios en la escena, ya que las regiones de interés de una imagen son los objetos (personas, coches, texto, etc.) en primer plano. Tras la etapa de preprocesamiento de la imagen (que puede incluir la reducción de ruido , el postprocesamiento como la morfología, etc.), se requiere la localización de objetos, para lo cual se puede utilizar esta técnica.
La detección de primer plano separa el primer plano del fondo basándose en los cambios que se producen en el primer plano. Se trata de un conjunto de técnicas que normalmente analizan secuencias de vídeo grabadas en tiempo real con una cámara fija.
Descripción

Todas las técnicas de detección se basan en modelar el fondo de la imagen, es decir, definir el fondo y detectar los cambios que se producen. Definir el fondo puede resultar difícil cuando contiene formas, sombras y objetos en movimiento. Al definir el fondo, se asume que los objetos estáticos pueden variar de color e intensidad con el tiempo.
Los escenarios en los que se aplican estas técnicas suelen ser muy diversos. Pueden presentarse secuencias muy variables, como imágenes con distinta iluminación, interiores, exteriores, calidad y ruido. Además del procesamiento en tiempo real, los sistemas deben adaptarse a estos cambios.
Un sistema de detección de primer plano debería ser capaz de:
- Desarrollar un modelo de fondo (estimación).
- Debe ser resistente a los cambios de iluminación, a los movimientos repetitivos (hojas, olas, sombras) y a los cambios a largo plazo.
sustracción de fondo
La sustracción de fondo es un método ampliamente utilizado para detectar objetos en movimiento en vídeos grabados con cámaras estáticas. Su fundamento reside en la detección de dichos objetos a partir de la diferencia entre el fotograma actual y un fotograma de referencia, a menudo denominado "imagen de fondo" o "modelo de fondo". La sustracción de fondo se realiza principalmente cuando la imagen en cuestión forma parte de una secuencia de vídeo. Este método proporciona información valiosa para numerosas aplicaciones en visión artificial, como el seguimiento de vigilancia o la estimación de la postura humana .
La sustracción de fondo generalmente se basa en una hipótesis de fondo estático que a menudo no es aplicable en entornos reales. En escenas de interiores, los reflejos o las imágenes animadas en las pantallas provocan cambios en el fondo. Del mismo modo, debido al viento, la lluvia o los cambios de iluminación causados por el clima, los métodos de fondo estático presentan dificultades en escenas de exteriores. [ 1 ]
Filtro de promedio temporal

El filtro de promedio temporal es un método propuesto en Velastin. Este sistema estima el modelo de fondo a partir de la mediana de todos los píxeles de varias imágenes anteriores. El sistema utiliza un búfer con los valores de píxeles de los últimos fotogramas para actualizar la mediana de cada imagen.
Para modelar el fondo, el sistema examina todas las imágenes en un período de tiempo determinado llamado tiempo de entrenamiento . En este tiempo, solo mostramos imágenes y calculamos la mediana, píxel a píxel, de todos los gráficos del fondo.
Tras el periodo de entrenamiento de cada nuevo fotograma, el valor de cada píxel se compara con el valor de entrada de los fondos calculados previamente. Si el píxel de entrada se encuentra dentro de un umbral, se considera que coincide con el modelo de fondo y su valor se incluye en el búfer de píxeles. De lo contrario, si el valor está fuera de este umbral, el píxel se clasifica como primer plano y no se incluye en el búfer.
Este método no puede considerarse muy eficiente porque no presenta una base estadística rigurosa y requiere un búfer que tiene un alto coste computacional.
Enfoques convencionales
Un algoritmo robusto de sustracción de fondo debería poder manejar cambios de iluminación, movimientos repetitivos de desorden y cambios de escena a largo plazo. [ 2 ] Los siguientes análisis utilizan la función de V ( x , y , t ) como una secuencia de video donde t es la dimensión de tiempo, x e y son las variables de ubicación de píxeles. Por ejemplo, V (1,2,3) es la intensidad del píxel en la ubicación del píxel (1,2) de la imagen en t = 3 en la secuencia de video.
Utilizando la diferencia de fotogramas
Un algoritmo de detección de movimiento comienza con la segmentación, donde los objetos en primer plano o en movimiento se separan del fondo. La forma más sencilla de implementarlo es tomar una imagen como fondo y comparar los fotogramas obtenidos en el instante t, denotados por I(t), con la imagen de fondo, denotada por B. Mediante cálculos aritméticos sencillos, podemos segmentar los objetos utilizando la técnica de sustracción de imágenes de visión artificial. Esto significa que, para cada píxel en I(t), se toma el valor del píxel, denotado por P[I(t)], y se le resta el valor del píxel correspondiente en la misma posición en la imagen de fondo, denotado por P[B].
En una ecuación matemática, se escribe como:
Se supone que el fondo es el fotograma en el instante t . Esta imagen de diferencia solo mostraría cierta intensidad para las ubicaciones de píxeles que han cambiado en los dos fotogramas. Aunque aparentemente hemos eliminado el fondo, este enfoque solo funcionará para casos en los que todos los píxeles del primer plano se mueven y todos los píxeles del fondo son estáticos. [ 2 ] Se aplica un umbral "Threshold" a esta imagen de diferencia para mejorar la sustracción (véase Umbralización de imagen ):
Esto significa que las intensidades de los píxeles de la imagen de diferencia se "umbralizan" o filtran en función del valor del umbral. [ 3 ] La precisión de este método depende de la velocidad del movimiento en la escena. Los movimientos más rápidos pueden requerir umbrales más altos.
Filtro medio
Para calcular la imagen que contiene solo el fondo, se promedia una serie de imágenes precedentes. Para calcular la imagen de fondo en el instante t:
donde N es el número de imágenes precedentes tomadas para el promedio. Este promedio se refiere al promedio de los píxeles correspondientes en las imágenes dadas. N dependería de la velocidad del video (número de imágenes por segundo en el video) y la cantidad de movimiento en el video. [ 4 ] Después de calcular el fondo B ( x , y , t ) podemos restarlo de la imagen V ( x , y , t ) en el tiempo t = t y umbralizarlo. Por lo tanto, el primer plano es:
donde Th es un valor umbral. De manera similar, también podemos usar la mediana en lugar de la media en el cálculo anterior de B ( x , y , t ).
El uso de umbrales globales e independientes del tiempo (mismo valor Th para todos los píxeles de la imagen) puede limitar la precisión de los dos enfoques anteriores. [ 2 ]
Media gaussiana móvil
Para este método, Wren et al. [ 5 ] proponen ajustar una función de densidad de probabilidad gaussiana (pdf) al más recientefotogramas. Para evitar ajustar el pdf desde cero en cada nuevo intervalo de tiempo del fotograma.Se calcula un promedio móvil (o acumulativo en línea).
La función de densidad de probabilidad de cada píxel se caracteriza por la media.y varianzaLa siguiente es una posible condición inicial (suponiendo que inicialmente cada píxel es fondo):
dóndees el valor de la intensidad del píxel en el tiempoPara inicializar la varianza, podemos, por ejemplo, usar la varianza en x e y de una pequeña ventana alrededor de cada píxel.
Tenga en cuenta que el fondo puede cambiar con el tiempo (por ejemplo, debido a cambios de iluminación u objetos de fondo no estáticos). Para adaptarse a ese cambio, en cada fotogramaLa media y la varianza de cada píxel deben actualizarse de la siguiente manera:
Dóndedetermina el tamaño de la ventana temporal que se utiliza para ajustar la pdf (generalmente) yes la distancia euclidiana entre la media y el valor del píxel.

Ahora podemos clasificar un píxel como fondo si su intensidad actual se encuentra dentro de algún intervalo de confianza de la media de su distribución:
donde el parámetroes un umbral libre (generalmente). Un valor mayor parapermite un fondo más dinámico, mientras que uno más pequeñoaumenta la probabilidad de una transición del fondo al primer plano debido a cambios más sutiles.
En una variante del método, la distribución de un píxel solo se actualiza si se clasifica como fondo. Esto evita que los objetos de primer plano recién introducidos se desvanezcan en el fondo. La fórmula de actualización para la media se modifica en consecuencia:
dóndecuandose considera primer plano yde lo contrario. Entonces cuandoEs decir, cuando el píxel se detecta como primer plano, la media se mantiene igual. Como resultado, un píxel, una vez que se ha convertido en primer plano, solo puede volver a ser fondo cuando el valor de intensidad se acerca al que tenía antes de convertirse en primer plano. Sin embargo, este método tiene varios problemas: solo funciona si todos los píxeles son inicialmente píxeles de fondo (o si los píxeles de primer plano están anotados como tales). Además, no puede manejar cambios graduales de fondo: si un píxel se clasifica como primer plano durante un período de tiempo demasiado largo, la intensidad del fondo en esa ubicación podría haber cambiado (debido a que la iluminación ha cambiado, etc.). Como resultado, una vez que el objeto de primer plano desaparece, la nueva intensidad del fondo podría ya no ser reconocida como tal.
Modelos de mezcla de fondo
El método de mezcla de gaussianas modela cada píxel como una mezcla de gaussianas y utiliza una aproximación en línea para actualizar el modelo. En esta técnica, se asume que los valores de intensidad de cada píxel en el video pueden modelarse mediante un modelo de mezcla gaussiana . [ 6 ] Una heurística simple determina qué intensidades son más probablemente del fondo. Los píxeles que no coinciden con estas se denominan píxeles de primer plano. Los píxeles de primer plano se agrupan mediante análisis de componentes conectados 2D. [ 6 ]
En cualquier momento t, un píxel en particular (La historia de ) es:
Esta historia se modela mediante una mezcla de K distribuciones gaussianas:
dónde:
En primer lugar, cada píxel se caracteriza por su intensidad en el espacio de color RGB. A continuación, la probabilidad de observar el píxel actual viene dada por la siguiente fórmula en el caso multidimensional:
Donde K es el número de distribuciones, ω es un peso asociado a la i-ésima gaussiana en el tiempo t y μ, Σ son la media y la desviación estándar de dicha gaussiana respectivamente.
Una vez inicializados los parámetros, se puede realizar una primera detección de primer plano y luego actualizar los parámetros. La primera distribución gaussiana B que supera el umbral T se conserva como distribución de fondo:
Las otras distribuciones se consideran representativas de una distribución de primer plano. Luego, cuando los nuevos ingresos del marco en los momentos...Se realiza una prueba de coincidencia a cada píxel. Un píxel coincide con una distribución gaussiana si la distancia de Mahalanobis :
donde k es un umbral constante igual aEntonces, pueden darse dos casos:
Caso 1: Se encuentra una coincidencia con una de las k gaussianas. Para el componente coincidente, la actualización se realiza de la siguiente manera: [ 7 ]
Power y Schoonees [3] utilizaron el mismo algoritmo para segmentar el primer plano de la imagen:
La aproximación esencial aes dado por: [ 8 ]
Caso 2: No se encuentra ninguna coincidencia con ninguno de losGaussianas. En este caso, la distribución menos probablese reemplaza por uno nuevo con parámetros:
Una vez realizado el mantenimiento de parámetros, se puede realizar la detección de primer plano y así sucesivamente. Se utiliza una aproximación K-means en línea para actualizar las gaussianas. Se han propuesto numerosas mejoras de este método original desarrollado por Stauffer y Grimson [ 6 ] y se puede encontrar una revisión completa en Bouwmans et al. [ 7 ]. Un método estándar de fondo adaptativo consiste en promediar las imágenes a lo largo del tiempo, creando una aproximación de fondo que es similar a la escena estática actual excepto donde ocurre movimiento.
Encuestas
A continuación se pueden encontrar varias encuestas que tratan sobre categorías o subcategorías de modelos:
- Sustracción de fondo MOG [ 7 ]
- Sustracción de fondo de aprendizaje de subespacios [ 9 ]
- Sustracción de fondo estadístico [ 10 ] [ 11 ]
- Sustracción de fondo difusa [ 12 ]
- Sustracción de fondo RPCA [ 13 ] (Consulte Análisis de componentes principales robusto para obtener más detalles)
- RPCA dinámico para la separación de fondo/primer plano [ 14 ] (Véase Análisis de componentes principales robusto para más detalles)
- Descomposición en matrices de bajo rango más matrices aditivas para la separación de fondo/primer plano [ 15 ]
- Conceptos de redes neuronales profundas para la sustracción de fondo [ 16 ]
- Enfoques tradicionales y recientes para la sustracción de fondo [ 17 ] [ 18 ]
Aplicaciones
- Videovigilancia
- Captura de movimiento óptica
- Interacción persona-computadora
- Codificación de vídeo basada en contenido
- Monitoreo del tráfico
- Reconocimiento de gestos de movimiento en tiempo real
Para más detalles, consulte [ 19 ].
Véase también
Referencias
- ↑ Piccardi, M. (2004). "Técnicas de sustracción de fondo: una revisión" (PDF) . Conferencia Internacional IEEE de 2004 sobre Sistemas, Hombre y Cibernética . págs. 3099–3104 . doi : 10.1109/icsmc.2004.1400815 . ISBN 0-7803-8567-5. S2CID 12127129 .
- 1 2 3 Tamersoy, B. (29 de septiembre de 2009). "Resta de fondo: notas de clase" (PDF) . Universidad de Texas en Austin.
- ↑ Lu, N.; Wang, J.; Wu, Q.; Yang, L. (febrero de 2012). Un método mejorado de detección de movimiento para vigilancia en tiempo real . CiteSeerX 10.1.1.149.33 .
- ↑ Benezeth, Y.; Jodoin, PM; Emile, B.; Laurent, H.; Rosenberger, C. (2008). "Revisión y evaluación de algoritmos de sustracción de fondo comúnmente implementados" (PDF) . 19.ª Conferencia Internacional sobre Reconocimiento de Patrones (PDF) . pp. 1–4 . doi : 10.1109/ICPR.2008.4760998 . ISBN 978-1-4244-2174-9. S2CID 15733287 .
- ↑ Wren, CR; Azarbayejani, A.; Darrell, T.; Pentland, AP (1997). "Pfinder: Seguimiento en tiempo real del cuerpo humano" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 19 (7): 780– 785. Bibcode : 1997ITPAM..19..780W . doi : 10.1109/34.598236 . hdl : 1721.1/10652 .
- 1 2 3 Stauffer, C.; Grimson, WEL (1999). "Modelos adaptativos de mezcla de fondo para seguimiento en tiempo real" (PDF) . Actas de la Conferencia de la Sociedad de Computación IEEE de 1999 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 246–252 . doi : 10.1109/CVPR.1999.784637 . ISBN 0-7695-0149-4. S2CID 8195115 .
- 1 2 3 Bouwmans, T.; El Baf, F.; Vachon, B. (noviembre de 2008). "Modelado de fondo mediante mezcla de gaussianas para detección de primer plano: una revisión" . Patentes recientes en informática . 1 (3): 219– 237. CiteSeerX 10.1.1.324.22 . doi : 10.2174/2213275910801030219 .
- ↑ Power, P.; Schoonees, J. (2002). "Understanding Background Mixture Models for Foreground Segmentation" (PDF) . Proceedings Image and Vision Computing New Zealand 2002. pp. 267–271 .
- ↑ Bouwmans, Thierry (noviembre de 2009). "Aprendizaje de subespacios para modelado de fondo: una revisión" . Patentes recientes en informática . 2 (3): 223– 234. doi : 10.2174/1874479610902030223 . S2CID 62697257 .
- ↑ Chen, CH (2009). Manual de reconocimiento de patrones y visión por computadora . págs. 181–199 . doi : 10.1142/7297 . ISBN 978-981-4273-38-1. S2CID 58410480 .
- ↑ Bouwmans, Thierry (septiembre de 2011). "Modelado estadístico avanzado reciente del fondo para la detección de primer plano: una revisión sistemática" . Patentes recientes en informática . 4 (3): 147– 176. doi : 10.2174/1874479611104030147 .
- ↑ Bouwmans, Thierry (2012). «Restracción de fondo para videovigilancia». Manual de computación blanda para videovigilancia . Serie de criptografía y seguridad de redes de Chapman & Hall/CRC. págs. 103–138 . ISBN 978-1-4398-5684-0.
- ↑ Bouwmans, Thierry; Zahzah, El Hadi (2014). "PCA robusto mediante búsqueda de componentes principales: una revisión para una evaluación comparativa en videovigilancia". Visión por computadora y comprensión de imágenes . 122 : 22–34 . doi : 10.1016/j.cviu.2013.11.009 .
- ↑ Vaswani, Namrata; Bouwmans, Thierry; Javed, Sajid; Narayanamurthy, Praneeth (2018). "Aprendizaje robusto de subespacios: PCA robusto, seguimiento robusto de subespacios y recuperación robusta de subespacios". IEEE Signal Processing Magazine . 35 (4): 32– 55. arXiv : 1711.09492 . Bibcode : 2018ISPM...35d..32V . doi : 10.1109/MSP.2018.2826566 . S2CID 3691367 .
- ↑ Bouwmans, Thierry; Sobral, Andrews; Javed, Sajid; Jung, Soon Ki; Zahzah, El-Hadi (2017). "Descomposición en matrices aditivas de bajo rango para la separación de fondo/primer plano: una revisión para una evaluación comparativa con un conjunto de datos a gran escala". Computer Science Review . 23 : 1–71 . arXiv : 1511.01245 . doi : 10.1016/j.cosrev.2016.11.001 . S2CID 10420698 .
- ↑ Vaswani, Namrata; Bouwmans, Thierry; Javed, Sajid; Narayanamurthy, Praneeth (2018). "Conceptos de redes neuronales profundas para la sustracción de fondo: una revisión sistemática y evaluación comparativa". arXiv : 1811.05255 [ cs.CV ].
- ↑ Bouwmans, T. (25 de julio de 2014). «Enfoques tradicionales en el modelado de fondo para cámaras estáticas». Modelado de fondo y detección de primer plano para videovigilancia . CRC Press. ISBN 9781482205374.
- ↑ Bouwmans, T. (25 de julio de 2014). «Enfoques recientes en el modelado de fondo para cámaras estáticas». Modelado de fondo y detección de primer plano para videovigilancia . CRC Press. ISBN 9781482205374.
- ↑ Bouwmans, T.; Garcia-Garcia, B. (2019). "Restracción de fondo en aplicaciones reales: desafíos, modelos actuales y direcciones futuras". arXiv : 1901.03577 [ cs.CV ].
Comparaciones
En la bibliografía se pueden encontrar varios artículos comparativos/de evaluación:
- A. Sobral, A. Vacavant. " Una revisión exhaustiva de los algoritmos de sustracción de fondo evaluados con vídeos sintéticos y reales "". Visión por Computadora y Comprensión de Imágenes, CVIU 2014, 2014.
- A. Shahbaz, J. Hariyono, K. Jo, " Evaluación de algoritmos de sustracción de fondo para videovigilancia ", FCV 2015, 2015.
- Y. Xu, J. Dong, B. Zhang, D. Xu, " Métodos de modelado de fondo en el análisis de vídeo: una revisión y evaluación comparativa ", CAAI Transactions on Intelligence Technology, páginas 43–60, Volumen 1, Número 1, enero de 2016.
Libros
- T. Bouwmans, F. Porikli, B. Horferlin, A. Vacavant, Manual sobre "Modelado de fondo y detección de primer plano para videovigilancia: enfoques tradicionales y recientes, implementaciones, evaluación comparativa y análisis" , CRC Press, Taylor and Francis Group, junio de 2014. (Para más información: http://www.crcpress.com/product/isbn/9781482205374 )
- T. Bouwmans, N. Aybat y E. Zahzah. Manual sobre descomposición robusta de matrices dispersas y de bajo rango: aplicaciones en el procesamiento de imágenes y vídeo , CRC Press, Taylor and Francis Group, mayo de 2016. (Para más información: http://www.crcpress.com/product/isbn/9781498724623 )
Revistas
- T. Bouwmans, L. Davis, J. Gonzalez, M. Piccardi, C. Shan, Número especial sobre " Modelado de fondo para la detección de primer plano en escenas dinámicas del mundo real ", Número especial en Machine Vision and Applications , julio de 2014.
- A. Vacavant, L. Tougne, T. Chateau, Sección especial sobre " Comparación de modelos de fondo ", Visión por computadora y comprensión de imágenes , CVIU 2014, mayo de 2014.
- A. Petrosino, L. Maddalena, T. Bouwmans, Número especial sobre " Modelado e inicialización del fondo de la escena ", Pattern Recognition Letters , septiembre de 2017.
- T. Bouwmans, Número especial sobre " Detección de objetos en movimiento ", MDPI Journal of Imaging, 2018.
Talleres
- Taller sobre aprendizaje de fondo para detección y seguimiento a partir de vídeos RGB (RGBD 2017) en conjunto con ICIAP 2017. (Para más información: http://rgbd2017.na.icar.cnr.it/ )
- Taller de modelado e inicialización de fondos de escena (SBMI 2015) en conjunto con ICIAP 2015. (Para más información: http://sbmi2015.na.icar.cnr.it/ )
- Taller de detección de cambios de IEEE en conjunto con CVPR 2014. (Para más información: http://www.changedetection.net/ Archivado el 17/12/2014 en Wayback Machine )
- Taller sobre desafíos de los modelos de fondo (BMC 2012) en conjunto con ACCV 2012. (Para más información: http://bmc.iut-auvergne.com/ )
Concursos
- Concurso IEEE de Modelado de Fondos de Escena (SBMC 2016) en conjunto con ICPR 2016 (Para más información: http://pione.dinf.usherbrooke.ca/sbmc2016/ Archivado el 10 de agosto de 2019 en Wayback Machine )
Enlaces externos
- Sustracción de fondo por R. Venkatesh Babu
- Segmentación y seguimiento del primer plano basados en técnicas de modelado de primer plano y fondo por Jaume Gallego
- Detección y extracción de aviones a secuencias de vídeo por Marc García i Ramis
sitios web
- Sitio web de sustracción de fondo
El sitio web Background Sustraction (T. Bouwmans, Univ. La Rochelle, Francia) contiene una lista completa de las referencias en este campo, así como enlaces a conjuntos de datos y software disponibles.
conjuntos de datos
- ChangeDetection.net (Para más información: http://www.changedetection.net/ Archivado el 17/12/2014 en Wayback Machine )
- Desafío de modelos de fondo (Para más información: http://bmc.iut-auvergne.com/ )
- Conjunto de datos de sustracción de fondo artificial de Stuttgart (Para más información: http://www.vis.uni-stuttgart.de/index.php?id=sabs Archivado el 27/03/2015 en Wayback Machine )
- Conjunto de datos SBMI (Para más información: http://sbmi2015.na.icar.cnr.it/ )
- Conjunto de datos SBMnet (Para más información: http://pione.dinf.usherbrooke.ca/dataset/ Archivado el 31/10/2018 en Wayback Machine )
Bibliotecas
- FondoSubtractorCNT
La biblioteca BackgroundSubtractorCNT implementa un algoritmo muy rápido y de alta calidad escrito en C++ basado en OpenCV. Está diseñado para hardware de bajas especificaciones, pero funciona igual de rápido en sistemas Linux y Windows modernos. (Para más información: https://github.com/sagi-z/BackgroundSubtractorCNT ).
- Biblioteca BGS
La biblioteca BGS (A. Sobral, Univ. La Rochelle, Francia) proporciona un marco de trabajo en C++ para realizar algoritmos de sustracción de fondo. El código funciona tanto en Windows como en Linux. Actualmente, la biblioteca ofrece más de 30 algoritmos BGS. (Para más información: https://github.com/andrewssobral/bgslibrary )
- Biblioteca LRS: Herramientas de bajo rango y dispersas para el modelado y la sustracción de fondo en vídeos. La biblioteca LRS (A. Sobral, Univ. La Rochelle, Francia) ofrece una colección de algoritmos de descomposición de bajo rango y dispersa en MATLAB. Diseñada para la segmentación de movimiento en vídeos, también puede utilizarse o adaptarse a otros problemas de visión artificial. Actualmente, la biblioteca LRS contiene más de 100 algoritmos basados en matrices y tensores. (Para más información: https://github.com/andrewssobral/lrslibrary )
- OpenCV: La biblioteca OpenCV proporciona varios algoritmos de segmentación de fondo/primer plano .
- Telecomunicaciones