La detección de copias de vídeo es el proceso de detectar vídeos copiados ilegalmente mediante su análisis y comparación con el contenido original.
El objetivo de este proceso es proteger la propiedad intelectual del creador de vídeos .
Historia
Indyk et al. [ 1 ] desarrollaron una teoría de detección de copias de vídeo basada en la duración de la película; sin embargo, solo funcionaba con películas completas sin modificaciones. Al aplicarla a fragmentos cortos de un vídeo, la técnica de Idynk et al. no detecta que el fragmento sea una copia.
Posteriormente, Oostveen et al. introdujeron el concepto de huella digital , o función hash , que crea una firma única del vídeo a partir de su contenido. Esta huella digital se basa en la duración del vídeo y el brillo, determinado mediante su división en una cuadrícula. La huella digital no permite recrear el vídeo original, ya que solo describe ciertas características del mismo.
Hace algún tiempo, B.Coskun et al. presentaron dos algoritmos robustos basados en la transformada discreta del coseno .
Hampapur y Balle crearon un algoritmo que genera una descripción global de un fragmento de vídeo basándose en el movimiento, el color, el espacio y la duración del mismo.
Se consideró necesario analizar los niveles de color de la imagen, y por ello, Li et al. crearon un algoritmo que examina los colores de un clip mediante la generación de una firma binaria a partir del histograma de cada fotograma. Sin embargo, este algoritmo arroja resultados inconsistentes cuando se añade un logotipo al vídeo, ya que la inserción de los elementos de color del logotipo añade información errónea que puede confundir al sistema.
Técnicas

marcas de agua
Las marcas de agua se utilizan para introducir una señal invisible en un vídeo y facilitar la detección de copias ilegales. Esta técnica es muy utilizada por los fotógrafos . Colocar una marca de agua en un vídeo de forma que sea fácilmente visible para el público permite al creador del contenido detectar fácilmente si la imagen ha sido copiada.
La limitación de las marcas de agua es que, si la imagen original no tiene marca de agua, no es posible saber si otras imágenes son copias.
Firma basada en contenido

En esta técnica, se crea una firma única para el video basándose en su contenido. Existen diversos algoritmos de detección de copias de video que utilizan características del contenido para asignarle un hash de video único . Esta huella digital se puede comparar con otros hashes de video en una base de datos .
Este tipo de algoritmo presenta un problema importante: si varios aspectos del contenido de los vídeos son similares, resulta difícil determinar si el vídeo en cuestión es una copia del original o simplemente similar. En tal caso (por ejemplo, dos noticieros distintos ), el algoritmo puede concluir que el vídeo es una copia, ya que el noticiero suele incluir un banner similar y el presentador suele ocupar una posición parecida. Los vídeos con cambios mínimos de fotogramas a lo largo del tiempo son más vulnerables a colisiones de hash.
Algoritmos
A continuación se presentan algunos algoritmos y técnicas propuestos para la detección de copias en vídeo.
Descriptores globales
descriptor temporal global
En este algoritmo, la intensidad global se define como la suma de las intensidades de todos los píxeles ponderadas a lo largo de todo el vídeo. De este modo, se puede construir una identidad para una muestra de vídeo basándose en la duración del vídeo y las intensidades de los píxeles a lo largo del mismo.
La intensidad global a(t) se define como:
Donde k es el peso de la imagen, I es la imagen y N es el número de píxeles de la imagen.
Descriptor de medición ordinal global
En este algoritmo, el vídeo se divide en N bloques, ordenados por nivel de gris . A continuación, es posible crear un vector que describa el nivel de gris promedio de cada bloque.
Con estos niveles promedio es posible crear un nuevo vector S(t) , la firma del video:
Para comparar dos vídeos, el algoritmo define una D(t) que representa la similitud entre ambos.
El valor devuelto por D(t) ayuda a determinar si el vídeo en cuestión es una copia.
Descriptores ordinales y temporales
Esta técnica fue propuesta por L. Chen y F. Stentiford. La medición de la disimilitud se realiza combinando los dos algoritmos mencionados anteriormente, descriptores temporales globales y descriptores de medición ordinales globales , en el tiempo y el espacio .
TMK+PDQF
En 2019, Facebook liberó el código fuente de TMK+PDQF, [ 2 ] parte de un conjunto de herramientas utilizadas en Facebook para detectar contenido dañino. Genera una firma de un video completo y puede manejar fácilmente cambios de formato o marcas de agua añadidas, pero es menos tolerante con el recorte o la edición. [ 3 ]
Descriptores locales
AJ
Descrito por A. Joly et al., este algoritmo es una mejora del detector de puntos de interés de Harris. Esta técnica sugiere que en muchos vídeos un número significativo de fotogramas son casi idénticos, por lo que resulta más eficiente analizar no todos los fotogramas, sino solo aquellos que muestran una cantidad significativa de movimiento.
ViCopT
ViCopT utiliza los puntos de interés de cada imagen para definir una firma del vídeo completo. En cada imagen, los algoritmos identifican y definen dos partes: el fondo , un conjunto de elementos estáticos a lo largo de una secuencia temporal, y el movimiento , puntos persistentes que cambian de posición a lo largo del vídeo.
Puntos de Interés Espacio-Temporal (PIE)
Este algoritmo fue desarrollado por I. Laptev y T. Lindeberg. Utiliza la técnica de puntos de interés en el espacio y el tiempo para definir la firma de vídeo y crea un vector de 34 dimensiones que almacena dicha firma.
Algoritmo que muestra
Actualmente existen algoritmos para la detección de copias de vídeo que se utilizan en la actualidad. En 2007, se llevó a cabo una demostración de evaluación conocida como Multimedia Understanding Through Semantics, Computation and Learning (MUSCLE) , que puso a prueba algoritmos de detección de copias de vídeo en diversas muestras de vídeo, desde grabaciones caseras hasta segmentos de programas de televisión con una duración de entre un minuto y una hora.
Referencias
- ↑ P. Indyk, G. Iyengar y N. Shivakumar. Cómo encontrar secuencias de vídeo pirateadas en internet. Informe técnico, Universidad de Stanford, 1999.
- ↑ "Facebook publica como código abierto algoritmos para detectar imágenes de explotación infantil y terrorismo" . Agosto de 2019.
- ↑ "Documentos con código: PDQ y TMK + PDQF: una prueba de los algoritmos de hash perceptual de Facebook" .
- MUSCLE (Comprensión multimedia a través de la semántica, la computación y el aprendizaje) (en inglés)
- IBM - Explorando el grupo de visión artificial (en inglés)
- "Un estudio comparativo" (PDF) . Archivado del original (PDF) el 16 de julio de 2011. Consultado el 11 de diciembre de 2010 . (563 KB) (en inglés)
- Multimedia
- Video