Una huella acústica es un resumen digital condensado, una huella digital , generada de forma determinista a partir de una señal de audio , que puede utilizarse para identificar una muestra de audio o localizar rápidamente elementos similares en una base de datos musical . [ 1 ]
Entre las aplicaciones prácticas de la identificación acústica se incluyen la identificación de canciones , melodías , tonadas o anuncios ; la gestión de bibliotecas de efectos de sonido ; y la identificación de archivos de vídeo . La identificación de medios mediante huellas acústicas permite monitorizar el uso de obras musicales y actuaciones específicas en emisiones de radio , discos , CD , plataformas de streaming y redes P2P . Esta identificación se ha utilizado en el cumplimiento de los derechos de autor, la concesión de licencias y otros sistemas de monetización .
Atributos
Un algoritmo robusto de huella acústica debe tener en cuenta las características perceptivas del audio. Si dos archivos suenan igual para el oído humano, sus huellas acústicas deberían coincidir, incluso si sus representaciones binarias (digitales) son muy diferentes. Las huellas acústicas no son funciones hash criptográficas , que son sensibles a cualquier pequeño cambio en los datos. Las huellas acústicas son más análogas a las huellas dactilares humanas, donde se toleran pequeñas variaciones que son insignificantes para las características que utiliza la huella. Podemos imaginar el caso de una huella dactilar humana borrosa que se puede comparar con precisión con otra muestra de huella dactilar en una base de datos de referencia; las huellas acústicas funcionan de manera similar.
Las características perceptivas que suelen explotar las huellas digitales de audio incluyen la tasa media de cruce por cero , el tempo estimado , el espectro medio , la planitud espectral , los tonos prominentes en un conjunto de bandas de frecuencia y el ancho de banda .
La mayoría de las técnicas de compresión de audio modifican radicalmente la codificación binaria de un archivo de audio, sin afectar significativamente su percepción auditiva. Una huella acústica robusta permite identificar una grabación tras dicha compresión, incluso si la calidad del audio se reduce considerablemente. Para su uso en la monitorización de emisiones de radio , las huellas acústicas deben ser insensibles a los artefactos de la transmisión analógica .
Espectrograma
Generar una firma a partir del audio es esencial para la búsqueda por sonido . Una técnica común es crear un gráfico de tiempo-frecuencia llamado espectrograma .
Cualquier fragmento de audio puede convertirse en un espectrograma. Cada fragmento se divide en segmentos temporales. En algunos casos, los segmentos adyacentes comparten un límite temporal común; en otros, pueden superponerse. El resultado es un gráfico que representa tres dimensiones del audio: frecuencia, amplitud (intensidad) y tiempo.
Shazam
El algoritmo de Shazam selecciona puntos donde hay picos en el espectrograma que representan un mayor contenido energético. [ 2 ] Centrarse en los picos del audio reduce considerablemente el impacto del ruido de fondo en la identificación de audio. Shazam construye su catálogo de huellas digitales como una tabla hash , donde la clave es la frecuencia. No solo marcan un único punto en el espectrograma, sino un par de puntos: la intensidad del pico más un segundo punto de referencia . [ 3 ] Por lo tanto, la clave de su base de datos no es solo una frecuencia, sino un hash de las frecuencias de ambos puntos. Esto reduce las colisiones de hash , mejorando el rendimiento de la tabla hash. [ 4 ]
Chromaprint, AcoustID y MusicBrainz
Cuando las empresas comerciales de identificación acústica generaban incertidumbre sobre los algoritmos propietarios a finales de la década de 2000, uno de los colaboradores del servicio de datos abiertos MusicBrainz , Lukáš Lalinský, desarrolló un algoritmo de código abierto, Chromaprint, y el servicio AcoustID que lo utiliza. [ 5 ] MusicBrainz ahora utiliza este servicio.
Véase también
Referencias
- ↑ ISO IEC TR 21000-11 (2004), Marco multimedia (MPEG-21) - Parte 11: Herramientas de evaluación para tecnologías de asociación persistente
- ↑ Surdu, Nicolae (20 de enero de 2011). "¿Cómo funciona Shazam para reconocer una canción?" . Archivado del original el 24 de octubre de 2016. Recuperado el 12 de febrero de 2018 .
- ↑ Li-Chun Wang, Avery, Un algoritmo de búsqueda de audio de nivel industrial (PDF) , Universidad de Columbia , consultado el 2 de abril de 2018.
- ↑ "Cómo funciona Shazam" . 10 de enero de 2009. Consultado el 2 de abril de 2018 .
- ↑ "Presentación de Chromaprint – Lukáš Lalinský" . Oxygene.sk. 24 de julio de 2010. Archivado del original el 10 de octubre de 2018. Consultado el 23 de noviembre de 2024 .
Enlaces externos
- Revisión de algoritmos para la identificación de huellas digitales de audio (P. Cano et al. En Taller internacional sobre procesamiento de señales multimedia, Islas Vírgenes de los Estados Unidos, diciembre de 2002)
- Recuperación de música y audio basada en contenido, por Jonathan Foote, ISS, Universidad Nacional de Singapur.
- Huella acústica
- Algoritmos de huellas dactilares