La interpolación de audio (también conocida como relleno de audio ) es una tarea de restauración de audio que se ocupa de la reconstrucción de partes faltantes o corruptas de una señal de audio digital . [ 1 ] [ 2 ] [ 3 ] [ 4 ] Las técnicas de relleno se emplean cuando se han perdido partes del audio debido a diversos factores, como errores de transmisión, corrupción de datos o errores durante la grabación. [ 5 ]
El objetivo de la reconstrucción de audio es rellenar los huecos (es decir, las partes faltantes) en la señal de audio sin problemas, haciendo que las partes reconstruidas sean indistinguibles del contenido original y evitando la introducción de distorsiones o alteraciones audibles. [ 1 ] [ 3 ] [ 6 ]
Se han propuesto muchas técnicas para resolver el problema de la restauración de audio y esto generalmente se logra analizando la información temporal [ 4 ] [ 3 ] [ 7 ] y espectral [ 6 ] [ 5 ] que rodea cada porción faltante de la señal de audio considerada.

Los métodos clásicos emplean modelos estadísticos o algoritmos de procesamiento de señales digitales [ 4 ] [ 3 ] [ 7 ] para predecir y sintetizar las secciones faltantes o dañadas. Las soluciones recientes, en cambio, aprovechan los modelos de aprendizaje profundo , gracias a la creciente tendencia de explotar métodos basados en datos en el contexto de la restauración de audio. [ 6 ] [ 5 ] [ 8 ]
Dependiendo de la extensión de la información perdida, la tarea de relleno se puede dividir en tres categorías. El relleno corto se refiere a la reconstrucción de unos pocos milisegundos (aproximadamente menos de 10) de señal faltante, que ocurre en el caso de distorsiones cortas como clics o recortes . [ 9 ] En este caso, el objetivo de la reconstrucción es recuperar la información perdida con exactitud. En el relleno largo, en cambio, con huecos del orden de cientos de milisegundos o incluso segundos, este objetivo se vuelve irrealista, ya que las técnicas de restauración no pueden depender de la información local. [ 10 ] Por lo tanto, además de proporcionar una reconstrucción coherente, los algoritmos necesitan generar nueva información que debe ser semánticamente compatible con el contexto circundante (es decir, la señal de audio que rodea los huecos). [ 6 ] El caso de huecos de duración media se encuentra entre el relleno corto y el largo. Se refiere a la reconstrucción de decenas de milisegundos de datos faltantes , una escala donde la característica no estacionaria del audio ya se vuelve importante. [ 11 ]
Definición
Consideremos una señal de audio digital.. Una versión corrupta de, que es la señal de audio que presenta huecos faltantes para ser reconstruidos, se puede definir como, dóndees una máscara binaria que codifica las muestras confiables o faltantes de, yrepresenta el producto elemento por elemento . [ 5 ] El relleno de audio tiene como objetivo encontrar(es decir, la reconstrucción), que es una estimación de. Este es un problema inverso mal condicionado , que se caracteriza por un conjunto de soluciones no único. [ 5 ] Por esta razón, de manera similar a la formulación utilizada para el problema de relleno en otros dominios, [ 12 ] [ 13 ] [ 14 ] la señal de audio reconstruida se puede encontrar a través de un problema de optimización que se expresa formalmente como
.
En particular,es la señal de audio reconstruida óptima yes un término de medida de distancia que calcula la precisión de reconstrucción entre la señal de audio corrupta y la estimada. [ 12 ] Por ejemplo, este término puede expresarse con un error cuadrático medio o métricas similares .
DesdeSe calcula solo en los fotogramas fiables, hay muchas soluciones que pueden minimizarlo.Por lo tanto, es necesario agregar una restricción a la minimización, para limitar los resultados solo a las soluciones válidas. [ 14 ] [ 13 ] Esto se expresa a través del término de regularización.que se calcula sobre la señal de audio reconstruidaEste término codifica algún tipo de información a priori sobre los datos de audio. Por ejemplo,pueden expresar suposiciones sobre la estacionariedad de la señal, sobre la escasez de su representación o pueden aprenderse a partir de datos. [ 14 ] [ 13 ]
Técnicas
Existen diversas técnicas para realizar la restauración de audio. Estas pueden variar significativamente, influenciadas por factores como los requisitos específicos de la aplicación, la longitud de los huecos y los datos disponibles. [ 6 ] En la literatura, estas técnicas se dividen generalmente en técnicas basadas en modelos (a veces también denominadas técnicas de procesamiento de señales) [ 6 ] y técnicas basadas en datos. [ 5 ]
Técnicas basadas en modelos
Las técnicas basadas en modelos implican la explotación de modelos matemáticos o supuestos sobre la estructura subyacente de la señal de audio. Estos modelos pueden basarse en el conocimiento previo del contenido de audio o en propiedades estadísticas observadas en los datos. Al aprovechar estos modelos, se pueden inferir o estimar las partes faltantes o corruptas de la señal de audio. [ 4 ]
Un ejemplo de técnicas basadas en modelos son los modelos autorregresivos . [ 7 ] [ 15 ] Estos métodos interpolan o extrapolan las muestras faltantes basándose en los valores vecinos, utilizando funciones matemáticas para aproximar los datos faltantes. En particular, en los modelos autorregresivos las muestras faltantes se completan mediante predicción lineal. [ 16 ] Los coeficientes autorregresivos necesarios para esta predicción se aprenden a partir de los datos de audio circundantes, específicamente de los datos adyacentes a cada hueco. [ 7 ] [ 15 ]
Algunas técnicas más recientes abordan la restauración de audio representando las señales de audio como combinaciones lineales dispersas de un número limitado de funciones base (como por ejemplo en la Transformada de Fourier de Tiempo Corto ). [ 4 ] [ 17 ] En este contexto, el objetivo es encontrar la representación dispersa de la sección faltante de la señal que coincida con mayor precisión con la señal circundante no afectada. [ 4 ]
Los métodos mencionados anteriormente muestran un rendimiento óptimo cuando se aplican al relleno de intervalos relativamente cortos, de apenas unas decenas de milisegundos, por lo que pueden incluirse en el contexto del relleno de intervalos cortos. Sin embargo, estas técnicas de procesamiento de señales suelen tener dificultades al tratar con intervalos más largos. [ 5 ] La razón de esta limitación radica en la violación de la condición de estacionariedad, ya que la señal a menudo experimenta cambios significativos después del intervalo, lo que la hace sustancialmente diferente de la señal que lo precede. [ 5 ]
Como forma de superar estas limitaciones, algunos enfoques añaden fuertes suposiciones también sobre la estructura fundamental de la brecha en sí, explotando el modelado sinusoidal [ 18 ] o los gráficos de similitud [ 10 ] para realizar el relleno de porciones faltantes más largas de señales de audio.
Técnicas basadas en datos
Las técnicas basadas en datos se fundamentan en el análisis y la explotación de los datos de audio disponibles. Estas técnicas suelen emplear algoritmos de aprendizaje profundo que aprenden patrones y relaciones directamente de los datos proporcionados. Implican el entrenamiento de modelos con grandes conjuntos de datos de ejemplos de audio, lo que les permite capturar las regularidades estadísticas presentes en las señales de audio. Una vez entrenados, estos modelos pueden utilizarse para generar las partes faltantes de la señal de audio basándose en las representaciones aprendidas, sin estar restringidos por supuestos de estacionariedad. [ 6 ] Las técnicas basadas en datos también ofrecen la ventaja de la adaptabilidad y la flexibilidad, ya que pueden aprender de diversos conjuntos de datos de audio y potencialmente manejar escenarios de relleno complejos. [ 6 ]
Actualmente, estas técnicas constituyen la vanguardia en la reconstrucción de audio, permitiendo reconstruir intervalos de cientos de milisegundos o incluso segundos. Estos resultados son posibles gracias al uso de modelos generativos capaces de generar contenido novedoso para rellenar las partes faltantes. Por ejemplo, las redes generativas antagónicas ( GANA), que representan la vanguardia en modelos generativos en muchos ámbitos, se basan en dos redes neuronales que compiten entre sí, entrenadas simultáneamente en un juego minmax de dos jugadores : el generador produce nuevos datos a partir de muestras de una variable aleatoria , y el discriminador intenta distinguir entre datos generados y reales. [ 19 ] Durante el entrenamiento, el objetivo del generador es engañar al discriminador, mientras que este intenta aprender a clasificar mejor los datos reales y falsos. [ 19 ]
En los métodos de relleno basados en GAN, el generador actúa como un codificador de contexto y produce una finalización plausible para el hueco solo en función de la información disponible que lo rodea. [ 6 ] El discriminador se utiliza para entrenar al generador y prueba la consistencia del audio relleno producido. [ 6 ]
Recientemente, los modelos de difusión también se han consolidado como el estado del arte de los modelos generativos en muchos campos, superando a menudo incluso a las soluciones basadas en GAN. Por esta razón, también se han utilizado para resolver el problema de la restauración de audio, obteniendo resultados válidos. [ 5 ] Estos modelos generan nuevas instancias de datos invirtiendo el proceso de difusión, donde las muestras de datos se transforman progresivamente en ruido gaussiano . [ 5 ]
Una desventaja de los modelos generativos es que suelen necesitar una gran cantidad de datos de entrenamiento . Esto es necesario para que la red generalice bien y pueda producir información de audio coherente, que además presenta cierta complejidad estructural. [ 8 ] No obstante, algunos trabajos demostraron que capturar la esencia de una señal de audio también es posible utilizando solo unas pocas decenas de segundos de una única muestra de entrenamiento. [ 8 ] [ 20 ] [ 21 ] Esto se logra mediante el sobreajuste de una red neuronal generativa a una única señal de audio de entrenamiento. De esta forma, los investigadores pudieron realizar el relleno de audio sin explotar grandes conjuntos de datos. [ 8 ] [ 21 ]
Aplicaciones
La restauración de audio tiene aplicaciones en una amplia gama de campos, incluyendo la restauración y el análisis forense de audio, entre otros. En estos campos, se puede utilizar para eliminar ruido, fallos o distorsiones no deseadas de una grabación de audio, mejorando así su calidad e inteligibilidad. También se puede emplear para recuperar grabaciones antiguas deterioradas que han sufrido modificaciones locales o que presentan muestras de audio faltantes debido a arañazos en los CD . [ 5 ]
La reconstrucción de audio también está estrechamente relacionada con la ocultación de pérdida de paquetes (PLC). En el problema de PLC, es necesario compensar la pérdida de paquetes de audio en las redes de comunicación. Si bien ambos problemas buscan rellenar los huecos faltantes en una señal de audio, PLC tiene mayores restricciones de tiempo de cálculo y solo los paquetes que preceden a un hueco se consideran fiables (se dice que el proceso es causal). [ 22 ] [ 5 ]
Véase también
Referencias
- ^ Le Roux , Jonathan; Kameoka, Hirokazu; Ono, Nobutaka; de Cheveigné, Alain; Sagayama, Shigeki (septiembre de 2008). "Inducción auditiva computacional mediante factorización matricial no negativa de datos faltantes" . Proc. Taller de investigación y tutorial de ISCA sobre audición estadística y perceptiva (SAPA 2008) : 1– 6.
- ^ Le Roux, Jonathan; Kameoka, Hirokazu; Ono, Nobutaka; de Cheveigné, Alain; Sagayama, Shigeki (1 de mayo de 2011). "La inducción auditiva computacional como un problema de ajuste de modelos de datos faltantes con divergencia de Bregman" . Comunicación del habla . Audición perceptual y estadística. 53 (5): 658– 676. doi : 10.1016/j.specom.2010.08.009 . ISSN 0167-6393 .
- 1 2 3 4 Adler, Amir; Emiya, Valentin; Jafari, Maria G.; Elad, Michael; Gribonval, Rémi; Plumbley, Mark D. (marzo de 2012). "Audio Inpainting" . IEEE Transactions on Audio, Speech, and Language Processing . 20 (3): 922– 932. Bibcode : 2012ITASL..20..922A . doi : 10.1109/TASL.2011.2168211 . S2CID 11136245 .
- 1 2 3 4 5 6 Mokrý, Ondřej; Rajmic, Pavel (2020). "Audio Inpainting: Revisited and Reweighted". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 28 : 2906– 2918. arXiv : 2001.02480 . Bibcode : 2020ITASL..28.2906M . doi : 10.1109/TASLP.2020.3030486 . S2CID 210064378 .
- 1 2 3 4 5 6 7 8 9 10 11 12 Moliner, Eloi (2024). "Diffusion-Based Audio Inpainting". Journal of the Audio Engineering Society . 72 (3): 100– 113. arXiv : 2305.15266 . doi : 10.17743/jaes.2022.0129 .
- 1 2 3 4 5 6 7 8 9 10 Marafioti, Andres; Majdak, Piotr; Holighaus, Nicki; Perraudin, Nathanael (enero de 2021). "GACELA: un codificador de contexto generativo adversarial para la inserción de audio largo en música". IEEE Journal of Selected Topics in Signal Processing . 15 (1): 120– 131. arXiv : 2005.05032 . Bibcode : 2021ISTSP..15..120M . doi : 10.1109/JSTSP.2020.3037506 . S2CID 218581410 .
- 1 2 3 4 Janssen, A.; Veldhuis, R.; Vries, L. (abril de 1986). "Interpolación adaptativa de señales de tiempo discreto que pueden modelarse como procesos autorregresivos" (PDF) . IEEE Transactions on Acoustics, Speech, and Signal Processing . 34 (2): 317– 330. doi : 10.1109/TASSP.1986.1164824 . S2CID 17149340 .
- 1 2 3 4 Greshler, Gal; Shaham, Tamar; Michaeli, Tomer (2021). "Catch-A-Waveform: Aprendizaje para generar audio a partir de un único ejemplo corto" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 20916–20928 . arXiv : 2106.06426 .
- ↑ Aplicaciones del procesamiento digital de señales al audio y la acústica (6.ª ed.). Boston, Mass.: Kluwer. 2003. pp. 133–194 . ISBN 978-0-7923-8130-3.
- 1 2 Perraudin, Nathanael; Holighaus, Nicki; Majdak, Piotr; Balazs, Peter (junio de 2018). "Inpainting of Long Audio Segments With Similarity Graphs". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 26 (6): 1083– 1094. arXiv : 1607.06667 . Bibcode : 2018ITASL..26.1083P . doi : 10.1109/TASLP.2018.2809864 . S2CID 3532979 .
- ↑ Marafioti, Andres; Perraudin, Nathanael; Holighaus, Nicki; Majdak, Piotr (diciembre de 2019). "Un codificador de contexto para la inserción de audio". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 27 (12): 2362– 2372. Bibcode : 2019ITASL..27.2362M . doi : 10.1109/TASLP.2019.2947232 . S2CID 53102801 .
- 1 2 Ulyanov, Dmitry; Vedaldi, Andrea; Lempitsky, Victor (1 de julio de 2020). "Deep Image Prior". International Journal of Computer Vision . 128 (7): 1867– 1888. arXiv : 1711.10925 . doi : 10.1007/s11263-020-01303-4 . S2CID 4531078 .
- 1 2 3 Pezzoli, Mirco; Perini, Davide; Bernardini, Alberto; Borrá, Federico; Antonacci, Fabio; Sarti, Augusto (enero 2022). "Enfoque previo profundo para la reconstrucción de la respuesta al impulso espacial" . Sensores . 22 (7): 2710. Código Bib : 2022Senso..22.2710P . doi : 10.3390/s22072710 . PMC 9003306 . PMID 35408325 .
- 1 2 3 Kong, Fantong; Picetti, Francesco; Lipari, Vincenzo; Bestagini, Paolo; Tang, Xiaoming; Tubaro, Stefano (2022). "Reconstrucción no supervisada basada en prior profundo de datos sísmicos muestreados irregularmente". IEEE Geoscience and Remote Sensing Letters . 19 : 1–5 . Bibcode : 2022IGRSL..1944455K . doi : 10.1109/LGRS.2020.3044455 . hdl : 11311/1201461 . S2CID 234970208 .
- 1 2 Etter, W. (mayo de 1996). "Restauración de un segmento de señal de tiempo discreto mediante interpolación basada en parámetros autorregresivos de lado izquierdo y derecho". IEEE Transactions on Signal Processing . 44 (5): 1124– 1135. Bibcode : 1996ITSP...44.1124E . doi : 10.1109/78.502326 .
- ↑ O'Shaughnessy, D. (febrero de 1988). "Codificación predictiva lineal". IEEE Potentials . 7 (1): 29– 32. doi : 10.1109/45.1890 . S2CID 12786562 .
- ↑ Mokry, Ondrej; Zaviska, Pavel; Rajmic, Pavel; Vesely, Vitezslav (septiembre de 2019). «Presentación de SPAIN (SParse Audio INpainter)». 27.ª Conferencia Europea de Procesamiento de Señales (EUSIPCO) de 2019. págs. 1-5 . arXiv : 1810.13137 . doi : 10.23919/EUSIPCO.2019.8902560 . ISBN 978-9-0827-9703-9. S2CID 53109833 .
- ↑ Lagrange, Mathieu; Marchand, Sylvain; Rault, Jean-bernard (15 de octubre de 2005). "Interpolación larga de señales de audio mediante predicción lineal en modelado sinusoidal" . Journal of the Audio Engineering Society . 53 (10): 891–905 .
- 1 2 Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). Generative Adversarial Nets . Vol. 27. Curran Associates, Inc.
{{cite book}}:|work=ignorado ( ayuda ) - ^ Tian, Yapeng; Xu, Chenliang; Li, Dingzeyu (2019). "Antes de audio profundo". arXiv : 1912.10292 [ cs.SD ].
- 1 2 Turetzky, Arnon; Michelson, Tzvi; Adi, Yossi; Peleg, Shmuel (18 de septiembre de 2022). "Deep Audio Waveform Prior". Interspeech 2022 : 2938–2942 . arXiv : 2207.10441 . doi : 10.21437/Interspeech.2022-10735 . S2CID 250920681 .
- ↑ Diener, Lorenz; Sootla, Sten; Branets, Solomiya; Saabas, Ando; Aichner, Robert; Cutler, Ross (18 de septiembre de 2022). "INTERSPEECH 2022 Audio Deep Packet Loss Concealment Challenge". Interspeech 2022. pp. 580–584 . arXiv : 2204.05222 . doi : 10.21437/Interspeech.2022-10829 .
- Aprendizaje automático
- Aprendizaje profundo
- Procesamiento digital de señales