Articulo de referencia

Codificador de voz de fase

Un vocoder de fase es un tipo de algoritmo diseñado para vocoder que puede interpolar información presente en los dominios de frecuencia y tiempo de señales de audio mediante el...

Un vocoder de fase es un tipo de algoritmo diseñado para vocoder que puede interpolar información presente en los dominios de frecuencia y tiempo de señales de audio mediante el uso de información de fase extraída de una transformación de frecuencia. [1] El algoritmo informático permite modificaciones del dominio de frecuencia a un archivo de sonido digital (normalmente expansión/compresión de tiempo y cambio de tono ).

En el corazón del vocoder de fase se encuentra la transformada de Fourier de tiempo corto (STFT), codificada típicamente mediante transformadas rápidas de Fourier . La STFT convierte una representación del dominio temporal del sonido en una representación de tiempo-frecuencia (la fase de "análisis"), lo que permite modificaciones de las amplitudes o fases de componentes de frecuencia específicos del sonido, antes de la resíntesis de la representación del dominio de tiempo-frecuencia en el dominio temporal mediante la STFT inversa. La evolución temporal del sonido resintetizado se puede cambiar modificando la posición temporal de los cuadros de la STFT antes de la operación de resíntesis, lo que permite la modificación de la escala temporal del archivo de sonido original.

Problema de coherencia de fase

El principal problema que debe resolverse para todos los casos de manipulación de la STFT es el hecho de que los componentes de señal individuales (sinusoides, impulsos) se distribuirán en múltiples cuadros y múltiples ubicaciones de frecuencia STFT (bins). Esto se debe a que el análisis STFT se realiza utilizando ventanas de análisis superpuestas . La superposición de ventanas da como resultado una fuga espectral de modo que la información de los componentes sinusoidales individuales se distribuye en bins STFT adyacentes. Para evitar los efectos de borde de la reducción gradual de las ventanas de análisis, las ventanas de análisis STFT se superponen en el tiempo. Esta superposición temporal da como resultado el hecho de que los análisis STFT adyacentes están fuertemente correlacionados (una sinusoide presente en el cuadro de análisis en el tiempo "t" también estará presente en los cuadros posteriores). El problema de la transformación de la señal con el vocoder de fase está relacionado con el problema de que todas las modificaciones que se realizan en la representación STFT deben preservar la correlación adecuada entre los bins de frecuencia adyacentes (coherencia vertical) y los cuadros de tiempo (coherencia horizontal). Salvo en el caso de sonidos sintéticos extremadamente simples, estas correlaciones apropiadas sólo se pueden conservar de forma aproximada y, desde la invención del vocoder de fase, la investigación se ha centrado principalmente en encontrar algoritmos que preserven la coherencia vertical y horizontal de la representación STFT después de la modificación. El problema de la coherencia de fase se investigó durante bastante tiempo antes de que aparecieran soluciones adecuadas.

Historia

El vocoder de fase fue introducido en 1966 por Flanagan como un algoritmo que preservaría la coherencia horizontal entre las fases de los bins que representan componentes sinusoidales. [2] Este vocoder de fase original no tenía en cuenta la coherencia vertical entre los bins de frecuencia adyacentes y, por lo tanto, el estiramiento temporal con este sistema producía señales de sonido a las que les faltaba claridad.

La reconstrucción óptima de la señal de sonido a partir de STFT después de modificaciones de amplitud fue propuesta por Griffin y Lim en 1984. [3] Este algoritmo no considera el problema de producir una STFT coherente, pero sí permite encontrar la señal de sonido que tiene una STFT lo más cercana posible a la STFT modificada incluso si la STFT modificada no es coherente (no representa ninguna señal).

El problema de la coherencia vertical siguió siendo un problema importante para la calidad de las operaciones de escalado temporal hasta 1999, cuando Laroche y Dolson [4] propusieron un medio para preservar la coherencia de fase en todos los intervalos espectrales. La propuesta de Laroche y Dolson debe considerarse un punto de inflexión en la historia de los vocoders de fase. Se ha demostrado que, al garantizar la coherencia de fase vertical, se pueden obtener transformaciones de escalado temporal de muy alta calidad.

El algoritmo propuesto por Laroche no permitía preservar la coherencia de fase vertical en los inicios de sonido (inicios de nota). Roebel propuso una solución para este problema. [5]

Un ejemplo de implementación de software de transformación de señal basada en vocoder de fase que utiliza medios similares a los descritos aquí para lograr una transformación de señal de alta calidad es SuperVP de Ircam . [6] [ verificación necesaria ]

Uso en la música

El compositor británico Trevor Wishart utilizó análisis y transformaciones de vocoder de fase de una voz humana como base para su composición Vox 5 (parte de su ciclo Vox más amplio ). [7] Transfigured Wind del compositor estadounidense Roger Reynolds utiliza el vocoder de fase para realizar estiramientos temporales de sonidos de flauta. [8] La música de JoAnn Kuchera-Morin hace uno de los primeros y más extensos usos de transformaciones de vocoder de fase, como en Dreampaths (1989). [9]

Véase también

Referencias

  1. ^ Sethares, William. "Un codificador de voz de fase en Matlab". sethares.engr.wisc.edu . Consultado el 6 de diciembre de 2020 .
  2. ^ Flanagan JL y Golden, RM (1966). "Codificador de voz de fase". Bell System Technical Journal . 45 (9): 1493–1509. doi :10.1002/j.1538-7305.1966.tb01706.x.
  3. ^ Griffin D. y Lim J. (1984). "Estimación de señal a partir de la transformada de Fourier de tiempo corto modificada". IEEE Transactions on Acoustics, Speech, and Signal Processing . 32 (2): 236–243. CiteSeerX 10.1.1.306.7858 . doi :10.1109/TASSP.1984.1164317. 
  4. ^ J. Laroche y M. Dolson (1999). "Modificación de la escala temporal del audio mediante vocoder de fase mejorada". IEEE Transactions on Speech and Audio Processing . 7 (3): 323–332. doi :10.1109/89.759041.
  5. ^ Roebel A., "Un nuevo enfoque para el procesamiento transitorio en el vocoder de fase", DAFx, 2003. pdf Archivado el 17 de junio de 2004 en Wayback Machine.
  6. ^ "SuperVP", Ircam.fr .
  7. ^ Wishart, T. "La composición de Vox 5". Computer Music Journal 4 de diciembre de 1988
  8. ^ Serra, X. 'Un sistema para el análisis/transformación/síntesis del sonido basado en la descomposición determinista más estocástica', p.12 (Tesis doctoral 1989)
  9. ^ Roads, Curtis (2004). Microsonido , pág. 318. MIT Press. ISBN 9780262681544 . 
  • El vocoder de fase: un tutorial: una buena descripción del vocoder de fase
  • Nuevas técnicas de Phase Vocoder para cambios de tono, armonización y otros efectos exóticos
  • Un nuevo enfoque para el procesamiento transitorio en el Phase Vocoder
  • Phase Vocoder - Descripción del Phase Vocoder con figuras y ecuaciones
Obtenido de "https://es.wikipedia.org/w/index.php?title=Codificador_de_voz_de_fase&oldid=1174458737"