La codificación de voz es una aplicación de la compresión de datos a señales de audio digitales que contienen voz . La codificación de voz utiliza la estimación de parámetros específicos de la voz mediante técnicas de procesamiento de señales de audio para modelar la señal de voz, combinada con algoritmos genéricos de compresión de datos para representar los parámetros modelados resultantes en un flujo de bits compacto. [ 1 ]
Las aplicaciones comunes de la codificación de voz son la telefonía móvil y la voz sobre IP (VoIP). [ 2 ] La técnica de codificación de voz más utilizada en telefonía móvil es la codificación predictiva lineal (LPC), mientras que las más utilizadas en aplicaciones VoIP son la LPC y la transformada discreta del coseno modificada (MDCT).
Las técnicas empleadas en la codificación de voz son similares a las utilizadas en la compresión y codificación de datos de audio , donde se emplean principios psicoacústicos para transmitir únicamente datos relevantes para el sistema auditivo humano. Por ejemplo, en la codificación de voz por banda de voz , solo se transmite información en la banda de frecuencia de 400 a 3500 Hz, pero la señal reconstruida conserva una inteligibilidad adecuada .
La codificación de voz se diferencia de otras formas de codificación de audio en que la voz es una señal más simple que otras señales de audio, y se dispone de información estadística sobre sus propiedades. Como resultado, cierta información auditiva relevante en la codificación de audio general puede resultar innecesaria en el contexto de la codificación de voz. La codificación de voz prioriza la preservación de la inteligibilidad y la agradable sonoridad del habla, utilizando una cantidad limitada de datos transmitidos. [ 3 ] Además, la mayoría de las aplicaciones de voz requieren un retardo de codificación bajo, ya que la latencia interfiere con la interacción verbal. [ 4 ]
Categorías
Los codificadores de voz son de dos clases: [ 5 ]
- Codificadores de forma de onda
- Dominio del tiempo: PCM , ADPCM
- Dominio de la frecuencia: codificación de subbandas , ATRAC
- Vocoders
La compresión de muestras vista como una forma de codificación del habla.
Los algoritmos A-law y μ-law utilizados en la telefonía digital G.711 PCM pueden considerarse un precursor de la codificación de voz, que requiere solo 8 bits por muestra pero ofrece efectivamente 12 bits de resolución . [ 7 ] La compresión logarítmica es coherente con la percepción auditiva humana, ya que un ruido de baja amplitud se escucha junto con una señal de voz de baja amplitud, pero queda enmascarado por una de alta amplitud. Aunque esto generaría una distorsión inaceptable en una señal musical, la naturaleza de picos de las formas de onda de la voz, combinada con la estructura de frecuencia simple de la voz como una forma de onda periódica con una única frecuencia fundamental y ocasionales ráfagas de ruido añadidas, hace que estos algoritmos de compresión instantánea tan simples sean aceptables para la voz.
En aquel entonces se probaron diversos algoritmos, principalmente variantes de modulación delta , pero tras un análisis exhaustivo, los diseñadores de los primeros sistemas de telefonía digital optaron por los algoritmos A-law/μ-law. En el momento de su diseño, su reducción del 33 % en el ancho de banda, con una complejidad muy baja, representó una excelente solución de compromiso técnico. Su rendimiento de audio sigue siendo aceptable y no fue necesario reemplazarlos en la red telefónica fija.
En 2008, el códec G.711.1 , que tiene una estructura escalable, fue estandarizado por la UIT-T. La frecuencia de muestreo de entrada es de 16 kHz. [ 8 ]
Compresión de voz moderna
Gran parte del trabajo posterior en compresión de voz estuvo motivado por la investigación militar en comunicaciones digitales para radios militares seguras , donde se utilizaban velocidades de datos muy bajas para lograr un funcionamiento eficaz en un entorno radioeléctrico hostil. Al mismo tiempo, se disponía de mucha más potencia de procesamiento , en forma de circuitos VLSI , que la que ofrecían las técnicas de compresión anteriores. Como resultado, los algoritmos modernos de compresión de voz podían utilizar técnicas mucho más complejas que las disponibles en la década de 1960 para lograr índices de compresión mucho mayores.
Los algoritmos de codificación de voz más utilizados se basan en la codificación predictiva lineal (LPC). [ 9 ] En particular, el esquema de codificación de voz más común es la codificación de predicción lineal excitada por código (CELP) basada en LPC, que se utiliza, por ejemplo, en el estándar GSM . En CELP, el modelado se divide en dos etapas: una etapa predictiva lineal que modela la envolvente espectral y un modelo basado en un libro de códigos del residuo del modelo predictivo lineal. En CELP, los coeficientes de predicción lineal (LPC) se calculan y cuantifican, generalmente como pares espectrales de línea (LSP). Además de la codificación de voz propiamente dicha de la señal, a menudo es necesario utilizar la codificación de canal para la transmisión, para evitar pérdidas debidas a errores de transmisión. Para obtener los mejores resultados de codificación generales, los métodos de codificación de voz y de canal se eligen en pares, con los bits más importantes en el flujo de datos de voz protegidos por una codificación de canal más robusta.
La transformada discreta del coseno modificada (MDCT) se utiliza en la técnica LD-MDCT empleada por el formato AAC-LD introducido en 1999. [ 10 ] Desde entonces, la MDCT se ha adoptado ampliamente en aplicaciones de voz sobre IP (VoIP), como el códec de audio de banda ancha G.729.1 introducido en 2006, [ 11 ] FaceTime de Apple (que utiliza AAC-LD) introducido en 2010, [ 12 ] y el códec CELT introducido en 2011. [ 13 ]
Opus es un codificador de audio de software libre . Combina el algoritmo SILK basado en LPC orientado al habla y el algoritmo CELT basado en MDCT de menor latencia, alternando entre ellos o combinándolos según sea necesario para una máxima eficiencia. [ 14 ] [ 15 ] Se utiliza ampliamente para llamadas VoIP en WhatsApp . [ 16 ] [ 17 ] [ 18 ] La consola de videojuegos PlayStation 4 también utiliza Opus para el chat de grupo de su sistema PlayStation Network . [ 19 ]
Se han demostrado varios códecs con tasas de bits aún más bajas. El códec 2 , que opera a tasas de bits tan bajas como 450 bit/s , se utiliza en la radioafición. [ 20 ] La OTAN utiliza actualmente MELPe , que ofrece habla inteligible a 600 bit/s y por debajo. [ 21 ] También han surgido enfoques de vocoder neuronal: Lyra de Google ofrece una calidad "casi inquietante" a 3 kbit/s . [ 22 ] Satin de Microsoft también utiliza aprendizaje automático, pero utiliza una tasa de bits ajustable más alta y es de banda ancha. [ 23 ]
Subcampos
- Codificación de audio de banda ancha
- Codificación predictiva lineal (LPC)
- AMR-WB para redes WCDMA
- VMR-WB para redes CDMA2000
- Speex , IP-MR, SILK (parte de Opus ) y USAC/xHE-AAC para VoIP y videoconferencias.
- Transformada discreta del coseno modificada (MDCT)
- Modulación por impulsos codificados diferencial adaptativa (ADPCM)
- G.722 para VoIP
- Codificación neuronal del habla
- Lyra (Google): V1 utiliza la reconstrucción de redes neuronales del espectrograma log-mel; V2 es un autoencoder de extremo a extremo .
- Satén (Microsoft)
- LPCNet (Mozilla, Xiph): reconstrucción de características LPC mediante redes neuronales [ 24 ]
- Codificación de audio de banda estrecha
- LPC
- ADPCM
- G.726 para VoIP
- Excitación multibanda (MBE)
Véase también
Referencias
- ↑ Arjona Ramírez, M.; Minam, M. (2003). "Codificación de voz de baja tasa de bits". Wiley Encyclopedia of Telecommunications, JG Proakis, Ed . 3. Nueva York: Wiley: 1299–1308 .
- ↑ M. Arjona Ramírez y M. Minami, "Tecnología y estándares para métodos de vocodificación de baja tasa de bits", en The Handbook of Computer Networks, H. Bidgoli, Ed., Nueva York: Wiley, 2011, vol. 2, pp. 447–467.
- ^ P. Kroon, "Evaluación de codificadores de voz", en Speech Coding and Synthesis, W. Bastiaan Kleijn y KK Paliwal, Ed., Amsterdam: Elsevier Science, 1995, págs.
- ↑ JH Chen, RV Cox, Y.-C. Lin, NS Jayant y MJ Melchner, Un codificador CELP de baja latencia para el estándar de codificación de voz CCITT de 16 kb/s. IEEE J. Select. Areas Commun. 10(5): 830-849, junio de 1992.
- ↑ "Soo Hyun Bae, ECE 8873 Compresión y modelado de datos, Instituto Tecnológico de Georgia, 2004" . Archivado del original el 7 de septiembre de 2006.
- ^ Zeghidour, Neil; Luebs, Alejandro; Omran, Ahmed; Skoglund, enero; Tagliasacchi, Marco (2022). "SoundStream: un códec de audio neuronal de extremo a extremo". Transacciones IEEE/ACM sobre procesamiento de audio, voz y lenguaje . 30 : 495– 507. arXiv : 2107.03312 . doi : 10.1109/TASLP.2021.3129994 . S2CID 236149944 .
- ↑ Jayant, NS; Noll, P. (1984). Codificación digital de formas de onda . Englewood Cliffs: Prentice-Hall.
- ↑ G.711.1 : Extensión integrada de banda ancha para modulación por código de impulsos G.711 , ITU-T, 2012 , consultado el 24/12/2022.
- ↑ Gupta, Shipra (mayo de 2016). "Aplicación de MFCC en el reconocimiento de locutores independiente del texto" (PDF) . Revista Internacional de Investigación Avanzada en Ciencias de la Computación e Ingeniería de Software . 6 (5): 805–810 (806). ISSN 2277-128X . S2CID 212485331. Archivado del original (PDF) el 18 de octubre de 2019. Recuperado el 18 de octubre de 2019 .
- ↑ Schnell, Markus; Schmidt, Markus; Jander, Manuel; Albert, Tobias; Geiger, Ralf; Ruoppila, Vesa; Ekstrand, Per; Bernhard, Grill (octubre de 2008). MPEG-4 Enhanced Low Delay AAC: un nuevo estándar para la comunicación de alta calidad (PDF) . 125.ª Convención de la AES. Fraunhofer IIS . Audio Engineering Society . Consultado el 20 de octubre de 2019 .
- ↑ Nagireddi, Sivannarayana (2008). Procesamiento de señales de voz y fax VoIP . John Wiley & Sons . pág. 69. ISBN 9780470377864.
- ↑ Daniel Eran Dilger (8 de junio de 2010). "Dentro del iPhone 4: videollamadas FaceTime" . AppleInsider . Consultado el 9 de junio de 2010 .
- ↑ Presentación del códec CELT Archivada el 7 de agosto de 2011 en Wayback Machine por Timothy B. Terriberry (65 minutos de vídeo; véanse también las diapositivas de la presentación en PDF).
- ↑ "Opus Codec" . Opus (Página principal). Fundación Xiph.org . Consultado el 31 de julio de 2012 .
- ↑ Valin, Jean-Marc; Maxwell, Gregory; Terriberry, Timothy B.; Vos, Koen (octubre de 2013). Codificación musical de alta calidad y baja latencia en el códec Opus . 135.ª Convención de la AES. Audio Engineering Society . arXiv : 1602.04845 .
- ↑ Leyden, John (27 de octubre de 2015). "WhatsApp al descubierto: se analizan las entrañas de la aplicación que succiona información" . The Register . Consultado el 19 de octubre de 2019 .
- ^ Hazra, Sudip; Mateti, Prabhaker (13 al 16 de septiembre de 2017). "Desafíos en la ciencia forense de Android" . En Thampi, Sabu M.; Pérez, Gregorio Martínez; Westphall, Carlos Becker; Hu, Jiankun; Fan, Chun I.; Mármol, Félix Gómez (eds.). Seguridad en Computación y Comunicaciones: 5to Simposio Internacional, SSCC 2017 . Saltador. págs. 286–299 (290). doi : 10.1007/978-981-10-6898-0_24 . ISBN 9789811068980.
- ↑ Srivastava, Saurabh Ranjan; Dube, Sachin; Shrivastaya, Gulshan; Sharma, Kavita (2019). "Desafíos de seguridad desencadenados por teléfonos inteligentes: problemas, estudios de caso y prevención" . En Le, Dac-Nhuong; Kumar, Raghvendra; Mishra, Brojo Kishore; Chatterjee, Jyotir Moy; Khari, Manju (eds.). Ciberseguridad en computación paralela y distribuida: conceptos, técnicas, aplicaciones y estudios de caso . John Wiley & Sons. pp. 187–206 (200). doi : 10.1002/9781119488330.ch12 . ISBN 9781119488057. S2CID 214034702 .
- ↑ "Software de código abierto utilizado en PlayStation 4" . Sony Interactive Entertainment Inc. Consultado el 11 de diciembre de 2017 .
- ↑ "GitHub - Codec2" . GitHub . Noviembre de 2019.
- ↑ Alan McCree, “Un marco de vocoder fonético escalable que utiliza la cuantificación vectorial predictiva conjunta de parámetros MELP”, en Actas de la Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales, 2006, págs. 1 705–708, Toulouse, Francia
- ↑ Buckley, Ian (2021-04-08). "Google hace público su códec de voz de baja tasa de bits Lyra" . MakeUseOf . Recuperado el 2022-07-21 .
- ↑ Levent-Levi, Tsahi (19 de abril de 2021). "Lyra, Satin y el futuro de los códecs de voz en WebRTC" . BlogGeek.me . Consultado el 21 de julio de 2022 .
- ↑ "LPCNet: Síntesis de voz neuronal eficiente" . Fundación Xiph.Org. 8 de agosto de 2023.
Enlaces externos
- Muestras de prueba de señales de prueba de la UIT-T para sistemas de telecomunicaciones
- Fuentes de la herramienta de evaluación perceptiva de la calidad del habla (PESQ) de la UIT-T
- Códecs de voz
- Compresión de datos