A principios de la década de 2000, existían varios paquetes de software de reconocimiento de voz (SR) para Linux . Algunos eran software libre y de código abierto, mientras que otros eran software propietario . El reconocimiento de voz generalmente se refiere al software que intenta distinguir miles de palabras en un idioma humano. El control por voz puede referirse al software utilizado para comunicar comandos operativos a una computadora.
Reconocimiento de voz nativo de Linux
Historia
A finales de la década de 1990, IBM lanzó una versión de ViaVoice para Linux , disponible gratuitamente para los usuarios. En 2002, el desarrollador eliminó el kit de desarrollo de software (SDK) gratuito.
Estado de desarrollo
A principios de la década de 2000, se impulsó el desarrollo de un motor de reconocimiento de voz nativo de alta calidad para Linux. Como resultado, se iniciaron varios proyectos dedicados a la creación de programas de reconocimiento de voz para Linux, como Mycroft , similar a Microsoft Cortana , pero de código abierto. En 2022, OpenAI publicó el modelo de reconocimiento de voz de propósito general Whisper como código abierto bajo la licencia MIT . [ 1 ]
Muestra de voz obtenida mediante crowdsourcing
Es fundamental recopilar un corpus de voz para generar modelos acústicos para proyectos de reconocimiento de voz . VoxForge es un repositorio gratuito de corpus de voz y modelos acústicos creado para recopilar transcripciones de voz utilizadas en proyectos de reconocimiento de voz. VoxForge acepta muestras de voz aportadas por la comunidad y correcciones de secuencias de voz reconocidas. Su licencia es la Licencia Pública General GNU (GPL).
concepto de reconocimiento de voz
El primer paso es comenzar a grabar una transmisión de audio en una computadora. El usuario tiene dos opciones principales de procesamiento:
- El reconocimiento de voz discreto (DSR) procesa la información completamente en una máquina local. Se refiere a sistemas autónomos en los que todos los aspectos del reconocimiento de voz se realizan íntegramente en el ordenador del usuario. Esto se está volviendo fundamental para proteger la propiedad intelectual y evitar la vigilancia no deseada (2018).
- El reconocimiento de voz remoto o basado en servidor transmite un archivo de audio a un servidor remoto para convertirlo en un archivo de texto. Debido a los recientes sistemas de almacenamiento en la nube y la minería de datos, este método facilita la vigilancia, el robo de información y la inserción de malware.
El reconocimiento remoto se utilizaba anteriormente en teléfonos inteligentes debido a que carecían del rendimiento, la memoria RAM o el almacenamiento suficientes para procesar el reconocimiento de voz dentro del propio teléfono. Estas limitaciones se han superado en gran medida, aunque el reconocimiento de voz basado en servidores en dispositivos móviles sigue siendo habitual.
Reconocimiento de voz en el navegador
El reconocimiento de voz discreto se puede realizar dentro de un navegador web y funciona correctamente con los navegadores compatibles. El reconocimiento de voz remoto no requiere la instalación de software en una computadora de escritorio o dispositivo móvil, ya que se trata principalmente de un sistema basado en servidor con los problemas de seguridad inherentes mencionados anteriormente.
- Remoto : El servicio de dictado graba una pista de audio del usuario a través de un navegador web.
- DSR : Algunas soluciones funcionan únicamente en el cliente, sin enviar datos a los servidores.
Motores de reconocimiento de voz gratuitos
A continuación se presenta una lista de proyectos dedicados a la implementación del reconocimiento de voz en Linux, junto con las principales soluciones nativas. No se trata de aplicaciones para el usuario final, sino de bibliotecas de programación que pueden utilizarse para desarrollar dichas aplicaciones.
- CMU Sphinx es un término general que describe un grupo de sistemas de reconocimiento de voz desarrollados en la Universidad Carnegie Mellon.
- HTK era el software de reconocimiento de voz más famoso y utilizado antes de Kaldi.
- Julius es un software decodificador de reconocimiento continuo de voz con vocabulario amplio (LVCSR) de alto rendimiento y dos pasadas, diseñado para investigadores y desarrolladores relacionados con el habla.
- Kaldi es un conjunto de herramientas para el reconocimiento de voz que se distribuye bajo la licencia Apache.
- Mozilla DeepSpeech está desarrollando un motor de conversión de voz a texto de código abierto basado en el artículo de investigación de Baidu sobre voz profunda. [ 2 ]
- VoxForge es un repositorio gratuito de corpus de voz y modelos acústicos para motores de reconocimiento de voz de código abierto.
Motores de reconocimiento de voz propietarios
- Janus Recognition Toolkit (JRTk) es un conjunto de herramientas de reconocimiento de voz de código cerrado, principalmente dirigido a Linux, desarrollado por Interactive Systems Laboratories en la Universidad Carnegie Mellon y el Instituto Tecnológico de Karlsruhe, para el cual existen licencias comerciales y de investigación. [ 3 ]
Control por voz y atajos de teclado
El reconocimiento de voz generalmente se refiere al software que intenta distinguir miles de palabras en un idioma humano. El control por voz puede referirse al software utilizado para enviar comandos operativos a una computadora o electrodoméstico. El control por voz generalmente requiere un vocabulario mucho más reducido y, por lo tanto, es mucho más fácil de implementar.
El software sencillo, combinado con atajos de teclado , ofrece el potencial más temprano para un control por voz prácticamente preciso en Linux.
Ejecutar software de reconocimiento de voz de Windows con Linux
A través de la capa de compatibilidad
Es posible usar programas como Dragon NaturallySpeaking en Linux, usando Wine , aunque pueden surgir algunos problemas, dependiendo de la versión que se use. [ 4 ]
Mediante Windows virtualizado
También es posible usar el software de reconocimiento de voz de Windows en Linux. Mediante software de virtualización gratuito , es posible ejecutar Windows y NaturallySpeaking en Linux. VMware Server o VirtualBox permiten copiar y pegar desde y hacia una máquina virtual, lo que facilita la transferencia de texto dictado desde y hacia la máquina virtual. [ 5 ]
Véase también
- Lista de software de reconocimiento de voz
- Guía para interfaces de voz : Guía para el diseño de interfaces operadas por voz humana.
Referencias
- ↑ openai/whisper , OpenAI, 4 de julio de 2026 , consultado el 4 de julio de 2026
- ↑ "Una implementación en TensorFlow de la arquitectura DeepSpeech de Baidu" . Mozilla. 5 de diciembre de 2017. Consultado el 5 de diciembre de 2017 .
- ↑ (IAR), Roedder, Margit (26 de enero de 2018). "KIT – Janus Recognition Toolkit" . isl.ira.uka.de. Archivado del original el 19 de julio de 2012.
{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ "WineHQ – Dragon Naturally Speaking" . appdb.winehq.org .
- ↑ Herrod, Stephen Alan (13 de diciembre de 2010). "Investigación y desarrollo de sistemas en VMware" . SIGOPS Oper. Syst. Rev. 44 ( 4): 1– 2. doi : 10.1145/1899928.1899949 . ISSN 0163-5980 .
Enlaces externos
- Accesibilidad, reconocimiento de voz – Ayuda de Ubuntu
- Accesibilidad informática
- Accesibilidad de GNOME
- Software de audio y vídeo para Linux
- Reconocimiento de voz