El software de transcripción ayuda a convertir el habla humana en una transcripción de texto. Los archivos de audio o video se pueden transcribir de forma manual o automática. [1] Los transcriptores pueden reproducir una grabación varias veces en un editor de transcripción y escribir lo que escuchan. Al usar teclas de acceso rápido de transcripción, se puede acelerar la transcripción manual, filtrar el sonido, ecualizar o ajustar el tempo cuando la claridad no es muy buena. Con la tecnología de reconocimiento de voz , los transcriptores pueden convertir automáticamente las grabaciones en transcripciones de texto abriendo las grabaciones en una PC y subiéndolas a una nube para la transcripción automática, o transcribir grabaciones en tiempo real mediante dictado digital . Dependiendo de la calidad de las grabaciones, es posible que las transcripciones generadas por máquina aún deban verificarse manualmente. La tasa de precisión de la transcripción automática depende de varios factores, como los ruidos de fondo, la distancia de los hablantes al micrófono y los acentos.
El software de transcripción, al igual que los servicios de transcripción , se suele proporcionar con fines comerciales, legales o médicos . En comparación con el contenido de audio, una transcripción de texto se puede buscar, ocupa menos memoria de la computadora y se puede utilizar como un método alternativo de comunicación, como para subtítulos y subtítulos ocultos .
La definición de "software" de transcripción, en comparación con "servicio" de transcripción, es que el primero está lo suficientemente automatizado como para que un usuario pueda ejecutar todo el sistema sin contratar personal externo. Sin embargo, la aparición de los modelos de software como servicio y computación en la nube desdibuja esta distinción. Utiliza inteligencia artificial , aprendizaje automático y procesamiento del lenguaje natural para convertir el habla en texto y aprender continuamente nuevas frases y acentos. [2]
Desarrollo
La investigación de Google lanzó una aplicación gratuita para Android, Google Live Transcribe, que se ejecuta en Google Cloud . [3] [4] Google Chrome se desarrolló y tiene disponible un Live Caption incorporado en inglés. [5] Google Docs , Google Translate , Google Assistant , GBoard El motor de texto a voz de Google también admite la herramienta de transcripción. [6] [7] [8] [9]
OpenAI lanzó Whisper , un modelo de aprendizaje profundo de reconocimiento de voz de código abierto en septiembre de 2022. [10]
Véase también
Referencias
- ^ "Funciones de transcripción | Transcribir". Funciones y convenciones generales de transcripción, Transcripciones de audio . 2017-06-08 . Consultado el 2019-02-15 .
- ^ Bhatt, Medha. "¿Qué es la transcripción con inteligencia artificial? Todo lo que necesita saber". fireflies.ai . Consultado el 3 de junio de 2022 .
- ^ "Usar Live Transcribe - Ayuda de accesibilidad de Android". support.google.com . Consultado el 14 de junio de 2021 .
- ^ Butler, Sydney (9 de diciembre de 2019). "Cómo transcribir el habla con la aplicación Live Transcribe de Google". 9to5Google . Consultado el 14 de junio de 2021 .
- ^ "La nueva función Live Caption de Google Chrome transcribirá el habla en los videos". techxplore.com . Consultado el 14 de junio de 2021 .
- ^ "Ahora puedes transcribir el habla con el Traductor de Google". Google . 2020-03-17 . Consultado el 2021-06-14 .
- ^ Krasnoff, Barbara (14 de agosto de 2020). «Cómo utilizar las herramientas de transcripción gratuitas de Google». The Verge . Consultado el 14 de junio de 2021 .
- ^ "Transcripción en vivo y notificaciones de sonido: aplicaciones en Google Play". play.google.com . Consultado el 14 de junio de 2021 .
- ^ "Google lanza transcripción y traducción en tiempo real para usuarios de Gboard" . Consultado el 14 de junio de 2021 .
- ^ Golla, Ramsri Goutham (6 de marzo de 2023). "A continuación se presentan seis casos prácticos de uso de la nueva API Whisper". Slator . Archivado desde el original el 25 de marzo de 2023 . Consultado el 12 de agosto de 2023 .