
Una interfaz de usuario de voz ( VUI ) permite la interacción verbal entre humanos y ordenadores, utilizando el reconocimiento de voz para comprender comandos hablados y responder preguntas , y normalmente la conversión de texto a voz para reproducir una respuesta. Un dispositivo de comandos de voz es un dispositivo controlado mediante una interfaz de usuario de voz.
Las interfaces de voz se han incorporado a automóviles , sistemas de domótica , sistemas operativos de computadoras , electrodomésticos como lavadoras y hornos microondas , y controles remotos de televisión . Son la principal forma de interactuar con asistentes virtuales en teléfonos inteligentes y altavoces inteligentes . Los sistemas de contestación automática más antiguos (que dirigen las llamadas a la extensión correcta) y los sistemas de respuesta de voz interactiva (que realizan transacciones más complejas por teléfono) pueden responder a la pulsación de botones del teclado mediante tonos DTMF , pero aquellos con una interfaz de voz completa permiten a quienes llaman expresar sus solicitudes y respuestas sin necesidad de pulsar ningún botón.
Los dispositivos de control por voz más recientes son independientes del hablante, por lo que pueden responder a múltiples voces, independientemente del acento o las influencias dialectales. También son capaces de responder a varios comandos a la vez, separando los mensajes de voz y proporcionando la retroalimentación adecuada , imitando con precisión una conversación natural. [ 1 ]
Descripción general
Una interfaz de voz (VUI) es la interfaz de cualquier aplicación de voz. Hasta hace poco, controlar una máquina simplemente hablándole solo era posible en la ciencia ficción . Hasta hace poco, este campo se consideraba inteligencia artificial . Sin embargo, los avances en tecnologías como la conversión de texto a voz, la conversión de voz a texto, el procesamiento del lenguaje natural y los servicios en la nube contribuyeron a la adopción masiva de este tipo de interfaces. Las VUI se han vuelto más comunes y las personas están aprovechando el valor que estas interfaces manos libres y sin necesidad de mirar ofrecen en muchas situaciones.
Las interfaces de voz (VUI) dependen de la capacidad de procesar la entrada de forma fiable; un rendimiento inconsistente suele provocar una menor participación del usuario y comentarios negativos. Diseñar una buena VUI requiere talento interdisciplinario en informática , lingüística y factores humanos como la psicología . Incluso con herramientas de desarrollo avanzadas, la creación de una VUI eficaz exige comprender tanto las tareas a realizar como el público objetivo que utilizará el sistema final. Cuanto más se ajuste la VUI al modelo mental que el usuario tiene de la tarea, más fácil será usarla con poca o ninguna formación, lo que se traducirá en una mayor eficiencia y una mayor satisfacción del usuario.
Una interfaz de voz (VUI) diseñada para el público general debe priorizar la facilidad de uso y ofrecer ayuda y orientación a quienes llaman por primera vez. En cambio, una VUI diseñada para un grupo reducido de usuarios avanzados (incluidos los técnicos de servicio de campo) debe centrarse más en la productividad y menos en la ayuda y la orientación. Estas aplicaciones deben agilizar el flujo de llamadas, minimizar las indicaciones, eliminar las iteraciones innecesarias y permitir diálogos complejos de iniciativa mixta , que permiten a los usuarios introducir varias piezas de información en una sola frase, en cualquier orden o combinación. En resumen, las aplicaciones de voz deben diseñarse cuidadosamente para el proceso de negocio específico que se está automatizando.
No todos los procesos empresariales se prestan por igual a la automatización por voz. En general, cuanto más complejas sean las consultas y transacciones, más difícil será automatizarlas y mayor será la probabilidad de que no sean bien recibidas por el público en general. En algunos casos, la automatización simplemente no es viable, por lo que la asistencia de un agente en vivo es la única opción. Una línea de atención telefónica para asesoramiento legal, por ejemplo, sería muy difícil de automatizar. Por otro lado, la voz es perfecta para gestionar transacciones rápidas y rutinarias, como cambiar el estado de una orden de trabajo, registrar horas o gastos, o transferir fondos entre cuentas.
Historia
Las primeras aplicaciones de la interfaz de usuario por voz (VUI, por sus siglas en inglés) incluían la marcación telefónica mediante comandos de voz , ya sea directamente o a través de unos auriculares (normalmente Bluetooth ) o del sistema de audio del vehículo.
En 2007, un artículo de negocios de CNN informó que el control por voz era una industria de más de mil millones de dólares y que empresas como Google y Apple estaban intentando crear funciones de reconocimiento de voz. [ 2 ] En los años transcurridos desde la publicación del artículo, el mundo ha visto una variedad de dispositivos de control por voz. Además, Google ha creado un motor de reconocimiento de voz llamado Pico TTS y Apple lanzó Siri. Los dispositivos de control por voz son cada vez más accesibles y constantemente se crean formas innovadoras de utilizar la voz humana. Por ejemplo, Business Week sugiere que el control remoto del futuro será la voz humana. Actualmente, Xbox Live permite este tipo de funciones y Jobs insinuó una función similar en el nuevo Apple TV . [ 3 ]
Software de control por voz para dispositivos informáticos
Tanto los ordenadores Apple Mac como los PC con Windows ofrecen funciones de reconocimiento de voz integradas en sus sistemas operativos más recientes .
Microsoft Windows
Dos sistemas operativos de Microsoft, Windows 7 y Windows Vista , ofrecen capacidades de reconocimiento de voz. Microsoft integró comandos de voz en sus sistemas operativos para proporcionar un mecanismo a las personas que desean limitar el uso del ratón y el teclado, pero que aun así quieren mantener o aumentar su productividad general. [ 4 ]
Windows Vista
Con el control por voz de Windows Vista, un usuario puede dictar documentos y correos electrónicos en las aplicaciones más comunes, iniciar y alternar entre aplicaciones, controlar el sistema operativo, formatear documentos, guardarlos, editar archivos, corregir errores de forma eficiente y completar formularios en la web . El software de reconocimiento de voz aprende automáticamente cada vez que un usuario lo utiliza y está disponible en inglés (EE. UU.), inglés (Reino Unido), alemán (Alemania), francés (Francia), español (España), japonés, chino (tradicional) y chino (simplificado). Además, el software incluye un tutorial interactivo que puede utilizarse para entrenar tanto al usuario como al motor de reconocimiento de voz. [ 5 ]
Windows 7
Además de todas las funciones que ofrece Windows Vista, Windows 7 proporciona un asistente para configurar el micrófono y un tutorial sobre cómo usar la función. [ 6 ]
Mac OS X
Todos los ordenadores Mac OS X vienen con el software de reconocimiento de voz preinstalado. Este software es independiente del usuario y permite navegar por menús e introducir atajos de teclado; leer nombres de casillas de verificación, botones de opción, elementos de listas y botones; y abrir, cerrar, controlar y alternar entre aplicaciones. [ 7 ] Sin embargo, el sitio web de Apple recomienda adquirir un producto comercial llamado Dictate . [ 7 ]
Productos comerciales
Si un usuario no está satisfecho con el software de reconocimiento de voz integrado o no dispone de un software de reconocimiento de voz integrado en su sistema operativo, puede experimentar con un producto comercial como Braina Pro o DragonNaturallySpeaking para PC con Windows, [ 8 ] y Dictate, el mismo software para Mac OS. [ 9 ]
Dispositivos móviles controlados por voz
Cualquier dispositivo móvil con sistema operativo Android, Microsoft Windows Phone, iOS 9 o posterior, o Blackberry OS ofrece funciones de comandos de voz. Además del software de reconocimiento de voz integrado en el sistema operativo de cada teléfono móvil, el usuario puede descargar aplicaciones de comandos de voz de terceros desde la tienda de aplicaciones de cada sistema operativo: Apple App Store , Google Play , Windows Phone Marketplace (inicialmente Windows Marketplace for Mobile ) o BlackBerry App World .
Sistema operativo Android
Google ha desarrollado un sistema operativo de código abierto llamado Android , que permite al usuario realizar comandos de voz como: enviar mensajes de texto, escuchar música, obtener direcciones, llamar a empresas, llamar a contactos, enviar correos electrónicos, ver un mapa, ir a sitios web, escribir una nota y buscar en Google. [ 10 ] El software de reconocimiento de voz está disponible para todos los dispositivos desde Android 2.2 "Froyo" , pero la configuración debe estar en inglés. [ 10 ] Google permite al usuario cambiar el idioma, y se le pregunta al usuario la primera vez que usa la función de reconocimiento de voz si desea que sus datos de voz se asocien a su cuenta de Google. Si un usuario decide optar por este servicio, permite a Google entrenar el software con la voz del usuario. [ 11 ]
Google presentó el Asistente de Google con Android 7.0 "Nougat" . Es mucho más avanzado que la versión anterior.
Amazon.com ofrece el Echo , que utiliza la versión personalizada de Android de Amazon para proporcionar una interfaz de voz.
Microsoft Windows
Windows Phone es el sistema operativo de los dispositivos móviles de Microsoft . En Windows Phone 7.5, la aplicación de voz es independiente del usuario y se puede usar para: llamar a alguien de la lista de contactos, llamar a cualquier número de teléfono, volver a marcar el último número, enviar un mensaje de texto, llamar al buzón de voz, abrir una aplicación, leer citas, consultar el estado del teléfono y buscar en la web. [ 12 ] [ 13 ] Además, la voz también se puede usar durante una llamada telefónica, y las siguientes acciones son posibles durante una llamada telefónica: presionar un número, activar el altavoz o llamar a alguien, lo que pone la llamada actual en espera. [ 13 ]
Windows 10 introduce Cortana , un sistema de control por voz que reemplaza al control por voz que se utilizaba anteriormente en los teléfonos Windows.
iOS
Apple añadió el Control por Voz a su familia de dispositivos iOS como una nueva función de iPhone OS 3. El iPhone 4S , iPad 3 , iPad Mini 1G , iPad Air , iPad Pro 1G , iPod Touch 5G y posteriores, incluyen un asistente de voz más avanzado llamado Siri . El Control por Voz aún se puede activar a través del menú Ajustes de los dispositivos más recientes. Siri es una función de reconocimiento de voz integrada e independiente del usuario que permite dar órdenes por voz. Con la ayuda de Siri, un usuario puede dar órdenes como enviar un mensaje de texto, consultar el tiempo, establecer un recordatorio, buscar información, programar reuniones, enviar un correo electrónico, buscar un contacto, configurar una alarma, obtener indicaciones, consultar la bolsa, configurar un temporizador y pedir ejemplos de consultas de comandos de voz. [ 14 ] Además, Siri funciona con Bluetooth y auriculares con cable. [ 15 ]
Apple introdujo la función Voz Personal como una característica de accesibilidad en iOS 17 , lanzado el 18 de septiembre de 2023. [ 16 ] Esta función permite a los usuarios crear una versión personalizada de su voz, generada mediante aprendizaje automático (IA), para usarla en aplicaciones de conversión de texto a voz . Diseñada especialmente para personas con dificultades del habla , Voz Personal ayuda a preservar el sonido único de la voz del usuario. Mejora Siri y otras herramientas de accesibilidad al proporcionar una experiencia de usuario más personalizada e inclusiva . Voz Personal refleja el compromiso continuo de Apple con la accesibilidad y la innovación . [ 17 ] [ 18 ]
Amazon Alexa
En 2014, Amazon presentó el dispositivo inteligente para el hogar Alexa . Su propósito principal era simplemente un altavoz inteligente que permitía al usuario controlarlo con la voz. Con el tiempo, se convirtió en un dispositivo innovador con la capacidad de controlar electrodomésticos mediante la voz. Ahora, casi todos los electrodomésticos se pueden controlar con Alexa, incluyendo bombillas y termostatos. Al permitir el control por voz, Alexa se conecta a la tecnología del hogar inteligente, lo que permite a los usuarios cerrar la puerta, controlar la temperatura y activar diversos dispositivos. Esta forma de IA permite que una persona simplemente le haga una pregunta, y Alexa, en respuesta, busca, encuentra y recita la respuesta. [ 19 ]
Reconocimiento de voz en los coches
A medida que la tecnología automotriz mejora, se agregarán más funciones a los autos y estas funciones podrían distraer al conductor. Los comandos de voz para autos, según CNET , deberían permitir que el conductor dé órdenes sin distraerse. CNET afirmó que Nuance sugirió que en el futuro crearían un software similar a Siri, pero para autos. [ 20 ] La mayoría del software de reconocimiento de voz en el mercado en 2011 tenía solo entre 50 y 60 comandos de voz, pero Ford Sync tenía 10 000. [ 20 ] Sin embargo, CNET sugirió que incluso 10 000 comandos de voz no eran suficientes dada la complejidad y la variedad de tareas que un usuario podría querer realizar mientras conduce. [ 20 ] El comando de voz para autos es diferente del comando de voz para teléfonos móviles y para computadoras porque un conductor puede usar la función para buscar restaurantes cercanos, buscar gasolina, obtener indicaciones para conducir, condiciones de la carretera y la ubicación del hotel más cercano. [ 20 ] Actualmente, la tecnología permite que un conductor emita comandos de voz tanto en un GPS portátil como un Garmin como en un sistema de navegación del fabricante del automóvil. [ 21 ]
Lista de sistemas de control por voz proporcionados por los fabricantes de motores:
- Ford Sync
- Comando de voz de Lexus
- Chrysler UConnect
- Honda Accord
- GM IntelliLink
- BMW
- Mercedes
- Pionero
- Harman
- Hyundai
Información no verbal
Si bien la mayoría de las interfaces de usuario de voz están diseñadas para admitir la interacción a través del lenguaje humano hablado, también se han realizado exploraciones recientes en el diseño de interfaces que toman sonidos humanos no verbales como entrada. [ 22 ] [ 23 ] En estos sistemas, el usuario controla la interfaz emitiendo sonidos no verbales como tararear, silbar o soplar en un micrófono. [ 24 ]
Un ejemplo de interfaz de usuario de voz no verbal es Blendie, [ 25 ] [ 26 ] una instalación de arte interactiva creada por Kelly Dobson. La obra consistía en una licuadora clásica de la década de 1950 que fue modificada para responder a la entrada de un micrófono. Para controlar la licuadora, el usuario debe imitar los sonidos mecánicos característicos de una licuadora: la licuadora girará lentamente en respuesta a un gruñido grave del usuario y aumentará su velocidad a medida que el usuario emita sonidos vocales más agudos.
Otro ejemplo es VoiceDraw, [ 27 ] un sistema de investigación que permite el dibujo digital a personas con capacidades motoras limitadas. VoiceDraw permite a los usuarios "pintar" trazos en un lienzo digital modulando los sonidos vocálicos, que se asignan a la dirección del pincel. La modulación de otras características paralingüísticas (por ejemplo, el volumen de la voz) permite al usuario controlar diferentes aspectos del dibujo, como el grosor del trazo.
Otros enfoques incluyen la adopción de sonidos no verbales para complementar las interfaces táctiles (por ejemplo, en un teléfono móvil) y así admitir nuevos tipos de gestos que no serían posibles solo con la entrada de los dedos. [ 24 ]
Desafíos de diseño
Las interfaces de voz plantean un número considerable de desafíos en cuanto a usabilidad. A diferencia de las interfaces gráficas de usuario (GUI), las mejores prácticas para el diseño de interfaces de voz aún están en desarrollo. [ 28 ]
Descubribilidad
Con la interacción basada exclusivamente en audio, las interfaces de usuario de voz tienden a sufrir de baja capacidad de descubrimiento : [ 28 ] es difícil para los usuarios comprender el alcance de las capacidades de un sistema. Para que el sistema transmita lo que es posible sin una pantalla visual, necesitaría enumerar las opciones disponibles, lo que puede volverse tedioso o inviable. La baja capacidad de descubrimiento a menudo resulta en que los usuarios informen confusión sobre lo que se les "permite" decir, o una discrepancia en las expectativas sobre la amplitud de la comprensión de un sistema. [ 29 ] [ 30 ]
Transcripción
Aunque la tecnología de reconocimiento de voz ha mejorado considerablemente en los últimos años, las interfaces de usuario de voz aún presentan errores de análisis o transcripción en los que el habla del usuario no se interpreta correctamente. [ 31 ] Estos errores tienden a ser especialmente frecuentes cuando el contenido de voz utiliza vocabulario técnico (por ejemplo, terminología médica) o grafías poco convencionales, como nombres de artistas musicales o canciones. [ 32 ]
Comprensión
El diseño eficaz de sistemas para maximizar la comprensión conversacional sigue siendo un área de investigación abierta. Las interfaces de usuario de voz que interpretan y gestionan el estado conversacional son difíciles de diseñar debido a la dificultad inherente de integrar tareas complejas de procesamiento del lenguaje natural, como la resolución de correferencias , el reconocimiento de entidades nombradas , la recuperación de información y la gestión del diálogo . [ 33 ] La mayoría de los asistentes de voz actuales son capaces de ejecutar comandos individuales muy bien, pero su capacidad para gestionar el diálogo más allá de una tarea específica o un par de turnos en una conversación es limitada. [ 34 ]
Implicaciones para la privacidad
La privacidad se ve afectada por el hecho de que los proveedores de interfaces de usuario de voz tienen acceso a los comandos de voz sin cifrar, pudiendo así compartirlos con terceros y procesarlos de forma no autorizada o inesperada. [ 35 ] [ 36 ] Además del contenido lingüístico del habla grabada, la forma de expresión y las características de la voz del usuario pueden contener implícitamente información sobre su identidad biométrica, rasgos de personalidad, complexión, estado de salud física y mental, sexo, género, estados de ánimo y emociones , estatus socioeconómico y origen geográfico. [ 37 ]
Véase también
Referencias
- ↑ "Control por voz de la lavadora" . Revista Appliance Magazine . Archivado del original el 3 de noviembre de 2011. Consultado el 20 de diciembre de 2018 .
- ↑ Borzo, Jeanette (8 de febrero de 2007). "Ahora sí que hablas" . CNN Money. Archivado del original el 11 de febrero de 2007. Recuperado el 25 de abril de 2012 .
- ↑ "¿Control por voz, el fin del control remoto del televisor?" . Bloomberg.com . Business Week. 9 de diciembre de 2011. Archivado del original el 8 de diciembre de 2011. Consultado el 1 de mayo de 2012 .
- ↑ "Windows Vista Built In Speech" . Windows Vista . Consultado el 25 de abril de 2012 .
- ↑ "Funcionamiento por voz en Vista" . Microsoft.
- ↑ "Configuración del reconocimiento de voz" . Microsoft.
- 1 2 "Habilidades físicas y motoras" . Apple.
- ↑ "DragonNaturallySpeaking PC" . Matices.
- ↑ "DragonNaturallySpeaking Mac" . Matiz.
- 1 2 "Acciones de voz" .
- ↑ "La búsqueda por voz de Google para Android ahora se puede "entrenar" con tu voz" . 14 de diciembre de 2010. Consultado el 24 de abril de 2012 .
- ↑ "Uso de comandos de voz" . Microsoft . Consultado el 24 de abril de 2012 .
- 1 2 "Uso de comandos de voz" . Microsoft . Consultado el 27 de abril de 2012 .
- ↑ "Siri, el iPhone 3GS y 4, iPod 3 y 4, tienen control por voz como un Siri Express, reproduce música, pausa música, reproducción aleatoria, FaceTime y funciones de llamada" . Apple . Consultado el 27 de abril de 2012 .
- ↑ "Preguntas frecuentes sobre Siri" . Apple.
- ↑ "Cómo usar la Voz Personal en iPhone con iOS 17" . Engadget . 6 de diciembre de 2023. Consultado el 21 de agosto de 2024 .
- ↑ Jason England (13 de julio de 2023). "Cómo configurar y usar la Voz Personal en iOS 17: haz que tu iPhone suene como tú" . LaptopMag . Consultado el 21 de agosto de 2024 .
- ↑ "Mejorando la accesibilidad del habla con la voz personal" . Investigación de aprendizaje automático de Apple . Consultado el 21 de agosto de 2024 .
- ↑ "Cómo Amazon Echo pasó de ser un altavoz inteligente al centro de tu hogar" . Business Insider .
- 1 2 3 4 "Voz similar a la de Siri" . CNET.
- ↑ "GPS portátil con control por voz" . CNET.
- ↑ Blattner, Meera M.; Greenberg, Robert M. (1992). «Comunicación y aprendizaje a través de audio no verbal». Diseño de interfaces multimedia en educación . págs. 133–143 . doi : 10.1007/978-3-642-58126-7_9 . ISBN 978-3-540-55046-4.
- ↑ Hereford, James; Winn, William (octubre de 1994). "Sonidos no verbales en la interacción persona-ordenador: una revisión y directrices de diseño". Journal of Educational Computing Research . 11 (3): 211– 233. doi : 10.2190/mkd9-w05t-yj9y-81nm . ISSN 0735-6331 . S2CID 61510202 .
- 1 2 Sakamoto, Daisuke; Komatsu, Takanori; Igarashi, Takeo (27 de agosto de 2013). "Manipulación aumentada por voz | Actas de la 15.ª conferencia internacional sobre interacción humano-computadora con dispositivos y servicios móviles" : 69–78 . doi : 10.1145/2493190.2493244 . S2CID 6251400. Recuperado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Dobson, Kelly (agosto de 2004). "Blendie | Actas de la 5.ª conferencia sobre diseño de sistemas interactivos: procesos, prácticas, métodos y técnicas" : 309. doi : 10.1145/1013115.1013159 . Recuperado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ "Kelly Dobson: Blendie" . web.media.mit.edu . Archivado del original el 10 de mayo de 2022. Consultado el 27 de febrero de 2019 .
- ↑ Harada, Susumu; Wobbrock, Jacob O.; Landay, James A. (15 de octubre de 2007). "Voicedraw | Actas de la 9.ª conferencia internacional ACM SIGACCESS sobre informática y accesibilidad" : 27–34 . doi : 10.1145/1296843.1296850 . S2CID 218338. Consultado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - 1 2 Murad, Christine; Munteanu, Cosmin; Clark, Leigh; Cowan, Benjamin R. (3 de septiembre de 2018). "Directrices de diseño para la interacción de voz manos libres | Actas de la 20.ª Conferencia Internacional sobre Interacción Humano-Computadora con Dispositivos y Servicios Móviles Adjuntos" : 269–276 . doi : 10.1145/3236112.3236149 . S2CID 52099112. Recuperado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Yankelovich, Nicole; Levow, Gina-Anne; Marx, Matt (mayo de 1995). "Designing SpeechActs | Proceedings of the SIGCHI Conference on Human Factors in Computing Systems" : 369– 376. doi : 10.1145/223904.223952 . S2CID 9313029 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ "¿Qué puedo decir? | Actas de la 18.ª Conferencia Internacional sobre Interacción Humano-Computadora con Dispositivos y Servicios Móviles" . doi : 10.1145/2935334.2935386 . S2CID 6246618 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Myers, Chelsea; Furqan, Anushay; Nebolsky, Jessica; Caro, Karina; Zhu, Jichen (19 de abril de 2018). "Patrones sobre cómo los usuarios superan obstáculos en las interfaces de usuario de voz | Actas de la Conferencia CHI 2018 sobre factores humanos en sistemas informáticos" : 1–7 . doi : 10.1145/3173574.3173580 . S2CID 5041672. Consultado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Springer, Aaron; Cramer, Henriette (21 de abril de 2018) ."Play PRBLMS" | Actas de la Conferencia CHI 2018 sobre Factores Humanos en Sistemas Informáticos" : 1–13 . doi : 10.1145/3173574.3173870 . S2CID 5050837. Consultado el 27 de febrero de 2019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Galitsky, Boris (2019). Desarrollo de chatbots empresariales: Aprendizaje de estructuras lingüísticas (1.ª ed.). Cham, Suiza: Springer. pp. 13–24 . doi : 10.1007/978-3-030-04299-8 . ISBN 978-3-030-04298-1. S2CID 102486666 .
- ↑ Pearl, Cathy (6 de diciembre de 2016). Diseño de interfaces de usuario de voz: Principios de experiencias conversacionales (1.ª ed.). Sebastopol, CA: O'Reilly Media. págs. 16-19 . ISBN 978-1-491-95541-3.
- ↑ "Apple, Google y Amazon podrían haber violado tu privacidad al revisar los comandos de los asistentes digitales" . Fortune . 5 de agosto de 2019. Consultado el 13 de mayo de 2020 .
- ↑ Hern, Alex (11 de abril de 2019). "Según un informe, empleados de Amazon escuchan las grabaciones de Alexa de los clientes" . The Guardian . Consultado el 21 de mayo de 2020 .
- ↑ Kröger, Jacob Leon; Lutz, Otto Hans-Martin; Raschke, Philip (2020). «Implicaciones para la privacidad del análisis de voz y habla: divulgación de información por inferencia». Privacidad y gestión de la identidad. Datos para una mejor calidad de vida: IA y privacidad . IFIP Advances in Information and Communication Technology. Vol. 576. pp. 242–258 . doi : 10.1007/978-3-030-42504-3_16 . ISBN 978-3-030-42503-6ISSN 1868-4238
Enlaces externos
- Interfaces de voz: Evaluación del potencial, por Jakob Nielsen
- El auge de la voz: una cronología
- Glosario de términos de Voice First
- La voz primero: Una lista de lecturas
- Técnicas de interfaz de usuario
- Tecnología de voz
- Reconocimiento de voz
- Historia de la interacción humano-computadora
- Interacción persona-ordenador
- Dispositivos de entrada de computación
- Tecnología de asistencia
- Procesamiento del habla
- Inteligencia ambiental