El reconocimiento de locutor es la identificación de una persona a partir de las características de su voz. [ 1 ] Se utiliza para responder a la pregunta "¿Quién está hablando?". El término reconocimiento de voz [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ] puede referirse al reconocimiento de locutor o al reconocimiento de voz . La verificación del locutor (también llamada autenticación del locutor ) contrasta con la identificación, y el reconocimiento del locutor difiere de la diarización del locutor (reconocer cuándo habla la misma persona).
El reconocimiento de voz puede simplificar la traducción del habla en sistemas entrenados con voces específicas, o bien utilizarse para autenticar o verificar la identidad de una persona como parte de un proceso de seguridad. El reconocimiento de voz tiene una trayectoria de aproximadamente cuatro décadas (en 2019) y utiliza las características acústicas del habla que varían entre individuos. Estos patrones acústicos reflejan tanto la anatomía como patrones de comportamiento aprendidos.
Verificación versus identificación
Existen dos aplicaciones principales de las tecnologías y metodologías de reconocimiento de voz. Si el hablante afirma tener una identidad determinada y su voz se utiliza para verificar dicha afirmación, se habla de verificación o autenticación . Por otro lado, la identificación consiste en determinar la identidad de un hablante desconocido. En cierto modo, la verificación de voz es una comparación uno a uno, donde la voz de un hablante se compara con una plantilla específica, mientras que la identificación de voz es una comparación uno a muchos, donde la voz se compara con múltiples plantillas.
Desde el punto de vista de la seguridad, la identificación es diferente de la verificación. La verificación del hablante se suele emplear como un "guardián" para dar acceso a un sistema seguro. Estos sistemas operan con el conocimiento de los usuarios y normalmente requieren su cooperación. Los sistemas de identificación del hablante también pueden implementarse de forma encubierta, sin el conocimiento del usuario, para identificar a los participantes en una conversación, alertar a los sistemas automatizados sobre cambios de interlocutor, comprobar si un usuario ya está registrado en un sistema, etc.
En aplicaciones forenses, es común realizar primero un proceso de identificación del hablante para crear una lista de las "mejores coincidencias" y luego llevar a cabo una serie de procesos de verificación para determinar una coincidencia concluyente. Comparar las muestras del hablante con la lista de mejores coincidencias ayuda a determinar si se trata de la misma persona en función del grado de similitudes o diferencias. La fiscalía y la defensa utilizan esta información como evidencia para determinar si el sospechoso es realmente el delincuente. [ 7 ]
Capacitación
Una de las primeras tecnologías de entrenamiento que se comercializaron se implementó en la muñeca Julie de Worlds of Wonder en 1987. En ese momento, la independencia del hablante era un avance previsto, y los sistemas requerían un período de entrenamiento. Un anuncio de 1987 de la muñeca llevaba el eslogan "Por fin, la muñeca que te entiende", a pesar de que se describía como un producto "que los niños podían entrenar para que respondiera a su voz". [ 8 ] El término reconocimiento de voz, incluso una década después, se refería a la independencia del hablante. [ 9 ]
Variantes del reconocimiento de locutores
Cada sistema de reconocimiento de locutor consta de dos fases: registro y verificación. Durante el registro, se graba la voz del locutor y, por lo general, se extraen varias características para crear una huella de voz, plantilla o modelo. [ 10 ] En la fase de verificación, una muestra de voz o "enunciado" se compara con una huella de voz creada previamente. En los sistemas de identificación, el enunciado se compara con múltiples huellas de voz para determinar la(s) mejor(es) coincidencia(s), mientras que los sistemas de verificación comparan un enunciado con una sola huella de voz. Debido al proceso involucrado, la verificación es más rápida que la identificación.
Los sistemas de reconocimiento de locutor se dividen en dos categorías: dependientes del texto e independientes del texto. [ 11 ] El reconocimiento dependiente del texto requiere que el texto sea el mismo tanto para el registro como para la verificación. [ 12 ] En un sistema dependiente del texto, las indicaciones pueden ser comunes a todos los locutores (por ejemplo, una frase de contraseña común) o únicas. Además, se puede emplear el uso de secretos compartidos (por ejemplo, contraseñas y PIN) o información basada en el conocimiento para crear un escenario de autenticación multifactor . Por el contrario, los sistemas independientes del texto no requieren el uso de un texto específico. Se utilizan con mayor frecuencia para la identificación del locutor, ya que requieren muy poca o ninguna cooperación por parte del locutor. En este caso, el texto durante el registro y la prueba es diferente. De hecho, el registro puede ocurrir sin el conocimiento del usuario, como sucede en muchas aplicaciones forenses. Dado que las tecnologías independientes del texto no comparan lo que se dijo en el registro y la verificación, las aplicaciones de verificación tienden a emplear también el reconocimiento de voz para determinar lo que el usuario está diciendo en el momento de la autenticación. En los sistemas independientes del texto se utilizan técnicas de análisis acústico y de voz . [ 13 ]
Tecnología
El reconocimiento de locutores es un problema de reconocimiento de patrones . Las diversas tecnologías utilizadas para procesar y almacenar huellas de voz incluyen estimación de frecuencia , modelos ocultos de Markov , modelos de mezcla gaussiana , algoritmos de coincidencia de patrones , redes neuronales , representación matricial , cuantización vectorial y árboles de decisión . Para comparar enunciados con huellas de voz, se utilizan tradicionalmente métodos más básicos como la similitud del coseno por su simplicidad y rendimiento. Algunos sistemas también utilizan técnicas "antilocutor" como modelos de cohorte y modelos de mundo. Las características espectrales se utilizan predominantemente para representar las características del locutor. [ 14 ] La codificación predictiva lineal (LPC) es un método de codificación de voz utilizado en el reconocimiento de locutores y la verificación del habla .
Los niveles de ruido ambiental pueden dificultar la recopilación tanto de las muestras de voz iniciales como de las posteriores. Se pueden emplear algoritmos de reducción de ruido para mejorar la precisión, pero una aplicación incorrecta puede tener el efecto contrario. La degradación del rendimiento puede deberse a cambios en los atributos de comportamiento de la voz y al registro mediante un teléfono y la verificación en otro. Se prevé un aumento de la integración con productos de autenticación de dos factores . Los cambios en la voz debidos al envejecimiento pueden afectar al rendimiento del sistema con el tiempo. Algunos sistemas adaptan los modelos de locutor después de cada verificación exitosa para capturar estos cambios a largo plazo en la voz, aunque existe un debate sobre el impacto general en la seguridad que supone la adaptación automatizada.
Implicaciones legales
Debido a la introducción de leyes como el Reglamento General de Protección de Datos en la Unión Europea y la Ley de Privacidad del Consumidor de California en Estados Unidos, se ha debatido ampliamente sobre el uso del reconocimiento de voz en el ámbito laboral. En septiembre de 2019, la empresa irlandesa de desarrollo de reconocimiento de voz Soapbox Labs advirtió sobre las posibles implicaciones legales. [ 15 ]
Aplicaciones
La primera patente internacional se presentó en 1983, a partir de la investigación en telecomunicaciones realizada en CSELT [ 16 ] (Italia) por Michele Cavazza y Alberto Ciaramella como base tanto para futuros servicios de telecomunicaciones a clientes finales como para mejorar las técnicas de reducción de ruido en toda la red.
Entre 1996 y 1998, se utilizó tecnología de reconocimiento de voz en el cruce fronterizo de Scobey-Coronach para permitir que los residentes locales inscritos que no tenían nada que declarar cruzaran la frontera entre Canadá y Estados Unidos cuando los puestos de inspección estaban cerrados por la noche. [ 17 ] El sistema fue desarrollado para el Servicio de Inmigración y Naturalización de los Estados Unidos por Voice Strategies de Warren, Michigan.
En 2013, Barclays Wealth, la división de banca privada de Barclays, se convirtió en la primera empresa de servicios financieros en implementar la biometría de voz como principal medio para identificar a los clientes en sus centros de llamadas . El sistema utilizaba el reconocimiento pasivo del hablante para verificar la identidad de los clientes telefónicos en 30 segundos de conversación normal. [ 18 ] Fue desarrollado por la empresa de reconocimiento de voz Nuance (que en 2011 adquirió la empresa Loquendo , la escisión de CSELT para tecnología de voz), la empresa detrás de la tecnología Siri de Apple . El 93 % de los clientes le dio al sistema una calificación de "9 sobre 10" en velocidad, facilidad de uso y seguridad. [ 19 ]
El reconocimiento de locutor también puede utilizarse en investigaciones criminales, como las de las ejecuciones de 2014 de, entre otros, James Foley y Steven Sotloff . [ 20 ]
En febrero de 2016, el banco británico HSBC y su banco minorista en línea First Direct anunciaron que ofrecerían a 15 millones de clientes su software de banca biométrica para acceder a sus cuentas en línea y telefónicas utilizando su huella dactilar o voz. [ 21 ]
En 2023, Vice News y The Guardian demostraron por separado que podían burlar los sistemas estándar de autenticación de locutores financieros utilizando voces generadas por IA a partir de aproximadamente cinco minutos de muestras de voz del objetivo. [ 22 ] [ 23 ]
Véase también
- efecto de la IA
- Aplicaciones de la inteligencia artificial
- Diarización de oradores
- Reconocimiento de voz
- Cambiador de voz
- Liza
Notas
- ↑ Poddar, Arnab; Sahidullah, Md; Saha, Goutam (27 de noviembre de 2017). "Verificación del hablante con enunciados cortos: una revisión de desafíos, tendencias y oportunidades". IET Biometrics . 7 (2). Institution of Engineering and Technology (IET): 91– 101. doi : 10.1049/iet-bmt.2017.0065 . ISSN 2047-4938 .
- ↑ Lass, Norman J. (1974). Fonética experimental . MSS Information Corporation. págs. 251–258 . ISBN 978-0-8422-5149-5.
- ↑ Van Lancker, Diana; Kreiman, Jody; Emmorey, Karen (1985). "Reconocimiento de voz familiar: patrones y parámetros Parte I: Reconocimiento de voces al revés" . Journal of Phonetics . 13 (1). Elsevier BV: 19–38 . doi : 10.1016/s0095-4470(19)30723-5 . ISSN 0095-4470 .
- ↑ "RECONOCIMIENTO DE VOZ (sustantivo): definición y sinónimos" . macmillandictionary.com . 23 de enero de 2010. Archivado del original el 27 de marzo de 2023. Consultado el 13 de octubre de 2023 .
- ↑ "¿Qué es el reconocimiento de voz? Definición y significado" . businessdictionary.com . 6 de octubre de 2008. Archivado del original el 3 de diciembre de 2011.
- ↑ "El buzón de correo LG #114" . Linux Gazette . 28 de marzo de 2005.
- ↑ Rose, Phil; Osanai, Takashi; Kinoshita, Yuko (6 de agosto de 2003). "Fortaleza de la evidencia de identificación forense del hablante: discriminación segmental basada en formantes y cepstrums de múltiples hablantes con una razón de verosimilitud bayesiana como umbral". Revista Internacional de Habla, Lenguaje y Derecho . 10 (2). Equinox Publishing: 179–202 . doi : 10.1558/sll.2003.10.2.179 . ISSN 1748-8893 .
- ↑ Pinola, Melanie (2 de noviembre de 2011). "Reconocimiento de voz a través de las décadas: cómo terminamos con Siri" . PCWorld .
- ↑ Rosen, Cheryl (3 de marzo de 1997). "El reconocimiento de voz facilitará las reservas de viajes" . Business Travel News .
Las primeras aplicaciones del software de reconocimiento de voz fueron el dictado... Hace cuatro meses, IBM presentó un "producto de dictado continuo" diseñado para... debutó en la feria comercial de la National Business Travel Association en 1994.
- ↑ "¿Qué es la identificación del hablante?" . picovoice.ai . Consultado el 10 de octubre de 2025 .
- ↑ "Verificación del hablante: dependiente del texto vs. independiente del texto" . Microsoft Research . 19 de junio de 2017.
El hablante dependiente del texto y el independiente del texto... ambos tienen la misma tasa de error y detección...
- ↑ Hébert, Matthieu (2008). «Reconocimiento de locutor dependiente del texto». Manual Springer de procesamiento del habla . Manuales Springer. Berlín, Heidelberg: Springer Berlin Heidelberg. págs. 743–762 . doi : 10.1007/978-3-540-49127-9_37 . ISBN 978-3-540-49125-5ISSN 2522-8692 .
Tarea: verificación o identificación
. - ↑ Myers, Lisa (25 de julio de 2004). "Una exploración de la biometría de la voz" . Instituto SANS .
- ↑ Sahidullah, Md; Kinnunen, Tomi (2016). "Características de variabilidad espectral local para la verificación del hablante" (PDF) . Procesamiento de señales digitales . 50. Elsevier BV: 1–11 . Bibcode : 2016DSP....50....1S . doi : 10.1016/j.dsp.2015.10.011 . ISSN 1051-2004 .
- ↑ «Experto en reconocimiento de voz expresa su preocupación por la tecnología de voz en el lugar de trabajo» . Independent.ie . 29 de septiembre de 2019. Consultado el 30 de septiembre de 2019 .
- ↑ US4752958 A, Michele Cavazza, Alberto Ciaramella, "Dispositivo de verificación del hablante" https://patents.google.com/patent/US4752958/en
- ↑ Meyer, Barb (12 de junio de 1996). "Cruce fronterizo automatizado". Reportaje televisivo . Meyer Television News.
- ↑ Banca Internacional (27 de diciembre de 2013). "Tecnología biométrica de voz en la banca | Barclays" . Wealth.barclays.com . Consultado el 21 de febrero de 2016 .
- ↑ Matt Warman (8 de mayo de 2013). "Dile adiós al PIN: el reconocimiento de voz toma el relevo en Barclays Wealth" . Consultado el 5 de junio de 2013 .
- ↑ Ewen MacAskill. "¿Mató 'Jihadi John' a Steven Sotloff? | Medios de comunicación" . The Guardian . Consultado el 21 de febrero de 2016 .
- ↑ Julia Kollewe (19 de febrero de 2016). "HSBC implementa seguridad mediante reconocimiento de voz y táctil para clientes bancarios | Negocios" . The Guardian . Consultado el 21 de febrero de 2016 .
- ↑ "Cómo logré acceder a una cuenta bancaria con una voz generada por IA" . 23 de febrero de 2023.
- ↑ Evershed, Nick; Taylor, Josh (16 de marzo de 2023). "La IA puede engañar al reconocimiento de voz utilizado para verificar la identidad por Centrelink y la oficina de impuestos australiana" . The Guardian . Consultado el 16 de junio de 2023 .
Referencias
- Homayoon Beigi (2011), " Fundamentos del reconocimiento de hablantes ", Springer-Verlag, Berlín, 2011, ISBN 978-0-387-77591-3.
- "Biometría en el cine" – Instituto Nacional de Estándares y Tecnología
- Elisabeth Zetterholm (2003), Imitación de la voz. Un estudio fonético de las ilusiones perceptivas y el éxito acústico , tesis doctoral, Universidad de Lund .
- Md Sahidullah (2015), Mejora del rendimiento del reconocimiento de hablantes mediante información relativa y temporal a nivel de bloque de las energías de subbanda , tesis doctoral, Instituto Indio de Tecnología Kharagpur .
Enlaces externos
- Cómo eludir la autenticación por voz. Archivado el 10 de junio de 2008 en Wayback Machine . El podcast de PLA Radio presentó recientemente una forma sencilla de engañar a los sistemas rudimentarios de autenticación por voz.
- Reconocimiento de oradores – Scholarpedia
- Ventajas y desafíos del reconocimiento de voz en el control de acceso
Software
- bob.bio.spear
- ALIZE
- Reconocimiento del orador
- Procesamiento del habla
- Tecnología de voz
- Identificación automática y captura de datos
- Biometría