Articulo de referencia

Tasa de error de palabras

La tasa de error de palabras ( WER , por sus siglas en inglés) es una métrica común para evaluar el rendimiento de un sistema de reconocimiento de voz o traducción automática . ...

La tasa de error de palabras ( WER , por sus siglas en inglés) es una métrica común para evaluar el rendimiento de un sistema de reconocimiento de voz o traducción automática . Esta métrica suele variar de 0 a 1, donde 0 indica que los fragmentos de texto comparados son idénticos y 1 (o un valor mayor) indica que son completamente diferentes, sin ninguna similitud. Por ejemplo, una WER de 0,8 significa que existe una tasa de error del 80 % en las oraciones comparadas.

La principal dificultad para medir el rendimiento radica en que la secuencia de palabras reconocida puede tener una longitud distinta a la de la secuencia de referencia (supuestamente la correcta). El WER se deriva de la distancia de Levenshtein , pero opera a nivel de palabra en lugar de a nivel de fonema . El WER es una herramienta valiosa para comparar diferentes sistemas y evaluar las mejoras dentro de un mismo sistema. Sin embargo, este tipo de medición no proporciona detalles sobre la naturaleza de los errores de traducción, por lo que se requiere más investigación para identificar la(s) principal(es) fuente(s) de error y enfocar los esfuerzos de investigación.

Este problema se resuelve alineando primero la secuencia de palabras reconocidas con la secuencia de palabras de referencia (hablada) mediante alineación dinámica de cadenas. El análisis de este problema se realiza a través de una teoría denominada ley de potencias, que establece la correlación entre la perplejidad y la tasa de error de palabras. [ 1 ]

La tasa de error de palabras se puede calcular entonces de la siguiente manera:

WmiR=S+D+Inorte=S+D+IS+D+do{\displaystyle {\mathit {WER}}={\frac {S+D+I}{N}}={\frac {S+D+I}{S+D+C}}}

dónde

  • S es el número de sustituciones,
  • D es el número de eliminaciones,
  • I es el número de inserciones,
  • C es el número de palabras correctas,
  • N es el número de palabras en la referencia (N=S+D+C)

La intuición detrás de la "eliminación" y la "inserción" radica en cómo pasar de la referencia a la hipótesis. Así, si tenemos la referencia "Esto es Wikipedia" y la hipótesis "Esto _ Wikipedia", lo llamamos una eliminación.

Tenga en cuenta que, dado que N es el número de palabras en la referencia, la tasa de error de palabras puede ser mayor que 1,0, es decir, si el número de inserciones I es mayor que el número de palabras correctas C.

Al informar sobre el rendimiento de un sistema de reconocimiento de voz, a veces se utiliza la precisión de palabras (WAcc) en su lugar:

WAdodo=1WmiR=norteSDInorte=doInorte{\displaystyle {\mathit {WAcc}}=1-{\mathit {WER}}={\frac {NSDI}{N}}={\frac {CI}{N}}}

Dado que el WER puede ser mayor que 1,0, la precisión de las palabras puede ser menor que 0,0.

Experimentos

Se suele creer que una menor tasa de error de palabras indica una mayor precisión en el reconocimiento del habla, en comparación con una mayor tasa de error de palabras. Sin embargo, al menos un estudio ha demostrado que esto podría no ser cierto. En un experimento de Microsoft Research , se demostró que, si las personas eran entrenadas bajo el enfoque de "que coincide con el objetivo de optimización para la comprensión" (Wang, Acero y Chelba, 2003), mostraban una mayor precisión en la comprensión del lenguaje que otras personas con una menor tasa de error de palabras, lo que demuestra que la verdadera comprensión del lenguaje hablado depende de algo más que una alta precisión en el reconocimiento de palabras . [ 2 ]

Otras métricas

Sin embargo, un problema al usar una fórmula genérica como la anterior es que no se considera el efecto que los diferentes tipos de errores pueden tener en la probabilidad de un resultado exitoso; por ejemplo, algunos errores pueden ser más perjudiciales que otros y algunos pueden corregirse con mayor facilidad. Es probable que estos factores sean específicos de la sintaxis que se está probando. Otro problema es que, incluso con la mejor alineación, la fórmula no puede distinguir un error de sustitución de un error combinado de eliminación e inserción.

Hunt (1990) propuso el uso de una medida ponderada de precisión del desempeño donde los errores de sustitución se ponderan en la unidad, pero los errores de eliminación e inserción se ponderan solo en 0,5, de la siguiente manera:

WmiR=S+0,5D+0,5Inorte{\displaystyle {\mathit {WER}}={\frac {S+0.5D+0.5I}{N}}}

Sin embargo, existe cierto debate sobre si la fórmula de Hunt puede utilizarse adecuadamente para evaluar el rendimiento de un sistema individual, dado que se desarrolló como un método para comparar de forma más equitativa sistemas candidatos. Además, se complica la cuestión de si una sintaxis determinada permite la corrección de errores y, en caso afirmativo, cuán sencillo resulta dicho proceso para el usuario. Por lo tanto, resulta válido el argumento de que las métricas de rendimiento deberían desarrollarse en función del sistema específico que se esté evaluando.

Sin embargo, independientemente de la métrica utilizada, un problema teórico importante al evaluar el rendimiento de un sistema es determinar si una palabra se ha pronunciado incorrectamente; es decir, si el error reside en el usuario o en el sistema de reconocimiento. Esto puede ser especialmente relevante en un sistema diseñado para interactuar con hablantes no nativos de un idioma determinado o con acentos regionales marcados.

El ritmo al que se pronuncian las palabras durante el proceso de medición también genera variabilidad entre los sujetos, al igual que la necesidad de que descansen o respiren. Es posible que sea necesario controlar de alguna manera todos estos factores.

En el caso del dictado de texto, generalmente se acepta que una precisión inferior al 95 % no es aceptable, pero esto puede depender de la sintaxis o del dominio específico, por ejemplo, si los usuarios tienen prisa por completar la tarea, si existen métodos alternativos para completarla, etc.

El término "Tasa de error de palabra única" se refiere a veces al porcentaje de reconocimientos incorrectos para cada palabra diferente en el vocabulario del sistema.

Editar distancia

La tasa de error de palabras también puede denominarse distancia de edición normalizada de longitud . [ 3 ] La distancia de edición normalizada entre X e Y, d ( X, Y ) se define como el mínimo de W( P ) / L ( P ), donde P es una ruta de edición entre X e Y, W ( P ) es la suma de los pesos de las operaciones de edición elementales de P, y L(P) es el número de estas operaciones (longitud de P). [ 4 ]

Véase también

Referencias

Notas

  1. Klakow, Dietrich; Jochen Peters (septiembre de 2002). "Prueba de correlación entre la tasa de error de palabras y la perplejidad". Speech Communication . 38 ( 1–2 ): 19–28 . doi : 10.1016/S0167-6393(01)00041-3 . ISSN 0167-6393 . 
  2. Wang, Y.; Acero, A.; Chelba, C. (2003). ¿Es la tasa de error de palabras un buen indicador de la precisión en la comprensión del lenguaje hablado ? Taller IEEE sobre reconocimiento y comprensión automáticos del habla. St. Thomas, Islas Vírgenes de los Estados Unidos. CiteSeerX 10.1.1.89.424 . 
  3. Nießen et al. (2000)
  4. Cálculo de la distancia de edición normalizada y su aplicación: AndrCs Marzal y Enrique Vidal

Otras fuentes

  • McCowan et al. 2005: Sobre el uso de medidas de recuperación de información para la evaluación del reconocimiento de voz. Archivado el 24/02/2019 en Wayback Machine.
  • Hunt, MJ, 1990: Indicadores de rendimiento para evaluar sistemas de reconocimiento de palabras conectadas (Speech Communication, 9, 1990, pp 239-336)
  • Zechner, K., Waibel, A. Minimización de la tasa de errores de palabras en resúmenes textuales de lenguaje hablado.