Articulo de referencia

Evaluación de pronunciación

La evaluación automática de la pronunciación es el uso del reconocimiento de voz para verificar la exactitud del habla pronunciada , [1] [2] a diferencia de la evaluación manual...

La evaluación automática de la pronunciación es el uso del reconocimiento de voz para verificar la exactitud del habla pronunciada , [1] [2] a diferencia de la evaluación manual por parte de un instructor o supervisor. [3] También llamada verificación del habla, evaluación de la pronunciación y puntuación de la pronunciación , la principal aplicación de esta tecnología es la enseñanza de la pronunciación asistida por computadora (CAPT) cuando se combina con la instrucción asistida por computadora para el aprendizaje de idiomas asistido por computadora (CALL), la corrección del habla o la reducción del acento .

La evaluación de la pronunciación no determina el habla desconocida (como en el dictado o la transcripción automática ), sino que, conociendo de antemano las palabras esperadas, intenta verificar la corrección de la pronunciación del alumno e idealmente su inteligibilidad para los oyentes, [4] [5] a veces junto con una prosodia a menudo intrascendente como la entonación , el tono , el tempo , el ritmo y el acento de sílabas y palabras . [6] La evaluación de la pronunciación también se utiliza en la tutoría de lectura , por ejemplo, en productos como Microsoft Teams [7] y de Amira Learning. [8] La evaluación automática de la pronunciación también se puede utilizar para ayudar a diagnosticar y tratar trastornos del habla como la apraxia . [9]

Inteligibilidad

Los primeros trabajos sobre evaluación de la pronunciación evitaron medir la inteligibilidad genuina del oyente, [10] una deficiencia corregida en 2011 en la Universidad de Tecnología de Toyohashi , [11] e incluida en la evaluación de fluidez en inglés de alto riesgo Versant de Pearson [12] y las aplicaciones móviles de 17zuoye Education & Technology , [13] pero que sigue faltando en los productos de 2023 de Google Search , [14] Microsoft , [15] Educational Testing Service , [16] Speechace, [17] y ELSA. [18] Evaluar la inteligibilidad auténtica del oyente es esencial para evitar imprecisiones por sesgo de acento , especialmente en evaluaciones de alto riesgo; [19] [20] [21] de palabras con múltiples pronunciaciones correctas; [22] y de errores de codificación de fonemas en diccionarios de pronunciación legibles por máquina. [23] En los criterios de evaluación del Marco Común Europeo de Referencia para las Lenguas (MCER) para el "control fonológico general", la inteligibilidad tiene más peso que la pronunciación formalmente correcta en todos los niveles. [24]

En 2022, los investigadores descubrieron que algunos sistemas de voz a texto más nuevos, basados ​​en el aprendizaje de refuerzo de extremo a extremo para mapear señales de audio directamente en palabras, producen puntajes de confianza de palabras y frases estrechamente correlacionados con la inteligibilidad genuina del oyente. [25] En 2023, otros pudieron evaluar la inteligibilidad utilizando la distancia basada en la deformación temporal dinámica de la representación Wav2Vec2 del habla correcta. [26]

Evaluación

Aunque todavía no existen estándares industriales para evaluar la precisión de la evaluación de la pronunciación, los investigadores ocasionalmente publican corpus de discursos de evaluación para que otros los utilicen para mejorar la calidad de la evaluación. [27] [28] Estas bases de datos de evaluación a menudo enfatizan la pronunciación formalmente no acentuada, con exclusión de la inteligibilidad genuina evidente a partir de las transcripciones de oyentes ciegos . [5]

Los problemas éticos en la evaluación de la pronunciación están presentes tanto en los métodos humanos como en los automáticos. La validez auténtica, la imparcialidad y la mitigación del sesgo en la evaluación son fundamentales. Los modelos de evaluación automática de la pronunciación deberían incluir diversos datos del habla. La combinación del juicio humano con la retroalimentación automatizada puede mejorar la precisión y la imparcialidad. [29]

Acontecimientos recientes

Algunas áreas prometedoras de mejora que se están desarrollando en 2024 incluyen la extracción de características articulatorias [30] [31] [32] y el aprendizaje por transferencia para suprimir correcciones innecesarias. [33] Otros avances interesantes en desarrollo incluyen interfaces de " realidad aumentada " para dispositivos móviles que utilizan reconocimiento óptico de caracteres para proporcionar entrenamiento de pronunciación en el texto que se encuentra en los entornos de usuario. [34] [35] A mediados de 2024, se han utilizado modelos de lenguaje grandes multimodales de audio para evaluar la pronunciación. [36]

Véase también

Referencias

  1. ^ El Kheir, Yassine; et al. (21 de octubre de 2023), Automatic Pronunciation Assessment — A Review , Conferencia sobre métodos empíricos en el procesamiento del lenguaje natural, arXiv : 2310.13974 , S2CID  264426545
  2. ^ Ehsani, Farzad; Knodt, Eva (julio de 1998). "Tecnología del habla en el aprendizaje de idiomas asistido por ordenador: fortalezas y limitaciones de un nuevo paradigma CALL". Aprendizaje de idiomas y tecnología . 2 (1). Centro Nacional de Recursos de Idiomas Extranjeros de la Universidad de Hawái; Centro de Educación e Investigación en Idiomas de la Universidad Estatal de Michigan: 54– 73 . Consultado el 11 de febrero de 2023 .
  3. ^ Isaacs, Talia; Harding, Luke (julio de 2017). "Evaluación de la pronunciación". Enseñanza de idiomas . 50 (3): 347– 366. doi : 10.1017/S0261444817000118 . ISSN  0261-4448. S2CID  209353525.
  4. ^ Loukina, Anastassia; et al. (6 de septiembre de 2015), "Precisión de pronunciación e inteligibilidad del habla no nativa" (PDF) , INTERSPEECH 2015 , Dresde, Alemania: International Speech Communication Association , págs.  1917-1921 , solo el 16% de la variabilidad en la inteligibilidad a nivel de palabra puede explicarse por la presencia de pronunciaciones erróneas obvias.
  5. ^ ab O'Brien, Mary Grantham; et al. (31 de diciembre de 2018). "Direcciones para el futuro de la tecnología en la investigación y enseñanza de la pronunciación". Journal of Second Language Pronunciation . 4 (2): 182– 207. doi : 10.1075/jslp.17001.obr . hdl : 2066/199273 . ISSN  2215-1931. S2CID  86440885. Los investigadores de la pronunciación están interesados ​​principalmente en mejorar la inteligibilidad y la comprensibilidad de los estudiantes de L2, pero aún no han recopilado cantidades suficientes de datos representativos y confiables (grabaciones de habla con las anotaciones y juicios correspondientes) que indiquen qué errores afectan a estas dimensiones del habla y cuáles no. Estos datos son esenciales para entrenar algoritmos ASR para evaluar la inteligibilidad de los estudiantes de L2.
  6. ^ Eskenazi, Maxine (enero de 1999). "Uso del procesamiento automático del habla para la enseñanza de la pronunciación de lenguas extranjeras: algunos problemas y un prototipo". Aprendizaje de idiomas y tecnología . 2 (2): 62– 76 . Consultado el 11 de febrero de 2023 .
  7. ^ Tholfsen, Mike (9 de febrero de 2023). "Reading Coach en Immersive Reader y nuevas funciones que llegan a Reading Progress en Microsoft Teams". Blog de educación de Techcommunity . Microsoft . Consultado el 12 de febrero de 2023 .
  8. ^ Banerji, Olina (7 de marzo de 2023). "Las escuelas están utilizando tecnología de voz para enseñar a leer. ¿Está ayudando?". EdSurge News . Consultado el 7 de marzo de 2023 .
  9. ^ Hair, Adam; et al. (19 de junio de 2018). "Apraxia world: Un juego de terapia del habla para niños con trastornos del sonido del habla". Actas de la 17.ª Conferencia de la ACM sobre diseño de interacción y niños (PDF) . pp.  119– 131. doi :10.1145/3202185.3202733. ISBN 9781450351522. Número de identificación S2CID  13790002.
  10. ^ Bernstein, Jared; et al. (18 de noviembre de 1990), "Evaluación automática y entrenamiento en pronunciación inglesa" (PDF) , Primera Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP 90) , Kobe, Japón: International Speech Communication Association , págs.  1185– 1188 , consultado el 11 de febrero de 2023 , los oyentes difieren considerablemente en su capacidad para predecir palabras ininteligibles.... Por lo tanto, parece que la calificación de calidad es una opción más deseable... puntuación de calificación automática.(Sección 2.2.2.)
  11. ^ Hiroshi, Kibishi; Nakagawa, Seiichi (28 de agosto de 2011), "Nuevos parámetros de características para la evaluación de la pronunciación en presentaciones en inglés en conferencias internacionales" (PDF) , INTERSPEECH 2011 , Florencia, Italia: International Speech Communication Association , págs.  1149– 1152 , recuperado el 11 de febrero de 2023 , investigamos la relación entre la puntuación de pronunciación / inteligibilidad y varias medidas acústicas, y luego combinamos estas medidas... Hasta donde sabemos, la estimación automática de la inteligibilidad aún no se ha estudiado.
  12. ^ Bonk, Bill (25 de agosto de 2020). "Nuevas innovaciones en la evaluación: puntaje del índice de inteligibilidad de Versant". Recursos para estudiantes y profesores de inglés . Pearson English. Archivado desde el original el 27 de enero de 2023. Consultado el 11 de febrero de 2023. No necesitas un acento, una gramática o un vocabulario perfectos para ser comprensible. En realidad, solo necesitas ser comprensible con poco esfuerzo por los oyentes.
  13. ^ Gao, Yuan; et al. (25 de mayo de 2018), "La corrección de la inteligibilidad del inglés hablado con la alineación y la extracción de características de PocketSphinx mejora sustancialmente con respecto al estado del arte", 2.ª Conferencia IEEE sobre gestión avanzada de la información, comunicación, control electrónico y de automatización (IMCEC 2018) , págs.  924– 927, arXiv : 1709.01713 , doi : 10.1109/IMCEC.2018.8469649, ISBN 978-1-5386-1803-5, Número de identificación del sujeto  31125681
  14. ^ Snir, Tal (14 de noviembre de 2019). «¿Cómo se pronuncia quokka? Practica con la búsqueda». La palabra clave . Google . Consultado el 11 de febrero de 2023 .
  15. ^ "Herramienta de evaluación de la pronunciación". Azure Cognitive Services Speech Studio . Microsoft . Consultado el 11 de febrero de 2023 .
  16. ^ Chen, Lei; et al. (diciembre de 2018). Puntuación automatizada del habla no nativa: uso del motor SpeechRater v. 5.0. Serie de informes de investigación de ETS. Vol. 2018. Princeton, NJ: Educational Testing Service. págs.  1– 31. doi :10.1002/ets2.12198. ISSN  2330-8516. S2CID  69925114. Consultado el 11 de febrero de 2023 .
  17. ^ Alnafisah, Mutleb (septiembre de 2022), "Technology Review: Speechace", Actas de la 12.ª Conferencia sobre pronunciación en el aprendizaje y la enseñanza de segundas lenguas (PSLLT virtual) , n.º 40, vol. 12, St. Catharines, Ontario, ISSN  2380-9566 , consultado el 14 de febrero de 2023{{citation}}: Mantenimiento de CS1: falta la ubicación del editor ( enlace )
  18. ^ Gorham, Jon; et al. (10 de marzo de 2022). Reconocimiento de voz para el aprendizaje del idioma inglés (video) . Tecnología en la enseñanza y el aprendizaje de idiomas . Soluciones educativas . Consultado el 14 de febrero de 2023 .
  19. ^ "La computadora dice que no: un veterano irlandés no aprueba el examen oral de inglés necesario para quedarse en Australia". The Guardian . Australian Associated Press. 8 de agosto de 2017 . Consultado el 12 de febrero de 2023 .
  20. ^ Ferrier, Tracey (9 de agosto de 2017). «Ex lector de noticias australiano con título en inglés no aprueba el examen de inglés de un robot». The Sydney Morning Herald . Consultado el 12 de febrero de 2023 .
  21. ^ Main, Ed; Watson, Richard (9 de febrero de 2022). «El examen de inglés que arruinó miles de vidas». BBC News . Consultado el 12 de febrero de 2023 .
  22. ^ Joyce, Katy Spratte (24 de enero de 2023). «13 palabras que se pueden pronunciar de dos maneras». Reader's Digest . Consultado el 23 de febrero de 2023 .
  23. ^ Por ejemplo, CMUDICT , "The CMU Pronouncing Dictionary". www.speech.cs.cmu.edu . Consultado el 15 de febrero de 2023 .Compare "cuatro" dado como "F AO R" con la vocal AO como en "caught", con "row" dado como "R OW" con la vocal OW como en "oat".
  24. ^ Marco común europeo de referencia para el aprendizaje, la enseñanza y la evaluación de lenguas: volumen complementario con nuevos descriptores. Programa de Política Lingüística, División de Política Educativa, Departamento de Educación, Consejo de Europa . Febrero de 2018. pág. 136. OCLC  1090351600.
  25. ^ Tu, Zehai; Ma, Ning; Barker, Jon (2022). "Medidas de incertidumbre no supervisadas del reconocimiento automático del habla para la predicción no intrusiva de la inteligibilidad del habla" (PDF) . Proc. Interspeech 2022 . INTERSPEECH 2022. ISCA. pp.  3493– 3497. doi :10.21437/Interspeech.2022-10408 . Consultado el 17 de diciembre de 2023 .
  26. ^ Anand, Nayan; Sirigiraju, Meenakshi; Yarra, Chiranjeevi (15 de junio de 2023). "Evaluación de la inteligibilidad del habla no supervisada con distancia de alineación del nivel de enunciado entre las representaciones Wav2Vec-2.0 del profesor y del alumno". arXiv : 2306.08845 [cs.SD].
  27. ^ Vidal, Jazmín; et al. (15 de septiembre de 2019), «EpaDB: una base de datos para el desarrollo de sistemas de evaluación de la pronunciación» (PDF) , Interspeech 2019 , pp.  589– 593, doi :10.21437/Interspeech.2019-1839, hdl : 11336/161618 , S2CID  202742421 , consultado el 19 de febrero de 2023; archivo .zip de base de datos.
  28. ^ Zhang, Junbo; et al. (30 de agosto de 2021), "speechocean762: un corpus de habla en inglés no nativo de código abierto para la evaluación de la pronunciación" (PDF) , Interspeech 2021 , págs.  3710–3714 , arXiv : 2104.01378 , doi : 10.21437/Interspeech.2021-1259, S2CID  233025050 , consultado el 19 de febrero de 2023.; Repositorio de corpus de GitHub.
  29. ^ Babaeian, Ali (2023). «Evaluación de la pronunciación: modos tradicionales frente a modernos». Revista de educación para la innovación sostenible . 1 (1): 61– 68 . Consultado el 31 de diciembre de 2024 .
  30. ^ Wu, Peter; et al. (14 de febrero de 2023), "Inversión del habla acústica a articulatoria independiente del hablante", arXiv : 2302.06774 [eess.AS]
  31. ^ Cho, Cheol Jun; Mohamed, Abdelrahman; Black, Alan W.; Anumanchipalli, Gopala K. (16 de enero de 2024). "Los modelos autosupervisados ​​del habla infieren cinemática articulatoria universal". arXiv : 2310.10788 [eess.AS].
  32. ^ Mallela, Jhansi; Aluru, Sai Harshitha; Yarra, Chiranjeevi (28 de febrero de 2024). Exploración del uso de representaciones autosupervisadas para la detección automática de acentos silábicos. Conferencia Nacional sobre Comunicaciones. Chennai, India. pp.  1– 6. doi :10.1109/NCC60321.2024.10486028 . Consultado el 10 de junio de 2024 .
  33. ^ Sancinetti, Marcelo; et al. (23 de mayo de 2022). "Un enfoque de aprendizaje por transferencia para la puntuación de la pronunciación". ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) . págs.  6812– 6816. arXiv : 2111.00976 . doi :10.1109/ICASSP43922.2022.9747727. ISBN 978-1-6654-0540-9.S2CID249437375  .
  34. ^ Che Dalim, Che Samihah; et al. (febrero de 2020). "Uso de realidad aumentada con entrada de voz para el aprendizaje de idiomas de niños no nativos" (PDF) . Revista internacional de estudios humanos-computadores . 134 : 44– 64. doi :10.1016/j.ijhcs.2019.10.002. S2CID  208098513 . Consultado el 28 de febrero de 2023 .
  35. ^ Tolba, Rahma M.; et al. (2023). "Realidad aumentada móvil para el aprendizaje de la fonética: una revisión (2012-2022)". Realidad extendida y metaverso . Springer Proceedings in Business and Economics. Springer International Publishing: 87-98 . doi :10.1007/978-3-031-25390-4_7. ISBN 978-3-031-25389-8. Recuperado el 28 de febrero de 2023 .
  36. ^ Fu, Kaiqi; Peng, Linkai; Yang, Nan; Zhou, Shuran (18 de julio de 2024). "Evaluación de la pronunciación con modelos lingüísticos multimodales de gran tamaño". arXiv : 2407.09209 [cs.CL].
  37. ^ Mathad, Vikram C.; et al. (2021). "El impacto de los errores de alineación forzada en la evaluación automática de la pronunciación" (PDF) . 22.ª Conferencia Anual de la Asociación Internacional de Comunicación del Habla (INTERSPEECH 2021) . Asociación Internacional de Comunicación del Habla. págs.  176– 180. doi :10.21437/interspeech.2021-1403. ISBN 9781713836902. S2CID  239694157 . Consultado el 10 de marzo de 2023 .
Obtenido de "https://es.wikipedia.org/w/index.php?title=Evaluación_de_la_pronunciación&oldid=1266556117"