Articulo de referencia

Corpus de inglés hablado

El Corpus de Inglés Hablado ( SEC ) es una colección de grabaciones de habla en inglés británico recopiladas entre 1984 y 1987. El manual del corpus se puede encontrar en ICAME ...

El Corpus de Inglés Hablado ( SEC ) es una colección de grabaciones de habla en inglés británico recopiladas entre 1984 y 1987. El manual del corpus se puede encontrar en ICAME . [ 1 ]

Historia

El proyecto Spoken English Corpus (SEC) fue financiado conjuntamente en 1984-1985 por el Humanities Research Fund de la Universidad de Lancaster y por IBM (UK) Ltd, y posteriormente por IBM UK Ltd. El proyecto contó con el apoyo de Geoffrey Leech en Lancaster y Geoffrey Kaye en IBM. El proyecto fue una colaboración, financiada por IBM , entre la Unidad de Investigación Informática sobre el Idioma Inglés (UCREL) de la Universidad de Lancaster y el Centro Científico de IBM en Winchester . [ 2 ]

Compilación

SEC comprende 53 pasajes grabados, principalmente de la BBC , hablados con el acento conocido como Received Pronunciation (RP). La colección abarca categorías como comentarios, noticieros, conferencias, diálogos, poesía y propaganda. [ 3 ] El corpus contiene 52 637 palabras, con una duración total de 339 minutos. La compilación del corpus es descrita por Lita Taylor en su artículo de 1996 «The Compilation of the Spoken English Corpus». [ 4 ]

Transcripción

Knowles et al., (1996) Un corpus del habla formal del inglés británico, Routledge

Se diseñó un sistema para transcribir la entonación del material en las grabaciones. Dos transcriptores, Gerry Knowles y Briony Williams, ambos con el apoyo de Lita Taylor, analizaron todo el corpus. Williams explica el sistema de transcripción [ 5 ] y Brian Pickering realizó un experimento para evaluar el grado de concordancia entre los dos transcriptores en una sección del corpus que contenía alrededor de 1000 unidades tonales , la cual fue transcrita por ambos [ 6 ] . Se encontró una buena concordancia.

La transcripción completa impresa fue realizada en su forma actual por Peter Alderson, quien posteriormente asumió el cargo de Gerente de Investigación del Habla en IBM. El volumen se tituló más tarde «A Corpus of Formal British English Speech: The Lancaster/IBM Spoken English Corpus» y fue publicado por primera vez por Longman en 1996, y posteriormente por Routledge en 2013. El libro está disponible actualmente en librerías en línea como Routledge y Book Depository, o en formato electrónico en Google Play Libros. [ 7 ] [ 8 ]

Otros análisis

El etiquetado gramatical de cada palabra, basado en el conjunto de etiquetas CLAWS1 , se añadió al texto del SEC mediante un proceso automático. [ 9 ] [ 10 ] El hecho de que este etiquetado estuviera en un formato legible por máquina permitió relacionar la información gramatical y prosódica de los textos. Trabajos posteriores utilizaron modelos probabilísticos para desarrollar aún más el etiquetado gramatical y producir técnicas de análisis sintáctico automático . [ 11 ]

Anne Wichmann publicó su investigación sobre la entonación SEC, "Entonación en texto y discurso: comienzos, medios y finales" en 2000. [ 12 ]

Corpus de inglés hablado legible por máquina (MARSEC)

Aunque el texto y su etiquetado asociado existían en formato legible por máquina, las grabaciones en sí solo existían como grabaciones de cinta. Una colaboración, financiada por el Consejo de Investigación Económica y Social entre 1992 y 1994, entre científicos del habla de las Universidades de Lancaster y Leeds en el Reino Unido, se propuso producir una versión del corpus que contuviera las grabaciones en formato digital, vinculadas temporalmente al texto. [ 13 ] Los investigadores principales fueron Gerry Knowles y Tamas Varadi (Lancaster) y Peter Roach y Simon Arnfield (Leeds). El esquema del proyecto se expone en Knowles, [ 14 ] y la alineación temporal automática es descrita por Roach y Arnfield. [ 15 ] Las grabaciones digitalizadas se grabaron en CD-ROM . Posteriormente, se puso a disposición para su descarga con fines de investigación desde la Universidad de Leeds, aunque este servicio ya no cuenta con soporte. [ 16 ]

Aix-MARSEC

El trabajo en MARSEC en Lancaster y Leeds finalizó alrededor de 1995, pero el corpus ha sido posteriormente objeto de un considerable desarrollo adicional en la Universidad de Aix-en-Provence , Francia, bajo la dirección de Daniel Hirst. [ 17 ] La base de datos consta de dos componentes principales: las grabaciones digitalizadas de MARSEC y las anotaciones. Hasta el momento, las anotaciones se han realizado en nueve niveles, incluyendo fonemas , sílabas , palabras , pies tónicos , unidades rítmicas y unidades de giro menor y mayor . Dos niveles suplementarios, la anotación gramatical de CLAWS y un sistema de gramática de propiedades desarrollado en Aix-en-Provence, se integrarán próximamente. [ 18 ] Una posible desventaja de este tratamiento es que el corpus solo se puede buscar utilizando scripts especialmente escritos. [ 19 ] La base de datos, junto con las herramientas, está disponible bajo la licencia GNU GPL en el sitio del proyecto Aix-MARSEC. [ 20 ]

Referencias

  1. "MANUAL DE INFORMACIÓN QUE ACOMPAÑA AL CORPUS DE LA SEC" . korpus.uib.no . Archivado del original el 8 de marzo de 2022. Consultado el 15 de octubre de 2020 .
  2. Leech, Geoffrey . (1996). «El corpus del inglés hablado en su contexto». Prólogo. Knowles, Gerard; Wichmann, Anne; Alderson, Peter, eds. (1996). Trabajar con el habla . Longman. pág. ix. ISBN  9780582045347.
  3. ^ Xiao, Ricardo; Toño, Yukio (2006). MacEnery, Tony (ed.). Estudios lingüísticos basados ​​en corpus: un libro de recursos avanzados . Taylor y Francisco. pag. 63.ISBN  9780415286220.
  4. Taylor, Lita. (1996). «La compilación del corpus del inglés hablado». Knowles, Gerard; Wichmann, Anne; Alderson, Peter, eds. (1996). Working with Speech . Longman. pp. 20–37 . ISBN  9780582045347.
  5. Williams, Briony. (1996). «La formulación de un sistema de transcripción de entonación para el inglés británico». Knowles, Gerard; Wichmann, Anne; Alderson, Peter, eds. (1996). Working with Speech . Longman. pp. 38–57 . ISBN  9780582045347.
  6. Pickering, Brian. (1996). «Análisis de las diferencias entre transcriptores en el SEC». Knowles, Gerard; Wichmann, Anne; Alderson, Peter, eds. (1996). Working with Speech . Longman. pp. 61–86 . ISBN  9780582045347.
  7. "Un corpus del habla inglesa británica formal: El corpus de inglés hablado de Lancaster/IBM (edición de bolsillo) - Routledge" . Routledge.com . Consultado el 22 de julio de 2018 .
  8. "Un corpus del habla formal del inglés británico : Gerald Knowles : 9781138457768" . www.bookdepository.com . Consultado el 30 de enero de 2019 .  
  9. Taylor, Lita. (1996). «La compilación del corpus del inglés hablado». Knowles, Gerard; Wichmann, Anne; Alderson, Peter, eds. (1996). Working with Speech . Longman. p. 30. ISBN  9780582045347.
  10. "UCREL CLAWS1 (LOB) Tagset" . ucrel.lancs.ac.uk . Consultado el 15 de octubre de 2020 .
  11. Sampson, Geoffrey . (1987). "Modelos probabilísticos de análisis." Garside, Roger; Sampson, Geoffrey ; Leech, Geoffrey (1987). El análisis computacional del inglés . Longman. ISBN 9780582291492.
  12. "Entonación en el texto y el discurso: comienzos, desarrollos y finales" . Routledge & CRC Press . Consultado el 15 de octubre de 2020 .
  13. Roach, P., Knowles, G., Varadi, T. y Arnfield, S. (1994) Roach, Peter; Knowles, Gerry; Varadi, Tamas; Arnfield, Simon (1993). "MARSEC: un corpus de inglés hablado legible por máquina". Journal of the International Phonetic Association . 23 (2): 47– 54. doi : 10.1017/s0025100300004849 . ISSN 0025-1003 . S2CID 145797962 .  
  14. Knowles, G. «Conversión de un corpus en una base de datos relacional: SEC se convierte en MARSEC» Geoffrey, Leech ; Myers, Greg; Thomas, Jenny (1995). Inglés hablado en computadora . Longman. págs. 208–219 . ISBN  9780582250215.
  15. Roach, Peter y Arnfield, Simon. «Vinculando la transcripción prosódica con la dimensión temporal». Geoffrey, Leech ; Myers, Greg; Thomas, Jenny (1995). Inglés hablado en computadora . Longman. págs. 149–160 . ISBN  9780582250215.
  16. "MARSEC: El corpus de inglés hablado legible por máquina" . www.reading.ac.uk . Consultado el 15 de octubre de 2020 .
  17. Hirst, Daniel; De Looze, Céline; Auran, Cyril; Bouzon, Caroline (27 de julio de 2010). "Base de datos Aix-MARSEC" . Archivado del original el 23 de enero de 2010. Recuperado el 15 de abril de 2013 .
  18. ^ Auron, Cirilo; Bouzon, Carolina (2003). "Phonotáctica predictiva y alineación automática : aplicación en el corpus MARSEC y perspectivas" [ Fonotáctica predictiva y alineación automática: aplicación en el corpus y perspectivas MARSEC ] . Travaux interdisciplinaires du laboratoire parole et langage d'Aix-en-Provence (en francés). 22 . Publicaciones de la Universidad de Provence : 33– 63 . Consultado el 15 de abril de 2013 . 
  19. ^ Wichmann, Anne "Corpus de habla y corpus hablados" Ludeling, Anke; Kyto, Merja (2006). Lingüística de Corpus 1 . Walter de Gruyter. pag. 200.ISBN  9783110180435.
  20. Hirst, Daniel. "Proyecto Aix-MARSEC" . Archivado del original el 23 de enero de 2010. Recuperado el 15 de abril de 2013 .