Articulo de referencia

Corpus Internacional de Inglés

El Corpus Internacional de Inglés ( ICE ) es un conjunto de corpus de texto que representan variedades de inglés de todo el mundo. Incluye más de veinte países o grupos de paíse...

El Corpus Internacional de Inglés ( ICE ) es un conjunto de corpus de texto que representan variedades de inglés de todo el mundo. Incluye más de veinte países o grupos de países donde el inglés es la primera lengua o una segunda lengua oficial.

Historia

El objetivo de Sidney Greenbaum de compilar corpus que compararan la sintaxis del inglés mundial se convirtió en el proyecto ICE, llevado a cabo por el profesor Charles F. Meyer. Sidney Greenbaum previó que equipos internacionales de investigadores recopilarían variaciones nacionales comparables del inglés, tanto escrito como hablado. [ 1 ] Las variaciones comparables serían el inglés británico, el inglés americano y el inglés indio, que se representarían mediante un corpus informático. [ 2 ] Los investigadores utilizan los corpus para comparar la sintaxis de las variedades de inglés. [ 3 ] La finalización de los corpus ICE proporcionaría un análisis lingüístico exhaustivo de las variedades de inglés que han surgido. [ 4 ] La investigación en curso para ICE es implementada por equipos internacionales en diversas regiones. [ 5 ] El proyecto comenzó en 1990 con el objetivo principal de recopilar material para estudios comparativos del inglés en todo el mundo. Veintitrés equipos de investigación de todo el mundo están preparando corpus electrónicos de su propia variedad nacional o regional de inglés. Cada corpus ICE consta de un millón de palabras de inglés hablado y escrito producidas después de 1989. [ 6 ] Para la mayoría de los países participantes, el proyecto ICE está impulsando la primera investigación sistemática de la variedad nacional. Para garantizar la compatibilidad entre los corpus que lo componen, cada equipo sigue un diseño de corpus común, así como un esquema común para la anotación gramatical.

Descripción

Cada corpus contiene un millón de palabras en 500 textos de 2000 palabras, [ 7 ] siguiendo la metodología de muestreo utilizada para el Corpus Brown . Sin embargo, a diferencia de Brown o del Corpus Lancaster-Oslo-Bergen (LOB) (o incluso megacorpus como el Corpus Nacional Británico ), la mayoría de los textos se derivan de datos orales.

Con tan solo un millón de palabras por corpus, los corpus ICE se consideran muy pequeños para los estándares actuales. [ 8 ] Los corpus ICE contienen el 60 % (600 000 palabras) de inglés hablado transcrito ortográficamente . El padre del proyecto, Sidney Greenbaum, insistió en la primacía de la palabra hablada, siguiendo la colaboración de Randolph Quirk y Jan Svartvik en el Corpus London-Lund (LLC) original. Este énfasis en la transcripción palabra por palabra distingue a ICE de muchos otros corpus, incluidos aquellos que contienen, por ejemplo, paráfrasis parlamentarias o legales.

Los corpus constan exclusivamente de datos de 1990 o posteriores. Los sujetos de los que se recopilaron los datos son todos adultos que recibieron educación en inglés y que nacieron o se mudaron a temprana edad al país al que se atribuyen sus datos. [ 7 ] Hay muestras de habla y texto de hombres y mujeres de diversos grupos de edad, pero el sitio web del corpus aclara que «las proporciones, sin embargo, no son representativas de las proporciones en la población en su conjunto: las mujeres no están representadas por igual en profesiones como la política y el derecho, y por lo tanto no producen la misma cantidad de discurso en estos campos». [ 7 ]

El componente británico de ICE, ICE-GB, se analiza completamente con una gramática detallada de estructura de frases de Quirk et al. [ 9 ] , y los análisis se han revisado y completado exhaustivamente. Este análisis incluye el etiquetado de partes de la oración y el análisis sintáctico de todo el corpus. El banco de árboles se puede buscar y explorar exhaustivamente con el programa de utilidades del corpus ICE o el software ICECUP . Encontrará más información en el manual. [ 10 ]

Para garantizar la compatibilidad entre los distintos corpus de ICE, cada equipo sigue un diseño de corpus común, así como un esquema común para la anotación gramatical. [ 11 ] Muchos corpus están disponibles para su descarga en la página web oficial de ICE, aunque algunos requieren licencia. Otros, sin embargo, aún no están listos para su publicación. [ 12 ]

Anotación textual y gramatical

Los investigadores y lingüistas siguen directrices específicas al anotar los datos del corpus, que se pueden encontrar aquí , en el Corpus Internacional de Manuales y Documentación del Inglés. Los tres niveles de anotación son Marcado de texto, Etiquetado de clase de palabra y Análisis sintáctico. [ 13 ]

Marcado textual

Se conserva el formato y la maquetación originales, como el análisis de oraciones y párrafos, con marcadores especiales que indican su originalidad. Los datos hablados se transcriben ortográficamente, con indicadores de vacilaciones, falsos comienzos y pausas. [ 13 ]

Etiquetado de clases de palabras

Las clases de palabras, también llamadas partes de la oración , son categorías gramaticales para las palabras basadas en su función dentro de una oración.

Los textos británicos son etiquetados automáticamente según su clase de palabra por el etiquetador ICE, desarrollado en el University College de Londres, que utiliza una gramática exhaustiva del idioma inglés.

Todos los demás idiomas se etiquetan automáticamente utilizando el PENN Treebank y el conjunto de etiquetas CLAWS. Si bien las etiquetas no se corrigen manualmente, se revisan periódicamente para garantizar su calidad. [ 13 ]

Análisis sintáctico

Las oraciones se analizan automáticamente y, si es necesario, se corrigen manualmente con ICECUP, un editor de árboles sintácticos creado específicamente para el corpus.

El análisis de dependencias también se realiza automáticamente con el analizador de dependencias Pro3GreS. Los resultados no se verifican manualmente. [ 13 ]

Análisis pragmático

Actualmente, Irlanda es el único país participante que incluye anotaciones pragmáticas en sus datos.

Diseño de los corpus

A continuación se muestran las subsecciones del ICE, con el número de corpus para cada categoría y subcategoría entre paréntesis. [ 7 ]

Publicaciones

Existen varios libros publicados sobre el Corpus Internacional de Inglés, así como libros basados ​​en parte en los corpus. [ 14 ]

  • Inglés en el Caribe: Variación, estilo y estándares en Jamaica y Trinidad (2014) por Dagmar Deuber
  • El presente perfecto en las variedades del inglés a nivel mundial: Trazando la unidad y la diversidad (2014) por Valentin Werner
  • Mapeando la unidad y la diversidad en todo el mundo: estudios basados ​​en corpus de las nuevas variedades del inglés (2012) por Marianne Hundt y Ulrike Gut
  • La sintaxis del inglés hablado de la India (2012) por Claudia Lange
  • Gramática inglesa moderna de Oxford (2011) por Bas Aarts
  • Adverbiales adjuntos en inglés (2010) de Hilde Hasselgård
  • Revista ICAME N° 34 (2010)
  • Introducción a la gramática inglesa (2009) por Sidney Greenbaum y Gerald Nelson
  • Formación de palabras en las nuevas variedades del inglés: un análisis basado en corpus (2008) por Thomas Biermeier
  • Número especial de World Englishes Volumen 23 Número 2 (2004)
  • Explorando el lenguaje natural: Trabajando con el componente británico del Corpus Internacional de Inglés (2002) por Gerald Nelson, Sean Wallis y Bas Aarts
  • Comparación del inglés a nivel mundial: El corpus internacional del inglés (1996) por Sidney Greenbaum
  • Gramática inglesa de Oxford (1996) por Sidney Greenbaum

Participantes

La lista actual de países participantes es (*= disponible):

  • Australia
  • Camerún
  • Canadá*
  • África Oriental (Kenia, Malawi, Tanzania)*
  • Fiyi
  • Ghana
  • Gran Bretaña* (analizado)
  • Hong Kong*
  • India*
  • Irlanda*
  • Jamaica*
  • Malta
  • Malasia
  • Nueva Zelanda*
  • Nigeria* (etiquetado)
  • Pakistán
  • Filipinas*
  • Sierra Leona
  • Singapur*
  • Sudáfrica
  • Sri Lanka
  • Trinidad y Tobago
  • EE.UU*

Véase también

Referencias

  1. "El Proyecto ICE" (PDF) .
  2. "El Proyecto ICE" (PDF) .
  3. Nelson, Gerald (mayo de 2004). "Introducción". World Englishes . 23 (2): 225– 226. doi : 10.1111/j.0883-2919.2004.00347.x . ISSN 0883-2919 . 
  4. "El Proyecto ICE" (PDF) .
  5. "El Proyecto ICE" (PDF) .
  6. "Página principal del Corpus Internacional de Inglés (ICE) @ ICE-corpora.net" .
  7. 1 2 3 4 "Diseño de corpus @ ICE-corpora.net" . ice-corpora.net . Consultado el 3 de marzo de 2018 .
  8. Nelson, Gerald (2017). "El proyecto ICE y las variedades del inglés en el mundo". World Englishes . 36 (3): 367– 370. doi : 10.1111/weng.12276 .
  9. Quirk, Randolph, Greenbaum, Sidney, Leech, Geoffrey y Svartvik, Jan (1985). Gramática completa de la lengua inglesa. Londres: Longman
  10. Nelson, Gerald, Wallis, Sean y Aarts, Bas (2002). Explorando el lenguaje natural. Trabajando con el componente británico del Corpus Internacional de Inglés. Ámsterdam: John Benjamins
  11. "Sitio web del Corpus Internacional de Inglés" . Archivado del original el 4 de febrero de 2009. Consultado el 13 de enero de 2008 .
  12. "Página principal del Corpus Internacional de Inglés (ICE) @ ICE-corpora.net" . ice-corpora.net . Consultado el 3 de marzo de 2018 .
  13. 1 2 3 4 "Anotación" . www.ice-corpora.uzh.ch . Consultado el 29 de marzo de 2018 .
  14. "Publicaciones en ICE-corpora.net" . ice-corpora.net . Consultado el 22 de abril de 2018 .
  • El sitio web del Corpus Internacional de Inglés