Articulo de referencia

Corpus de textos

En lingüística y procesamiento del lenguaje natural , un corpus ( plural "}]],"parts":[{"template":{"target":{"wt":"plural form","href":"./Template:Plural_form"},"params":{},"i"...

En lingüística y procesamiento del lenguaje natural , un corpus ( plural : corpus ) o corpus de texto es un conjunto de datos que consta de recursos lingüísticos digitales nativos y otros más antiguos digitalizados , ya sean anotados o sin anotar. Los corpus anotados se han utilizado en lingüística de corpus para la comprobación de hipótesis estadísticas , la verificación de ocurrencias o la validación de reglas lingüísticas dentro de un territorio lingüístico específico.

Descripción general

Un corpus puede contener textos en un solo idioma ( corpus monolingüe ) o datos textuales en varios idiomas ( corpus multilingüe ). Para que los corpus sean más útiles para la investigación lingüística, a menudo se someten a un proceso conocido como anotación . Un ejemplo de anotación de un corpus es el etiquetado de partes de la oración ( POS-tagging ), en el que se añade información sobre la categoría gramatical de cada palabra (verbo, sustantivo, adjetivo, etc.) al corpus en forma de etiquetas . Otro ejemplo es indicar la forma lemática (base) de cada palabra. Cuando el idioma del corpus no es el idioma de trabajo de los investigadores que lo utilizan, se emplea el glosado interlineal para que la anotación sea bilingüe.

Algunos corpus cuentan con niveles de análisis estructurados adicionales. En particular, los corpus más pequeños pueden ser analizados completamente . Estos corpus suelen denominarse Treebanks o Corpus Analizados . La dificultad de garantizar que todo el corpus esté anotado de forma completa y coherente implica que estos corpus suelen ser más pequeños, conteniendo entre uno y tres millones de palabras. También son posibles otros niveles de análisis lingüístico estructurado, incluyendo anotaciones para morfología , semántica y pragmática .

Aplicaciones

Los corpus son la principal base de conocimiento en la lingüística de corpus . Otras áreas de aplicación destacadas incluyen:

  • Traducción automática
    • Los corpus multilingües formateados especialmente para la comparación lado a lado se denominan corpus paralelos alineados . Existen dos tipos principales de corpus paralelos que contienen textos en dos idiomas. En un corpus de traducción , los textos en un idioma son traducciones de textos en el otro idioma. En un corpus comparable , los textos son del mismo tipo y abarcan el mismo contenido, pero no son traducciones entre sí. [ 2 ] Para aprovechar un texto paralelo, es requisito previo para el análisis algún tipo de alineación de texto que identifique segmentos de texto equivalentes (frases u oraciones). Los algoritmos de traducción automática para traducir entre dos idiomas suelen entrenarse utilizando fragmentos paralelos que comprenden un corpus en el primer idioma y un corpus en el segundo idioma, que es una traducción elemento por elemento del corpus en el primer idioma. [ 3 ]
  • Filologías
    • Los corpus textuales también se utilizan en el estudio de documentos históricos, por ejemplo, para descifrar escrituras antiguas o en estudios bíblicos . Algunos corpus arqueológicos son tan breves que ofrecen una instantánea de un momento determinado. Uno de los corpus más cortos podría ser el de las cartas de Amarna, de entre 15 y 30 años de antigüedad ( 1350 a. C. ). El corpus de una ciudad antigua (por ejemplo, los « Textos de Kültepe » de Turquía) puede constar de varios corpus, cuya fecha de hallazgo depende de la fecha de cada yacimiento.

Algunos corpus de texto notables

Véase también

Referencias

  1. Yoon, H., & Hirvela, A. (2004). Actitudes de los estudiantes de inglés como segunda lengua hacia el uso de corpus en la escritura en L2 . Journal of Second Language Writing, 13 (4), 257–283. Recuperado el 21 de marzo de 2012.
  2. Wołk, K.; Marasek, K. (7 de abril de 2014). «Traducción de voz estadística en tiempo real». Nuevas perspectivas en sistemas y tecnologías de la información, volumen 1. Avances en sistemas inteligentes y computación. Vol.  275. Springer. págs. 107–114 . arXiv : 1509.09090 . doi : 10.1007/978-3-319-05951-8_11 . ISBN  978-3-319-05950-1. ISSN 2194-5357 . S2CID 15361632 .  
  3. Wolk, Krzysztof; Marasek, Krzysztof (2015). "Minería de datos paralela optimizada y acelerada por GPU a partir de corpus comparables". En Král, Pavel; Matoušek, Václav (eds.). Texto, habla y diálogo: 18.ª Conferencia Internacional, TSD 2015, Plzeň, República Checa, 14-17 de septiembre de 2015, Actas . Lecture Notes in Computer Science. Vol. 9302. Springer. pp. 32-40 . arXiv : 1509.08639 . doi : 10.1007/978-3-319-24033-6_4 . ISBN   978-3-319-24032-9.
  • Enlaces a recursos de ACL SIGLEX: Corpus de texto archivados el 13 de agosto de 2013 en Wayback Machine.
  • Desarrollo de corpus lingüísticos: una guía para las buenas prácticas.
  • Muestras gratuitas (no gratuitas), corpus en línea (de 45 a 425 millones de palabras cada uno): estadounidense (COCA, COHA, TIME), británico (BNC), español, portugués.
  • Intercorp crea corpus paralelos síncronos de las lenguas que se imparten en la Facultad de Artes de la Universidad Carolina.
  • Sketch Engine: Corpus abiertos con acceso gratuito
  • Corpus TS: un corpus turco disponible gratuitamente para la investigación académica.
  • Corpus Nacional Turco – Un corpus de propósito general para el turco contemporáneo. Archivado el 2 de abril de 2015 en Wayback Machine.
  • Corpus de discursos políticos , acceso gratuito a discursos políticos de políticos estadounidenses y chinos, desarrollado por la Biblioteca de la Universidad Bautista de Hong Kong.
  • Corpus Nacional Ruso