Articulo de referencia

Corpus de escritura tártara

El Corpus de Tártaro Escrito (Corpus Tártaro) es un corpus electrónico de la lengua tártara , disponible en línea. Esta colección de textos tártaros en formato electrónico está ...

El Corpus de Tártaro Escrito (Corpus Tártaro) es un corpus electrónico de la lengua tártara , disponible en línea. Esta colección de textos tártaros en formato electrónico está destinada a quienes estén interesados ​​en la estructura, el estado actual y las perspectivas de la lengua tártara. El Corpus de Tártaro Escrito es indispensable para todo aquel que desee estudiar el tártaro mediante los métodos de la lingüística de corpus . El sitio web se inauguró el 15 de marzo de 2012 y está disponible en tártaro, ruso e inglés.

Tamaño del corpus

A finales de 2014, el corpus de la lengua tártara contenía más de 116 millones de palabras. El número de oraciones era de 10 millones, y el de formas léxicas diferentes, de aproximadamente 1,5 millones. Para evitar la copia, los textos se almacenan como oraciones mixtas en el corpus.

Acceso

El acceso al Corpus Tártaro con fines de investigación es gratuito.

Acerca del proceso de creación de corpus

La creación del corpus de la lengua tártara fue iniciada en 2010 por un grupo de entusiastas. La tarea se consideró urgente, ya que proporcionaría la base de datos de textos necesaria para el desarrollo de sistemas de traducción automática para la lengua tártara, y también era indispensable para resolver problemas en la síntesis y el reconocimiento del habla tártara.

Valor práctico y áreas de uso

El objetivo principal del Corpus de Lengua Tártara Escrita es facilitar la investigación del léxico tártaro. Además, el corpus puede utilizarse para el aprendizaje de idiomas y como fuente de modelos para diversos tipos de documentos. El Corpus de Lengua Tártara Escrita permite al usuario buscar palabras por características específicas, visualizarlas en su contexto y proporciona datos de frecuencia.

corpus contextual (estadístico)

Este tipo de búsqueda permite visualizar los contextos derecho, izquierdo y semántico de una palabra específica, ordenados por frecuencia. Contexto derecho: palabras que aparecen inmediatamente después de la palabra actual. Contexto izquierdo: palabras que aparecen inmediatamente antes de la palabra actual. Contexto semántico: palabras que se encuentran en la misma oración que la palabra actual, es decir, existe algún tipo de conexión semántica implícita entre ellas.

En 2014, se realizó el marcado morfológico del Corpus Tártaro. El metalenguaje de etiquetas gramaticales se basa en el sistema de etiquetas para lenguas túrquicas desarrollado por el proyecto internacional Apertium. Este proyecto tiene como objetivo desarrollar un sistema de traducción automática para una gran variedad de lenguas. Los principales argumentos a favor de elegir el etiquetador morfológico de Apertium para marcar el Corpus son: - alta calidad de la anotación morfológica; - ser un proyecto de código abierto: todo el código fuente y los datos están disponibles públicamente para todos de forma gratuita. El sistema de búsqueda morfológica compleja desarrollado por nosotros en 2015-2016 permite realizar búsquedas en el Corpus mediante diferentes combinaciones de parámetros como la forma de la palabra, el lema, el conjunto de etiquetas morfológicas (gramaticales), el inicio de la palabra, la parte media, el final de la palabra y la distancia entre las palabras buscadas. La longitud máxima de la consulta de búsqueda es de cinco tokens + cuatro distancias entre ellos.

Síntesis de voz tártara

El Corpus de Tártaro Escrito ofrece al usuario una oportunidad única para escuchar las frases encontradas en una búsqueda, y también para escuchar cualquier otro texto que el usuario introduzca en esta función, véase http://search.corpus.tatar/search/sintez_en.html .

Datos estadísticos

Los creadores del Corpus de la lengua tártara suben diversos datos estadísticos adicionales tan pronto como están disponibles como resultado del procesamiento del Corpus, véase http://corpus.tatar/stat_en.htm .

Deficiencias y perspectivas

  • Ausencia de una versión del corpus sin conexión.
  • Desambiguación automática.

Autores

Creadores del Corpus:

  • Saykhunov MR (Candidato a Doctor en Filología, investigador asociado del Instituto de Informática)
  • Ibragimov TI (candidato a doctor en Filología, profesor asociado del Departamento de Lingüística Aplicada de la Universidad Federal de Kazán)
  • Khusainov RR (ingeniero, "GDC")

Con la ayuda de:

  • El Centro Republicano para el Desarrollo de la Cultura Tradicional
  • Unidad de Investigación de Lenguas Volgaicas de la Universidad de Turku (Finlandia)
  • Empresa «RX5»
  • La redacción de la revista científica de divulgación "Фuddlen ы Тел"

Literatura

  • Татар теленең язма корпусы // «Мuddlen җомга» (2012 № 20) Archivado el 26 de abril de 2016 en la Wayback Machine.
  • Татар теленең язма корпусы // "Фuddler Тел" (2012 №1-2) Archivado el 26 de abril de 2016 en la Wayback Machine.
  • Татар теленең язма корпусы һ֙м тел мuddle меленең // "Мuddlen җомга" (2012 №32) Archivado el 26 de abril de 2016 en la Wayback Machine.
  • К построению структурно-функциональной модели ценностной ориентации татарского этноса (по материалам письменного корпуса татарского языка) // Языки России и стран ближнего зарубежья как иностранные: преподавание и изучение: материалы Международной научно-практической конференции (28-29 de noviembre de 2013) Archivado el 26 de abril de 2016 en Wayback Machine.
  • Письменный корпус татарского языка: идеи, проблемы, решения // Нематериальное культурное наследие тюркских народов как objeto сохранения: сборник материалов Международной научно-практической конференции (16-19 июля 2014 г.) Archivado el 26 de abril de 2016 en Wayback Machine .
  • Письменный корпус татарского языка с озвучением визуализированных предложений как инструмент лингвистических исследований // Filosofía y política de apoyo: Materiales de conferencia práctica práctica (Kazan, 19-21 de noviembre) 2014 г.) Archivado el 26 de abril de 2016 en el Máquina del tiempo
  • Письменный корпус татарского языка: структурные и функциональные характеристики // Актуальные проблемы диалектоLOGии языков народов России: Материалы XIV Всероссийской научной конференции (Уфа, 20-22 de noviembre de 2014 г.) Archivado el 25 de abril de 2016 en Wayback Machine.
  • Татар теле, татарлар ассимиляция кыренеше // "Фенни Татарстан" (2015 №1) Archivado el 25 de abril de 2016 en la Wayback Machine.
  • La situación lingüística de una comunidad étnica (a partir del material del Corpus de la lengua tártara escrita) // "Tatarica" ​​(2015 №4) Archivado el 26 de abril de 2016 en Wayback Machine
  • Языковое состояние этнической общности на материале Письменного корпуса татарского языка // "Tatarica" ​​(2015 №4) Archivado el 26 de abril de 2016 en Wayback Machine.
  • Fonología tatarskogo языка en el plano de las teorías de los fonemas I.А. Бодуэна де Куртенэ // И.А. Бодуэн де Куртенэ и мировая лингвистика: международная конференция: V Бодуэновские чтения (Казанский федеральный) universidad, 12-15 (octubre de 2015) Archivado el 26 de abril de 2016 en Wayback Machine

[ 1 ]

Referencias

  1. «Письменный Корпус Татарского Языка» .
  • Corpus de Tártaro Escrito (Corpus de la lengua tártara) - Sitio oficial