Articulo de referencia

Corpus general de Internet del ruso

El Corpus General de Internet del Ruso ( GICR , por sus siglas en inglés) es un corpus de textos rusos de internet al que se puede acceder bajo petición a través de una interfaz...

El Corpus General de Internet del Ruso ( GICR , por sus siglas en inglés) es un corpus de textos rusos de internet al que se puede acceder bajo petición a través de una interfaz de consulta en línea desde 2013. El corpus incluye material textual enriquecido procedente de la blogosfera, las redes sociales, los principales medios de comunicación y las revistas literarias.

Objetivos del proyecto

El proyecto tiene carácter educativo y científico, y numerosos problemas de lingüística computacional son resueltos por investigadores independientes y grupos de investigación con los materiales obtenidos por el GICR. Mientras que otros proyectos de corpus del ruso se centran en la ficción y los textos editados, el Corpus General de Internet ofrece a los lingüistas una oportunidad única para aprender el idioma tal como es, con toda su jerga y particularidades regionales.

Corpus brinda la oportunidad de realizar investigaciones en

  • Investigación lingüística de amplio alcance: investigación dialectológica, estudio de la distribución de palabras, estudio del lenguaje de las redes sociales, estudio de la influencia del género, la edad y otros factores en el lenguaje, frecuencia de palabras, expresiones fijas y diferentes construcciones, características estilísticas de textos de diferentes segmentos de Internet, etc.
  • Análisis de redes sociales
  • Aprendizaje automático basado en corpus para evaluar el etiquetado automático [ 1 ]

En diversas ocasiones, estudiantes, graduados y empleados de la MSU, MIPT, la Universidad Estatal Humanitaria Rusa, la Universidad Estatal de Novosibirsk, la Escuela Superior de Economía, la Academia Rusa de Ciencias, SFU, CSU, SGMP e IAAS de la MSU realizaron trabajos de investigación e investigaciones independientes sobre el material del proyecto.

Responsables de proyectos científicos:

  • Belikov V. - RSUH, Moscú, Rusia
  • Selegey V. - RSUH, ABBYY, Moscú, Rusia
  • Sharoff S. - RSUH, Moscú, Rusia; Universidad de Leeds, Reino Unido [ 2 ]

Las organizaciones que participan en el apoyo a GICR:

Tamaño y contenido del corpus

El tamaño del corpus para el verano de 2016 es de 19.8 mil millones de tokens, de los cuales el 49% son de VKontakte , el 40% de LiveJournal , otro 4% de Mail.ru Blogs and News y el 2% de Russian Magazine Hall . [ 3 ] Las fuentes recopiladas en el segmento de noticias son: RIA Novosti , Regnum , Lenta.ru , Rosbalt . Los textos se proporcionan con metamarcado (por fecha de creación del texto, sexo, lugar y año de nacimiento del autor, género de Internet, etc.); todos los textos se proporcionan con etiquetado morfológico automático y lematización. [ 3 ] La mayoría de los textos recopilados son de los años de creación 2013-2014, aunque en algunos segmentos, como en Russian Magazine Hall, hay algunos textos recopilados desde 1994. [ 4 ]

GICR es uno de los pocos megaproyectos de corpus que existen actualmente, lo que significa que su tamaño disponible alcanza varios miles de millones de palabras.

Acceso

Actualmente, la interfaz de GICR se encuentra en fase beta, por lo que el acceso a la búsqueda en los corpus se proporciona de forma gratuita, pero está disponible para los investigadores que la soliciten. [ 5 ]

Véase también

Referencias

  1. Clasificación automática de textos web mediante dimensiones funcionales del texto
  2. "Colectivo | GICR" .
  3. ^ " Cuerpo | ГИКРЯ" .
  4. "Publicación en el blog: ГИКРЯ Генеральный интернет-корпус русского языка" [ GIKRYA Corpus general de Internet de la lengua rusa ] (en ruso). Archivado desde el original el 25 de diciembre de 2024.
  5. «Контакты | ГИКРЯ» .

Lecturas adicionales

  1. Belikov V., Kopylov N., Piperski A., Selegey V., Sharoff S., (2013), Grande y diverso es hermoso: Un gran corpus de ruso para estudiar la variación lingüística. En Web as Corpus Workshop (WAC-8).
  2. Lagutin MB, Katinskaya AY, Selegey VP, Sharoff S., Sorokin AA (2015) Clasificación automática de textos web mediante dimensiones funcionales del texto. En Diálogo, Conferencia Internacional Rusa sobre Lingüística Computacional, Bekasovo.
  3. Katinskaya A., Sharoff S. (2015) Aplicación del análisis multidimensional a un corpus web ruso: búsqueda de evidencia de géneros, en Actas del Taller sobre Procesamiento del Lenguaje Natural Balto-Eslavo asociado con la Conferencia Internacional RANLP, Hissar, Bulgaria.

• Sitio web oficial de GICR