Articulo de referencia

Corpus Nacional Ruso

El Corpus Nacional Ruso ( en ruso : Национальный корпус русского языка , lit. ' Corpus Nacional de la Lengua Rusa ' ) es un corpus de la lengua rusa que ha sido parcialmente acc...

El Corpus Nacional Ruso ( en ruso : Национальный корпус русского языка , lit. ' Corpus Nacional de la Lengua Rusa ' ) es un corpus de la lengua rusa que ha sido parcialmente accesible a través de una interfaz de consulta en línea desde el 29 de abril de 2004. Está siendo creado por el Instituto de la Lengua Rusa de la Academia Rusa de Ciencias .

Actualmente contiene más de mil millones de formas de palabras [ 1 ] que se lematizan automáticamente y se etiquetan con POS /gramamemas , es decir, se le atribuyen todos los análisis morfológicos posibles para cada forma ortográfica. Se pueden buscar lemas, POS, elementos gramaticales y sus combinaciones. Además, el subcorpus contiene 6 millones de formas de palabras con homonimia resuelta manualmente .

El subcorpus con homonimia morfológica resuelta también se acentúa automáticamente . Todo el corpus tiene un etiquetado de búsqueda en lo que respecta a la semántica léxica (SL), [ 2 ] incluyendo subclases de POS morfosemánticas (nombre propio, pronombre reflexivo, etc.), características de SL propias (clase temática, causalidad, evaluación), derivación (diminutivo, adverbio formado a partir de adjetivo, etc.).

El RNC también incluye los siguientes subcorpus:

  • un banco de árboles de dependencias sintácticas (basado en gran medida en la Teoría del Texto-Significado de Igor Mel'čuk )
  • corpus paralelos inglés⇔ruso, alemán⇒ruso, ucraniano⇔ruso y bielorruso⇔ruso ;
  • un amplio corpus independiente (más de 100 millones de palabras) de periódicos modernos (2001-2011);
  • un corpus de poesía rusa , donde las palabras que riman y la prosodia poética (incluyendo la métrica, las estrofas, etc.) están etiquetadas adicionalmente;
  • un corpus de dialectos rusos con etiquetado gramatical dialectal específico;
  • un corpus multimedia con fragmentos etiquetados y con capacidad de búsqueda de películas en idioma ruso;
  • un corpus que muestra la historia del estrés ruso
  • un subcorpus educativo que refleja los estándares escolares.

Todos los textos contienen etiquetas con información metatextual: autor, fecha de nacimiento, fecha de creación, tamaño del texto y género (ficción general, novela policíaca, artículo periodístico, etc.). Todas estas categorías se pueden explorar y buscar por separado. Es posible definir un subcorpus para que el usuario busque combinaciones de lemas, gramáticas POS y etiquetas semánticas únicamente dentro de este subconjunto.

Véase también

Referencias

  1. «Национальный корпус русского языка» . Национальный корпус русского языка (en ruso). Archivado desde el original el 5 de marzo de 2022 . Consultado el 28 de agosto de 2022 .
  2. Apresjan, Ju.; Boguslavsky, I.; Iomdin, B.; Iomdin, L.; Sannikov, A.; Sizov, V. (2006). Un corpus de ruso etiquetado sintáctica y semánticamente: estado del arte y perspectivas . Actas de LREC. Génova, Italia. pp. 1378–1381 . CiteSeerX 10.1.1.111.8165 .  
  • Corpus nacional ruso