Articulo de referencia

Corpus de la lengua croata

El Corpus de la Lengua Croata ( CLC ; en croata : Hrvatski jezični korpus , HJK) es un corpus de lengua croata compilado en el Instituto de Lengua y Lingüística Croata (IHJJ). F...

El Corpus de la Lengua Croata ( CLC ; en croata : Hrvatski jezični korpus , HJK) es un corpus de lengua croata compilado en el Instituto de Lengua y Lingüística Croata (IHJJ).

Fondo

El CLC fue financiado inicialmente como un subproyecto del programa de investigación Riznica ( Repositorio de la Lengua Croata ) por el Ministerio de Ciencia, Educación y Deportes de la República de Croacia ( MZOŠ ) (proyecto n.º 0212010) a partir de mayo de 2005. En una segunda fase de desarrollo, desde 2007, la ampliación y el desarrollo del CLC se integraron en el programa de investigación Repositorio de la Lengua Croata (CLR), financiado por el MZOŠ (véase Ćavar y Brozović Rončević, 2012 [ 1 ] ). Al ser un programa de investigación (investigadora principal Dunja Brozović Rončević ) con numerosos proyectos de investigación independientes que utilizan el CLC, el corpus se desarrolla principalmente como un subproducto de dichos proyectos de investigación dentro del CLR. Actualmente, Dunja Brozović Rončević y Damir Ćavar están a cargo del desarrollo del corpus.

Objetivos

Uno de los principales objetivos del proyecto CLC es crear un corpus croata de acceso público anotado en múltiples niveles: lematizado , segmentado morfológicamente y anotado morfosintácticamente , transcrito fonémicamente y silabificado, y analizado sintácticamente. Si bien la versión actual del corpus proporciona recursos del estándar de la lengua croata , también se crean varios corpus de diferentes fases de desarrollo del croata , incluidas las digitalizaciones de manuscritos y diccionarios croatas .

Formato y disponibilidad

Desde el principio, los textos recopilados y digitalizados en el CLC fueron anotados utilizando el estándar XML P5 de la Iniciativa de Codificación de Textos ( TEI ) . Actualmente, hay aproximadamente 90 millones de tokens disponibles en formato XML P5 de TEI . Se puede acceder al corpus en línea a través de la interfaz Philologic [ 2 ] (véase el Proyecto ARTFL, [ 3 ] Departamento de Lenguas y Literaturas Románicas, Universidad de Chicago ). Está virtualizado en varios subcorpus, y se pueden proporcionar definiciones individuales o específicas de los subcorpus bajo demanda.

Contenido

El CLC se compone de textos seleccionados en croata , que abarcan diversos ámbitos funcionales y géneros. Incluye literatura y otras fuentes escritas del período inicial de la estandarización definitiva del croata , es decir, desde la segunda mitad del siglo XIX en adelante.

El CLC consta de:

  • Literatura croata fundamental (por ejemplo, novelas, cuentos, teatro, poesía)
  • no ficción
  • Publicaciones científicas de diversos ámbitos y libros de texto universitarios.
  • libros escolares
  • Literatura traducida por destacados traductores croatas.
  • Revistas y periódicos en línea
  • libros del período anterior a la estandarización del croata que se adaptan al croata estándar actual

Cooperación

La realización del CLC fue posible gracias a la cooperación con:

Referencias

  1. Ćavar y Brozović Rončević, 2012
  2. Filología
  3. "El proyecto ARTFL" . Archivado del original el 4 de diciembre de 2009. Consultado el 22 de mayo de 2011 .