El Corpus de la Lengua Croata ( CLC ; en croata : Hrvatski jezični korpus , HJK) es un corpus de lengua croata compilado en el Instituto de Lengua y Lingüística Croata (IHJJ).
Fondo
El CLC fue financiado inicialmente como un subproyecto del programa de investigación Riznica ( Repositorio de la Lengua Croata ) por el Ministerio de Ciencia, Educación y Deportes de la República de Croacia ( MZOŠ ) (proyecto n.º 0212010) a partir de mayo de 2005. En una segunda fase de desarrollo, desde 2007, la ampliación y el desarrollo del CLC se integraron en el programa de investigación Repositorio de la Lengua Croata (CLR), financiado por el MZOŠ (véase Ćavar y Brozović Rončević, 2012 [ 1 ] ). Al ser un programa de investigación (investigadora principal Dunja Brozović Rončević ) con numerosos proyectos de investigación independientes que utilizan el CLC, el corpus se desarrolla principalmente como un subproducto de dichos proyectos de investigación dentro del CLR. Actualmente, Dunja Brozović Rončević y Damir Ćavar están a cargo del desarrollo del corpus.
Objetivos
Uno de los principales objetivos del proyecto CLC es crear un corpus croata de acceso público anotado en múltiples niveles: lematizado , segmentado morfológicamente y anotado morfosintácticamente , transcrito fonémicamente y silabificado, y analizado sintácticamente. Si bien la versión actual del corpus proporciona recursos del estándar de la lengua croata , también se crean varios corpus de diferentes fases de desarrollo del croata , incluidas las digitalizaciones de manuscritos y diccionarios croatas .
Formato y disponibilidad
Desde el principio, los textos recopilados y digitalizados en el CLC fueron anotados utilizando el estándar XML P5 de la Iniciativa de Codificación de Textos ( TEI ) . Actualmente, hay aproximadamente 90 millones de tokens disponibles en formato XML P5 de TEI . Se puede acceder al corpus en línea a través de la interfaz Philologic [ 2 ] (véase el Proyecto ARTFL, [ 3 ] Departamento de Lenguas y Literaturas Románicas, Universidad de Chicago ). Está virtualizado en varios subcorpus, y se pueden proporcionar definiciones individuales o específicas de los subcorpus bajo demanda.
Contenido
El CLC se compone de textos seleccionados en croata , que abarcan diversos ámbitos funcionales y géneros. Incluye literatura y otras fuentes escritas del período inicial de la estandarización definitiva del croata , es decir, desde la segunda mitad del siglo XIX en adelante.
El CLC consta de:
- Literatura croata fundamental (por ejemplo, novelas, cuentos, teatro, poesía)
- no ficción
- Publicaciones científicas de diversos ámbitos y libros de texto universitarios.
- libros escolares
- Literatura traducida por destacados traductores croatas.
- Revistas y periódicos en línea
- libros del período anterior a la estandarización del croata que se adaptan al croata estándar actual
Cooperación
La realización del CLC fue posible gracias a la cooperación con:
- Školska knjiga dd
- Academia Croata de Ciencias y Artes (HAZU)
- Stoljeća hrvatske književnosti, Matica hrvatska
Referencias
Enlaces externos
- Sitio web del Corpus de la Lengua Croata (CLC) e interfaz filológica
- (en croata) Corpus Nacional Croata , otro corpus croata del Instituto de Lingüística de la Facultad de Humanidades y Ciencias Sociales de la Universidad de Zagreb.
- Cuerpos
- idioma croata
- bases de datos en línea
- Lingüística aplicada
- Investigación lingüística