Articulo de referencia

Corpus de texto de AsoSoft

El corpus de textos de AsoSoft es el primer corpus de textos kurdos a gran escala , recopilado y procesado por el grupo de investigación y desarrollo de AsoSoft. Contiene 458.00...

El corpus de textos de AsoSoft es el primer corpus de textos kurdos a gran escala , recopilado y procesado por el grupo de investigación y desarrollo de AsoSoft. Contiene 458.000 documentos (188 millones de tokens) que se recopilan de fuentes como sitios web, agencias de noticias, libros y revistas. El corpus está parcialmente etiquetado por tema, por lo que se puede utilizar para tareas de identificación de temas. Además, es aplicable para extraer modelos de lenguaje e información de léxico computacional. Parte del corpus (75 millones de tokens) está disponible en línea para uso no comercial. El corpus utiliza el formato TEI. [1]

Referencias

  1. ^ Veisi, Hadi; MohammadAmini, Mohammad; Hosseini, Hawre (8 de febrero de 2019). "Hacia el procesamiento del idioma kurdo: experimentos en la recopilación y procesamiento del corpus de texto de AsoSoft". Beca digital en humanidades . doi :10.1093/llc/fqy074.
  • Sitio web oficial
  • Corpus de texto de AsoSoft en GitHub


Retrieved from "https://en.wikipedia.org/w/index.php?title=AsoSoft_text_corpus&oldid=1186660728"