
El corpus árabe coránico ( árabe : المدونة القرآنية العربية , romanizado : al-mudawwana al-Qurʾāni al-ʿArabiyya ) es un recurso lingüístico comentado que consta de 77.430 palabras de árabe coránico. El proyecto tiene como objetivo proporcionar anotaciones morfológicas y sintácticas para investigadores que quieran estudiar el lenguaje del Corán. [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ]
Funciones
El análisis gramatical ayuda a los lectores a comprender mejor el significado detallado de cada versículo y oración. Cada palabra del Corán está etiquetada con su categoría gramatical y múltiples características morfológicas. A diferencia de otros corpus árabes anotados, el marco gramatical adoptado por el Corpus Coránico es la gramática árabe tradicional de i'rab ( إﻋﺮﺍﺏ ). El proyecto de investigación está dirigido por Kais Dukes en la Universidad de Leeds [ 4 ] y forma parte del grupo de investigación en informática del idioma árabe dentro de la Facultad de Informática, supervisado por Eric Atwell [ 6 ] .
El corpus anotado incluye: [ 1 ] [ 7 ]
- Un corpus de árabe coránico con etiquetas de partes de la oración verificadas manualmente .
- Un banco de árboles anotado del árabe coránico.
- Una novedosa visualización de la gramática árabe tradicional mediante gráficos de dependencia.
- Búsqueda morfológica del Corán.
- Un léxico morfológico de palabras coránicas en inglés, legible por máquina.
- Una concordancia de partes de la oración para el árabe coránico organizada por lema.
- Un foro de mensajes en línea para que los voluntarios de la comunidad realicen anotaciones.
La anotación del corpus asigna una etiqueta de categoría gramatical y características morfológicas a cada palabra. Por ejemplo, la anotación implica determinar si una palabra es un sustantivo o un verbo, y si se flexiona para masculino o femenino. La primera etapa del proyecto consistió en el etiquetado automático de categorías gramaticales mediante la aplicación de tecnología informática del idioma árabe al texto. Posteriormente, dos anotadores revisaron por etapas la anotación de cada una de las 77 430 palabras del Corán, y se siguen realizando mejoras para aumentar aún más la precisión.
La investigación lingüística del Corán que utiliza el corpus anotado incluye el entrenamiento de etiquetadores de partes del discurso basados en modelos ocultos de Markov para el árabe, [ 8 ] la categorización automática de capítulos coránicos, [ 9 ] y el análisis prosódico del texto. [ 10 ]
Además, el proyecto proporciona una traducción coránica palabra por palabra basada en fuentes inglesas aceptadas, en lugar de producir una nueva traducción del Corán. [ 4 ]
Véase también
Referencias
- 1 2 K. Dukes, E. Atwell y N. Habash (2011). Colaboración supervisada para la anotación sintáctica del árabe coránico. Archivado el 10 de mayo de 2012 en la Wayback Machine Language Resources and Evaluation Journal (LREJ). Número especial sobre recursos lingüísticos construidos de forma colaborativa.
- ↑ Colaboración supervisada para la anotación sintáctica del árabe coránico en ResearchGate . Subido por Nizar Habash, Universidad de Columbia .
- ↑ K. Dukes y T. Buckwalter (2010). Un banco de árboles de dependencias del Corán utilizando la gramática árabe tradicional. Archivado el 10 de mayo de 2012 en Wayback Machine . En las Actas de la 7.ª Conferencia Internacional sobre Informática y Sistemas (INFOS). El Cairo, Egipto.
- 1 2 3 El Corpus Árabe Coránico Archivado el 23-02-2013 en Wayback Machine en The Muslim Tribune. 20 de junio de 2011.
- ↑ Eric Atwell, Claire Brierley, Kais Dukes, Majdi Sawalha y Abdul-Baquee Sharaf. Un enfoque de inteligencia artificial para el contenido árabe e islámico en internet , pág. 2. Riad : Universidad Rey Saud , 2011.
- ↑ Ingeniería. "Perfil del Dr. Eric Atwell - Escuela de Informática - Universidad de Leeds" . www.comp.leeds.ac.uk .
- ↑ K. Dukes y Habash, N. (2011). Análisis estadístico en un solo paso de representaciones sintácticas híbridas de dependencia-constitución. Archivado el 10 de mayo de 2012 en la Conferencia Internacional sobre Tecnologías de Análisis Sintáctico (IWPT) de Wayback Machine . Dublín, Irlanda.
- ↑ M. Albared, N. Omar y M. Ab Aziz (2011). Desarrollo de un etiquetador POS árabe HMM competitivo utilizando pequeños corpus de entrenamiento. Sistemas inteligentes de información y bases de datos. Springer Berlin, Heidelberg.
- ↑ AM Sharaf y E. Atwell (2011). Categorización automática de los capítulos coránicos. 7.ª Conferencia Internacional de Computación en Árabe (ICCA11). Riad, Arabia Saudita.
- ↑ C. Brierley, M. Sawalha y E. Atwell (2012). Corpus del Corán con anotaciones de límites para la predicción de pausas de frases en árabe. Archivado el 15 de diciembre de 2018 en Wayback Machine . Simposio anual de IVACS. Cambridge.
Enlaces externos
- Corpus árabe coránico
- Cuerpos
- idioma árabe
- Obras sobre el Corán
- Lingüística aplicada
- Investigación lingüística
- Motor de búsqueda de las Escrituras en línea