Las categorías lingüísticas incluyen
- Categoría léxica , una parte de la oración como sustantivo , preposición , etc.
- Categoría sintáctica , un concepto similar que también puede incluir categorías sintagmáticas.
- Categoría gramatical , una característica gramatical como el tiempo verbal , el género , etc.
La definición de categorías lingüísticas es una preocupación fundamental de la teoría lingüística , por lo que la definición y denominación de las categorías varían según los diferentes marcos teóricos y tradiciones gramaticales de cada idioma. La operacionalización de las categorías lingüísticas en lexicografía , lingüística computacional , procesamiento del lenguaje natural , lingüística de corpus y gestión terminológica suele requerir definiciones específicas de recursos, problemas o aplicaciones. En lingüística cognitiva, se ha argumentado que las categorías lingüísticas poseen una estructura prototípica similar a la de las categorías de palabras comunes en un idioma. [ 1 ]
Inventarios de categorías lingüísticas
Para facilitar la interoperabilidad entre recursos léxicos , anotaciones lingüísticas y herramientas de anotación, y para el manejo sistemático de categorías lingüísticas en diferentes marcos teóricos, se han desarrollado y se utilizan varios inventarios de categorías lingüísticas, con ejemplos como los que se muestran a continuación. El objetivo práctico de estos inventarios es realizar una evaluación cuantitativa (para inventarios específicos de cada idioma), entrenar herramientas de PLN o facilitar la evaluación, consulta o anotación interlingüística de datos lingüísticos. A nivel teórico, se ha postulado la existencia de categorías universales en el lenguaje humano, por ejemplo, en la gramática universal , pero también ha sido objeto de fuertes críticas .
Conjuntos de etiquetas de partes de la oración
Las escuelas suelen enseñar que en inglés existen 9 categorías gramaticales : sustantivo , verbo , artículo , adjetivo , preposición , pronombre , adverbio , conjunción e interjección . Sin embargo, existen muchas más categorías y subcategorías. En el caso de los sustantivos, se distinguen las formas plural, posesiva y singular. En muchos idiomas, las palabras también se marcan según su caso (sujeto, objeto, etc.), género gramatical , etc.; mientras que los verbos se marcan según su tiempo , aspecto y otras características. En algunos sistemas de etiquetado, las diferentes inflexiones de la misma raíz reciben distintas categorías gramaticales, lo que resulta en un gran número de etiquetas. Por ejemplo, NN para sustantivos comunes singulares, NNS para sustantivos comunes plurales y NP para nombres propios singulares (véanse las etiquetas POS utilizadas en el Corpus Brown). Otros sistemas de etiquetado utilizan un número menor de etiquetas e ignoran las diferencias sutiles o las modelan como características algo independientes de la categoría gramatical. [ 2 ]
En el etiquetado de partes de la oración por computadora, es típico distinguir entre 50 y 150 partes de la oración distintas para el inglés. Se ha trabajado en el etiquetado de partes de la oración en una variedad de idiomas, y el conjunto de etiquetas POS utilizado varía mucho según el idioma. Las etiquetas generalmente se diseñan para incluir distinciones morfológicas explícitas, aunque esto lleva a inconsistencias como la marcación de caso para pronombres pero no para sustantivos en inglés, y diferencias interlingüísticas mucho mayores. Los conjuntos de etiquetas para lenguas con mucha flexión como el griego y el latín pueden ser muy grandes; etiquetar palabras en lenguas aglutinantes como las lenguas inuit puede ser prácticamente imposible. El trabajo sobre métodos estocásticos para etiquetar el griego koiné (DeRose 1990) ha utilizado más de 1000 partes de la oración y encontró que casi tantas palabras eran ambiguas en ese idioma como en inglés. Un descriptor morfosintáctico en el caso de lenguas morfológicamente ricas se expresa comúnmente utilizando mnemotecnias muy cortas, como ncmsan para categoría = sustantivo, tipo = común, género = masculino, número = singular, caso = acusativo, animado = no .
El conjunto de etiquetas más popular para el etiquetado POS en inglés americano es probablemente el conjunto de etiquetas Penn, desarrollado en el proyecto Penn Treebank.
Esquemas de anotación multilingües
Para las lenguas de Europa Occidental, se han desarrollado esquemas de anotación aplicables a diversas lenguas para las partes de la oración, la morfosintaxis y la sintaxis con las Directrices EAGLES . El "Grupo Asesor de Expertos en Normas de Ingeniería Lingüística" (EAGLES) fue una iniciativa de la Comisión Europea que se desarrolló dentro del programa DG XIII de Investigación e Ingeniería Lingüística de 1994 a 1998, coordinado por el Consorzio Pisa Ricerche, Pisa, Italia. Las directrices EAGLES proporcionan orientación sobre el marcado que se utilizará con corpus de texto , en particular para identificar características relevantes en lingüística computacional y lexicografía . Numerosas empresas, centros de investigación, universidades y organismos profesionales de toda la Unión Europea colaboraron para producir las Directrices EAGLES, que establecen recomendaciones para normas de facto y reglas de buenas prácticas para: [ 3 ]
- Recursos lingüísticos a gran escala (como corpus de texto, léxicos computacionales y corpus de voz );
- Medios para manipular dicho conocimiento, mediante formalismos lingüísticos computacionales , lenguajes de marcado y diversas herramientas de software;
- Medios para evaluar y valorar recursos, herramientas y productos.
Las directrices de Eagles también han inspirado trabajos posteriores en otras regiones, por ejemplo, Europa del Este. [ 4 ]
Una generación más tarde, la comunidad investigadora inició un esfuerzo similar bajo el paraguas de Universal Dependencies . Petrov et al. [ 5 ] [ 6 ] propusieron un conjunto de etiquetas "universal", pero altamente reduccionista, con 12 categorías (por ejemplo, sin subtipos de sustantivos, verbos, puntuación, etc.; sin distinción de "to" como marcador de infinitivo frente a preposición (difícilmente una coincidencia "universal"), etc.). Posteriormente, esto se complementó con especificaciones interlingüísticas para la sintaxis de dependencia (Stanford Dependencies), [ 7 ] y la morfosintaxis (Interset interlingua, [ 8 ] que se basa parcialmente en la tradición Multext-East/Eagles) en el contexto de Universal Dependencies (UD), un proyecto cooperativo internacional para crear bancos de árboles de las lenguas del mundo con anotaciones interlingüísticamente aplicables ("universales") para partes de la oración, sintaxis de dependencia y (opcionalmente) características morfosintácticas (morfológicas). Las aplicaciones principales son el procesamiento automatizado de texto en el campo del procesamiento del lenguaje natural (PLN) y la investigación sobre la sintaxis y la gramática del lenguaje natural, especialmente dentro de la tipología lingüística . El esquema de anotación tiene sus raíces en tres proyectos relacionados: El esquema de anotación UD utiliza una representación en forma de árboles de dependencia en lugar de árboles de estructura de frases . A febrero de 2019, hay poco más de 100 bancos de árboles de más de 70 idiomas disponibles en el inventario UD. [ 9 ] El objetivo principal del proyecto es lograr la coherencia interlingüística de la anotación. Sin embargo, se permiten extensiones específicas del idioma para características morfológicas (los idiomas o recursos individuales pueden introducir características adicionales). De forma más restringida, las relaciones de dependencia se pueden extender con una etiqueta secundaria que acompaña a la etiqueta UD, por ejemplo, aux:pass para un auxiliar (UD aux ) utilizado para marcar la voz pasiva. [ 10 ]
Las Dependencias Universales han inspirado esfuerzos similares para las áreas de morfología flexiva, [ 11 ] semántica de marcos [ 12 ] y correferencia . [ 13 ] Para la sintaxis de la estructura de frases , no parece existir un esfuerzo comparable, pero las especificaciones del Penn Treebank se han aplicado a (y extendido para) una amplia gama de idiomas, [ 14 ] por ejemplo, islandés, [ 15 ] inglés antiguo, [ 16 ] inglés medio, [ 17 ] bajo alemán medio, [ 18 ] alto alemán moderno temprano, [ 19 ] yiddish, [ 20 ] portugués, [ 21 ] japonés, [ 22 ] árabe [ 23 ] y chino. [ 24 ]
Convenciones para glosas interlineales
En lingüística , una glosa interlineal es una glosa (serie de explicaciones breves, como definiciones o pronunciaciones) colocada entre líneas ( inter- + lineal ), por ejemplo, entre una línea del texto original y su traducción a otro idioma . Al glosarse, cada línea del texto original adquiere una o más líneas de transcripción conocidas como texto interlineal o texto glosado interlineal ( TGI ), o simplemente interlineal . Estas glosas ayudan al lector a seguir la relación entre el texto fuente y su traducción, así como la estructura del idioma original. No existe un inventario estándar para las glosas, pero las etiquetas comunes se recogen en las Reglas de glosado de Leipzig. [ 25 ] Wikipedia también proporciona una lista de abreviaturas de glosado que se basa en esta y otras fuentes.
Ontología General para la Descripción Lingüística (GOLD)
GOLD ("Ontología General para la Descripción Lingüística") es una ontología para la lingüística descriptiva . Proporciona una descripción formalizada de las categorías y relaciones más básicas utilizadas en la descripción científica del lenguaje humano, por ejemplo, como una formalización de glosas interlineales. GOLD fue introducida por primera vez por Farrar y Langendoen (2003). [ 26 ] Originalmente, se concibió como una solución al problema de resolver esquemas de marcado dispares para datos lingüísticos, en particular datos de lenguas en peligro de extinción . Sin embargo, GOLD es mucho más general y puede aplicarse a todas las lenguas. En esta función, GOLD se solapa con el Registro de Categorías de Datos ISO 12620 (ISOcat); sin embargo, está estructurado de forma más rigurosa.
GOLD fue mantenido por la Lista LINGUIST y otros desde 2007 hasta 2010. [ 27 ] El proyecto RELISH creó un espejo de la edición 2010 de GOLD como una Selección de Categoría de Datos dentro de ISOcat. A partir de 2018, los datos de GOLD siguen siendo un centro terminológico importante en el contexto de la nube de Datos Abiertos Enlazados Lingüísticos , pero como ya no se mantiene activamente, su función está siendo reemplazada cada vez más por OLiA (para anotación lingüística, basada en GOLD e ISOcat) y lexinfo.net (para metadatos de diccionario, basada en ISOcat).
ISO 12620 (Registro de categorías de datos ISO TC37, ISOcat)
ISO 12620 es una norma de ISO/TC 37 que define un Registro de Categorías de Datos , un registro para registrar términos lingüísticos utilizados en diversos campos de la traducción , la lingüística computacional y el procesamiento del lenguaje natural , y que define correspondencias tanto entre diferentes términos como entre diferentes sistemas en los que se utilizan los mismos términos. [ 28 ] [ 29 ] [ 30 ]
Una implementación anterior de este estándar, ISOcat, proporciona identificadores persistentes y URI para categorías lingüísticas, incluido el inventario de la ontología GOLD (véase más abajo). El objetivo del registro es que los nuevos sistemas puedan reutilizar la terminología existente, o al menos ser fácilmente mapeados a la terminología existente, para ayudar a la interoperabilidad . [ 31 ] El estándar es utilizado por otros estándares como Lexical Markup Framework (ISO 24613:2008), y se han agregado varias terminologías al registro, incluidas las directrices Eagles, el Corpus Nacional de Polaco y el formato TermBase eXchange de la Localization Industry Standards Association .
Sin embargo, la edición de 2019, ISO 12620:2019, [ 32 ] ya no proporciona un registro de términos para tecnología del lenguaje y ahora se restringe a recursos terminológicos, de ahí el título revisado "Gestión de recursos terminológicos: especificaciones de categorías de datos". En consecuencia, ISOcat ya no se desarrolla activamente. [ 33 ] A partir de mayo de 2020, estaban surgiendo los sistemas sucesores CLARIN Concept Registry [ 34 ] y DatCatInfo [ 35 ] .
Para las categorías lingüísticas relevantes para los recursos léxicos , el vocabulario lexinfo representa un estándar comunitario establecido, [ 36 ] en particular en conexión con el vocabulario OntoLex y los diccionarios legibles por máquina en el contexto de las tecnologías de datos abiertos enlazados lingüísticos . Al igual que el vocabulario OntoLex se basa en el Marco de Marcado Léxico (LMF), lexinfo se basa en (la sección LMF de) ISOcat. [ 37 ] Sin embargo, a diferencia de ISOcat, lexinfo se mantiene activamente y actualmente (mayo de 2020) se está ampliando mediante un esfuerzo comunitario. [ 38 ]
Ontologías de Anotación Lingüística (OLiA)
De forma similar a GOLD, las Ontologías de Anotación Lingüística (OLiA) proporcionan un inventario de referencia de categorías lingüísticas para fenómenos sintácticos, morfológicos y semánticos relevantes para la anotación lingüística y los corpus lingüísticos en forma de ontología . Además, también proporcionan esquemas de anotación legibles por máquina para más de 100 idiomas, vinculados con el modelo de referencia OLiA. [ 39 ] Las ontologías OLiA representan un importante centro de terminología de anotación en la nube de datos abiertos enlazados (lingüísticos) , con aplicaciones para búsqueda, recuperación y aprendizaje automático sobre recursos lingüísticos anotados heterogéneamente. [ 37 ]
Además de los esquemas de anotación, el modelo de referencia OLiA también está vinculado con las directrices de Eagle, [ 40 ] GOLD, [ 40 ] ISOcat, [ 41 ] CLARIN Concept Registry, [ 42 ] Universal Dependencies, [ 43 ] lexinfo, [ 43 ] etc., lo que permite la interoperabilidad entre estos vocabularios. OLiA se está desarrollando como un proyecto comunitario en GitHub [ 44 ].
Referencias
- ↑ John R Taylor (1995) Categorización lingüística: Prototipos en la teoría lingüística , 2.ª ed., cap. 2, pág. 21
- ↑ Etiquetas POS universales
- ↑ Lo esencial de las ÁGUILAS
- ↑ Dimitrova, L., Ide, N., Petkevic, V., Erjavec, T., Kaalep, HJ, & Tufis, D. (1998, agosto). Multext-east: Corpus y léxicos paralelos y comparables para seis lenguas de Europa central y oriental . En Actas de la 17.ª conferencia internacional sobre lingüística computacional - Volumen 1 (pp. 315-319). Asociación de Lingüística Computacional.
- ↑ Petrov, eslavo; Das, Dipanjan; McDonald, Ryan (11 de abril de 2011). "Un conjunto de etiquetas universales de parte del discurso". arXiv : 1104.2086 [ cs.CL ].
- ↑ Petrov, Slav (11 de abril de 2011). "Un conjunto de etiquetas universales para partes de la oración". arXiv : 1104.2086 [ cs.CL ].
- ↑ "Dependencias de Stanford" . nlp.stanford.edu . El Grupo de Procesamiento del Lenguaje Natural de Stanford . Consultado el 8 de mayo de 2020 .
- ↑ "Interset" . cuni.cz. Instituto de Lingüística Formal y Aplicada (República Checa) . Consultado el 8 de mayo de 2020 .
- ↑ "Dependencias Universales" . universaldependencies.org . Consultado el 14 de mayo de 2020 .
- ↑ "aux:pass" . universaldependencies.org . Consultado el 14 de mayo de 2020 .
- ↑ UniMorph. "UniMorph: Anotación Morfológica Universal" . UniMorph . Consultado el 14 de mayo de 2020 .
- ↑ System-T/UniversalPropositions , System-T, 14 de mayo de 2020 , consultado el 14 de mayo de 2020
- ↑ Prange, J., Schneider, N., & Abend, O. (2019, agosto). Anotación multicapa con restricciones semánticas: el caso de la correferencia . En Actas del Primer Taller Internacional sobre Diseño de Representaciones de Significado (págs. 164-176).
- ↑ "Penn Parsed Corpora of Historical English: Other Corpora" . www.ling.upenn.edu . Consultado el 14 de mayo de 2020 .
- ↑ "Corpus histórico islandés analizado (IcePaHC)" . www.linguist.is . Archivado del original el 6 de junio de 2022. Consultado el 14 de mayo de 2020 .
- ↑ Warner, Anthony Departamento de Lengua y Ciencias Lingüísticas Universidad de York York; Taylor, Ann; Warner, Anthony; Pintzuk, Susan; Beths, Frank (septiembre de 2003). "El corpus analizado de prosa en inglés antiguo York-Toronto-Helsinki (YCOE)" .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ "Penn-Helsinki Parsed Corpus of Middle English 2" . www.ling.upenn.edu . Consultado el 14 de mayo de 2020 .
- ↑ "Corpus de bajo alemán histórico" . www.chlg.ac.uk. Consultado el 14 de mayo de 2020 .
- ↑ Light, C., & Wallenberg, J. (2011). Sobre el uso de la pasiva en las lenguas germánicas. Presentado en la 13.ª Reunión de la Conferencia de Sintaxis Generativa Diacrónica (DIGS), DIGS 13, Universidad de Pensilvania. 5 de junio de 2011.
- ↑ Beatrice Santorini (1993) [./ Ftp://babel.ling.upenn.edu/papers/faculty/beatrice%20santorini/santorini-1993.pdf La tasa de cambio de la estructura sintáctica en la historia del yiddish]. Variación y cambio lingüístico 5, 257-283.
- ↑ "Proyecto Tycho Brahe" . www.tycho.iel.unicamp.br . Consultado el 14 de mayo de 2020 .
- ↑ "NPCMJ – Corpus analizado de japonés moderno de Ninjal" . Consultado el 14 de mayo de 2020 .
- ↑ "Arabic Treebank: Part 3 (full corpus) v 2.0 (MPG + Syntactic Analysis) - Linguistic Data Consortium" . catalog.ldc.upenn.edu . Consultado el 14 de mayo de 2020 .
- ↑ "Proyecto Penn Chinese Treebank" . verbs.colorado.edu . Consultado el 14 de mayo de 2020 .
- ↑ Comrie, B., Haspelmath, M., & Bickel, B. (2008). Las reglas de glosado de Leipzig: convenciones para glosas interlineales morfema por morfema . Departamento de Lingüística del Instituto Max Planck de Antropología Evolutiva y Departamento de Lingüística de la Universidad de Leipzig. Recuperado el 28 de enero de 2010 .
- ↑ Scott Farrar y D. Terence Langendoen (2003) "Una ontología lingüística para la Web Semántica." GLOT International. 7 (3), pp.97-100,.
- ↑ Versiones DORADA
- ↑ "ISO 12620:1999 – Aplicaciones informáticas en terminología – Categorías de datos" . iso.org . 2011. Consultado el 9 de noviembre de 2011 .
- ↑ "ISO 12620:2009 – Terminología y otros recursos lingüísticos y de contenido – Especificación de categorías de datos y gestión de un registro de categorías de datos para recursos lingüísticos" . iso.org . 2011. Consultado el 9 de noviembre de 2011 .
- ↑ "ISO 12620:2019 Gestión de recursos terminológicos – Especificaciones de categorías de datos" . ISO . Consultado el 20 de enero de 2020 .
- ↑ Bononno, Robert (2011). "Terminología para traductores: una implementación de la norma ISO 12620". Meta . 45 (4): 646– 669. CiteSeerX 10.1.1.136.4771 . doi : 10.7202/002101ar .
- ↑ "ISO 12620:2019 Gestión de recursos terminológicos – Especificaciones de categorías de datos" . ISO . Consultado el 20 de enero de 2020 .
- ↑ "El Repositorio de Categorías de Datos (DCR) ha cambiado de dirección" . www.iso.org . Consultado el 8 de mayo de 2020 .
- ↑ "Registro de conceptos CLARIN | CLARIN ERIC" . www.clarin.eu . Consultado el 8 de mayo de 2020 .
- ↑ "DatCatInfo" . www.datcatinfo.net . Consultado el 8 de mayo de 2020 .
- ↑ "LexInfo" . www.lexinfo.net . Consultado el 14 de mayo de 2020 .
- 1 2 Cimiano, P., Chiarcos, C., McCrae, JP, & Gracia, J. (2020). Linguistic Linked Data (pp. 137–160). Springer, Cham.
- ↑ ontolex/lexinfo , Grupo de la Comunidad OntoLex, 7 de marzo de 2020 , consultado el 14 de mayo de 2020
- ↑ "Ontologías OLiA" . purl.org/olia . Consultado el 14 de mayo de 2020 .
- 1 2 Chiarcos, C. (2008). Una ontología de anotaciones lingüísticas . En LDV Forum (Vol. 23, No. 1, pp. 1-16).
- ↑ Chiarcos, C. (2010, mayo). Fundamentación de una ontología de anotaciones lingüísticas en el Registro de Categorías de Datos . En Taller LREC 2010 sobre Estándares de Recursos Lingüísticos y Tecnología del Lenguaje (LT<S), Valetta, Malta (págs. 37-40).
- ↑ Rehm, G., Galanis, D., Labropoulou, P., Piperidis, S., Welß, M., Usbeck, R., et al (2020). Hacia un ecosistema interoperable de plataformas de IA y LT: una hoja de ruta para la implementación de diferentes niveles de interoperabilidad. Preimpresión de arXiv arXiv : 2004.08355 .
- 1 2 Christian Chiarcos, Maxim Ionov y Christian Fäth (2020), Interoperabilidad de anotaciones en la era posterior a ISOcat, LREC 2020
- ^ acoli-repo/olia , ACoLi, 10 de marzo de 2020 , consultado el 14 de mayo de 2020
Enlaces externos
- Página oficial de las directrices de los Eagles
- Reglas de glosado de Leipzig
- Ontología GOLD
- ISOcat
- Repositorio de categorías de datos (DCR) de DatCatInfo
- Lingüística
- Ciencias de la información
- Web semántica
- Ontología (ciencia de la información)
- normas ISO
- Traducción
- Lingüística computacional