Articulo de referencia

Identificación de idiomas

En el procesamiento del lenguaje natural , la identificación o deducción del idioma consiste en determinar en qué idioma natural se encuentra un contenido dado. Los enfoques com...

En el procesamiento del lenguaje natural , la identificación o deducción del idioma consiste en determinar en qué idioma natural se encuentra un contenido dado. Los enfoques computacionales para este problema lo consideran un caso especial de categorización de texto , que se resuelve con diversos métodos estadísticos .

Descripción general

Enfoque lógico

Un enfoque intuitivo común, no estadístico (aunque muy incierto), consiste en buscar combinaciones de letras comunes o diacríticos o signos de puntuación distintivos. [ 1 ] [ 2 ]

Enfoque estadístico

Existen varios enfoques estadísticos para la identificación de idiomas.

Un método estadístico anterior de Grefenstette [ 3 ] se basaba en la frecuencia de n-gramas cortos, que suelen ser morfemas funcionales . Por ejemplo, "ing" es más común en inglés que en francés, mientras que la secuencia "que" es más común en francés. Al encontrar una página web nueva, se cuenta el número de ocurrencias de cada una de estas secuencias cortas y se elige el idioma cuya tabla de frecuencias coincide mejor.

Una técnica consiste en comparar la compresibilidad del texto con la de textos en un conjunto de lenguas conocidas. Este enfoque se conoce como medida de distancia basada en información mutua. La misma técnica también puede utilizarse para construir empíricamente árboles genealógicos de lenguas que se correspondan estrechamente con los árboles construidos mediante métodos históricos. [ 4 ] La medida de distancia basada en información mutua es esencialmente equivalente a los métodos más convencionales basados ​​en modelos y, por lo general, no se considera novedosa ni superior a técnicas más sencillas.

Otra técnica, descrita por Cavnar y Trenkle (1994) y Dunning (1994), consiste en crear un modelo de n-gramas de lenguaje a partir de un "texto de entrenamiento" para cada idioma. Estos modelos pueden basarse en caracteres (Cavnar y Trenkle) o en bytes codificados (Dunning); en este último caso, se integran la identificación del idioma y la detección de la codificación de caracteres . A continuación, para cualquier fragmento de texto que se necesite identificar, se crea un modelo similar y se compara con cada modelo de lenguaje almacenado. El idioma más probable es aquel cuyo modelo es más similar al del texto que se desea identificar. Este enfoque puede resultar problemático cuando el texto de entrada está en un idioma para el que no existe un modelo. En ese caso, el método podría devolver otro idioma, el "más similar", como resultado. También resultan problemáticos para cualquier enfoque los fragmentos de texto de entrada compuestos por varios idiomas, como suele ocurrir en la web.

A partir de 2025, un método de referencia comúnmente utilizado es a través de la biblioteca fastText , que tiene una precisión de clasificación comparable a la de las técnicas de aprendizaje profundo, pero mucho más rápido. [ 5 ]

Identificación de lenguas similares

Uno de los principales obstáculos de los sistemas de identificación de idiomas es la dificultad para distinguir entre lenguas estrechamente relacionadas. Idiomas similares como el búlgaro y el macedonio , o el indonesio y el malayo, presentan una superposición léxica y estructural significativa, lo que dificulta que los sistemas los diferencien.

En 2014 se organizó la tarea compartida DSL [ 6 ] , que proporcionó un conjunto de datos (Tan et al., 2014) con 13 idiomas diferentes (y variedades lingüísticas) en seis grupos lingüísticos: Grupo A (bosnio, croata, serbio), Grupo B (indonesio, malayo), Grupo C (checo, eslovaco), Grupo D (portugués brasileño, portugués europeo), Grupo E (español peninsular, español argentino) y Grupo F (inglés americano, inglés británico). El mejor sistema alcanzó un rendimiento superior al 95 % de los resultados (Goutte et al., 2014). Los resultados de la tarea compartida DSL se describen en Zampieri et al., 2014.

Software

  • Apache OpenNLP incluye un detector estadístico basado en n-gramas de caracteres y viene con un modelo que puede distinguir 103 idiomas.
  • Apache Tika contiene un detector de idiomas para 18 idiomas.

Véase también

Referencias

  • Benedetto, D., E. Caglioti y V. Loreto. Árboles de lenguaje y zipping . Physical Review Letters , 88:4 (2002), Teoría de la complejidad .
  • Cavnar, William B. y John M. Trenkle. «Categorización de texto basada en n-gramas». Actas de SDAIR-94, 3.er Simposio Anual sobre Análisis de Documentos y Recuperación de Información (1994)..
  • Cilibrasi, Rudi y Paul MB Vitanyi. " Agrupamiento por compresión ". IEEE Transactions on Information Theory 51(4), abril de 2005, 1523–1545.
  • Dunning, T. (1994) "Identificación estadística del lenguaje". Informe técnico MCCS 94-273, Universidad Estatal de Nuevo México, 1994.
  • Goodman, Joshua. (2002) Comentario extendido sobre "Árboles de lenguaje y compresión" . Microsoft Research, 21 de febrero de 2002. (Se trata de una crítica a la compresión de datos a favor del método Naive Bayes).
  • Goutte, C.; Leger, S.; Carpuat, M. (2014) El sistema NRC para la discriminación de lenguas similares . Actas del taller Coling 2014 "Aplicación de herramientas de PLN a lenguas, variedades y dialectos similares".
  • Grefenstette, Gregory. (1995) Comparación de dos esquemas de identificación de idiomas. Actas de la 3ª Conferencia Internacional sobre Análisis Estadístico de Datos Textuales (JADT 1995).
  • Poutsma, Arjen. (2001) Aplicación de técnicas de Monte Carlo a la identificación de idiomas. SmartHaven, Ámsterdam. Presentado en CLIN 2001. Archivado el 7 de enero de 2015 en Wayback Machine .
  • Tan, L.; Zampieri, M.; Ljubešić, N.; Tiedemann, J. (2014) Fusión de fuentes de datos comparables para la discriminación de lenguas similares: la colección de corpus DSL . Actas del 7.º Taller sobre la creación y el uso de corpus comparables (BUCC). Reikiavik, Islandia. págs.  6-10.
  • The Economist. (2002) " Los elementos del estilo: El análisis de datos comprimidos arroja resultados impresionantes en lingüística "
  • Radim Řehůřek y Milan Kolkus. (2009) " Identificación de idiomas en la web: Ampliando el método del diccionario " Lingüística computacional y procesamiento inteligente de texto .
  • Zampieri, M.; Tan, L.; Ljubešić, N.; Tiedemann, J. (2014) Informe sobre la tarea compartida de DSL 2014. Actas del 1.er taller sobre la aplicación de herramientas de PLN a lenguas, variedades y dialectos similares (VarDial). Dublín, Irlanda. págs.  58-67.

Referencias

  1. Valores, Wolfgang G.; Stock, Matilda (31 de julio de 2013). Manual de ciencias de la información . Walter de Gruyter. págs. 180-181 . ISBN  978-3-11-023500-5.
  2. Hagiwara, Masato (14 de diciembre de 2021). Procesamiento del lenguaje natural en el mundo real: aplicaciones prácticas con aprendizaje profundo . Simon and Schuster. págs. 105–106 . ISBN  978-1-61729-642-0.
  3. Grefenstette, Gregory (diciembre de 1995). "Comparación de dos esquemas de identificación de idiomas" (PDF) . Actas de la 3.ª Conferencia Internacional sobre Análisis Estadístico de Datos Textuales (JADT'95) . Roma. págs. 263–268 . 
  4. Benedetto, Dario; Caglioti, Emanuele; Loreto, Vittorio (enero de 2002). "Árboles del lenguaje y zipping" . Physical Review Letters . 88 (4) 048702. arXiv : cond-mat/0108530 . Bibcode : 2002PhRvL..88d8702B . doi : 10.1103/PhysRevLett.88.048702 . ISSN 0031-9007 . PMID 11801178 .  
  5. Joulin, Armand; Grave, Edouard; Bojanowski, Piotr; Mikolov, Tomas (abril de 2017). Lapata, Mirella; Blunsom, Phil; Koller, Alexander (eds.). «Un repertorio de trucos para la clasificación eficiente de textos» . Actas de la XV Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional: Volumen 2, Artículos breves . Valencia, España: Asociación de Lingüística Computacional: 427–431 .
  6. "Taller VarDial en COLING 2014" .