Articulo de referencia

Recuperación de información multilingüe

La recuperación de información multilingüe ( CLIR ) es un subcampo de la recuperación de información que se ocupa de recuperar información escrita en un idioma diferente al de l...

La recuperación de información multilingüe ( CLIR ) es un subcampo de la recuperación de información que se ocupa de recuperar información escrita en un idioma diferente al de la consulta del usuario. [ 1 ] El término "recuperación de información multilingüe" tiene muchos sinónimos, de los cuales los siguientes son quizás los más frecuentes: recuperación de información translingüe, recuperación de información multilingüe. El término "recuperación de información multilingüe" se refiere de forma más general tanto a la tecnología para la recuperación de colecciones multilingües como a la tecnología que se ha adaptado para gestionar material de un idioma a otro. El término Recuperación de Información Multilingüe (MLIR) implica el estudio de sistemas que aceptan consultas de información en varios idiomas y devuelven objetos (texto y otros medios) en varios idiomas, traducidos al idioma del usuario. La recuperación de información multilingüe se refiere más específicamente al caso de uso en el que los usuarios formulan su necesidad de información en un idioma y el sistema recupera los documentos relevantes en otro. Para ello, la mayoría de los sistemas CLIR utilizan diversas técnicas de traducción. Las técnicas CLIR se pueden clasificar en diferentes categorías según los diferentes recursos de traducción: [ 2 ]

  • Técnicas CLIR basadas en diccionarios
  • Técnicas CLIR basadas en corpus paralelos
  • Técnicas CLIR basadas en corpus comparables
  • Técnicas CLIR basadas en traductores automáticos

Los sistemas CLIR han mejorado tanto que los sistemas ad hoc de recuperación de información multilingües e interlingüísticos más precisos de la actualidad son casi tan efectivos como los sistemas monolingües. [ 3 ] Otras tareas relacionadas con el acceso a la información, como la monitorización de medios , el filtrado y enrutamiento de información , el análisis de sentimientos y la extracción de información , requieren modelos más sofisticados y, por lo general, un mayor procesamiento y análisis de los elementos de información de interés. Gran parte de ese procesamiento debe tener en cuenta las particularidades de los idiomas de destino en los que se implementa.

Principalmente, los diversos mecanismos de variación en el lenguaje humano plantean desafíos de cobertura para los sistemas de recuperación de información: los textos en una colección pueden tratar un tema de interés pero usar términos o expresiones que no coinciden con la expresión de la necesidad de información dada por el usuario. Esto puede ser cierto incluso en un caso monolingüe, pero es especialmente cierto en la recuperación de información multilingüe, donde los usuarios pueden conocer el idioma de destino solo en cierta medida. Se ha encontrado que los beneficios de la tecnología CLIR para usuarios con una competencia baja a moderada en el idioma de destino son mayores que para aquellos que son fluidos. [ 4 ] Las tecnologías específicas implementadas para los servicios CLIR incluyen análisis morfológico para manejar la flexión , descomposición o división de compuestos para manejar términos compuestos y mecanismos de traducción para traducir una consulta de un idioma a otro.

El primer taller sobre CLIR se celebró en Zúrich durante la conferencia SIGIR-96. [ 5 ] Desde el año 2000, se han celebrado talleres anualmente en las reuniones del Foro de Evaluación Interlingüística (CLEF). Los investigadores también se reúnen en la Conferencia anual de Recuperación de Texto (TREC) para debatir sus hallazgos sobre diferentes sistemas y métodos de recuperación de información, y la conferencia ha servido como punto de referencia para el subcampo CLIR. [ 6 ] Los primeros experimentos de CLIR se llevaron a cabo en TREC-6, celebrada en el Instituto Nacional de Estándares y Tecnología (NIST) del 19 al 21 de noviembre de 1997. [ 7 ]

Google Search tenía una función de búsqueda multilingüe que fue eliminada en 2013. [ 8 ]

Véase también

  • EXCLAIM (Máquina de Información Automática Multilingüe Extensible)
  • CLEF (Conferencia y Laboratorios del Foro de Evaluación, anteriormente conocido como Foro de Evaluación Interlingüística)

Referencias

  1. Wang, Jianqiang y Douglas W. Oard. "Coincidencia de significado para la recuperación de información multilingüe". Information Processing & Management 48.4 (2012): 631-53.
  2. Tsai, Peishan. "Introducción a los enfoques de recuperación de información multilingüe" . www.mikeandpeishan.com . Archivado del original el 4 de noviembre de 2022. Consultado el 4 de noviembre de 2022 .
  3. Oard, Douglas. "Acceso a información multilingüe". Comprensión de los sistemas de recuperación de información (2011): 373-80. Web.
  4. Airio, Eija (2008). "¿Quién se beneficia de CLIR en la recuperación web?" . Journal of Documentation . 64 (5): 760– 778. doi : 10.1108/00220410810899754 .
  5. Las actas de este taller se pueden encontrar en el libro Cross-Language Information Retrieval (Grefenstette, ed.; Kluwer, 1998) ISBN 0-7923-8122-X.
  6. Olvera-Lobo, María-Dolores. "Recuperación de información multilingüe en la web". Manual de investigación sobre las dimensiones sociales de las tecnologías semánticas y los servicios web (s.f.): 704-19. Web.
  7. Vorhees, Ellen M.; Harman, Donna (1999). "Descripción general de la sexta Conferencia de Recuperación de Texto (TREC-6)" . Procesamiento y gestión de la información .
  8. "Google elimina la opción de búsqueda "Páginas extranjeras traducidas" debido a la falta de uso" . 20 de mayo de 2013.
  • Una página de recursos para CLIR
  • Un motor de búsqueda para CLIR