La búsqueda conceptual es un método automatizado de recuperación de información que se utiliza para buscar en textos no estructurados almacenados electrónicamente ( por ejemplo, archivos digitales , correo electrónico, literatura científica, etc.) información conceptualmente similar a la proporcionada en una consulta de búsqueda . En otras palabras, las ideas expresadas en la información recuperada en respuesta a una consulta de búsqueda conceptual son relevantes para las ideas contenidas en el texto de la consulta.
Desarrollo
Las técnicas de búsqueda conceptual se desarrollaron debido a las limitaciones impuestas por las tecnologías clásicas de búsqueda booleana por palabras clave al trabajar con grandes colecciones digitales de texto no estructuradas. Las búsquedas por palabras clave a menudo arrojan resultados que incluyen muchos elementos irrelevantes ( falsos positivos ) o que excluyen demasiados elementos relevantes (falsos negativos) debido a los efectos de la sinonimia y la polisemia . La sinonimia implica que dos o más palabras en un mismo idioma tienen el mismo significado, y la polisemia implica que muchas palabras individuales tienen más de un significado.
La polisemia es un obstáculo importante para todos los sistemas informáticos que intentan procesar el lenguaje humano. En inglés, los términos más utilizados tienen varios significados comunes. Por ejemplo, la palabra «fire» puede significar: una actividad de combustión; terminar un empleo; lanzar o excitar (como en «fire up»). Para los 200 términos más polisémicos en inglés, el verbo típico tiene más de doce significados o sentidos comunes. El sustantivo típico de este conjunto tiene más de ocho sentidos comunes. Para los 2000 términos más polisémicos en inglés, el verbo típico tiene más de ocho sentidos comunes y el sustantivo típico tiene más de cinco. [ 1 ]
Además de los problemas de polisemia y sinonimia, las búsquedas por palabras clave pueden excluir palabras mal escritas involuntariamente , así como variaciones en las raíces de las palabras (por ejemplo, strike frente a striking). Las búsquedas por palabras clave también son susceptibles a errores introducidos por los procesos de escaneo de reconocimiento óptico de caracteres (OCR), que pueden introducir errores aleatorios en el texto de los documentos (a menudo denominados texto ruidoso ) durante el proceso de escaneo.
Una búsqueda de conceptos puede superar estos desafíos empleando la desambiguación del sentido de las palabras (WSD), [ 2 ] y otras técnicas, para ayudarla a derivar los significados reales de las palabras y sus conceptos subyacentes, en lugar de simplemente hacer coincidir cadenas de caracteres como las tecnologías de búsqueda de palabras clave.
Aproches
En general, la investigación y la tecnología de recuperación de información se pueden dividir en dos grandes categorías: semántica y estadística. Los sistemas de recuperación de información que pertenecen a la categoría semántica intentarán implementar cierto grado de análisis sintáctico y semántico del texto en lenguaje natural que proporcionaría un usuario humano (véase también lingüística computacional ). Los sistemas que pertenecen a la categoría estadística encontrarán resultados basándose en medidas estadísticas de su grado de coincidencia con la consulta. Sin embargo, los sistemas de la categoría semántica también suelen recurrir a métodos estadísticos para encontrar y recuperar información. [ 3 ]
Los esfuerzos por dotar a los sistemas de recuperación de información de capacidades de procesamiento semántico han utilizado básicamente tres enfoques:
- Estructuras auxiliares
- Estadísticas de coocurrencia local
- Técnicas de transformación (en particular, descomposiciones matriciales )
Estructuras auxiliares
Se han aplicado diversas técnicas basadas en inteligencia artificial (IA) y procesamiento del lenguaje natural (PLN) al procesamiento semántico, y la mayoría de ellas se han basado en el uso de estructuras auxiliares como vocabularios controlados y ontologías . Los vocabularios controlados (diccionarios y tesauros) y las ontologías permiten incorporar términos más amplios, más específicos y relacionados en las consultas. [ 4 ] Los vocabularios controlados son una forma de superar algunas de las restricciones más severas de las consultas booleanas por palabras clave. A lo largo de los años, se han construido estructuras auxiliares adicionales de interés general, como los grandes conjuntos de sinónimos de WordNet . [ 5 ] Se demostró que la búsqueda de conceptos basada en estructuras auxiliares, como WordNet, puede implementarse de manera eficiente reutilizando modelos de recuperación y estructuras de datos de la recuperación de información clásica. [ 6 ] Enfoques posteriores han implementado gramáticas para ampliar el rango de construcciones semánticas. En los últimos años también se ha implementado la creación de modelos de datos que representan conjuntos de conceptos dentro de un dominio específico ( ontologías de dominio ) y que pueden incorporar las relaciones entre los términos.
Los vocabularios controlados elaborados manualmente contribuyen a la eficiencia y exhaustividad de la recuperación de información y las operaciones de análisis de texto relacionadas, pero funcionan mejor cuando los temas están definidos con precisión y la terminología está estandarizada. Los vocabularios controlados requieren una amplia intervención y supervisión humana para mantenerse al día con la rápida evolución del lenguaje. Tampoco son adecuados para los crecientes volúmenes de texto no estructurado que abarcan un número ilimitado de temas y contienen miles de términos únicos, ya que es necesario introducir constantemente nuevos términos y temas. Los vocabularios controlados también tienden a capturar una visión del mundo particular en un momento específico, lo que dificulta su modificación si los conceptos en un área temática determinada cambian. [ 7 ]
Estadísticas de coocurrencia local
Los sistemas de recuperación de información que incorporan este enfoque cuentan la cantidad de veces que grupos de términos aparecen juntos (coocurren) dentro de una ventana deslizante de términos o oraciones (por ejemplo, ± 5 oraciones o ± 50 palabras) dentro de un documento. Se basa en la idea de que las palabras que aparecen juntas en contextos similares tienen significados similares. Es un método local en el sentido de que la ventana deslizante de términos y oraciones utilizada para determinar la coocurrencia de términos es relativamente pequeña.
Este enfoque es sencillo, pero solo captura una pequeña parte de la información semántica contenida en una colección de texto. En su nivel más básico, numerosos experimentos han demostrado que aproximadamente solo una cuarta parte de la información contenida en un texto es de naturaleza local. [ 8 ] Además, para ser más eficaz, este método requiere conocimiento previo sobre el contenido del texto, lo cual puede ser difícil con colecciones de documentos grandes y no estructuradas. [ 7 ]
Técnicas de transformación
Algunos de los enfoques más potentes para el procesamiento semántico se basan en el uso de técnicas de transformación matemática. Las técnicas de descomposición matricial han sido las más exitosas. Algunas técnicas de descomposición matricial ampliamente utilizadas incluyen las siguientes: [ 9 ]
- Análisis de componentes independientes
- Descomposición semidiscreta
- Factorización de matrices no negativas
- Descomposición en valores singulares
Las técnicas de descomposición matricial se basan en datos, lo que evita muchos de los inconvenientes asociados con las estructuras auxiliares. También son de naturaleza global, lo que significa que son capaces de extraer información y representar información semántica de forma mucho más robusta que las técnicas basadas en estadísticas de coocurrencia local. [ 7 ]
El análisis de componentes independientes es una técnica que crea representaciones dispersas de forma automatizada, [ 10 ] y los enfoques de matrices semidiscretas y no negativas sacrifican la precisión de la representación para reducir la complejidad computacional. [ 7 ]
La descomposición en valores singulares (SVD) se aplicó por primera vez a texto en Bell Labs a finales de la década de 1980. Se utilizó como base para una técnica llamada indexación semántica latente (LSI) debido a su capacidad para encontrar el significado semántico latente en una colección de texto. Al principio, la adopción de la SVD fue lenta debido a los requisitos de recursos necesarios para trabajar con grandes conjuntos de datos. Sin embargo, el uso de LSI se ha expandido significativamente en los últimos años a medida que se han superado los desafíos anteriores de escalabilidad y rendimiento. [ 11 ] e incluso se ha liberado como código abierto. [ 12 ] LSI se está utilizando en una variedad de aplicaciones de recuperación de información y procesamiento de texto, aunque su aplicación principal ha sido para la búsqueda de conceptos y la categorización automatizada de documentos. [ 13 ]
Usos
- eDiscovery : Las tecnologías de búsqueda basadas en conceptos se utilizan cada vez más para el descubrimiento electrónico de documentos (EDD o eDiscovery) con el fin de ayudar a las empresas a prepararse para los litigios. En eDiscovery, la capacidad de agrupar, categorizar y buscar grandes colecciones de texto no estructurado sobre una base conceptual es mucho más eficiente que las técnicas tradicionales de revisión lineal. La búsqueda basada en conceptos se está consolidando como un método de búsqueda fiable y eficiente, con mayor probabilidad de generar resultados relevantes que las búsquedas por palabras clave o booleanas. [ 14 ]
- Búsqueda empresarial y gestión de contenido empresarial (ECM) : las tecnologías de búsqueda conceptual se utilizan ampliamente en la búsqueda empresarial. A medida que aumenta el volumen de información dentro de la empresa, la capacidad de agrupar, categorizar y buscar grandes colecciones de texto no estructurado sobre una base conceptual se ha vuelto esencial. En 2004, el Grupo Gartner estimó que los profesionales dedican el 30 % de su tiempo a buscar, recuperar y gestionar información. [ 15 ] La empresa de investigación IDC descubrió que una corporación de 2000 empleados puede ahorrar hasta 30 millones de dólares al año al reducir el tiempo que los empleados dedican a buscar información y a duplicar documentos existentes. [ 15 ]
- Recuperación de imágenes basada en contenido (CBIR) : Los enfoques basados en contenido se utilizan para la recuperación semántica de imágenes y videos digitalizados de grandes corpus visuales. Uno de los primeros sistemas de recuperación de imágenes basados en contenido que abordó el problema semántico fue el motor de búsqueda ImageScape. En este sistema, el usuario podía realizar consultas directas de múltiples objetos visuales como cielo, árboles, agua, etc., utilizando iconos posicionados espacialmente en un índice WWW que contenía más de diez millones de imágenes y videos utilizando fotogramas clave. El sistema utilizó la teoría de la información para determinar las mejores características para minimizar la incertidumbre en la clasificación. [ 16 ] La brecha semántica se menciona a menudo en relación con CBIR. La brecha semántica se refiere a la brecha entre la información que se puede extraer de los datos visuales y la interpretación que esos mismos datos tienen para un usuario en una situación dada. [ 17 ] El Taller ACM SIGMM sobre Recuperación de Información Multimedia [ 18 ] está dedicado a estudios de CBIR.
- Multimedia y publicación : La búsqueda conceptual es utilizada por las industrias multimedia y editorial para brindar a los usuarios acceso a noticias, información técnica y conocimientos especializados provenientes de diversas fuentes no estructuradas. Los métodos basados en contenido para la recuperación de información multimedia (RIM) se han vuelto especialmente importantes cuando las anotaciones de texto son incompletas o faltan. [ 16 ]
- Bibliotecas y archivos digitales : Las imágenes, los vídeos, la música y los textos de las bibliotecas y archivos digitales se están haciendo accesibles a grandes grupos de usuarios (especialmente en la web) mediante técnicas de búsqueda conceptual. Por ejemplo, Executive Daily Brief (EDB), un producto de monitorización y alerta de información empresarial desarrollado por EBSCO Publishing , utiliza tecnología de búsqueda conceptual para proporcionar a los usuarios corporativos acceso a una biblioteca digital con una amplia gama de contenido empresarial. De forma similar, el Music Genome Project dio origen a Pandora, que emplea la búsqueda conceptual para crear espontáneamente bibliotecas musicales individuales o emisoras de radio virtuales .
- Recuperación de Información Genómica (GIR) : La recuperación de información genómica (GIR) utiliza técnicas de búsqueda de conceptos aplicadas a bases de datos de literatura genómica para superar las ambigüedades de la literatura científica.
- Selección y contratación de personal : muchas organizaciones de selección y contratación de personal han adoptado tecnologías de búsqueda conceptual para generar resultados de búsqueda de currículos altamente relevantes que proporcionan currículos de candidatos más precisos y pertinentes que los resultados de palabras clave vagamente relacionados.
Búsqueda eficaz
La eficacia de una búsqueda conceptual puede depender de diversos elementos, como el conjunto de datos consultado y el motor de búsqueda utilizado para procesar las consultas y mostrar los resultados. Sin embargo, la mayoría de los motores de búsqueda conceptual funcionan mejor para ciertos tipos de consultas:
- Las consultas eficaces contienen suficiente texto para transmitir adecuadamente los conceptos que se pretenden comunicar. Pueden incluir oraciones completas, párrafos o incluso documentos enteros. Las consultas con solo unas pocas palabras tienen menos probabilidades de arrojar los resultados más relevantes.
- Las consultas efectivas no incluyen conceptos que no sean el objeto de la búsqueda. Incluir demasiados conceptos irrelevantes en una consulta puede afectar negativamente la relevancia de los resultados. Por ejemplo, buscar información sobre navegación en el río Misisipi tendría más probabilidades de arrojar resultados relevantes que buscar información sobre navegación en el río Misisipi en un día lluvioso a mediados del verano de 1967.
- Las consultas eficaces se expresan en un lenguaje natural y de texto completo, similar al estilo de los documentos que se buscan. Por ejemplo, usar consultas compuestas por extractos de un libro de texto de ciencias introductorio no sería tan eficaz para la búsqueda de conceptos si el conjunto de datos consultado está formado por textos de ciencias avanzados de nivel universitario. Las consultas sustanciales que representan mejor los conceptos, estilos y lenguaje generales de los elementos que se buscan suelen ser más eficaces.
Como ocurre con todas las estrategias de búsqueda, los usuarios experimentados suelen refinar sus consultas mediante múltiples búsquedas, comenzando con una consulta inicial para obtener resultados conceptualmente relevantes que luego pueden utilizarse para componer o refinar consultas adicionales y obtener resultados cada vez más relevantes. Dependiendo del motor de búsqueda, utilizar conceptos de consulta encontrados en los documentos de resultados puede ser tan sencillo como seleccionar un documento y realizar una búsqueda de similares . Modificar una consulta añadiendo términos y conceptos para mejorar la relevancia de los resultados se denomina expansión de consulta . [ 19 ] Se ha estudiado el uso de ontologías como WordNet para expandir consultas con palabras conceptualmente relacionadas. [ 20 ]
Retroalimentación sobre la relevancia
La retroalimentación de relevancia es una función que ayuda a los usuarios a determinar si los resultados devueltos para sus consultas satisfacen sus necesidades de información. En otras palabras, la relevancia se evalúa en relación con una necesidad de información, no con una consulta. Un documento es relevante si aborda la necesidad de información declarada, no porque simplemente contenga todas las palabras de la consulta. [ 21 ] Es una forma de involucrar a los usuarios en el proceso de recuperación para mejorar el conjunto de resultados final . [ 21 ] Los usuarios pueden refinar sus consultas basándose en sus resultados iniciales para mejorar la calidad de sus resultados finales.
En general, la relevancia de la búsqueda de conceptos se refiere al grado de similitud entre los conceptos expresados en la consulta y los conceptos contenidos en los resultados devueltos. Cuanto más similares sean los conceptos de los resultados a los de la consulta, más relevantes se consideran los resultados. Los resultados suelen clasificarse y ordenarse por relevancia, de modo que los más relevantes aparecen al principio de la lista y los menos relevantes al final.
Se ha demostrado que la retroalimentación de relevancia es muy eficaz para mejorar la relevancia de los resultados. [ 21 ] Una búsqueda de conceptos disminuye el riesgo de omitir elementos de resultados importantes porque se devolverán todos los elementos relacionados con los conceptos de la consulta, independientemente de si contienen o no las mismas palabras utilizadas en la consulta. [ 15 ]
La clasificación seguirá siendo parte de cualquier sistema moderno de recuperación de información. Sin embargo, los problemas de datos heterogéneos, escala y tipos de discurso no tradicionales reflejados en el texto, junto con el hecho de que los motores de búsqueda se integrarán cada vez más en procesos complejos de gestión de la información, y no solo serán sistemas independientes, requerirán nuevos tipos de respuestas del sistema a una consulta. Por ejemplo, uno de los problemas con las listas clasificadas es que podrían no revelar las relaciones que existen entre algunos de los elementos de los resultados. [ 22 ]
Directrices para evaluar un motor de búsqueda de conceptos
- Los resultados deben ser relevantes para la necesidad de información expresada por los conceptos contenidos en las consultas, incluso si la terminología utilizada en los resultados es diferente de la terminología utilizada en la consulta.
- Los resultados deben ordenarse y clasificarse según su relevancia.
- Los resultados relevantes deben localizarse y mostrarse rápidamente. Incluso las consultas complejas deben devolver resultados relevantes con bastante rapidez.
- La longitud de la consulta no debe ser fija ; es decir, puede ser tan larga como se considere necesario. Se puede enviar una oración, un párrafo o incluso un documento completo como consulta.
- Una consulta conceptual no debería requerir una sintaxis especial ni compleja. Los conceptos que contiene pueden expresarse de forma clara y destacada sin necesidad de utilizar reglas especiales.
- Se deberían permitir las consultas combinadas que utilicen conceptos, palabras clave y metadatos. [ 23 ]
- Las partes relevantes de los resultados deberían poder utilizarse como texto de consulta simplemente seleccionando el elemento e indicándole al motor de búsqueda que encuentre elementos similares .
- Los índices listos para consultas deberían crearse con relativa rapidez.
- El motor de búsqueda debe ser capaz de realizar búsquedas federadas . La búsqueda federada permite utilizar consultas conceptuales para buscar simultáneamente información en múltiples fuentes de datos , la cual luego se combina, ordena y muestra en los resultados.
- Una búsqueda conceptual no debería verse afectada por palabras mal escritas, errores tipográficos o errores de escaneo OCR, ni en el texto de la consulta ni en el texto del conjunto de datos que se está buscando.
Conferencias y foros
La evaluación formalizada de motores de búsqueda se lleva a cabo desde hace muchos años. Por ejemplo, la Conferencia de Recuperación de Texto (TREC) se creó en 1992 para apoyar la investigación dentro de la comunidad de recuperación de información, proporcionando la infraestructura necesaria para la evaluación a gran escala de metodologías de recuperación de texto. La mayoría de los motores de búsqueda comerciales actuales incluyen tecnología desarrollada inicialmente en TREC. [ 24 ]
En 1997, se lanzó en Japón una contraparte de TREC, llamada National Institute of Informatics Test Collection for IR Systems (NTCIR). NTCIR organiza una serie de talleres de evaluación para la investigación en recuperación de información, respuesta a preguntas, resumen automático , etc. En 2001, se inició una serie de talleres europeos llamada Cross-Language Evaluation Forum (CLEF) para apoyar la investigación en acceso a información multilingüe. En 2002, se estableció la Initiative for the Evaluation of XML Retrieval (INEX) para la evaluación de sistemas de recuperación de XML orientados al contenido .
La precisión y la exhaustividad han sido dos de las medidas de rendimiento tradicionales para evaluar los sistemas de recuperación de información. La precisión es la fracción de los documentos recuperados que son relevantes para la necesidad de información del usuario. La exhaustividad se define como la fracción de documentos relevantes de toda la colección que se devuelven como documentos de resultado. [ 21 ]
Aunque los talleres y las colecciones de prueba disponibles públicamente que se utilizan para la evaluación y prueba de motores de búsqueda han proporcionado información sustancial sobre cómo se gestiona y recupera la información, el campo apenas ha arañado la superficie de los desafíos que enfrentan las personas y las organizaciones para encontrar, gestionar y utilizar la información ahora que hay tanta información disponible. [ 22 ] Los datos científicos sobre cómo las personas utilizan las herramientas de información disponibles hoy en día aún son incompletos porque las metodologías de investigación experimental no han podido seguir el ritmo acelerado del cambio. Muchos desafíos, como la búsqueda contextualizada, la gestión de la información personal, la integración de la información y el apoyo a las tareas, aún deben abordarse. [ 22 ]
Véase también
Referencias
- ↑ Bradford, RB, Desambiguación del sentido de las palabras, Content Analyst Company , LLC, Patente estadounidense 7415462, 2008.
- ↑ R. Navigli, Desambiguación del sentido de las palabras: una revisión , ACM Computing Surveys, 41(2), 2009.
- ↑ Greengrass, E., Recuperación de información: una revisión, 2000.
- ^ Dubois, C., El uso de tesauros en la recuperación en línea, Journal of Information Science, 8(2), marzo de 1984, págs.
- ↑ Miller, G., Número especial, WordNet: una base de datos léxica en línea , Revista Internacional de Lexicografía, 3(4), 1990.
- ↑ Fausto Giunchiglia, Uladzimir Kharkevich e Ilya Zaihrayeu. Concept Search Archivado el 10 de febrero de 2014 en Wayback Machine , en Actas de la Conferencia Europea de la Web Semántica, 2009.
- 1 2 3 4 Bradford, RB, ¿Por qué LSI? Indexación semántica latente y recuperación de información, Libro blanco, Content Analyst Company , LLC, 2008.
- ↑ Landauer, T., y Dumais, S., Una solución al problema de Platón: la teoría del análisis semántico latente de la adquisición, inducción y representación del conocimiento , Psychological Review, 1997, 104(2), pp. 211-240.
- ↑ Skillicorn, D., Comprensión de conjuntos de datos complejos: Minería de datos con descomposiciones matriciales , CRC Publishing, 2007.
- ↑ Honkela, T., Hyvarinen, A. y Vayrynen, J. WordICA: Surgimiento de representaciones lingüísticas para palabras mediante análisis de componentes independientes. Natural Language Engineering, 16(3):277-308, 2010
- ↑ Řehůřek, Radim (2011). "Escalabilidad del análisis semántico en el procesamiento del lenguaje natural" (PDF) . Recuperado el 27 de enero de 2015 .
- ↑ Software de código abierto Gensim
- ↑ Dumais, S., Análisis semántico latente, ARIST Review of Information Science and Technology, vol. 38, Capítulo 4, 2004.
- ↑ Juez magistrado John M. Facciola del Tribunal de Distrito de los Estados Unidos para el Distrito de Washington, DC Disability Rights Council v. Washington Metropolitan Transit Authority, 242 FRD 139 (DDC 2007), citando a George L. Paul y Jason R. Baron, "Inflación de información: ¿Puede adaptarse el sistema legal?" 13 Rich. JL & Tech. 10 (2007).
- 1 2 3 Laplanche, R., Delgado, J., Turck, M., La tecnología de búsqueda de conceptos va más allá de las palabras clave, Information Outlook, julio de 2004.
- 1 2 Lew, MS, Sebe, N., Djeraba, C., Jain, R., Recuperación de información multimedia basada en contenido: estado del arte y desafíos , ACM Transactions on Multimedia Computing, Communications, and Applications, febrero de 2006.
- ↑ Datta R., Joshi, D., Li J., Wang, JZ, Recuperación de imágenes: ideas, influencias y tendencias de la nueva era , ACM Computing Surveys, vol. 40, n.º 2, abril de 2008.
- ↑ "Mir 2004" . www.liacs.nl . Archivado del original el 7 de marzo de 2014. Consultado el 12 de enero de 2022 .
- ↑ Robertson, SE , Spärck Jones, K. , Enfoques simples y probados para la recuperación de texto, Informe técnico, Laboratorio de computación de la Universidad de Cambridge, diciembre de 1994.
- ↑ Navigli, R., Velardi, P. Un análisis de estrategias de expansión de consultas basadas en ontologías. Archivado el 26 de abril de 2012 en Wayback Machine . Actas del Taller sobre Extracción y Minería Adaptativa de Texto (ATEM 2003) , en la 14.ª Conferencia Europea sobre Aprendizaje Automático (ECML 2003) , Cavtat-Dubrovnik, Croacia, del 22 al 26 de septiembre de 2003, págs. 42-49.
- 1 2 3 4 Manning, CD, Raghavan P., Schütze H., Introducción a la recuperación de información, Cambridge University Press, 2008.
- 1 2 3 Callan, J., Allan, J., Clarke, CLA, Dumais, S., Evans, D., A., Sanderson, M., Zhai, C., Reunión de MINDS: Una agenda de investigación sobre recuperación de información , ACM, Foro SIGIR, Vol. 41 No. 2, diciembre de 2007.
- ↑ Rehurek, R., Un sistema combinado para la búsqueda de similitud vectorial basado en el índice de texto completo invertido, ScaleText Search Engine , Patente estadounidense pendiente 15726803, 2017.
- ↑ Croft, B., Metzler, D., Strohman, T., Motores de búsqueda, recuperación de información en la práctica, Addison Wesley, 2009.
Enlaces externos
- Conferencia de Recuperación de Texto (TREC) , NIST
- Bancos de pruebas y comunidad para la investigación del acceso a la información (NTCIR) del Instituto Nacional de Informática, Tokio
- Educación y funcionamiento en varios idiomas (CLEF)
- (Iniciativa para la evaluación de la recuperación XML) , Universidad de Duisburg-Essen
- INEX (Iniciativa para la Evaluación de la Recuperación XML) , Universidad de Duisburg (archivado en 2007)
- Géneros de recuperación de información