La recuperación de información ( RI ) en informática y ciencias de la información es la tarea de identificar y recuperar recursos de sistemas de información que sean relevantes para una necesidad de información . La necesidad de información puede especificarse en forma de consulta de búsqueda. En el caso de la recuperación de documentos, las consultas pueden basarse en indexación de texto completo u otra indexación basada en contenido. La recuperación de información es la ciencia [ 1 ] de buscar información en un documento, buscar los documentos en sí, y también buscar los metadatos que describen los datos, y bases de datos de textos, imágenes o sonidos. La recuperación multimodal implica la recuperación a través de diferentes modalidades.
Los sistemas automatizados de recuperación de información se utilizan para reducir lo que se conoce como sobrecarga de información . Un sistema de recuperación de información es un software que proporciona acceso a libros, revistas y otros documentos, además de almacenarlos y gestionarlos. Los motores de búsqueda web son las aplicaciones de recuperación de información más conocidas.
Descripción general
El proceso de recuperación de información comienza cuando un usuario introduce una consulta en el sistema. Las consultas son declaraciones formales de necesidades de información, por ejemplo, cadenas de búsqueda en los motores de búsqueda web. En la recuperación de información, una consulta no identifica de forma unívoca un único objeto en la colección. En cambio, varios objetos pueden coincidir con la consulta, quizás con distintos grados de relevancia .
Un objeto es una entidad representada por información en una colección de contenido o base de datos . Las consultas de los usuarios se comparan con la información de la base de datos. Sin embargo, a diferencia de las consultas SQL clásicas, en la recuperación de información los resultados devueltos pueden o no coincidir con la consulta, por lo que generalmente se clasifican. Esta clasificación de resultados es una diferencia clave entre la búsqueda en recuperación de información y la búsqueda en bases de datos. [ 2 ]
Dependiendo de la aplicación , los objetos de datos pueden ser, por ejemplo, documentos de texto, imágenes, [ 3 ] audio, [ 4 ] mapas mentales [ 5 ] o vídeos. A menudo, los documentos en sí no se guardan ni se almacenan directamente en el sistema IR, sino que se representan en el sistema mediante sustitutos de documentos o metadatos .
La mayoría de los sistemas de recuperación de información calculan una puntuación numérica sobre la coincidencia de cada objeto de la base de datos con la consulta y clasifican los objetos según este valor. Los objetos mejor clasificados se muestran al usuario. El proceso puede repetirse si el usuario desea refinar la consulta. [ 6 ]
Recuperación de información multimedia
La recuperación de información multimedia (MMIR o MIR) es una disciplina de investigación de la informática que tiene como objetivo extraer información semántica de fuentes de datos multimedia . [ 7 ] Las fuentes de datos incluyen medios directamente perceptibles como audio , imagen y video , fuentes indirectamente perceptibles como texto , descripciones semánticas, [ 8 ] bioseñales, así como fuentes no perceptibles como bioinformación, precios de acciones, etc. La metodología de MMIR se puede organizar en tres grupos:
- Métodos para la síntesis de contenido multimedia ( extracción de características ). El resultado de la extracción de características es una descripción.
- Métodos para el filtrado de descripciones de medios (por ejemplo, eliminación de redundancias )
- Métodos para la categorización de descripciones de medios en clases.
Historia
Existe una máquina llamada Univac, mediante la cual las letras y los números se codifican como un patrón de puntos magnéticos en una larga cinta de acero. De esta manera, se puede registrar el texto de un documento, precedido por su símbolo de código de materia. La máquina selecciona y transcribe automáticamente las referencias que han sido codificadas de la forma deseada a una velocidad de 120 palabras por minuto.
— JE Holmstrom, 1948
La idea de usar computadoras para buscar información relevante se popularizó en el artículo «As We May Think» de Vannevar Bush en 1945. [ 9 ] Parece que Bush se inspiró en las patentes de una «máquina estadística» —registradas por Emanuel Goldberg en las décadas de 1920 y 1930— que buscaba documentos almacenados en película. [ 10 ] La primera descripción de una computadora que buscaba información fue descrita por Holmstrom en 1948, [ 11 ] detallando una mención temprana de la computadora Univac . Los sistemas automatizados de recuperación de información se introdujeron en la década de 1950: uno incluso apareció en la comedia romántica de 1957 «Desk Set» . En la década de 1960, Gerard Salton formó el primer gran grupo de investigación en recuperación de información en Cornell. Para la década de 1970, se había demostrado que varias técnicas de recuperación diferentes funcionaban bien en pequeños corpus de texto como la colección Cranfield (varios miles de documentos). [ 9 ] Los sistemas de recuperación a gran escala, como el sistema Lockheed Dialog, comenzaron a utilizarse a principios de la década de 1970.
En 1992, el Departamento de Defensa de los Estados Unidos, junto con el Instituto Nacional de Estándares y Tecnología (NIST), copatrocinó la Conferencia de Recuperación de Texto (TREC) como parte del programa de texto TIPSTER. El objetivo era explorar la comunidad de recuperación de información proporcionando la infraestructura necesaria para evaluar metodologías de recuperación de texto en una colección de texto muy extensa. Esto impulsó la investigación sobre métodos escalables a grandes corpus. La introducción de los motores de búsqueda web ha incrementado aún más la necesidad de sistemas de recuperación a gran escala.
A finales de la década de 1990, el auge de la World Wide Web transformó radicalmente la recuperación de información. Si bien los primeros motores de búsqueda, como AltaVista (1995) y Yahoo! (1994), ofrecían recuperación basada en palabras clave, su escala y precisión en la clasificación eran limitadas. El gran avance se produjo en 1998 con la fundación de Google , que introdujo el algoritmo PageRank [ 12 ] , utilizando la estructura de hipervínculos de la web para evaluar la importancia de las páginas y mejorar la clasificación por relevancia.
Durante la década de 2000, los sistemas de búsqueda web evolucionaron rápidamente con la integración de técnicas de aprendizaje automático. Estos sistemas comenzaron a incorporar datos de comportamiento del usuario (por ejemplo, registros de clics), reformulación de consultas y señales basadas en el contenido para mejorar la precisión y la personalización de la búsqueda. En 2009, Microsoft lanzó Bing , introduciendo funciones que posteriormente incorporarían tecnologías de la web semántica mediante el desarrollo de su base de conocimiento Satori. Los análisis académicos [ 13 ] han resaltado las capacidades semánticas de Bing, incluido el uso de datos estructurados y el reconocimiento de entidades, como parte de un cambio más amplio en la industria hacia la mejora de la relevancia de la búsqueda y la comprensión de la intención del usuario mediante el procesamiento del lenguaje natural.
En 2018 se produjo un gran avance cuando Google implementó BERT ( Representaciones de codificadores bidireccionales a partir de transformadores ) para comprender mejor el significado contextual de las consultas y los documentos. Esto marcó una de las primeras veces que se utilizaron modelos de lenguaje neuronales profundos a gran escala en sistemas de recuperación del mundo real. [ 14 ] El entrenamiento bidireccional de BERT permitió una comprensión más refinada de las relaciones entre palabras en contexto, mejorando el manejo de consultas en lenguaje natural. Debido a su éxito, los modelos basados en transformadores ganaron terreno en la investigación académica y en aplicaciones de búsqueda comerciales. [ 15 ]
Simultáneamente, la comunidad investigadora comenzó a explorar modelos de clasificación neuronal que superaban a los métodos tradicionales basados en el léxico. Puntos de referencia de larga trayectoria, como la Conferencia de Recuperación de Texto ( TREC ) , iniciada en 1992, y marcos de evaluación más recientes como Microsoft MARCO ( Comprensión de Lectura Automática ) ( 2019) [ 16 ], se convirtieron en elementos centrales para el entrenamiento y la evaluación de sistemas de recuperación en múltiples tareas y dominios. MS MARCO también se ha adoptado en las pistas de aprendizaje profundo de TREC, donde sirve como conjunto de datos principal para evaluar los avances en modelos de clasificación neuronal dentro de un entorno de evaluación comparativa estandarizado. [ 17 ]
A medida que el aprendizaje profundo se integró en los sistemas de recuperación de información, los investigadores comenzaron a clasificar los enfoques neuronales en tres grandes categorías: modelos dispersos , densos e híbridos . Los modelos dispersos, incluidos los métodos tradicionales basados en términos y variantes aprendidas como SPLADE, se basan en representaciones interpretables e índices invertidos para permitir una coincidencia exacta de términos eficiente con señales semánticas adicionales. [ 18 ] Los modelos densos, como las arquitecturas de doble codificador como ColBERT, utilizan incrustaciones vectoriales continuas para admitir la similitud semántica más allá de la superposición de palabras clave. [ 19 ] Los modelos híbridos buscan combinar las ventajas de ambos, equilibrando la precisión léxica (token) de los métodos dispersos con la profundidad semántica de los modelos densos. Esta forma de clasificar los modelos equilibra la escalabilidad, la relevancia y la eficiencia en los sistemas de recuperación. [ 20 ]
A medida que los sistemas de recuperación de información dependen cada vez más del aprendizaje profundo, surgen preocupaciones sobre el sesgo, la equidad y la explicabilidad. La investigación ahora se centra no solo en la relevancia y la eficiencia, sino también en la transparencia, la rendición de cuentas y la confianza del usuario en los algoritmos de recuperación.
Aplicaciones
Las áreas donde se emplean técnicas de recuperación de información incluyen (las entradas están en orden alfabético dentro de cada categoría):
Aplicaciones generales
- Bibliotecas digitales
- Filtrado de información
- Búsqueda de medios
- Búsqueda en el blog
- Recuperación de imágenes
- Recuperación 3D
- Recuperación de música
- Búsqueda de noticias
- Recuperación de voz
- Recuperación de vídeo
- motores de búsqueda
Aplicaciones específicas de dominio
- Búsqueda experta
- recuperación de información genómica
- recuperación de información geográfica
- Recuperación de información para estructuras químicas
- Recuperación de información en ingeniería de software
- Recuperación de información legal
- Búsqueda vertical
Otros métodos de recuperación
Los métodos/técnicas en los que se emplean técnicas de recuperación de información incluyen:
Tipos de modelos

Para recuperar eficazmente los documentos relevantes mediante estrategias de recuperación de información, estos se transforman en una representación adecuada. Cada estrategia incorpora un modelo específico para la representación de sus documentos. La imagen de la derecha ilustra la relación entre algunos modelos comunes. En la imagen, los modelos se clasifican según dos dimensiones: su base matemática y sus propiedades.
Primera dimensión: fundamentos matemáticos
- Los modelos basados en la teoría de conjuntos representan los documentos como conjuntos de palabras o frases. Las similitudes generalmente se derivan de operaciones de teoría de conjuntos sobre esos conjuntos. Los modelos comunes son:
- Los modelos algebraicos representan documentos y consultas generalmente como vectores, matrices o tuplas. La similitud entre el vector de consulta y el vector de documento se representa como un valor escalar.
- Los modelos probabilísticos tratan el proceso de recuperación de documentos como una inferencia probabilística. Las similitudes se calculan como probabilidades de que un documento sea relevante para una consulta determinada. En estos modelos se suelen utilizar teoremas probabilísticos como el teorema de Bayes .
- Los modelos de recuperación basados en características consideran los documentos como vectores de valores de funciones de características (o simplemente características ) y buscan la mejor manera de combinar estas características en una única puntuación de relevancia, generalmente aprendiendo a clasificar los métodos. Las funciones de características son funciones arbitrarias del documento y la consulta, y como tales pueden incorporar fácilmente casi cualquier otro modelo de recuperación como una característica más.
- Modelos de fusión de datos: La fusión de datos en la recuperación de información combina resultados de múltiples sistemas de búsqueda o modelos de recuperación para mejorar el rendimiento. Al fusionar listas clasificadas, aprovecha las fortalezas de diversos enfoques, lo que a menudo mejora la exhaustividad y la precisión. Los métodos comunes incluyen la normalización de puntuaciones y técnicas de votación como CombSUM o el conteo de Borda. Esta estrategia de metabúsqueda es particularmente efectiva cuando los sistemas individuales tienen una cobertura complementaria o cuando la dificultad de la consulta varía, lo que produce una dispersión de clasificación final más robusta y confiable. [ 21 ] [ 22 ]
Segunda dimensión: propiedades del modelo
- Los modelos sin interdependencias entre términos tratan los diferentes términos/palabras como independientes. Este hecho se suele representar en los modelos de espacio vectorial mediante la suposición de ortogonalidad de los vectores de términos o, en los modelos probabilísticos, mediante la suposición de independencia de las variables de los términos.
- Los modelos con interdependencias inmanentes entre términos permiten representar dichas interdependencias. Sin embargo, el grado de interdependencia entre dos términos viene definido por el propio modelo. Generalmente, se deriva, directa o indirectamente (por ejemplo, mediante reducción dimensional ), de la coocurrencia de esos términos en el conjunto completo de documentos.
- Los modelos con interdependencias de términos trascendentes permiten representar las interdependencias entre términos, pero no especifican cómo se define la interdependencia entre dos términos. Recurren a una fuente externa para determinar el grado de interdependencia entre dos términos (por ejemplo, un ser humano o algoritmos sofisticados).
Tercera dimensión: clasificación basada en un enfoque representacional
Además de las distinciones teóricas, los modelos modernos de recuperación de información también se clasifican según cómo se representan y comparan las consultas y los documentos, utilizando una clasificación práctica que distingue entre modelos dispersos, densos e híbridos. [ 18 ]
- Los modelos dispersos utilizan representaciones interpretables basadas en términos y, por lo general, se basan en estructuras de índice invertidas. Los métodos clásicos como TF-IDF y BM25 se incluyen en esta categoría, junto con modelos dispersos aprendidos más recientes que integran arquitecturas neuronales manteniendo la dispersión. [ 23 ]
- Los modelos densos representan consultas y documentos como vectores continuos mediante modelos de aprendizaje profundo, generalmente codificadores basados en transformadores. Estos modelos permiten la coincidencia de similitud semántica más allá de la superposición exacta de términos y se utilizan en tareas que implican búsqueda semántica y respuesta a preguntas. [ 24 ]
- Los modelos híbridos buscan combinar las fortalezas de ambos enfoques, integrando señales léxicas (tokens) y semánticas a través de la fusión de puntuaciones, la interacción tardía o los procesos de clasificación de múltiples etapas. [ 25 ]
Esta clasificación se ha vuelto cada vez más común tanto en aplicaciones académicas como del mundo real y se está adoptando y utilizando ampliamente en puntos de referencia de evaluación para modelos de recuperación de información. [ 20 ] [ 23 ]
Medidas de rendimiento y corrección
La evaluación de un sistema de recuperación de información es el proceso de determinar qué tan bien un sistema satisface las necesidades de información de sus usuarios. En general, la medición considera un conjunto de documentos a buscar y una consulta de búsqueda. Las métricas de evaluación tradicionales, diseñadas para la recuperación booleana o la recuperación top-k, incluyen la precisión y la exhaustividad . Todas las medidas presuponen una noción de relevancia establecida : se sabe que cada documento es relevante o no relevante para una consulta particular. En la práctica, las consultas pueden estar mal planteadas y puede haber diferentes matices de relevancia.
Bibliotecas para búsqueda e indexación
Cronología
- Antes de 1900
- 1801 : Joseph Marie Jacquard inventa el telar Jacquard , la primera máquina que utiliza tarjetas perforadas para controlar una secuencia de operaciones.
- Década de 1880 : Herman Hollerith inventa una tabuladora de datos electromecánica que utiliza tarjetas perforadas como medio legible por máquina.
- Tarjetas Hollerith , perforadoras de tarjetas y tabuladoras de 1890 utilizadas para procesar los datos del censo estadounidense de 1890 .
- Décadas de 1920 y 1930
- Emanuel Goldberg solicita patentes para su "Máquina Estadística", un motor de búsqueda de documentos que utilizaba células fotoeléctricas y reconocimiento de patrones para buscar metadatos en rollos de documentos microfilmados.
- Décadas de 1940 a 1950
- Finales de la década de 1940 : El ejército estadounidense se enfrentó a problemas de indexación y recuperación de documentos de investigación científica capturados a los alemanes durante la guerra.
- 1945 : El poema "As We May Think" de Vannevar Bush apareció en la revista Atlantic Monthly .
- 1947 : Hans Peter Luhn (ingeniero de investigación en IBM desde 1941) comenzó a trabajar en un sistema mecanizado basado en tarjetas perforadas para la búsqueda de compuestos químicos.
- Década de 1950 : La creciente preocupación en los EE. UU. por una "brecha científica" con la URSS motivó, fomentó la financiación y proporcionó un telón de fondo para los sistemas mecanizados de búsqueda de literatura ( Allen Kent et al. ) y la invención del índice de citas por Eugene Garfield .
- 1950 : El término "recuperación de información" fue acuñado por Calvin Mooers . [ 26 ]
- 1951 : Philip Bagley realizó el primer experimento de recuperación computarizada de documentos en una tesis de maestría en el MIT . [ 27 ]
- 1955 : Allen Kent se unió a la Universidad Case Western Reserve y, con el tiempo, se convirtió en director asociado del Centro de Investigación en Documentación y Comunicaciones. Ese mismo año, Kent y sus colegas publicaron un artículo en American Documentation que describía las medidas de precisión y exhaustividad, además de detallar un "marco" propuesto para evaluar un sistema de recuperación de información que incluía métodos de muestreo estadístico para determinar la cantidad de documentos relevantes no recuperados. [ 28 ]
- 1958 : La Conferencia Internacional sobre Información Científica celebrada en Washington D. C. incluyó el análisis de los sistemas de infrarrojos como solución a los problemas identificados. Véase: Actas de la Conferencia Internacional sobre Información Científica de 1958 (Academia Nacional de Ciencias, Washington D. C., 1959).
- 1959 : Hans Peter Luhn publicó "Autocodificación de documentos para la recuperación de información".
- Finales de la década de 1940 : El ejército estadounidense se enfrentó a problemas de indexación y recuperación de documentos de investigación científica capturados a los alemanes durante la guerra.
- Década de 1960 :
- Principios de la década de 1960 : Gerard Salton comenzó a trabajar en Relaciones Internacionales en Harvard, y más tarde se trasladó a Cornell.
- 1960 : Melvin Earl Maron y John Lary Kuhns [ 29 ] publicaron "Sobre relevancia, indexación probabilística y recuperación de información" en el Journal of the ACM 7(3):216–244, julio de 1960.
- 1962 :
- Cyril W. Cleverdon publicó los primeros hallazgos de los estudios de Cranfield, desarrollando un modelo para la evaluación de sistemas de indexación. Véase: Cyril W. Cleverdon, «Informe sobre las pruebas y el análisis de una investigación sobre la eficiencia comparativa de los sistemas de indexación». Colección de Aeronáutica de Cranfield, Cranfield, Inglaterra, 1962.
- * Kent publicó Análisis y recuperación de información .
- 1963 :
- * El informe Weinberg, titulado "Ciencia, Gobierno e Información", articuló en profundidad la idea de una "crisis de la información científica". El informe recibió su nombre en honor al Dr. Alvin Weinberg .
- * Joseph Becker y Robert M. Hayes publicaron un texto sobre recuperación de información. Becker, Joseph; Hayes, Robert Mayo. Almacenamiento y recuperación de información: herramientas, elementos, teorías . Nueva York, Wiley (1963).
- 1964 :
- Karen Spärck Jones finalizó su tesis en Cambridge, titulada "Sinonimia y clasificación semántica" , y continuó trabajando en lingüística computacional aplicada a la recuperación de información.
- * La Oficina Nacional de Estándares patrocinó un simposio titulado "Métodos de asociación estadística para la documentación mecanizada". Se presentaron varios artículos de gran relevancia, incluyendo la primera referencia publicada de G. Salton (creemos) al sistema SMART .
- mediados de la década de 1960 :
- * La Biblioteca Nacional de Medicina (NLM, por sus siglas en inglés) desarrolló MEDLARS , el Sistema de Análisis y Recuperación de Literatura Médica, la primera base de datos legible por máquina y sistema de recuperación por lotes importante.
- * Proyecto Intrex en el MIT.
- 1965 : JCR Licklider publicó Bibliotecas del futuro .
- 1966 : Don Swanson participó en estudios en la Universidad de Chicago sobre los requisitos para futuros catálogos.
- Finales de la década de 1960 : F. Wilfrid Lancaster completó los estudios de evaluación del sistema MEDLARS y publicó la primera edición de su texto sobre recuperación de información.
- 1968 :
- * Gerard Salton publicó Organización y recuperación automática de la información .
- * El informe técnico de RADC de John W. Sammon, Jr., titulado "Algunos aspectos matemáticos del almacenamiento y la recuperación de información...", describió el modelo vectorial.
- 1969 : El artículo de Sammon " A nonlinear mapping for data structure analysis Archived 2017-08-08 at the Wayback Machine " (IEEE Transactions on Computers) fue la primera propuesta de interfaz de visualización para un sistema IR.
- década de 1970
- principios de la década de 1970 :
- * Primeros sistemas en línea: AIM-TWX y MEDLINE de la NLM; Dialog de Lockheed; ORBIT de SDC.
- * Theodor Nelson promovió el concepto de hipertexto , publicó Computer Lib/Dream Machines .
- 1971 : Nicholas Jardine y Cornelis J. van Rijsbergen publicaron "El uso de la agrupación jerárquica en la recuperación de información", que articuló la "hipótesis de agrupamiento". [ 30 ]
- 1975 : Tres publicaciones de gran influencia de Salton articularon completamente su marco de procesamiento vectorial y su modelo de discriminación de términos :
- 1978 : La primera conferencia ACM SIGIR .
- 1979 : CJ van Rijsbergen publicó Recuperación de información (Butterworths). Gran énfasis en los modelos probabilísticos.
- 1979 : Tamas Doszkocs implementó la interfaz de usuario de lenguaje natural CITE para MEDLINE en la Biblioteca Nacional de Medicina. El sistema CITE admitía la entrada de consultas de formato libre, la salida clasificada y la retroalimentación de relevancia. [ 31 ]
- principios de la década de 1970 :
- década de 1980
- 1980 : Primera conferencia internacional ACM SIGIR, celebrada conjuntamente con el grupo IR de la British Computer Society en Cambridge.
- 1982 : Nicholas J. Belkin , Robert N. Oddy y Helen M. Brooks propusieron el enfoque ASK (Anomalous State of Knowledge, Estado Anómalo del Conocimiento) para la recuperación de información. Este fue un concepto importante, aunque su herramienta de análisis automatizado resultó, en última instancia, decepcionante.
- 1983 : Salton (y Michael J. McGill) publicaron Introduction to Modern Information Retrieval (McGraw-Hill), con un fuerte énfasis en los modelos vectoriales.
- 1985 : David Blair y Bill Maron publican: Una evaluación de la eficacia de la recuperación para un sistema de recuperación de documentos de texto completo . [ 32 ]
- 1986 : Donald AB Lindberg , MD, director de la NLM, implementó una interfaz directa para profesionales de la salud con MEDLINE y otras bases de datos MEDLARS. Grateful Med , un juego de palabras con Grateful Dead , se adaptó de Microsearch, una interfaz de usuario de ELHILL que ensamblaba el lenguaje de consulta antes de conectarse al sistema central de la NLM. Después de recuperar los resultados de la consulta, Grateful Med se desconectaba del sistema central para mantener bajos los costos de búsqueda. [ 33 ]
- Mediados de la década de 1980 : Esfuerzos por desarrollar versiones para el usuario final de sistemas IR comerciales.
- 1985–1993 : Artículos clave sobre sistemas experimentales para interfaces de visualización.
- Obras de Donald B. Crouch , Robert R. Korfhage , Matthew Chalmers, Anselm Spoerri y otros.
- 1989 : Tim Berners-Lee presenta en el CERN las primeras propuestas para la World Wide Web .
- década de 1990
- 1992 : Primera conferencia de TREC .
- 1997 : Publicación de Almacenamiento y recuperación de información de Korfhage [ 34 ] con énfasis en la visualización y los sistemas de puntos de referencia múltiples.
- 1998: Google es fundado por Larry Page y Sergey Brin . Introduce el algoritmo PageRank, que evalúa la importancia de las páginas web en función de la estructura de hipervínculos. [ 12 ]
- 1999 : Publicación de Modern Information Retrieval de Ricardo Baeza-Yates y Berthier Ribeiro-Neto por Addison Wesley, el primer libro que intenta abarcar todos los aspectos de la recuperación de información.
- década de 2000
- 2001: Wikipedia se lanza como una enciclopedia en línea gratuita y colaborativa. Rápidamente se convierte en un recurso importante para la recuperación de información, particularmente para el procesamiento del lenguaje natural y los puntos de referencia de búsqueda semántica. [ 35 ]
- 2009: Microsoft lanza Bing, introduciendo funciones como búsquedas relacionadas, sugerencias semánticas y, posteriormente, incorporando técnicas de aprendizaje profundo en sus algoritmos de clasificación. [ 13 ]
- década de 2010
- 2013: El algoritmo Hummingbird de Google entra en funcionamiento, marcando un cambio de la coincidencia de palabras clave a la comprensión de la intención de la consulta y el contexto semántico en las consultas de búsqueda. [ 36 ]
- 2018: Investigadores de IA de Google lanzan BERT (Bidirectional Encoder Representations from Transformers), que permite una comprensión bidireccional profunda del lenguaje y mejora la clasificación de documentos y la comprensión de consultas en la recuperación de información. [ 14 ]
- 2019: Microsoft presenta MS MARCO (Microsoft Machine Reading CO mprehension), un conjunto de datos a gran escala diseñado para entrenar y evaluar modelos de lectura automática y clasificación de pasajes . [ 16 ]
- década de 2020
- 2020: El modelo ColBERT (Contextualized Late Interaction over BERT), diseñado para la recuperación eficiente de pasajes mediante incrustaciones contextualizadas, se presentó en SIGIR 2020. [ 37 ] [ 19 ]
- 2021: SPLADE se presenta en SIGIR 2021. Es un modelo de recuperación neuronal dispersa que equilibra las características léxicas y semánticas mediante modelado de lenguaje enmascarado y regularización de la dispersión. [ 38 ]
- 2022: Se publica el benchmark BEIR para evaluar la recuperación de información sin entrenamiento previo en 18 conjuntos de datos que abarcan diversas tareas. Estandariza las comparaciones entre modelos de recuperación de información densos, dispersos e híbridos. [ 23 ]
Conferencias importantes
- SIGIR: Grupo de Interés Especial en Recuperación de Información
- ECIR: Conferencia Europea sobre Recuperación de Información
- CIKM: Conferencia sobre Gestión de la Información y el Conocimiento
- WWW: Conferencia Internacional de la World Wide Web
Premios en el campo
Véase también
- Recuperación de información adversaria : estrategias de recuperación de información en conjuntos de datos
- Memoria de computadora : componente que almacena información.
- Vocabulario controlado : método para organizar el conocimiento.
- Recuperación de información multilingüe : recuperación de información en diferentes idiomas.
- Minería de datos : proceso de análisis de grandes conjuntos de datos.
- Recuperación de datos : método para obtener datos de una base de datos.
- Recuperación de información humano-computadora ( HCIR )
- Extracción de información : lectura automática de documentos no estructurados.
- Búsqueda de información : un tipo de actividad en la ciencia de la información.
- Centro de recuperación de información – Organización en Viena, Austria, 2006–2012
- Visualización del conocimiento : conjunto de técnicas para crear imágenes, diagramas o animaciones que comuniquen un mensaje. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Gestión de información personal : herramientas y sistemas para gestionar los propios datos.
- Cultivo de perlas : tipo de estrategia de búsqueda
- Comprensión de la consulta : paso de procesamiento del motor de búsqueda
- Relevancia (recuperación de información) : Medida de la aplicabilidad de un documento a un tema o consulta de búsqueda determinados.
- Retroalimentación de relevancia : datos utilizados en sistemas de recuperación y recomendación de información.
- Recuperabilidad – Propiedad de poder acceder a algo
- Clasificación de Rocchio : modelo de clasificación en aprendizaje automático
- Indexación de motores de búsqueda : método para la gestión de datos.
- Grupo de Interés Especial en Recuperación de Información – Subgrupo de la Asociación para la Maquinaria Informática
- Indexación temática : clasificar un documento mediante términos de indexación.
- Recuperación de información temporal : área de investigación relacionada con la recuperación de información centrada en la oportunidad.
- tf–idf – Estimación de la importancia de una palabra en un documento
- Recuperación de XML : recuperación de documentos XML basada en el contenido.
- Minería web : proceso de análisis de grandes conjuntos de datos. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
Referencias
- ↑ Luk, RWP (2022). "¿Por qué la recuperación de información es una disciplina científica?". Foundations of Science . 27 (2): 427– 453. doi : 10.1007/s10699-020-09685-x . hdl : 10397/94873 . S2CID 220506422 .
- ↑ Jansen, BJ; Rieh, S. (2010). "Los diecisiete constructos teóricos de la búsqueda y recuperación de información" (PDF) . Journal of the American Society for Information Sciences and Technology . 61 (8): 1517– 34. doi : 10.1002/asi.21358 .
- ↑ Goodrum, Abby A. (2000). "Recuperación de información de imágenes: una visión general de la investigación actual" (PDF) . Informing Science . 3 (2): 063– 066. doi : 10.28945/578 .
- ↑ Foote, Jonathan (1999). "Una visión general de la recuperación de información de audio". Multimedia Systems . 7 : 2–10 . CiteSeerX 10.1.1.39.6339 . doi : 10.1007/s005300050106 . S2CID 2000641 .
- ↑ Beel, Jöran; Gipp, Bela; Stiller, Jan-Olaf (2009). Recuperación de información en mapas mentales: ¿para qué podría ser útil? (PDF) . Actas de la 5.ª Conferencia Internacional sobre Computación Colaborativa: Redes, Aplicaciones y Trabajo Compartido (CollaborateCom'09). IEEE. doi : 10.4108/ICST.COLLABORATECOM2009.8298 . ISBN 978-963-9799-76-9.
- ↑ Frakes, William B.; Baeza-Yates, Ricardo (1992). Estructuras de datos y algoritmos para la recuperación de información . Prentice-Hall, Inc. ISBN 978-0-13-463837-9Archivado del original el 28 de septiembre de 2013.
- ↑ H Eidenberger. Comprensión fundamental de los medios , atpress, 2011, pág. 1.
- ↑ Sikos, LF (2016). "Herramientas de anotación de vídeo semántico basadas en RDF con mapeo de conceptos a Linked Data para la indexación de vídeo de próxima generación: una revisión exhaustiva" . Multimedia Tools and Applications . 76 (12): 14437– 14460. doi : 10.1007/s11042-016-3705-7 . S2CID 254832794 .
- 1 2 Singhal, Amit (2001). "Recuperación moderna de información: una breve descripción general" (PDF) . Boletín del Comité Técnico de Ingeniería de Datos de la Sociedad de Computación del IEEE . 24 (4): 35– 43.
- ↑ Mark Sanderson y W. Bruce Croft (2012). "La historia de la investigación en recuperación de información" . Actas del IEEE . 100 : 1444–51 . doi : 10.1109/jproc.2012.2189916 .
- ↑ JE Holmstrom (1948) .'Sección III. Sesión plenaria de apertura' . Conferencia de información científica de la Royal Society, 21 de junio - 2 de julio de 1948: Informe y ponencias presentadas : 85.
- 1 2 Brin, Sergey; Page, Lawrence (1998). "La anatomía de un motor de búsqueda web hipertextual a gran escala" (PDF) . Redes informáticas y sistemas ISDN . 30 ( 1–7 ): 107–117 . doi : 10.1016/S0169-7552(98)00110-X .
- 1 2 Uyar, Ahmet; Aliyu, Farouk Musa (2015-01-01). "Evaluación de las características de búsqueda de Google Knowledge Graph y Bing Satori: tipos de entidades, búsquedas de listas e interfaces de consulta" . Online Information Review . 39 (2): 197– 213. doi : 10.1108/OIR-10-2014-0257 . ISSN 1468-4527 .
- 1 2 Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (2018). "BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje". arXiv : 1810.04805 [ cs.CL ].
- ↑ Gardazi, Nadia Mushtaq; Daud, Ali; Malik, Muhammad Kamran; Bukhari, Amal; Alsahfi, Tariq; Alshemaimri, Bader (2025-03-15). "Aplicaciones de BERT en el procesamiento del lenguaje natural: una revisión" . Artificial Intelligence Review . 58 (6): 166. doi : 10.1007/s10462-025-11162-5 . ISSN 1573-7462 .
- 1 2 Bajaj, Payal; Campos, Daniel; Craswell, Nick; Deng, Li; Gao, Jianfeng; Liu, Xiaodong; Majumder, Rangan; McNamara, Andrew; Mitra, Bhaskar; Nguyen, Tri; Rosenberg, Mir; Song, Xia; Stoica, Alina; Tiwary, Saurabh; Wang, Tong (2016). "MS MARCO: Un conjunto de datos de comprensión lectora generada por máquinas generada por humanos". arXiv : 1611.09268 [ cs.CL ].
- ↑ Craswell, Nick; Mitra, Bhaskar; Yilmaz, Emine; Rahmani, Hossein A.; Campos, Daniel; Lin, Jimmy; Voorhees, Ellen M.; Soboroff, Ian (febrero de 2024). "Descripción general de la pista de aprendizaje profundo de TREC 2023" . Conferencia de recuperación de texto (TREC) – vía Microsoft.
- 1 2 Kim, Dohyun; Zhao, Lina; Chung, Eric; Park, Eun-Jae (2021). "Métodos DG escalonados robustos a la presión para las ecuaciones de Navier-Stokes en mallas generales". arXiv : 2107.09226 [ math.NA ].
- 1 2 Khattab, Omar; Zaharia, Matei (25 de julio de 2020). "ColBERT: Búsqueda de pasajes eficiente y efectiva mediante interacción tardía contextualizada sobre BERT" . Actas de la 43.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . SIGIR '20. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 39–48 . doi : 10.1145/3397271.3401075 . ISBN 978-1-4503-8016-4.
- 1 2 Lin, Jimmy; Nogueira, Rodrigo; Yates, Andrew (2020). "Transformers preentrenados para la clasificación de texto: BERT y más allá". arXiv : 2010.06467 [ cs.IR ].
- ↑ Shaw, Joseph A; Fox, Edward A. (1994) Combinación de búsquedas múltiples. TREC 1994: 105-108
- ↑ Wu, Shengli (2012). Fusión de datos en la recuperación de información . Springer. págs. 1–212 . ISBN 978-3-642-28865-4.
- 1 2 3 Thakur, Nandan; Reimers, Nils; Rücklé, Andreas; Srivastava, Abhishek; Gurevych, Iryna (2021). "BEIR: Un punto de referencia heterogéneo para la evaluación de cero disparos de modelos de recuperación de información". arXiv : 2104.08663 [ cs.IR ].
- ↑ Lau, Jey Han; Armendariz, Carlos; Lappin, Shalom; Purver, Matthew; Shu, Chang (2020). Johnson, Mark; Roark, Brian; Nenkova, Ani (eds.). "¿Con qué furia pueden dormir las ideas verdes incoloras? Aceptabilidad de las oraciones en contexto" . Transactions of the Association for Computational Linguistics . 8 : 296–310 . doi : 10.1162/tacl_a_00315 .
- ↑ Arabzadeh, Negar; Yan, Xinyi; Clarke, Charles LA (2021). "Predicción de las compensaciones entre eficiencia y efectividad para la selección de estrategias de recuperación densas frente a dispersas". arXiv : 2109.10739 [ cs.IR ].
- ↑ Mooers, Calvin N. (1951). La teoría del manejo digital de información no numérica y sus implicaciones para la economía de las máquinas . Boletín técnico de Zator (Informe técnico). 48., citado en Fairthorne, RA (1958). "Recuperación automática de información registrada" . The Computer Journal . 1 (1): 37. doi : 10.1093/comjnl/1.1.36 .
- ↑ Doyle, Lauren; Becker, Joseph (1975). Recuperación y procesamiento de información . Melville. ISBN 978-0-471-22151-7.
- ↑ Perry, James W.; Kent, Allen; Berry, Madeline M. (1955). "Búsqueda bibliográfica mediante máquinas X. Lenguaje máquina; factores subyacentes a su diseño y desarrollo". American Documentation . 6 (4): 242– 254. doi : 10.1002/asi.5090060411 .
- ↑ Maron, Melvin E. (2008). "Una nota histórica sobre los orígenes de la indexación probabilística" (PDF) . Procesamiento y gestión de la información . 44 (2): 971–2 . doi : 10.1016/j.ipm.2007.02.012 .
- ^ N. Jardine, CJ van Rijsbergen (diciembre de 1971). "El uso de agrupamiento jerárquico en la recuperación de información". Almacenamiento y recuperación de información . 7 (5): 217– 240. doi : 10.1016/0020-0271(71)90051-9 .
- ↑ Doszkocs, TE; Rapp, BA (1979). "Búsqueda en MEDLINE en inglés: una interfaz de usuario prototipo con consulta en lenguaje natural, resultados clasificados y retroalimentación de relevancia" . Opciones y políticas de información : 42.ª reunión anual, Minneapolis, Minnesota, 14-18 de octubre de 1979. Sociedad Estadounidense de Ciencias de la Información. Vol. 16. Publicaciones de la industria del conocimiento. págs. 131-139 . OCLC 271407392. OSTI 5047496 .
- ↑ Blair, DC; Maron, ME (1985). "Una evaluación de la efectividad de recuperación para un sistema de recuperación de documentos de texto completo". Communications of the ACM . 28 (3): 289– 299. doi : 10.1145/3166.3197 .
- ↑ Dorsch JL, Faughnan JG, Humphreys BL (junio de 2022). "Grateful Med: acceso directo a MEDLINE para profesionales de la salud con ordenadores personales" . Inf Serv Use . 42 (2): 151– 160. doi : 10.3233/ISU-220147 . PMC 9196098. PMID 35720429 .
- ↑ Korfhage, Robert R. (1997). Almacenamiento y recuperación de información . Wiley. 368 págs . ISBN 978-0-471-14338-3.
- ↑ "Historia de Wikipedia" , Wikipedia , 21 de febrero de 2025 , consultado el 9 de abril de 2025.
- ↑ Sullivan, Danny (26 de septiembre de 2013). "Preguntas frecuentes: Todo sobre el nuevo algoritmo "Hummingbird" de Google" . Search Engine Land . Recuperado el 9 de abril de 2025 .
- ↑ Khattab, Omar; Zaharia, Matei (2020). "ColBERT: Búsqueda de pasajes eficiente y efectiva mediante interacción tardía contextualizada sobre BERT". arXiv : 2004.12832 [ cs.IR ].
- ↑ Jones, Rosie; Zamani, Hamed; Schedl, Markus; Chen, Ching-Wei; Reddy, Sravana; Clifton, Ann; Karlgren, Jussi; Hashemi, Helia; Pappu, Aasish; Nazari, Zahra; Yang, Longqi; Semerci, Oguz; Bouchard, Hugues; Carterette, Ben (11 de julio de 2021). «Desafíos actuales y direcciones futuras en el acceso a la información de podcasts» . Actas de la 44.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . SIGIR '21. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1554–65 . arXiv : 2106.09227 . doi : 10.1145/3404835.3462805 . ISBN 978-1-4503-8037-9.
Lecturas adicionales
- Baeza-Yates, Ricardo; Ribeiro-Neto, Berthier (2011). Recuperación moderna de información: conceptos y tecnología detrás de la búsqueda (2.ª ed.). Addison-Wesley. ISBN 978-0-321-41691-9.
- Büttcher, Stefan; Clarke, Charles LA; Cormack, Gordon V. (2010). Recuperación de información: Implementación y evaluación de motores de búsqueda . MIT Press. ISBN 978-0-262-02651-2OCLC 473652398
- "Sistema de recuperación de información" . Red de Biblioteconomía y Ciencias de la Información . 24 de abril de 2015. Archivado del original el 11 de mayo de 2020. Consultado el 3 de mayo de 2020 .
- Manning, Christopher D.; Raghavan, Prabhakar; Schütze, Hinrich (2008). Introducción a la recuperación de información . Prensa de la Universidad de Cambridge. ISBN 978-0-521-86571-5.
- ShinJoung, Yeo (2023). Detrás del cuadro de búsqueda: Google y la industria global de Internet . University of Illinois Press. ISBN 978-0-252-05417-4. JSTOR jj.4116455 . OCLC 1371410330 .
Enlaces externos
- ACM SIGIR: Grupo de Interés Especial en Recuperación de Información
- BCS IRSG: Sociedad Británica de Informática – Grupo de Especialistas en Recuperación de Información
- Conferencia sobre Recuperación de Texto (TREC)
- Foro para la Evaluación de la Recuperación de Información (FIRE)
- Recuperación de información (libro en línea) por CJ van Rijsbergen
- Wiki de recuperación de información archivada el 24/11/2015 en Wayback Machine.
- Archivo de la herramienta de recuperación de información (22/05/2008) en Wayback Machine.
- Informe de TREC sobre técnicas de evaluación de la recuperación de información.
- Cómo eBay mide la relevancia de las búsquedas
- Herramienta de evaluación del rendimiento de la recuperación de información en el Centro de Investigación Athena.
- Recuperación de información
- Procesamiento del lenguaje natural