Articulo de referencia

Búsqueda semántica

La búsqueda semántica se refiere a la búsqueda con significado, a diferencia de la búsqueda léxica, donde el motor de búsqueda busca coincidencias literales de las palabras de l...

La búsqueda semántica se refiere a la búsqueda con significado, a diferencia de la búsqueda léxica, donde el motor de búsqueda busca coincidencias literales de las palabras de la consulta o variantes de las mismas, sin comprender el significado general de la consulta. [ 1 ] La búsqueda semántica es un enfoque para la recuperación de información que busca mejorar la precisión de la búsqueda al comprender la intención del usuario y el significado contextual de los términos tal como aparecen en el espacio de datos de búsqueda, ya sea en la web o dentro de un sistema cerrado, para generar resultados más relevantes. Los sistemas modernos de búsqueda semántica utilizan incrustaciones vectoriales que convierten palabras, frases o documentos en vectores numéricos. Esto permite que el motor encuentre resultados basados ​​en el significado, no solo en coincidencias exactas de palabras clave. [ 2 ] [ 3 ]

Algunos autores consideran la búsqueda semántica como un conjunto de técnicas para recuperar conocimiento de fuentes de datos ricamente estructuradas, como ontologías y XML, presentes en la Web Semántica . [ 4 ] Estas tecnologías permiten la articulación formal del conocimiento del dominio con un alto nivel de expresividad y podrían permitir al usuario especificar su intención con mayor detalle al realizar la consulta. [ 5 ] La articulación mejora la relevancia y la profundidad del contenido al incluir lugares, personas o conceptos específicos relevantes para la consulta.

Modelos y herramientas

Herramientas como el Knowledge Graph de Google proporcionan relaciones estructuradas entre entidades para enriquecer la interpretación de las consultas. [ 6 ]

Modelos como BERT y Sentence-BERT convierten palabras u oraciones en vectores densos para la comparación de similitud. [ 7 ]

Las ontologías semánticas como Web Ontology Language , Resource Description Framework y Schema.org organizan conceptos y relaciones, lo que permite a los sistemas inferir términos relacionados y significados más profundos. [ 8 ]

Los modelos de búsqueda híbridos combinan la recuperación léxica (por ejemplo, BM25 ) con la clasificación semántica utilizando modelos transformadores preentrenados para un rendimiento óptimo. [ 9 ]

Véase también

Referencias

  1. Bast, Hannah; Buchhold, Björn; Haussmann, Elmar (2016). "Búsqueda semántica en texto y bases de conocimiento" . Foundations and Trends in Information Retrieval . 10 ( 2–3 ): 119–271 . doi : 10.1561/1500000032 . Recuperado el 1 de diciembre de 2018 .
  2. ^ Klampanos, Iraklis A. (2 de junio de 2009). "Manning Christopher, Prabhakar Raghavan, Hinrich Schütze: Introducción a la recuperación de información" . Recuperación de información . 12 (5): 609– 612. doi : 10.1007/s10791-009-9096-x . ISSN 1386-4564 . 
  3. Kim, Bosung; Hong, Taesuk; Ko, Youngjoong; Seo, Jungyun (2020). "Aprendizaje multitarea para la compleción de grafos de conocimiento con modelos de lenguaje preentrenados" . Actas de la 28.ª Conferencia Internacional sobre Lingüística Computacional . Stroudsburg, PA, EE. UU.: Comité Internacional de Lingüística Computacional. doi : 10.18653/v1/2020.coling-main.153 .
  4. Dong, Hai (2008). Un estudio sobre tecnologías de búsqueda semántica . IEEE. pp. 403–408 . Recuperado el 1 de mayo de 2009 . 
  5. Ruotsalo, T. (mayo de 2012). «Recuperación de datos específicos de dominio en la Web Semántica». La Web Semántica: Investigación y Aplicaciones . Eswc2012. Lecture Notes in Computer Science. Vol. 7295. pp. 422–436 . doi : 10.1007/978-3-642-30284-8_35 . ISBN   978-3-642-30283-1.
  6. Singhal, A. (2012). Presentación del grafo de conocimiento: cosas, no cadenas. Blog de Google. https://blog.google/products/search/introducing-knowledge-graph-things-not/
  7. Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Incrustaciones de oraciones mediante redes BERT siamesas. EMNLP 2019. https://arxiv.org/abs/1908.10084
  8. Bodenreider, O. (2004). El Sistema Unificado de Lenguaje Médico (UMLS): integración de la terminología biomédica. Nucleic Acids Research , 32(supl._1), D267–D270.
  9. Lin, J., et al. (2021). Transformers preentrenados para la clasificación de textos: BERT y más allá. https://arxiv.org/abs/2010.06467
  • Taller de Búsqueda Semántica 2008 en ESWC'08
  • Taller de Búsqueda Semántica 2010 en WWW2010
  • Taller sobre el aprovechamiento de las anotaciones semánticas en la recuperación de información en ECIR'08 .