El descubrimiento de la verdad (también conocido como búsqueda de la verdad ) es el proceso de elegir el valor real de un dato cuando diferentes fuentes de datos proporcionan información contradictoria al respecto.
Se han propuesto varios algoritmos para abordar este problema, desde métodos simples como la votación por mayoría hasta otros más complejos capaces de estimar la confiabilidad de las fuentes de datos . [ 1 ]
Los problemas de descubrimiento de la verdad se pueden dividir en dos subclases: verdad única y verdad múltiple. En el primer caso, solo se permite un valor verdadero para un elemento de datos (por ejemplo, la fecha de nacimiento de una persona, la capital de un país). En cambio, en el segundo caso se permiten múltiples valores verdaderos (por ejemplo, el reparto de una película, los autores de un libro). [ 2 ] [ 3 ]
Por lo general, el descubrimiento de la verdad es el último paso de una canalización de integración de datos , cuando se han unificado los esquemas de diferentes fuentes de datos y se han detectado los registros que hacen referencia al mismo elemento de datos . [ 4 ]
Principios generales
La abundancia de datos disponibles en la web hace cada vez más probable encontrar que diferentes fuentes proporcionan valores (parcial o totalmente) diferentes para el mismo dato . Esto, junto con el hecho de que dependemos cada vez más de los datos para tomar decisiones importantes, motiva la necesidad de desarrollar buenos algoritmos de descubrimiento de la verdad . [ 5 ]
Muchos de los métodos disponibles actualmente se basan en una estrategia de votación para definir el valor real de un elemento de datos . Sin embargo, estudios recientes han demostrado que, si nos basamos únicamente en la votación por mayoría , podríamos obtener resultados erróneos incluso en el 30 % de los elementos de datos . [ 5 ]
La solución a este problema consiste en evaluar la fiabilidad de las fuentes y dar mayor importancia a los votos procedentes de fuentes fiables. [ 4 ] [ 5 ]
Idealmente, se podrían utilizar técnicas de aprendizaje supervisado para asignar una puntuación de fiabilidad a las fuentes tras el etiquetado manual de los valores proporcionados; desafortunadamente, esto no es factible, ya que el número de ejemplos etiquetados necesarios debería ser proporcional al número de fuentes , y en muchas aplicaciones el número de fuentes puede ser prohibitivo. [ 2 ] [ 6 ]
Descubrimiento de verdad única frente a descubrimiento de múltiples verdades
El descubrimiento de una sola verdad y el descubrimiento de múltiples verdades son dos problemas muy diferentes. [ 2 ]
El descubrimiento de una única verdad se caracteriza por las siguientes propiedades:
- Solo se permite un valor verdadero para cada elemento de datos ;
- Los diferentes valores proporcionados para un elemento de datos determinado se oponen entre sí;
- Los valores y las fuentes pueden ser correctos o erróneos.
En el caso de múltiples verdades, se cumplen las siguientes propiedades:
- La verdad está compuesta por un conjunto de valores;
- Los diferentes valores podrían ofrecer una verdad parcial;
- Atribuir un valor a un dato determinado no implica oponerse a todos los demás valores;
- El número de valores verdaderos para cada elemento de datos no se conoce de antemano.
El descubrimiento de múltiples verdades tiene características únicas que hacen que el problema sea más complejo y deben tenerse en cuenta al desarrollar soluciones de descubrimiento de la verdad. [ 2 ]
Los ejemplos que se presentan a continuación ilustran las principales diferencias entre ambos métodos. Sabiendo que en ambos ejemplos la fuente 1 proporciona la verdad, en el caso de una única verdad (primera tabla) podemos afirmar que las fuentes 2 y 3 se oponen a la verdad y, por consiguiente, proporcionan valores erróneos. Por otro lado, en el segundo caso (segunda tabla), las fuentes 2 y 3 no son ni correctas ni erróneas; simplemente proporcionan un subconjunto de los valores verdaderos y, al mismo tiempo, no se oponen a la verdad.
Fiabilidad de la fuente
La gran mayoría de los métodos de descubrimiento de la verdad se basan en un enfoque de votación: cada fuente vota por un valor de un elemento de datos determinado y, al final, el valor con el mayor número de votos se selecciona como el verdadero. En los métodos más sofisticados, los votos no tienen el mismo peso para todas las fuentes de datos ; de hecho, se da mayor importancia a los votos provenientes de fuentes confiables. [ 5 ]
La fiabilidad de una fuente generalmente no se conoce a priori , sino que se estima mediante un enfoque iterativo. En cada paso del algoritmo de descubrimiento de la verdad, se refina la puntuación de fiabilidad de cada fuente de datos , mejorando la evaluación de los valores reales, lo que a su vez conduce a una mejor estimación de la fiabilidad de las fuentes. Este proceso suele finalizar cuando todos los valores alcanzan un estado de convergencia. [ 5 ]
La confiabilidad de la fuente puede basarse en diferentes métricas, como la precisión de los valores proporcionados, la copia de valores de otras fuentes y la cobertura del dominio. [ 1 ]
Detectar comportamientos de copia es muy importante; de hecho, la copia permite difundir fácilmente valores falsos, lo que dificulta enormemente el descubrimiento de la verdad, ya que muchas fuentes votarían por valores erróneos. Por lo general, los sistemas disminuyen el peso de los votos asociados a los valores copiados o incluso no los contabilizan en absoluto. [ 7 ]
Métodos de verdad única
La mayoría de los métodos de descubrimiento de la verdad disponibles actualmente han sido diseñados para funcionar bien solo en el caso de una única verdad. [ 1 ] [ 3 ]
A continuación se describen algunas de las características de las tipologías más relevantes de métodos de verdad única y cómo diferentes sistemas modelan la confiabilidad de la fuente. [ 5 ]
Votación mayoritaria
La votación por mayoría es el método más sencillo; el valor más popular se selecciona como el verdadero. Este método se utiliza habitualmente como referencia al evaluar el rendimiento de métodos más complejos.
Basado en enlaces web
Estos métodos estiman la confiabilidad de las fuentes mediante una técnica similar a la utilizada para medir la autoridad de las páginas web a partir de enlaces web . El voto asignado a un valor se calcula como la suma de la confiabilidad de las fuentes que proporcionan ese valor en particular, mientras que la confiabilidad de una fuente se calcula como la suma de los votos asignados a los valores que proporciona dicha fuente. [ 5 ] [ 8 ]
Recuperación de información basada en
Estos métodos estiman la confiabilidad de la fuente utilizando medidas de similitud que se emplean habitualmente en la recuperación de información . La confiabilidad de la fuente se calcula como la similitud del coseno (u otras medidas de similitud ) entre el conjunto de valores proporcionados por la fuente y el conjunto de valores considerados verdaderos (seleccionados de forma probabilística u obtenidos a partir de una verdad fundamental). [ 5 ] [ 9 ]
Basado en Bayes
Estos métodos utilizan la inferencia bayesiana para definir la probabilidad de que un valor sea verdadero, condicionada a los valores proporcionados por todas las fuentes.
dóndees un valor proporcionado para un elemento de datosyes el conjunto de valores observados proporcionados por todas las fuentes para ese elemento de datos específico .
La confiabilidad de una fuente se calcula entonces en función de la precisión de los valores que proporciona. [ 7 ] [ 10 ] Otros métodos más complejos explotan la inferencia bayesiana para detectar comportamientos de copia y utilizan estos conocimientos para evaluar mejor la confiabilidad de la fuente. [ 7 ]
Métodos de verdad múltiple
Debido a su complejidad , se ha dedicado menos atención al estudio del descubrimiento de múltiples verdades [ 2 ] [ 3 ].
A continuación se describen dos tipologías de métodos de verdad múltiple y sus características.
Basado en Bayes
Estos métodos utilizan la inferencia bayesiana para definir la probabilidad de que un grupo de valores sea verdadero, condicionada a los valores proporcionados por todas las fuentes de datos . En este caso, dado que podría haber múltiples valores verdaderos para cada elemento de datos , y las fuentes pueden proporcionar múltiples valores para un mismo elemento, no es posible considerar los valores individualmente. Una alternativa es considerar las correspondencias y relaciones entre el conjunto de valores proporcionados y las fuentes que los suministran. La confiabilidad de una fuente se calcula entonces en función de la precisión de los valores que proporciona. [ 2 ]
Los métodos más sofisticados también consideran la cobertura del dominio y los comportamientos de copia para estimar mejor la confiabilidad de la fuente. [ 2 ] [ 3 ]
Modelos gráficos probabilísticos basados en
Estos métodos utilizan modelos gráficos probabilísticos para definir automáticamente el conjunto de valores verdaderos de un elemento de datos dado y también para evaluar la calidad de la fuente sin necesidad de supervisión alguna. [ 11 ]
Aplicaciones
Muchas aplicaciones del mundo real pueden beneficiarse del uso de algoritmos de descubrimiento de la verdad. Los dominios de aplicación típicos incluyen: atención médica , detección colectiva/social , agregación de crowdsourcing , extracción de información y construcción de bases de conocimiento . [ 1 ]
Los algoritmos de descubrimiento de la verdad también podrían utilizarse para revolucionar la forma en que se clasifican las páginas web en los motores de búsqueda , pasando de los métodos actuales basados en el análisis de enlaces como PageRank , a procedimientos que clasifican las páginas web en función de la precisión de la información que proporcionan. [ 12 ]
Véase también
- Integración de datos
- Integración de la información
- Fusión de datos (integración de datos)
- Calidad de los datos
Referencias
- 1 2 3 4 Li, Yaliang; Gao, Jing ; Meng, Chuishi; Li, Qi; Su, Lu; Zhao, Bo; Fan, Wei; Han, Jiawei (25 de febrero de 2016). "Una encuesta sobre el descubrimiento de la verdad". Boletín de exploraciones de ACM SIGKDD . 17 (2): 1– 16. doi : 10.1145/2897350.2897352 . S2CID 9060471 .
- 1 2 3 4 5 6 7 Wang, Xianzhi; Sheng, Quan Z.; Fang, Xiu Susie; Yao, Lina; Xu, Xiaofei; Li, Xue (2015). "Un enfoque bayesiano integrado para el descubrimiento efectivo de múltiples verdades" . Actas de la 24.ª Conferencia Internacional ACM sobre Gestión de la Información y el Conocimiento . Melbourne, Australia: ACM Press. págs. 493–502 . doi : 10.1145/2806416.2806443 . hdl : 2440/110033 . ISBN 9781450337946. S2CID 16207808 .
- 1 2 3 4 Lin, Xueling; Chen, Lei (2018). "Descubrimiento de múltiples verdades consciente del dominio a partir de fuentes conflictivas". Actas de la Fundación VLDB . 11 (5): 635– 647. doi : 10.1145/3187009.3177739 .
- 1 2 Dong, Xin Luna ; Srivastava, Divesh (2015-02-15). "Integración de Big Data" . Synthesis Lectures on Data Management . 7 (1): 1– 198. doi : 10.2200/S00578ED1V01Y201404DTM040 . ISSN 2153-5418 .
- 1 2 3 4 5 6 7 8 Li, Xian; Dong, Xin Luna ; Lyons, Kenneth; Meng, Weiyi; Srivastava, Divesh (2012-12-01). "Encontrar la verdad en la web profunda: ¿se ha resuelto el problema?". Actas de la Fundación VLDB . 6 (2): 97– 108. arXiv : 1503.00303 . doi : 10.14778/2535568.2448943 . S2CID 3133027 .
- ↑ Ng, Andrew Y; Jordan, Michael I. (2001). "Sobre clasificadores discriminativos frente a generativos: una comparación de regresión logística y Naive Bayes" . NIPS'01: Actas de la 15.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal: Naturales y Sintéticos . págs. 841–848 .
- 1 2 3 Dong, Xin Luna ; Berti-Equille, Laure; Srivastava, Divesh (2009-08-01). "Integración de datos contradictorios: el papel de la dependencia de la fuente" . Actas de la Fundación VLDB . 2 (1): 550– 561. doi : 10.14778/1687627.1687690 . S2CID 9664056 .
- ↑ Kleinberg, Jon M. (1999-09-01). "Fuentes autorizadas en un entorno hipervinculado" . Journal of the ACM . 46 (5): 604– 632. doi : 10.1145/324133.324140 . S2CID 221584113 .
- ↑ Galland, Alban; Abiteboul, Serge; Marian, Amélie; Senellart, Pierre (2010). «Corroborando información a partir de puntos de vista divergentes» . Actas de la tercera conferencia internacional de la ACM sobre búsqueda web y minería de datos (PDF) . Nueva York, Nueva York, EE. UU.: ACM Press. págs. 131–140 . doi : 10.1145/1718487.1718504 . ISBN 9781605588896. S2CID 1761360 .
- ↑ Xiaoxin Yin; Jiawei Han; Yu, PS (2008). "Descubrimiento de la verdad con múltiples proveedores de información conflictivos en la web". IEEE Transactions on Knowledge and Data Engineering . 20 (6): 796– 808. Bibcode : 2008ITKDE..20..796Y . doi : 10.1109/TKDE.2007.190745 . ISSN 1041-4347 .
- ↑ Zhao, Bo; Rubinstein, Benjamin IP; Gemmell, Jim; Han, Jiawei (2012-02-01). "Un enfoque bayesiano para descubrir la verdad a partir de fuentes conflictivas para la integración de datos". Actas de la Fundación VLDB . 5 (6): 550– 561. arXiv : 1203.0058 . doi : 10.14778/2168651.2168656 . S2CID 8837716 .
- ↑ "Las enormes implicaciones de la idea de Google de clasificar los sitios web según su precisión" . www.washingtonpost.com . 2015.
- Bases de datos