La vinculación de registros (también conocida como coincidencia de datos , enlace de datos , resolución de entidades y muchos otros términos) es la tarea de encontrar registros en un conjunto de datos que se refieren a la misma entidad en diferentes fuentes de datos (por ejemplo, archivos de datos, libros, sitios web y bases de datos). La vinculación de registros es necesaria al unir diferentes conjuntos de datos basados en entidades que pueden o no compartir un identificador común (por ejemplo, clave de base de datos , URI , número de identificación nacional ), lo que puede deberse a diferencias en la forma del registro, la ubicación de almacenamiento o el estilo o preferencia del curador. Un conjunto de datos que ha sido sometido a una conciliación orientada a la resolución de registros puede denominarse conjunto de datos con enlaces cruzados .
Convenciones de nomenclatura
El término «vinculación de registros» es utilizado por estadísticos, epidemiólogos e historiadores, entre otros, para describir el proceso de combinar registros de una fuente de datos con otra que describen la misma entidad. Sin embargo, se utilizan muchos otros términos para este proceso. Desafortunadamente, esta profusión de terminología ha dado lugar a pocas referencias cruzadas entre estas comunidades de investigación. [ 1 ] [ 2 ]
Los informáticos suelen referirse a ello como "coincidencia de datos" o como el "problema de identidad de objetos". Las aplicaciones comerciales de correo y bases de datos lo denominan "procesamiento de fusión/purga" o "limpieza de listas". Otros nombres utilizados para describir el mismo concepto incluyen: "resolución de correferencia/entidad/identidad/nombre/registro", "desambiguación/vinculación de entidades", "coincidencia aproximada", "detección de duplicados", "deduplicación", "coincidencia de registros", "reconciliación (de referencia)", "identificación de objetos", "integración de datos/información" y "confusión". [ 3 ]
Aunque comparten nombres similares, la vinculación de registros y los datos enlazados son dos enfoques distintos para procesar y estructurar datos. Si bien ambos implican la identificación de entidades coincidentes en diferentes conjuntos de datos, la vinculación de registros suele equiparar las "entidades" con personas físicas; por el contrario, los datos enlazados se basan en la posibilidad de interconectar cualquier recurso web entre conjuntos de datos, utilizando un concepto de identificador correspondientemente más amplio: una URI .
Historia
La idea inicial de vinculación de registros se remonta a Halbert L. Dunn en su artículo de 1946 titulado "Vinculación de registros", publicado en el American Journal of Public Health . [ 4 ]
Howard Borden Newcombe sentó las bases probabilísticas de la teoría moderna de vinculación de registros en un artículo de 1959 en Science . [ 5 ] Estas fueron formalizadas en 1969 por Ivan Fellegi y Alan Sunter, en su obra pionera "A Theory For Record Linkage", donde demostraron que la regla de decisión probabilística que describieron era óptima cuando los atributos de comparación eran condicionalmente independientes. [ 6 ] En su trabajo reconocieron el creciente interés en aplicar los avances en computación y automatización a grandes colecciones de datos administrativos , y la teoría de Fellegi-Sunter sigue siendo el fundamento matemático para muchas aplicaciones de vinculación de registros.
Desde finales de la década de 1990, se han desarrollado diversas técnicas de aprendizaje automático que, en condiciones favorables, pueden utilizarse para estimar las probabilidades condicionales requeridas por la teoría de Fellegi-Sunter. Varios investigadores han informado que el supuesto de independencia condicional del algoritmo de Fellegi-Sunter a menudo se incumple en la práctica; sin embargo, los esfuerzos publicados para modelar explícitamente las dependencias condicionales entre los atributos de comparación no han dado como resultado una mejora en la calidad de la vinculación de registros. Por otro lado, los algoritmos de aprendizaje automático o de redes neuronales que no se basan en estos supuestos suelen proporcionar una precisión mucho mayor cuando se dispone de suficientes datos de entrenamiento etiquetados. [ 7 ]
La vinculación de registros puede realizarse completamente sin la ayuda de una computadora, pero las principales razones por las que se suelen utilizar computadoras para completar la vinculación de registros son reducir o eliminar la revisión manual y facilitar la reproducibilidad de los resultados. La comparación computarizada ofrece las ventajas de permitir la supervisión centralizada del procesamiento, un mejor control de calidad, mayor velocidad, consistencia y una mejor reproducibilidad de los resultados. [ 8 ]
Métodos
preprocesamiento de datos
La vinculación de registros es muy sensible a la calidad de los datos que se vinculan, por lo que idealmente todos los conjuntos de datos considerados (en particular sus campos de identificadores clave) deberían someterse a una evaluación de calidad de datos antes de la vinculación. Muchos identificadores clave para una misma entidad pueden presentarse de forma muy diferente entre conjuntos de datos (e incluso dentro de ellos), lo que puede complicar enormemente la vinculación de registros si no se comprende de antemano. Por ejemplo, los identificadores clave de un hombre llamado William J. Smith podrían aparecer en tres conjuntos de datos diferentes de la siguiente manera:
En este ejemplo, los diferentes estilos de formato dan lugar a registros que parecen distintos, pero que en realidad se refieren a la misma entidad con los mismos valores de identificador lógico. La mayoría, si no todas, las estrategias de vinculación de registros darían como resultado una vinculación más precisa si estos valores se normalizaran o estandarizaran primero a un formato coherente (por ejemplo, todos los nombres son "Apellido, Nombre" y todas las fechas son "AAAA/MM/DD"). La estandarización se puede lograr mediante transformaciones de datos simples basadas en reglas o procedimientos más complejos como la tokenización basada en léxico y los modelos ocultos de Markov probabilísticos. [ 9 ] Varios de los paquetes enumerados en la sección Implementaciones de software proporcionan algunas de estas características para simplificar el proceso de estandarización de datos.
Resolución de entidades
La resolución de entidades es un proceso de inteligencia operativa , generalmente impulsado por un motor o middleware de resolución de entidades , que permite a las organizaciones conectar diversas fuentes de datos para comprender posibles coincidencias de entidades y relaciones no evidentes entre múltiples silos de datos . Analiza toda la información relativa a individuos y/o entidades proveniente de diversas fuentes de datos y, a continuación, aplica puntuaciones de probabilidad para determinar qué identidades coinciden y qué relaciones, si las hay, no son evidentes entre ellas.
Los motores de resolución de entidades se utilizan habitualmente para detectar riesgos , fraudes y conflictos de intereses, pero también son herramientas útiles para la integración de datos de clientes (CDI) y la gestión de datos maestros (MDM). Entre los usos típicos de los motores de resolución de entidades se incluyen la detección de terrorismo, la detección de fraude en seguros , el cumplimiento de la Ley Patriota de EE. UU. , la detección de redes delictivas organizadas en el sector minorista y la evaluación de candidatos.
Por ejemplo, en diferentes silos de datos (registros de empleados, datos de proveedores, listas de vigilancia, etc.), una organización puede tener varias variantes de una entidad llamada ABC, que pueden o no ser la misma persona. De hecho, estas entradas pueden aparecer como ABC1, ABC2 o ABC3 en dichas fuentes de datos. Al comparar las similitudes entre atributos subyacentes como la dirección , la fecha de nacimiento o el número de la seguridad social , el usuario puede descartar algunas posibles coincidencias y confirmar otras como muy probables.
Los motores de resolución de entidades aplican reglas, basadas en la lógica del sentido común, para identificar relaciones ocultas en los datos. En el ejemplo anterior, es posible que ABC1 y ABC2 no sean la misma persona, sino dos personas distintas que comparten atributos comunes como la dirección o el número de teléfono.
Coincidencia de datos
Si bien las soluciones de resolución de entidades incluyen tecnología de cotejo de datos, muchas ofertas de cotejo de datos no se ajustan a la definición de resolución de entidades. A continuación, se presentan cuatro factores que distinguen la resolución de entidades del cotejo de datos, según John Talburt, director del Centro de Investigación Avanzada en Resolución de Entidades y Calidad de la Información de la UALR :
- Funciona tanto con registros estructurados como no estructurados, e implica el proceso de extracción de referencias cuando las fuentes son no estructuradas o semiestructuradas.
- Utiliza reglas de negocio y modelos conceptuales elaborados para lidiar con información faltante, contradictoria y corrupta.
- Utiliza información de vinculación afirmada (asociación) que no coincide, además de la coincidencia directa.
- Descubre relaciones y redes de asociación no evidentes (es decir, quién está asociado con quién).
A diferencia de los productos de calidad de datos, los motores de resolución de identidades más potentes también incluyen un motor de reglas y un proceso de flujo de trabajo que aplican inteligencia empresarial a las identidades resueltas y sus relaciones. Estas tecnologías avanzadas toman decisiones automatizadas e impactan los procesos empresariales en tiempo real, lo que reduce la necesidad de intervención humana.
Vinculación de registros determinista
El tipo más simple de vinculación de registros, llamado vinculación de registros determinista o basada en reglas , genera vínculos en función del número de identificadores individuales que coinciden entre los conjuntos de datos disponibles. [ 10 ] Se dice que dos registros coinciden mediante un procedimiento de vinculación de registros determinista si todos o algunos de sus identificadores (por encima de un cierto umbral) son idénticos. La vinculación de registros determinista es una buena opción cuando las entidades en los conjuntos de datos se identifican mediante un identificador común, o cuando existen varios identificadores representativos (por ejemplo, nombre, fecha de nacimiento y sexo al identificar a una persona) cuya calidad de datos es relativamente alta.
Como ejemplo, consideremos dos conjuntos de datos estandarizados, el Conjunto A y el Conjunto B, que contienen información diferente sobre pacientes en un sistema hospitalario. Ambos conjuntos identifican a los pacientes mediante diversos identificadores: número de la Seguridad Social (SSN), nombre, fecha de nacimiento (DOB), sexo y código postal (ZIP). Los registros de ambos conjuntos de datos (identificados con la columna "#") se muestran a continuación:
La estrategia de vinculación de registros determinista más sencilla consistiría en elegir un único identificador, como el número de la seguridad social (SSN), y declarar que los registros que comparten el mismo valor identifican a la misma persona, mientras que los que no lo comparten identifican a personas diferentes. En este ejemplo, la vinculación determinista basada en el SSN crearía entidades basadas en A1 y A2; A3 y B1; y A4. Si bien A1, A2 y B2 parecen representar la misma entidad, B2 no se incluiría en la coincidencia porque le falta un valor para el SSN.
El manejo de excepciones como la falta de identificadores implica la creación de reglas adicionales de vinculación de registros. Una de estas reglas, en el caso de un número de seguro social faltante, podría ser comparar el nombre, la fecha de nacimiento, el sexo y el código postal con otros registros con la esperanza de encontrar una coincidencia. En el ejemplo anterior, esta regla aún no relacionaría A1/A2 con B2 porque los nombres aún son ligeramente diferentes: la estandarización los puso en el formato correcto (Apellido, Nombre), pero no pudo discernir "Bill" como un apodo para "William". Procesar los nombres a través de un algoritmo fonético como Soundex , NYSIIS o Metaphone puede ayudar a resolver este tipo de problemas. Sin embargo, aún podrían tener problemas con los cambios de apellido como resultado del matrimonio o el divorcio, pero entonces B2 solo se relacionaría con A1, ya que el código postal en A2 es diferente. Por lo tanto, sería necesario crear otra regla para determinar si las diferencias en identificadores particulares son aceptables (como el código postal) y cuáles no lo son (como la fecha de nacimiento).
Como demuestra este ejemplo, incluso una pequeña disminución en la calidad de los datos o un pequeño aumento en su complejidad puede resultar en un incremento considerable en la cantidad de reglas necesarias para vincular correctamente los registros. Con el tiempo, estas reglas de vinculación se volverán demasiado numerosas e interrelacionadas para su creación sin la ayuda de herramientas de software especializadas. Además, las reglas de vinculación suelen ser específicas de la naturaleza de los conjuntos de datos que se pretenden vincular. Un estudio logró vincular el Archivo Maestro de Defunciones de la Seguridad Social con dos registros hospitalarios del Medio Oeste de Estados Unidos utilizando el número de la Seguridad Social (SSN), el nombre codificado en NYSIIS, el mes de nacimiento y el sexo; sin embargo, estas reglas podrían no funcionar igual de bien con conjuntos de datos de otras regiones geográficas o con datos recopilados de poblaciones más jóvenes. [ 11 ] Por lo tanto, es necesario realizar pruebas de mantenimiento continuas de estas reglas para garantizar que sigan funcionando como se espera a medida que nuevos datos ingresan al sistema y necesitan ser vinculados. Los nuevos datos que presenten características diferentes a las inicialmente previstas podrían requerir una reconstrucción completa del conjunto de reglas de vinculación de registros, lo que podría ser una tarea muy costosa y que consume mucho tiempo.
Vinculación probabilística de registros
La vinculación probabilística de registros , a veces denominada coincidencia difusa (o fusión probabilística o fusión difusa en el contexto de la fusión de bases de datos), adopta un enfoque diferente al problema de la vinculación de registros al considerar una gama más amplia de identificadores potenciales, calcular ponderaciones para cada identificador en función de su capacidad estimada para identificar correctamente una coincidencia o una no coincidencia, y utilizar estas ponderaciones para calcular la probabilidad de que dos registros dados se refieran a la misma entidad. Los pares de registros con probabilidades superiores a un cierto umbral se consideran coincidencias, mientras que los pares con probabilidades inferiores a otro umbral se consideran no coincidencias; los pares que se encuentran entre estos dos umbrales se consideran "posibles coincidencias" y pueden tratarse en consecuencia (por ejemplo, revisión humana, vinculación o no vinculación, según los requisitos). Mientras que la vinculación determinista de registros requiere una serie de reglas potencialmente complejas que deben programarse con antelación, los métodos de vinculación probabilística de registros pueden "entrenarse" para funcionar bien con mucha menos intervención humana.
Muchos algoritmos de vinculación de registros probabilísticos asignan ponderaciones de coincidencia/no coincidencia a los identificadores mediante dos probabilidades llamadasy. ElLa probabilidad es la probabilidad de que un identificador en dos registros que no coinciden coincida puramente por casualidad. Por ejemplo, elLa probabilidad del mes de nacimiento (donde doce valores se distribuyen aproximadamente de manera uniforme) es; los identificadores con valores que no están distribuidos uniformemente tendrán diferentesprobabilidades para diferentes valores (posiblemente incluyendo valores faltantes).La probabilidad es la probabilidad de que un identificador en pares coincidentes coincida (o sea suficientemente similar, como cadenas con baja distancia de Jaro-Winkler o Levenshtein ). Este valor seríaen el caso de datos perfectos, pero dado que esto rara vez (si acaso alguna vez) es cierto, en su lugar se puede estimar. Esta estimación se puede realizar basándose en el conocimiento previo de los conjuntos de datos, identificando manualmente un gran número de pares coincidentes y no coincidentes para "entrenar" el algoritmo de vinculación de registros probabilísticos, o ejecutando iterativamente el algoritmo para obtener estimaciones más cercanas de laprobabilidad. Si un valor dedebían ser estimados para elprobabilidad, entonces los pesos de coincidencia/no coincidencia para el identificador del mes de nacimiento serían:
The same calculations would be done for all other identifiers under consideration to find their match/non-match weights. Then, every identifier of one record would be compared with the corresponding identifier of another record to compute the total weight of the pair: the match weight is added to the running total whenever a pair of identifiers agree, while the non-match weight is added (i.e. the running total decreases) whenever the pair of identifiers disagrees. The resulting total weight is then compared to the aforementioned thresholds to determine whether the pair should be linked, non-linked, or set aside for special consideration (e.g. manual validation).[12]
Blocking
Determining where to set the match/non-match thresholds is a balancing act between obtaining an acceptable sensitivity (or recall, the proportion of truly matching records that are linked by the algorithm) and positive predictive value (or precision, the proportion of records linked by the algorithm that truly do match). Various manual and automated methods are available to predict the best thresholds, and some record linkage software packages have built-in tools to help the user find the most acceptable values. Because this can be a very computationally demanding task, particularly for large data sets, a technique known as blocking is often used to improve efficiency. Blocking attempts to restrict comparisons to just those records for which one or more particularly discriminating identifiers agree, which has the effect of increasing the positive predictive value (precision) at the expense of sensitivity (recall).[12] For example, blocking based on a phonetically coded surname and ZIP code would reduce the total number of comparisons required and would improve the chances that linked records would be correct (since two identifiers already agree), but would potentially miss records referring to the same person whose surname or ZIP code was different (due to marriage or relocation, for instance). Blocking based on birth month, a more stable identifier that would be expected to change only in the case of data error, would provide a more modest gain in positive predictive value and loss in sensitivity, but would create only twelve distinct groups which, for extremely large data sets, may not provide much net improvement in computation speed. Thus, robust record linkage systems often use multiple blocking passes to group data in various ways in order to come up with groups of records that should be compared to each other.
Machine learning
En los últimos años, se han utilizado diversas técnicas de aprendizaje automático en la vinculación de registros. Se ha reconocido [ 7 ] que el algoritmo clásico de Fellegi-Sunter para la vinculación probabilística de registros descrito anteriormente es equivalente al algoritmo Naive Bayes en el campo del aprendizaje automático, [ 13 ] y adolece de la misma suposición de independencia de sus características (una suposición que normalmente no es cierta). [ 14 ] [ 15 ] A menudo se puede lograr una mayor precisión utilizando otras técnicas de aprendizaje automático, como un perceptrón de una sola capa , [ 7 ] bosques aleatorios y SVM . [ 16 ] En combinación con tecnologías distribuidas, [ 17 ] se puede mejorar aún más la precisión y la escala para la vinculación de registros.
Vinculación de registros híbrida hombre-máquina
La vinculación de registros de alta calidad a menudo requiere un sistema híbrido humano-máquina para gestionar de forma segura la incertidumbre en los flujos siempre cambiantes de big data caóticos. [ 18 ] [ 19 ] Reconociendo que los errores de vinculación se propagan a los datos vinculados y su análisis, se han propuesto sistemas interactivos de vinculación de registros. La vinculación interactiva de registros se define como el ajuste iterativo por parte de personas de los resultados de los métodos automatizados y la gestión de la incertidumbre y su propagación a los análisis subsiguientes. [ 20 ] Los objetivos principales de los sistemas interactivos de vinculación de registros son resolver manualmente las vinculaciones inciertas y validar los resultados hasta que alcancen niveles aceptables para la aplicación dada. También se han propuesto variaciones de la vinculación interactiva de registros que mejoran la privacidad durante los pasos de interacción humana. [ 21 ] [ 22 ]
Vinculación de registros que preserva la privacidad
La vinculación de registros es cada vez más necesaria entre bases de datos de diferentes organizaciones, donde los datos complementarios que poseen estas organizaciones pueden, por ejemplo, ayudar a identificar pacientes susceptibles a ciertas reacciones adversas a medicamentos (vinculando bases de datos de hospitales, médicos y farmacias). Sin embargo, en muchas de estas aplicaciones, las bases de datos que se van a vincular contienen información sensible sobre las personas que no se puede compartir entre las organizaciones. [ 23 ]
Se han desarrollado métodos de vinculación de registros que preservan la privacidad (PPRL) para vincular bases de datos sin necesidad de compartir los valores sensibles originales entre las organizaciones que participan en la vinculación. [ 24 ] [ 25 ] En PPRL, generalmente los valores de los atributos de los registros que se comparan se codifican o cifran de alguna forma. Una técnica de codificación popular es el filtro de Bloom , [ 26 ] que permite calcular similitudes aproximadas entre valores codificados sin necesidad de compartir los valores sensibles correspondientes en texto plano. Al final del proceso PPRL, solo se revela información limitada sobre los pares de registros clasificados como coincidentes a las organizaciones que participan en el proceso de vinculación. Las técnicas utilizadas en PPRL [ 24 ] deben garantizar que ninguna organización participante, ni ningún adversario externo, pueda comprometer la privacidad de las entidades representadas por los registros en las bases de datos que se vinculan. [ 27 ]
Modelo matemático
En una aplicación con dos archivos, A y B, denotemos las filas ( registros ) poren el archivo A yen el archivo B. Asignarcaracterísticas para cada registro. El conjunto de registros que representan entidades idénticas se define por
y el complemento del conjunto, es decir, conjuntorepresentar diferentes entidades se define como
.
Un vector,se define que contiene los acuerdos y desacuerdos codificados sobre cada característica:
dóndees un subíndice para las características (sexo, edad, estado civil, etc.) en los archivos. Las probabilidades condicionales de observar un vector específicodado,se definen como
y
respectivamente. [ 6 ]
Aplicaciones
Gestión de datos maestros
La mayoría de los productos de gestión de datos maestros (MDM) utilizan un proceso de vinculación de registros para identificar aquellos provenientes de diferentes fuentes que representan la misma entidad del mundo real. Esta vinculación se utiliza para crear un "registro maestro de referencia" que contiene los datos depurados y conciliados de dicha entidad. Las técnicas empleadas en MDM son las mismas que las utilizadas para la vinculación de registros en general. MDM amplía esta coincidencia no solo para crear un "registro maestro de referencia", sino también para inferir relaciones (por ejemplo, si una persona tiene el mismo apellido o uno similar y la misma dirección o una similar, esto podría implicar que comparten una relación de convivencia).
Almacenamiento de datos e inteligencia empresarial
La vinculación de registros desempeña un papel fundamental en el almacenamiento de datos y la inteligencia empresarial . Los almacenes de datos combinan información de diversos sistemas operativos en un único modelo lógico , que posteriormente se integra en un sistema de inteligencia empresarial para la generación de informes y análisis. Cada sistema operativo puede tener su propio método para identificar las mismas entidades utilizadas en el modelo lógico, por lo que la vinculación de registros entre las distintas fuentes resulta esencial para garantizar que la información sobre una entidad específica en un sistema se pueda comparar sin problemas con la información sobre la misma entidad en otro sistema. La estandarización de datos y la posterior vinculación de registros suelen tener lugar en la fase de transformación del proceso de extracción, transformación y carga (ETL).
Investigación histórica
La vinculación de registros es importante para la investigación en historia social, ya que la mayoría de los conjuntos de datos, como los censos y los registros parroquiales, se registraron mucho antes de la invención de los números de identificación nacional . Cuando se digitalizan fuentes antiguas, la vinculación de conjuntos de datos es un requisito previo para el estudio longitudinal . Este proceso suele complicarse aún más por la falta de una ortografía estándar de los nombres, los apellidos que cambian según el lugar de residencia, la modificación de los límites administrativos y los problemas para cotejar los datos con otras fuentes. La vinculación de registros fue uno de los temas más destacados en el campo de la historia y la informática en la década de 1980, pero desde entonces ha recibido menos atención en la investigación.
Práctica médica e investigación
La vinculación de registros es una herramienta importante para generar los datos necesarios para evaluar la salud pública y el propio sistema de salud. Permite mejorar la gestión de datos, la recopilación de datos, la evaluación de la calidad y la difusión de información. Las fuentes de datos se pueden examinar para eliminar registros duplicados, identificar casos no registrados o con datos faltantes (por ejemplo, en censos de población), crear estadísticas de salud centradas en la persona y generar registros de enfermedades y sistemas de vigilancia sanitaria. Algunos registros de cáncer vinculan diversas fuentes de datos (por ejemplo, admisiones hospitalarias, informes clínicos y de patología, y registros de defunción) para generar sus registros. La vinculación de registros también se utiliza para crear indicadores de salud. Por ejemplo, la mortalidad fetal e infantil es un indicador general del desarrollo socioeconómico, la salud pública y los servicios de salud materno-infantil de un país. Si se cotejan los registros de defunción infantil con los de nacimiento, es posible utilizar variables de nacimiento, como el peso al nacer y la edad gestacional, junto con datos de mortalidad, como la causa de la muerte, para analizar los datos. Los vínculos de datos pueden ser útiles en estudios de seguimiento de cohortes u otros grupos para determinar factores como el estado vital, la situación residencial o los resultados de salud. El rastreo suele ser necesario para el seguimiento de cohortes industriales, ensayos clínicos y encuestas longitudinales con el fin de obtener la causa de muerte o cáncer. Un ejemplo de un sistema de vinculación de registros exitoso y de larga trayectoria que permite la investigación médica poblacional es el Proyecto de Epidemiología de Rochester , con sede en Rochester, Minnesota . [ 28 ]
Crítica a las implementaciones de software existentes
Las principales razones citadas son:
- Costos del proyecto : costos que generalmente ascienden a cientos de miles de dólares.
- Tiempo : falta de tiempo suficiente para manejar software de limpieza de datos a gran escala.
- Seguridad : preocupaciones sobre el intercambio de información, el acceso de una aplicación a través de sistemas y los efectos en los sistemas heredados.
- Escalabilidad : Debido a la ausencia de identificadores únicos en los registros, la vinculación de registros es computacionalmente costosa y difícil de escalar. [ 29 ]
- Precisión : Cambiar los datos comerciales y capturar todas las reglas para la vinculación es un ejercicio arduo y extenso.
Véase también
- Optimización de la capacidad
- Almacenamiento direccionable por contenido
- Eliminación de datos duplicados
- Codificación delta
- Vinculación de entidades
- Modelo entidad-atributo-valor
- Resolución de identidad
- Datos vinculados
- Reconocimiento de entidades nombradas
- Datos abiertos
- Coincidencia de esquemas
- Almacenamiento de instancia única
- Desambiguación del nombre del autor
Notas y referencias
- ↑ "Cristen, P & T: Febrl - Vinculación de registros biomédicos libremente extensible (Manual, versión 0.3) p.9" . Archivado del original el 11 de marzo de 2016. Consultado el 21 de abril de 2006 .
- ↑ Elmagarmid, Ahmed; Panagiotis G. Ipeirotis; Vassilios Verykios (enero de 2007). "Detección de registros duplicados: una revisión" (PDF) . IEEE Transactions on Knowledge and Data Engineering . 19 (1): págs. 1–16. Bibcode : 2007ITKDE..19E0581E . doi : 10.1109/tkde.2007.250581 . S2CID 386036. Recuperado el 30 de marzo de 2009 .
- ↑ Singla, Parag; Domingos, Pedro (diciembre de 2006). "Resolución de entidades con lógica de Markov" (PDF) . Sexta Conferencia Internacional sobre Minería de Datos (ICDM'06) . págs. 572–582 . doi : 10.1109/ICDM.2006.65 . ISBN 9780769527024. S2CID 12211870 . Consultado el 1 de marzo de 2023 .
- ↑ Dunn, Halbert L. (diciembre de 1946). "Record Linkage" . American Journal of Public Health . 36 (12): págs. 1412–1416. doi : 10.2105/AJPH.36.12.1412 . PMC 1624512. PMID 18016455 .
- ↑ Newcombe, HB; JM Kennedy; SJ Axford; AP James (octubre de 1959). "Vinculación automática de registros vitales". Science . 130 (3381): 954– 959. Bibcode : 1959Sci...130..954N . doi : 10.1126/science.130.3381.954 . PMID 14426783 .
- 1 2 Fellegi, Ivan ; Sunter, Alan (diciembre de 1969). "Una teoría para la vinculación de registros" (PDF) . Journal of the American Statistical Association . 64 (328): págs. 1183–1210. doi : 10.2307/2286061 . JSTOR 2286061 .
- 1 2 3 Wilson, D. Randall, D. Randall (31 de julio - 5 de agosto de 2011). Más allá de la vinculación probabilística de registros: uso de redes neuronales y características complejas para mejorar la vinculación de registros genealógicos (PDF) . Actas de la Conferencia Conjunta Internacional sobre Redes Neuronales. San José, California, EE. UU.
- ↑ Winkler, William E. "Coincidencia y vinculación de registros" (PDF) . Oficina del Censo de los Estados Unidos . Consultado el 12 de noviembre de 2011 .
- ↑ Churches, Tim; Peter Christen; Kim Lim; Justin Xi Zhu (13 de diciembre de 2002). "Preparación de datos de nombre y dirección para la vinculación de registros mediante modelos ocultos de Markov" . BMC Medical Informatics and Decision Making . 2 9. doi : 10.1186/1472-6947-2-9 . PMC 140019. PMID 12482326 .
- ↑ Roos, LL; Wajda A (abril de 1991). "Estrategias de vinculación de registros. Parte I: Estimación de la información y evaluación de los enfoques". Methods of Information in Medicine . 30 (2): 117– 123. doi : 10.1055/s-0038-1634828 . PMID 1857246. S2CID 23501719 .
- ↑ Grannis, SJ; Overhage JM; McDonald CJ (2002). "Análisis del rendimiento de los identificadores mediante un algoritmo de enlace determinista" . Actas del Simposio AMIA : 305–9 . PMC 2244404. PMID 12463836 .
- 1 2 Blakely, Tony; Salmond, Clare (diciembre de 2002). "Vinculación probabilística de registros y un método para calcular el valor predictivo positivo" . International Journal of Epidemiology . 31 (6): 1246– 1252. doi : 10.1093/ije/31.6.1246 . PMID 12540730 .
- ↑ Quass, Dallan y Starkey, Paul. “ Vinculación de registros para bases de datos genealógicas ”, Taller ACM SIGKDD '03 sobre limpieza de datos, vinculación de registros y consolidación de objetos, 24-27 de agosto de 2003, Washington, DC.
- ↑ Langley, Pat, Wayne Iba y Kevin Thompson. “ Análisis de clasificadores bayesianos ”, en Actas de la 10.ª Conferencia Nacional sobre Inteligencia Artificial (AAAI-92), AAAI Press/MIT Press, Cambridge, MA, págs. 223-228, 1992.
- ↑ Michie, D.; Spiegelhalter, D.; Taylor, C. (1994). Aprendizaje automático, clasificación neuronal y estadística . Hertfordshire, Inglaterra: Ellis Horwood. ISBN 0-13-106360-X.
- ↑ Ramezani, M.; Ilangovan, G.; Kum, HC. (2021). Evaluación de algoritmos de aprendizaje automático en un sistema híbrido humano-computadora de vinculación de registros (PDF) . Vol. 2846. Actas del taller CEUR.
- ↑ "Coincidencia difusa con Spark" . Cumbre Spark. 17 de julio de 2014.
- ↑ Bronstein, Janet M.; Lomatsch, Charles T.; Fletcher, David; Wooten, Terri; Lin, Tsai Mei; Nugent, Richard; Lowery, Curtis L. (2008-05-01). "Problemas y sesgos en la correspondencia de episodios de embarazo de Medicaid con datos de registros vitales: la experiencia de Arkansas" . Maternal and Child Health Journal . 13 (2): 250– 259. doi : 10.1007/s10995-008-0347-z . ISSN 1092-7875 . PMID 18449631. S2CID 22259447 .
- ↑ Boscoe, Francis P.; Schrag, Deborah; Chen, Kun; Roohan, Patrick J.; Schymura, Maria J. (2010-12-15). "Desarrollo de capacidades para evaluar la atención oncológica en la población de Medicaid en el estado de Nueva York" . Health Services Research . 46 (3): 805– 820. doi : 10.1111/j.1475-6773.2010.01221.x . ISSN 0017-9124 . PMC 3087842. PMID 21158856 .
- ↑ Kum, Hye-Chung; Krishnamurthy, Ashok; Machanavajjhala, Ashwin; Reiter, Michael K; Ahalt, Stanley (marzo de 2014). "Enlace interactivo de registros que preserva la privacidad (PPIRL)" . Journal of the American Medical Informatics Association . 21 (2): 212– 220. doi : 10.1136/amiajnl-2013-002165 . ISSN 1067-5027 . PMC 3932473. PMID 24201028 .
- ↑ Kum, HC.; Ragan, E.; Ilangovan, G.; Ramezani, M.; Li, Q.; Schmit, C. (2019). Mejora de la privacidad mediante una interfaz interactiva de divulgación incremental de información bajo demanda: Aplicación de la privacidad desde el diseño a la vinculación de registros (PDF) . Decimoquinto Simposio sobre Privacidad y Seguridad Usables (SOUPS). págs. 175–189 . ISBN 978-1-939133-05-2.
- ↑ Ragan, Eric D.; Kum, Hye-Chung; Ilangovan, Gurudev; Wang, Han (21 de abril de 2018). «Equilibrando la privacidad y la divulgación de información en la vinculación interactiva de registros con enmascaramiento visual» . Actas de la Conferencia CHI de 2018 sobre factores humanos en sistemas informáticos . Nueva York, NY, EE. UU.: ACM. págs. 1-12 . doi : 10.1145/3173574.3173900 . ISBN 9781450356206. S2CID 5051254 .
- ↑ Vatsalan, D; Sehili, Z; Christen, P; Rahm, E (2017). «Vinculación de registros que preserva la privacidad para macrodatos: enfoques actuales y desafíos de investigación» . Manual de tecnologías de macrodatos . págs. 851–895 . doi : 10.1007/978-3-319-49340-4_25 . hdl : 1885/247396 . ISBN 978-3-319-49339-8.
- 1 2 Christen, P; Ranbaduge, T; Schnell, R (2020). Vinculación de datos sensibles: métodos y técnicas para el intercambio práctico de información que preserva la privacidad . Heidelberg: Springer. doi : 10.1007/978-3-030-59706-1 . ISBN 978-3-030-59706-1. S2CID 222821833 .
- ↑ Gkoulalas-Divanis, A; Vatsalan, D; Karapiperis, D; Kantarcioglu, M (2021). "Técnicas modernas de vinculación de registros que preservan la privacidad: una visión general". IEEE Transactions on Information Forensics and Security . 16 : 4966–4987 . Bibcode : 2021ITIF...16.4966G . doi : 10.1109/TIFS.2021.3114026 . S2CID 239088979 .
- ↑ Schnell, R; Bachteler, T; Reiher, J (2009). "Vinculación de registros que preserva la privacidad mediante filtros de Bloom" . BMC Medical Informatics and Decision Making . 9 41. doi : 10.1186/1472-6947-9-41 . PMC 2753305. PMID 19706187 .
- ↑ Vidanage, A (2022). Técnicas eficientes de criptoanálisis para la vinculación de registros que preservan la privacidad (Tesis). Canberra: Universidad Nacional Australiana. doi : 10.25911/VSBZ-A727 . hdl : 1885/254502 .
- ↑ St. Sauver JL; Grossardt BR; Yawn BP; Melton LJ 3rd; Pankratz JJ; Brue SM; Rocca WA (2012). " Perfil de recursos de datos: El sistema de vinculación de registros médicos del Proyecto de Epidemiología de Rochester (REP)" . Int J Epidemiol . 41 (6): 1614– 24. doi : 10.1093/ije/dys195 . PMC 3535751. PMID 23159830 .
{{cite journal}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "Resolución de entidades a escala" . 14 de febrero de 2020.
Enlaces externos
- Proyecto de vinculación de datos en Penn State, EE. UU.
- Marco de resolución de entidades de Stanford
- Dedoop - Deduplicación con Hadoop Archivado el 6 de agosto de 2016 en Wayback Machine
- Vinculación interactiva de registros con privacidad mejorada en la Universidad de Texas A&M
- Descripción general de la comparación de datos
- Gestión de datos
- Vigilancia masiva
- Aplicaciones de la inteligencia artificial