Los términos coincidencia de esquemas y mapeo se utilizan a menudo indistintamente en un proceso de base de datos . En este artículo, diferenciamos ambos de la siguiente manera: la coincidencia de esquemas es el proceso de identificar que dos objetos están relacionados semánticamente (ámbito de este artículo), mientras que el mapeo se refiere a las transformaciones entre los objetos. Por ejemplo, en los dos esquemas DB1.Student (Nombre, SSN, Nivel, Especialidad, Calificaciones) y DB2.Grad-Student (Nombre, ID, Especialidad, Calificaciones); las posibles coincidencias serían: DB1.Student ≈ DB2.Grad-Student; DB1.SSN = DB2.ID, etc., y las posibles transformaciones o mapeos serían: DB1.Marks a DB2.Grades (100–90 A; 90–80 B, etc.).
La automatización de estos dos enfoques ha sido una de las tareas fundamentales de la integración de datos . En general, no es posible determinar de forma totalmente automática las diferentes correspondencias entre dos esquemas, principalmente debido a la semántica distinta y, a menudo, no explícita ni documentada de ambos esquemas.
Impedimentos
Entre otros, los desafíos comunes para automatizar la coincidencia y el mapeo se han clasificado previamente en [ 1 ] especialmente para esquemas de bases de datos relacionales; y en [ 2 ] – una lista bastante completa de heterogeneidad que no se limita al modelo relacional que reconoce diferencias/heterogeneidad esquemáticas vs. semánticas. La mayoría de estas heterogeneidades existen porque los esquemas usan diferentes representaciones o definiciones para representar la misma información (conflictos de esquema); O diferentes expresiones, unidades y precisión dan como resultado representaciones conflictivas de los mismos datos (conflictos de datos). [ 1 ] La investigación en coincidencia de esquemas busca brindar soporte automatizado al proceso de encontrar coincidencias semánticas entre dos esquemas. Este proceso se dificulta debido a las heterogeneidades en los siguientes niveles [ 3 ]
- Heterogeneidad sintáctica: diferencias en el lenguaje utilizado para representar los elementos.
- Heterogeneidad estructural: diferencias en los tipos y estructuras de los elementos.
- Heterogeneidad del modelo/representación: diferencias en los modelos subyacentes (bases de datos, ontologías) o sus representaciones (pares clave-valor, relacionales, documentos, XML, JSON , triples, grafos, RDF, OWL).
- Heterogeneidad semántica : donde la misma entidad del mundo real se representa utilizando diferentes términos o viceversa.
Coincidencia de esquemas
Metodología
Analiza una metodología genérica para la tarea de integración de esquemas o las actividades involucradas. [ 5 ] Según los autores, se puede ver la integración.
- Preintegración: Antes de la integración, se realiza un análisis de los esquemas para definir una política de integración. Esta política determina la selección de los esquemas que se integrarán, el orden de integración y la posible asignación de preferencias a esquemas completos o a partes de ellos.
- Comparación de esquemas: Los esquemas se analizan y comparan para determinar las correspondencias entre conceptos y detectar posibles conflictos. Al comparar esquemas, se pueden descubrir propiedades entre ellos.
- Adaptación de los esquemas: una vez detectados los conflictos, se intenta resolverlos para que sea posible la fusión de los distintos esquemas.
- Fusión y reestructuración: Ahora los esquemas están listos para superponerse, dando lugar a uno o varios esquemas integrados intermedios. Los resultados intermedios se analizan y, si es necesario, se reestructuran para lograr las características deseadas.
Aproches
Los enfoques para la integración de esquemas se pueden clasificar ampliamente en aquellos que explotan solo la información del esquema o la información del esquema y de la instancia. [ 4 ] [ 5 ]
Los comparadores a nivel de esquema solo consideran la información del esquema, no los datos de instancia. La información disponible incluye las propiedades habituales de los elementos del esquema, como nombre, descripción, tipo de datos, tipos de relaciones (parte de, es un, etc.), restricciones y estructura del esquema. Al trabajar a nivel de elemento (elementos atómicos como atributos de objetos) o de estructura (combinaciones coincidentes de elementos que aparecen juntos en una estructura), estas propiedades se utilizan para identificar elementos coincidentes en dos esquemas. Los comparadores basados en lenguaje o lingüísticos utilizan nombres y texto (es decir, palabras u oraciones) para encontrar elementos de esquema semánticamente similares. Los comparadores basados en restricciones aprovechan las restricciones que suelen contener los esquemas. Dichas restricciones se utilizan para definir tipos de datos y rangos de valores, unicidad, opcionalidad, tipos de relaciones y cardinalidades, etc. Las restricciones en dos esquemas de entrada se comparan para determinar la similitud de los elementos del esquema.
Los comparadores a nivel de instancia utilizan datos a nivel de instancia para obtener información importante sobre el contenido y el significado de los elementos del esquema. Estos se suelen utilizar junto con las coincidencias a nivel de esquema para aumentar la confianza en los resultados de la coincidencia, sobre todo cuando la información disponible a nivel de esquema es insuficiente. Los comparadores de este nivel utilizan la caracterización lingüística y basada en restricciones de las instancias. Por ejemplo, utilizando técnicas lingüísticas, podría ser posible analizar las instancias Dept, DeptName y EmpName para concluir que DeptName es un mejor candidato para coincidir con Dept que EmpName. Restricciones como que los códigos postales deban tener 5 dígitos o el formato de los números de teléfono pueden permitir la coincidencia de este tipo de datos de instancia. [ 9 ]
Los sistemas de comparación híbridos combinan directamente varios enfoques de comparación para determinar candidatos de coincidencia basados en múltiples criterios o fuentes de información. La mayoría de estas técnicas también emplean información adicional como diccionarios, tesauros e información de coincidencia o no coincidencia proporcionada por el usuario [ 10 ].
Reutilización de información coincidente Otra iniciativa ha consistido en reutilizar información coincidente previa como información auxiliar para futuras tareas de coincidencia. La motivación para este trabajo radica en que las estructuras o subestructuras suelen repetirse, por ejemplo, en esquemas del ámbito del comercio electrónico. Sin embargo, dicha reutilización de coincidencias previas requiere una cuidadosa selección. Es posible que dicha reutilización solo tenga sentido para una parte de un nuevo esquema o solo en ciertos ámbitos. Por ejemplo, Salario e Ingresos pueden considerarse idénticos en una aplicación de nóminas, pero no en una aplicación de declaración de impuestos. Existen varios desafíos abiertos en dicha reutilización que merecen un análisis más profundo.
Prototipos de muestra. Por lo general, la implementación de estas técnicas de emparejamiento se puede clasificar como sistemas basados en reglas o sistemas basados en aprendizaje. La naturaleza complementaria de estos diferentes enfoques ha propiciado diversas aplicaciones que utilizan una combinación de técnicas, dependiendo de la naturaleza del dominio o la aplicación en cuestión. [ 4 ] [ 5 ]
Relaciones identificadas
Los tipos de relaciones entre objetos que se identifican al final de un proceso de coincidencia son típicamente aquellos con semántica de conjunto como superposición, disyunción, exclusión, equivalencia o subsunción. Las codificaciones lógicas de estas relaciones son lo que significan. Entre otros, se presentó un intento temprano de usar lógicas de descripción para la integración de esquemas e identificar tales relaciones. [ 11 ] Varias herramientas de coincidencia de última generación en la actualidad [ 4 ] [ 7 ] y las evaluadas en la Iniciativa de Evaluación de Alineación de Ontologías [ 12 ] son capaces de identificar muchas de estas coincidencias simples (coincidencias a nivel de elemento 1:1 / 1:n / n:1) y complejas (coincidencias a nivel de elemento o estructura n:1 / n:m) entre objetos.
Evaluación de la calidad
La calidad de la coincidencia de esquemas se suele medir mediante la precisión y la exhaustividad . Mientras que la precisión mide el número de pares coincidentes correctamente de entre todos los pares que se han comparado, la exhaustividad mide cuántos de los pares reales se han comparado.
Véase también
Referencias
- 1 2 Kim, W. y Seo, J. (dic. 1991). "Clasificación de la heterogeneidad esquemática y de datos en sistemas de bases de datos múltiples". Computer 24, 12 .
- ↑ Sheth, AP y Kashyap, V. (1993). "Tan lejos (esquemáticamente) pero tan cerca (semánticamente)". En Actas de la Conferencia IFIP WG 2.6 sobre semántica de bases de datos sobre sistemas de bases de datos interoperables .
- ↑ Sheth, AP (1999). "Changing Focus on Interoperability in Information Systems: From System, Syntax, Structure to Semantics". En Interoperating Geographic Information Systems. MF Goodchild, MJ Egenhofer, R. Fegeas y CA Kottman (eds.), Kluwer, Academic Publishers .
- 1 2 3 4 Rahm, E. y Bernstein, P (2001). "Una revisión de los enfoques para la coincidencia automática de esquemas". The VLDB Journal 10, 4 .
- 1 2 3 4 Batini, C., Lenzerini, M., y Navathe, SB (1986). "Un análisis comparativo de metodologías para la integración de esquemas de bases de datos". ACM Comput. Surv. 18, 4 .
{{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Doan, A. y Halevy, A. (2005). "Investigación sobre integración semántica en la comunidad de bases de datos". AI Mag. 26, 1 .
- 1 2 Kalfoglou, Y. y Schorlemmer, M. (2003). "Mapeo de ontologías: estado del arte". Knowl. Eng. Rev. 18, 1 .
- ↑ Choi, N., Song, I., y Han, H. (2006). "Una revisión sobre el mapeo de ontologías". SIGMOD Rec. 35, 3 .
{{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Pereira Nunes, Bernardo; Mera, Alexander; Casanova, Marco Antonio; P. Paes Leme, Luis Andre; Dietze, Stefan (2013). "Combinación compleja de propiedades de tipos de datos RDF" . Aplicaciones de bases de datos y sistemas expertos . Notas de clase en informática. Vol. 8055. pp. 195–208 . doi : 10.1007/978-3-642-40285-2_18 . ISBN 978-3-642-40284-5.
- ↑ Hamdaqa, Mohammad; Tahvildari, Ladan (2014). «Prison Break: A Generic Schema Matching Solution to the Cloud Vendor Lock-in Problem». 2014 IEEE 8th International Symposium on the Maintenance and Evolution of Service-Oriented and Cloud-Based Systems . pp. 37–46 . doi : 10.1109/MESOCA.2014.13 . ISBN 978-1-4799-6152-8. S2CID 14499875 .
- ↑ Ashoka Savasere; Amit P. Sheth; Sunit K. Gala; Shamkant B. Navathe; H. Markus (1993). "Sobre la aplicación de la clasificación a la integración de esquemas". RIDE-IMS .
- ↑ Iniciativa de evaluación de la alineación de ontologías::2006
Enlaces externos
- Primeros trabajos en la coincidencia de esquemas
- Bases de datos