Articulo de referencia

Envoltorio (minería de datos)

En minería de datos, el proceso de envoltorio consiste en extraer subcontenido regular de una fuente de información no estructurada o poco estructurada y transformarlo en una fo...

En minería de datos, el proceso de envoltorio consiste en extraer subcontenido regular de una fuente de información no estructurada o poco estructurada y transformarlo en una forma relacional , para que pueda procesarse como datos estructurados. [ 1 ] La inducción de envoltorios es el problema de diseñar procedimientos de extracción de forma automática, con una dependencia mínima de reglas elaboradas manualmente.

Muchas páginas web se generan automáticamente a partir de datos estructurados (directorios telefónicos, catálogos de productos, etc.), envueltos en un lenguaje de presentación con una estructura flexible (generalmente alguna variante de HTML ), formateado para la navegación humana. Los datos estructurados suelen ser descripciones de objetos recuperados de bases de datos subyacentes y mostrados en páginas web siguiendo plantillas fijas de bajo nivel, insertadas en páginas donde la estructura de alto nivel puede variar semanalmente, según la evolución constante del diseño de la página web. La línea divisoria precisa entre la estructura de alto nivel flexible y las plantillas de datos estructurados menos flexibles rara vez se documenta para el público, fuera del equipo de gestión de contenido del sitio web. Los sistemas de software que utilizan estos recursos deben traducir el contenido HTML a un formato relacional. Los envoltorios se utilizan comúnmente como traductores. Formalmente, un envoltorio es una función que asigna a una página el conjunto de tuplas que contiene.

Generación de envoltura

Existen dos enfoques principales para la generación de wrappers: la inducción de wrappers y la extracción automatizada de datos . La inducción de wrappers utiliza el aprendizaje supervisado para aprender reglas de extracción de datos a partir de ejemplos de entrenamiento etiquetados manualmente. Las desventajas de la inducción de wrappers son:

  • el proceso de etiquetado manual que consume mucho tiempo y
  • la dificultad del mantenimiento del envoltorio.

Debido al esfuerzo de etiquetado manual, resulta difícil extraer datos de un gran número de sitios, ya que cada sitio tiene sus propias plantillas y requiere un etiquetado manual independiente para el aprendizaje de los wrappers. El mantenimiento de los wrappers también es un problema importante, puesto que cada vez que un sitio cambia, los wrappers creados para él quedan obsoletos. Debido a estas deficiencias, los investigadores han estudiado la generación automatizada de wrappers mediante minería de patrones no supervisada. La extracción automatizada es posible porque la mayoría de los objetos de datos web siguen plantillas fijas. El descubrimiento de dichas plantillas o patrones permite al sistema realizar la extracción automáticamente. [ 2 ]

La generación de wrappers en la web es un problema importante con una amplia gama de aplicaciones. La extracción de estos datos permite integrar información de múltiples sitios web para ofrecer servicios de valor añadido, como la comparación de precios, la búsqueda de objetos y la integración de información.

Véase también

Fuentes

  1. Nicholas Kushmerick, Daniel S. Weld, Robert Doorenbos, Inducción de envoltura para la extracción de información, Actas de la Conferencia Internacional Conjunta sobre Inteligencia Artificial, 1997
  2. Liu, B. Minería de datos web, Springer, 2007.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Wrapper_(data_mining)&oldid=1077665580 "