Articulo de referencia

Agregado (almacén de datos)

Un agregado es un tipo de resumen utilizado en modelos dimensionales de almacenes de datos para acortar el tiempo necesario para proporcionar respuestas a consultas típicas sobr...

Un agregado es un tipo de resumen utilizado en modelos dimensionales de almacenes de datos para acortar el tiempo necesario para proporcionar respuestas a consultas típicas sobre grandes conjuntos de datos . La razón por la que los agregados pueden generar un aumento tan drástico en el rendimiento de un almacén de datos es la reducción del número de filas a las que se debe acceder al responder a una consulta. [ 1 ]

Usar

En su forma más simple, una agregación es una tabla resumen que se puede obtener mediante una consulta SQL de agrupación . Un uso más común de las agregaciones es modificar la granularidad de una dimensión . Al cambiar la granularidad de la dimensión, la tabla de hechos debe resumirse parcialmente para ajustarse a la nueva granularidad de la nueva dimensión , creando así nuevas tablas dimensionales y de hechos que se ajusten a este nuevo nivel de granularidad.

Diseño

A veces, los agregados se denominan datos de resumen precalculados, ya que suelen ser datos precalculados y parcialmente resumidos que se almacenan en nuevas tablas agregadas. Cuando se agregan hechos, esto se realiza eliminando la dimensionalidad o asociándolos con una dimensión agregada. Las dimensiones agregadas deben ser versiones reducidas de las dimensiones asociadas con los hechos base granulares. De esta manera, las tablas de dimensiones agregadas deben ajustarse a las tablas de dimensiones base. [ 2 ]

Actuación

En 1996, Ralph Kimball , considerado por muchos como uno de los arquitectos originales del almacenamiento de datos, declaró: [ 3 ]

La forma más impactante de mejorar el rendimiento de un gran almacén de datos es proporcionar un conjunto adecuado de registros agregados (resumen) que coexistan con los registros base principales. Los agregados pueden tener un efecto muy significativo en el rendimiento, llegando a acelerar las consultas hasta cien o incluso mil veces. No existe otro método para obtener mejoras tan espectaculares.

Complejidad

Tener datos agregados y atómicos aumenta la complejidad del modelo dimensional. Esta complejidad debe ser transparente para los usuarios del almacén de datos; por lo tanto, cuando se realiza una solicitud, el almacén de datos debe devolver datos de la tabla con la granularidad correcta. Así, cuando se realizan solicitudes al almacén de datos, se debe implementar la funcionalidad de navegador de agregados para ayudar a determinar la tabla correcta con la granularidad adecuada. El número de agregaciones posibles viene determinado por cada combinación posible de granularidades de dimensión. Dado que generaría una gran sobrecarga construir todas las agregaciones posibles, es recomendable elegir un subconjunto de tablas sobre las que realizar agregaciones. La mejor manera de elegir este subconjunto y decidir qué agregaciones construir es monitorizar las consultas y diseñar agregaciones que coincidan con los patrones de consulta. [ 4 ]

Navegación agregada

La presencia de datos agregados en el modelo dimensional hace que el entorno sea más complejo. Para que esta complejidad adicional sea transparente para el usuario, se utiliza una funcionalidad conocida como navegación agregada para consultar las tablas dimensionales y de hechos con el nivel de granularidad adecuado. La navegación agregada examina la consulta para determinar si puede responderse utilizando una tabla agregada más pequeña. [ 5 ]

Las implementaciones de navegadores agregados se pueden encontrar en una variedad de tecnologías:

En general, se recomienda utilizar cualquiera de las tres primeras tecnologías, ya que los beneficios en el último caso se limitan a una única herramienta de BI de interfaz [ 6 ].

Desafíos

  • Dado que los modelos dimensionales solo se benefician de los agregados en conjuntos de datos grandes, se debe considerar a partir de qué tamaño de los conjuntos de datos se debe comenzar a utilizar los agregados.
  • También cabe preguntarse si un almacén de datos siempre maneja conjuntos de datos demasiado grandes para consultas directas, o si a veces es buena idea omitir las tablas agregadas al iniciar un nuevo proyecto de almacén de datos.
  • Una cuestión abierta es si omitir los agregados en la primera iteración de la construcción de un nuevo almacén de datos hará que la estructura del modelo dimensional sea más sencilla.

Referencias

  1. Christopher Adamson, Mastering Data Warehouse Aggregates: Solutions for Star Schema Performance , Wiley Publishing, Inc., 2006 ISBN 978-0-471-77709-0Página 23
  2. Ralph Kimball; Margy Ross (2002). The Data Warehouse Toolkit: The Complete Guide to Dimensional Modeling (Segunda edición). Wiley Computer Publishing. pág. 356. ISBN   0-471-20024-7.
  3. "Navegación agregada con (casi) ningún metadato" . 15 de agosto de 1995. Archivado del original el 11 de diciembre de 2010. Consultado el 22 de noviembre de 2010 .
  4. Kimball y Data Warehouse Toolkit , pág. 355.
  5. Kimball y Data Warehouse Toolkit , pág. 137.
  6. Kimball y Data Warehouse Toolkit , pág. 354.
Agregado (almacén de datos) | Hispanopedia Wiki