
Un cubo OLAP es un cubo de datos , una matriz multidimensional de datos, [ 1 ] utilizado para el procesamiento analítico en línea (OLAP), [ 2 ] una técnica basada en computadora para analizar datos y buscar información relevante.
Terminología
Un cubo puede considerarse una generalización multidimensional de una hoja de cálculo bidimensional o tridimensional . Por ejemplo, una empresa podría querer resumir los datos financieros por producto, por período de tiempo y por ciudad para comparar los gastos reales con los presupuestados. Producto, tiempo, ciudad y escenario (real y presupuestado) son las dimensiones de los datos. [ 3 ]
El término «cubo » se utiliza abreviatura de « conjunto de datos multidimensional» , dado que los datos pueden tener un número arbitrario de dimensiones . A veces se emplea el término «hipercubo », especialmente para datos con más de tres dimensiones. Un cubo no es un «cubo» en el sentido matemático estricto, ya que sus caras no son necesariamente iguales. Sin embargo, este término se usa con frecuencia.
Un segmento (o "slice") es un subconjunto de datos que se genera al seleccionar un valor para una dimensión y mostrar únicamente los datos correspondientes a ese valor (por ejemplo, solo los datos en un momento dado). Las hojas de cálculo son bidimensionales, por lo que, mediante el uso de segmentos u otras técnicas, es posible visualizar datos multidimensionales en ellas.
Cada celda del cubo contiene un número que representa alguna medida del negocio, como ventas, beneficios, gastos, presupuesto y previsiones.
Los datos OLAP se almacenan normalmente en un esquema de estrella o de copo de nieve en un almacén de datos relacional o en un sistema de gestión de datos específico. Las medidas se derivan de los registros de la tabla de hechos y las dimensiones se derivan de las tablas de dimensiones .
Jerarquía
Los elementos de una dimensión pueden organizarse como una jerarquía , [ 4 ] un conjunto de relaciones padre-hijo, típicamente donde un miembro padre resume a sus hijos. Los elementos padre pueden agregarse además como hijos de otro padre. [ 5 ]
Por ejemplo, el elemento principal de mayo de 2005 es el segundo trimestre de 2005, que a su vez es el elemento secundario del año 2005. De manera similar, las ciudades son elementos secundarios de las regiones; los productos se agrupan en categorías de productos y los gastos individuales se clasifican en tipos de gasto.
Operaciones
Concebir los datos como un cubo con dimensiones jerárquicas conduce a operaciones conceptualmente sencillas que facilitan el análisis. Alinear el contenido de los datos con una visualización familiar mejora el aprendizaje y la productividad del analista. [ 5 ] El proceso iniciado por el usuario de navegar solicitando visualizaciones de página de forma interactiva, a través de la especificación de cortes mediante rotaciones y desglose ascendente/descendente se denomina a veces "corte y división". Las operaciones comunes incluyen corte y división, desglose descendente, agregación ascendente y pivote.

El proceso de segmentación consiste en seleccionar un subconjunto rectangular de un cubo eligiendo un único valor para una de sus dimensiones, creando así un nuevo cubo con una dimensión menos. [ 5 ] La imagen muestra una operación de segmentación: las cifras de ventas de todas las regiones de ventas y todas las categorías de productos de la empresa en los años 2005 y 2006 se "segmentan" del cubo de datos.

Dados : La operación de dados produce un subcubo al permitir al analista seleccionar valores específicos de múltiples dimensiones. [ 6 ] La imagen muestra una operación de dados: El nuevo cubo muestra las cifras de ventas de un número limitado de categorías de productos; las dimensiones de tiempo y región cubren el mismo rango que antes.

La función de exploración en profundidad permite al usuario navegar entre los niveles de datos, desde los más resumidos (arriba) hasta los más detallados (abajo). [ 5 ] La imagen muestra una operación de exploración en profundidad: el analista pasa de la categoría de resumen "Equipos de protección para exteriores" a ver las cifras de ventas de los productos individuales.
Agregación : Una agregación implica resumir los datos a lo largo de una dimensión. La regla de resumen puede ser una función agregada , como calcular totales a lo largo de una jerarquía o aplicar un conjunto de fórmulas como "ganancia = ventas - gastos". [ 5 ] Las funciones de agregación generales pueden ser costosas de calcular al agregar: si no se pueden determinar a partir de las celdas del cubo, deben calcularse a partir de los datos base, ya sea calculándolas en línea (lento) o precalculándolas para posibles agregaciones (gran espacio). Las funciones de agregación que se pueden determinar a partir de las celdas se conocen como funciones de agregación descomponibles y permiten un cálculo eficiente. [ 7 ] Por ejemplo, es fácil admitir COUNT, MAX, MIN,y SUMen OLAP, ya que estos se pueden calcular para cada celda del cubo OLAP y luego agregarlos, ya que la suma general (o recuento, etc.) es la suma de las sub-sumas, pero es difícil admitir MEDIAN, ya que eso debe calcularse para cada vista por separado: la mediana de un conjunto no es la mediana de las medianas de los subconjuntos.

La función Pivot permite al analista rotar el cubo en el espacio para visualizar sus diferentes caras. Por ejemplo, las ciudades podrían organizarse verticalmente y los productos horizontalmente al visualizar los datos de un trimestre específico. Pivotar podría reemplazar los productos por períodos de tiempo para visualizar datos a lo largo del tiempo para un solo producto. [ 5 ] [ 8 ]
La imagen muestra una operación de pivote: todo el cubo gira, ofreciendo una perspectiva diferente de los datos.
Definición matemática
En teoría de bases de datos , un cubo OLAP es [ 9 ] una representación abstracta de una proyección de una relación RDBMS . Dada una relación de orden N , consideremos una proyección que subtiende X , Y y Z como la clave y W como el atributo residual . Caracterizando esto como una función ,
- f : ( X , Y , Z ) → W ,
Los atributos X , Y y Z corresponden a los ejes del cubo, mientras que el valor W corresponde al elemento de datos que rellena cada celda del cubo.
Dado que los dispositivos de salida bidimensionales no pueden caracterizar fácilmente tres dimensiones, es más práctico proyectar "segmentos" del cubo de datos (decimos proyectar en el sentido clásico de reducción dimensional del análisis vectorial, no en el sentido SQL , aunque ambos son conceptualmente similares).
- g : ( X , Y ) → W
que puede suprimir una clave primaria, pero aún así tener algún significado semántico, tal vez una porción de la representación funcional triádica para un valor Z de interés dado.
La motivación [ 9 ] detrás de las visualizaciones OLAP se remonta al paradigma de informes de tablas cruzadas de los DBMS de la década de 1980 y a las tablas de contingencia anteriores de 1904. El resultado es una visualización al estilo de una hoja de cálculo, donde los valores de X llenan la fila $1; los valores de Y llenan la columna $A; y los valores de g : ( X , Y ) → W llenan las celdas individuales en las intersecciones de las columnas etiquetadas con X y las filas etiquetadas con Y , "al sureste", por así decirlo, de $B$2, con $B$2 incluido.
Véase también
Referencias
- ↑ Gray, Jim; Bosworth, Adam; Layman, Andrew; Pirahesh, Hamid (1996). "Data Cube: A Relational Aggregation Operator Generalizing Group-By, Cross-Tab, and Sub-Totals". Actas de la Conferencia Internacional sobre Ingeniería de Datos (ICDE) . págs. 152–159 . arXiv : cs/0701155 . doi : 10.1109/ICDE.1996.492099 .
- ↑ "Descripción general del procesamiento analítico en línea (OLAP)" . support.office.com . Consultado el 8 de septiembre de 2018 .
- ↑ "Cybertec lanza cubos OLAP para PostgreSQL" . PostgreSQL. 2 de octubre de 2006. Archivado del original el 30 de junio de 2013. Consultado el 5 de marzo de 2008 .
- ↑ "Jerarquía de la guía de almacenamiento de datos de Oracle9i" . Centro Lorentz . Consultado el 5 de marzo de 2008 .
- 1 2 3 4 5 6 "Definiciones de OLAP y servidor OLAP" . El Consejo OLAP. 1995. Recuperado el 18 de marzo de 2008 .
- ↑ "Glosario de términos de minería de datos" . Universidad de Alberta. 1999. Consultado el 17 de marzo de 2008 .
- ↑ Zhang 2017 , pág. 1.
- ↑ "Enciclopedia de la informática: vistas multidimensionales" . Answers.com . Consultado el 5 de marzo de 2008 .
- 1 2 Gray, Jim ; Bosworth, Adam; Layman, Andrew; Priahesh, Hamid (1995-11-18). "Data Cube: A Relational Aggregation Operator Generalizing Group-By, Cross-Tab, and Sub-Totals" . Proc. 12th International Conference on Data Engineering . IEEE. pp. 152–159 . Recuperado el 2008-11-09 .
- Zhang, Chao (2017). Función agregada simétrica y asimétrica en computación masivamente paralela (Informe técnico).
Enlaces externos
- Daniel Lemire (diciembre de 2007). "Almacenamiento de datos y OLAP: una bibliografía orientada a la investigación" . Recuperado el 5 de marzo de 2008 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - El vocabulario del cubo de datos RDF
- Microsoft Azure: Procesamiento analítico en línea (OLAP)
- Procesamiento analítico en línea
- Almacenamiento de datos