
En informática , un almacén de datos ( DW o DWH ), también conocido como almacén de datos empresarial ( EDW ), es un sistema utilizado para la elaboración de informes y el análisis de datos , y es un componente fundamental de la inteligencia empresarial . [ 1 ] Los almacenes de datos son repositorios centrales de datos integrados de diversas fuentes. Almacenan datos actuales e históricos organizados de forma optimizada para el análisis de datos, la generación de informes y el desarrollo de conocimientos a partir de los datos integrados. [ 2 ] Están diseñados para que los analistas y gerentes los utilicen para facilitar la toma de decisiones organizacionales. [ 3 ]
Los datos almacenados en el almacén de datos se cargan desde sistemas operativos (como marketing o ventas). Estos datos pueden pasar por un repositorio de datos operativo y requerir un proceso de limpieza para garantizar su calidad antes de ser utilizados en el almacén de datos para la elaboración de informes.
Los dos flujos de trabajo principales para construir un sistema de almacenamiento de datos son la extracción, transformación y carga (ETL) y la extracción, carga y transformación (ELT).
Componentes
El entorno para almacenes y marts de datos incluye lo siguiente:
- Sistemas de origen de datos (a menudo, las bases de datos operativas de la empresa, como las bases de datos relacionales [ 3 ] );
- Tecnología y procesos de integración de datos para extraer datos de los sistemas de origen, transformarlos y cargarlos en un almacén de datos o depósito de datos; [ 3 ]
- Arquitecturas para almacenar datos en el almacén o en los marts;
- Herramientas y aplicaciones para diversos usuarios;
- Metadatos, calidad de datos y procesos de gobernanza. Los metadatos incluyen fuentes de datos (base de datos, nombres de tablas y columnas), cronogramas de actualización y medidas de uso de datos. [ 3 ]
Sistemas relacionados
Bases de datos operativas
Las bases de datos operativas están optimizadas para preservar la integridad de los datos y la velocidad de registro de las transacciones comerciales mediante la normalización de bases de datos y un modelo entidad-relación . [ 4 ] Los diseñadores de sistemas operativos generalmente siguen la normalización de bases de datos para garantizar la integridad de los datos. Los diseños de bases de datos totalmente normalizados a menudo resultan en que la información de una transacción comercial se almacene en decenas o cientos de tablas. Las bases de datos relacionales son eficientes en la gestión de las relaciones entre estas tablas. Las bases de datos tienen un rendimiento de inserción/actualización muy rápido porque solo una pequeña cantidad de datos en esas tablas se ve afectada por cada transacción. Para mejorar el rendimiento, los datos más antiguos se purgan periódicamente.
Los almacenes de datos están optimizados para patrones de acceso analítico, que generalmente implican la selección de campos específicos en lugar de todos los campos, como es común en las bases de datos operativas. Debido a estas diferencias en el acceso, las bases de datos operativas (OLTP) se benefician del uso de un sistema de gestión de bases de datos (DBMS) orientado a filas, mientras que las bases de datos analíticas (OLAP) se benefician del uso de un DBMS orientado a columnas . Los sistemas operativos mantienen una instantánea del negocio, mientras que los almacenes de datos mantienen datos históricos mediante procesos ETL que migran periódicamente los datos de los sistemas operativos al almacén.
El procesamiento analítico en línea (OLAP) se caracteriza por una baja tasa de transacciones y consultas complejas que implican agregaciones. [ 5 ] El tiempo de respuesta es una medida de rendimiento eficaz de los sistemas OLAP. Las aplicaciones OLAP se utilizan ampliamente para la minería de datos . Las bases de datos OLAP almacenan datos históricos agregados en esquemas multidimensionales (generalmente esquemas de estrella ). Los sistemas OLAP suelen tener una latencia de datos de unas pocas horas, mientras que la latencia de un data mart es cercana a un día. El enfoque OLAP se utiliza para analizar datos multidimensionales de múltiples fuentes y perspectivas. Las tres operaciones básicas en OLAP son la agregación (consolidación), la exploración en profundidad y el análisis de datos.
El procesamiento de transacciones en línea (OLTP) se caracteriza por un gran número de transacciones cortas (INSERTAR, ACTUALIZAR, ELIMINAR). Los sistemas OLTP priorizan el procesamiento rápido de consultas y el mantenimiento de la integridad de los datos en entornos de acceso múltiple. Para los sistemas OLTP, el rendimiento se mide por el número de transacciones por segundo. Las bases de datos OLTP contienen datos detallados y actualizados. El esquema utilizado para almacenar las bases de datos transaccionales es el modelo de entidad (generalmente en tercera forma normal, 3NF ). La normalización es la norma para las técnicas de modelado de datos en este sistema.
El análisis predictivo consiste en encontrar y cuantificar patrones ocultos en los datos mediante modelos matemáticos complejos para anticipar diferentes escenarios futuros, como la demanda de productos , y tomar mejores decisiones. Por el contrario, OLAP se centra en el análisis de datos históricos y es reactivo. Los sistemas predictivos también se utilizan para la gestión de relaciones con el cliente (CRM).
Base de datos
Una base de datos es una colección organizada de datos que se almacena y gestiona electrónicamente. [ 6 ] Está diseñada para almacenar, recuperar y gestionar datos estructurados utilizando un SGBD (Software de Gestión de Bases de Datos) para consultar y manipular los datos.
almacenes de datos
Un data mart es un almacén de datos simple enfocado en un solo tema o área funcional. Por lo tanto, obtiene datos de un número limitado de fuentes, como ventas, finanzas o marketing. Los data marts suelen ser construidos y controlados por un solo departamento dentro de una organización. Las fuentes pueden ser sistemas operativos internos, un almacén de datos central o datos externos. [ 8 ]
Los tipos de almacenes de datos incluyen almacenes de datos dependientes , independientes e híbridos.
lago de datos
Un lago de datos es un repositorio centralizado que almacena grandes volúmenes de datos en formato sin procesar, los cuales se procesan en tiempo de ejecución. [ 9 ] Puede recopilar datos de múltiples fuentes, como API, archivos, bases de datos, sensores, sitios web, etc. A diferencia de los almacenes de datos, los lagos de datos almacenan datos en formatos estructurados, semiestructurados y no estructurados, lo que los hace aptos para el aprendizaje automático y el procesamiento de big data.
Variantes
ETL
El almacén de datos típico basado en ETL ( Extracción, Transformación y Carga ) utiliza capas de preparación , integración de datos y acceso para albergar sus funciones clave. La capa de preparación o base de datos de preparación almacena los datos sin procesar extraídos de cada uno de los sistemas de datos de origen dispares. La capa de integración integra conjuntos de datos dispares transformando los datos de la capa de preparación, a menudo almacenando estos datos transformados en una base de datos de almacenamiento de datos operativos (ODS). Los datos integrados se transfieren a otra base de datos, a menudo denominada base de datos del almacén de datos, donde se organizan en grupos jerárquicos, a menudo llamados dimensiones, y en hechos y hechos agregados. La combinación de hechos y dimensiones se denomina a veces esquema de estrella . La capa de acceso ayuda a los usuarios a recuperar los datos. [ 11 ]
La fuente principal de datos se limpia , transforma, cataloga y pone a disposición de los gerentes y otros profesionales de negocios para la minería de datos , el procesamiento analítico en línea , la investigación de mercado y el apoyo a la toma de decisiones . [ 12 ] Sin embargo, los medios para recuperar y analizar datos, extraer, transformar y cargar datos, y administrar el diccionario de datos también se consideran componentes esenciales de un sistema de almacenamiento de datos. Muchas referencias al almacenamiento de datos utilizan este contexto más amplio. Por lo tanto, una definición ampliada de almacenamiento de datos incluye herramientas de inteligencia empresarial , herramientas para extraer, transformar y cargar datos en el repositorio, y herramientas para administrar y recuperar metadatos .
ELT

El almacenamiento de datos basado en ELT elimina la necesidad de una herramienta ETL independiente para la transformación de datos. En su lugar, mantiene un área de preparación dentro del propio almacén de datos. Con este enfoque, los datos se extraen de sistemas de origen heterogéneos y se cargan directamente en el almacén de datos, antes de cualquier transformación. Todas las transformaciones necesarias se gestionan dentro del propio almacén de datos. Finalmente, los datos procesados se cargan en las tablas de destino del mismo almacén de datos.
Beneficios
Un almacén de datos mantiene una copia de la información de los sistemas de transacciones de origen. Esta complejidad arquitectónica ofrece la oportunidad de:
- Integrar datos de múltiples fuentes en una única base de datos y modelo de datos. Mayor concentración de datos en una sola base de datos para que se pueda utilizar un único motor de consultas para presentar los datos en un almacén de datos operativo .
- Mitigar el problema de la contención de bloqueos a nivel de aislamiento en los sistemas de procesamiento de transacciones causado por consultas de análisis de larga duración en bases de datos de procesamiento de transacciones.
- Mantenga el historial de datos , incluso si los sistemas de transacciones de origen no lo hacen.
- Integrar datos de múltiples sistemas de origen permite una visión centralizada de toda la empresa. Este beneficio siempre es valioso, pero especialmente cuando la organización crece mediante fusiones.
- Mejorar la calidad de los datos proporcionando códigos y descripciones coherentes, señalando o incluso corrigiendo los datos erróneos.
- Presente la información de la organización de forma coherente.
- Proporcionar un modelo de datos común y único para todos los datos de interés, independientemente de su origen.
- Reestructurar los datos para que tengan sentido para los usuarios de negocio.
- Reestructurar los datos para que ofrezcan un rendimiento de consulta excelente, incluso para consultas analíticas complejas, sin afectar a los sistemas operativos .
- Aportar valor añadido a las aplicaciones operativas de la empresa, en particular a los sistemas de gestión de relaciones con el cliente (CRM).
- Facilitar la redacción de consultas de apoyo a la toma de decisiones.
- Organizar y desambiguar los datos repetitivos.
Historia
El concepto de almacenamiento de datos se remonta a finales de la década de 1980 [ 13 ] , cuando los investigadores de IBM, Barry Devlin y Paul Murphy, desarrollaron el "almacén de datos empresariales". En esencia, el concepto de almacenamiento de datos tenía como objetivo proporcionar un modelo arquitectónico para el flujo de datos desde los sistemas operativos a los entornos de apoyo a la toma de decisiones . El concepto buscaba abordar los diversos problemas asociados con este flujo, principalmente los altos costos asociados. En ausencia de una arquitectura de almacenamiento de datos, se requería una enorme cantidad de redundancia para dar soporte a múltiples entornos de apoyo a la toma de decisiones. En las grandes corporaciones, era común que múltiples entornos de apoyo a la toma de decisiones operaran de forma independiente. Aunque cada entorno atendía a diferentes usuarios, a menudo requerían gran parte de los mismos datos almacenados. El proceso de recopilación, limpieza e integración de datos de diversas fuentes, generalmente de sistemas operativos existentes a largo plazo (generalmente denominados sistemas heredados ), solía replicarse parcialmente para cada entorno. Además, los sistemas operativos se reevaluaban con frecuencia a medida que surgían nuevos requisitos de apoyo a la toma de decisiones. Con frecuencia, los nuevos requisitos exigían recopilar, limpiar e integrar nuevos datos procedentes de " almacenes de datos " adaptados para facilitar el acceso de los usuarios.
Además, con la publicación de *The IRM Imperative* (Wiley & Sons, 1991) de James M. Kerr, se popularizó la idea de gestionar y cuantificar los recursos de datos de una organización, registrando dicho valor como un activo en el balance. En el libro, Kerr describió un método para alimentar bases de datos temáticas a partir de datos provenientes de sistemas transaccionales, creando así un área de almacenamiento donde los datos resumidos pudieran utilizarse para fundamentar la toma de decisiones ejecutivas. Este concepto impulsó la reflexión sobre cómo desarrollar y gestionar un almacén de datos de forma práctica en cualquier empresa.
Principales avances en los primeros años del almacenamiento de datos:
- Década de 1960: General Mills y Dartmouth College , en un proyecto de investigación conjunto, desarrollan los términos dimensiones y hechos . [ 14 ]
- Década de 1970: ACNielsen e IRI proporcionan almacenes de datos dimensionales para ventas minoristas. [ 14 ]
- Década de 1970: Bill Inmon comienza a definir y analizar el término almacén de datos . [ 15 ] [ 16 ] [ 17 ]
- 1975 – Sperry Univac presenta MAPPER ( mantener, preparar y producir informes ejecutivos ), un sistema de gestión de bases de datos e informes que incluye el primer lenguaje de cuarta generación ( 4GL ) del mundo . Es la primera plataforma diseñada para la creación de centros de información (precursora de la tecnología actual de almacenamiento de datos).
- 1983 – Teradata presenta la computadora de base de datos DBC/1012 diseñada específicamente para el apoyo a la toma de decisiones. [ 18 ]
- 1984 – Metaphor Computer Systems , fundada por David Liddle y Don Massaro, lanza un paquete de hardware/software y una interfaz gráfica de usuario (GUI) para que los usuarios empresariales creen un sistema de gestión y análisis de bases de datos.
- 1988 – Barry Devlin y Paul Murphy publican el artículo "Una arquitectura para un sistema empresarial y de información" donde introducen el término "almacén de datos empresariales". [ 19 ]
- 1990 – Red Brick Systems, fundada por Ralph Kimball , presenta Red Brick Warehouse, un sistema de gestión de bases de datos específicamente diseñado para el almacenamiento de datos.
- 1991 – James M. Kerr publica "The IRM Imperative", obra que sugiere que los recursos de datos podrían contabilizarse como un activo en el balance, lo que impulsa el interés comercial en la creación de almacenes de datos.
- 1991 – Prism Solutions, fundada por Bill Inmon , presenta Prism Warehouse Manager, un software para el desarrollo de almacenes de datos.
- 1992 – Bill Inmon publica el libro Building the Data Warehouse . [ 20 ]
- 1995 – Se funda el Data Warehousing Institute, una organización con fines de lucro que promueve el almacenamiento de datos.
- 1996 – Ralph Kimball publica el libro The Data Warehouse Toolkit . [ 21 ]
- 1998 – El modelado focal se implementa como un enfoque de modelado de almacén de datos de conjunto (híbrido), con Patrik Lager como uno de los principales impulsores. [ 22 ] [ 23 ]
- 2000 – Dan Linstedt publica en el dominio público el modelo de bóveda de datos , concebido en 1990 como una alternativa a Inmon y Kimball para proporcionar almacenamiento histórico a largo plazo de datos provenientes de múltiples sistemas operativos, con énfasis en el rastreo, la auditoría y la resiliencia a los cambios del modelo de datos de origen.
- 2008 – Bill Inmon , junto con Derek Strauss y Genia Neushloss, publica "DW 2.0: La arquitectura para la próxima generación de almacenamiento de datos", donde explica su enfoque descendente para el almacenamiento de datos y acuña el término "almacenamiento de datos 2.0".
- 2008 – El modelado de anclaje se formalizó en un artículo presentado en la Conferencia Internacional sobre Modelado Conceptual, y ganó el premio al mejor artículo [ 24 ].
- 2012 – Bill Inmon desarrolla y publica una tecnología conocida como "desambiguación textual". Esta tecnología aplica contexto al texto sin procesar y lo reformatea, junto con el contexto, a un formato de base de datos estándar. Una vez que el texto sin procesar se somete a la desambiguación textual, puede ser accedido y analizado de forma sencilla y eficiente mediante tecnologías estándar de inteligencia empresarial. La desambiguación textual se logra mediante la ejecución de ETL textual. Resulta útil en cualquier contexto donde se encuentre texto sin procesar, como en documentos, Hadoop, correo electrónico, etc.
- 2013 – Se lanzó Data Vault 2.0, [ 25 ] [ 26 ] con algunos cambios menores en el método de modelado, así como la integración con las mejores prácticas de otras metodologías, arquitecturas e implementaciones, incluidos los principios ágiles y CMMI.
Organización de datos
Hechos
Un hecho es un valor o una medida en el sistema que se está gestionando.
Los datos brutos son los que informa la entidad informante. Por ejemplo, en un sistema de telefonía móvil, si una estación base transceptora (BTS) recibe 1000 solicitudes de asignación de canales de tráfico, asigna 820 y rechaza el resto, podría informar tres datos a un sistema de gestión:
tch_req_total = 1000tch_req_success = 820tch_req_fail = 180
Los datos brutos se agregan a niveles superiores en diversas dimensiones para extraer información más relevante para el servicio o negocio. Estos se denominan datos agregados o resúmenes.
Por ejemplo, si hay tres estaciones base de telefonía móvil (BTS) en una ciudad, entonces los datos anteriores se pueden agregar al nivel de ciudad en la dimensión de red. Por ejemplo:
tch_req_success_city = tch_req_success_bts1 + tch_req_success_bts2 + tch_req_success_bts3avg_tch_req_success_city = (tch_req_success_bts1 + tch_req_success_bts2 + tch_req_success_bts3) / 3
Enfoque dimensional versus enfoque normalizado para el almacenamiento de datos
Los dos enfoques más importantes para almacenar datos en un almacén son el dimensional y el normalizado. El enfoque dimensional utiliza un esquema en estrella , como propuso Ralph Kimball . El enfoque normalizado, también llamado tercera forma normal (3NF), es un modelo normalizado entidad-relación propuesto por Bill Inmon. [ 27 ]
Enfoque dimensional
En un enfoque dimensional , los datos de las transacciones se dividen en "hechos", que suelen ser datos numéricos, y " dimensiones ", que son la información de referencia que contextualiza los hechos. Por ejemplo, una transacción de venta se puede desglosar en hechos, como la cantidad de productos pedidos y el precio total pagado, y en dimensiones, como la fecha del pedido, el nombre del cliente, el número de producto, las direcciones de envío y facturación, y el vendedor responsable de recibir el pedido.
Este enfoque dimensional facilita la comprensión de los datos y acelera su recuperación. [ 21 ] Las estructuras dimensionales son fáciles de entender para los usuarios de negocio porque se dividen en mediciones/hechos y contexto/dimensiones. Los hechos se relacionan con los procesos de negocio y el sistema operativo de la organización, y las dimensiones constituyen el contexto (Kimball, Ralph 2008). Otra ventaja es que el modelo dimensional no requiere una base de datos relacional en cada caso. Por lo tanto, este tipo de técnica de modelado resulta muy útil para las consultas de los usuarios finales en el almacén de datos.
El modelo de hechos y dimensiones también puede entenderse como un cubo de datos , [ 28 ] donde las dimensiones son las coordenadas categóricas en un cubo multidimensional, el hecho es un valor que corresponde a las coordenadas.
Las principales desventajas del enfoque dimensional son:
- Es complicado mantener la integridad de los hechos y las dimensiones, cargando el almacén de datos con datos de diferentes sistemas operativos.
- Resulta difícil modificar la estructura del almacén si la organización cambia su forma de operar.
Enfoque normalizado
En el enfoque normalizado, los datos del almacén se almacenan siguiendo, en cierta medida, las reglas de normalización de bases de datos . Las tablas de bases de datos relacionales normalizadas se agrupan por áreas temáticas (por ejemplo, clientes, productos y finanzas). En grandes empresas, esto da como resultado decenas de tablas interconectadas mediante una compleja red de uniones (Kimball, Ralph 2008).
La principal ventaja de este enfoque es la sencillez para añadir información a la base de datos. Entre sus desventajas se encuentra que, debido a la gran cantidad de tablas, puede resultar difícil para los usuarios combinar datos de diferentes fuentes para obtener información coherente y acceder a ella sin comprender con precisión las fuentes de datos y la estructura del almacén de datos.
Tanto los modelos normalizados como los dimensionales pueden representarse en diagramas entidad-relación, ya que ambos contienen tablas relacionales vinculadas. La diferencia radica en el grado de normalización. Estos enfoques no son mutuamente excluyentes, y existen otros. Los enfoques dimensionales pueden implicar la normalización de datos hasta cierto punto (Kimball, Ralph 2008).
En Information-Driven Business , [ 29 ] Robert Hillard compara los dos enfoques basándose en las necesidades de información del problema empresarial. Concluye que los modelos normalizados contienen mucha más información que sus equivalentes dimensionales (incluso cuando se utilizan los mismos campos en ambos modelos), pero a costa de la usabilidad. La técnica mide la cantidad de información en términos de entropía de la información y la usabilidad en términos de la medida de transformación de datos de Small Worlds. [ 30 ]
Métodos de diseño
Diseño de abajo hacia arriba
En el enfoque ascendente , primero se crean almacenes de datos para proporcionar capacidades de análisis e informes para procesos de negocio específicos . Estos almacenes de datos se pueden integrar posteriormente para crear un almacén de datos integral. La arquitectura de bus del almacén de datos es principalmente una implementación del "bus", una colección de dimensiones confirmadas y hechos confirmados , que son dimensiones que se comparten (de una manera específica) entre hechos en dos o más almacenes de datos. [ 31 ]
Diseño de arriba hacia abajo
El enfoque descendente se diseña utilizando un modelo de datos empresariales normalizado . Los datos "atómicos" , es decir, los datos con el mayor nivel de detalle, se almacenan en el almacén de datos. A partir del almacén de datos, se crean almacenes de datos dimensionales que contienen los datos necesarios para procesos de negocio o departamentos específicos. [ 32 ]
Diseño híbrido
Los almacenes de datos suelen utilizar un paradigma de distribución radial . Los sistemas heredados que alimentan el almacén a menudo incluyen sistemas de gestión de relaciones con el cliente (CRM) y planificación de recursos empresariales (ERP) , generando grandes cantidades de datos. Para consolidar estos diversos modelos de datos y facilitar el proceso de extracción, transformación y carga ( ETC), los almacenes de datos suelen utilizar un repositorio de datos operativos , cuya información se procesa y se integra en el almacén de datos propiamente dicho. Para reducir la redundancia de datos, los sistemas de mayor tamaño suelen almacenar los datos de forma normalizada. Posteriormente, se pueden crear almacenes de datos para informes específicos sobre el almacén de datos.
Una base de datos de almacén de datos híbrida (también llamada de conjunto) se mantiene en tercera forma normal para eliminar la redundancia de datos . Sin embargo, una base de datos relacional normal no es eficiente para informes de inteligencia empresarial donde predomina el modelado dimensional. Los pequeños almacenes de datos pueden acceder a la información del almacén consolidado y utilizar los datos filtrados y específicos para las tablas de hechos y las dimensiones requeridas. El almacén de datos proporciona una única fuente de información de la que los almacenes de datos pueden leer, ofreciendo una amplia gama de información empresarial. La arquitectura híbrida permite reemplazar un almacén de datos por un repositorio de gestión de datos maestros donde podría residir la información operativa (no estática).
Los componentes del modelo Data Vault siguen una arquitectura de concentrador y radios. Este estilo de modelado es un diseño híbrido que combina las mejores prácticas de la tercera forma normal y el esquema de estrella . El modelo Data Vault no se ajusta a la tercera forma normal y rompe algunas de sus reglas, pero se basa en una arquitectura descendente con un diseño ascendente. El modelo Data Vault está diseñado exclusivamente para funcionar como un almacén de datos. No está pensado para ser accesible al usuario final, lo que, una vez implementado, requiere el uso de un data mart o un área de lanzamiento basada en el esquema de estrella para fines comerciales.
Características
Existen características básicas que definen los datos en el almacén de datos, entre las que se incluyen la orientación temática, la integración de datos, la variabilidad temporal, la no volatilidad de los datos y la granularidad de los datos.
Orientado al tema
A diferencia de los sistemas operativos, los datos en el almacén de datos giran en torno a los temas de la empresa. La orientación a temas no es normalización de bases de datos . La orientación a temas puede ser muy útil para la toma de decisiones. La recopilación de los objetos necesarios se denomina orientación a temas.
Integrado
Los datos almacenados en el repositorio están integrados. Dado que provienen de diversos sistemas operativos, es necesario eliminar cualquier inconsistencia. Las inconsistencias incluyen convenciones de nomenclatura, medición de variables, estructuras de codificación, atributos físicos de los datos, etc.
Variante en el tiempo
Si bien los sistemas operativos reflejan los valores actuales al respaldar las operaciones diarias, los datos del almacén de datos representan un horizonte temporal extenso (hasta 10 años), lo que significa que almacenan principalmente datos históricos. Su propósito principal es la minería de datos y la previsión. (Por ejemplo, si un usuario busca el patrón de compra de un cliente específico, necesita consultar los datos de sus compras actuales y pasadas). [ 33 ]
No volátil
Los datos en el almacén de datos son de solo lectura, lo que significa que no se pueden actualizar, crear ni eliminar (a menos que exista una obligación reglamentaria o legal para hacerlo). [ 34 ]
Opciones
Agregación
En el proceso de almacenamiento de datos, estos se pueden agregar en almacenes de datos en diferentes niveles de abstracción. El usuario puede comenzar analizando las unidades vendidas totales de un producto en toda una región. Luego, analiza los estados de esa región. Finalmente, puede examinar las tiendas individuales en un estado determinado. Por lo tanto, normalmente, el análisis comienza en un nivel superior y profundiza en niveles de detalle inferiores. [ 33 ]
Virtualización
Con la virtualización de datos , los datos utilizados permanecen en sus ubicaciones originales y se establece un acceso en tiempo real para permitir análisis en múltiples fuentes, creando un almacén de datos virtual. Esto puede ayudar a resolver algunas dificultades técnicas, como problemas de compatibilidad al combinar datos de diversas plataformas, reduciendo el riesgo de errores causados por datos defectuosos y garantizando el uso de los datos más recientes. Además, evitar la creación de una nueva base de datos con información personal facilita el cumplimiento de las normativas de privacidad. Sin embargo, con la virtualización de datos, la conexión a todas las fuentes de datos necesarias debe estar operativa, ya que no existe una copia local de los datos, lo cual es uno de los principales inconvenientes de este enfoque. [ 35 ]
Arquitectura
Existen numerosos métodos para construir u organizar un almacén de datos según las especificaciones de una organización. El hardware utilizado, el software creado y los recursos de datos necesarios para el correcto funcionamiento del almacén de datos constituyen los componentes principales de su arquitectura. Todos los almacenes de datos constan de varias fases en las que se modifican y ajustan los requisitos de la organización. [ 36 ]
Evolución en el uso de la organización
Estos términos hacen referencia al nivel de sofisticación de un almacén de datos:
- Almacén de datos operativos fuera de línea
- En esta etapa de evolución, los almacenes de datos se actualizan periódicamente (normalmente a diario, semanalmente o mensualmente) a partir de los sistemas operativos, y los datos se almacenan en una base de datos integrada orientada a la generación de informes.
- Almacén de datos fuera de línea
- En esta etapa, los almacenes de datos se actualizan periódicamente a partir de los datos de los sistemas operativos, y los datos del almacén de datos se almacenan en una estructura de datos diseñada para facilitar la elaboración de informes.
- Almacén de datos puntual
- El almacenamiento de datos integrado en línea representa los almacenes de datos en tiempo real; los datos en el almacén se actualizan para cada transacción realizada en los datos de origen.
- Almacén de datos integrado
- Estos almacenes de datos recopilan información de diferentes áreas de negocio, de modo que los usuarios pueden buscar la información que necesitan en otros sistemas. [ 37 ]
En el ámbito sanitario
En el sector sanitario , los almacenes de datos son componentes fundamentales de la informática sanitaria , ya que permiten la integración, el almacenamiento y el análisis de grandes volúmenes de datos clínicos, administrativos y operativos. Estos sistemas consolidan información procedente de diversas fuentes, como historias clínicas electrónicas (HCE), sistemas de información de laboratorio , sistemas de archivo y comunicación de imágenes (PACS) y plataformas de facturación médica . Al centralizar los datos, los almacenes de datos sanitarios dan soporte a una amplia gama de funciones, entre las que se incluyen la salud poblacional , el apoyo a la toma de decisiones clínicas , la mejora de la calidad, la vigilancia de la salud pública y la investigación médica .
Los almacenes de datos sanitarios suelen incorporar modelos de datos especializados que tienen en cuenta la complejidad y la sensibilidad de los datos médicos, como la información temporal (por ejemplo, historiales longitudinales de pacientes), las terminologías codificadas (por ejemplo, ICD-10 , SNOMED CT ) y el cumplimiento de las normativas de privacidad (por ejemplo, HIPAA en Estados Unidos o GDPR en la Unión Europea).
A continuación se presenta una lista de los principales almacenes de datos de pacientes con un amplio alcance (no específicos de enfermedades o especialidades ), con variables que incluyen resultados de laboratorio, farmacia, edad, raza, estatus socioeconómico, comorbilidades y cambios longitudinales:
Estos almacenes de datos permiten una atención sanitaria basada en datos, al respaldar estudios retrospectivos, investigaciones sobre la efectividad comparativa y análisis predictivos , a menudo con el uso de inteligencia artificial aplicada a la atención sanitaria .
Véase también
- Lista de software de inteligencia empresarial
- Lago de datos : repositorio de datos almacenados en formato sin procesar.
- Malla de datos : marco de arquitectura distribuida para la gestión de datos.
Referencias
- ↑ Dedić, Nedim; Stanier, Clare (2016). "Una evaluación de los desafíos del multilingüismo en el desarrollo de almacenes de datos". En Hammoudi, Slimane; Maciaszek, Leszek; Missikoff, Michele M. Missikoff; Camp, Olivier; Cordeiro, José (eds.). Actas de la 18.ª Conferencia Internacional sobre Sistemas de Información Empresarial . Conferencia Internacional sobre Sistemas de Información Empresarial, 25-28 de abril de 2016, Roma, Italia (PDF) . Vol. 1. SciTePress. pp. 196-206 . doi : 10.5220/0005858401960206 . ISBN 978-989-758-187-8Archivado (PDF) del original el 22 de mayo de 2018 .
- ↑ "¿Qué es un almacén de datos? | Conceptos clave | Amazon Web Services" . Amazon Web Services, Inc. Consultado el 13 de febrero de 2023 .
- 1 2 3 4 Rainer, R. Kelly; Cegielski, Casey G. (2012-05-01). Introducción a los sistemas de información: Facilitando y transformando los negocios, 4.ª edición (edición Kindle ). Wiley. págs. 127 , 128, 130, 131, 133. ISBN 978-1118129401.
- ↑ Halder, Nilimesh (22 de abril de 2024). "Base de datos operativa frente a almacén de datos: diferencias clave y perspectivas estratégicas para las empresas" . Medium . Recuperado el 16 de abril de 2026 .
- ↑ "Procesamiento de transacciones en línea (OLTP) y procesamiento analítico en línea (OLAP)" . GeeksforGeeks . 27 de enero de 2020. Consultado el 16 de abril de 2026 .
- ↑ "¿Qué es una base de datos?" . Oracle . Consultado el 15 de junio de 2026 .
- ↑ "Diferencia entre base de datos y almacén de datos" . Global Data 365. Consultado el 15 de junio de 2026 .
- ↑ "Conceptos de Data Mart" . Oracle. 2007.
- ↑ "¿Qué es un lago de datos?" . IBM . Consultado el 15 de junio de 2026 .
- ↑ "Data Lake vs Data Warehouse" . Global Data 365. Consultado el 15 de junio de 2026 .
- ↑ Patil, Preeti S.; Srikantha Rao; Suryakant B. Patil (2011). "Optimización del sistema de almacenamiento de datos: simplificación en la elaboración de informes y el análisis" . Actas de la IJCA sobre la Conferencia y Taller Internacional sobre Tendencias Emergentes en Tecnología . 9 (6). Fundamentos de la Informática: 33–37 .
- ↑ Marakas y O'Brien 2009
- ↑ "La historia hasta ahora" . 15 de abril de 2002. Archivado del original el 8 de julio de 2008. Consultado el 21 de septiembre de 2008 .
- 1 2 Kimball 2013, pág. 15
- ↑ "Auditoría del marco de almacenamiento de datos" (PDF) . Archivado (PDF) del original el 12 de mayo de 2012.
- ↑ Kempe, Shannon (23 de agosto de 2012). "Una breve historia del almacenamiento de datos" . DATAVERSITY . Recuperado el 10 de mayo de 2024 .
- ↑ "Almacén de datos: qué es y por qué importa" . www.sas.com . Consultado el 10 de mayo de 2024 .
- ↑ Paul Gillin (20 de febrero de 1984). "¿Revivirá Teradata un mercado?" . Computer World . pp. 43, 48 . Consultado el 13 de marzo de 2017 .
- ↑ Devlin, BA; Murphy, PT (1988). "Una arquitectura para un sistema empresarial y de información". IBM Systems Journal . 27 : 60–80 . doi : 10.1147/sj.271.0060 .
- ↑ Inmon, Bill (1992). Construyendo el almacén de datos . Wiley. ISBN 0-471-56960-7.
- 1 2 Kimball, Ralph (2011). The Data Warehouse Toolkit . Wiley. pág. 237. ISBN 978-0-470-14977-5.
- ↑ Introducción al marco conceptual
- ↑ Encuentro de modelado de datos en Múnich: Introducción a Focal con Patrik Lager - YouTube
- ^ Respecto a Olle; Rönnbäck, Lars; Bergholtz, María; Johannesson, Paul; Wohed, Petia (2009). "Modelado de anclajes". Modelado Conceptual - ER 2009 . Emergencias '09. vol. 5829. Gramado, Brasil: Springer-Verlag. págs. 234–250 . Bibcode : 2009LNCS.5829..234R . doi : 10.1007/978-3-642-04840-1_19 . ISBN 978-3-642-04839-5.
- ↑ Breve introducción a #datavault 2.0
- ↑ Se anuncia Data Vault 2.0
- ↑ Golfarelli, Matteo; Maio, Dario; Rizzi, Stefano (1998-06-01). "El modelo de hechos dimensional: un modelo conceptual para almacenes de datos" . International Journal of Cooperative Information Systems . 07 (2n03): 215– 247. doi : 10.1142/S0218843098000118 . ISSN 0218-8430 .
- ↑ "Introducción a los cubos de datos" .
- ↑ Hillard, Robert (2010). Negocios impulsados por la información . Wiley. ISBN 978-0-470-62577-4.
- ↑ "Teoría de la información y estrategia de inteligencia empresarial: Medida de transformación de datos de mundos pequeños - MIKE2.0, la metodología de código abierto para el desarrollo de la información" . Mike2.openmethodology.org . Consultado el 14 de junio de 2013 .
- ↑ "El término erróneo de abajo hacia arriba - DecisionWorks Consulting" . DecisionWorks Consulting . 17 de septiembre de 2003. Consultado el 6 de marzo de 2016 .
- ↑ Gartner, Sobre almacenes de datos, depósitos de datos operativos, data marts y depósitos de datos externos, diciembre de 2005
- 1 2 Paulraj., Ponniah (2010). Fundamentos del almacenamiento de datos para profesionales de TI . Ponniah, Paulraj. (2.ª ed.). Hoboken, NJ: John Wiley & Sons. ISBN 9780470462072OCLC 662453070
- ↑ Inmon, William H. (2005). Construyendo el almacén de datos (4.ª ed.). Indianápolis, IN: Wiley Pub. ISBN 9780764599446OCLC 61762085
- ^ Paiho, Satu; Tuominen, Pekka; Rökman, Jyri; Ylikerälä, Markus; Pajula, Juha; Siikavirta, Hanne (2022). "Oportunidades de los datos urbanos recopilados para ciudades inteligentes" . Ciudades inteligentes IET . 4 (4): 275– 291. doi : 10.1049/smc2.12044 . S2CID 253467923 .
- ↑ Gupta, Satinder Bal; Mittal, Aditya (2009). Introducción a los sistemas de gestión de bases de datos . Laxmi Publications. ISBN 9788131807248.
- ↑ "Almacén de datos" . 6 de abril de 2019.
- 1 2 Fayanju OM, Haut ER, Itani K (marzo de 2025). " Guía práctica de fuentes de macrodatos clínicos" . JAMA Surg . 160 (3): 344– 346. doi : 10.1001/jamasurg.2024.6006 . PMC 12230764. PMID 39775674 .
- ↑ "Epic Cosmos" . Sitio web de Epic Systems . Consultado el 13 de abril de 2025 .
- ↑ "OptumLabs Data Warehouse (OLDW)" . Universidad de California San Francisco . Consultado el 13 de abril de 2025 .
- ↑ "Optum Labs" . Universidad de Maryland . Consultado el 13 de abril de 2025 .
- ↑ Voss EA, Blacketer C, van Sandijk S, Moinat M, Kallfelz M, van Speybroeck M, Prieto-Alhambra D, Schuemie MJ, Rijnbeek PR (diciembre de 2023). "European Health Data & Evidence Network: aprendizajes de la creación de una red internacional estandarizada de datos de salud" . J Am Med Inform Assoc . 31 (1): 209– 219. doi : 10.1093/jamia/ocad214 . PMC 10746315. PMID 37952118 .
- ↑ Voss, Erica A; Blacketer, Clair; van Sandijk, Sebastiaan; Moinat, Maxim; Kallfelz, Michael; van Speybroeck, Michel; Prieto-Alhambra, Daniel; Schuemie, Martijn J; Rijnbeek, Peter R (22 de diciembre de 2023). "Red Europea de Datos y Evidencia en Salud: aprendizajes de la creación de una red internacional estandarizada de datos en salud" . Revista de la Asociación Estadounidense de Informática Médica . 31 (1): 209– 219. doi : 10.1093/jamia/ocad214 . ISSN 1067-5027 . PMC 10746315. PMID 37952118. Recuperado el 18 de enero de 2026 .
- ↑ «Artículos del Espacio Europeo de Datos Sanitarios (EHDS), Artículo 42, Tasas» . El Espacio Europeo de Datos Sanitarios (EHDS) . Consultado el 13 de abril de 2025 .
Lecturas adicionales
- Davenport, Thomas H. y Harris, Jeanne G. Competir con análisis: La nueva ciencia del éxito (2007) Harvard Business School Press. ISBN 978-1-4221-0332-6
- Ganczarski, Joe. Implementaciones de almacenes de datos: Estudio de factores críticos de implementación (2009) VDM Verlag ISBN 3-639-18589-7ISBN 978-3-639-18589-8
- Kimball, Ralph y Ross, Margy. The Data Warehouse Toolkit, tercera edición (2013). Wiley, ISBN. 978-1-118-53080-1
- Linstedt, Graziano, Hultgren. El negocio del modelado de bóvedas de datos, segunda edición (2010) Dan linstedt, ISBN 978-1-4357-1914-9
- William Inmon. Construyendo el almacén de datos (2005) John Wiley and Sons, ISBN 978-81-265-0645-3
- Watson, H. (2002). Avances recientes en el almacenamiento de datos. Communications of the Association for Information Systems, 8, pp-pp. https://doi.org/10.17705/1CAIS.00801
- Ingeniería de datos
- Almacenamiento de datos