Articulo de referencia

lago de datos

Diagrama visual de Data Lake Un lago de datos es un sistema o repositorio de datos almacenados en su formato natural, sin procesar, [ 1 ] generalmente como objetos binarios o ar...

Diagrama visual de cómo funciona Data Lake
Diagrama visual de Data Lake

Un lago de datos es un sistema o repositorio de datos almacenados en su formato natural, sin procesar, [ 1 ] generalmente como objetos binarios o archivos. Un lago de datos suele ser un único almacén de datos que incluye copias sin procesar de datos del sistema de origen, datos de sensores, datos sociales, etc., [ 2 ] y datos transformados utilizados para tareas como informes , visualización , análisis avanzados y aprendizaje automático . Un lago de datos puede incluir datos estructurados de bases de datos relacionales (filas y columnas), datos semiestructurados ( CSV , registros, XML , JSON ), datos no estructurados ( correos electrónicos , documentos, PDF ) y datos binarios (imágenes, audio , vídeo). [ 3 ] Un lago de datos puede establecerse en las instalaciones (dentro de los centros de datos de una organización) o en la nube (utilizando servicios en la nube ).

Fondo

James Dixon, entonces director de tecnología de Pentaho , acuñó el término en 2011 [ 4 ] para contrastarlo con el data mart , que es un repositorio más pequeño de atributos interesantes derivados de datos brutos. [ 5 ] Al promover los data lakes, argumentó que los data marts tienen varios problemas inherentes, como el silo de información . PricewaterhouseCoopers (PwC) afirmó que los data lakes podrían "poner fin a los silos de datos". [ 6 ] En su estudio sobre data lakes, señalaron que las empresas estaban "comenzando a extraer y colocar datos para análisis en un único repositorio basado en Hadoop ".

Ejemplos

Muchas empresas utilizan servicios de almacenamiento en la nube como Google Cloud Storage y Amazon S3 o un sistema de archivos distribuido como el sistema de archivos distribuido Apache Hadoop (HDFS). [ 7 ] Existe un creciente interés académico en el concepto de lagos de datos. Por ejemplo, Personal DataLake en la Universidad de Cardiff es un nuevo tipo de lago de datos que busca gestionar grandes volúmenes de datos de usuarios individuales al proporcionar un único punto para recopilar, organizar y compartir datos personales. [ 8 ]

Los primeros lagos de datos, como Hadoop 1.0, tenían capacidades limitadas porque solo admitían el procesamiento por lotes ( MapReduce ). Interactuar con ellos requería conocimientos de Java, MapReduce y herramientas de nivel superior como Apache Pig , Apache Spark y Apache Hive (que también estaban originalmente orientadas al procesamiento por lotes).

Crítica

Los lagos de datos mal gestionados han sido denominados jocosamente pantanos de datos. [ 9 ]

En junio de 2015, David Needle caracterizó los "llamados lagos de datos" como "una de las formas más controvertidas de gestionar big data ". [ 10 ] PwC también tuvo cuidado de señalar en su investigación que no todas las iniciativas de lagos de datos tienen éxito. Citan a Sean Martin, CTO de Cambridge Semantics :

Observamos que los clientes crean grandes cementerios de datos, volcando todo en el sistema de archivos distribuidos de Hadoop (HDFS) con la esperanza de hacer algo con ello más adelante. Pero luego simplemente pierden el rastro de lo que hay allí. El principal desafío no es crear un lago de datos, sino aprovechar las oportunidades que ofrece. [ 6 ]

Describen a las empresas que construyen lagos de datos exitosos como aquellas que van madurando gradualmente su lago a medida que descubren qué datos y metadatos son importantes para la organización.

Otra crítica es que el término data lake se utiliza con muchos significados diferentes. [ 11 ] Puede usarse para referirse, por ejemplo: cualquier herramienta o práctica de gestión de datos que no sean almacenes de datos ; una tecnología particular para la implementación; un depósito de datos sin procesar; un centro para la descarga de ETL ; o un centro central para análisis de autoservicio.

Si bien las críticas a los lagos de datos están justificadas, en muchos casos también se aplican a otros proyectos de datos. [ 12 ] Por ejemplo, la definición de almacén de datos también es variable, y no todos los esfuerzos en este ámbito han tenido éxito. En respuesta a diversas críticas, McKinsey señaló [ 13 ] que el lago de datos debe considerarse un modelo de servicio para generar valor empresarial dentro de la organización, no un resultado tecnológico.

casas de datos del lago

Los data lakehouses son un enfoque híbrido que puede ingerir una variedad de formatos de datos sin procesar como un data lake, al tiempo que proporciona transacciones ACID y calidad de datos forzada como un data warehouse . [ 14 ]

Véase también

Referencias

  1. "La creciente importancia de la calidad de los macrodatos" . The Data Roundtable . 21 de noviembre de 2016. Consultado el 1 de junio de 2020 .
  2. "¿Qué es un lago de datos?" . aws.amazon.com . Consultado el 12 de octubre de 2020 .
  3. Campbell, Chris. "Las cinco principales diferencias entre almacenes de datos y lagos de datos" . Blue-Granite.com . Archivado del original el 14 de marzo de 2016.
  4. Woods, Dan (21 de julio de 2011). "Los macrodatos requieren una gran arquitectura" . Forbes .
  5. Dixon, James (14 de octubre de 2010). "Pentaho, Hadoop y lagos de datos" . Blog de James Dixon . James Dixon . Recuperado el 7 de noviembre de 2015. Si piensas en un datamart como una tienda de agua embotellada (limpiada, envasada y estructurada para un consumo fácil), el lago de datos es una gran masa de agua en un estado más natural. El contenido del lago de datos fluye desde una fuente para llenarlo, y varios usuarios del lago pueden venir a examinarlo, sumergirse o tomar muestras.
  6. 1 2 Stein, Brian; Morrison, Alan (2014). Data lakes and the promise of unsiloed data (PDF) (Informe). Technology Forecast: Rethinking integration. PricewaterhouseCoopers.
  7. Tuulos, Ville (22 de septiembre de 2015). "Pipelines de datos a escala de petabytes con Docker, Luigi e instancias de Elastic Spot" . NextRoll .
  8. Walker, Coral; Alrehamy, Hassan (2015). "Personal Data Lake with Data Gravity Pull". Quinta Conferencia Internacional IEEE de 2015 sobre Big Data y Computación en la Nube . pp. 160–167 . doi : 10.1109/BDCloud.2015.62 . ISBN  978-1-4673-7183-4. S2CID 18024161 . 
  9. Olavsrud, Thor (8 de junio de 2017). "3 claves para evitar que tu lago de datos se convierta en un pantano de datos" . CIO . Consultado el 4 de enero de 2021 .
  10. Needle, David (10 de junio de 2015). "Cumbre de Hadoop: el manejo de grandes volúmenes de datos requiere herramientas y técnicas novedosas" . Aplicaciones empresariales. eWeek . Consultado el 1 de noviembre de 2015. Walter Maguire, tecnólogo jefe de campo de la Unidad de Negocio de Big Data de HP, habló sobre una de las formas más controvertidas de gestionar grandes volúmenes de datos, los llamados lagos de datos.
  11. "¿Son los lagos de datos noticias falsas?" . Sonra . 8 de agosto de 2017 . Consultado el 10 de agosto de 2017 .
  12. Belov, Vladimir; Kosenkov, Alexander N.; Nikulchev, Evgeny (2021). "Estudio de las características experimentales de los formatos de almacenamiento de datos para el desarrollo de data marts dentro de data lakes" . Applied Sciences . 11 (18): 8651. doi : 10.3390/app11188651 .
  13. "Una forma más inteligente de adentrarse en los lagos de datos" . McKinsey . 1 de agosto de 2017.
  14. "¿Qué es un Data Lakehouse?" . Databricks . 11 de febrero de 2020 . Consultado el 17 de febrero de 2026 .