Apache Iceberg es un formato de alto rendimiento y código abierto para tablas analíticas de gran tamaño . Iceberg permite el uso de tablas SQL para big data y, al mismo tiempo, hace posible que motores como Spark , Trino , Flink , Presto , Hive , Impala , StarRocks, Doris y Pig trabajen de forma segura con las mismas tablas al mismo tiempo. [1] Iceberg se publica bajo la licencia Apache . [2] Iceberg aborda los desafíos de rendimiento y usabilidad del uso de tablas Apache Hive en entornos de lagos de datos grandes y exigentes. [3] Los proveedores que actualmente admiten tablas Apache Iceberg en sus productos incluyen Buster, [4] CelerData, Cloudera , Dremio, IOMETE, Snowflake , Starburst, Tabular, [5] y AWS . [6]
Historia
Iceberg fue creado en Netflix por Ryan Blue y Dan Weeks. Hive fue utilizado por muchos servicios y motores diferentes en la infraestructura de Netflix. Hive nunca pudo garantizar la exactitud y no proporcionó transacciones atómicas estables . [3] Muchos en Netflix evitaron usar estos servicios y realizar cambios en los datos para evitar consecuencias no deseadas del formato Hive. [3] Ryan Blue se propuso abordar tres problemas que enfrentaba la tabla Hive al crear Iceberg: [3]
- Garantizar la exactitud de los datos y apoyar las transacciones ACID .
- Mejore el rendimiento al permitir que se realicen operaciones más detalladas en la granularidad del archivo para lograr escrituras óptimas.
- Simplificar y ofuscar [ cita requerida ] el funcionamiento y mantenimiento general de las tablas.
El desarrollo de Iceberg comenzó en 2017. [7] El proyecto se convirtió en código abierto y se donó a la Apache Software Foundation en noviembre de 2018. [8] En mayo de 2020, el proyecto Iceberg pasó a ser un proyecto Apache de nivel superior. [8]
Iceberg es utilizado por varias empresas, incluidas Airbnb , [9] Apple , [3] Expedia , [10] LinkedIn , [11] Adobe , [12] Lyft y muchas más. [13]
Véase también
Referencias
- ^ "Iceberg Apache". iceberg.apache.org . Consultado el 5 de octubre de 2022 .
- ^ "Licencia de GitHub de apache/iceberg". The Apache Software Foundation. 5 de octubre de 2022. Consultado el 5 de octubre de 2022 .
- ^ abcde Woodie, Alex (8 de febrero de 2021). "Apache Iceberg: ¿El centro de un ecosistema de servicios de datos emergente?". Datanami . Archivado desde el original el 4 de septiembre de 2024. Consultado el 5 de octubre de 2022 .
- ^ "Destructor".
- ^ "Proveedores". iceberg.apache.org . Consultado el 5 de mayo de 2023 .
- ^ "Uso de tablas Apache Iceberg – Amazon Athena". Amazon Web Services, Inc. Archivado desde el original el 4 de septiembre de 2024. Consultado el 16 de junio de 2023 .
- ^ "Lanzamiento público inicial en apache/iceberg". GitHub . Archivado desde el original el 4 de septiembre de 2024 . Consultado el 5 de octubre de 2022 .
- ^ ab "Plantilla de estado de incubación - Incubadora Apache". incubator.apache.org . Archivado desde el original el 2022-10-05 . Consultado el 2022-10-05 .
- ^ Zhu, Ronnie (26 de septiembre de 2022). "Actualización de la infraestructura del almacén de datos en Airbnb". El blog tecnológico de Airbnb .
- ^ Mathiesen, Christine (26 de enero de 2021). "Una breve introducción a Apache Iceberg". Expedia Group Technology . Archivado desde el original el 5 de octubre de 2022. Consultado el 5 de octubre de 2022 .
- ^ "FastIngest: Gobblin de baja latencia con Apache Iceberg y formato ORC". engineering.linkedin.com . Archivado desde el original el 2024-09-04 . Consultado el 2022-10-05 .
- ^ Bremner, Jaemi (3 de diciembre de 2020). «Iceberg at Adobe». Medium . Archivado desde el original el 4 de septiembre de 2024. Consultado el 5 de octubre de 2022 .
- ^ Council, Data. «Open Source Highlight: Apache Iceberg». www.datacouncil.ai . Archivado desde el original el 5 de octubre de 2022. Consultado el 5 de octubre de 2022 .