Apache Beam es un modelo de programación unificado de código abierto para definir y ejecutar pipelines de procesamiento de datos , incluyendo ETL , procesamiento por lotes y procesamiento continuo ( stream ). [ 2 ] Los pipelines de Beam se definen utilizando uno de los SDK proporcionados y se ejecutan en uno de los ejecutores compatibles con Beam ( back-ends de procesamiento distribuido ), incluyendo Apache Flink , Apache Samza , Apache Spark y Google Cloud Dataflow . [ 3 ]
Historia
Apache Beam [ 3 ] es una implementación del modelo Dataflow descrito en el artículo. [ 4 ] El modelo Dataflow se basa en trabajos previos sobre abstracciones de procesamiento distribuido en Google, en particular sobre FlumeJava [ 5 ] y Millwheel. [ 6 ] [ 7 ]
En 2014, Google lanzó una implementación de SDK abierta del modelo Dataflow y un entorno para ejecutar Dataflows tanto localmente (no distribuido) como en el servicio Google Cloud Platform .
Cronología
Apache Beam realiza lanzamientos menores cada 6 semanas. [ 8 ]
Véase también
Referencias
- ↑ "Blogs" . beam.apache.org . La Fundación de Software Apache . Consultado el 6 de agosto de 2024 .
- ↑ Woodie, Alex (22 de abril de 2016). "El ambicioso objetivo de Apache Beam: unificar el desarrollo de Big Data" . Datanami . Recuperado el 4 de agosto de 2016 .
- 1 2 "Cloud Dataflow - Procesamiento de datos por lotes y en tiempo real" .
- ↑ Akidau, Tyler; Schmidt, Eric; Whittle, Sam; Bradshaw, Robert; Chambers, Craig; Chernyak, Slava; Fernández-Moctezuma, Rafael J.; Lax, Reuven; McVeety, Sam; Mills, Daniel; Perry, Frances (1 de agosto de 2015). "El modelo de flujo de datos" (PDF) . Actas de la Fundación VLDB . 8 (12): 1792– 1803. doi : 10.14778/2824032.2824076 . Recuperado el 4 de agosto de 2016 .
- ↑ Chambers, Craig; Raniwala, Ashish; Perry, Frances; Adams, Stephen; Henry, Robert R.; Bradshaw, Robert; Weizenbaum, Nathan (1 de enero de 2010). «FlumeJava: Pipelines de datos paralelos fáciles y eficientes». Actas de la 31.ª Conferencia ACM SIGPLAN sobre Diseño e Implementación de Lenguajes de Programación (PDF) . ACM. págs. 363–375 . doi : 10.1145/1806596.1806638 . ISBN 9781450300193. S2CID 14888571 . Archivado del original (PDF) el 23 de septiembre de 2016 . Recuperado el 4 de agosto de 2016 .
- ↑ Akidau, Tyler; Whittle, Sam; Balikov, Alex; Bekiroğlu, Kaya; Chernyak, Slava; Haberman, Josh; Lax, Reuven; McVeety, Sam; Mills, Daniel; Nordstrom, Paul (27 de agosto de 2013). "MillWheel" (PDF) . Actas de la Fundación VLDB . 6 (11): 1033– 1044. doi : 10.14778/2536222.2536229 . Archivado del original (PDF) el 1 de febrero de 2016. Recuperado el 4 de agosto de 2016 .
- ↑ Pointer, Ian (14 de abril de 2016). "Apache Beam quiere ser la uber-API para big data" . InfoWorld . Consultado el 4 de agosto de 2016 .
- ↑ "Políticas" . beam.apache.org . Consultado el 21 de abril de 2022 .
- Proyectos de la Apache Software Foundation
- Productos de big data
- computación en clúster
- Procesamiento distribuido de flujos
- Software de Google
- Apache Hadoop
- Software libre programado en Java.
- Software que utiliza la licencia Apache.