Articulo de referencia

Apache HBase

{{cite web|url=https://hbase.apache.org/downloads.html|title=Apache HBase – Apache HBase Downloads|access-date=12 January 2025}} \n |branch2 = 2.6.x\n |version2 = 2.6.4\n |date2...

HBase es una base de datos distribuida no relacional de código abierto, modelada a partir de Bigtable de Google y escrita en Java . Se desarrolla como parte del proyecto Apache Hadoop de la Apache Software Foundation y se ejecuta sobre HDFS (Hadoop Distributed File System) o Alluxio , proporcionando capacidades similares a las de Bigtable para Hadoop. Es decir, ofrece una forma tolerante a fallos de almacenar grandes cantidades de datos dispersos (pequeñas cantidades de información atrapadas dentro de una gran colección de datos vacíos o sin importancia, como encontrar los 50 elementos más grandes en un grupo de 2 mil millones de registros, o encontrar los elementos distintos de cero que representan menos del 0,1 % de una colección enorme).

HBase ofrece compresión, operación en memoria y filtros Bloom por columna, tal como se describe en el documento original de Bigtable. [ 2 ] Las tablas en HBase pueden servir como entrada y salida para trabajos MapReduce ejecutados en Hadoop, y se puede acceder a ellas a través de la API de Java, así como a través de las API de puerta de enlace REST , Avro o Thrift . HBase es un almacén de columnas anchas y ha sido ampliamente adoptado debido a su origen en Hadoop y HDFS. HBase se ejecuta sobre HDFS y es ideal para operaciones rápidas de lectura y escritura en grandes conjuntos de datos con alto rendimiento y baja latencia de entrada/salida.

HBase no reemplaza directamente una base de datos SQL clásica ; sin embargo, el proyecto Apache Phoenix proporciona una capa SQL para HBase, así como un controlador JDBC que se puede integrar con diversas aplicaciones de análisis e inteligencia empresarial . El proyecto Apache Trafodion proporciona un motor de consultas SQL con controladores ODBC y JDBC , y protección de transacciones ACID distribuidas en múltiples sentencias, tablas y filas que utilizan HBase como motor de almacenamiento.

HBase ahora da servicio a varios sitios web basados ​​en datos [ 3 ], pero la plataforma de mensajería de Facebook migró de HBase a MyRocks en 2018. [ 4 ] [ 5 ] A diferencia de las bases de datos relacionales y tradicionales, HBase no admite scripts SQL; en su lugar, el equivalente se escribe en Java, empleando una similitud con una aplicación MapReduce.

En la terminología del Teorema CAP de Eric Brewer , HBase es un sistema de tipo CP. [ 6 ]

Historia

Apache HBase comenzó como un proyecto de la empresa Powerset ante la necesidad de procesar grandes cantidades de datos para la búsqueda en lenguaje natural . Desde 2010 es un proyecto de primer nivel de Apache.

Facebook optó por implementar su nueva plataforma de mensajería utilizando HBase en noviembre de 2010, pero migró fuera de HBase en 2018. [ 4 ]

La serie 2.5.x es la línea de versiones estables actual y reemplaza a las líneas de versiones anteriores.

Casos de uso e implementaciones en producción

Empresas que utilizan HBase

A continuación se presenta una lista de empresas destacadas que han utilizado o están utilizando HBase:

Véase también

Referencias

  1. 1 2 3 "Apache HBase – Descargas de Apache HBase" . Consultado el 12 de enero de 2025 .
  2. Chang, et al. (2006). Bigtable: Un sistema de almacenamiento distribuido para datos estructurados.
  3. "Apache HBase – Powered By Apache HBase" . hbase.apache.org . Consultado el 8 de abril de 2018 .
  4. 1 2 "Migración del almacenamiento de Messenger para optimizar el rendimiento" . www.facebook.com . 26 de junio de 2018. Consultado el 5 de julio de 2018 .
  5. Facebook: Por qué nuestra comunicación de "próxima generación" abandonó MySQL. Recuperado: 17 de diciembre de 2010
  6. "Compromisos de consistencia en el diseño de sistemas de bases de datos distribuidas modernas" (PDF) . Febrero de 2012. Consultado el 23 de octubre de 2024 .
  7. HBaseCon (2 de agosto de 2016). "Apache HBase en Airbnb" . slideshare.net . Consultado el 8 de abril de 2018 .
  8. "Indexación de búsqueda casi en tiempo real" . 4 de enero de 2018.
  9. "¿La localidad de datos viene siempre incluida de serie en Hadoop?" 10 de marzo de 2018.
  10. "Por qué Imgur abandonó MySQL en favor de HBase - Base de datos DZone" . dzone.com . Consultado el 8 de abril de 2018 .
  11. "Martes Tecnológico: Notificaciones de Imgur: De MySQL a HBase - El Blog de Imgur" . blog.imgur.com . Consultado el 8 de abril de 2018 .
  12. Doyung Yoon. "S2Graph : Una base de datos de grafos a gran escala con HBase" . 
  13. Esen Sagynov (2012). "La historia detrás del desarrollo de la aplicación Line" . CUBRID.org . Archivado del original el 16 de agosto de 2013. Recuperado el 8 de julio de 2013 .
  14. Cheolsoo Park y Ashwin Shankar. "Netflix: Integrando Spark a escala de petabytes" .
  15. "Mejorando la eficiencia de las copias de seguridad de HBase en Pinterest" . Medium . 30 de marzo de 2018. Consultado el 14 de abril de 2020 .
  16. "Hbase en Salesforce.com" .
  17. Josh Baer. "Cómo Apache impulsa las recomendaciones musicales de Spotify" .
  18. "Tuenti Group Chat: Simple, pero complejo" . Archivado del original el 24 de noviembre de 2012. Consultado el 29 de septiembre de 2015 .
  19. «Tuenti Asincrónico» . GitHub . 6 de noviembre de 2013.

Bibliografía

  • Dimiduk, Nick; Khurana, Amandeep (28 de noviembre de 2012). HBase en acción (1.ª  ed.). Manning Publications . pág.  350. ISBN 978-1617290527.
  • George, Lars (20 de septiembre de 2011). HBase: La guía definitiva (1.ª  ed.). O'Reilly Media . pág.  556. ISBN 978-1449396107.
  • Jiang, Yifeng (16 de agosto de 2012). Libro de recetas de administración de HBase (1ª  ed.). Publicación de paquetes . pag.  332.ISBN 978-1849517140.
  • Página principal oficial de Apache HBase