Un almacén de datos distribuido es una red informática donde la información se almacena en más de un nodo , a menudo de forma replicada . [ 1 ] Generalmente se utiliza específicamente para referirse a una base de datos distribuida donde los usuarios almacenan información en varios nodos , o a una red informática en la que los usuarios almacenan información en varios nodos de la red pares .
Bases de datos distribuidas
Las bases de datos distribuidas suelen ser bases de datos no relacionales que permiten un acceso rápido a los datos a través de un gran número de nodos. Algunas bases de datos distribuidas ofrecen amplias capacidades de consulta, mientras que otras se limitan a una semántica de almacenamiento clave-valor . Ejemplos de bases de datos distribuidas limitadas son Bigtable de Google , que es mucho más que un sistema de archivos distribuido o una red peer-to-peer , [ 2 ] Dynamo de Amazon [ 3 ] y Azure Storage de Microsoft . [ 4 ]
Dado que la capacidad de realizar consultas arbitrarias no es tan importante como la disponibilidad , los diseñadores de almacenes de datos distribuidos han aumentado esta última a expensas de la consistencia. Sin embargo, el acceso de lectura/escritura de alta velocidad reduce la consistencia, ya que no es posible garantizar tanto la consistencia como la disponibilidad en una red particionada, como lo establece el teorema CAP .
Almacenes de datos de nodos de red pares
En las redes de almacenamiento de datos entre pares, el usuario generalmente puede permitir que otros usuarios utilicen su ordenador como nodo de almacenamiento. La información puede ser accesible o no para otros usuarios, dependiendo del diseño de la red.
La mayoría de las redes peer-to-peer no cuentan con almacenes de datos distribuidos, ya que los datos del usuario solo están disponibles cuando su nodo está conectado a la red. Sin embargo, esta distinción se difumina en sistemas como BitTorrent , donde es posible que el nodo de origen se desconecte, pero el contenido siga estando disponible. Aun así, esto solo ocurre con los archivos individuales solicitados por los redistribuidores, a diferencia de redes como Hyphanet , Winny , Share y Perfect Dark, donde cualquier nodo puede almacenar cualquier parte de los archivos en la red.
Los sistemas de almacenamiento de datos distribuidos suelen utilizar técnicas de detección y corrección de errores . Algunos (como Parchive sobre NNTP) emplean técnicas de corrección de errores hacia adelante para recuperar el archivo original cuando partes de este están dañadas o no disponibles. Otros intentan descargar el archivo nuevamente desde un servidor espejo diferente.
Ejemplos
Bases de datos distribuidas no relacionales
Almacenes de datos de nodos de red pares
- BitTorrent
- Cadena de bloques (base de datos)
- Proyecto Chord
- Freenet
- GNUnet
- IPFS
- Mnet
- Napster
- NNTP (el protocolo de almacenamiento de datos distribuidos utilizado para las noticias de Usenet )
- Unity, del software Perfect Dark
- Compartir
- Siacoin
- DeNet
- Almacenamiento en casa
- Tahoe-LAFS
- Winny
- ZeroNet
Véase también
Referencias
- ↑ Yaniv Pessach, Almacenamiento distribuido (Almacenamiento distribuido: conceptos, algoritmos e implementaciones , ed.), OL 25423189M
- ↑ "Bigtable: Google's Distributed Data Store" . Paper Trail. Archivado del original el 16/07/2017 . Recuperado el 05/04/2011 .
Aunque GFS proporciona a Google un almacenamiento de archivos distribuido fiable y escalable, no ofrece ninguna funcionalidad para estructurar los datos contenidos en los archivos más allá de una estructura de directorios jerárquica y nombres de archivo significativos. Es bien sabido que se requieren soluciones más expresivas para grandes conjuntos de datos. Los terabytes y terabytes de datos que Google recupera de los rastreadores web, entre muchas otras fuentes, necesitan organización, de modo que las aplicaciones cliente puedan realizar rápidamente búsquedas y actualizaciones con una granularidad más fina que el nivel de archivo. [...] Lo primero que hay que saber sobre Bigtable es que no es una base de datos relacional. Esto no debería sorprender: un tema recurrente en todos estos documentos sobre almacenes de datos distribuidos a gran escala es que los SGBDR son difíciles de implementar con un buen rendimiento. En Bigtable no existe un esquema fijo y rígido, ni integridad referencial entre tablas (por lo que no hay claves foráneas) y, por lo tanto, hay poco soporte para uniones optimizadas.
- ↑ Sarah Pidcock (31/01/2011). "Dynamo: el almacén de clave-valor de alta disponibilidad de Amazon" (PDF) . WATERLOO – CHERITON SCHOOL OF COMPUTER SCIENCE. pág. 2/22 . Consultado el 05/04/2011 .
Dynamo: un almacén de datos distribuido, escalable y de alta disponibilidad.
- ↑ "Almacenamiento de Windows Azure" . Microsoft . 16 de septiembre de 2011. Archivado del original el 9 de noviembre de 2011. Consultado el 6 de noviembre de 2011 .
- Gestión de datos
- Almacenamiento de datos distribuido
- Almacenes de datos distribuidos