Articulo de referencia

sistema de archivos de cuadrícula

Un sistema de archivos en cuadrícula es un sistema de archivos informático cuyo objetivo es mejorar la fiabilidad y la disponibilidad aprovechando muchas áreas de almacenamiento...

Un sistema de archivos en cuadrícula es un sistema de archivos informático cuyo objetivo es mejorar la fiabilidad y la disponibilidad aprovechando muchas áreas de almacenamiento de archivos más pequeñas. [ 1 ]

Componentes

Los sistemas de archivos contienen hasta tres componentes:

  • Tabla de archivos (tabla FAT, MFT, etc.)
  • Datos del archivo
  • Metadatos (permisos de usuario, etc.)

Un sistema de archivos de cuadrícula tendría necesidades similares:

Comparaciones

Debido a que los sistemas de archivos están diseñados para aparecer como un único disco que un único ordenador puede gestionar (por completo), surgen muchos desafíos nuevos en un escenario de red, donde cualquier disco dentro de la red debe ser capaz de gestionar las solicitudes de cualquier dato contenido en ella.

Características

La mayoría de los sistemas de almacenamiento de archivos utilizan capas de redundancia para lograr un alto nivel de protección de datos (imposibilidad de perderlos). Los métodos actuales de redundancia incluyen la replicación y las comprobaciones de paridad. Esta redundancia se puede implementar mediante una matriz RAID (en la que varios discos físicos aparecen en un ordenador local como un único disco, lo que puede incluir replicación de datos y/o particionamiento de disco). Del mismo modo, un sistema de archivos en cuadrícula contaría con algún nivel de redundancia (ya sea a nivel de archivo lógico o a nivel de bloque, posiblemente incluyendo algún tipo de comprobación de paridad) entre los distintos discos presentes en la cuadrícula.

Estructura

En primer lugar, es necesario un mecanismo de tabla de archivos. Además, dicha tabla debe incluir un mecanismo para localizar el archivo (de destino) dentro de la cuadrícula. En segundo lugar, debe existir un mecanismo para trabajar con los datos de los archivos. Este mecanismo es responsable de que los datos de los archivos estén disponibles para las solicitudes.

Implementación

Con la tecnología BitTorrent , se puede establecer un paralelismo con un sistema de archivos en cuadrícula, donde un rastreador de torrents (y motor de búsqueda) sería la "tabla de archivos" y las aplicaciones de torrents (que transmiten los archivos) serían el componente de "datos de archivo". Los nodos de la tabla de archivos podrían utilizar un mecanismo similar a un feed RSS para indicar cuándo se agregan nuevos archivos a la tabla, lo que permitiría la replicación y otras funciones similares.

Un sistema de archivos puede incorporar tecnología similar (replicación distribuida, solicitud/cumplimiento de datos distribuidos).

Si ambos sistemas (tabla de archivos y datos de archivos) pudieran abordarse como una sola entidad (es decir, utilizando nodos virtuales en un clúster), entonces el crecimiento de dicho sistema podría controlarse fácilmente simplemente decidiendo de qué usos sería responsable el miembro de la red (tabla de archivos, búsquedas de archivos y/o datos de archivos).

Disponibilidad

Suponiendo que exista algún método para gestionar la replicación de datos (asignación de cuotas, etc.) de forma autónoma dentro de la red, los datos podrían configurarse para una alta disponibilidad, independientemente de las pérdidas o interrupciones.

Desafíos

El principal problema actual gira en torno a la distribución de actualizaciones de datos. Los torrents admiten una jerarquía mínima (actualmente implementada como metadatos en el rastreador de torrents o estrictamente como interfaz de usuario y categorización básica). Actualizar varios nodos simultáneamente (suponiendo que se requieran transacciones atómicas) genera latencia durante las actualizaciones y adiciones, generalmente hasta el punto de resultar inviable. Además, un sistema de archivos en cuadrícula (basado en red) rompe con los paradigmas tradicionales de TCP/IP, ya que un sistema de archivos (generalmente de bajo nivel, operaciones de tipo anillo 0) requiere implementaciones complejas de TCP/IP, lo que introduce capas de abstracción y complicación en el proceso de creación de dicho sistema de archivos en cuadrícula.

Ejemplos

Algunos ejemplos de datos de alta disponibilidad son:

  • Balanceo de carga de red / CARP : división de las solicitudes entrantes entre varios ordenadores, normalmente configurados de forma idéntica o como un único equipo.
  • Agrupación de almacenamiento compartido / SAN : un único disco (uno o más discos físicos que actúan como un único disco lógico) se presenta a varios ordenadores que distribuyen las solicitudes entrantes. Esto se suele utilizar cuando se requiere mayor capacidad de procesamiento que acceso al disco.
  • Replicación /duplicación de datos : varios ordenadores pueden intentar sincronizar los datos (normalmente a partir de un momento específico o una instantánea). Se utiliza con mayor frecuencia para generar informes (basados ​​en la última instantánea) o para realizar copias de seguridad.
  • Particionamiento de datos : división de datos entre varios ordenadores. En las bases de datos, los datos suelen particionarse en función de tablas (ciertas tablas se encuentran en determinados ordenadores, o una tabla se divide entre varios ordenadores en determinados "puntos de ruptura")... Los archivos en general tienden a particionarse por categoría (carpetas basadas en categorías) o por ubicación (separados geográficamente).

Véase también

Referencias

  1. Maad, Soha; Coghlan, Brian; Quigley, Geoff; Ryan, John; Kenny, Eamonn; o'Callaghan, David (2007). "Hacia una funcionalidad completa del sistema de archivos en cuadrícula". Future Generation Computer Systems . 23 : 123–131 . doi : 10.1016/j.future.2006.06.006 .