
En teoría de la información y sistemas de información , los datos digitales o información digital se representan como una cadena de símbolos discretos , cada uno de los cuales puede tomar uno de un número finito de valores de un alfabeto , como letras o dígitos. Un ejemplo es un documento de texto , que consiste en una cadena de caracteres alfanuméricos . La forma más común de datos digitales en los sistemas de información modernos son los datos binarios , que se representan mediante una cadena de dígitos binarios (bits), cada uno de los cuales puede tener uno de dos valores: 0 o 1.
Los datos digitales se diferencian de los datos analógicos , que se representan mediante un valor de un rango continuo de números reales . Los datos analógicos se transmiten mediante una señal analógica , que no solo toma valores continuos, sino que también puede variar continuamente con el tiempo, siendo una función continua de valor real del tiempo. Un ejemplo es la variación de la presión del aire en una onda sonora .
Los datos requieren interpretación para convertirse en información . En los sistemas informáticos modernos (posteriores a 1960), todos los datos son digitales. Los datos digitales también sirven como entrada principal para la ciencia de datos , donde se recopilan , procesan , analizan y modelan utilizando métodos de estadística , informática y aprendizaje automático para el reconocimiento de patrones y el apoyo a la toma de decisiones .
La palabra digital proviene de la misma raíz que las palabras dígito y digitus (la palabra latina para dedo ), ya que los dedos se usan a menudo para contar. El matemático George Stibitz de los Laboratorios Bell Telephone usó la palabra digital en referencia a los rápidos pulsos eléctricos emitidos por un dispositivo diseñado para apuntar y disparar cañones antiaéreos en 1942. [ 1 ] El término se usa más comúnmente en informática y electrónica , especialmente donde la información del mundo real se convierte a forma numérica binaria , como en el audio digital y la fotografía digital .
Conversión de símbolos a formato digital
Dado que los símbolos (por ejemplo, los caracteres alfanuméricos ) no son continuos, representarlos digitalmente es mucho más sencillo que convertir información continua o analógica a digital. En lugar de utilizar el muestreo y la cuantificación , como en la conversión analógica-digital , se emplean técnicas como el sondeo y la codificación .
Un dispositivo de entrada de símbolos generalmente consta de un grupo de interruptores que se consultan a intervalos regulares para ver cuáles se activan. Se perderán datos si, dentro de un mismo intervalo de consulta, se presionan dos interruptores, o si se presiona, se suelta y se vuelve a presionar un interruptor. Esta consulta puede ser realizada por un procesador especializado en el dispositivo para evitar sobrecargar la CPU principal . [ 2 ] Cuando se ha ingresado un nuevo símbolo, el dispositivo normalmente envía una interrupción , en un formato especializado, para que la CPU pueda leerla.
En dispositivos con pocos interruptores (como los botones de un joystick ), el estado de cada uno se puede codificar mediante bits (normalmente 0 para liberado y 1 para pulsado) en una sola palabra. Esto resulta útil cuando las combinaciones de teclas tienen significado y, a veces, se utiliza para transmitir el estado de las teclas modificadoras del teclado (como Mayús y Control). Sin embargo, no permite gestionar más teclas que el número de bits que caben en un byte o palabra.
Los dispositivos con muchos interruptores (como un teclado de ordenador ) suelen disponerlos en una matriz de exploración, con los interruptores individuales en las intersecciones de las líneas x e y. Al pulsar un interruptor, se conectan las líneas x e y correspondientes. El sondeo (a menudo llamado exploración en este caso) se realiza activando cada línea x secuencialmente y detectando qué líneas y tienen una señal , es decir, qué teclas se han pulsado. Cuando el procesador del teclado detecta que una tecla ha cambiado de estado, envía una señal a la CPU indicando el código de exploración de la tecla y su nuevo estado. El símbolo se codifica o se convierte en un número en función del estado de las teclas modificadoras y la codificación de caracteres deseada .
Se puede utilizar una codificación personalizada para una aplicación específica sin pérdida de datos. Sin embargo, usar una codificación estándar como ASCII resulta problemático si se necesita convertir un símbolo como 'ß', pero este no se encuentra en el estándar.
Se estima que en 1986, menos del 1% de la capacidad tecnológica mundial para almacenar información era digital, mientras que en 2007 ya era del 94%. [ 3 ] Se considera que el año 2002 fue el año en que la humanidad logró almacenar más información en formato digital que en formato analógico (el "inicio de la era digital "). [ 4 ] [ 5 ]
Estados

Los datos digitales se presentan en estos tres estados: datos en reposo , datos en tránsito y datos en uso . [ 6 ] [ 7 ] La confidencialidad, la integridad y la disponibilidad deben gestionarse durante todo el ciclo de vida, desde el «nacimiento» hasta la destrucción de los datos. [ 8 ]
Datos en reposo
En tecnología de la información, los datos en reposo se refieren a los datos almacenados físicamente en sistemas de almacenamiento informático en cualquier formato digital (por ejemplo, almacenamiento en la nube , servicios de alojamiento de archivos , bases de datos , almacenes de datos , hojas de cálculo , archivos, cintas, copias de seguridad externas o en la nube, dispositivos móviles , etc.). Los datos en reposo incluyen tanto datos estructurados como no estructurados . [ 9 ] Este tipo de datos está expuesto a amenazas de hackers y otras amenazas maliciosas que buscan acceder a ellos digitalmente o mediante el robo físico de los medios de almacenamiento. Para evitar que estos datos sean accedidos, modificados o robados, las organizaciones suelen emplear medidas de seguridad como la protección con contraseña, el cifrado de datos o una combinación de ambos. Las opciones de seguridad utilizadas para este tipo de datos se conocen generalmente como protección de datos en reposo ( DARP ). [ 10 ]
Las definiciones incluyen:
"...todos los datos en el almacenamiento informático, excluyendo los datos que están atravesando una red o que residen temporalmente en la memoria del ordenador para ser leídos o actualizados." [ 11 ]
"...todos los datos almacenados, pero excluyen cualquier dato que atraviese frecuentemente la red o que resida en memoria temporal. Los datos en reposo incluyen, entre otros, datos archivados, datos a los que no se accede ni se modifican con frecuencia, archivos almacenados en discos duros, unidades USB, archivos almacenados en cintas y discos de respaldo, y también archivos almacenados fuera de las instalaciones o en una red de área de almacenamiento (SAN)." [ 12 ]
Si bien se acepta generalmente que los datos de archivo (es decir, los que nunca cambian), independientemente de su medio de almacenamiento, son datos en reposo, y los datos activos sujetos a cambios constantes o frecuentes son datos en uso, se podría considerar que los "datos inactivos" son aquellos que pueden cambiar, pero con poca frecuencia. La naturaleza imprecisa de términos como "constante" y "frecuente" implica que algunos datos almacenados no pueden definirse de forma exhaustiva como datos en reposo o en uso. Estas definiciones podrían dar a entender que los datos en reposo son un superconjunto de los datos en uso; sin embargo, los datos en uso, sujetos a cambios frecuentes, tienen requisitos de procesamiento distintos a los de los datos en reposo, ya sean completamente estáticos o sujetos a cambios ocasionales.
Seguridad
Debido a su naturaleza, los datos en reposo son una preocupación creciente para las empresas, las agencias gubernamentales y otras instituciones. [ 11 ] Los dispositivos móviles suelen estar sujetos a protocolos de seguridad específicos para proteger los datos en reposo del acceso no autorizado cuando se pierden o son robados [ 13 ] y existe un reconocimiento creciente de que los sistemas de gestión de bases de datos y los servidores de archivos también deben considerarse en riesgo; [ 14 ] cuanto más tiempo permanezcan los datos sin usar en el almacenamiento, mayor será la probabilidad de que personas no autorizadas fuera de la red puedan recuperarlos.
El cifrado de datos , que impide la visibilidad de los datos en caso de acceso no autorizado o robo, se utiliza comúnmente para proteger los datos en tránsito y se promueve cada vez más para proteger los datos en reposo. [ 15 ] El cifrado de datos en reposo solo debe incluir métodos de cifrado robustos como AES o RSA . Los datos cifrados deben permanecer cifrados incluso cuando fallen los controles de acceso, como nombres de usuario y contraseñas. Se recomienda aumentar el cifrado en múltiples niveles. La criptografía puede implementarse en la base de datos que contiene los datos y en el almacenamiento físico donde se almacenan las bases de datos. Las claves de cifrado de datos deben actualizarse periódicamente. Las claves de cifrado deben almacenarse por separado de los datos. El cifrado también permite la destrucción criptográfica al final del ciclo de vida de los datos o del hardware. La auditoría periódica de datos confidenciales debe formar parte de la política y realizarse según un calendario establecido. Por último, solo se debe almacenar la cantidad mínima posible de datos confidenciales. [ 16 ]
La tokenización es un método no matemático para proteger los datos en reposo que reemplaza los datos confidenciales con sustitutos no confidenciales, denominados tokens, que carecen de significado o valor extrínseco o explotable. Este proceso no altera el tipo ni la longitud de los datos, lo que permite su procesamiento en sistemas heredados, como bases de datos que pueden ser sensibles a la longitud y el tipo de datos. Los tokens requieren muchos menos recursos computacionales para su procesamiento y menos espacio de almacenamiento en bases de datos que los datos cifrados tradicionalmente. Esto se logra manteniendo ciertos datos total o parcialmente visibles para su procesamiento y análisis, mientras que la información confidencial permanece oculta. Los menores requisitos de procesamiento y almacenamiento hacen de la tokenización un método ideal para proteger los datos en reposo en sistemas que gestionan grandes volúmenes de datos.
Otro método para prevenir el acceso no deseado a los datos en reposo es el uso de la federación de datos [ 17 ] especialmente cuando los datos se distribuyen globalmente (por ejemplo, en archivos extraterritoriales). Un ejemplo de esto sería una organización europea que almacena sus datos archivados fuera de sus instalaciones en los EE. UU. Según los términos de la Ley USA PATRIOT [ 18 ] , las autoridades estadounidenses pueden exigir acceso a todos los datos almacenados físicamente dentro de sus fronteras, incluso si incluyen información personal de ciudadanos europeos sin conexiones con los EE. UU. El cifrado de datos por sí solo no puede utilizarse para prevenir esto, ya que las autoridades tienen derecho a exigir la información descifrada. Una política de federación de datos que retenga la información personal de los ciudadanos sin conexiones extranjeras dentro de su país de origen (separada de la información que no es personal o que es relevante para las autoridades extraterritoriales) es una opción para abordar esta preocupación. Sin embargo, se puede acceder a los datos almacenados en países extranjeros mediante la legislación de la Ley CLOUD .
Datos en uso
Los datos en uso son un término de tecnología de la información que se refiere a datos activos que se almacenan en un estado digital no persistente o memoria volátil , normalmente en la memoria de acceso aleatorio (RAM) de la computadora, las cachés de la CPU o los registros de la CPU . [ 19 ]
Los datos en uso también se han interpretado como “datos activos” en el contexto de estar en una base de datos o ser manipulados por una aplicación. Por ejemplo, algunas soluciones de puerta de enlace de cifrado empresarial para la nube afirman cifrar los datos en reposo, los datos en tránsito y los datos en uso . [ 20 ]
Algunos proveedores de software como servicio (SaaS) en la nube se refieren a los datos en uso como cualquier dato que las aplicaciones estén procesando actualmente, a medida que se utilizan la CPU y la memoria. [ 21 ]
Seguridad
Debido a su naturaleza, los datos en uso son motivo de creciente preocupación para empresas, agencias gubernamentales y otras instituciones. Estos datos, o datos en memoria, pueden contener información confidencial, como certificados digitales, claves de cifrado, propiedad intelectual (algoritmos de software, datos de diseño) e información personal identificable . La vulneración de los datos en uso permite el acceso a datos cifrados, tanto en reposo como en tránsito. Por ejemplo, alguien con acceso a la memoria RAM puede analizarla para localizar la clave de cifrado de los datos en reposo. Una vez obtenida dicha clave, puede descifrar los datos cifrados en reposo. Las amenazas a los datos en uso pueden presentarse en forma de ataques de arranque en frío , dispositivos de hardware maliciosos, rootkits y bootkits.
El cifrado, que impide la visibilidad de los datos en caso de acceso no autorizado o robo, se utiliza comúnmente para proteger los datos en tránsito y los datos en reposo, y se reconoce cada vez más como un método óptimo para proteger los datos en uso. Se han realizado múltiples proyectos para cifrar la memoria. Los sistemas Microsoft Xbox están diseñados para proporcionar cifrado de memoria, y la empresa PrivateCore cuenta actualmente con un producto de software comercial, vCage, que proporciona atestación junto con cifrado completo de la memoria para servidores x86. [ 22 ] Se han publicado varios artículos que destacan la disponibilidad de procesadores comerciales x86 y ARM con seguridad mejorada. [ 19 ] [ 23 ] En ese trabajo, se utiliza un procesador ARM Cortex-A8 como sustrato sobre el que se construye una solución de cifrado de memoria completa. Los segmentos de proceso (por ejemplo, pila, código o montón) se pueden cifrar individualmente o en composición. Este trabajo marca la primera implementación de cifrado de memoria completa en un procesador comercial móvil de propósito general. El sistema proporciona protección de confidencialidad e integridad tanto para el código como para los datos, que se cifran en todo el espacio fuera del límite de la CPU.
Para sistemas x86, AMD cuenta con una función de cifrado de memoria segura (SME) introducida en 2017 con Epyc . [ 24 ] Intel ha prometido ofrecer su función de cifrado de memoria total (TME) en una próxima CPU. [ 25 ] [ 26 ]
Los parches del núcleo del sistema operativo, como TRESOR y Loop-Amnesia, modifican el sistema operativo para que los registros de la CPU se utilicen para almacenar claves de cifrado, evitando así su almacenamiento en la memoria RAM. Si bien este enfoque no es de propósito general y no protege todos los datos en uso, sí protege contra ataques de arranque en frío. Las claves de cifrado se almacenan en la CPU en lugar de en la RAM, protegiendo así las claves de cifrado en reposo contra ataques que podrían comprometerlas.
Los enclaves permiten proteger un “enclave” mediante cifrado en la RAM, de modo que los datos del enclave se cifran mientras están en la RAM, pero están disponibles como texto plano dentro de la CPU y la caché de la CPU. Intel Corporation introdujo el concepto de “enclaves” como parte de sus Software Guard Extensions . Intel reveló una arquitectura que combina software y hardware de CPU en documentos técnicos publicados en 2013. [ 27 ]
Varias herramientas criptográficas, como la computación multipartita segura y el cifrado homomórfico , permiten el procesamiento privado de datos en sistemas no confiables. Los datos en uso pueden ser manipulados mientras están cifrados, sin que el sistema que los procesa se entere.
Datos en tránsito
Los datos en tránsito , también denominados datos en movimiento [ 28 ] y datos en vuelo [ 29 ] , son datos en ruta entre origen y destino, normalmente en una red informática .
Los datos en tránsito se pueden separar en dos categorías: información que fluye a través de una red pública o no confiable, como Internet, y datos que fluyen dentro de los límites de una red privada, como una red de área local (LAN) corporativa o empresarial. [ 30 ]

En informática
Los datos dentro de una computadora, en la mayoría de los casos, se mueven como datos paralelos . Los datos que se mueven hacia o desde una computadora, en la mayoría de los casos, se mueven como datos seriales . Los datos provenientes de un dispositivo analógico, como un sensor de temperatura, pueden convertirse a digital utilizando un convertidor analógico-digital . Los datos que representan cantidades , caracteres o símbolos sobre los cuales una computadora realiza operaciones se almacenan y registran en medios de grabación magnéticos , ópticos , electrónicos o mecánicos, y se transmiten en forma de señales eléctricas u ópticas digitales. [ 31 ] Los datos entran y salen de las computadoras a través de dispositivos periféricos .
Los elementos de memoria física de una computadora constan de una dirección y un byte/palabra de almacenamiento de datos. Los datos digitales suelen almacenarse en bases de datos relacionales , como tablas o bases de datos SQL, y generalmente se pueden representar como pares clave/valor abstractos. Los datos se pueden organizar en muchos tipos diferentes de estructuras de datos , incluyendo matrices, grafos y objetos . Las estructuras de datos pueden almacenar datos de muchos tipos diferentes , incluyendo números , cadenas e incluso otras estructuras de datos .
Características
Los metadatos ayudan a convertir los datos en información. Los metadatos son datos sobre los datos. Los metadatos pueden ser implícitos, explícitos o proporcionados.
Los datos relacionados con eventos o procesos físicos tendrán un componente temporal. Este componente temporal puede ser implícito. Este es el caso cuando un dispositivo, como un registrador de temperatura, recibe datos de un sensor de temperatura . Al recibir la temperatura, se asume que los datos tienen una referencia temporal del momento presente . Por lo tanto, el dispositivo registra la fecha, la hora y la temperatura simultáneamente. Cuando el registrador de datos comunica las temperaturas, también debe informar la fecha y la hora como metadatos para cada lectura de temperatura.
Fundamentalmente, las computadoras siguen una secuencia de instrucciones que se les proporcionan en forma de datos. Un conjunto de instrucciones para realizar una tarea (o tareas) determinada se denomina programa . Un programa son datos en forma de instrucciones codificadas para controlar el funcionamiento de una computadora u otra máquina. [ 32 ] En el caso nominal, el programa, tal como lo ejecuta la computadora, consistirá en código máquina . Los elementos de almacenamiento manipulados por el programa, pero que no son ejecutados realmente por la unidad central de procesamiento (CPU), también son datos. En su forma más esencial, un dato individual es un valor almacenado en una ubicación específica. Por lo tanto, es posible que los programas de computadora operen sobre otros programas de computadora, manipulando sus datos programáticos.
Para almacenar bytes de datos en un archivo, estos deben serializarse en un formato de archivo . Normalmente, los programas se almacenan en tipos de archivo especiales, distintos de los utilizados para otros datos. Los archivos ejecutables contienen programas; todos los demás archivos también son archivos de datos . Sin embargo, los archivos ejecutables también pueden contener datos utilizados por el programa, que están integrados en él. En particular, algunos archivos ejecutables tienen un segmento de datos que, en teoría, contiene constantes y valores iniciales para variables, los cuales pueden considerarse datos.
La línea que separa el programa de los datos puede difuminarse. Un intérprete , por ejemplo, es un programa. Los datos de entrada a un intérprete también son un programa, aunque no estén escritos en lenguaje máquina nativo. En muchos casos, el programa interpretado será un archivo de texto legible , que se manipula con un editor de texto . De forma similar, la metaprogramación implica que los programas manipulen otros programas como si fueran datos. Programas como compiladores , enlazadores , depuradores , actualizadores de programas, antivirus, etc., utilizan otros programas como datos.
Por ejemplo, un usuario podría indicarle al sistema operativo que cargue un procesador de texto desde un archivo y, a continuación, usar dicho programa para abrir y editar un documento almacenado en otro archivo. En este caso, el documento se consideraría dato. Si el procesador de texto también incluye un corrector ortográfico , el diccionario (lista de palabras) de este corrector también se consideraría dato. Los algoritmos que utiliza el corrector ortográfico para sugerir correcciones serían datos en código máquina o texto en algún lenguaje de programación interpretable .
En un uso alternativo, los archivos binarios (que no son legibles por humanos ) a veces se denominan datos , a diferencia del texto legible por humanos . [ 33 ]
La cantidad total de datos digitales en 2007 se estimó en 281 mil millones de gigabytes (281 exabytes ). [ 34 ] [ 35 ]
Claves y valores de datos, estructuras y persistencia.
Las claves en los datos proporcionan el contexto para los valores. Independientemente de la estructura de los datos, siempre hay un componente clave presente. Las claves en los datos y las estructuras de datos son esenciales para dar significado a los valores de los datos. Sin una clave que esté directa o indirectamente asociada con un valor, o con un conjunto de valores en una estructura, los valores pierden significado y dejan de ser datos. Es decir, debe haber un componente clave vinculado a un componente de valor para que se considere dato. [ 36 ]
Los datos pueden representarse en ordenadores de múltiples maneras, como se muestra en los siguientes ejemplos:
RAM
La memoria de acceso aleatorio (RAM) almacena datos a los que la CPU tiene acceso directo. Una CPU solo puede manipular datos dentro de sus registros o memoria del procesador. Esto contrasta con el almacenamiento de datos, donde la CPU debe dirigir la transferencia de datos entre el dispositivo de almacenamiento (disco, cinta...) y la memoria. La RAM es una matriz de ubicaciones lineales contiguas que un procesador puede leer o escribir proporcionando una dirección para la operación de lectura o escritura. El procesador puede operar en cualquier ubicación de la memoria en cualquier momento y en cualquier orden. En la RAM, el elemento de datos más pequeño es el bit binario . Las capacidades y limitaciones del acceso a la RAM son específicas del procesador. En general, la memoria principal está organizada como una matriz de ubicaciones que comienza en la dirección 0 ( hexadecimal 0). Cada ubicación puede almacenar generalmente 8 o 32 bits, dependiendo de la arquitectura del ordenador .
Llaves
Las claves de datos no tienen por qué ser una dirección de hardware directa en la memoria. Se pueden almacenar códigos de clave indirectos , abstractos y lógicos asociados a valores para formar una estructura de datos . Las estructuras de datos tienen desplazamientos (o enlaces o rutas) predeterminados desde el inicio de la estructura, donde se almacenan los valores de datos. Por lo tanto, la clave de datos consta de la clave de la estructura más el desplazamiento (o los enlaces o rutas) dentro de la misma. Cuando se repite dicha estructura, almacenando variaciones de los valores de datos y las claves de datos dentro de la misma estructura repetitiva, el resultado puede considerarse similar a una tabla , en la que cada elemento de la estructura repetitiva se considera una columna y cada repetición de la estructura se considera una fila de la tabla. En esta organización de datos, la clave de datos suele ser un valor en una (o una combinación de los valores de varias) de las columnas.
Estructuras de datos recurrentes organizadas
La representación tabular de estructuras de datos repetitivas es solo una de las muchas posibilidades. Estas estructuras pueden organizarse jerárquicamente , de modo que los nodos se vinculen entre sí en una cascada de relaciones padre-hijo. Los valores y, potencialmente, estructuras de datos más complejas se vinculan a los nodos. De este modo, la jerarquía nodal proporciona la clave para acceder a las estructuras de datos asociadas a los nodos. Esta representación puede considerarse como un árbol invertido . Los sistemas de archivos de los sistemas operativos modernos son un ejemplo común, al igual que XML .
Datos ordenados o clasificados
Los datos presentan ciertas características inherentes al ordenarse por una clave . Todos los valores de los subconjuntos de la clave aparecen juntos. Al recorrer secuencialmente grupos de datos con la misma clave, o cuando cambia un subconjunto de la clave, esto se conoce en el ámbito del procesamiento de datos como un salto de línea o un control de salto . Esto facilita especialmente la agregación de valores de datos en subconjuntos de una clave.
Almacenamiento periférico
Hasta la llegada de la memoria no volátil masiva como la memoria flash , el almacenamiento persistente de datos se lograba tradicionalmente escribiendo los datos en dispositivos de bloques externos como cintas magnéticas y discos duros . Estos dispositivos suelen buscar una ubicación en el medio magnético y luego leen o escriben bloques de datos de un tamaño predeterminado. En este caso, la ubicación de búsqueda en el medio es la clave de datos y los bloques son los valores de los datos. Los primeros sistemas de archivos de datos de disco sin procesar o sistemas operativos de disco reservaban bloques contiguos en el disco duro para los archivos de datos . En esos sistemas, los archivos podían llenarse, quedándose sin espacio de datos antes de que se hubieran escrito todos los datos en ellos. Por lo tanto, se reservaba mucho espacio de datos sin usar de forma improductiva para garantizar suficiente espacio libre para cada archivo. Los sistemas de archivos posteriores introdujeron las particiones . Reservaban bloques de espacio de datos en disco para las particiones y utilizaban los bloques asignados de forma más económica, asignando dinámicamente bloques de una partición a un archivo según fuera necesario. Para lograr esto, el sistema de archivos tenía que llevar un registro de qué bloques eran utilizados o no utilizados por los archivos de datos en un catálogo o tabla de asignación de archivos. Si bien esto permitió un mejor aprovechamiento del espacio de datos en disco, provocó la fragmentación de los archivos y una sobrecarga de rendimiento debido al tiempo adicional de búsqueda necesario para leer los datos. Los sistemas de archivos modernos reorganizan dinámicamente los archivos fragmentados para optimizar los tiempos de acceso. Los avances posteriores en los sistemas de archivos dieron lugar a la virtualización de las unidades de disco, donde una unidad lógica se puede definir como particiones de varias unidades físicas.
Datos indexados
Recuperar un pequeño subconjunto de datos de un conjunto mucho mayor puede implicar una búsqueda ineficiente a través de los datos de forma secuencial. Los índices son una forma de copiar claves y direcciones de ubicación de estructuras de datos en archivos, tablas y conjuntos de datos, y luego organizarlas usando estructuras de árbol invertido para reducir el tiempo necesario para recuperar un subconjunto de los datos originales. Para hacer esto, la clave del subconjunto de datos que se va a recuperar debe conocerse antes de que comience la recuperación. Los índices más populares son el árbol B y los métodos de indexación de clave hash dinámica . La indexación supone una sobrecarga para archivar y recuperar datos. Hay otras formas de organizar los índices, por ejemplo, ordenar las claves y usar un algoritmo de búsqueda binaria .
Abstracción e indirección
La programación orientada a objetos utiliza dos conceptos básicos para comprender los datos y el software:
- La estructura de rango taxonómico de las clases , que es un ejemplo de una estructura de datos jerárquica; y
- en tiempo de ejecución, la creación de referencias a estructuras de datos en memoria de objetos que han sido instanciados desde una biblioteca de clases .
Solo después de la instanciación existe un objeto de una clase específica. Una vez que se borra la referencia a un objeto, este deja de existir. Las ubicaciones de memoria donde se almacenaban los datos del objeto se consideran basura y se reclasifican como memoria no utilizada disponible para su reutilización.
Datos de la base de datos
La llegada de las bases de datos introdujo una capa adicional de abstracción para el almacenamiento persistente de datos. Las bases de datos utilizan metadatos y un protocolo de lenguaje de consulta estructurado entre los sistemas cliente y servidor , que se comunican a través de una red informática , empleando un sistema de registro de confirmación en dos fases para garantizar la integridad de las transacciones al guardar los datos.
Procesamiento de datos distribuido en paralelo
Las tecnologías modernas de persistencia de datos escalables y de alto rendimiento, como Apache Hadoop , se basan en el procesamiento de datos distribuido masivamente paralelo en múltiples computadoras estándar conectadas a una red de alto ancho de banda. En estos sistemas, los datos se distribuyen entre varias computadoras, por lo que cada computadora del sistema debe estar representada en la clave de los datos, ya sea directa o indirectamente. Esto permite diferenciar dos conjuntos de datos idénticos, cada uno procesado simultáneamente en una computadora diferente.
Propiedades de la información digital
Toda información digital posee propiedades comunes que la distinguen de los datos analógicos en lo que respecta a las comunicaciones:
- Sincronización: Dado que la información digital se transmite mediante la secuencia en que se ordenan los símbolos, todos los sistemas digitales cuentan con algún método para determinar el inicio de una secuencia. En los lenguajes humanos, tanto escritos como hablados, la sincronización se suele proporcionar mediante pausas (espacios), mayúsculas y signos de puntuación . Las comunicaciones entre máquinas suelen utilizar secuencias de sincronización especiales .
- Lenguaje: Todas las comunicaciones digitales requieren un lenguaje formal , que en este contexto comprende toda la información que tanto el emisor como el receptor deben poseer de antemano para que la comunicación sea exitosa. Los lenguajes suelen ser arbitrarios y especifican el significado que se debe asignar a determinadas secuencias de símbolos, el rango de valores permitidos, los métodos que se deben usar para la sincronización, etc.
- Errores: Las perturbaciones ( ruido ) en las comunicaciones analógicas introducen invariablemente alguna desviación o error, generalmente pequeño, entre la comunicación prevista y la real. En las comunicaciones digitales, las perturbaciones solo provocan errores cuando son tan grandes que causan que un símbolo se malinterprete como otro o alteran la secuencia de símbolos. Generalmente, es posible lograr una comunicación digital prácticamente libre de errores. Además, se pueden utilizar técnicas como los códigos de verificación para detectar errores y corregirlos mediante redundancia o retransmisión. Los errores en las comunicaciones digitales pueden ser de sustitución, en los que un símbolo se reemplaza por otro, o de inserción/eliminación , en los que se inserta o elimina un símbolo incorrecto adicional de un mensaje digital. Los errores no corregidos en las comunicaciones digitales tienen un impacto impredecible y generalmente significativo en el contenido informativo de la comunicación.
- Copia : Debido a la inevitable presencia de ruido, realizar muchas copias sucesivas de una comunicación analógica es inviable, ya que cada generación incrementa el ruido. Dado que las comunicaciones digitales generalmente no presentan errores, se pueden realizar copias de copias indefinidamente.
- Granularidad : La representación digital de un valor analógico de variación continua generalmente implica la selección del número de símbolos que se asignarán a dicho valor. El número de símbolos determina la precisión o resolución del dato resultante. La diferencia entre el valor analógico real y la representación digital se conoce como error de cuantificación . Por ejemplo, si la temperatura real es 23,234456544453 grados, pero solo se asignan dos dígitos (23) a este parámetro en una representación digital particular, el error de cuantificación es 0,234456544453. Esta propiedad de la comunicación digital se conoce como granularidad .
- Compresible : Según Miller, «Los datos digitales sin comprimir son muy grandes y, en su forma original, producirían una señal mayor (y, por lo tanto, serían más difíciles de transferir) que los datos analógicos. Sin embargo, los datos digitales se pueden comprimir. La compresión reduce la cantidad de ancho de banda necesario para enviar información. Los datos se pueden comprimir, enviar y luego descomprimir en el punto de consumo. Esto permite enviar mucha más información y da como resultado, por ejemplo, que las señales de televisión digital ofrezcan más espacio en el espectro radioeléctrico para más canales de televisión». [ 5 ]
Sistemas digitales históricos
Aunque las señales digitales suelen asociarse con los sistemas electrónicos binarios utilizados en la electrónica y la informática modernas, los sistemas digitales son en realidad muy antiguos y no tienen por qué ser binarios ni electrónicos.
- El código genético del ADN es una forma natural de almacenamiento de datos digitales.
- Texto escrito (debido al conjunto limitado de caracteres y al uso de símbolos discretos , en la mayoría de los casos el alfabeto).
- El ábaco se creó entre el 1000 a. C. y el 500 a. C., y posteriormente se convirtió en una herramienta de cálculo. Hoy en día, puede utilizarse como una calculadora digital muy avanzada, aunque básica, que emplea cuentas dispuestas en filas para representar números. Las cuentas solo tienen significado en sus posiciones fijas (arriba y abajo), no en estados intermedios analógicos.
- Una baliza es quizás la señal digital no electrónica más simple, con solo dos estados (encendido y apagado). En particular, las señales de humo son uno de los ejemplos más antiguos de señal digital, donde una "portadora" analógica (humo) se modula con una manta para generar una señal digital (bocados) que transmite información.
- El código Morse utiliza seis estados digitales —punto, raya, espacio entre caracteres (entre cada punto o raya), espacio corto (entre cada letra), espacio medio (entre palabras) y espacio largo (entre oraciones)— para enviar mensajes a través de diversos medios potenciales, como la electricidad o la luz, por ejemplo, mediante un telégrafo eléctrico o una luz intermitente.
- El sistema Braille utiliza un código de seis bits que se representa mediante patrones de puntos.
- El sistema de semáforos de banderas utiliza varillas o banderas sostenidas en posiciones específicas para enviar mensajes al receptor, que las observa a cierta distancia.
- Las banderas de señales marítimas internacionales tienen marcas distintivas que representan letras del alfabeto para permitir que los barcos se envíen mensajes entre sí.
- Más recientemente inventado, un módem modula una señal portadora analógica (como el sonido) para codificar información digital eléctrica binaria, como una serie de pulsos de sonido digitales binarios. Una versión ligeramente anterior, y sorprendentemente fiable, del mismo concepto consistía en agrupar una secuencia de información digital de audio con "señal" y sin "señal" (es decir, "sonido" y "silencio") en una cinta de casete magnética para su uso con los primeros ordenadores domésticos .
Véase también
- Convertidor analógico-digital
- Código Barker
- Big data
- Número binario
- Comparación de la grabación analógica y digital
- Almacenamiento de datos informáticos
- Datos
- Diccionario de datos
- Modelado de datos
- remanencia de datos
- flujo de datos
- Conjunto de datos
- Índice de la base de datos
- Arquitectura digital
- Arte digital
- Control digital
- brecha digital
- electrónica digital
- Infinito digital
- nativo digital
- Física digital
- Grabación digital
- Revolución digital
- Vídeo digital
- Convertidor digital-analógico
- foro de Internet
- Estado (informática)
- Tupla
Referencias
- ↑ Ceruzzi, Paul E (29 de junio de 2012). Computing: A Concise History . MIT Press . ISBN 978-0-262-51767-6.
- ^ Heinrich, Lutz J.; Heinzl, Armin; Roithmayr, Friedrich (29 de agosto de 2014). Wirtschaftsinformatik-Lexikon (en alemán). Walter de Gruyter GmbH & Co KG. ISBN 978-3-486-81590-0.
- ↑ Martin Hilbert; Priscila López (10 de febrero de 2011). «La capacidad tecnológica mundial para almacenar, comunicar y procesar información» . Science . Vol. 332, n.º 6025, págs. 60-65 . doi : 10.1126/science.1200970 . Archivado (PDF) del original el 31 de mayo de 2011. Véase también «Material complementario en línea para La capacidad tecnológica mundial para almacenar, comunicar y procesar información» (PDF) . Science . doi : 10.1126/science.1200970 . Archivado (PDF) del original el 31 de mayo de 2011.Acceso gratuito al artículo a través de aquí : www.martinhilbert.net/WorldInfoCapacity.html/
- ↑ "Animación en vídeo sobre la capacidad tecnológica mundial para almacenar, comunicar y procesar información desde 1986 hasta 2010" . 11 de junio de 2011. Archivado del original el 21 de febrero de 2013. Consultado el 6 de noviembre de 2013 a través de YouTube.
- 1 2 Miller, Vincent (2011). Entendiendo la cultura digital . Londres: Sage Publications. sec. "Convergencia y la experiencia mediática contemporánea". ISBN 978-1-84787-497-9.
- ↑ "Prevención de pérdida de datos | Norton Internet Security" . Nortoninternetsecurity.cc. 12 de marzo de 2011. Consultado el 26 de diciembre de 2012 .
- ↑ "Protección de datos: datos en tránsito frente a datos en reposo" . Digital Guardian . Consultado el 12 de abril de 2023 .
- ↑ "Los tres estados de la información" . Universidad de Edimburgo . Archivado del original el 14 de abril de 2021. Consultado el 21 de febrero de 2021 .
- ↑ Pickell, Devin. "Datos estructurados vs. datos no estructurados: ¿cuál es la diferencia?" . learn.g2.com . Consultado el 17 de noviembre de 2020 .
- ↑ "Webopedia: Datos en reposo" . 8 de junio de 2007.
- 1 2 "¿Qué son los datos en reposo? - Definición de WhatIs.com" . Searchstorage.techtarget.com. 22 de diciembre de 2012. Consultado el 26 de diciembre de 2012 .
- ↑ "¿Qué son los datos en reposo? - Definición de una palabra del diccionario informático de Webopedia" . Webopedia.com. 8 de junio de 2007. Consultado el 26 de diciembre de 2012 .
- ↑ "06-EC-O-0008: Protección de datos en reposo (DAR)" (PDF) . Departamento del Ejército . Mejores prácticas empresariales de seguridad de la información (IA BBP). 12 de octubre de 2006. Archivado del original (PDF) el 22 de diciembre de 2016.
- ↑ "Investigación en TI, Cuadrantes Mágicos, Ciclos de Hype" . Gartner. Archivado del original el 2 de mayo de 2004. Consultado el 26 de diciembre de 2012 .
- ↑ Inmon, Bill (agosto de 2005). "Cifrado en reposo: artículo de la revista Information Management" . Information-management.com . Consultado el 26 de diciembre de 2012 .
- ↑ "Guía rápida de almacenamiento criptográfico" . OWASP . Consultado el 26 de diciembre de 2012 .
- ↑ "Patrones de servicio de información, Parte 1: Patrón de federación de datos" . Ibm.com . Consultado el 26 de diciembre de 2012 .
- ↑ "Ley Patriota de EE. UU ." Fincen.gov. 1 de enero de 2002. Archivado del original el 28 de diciembre de 2012. Consultado el 26 de diciembre de 2012 .
- 1 2 M. Henson y S. Taylor "Más allá del cifrado de disco completo: protección en procesadores comerciales con seguridad mejorada" , "Actas de la 11.ª conferencia internacional sobre criptografía aplicada y seguridad de redes", 2013
- ↑ "CipherCloud incorpora cifrado a Microsoft Office 365" . 18 de julio de 2012. Consultado el 1 de noviembre de 2013 .
- ↑ "CipherCloud cifra datos en múltiples aplicaciones en la nube" . Searchstorage.techtarget.com. 6 de septiembre de 2012. Archivado del original el 29 de octubre de 2013. Consultado el 8 de noviembre de 2013 .
- ↑ GCN, John Moore, 12 de marzo de 2014: "Cómo proteger los datos en uso y en la nube"
- ↑ M. Henson y S. Taylor, «Cifrado de memoria: una revisión de las técnicas existentes» , «ACM Computing Surveys, volumen 46, número 4», 2014
- ↑ "Cifrado de memoria segura (SME) - x86" . WikiChip .
- ↑ "Cifrado de memoria total (TME) - x86" . WikiChip .
- ↑ Salter, Jim (26 de febrero de 2020). "Intel promete cifrado de memoria completa en sus próximas CPU" . Ars Technica .
- ↑ "Las extensiones de Intel Software Guard (SGX) son sumamente interesantes" . Securosis. 15 de julio de 2013. Consultado el 8 de noviembre de 2013 .
- ↑ "Datos en movimiento y datos en tránsito, ambos utilizados en cloudsecurityalliance.org" (PDF) . Archivado del original (PDF) el 15 de abril de 2016. Recuperado el 18 de abril de 2016 .
- ↑ "Datos en tránsito | Enero de 2010 | Comunicaciones de la ACM" . Enero de 2010.
- ↑ Libro blanco de SANS sobre cifrado
- ↑ "Datos" . Lexico . Archivado del original el 23 de junio de 2019. Consultado el 14 de enero de 2022 .
- ↑ "Programa informático" . Diccionario de bolsillo Oxford de inglés actual . Archivado del original el 28 de noviembre de 2011. Consultado el 11 de octubre de 2012 .
- ↑ "file(1)" . Páginas del manual de OpenBSD . 24 de diciembre de 2015. Archivado del original el 5 de febrero de 2018. Recuperado el 4 de febrero de 2018 .
- ↑ Paul, Ryan (12 de marzo de 2008). "Estudio: cantidad de información digital > capacidad de almacenamiento global" . Ars Technics. Archivado del original el 13 de marzo de 2008. Recuperado el 13 de marzo de 2008 .
- ↑ Gantz, John F.; et al. (2008). "El universo digital diverso y en explosión" . International Data Corporation vía EMC. Archivado del original el 11 de marzo de 2008. Recuperado el 12 de marzo de 2008 .
- ↑ Beynon-Davis, Paul (2004). Sistemas de bases de datos . Palgrave Macmillan. ISBN 978-1403916013.
Lecturas adicionales
- Tocci, R. 2006. Sistemas digitales: Principios y aplicaciones (10.ª edición). Prentice Hall. ISBN 0-13-172579-3
- Datos informáticos
- electrónica de consumo
- Medios digitales
- Sistemas digitales
- Tecnología digital