Articulo de referencia

Datos

Estos son algunos de los diferentes tipos de datos: geográficos, culturales, científicos, financieros, estadísticos, meteorológicos, naturales, de transporte. Datos ( / ˈ d eɪ t...

Estos son algunos de los diferentes tipos de datos: geográficos, culturales, científicos, financieros, estadísticos, meteorológicos, naturales, de transporte.

Datos ( / ˈ d t ə / DAY -tə , también en EE. UU. / ˈ d æ t ə / DAT ) es una colección de valores discretos o continuos que transmiten información , describiendo la cantidad , calidad , hechos , estadísticas , otras unidades básicas de significado o simplemente secuencias de símbolos que pueden interpretarse formalmente . Un punto de datos o dato es un valor individual en una colección de datos. Los datos suelen organizarse en estructuras como tablas que proporcionan contexto y significado adicionales, y pueden utilizarse como datos en estructuras más grandes. Los datos pueden utilizarse como variables en un proceso computacional . [ 1 ] [ 2 ] Los datos pueden representar ideas abstractas o mediciones concretas. [ 3 ] Los datos se utilizan comúnmente en la investigación científica , la economía y prácticamente cualquier otra forma de actividad organizativa humana. Ejemplos de conjuntos de datos incluyen índices de precios (como el índice de precios al consumidor ), tasas de desempleo , tasas de alfabetización y datos censales . En este contexto, los datos representan los hechos y cifras en bruto de los que se puede extraer información útil.

Los datos se recopilan mediante técnicas como la medición , la observación , la consulta o el análisis , y generalmente se representan como números o caracteres que pueden procesarse posteriormente . Los datos de campo son aquellos que se recopilan en un entorno no controlado e in situ . Los datos experimentales son aquellos que se generan durante un experimento científico controlado. Los datos se analizan mediante técnicas como el cálculo , el razonamiento , la discusión, la presentación , la visualización u otras formas de postanálisis. Antes del análisis, los datos brutos (o datos sin procesar) se limpian: se eliminan los valores atípicos y se corrigen los errores evidentes de los instrumentos o de la introducción de datos.

Los datos pueden considerarse la unidad más pequeña de información fáctica que puede utilizarse como base para el cálculo, el razonamiento o la discusión. Los datos pueden abarcar desde ideas abstractas hasta mediciones concretas, incluyendo, entre otros, las estadísticas . Los datos conectados temáticamente y presentados en algún contexto relevante pueden considerarse información . Las piezas de información conectadas contextualmente pueden describirse entonces como conocimientos o inteligencia de datos . El conjunto de conocimientos e inteligencia que se acumulan con el tiempo, como resultado de la síntesis de datos en información, puede describirse entonces como conocimiento . Los datos han sido descritos como "el nuevo petróleo de la economía digital ". [ 4 ] [ 5 ] Los datos, como concepto general, se refieren al hecho de que cierta información o conocimiento existente está representado o codificado de alguna forma adecuada para un mejor uso o procesamiento .

Los avances en las tecnologías informáticas han propiciado el surgimiento del big data , que generalmente se refiere a cantidades ingentes de datos, típicamente del orden de los petabytes. Si nos limitamos a los métodos tradicionales de análisis de datos y computación, trabajar con conjuntos de datos tan grandes (y en constante crecimiento) resulta difícil, incluso imposible. En respuesta, el campo relativamente nuevo de la ciencia de datos utiliza métodos de aprendizaje automático (y otras formas de inteligencia artificial ) que permiten aplicar de forma eficiente los métodos analíticos al big data.

Etimología y terminología

La palabra latina data es el plural de datum , «(algo) dado», que es el participio pasado neutro de dare , «dar». [ 6 ] El primer uso en inglés de la palabra data data de la década de 1640. Data se utilizó por primera vez para referirse a «información informática transmisible y almacenable» en 1946. La expresión procesamiento de datos se utilizó por primera vez en 1954. [ 6 ]

Cuando «datos» se usa de forma más general como sinónimo de «información» , se trata como un sustantivo incontable en singular. Este uso es común en el lenguaje cotidiano y en campos técnicos y científicos como el desarrollo de software y la informática . Un ejemplo de este uso es el término «big data» . Cuando se usa más específicamente para referirse al procesamiento y análisis de conjuntos de datos, el término conserva su forma plural, un uso que ha ganado popularidad en los siglos XX y XXI, siendo común en las ciencias naturales, las ciencias biológicas, las ciencias sociales, la informática y la ingeniería de software. Algunas guías de estilo no reconocen los diferentes significados del término y simplemente recomiendan la forma que mejor se adapte al público objetivo de la guía; por ejemplo, el estilo APA, a partir de la séptima edición, exige que «datos» se trate como plural. [ 7 ]

Significado

"TABLA de las aberturas de los cristales de objeto" de Adrien Auzout , procedente de un artículo de 1665 en Philosophical Transactions.

Datos, información , conocimiento y sabiduría son conceptos estrechamente relacionados, pero cada uno tiene su función con respecto al otro, y cada término tiene su significado. Según una visión común, los datos se recopilan y analizan, y se convierten en información adecuada para la toma de decisiones solo después de haber sido analizados de alguna manera. [ 8 ] Se puede decir que el grado en que un conjunto de datos es informativo para alguien depende del grado en que es inesperado para esa persona. La cantidad de información contenida en un flujo de datos puede caracterizarse por su entropía de Shannon .

El conocimiento es la percepción que una entidad tiene de su entorno, mientras que los datos simplemente comunican ese conocimiento. Por ejemplo, la entrada en una base de datos que especifica la altura del Monte Everest es un dato que comunica un valor medido con precisión. Esta medición puede incluirse en un libro junto con otros datos sobre el Monte Everest para describir la montaña de una manera útil para quienes desean decidir el mejor método para escalarla. La percepción de las características representadas por estos datos es conocimiento.

A menudo se asume que los datos son el concepto menos abstracto, la información el siguiente menos abstracto y el conocimiento el más abstracto. [ 9 ] Desde esta perspectiva, los datos se convierten en información por interpretación; por ejemplo, la altura del Monte Everest se considera generalmente "datos", un libro sobre las características geológicas del Monte Everest puede considerarse "información", y una guía de escalada que contiene información práctica sobre la mejor manera de llegar a la cima del Monte Everest puede considerarse "conocimiento". "Información" tiene una diversidad de significados que van desde el uso cotidiano hasta el uso técnico. Sin embargo, también se ha argumentado que esta perspectiva invierte cómo surgen los datos de la información y la información del conocimiento. [ 10 ] En términos generales, el concepto de información está estrechamente relacionado con las nociones de restricción, comunicación, control, datos, forma, instrucción, conocimiento, significado, estímulo mental, patrón , percepción y representación. Beynon-Davies utiliza el concepto de signo para diferenciar entre datos e información; los datos son una serie de símbolos, mientras que la información se produce cuando los símbolos se utilizan para referirse a algo. [ 11 ] [ 12 ]

Antes del desarrollo de los dispositivos y máquinas informáticas, las personas tenían que recopilar datos manualmente e imponerles patrones. Con el desarrollo de estos dispositivos, también se pueden recopilar datos. En la década de 2010, las computadoras se utilizaban ampliamente en muchos campos para recopilar, clasificar y procesar datos, en disciplinas que abarcan desde el marketing y el análisis del uso de servicios sociales por parte de los ciudadanos hasta la investigación científica. Estos patrones en los datos se consideran información que puede utilizarse para ampliar el conocimiento. Dichos patrones pueden interpretarse como " verdad " (aunque la "verdad" puede ser un concepto subjetivo) y pueden ser autorizados como criterios estéticos y éticos en algunas disciplinas o culturas. Los eventos que dejan tras de sí restos físicos o virtuales perceptibles pueden rastrearse a través de los datos. Las marcas dejan de considerarse datos una vez que se rompe el vínculo entre la marca y la observación. [ 13 ]

Los dispositivos informáticos mecánicos se clasifican según cómo representan los datos. Un ordenador analógico representa un dato como un voltaje, una distancia, una posición u otra magnitud física. Un ordenador digital representa un dato como una secuencia de símbolos extraídos de un alfabeto fijo . Los ordenadores digitales más comunes utilizan un alfabeto binario, es decir, un alfabeto de dos caracteres, generalmente denominados "0" y "1". A partir de este alfabeto binario, se construyen representaciones más familiares, como números o letras. Se distinguen algunas formas especiales de datos. Un programa informático es una colección de datos que puede interpretarse como instrucciones. La mayoría de los lenguajes de programación distinguen entre los programas y los demás datos sobre los que operan, pero en algunos lenguajes, especialmente en Lisp y otros similares, los programas son prácticamente indistinguibles de otros datos. También es útil distinguir los metadatos , es decir, una descripción de otros datos. Un término similar, aunque anterior, para metadatos es "datos auxiliares". El ejemplo prototípico de metadatos es el catálogo de la biblioteca, que es una descripción del contenido de los libros.

Fuentes de datos

Con respecto a la propiedad de los datos recopilados en el curso del marketing u otra recopilación corporativa, los datos se han caracterizado según la parte dependiendo de qué tan cerca estén los datos de la fuente o si se han generado a través de un procesamiento adicional. Los "datos de parte cero" se refieren a los datos que los clientes "comparten intencional y proactivamente". [ 14 ] Este tipo de datos puede provenir de una variedad de fuentes, incluyendo: suscripciones, centros de preferencias, cuestionarios, encuestas, formularios emergentes y experiencias digitales interactivas. [ 15 ] Los "datos de primera parte" pueden ser recopilados por una empresa directamente de sus clientes. [ 16 ] El intercambio seguro de datos de primera parte entre empresas puede hacerse utilizando salas limpias de datos . [ 17 ] Los "datos de segunda parte" se refieren a los datos obtenidos de otras organizaciones o socios, a través de compra u otros medios y se han descrito como "datos de primera parte de otra organización". [ 18 ] [ 19 ] Los "datos de tercera parte" son datos recopilados por otras organizaciones y posteriormente agregados de diferentes fuentes, sitios web y plataformas. [ 18 ]

Los datos "sin partido" a veces pueden referirse a datos sintéticos que se generan en base a patrones de datos originales. [ 17 ]

Documentos de datos

Siempre que sea necesario registrar datos, estos existen en forma de documento de datos . Los tipos de documentos de datos incluyen:

Algunos de estos documentos de datos (repositorios de datos, estudios de datos, conjuntos de datos y software) están indexados en índices de citas de datos , mientras que los artículos de datos están indexados en bases de datos bibliográficas tradicionales, por ejemplo, Science Citation Index .

Recopilación de datos

La recopilación de datos puede realizarse a través de una fuente primaria (el investigador es la primera persona en obtener los datos) o una fuente secundaria (el investigador obtiene los datos que ya han sido recopilados por otras fuentes, como los datos difundidos en una revista científica). Las metodologías de análisis de datos varían e incluyen la triangulación de datos y la percolación de datos. [ 20 ] Esta última ofrece un método articulado para recopilar, clasificar y analizar datos utilizando cinco ángulos de análisis posibles (al menos tres) para maximizar la objetividad de la investigación y permitir una comprensión de los fenómenos bajo investigación lo más completa posible: métodos cualitativos y cuantitativos, revisiones de literatura (incluidos artículos académicos), entrevistas con expertos y simulación por computadora. Posteriormente, los datos se "percolan" utilizando una serie de pasos predeterminados para extraer la información más relevante.

Longevidad, accesibilidad y fiabilidad de los datos.

Un campo importante en informática , tecnología y biblioteconomía es la longevidad de los datos. La investigación científica genera enormes cantidades de datos, especialmente en genómica y astronomía , pero también en ciencias médicas , como en imagenología médica . Antiguamente, los datos científicos se publicaban en artículos y libros, almacenados en bibliotecas, pero más recientemente prácticamente todos se almacenan en discos duros o discos ópticos . Sin embargo, a diferencia del papel, estos dispositivos de almacenamiento pueden volverse ilegibles después de unas décadas. Las editoriales científicas y las bibliotecas llevan décadas lidiando con este problema, y ​​aún no existe una solución satisfactoria para el almacenamiento a largo plazo de datos durante siglos o incluso para siempre.

Accesibilidad a los datos . Otro problema es que muchos datos científicos nunca se publican ni se depositan en repositorios de datos como bases de datos . En una encuesta reciente, se solicitaron datos de 516 estudios que se publicaron entre 2 y 22 años antes, pero menos de uno de cada cinco de estos estudios pudieron o quisieron proporcionar los datos solicitados. En general, la probabilidad de recuperar datos disminuyó un 17 % cada año después de la publicación. [ 21 ] De manera similar, una encuesta de 100 conjuntos de datos en Dryad encontró que más de la mitad carecían de los detalles para reproducir los resultados de la investigación de estos estudios. [ 22 ] Esto muestra la grave situación del acceso a los datos científicos que no se publican o no tienen suficientes detalles para ser reproducidos.

Fiabilidad de los datos. Pueden surgir problemas más graves cuando los datos se utilizan bajo el supuesto de que son datos reales, de calidad suficiente o que han sido documentados con precisión con la procedencia y los metadatos adecuados . Los repositorios de datos rara vez, o nunca, exigen informes obligatorios sobre la procedencia de los datos, y se pueden cargar datos falsificados, sintéticos o poco éticos en los repositorios sin las consideraciones necesarias. Como ejemplo en la investigación médica y sanitaria, se utilizaron datos de Kaggle que se consideraron poco fiables debido a la evidencia de posible falsificación, asociaciones inexplicables y falta de documentación para desarrollar 125 modelos de predicción clínica [ 23 ] .

Una solución al problema de la reproducibilidad es el intento de exigir datos FAIR , es decir, datos que sean localizables, accesibles, interoperables y reutilizables. Los datos que cumplen estos requisitos pueden utilizarse en investigaciones posteriores y, por lo tanto, impulsan el avance de la ciencia y la tecnología. [ 24 ]

En otros campos

Aunque los datos también se utilizan cada vez más en otros campos, se ha sugerido que su naturaleza altamente interpretativa podría estar en desacuerdo con el ethos de los datos como "dados". Peter Checkland introdujo el término capta (del latín capere , "tomar") para distinguir entre una inmensa cantidad de datos posibles y un subconjunto de ellos, al que se dirige la atención. [ 25 ] Johanna Drucker ha argumentado que, dado que las humanidades afirman la producción de conocimiento como "situada, parcial y constitutiva", el uso de datos puede introducir supuestos que son contraproducentes, por ejemplo, que los fenómenos son discretos o son independientes del observador. [ 26 ] El término capta , que enfatiza el acto de observación como constitutivo, se ofrece como una alternativa a los datos para las representaciones visuales en las humanidades.

El término «basado en datos» es un neologismo que se aplica a una actividad que se rige principalmente por los datos, por encima de cualquier otro factor. Entre las aplicaciones basadas en datos se incluyen la programación basada en datos , el periodismo basado en datos y otras .

Véase también

Referencias

  1. Glosario de términos estadísticos de la OCDE . OCDE. 2008. pág.  119. ISBN 978-92-64-025561.
  2. "Lenguaje estadístico: ¿Qué son los datos?" . Oficina Australiana de Estadística . 13 de julio de 2013. Archivado del original el 19 de abril de 2019. Consultado el 9 de marzo de 2020 .
  3. "Datos vs. Información: Diferencia y comparación | Diffen" . www.diffen.com . Consultado el 11 de diciembre de 2018 .
  4. Toonders, Joris (23 de julio de 2014). "Los datos son el nuevo petróleo de la economía digital" . Wired . Archivado del original el 27 de junio de 2024.
  5. "Los datos son el nuevo petróleo" . Spotless Data . Archivado del original el 16 de julio de 2018.
  6. 1 2 "datos | Origen y significado de datos" . Diccionario etimológico en línea .
  7. Asociación Americana de Psicología (2020). "6.11". Manual de Publicaciones de la Asociación Americana de Psicología: la guía oficial del estilo APA . Asociación Americana de Psicología. ISBN 978-1-4338-3216-1.
  8. "Publicación Conjunta 2-0, Inteligencia Conjunta" (PDF) . Estado Mayor Conjunto, Publicaciones de Doctrina Conjunta . Departamento de Defensa. 23 de octubre de 2013. págs. I-1. Archivado del original (PDF) el 18 de julio de 2018. Consultado el 17 de julio de 2018 . 
  9. Akash Mitra (2011). "Clasificación de datos para un modelado exitoso" . Archivado del original el 7 de noviembre de 2017. Recuperado el 5 de noviembre de 2017 .
  10. Tuomi, Ilkka (2000). "Los datos son más que conocimiento". Journal of Management Information Systems . 6 (3): 103– 117. doi : 10.1080/07421222.1999.11518258 .
  11. P. Beynon-Davies (2002). Sistemas de información: Una introducción a la informática en las organizaciones . Basingstoke, Reino Unido: Palgrave Macmillan . ISBN 0-333-96390-3.
  12. P. Beynon-Davies (2009). Sistemas de información empresarial . Basingstoke, Reino Unido: Palgrave. ISBN 978-0-230-20368-6.
  13. Sharon Daniel. La base de datos: una estética de la dignidad .
  14. Liu, Stephanie (30 de julio de 2020). "Directamente de la fuente: recopilación de datos de primera mano de los clientes" . Forrester . Recuperado el 14 de enero de 2025 .
  15. Greenstein, Danielle (19 de agosto de 2019). "¿Qué son los datos de primera parte frente a los datos de terceros: definiciones y estrategias?" . Lotame . Consultado el 14 de enero de 2025 .
  16. Studio, AdExchanger Content (2 de enero de 2025). "El amanecer de los datos de primera parte: navegando por el nuevo panorama publicitario" . AdExchanger . Consultado el 14 de enero de 2025 .
  17. 1 2 Bridgwater, Adrian. "Los datos de terceros ahora son de primera clase" . Forbes . Consultado el 14 de enero de 2025 .
  18. 1 2 3 Fallows, Carley (13 de enero de 2025). "¿En qué fuente de datos puede confiar para obtener un mejor retorno de la inversión en marketing?" . Littlegate Publishing . Archivado del original el 5 de marzo de 2025 . Recuperado el 14 de enero de 2025 .
  19. Greenstein, Danielle (15 de marzo de 2024). "¿Qué son los datos de segunda parte y cómo se pueden utilizar?" . Lotame . Consultado el 14 de enero de 2025 .
  20. Mesly, Olivier (2015), Creación de modelos en la investigación psicológica , Springer Psychology : 126 páginas. ISBN 978-3-319-15752-8
  21. Vines, Timothy H.; Albert, Arianne YK; Andrew, Rose L.; Débarre, Florence; Bock, Dan G.; Franklin, Michelle T.; Gilbert, Kimberly J.; Moore, Jean-Sébastien; Renaut, Sébastien; Rennison, Diana J. (6 de enero de 2014). "La disponibilidad de datos de investigación disminuye rápidamente con la antigüedad del artículo" . Current Biology . 24 (1): 94– 97. arXiv : 1312.5670 . Bibcode : 2014CBio...24...94V . doi : 10.1016/ j.cub.2013.11.014 . ISSN 1879-0445 . PMID 24361065. S2CID 7799662 .   
  22. Roche, Dominique G.; Kruuk, Loeske EB; Lanfear, Robert; Binning, Sandra A. (2015). "Archivo público de datos en ecología y evolución: ¿Qué tan bien lo estamos haciendo?" . PLOS Biology . 13 (11) e1002295. doi : 10.1371/journal.pbio.1002295 . ISSN 1545-7885 . PMC 4640582 . PMID 26556502 .   
  23. Gibson, Alexander D.; White, Nicole M.; Collins, Gary S.; Barnett, Adrian G. (4 de junio de 2026). "Evidencia de datos poco fiables y procedencia deficiente de los datos en la investigación de modelos de predicción clínica y la práctica clínica" . BMC Medicine . doi : 10.1186/s12916-026-04981-y . ISSN 1741-7015 . PMID 42243840 .  
  24. Eisenstein, Michael (abril de 2022). "En busca de la inmortalidad de los datos" . Nature . 604 ( 7904): 207–208 . Bibcode : 2022Natur.604..207E . doi : 10.1038/d41586-022-00929-3 . ISSN 1476-4687 . PMID 35379989. S2CID 247954952 .   
  25. P. Checkland y S. Holwell (1998). Información, sistemas y sistemas de información: Cómo comprender el campo . Chichester, West Sussex: John Wiley & Sons. págs. 86–89 . ISBN  0-471-95820-4.
  26. Johanna Drucker (2011). "Enfoques humanísticos de la representación gráfica" . Digital Humanities Quarterly . 005 (1).
  • Datos es un sustantivo singular (una evaluación detallada).