Articulo de referencia

Big data

Diagrama de la generación y aplicación común de macrodatos. El término big data se refiere principalmente a conjuntos de datos demasiado grandes o complejos para ser procesados ...

Diagrama de la generación y aplicación común de macrodatos.

El término big data se refiere principalmente a conjuntos de datos demasiado grandes o complejos para ser procesados ​​por el software tradicional . Los datos con muchas entradas (filas) ofrecen mayor potencia estadística , mientras que los datos con mayor complejidad (más atributos o columnas) pueden generar una mayor tasa de falsos positivos . [ 1 ]

Los desafíos del análisis de big data incluyen la captura de datos , el almacenamiento de datos , el análisis de datos , la búsqueda, el intercambio , la transferencia , la visualización , la consulta , la actualización, la privacidad de la información y las fuentes de datos. Big data se asoció originalmente con tres conceptos clave: volumen , variedad y velocidad . [ 2 ] El análisis de big data que solo tiene volumen, velocidad y variedad puede plantear desafíos en el muestreo . Por lo tanto, se agregó un cuarto concepto, la veracidad, que se refiere al nivel de confiabilidad de los datos. [ 3 ] Sin una inversión suficiente en experiencia para garantizar la veracidad de big data, el volumen y la variedad de datos pueden producir costos y riesgos que superan la capacidad de una organización para crear y capturar valor de big data . [ 4 ]

El uso actual del término big data tiende a referirse al uso de análisis predictivo , análisis del comportamiento del usuario u otros métodos avanzados de análisis de datos que extraen valor de big data, y rara vez a un tamaño particular de conjunto de datos. "Hay pocas dudas de que las cantidades de datos ahora disponibles son realmente grandes, pero esa no es la característica más relevante de este nuevo ecosistema de datos." [ 5 ] El análisis de conjuntos de datos puede encontrar nuevas correlaciones para "detectar tendencias comerciales, prevenir enfermedades, combatir el crimen, etc." [ 6 ] Científicos, ejecutivos de negocios, profesionales médicos, publicidad y gobiernos por igual se encuentran regularmente con dificultades con grandes conjuntos de datos en áreas que incluyen búsquedas en Internet , fintech , análisis de salud, sistemas de información geográfica, informática urbana e informática empresarial . Los científicos encuentran limitaciones en el trabajo de e-Ciencia , incluyendo meteorología , genómica , [ 7 ] conectómica , simulaciones físicas complejas, biología e investigación ambiental. [ 8 ]

El tamaño y la cantidad de conjuntos de datos disponibles han crecido rápidamente a medida que se recopilan datos mediante dispositivos como dispositivos móviles , dispositivos de Internet de las cosas de detección de información baratos y numerosos , equipos aéreos ( de teledetección ), registros de software, cámaras , micrófonos, lectores de identificación por radiofrecuencia (RFID) y redes de sensores inalámbricos . [ 9 ] [ 10 ] La capacidad tecnológica per cápita del mundo para almacenar información se ha duplicado aproximadamente cada 40 meses desde la década de 1980; [ 11 ] a partir de 2012Cada día se generan 2,5 exabytes (2,17 × 2⁶⁰ bytes) de datos. [ 12 ] Según una predicción de un informe de IDC , se predijo que el volumen global de datos crecería exponencialmente de 4,4 zettabytes a 44 zettabytes entre 2013 y 2020. Para 2025, IDC predice que habrá 163 zettabytes de datos. [ 13 ] Según IDC, se estima que el gasto global en soluciones de big data y análisis de negocios (BDA) alcanzará los 215.700 millones de dólares en 2021. [ 14 ] [ 15 ] Statista informó que se prevé que el mercado global de big data crezca hasta los 103.000 millones de dólares en 2027. [ 16 ] En 2011, McKinsey & Company informó que, si el sector sanitario estadounidense utilizara big data de forma creativa y eficaz para impulsar la eficiencia y la calidad, podría generar más de 300.000 millones de dólares en valor cada año. [ 17 ] En las economías desarrolladas de Europa, los administradores gubernamentales podrían ahorrar más de 100.000 millones de euros (149.000 millones de dólares) solo en mejoras de eficiencia operativa mediante el uso de big data. [ 17 ] Y los usuarios de servicios habilitados por datos de ubicación personal podrían obtener 600.000 millones de dólares en excedente del consumidor. [ 17 ] Una pregunta para las grandes empresas es determinar quién debe ser el propietario de las iniciativas de big data que afectan a toda la organización. [ 18 ]

Los sistemas de gestión de bases de datos relacionales y los paquetes de software estadístico de escritorio utilizados para visualizar datos suelen tener dificultades para procesar y analizar grandes volúmenes de datos. El procesamiento y análisis de grandes volúmenes de datos puede requerir "software de procesamiento masivamente paralelo que se ejecuta en decenas, cientos o incluso miles de servidores". [ 19 ] Lo que se considera "grandes datos" varía según las capacidades de quienes los analizan y sus herramientas. Además, la expansión de las capacidades convierte a los grandes volúmenes de datos en un objetivo en constante evolución. "Para algunas organizaciones, enfrentarse por primera vez a cientos de gigabytes de datos puede generar la necesidad de reconsiderar las opciones de gestión de datos. Para otras, pueden ser necesarias decenas o cientos de terabytes antes de que el tamaño de los datos se convierta en una consideración importante". [ 20 ]

Definición

El término big data se utiliza desde la década de 1990, y algunos atribuyen a John Mashey su popularización. [ 21 ] [ 22 ] Big data generalmente incluye conjuntos de datos con tamaños que superan la capacidad de las herramientas de software comúnmente utilizadas para capturar , organizar , gestionar y procesar datos en un tiempo tolerable. [ 23 ] La filosofía de big data abarca datos no estructurados, semiestructurados y estructurados; sin embargo, el enfoque principal está en los datos no estructurados . [ 24 ] El "tamaño" de big data es un objetivo en constante cambio; a partir de 2012que abarcan desde unas pocas docenas de terabytes hasta muchos zettabytes de datos. [ 25 ] El big data requiere un conjunto de técnicas y tecnologías con nuevas formas de integración para revelar información a partir de conjuntos de datos que son diversos, complejos y de escala masiva. [ 26 ] La variabilidad a menudo se incluye como una cualidad adicional del big data.

Una definición de 2018 afirma que "el big data es donde se necesitan herramientas de computación paralela para manejar datos" y señala: "Esto representa un cambio distinto y claramente definido en la ciencia de la computación utilizada, a través de teorías de programación paralela, y pérdidas de algunas de las garantías y capacidades que brindaba el modelo relacional de Codd ". [ 27 ]

En un estudio comparativo de grandes conjuntos de datos, Kitchin y McArdle descubrieron que ninguna de las características comúnmente consideradas de los macrodatos aparece de forma consistente en todos los casos analizados. [ 28 ] Por esta razón, otros estudios identificaron la redefinición de la dinámica de poder en el descubrimiento del conocimiento como el rasgo definitorio. [ 29 ] En lugar de centrarse en las características intrínsecas de los macrodatos, esta perspectiva alternativa promueve una comprensión relacional del objeto, afirmando que lo que importa es la forma en que los datos se recopilan, almacenan, ponen a disposición y analizan.

Big data frente a inteligencia empresarial

La creciente madurez del concepto delimita de forma más clara la diferencia entre "big data" e " inteligencia empresarial ": [ 30 ]

  • La inteligencia empresarial utiliza herramientas de matemáticas aplicadas y estadística descriptiva con datos de alta densidad de información para medir cosas, detectar tendencias, etc.
  • El big data utiliza análisis matemático, optimización, estadística inductiva y conceptos de identificación de sistemas no lineales [ 31 ] para inferir leyes (regresiones, relaciones no lineales y efectos causales) a partir de grandes conjuntos de datos con baja densidad de información [ 32 ] para revelar relaciones y dependencias, o para realizar predicciones de resultados y comportamientos. [ 31 ] [ 33 ]

Características

Esta imagen muestra el crecimiento de las características principales del big data: volumen, velocidad y variedad.

Los macrodatos se pueden describir mediante las siguientes características:

Volumen
La cantidad de datos generados y almacenados. El tamaño de los datos determina su valor y el potencial de análisis, así como si pueden considerarse macrodatos o no. El tamaño de los macrodatos suele ser mayor que los terabytes y petabytes. [ 34 ]
Variedad
El tipo y la naturaleza de los datos. Las tecnologías anteriores, como los RDBMS, eran capaces de manejar datos estructurados de manera eficiente y efectiva. Sin embargo, el cambio en el tipo y la naturaleza de estructurado a semiestructurado o no estructurado desafió las herramientas y tecnologías existentes. Las tecnologías de big data evolucionaron con la intención principal de capturar, almacenar y procesar los datos semiestructurados y no estructurados (variedad) generados a alta velocidad (velocidad) y en gran tamaño (volumen). Posteriormente, estas herramientas y tecnologías se exploraron y utilizaron también para manejar datos estructurados, pero se preferían para el almacenamiento. Finalmente, el procesamiento de datos estructurados se mantuvo como opcional, ya sea utilizando big data o RDBMS tradicionales. Esto ayuda a analizar los datos para un uso efectivo de las perspectivas ocultas expuestas a partir de los datos recopilados a través de redes sociales, archivos de registro, sensores, etc. Big data se nutre de texto, imágenes, audio, video; además, completa las piezas faltantes a través de la fusión de datos .
Velocidad
La velocidad a la que se generan y procesan los datos para satisfacer las demandas y afrontar los retos que se presentan en el camino del crecimiento y el desarrollo. Los macrodatos suelen estar disponibles en tiempo real. En comparación con los microdatos , los macrodatos se producen de forma más continua. Dos tipos de velocidad relacionados con los macrodatos son la frecuencia de generación y la frecuencia de procesamiento, registro y publicación. [ 35 ]
Veracidad
La veracidad o fiabilidad de los datos, que se refiere a la calidad y el valor de los datos. [ 36 ] Los macrodatos no solo deben ser de gran tamaño, sino también fiables para obtener valor en su análisis. La calidad de los datos capturados puede variar considerablemente, lo que afecta a la precisión del análisis. [ 37 ]
Valor
El valor de la información que se puede obtener mediante el procesamiento y análisis de grandes conjuntos de datos. El valor también se puede medir mediante una evaluación de otras cualidades de los macrodatos. [ 38 ] El valor también puede representar la rentabilidad de la información que se obtiene del análisis de macrodatos.
Variabilidad
A diferencia de la variedad, la variabilidad refleja la idea de que los formatos, la estructura o las fuentes de los macrodatos cambian con el tiempo y en función de las diferentes circunstancias. La interpretación de los datos depende de un contexto cambiante, y con un contexto diferente, los significados anteriores pueden dejar de ser válidos. [ 39 ]

Otras posibles características de los macrodatos son: [ 40 ]

Exhaustivo
Si todo el sistema (es decir,norte{\textstyle n}=todos) se capturan o registran o no. Los macrodatos pueden o no incluir todos los datos disponibles de las fuentes.
De grano fino y léxico único
Respectivamente, la proporción de datos específicos de cada elemento por elemento recopilado y si el elemento y sus características están debidamente indexados o identificados.
Relacional
Si los datos recopilados contienen campos comunes que permitan la combinación, o metaanálisis, de diferentes conjuntos de datos.
Extensional
Si se pueden agregar o modificar fácilmente nuevos campos en cada elemento de los datos recopilados.
Escalabilidad
Si el tamaño del sistema de almacenamiento de big data puede expandirse rápidamente.

Arquitectura

Los repositorios de big data han existido en muchas formas, a menudo creados por corporaciones con una necesidad específica. Históricamente, los proveedores comerciales ofrecieron sistemas de gestión de bases de datos paralelas para big data a partir de la década de 1990. Durante muchos años, WinterCorp publicó el informe de bases de datos más extenso. [ 41 ]

En 1984, Teradata Corporation comercializó el sistema de procesamiento paralelo DBC 1012. Los sistemas Teradata fueron los primeros en almacenar y analizar 1 terabyte de datos en 1992. Los discos duros tenían una capacidad de 2,5 GB en 1991, por lo que la definición de big data evoluciona continuamente. Teradata instaló el primer sistema basado en RDBMS de clase petabyte en 2007. A partir de 2017Actualmente, existen varias docenas de bases de datos relacionales Teradata de clase petabyte instaladas, la mayor de las cuales supera los 50 PB. Hasta 2008, los sistemas utilizaban exclusivamente datos relacionales estructurados. Desde entonces, Teradata ha incorporado tipos de datos semiestructurados, como XML , JSON y Avro .

En 2000, Seisint Inc. (ahora LexisNexis Risk Solutions ) desarrolló una plataforma distribuida basada en C++ para el procesamiento y la consulta de datos, conocida como la plataforma HPCC Systems . Este sistema particiona, distribuye, almacena y entrega automáticamente datos estructurados, semiestructurados y no estructurados en múltiples servidores estándar. Los usuarios pueden escribir flujos de procesamiento de datos y consultas en un lenguaje de programación de flujo de datos declarativo llamado ECL. Los analistas de datos que trabajan con ECL no necesitan definir esquemas de datos de antemano y pueden centrarse en el problema específico en cuestión, remodelando los datos de la mejor manera posible a medida que desarrollan la solución. En 2004, LexisNexis adquirió Seisint Inc. [ 42 ] y su plataforma de procesamiento paralelo de alta velocidad, y utilizó con éxito esta plataforma para integrar los sistemas de datos de Choicepoint Inc. cuando adquirió esa empresa en 2008. [ 43 ] En 2011, la plataforma HPCC Systems se publicó como código abierto bajo la licencia Apache v2.0.

El CERN y otros experimentos de física han recopilado grandes conjuntos de datos durante muchas décadas, que generalmente se analizan mediante computación de alto rendimiento en lugar de las arquitecturas map-reduce a las que suele referirse el actual movimiento de "big data".

En 2004, Google publicó un documento sobre un proceso llamado MapReduce que utiliza una arquitectura similar. El concepto de MapReduce proporciona un modelo de procesamiento paralelo, y se lanzó una implementación asociada para procesar grandes cantidades de datos. Con MapReduce, las consultas se dividen y distribuyen entre nodos paralelos y se procesan en paralelo (el paso "map"). Los resultados se recopilan y se entregan (el paso "reduce"). El marco fue muy exitoso, [ 44 ] por lo que otros quisieron replicar el algoritmo. Por lo tanto, una implementación del marco MapReduce fue adoptada por un proyecto de código abierto de Apache llamado " Hadoop ". [ 45 ] Apache Spark se desarrolló en 2012 en respuesta a las limitaciones del paradigma MapReduce, ya que agrega procesamiento en memoria y la capacidad de configurar muchas operaciones (no solo map seguido de reduce).

MIKE2.0 es un enfoque abierto para la gestión de la información que reconoce la necesidad de revisiones debido a las implicaciones del big data identificadas en un artículo titulado "Oferta de soluciones de big data". [ 46 ] La metodología aborda el manejo de big data en términos de permutaciones útiles de fuentes de datos, complejidad en las interrelaciones y dificultad para eliminar (o modificar) registros individuales. [ 47 ]

Estudios realizados en 2012 demostraron que una arquitectura multicapa era una opción para abordar los problemas que presenta el big data. Una arquitectura paralela distribuida distribuye los datos entre varios servidores; estos entornos de ejecución paralela pueden mejorar drásticamente la velocidad de procesamiento de datos. Este tipo de arquitectura inserta datos en un sistema de gestión de bases de datos (DBMS) paralelo, que implementa el uso de los marcos de trabajo MapReduce y Hadoop. Este tipo de marco de trabajo busca que la potencia de procesamiento sea transparente para el usuario final mediante el uso de un servidor de aplicaciones front-end. [ 48 ]

El lago de datos permite a una organización pasar de un control centralizado a un modelo compartido para responder a la dinámica cambiante de la gestión de la información. Esto posibilita la segregación rápida de datos en el lago de datos, reduciendo así el tiempo de procesamiento. [ 49 ] [ 50 ]

Tecnologías

Un informe del McKinsey Global Institute de 2011 caracteriza los principales componentes y el ecosistema de big data de la siguiente manera: [ 51 ]

Los macrodatos multidimensionales también pueden representarse como cubos de datos OLAP o, matemáticamente, como tensores . Los sistemas de bases de datos de matrices se han propuesto proporcionar almacenamiento y soporte para consultas de alto nivel en este tipo de datos. Otras tecnologías aplicadas a los macrodatos incluyen computación eficiente basada en tensores, [ 52 ] como el aprendizaje de subespacios multilineales , [ 53 ] bases de datos de procesamiento masivamente paralelo ( MPP ), aplicaciones basadas en búsqueda , minería de datos , [ 54 ] sistemas de archivos distribuidos , caché distribuida (por ejemplo, búfer de ráfaga y Memcached ), bases de datos distribuidas , infraestructura basada en la nube y HPC (aplicaciones, almacenamiento y recursos informáticos), [ 55 ] e Internet. Aunque se han desarrollado muchos enfoques y tecnologías, sigue siendo difícil llevar a cabo el aprendizaje automático con macrodatos. [ 56 ]

Algunas bases de datos relacionales MPP tienen la capacidad de almacenar y gestionar petabytes de datos. Implícitamente, esto implica la capacidad de cargar, monitorizar, realizar copias de seguridad y optimizar el uso de las grandes tablas de datos en el RDBMS . [ 57 ]

El programa de Análisis Topológico de Datos de DARPA busca la estructura fundamental de conjuntos de datos masivos y en 2008 la tecnología se hizo pública con el lanzamiento de una empresa llamada "Ayasdi". [ 58 ]

Los profesionales de los procesos de análisis de big data suelen ser reacios al almacenamiento compartido más lento, [ 59 ] prefiriendo el almacenamiento de conexión directa ( DAS ) en sus diversas formas, desde unidades de estado sólido ( SSD ) hasta discos SATA de alta capacidad integrados en nodos de procesamiento paralelo. La percepción de las arquitecturas de almacenamiento compartido —red de área de almacenamiento (SAN) y almacenamiento conectado a la red (NAS)— es que son relativamente lentas, complejas y costosas. Estas características no son compatibles con los sistemas de análisis de big data, que se basan en el rendimiento del sistema, la infraestructura estándar y el bajo costo.

La entrega de información en tiempo real o casi real es una de las características definitorias del análisis de big data. Por lo tanto, se evita la latencia siempre que sea posible. Los datos en memoria o disco de conexión directa son adecuados; los datos en memoria o disco en el otro extremo de una conexión FC SAN no lo son. El costo de una SAN a la escala necesaria para las aplicaciones de análisis es mucho mayor que el de otras técnicas de almacenamiento.

Aplicaciones

Un gráfico que muestra la cantidad de puntos de datos utilizados para entrenar sistemas de IA notables desde 1950 hasta 2025 [ 60 ].

El big data ha incrementado tanto la demanda de especialistas en gestión de la información que Software AG , Oracle Corporation , IBM , Microsoft , SAP , EMC , HP y Dell han invertido más de 15.000  millones de dólares en empresas de software especializadas en gestión y análisis de datos. En 2010, esta industria tenía un valor superior a los 100.000  millones de dólares y crecía a casi un 10  % anual, aproximadamente el doble de rápido que el sector del software en su conjunto. [ 6 ]

Las economías desarrolladas utilizan cada vez más tecnologías intensivas en datos. Hay 4.600  millones de suscripciones de telefonía móvil en todo el mundo, y entre 1.000  y 2.000  millones de personas acceden a internet. [ 6 ] Entre 1990 y 2005, más de 1.000  millones de personas en todo el mundo entraron en la clase media, lo que significa que más personas se volvieron más alfabetizadas, lo que a su vez llevó al crecimiento de la información. La capacidad efectiva del mundo para intercambiar información a través de redes de telecomunicaciones fue de 281 petabytes en 1986, 471 petabytes en 1993, 2,2 exabytes en 2000, 65 exabytes en 2007 [ 11 ] y las predicciones sitúan la cantidad de tráfico de internet en 667 exabytes anuales para 2014. [ 6 ] Según una estimación, un tercio de la información almacenada globalmente está en forma de texto alfanumérico y datos de imágenes fijas, [ 61 ] que es el formato más útil para la mayoría de las aplicaciones de big data. Esto también demuestra el potencial de los datos aún no utilizados (es decir, en forma de contenido de vídeo y audio).

Si bien muchos proveedores ofrecen productos listos para usar para big data, los expertos promueven el desarrollo de sistemas personalizados internos si la empresa cuenta con las capacidades técnicas suficientes. [ 62 ]

Gobierno

El uso y la adopción de macrodatos en los procesos gubernamentales permiten una mayor eficiencia en términos de costos, productividad e innovación, [ 63 ] pero también presentan inconvenientes. El análisis de datos suele requerir la colaboración de múltiples instancias gubernamentales (centrales y locales) y la creación de procesos nuevos e innovadores para lograr el resultado deseado. Un ejemplo común de organización gubernamental que utiliza macrodatos es la Agencia de Seguridad Nacional (NSA), la cual monitorea constantemente la actividad en internet en busca de posibles patrones de actividades sospechosas o ilegales que su sistema pueda detectar.

El registro civil y las estadísticas vitales (CRVS) recopilan todos los certificados de estado civil desde el nacimiento hasta la defunción. El CRVS es una fuente de macrodatos para los gobiernos.

desarrollo internacional

La investigación sobre el uso efectivo de las tecnologías de la información y la comunicación para el desarrollo (también conocidas como "TIC para el desarrollo") sugiere que la tecnología de macrodatos puede hacer contribuciones importantes, pero también presenta desafíos únicos para el desarrollo internacional . [ 64 ] [ 65 ] Los avances en el análisis de macrodatos ofrecen oportunidades rentables para mejorar la toma de decisiones en áreas críticas del desarrollo, como la atención médica, el empleo, la productividad económica , la delincuencia, la seguridad y la gestión de desastres naturales y recursos. [ 66 ] [ 67 ] [ 68 ] Además, los datos generados por los usuarios ofrecen nuevas oportunidades para dar voz a quienes no la tienen. [ 69 ] Sin embargo, los desafíos de larga data para las regiones en desarrollo, como la infraestructura tecnológica inadecuada y la escasez de recursos económicos y humanos, exacerban las preocupaciones existentes con los macrodatos, como la privacidad, la metodología imperfecta y los problemas de interoperabilidad. [ 66 ] El desafío de los "macrodatos para el desarrollo" [ 66 ] está evolucionando actualmente hacia la aplicación de estos datos a través del aprendizaje automático, conocido como "inteligencia artificial para el desarrollo (IA para el desarrollo)". [ 70 ]

Beneficios

Una importante aplicación práctica de los macrodatos para el desarrollo ha sido la "lucha contra la pobreza con datos". [ 71 ] En 2015, Blumenstock y sus colegas estimaron la pobreza y la riqueza previstas a partir de metadatos de teléfonos móviles [ 72 ] y en 2016 Jean y sus colegas combinaron imágenes satelitales y aprendizaje automático para predecir la pobreza. [ 73 ] Utilizando datos de rastreo digital para estudiar el mercado laboral y la economía digital en América Latina, Hilbert y sus colegas [ 74 ] [ 75 ] argumentan que los datos de rastreo digital tienen varios beneficios, tales como:

  • Cobertura temática: incluyendo áreas que antes eran difíciles o imposibles de medir.
  • Cobertura geográfica: proporciona datos considerables y comparables para casi todos los países, incluidos muchos países pequeños que normalmente no se incluyen en los inventarios internacionales.
  • Nivel de detalle: proporciona datos muy detallados con muchas variables interrelacionadas y nuevos aspectos, como conexiones de red.
  • Puntualidad y series temporales: los gráficos se pueden generar a los pocos días de su recopilación.

Desafíos

Al mismo tiempo, trabajar con datos de rastreo digital en lugar de datos de encuestas tradicionales no elimina los desafíos tradicionales que implica el campo del análisis cuantitativo internacional. Las prioridades pueden cambiar, pero los debates fundamentales siguen siendo los mismos. Entre los principales desafíos se encuentran:

  • Representatividad. Si bien las estadísticas de desarrollo tradicionales se ocupan principalmente de la representatividad de las muestras de encuestas aleatorias, los datos de rastreo digital nunca son una muestra aleatoria. [ 76 ]
  • Generalización. Si bien los datos de observación siempre representan muy bien esta fuente, solo representan lo que representan, y nada más. Aunque resulta tentador generalizar a partir de observaciones específicas de una plataforma a contextos más amplios, esto suele ser muy engañoso.
  • Armonización. Los datos de trazabilidad digital aún requieren la armonización internacional de los indicadores. Esto añade el reto de la denominada "fusión de datos", es decir, la armonización de diferentes fuentes.
  • Sobrecarga de datos. Los analistas y las instituciones no están acostumbrados a manejar eficazmente un gran número de variables, lo cual se realiza eficientemente con paneles interactivos. Los profesionales aún carecen de un flujo de trabajo estándar que permita a investigadores, usuarios y responsables políticos manejar los datos de manera eficiente y efectiva. [ 74 ]

Finanzas

El Big Data se está adoptando rápidamente en Finanzas para 1) acelerar el procesamiento y 2) ofrecer inferencias mejores y más informadas, tanto internamente como para los clientes de las instituciones financieras. [ 77 ] Las aplicaciones financieras del Big Data abarcan desde decisiones de inversión y negociación (procesamiento de volúmenes de datos de precios disponibles, libros de órdenes límite, datos económicos y más, todo al mismo tiempo), gestión de cartera (optimización sobre una gama cada vez mayor de instrumentos financieros, potencialmente seleccionados de diferentes clases de activos), gestión de riesgos (calificación crediticia basada en información extendida) y cualquier otro aspecto donde las entradas de datos sean grandes. [ 78 ] El Big Data también ha sido un concepto típico dentro del campo de los servicios financieros alternativos . Algunas de las áreas principales incluyen plataformas de financiación colectiva y exchanges de criptomonedas. [ 79 ]

Cuidado de la salud

El análisis de big data se ha utilizado en la atención médica para proporcionar medicina personalizada y análisis prescriptivo , intervención de riesgo clínico y análisis predictivo, reducción de desperdicio y variabilidad en la atención, informes externos e internos automatizados de datos de pacientes, términos médicos estandarizados y registros de pacientes. [ 80 ] [ 81 ] [ 82 ] [ 83 ] Algunas áreas de mejora son más aspiracionales que implementadas realmente. El nivel de datos generados dentro de los sistemas de atención médica no es trivial. Con la adopción adicional de mHealth, eHealth y tecnologías portátiles, el volumen de datos continuará aumentando. Esto incluye datos de registros médicos electrónicos , datos de imágenes, datos generados por el paciente, datos de sensores y otras formas de datos difíciles de procesar. Ahora hay una necesidad aún mayor de que dichos entornos presten mayor atención a la calidad de los datos y la información. [ 84 ] "Big data muy a menudo significa ' datos sucios ' y la fracción de inexactitudes de datos aumenta con el crecimiento del volumen de datos". La inspección humana a escala de big data es imposible y hay una necesidad desesperada en el servicio de salud de herramientas inteligentes para el control de precisión y credibilidad y manejo de la información omitida. [ 85 ] Si bien gran parte de la información en el ámbito de la salud ahora es electrónica, se engloba dentro del concepto de macrodatos, ya que la mayor parte no está estructurada y es difícil de usar. [ 86 ] El uso de macrodatos en la atención médica ha planteado importantes desafíos éticos que abarcan desde riesgos para los derechos individuales, la privacidad y la autonomía , hasta la transparencia y la confianza. [ 87 ]

El análisis de grandes datos en la investigación sanitaria resulta especialmente prometedor en lo que respecta a la investigación biomédica exploratoria, ya que el análisis basado en datos puede avanzar con mayor rapidez que la investigación basada en hipótesis. [ 88 ] Posteriormente, las tendencias observadas en el análisis de datos pueden someterse a prueba en la investigación biológica tradicional basada en hipótesis y, finalmente, en la investigación clínica.

Un subárea de aplicación relacionada, que depende en gran medida de los macrodatos, dentro del campo de la salud es la del diagnóstico asistido por computadora en medicina. [ 89 ] Por ejemplo, para el monitoreo de la epilepsia es habitual generar de 5 a 10 GB de datos diariamente. [ 90 ] De manera similar, una sola imagen sin comprimir de tomosíntesis mamaria tiene un promedio de 450 MB de datos. [ 91 ] Estos son solo algunos de los muchos ejemplos donde el diagnóstico asistido por computadora utiliza macrodatos. Por esta razón, los macrodatos se han reconocido como uno de los siete desafíos clave que los sistemas de diagnóstico asistido por computadora deben superar para alcanzar el siguiente nivel de rendimiento. [ 92 ]

Educación

Un estudio del McKinsey Global Institute encontró una escasez de 1,5 millones de profesionales y gerentes de datos altamente capacitados [ 51 ] y varias universidades [ 93 ] incluidas la Universidad de Tennessee y UC Berkeley , han creado programas de maestría para satisfacer esta demanda. Los campamentos de entrenamiento privados también han desarrollado programas para satisfacer esa demanda, incluidos programas de pago como The Data Incubator o General Assembly . [ 94 ] En el campo específico del marketing, uno de los problemas enfatizados por Wedel y Kannan [ 95 ] es que el marketing tiene varios subdominios (por ejemplo, publicidad, promociones, desarrollo de productos, marca) que utilizan diferentes tipos de datos.

Medios de comunicación

Para comprender cómo los medios utilizan el big data, primero es necesario contextualizar el mecanismo empleado en el procesamiento de datos. Nick Couldry y Joseph Turow sugieren que los profesionales de los medios y la publicidad abordan el big data como una gran cantidad de información útil sobre millones de personas. La industria parece estar alejándose del enfoque tradicional de utilizar medios específicos como periódicos, revistas o programas de televisión, y en su lugar, se dirige a los consumidores mediante tecnologías que alcanzan a las personas objetivo en los momentos y lugares óptimos. El objetivo final es ofrecer o transmitir un mensaje o contenido que, estadísticamente hablando, esté en consonancia con la mentalidad del consumidor. Por ejemplo, los medios de publicación adaptan cada vez más los mensajes (anuncios) y el contenido (artículos) para atraer a consumidores que han sido recopilados exclusivamente mediante diversas actividades de minería de datos . [ 96 ]

  • Segmentación de consumidores (para publicidad por parte de los especialistas en marketing) [ 97 ]
  • Captura de datos
  • Periodismo de datos : editores y periodistas utilizan herramientas de big data para proporcionar información e infografías únicas e innovadoras .

Channel 4 , la emisora ​​de televisión pública británica , es líder en el campo del big data y el análisis de datos . [ 98 ]

Seguro

Las aseguradoras de salud recopilan datos sobre los "determinantes sociales de la salud", como el consumo de alimentos y televisión , el estado civil, la talla de ropa y los hábitos de compra, a partir de los cuales realizan predicciones sobre los costos de salud para detectar problemas de salud en sus clientes. Es controvertido si estas predicciones se utilizan actualmente para la fijación de precios. [ 99 ]

Internet de las cosas (IoT)

El big data y el IoT funcionan conjuntamente. Los datos extraídos de los dispositivos IoT proporcionan un mapa de la interconectividad de los dispositivos. Estos mapas han sido utilizados por la industria de los medios de comunicación, empresas y gobiernos para segmentar con mayor precisión a su público objetivo y aumentar la eficiencia de los medios. El IoT también se está adoptando cada vez más como medio para recopilar datos sensoriales, y estos datos se han utilizado en contextos médicos, [ 100 ] de fabricación [ 101 ] y de transporte [ 102 ] .

Kevin Ashton , el experto en innovación digital a quien se le atribuye la creación del término, [ 103 ] define el Internet de las cosas en esta cita: «Si tuviéramos computadoras que supieran todo lo que hay que saber sobre las cosas —utilizando datos que recopilan sin nuestra ayuda— podríamos rastrear y contabilizar todo, y reducir enormemente el desperdicio, las pérdidas y los costos. Sabríamos cuándo las cosas necesitan ser reemplazadas, reparadas o retiradas del mercado, y si están en buen estado o ya han pasado su mejor momento».

Tecnologías de la información

Especialmente desde 2015, el big data ha cobrado prominencia en las operaciones comerciales como una herramienta para ayudar a los empleados a trabajar de manera más eficiente y optimizar la recopilación y distribución de tecnología de la información (TI). El uso de big data para resolver problemas de TI y recopilación de datos dentro de una empresa se denomina análisis de operaciones de TI (ITOA). [ 104 ] Al aplicar los principios del big data a los conceptos de inteligencia artificial y computación profunda, los departamentos de TI pueden predecir problemas potenciales y prevenirlos. [ 104 ] Las empresas de ITOA ofrecen plataformas para la gestión de sistemas que integran silos de datos y generan información valiosa a partir de todo el sistema, en lugar de a partir de conjuntos de datos aislados.

Ciencia de la topografía

En comparación con la recopilación de datos basada en encuestas , el big data tiene un bajo costo por punto de datos, aplica técnicas de análisis mediante aprendizaje automático y minería de datos , e incluye fuentes de datos diversas y nuevas, por ejemplo, registros, redes sociales, aplicaciones y otras formas de datos digitales. Desde 2018, los científicos de encuestas han comenzado a examinar cómo el big data y la ciencia de las encuestas pueden complementarse para permitir que los investigadores y profesionales mejoren la producción de estadísticas y su calidad. Se han realizado tres conferencias Big Data Meets Survey Science (BigSurv) en 2018, 2020 (virtual), 2023 y, a partir de 2023una conferencia próxima en 2025, [ 105 ] un número especial en Social Science Computer Review , [ 106 ] un número especial en Journal of the Royal Statistical Society , [ 107 ] y un número especial en EP J Data Science , [ 108 ] y un libro llamado Big Data Meets Social Sciences [ 109 ] editado por Craig Hill y otros cinco miembros de la American Statistical Association . En 2021, los miembros fundadores de BigSurv recibieron el Premio Warren J. Mitofsky a la Innovación de la Asociación Estadounidense para la Investigación de la Opinión Pública . [ 110 ]

Marketing

El big data es notable en el marketing debido a la constante "datificación" [ 111 ] de los consumidores cotidianos de internet, en la que se rastrean todas las formas de datos. La datificación de los consumidores puede definirse como la cuantificación de muchos o todos los comportamientos humanos con fines de marketing. [ 111 ] El mundo cada vez más digital de rápida datificación hace que esta idea sea relevante para el marketing porque la cantidad de datos crece constantemente de forma exponencial. Se prevé que aumente de 44 a 163 zettabytes en el lapso de cinco años. [ 112 ] El tamaño del big data a menudo puede ser difícil de manejar para los especialistas en marketing. [ 113 ] Como resultado, los adoptantes del big data pueden encontrarse en desventaja. Los hallazgos algorítmicos pueden ser difíciles de lograr con conjuntos de datos tan grandes. [ 114 ] El big data en marketing es una herramienta altamente lucrativa que pueden utilizar las grandes corporaciones, su valor radica en la posibilidad de predecir tendencias, intereses o resultados estadísticos significativos de una manera basada en el consumidor. [ 115 ]

Existen tres factores importantes en el uso de big data en marketing:

  1. El big data proporciona a los profesionales del marketing la posibilidad de identificar patrones de comportamiento del cliente, ya que todas las acciones humanas se cuantifican en números legibles que los profesionales del marketing pueden analizar y utilizar en sus investigaciones. [ 116 ] Además, el big data también puede considerarse una herramienta de recomendación de productos personalizada. En concreto, dado que el big data es eficaz para analizar los comportamientos de compra y los patrones de navegación de los clientes, esta tecnología puede ayudar a las empresas a promocionar productos personalizados específicos a clientes específicos. [ 117 ]
  2. La capacidad de respuesta del mercado en tiempo real es importante para los profesionales del marketing debido a la posibilidad de reorientar sus esfuerzos y ajustarlos a las tendencias actuales, lo que resulta útil para mantener la relevancia para los consumidores. Esto puede proporcionar a las empresas la información necesaria para predecir con antelación los deseos y necesidades de los consumidores. [ 116 ]
  3. La ambidextría del mercado impulsada por datos se ve fuertemente potenciada por el big data. [ 116 ] Se están desarrollando nuevos modelos y algoritmos para realizar predicciones significativas sobre ciertas situaciones económicas y sociales. [ 118 ]

Estudios de caso

Gobierno

Porcelana

  • La Plataforma Integrada de Operaciones Conjuntas (IJOP, 一体化联合作战平台) es utilizada por el gobierno para monitorear a la población, particularmente a los uigures . [ 119 ] Se recopilan datos biométricos , incluidas muestras de ADN, a través de un programa de exámenes físicos gratuitos. [ 120 ]
  • Para 2020, China planea otorgar a todos sus ciudadanos una puntuación personal de "crédito social" basada en su comportamiento. [ 121 ] El Sistema de Crédito Social , que actualmente se está probando en varias ciudades chinas, se considera una forma de vigilancia masiva que utiliza tecnología de análisis de macrodatos. [ 122 ] [ 123 ]

India

  • El análisis de macrodatos fue probado por el BJP para ganar las elecciones generales indias de 2014. [ 124 ]
  • El gobierno indio utiliza numerosas técnicas para determinar cómo responde el electorado indio a las acciones gubernamentales, así como para obtener ideas para la mejora de las políticas.

Israel

  • Se pueden crear tratamientos personalizados para la diabetes mediante la solución de macrodatos de GlucoMe. [ 125 ]

Reino Unido

Ejemplos de usos del big data en los servicios públicos:

  • Datos sobre medicamentos recetados: al vincular el origen, la ubicación y la hora de cada receta, una unidad de investigación pudo ejemplificar y examinar el considerable retraso entre la comercialización de un medicamento determinado y la adaptación a nivel nacional en el Reino Unido de las directrices del Instituto Nacional para la Excelencia en la Salud y la Atención (NICE). Esto sugiere que los medicamentos nuevos o más recientes tardan un tiempo en llegar al público general. [ 126 ]
  • Integración de datos: una autoridad local combinó datos sobre servicios, como los turnos de esparcimiento de sal en las carreteras, con servicios para personas en situación de riesgo, como el programa de reparto de comidas a domicilio . La conexión de datos permitió a la autoridad local evitar cualquier retraso relacionado con las condiciones meteorológicas. [ 127 ]

Estados Unidos

Minorista

  • Walmart gestiona más de 1 millón de transacciones de clientes cada hora, las cuales se importan a bases de datos que se estima contienen más de 2,5 petabytes (2560 terabytes) de datos, el equivalente a 167 veces la información contenida en todos los libros de la Biblioteca del Congreso de los Estados Unidos . [ 6 ]
  • Windermere Real Estate utiliza información de ubicación de casi 100 millones de conductores para ayudar a los compradores de viviendas nuevas a determinar sus tiempos de viaje típicos hacia y desde el trabajo en diferentes momentos del día. [ 137 ]
  • El sistema de detección de tarjetas FICO protege las cuentas en todo el mundo. [ 138 ]
  • El comercio minorista omnicanal [ 139 ] aprovecha los macrodatos en línea para mejorar las experiencias fuera de línea.

Ciencia

  • Los experimentos del Gran Colisionador de Hadrones representan aproximadamente 150 millones de sensores que transmiten datos 40  millones de veces por segundo. Se producen casi 600  millones de colisiones por segundo. Tras filtrar y descartar más del 99,99995 % [ 140 ] de estos flujos, quedan 1000 colisiones de interés por segundo. [ 141 ] [ 142 ] [ 143 ]
    • Como resultado, trabajando con menos del 0,001% de los datos del flujo de sensores, el flujo de datos de los cuatro experimentos del LHC representa una tasa anual de 25 petabytes antes de la replicación ( a partir de 2012).Esto se convierte en casi 200 petabytes después de la replicación.
    • Si todos los datos de los sensores se registraran en el LHC, el flujo de datos sería extremadamente difícil de gestionar. Antes de la replicación, el flujo de datos superaría los 150 millones de petabytes anuales, o casi 500 exabytes diarios. Para ponerlo en perspectiva, esto equivale a 500 quintillones (5 × 10²⁰ ) de bytes al día, casi 200 veces más que todas las demás fuentes combinadas del mundo.
  • El Square Kilometre Array es un radiotelescopio compuesto por miles de antenas. Se espera que entre en funcionamiento en 2024. En conjunto, se prevé que estas antenas recojan 14 exabytes y almacenen un petabyte al día. [ 144 ] [ 145 ] Se considera uno de los proyectos científicos más ambiciosos jamás emprendidos. [ 146 ]
  • Cuando el Sloan Digital Sky Survey (SDSS) comenzó a recopilar datos astronómicos en el año 2000, acumuló en sus primeras semanas más datos que todos los recopilados en la historia de la astronomía hasta entonces. Continuando a un ritmo de aproximadamente 200  GB por noche, el SDSS ha acumulado más de 140 terabytes de información. [ 6 ] Cuando el Large Synoptic Survey Telescope , sucesor del SDSS, entre en funcionamiento en 2020, sus diseñadores esperan que adquiera esa cantidad de datos cada cinco días. [ 6 ]
  • La decodificación del genoma humano originalmente requería 10 años; ahora se puede lograr en menos de un día. Los secuenciadores de ADN han reducido el costo de secuenciación en 10 000 veces en los últimos diez años, lo que representa un ahorro de 100 veces en comparación con la reducción de costos prevista por la ley de Moore . [ 147 ]
  • El Centro de Simulación Climática de la NASA (NCCS) almacena 32 petabytes de observaciones y simulaciones climáticas en el clúster de supercomputación Discover. [ 148 ] [ 149 ]
  • DNAStack de Google recopila y organiza muestras de ADN con datos genéticos de todo el mundo para identificar enfermedades y otros defectos médicos. Estos cálculos rápidos y precisos eliminan cualquier punto de fricción o error humano que pudieran cometer los numerosos expertos en ciencia y biología que trabajan con el ADN. DNAStack, que forma parte de Google Genomics, permite a los científicos utilizar la vasta muestra de recursos del servidor de búsqueda de Google para escalar experimentos sociales que normalmente tardarían años, de forma instantánea. [ 150 ] [ 151 ]
  • La base de datos de ADN de 23andme contiene la información genética de más de 1.000.000 de personas en todo el mundo. [ 152 ] La empresa explora la posibilidad de vender los "datos genéticos agregados anónimos" a otros investigadores y compañías farmacéuticas con fines de investigación si los pacientes dan su consentimiento. [ 153 ] [ 154 ] [ 155 ] [ 156 ] [ 157 ] Ahmad Hariri, profesor de psicología y neurociencia en la Universidad de Duke, quien ha estado utilizando 23andMe en su investigación desde 2009, afirma que el aspecto más importante del nuevo servicio de la empresa es que hace que la investigación genética sea accesible y relativamente barata para los científicos. [ 153 ] Un estudio que identificó 15 sitios del genoma vinculados a la depresión en la base de datos de 23andMe provocó un aumento en las demandas para acceder al repositorio, y 23andMe recibió casi 20 solicitudes para acceder a los datos de depresión en las dos semanas posteriores a la publicación del artículo. [ 158 ]
  • La dinámica de fluidos computacional ( CFD ) y la investigación sobre turbulencia hidrodinámica generan conjuntos de datos masivos. La base de datos de turbulencia de Johns Hopkins ( JHTDB ) contiene más de 350 terabytes de campos espaciotemporales provenientes de simulaciones numéricas directas de diversos flujos turbulentos. Compartir estos datos mediante métodos tradicionales, como la descarga de archivos de salida de simulación, ha sido complicado. Se puede acceder a los datos de JHTDB mediante "sensores virtuales" con diversos modos de acceso, desde consultas directas a través de navegadores web y acceso mediante programas en Matlab, Python, Fortran y C que se ejecutan en las plataformas de los clientes, hasta servicios de descarga de datos sin procesar. Estos datos se han utilizado en más de 150 publicaciones científicas.

Deportes

Los macrodatos pueden utilizarse para mejorar el entrenamiento y la comprensión de los competidores, mediante sensores deportivos. También es posible predecir a los ganadores de un partido utilizando análisis de macrodatos. [ 159 ] Asimismo, se podría predecir el rendimiento futuro de los jugadores. [ 160 ] Por lo tanto, el valor y el salario de los jugadores se determinan mediante datos recopilados a lo largo de la temporada. [ 161 ]

En las carreras de Fórmula Uno , los coches de carreras con cientos de sensores generan terabytes de datos. Estos sensores recogen datos que van desde la presión de los neumáticos hasta la eficiencia del consumo de combustible. [ 162 ] Con base en estos datos, los ingenieros y analistas de datos deciden si se deben realizar ajustes para ganar una carrera. Además, utilizando macrodatos, los equipos de carreras intentan predecir el tiempo que tardarán en terminar la carrera, basándose en simulaciones con datos recopilados durante la temporada. [ 163 ]

Tecnología

  • A partir de 2013eBay.com utiliza dos almacenes de datos de 7,5 petabytes y 40 PB , así como un clúster Hadoop de 40 PB para búsqueda, recomendaciones al consumidor y comercialización. [ 164 ]
  • Amazon.com gestiona millones de operaciones de back-end cada día, así como consultas de más de medio millón de vendedores externos. La tecnología central que mantiene a Amazon en funcionamiento se basa en Linux y, desde 2005Tenían las tres bases de datos Linux más grandes del mundo, con capacidades de 7,8 TB, 18,5 TB y 24,7 TB. [ 165 ]
  • Facebook gestiona 50  mil millones de fotos de sus usuarios. [ 166 ] A junio de 2017 Facebook alcanzó los 2 mil millones de usuarios activos mensuales . [ 167 ]
  • En agosto de 2012, Google gestionaba aproximadamente 100  mil millones de búsquedas al mes. . [ 168 ]
  • Un ejemplo muy conocido de la aplicación del big data es Amazon. Amazon utiliza el análisis de datos para impulsar su sistema de recomendaciones. Amazon obtiene un gran éxito gracias a la parte de las ventas que proviene de la sección de "recomendaciones", que ofrece sugerencias de compra personalizadas.

COVID-19

Durante la pandemia de COVID-19 , se planteó el uso de macrodatos como una forma de minimizar el impacto de la enfermedad. Entre las aplicaciones más importantes de los macrodatos se incluyeron la minimización de la propagación del virus, la identificación de casos y el desarrollo de tratamientos médicos. [ 169 ]

Los gobiernos utilizaron macrodatos para rastrear a las personas infectadas y minimizar la propagación. Entre los primeros países en adoptarlos se encontraban China, Taiwán, Corea del Sur e Israel. [ 170 ] [ 171 ] [ 172 ]

Actividades de investigación

La búsqueda cifrada y la formación de clústeres en macrodatos se demostraron en marzo de 2014 en la Sociedad Estadounidense de Educación en Ingeniería. Gautam Siwach, del Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT, y Amir Esmailpour, del Grupo de Investigación de la UNH, investigaron las características clave de los macrodatos, como la formación de clústeres y sus interconexiones. Se centraron en la seguridad de los macrodatos y en la orientación del término hacia la presencia de diferentes tipos de datos en formato cifrado en la interfaz de la nube, proporcionando definiciones básicas y ejemplos en tiempo real dentro de la tecnología. Además, propusieron un enfoque para identificar la técnica de codificación que permita avanzar hacia una búsqueda más rápida sobre texto cifrado, lo que conlleva mejoras en la seguridad de los macrodatos. [ 173 ]

En marzo de 2012, la Casa Blanca anunció una "Iniciativa de Big Data" nacional que consistía en seis departamentos y agencias federales que comprometieron más de 200  millones de dólares a proyectos de investigación de big data. [ 174 ]

La iniciativa incluyó una subvención de la National Science Foundation, "Expeditions in Computing", de 10 millones de dólares durante cinco años para el AMPLab [ 175 ] de la Universidad de California, Berkeley. [ 176 ] El AMPLab también recibió fondos de DARPA y de más de una docena de patrocinadores industriales, y utiliza macrodatos para abordar una amplia gama de problemas, desde la predicción de la congestión del tráfico [ 177 ] hasta la lucha contra el cáncer. [ 178 ]

La Iniciativa de Big Data de la Casa Blanca también incluyó el compromiso del Departamento de Energía de proporcionar 25 millones de dólares en financiación durante cinco años para establecer el Instituto de Gestión, Análisis y Visualización de Datos Escalables (SDAV), [ 179 ] dirigido por el Laboratorio Nacional Lawrence Berkeley del Departamento de Energía . El Instituto SDAV tiene como objetivo reunir la experiencia de seis laboratorios nacionales y siete universidades para desarrollar nuevas herramientas que ayuden a los científicos a gestionar y visualizar datos en las supercomputadoras del departamento.

El estado estadounidense de Massachusetts anunció la Iniciativa de Big Data de Massachusetts en mayo de 2012, que proporciona financiación del gobierno estatal y de empresas privadas a diversas instituciones de investigación. [ 180 ] El Instituto Tecnológico de Massachusetts alberga el Centro de Ciencia y Tecnología de Intel para Big Data en el Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT , que combina financiación y esfuerzos de investigación gubernamentales, corporativos e institucionales. [ 181 ]

La Comisión Europea financia el Foro Público-Privado sobre Big Data, de dos años de duración, a través de su Séptimo Programa Marco, con el objetivo de involucrar a empresas, académicos y otras partes interesadas en el debate sobre cuestiones relacionadas con el big data. El proyecto busca definir una estrategia en materia de investigación e innovación para orientar las acciones de apoyo de la Comisión Europea en la implementación exitosa de la economía del big data. Los resultados de este proyecto se utilizarán como insumo para Horizonte 2020 , su próximo programa marco . [ 182 ]

El gobierno británico anunció en marzo de 2014 la fundación del Instituto Alan Turing , que lleva el nombre del pionero de la informática y descifrador de códigos, y que se centrará en nuevas formas de recopilar y analizar grandes conjuntos de datos. [ 183 ]

En el Día de Inspiración de la Experiencia Canadiense de Datos Abiertos (CODE) del Campus Stratford de la Universidad de Waterloo , los participantes demostraron cómo el uso de la visualización de datos puede aumentar la comprensión y el atractivo de los grandes conjuntos de datos y comunicar su historia al mundo. [ 184 ]

Ciencias sociales computacionales  : cualquiera puede usar las interfaces de programación de aplicaciones (API) proporcionadas por los poseedores de big data, como Google y Twitter, para hacer investigación en las ciencias sociales y del comportamiento. [ 185 ] A menudo, estas API se proporcionan de forma gratuita. [ 185 ] Tobias Preis et al. utilizaron datos de Google Trends para demostrar que los usuarios de Internet de países con un producto interno bruto (PIB) per cápita más alto son más propensos a buscar información sobre el futuro que información sobre el pasado. Los hallazgos sugieren que puede haber un vínculo entre los comportamientos en línea y los indicadores económicos del mundo real. [ 186 ] [ 187 ] [ 188 ] Los autores del estudio examinaron los registros de consultas de Google hechos por la proporción del volumen de búsquedas para el año siguiente (2011) al volumen de búsquedas para el año anterior (2009), que ellos llaman el " índice de orientación futura ". [ 189 ] Compararon el índice de orientación al futuro con el PIB per cápita de cada país y encontraron una fuerte tendencia a que los países donde los usuarios de Google preguntan más sobre el futuro tengan un PIB más alto.

Tobias Preis y sus colegas Helen Susannah Moat y H. Eugene Stanley introdujeron un método para identificar precursores en línea de movimientos del mercado de valores, utilizando estrategias de negociación basadas en datos de volumen de búsqueda proporcionados por Google Trends. [ 190 ] Su análisis del volumen de búsqueda de Google para 98 términos de relevancia financiera variable, publicado en Scientific Reports , [ 191 ] sugiere que los aumentos en el volumen de búsqueda para términos de búsqueda financieramente relevantes tienden a preceder a grandes pérdidas en los mercados financieros. [ 192 ] [ 193 ] [ 194 ] [ 195 ] [ 196 ] [ 197 ] [ 198 ]

Los grandes conjuntos de datos presentan desafíos algorítmicos que antes no existían. Por lo tanto, algunos consideran necesario cambiar fundamentalmente las formas de procesamiento. [ 199 ]

Muestreo de grandes datos

Una pregunta de investigación sobre los macrodatos es si es necesario analizar todos los datos para extraer conclusiones sobre sus propiedades o si basta con una muestra. El término "macrodatos" en sí mismo alude al tamaño, una característica importante de este tipo de datos. Sin embargo, el muestreo permite seleccionar los puntos de datos adecuados dentro del conjunto de datos más amplio para estimar las características de toda la población. En la fabricación, se dispone de diferentes tipos de datos sensoriales, como datos acústicos, de vibración, presión, corriente, voltaje y datos de control, a intervalos cortos. Para predecir el tiempo de inactividad, puede que no sea necesario analizar todos los datos; una muestra puede ser suficiente. Los macrodatos se pueden clasificar en diversas categorías, como datos demográficos, psicográficos, conductuales y transaccionales. Con grandes conjuntos de datos, los profesionales del marketing pueden crear y utilizar segmentos de consumidores más personalizados para una segmentación más estratégica.

Crítica

Las críticas al paradigma de los macrodatos se presentan en dos variantes: las que cuestionan las implicaciones del enfoque en sí mismo y las que cuestionan la forma en que se realiza actualmente. [ 200 ] Un enfoque para esta crítica es el campo de los estudios críticos de datos .

Críticas al paradigma del big data

"Un problema crucial es que no sabemos mucho acerca de los microprocesos empíricos subyacentes que conducen a la aparición de las características típicas de red de Big Data." [ 23 ] En su crítica, Snijders, Matzat y Reips señalan que a menudo se hacen suposiciones muy fuertes sobre propiedades matemáticas que pueden no reflejar en absoluto lo que realmente está sucediendo a nivel de microprocesos. Mark Graham ha formulado amplias críticas a la afirmación de Chris Anderson de que big data significará el fin de la teoría: [ 201 ] centrándose en particular en la noción de que big data siempre debe contextualizarse en sus contextos sociales, económicos y políticos. [ 202 ] Incluso cuando las empresas invierten sumas de ocho y nueve cifras para obtener conocimiento de la información que fluye de proveedores y clientes, menos del 40% de los empleados tienen procesos y habilidades suficientemente maduros para hacerlo. Para superar este déficit de conocimiento, big data, por muy completo o bien analizado que sea, debe complementarse con un "gran juicio", según un artículo en la Harvard Business Review . [ 203 ]

En la misma línea, se ha señalado que las decisiones basadas en el análisis de big data están inevitablemente "informadas por el mundo como era en el pasado o, en el mejor de los casos, como es actualmente". [ 66 ] Alimentados por una gran cantidad de datos sobre experiencias pasadas, los algoritmos pueden predecir el desarrollo futuro si el futuro es similar al pasado. [ 204 ] Si la dinámica del sistema del futuro cambia (si no es un proceso estacionario ), el pasado puede decir poco sobre el futuro. Para hacer predicciones en entornos cambiantes, sería necesario tener una comprensión profunda de la dinámica de los sistemas, lo que requiere teoría. [ 204 ] Como respuesta a esta crítica, Alemany Oliver y Vayre sugieren utilizar "el razonamiento abductivo como primer paso en el proceso de investigación para dar contexto a las huellas digitales de los consumidores y hacer surgir nuevas teorías". [ 205 ] Además, se ha sugerido combinar enfoques de big data con simulaciones por computadora, como modelos basados ​​en agentes [ 66 ] y sistemas complejos . Los modelos basados ​​en agentes están mejorando cada vez más en la predicción del resultado de las complejidades sociales de escenarios futuros incluso desconocidos a través de simulaciones por computadora que se basan en una colección de algoritmos mutuamente interdependientes. [ 206 ] [ 207 ] Finalmente, el uso de métodos multivariados que exploran la estructura latente de los datos, como el análisis factorial y el análisis de conglomerados , han demostrado ser útiles como enfoques analíticos que van mucho más allá de los enfoques bivariados (por ejemplo, tablas de contingencia ) que se emplean típicamente con conjuntos de datos más pequeños.

En salud y biología, los enfoques científicos convencionales se basan en la experimentación. Para estos enfoques, el factor limitante son los datos relevantes que pueden confirmar o refutar la hipótesis inicial. [ 208 ] Ahora se acepta un nuevo postulado en biociencias: la información proporcionada por los datos en grandes volúmenes ( ómicas ) sin hipótesis previa es complementaria y a veces necesaria a los enfoques convencionales basados ​​en la experimentación. [ 209 ] [ 210 ] En los enfoques masivos, la formulación de una hipótesis relevante para explicar los datos es el factor limitante. [ 211 ] La lógica de búsqueda se invierte y se deben considerar los límites de la inducción ("Glory of Science and Philosophy scandal", CD Broad , 1926).

Los defensores de la privacidad están preocupados por la amenaza a la privacidad que representa el creciente almacenamiento e integración de información de identificación personal ; paneles de expertos han publicado varias recomendaciones de políticas para adaptar la práctica a las expectativas de privacidad. [ 212 ] El mal uso de los macrodatos en varios casos por parte de los medios de comunicación, las empresas e incluso el gobierno ha permitido la abolición de la confianza en casi todas las instituciones fundamentales que sostienen la sociedad. [ 213 ]

Barocas y Nissenbaum sostienen que una forma de proteger a los usuarios individuales es informándoles sobre los tipos de información que se recopilan, con quién se comparte, bajo qué restricciones y para qué fines. [ 214 ]

Críticas al modelo "V"

El modelo "V" de big data es preocupante, ya que se centra en la escalabilidad computacional y carece de una pérdida en torno a la perceptibilidad y la comprensibilidad de la información. Esto condujo al marco de big data cognitivo , que caracteriza las aplicaciones de big data según: [ 215 ]

  • Completitud de los datos: comprensión de lo no obvio a partir de los datos.
  • Correlación de datos, causalidad y predictibilidad: la causalidad no es un requisito esencial para lograr la predictibilidad.
  • Explicabilidad e interpretabilidad: los humanos desean comprender y aceptar lo que entienden, mientras que los algoritmos no pueden lidiar con esto.
  • Nivel de toma de decisiones automatizada : algoritmos que respaldan la toma de decisiones automatizada y el autoaprendizaje algorítmico.

Críticas a la novedad

Durante más de un siglo, las computadoras han analizado grandes conjuntos de datos, incluyendo los análisis del censo estadounidense realizados por las máquinas de tarjetas perforadas de IBM , que calculaban estadísticas como medias y varianzas de poblaciones en todo el continente. En décadas más recientes, experimentos científicos como el del CERN han generado datos a escalas similares a las del actual "big data" comercial. Sin embargo, estos experimentos han tendido a analizar sus datos utilizando clústeres y redes de computación de alto rendimiento (supercomputación) especializados y diseñados a medida , en lugar de nubes de computadoras comerciales económicas como en la actual ola comercial, lo que implica una diferencia tanto en la cultura como en la infraestructura tecnológica.

Críticas a la ejecución de big data

Ulf-Dietrich Reips y Uwe Matzat escribieron en 2014 que el big data se había convertido en una "moda" en la investigación científica. [ 185 ] La investigadora danah boyd ha expresado su preocupación por el uso del big data en la ciencia, descuidando principios como la elección de una muestra representativa por estar demasiado preocupada por manejar las enormes cantidades de datos. [ 216 ] Este enfoque puede conducir a resultados que tienen un sesgo de una u otra manera. [ 217 ] La integración de recursos de datos heterogéneos —algunos que podrían considerarse big data y otros no— presenta formidables desafíos logísticos y analíticos, pero muchos investigadores argumentan que tales integraciones probablemente representen las nuevas fronteras más prometedoras en la ciencia. [ 218 ] En el provocador artículo "Preguntas críticas para el Big Data", [ 219 ] los autores titulan el big data como parte de la mitología : "los grandes conjuntos de datos ofrecen una forma superior de inteligencia y conocimiento [...], con el aura de verdad, objetividad y precisión". Los usuarios de big data a menudo se "pierden en el enorme volumen de números", y "trabajar con Big Data sigue siendo subjetivo, y lo que cuantifica no necesariamente tiene una pretensión más cercana a la verdad objetiva". [ 219 ] Los desarrollos recientes en el dominio de BI, como los informes proactivos, apuntan especialmente a mejoras en la usabilidad de big data, a través del filtrado automatizado de datos y correlaciones no útiles . [ 220 ] Las grandes estructuras están llenas de correlaciones espurias [ 221 ] ya sea debido a coincidencias no causales ( ley de los números verdaderamente grandes ), únicamente a la naturaleza de la gran aleatoriedad [ 222 ] ( teoría de Ramsey ), o a la existencia de factores no incluidos, por lo que se cuestiona la esperanza de los primeros experimentadores de hacer que las grandes bases de datos de números "hablen por sí mismas" y revolucionen el método científico. [ 223 ] Catherine Tucker ha señalado el "bombo" en torno a big data, escribiendo "Por sí mismo, es poco probable que big data sea valioso". El artículo explica: "Los numerosos contextos en los que los datos son baratos en relación con el coste de retener talento para procesarlos, sugieren que las habilidades de procesamiento son más importantes que los datos en sí mismos para crear valor para una empresa". [ 224 ]

El análisis de big data suele ser superficial en comparación con el análisis de conjuntos de datos más pequeños. [ 225 ] En muchos proyectos de big data, no se realiza un análisis de grandes conjuntos de datos, sino que el desafío reside en la extracción, transformación y carga de datos durante el preprocesamiento. [ 225 ]

Big data es una palabra de moda y un "término vago", [ 226 ] [ 227 ] pero al mismo tiempo una "obsesión" [ 227 ] para emprendedores, consultores, científicos y medios de comunicación. Ejemplos de big data como Google Flu Trends no lograron ofrecer buenas predicciones en los últimos años, exagerando los brotes de gripe por un factor de dos. De manera similar, las predicciones de los Premios de la Academia y las elecciones basadas únicamente en Twitter fueron más a menudo erróneas que acertadas. Big data suele plantear los mismos desafíos que los datos pequeños; agregar más datos no resuelve los problemas de sesgo, sino que puede enfatizar otros problemas. En particular, las fuentes de datos como Twitter no son representativas de la población general, y los resultados obtenidos de dichas fuentes pueden llevar a conclusiones erróneas. Google Translate , que se basa en el análisis estadístico de texto mediante big data, hace un buen trabajo traduciendo páginas web. Sin embargo, los resultados de dominios especializados pueden estar drásticamente sesgados. Por otro lado, el big data también puede introducir nuevos problemas, como el problema de las comparaciones múltiples : probar simultáneamente un gran conjunto de hipótesis es probable que produzca muchos resultados falsos que erróneamente parecen significativos. Ioannidis argumentó que "la mayoría de los hallazgos de investigación publicados son falsos" [ 228 ] debido esencialmente al mismo efecto: cuando muchos equipos científicos e investigadores realizan muchos experimentos (es decir, procesan una gran cantidad de datos científicos; aunque no con tecnología de big data), la probabilidad de que un resultado "significativo" sea falso crece rápidamente, aún más, cuando solo se publican resultados positivos. Además, los resultados del análisis de big data son tan buenos como el modelo en el que se basan. En un ejemplo, el big data participó en el intento de predecir los resultados de las elecciones presidenciales de EE. UU. de 2016 [ 229 ] con diversos grados de éxito.

Críticas a la vigilancia y el control mediante macrodatos

El big data se ha utilizado en la vigilancia policial y la vigilancia por instituciones como las fuerzas del orden y las corporaciones ( ). [ 230 ] Debido a la naturaleza menos visible de la vigilancia basada en datos en comparación con los métodos policiales tradicionales, es menos probable que surjan objeciones a la vigilancia policial basada en big data. Según el libro de Sarah Brayne, Big Data Surveillance: The Case of Policing , [ 231 ] la vigilancia policial basada en big data puede reproducir las desigualdades sociales existentes de tres maneras:

  • Someter a las personas a una mayor vigilancia utilizando como justificación un algoritmo matemático y, por lo tanto, imparcial.
  • Aumentar el alcance y el número de personas sujetas a vigilancia policial y exacerbar la sobrerrepresentación racial existente en el sistema de justicia penal.
  • Fomentar que los miembros de la sociedad abandonen las interacciones con instituciones que dejen una huella digital, creando así obstáculos para la inclusión social.

Si estos problemas potenciales no se corrigen ni se regulan, los efectos de la vigilancia mediante macrodatos podrían seguir configurando las jerarquías sociales. Brayne también señala que el uso responsable de la vigilancia mediante macrodatos podría evitar que los sesgos individuales se conviertan en sesgos institucionales.

Véase también

Referencias

  1. Breur, Tom (julio de 2016). "Análisis de potencia estadística y la "crisis" contemporánea en las ciencias sociales" . Journal of Marketing Analytics . 4 ( 2–3 ). Londres, Inglaterra: Palgrave Macmillan : 61–65 . doi : 10.1057/s41270-016-0001-3 . ISSN 2050-3318 . 
  2. McAfee, Andrew; Brynjolfsson, Erik (1 de octubre de 2012). "Big data: la revolución de la gestión". Harvard Business Review . 90 (10): 60– 66, 68, 128. ISSN 0017-8012 . PMID 23074865 .  
  3. Scholz, Tobias M. (2017), "Marco teórico" , Big Data en las organizaciones y el papel de la gestión de recursos humanos , una conceptualización basada en la teoría de sistemas complejos, Peter Lang AG, pp. 9–82 , ISBN  978-3-631-71890-2Consultado el 27 de noviembre de 2025.
  4. Cappa, Francesco; Oriani, Raffaele; Peruffo, Enzo; McCarthy, Ian (2021). "Big Data para crear y capturar valor en el entorno digitalizado: desempaquetando los efectos del volumen, la variedad y la veracidad en el desempeño de la empresa" . Journal of Product Innovation Management . 38 (1): 49– 67. doi : 10.1111/jpim.12545 . ISSN 0737-6782 . S2CID 225209179 .  
  5. Boyd, Danah; Crawford, Kate (21 de septiembre de 2011). " Seis provocaciones para el Big Data" . Social Science Research Network . doi : 10.2139/ssrn.1926431 . S2CID 148610111. Archivado del original el 28 de febrero de 2020. Recuperado el 12 de julio de 2019 . 
  6. 1 2 3 4 5 6 7 "Datos, datos por todas partes" . The Economist . 25 de febrero de 2010. Archivado del original el 27 de mayo de 2018. Recuperado el 9 de diciembre de 2012 .
  7. "Se requiere inteligencia comunitaria" . Nature . 455 (7209): 1. Septiembre de 2008. Bibcode : 2008Natur.455....1. . doi : 10.1038/455001a . PMID 18769385 . 
  8. ^ Reichman OJ, Jones MB, Schildhauer MP (febrero de 2011). «Retos y oportunidades de los datos abiertos en ecología» . Ciencia . 331 (6018): 703– 5. Bibcode : 2011Sci...331..703R . doi : 10.1126/ciencia.1197962 . PMID 21311007 . S2CID 22686503 . Archivado desde el original el 19 de octubre de 2020 . Consultado el 12 de julio de 2019 .  
  9. Hellerstein, Joe (9 de noviembre de 2008). "Programación paralela en la era del Big Data" . Blog de Gigaom . Archivado del original el 7 de octubre de 2012. Recuperado el 21 de abril de 2010 .
  10. Segaran, Toby; Hammerbacher, Jeff (2009). Beautiful Data: The Stories Behind Elegant Data Solutions . O'Reilly Media. p. 257. ISBN  978-0-596-15711-1Archivado del original el 12 de mayo de 2016. Consultado el 31 de diciembre de 2015 .
  11. 1 2 Hilbert M, López P (abril de 2011). "La capacidad tecnológica del mundo para almacenar, comunicar y procesar información" ( PDF) . Science . 332 (6025): 60– 5. Bibcode : 2011Sci...332...60H . doi : 10.1126/science.1200970 . PMID 21310967. S2CID 206531385. Archivado (PDF) del original el 19 de agosto de 2019. Recuperado el 11 de mayo de 2019 .  
  12. "IBM ¿Qué es big data? – Llevando big data a la empresa" . ibm.com. Archivado del original el 24 de agosto de 2013. Consultado el 26 de agosto de 2013 .
  13. Reinsel, David; Gantz, John; Rydning, John (13 de abril de 2017). "Data Age 2025: The Evolution of Data to Life-Critical" (PDF) . seagate.com . Framingham, MA, EE. UU.: International Data Corporation . Archivado (PDF) del original el 8 de diciembre de 2017. Recuperado el 2 de noviembre de 2017 .
  14. "El gasto global en soluciones de macrodatos y análisis alcanzará los 215.700 millones de dólares en 2021, según una nueva guía de gasto de IDC" . Archivado del original el 23 de julio de 2022. Consultado el 31 de julio de 2022 .
  15. "Ingresos por big data y análisis de negocios 2022" .
  16. "Tamaño del mercado global de la industria de big data 2011-2027" .
  17. 1 2 3 Big data: La próxima frontera para la innovación, la competencia y la productividad. Archivado el 15 de marzo de 2023 en Wayback Machine. McKinsey Global Institute, mayo de 2011.
  18. Oracle y FSN, "Dominando el Big Data: Estrategias de CFO para transformar la información en oportunidades" Archivado el 4 de agosto de 2013 en Wayback Machine , diciembre de 2012
  19. Jacobs, A. (6 de julio de 2009). "Las patologías de los macrodatos" . ACMQueue . Archivado del original el 8 de diciembre de 2015. Recuperado el 21 de abril de 2010 .
  20. Magoulas, Roger; Lorica, Ben (febrero de 2009). «Introducción al Big Data» . Versión 2.0 (11). Sebastopol, CA: O'Reilly Media. Archivado del original el 2 de noviembre de 2021. Recuperado el 26 de febrero de 2021 .
  21. John R. Mashey (25 de abril de 1998). "Big Data… y la próxima ola de estrés en infraestructura" (PDF) . Diapositivas de una charla por invitación . Usenix. Archivado (PDF) del original el 12 de octubre de 2016. Recuperado el 28 de septiembre de 2016 .
  22. Steve Lohr (1 de febrero de 2013). "Los orígenes de 'Big Data': una historia detectivesca etimológica" . The New York Times . Archivado del original el 6 de marzo de 2016. Consultado el 28 de septiembre de 2016 .
  23. ^ Snijders , Matzat y Reips 2012 .
  24. Dedić, N.; Stanier, C. (2017). «Hacia la diferenciación de la inteligencia empresarial, el big data, el análisis de datos y el descubrimiento del conocimiento» . Innovaciones en la gestión e ingeniería de sistemas de información empresarial . Notas de clase en procesamiento de información empresarial. Vol. 285. Berlín; Heidelberg: Springer International Publishing. pp. 114–22 . doi : 10.1007/978-3-319-58801-8_10 . ISBN   978-3-319-58800-1ISSN 1865-1356 . OCLC 909580101. Archivado del original el 27 de noviembre de 2020. Consultado el 7 de septiembre de 2019 .  
  25. Everts, Sarah (2016). "Sobrecarga de información" . Distillations . Vol. 2, n.º 2, págs. 26-33 . Archivado del original el 3 de abril de 2019. Recuperado el 22 de marzo de 2018 .   
  26. Abraham; Targio Hashem, Abaker; Yaqoob, Ibrar; Badrul Anuar, ni; Mokhtar, Salimah; Gani, Abdullah; Ullah Khan, Samee (2015). "Big Data" sobre computación en la nube: revisión y temas de investigación abierta". Sistemas de información . 47 : 98–115 e.
  27. Fox, Charles (25 de marzo de 2018). Ciencia de datos para el transporte . Libros de texto de Springer en ciencias de la Tierra, geografía y medio ambiente. Springer. ISBN 978-3-319-72952-7Archivado del original el 1 de abril de 2018. Consultado el 31 de marzo de 2018 .
  28. Kitchin, Rob; McArdle, Gavin (2016). "¿Qué hace que Big Data sea Big Data? Explorando las características ontológicas de 26 conjuntos de datos" . Big Data & Society . 3 : 1–10 . doi : 10.1177/2053951716631130 . S2CID 55539845 . 
  29. Balazka, Dominik; Rodighiero, Dario (2020). "Big Data y el pequeño Big Bang: una (R)evolución epistemológica" . Frontiers in Big Data . 3 : 31. doi : 10.3389/fdata.2020.00031 . hdl : 1721.1/128865 . PMC 7931920. PMID 33693404 .  
  30. "avec focalisation sur Big Data & Analytique" (PDF) . Bigdataparis.com . Archivado del original (PDF) el 25 de febrero de 2021 . Recuperado el 8 de octubre de 2017 .
  31. 1 2 Billings SA "Identificación de sistemas no lineales: métodos NARMAX en los dominios de tiempo, frecuencia y espacio-temporal". Wiley, 2013
  32. "le Blog ANDSI » DSI Big Data" . Andsi.fr . Archivado del original el 10 de octubre de 2017. Consultado el 8 de octubre de 2017 . 
  33. Les Echos (3 de abril de 2013). "Les Echos - ¿Big Data car datos de baja densidad ? La faible densidad en información como factor discriminante - Archivos" . Lesechos.fr . Archivado desde el original el 30 de abril de 2014 . Consultado el 8 de octubre de 2017 . 
  34. Sagiroglu, Seref (2013). "Big data: Una revisión". Conferencia Internacional de 2013 sobre Tecnologías y Sistemas de Colaboración (CTS) . págs. 42–47 . doi : 10.1109/CTS.2013.6567202 . ISBN  978-1-4673-6404-1. S2CID 5724608 . 
  35. Kitchin, Rob; McArdle, Gavin (17 de febrero de 2016). "¿Qué hace que Big Data sea Big Data? Explorando las características ontológicas de 26 conjuntos de datos" . Big Data & Society . 3 (1): 205395171663113. doi : 10.1177/2053951716631130 .
  36. Onay, Ceylan; Öztürk, Elif (2018). "Una revisión de la investigación sobre calificación crediticia en la era del Big Data". Journal of Financial Regulation and Compliance . 26 (3): 382– 405. doi : 10.1108/JFRC-06-2017-0054 . S2CID 158895306 . 
  37. La cuarta V del Big Data
  38. "Medición del valor empresarial de los macrodatos | IBM Big Data & Analytics Hub" . www.ibmbigdatahub.com . Archivado del original el 28 de enero de 2021. Consultado el 20 de enero de 2021 .
  39. Mlącki, Jakub (6 de abril de 2026). "7 V del Big Data: ¿qué son y por qué son tan importantes?" . www.dsstream.com . DS Stream . Consultado el 23 de junio de 2026 .
  40. Kitchin, Rob; McArdle, Gavin (5 de enero de 2016). "¿Qué hace que Big Data sea Big Data? Explorando las características ontológicas de 26 conjuntos de datos" . Big Data & Society . 3 (1): 205395171663113. doi : 10.1177/2053951716631130 . ISSN 2053-9517 . 
  41. "Encuesta: Las bases de datos más grandes se acercan a los 30 terabytes" . Eweek.com . 8 de noviembre de 2003. Consultado el 8 de octubre de 2017 .
  42. "LexisNexis comprará Seisint por 775 millones de dólares" . The Washington Post . Archivado del original el 24 de julio de 2008. Consultado el 15 de julio de 2004 .
  43. "The Washington Post" . The Washington Post . Archivado del original el 19 de octubre de 2016. Consultado el 24 de agosto de 2017 .
  44. Bertolucci, Jeff "Hadoop: De experimento a plataforma líder de big data" Archivado el 23 de noviembre de 2020 en Wayback Machine , "Information Week", 2013. Recuperado el 14 de noviembre de 2013.
  45. Webster, John. "MapReduce: Procesamiento de datos simplificado en grandes clústeres". Archivado el 14 de diciembre de 2009 en Wayback Machine , "Almacenamiento de búsqueda", 2004. Recuperado el 25 de marzo de 2013.
  46. "Oferta de soluciones de Big Data" . MIKE2.0. Archivado del original el 16 de marzo de 2013. Consultado el 8 de diciembre de 2013 .
  47. "Definición de Big Data" . MIKE2.0. Archivado del original el 25 de septiembre de 2018. Recuperado el 9 de marzo de 2013 .
  48. Boja, C; Pocovnicu, A; Bătăgan, L. (2012). "Arquitectura paralela distribuida para Big Data". Informática Económica . 16 (2): 116-127 .
  49. "Resolviendo desafíos empresariales clave con un lago de datos masivos" (PDF) . Hcltech.com . Agosto de 2014. Archivado (PDF) del original el 3 de julio de 2017. Consultado el 8 de octubre de 2017 .
  50. "Método para probar la tolerancia a fallos de los marcos de trabajo MapReduce" (PDF) . Redes informáticas. 2015. Archivado (PDF) del original el 22 de julio de 2016. Consultado el 13 de abril de 2016 .
  51. 1 2 Manyika, James; Chui, Michael; Bughin, Jaques; Brown, Brad; Dobbs, Richard; Roxburgh, Charles; Byers, Angela Hung (mayo de 2011). "Big Data: La próxima frontera para la innovación, la competencia y la productividad" (PDF) . McKinsey Global Institute. Archivado (PDF) del original el 25 de julio de 2021. Recuperado el 22 de mayo de 2021 .
  52. "Direcciones futuras en computación y modelado basados ​​en tensores" (PDF) . Mayo de 2009. Archivado (PDF) del original el 17 de abril de 2018. Recuperado el 4 de enero de 2013 .
  53. Lu, Haiping; Plataniotis, KN; Venetsanopoulos, AN (2011). "Una revisión del aprendizaje de subespacios multilineales para datos tensoriales" (PDF) . Pattern Recognition . 44 (7): 1540– 1551. Bibcode : 2011PatRe..44.1540L . doi : 10.1016/j.patcog.2011.01.004 . Archivado (PDF) del original el 10 de julio de 2019. Recuperado el 21 de enero de 2013 .
  54. Pllana, Sabri; Janciak, Ivan; Brezany, Peter; Wöhrer, Alexander (2016). "Una revisión del estado del arte en lenguajes de consulta para minería de datos e integración". 14.ª Conferencia Internacional sobre Sistemas de Información Basados ​​en Redes de 2011. IEEE Computer Society. pp. 341–348 . arXiv : 1603.01113 . Bibcode : 2016arXiv160301113P . doi : 10.1109/NBiS.2011.58 . ISBN  978-1-4577-0789-6. S2CID 9285984 . 
  55. Wang, Yandong; Goldstone, Robin; Yu, Weikuan; Wang, Teng (octubre de 2014). "Caracterización y optimización de MapReduce residente en memoria en sistemas HPC". 2014 IEEE 28th International Parallel and Distributed Processing Symposium . IEEE. págs. 799–808 . doi : 10.1109/IPDPS.2014.87 . ISBN  978-1-4799-3800-1. S2CID 11157612 . 
  56. L'Heureux, A.; Grolinger, K.; Elyamany, HF; Capretz, MAM (2017). "Aprendizaje automático con macrodatos: desafíos y enfoques" . IEEE Access . 5 : 7776–7797 . Bibcode : 2017IEEEA...5.7776L . doi : 10.1109/ACCESS.2017.2696365 . ISSN 2169-3536 . 
  57. Monash, Curt (30 de abril de 2009). "Los dos enormes almacenes de datos de eBay" . Archivado del original el 31 de marzo de 2019. Recuperado el 11 de noviembre de 2010 .Monash, Curt (6 de octubre de 2010). "Seguimiento de eBay  : Greenplum fuera, Teradata > 10 petabytes, Hadoop tiene cierto valor y más" . Archivado del original el 31 de marzo de 2019. Recuperado el 11 de noviembre de 2010 .
  58. "Recursos sobre cómo se utiliza el análisis topológico de datos para analizar grandes volúmenes de datos" . Ayasdi. Archivado del original el 3 de marzo de 2013. Consultado el 5 de marzo de 2013 .
  59. Noticias de CNET (1 de abril de 2011). "Las redes de área de almacenamiento no son relevantes" . CNET . Archivado del original el 18 de octubre de 2013. Consultado el 17 de abril de 2013 .
  60. Samborska, Veronika (20 de enero de 2025). "Ampliación: cómo el aumento de las entradas ha hecho que la inteligencia artificial sea más capaz" . Nuestro mundo en datos .
  61. Hilbert, Martin (2014). "¿Cuál es el contenido de la capacidad mundial de información y comunicación mediada tecnológicamente: cuánto texto, imagen, audio y vídeo?" . The Information Society . 30 (2): 127– 143. doi : 10.1080/01972243.2013.873748 . S2CID 45759014. Archivado del original el 24 de junio de 2020. Recuperado el 12 de julio de 2019 . 
  62. Rajpurohit, Anmol (11 de julio de 2014). "Entrevista: Amy Gershkoff, Directora de Análisis e Información del Cliente, eBay sobre cómo diseñar herramientas de BI internas personalizadas" . KDnuggets . Archivado del original el 14 de julio de 2014. Recuperado el 14 de julio de 2014. En general, considero que las herramientas de inteligencia empresarial estándar no satisfacen las necesidades de los clientes que desean obtener información personalizada a partir de sus datos. Por lo tanto, para organizaciones medianas y grandes con acceso a talento técnico sólido, suelo recomendar la creación de soluciones internas personalizadas.
  63. "El gobierno y los macrodatos: uso, problemas y potencial" . Computerworld . 21 de marzo de 2012. Archivado del original el 15 de septiembre de 2016. Consultado el 12 de septiembre de 2016 .
  64. «Libro Blanco: Big Data para el Desarrollo: Oportunidades y Desafíos» . Global Pulse . Naciones Unidas. 2012. Archivado del original el 1 de junio de 2020. Consultado el 13 de abril de 2016 .
  65. "Big Data, Big Impact: Nuevas Posibilidades para el Desarrollo Internacional" . Foro Económico Mundial y Vital Wave Consulting. Archivado del original el 1 de junio de 2020. Consultado el 24 de agosto de 2012 .
  66. 1 2 3 4 5 Hilbert 2016 .
  67. "Elena Kvochko, Cuatro maneras de hablar sobre macrodatos (Serie Tecnologías de la Información y la Comunicación para el Desarrollo)" . worldbank.org. 4 de diciembre de 2012. Archivado del original el 15 de diciembre de 2012. Consultado el 30 de mayo de 2012 .
  68. "Daniele Medri: Big Data y Negocios: Una revolución en curso" . Statistics Views. 21 de octubre de 2013. Archivado del original el 17 de junio de 2015. Consultado el 21 de junio de 2015 .
  69. Tobias Knobloch y Julia Manske (11 de enero de 2016). "Uso responsable de los datos" . D+C, Desarrollo y Cooperación . Archivado del original el 13 de enero de 2017. Recuperado el 11 de enero de 2017 .
  70. Mann, S., & Hilbert, M. (2020). AI4D: Inteligencia artificial para el desarrollo. International Journal of Communication, 14(0), 21. https://www.martinhilbert.net/ai4d-artificial-intelligence-for-development/ Archivado el 22 de abril de 2021 en Wayback Machine
  71. Blumenstock, JE (2016). Luchar contra la pobreza con datos. Science, 353(6301), 753–754. https://doi.org/10.1126/science.aah5217 Archivado el 1 de junio de 2022 en Wayback Machine
  72. Blumenstock, J., Cadamuro, G., & On, R. (2015). Predicción de la pobreza y la riqueza a partir de metadatos de teléfonos móviles. Science, 350(6264), 1073–1076. https://doi.org/10.1126/science.aac4420 Archivado el 1 de junio de 2022 en Wayback Machine
  73. Jean, N., Burke, M., Xie, M., Davis, WM, Lobell, DB, & Ermon, S. (2016). Combinación de imágenes satelitales y aprendizaje automático para predecir la pobreza. Science, 353(6301), 790–794. https://doi.org/10.1126/science.aaf7894 Archivado el 1 de junio de 2022 en Wayback Machine
  74. 1 2 Hilbert, M., & Lu, K. (2020). El rastro del mercado laboral en línea en América Latina y el Caribe (UN CEPAL LC/TS.2020/83; p. 79). Comisión Económica para América Latina y el Caribe de las Naciones Unidas. https://www.cepal.org/en/publications/45892-online-job-market-trace-latin-america-and-caribbean Archivado el 22 de septiembre de 2020 en Wayback Machine
  75. CEPAL (Comisión Económica para América Latina y el Caribe de las Naciones Unidas). (2020). Seguimiento de la huella digital en América Latina y el Caribe: Lecciones aprendidas del uso de macrodatos para evaluar la economía digital (Desarrollo Productivo, Asuntos de Género LC/TS.2020/12; Documentos de Proyecto). CEPAL. https://repositorio.cepal.org/handle/11362/45484 Archivado el 18 de septiembre de 2020 en Wayback Machine
  76. Banerjee, Amitav; Chaudhury, Suprakash (2010). " Estadística sin lágrimas: poblaciones y muestras" . Industrial Psychiatry Journal . 19 (1): 60– 65. doi : 10.4103/0972-6748.77642 . ISSN 0972-6748 . PMC 3105563. PMID 21694795 .   
  77. Aldridge, Irene (2016). Riesgo en tiempo real: lo que los inversores deben saber sobre FinTech, negociación de alta frecuencia y caídas repentinas . Steven Krawciw. Somerset: John Wiley & Sons, Incorporated. ISBN 978-1-119-31906-1OCLC 972292212 
  78. Aldridge, Irene (2021). Ciencia de datos masivos en finanzas . Marco Avellaneda. Hoboken, Nueva Jersey: Wiley. ISBN 978-1-119-60297-2OCLC 1184122216 
  79. Hasan, Md. Morshadul; Popp, József; Oláh, Judit (12 de marzo de 2020). "Panorama actual e influencia de los macrodatos en las finanzas" . Journal of Big Data . 7 (1): 21. doi : 10.1186/s40537-020-00291-z . ISSN 2196-1115 . 
  80. Huser V, Cimino JJ (julio de 2016). "Desafíos inminentes para el uso de macrodatos" . Revista internacional de oncología radioterápica, biología y física . 95 ( 3): 890–894 . doi : 10.1016/j.ijrobp.2015.10.060 . PMC 4860172. PMID 26797535 .  
  81. Sejdic, Ervin; Falk, Tiago H. (4 de julio de 2018). Procesamiento de señales y aprendizaje automático para macrodatos biomédicos . Sejdić, Ervin, Falk, Tiago H. [Lugar de publicación no identificado]. ISBN 978-1-351-06121-6OCLC 1044733829 .​ {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  82. Raghupathi W , Raghupathi V (diciembre de 2014). "Análisis de macrodatos en la atención médica: promesa y potencial" . Health Information Science and Systems . 2 (1) 3. doi : 10.1186/2047-2501-2-3 . PMC 4341817. PMID 25825667 .  
  83. Viceconti M, Hunter P, Hose R (julio de 2015). "Big data, big knowledge: big data for Personalized healthcare" ( PDF) . IEEE Journal of Biomedical and Health Informatics . 19 (4): 1209–15 . doi : 10.1109/JBHI.2015.2406883 . PMID 26218867. S2CID 14710821. Archivado (PDF) del original el 23 de julio de 2018. Recuperado el 21 de septiembre de 2019 .  
  84. O'Donoghue, John; Herbert, John (1 de octubre de 2012). "Gestión de datos en entornos de salud móvil: sensores de pacientes, dispositivos móviles y bases de datos". Journal of Data and Information Quality . 4 (1): 5:1–5:20. doi : 10.1145/2378016.2378021 . S2CID 2318649 . 
  85. Mirkes EM, Coats TJ, Levesley J, Gorban AN (agosto de 2016). "Manejo de datos faltantes en grandes conjuntos de datos de atención médica: un estudio de caso de resultados de trauma desconocidos". Computers in Biology and Medicine . 75 : 203–16 . arXiv : 1604.00627 . Bibcode : 2016arXiv160400627M . doi : 10.1016/j.compbiomed.2016.06.004 . PMID 27318570. S2CID 5874067 .  
  86. Murdoch TB, Detsky AS (abril de 2013). "La inevitable aplicación de los macrodatos a la atención sanitaria". JAMA . 309 ( 13): 1351–2 . doi : 10.1001/jama.2013.393 . PMID 23549579. S2CID 20462354 .  
  87. Vayena E, Salathé M, Madoff LC, Brownstein JS (febrero de 2015). "Desafíos éticos de los macrodatos en la salud pública" . PLOS Computational Biology . 11 (2) e1003904. Bibcode : 2015PLSCB..11E3904V . doi : 10.1371/journal.pcbi.1003904 . PMC 4321985. PMID 25664461 .  
  88. Copeland, CS (julio-agosto de 2017). "Los datos impulsan el descubrimiento" (PDF) . Healthcare Journal of New Orleans : 22-27 . Archivado (PDF) del original el 5 de diciembre de 2019. Recuperado el 5 de diciembre de 2019 .
  89. Yanase y Triantaphyllou 2019 .
  90. Dong X, Bahroos N, Sadhu E, Jackson T, Chukhman M, Johnson R, Boyd A, Hynes D (2013). "Aprovechar el marco de Hadoop para aplicaciones de informática clínica a gran escala". Actas de las Cumbres Conjuntas de AMIA sobre Ciencia Traslacional. Cumbres Conjuntas de AMIA sobre Ciencia Traslacional . 2013 : 53. PMID 24303235 . 
  91. Clunie, D. (2013). "La tomosíntesis mamaria supone un reto para la infraestructura de imagen digital" . Science and Medicine Group. Archivado del original el 24 de febrero de 2021. Recuperado el 28 de noviembre de 2023 .
  92. Yanase J, Triantaphyllou E (2019b). "Los siete desafíos clave para el futuro del diagnóstico asistido por computadora en medicina". Revista Internacional de Informática Médica . 129 : 413–22 . doi : 10.1016/j.ijmedinf.2019.06.017 . PMID 31445285. S2CID 198287435 .  
  93. "Grados en Big Data: ¿Moda pasajera o vía rápida al éxito profesional?" . Forbes . Archivado del original el 3 de marzo de 2016. Consultado el 21 de febrero de 2016 .
  94. "Nueva York estrena un nuevo programa intensivo para científicos de datos: es gratuito, pero es más difícil acceder que en Harvard" . Venture Beat . Archivado del original el 15 de febrero de 2016. Consultado el 21 de febrero de 2016 .
  95. Wedel, Michel; Kannan, PK (2016). "Marketing Analytics for Data-Rich Environments". Journal of Marketing . 80 (6): 97– 121. doi : 10.1509/jm.15.0413 . S2CID 168410284 . 
  96. Couldry, Nick; Turow, Joseph (2014). "Publicidad, macrodatos y la depuración del ámbito público: nuevos enfoques de los profesionales del marketing respecto a la subvención de contenidos". Revista Internacional de Comunicación . 8 : 1710–1726 .
  97. "Por qué las agencias de publicidad digital son pésimas en la captación de clientes y necesitan urgentemente una actualización con asistencia de IA" . Ishti.org . 15 de abril de 2018. Archivado del original el 12 de febrero de 2019. Consultado el 15 de abril de 2018 .
  98. "Big data y análisis: C4 y Genius Digital" . Ibc.org . Archivado del original el 8 de octubre de 2017. Consultado el 8 de octubre de 2017 .
  99. Marshall Allen (17 de julio de 2018). "Las aseguradoras de salud están recopilando información sobre usted, y esto podría aumentar sus tarifas" . www.propublica.org . Archivado del original el 21 de julio de 2018. Consultado el 21 de julio de 2018 .
  100. "QuiO nombrada Campeona de Innovación del Desafío de Innovación en Tecnología Sanitaria de Accenture" . Businesswire.com . 10 de enero de 2017. Archivado del original el 22 de marzo de 2017. Consultado el 8 de octubre de 2017 .
  101. "Una plataforma de software para la innovación en tecnología operativa" (PDF) . Predix.com . Archivado del original (PDF) el 22 de marzo de 2017. Consultado el 8 de octubre de 2017 .
  102. Z. Jenipher Wang (marzo de 2017). "Transporte inteligente impulsado por macrodatos: la historia subyacente de la movilidad transformada por el IoT" . Archivado del original el 4 de julio de 2018. Recuperado el 4 de julio de 2018 .
  103. "Eso del Internet de las Cosas" . 22 de junio de 2009. Archivado del original el 2 de mayo de 2013. Consultado el 29 de diciembre de 2017 .
  104. 1 2 Solnik, Ray. "Ha llegado el momento: la analítica aporta valor a las operaciones de TI" . Data Center Journal . Archivado del original el 4 de agosto de 2016. Recuperado el 21 de junio de 2016 .
  105. "BigSurv: Big Data se une a la ciencia de las encuestas" . Consultado el 15 de octubre de 2023 .
  106. ^ Eck, Adán; Cazar, Ana Lucía Córdova; Callegaro, Mario; Biemer, Paul (2021). ""El Big Data se une a la ciencia de las encuestas"" . Social Science Computer Review . 39 (4): 484– 488. doi : 10.1177/0894439319883393 .
  107. "Número especial: Los macrodatos se encuentran con la ciencia de las encuestas" . Revista de la Real Sociedad Estadística, Serie A. 185 ( S2): S165– S166.
  108. "Integración de datos de encuestas y datos no procedentes de encuestas para medir el comportamiento y la opinión pública" . www.springeropen.com . Consultado el 19 de octubre de 2023 .
  109. Hill, Craig A.; Biemer, Paul P.; Buskirk, Trent D.; Japec, Lilli; Kirchner, Antje; Kolenikov, Stas; Lyberg, Lars E., eds. (13 de octubre de 2020). Big Data Meets Survey Science: A Collection of Innovative Methods (1.ª ed.). Wiley. doi : 10.1002/9781118976357 . ISBN  978-1-118-97632-6. S2CID 240797608 . 
  110. "Ganadores anteriores del premio Warren J. Mitofsky a la innovación - AAPOR" . 7 de junio de 2023. Consultado el 19 de octubre de 2023 .
  111. 1 2 Strong, Colin (2015). Humanizando el big data: el marketing en el encuentro de los datos, las ciencias sociales y el conocimiento del consumidor . Londres: Kogan Page. ISBN 978-0-7494-7211-5.
  112. Berisha, Blend; Mëziu, Endrit; Shabani, Isak (2022). "Análisis de big data en computación en la nube: una visión general" . Journal of Cloud Computing . 11 (1): 24. doi : 10.1186/s13677-022-00301-w . PMC 9362456. PMID 35966392 .  
  113. Bosch, Volker (2016). "Big Data en la investigación de mercado: por qué más datos no significan automáticamente mejor información" . GFK Marketing Intelligence Review . 8 (2): 56– 63. doi : 10.1515/gfkmir-2016-0017 .
  114. McFarland, Daniel A.; McFarland, H Richard (2015). "Big Data y el peligro de ser precisamente inexacto" . Big Data & Society . 2 (2). doi : 10.1177/2053951715602495 .
  115. ^ Sivarajah, Uthayasankar; Kamal, Muhammad Mustafa; iraní, Zahir; Weerakkody, Vishanth (2017). "Análisis crítico de los desafíos del Big Data y métodos analíticos". Revista de investigación empresarial . 70 : 263– 286. doi : 10.1016/j.jbusres.2016.08.001 . hdl : 10454/11325 .
  116. 1 2 3 De Luca, Luigi M.; Herhausen, Dennis; Troilo, Gabriele; Rossi, Andrea (2021-07-01). "¿Cómo y cuándo dan frutos las inversiones en big data? El papel de las posibilidades de marketing y la innovación en el servicio". Journal of the Academy of Marketing Science . 49 (4): 790–810.
  117. Ghasemaghaei, Maryam; Calic, Goran (enero de 2020). "Evaluación del impacto de los macrodatos en el desempeño de la innovación empresarial: Los macrodatos no siempre son mejores datos". Journal of Business Research . 108 : 147–162 . doi : 10.1016/j.jbusres.2019.09.062 . ISSN 0148-2963 . 
  118. Grybauskas, Andrius; Pilinkienė, Vaida; Stundžienė, Alina (2021). "Análisis predictivo mediante Big Data para el mercado inmobiliario durante la pandemia de COVID-19" . Journal of Big Data . 8 (1): 105. doi : 10.1186/s40537-021-00476-0 . PMC 8329615. PMID 34367876 .  
  119. Josh Rogin (2 de agosto de 2018). "La limpieza étnica regresa en China" . No. Washington Post. Archivado del original el 31 de marzo de 2019. Recuperado el 4 de agosto de 2018. A esto se suma el estado de seguridad y vigilancia sin precedentes en Xinjiang, que incluye una vigilancia integral basada en tarjetas de identidad, puestos de control, reconocimiento facial y la recolección de ADN de millones de individuos. Las autoridades introducen todos estos datos en una máquina de inteligencia artificial que califica la lealtad de las personas al Partido Comunista para controlar cada aspecto de sus vidas. 
  120. "China: El análisis de macrodatos impulsa la represión en una región con población minoritaria: Un programa de vigilancia predictiva identifica a personas para investigaciones y detenciones" . hrw.org . Human Rights Watch. 26 de febrero de 2018. Archivado del original el 21 de diciembre de 2019. Consultado el 4 de agosto de 2018 .
  121. "Disciplina y castigo: El nacimiento del sistema de crédito social de China" . The Nation . 23 de enero de 2019. Archivado del original el 13 de septiembre de 2019. Consultado el 8 de agosto de 2019 .
  122. "El sistema de monitoreo de comportamiento de China prohíbe a algunos viajar y comprar propiedades" . CBS News . 24 de abril de 2018. Archivado del original el 13 de agosto de 2019. Consultado el 8 de agosto de 2019 .
  123. "La compleja verdad sobre el sistema de crédito social de China" . WIRED . 21 de enero de 2019. Archivado del original el 8 de agosto de 2019. Consultado el 8 de agosto de 2019 .
  124. "Noticias: Live Mint" . ¿Están las empresas indias aprovechando al máximo el Big Data? Live Mint. 23 de junio de 2014. Archivado del original el 29 de noviembre de 2014. Consultado el 22 de noviembre de 2014 .
  125. «Una startup israelí utiliza macrodatos y hardware mínimo para tratar la diabetes» . The Times of Israel . Archivado del original el 1 de marzo de 2018. Consultado el 28 de febrero de 2018 .
  126. Singh, Gurparkash; Schulthess, Duane; Hughes, Nigel; Vannieuwenhuyse, Bart; Kalra, Dipak (2018). "Datos masivos del mundo real para la investigación clínica y el desarrollo de fármacos" . Drug Discovery Today . 23 (3): 652– 660. doi : 10.1016/j.drudis.2017.12.002 . PMID 29294362 . 
  127. "Avances recientes de la computación en la nube móvil e Internet de las cosas para aplicaciones de macrodatos: una revisión" . Revista Internacional de Gestión de Redes. 11 de marzo de 2016. Archivado del original el 1 de junio de 2022. Consultado el 14 de septiembre de 2016 .
  128. Kalil, Tom (29 de marzo de 2012). "Big Data es un asunto importante" . whitehouse.gov . Archivado del original el 10 de enero de 2017. Recuperado el 26 de septiembre de 2012 a través de los Archivos Nacionales .
  129. Oficina Ejecutiva del Presidente (marzo de 2012). "Big Data en todo el Gobierno Federal" (PDF) . Oficina de Política Científica y Tecnológica . Archivado (PDF) del original el 21 de enero de 2017. Recuperado el 26 de septiembre de 2012 a través de los Archivos Nacionales .
  130. Lampitt, Andrew (14 de febrero de 2013). "La verdadera historia de cómo el análisis de macrodatos ayudó a Obama a ganar" . InfoWorld . Archivado del original el 5 de julio de 2014. Recuperado el 31 de mayo de 2014 .
  131. "Noviembre 2023 | TOP500" . Archivado del original el 7 de abril de 2024. Consultado el 20 de abril de 2024 .
  132. Hoover, J. Nicholas. "Las 10 supercomputadoras más potentes del gobierno" . Information Week . UBM. Archivado del original el 16 de octubre de 2013. Recuperado el 26 de septiembre de 2012 .
  133. Bamford, James (15 de marzo de 2012). "La NSA está construyendo el centro de espionaje más grande del país (cuidado con lo que dices)" . Wired . Archivado del original el 4 de abril de 2012. Recuperado el 18 de marzo de 2013 .
  134. "Ceremonia de colocación de la primera piedra del centro de datos de Utah de 1200 millones de dólares" . Servicio Central de Seguridad de la Agencia de Seguridad Nacional. Archivado del original el 5 de septiembre de 2013. Consultado el 18 de marzo de 2013 .
  135. Hill, Kashmir. «Los planos del ridículamente caro centro de datos de la NSA en Utah sugieren que contiene menos información de la que se pensaba» . Forbes . Archivado del original el 29 de marzo de 2018. Consultado el 31 de octubre de 2013 .
  136. Smith, Gerry; Hallman, Ben (12 de junio de 2013). "La controversia sobre el espionaje de la NSA pone de relieve la adopción del Big Data" . Huffington Post . Archivado del original el 19 de julio de 2017. Recuperado el 7 de mayo de 2018 .
  137. Wingfield, Nick (12 de marzo de 2013). "Predicción más precisa de los desplazamientos diarios para posibles compradores de vivienda" . The New York Times . Archivado del original el 29 de mayo de 2013. Consultado el 21 de julio de 2013 .
  138. "FICO® Falcon® Fraud Manager" . Fico.com. Archivado del original el 11 de noviembre de 2012. Consultado el 21 de julio de 2013 .
  139. Brynjolfsson, Erik; Hu, Yu Jeffrey; Rahman, Mohammad S. (21 de mayo de 2013). "Competir en la era del comercio minorista omnicanal" . MIT Sloan Management Review .
  140. Alexandru, Dan. "Prof" (PDF) . cds.cern.ch. CERN. Archivado (PDF) del original el 15 de julio de 2017. Recuperado el 24 de marzo de 2015 .
  141. "Folleto del LHC, versión en inglés. Una presentación del acelerador de partículas más grande y potente del mundo, el Gran Colisionador de Hadrones (LHC), que comenzó a funcionar en 2008. Su función, características, tecnologías, etc., se explican para el público general" . CERN-Brochure-2010-006-Eng. Folleto del LHC, versión en inglés . CERN. Archivado del original el 19 de marzo de 2019. Recuperado el 20 de enero de 2013 .
  142. "Guía del LHC, versión en inglés. Una recopilación de datos y cifras sobre el Gran Colisionador de Hadrones (LHC) en forma de preguntas y respuestas" . CERN-Brochure-2008-001-Eng. Guía del LHC, versión en inglés . CERN. Archivado del original el 7 de abril de 2020. Consultado el 20 de enero de 2013 .
  143. Brumfiel, Geoff (19 de enero de 2011). "Física de alta energía: Por la autopista del petabyte" . Nature . 469 ( 7330): 282– 83. Bibcode : 2011Natur.469..282B . doi : 10.1038/469282a . PMID 21248814. S2CID 533166 .  
  144. "IBM Research – Zurich" (PDF) . Zurich.ibm.com . Archivado del original el 1 de junio de 2022. Consultado el 8 de octubre de 2017 .
  145. "Un futuro conjunto de telescopios impulsa el desarrollo del procesamiento de exabytes" . Ars Technica . 2 de abril de 2012. Archivado del original el 31 de marzo de 2019. Consultado el 15 de abril de 2015 .
  146. "La candidatura de Australia para el Square Kilometre Array: una perspectiva desde dentro" . The Conversation . 1 de febrero de 2012. Archivado del original el 12 de octubre de 2016. Consultado el 27 de septiembre de 2016 .
  147. "Delort P., OECD ICCP Technology Proesight Forum, 2012" (PDF) . Oecd.org . Archivado (PDF) del original el 19 de junio de 2017. Consultado el 8 de octubre de 2017 .
  148. "NASA – El Centro Goddard de la NASA presenta el Centro de Simulación Climática de la NASA" . Nasa.gov . Archivado del original el 3 de abril de 2016. Consultado el 13 de abril de 2016 .
  149. Webster, Phil. "Supercomputación del clima: la misión de macrodatos de la NASA" . CSC World . Computer Sciences Corporation. Archivado del original el 4 de enero de 2013. Recuperado el 18 de enero de 2013 .
  150. "Estas seis grandes ideas de la neurociencia podrían dar el salto del laboratorio al mercado" . The Globe and Mail . 20 de noviembre de 2014. Archivado del original el 11 de octubre de 2016. Consultado el 1 de octubre de 2016 .
  151. "DNAstack aborda conjuntos de datos de ADN masivos y complejos con Google Genomics" . Google Cloud Platform. Archivado del original el 24 de septiembre de 2016. Consultado el 1 de octubre de 2016 .
  152. "23andMe – Ancestros" . 23andme.com . Archivado del original el 18 de diciembre de 2016. Consultado el 29 de diciembre de 2016 .
  153. 1 2 Potenza, Alessandra (13 de julio de 2016). "23andMe quiere que los investigadores utilicen sus kits, en un intento por ampliar su colección de datos genéticos" . The Verge . Archivado del original el 29 de diciembre de 2016. Recuperado el 29 de diciembre de 2016 .
  154. "Esta startup secuenciará tu ADN para que puedas contribuir a la investigación médica" . Fast Company . 23 de diciembre de 2016. Archivado del original el 29 de diciembre de 2016. Consultado el 29 de diciembre de 2016 .
  155. Seife, Charles. "23andMe es aterrador, pero no por las razones que cree la FDA" . Scientific American . Archivado del original el 29 de diciembre de 2016. Consultado el 29 de diciembre de 2016 .
  156. Zaleski, Andrew (22 de junio de 2016). "Esta empresa emergente de biotecnología apuesta a que tus genes darán como resultado el próximo fármaco milagroso" . CNBC. Archivado del original el 29 de diciembre de 2016. Recuperado el 29 de diciembre de 2016 .
  157. Regalado, Antonio. "Cómo 23andMe convirtió tu ADN en una máquina de descubrimiento de fármacos de mil millones de dólares" . MIT Technology Review . Archivado del original el 29 de diciembre de 2016. Recuperado el 29 de diciembre de 2016 .
  158. "23andMe registra un aumento en las solicitudes de datos tras el estudio de Pfizer sobre la depresión | FierceBiotech" . fiercebiotech.com . 22 de agosto de 2016. Archivado del original el 29 de diciembre de 2016. Consultado el 29 de diciembre de 2016 .
  159. Admire Moyo (23 de octubre de 2015). "Científicos de datos predicen la derrota de los Springboks" . itweb.co.za . Archivado del original el 22 de diciembre de 2015. Consultado el 12 de diciembre de 2015 .
  160. Bai, Zhongbo; Bai, Xiaomei (2021). "Big Data deportivo: gestión, análisis, aplicaciones y desafíos" . Complexity . 2021 : 1–11 . doi : 10.1155/2021/6676297 .
  161. Regina Pazvakavambwa (17 de noviembre de 2015). "Análisis predictivo y macrodatos transforman el deporte" . itweb.co.za . Archivado del original el 22 de diciembre de 2015. Consultado el 12 de diciembre de 2015 .
  162. Dave Ryan (13 de noviembre de 2015). "Deportes: donde el Big Data finalmente cobra sentido" . huffingtonpost.com . Archivado del original el 22 de diciembre de 2015. Consultado el 12 de diciembre de 2015 .
  163. Frank Bi. "Cómo los equipos de Fórmula Uno están utilizando el Big Data para obtener una ventaja competitiva" . Forbes . Archivado del original el 20 de diciembre de 2015. Consultado el 12 de diciembre de 2015 .
  164. Tay, Liz. "Dentro del almacén de datos de 90 PB de eBay" . ITNews. Archivado del original el 15 de febrero de 2016. Consultado el 12 de febrero de 2016 .
  165. Layton, Julia (25 de enero de 2006). "Tecnología de Amazon" . Money.howstuffworks.com. Archivado del original el 28 de febrero de 2013. Recuperado el 5 de marzo de 2013 .
  166. "Ampliando Facebook a 500 millones de usuarios y más allá" . Facebook.com. Archivado del original el 5 de julio de 2013. Consultado el 21 de julio de 2013 .
  167. Constine, Josh (27 de junio de 2017). "Facebook ahora tiene 2 mil millones de usuarios mensuales... y responsabilidad" . TechCrunch . Archivado del original el 27 de diciembre de 2020. Recuperado el 3 de septiembre de 2018 .
  168. "Google sigue realizando al menos 1 billón de búsquedas al año" . Search Engine Land . 16 de enero de 2015. Archivado del original el 15 de abril de 2015. Consultado el 15 de abril de 2015 .
  169. ^ Haleem, Abid; Javaid, Mohd; Khan, Ibrahim; Vaishya, Raju (2020). "Aplicaciones importantes de Big Data en la pandemia de COVID-19" . Revista India de Ortopedia . 54 (4): 526– 528. doi : 10.1007/s43465-020-00129-z . PMC 7204193 . PMID 32382166 .  
  170. Manancourt, Vincent (10 de marzo de 2020). "El coronavirus pone a prueba la determinación de Europa en materia de privacidad" . Politico . Archivado del original el 20 de marzo de 2020. Consultado el 30 de octubre de 2020 .
  171. Choudhury, Amit Roy (27 de marzo de 2020). "El gobierno en tiempos de coronavirus" . Gov Insider . Archivado del original el 20 de marzo de 2020. Consultado el 30 de octubre de 2020 .
  172. Cellan-Jones, Rory (11 de febrero de 2020). "China lanza una aplicación para detectar contactos cercanos de coronavirus" . BBC . Archivado del original el 28 de febrero de 2020. Consultado el 30 de octubre de 2020 .
  173. Siwach, Gautam; Esmailpour, Amir (marzo de 2014). Búsqueda cifrada y formación de clústeres en macrodatos (PDF) . Conferencia ASEE 2014 Zona I. Universidad de Bridgeport , Bridgeport , Connecticut, EE. UU. Archivado del original (PDF) el 9 de agosto de 2014. Recuperado el 26 de julio de 2014 .
  174. "La administración Obama presenta la iniciativa de "macrodatos": anuncia 200 millones de dólares en nuevas inversiones en I+D" (PDF) . Oficina de Política Científica y Tecnológica . Archivado (PDF) del original el 21 de enero de 2017 , a través de los Archivos Nacionales .
  175. "AMPLab en la Universidad de California, Berkeley" . Amplab.cs.berkeley.edu. Archivado del original el 6 de mayo de 2011. Consultado el 5 de marzo de 2013 .
  176. "La NSF lidera los esfuerzos federales en macrodatos" . Fundación Nacional de Ciencias (NSF). 29 de marzo de 2012. Archivado del original el 31 de marzo de 2019. Consultado el 6 de abril de 2018 .
  177. Timothy Hunter; Teodor Moldovan; Matei Zaharia; Justin Ma; Michael Franklin; Pieter Abbeel ; Alexandre Bayen (octubre de 2011). Escalando el Mobile Millennium System en la nube . Archivado del original el 31 de marzo de 2019. Recuperado el 2 de noviembre de 2012 .
  178. David Patterson (5 de diciembre de 2011). "Los científicos informáticos podrían tener lo necesario para ayudar a curar el cáncer" . The New York Times . Archivado del original el 30 de enero de 2017. Consultado el 26 de febrero de 2017 .
  179. "El secretario Chu anuncia un nuevo instituto para ayudar a los científicos a mejorar la investigación con conjuntos de datos masivos en las supercomputadoras del Departamento de Energía" . energy.gov. Archivado del original el 3 de abril de 2019. Consultado el 2 de noviembre de 2012 .
  180. Young, Shannon (30 de mayo de 2012). "El gobernador de Massachusetts y el MIT anuncian una iniciativa de macrodatos" . Boston.com . Archivado del original el 29 de julio de 2021. Consultado el 29 de julio de 2021 .
  181. "Big Data @ CSAIL" . Bigdata.csail.mit.edu. 22 de febrero de 2013. Archivado del original el 30 de marzo de 2013. Consultado el 5 de marzo de 2013 .
  182. "Foro público-privado de Big Data" . cordis.europa.eu. 1 de septiembre de 2012. Archivado del original el 9 de marzo de 2021. Consultado el 16 de marzo de 2020 .
  183. «Se creará el Instituto Alan Turing para investigar el big data» . BBC News . 19 de marzo de 2014. Archivado del original el 18 de agosto de 2021. Consultado el 19 de marzo de 2014 .
  184. "Día de inspiración en la Universidad de Waterloo, Campus Stratford" . betakit.com/. Archivado del original el 26 de febrero de 2014. Consultado el 28 de febrero de 2014 .
  185. 1 2 3 Reips, Ulf-Dietrich; Matzat, Uwe (2014). "Extracción de "Big Data" mediante servicios de Big Data" . Revista Internacional de Ciencia de Internet . 1 (1): 1– 8. Archivado del original el 14 de agosto de 2014. Recuperado el 14 de agosto de 2014 .
  186. Preis T, Moat HS, Stanley HE, Bishop SR (2012). " Cuantificando la ventaja de mirar hacia adelante" . Scientific Reports . 2 350. Bibcode : 2012NatSR...2..350P . doi : 10.1038/srep00350 . PMC 3320057. PMID 22482034 .  
  187. Marks, Paul (5 de abril de 2012). "Las búsquedas en línea sobre el futuro están vinculadas al éxito económico" . New Scientist . Archivado del original el 8 de abril de 2012. Recuperado el 9 de abril de 2012 .
  188. Johnston, Casey (6 de abril de 2012). "Google Trends revela pistas sobre la mentalidad de las naciones más ricas" . Ars Technica . Archivado del original el 7 de abril de 2012. Recuperado el 9 de abril de 2012 .
  189. Tobias Preis (24 de mayo de 2012). "Información complementaria: El Índice de Orientación al Futuro está disponible para su descarga" (PDF) . Archivado (PDF) del original el 17 de enero de 2013. Recuperado el 24 de mayo de 2012 .
  190. Philip Ball (26 de abril de 2013). " El conteo de búsquedas en Google predice los movimientos del mercado" . Nature . doi : 10.1038/nature.2013.12879 . S2CID 167357427. Archivado del original el 27 de septiembre de 2013. Consultado el 9 de agosto de 2013 . 
  191. Preis T, Moat HS, Stanley HE (2013). " Cuantificación del comportamiento comercial en los mercados financieros mediante Google Trends" . Scientific Reports . 3 1684. Bibcode : 2013NatSR...3.1684P . doi : 10.1038/srep01684 . PMC 3635219. PMID 23619126 .  
  192. Nick Bilton (26 de abril de 2013). "Un estudio revela que los términos de búsqueda de Google pueden predecir el mercado de valores" . The New York Times . Archivado del original el 2 de junio de 2013. Consultado el 9 de agosto de 2013 .
  193. Christopher Matthews (26 de abril de 2013). "¿Problemas con tu cartera de inversiones? ¡Búscalo en Google!" . Time . Archivado del original el 21 de agosto de 2013. Consultado el 9 de agosto de 2013 .
  194. Philip Ball (26 de abril de 2013). " El conteo de búsquedas en Google predice los movimientos del mercado" . Nature . doi : 10.1038/nature.2013.12879 . S2CID 167357427. Archivado del original el 27 de septiembre de 2013. Consultado el 9 de agosto de 2013 . 
  195. Bernhard Warner (25 de abril de 2013) .Investigadores de "Big Data" recurren a Google para superar a los mercados . Bloomberg Businessweek . Archivado del original el 23 de julio de 2013. Consultado el 9 de agosto de 2013 .
  196. Hamish McRae (28 de abril de 2013). «Hamish McRae: ¿Necesitas una buena idea del sentimiento de los inversores? Búscalo en Google» . The Independent . Londres. Archivado del original el 25 de julio de 2018. Consultado el 9 de agosto de 2013 .
  197. Richard Waters (25 de abril de 2013). "La búsqueda en Google demuestra ser una nueva palabra en la predicción del mercado de valores" . Financial Times . Archivado del original el 1 de junio de 2022. Consultado el 9 de agosto de 2013 .
  198. Jason Palmer (25 de abril de 2013). "Las búsquedas en Google predicen los movimientos del mercado" . BBC . Archivado del original el 5 de junio de 2013. Consultado el 9 de agosto de 2013 .
  199. E. Sejdić (marzo de 2014). "Adaptar las herramientas actuales para su uso con big data". Nature . 507 (7492): 306.
  200. Chris Kimble; Giannis Milolidakis (7 de octubre de 2015). "Big Data e inteligencia empresarial: desmintiendo los mitos". Excelencia empresarial y organizacional global . 35 (1): 23– 34. arXiv : 1511.03085 . doi : 10.1002/JOE.21642 . ISSN 1932-2054 . Wikidata Q56532925 .  
  201. Chris Anderson (23 de junio de 2008). "El fin de la teoría: el aluvión de datos vuelve obsoleto el método científico" . Wired . Archivado del original el 27 de marzo de 2014. Consultado el 5 de marzo de 2017 .
  202. Graham M. (9 de marzo de 2012). "¿Big data y el fin de la teoría?" . The Guardian . Londres. Archivado del original el 24 de julio de 2013. Recuperado el 14 de diciembre de 2016 .
  203. Shah, Shvetank; Horne, Andrew; Capellá, Jaime (abril de 2012). "Los buenos datos no garantizan buenas decisiones" . Harvard Business Review . Archivado del original el 11 de septiembre de 2012. Consultado el 8 de septiembre de 2012 .
  204. 1 2 Los macrodatos requieren grandes visiones para grandes cambios. Archivado el 2 de diciembre de 2016 en Wayback Machine , Hilbert, M. (2014). Londres: TEDx UCL, x=charlas TED organizadas de forma independiente
  205. Alemany Oliver, Mathieu; Vayre, Jean-Sebastien (2015). "Big Data y el futuro de la producción de conocimiento en la investigación de marketing: ética, huellas digitales y razonamiento abductivo". Journal of Marketing Analytics . 3 (1): 5– 13. doi : 10.1057/jma.2015.1 . S2CID 111360835 . 
  206. Jonathan Rauch (1 de abril de 2002). "Seeing Around Corners" . The Atlantic . Archivado del original el 4 de abril de 2017. Recuperado el 5 de marzo de 2017 .
  207. Epstein, JM, & Axtell, RL (1996). Growing Artificial Societies: Social Science from the Bottom Up. A Bradford Book.
  208. "Delort P., Big data in Biosciences, Big Data Paris, 2012" (PDF) . Bigdata Paris . Archivado del original (PDF) el 30 de julio de 2016. Consultado el 8 de octubre de 2017 .
  209. "Genómica de próxima generación: un enfoque integrador" (PDF) . Nature. Julio de 2010. Archivado (PDF) del original el 13 de agosto de 2017. Consultado el 18 de octubre de 2016 .
  210. "Big Data en Biociencias" . Octubre de 2015. Archivado del original el 1 de junio de 2022. Consultado el 18 de octubre de 2016 .
  211. «Big data: ¿estamos cometiendo un gran error?» . Financial Times . 28 de marzo de 2014. Archivado del original el 30 de junio de 2016. Consultado el 20 de octubre de 2016 .
  212. Ohm, Paul (23 de agosto de 2012). "No construyas una base de datos de ruina" . Harvard Business Review . Archivado del original el 30 de agosto de 2012. Recuperado el 29 de agosto de 2012 .
  213. Bond-Graham, Darwin (2018). "La perspectiva sobre los macrodatos" Archivado el 9 de noviembre de 2020 en Wayback Machine . La perspectiva .
  214. Barocas, Solon; Nissenbaum, Helen (junio de 2014). Lane, Julia; Stodden, Victoria; Bender, Stefan; Nissenbaum, Helen (eds.). Big Data's End Run around Anonymity and Consent . Cambridge University Press. págs. 44–75 . doi : 10.1017/cbo9781107590205.004 . ISBN  978-1-107-06735-6. S2CID 152939392 . 
  215. Lugmayr, A.; Stockleben, B; Scheib, C.; Mailaparampil, M.; Mesia, N.; Ranta, H.; Lab, E. (1 de junio de 2016). "Un estudio exhaustivo sobre la investigación en macrodatos y sus implicaciones: ¿qué es realmente 'nuevo' en macrodatos? ¡Son macrodatos cognitivos!" . Archivado del original el 1 de junio de 2022. Recuperado el 27 de noviembre de 2023 .
  216. Danah Boyd (29 de abril de 2010). " Privacidad y publicidad en el contexto del Big Data" . Conferencia WWW 2010. Archivado del original el 22 de octubre de 2018. Recuperado el 18 de abril de 2011 .
  217. Katyal, Sonia K. (2019). «Inteligencia artificial, publicidad y desinformación» . Advertising & Society Quarterly . 20 (4). doi : 10.1353/asr.2019.0026 . ISSN 2475-1790 . S2CID 213397212. Archivado del original el 28 de octubre de 2020. Recuperado el 18 de noviembre de 2020 .  
  218. Jones, MB; Schildhauer, MP; Reichman, OJ; Bowers, S (2006). "La nueva bioinformática: integración de datos ecológicos desde el gen hasta la biosfera" (PDF) . Annual Review of Ecology, Evolution, and Systematics . 37 (1): 519– 544. doi : 10.1146/annurev.ecolsys.37.091305.110031 . Archivado (PDF) del original el 8 de julio de 2019. Recuperado el 19 de septiembre de 2012 .
  219. 1 2 Boyd, D.; Crawford, K. (2012). "Preguntas críticas para el Big Data". Information, Communication & Society . 15 (5): 662– 679. doi : 10.1080/1369118X.2012.678878 . hdl : 10983/1320 . S2CID 51843165 . 
  220. Fracaso en el lanzamiento: De los macrodatos a las grandes decisiones. Archivado el 6 de diciembre de 2016 en Wayback Machine , Forte Wares.
  221. "15 cosas increíbles que se correlacionan entre sí" . Archivado del original el 27 de junio de 2019. Consultado el 27 de junio de 2019 .
  222. "Estructuras y algoritmos aleatorios" . doi : 10.1002/(ISSN)1098-2418 . Archivado del original el 27 de junio de 2019. Consultado el 27 de junio de 2019 .
  223. Cristian S. Calude, Giuseppe Longo, (2016), El diluvio de correlaciones espurias en macrodatos, Foundations of Science
  224. Anja Lambrecht y Catherine Tucker (2016) «Los 4 errores que cometen la mayoría de los gerentes con el análisis de datos», Harvard Business Review , 12 de julio. https://hbr.org/2016/07/the-4-mistakes-most-managers-make-with-analytics Archivado el 26 de enero de 2022 en Wayback Machine
  225. 1 2 Gregory Piatetsky (12 de agosto de 2014). "Entrevista: Michael Berthold, fundador de KNIME, sobre investigación, creatividad, macrodatos y privacidad, parte 2" . KDnuggets. Archivado del original el 13 de agosto de 2014. Recuperado el 13 de agosto de 2014 .
  226. Pelt, Mason (26 de octubre de 2015) ."Big Data" es una palabra de moda sobreutilizada y este bot de Twitter lo demuestra . Siliconangle . Archivado del original el 30 de octubre de 2015. Consultado el 4 de noviembre de 2015 .
  227. 1 2 Harford, Tim (28 de marzo de 2014). "Big data: ¿estamos cometiendo un gran error?" . Financial Times . Archivado del original el 7 de abril de 2014 . Recuperado el 7 de abril de 2014 .
  228. Ioannidis JP (agosto de 2005). "Por qué la mayoría de los hallazgos de investigación publicados son falsos" . PLOS Medicine . 2 (8) e124. doi : 10.1371/journal.pmed.0020124 . PMC 1182327. PMID 16060722 .  
  229. Lohr, Steve; Singer, Natasha (10 de noviembre de 2016). "Cómo los datos nos fallaron al predecir el resultado de una elección" . The New York Times . ISSN 0362-4331 . Archivado del original el 25 de noviembre de 2016. Consultado el 27 de noviembre de 2016 . 
  230. «Cómo la vigilancia policial basada en datos amenaza la libertad humana» . The Economist . 4 de junio de 2018. ISSN 0013-0613 . Archivado del original el 27 de octubre de 2019. Consultado el 27 de octubre de 2019 . 
  231. Brayne, Sarah (29 de agosto de 2017). " Vigilancia de macrodatos: el caso de la vigilancia policial" . American Sociological Review . 82 (5): 977– 1008. doi : 10.1177/0003122417725865 . PMC 10846878. PMID 38322733. S2CID 3609838 .   

Bibliografía

  • Hilbert, M (2016), "Big Data para el desarrollo: una revisión de promesas y desafíos", Development Policy Review , 34 (1): 135–74 , doi : 10.1111/dpr.12142Acceso gratuito , archivado el 21 de abril de 2021 en Wayback Machine.
  • Snijders, C.; Matzat, U.; Reips, U.-D. (2012). "«Big Data»: Grandes lagunas de conocimiento en el campo de Internet . Revista Internacional de Ciencia de Internet . 7 : 1–5 . Archivado del original el 23 de noviembre de 2019. Recuperado el 13 de abril de 2013 .
  • Yanase, J; Triantaphyllou, E (2019). "Un estudio sistemático del diagnóstico asistido por computadora en medicina: desarrollos pasados ​​y presentes". Expert Systems with Applications . 138 112821. doi : 10.1016/j.eswa.2019.112821 . S2CID 199019309 . 

Lecturas adicionales

  • Peter Kinnaird; Inbal Talgam-Cohen, eds. (2012). "Big Data" . XRDS: Crossroads, The ACM Magazine for Students . Vol.  19, n.º  1. Association for Computing Machinery . ISSN 1528-4980 . OCLC 779657714 .  
  • Leskovec, Jure ; Rajaraman, Anand ; Ullman, Jeffrey D. (2014). Minería de conjuntos de datos masivos . Cambridge University Press. ISBN 978-1-10707723-2OCLC 888463433 .​ 
  • Mayer-Schönberger, Viktor ; Cukier, Kenneth (2013). Big Data: Una revolución que transformará nuestra forma de vivir, trabajar y pensar . Houghton Mifflin Harcourt. ISBN 978-1-29990302-9OCLC 828620988 
  • Press, Gil (9 de mayo de 2013). "Una historia muy breve de los macrodatos" . forbes.com . Jersey City, NJ . Consultado el 17 de septiembre de 2016 .
  • Stephens-Davidowitz, Seth (2017). Everybody Lies: Big Data, New Data, and What the Internet Can Tell Us About Who We Really Are . Dey Street Books. ISBN 978-0-06239085-1.
  • "Big Data: La revolución de la gestión" . Harvard Business Review . Octubre de 2012.
  • O'Neil, Cathy (2017). Armas de destrucción matemática: Cómo el Big Data aumenta la desigualdad y amenaza la democracia . Broadway Books. ISBN 978-0-55341883-5.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con macrodatos en Wikimedia Commons
  • Logotipo de WikcionarioDefinición de big data en Wikcionario