Articulo de referencia

Manipulación de datos

La preparación de datos , también conocida como procesamiento de datos , consiste en transformar y convertir datos de un formato " bruto " a otro con el fin de hacerlos más adec...

La preparación de datos , también conocida como procesamiento de datos , consiste en transformar y convertir datos de un formato " bruto " a otro con el fin de hacerlos más adecuados y valiosos para diversos fines posteriores, como el análisis de datos. El objetivo de la preparación de datos es garantizar la calidad y la utilidad de los mismos. Los analistas de datos suelen dedicar la mayor parte de su tiempo a esta tarea, en comparación con el análisis propiamente dicho.

El proceso de preparación de datos puede incluir procesamiento adicional , visualización de datos , agregación de datos, entrenamiento de un modelo estadístico , así como muchos otros usos potenciales. La preparación de datos generalmente sigue una serie de pasos generales que comienzan con la extracción de los datos en formato sin procesar de la fuente de datos, el procesamiento de los datos sin procesar (por ejemplo, ordenación) o el análisis de los datos en estructuras de datos predefinidas, y finalmente el depósito del contenido resultante en un sumidero de datos para su almacenamiento y uso futuro. [ 1 ] Está estrechamente relacionado con el proceso ETL .

Fondo

Se suele decir que el término no técnico «wrangler» deriva del trabajo realizado por el Programa Nacional de Infraestructura y Preservación de Información Digital (NDIIPP) de la Biblioteca del Congreso de los Estados Unidos y su socio, la MetaArchive Partnership, con sede en las Bibliotecas de la Universidad de Emory . El término «mung» tiene sus raíces en «munging» , como se describe en el Jargon File . [ 2 ] También se sugirió el término «data wrangler» como la mejor analogía para describir a alguien que trabaja con datos. [ 3 ]

Una de las primeras menciones de la manipulación de datos en un contexto científico fue realizada por Donald Cline durante el Experimento de Procesos en Tierras Frías de la NASA/NOAA. [ 4 ] Cline afirmó que los manipuladores de datos "coordinan la adquisición de toda la colección de datos del experimento". Cline también especifica las tareas que normalmente realiza un administrador de almacenamiento para trabajar con grandes cantidades de datos . Esto puede ocurrir en áreas como grandes proyectos de investigación y la realización de películas con una gran cantidad de imágenes complejas generadas por computadora . En la investigación, esto implica tanto la transferencia de datos desde el instrumento de investigación a la red de almacenamiento o instalación de almacenamiento como la manipulación de datos para su reanálisis mediante instrumentos de computación de alto rendimiento o acceso a través de bibliotecas digitales basadas en ciberinfraestructura .

Con la llegada de la inteligencia artificial a la ciencia de datos, se ha vuelto cada vez más importante que la automatización del procesamiento de datos cuente con controles y equilibrios muy estrictos, razón por la cual el proceso de limpieza de datos no se ha automatizado mediante aprendizaje automático . La limpieza de datos requiere más que una simple solución automatizada; requiere conocimiento sobre qué información debe eliminarse, y la inteligencia artificial aún no está preparada para comprender tales aspectos. [ 5 ]

Conexión con la minería de datos

La preparación de datos es un superconjunto de la minería de datos y requiere procesos que algunos métodos de minería utilizan, pero no siempre. El proceso de minería de datos consiste en encontrar patrones dentro de grandes conjuntos de datos, mientras que la preparación de datos transforma los datos para obtener información valiosa sobre ellos. Si bien la preparación de datos es un superconjunto de la minería de datos, esto no significa que esta última no la utilice; existen numerosos casos de uso para la preparación de datos en la minería de datos. La preparación de datos puede beneficiar a la minería de datos al eliminar datos que no aportan valor al conjunto general o que no están formateados correctamente, lo que se traduce en mejores resultados para el proceso general de minería de datos.

Un ejemplo de minería de datos estrechamente relacionado con la manipulación de datos es ignorar los datos de un conjunto que no están conectados con el objetivo: supongamos que hay un conjunto de datos relacionado con el estado de Texas y el objetivo es obtener estadísticas sobre los residentes de Houston; los datos del conjunto relacionados con los residentes de Dallas no son útiles para el conjunto general y se pueden eliminar antes del procesamiento para mejorar la eficiencia del proceso de minería de datos.

Beneficios

Un procesamiento de datos bien diseñado puede ofrecer los siguientes beneficios en los flujos de trabajo analíticos:

  • Preparación para el análisis y mejora de la calidad de los datos. Al transformar los conjuntos de datos en estructuras consistentes y "ordenadas", el procesamiento reduce la manipulación ad hoc y facilita el modelado y la visualización de los datos. [ 6 ]
  • Reproducibilidad y auditabilidad. La captura de transformaciones como scripts o cuadernos crea un registro explícito de cómo se produjeron los resultados; los sistemas interactivos como Wrangler generan historiales editables y scripts de transformación auditables, lo que reduce la edición manual y puntual. [ 7 ] [ 8 ]
  • Eficiencia y reutilización. Las herramientas de iniciativa mixta pueden inferir transformaciones candidatas y admitir la reutilización de scripts de transformación guardados cuando se actualizan los datos, lo que mejora la productividad. [ 7 ]
  • Integración y enriquecimiento. Las herramientas de procesamiento de datos ayudan a fusionar fuentes heterogéneas y enriquecer registros mediante la conciliación o servicios web. Por ejemplo, OpenRefine admite la agrupación, la transformación y la conciliación con fuentes externas. [ 9 ]

Nota: Los beneficios dependen de documentar los pasos y utilizar flujos de trabajo con control de versiones; de lo contrario, la gestión puede ser laboriosa y propensa a errores. [ 8 ]

Ideas principales

Convertir datos desordenados en estadísticas útiles

Los pasos principales en el procesamiento de datos son los siguientes:

  1. Descubrimiento de datos

    Este término general describe cómo comprender tus datos. Este es el primer paso para familiarizarte con ellos.

  2. Estructuración
    El siguiente paso consiste en organizar los datos. Los datos brutos suelen estar desorganizados y gran parte de ellos puede no ser útil para el producto final. Este paso es importante para facilitar los cálculos y el análisis en las etapas posteriores.
  3. Limpieza
    Existen diversas formas de limpiar datos. Por ejemplo, una consiste en detectar fechas con formatos incorrectos, eliminar valores atípicos que distorsionan los resultados y formatear los valores nulos . Este paso es fundamental para garantizar la calidad general de los datos.
  4. Enriquecedor
    En este paso, determine si los datos adicionales que se podrían agregar fácilmente beneficiarían al conjunto de datos.
  5. Validación
    Este paso es similar a la estructuración y limpieza. Utilice secuencias repetitivas de reglas de validación para garantizar la coherencia , la calidad y la seguridad de los datos. Un ejemplo de regla de validación es confirmar la exactitud de los campos mediante la verificación cruzada de los datos.
  6. Publicación
    Prepare el conjunto de datos para su uso posterior, que podría incluir su uso por parte de usuarios o software. Asegúrese de documentar todos los pasos y la lógica empleada durante el procesamiento.

Estos pasos constituyen un proceso iterativo que debería generar un conjunto de datos limpio y utilizable, listo para su análisis. Este proceso es laborioso pero gratificante, ya que permite a los analistas extraer la información necesaria de un gran conjunto de datos que, de otro modo, resultaría ilegible.

El resultado de aplicar el proceso de limpieza de datos a este pequeño conjunto de datos muestra un conjunto de datos mucho más fácil de leer. Todos los nombres ahora tienen el mismo formato, {nombre apellido}, los números de teléfono también tienen el mismo formato {código de área-XXX-XXXX}, las fechas tienen formato numérico {AAAA-mm-dd} y los estados ya no se abrevian. La entrada de Jacob Alan no contenía datos completos (faltaba el código de área en el número de teléfono y la fecha de nacimiento no tenía año), por lo que se descartó del conjunto de datos. Ahora que el conjunto de datos resultante está limpio y legible, está listo para ser implementado o evaluado.

Uso típico

Las transformaciones de datos se aplican normalmente a entidades distintas (por ejemplo, campos, filas, columnas, valores de datos, etc.) dentro de un conjunto de datos, y pueden incluir acciones como extracciones, análisis sintáctico, unión, estandarización, aumento, limpieza, consolidación y filtrado para crear los resultados de procesamiento deseados que se pueden aprovechar posteriormente.

Los destinatarios podrían ser personas, como arquitectos de datos o científicos de datos que investigarán los datos con mayor profundidad, usuarios empresariales que consumirán los datos directamente en informes, o sistemas que procesarán los datos y los escribirán en destinos como almacenes de datos , lagos de datos o aplicaciones posteriores.

Modus operandi

Según la cantidad y el formato de los datos entrantes, el procesamiento de datos se ha realizado tradicionalmente de forma manual (por ejemplo, mediante hojas de cálculo como Excel), herramientas como KNIME o mediante scripts en lenguajes como Python o SQL . R , un lenguaje frecuentemente utilizado en minería de datos y análisis estadístico de datos, también se utiliza a veces para el procesamiento de datos. [ 10 ] Los procesadores de datos suelen tener conocimientos de R o Python, SQL, PHP, Scala y otros lenguajes utilizados habitualmente para el análisis de datos.

Los sistemas de manipulación visual de datos se desarrollaron para hacer que la manipulación de datos fuera accesible para personas sin conocimientos de programación y más sencilla para los programadores. Algunos de estos sistemas también incluyen recomendadores de IA integrados y herramientas de programación por ejemplo para brindar asistencia al usuario, así como técnicas de síntesis de programas para autogenerar código de flujo de datos escalable. Los primeros prototipos de herramientas de manipulación visual de datos incluyen OpenRefine y el sistema de investigación Stanford/Berkeley Wrangler ; [ 11 ] este último evolucionó hasta convertirse en Trifacta .

Otros términos para estos procesos han incluido franquicia de datos, [ 12 ] preparación de datos y manipulación de datos.

Ejemplo

Dado un conjunto de datos con información sobre pacientes, su objetivo es encontrar una correlación con una enfermedad. Antes de comenzar a analizar los datos, asegúrese de comprender el resultado: ¿busca pacientes que padezcan la enfermedad? ¿Existen otras enfermedades que puedan ser la causa? Una vez comprendido el resultado, puede comenzar el proceso de preparación de los datos.

Comience por determinar la estructura del resultado, qué es importante para comprender el diagnóstico de la enfermedad.

Una vez determinada la estructura final, limpie los datos eliminando cualquier dato que no sea útil o que esté mal formado; esto podría incluir pacientes a los que no se les haya diagnosticado ninguna enfermedad.

Tras la limpieza de los datos, analícelos de nuevo. ¿Hay algo que se pueda añadir al conjunto de datos ya conocido que lo beneficie? Por ejemplo, las enfermedades más comunes en la zona: Estados Unidos e India son muy diferentes en cuanto a las enfermedades más comunes.

Ahora llega la etapa de validación: determinar las reglas de validación para comprobar qué datos deben ser válidos. Esto podría incluir la fecha de nacimiento o la detección de enfermedades específicas.

Tras la validación, los datos deben organizarse y prepararse para su implementación o evaluación. Este proceso resulta beneficioso para determinar correlaciones en el diagnóstico de enfermedades, ya que reduce la gran cantidad de datos a información fácilmente analizable para obtener resultados precisos.

Véase también

Referencias

  1. "¿Qué es el procesamiento de datos?" . Archivado del original el 18 de agosto de 2013. Consultado el 21 de enero de 2022 .
  2. "mung" . Mung . Archivo de jerga . Archivado del original el 18 de septiembre de 2012. Consultado el 10 de octubre de 2012 .
  3. Así como "coder" se refiere al código, "X" se refiere a los datos. Archivado el 15 de abril de 2021 en Wayback Machine , entrada del blog de Open Knowledge Foundation.
  4. Parsons, MA; Brodzik, MJ; Rutter, NJ (2004). "Gestión de datos para el experimento de procesos en tierras frías: mejora de la ciencia hidrológica" . Hydrological Processes . 18 (18): 3637– 3653. Bibcode : 2004HyPr...18.3637P . doi : 10.1002/hyp.5801 . S2CID 129774847 . 
  5. "Repensando la estrategia de datos y la integración para la inteligencia artificial: conceptos, oportunidades y desafíos" .
  6. Wickham, Hadley (2014). "Tidy Data" . Journal of Statistical Software . 59 (10). doi : 10.18637/jss.v059.i10 .
  7. 1 2 Kandel, Sean; Paepcke, Andreas; Hellerstein, Joseph M.; Heer, Jeffrey (2011). "Wrangler: Especificación visual interactiva de scripts de transformación de datos" (PDF) . Actas de la Conferencia SIGCHI sobre factores humanos en sistemas informáticos . págs. 3363–3372 . doi : 10.1145/1978942.1979444 . 
  8. ^ Sandve , Geir Kjetil; Nekrutenko, Antón; Taylor, James; Hovig, Eivind (2013). "Diez reglas simples para la investigación computacional reproducible" . PLOS Biología Computacional . 9 (10) e1003285. Código Bib : 2013PLSCB...9E3285S . doi : 10.1371/journal.pcbi.1003285 . PMC 3812051 . 
  9. "Documentación de OpenRefine" . OpenRefine . 29 de diciembre de 2022. Consultado el 15 de agosto de 2025 .
  10. Wickham, Hadley; Grolemund, Garrett (2016). «Capítulo 9: Introducción al procesamiento de datos». R para la ciencia de datos: importar, ordenar, transformar, visualizar y modelar datos (Primera ed.). Sebastopol, CA: O'Reilly. ISBN  978-1-4919-1039-9Archivado del original el 11/10/2021 . Consultado el 12/01/2022 .
  11. Kandel, Sean; Paepcke, Andreas (mayo de 2011). «Wrangler: Especificación visual interactiva de scripts de transformación de datos». Actas de la Conferencia SIGCHI sobre Factores Humanos en Sistemas Informáticos . págs. 3363–3372 . doi : 10.1145/1978942.1979444 . ISBN  978-1-4503-0228-9. S2CID 11133756 . 
  12. ¿Qué es la franquicia de datos? ( IRI 2003 y 2017) Archivado el 15/04/2021 en Wayback Machine
  • ¿Qué es el procesamiento de datos? Beneficios, herramientas y habilidades. Mi trayectoria como influencer . Consultado el 26 de enero de 2022 .