Los datos sintéticos son datos generados artificialmente que no se producen a partir de eventos del mundo real. Generalmente creados mediante algoritmos, los datos sintéticos se pueden utilizar para validar modelos matemáticos y para entrenar modelos de aprendizaje automático . [ 1 ]
Los datos generados por una simulación informática pueden considerarse datos sintéticos. Esto abarca la mayoría de las aplicaciones de modelado físico, como los sintetizadores musicales o los simuladores de vuelo. El resultado de estos sistemas se aproxima a la realidad, pero se genera completamente mediante algoritmos.
Los datos sintéticos se utilizan en diversos campos como filtro para la información que, de otro modo, comprometería la confidencialidad de ciertos aspectos de los datos. En muchas aplicaciones sensibles, los conjuntos de datos existen teóricamente, pero no pueden divulgarse al público en general; [ 2 ] los datos sintéticos evitan los problemas de privacidad que surgen al utilizar información real de los consumidores sin permiso ni compensación.
Utilidad
Los datos sintéticos se generan para satisfacer necesidades específicas o ciertas condiciones que pueden no encontrarse en los datos reales originales. Uno de los obstáculos para aplicar enfoques de aprendizaje automático actualizados a tareas científicas complejas es la escasez de datos etiquetados, una brecha que se supera eficazmente mediante el uso de datos sintéticos, que replican fielmente los datos experimentales reales . [ 3 ] Esto puede ser útil al diseñar muchos sistemas, desde simulaciones basadas en valores teóricos hasta procesadores de bases de datos, etc. Esto ayuda a detectar y resolver problemas inesperados, como limitaciones en el procesamiento de la información. Los datos sintéticos se generan a menudo para representar los datos auténticos y permiten establecer una línea base. [ 4 ] Otro beneficio de los datos sintéticos es proteger la privacidad y la confidencialidad de los datos auténticos, al tiempo que permite su uso en sistemas de prueba.
Expertos en seguridad informática afirman que los datos sintéticos generados «... nos permiten crear perfiles de comportamiento realistas para usuarios y atacantes. Los datos se utilizan para entrenar el propio sistema de detección de fraude , creando así la adaptación necesaria del sistema a un entorno específico». [ 4 ] En contextos de defensa y militares, los datos sintéticos se consideran una herramienta potencialmente valiosa para desarrollar y mejorar sistemas de IA complejos, particularmente en contextos donde los datos del mundo real de alta calidad son escasos. [ 5 ] Al mismo tiempo, los datos sintéticos junto con el enfoque de pruebas pueden brindar la capacidad de modelar escenarios del mundo real.
Historia
La modelización científica de sistemas físicos tiene una larga historia que transcurre paralelamente a la historia de la física . Por ejemplo, la investigación sobre la síntesis de audio y voz se remonta a la década de 1930 e incluso antes, impulsada por el desarrollo de las tecnologías telefónicas y de grabación de audio. La digitalización dio lugar a los sintetizadores de software a partir de la década de 1970 .
En el contexto del análisis estadístico que preserva la privacidad, en 1993, Donald Rubin creó la idea de datos totalmente sintéticos originales . [ 6 ] Rubin diseñó originalmente esto para sintetizar las respuestas largas del Censo Decenal para los hogares que respondieron el formulario corto. Luego publicó muestras que no incluían ningún registro largo real, preservando así el anonimato del hogar. [ 7 ] Más tarde ese mismo año, Little creó la idea de datos parcialmente sintéticos originales. Little utilizó esta idea para sintetizar los valores sensibles del archivo de uso público. [ 8 ]
Un trabajo de 1993 [ 9 ] ajustó un modelo estadístico a 60.000 dígitos MNIST , que luego se utilizó para generar más de 1 millón de ejemplos. Estos se utilizaron para entrenar una LeNet-4 y alcanzar un rendimiento de vanguardia. [ 10 ] : 173
En 1994, Stephen Fienberg introdujo el «refinamiento crítico», en el que se utiliza una distribución predictiva posterior paramétrica (en lugar de un bootstrap bayesiano) para realizar el muestreo. [ 7 ] Posteriormente, otros importantes contribuyentes al desarrollo de la generación de datos sintéticos fueron Trivellore Raghunathan , Jerry Reiter , Donald Rubin , John M. Abowd y Jim Woodcock . En conjunto, idearon una solución para el tratamiento de datos parcialmente sintéticos con datos faltantes. De manera similar, desarrollaron la técnica de imputación multivariante de regresión secuencial . [ 7 ]
Cálculos
Los investigadores prueban el marco con datos sintéticos, que es "la única fuente de verdad fundamental sobre la cual pueden evaluar objetivamente el rendimiento de sus algoritmos ". [ 11 ]
Los datos sintéticos se pueden generar mediante el uso de líneas aleatorias con diferentes orientaciones y posiciones iniciales. [ 12 ] Los conjuntos de datos pueden ser bastante complejos. Un conjunto de datos más complejo se puede generar mediante la creación de un sintetizador. Para crear un sintetizador, primero se utilizan los datos originales para crear un modelo o ecuación que se ajuste mejor a los datos. Este modelo o ecuación se denominará sintetizador. Este sintetizador se puede utilizar para generar más datos. [ 13 ]
La construcción de un sintetizador implica la creación de un modelo estadístico . En un ejemplo de regresión lineal , se pueden graficar los datos originales y crear una línea de mejor ajuste a partir de ellos. Esta línea es un sintetizador creado a partir de los datos originales. El siguiente paso consiste en generar más datos sintéticos a partir del sintetizador o de la ecuación de esta línea. De esta manera, los nuevos datos pueden utilizarse para estudios e investigaciones, y se protege la confidencialidad de los datos originales. [ 13 ]
David Jensen del Laboratorio de Descubrimiento de Conocimiento explica cómo generar datos sintéticos: "Los investigadores frecuentemente necesitan explorar los efectos de ciertas características de los datos en su modelo de datos ". [ 13 ] Para ayudar a construir conjuntos de datos que exhiban propiedades específicas, como autocorrelación o disparidad de grado, la proximidad puede generar datos sintéticos que tengan uno de varios tipos de estructura de grafo: grafos aleatorios que se generan mediante algún proceso aleatorio ; grafos reticulares con una estructura de anillo; grafos reticulares con una estructura de cuadrícula, etc. [ 13 ] En todos los casos, el proceso de generación de datos sigue el mismo proceso:
- Generar la estructura de grafo vacía .
- Generar valores de atributos en función de las probabilidades previas proporcionadas por el usuario.
Dado que los valores de los atributos de un objeto pueden depender de los valores de los atributos de objetos relacionados, el proceso de generación de atributos asigna valores de forma colectiva. [ 13 ]
Aplicaciones
Sistemas de detección de fraude y confidencialidad
Testing and training fraud detection and confidentiality systems are devised using synthetic data. Specific algorithms and generators are designed to create realistic data,[14] which then assists in teaching a system how to react to certain situations or criteria. For example, intrusion detection software is tested using synthetic data. This data is a representation of the authentic data and may include intrusion instances that are not found in the authentic data. The synthetic data allows the software to recognize these situations and react accordingly. If synthetic data was not used, the software would only be trained to react to the situations provided by the authentic data and it may not recognize another type of intrusion.[4]
Scientific research
Researchers doing clinical trials or any other research may generate synthetic data to aid in creating a baseline for future studies and testing.
Real data can contain information that researchers may not want released,[15] so synthetic data is sometimes used to protect the privacy and confidentiality of a dataset. Using synthetic data reduces confidentiality and privacy issues since it holds no personal information and cannot be traced back to any individual.
Beyond privacy protection, synthetic data is also being explored for methodological innovation in drug development. For instance, synthetic data may be used to construct synthetic control arms as an alternative to conventional external control arms based on real-world data (RWD) or randomized controlled trials (RCTs). Collectively, regulatory agencies such as the FDA and EMA appear to be at various stages of recognizing and integrating AI-generated synthetic data into their methodologies. While there is growing consensus on the potential of such data to support model development and the broader lifecycle of medicinal products, to date no drug or medical device has been approved using solely or predominantly synthetic data—particularly not as a comparator arm generated entirely via data-driven algorithms. The quality and statistical handling of synthetic data are expected to become more prominent in future regulatory discussions, particularly in contexts such as predictive modeling (e.g., digital twins), where innovative approaches have already been referenced.[16]
Machine learning
Los datos sintéticos se utilizan cada vez más en aplicaciones de aprendizaje automático : un modelo se entrena con un conjunto de datos generado sintéticamente con la intención de transferir el aprendizaje a datos reales. Se han realizado esfuerzos para facilitar más experimentos de ciencia de datos mediante la construcción de generadores de datos sintéticos de propósito general, como Synthetic Data Vault. [ 17 ] En general, los datos sintéticos tienen varias ventajas naturales:
- Una vez que el entorno sintético está listo, es rápido y económico producir tantos datos como sean necesarios;
- Los datos sintéticos pueden tener etiquetas perfectamente precisas, incluidas etiquetas que pueden ser muy costosas o imposibles de obtener manualmente;
- El entorno sintético puede modificarse para mejorar el modelo y el entrenamiento;
- Los datos sintéticos pueden utilizarse como sustituto de ciertos segmentos de datos reales que contienen, por ejemplo, información confidencial.
Este uso de datos sintéticos se ha propuesto para aplicaciones de visión por computadora, en particular detección de objetos , donde el entorno sintético es un modelo 3D del objeto, [ 18 ] y aprendizaje para navegar entornos mediante información visual.
En el contexto del entrenamiento de modelos de lenguaje a gran escala , la generación de datos sintéticos se ha convertido en un componente fundamental del proceso posterior al entrenamiento. Técnicas como Self-Instruct, que utiliza un pequeño conjunto inicial de 175 instrucciones escritas por humanos para generar 52 000 ejemplos sintéticos de seguimiento de instrucciones, y Persona Hub, que genera más de mil millones de personas sintéticas para la generación de instrucciones diversas, han permitido la creación de conjuntos de datos de entrenamiento a gran escala a una fracción del coste de la anotación humana. [ 19 ]
Al mismo tiempo, el aprendizaje por transferencia sigue siendo un problema complejo, y los datos sintéticos aún no se han generalizado. Los resultados de la investigación indican que añadir una pequeña cantidad de datos reales mejora significativamente el aprendizaje por transferencia con datos sintéticos. Los avances en las redes generativas antagónicas (GAN) llevaron a la idea natural de que se pueden producir datos y luego utilizarlos para el entrenamiento. Desde al menos 2016, este entrenamiento antagónico se ha utilizado con éxito para producir datos sintéticos de calidad suficiente para obtener resultados de vanguardia en algunos dominios, sin siquiera necesitar mezclar datos reales con los datos sintéticos generados. [ 20 ]
Ejemplos
En 1987, un vehículo autónomo de Navlab utilizó 1200 imágenes sintéticas de carreteras como un método de entrenamiento. [ 21 ]
En 2021, Microsoft lanzó una base de datos de 100.000 rostros sintéticos basados en (500 rostros reales) que afirma "coincidir con los datos reales en precisión". [ 21 ] [ 22 ]
En 2023, Nature (revista) publicó una portada de su serie Nature's 10 diseñada por Kim Albrecht del proyecto "Artificial Worldviews". [ 23 ] La portada presenta un mapeo de más de 18 000 puntos de datos generados sintéticamente a partir de ChatGPT sobre las categorías de conocimiento.
DataFramer ha publicado conjuntos de datos sobre Hugging Face , incluyendo ehr-multi-file-patient-samples , un conjunto de datos sintéticos de historial de pacientes de múltiples archivos, [ 24 ] e INSURE-Dial , un conjunto de datos de diálogo para la detección de la fase de llamada de seguros y la verificación del cumplimiento. [ 25 ]
Véase también
Referencias
- ↑ "¿Qué son los datos sintéticos? - Definición de WhatIs.com" . SearchCIO . Consultado el 8 de septiembre de 2022 .
- ↑ Nikolenko, Sergey I. (2021). Datos sintéticos para el aprendizaje profundo . Springer Optimization and Its Applications. Vol. 174. doi : 10.1007/978-3-030-75178-4 . ISBN 978-3-030-75177-7. S2CID 202750227 .
- ↑ Zivenko, Oleksii; Walton, Noah AW; Fritsch, William; Forbes, Jacob; Lewis, Amanda M.; Clark, Aaron; Brown, Jesse M.; Sobes, Vladimir (2024-06-03). "Validating Automated Resonance Evaluation with Synthetic Data". arXiv : 2406.01754 [ physics.comp-ph ].
- 1 2 3 Barse, EL; Kvarnström, H.; Jonsson, E. (2003). Síntesis de datos de prueba para sistemas de detección de fraude . Actas de la 19.ª Conferencia Anual de Aplicaciones de Seguridad Informática. IEEE. doi : 10.1109/CSAC.2003.1254343 .
- ↑ Deng, Harry (30 de noviembre de 2023). "Explorando datos sintéticos para inteligencia artificial y sistemas autónomos: una introducción" . Instituto de las Naciones Unidas para la Investigación del Desarme .
- ↑ "Discusión: Limitación de la divulgación estadística". Revista de Estadísticas Oficiales . 9 : 461–468 . 1993.
- 1 2 3 Abowd, John M. "Protección de la confidencialidad de los microdatos de las ciencias sociales: datos sintéticos y métodos relacionados. [ Diapositivas de PowerPoint ] " . Recuperado el 17 de febrero de 2011 .
- ↑ "Análisis estadístico de datos enmascarados". Revista de Estadísticas Oficiales . 9 : 407–426 . 1993.
- ↑ Drucker, Harris; Schapire, Robert; Simard, Patrice (agosto de 1993). "Mejora del rendimiento en redes neuronales" . Revista internacional de reconocimiento de patrones e inteligencia artificial . 07 (4): 705– 719. doi : 10.1142/S0218001493000352 . ISSN 0218-0014 .
- ↑ Vapnik, Vladimir (2008). La naturaleza de la teoría del aprendizaje estadístico . Estadística para ingeniería y ciencias de la información (2.ª ed., 6.ª ed. impresa). Nueva York: Springer. ISBN 978-0-387-98780-4.
- ↑ Jackson, Charles; Murphy, Robert F.; Kovačević, Jelena (septiembre de 2009). "Adquisición y aprendizaje inteligentes de modelos de datos de microscopios de fluorescencia" ( PDF) . IEEE Transactions on Image Processing . 18 (9): 2071–84 . Bibcode : 2009ITIP...18.2071J . doi : 10.1109/TIP.2009.2024580 . PMID 19502128. S2CID 3718670 .
- ↑ Wang, Aiqi; Qiu, Tianshuang; Shao, Longtan (julio de 2009). "Un método simple de corrección de distorsión radial con estimación del centro de distorsión". Journal of Mathematical Imaging and Vision . 35 (3): 165– 172. Bibcode : 2009JMIV...35..165W . doi : 10.1007/s10851-009-0162-1 . S2CID 207175690 .
- 1 2 3 4 5 David Jensen (2004). "6. Uso de scripts" . Tutorial de Proximity 4.3 .
- ↑ Deng, Robert H.; Bao, Feng; Zhou, Jianying (diciembre de 2002). Seguridad de la información y las comunicaciones . Actas de la 4.ª Conferencia Internacional, ICICS 2002 Singapur. ISBN 9783540361596.
- ↑ Abowd, John M.; Lane, Julia (9-11 de junio de 2004). Nuevos enfoques para la protección de la confidencialidad: datos sintéticos, acceso remoto y centros de datos de investigación . Privacidad en bases de datos estadísticas: Conferencia final del proyecto CASC, Actas. Barcelona, España. doi : 10.1007/978-3-540-25955-8_22 .
- ^ Pasculli, Giuseppe; Virgolín, Marco; Myles, Puya; Vidovszky, Anna; Pescador, Carlos; Biasín, Elisabetta; Mourby, Miranda; Pappalardo, Francisco; D'Amico, Saverio; Antorcha, Mario; Chebykin, Alejandro; Carbone, Vincenzo; Emili, Luca; Roeshammar, Daniel (7 de abril de 2025). "Datos sintéticos en la atención sanitaria y el desarrollo de fármacos: definiciones, marcos regulatorios, cuestiones" . CPT: Farmacometría y Farmacología de Sistemas . 14 (5): 840– 852. doi : 10.1002/psp4.70021 . PMC 12072219 . PMID 40193292 .
- ↑ Patki, Neha; Wedge, Roy; Veeramachaneni, Kalyan (2016). "The Synthetic Data Vault". 2016 IEEE International Conference on Data Science and Advanced Analytics (DSAA) . IEEE. pp. 399–410 . doi : 10.1109/DSAA.2016.49 . ISBN 978-1-5090-5206-6.
- ↑ Peng, Xingchao; Sun, Baochen; Ali, Karim; Saenko, Kate (2015). "Aprendizaje de detectores de objetos profundos a partir de modelos 3D". arXiv : 1412.7122 [ cs.CV ].
- ↑ von Csefalvay, Chris (2026). Post-Training: A Practical Guide for AI Engineers and Developers . No Starch Press . pp. 283–300 . ISBN 978-1-7185-0520-9.
- ↑ Shrivastava, Ashish; Pfister, Tomas; Tuzel, Oncel; Susskind, Josh; Wang, Wenda; Webb, Russ (2016). "Aprendizaje a partir de imágenes simuladas y no supervisadas mediante entrenamiento adversario". arXiv : 1612.07828 [ cs.CV ].
- 1 2 "Las redes neuronales necesitan datos para aprender. Incluso si son falsos" . Junio de 2023. Consultado el 17 de junio de 2023 .
- ↑ Wood, Erroll; Baltrušaitis, Tadas; Hewitt, Charlie; Dziadzio, Sebastian; Cashman, Thomas J.; Shotton, Jamie (2021). "Finge hasta que lo consigas: Análisis facial en entornos reales utilizando únicamente datos sintéticos" . Conferencia Internacional IEEE/CVF de Visión por Computadora (ICCV) de 2021. págs. 3681–3691 . arXiv : 2109.15102 . doi : 10.1109 /ICCV48922.2021.00366 . ISBN 978-1-6654-2812-5.
- ↑ Albrecht, Kim. "Visiones del mundo artificiales" . artificial-worldviews.kimalbrecht.com . Consultado el 18 de noviembre de 2024 .
- ↑ "dataframer/ehr-multi-file-patient-samples" . Hugging Face . Consultado el 10 de marzo de 2026 .
- ↑ "dataframer/insure-dial" . Hugging Face . Consultado el 10 de marzo de 2026 .
- Datos
- Datos informáticos
- Gestión de datos
- Tipos de datos estadísticos