El control de divulgación estadística ( CDS ), también conocido como limitación de divulgación estadística ( LDS ) o prevención de la divulgación , es una técnica utilizada en la investigación basada en datos para garantizar que ninguna persona u organización sea identificable a partir de los resultados de un análisis de datos administrativos o de encuestas, o en la publicación de microdatos . El propósito del CDS es proteger la confidencialidad de los encuestados y sujetos de la investigación. [ 1 ]
La protección de datos de salida (SDC, por sus siglas en inglés) suele referirse a la protección de datos de salida, que garantiza, por ejemplo, que una tabla o un gráfico publicados no revelen información confidencial sobre los encuestados. La SDC también puede describir los métodos de protección aplicados a los datos: por ejemplo, la eliminación de nombres y direcciones, la limitación de valores extremos o el intercambio de observaciones problemáticas. A esto se le suele llamar protección de datos de entrada (SDC, por sus siglas en inglés), pero se conoce más comúnmente como anonimización , desidentificación o protección de microdatos.
Los libros de texto (por ejemplo, Control de Divulgación Estadística [ 2 ] ) suelen abarcar el control de divulgación estadística (CDS) de entrada y la protección de datos tabulares (pero no otras partes del CDS de salida). Esto se debe a que estos dos problemas son de interés directo para las agencias estadísticas que apoyaron el desarrollo del campo. [ 3 ] En entornos analíticos, las reglas de salida desarrolladas para las agencias estadísticas se utilizaron generalmente hasta que los gestores de datos comenzaron a abogar por un CDS de salida específico para la investigación. [ 4 ]
Esta página se centra en la salida SDC.
Necesidad
Muchos tipos de investigación social , económica y sanitaria utilizan datos potencialmente sensibles como base para sus estudios, como datos de encuestas o censos , registros fiscales, historiales médicos, información educativa, etc. Esta información suele proporcionarse de forma confidencial y, en el caso de los datos administrativos , no siempre con fines de investigación.
Los investigadores no suelen estar interesados en información sobre una sola persona o empresa; buscan tendencias entre grupos más amplios de personas. [ 5 ] Sin embargo, los datos que utilizan están, en primer lugar, vinculados a personas y empresas individuales, y SDC garantiza que estos no puedan identificarse a partir de los datos publicados, por muy detallados o generales que sean. [ 6 ]
Es posible que, al finalizar el análisis de datos , el investigador identifique a una persona o empresa en particular. Por ejemplo, podría detectar un servicio excepcionalmente bueno o malo en un departamento de geriatría de un hospital en una zona remota, donde solo un hospital ofrece este tipo de atención. En ese caso, el análisis de datos revela la identidad del hospital, incluso si el conjunto de datos utilizado se anonimizó o desidentificó correctamente.
El control de divulgación estadística identificará este riesgo de divulgación y garantizará que los resultados del análisis se modifiquen para proteger la confidencialidad. [ 7 ] Requiere un equilibrio entre la protección de la confidencialidad y la garantía de que los resultados del análisis de datos sigan siendo útiles para la investigación estadística . [ 8 ]
Salida SDC: modelos estadísticos
El análisis de datos de salida (SDC) se basa en un conjunto de reglas que puede ser seguido por un verificador de resultados; por ejemplo, que una tabla de frecuencias debe tener un número mínimo de observaciones, o que las tablas de supervivencia deben estar censuradas a la derecha para valores extremos. El valor y las desventajas de las reglas para tablas de frecuencia y magnitud se han debatido ampliamente desde finales del siglo XX. Sin embargo, ante la creciente necesidad de reglas para otros tipos de análisis, se requiere un enfoque más estructurado.
Estadísticas de "seguridad" e "inseguridad".
Algunos resultados estadísticos, como las tablas de frecuencia, presentan un alto nivel de riesgo inherente: diferencias, valores bajos y divulgación de clases. Por lo tanto, deben revisarse antes de su publicación, idealmente por alguien con conocimientos sobre los datos, para garantizar que no exista un riesgo significativo al publicarse. Estas se denominan «estadísticas inseguras». Sin embargo, existen algunas estadísticas, como los coeficientes de los modelos, que no presentan un riesgo significativo y, por lo tanto, pueden publicarse sin más comprobaciones. Estas se denominan «estadísticas seguras». Al separar las estadísticas en «seguras» e «inseguras», las comprobaciones de los resultados pueden concentrarse en estas últimas, mejorando tanto la seguridad como la eficiencia. [ 4 ]
Esto es menos importante para las estadísticas oficiales, donde predominan las estadísticas "poco fiables" como recuentos, medias, medianas e índices simples. Sin embargo, para la producción científica es importante, ya que gran parte de ella (en particular las estimaciones y las estadísticas de prueba) es inherentemente "fiable".
Graneros estadísticos o statbarns
El modelo seguro/inseguro es útil pero limitado a dos categorías simples; dentro de esas categorías, las directrices para SDC consisten principalmente en largas listas de estadísticas y cómo manejarlas. En 2023, el proyecto SACRO https://dareuk.org.uk/driver-project-sacro/ se propuso revisar todo el campo y ver si se podía introducir un esquema de clasificación más útil. El resultado es el concepto de "estadístico de granero" (o "statbarn"). [ 9 ]
Un statbarn es una clasificación de estadísticas para fines de control de divulgación, donde todas las estadísticas de esa clase comparten las mismas características en lo que respecta al control de divulgación:
- Su forma matemática es similar
- comparten los mismos riesgos
- Comparten las mismas respuestas a esos riesgos.
- Las reglas de verificación de salida son aplicables a todos
A marzo de 2024, se han identificado 14 statbarns, de los cuales 12 se han descrito para verificadores de salida: [ 10 ]
- frecuencias
- pruebas de hipótesis estadísticas
- coeficientes de asociación
- posición (mediana, rango intercuartílico, etc.)
- valores extremos (máximo, mínimo)
- forma
- agregados lineales
- modo
- relaciones de concentración no lineales
- Probabilidades y ratios de riesgo
- tablas de supervivencia
- coeficientes de Gini
Estos cubren casi todas las estadísticas. También cubren la mayoría de los formatos gráficos, donde el gráfico se puede convertir al statsbarn apropiado (por ejemplo, un gráfico circular es otro formato de tabla de frecuencias). El manual de SACRO proporciona orientación sobre qué buscar y las reglas que se deben seguir para la verificación. Hay una tabla de consulta entre statsistcs/graphs y statbarns disponible en outputchecking.org .
Salida SDC: modelos operativos
Existen dos enfoques principales para la generación de datos de divulgación científica (SDC): basados en principios y basados en reglas. [ 11 ] En los sistemas basados en principios, el control de divulgación busca mantener un conjunto específico de principios fundamentales; por ejemplo, "ninguna persona debe ser identificable en los microdatos publicados". [ 12 ] Los sistemas basados en reglas, en cambio, se caracterizan por un conjunto específico de reglas que sigue la persona que realiza el control de divulgación (por ejemplo, "cualquier frecuencia debe basarse en al menos cinco observaciones"), tras lo cual se presume que los datos son seguros para su publicación. En general, las estadísticas oficiales se basan en reglas; los entornos de investigación tienden a basarse en principios.
En entornos de investigación, la elección del régimen de verificación de resultados puede tener implicaciones operativas significativas. [ 13 ]
SDC basado en reglas
En el SDC basado en reglas, se utiliza un conjunto rígido de reglas para determinar si los resultados del análisis de datos pueden publicarse o no. Las reglas se aplican de forma consistente, lo que hace evidente qué tipos de resultados son aceptables. Los sistemas basados en reglas son buenos para garantizar la consistencia a lo largo del tiempo, entre fuentes de datos y entre equipos de producción, lo que los hace atractivos para las agencias estadísticas. [ 13 ] Los sistemas basados en reglas también funcionan bien para servicios de trabajo remoto como microdata.no o Lissy .
Sin embargo, debido a la inflexibilidad de las reglas, es posible que se filtre información confidencial o que las reglas sean demasiado restrictivas y solo permitan la publicación de resultados demasiado generales para un análisis útil. [ 11 ] En la práctica, los entornos de investigación que utilizan sistemas basados en reglas pueden tener que incorporar flexibilidad en los sistemas "ad hoc". [ 13 ]
La Agencia de Estadísticas e Investigación de Irlanda del Norte (NISRA) utiliza un enfoque basado en reglas para publicar estadísticas y resultados de investigación. [ 14 ]
SDC basado en principios
En la SDC basada en principios, tanto el investigador como el revisor de resultados reciben formación en SDC. Reciben un conjunto de reglas, que son reglas generales en lugar de reglas estrictas como en la SDC basada en reglas. Esto significa que, en principio, cualquier resultado puede ser aprobado o rechazado. Las reglas generales son un punto de partida para el investigador. Un investigador puede solicitar resultados que infrinjan las reglas generales siempre que (1) no sean divulgativos, (2) sean importantes y (3) se trate de una solicitud excepcional. [ 15 ] Corresponde al investigador demostrar que cualquier resultado "inseguro" no es divulgativo, pero el revisor tiene la última palabra. Dado que no hay reglas estrictas, esto requiere conocimiento sobre los riesgos de divulgación y criterio tanto del investigador como del revisor. Requiere formación y comprensión de la estadística y el análisis de datos, [ 11 ] aunque se ha argumentado [ 13 ] que esto puede utilizarse para hacer que el proceso sea más eficiente que un modelo basado en reglas.
En el Reino Unido, todos los principales entornos de investigación seguros en ciencias sociales y salud pública, con la excepción de Irlanda del Norte, se basan en principios. Esto incluye el Servicio de Datos Seguros del Servicio de Datos del Reino Unido , [ 16 ] el Servicio de Investigación Segura de la Oficina de Estadísticas Nacionales , los Refugios Seguros de Escocia, el Enlace de Información Anonimizada Segura (SAIL) y OpenSAFELY .
Críticas
Se ha demostrado que muchas técnicas contemporáneas de control de divulgación estadística, como la generalización y la supresión de celdas, son vulnerables a ataques por parte de un hipotético intruso de datos. Por ejemplo, Cox demostró en 2009 que la supresión de celdas complementarias suele dar lugar a soluciones "sobreprotegidas" debido a la necesidad de suprimir tanto las celdas primarias como las complementarias, e incluso así puede comprometer datos sensibles cuando se informan intervalos exactos. [ 17 ]
Muchas de las reglas son arbitrarias y reflejan la renuencia del propietario de los datos a ser diferente, en lugar de basarse en evidencia sólida. Por ejemplo, Ritchie [ 18 ] demostró que la elección de un umbral mínimo responde más al deseo de una organización de estar en sintonía con las demás que a cualquier fundamento estadístico.
Una crítica más sustancial es que los modelos teóricos utilizados para explorar las medidas de control no son apropiados como guías para la acción práctica. [ 19 ] Hafner et al. proporcionan un ejemplo práctico de cómo un cambio de perspectiva puede generar resultados sustancialmente diferentes. [ 3 ]
Modelos SDC y de IA de salida
Los modelos de inteligencia artificial y aprendizaje automático presentan diferentes riesgos para la verificación de resultados. [ 20 ] El proyecto GRAIMATTER https://dareuk.org.uk/sprint-exemplar-project-graimatter/ proporcionó algunas directrices iniciales y herramientas automáticas. Estas se ampliaron y simplificaron como parte del proyecto SACRO (véase más abajo), y se añadieron más directrices para el personal de servicios de datos. Esta sigue siendo un área en rápida evolución. La red comunitaria SDC-REBOOT https://www.jiscmail.ac.uk/cgi-bin/webadmin?A0=SDC-REBOOT está coordinando actualmente el desarrollo continuo de las herramientas y la guía.
Herramientas automatizadas
La verificación de la producción suele ser laboriosa, ya que requiere analistas que comprendan lo que están viendo y puedan decidir si publicar o no un dato. Por lo tanto, existe un gran interés en la verificación automatizada. Un informe encargado por Eurostat [ 21 ] exploró las opciones para la verificación de la producción, que en gran medida se reducen a dos opciones:
- Revisión al final del proceso (EoPR): entrenar a un ordenador para que analice los resultados y comprenda su significado. Esto tiene la ventaja de no requerir formación adicional para el investigador. Sin embargo, puede resultar difícil explicar a cualquier sistema automatizado qué está analizando, lo que puede llevar más tiempo que revisar los resultados manualmente. tauArgus y sdcTable son ejemplos de EoPR.
- Revisión dentro del proceso (WPR): la herramienta de verificación de salida se llama al mismo tiempo que se genera la salida y tiene acceso a los datos de origen; por lo tanto, no es necesario explicar cómo se ha creado la salida. La desventaja de este enfoque es que puede ralentizar los tiempos de procesamiento y requiere que el análisis incluya los comandos necesarios para ejecutar la herramienta de verificación de salida. Sin embargo, la principal ventaja es que no es necesario enseñarle sobre los datos,
tauArgus y sdcTable
tau-Argus y sdcTable son herramientas EoPR de código abierto totalmente automatizadas para la protección de datos tabulares (tablas de frecuencia y magnitud). Están diseñadas para trabajar con múltiples tablas. Es necesario configurar metadatos que describan la(s) salida(s) y los parámetros de control. Proporcionan a los verificadores de salida información detallada sobre posibles problemas, incluyendo la divulgación secundaria entre tablas. También pueden realizar medidas correctivas, desde la supresión y el redondeo simple hasta la supresión secundaria y el redondeo tabular controlado. No gestionan salidas no tabulares.
Debido a la necesidad de reescribir los metadatos de cada tabla, estas herramientas no son adecuadas para la investigación. Sin embargo, en las estadísticas oficiales, donde se generan repetidamente las mismas tablas y donde la diferenciación secundaria se considera un problema importante, la inversión en la configuración de estas herramientas puede resultar muy rentable.
El software para ambos es de código abierto y está disponible en GitHub https://github.com/sdcTools/tauargus y CRAN https://cran.r-project.org/web/packages/sdcTable/
SACRÓFONO
SACRO (Verificación semiautónoma de resultados de investigación) es una herramienta WPR, encargada originalmente (ACRO) por Eurostat en 2020 como prueba de concepto para demostrar que se podía desarrollar una herramienta de verificación de resultados de propósito general. [ 22 ] En 2023, el Consejo de Investigación Médica del Reino Unido encargó una versión generalizada (SACRO) que funcionaría con varios lenguajes (a partir de 2024: Stata, R y Python) y proporcionaría una interfaz más fácil de usar. [ 23 ] SACRO implementa directamente el modelo statbarns y se basa en principios; por lo tanto, es "semiautomática" ya que permite a los usuarios solicitar excepciones y a los verificadores de resultados anular las recomendaciones automatizadas. Todas las instalaciones seguras de ciencias sociales del Reino Unido, y la mayoría de las instalaciones seguras de salud pública del Reino Unido, planean adoptarla.
El software está disponible en GitHub en https://github.com/AI-SDC , que también contiene enlaces al ACRO original y herramientas para evaluar modelos de IA.
Véase también
- comprobación de salida.org
- Privacidad para los participantes en la investigación
- Anonimato
Referencias
- ↑ Skinner, Chris (2009). "Control de divulgación estadística para datos de encuestas" (PDF) . Manual de estadística, vol. 29A: Encuestas por muestreo: diseño, métodos y aplicaciones . Manual de estadística. 29 : 381–396 . doi : 10.1016/S0169-7161(08)00015-1 . ISBN 978-0-444-53124-7. Consultado el 8 de marzo de 2016 .
- ↑ "Referencias", Control de divulgación estadística , Chichester, Reino Unido: John Wiley & Sons, Ltd, 5 de julio de 2012, págs. 261–277 , doi : 10.1002/9781118348239.refs , ISBN 978-1-118-34823-9
- 1 2 Hafner, Hans-Peter; Lenz, Rainer; Ritchie, Felix (2019-01-01). "Identificación de amenazas centrada en el usuario para microdatos anonimizados" (PDF) . Statistical Journal of the IAOS . 35 (4): 703– 713. doi : 10.3233/SJI-190506 . ISSN 1874-7655 . S2CID 55976703 .
- 1 2 Ritchie, Felix (2007). Detección de divulgación en entornos de investigación en la práctica. Documento presentado en la sesión de trabajo de la UNECE/Eurostat sobre confidencialidad de datos estadísticos .
- ↑ "ADRN » Resultados seguros" . adrn.ac.uk. Consultado el 8 de marzo de 2016 .
- ↑ "Servicios estadísticos gubernamentales: Control de divulgación estadística" . Consultado el 8 de marzo de 2016 .
- ↑ Templ, Matthias; et al. (2014). "Red Internacional de Encuestas de Hogares" (PDF) . Documento de trabajo de la IHSN . Recuperado el 8 de marzo de 2016 .
- ↑ "Archivado: Control de divulgación estadística de la ONS" . Oficina de Estadísticas Nacionales. Archivado del original el 5 de enero de 2016. Consultado el 8 de marzo de 2016 .
- ↑ Green, Elizabeth; Ritche, Felix; White, Paul (2024). «The statbarn: A New Model for Output Statistical Disclosure Control» . En Domingo-Ferrer, Josep; Önen, Melek (eds.). Privacy in Statistical Databases . Lecture Notes in Computer Science. Vol. 14915. Cham: Springer Nature Switzerland. pp. 284–293 . doi : 10.1007/978-3-031-69651-0_19 . ISBN 978-3-031-69651-0.
- ↑ Felix, Ritchie; Green, Elizabeth; Smith, Jim; Tilbrook, Amy; White, Paul (30 de octubre de 2023). La guía de SACRO para la verificación de resultados estadísticos (Informe técnico). doi : 10.5281/zenodo.10054629 .
- 1 2 3 Ritchie, Felix; Elliot, Mark (2015). "Control de divulgación estadística de resultados basado en principios frente a reglas en entornos de acceso remoto" (PDF) . IASSIST Quarterly . 39 (2): 5– 13. doi : 10.29173/iq778 . S2CID 59043893. Recuperado el 8 de marzo de 2016 .
- ↑ Ritchie, Felix (1 de enero de 2009). "Prácticas de publicación de microdatos oficiales en el Reino Unido" . Statistical Journal of the IAOS . 26 (3, 4): 103–111 . doi : 10.3233/SJI-2009-0706 . ISSN 1874-7655 .
- 1 2 3 4 Alves, Kyle; Ritchie, Felix (2020-11-25). "Corredores, repetidores, extraños y alienígenas: Operacionalización del control eficiente de divulgación de resultados" . Statistical Journal of the IAOS . 36 (4): 1281– 1293. doi : 10.3233/SJI-200661 . S2CID 209455141 .
- ↑ "Censo de 2001 - Metodología" (PDF) . Agencia de Estadísticas e Investigación de Irlanda del Norte. 2001. Consultado el 8 de marzo de 2016 .
- ↑ Oficina Nacional de Estadística. "Formación segura para investigadores" .
- ↑ Afkhamai, Reza; et al. (2013). "Prácticas de control de divulgación estadística en el acceso seguro al servicio de datos del Reino Unido" (PDF) . Comisión Económica para Europa de las Naciones Unidas . Recuperado el 8 de marzo de 2016 .
- ↑ Lawrence H. Cox, Vulnerabilidad de la supresión de células complementarias ante ataques de intrusos, Journal of Privacy and Confidentiality (2009) 1, Número 2, págs. 235–251 http://repository.cmu.edu/jpc/vol1/iss2/8/
- ↑ Ritchie, Felix (2022). "10 es el número más seguro que jamás haya existido" . Transactions on Data Privacy . 15 (2): 109– 140.
- ↑ Ritchie, Felix; Hafner, Hans-Peter; Lenz, Rainer; Welpton, Richard (18 de octubre de 2018). Acceso a datos basado en evidencia, abierto por defecto, con gestión de riesgos y centrado en el usuario . Conferencia de partes interesadas en la estadística europea. Bamberg.
- ↑ Ritchie, Felix; Tilbrook, Amy; Cole, Christian; Jefferson, Emily; Krueger, Susan; Mansouri-Bensasassi, Esma; Rogers, Simon; Smith, Jim (2023-12-14). "Modelos de aprendizaje automático en entornos de investigación confiables: comprensión de los riesgos operativos" . International Journal of Population Data Science . 8 (1): 2165. doi : 10.23889/ijpds.v8i1.2165 . ISSN 2399-4908 . PMC 10898318. PMID 38414545 .
- ↑ Green, Elizabeth; Ritchie, Felix; Smith, James (31 de mayo de 2020). Comprensión de la verificación de la salida (Informe técnico).
- ↑ Eurostat (Comisión Europea); Green, Elizabeth; Smith, James; Ritchie, Felix (2021). Control automático de los resultados de la investigación (ACRO): una herramienta para controles dinámicos de divulgación : edición 2021. LU: Oficina de Publicaciones de la Unión Europea. doi : 10.2785/75954 . ISBN 978-92-76-41529-9.
- ↑ Smith, Jim; Preen, Richard; et al. (26 de septiembre de 2023). SACRO: Verificación semiautomatizada de resultados de investigación . Reunión de expertos de la UNECE sobre confidencialidad de datos estadísticos. Wiesbaden.
- Divulgación
- Investigación con sujetos humanos
- Privacidad