La reidentificación o desanonimización de datos es la práctica de cotejar datos anónimos (también conocidos como datos desidentificados) con información disponible públicamente, o datos auxiliares, para descubrir a la persona a la que pertenecen. [ 1 ] Esto es preocupante porque las empresas con políticas de privacidad , los proveedores de atención médica y las instituciones financieras pueden divulgar los datos que recopilan después de que estos hayan pasado por el proceso de desidentificación.
El proceso de anonimización implica enmascarar, generalizar o eliminar identificadores tanto directos como indirectos ; la definición de este proceso no es universal. La información de dominio público , incluso aparentemente anonimizada, puede ser reidentificada en combinación con otros datos disponibles y técnicas informáticas básicas. La Protección de Sujetos Humanos ( Regla Común ), un conjunto de múltiples agencias y departamentos federales de EE. UU., incluido el Departamento de Salud y Servicios Humanos de EE. UU ., advierte que la reidentificación se está volviendo gradualmente más fácil debido al " big data " —la abundancia y la recopilación y análisis constantes de información junto con la evolución de las tecnologías y los avances de los algoritmos—. Sin embargo, otros han afirmado que la anonimización es una herramienta segura y eficaz para la liberación de datos y no consideran la reidentificación como una preocupación. [ 2 ]
Cada vez hay más datos disponibles públicamente en internet. Estos datos se publican tras aplicar técnicas de anonimización, como la eliminación de información personal identificable (IPI), por ejemplo, nombres, direcciones y números de seguridad social, para garantizar la privacidad de las fuentes. Esta garantía de privacidad permite al gobierno compartir legalmente conjuntos de datos limitados con terceros sin necesidad de autorización por escrito. Dichos datos han demostrado ser muy valiosos para los investigadores, especialmente en el ámbito de la salud.
La pseudonimización conforme al RGPD busca reducir el riesgo de reidentificación mediante el uso de "información adicional" almacenada por separado. Este enfoque se basa en una evaluación experta de un conjunto de datos para designar algunos identificadores como "directos" y otros como "indirectos". Quienes defienden este enfoque argumentan que la reidentificación puede evitarse limitando el acceso a la "información adicional" que el responsable del tratamiento almacena por separado. La teoría es que el acceso a dicha información es necesario para la reidentificación, y que el responsable del tratamiento puede limitar la atribución de datos a un interesado específico únicamente para fines legítimos. Este enfoque es controvertido, ya que falla si existen conjuntos de datos adicionales que pueden utilizarse para la reidentificación. Dichos conjuntos de datos adicionales pueden ser desconocidos para quienes certifican la pseudonimización conforme al RGPD, o pueden no existir en el momento de la pseudonimización, pero podrían surgir en el futuro.
Protección legal de datos en los Estados Unidos
Las normativas de privacidad vigentes suelen proteger la información que ha sido modificada, de modo que los datos se consideran anonimizados o desidentificados. En el caso de la información financiera, la Comisión Federal de Comercio permite su circulación si está desidentificada y agregada. [ 3 ] La Ley Gramm-Leach-Bliley (GLBA), que obliga a las instituciones financieras a ofrecer a los consumidores la oportunidad de optar por no compartir su información con terceros, no cubre los datos desidentificados si la información está agregada y no contiene identificadores personales, ya que estos datos no se tratan como información de identificación personal . [ 3 ]
Registros educativos
En lo que respecta a los registros universitarios, las autoridades estatales y federales han demostrado ser conscientes de la importancia de la privacidad en la educación y mostrarse reacias a la divulgación de información por parte de las instituciones. El Departamento de Educación de los Estados Unidos ha proporcionado directrices sobre el análisis e identificación de datos, instruyendo a las instituciones educativas a ser sensibles al riesgo de reidentificación de datos anónimos mediante la comparación con datos auxiliares, a minimizar la cantidad de datos de dominio público reduciendo la publicación de información de directorio sobre estudiantes y personal institucional, y a ser coherentes en los procesos de anonimización. [ 4 ]
historiales médicos
La información médica de los pacientes está cada vez más disponible en Internet, en plataformas gratuitas y de acceso público como HealthData.gov y PatientsLikeMe , impulsadas por las políticas gubernamentales de datos abiertos y las iniciativas de intercambio de datos lideradas por el sector privado. Si bien este nivel de accesibilidad ofrece muchos beneficios, se han planteado preocupaciones con respecto a la discriminación y la privacidad. [ 5 ] Las protecciones sobre los registros médicos y los datos de los consumidores de las farmacias son más sólidas en comparación con las de otros tipos de datos de consumidores. La Ley de Portabilidad y Responsabilidad del Seguro Médico (HIPAA) protege la privacidad de los datos identificables sobre la salud, pero autoriza la divulgación de información a terceros si se anonimiza. Además, exige que los pacientes reciban notificaciones de violación de seguridad si existe una probabilidad superior a baja de que su información haya sido divulgada o utilizada indebidamente sin una mitigación suficiente del daño. [ 6 ] La probabilidad de reidentificación es un factor para determinar la probabilidad de que la información del paciente se haya visto comprometida. Comúnmente, las farmacias venden información anonimizada a empresas de minería de datos que, a su vez, la venden a compañías farmacéuticas. [ 3 ]
Se han promulgado leyes estatales para prohibir la minería de datos de información médica, pero fueron anuladas por tribunales federales en Maine y New Hampshire por violar la Primera Enmienda. Otro tribunal federal, en otro caso, utilizó el término "ilusorio" para describir las preocupaciones sobre la privacidad de los pacientes y no reconoció los riesgos de la reidentificación. [ 3 ]
Muestra biológica
El Aviso de Propuesta de Reglamentación, publicado por las Agencias de Reglamentación Común en septiembre de 2015, amplió el término general de "sujeto humano" en la investigación para incluir muestras biológicas , o materiales extraídos del cuerpo humano: sangre, orina, tejido, etc. Esto exige que los investigadores que utilicen muestras biológicas cumplan con los requisitos más estrictos para la investigación con sujetos humanos. La razón de esto es el mayor riesgo de reidentificación de las muestras biológicas. [ 7 ] Las revisiones finales ratificaron esta regulación. [ 8 ]
Esfuerzos de reidentificación
Se han realizado numerosos intentos exitosos de reidentificación en diferentes ámbitos. Si bien no es fácil para una persona común romper el anonimato, una vez que se conocen y se aprenden los pasos para hacerlo, no se requiere un conocimiento avanzado para acceder a la información en una base de datos . En ocasiones, ni siquiera se necesita experiencia técnica si una población posee una combinación única de identificadores. [ 3 ]
historiales médicos
A mediados de la década de 1990, una agencia gubernamental de Massachusetts llamada Group Insurance Commission (GIC), que compraba seguros de salud para los empleados del estado, decidió divulgar los registros de visitas hospitalarias a cualquier investigador que solicitara los datos, sin costo alguno. GIC aseguró que la privacidad del paciente no era una preocupación, ya que había eliminado identificadores como nombre, dirección y número de seguro social. Sin embargo, información como códigos postales, fecha de nacimiento y sexo permaneció intacta. La garantía de GIC fue reforzada por el entonces gobernador de Massachusetts, William Weld. Latanya Sweeney , estudiante de posgrado en ese momento, se propuso buscar los registros del gobernador en los datos de GIC. Al combinar los datos de GIC con la base de datos de votantes de la ciudad de Cambridge, que compró por 20 dólares, el registro del gobernador Weld fue descubierto fácilmente. [ 9 ]
En 1997, un investigador logró desanonimizar registros médicos utilizando bases de datos de votantes. [ 3 ]
En 2011, la profesora Latanya Sweeney volvió a utilizar registros anonimizados de visitas hospitalarias y registros de votación en el estado de Washington y logró identificar a personas individuales en el 43% de los casos. [ 10 ]
Existen algoritmos que se utilizan para reidentificar pacientes con información sobre medicamentos recetados. [ 3 ]
Hábitos y prácticas de consumo
Dos investigadores de la Universidad de Texas , Arvind Narayanan y el profesor Vitaly Shmatikov, lograron reidentificar una parte de los datos anonimizados de clasificación de películas de Netflix con consumidores individuales en el sitio web de streaming. [ 11 ] [ 12 ] [ 13 ] Netflix publicó los datos en 2006 después de la desidentificación, que consistió en reemplazar los nombres individuales con números aleatorios y reorganizar los detalles personales. Los dos investigadores desanonimizaron parte de los datos comparándolos con las calificaciones de películas de usuarios no anónimos de IMDb (Internet Movie Database). Se descubrió que se necesitaba muy poca información de la base de datos para identificar al suscriptor. [ 3 ] En el artículo de investigación resultante, se revelaron datos sorprendentes sobre la facilidad con la que se puede reidentificar a los usuarios de Netflix. Por ejemplo, con solo conocer los datos de dos películas que un usuario ha reseñado, incluyendo la calificación precisa y la fecha de la calificación (con un margen de tres días), se logra un éxito de reidentificación del 68 %. [ 9 ]
En 2006, después de que AOL publicara las consultas de búsqueda de sus usuarios, datos que habían sido anonimizados antes de su publicación, los reporteros de The New York Times lograron reidentificar a individuos tomando grupos de búsquedas realizadas por usuarios anonimizados. [ 3 ] AOL había intentado suprimir la información de identificación, incluidos los nombres de usuario y las direcciones IP, pero los había reemplazado con números de identificación únicos para preservar la utilidad de estos datos para los investigadores. Tras la publicación, los blogueros analizaron minuciosamente los datos, ya sea intentando identificar usuarios específicos con este contenido o señalando consultas de búsqueda entretenidas, deprimentes o impactantes, como por ejemplo "cómo matar a tu esposa", "depresión y baja médica" o "fotos de accidentes de coche". Dos reporteros, Michael Barbaro y Tom Zeller, lograron localizar a una viuda de 62 años llamada Thelma Arnold al reconocer pistas sobre la identidad del historial de búsquedas del Usuario 417729. Arnold reconoció ser la autora de las búsquedas, confirmando que la reidentificación es posible. [ 9 ]
Datos de ubicación
Los datos de localización —series de posiciones geográficas en el tiempo que describen la ubicación y los movimientos de una persona— son una clase de datos personales particularmente difíciles de mantener anónimos. La localización muestra visitas recurrentes a lugares frecuentados en la vida cotidiana, como el hogar, el lugar de trabajo, las tiendas, los centros de salud o patrones específicos de tiempo libre. [ 14 ] Eliminar la identidad de una persona de los datos de localización no elimina patrones identificables como los ritmos de desplazamiento, los lugares para dormir o los lugares de trabajo. Al asignar coordenadas a direcciones, los datos de localización se pueden reidentificar fácilmente [ 15 ] o correlacionar con los contextos de la vida privada de una persona. Los flujos de información de localización desempeñan un papel importante en la reconstrucción de identificadores personales a partir de datos de teléfonos inteligentes a los que acceden las aplicaciones. [ 16 ]
Decisiones judiciales
En 2019, la profesora Kerstin Noëlle Vokinger y el Dr. Urs Jakob Mühlematter, investigadores de la Universidad de Zúrich , analizaron casos del Tribunal Federal Supremo de Suiza para determinar qué compañías farmacéuticas y qué medicamentos estaban involucrados en acciones legales contra la Oficina Federal de Salud Pública (OFSP) en relación con las decisiones sobre precios de medicamentos. En general, las partes privadas involucradas (como las compañías farmacéuticas) y la información que revelaría a la parte privada (por ejemplo, los nombres de los medicamentos) se anonimizan en las sentencias suizas. Los investigadores lograron reidentificar el 84 % de los casos anonimizados relevantes del Tribunal Federal Supremo de Suiza mediante la vinculación de información de bases de datos de acceso público. [ 17 ] [ 18 ] Este logro fue cubierto por los medios de comunicación y dio inicio a un debate sobre si los casos judiciales deberían anonimizarse y cómo. [ 19 ] [ 20 ]
Preocupación y consecuencias
En 1997, Latanya Sweeney descubrió, a partir de un estudio de los registros del censo, que hasta el 87 por ciento de la población de EE. UU. puede ser identificada utilizando una combinación de su código postal de 5 dígitos , género y fecha de nacimiento. [ 21 ] [ 22 ]
La reidentificación no autorizada basada en dichas combinaciones no requiere acceso a "información adicional" que se mantenga por separado y que esté bajo el control del responsable del tratamiento de datos, como se exige actualmente para la seudonimización conforme al RGPD.
Las personas cuyos datos son reidentificados también corren el riesgo de que su información, junto con su identidad, sea vendida a organizaciones que no desean que posean información privada sobre sus finanzas, salud o preferencias. La divulgación de estos datos puede causar ansiedad, vergüenza o humillación. Una vez que la privacidad de una persona se ha visto comprometida como resultado de la reidentificación, las futuras violaciones se vuelven mucho más fáciles: una vez que se establece un vínculo entre un dato y la identidad real de una persona, cualquier asociación entre los datos y una identidad anónima rompe el anonimato de la persona. [ 3 ]
La reidentificación puede exponer a las empresas e instituciones que se han comprometido a garantizar el anonimato a una mayor responsabilidad civil y hacer que violen sus políticas internas, políticas de privacidad pública y leyes estatales y federales, como las leyes relativas a la confidencialidad financiera o la privacidad médica , al haber divulgado información a terceros que pueden identificar a los usuarios después de la reidentificación. [ 3 ]
Remedios
Para abordar los riesgos de reidentificación, se han sugerido varias propuestas:
- Estándares más altos y definición uniforme de anonimización manteniendo la utilidad de los datos: la definición de anonimización debe equilibrar las protecciones de la privacidad para reducir el riesgo de reidentificación con la negativa de las empresas a eliminar datos [ 23 ].
- Mayor protección de la privacidad de la información anonimizada [ 3 ]
- Mayor seguridad para las bases de datos que almacenan información anonimizada [ 3 ].
- Una fuerte prohibición de la reidentificación maliciosa, la aprobación de una legislación más amplia contra la discriminación y en materia de privacidad que garantice la protección de la privacidad y fomente la participación en proyectos e iniciativas de intercambio de datos, así como el establecimiento de estándares uniformes de protección de datos en las comunidades académicas, como en la comunidad científica, con el fin de minimizar las violaciones de la privacidad [ 24 ].
- Creación de políticas de divulgación de datos: asegurar que la retórica de anonimización sea precisa, elaborar contratos que prohíban los intentos de reidentificación y la difusión de información sensible, establecer enclaves de datos y utilizar estrategias basadas en datos para adaptar los estándares de protección requeridos al nivel de riesgo. [ 25 ]
- Implementación de privacidad diferencial en los conjuntos de datos solicitados.
- Generación de datos sintéticos que exhiben las propiedades estadísticas de los datos originales, sin permitir la identificación de individuos reales.
Aunque se ha instado a una prohibición total de la reidentificación, su aplicación sería difícil. Sin embargo, existen maneras para que los legisladores combatan y castiguen los intentos de reidentificación, si se descubren: combinar la prohibición con sanciones más severas y una aplicación más rigurosa por parte de la Comisión Federal de Comercio y el FBI ; otorgar a las víctimas de reidentificación el derecho a interponer una demanda contra quienes las reidentifican; y exigir registros de auditoría de software para quienes utilizan y analizan datos anonimizados. También se podría imponer una prohibición de reidentificación a pequeña escala a destinatarios de confianza de bases de datos específicas, como analistas de datos o investigadores gubernamentales. Esta prohibición sería mucho más fácil de aplicar y podría desalentar la reidentificación. [ 9 ]
Ejemplos de desanonimización
- Investigadores del MIT y de la Universidad Católica de Lovaina , en Bélgica, analizaron datos de 1,5 millones de usuarios de telefonía móvil en un pequeño país europeo durante un período de 15 meses y descubrieron que tan solo cuatro puntos de referencia, con una resolución espacial y temporal bastante baja, bastaban para identificar de forma unívoca al 95 % de ellos. En otras palabras, para extraer la información completa de ubicación de una sola persona a partir de un conjunto de datos "anonimizados" de más de un millón de personas, bastaría con ubicarla a unos cientos de metros de una antena de telefonía móvil, en algún momento a lo largo de una hora, cuatro veces en un año. Unas pocas publicaciones en Twitter probablemente proporcionarían toda la información necesaria, si contuvieran datos específicos sobre el paradero de la persona. [ 26 ]
- Aquí informamos que los apellidos pueden recuperarse de genomas personales mediante el análisis de repeticiones cortas en tándem en el cromosoma Y (Y-STR) y la consulta de bases de datos de genealogía genética recreativa. Demostramos que una combinación de un apellido con otros tipos de metadatos, como la edad y el estado, puede usarse para triangular la identidad del objetivo. [ 27 ]
Véase también
- Desidentificación : impedir que se revele la identidad personal.
- Doxing : publicación de datos privados.
- K-anonimato : propiedad de ciertos datos anonimizados.
- Información sanitaria protegida : información sobre el estado de salud de una persona.
- Control de divulgación estadística : técnica utilizada en la investigación basada en datos.
Referencias
- ↑ Pedersen, Torben (2005). "HTTPS, HTTPS seguro". Enciclopedia de criptografía y seguridad . págs. 268–269 . doi : 10.1007/0-387-23483-7_189 . ISBN 978-0-387-23473-1.
- ↑ Richardson, Victor; Milam, Sallie; Chrysler, Denise (abril de 2015). "¿Es legal compartir datos anonimizados? El estado de las leyes de confidencialidad de la salud pública y su interacción con las técnicas de limitación de la divulgación estadística". The Journal of Law, Medicine & Ethics . 43 (1_suppl): 83–86 . doi : 10.1111/jlme.12224 . hdl : 2027.42/111074AA . ISSN 1073-1105 . PMID 25846173. S2CID 9384220 .
- 1 2 3 4 5 6 7 8 9 10 11 12 13 Porter, Christine (2008). "Constitucional y regulatorio: datos desidentificados y minería de datos de terceros: el riesgo de reidentificación de información personal" . Shidler Journal of Law, Commerce & Technology . 5 (1).
- ↑ Peltz, Richard (2009). "De la torre de marfil a la casa de cristal: acceso a registros de admisión de universidades públicas "anonimizados" para estudiar la acción afirmativa" (PDF) . Harvard BlackLetter Law Journal . 25 : 181–197 . SSRN 1495788 .
- ↑ Hoffman, Sharona (2015). "Ciencia ciudadana: Derecho y ética del acceso público a los macrodatos médicos". Berkeley Technology Law Journal . doi : 10.15779/Z385Z78 .
- ↑ Greenberg, Yelena (2016). "Desarrollos recientes de casos: creciente reconocimiento del "riesgo de daño" como una lesión suficiente para justificar la legitimación activa en casos de violación de datos médicos de demandas colectivas". American Journal of Law & Medicine . 42 (1): 210– 4. doi : 10.1177/0098858816644723 . PMID 27263268. S2CID 77790820 .
- ↑ Groden, Samantha; Martin, Summer; Merrill, Rebecca (2016). "Cambios propuestos a la regla común: ¿Un enfrentamiento entre los derechos del paciente y los avances científicos?" . Revista de Derecho de la Salud y las Ciencias de la Vida . 9 (3).
- ↑ 24 CFR § .104 2017.
- 1 2 3 4 Ohm, Paul (agosto de 2010). "Promesas de privacidad incumplidas: respuesta al sorprendente fracaso de la anonimización" . UCLA Law Review . 57 (6): 1701– 1777. ISSN 0041-5650 . OCLC 670569859 – vía EBSCO.
- ↑ Sweeney, Latanya (28 de septiembre de 2015). "Solo usted, su médico y muchos otros pueden saberlo" . Ciencia de la tecnología . 2015092903. Recuperado el 12 de julio de 2024 .
- ↑ Rouse, Margaret. "desanonimización (deanonimización)" . WhatIs.com . Consultado el 19 de enero de 2014 .
- ↑ Narayanan, Arvind; Shmatikov, Vitaly. "Desanonimización robusta de grandes conjuntos de datos dispersos" (PDF) . Consultado el 19 de enero de 2014 .
- ↑ Narayanan, Arvind; Shmatikov, Vitaly (22 de noviembre de 2007). "Cómo romper el anonimato del conjunto de datos del premio Netflix". arXiv : cs/0610105 .
- ↑ Fritsch, Lothar (2008), "Profiling and Location-Based Services (LBS)", Profiling the European Citizen , Springer Netherlands, pp. 147–168 , doi : 10.1007/978-1-4020-6914-7_8 , ISBN 978-1-4020-6913-0
- ↑ Rocher, Luc; Hendrickx, Julien M.; de Montjoye, Yves-Alexandre (23 de julio de 2019). "Estimación del éxito de las reidentificaciones en conjuntos de datos incompletos mediante modelos generativos" . Nature Communications . 10 (1): 3069. Bibcode : 2019NatCo..10.3069R . doi : 10.1038/s41467-019-10933-3 . ISSN 2041-1723 . PMC 6650473. PMID 31337762 .
- ↑ Fritsch, Lothar; Momen, Nurul (2017). Identidades parciales derivadas generadas a partir de permisos de aplicaciones . Gesellschaft für Informatik, Bonn. ISBN 978-3-88579-671-8.
- ↑ Vokinger / Mühlematter, Kerstin Noëlle / Urs Jakob (2 de septiembre de 2019). "Identifikation von Gerichtsurteilen durch" Linkage "von Daten(banken)" . Carta justa (990).
- ↑ Vokinger / Mühlematter, Kerstin Noëlle / Urs Jacob. "Reidentificación de Gerichtsurteilen durch" Linkage "von Daten(banken)" .
- ↑ Chandler, Simon (4 de septiembre de 2019). "Investigadores utilizan macrodatos e IA para eliminar la confidencialidad legal" . Forbes . Consultado el 10 de diciembre de 2019 .
- ↑ "SRF Tagesschau" . SRF Radio y Televisión Suiza. 2 de septiembre de 2019. Consultado el 10 de diciembre de 2019 .
- ↑ "¿Qué tan único soy?" . Laboratorio de Privacidad de Datos, Universidad de Harvard . Consultado el 22 de julio de 2021 .
- ↑ Sweeney, Latanya. "Los datos demográficos simples a menudo identifican a las personas de manera única" (PDF) . Universidad Carnegie Mellon, Documento de trabajo sobre privacidad de datos 3. Consultado el 22 de julio de 2021 .
- ↑ Lagos, Yianni (2014). "Quitando lo personal de los datos: dando sentido a la desidentificación" (PDF) . Indiana Law Review . 48 : 187–203 . ISSN 2169-320X . OCLC 56050778 .
- ↑ Sejin, Ahn (verano de 2015). "¿De quién es el genoma, después de todo?: Reidentificación y protección de la privacidad en la genómica pública y participativa" . San Diego Law Review . 52 (3): 751–806 . ISSN 2994-9599 . OCLC 47865544 .
- ↑ Rubinstein, Ira S.; Hartzog, Woodrow (junio de 2016). "Anonimización y riesgo" . Washington Law Review . 91 (2): 703–760 . ISSN 0043-0617 . OCLC 3899779 – vía EBSCO.
- ↑ Hardesty, Larry (27 de marzo de 2013). "¿Qué tan difícil es 'desanonimizar' los datos de los teléfonos celulares?" . Noticias del MIT . Consultado el 14 de enero de 2015 .
- ↑ Melissa Gymrek; Amy L. McGuire; David Golan; Eran Halperin; Yaniv Erlich (18 de enero de 2013). "Identificación de genomas personales mediante inferencia de apellidos". Science . 339 ( 6117): 321– 4. Bibcode : 2013Sci...339..321G . doi : 10.1126/SCIENCE.1229566 . ISSN 0036-8075 . PMID 23329047. Wikidata Q29619963 .
- Anonimato
- gobernanza de la información
- Privacidad en Internet
- Privacidad