Local differential privacy (LDP) is a model of differential privacy with the added requirement that if an adversary has access to the personal responses of an individual in the database, that adversary will still be unable to learn much of the user's personal data. This is contrasted with global differential privacy, a model of differential privacy that incorporates a central aggregator with access to the raw data.[1]
Local differential privacy (LDP) is an approach to mitigate the concern of data fusion and analysis techniques used to expose individuals to attacks and disclosures. LDP is a well-known privacy model for distributed architectures that aims to provide privacy guarantees for each user while collecting and analyzing data, protecting from privacy leaks for the client and server.[2] LDP has been widely adopted to alleviate contemporary privacy concerns in the era of big data.[3]
History
The randomized response survey technique proposed by Stanley L. Warner in 1965 is frequently cited as an example of local differential privacy.[4] Warner's innovation was the introduction of what could now be called the "untrusted curator" model, where the entity collecting the data may not be trustworthy. Before users' responses are sent to the curator, the answers are randomized in a controlled manner, guaranteeing differential privacy while still allowing valid population-wide statistical inferences.
In 2003, Alexandre V. Evfimievski, Johannes Gehrke, and Ramakrishnan Srikant[5] gave a definition equivalent to local differential privacy.
In 2008, Kasiviswanathan et al.[6] first used the term "local private learning" and showed it to be equivalent to randomized response.
Applications
The era of big data exhibits a high demand for machine learning services that provide privacy protection for users. Demand for such services has pushed research into algorithmic paradigms that provably satisfy specific privacy requirements.
Anomaly Detection
La detección de anomalías se define formalmente como el proceso de identificar elementos o eventos inesperados en conjuntos de datos. El auge de las redes sociales en la actualidad ha generado numerosas preocupaciones relacionadas con la privacidad de la información . A medida que más usuarios dependen de las redes sociales, se ven amenazados por violaciones de la privacidad, acceso no autorizado a información personal y filtración de datos sensibles . Para abordar este problema, los autores de "Detección de anomalías sobre privacidad diferencial preservada en redes sociales en línea" han propuesto un modelo que utiliza una red social con privacidad diferencial local restringida. Este modelo busca mejorar la preservación de la privacidad mediante la detección de anomalías. En este artículo, los autores proponen un modelo de preservación de la privacidad que anonimiza la recopilación de información de usuario de una red social utilizando privacidad diferencial local restringida (LDP) para guardar copias sintéticas de los datos recopilados. Este modelo utiliza datos reconstruidos para clasificar la actividad del usuario y detectar comportamientos anómalos en la red. Los resultados experimentales demuestran que el método propuesto logra una alta utilidad de los datos gracias a una mejor preservación de la privacidad. Además, los datos anonimizados con privacidad diferencial local son adecuados para su uso en análisis posteriores, como la detección de anomalías. La detección de anomalías en los datos reconstruidos del método propuesto alcanza una precisión de detección similar a la de los datos originales. [ 7 ]
Tecnología Blockchain
Las posibles combinaciones de la tecnología blockchain con la privacidad diferencial local han recibido atención por parte de la investigación. Las blockchains implementan libros de contabilidad distribuidos, seguros y compartidos que se utilizan para registrar y rastrear datos dentro de una red descentralizada, y han reemplazado con éxito ciertos sistemas anteriores de transacciones económicas dentro y entre organizaciones. El mayor uso de las blockchains ha planteado algunas preguntas sobre la privacidad y la seguridad de los datos que almacenan, y se ha propuesto la privacidad diferencial local de diversos tipos como una propiedad deseable para las blockchains que contienen datos sensibles. [ 8 ]
Privacidad sin contexto
La privacidad diferencial local proporciona privacidad independiente del contexto incluso en ausencia de un recolector de datos confiable, aunque a menudo a costa de una caída significativa en la utilidad. La definición clásica de LDP asume que todos los elementos en el dominio de datos son igualmente sensibles. Sin embargo, en muchas aplicaciones, algunos símbolos son más sensibles que otros. Un marco de privacidad diferencial local sensible al contexto [ 9 ] puede permitir que un diseñador de privacidad incorpore el contexto de la aplicación en la definición de privacidad. Para dominios de datos binarios, la investigación algorítmica ha proporcionado un esquema de privatización universalmente óptimo y ha resaltado sus conexiones con la respuesta aleatoria de Warner [ 10 ] (RR) y la respuesta mejorada de Mangat. Para dominios de datos k-arios , motivados por aplicaciones de geolocalización y búsqueda web, los investigadores han considerado al menos dos casos especiales de LDP sensible al contexto: LDP estructurada en bloques y LDP alta-baja (esta última también se define en [ 11 ] ). La investigación ha proporcionado esquemas eficientes en comunicación, óptimos en muestras y límites inferiores teóricos de la información para ambos modelos.
Reconocimiento facial

El reconocimiento facial se ha generalizado en los últimos años. Los smartphones más recientes , por ejemplo, lo utilizan para desbloquear el teléfono y autorizar pagos con tarjeta de crédito. Si bien esto resulta práctico, plantea problemas de privacidad. Se trata de una tarea que consume muchos recursos y que a menudo involucra a terceros, lo que suele generar una brecha en la que la privacidad del usuario podría verse comprometida. La información biométrica transmitida a servidores de terceros no confiables de forma incontrolada puede constituir una importante fuga de privacidad, ya que los datos biométricos pueden correlacionarse con información sensible, como historiales médicos o financieros. En su artículo académico, Chamikara propone una técnica de preservación de la privacidad para la "difusión controlada de información", donde se disfraza una imagen facial original y se evita la filtración de las características biométricas durante la identificación de una persona. Presenta un nuevo protocolo de reconocimiento facial que preserva la privacidad, denominado PEEP (Privacy using Eigenface Perturbation), que utiliza privacidad diferencial local. PEEP aplica perturbaciones a los Eigenfaces mediante privacidad diferencial y almacena únicamente los datos perturbados en los servidores de terceros para ejecutar un algoritmo estándar de reconocimiento de Eigenfaces. Como resultado, el modelo entrenado no será vulnerable a ataques de privacidad como la inferencia de pertenencia y los ataques de memorización del modelo. [ 12 ] Este modelo proporcionado por Chami kara muestra la posible solución a este problema de fugas de privacidad.
Aprendizaje Federado (FL)

El aprendizaje federado tiene la ambición de proteger la privacidad de los datos a través de métodos de aprendizaje distribuido que mantienen los datos en su almacenamiento. Asimismo, la privacidad diferencial (PD) logra mejorar la protección de la privacidad de los datos midiendo la pérdida de privacidad en la comunicación entre los elementos del aprendizaje federado. La posible combinación del aprendizaje federado y la privacidad diferencial con los desafíos de la protección de la privacidad de los datos ha provocado el lanzamiento de varias herramientas de software que soportan sus funcionalidades, pero carecen de una visión unificada de estas técnicas y de un flujo de trabajo metodológico que respalde su uso. En el estudio patrocinado por el Instituto Andaluz de Investigación en Ciencia de Datos e Inteligencia Computacional , desarrollaron Sherpa.ai FL, 1,2 que es un marco unificado de investigación abierta de FL y PD que tiene como objetivo fomentar la investigación y el desarrollo de servicios de IA en los bordes y preservar la privacidad de los datos. Las características de FL y PD probadas y resumidas en el estudio sugieren que los convierten en buenos candidatos para soportar servicios de IA en los bordes y preservar la privacidad de los datos a través de su hallazgo de que al establecer el valor depara valores más bajos garantizaría una mayor privacidad a costa de una menor precisión. [ 13 ]
Agregación de datos de salud
El rápido crecimiento de los datos de salud, junto con los recursos limitados de almacenamiento y computación de las redes de sensores corporales inalámbricos, se está convirtiendo en una barrera para que el sector sanitario se mantenga al día. Para solucionar esto, la externalización de datos de salud cifrados a la nube se ha presentado como una estrategia atractiva. Sin embargo, como toda decisión, puede presentar inconvenientes potenciales. La agregación de datos se volverá más difícil y más vulnerable a las ramificaciones de datos de esta información sensible de los pacientes del sector sanitario. En su artículo académico «Agregación de datos de salud multifuncional y con privacidad mejorada bajo garantías de privacidad diferencial», Hao Ren y su equipo proponen un esquema de agregación de datos de salud multifuncional y con privacidad mejorada (PMHA-DP) bajo privacidad diferencial. Esta función de agregación está diseñada para proteger los datos agregados de los servidores en la nube . El rendimiento y la evaluación realizados en su estudio muestran que la propuesta genera una menor sobrecarga de comunicación que los modelos de agregación de datos existentes. [ 14 ]
Vehículos conectados a Internet
Un número creciente de vehículos incorpora conexión a internet para la comodidad de los usuarios. Esto supone una amenaza adicional para la privacidad del usuario. Se espera que el Internet de los vehículos (IoV) permita la gestión inteligente del tráfico , servicios de información dinámica inteligentes, control inteligente de vehículos, etc. Sin embargo, se argumenta que la privacidad de los datos de los vehículos es una barrera importante para la aplicación y el desarrollo del IoV, lo que genera una gran atención. La privacidad diferencial local (LDP) es una versión flexible del estándar de privacidad, privacidad diferencial, y puede proteger la privacidad de los datos de los usuarios frente a terceros no confiables en el peor escenario adversario. Los costos computacionales del uso de LDP son una preocupación para los investigadores, ya que su implementación es bastante costosa para un modelo tan específico dado que el modelo requiere alta movilidad y tiempos de conexión cortos. [ 15 ] Además, a medida que aumenta el número de vehículos, la comunicación frecuente entre los vehículos y el servidor en la nube genera costos de comunicación inesperados. Para evitar la amenaza a la privacidad y reducir el costo de comunicación, los investigadores proponen integrar el aprendizaje federado y la privacidad diferencial local (LDP) para facilitar las aplicaciones de crowdsourcing para lograr el modelo de aprendizaje automático. [ 16 ]
Lista negra de teléfonos

Dado que las llamadas no deseadas son una molestia creciente en el mundo digital, los investigadores han estado buscando posibles soluciones para minimizar este problema. Agencias federales como la Comisión Federal de Comercio de EE. UU. (FTC) han estado trabajando con operadores telefónicos para diseñar sistemas que bloqueen las llamadas automáticas . Además, se han creado varias aplicaciones comerciales y para teléfonos inteligentes que prometen bloquear las llamadas no deseadas, pero tienen un costo oculto. La información privada del usuario que se obtiene al otorgar a la aplicación acceso para bloquear llamadas no deseadas puede filtrarse sin el consentimiento del usuario ni siquiera saber que esto está ocurriendo. En el estudio, [ 17 ] los investigadores analizan los desafíos y las compensaciones relacionadas con el uso de la privacidad diferencial local, evalúan el sistema basado en LDP con registros de llamadas reales reportados por usuarios y recopilados por la FTC, y demuestran que es posible aprender una lista negra de teléfonos utilizando un presupuesto de privacidad general razonable y, al mismo tiempo, preservar la privacidad de los usuarios manteniendo la utilidad de la lista negra aprendida.
Restricción de correlación cruzada de trayectorias
Con el objetivo de resolver el problema de la baja utilización de datos y la protección de la privacidad, el investigador Hu propone un método personalizado de protección de la privacidad diferencial basado en restricciones de correlación cruzada . Al proteger los puntos de ubicación sensibles en la trayectoria y los puntos sensibles, este modelo extendido de protección de la privacidad diferencial combina la sensibilidad de la ubicación de la trayectoria del usuario con los requisitos de protección de la privacidad del usuario y el presupuesto de privacidad. Mediante la transformada de Laplace de autocorrelación , el ruido blanco específico se transforma en ruido relacionado con la secuencia de trayectoria real del usuario tanto en el tiempo como en el espacio. Estos datos de ruido se utilizan para encontrar la mecánica de restricción de correlación cruzada de la secuencia de trayectoria en el modelo. Al proponer este modelo, el método personalizado de protección de la privacidad diferencial del investigador Hu se desglosa y aborda el problema de agregar ruido independiente y no correlacionado y el mismo grado de confusión que resultan en una baja protección de la privacidad y una escasa disponibilidad de datos. [ 18 ]
Privacidad diferencial ε-local
Definición de privacidad diferencial ε-local
Sea ε un número real positivo ySea un algoritmo aleatorio que toma como entrada los datos privados del usuario.denota la imagen deEl algoritmoSe dice que proporciona-privacidad diferencial local si, para todos los pares de posibles datos privados de los usuariosyy todos los subconjuntosde:
donde la probabilidad se toma sobre la medida aleatoria implícita en el algoritmo.
La principal diferencia entre esta definición de privacidad diferencial local y la definición de privacidad diferencial estándar (global) es que en la privacidad diferencial estándar las probabilidades se refieren a las salidas de un algoritmo que toma los datos de todos los usuarios, mientras que aquí se refieren a un algoritmo que toma los datos de un solo usuario.
Otras definiciones formales de privacidad diferencial local se refieren a algoritmos que categorizan los datos de todos los usuarios como entrada y generan como salida una colección de todas las respuestas (como la definición en el artículo de Raef Bassily, Kobbi Nissim , Uri Stemmer y Abhradeep Guha Thakurta de 2017 [ 19 ] ).
Despliegue
En varias empresas de internet se han implementado algoritmos que garantizan la privacidad diferencial local:
- RAPPOR, [ 20 ] donde Google garantizó la privacidad diferencial local mientras recopilaba datos de los usuarios sobre los procesos en ejecución y las páginas de inicio de Chrome.
- Boceto de media de conteo privado (y variantes) [ 21 ] donde Apple garantizó la privacidad diferencial local mientras recopilaba datos de uso de emojis, uso de palabras y otra información de los usuarios de iPhone.
Referencias
- ↑ "Privacidad diferencial local vs. global: Ted está escribiendo cosas" . desfontaine.es . Consultado el 10 de febrero de 2020 .
- ↑ Joseph, Matthew; Roth, Aaron; Ullman, Jonathan; Waggoner, Bo (2018-11-19). "Privacidad diferencial local para datos en evolución". arXiv : 1802.07128 [ cs.LG ].
- ↑ Wang, Teng; Zhang, Xuefeng; Feng, Jingyu; Yang, Xinyu (2020-12-08). "Un estudio exhaustivo sobre la privacidad diferencial local para estadísticas y análisis de datos" . Sensors (Basilea, Suiza) . 20 (24): 7030. arXiv : 2010.05253 . Bibcode : 2020Senso..20.7030W . doi : 10.3390/s20247030 . ISSN 1424-8220 . PMC 7763193. PMID 33302517 .
- ↑ Warner, Stanley L. (1965). "Respuesta aleatoria: una técnica de encuesta para eliminar el sesgo de respuesta evasiva". Journal of the American Statistical Association . 60 (309): 63– 69. doi : 10.1080/01621459.1965.10480775 . PMID 12261830. S2CID 35435339 .
- ↑ Evfimievski, Alexandre V.; Gehrke, Johannes; Srikant, Ramakrishnan (9-12 de junio de 2003). «Limitación de las violaciones de la privacidad en la minería de datos que preserva la privacidad». Actas del Vigésimo Segundo Simposio ACM SIGMOD-SIGACT-SIGART sobre Principios de Sistemas de Bases de Datos . págs. 211-222 . doi : 10.1145/773153.773174 . ISBN 1-58113-670-6. S2CID 2379506 .
- ↑ Kasiviswanathan, Shiva Prasad; Lee, Homin K.; Nissim, Kobbi; Raskhodnikova, Sofya ; Smith, Adam D. (2008). "¿Qué podemos aprender en privado?". 49.º Simposio Anual IEEE sobre Fundamentos de la Informática , 2008. págs. 531–540 . arXiv : 0803.0924 . doi : 10.1109/FOCS.2008.27 . ISBN 978-0-7695-3436-7.
- ↑ Aljably, Randa; Tian, Yuan; Al-Rodhaan, Mznah; Al-Dhelaan, Abdullah (2019-04-25). "Detección de anomalías sobre privacidad preservada diferencial en redes sociales en línea" . PLOS ONE . 14 (4) e0215856. Bibcode : 2019PLoSO..1415856A . doi : 10.1371/journal.pone.0215856 . ISSN 1932-6203 . PMC 6483223. PMID 31022238 .
- ^ Ul Hassan, Muneeb; Rehmani, Mubashir Husain; Chen, Jinjun (1 de noviembre de 2020). "Privacidad diferencial en la tecnología blockchain: un enfoque futurista" . Revista de Computación Paralela y Distribuida . 145 : 50– 74. arXiv : 1910.04316 . doi : 10.1016/j.jpdc.2020.06.003 . ISSN 0743-7315 . S2CID 204008404 .
- ↑ Acharya, Jayadev; Bonawitz, Kallista; Kairouz, Peter; Ramage, Daniel; Sun, Ziteng (2020-11-21). "Privacidad diferencial local sensible al contexto" . Conferencia internacional sobre aprendizaje automático . PMLR: 52– 62. arXiv : 1911.00038 .
- ↑ Kim, Jong-Min; Warde, William D. (15 de febrero de 2004). "Un modelo de respuesta aleatoria estratificada de Warner" . Journal of Statistical Planning and Inference . 120 ( 1–2 ): 155–165 . doi : 10.1016/S0378-3758(02)00500-1 . ISSN 0378-3758 .
- ↑ Murakami, Takao; Kawamoto, Yusuke (2019). "Mecanismos de privacidad diferencial local optimizados en función de la utilidad para la estimación de la distribución" (PDF) . Actas del 28.º Simposio de Seguridad USENIX : 1877–1894 . arXiv : 1807.11317 .
- ↑ Chamikara, MAP; Bertok, P.; Khalil, I.; Liu, D.; Camtepe, S. (2020-10-01). "Reconocimiento facial que preserva la privacidad utilizando privacidad diferencial" . Computers & Security . 97 101951. arXiv : 2005.10486 . doi : 10.1016/j.cose.2020.101951 . ISSN 0167-4048 . S2CID 218763393 .
- ↑ Rodríguez-Barroso, Nuria; Stipcich, Goran; Jiménez-López, Daniel; Antonio Ruiz-Millán, José; Martínez-Cámara, Eugenio; González-Seco, Gerardo; Luzón, M. Victoria; Veganzones, Miguel Ángel; Herrera, Francisco (2020). "Aprendizaje federado y privacidad diferencial: análisis de herramientas de software, el marco Sherpa.ai FL y pautas metodológicas para preservar la privacidad de los datos". Fusión de información . 64 : 270–92 . arXiv : 2007.00914 . doi : 10.1016/j.inffus.2020.07.009 . S2CID 220302072 .
- ↑ Ren, Hao; Li, Hongwei; Liang, Xiaohui; He, Shibo; Dai, Yuanshun; Zhao, Lian (2016-09-10). "Privacy-Enhanced and Multifunctional Health Data Aggregation under Differential Privacy Guarantees" . Sensors (Basel, Suiza) . 16 ( 9): 1463. Bibcode : 2016Senso..16.1463R . doi : 10.3390/s16091463 . ISSN 1424-8220 . PMC 5038741. PMID 27626417 .
- ↑ Zhao, Ping; Zhang, Guanglin; Wan, Shaohua; Liu, Gaoyang; Umer, Tariq (2020-11-01). "Un estudio sobre la privacidad diferencial local para asegurar la Internet de los vehículos" . The Journal of Supercomputing . 76 (11): 8391– 8412. doi : 10.1007/s11227-019-03104-0 . S2CID 208869853 .
- ↑ Zhao, Yang; Zhao, junio; Yang, Mengmeng; Wang, Teng; Wang, Ning; Lyu, Lingjuan; Niyato, Dusit; Lam, Kwok-Yan (10 de noviembre de 2020). "Aprendizaje federado basado en privacidad diferencial local para Internet de las cosas" . Revista IEEE de Internet de las cosas . PP (11): 8836–8853 . arXiv : 2004.08856 . doi : 10.1109/JIOT.2020.3037194 . hdl : 10356/147888 . S2CID 215828540 .
- ↑ Ucci, Daniele; Perdisci, Roberto; Lee, Jaewoo; Ahamad, Mustaque (1 de junio de 2020). «Hacia un sistema práctico de bloqueo telefónico colaborativo con privacidad diferencial». Conferencia anual sobre aplicaciones de seguridad informática . págs. 100–115 . arXiv : 2006.09287 . doi : 10.1145/3427228.3427239 . ISBN 978-1-4503-8858-0. S2CID 227911367 .
- ↑ Hu, Zhaowei; Yang, Jing (2020-08-12). "Método de protección de privacidad diferencial basado en la restricción de correlación cruzada de trayectoria publicada" . PLOS ONE . 15 (8) e0237158. Bibcode : 2020PLoSO..1537158H . doi : 10.1371/journal.pone.0237158 . ISSN 1932-6203 . PMC 7423147. PMID 32785242 .
- ↑ Bassily, Raef; Nissim, Kobbi; Stemmer, Uri; Thakurta, Abhradeep Guha (2017). "Aprendizaje consciente de la privacidad". Practical Locally Private Heavy Hitters . Advances in Neural Information Processing Systems. Vol. 30. pp. 2288– 2296. arXiv : 1707.04982 . Bibcode : 2017arXiv170704982B .
- ↑ Erlingsson, Úlfar; Pihur, Vasyl; Korolova, Aleksandra (2014). "RAPPOR: Respuesta ordinal agregable aleatoria que preserva la privacidad". Actas de la Conferencia ACM SIGSAC de 2014 sobre seguridad informática y de comunicaciones . págs. 1054–1067 . arXiv : 1407.6981 . Bibcode : 2014arXiv1407.6981E . doi : 10.1145/2660267.2660348 . ISBN 978-1-4503-2957-6. S2CID 6855746 .
- ↑ "Aprendizaje con privacidad a gran escala" . 2017.
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda )
- Teoría de la criptografía
- Privacidad de la información
- Privacidad diferencial