数据匿名化
数据匿名化 是什么?
数据匿名化对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。
数据匿名化以不可逆方式转换个人数据,使个人无法再被单独识别、关联或推断,即便将发布数据与外部信息交叉也是如此。核心技术包括压制、泛化(例如将出生日期粗化到年份)、聚合、扰动/加噪与随机化,并以形式化模型加以衡量:k 匿名、l 多样性、t 接近度,或差分隐私——后者在可证明的隐私预算(ε)下加入校准噪声。
门槛之所以高,源于长期的重识别记录。Latanya Sweeney 估计,87% 的美国人可凭 5 位邮编、出生日期和性别的组合被唯一识别;她利用公开选民登记册,在「匿名化」的州数据中重新识别出马萨诸塞州州长 William Weld 的就医记录——正是这一结果催生了 k 匿名。2008 年,Narayanan 与 Shmatikov 通过将稀疏评分与公开的 IMDb 资料相关联,对 Netflix Prize 数据集(约 50 万订阅者)完成了去匿名化。2006 年 AOL 搜索日志的公开,也在数天内被追溯到具体个人。
在 GDPR 下,真正匿名化的数据不受该法规约束(序言第 26 条),但第 29 条工作组第 05/2014 号意见以及 EDPB、CNIL 等监管机构要求进行有文档记录的重识别风险评估,覆盖「单独识别」「可关联性」与「可推断性」,并考虑「合理可能」使用的手段。常见误区包括仅依赖哈希或简单假名、发布高维微观数据,或把假名化与匿名化混为一谈。
flowchart TD
R["原始个人数据"] --> D["移除直接标识符"]
D --> Q["泛化 / 压制准标识符"]
Q --> M["应用隐私模型(k 匿名 / 差分隐私)"]
M --> T{"重识别风险可接受?"}
T -->|"否"| Q
T -->|"是"| P["发布 / 共享匿名化数据集"]● 示例
- 01
公开按区域和季度聚合的医院再入院统计,小于五例的单元格被压制。
- 02
发布公共出行数据集,将轨迹泛化到 "街区—周" 粒度。
● 常见问题
数据匿名化 是什么?
对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。 它属于网络安全的 隐私与数据保护 分类。
数据匿名化 是什么意思?
对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。
如何防御 数据匿名化?
针对 数据匿名化 的防御通常结合技术控制与运营实践,详见上方完整定义。
数据匿名化 还有哪些其他名称?
常见的别称包括: 匿名化, 强去标识化。