Skip to content
Vol. 1 · Ed. 2026
CyberGlossary
Entry № 306

数据匿名化

审核人Cybersecurity entrepreneur & security researcher

数据匿名化 是什么?

数据匿名化对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。


数据匿名化以不可逆方式转换个人数据,使个人无法再被单独识别、关联或推断,即便将发布数据与外部信息交叉也是如此。核心技术包括压制、泛化(例如将出生日期粗化到年份)、聚合、扰动/加噪与随机化,并以形式化模型加以衡量:k 匿名、l 多样性、t 接近度,或差分隐私——后者在可证明的隐私预算(ε)下加入校准噪声。

门槛之所以高,源于长期的重识别记录。Latanya Sweeney 估计,87% 的美国人可凭 5 位邮编、出生日期和性别的组合被唯一识别;她利用公开选民登记册,在「匿名化」的州数据中重新识别出马萨诸塞州州长 William Weld 的就医记录——正是这一结果催生了 k 匿名。2008 年,Narayanan 与 Shmatikov 通过将稀疏评分与公开的 IMDb 资料相关联,对 Netflix Prize 数据集(约 50 万订阅者)完成了去匿名化。2006 年 AOL 搜索日志的公开,也在数天内被追溯到具体个人。

在 GDPR 下,真正匿名化的数据不受该法规约束(序言第 26 条),但第 29 条工作组第 05/2014 号意见以及 EDPB、CNIL 等监管机构要求进行有文档记录的重识别风险评估,覆盖「单独识别」「可关联性」与「可推断性」,并考虑「合理可能」使用的手段。常见误区包括仅依赖哈希或简单假名、发布高维微观数据,或把假名化与匿名化混为一谈。

flowchart TD
  R["原始个人数据"] --> D["移除直接标识符"]
  D --> Q["泛化 / 压制准标识符"]
  Q --> M["应用隐私模型(k 匿名 / 差分隐私)"]
  M --> T{"重识别风险可接受?"}
  T -->|"否"| Q
  T -->|"是"| P["发布 / 共享匿名化数据集"]

● 示例

  1. 01

    公开按区域和季度聚合的医院再入院统计,小于五例的单元格被压制。

  2. 02

    发布公共出行数据集,将轨迹泛化到 "街区—周" 粒度。

● 常见问题

数据匿名化 是什么?

对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。 它属于网络安全的 隐私与数据保护 分类。

数据匿名化 是什么意思?

对个人数据进行不可逆的处理,使其在与其他可用信息结合时也无法直接或间接识别到任何个人。

如何防御 数据匿名化?

针对 数据匿名化 的防御通常结合技术控制与运营实践,详见上方完整定义。

数据匿名化 还有哪些其他名称?

常见的别称包括: 匿名化, 强去标识化。

● 相关术语

● 另见