Skip to content
Vol. 1 · Ed. 2026
CyberGlossary
Entry № 306

データ匿名化

監修Cybersecurity entrepreneur & security researcher

データ匿名化 とは何ですか?

データ匿名化他の利用可能な情報と組み合わせても直接的・間接的に個人を識別できないよう、個人データを不可逆に変換する処理。


データ匿名化は、個人データを不可逆に変換し、公開データを外部情報と組み合わせても個人を特定・連結・推論できないようにします。中核的な手法は、抑制、一般化(例:生年月日を年単位まで粗くする)、集計、摂動/ノイズ付与、ランダム化で、形式的モデル——k-匿名性、l-多様性、t-近接性、または証明可能なプライバシー予算(ε)の下で校正済みノイズを加える差分プライバシー——で評価されます。

水準が高いのは、再識別の長い歴史があるためです。Latanya Sweeney は、5 桁郵便番号・生年月日・性別の組み合わせで米国人の 87% が一意に識別できると推定し、公開選挙人名簿を用いて「匿名化」された州データからマサチューセッツ州知事 William Weld の医療記録を再識別しました——これが k-匿名性を生んだ結果です。2008 年には Narayanan と Shmatikov が、疎な評価を公開 IMDb プロファイルと突き合わせることで Netflix Prize データセット(約 50 万加入者)を非匿名化しました。2006 年の AOL 検索ログ公開も、数日で特定の個人まで辿られました。

GDPR では、真に匿名化されたデータは規則の対象外(前文 26)ですが、第 29 条作業部会の意見 05/2014、および EDPB・CNIL などの規制当局は、「合理的に利用可能」な手段を踏まえ、単独識別・連結可能性・推論を網羅した、文書化された再識別リスク評価を求めています。典型的な落とし穴は、ハッシュ化や単純な仮名のみに依存すること、高次元のマイクロデータを公開すること、仮名化と匿名化を混同することです。

flowchart TD
  R["生の個人データ"] --> D["直接識別子を除去"]
  D --> Q["準識別子を一般化 / 抑制"]
  Q --> M["プライバシーモデルを適用(k-匿名性 / 差分プライバシー)"]
  M --> T{"再識別リスクは許容範囲?"}
  T -->|"いいえ"| Q
  T -->|"はい"| P["匿名化データセットを公開 / 共有"]

● 例

  1. 01

    病院の再入院統計を地域・四半期で集計し、5 件未満のセルを抑制して公開する。

  2. 02

    公共のモビリティデータを「街区×週」の粒度に一般化して公開する。

● よくある質問

データ匿名化 とは何ですか?

他の利用可能な情報と組み合わせても直接的・間接的に個人を識別できないよう、個人データを不可逆に変換する処理。 サイバーセキュリティの プライバシーとデータ保護 カテゴリに属します。

データ匿名化 とはどういう意味ですか?

他の利用可能な情報と組み合わせても直接的・間接的に個人を識別できないよう、個人データを不可逆に変換する処理。

データ匿名化 からどのように防御しますか?

データ匿名化 に対する防御は通常、上記の定義で述べたとおり、技術的統制と運用上の実践を組み合わせます。

データ匿名化 の別名は何ですか?

一般的な別名: 匿名化, 強い非識別化。

● 関連用語

● 関連項目