Datenanonymisierung
Was ist Datenanonymisierung?
DatenanonymisierungUnwiderrufliche Umwandlung personenbezogener Daten, sodass keine Person mehr direkt oder indirekt – auch nicht durch Verknüpfung mit anderen Informationen – identifizierbar ist.
Die Datenanonymisierung wandelt personenbezogene Daten unwiderruflich so um, dass Personen nicht mehr herausgegriffen, verknüpft oder erschlossen werden können – selbst wenn die Veröffentlichung mit externen Informationen kombiniert wird. Kerntechniken sind Unterdrückung, Generalisierung (z. B. Vergröberung eines Geburtsdatums auf das Jahr), Aggregation, Perturbation/Rauschen und Randomisierung, bewertet anhand eines formalen Modells: k-Anonymität, l-Diversität, t-Closeness oder Differential Privacy, die kalibriertes Rauschen unter einem beweisbaren Privacy-Budget (ε) hinzufügt.
Die Hürde ist wegen einer langen Geschichte der Re-Identifikation hoch. Latanya Sweeney schätzte, dass 87 % der US-Bürger durch die Kombination aus 5-stelliger PLZ, Geburtsdatum und Geschlecht eindeutig sind, und nutzte Wählerverzeichnisse, um in „anonymisierten" Verwaltungsdaten die Krankenakten des Gouverneurs von Massachusetts William Weld zu re-identifizieren – das Ergebnis, das k-Anonymität motivierte. 2008 de-anonymisierten Narayanan und Shmatikov den Netflix-Prize-Datensatz (~500 000 Abonnenten), indem sie spärliche Bewertungen mit öffentlichen IMDb-Profilen korrelierten. Die Veröffentlichung der AOL-Suchprotokolle 2006 wurde binnen Tagen auf namentlich benannte Personen zurückverfolgt.
Nach der DSGVO fallen echt anonyme Daten aus der Verordnung (Erwägungsgrund 26), doch die Stellungnahme 05/2014 der Artikel-29-Gruppe sowie Behörden wie EDSA und CNIL verlangen eine dokumentierte Re-Identifikations-Risikobewertung zu Herausgreifen, Verknüpfbarkeit und Rückschluss unter „vernünftigerweise wahrscheinlichen" Mitteln. Typische Fehler: sich allein auf Hashing oder einfache Pseudonyme verlassen, hochdimensionale Mikrodaten veröffentlichen oder Pseudonymisierung mit Anonymisierung verwechseln.
flowchart TD
R["Rohe personenbezogene Daten"] --> D["Direkte Identifikatoren entfernen"]
D --> Q["Quasi-Identifikatoren generalisieren / unterdrücken"]
Q --> M["Privacy-Modell anwenden (k-Anonymität / Differential Privacy)"]
M --> T{"Re-Identifikationsrisiko akzeptabel?"}
T -->|"Nein"| Q
T -->|"Ja"| P["Anonymisierten Datensatz veröffentlichen / teilen"]● Beispiele
- 01
Veröffentlichung von Krankenhaus-Wiederaufnahmestatistiken aggregiert nach Region und Quartal, Zellen unter fünf werden unterdrückt.
- 02
Veröffentlichung eines öffentlichen Mobilitätsdatensatzes, dessen Trajektorien auf Stadtteil-Wochen-Granularität generalisiert sind.
● Häufige Fragen
Was ist Datenanonymisierung?
Unwiderrufliche Umwandlung personenbezogener Daten, sodass keine Person mehr direkt oder indirekt – auch nicht durch Verknüpfung mit anderen Informationen – identifizierbar ist. Es gehört zur Kategorie Datenschutz der Cybersicherheit.
Was bedeutet Datenanonymisierung?
Unwiderrufliche Umwandlung personenbezogener Daten, sodass keine Person mehr direkt oder indirekt – auch nicht durch Verknüpfung mit anderen Informationen – identifizierbar ist.
Wie schützt man sich gegen Datenanonymisierung?
Schutzmaßnahmen gegen Datenanonymisierung kombinieren typischerweise technische Kontrollen und operative Praktiken, wie in der Definition oben beschrieben.
Welche anderen Bezeichnungen gibt es für Datenanonymisierung?
Übliche alternative Bezeichnungen: Anonymisierung, Starke De-Identifikation.