Anonimización de datos
¿Qué es Anonimización de datos?
Anonimización de datosTransformación irreversible de datos personales para que nadie pueda ser identificado, directa o indirectamente, ni siquiera al combinarlos con otra información disponible.
La anonimización de datos transforma de forma irreversible los datos personales para que las personas ya no puedan ser individualizadas, vinculadas ni inferidas, ni siquiera cruzando la publicación con información externa. Las técnicas principales son supresión, generalización (p. ej. reducir una fecha de nacimiento a solo el año), agregación, perturbación/ruido y aleatorización, evaluadas con un modelo formal: k-anonimidad, l-diversidad, t-cercanía o privacidad diferencial, que añade ruido calibrado bajo un presupuesto de privacidad demostrable (ε).
El listón es alto por un largo historial de reidentificación. Latanya Sweeney estimó que el 87 % de los estadounidenses son únicos por la combinación de código postal de 5 dígitos, fecha de nacimiento y sexo, y usó el censo electoral para reidentificar los registros hospitalarios del gobernador de Massachusetts William Weld en datos estatales «anonimizados»: el resultado que motivó la k-anonimidad. En 2008, Narayanan y Shmatikov reidentificaron el conjunto del Netflix Prize (~500 000 suscriptores) correlacionando valoraciones dispersas con perfiles públicos de IMDb. La publicación de los registros de búsqueda de AOL en 2006 se rastreó hasta personas concretas en pocos días.
Bajo el RGPD, los datos verdaderamente anónimos quedan fuera del Reglamento (considerando 26), pero el Dictamen 05/2014 del Grupo del Artículo 29 y autoridades como el EDPB y la CNIL exigen una evaluación documentada del riesgo de reidentificación que cubra individualización, vinculabilidad e inferencia con los medios «razonablemente probables». Errores comunes: apoyarse solo en hashing o seudónimos, publicar microdatos de alta dimensionalidad o confundir seudonimización con anonimización.
flowchart TD
R["Datos personales en bruto"] --> D["Eliminar identificadores directos"]
D --> Q["Generalizar / suprimir cuasi-identificadores"]
Q --> M["Aplicar modelo de privacidad (k-anonimidad / privacidad diferencial)"]
M --> T{"¿Riesgo de reidentificación aceptable?"}
T -->|"No"| Q
T -->|"Sí"| P["Publicar / compartir conjunto anonimizado"]● Ejemplos
- 01
Publicar estadísticas de reingresos hospitalarios agregadas por región y trimestre, suprimiendo celdas con menos de cinco casos.
- 02
Liberar un conjunto público de movilidad con trayectorias generalizadas a granularidad de barrio y semana.
● Preguntas frecuentes
¿Qué es Anonimización de datos?
Transformación irreversible de datos personales para que nadie pueda ser identificado, directa o indirectamente, ni siquiera al combinarlos con otra información disponible. Pertenece a la categoría de Privacidad y protección de datos en ciberseguridad.
¿Qué significa Anonimización de datos?
Transformación irreversible de datos personales para que nadie pueda ser identificado, directa o indirectamente, ni siquiera al combinarlos con otra información disponible.
¿Cómo defenderse de Anonimización de datos?
Las defensas contra Anonimización de datos combinan habitualmente controles técnicos y prácticas operativas, como se detalla en la definición.
¿Cuáles son otros nombres para Anonimización de datos?
Nombres alternativos comunes: Anonimización, De-identificación fuerte.