Een HR-afdeling deelt een geanonimiseerd verslag van een klachtenprocedure met het managementteam. De namen zijn eruit. Wat erin staat: een medewerker van de afdeling inkoop, in dienst sinds 2019, die in maart een gesprek had over een reorganisatiebesluit.
De afdeling inkoop heeft veertien mensen. Drie zijn er in 2019 begonnen. Eén daarvan had in maart dat gesprek.
Er staat geen naam in het document, en iedereen aan tafel weet over wie het gaat.
Twee soorten identificerende gegevens
Directe identificatoren wijzen in hun eentje één persoon aan: naam, BSN, e-mailadres, personeelsnummer, telefoonnummer. Die zijn makkelijk te herkennen en worden bij anonimiseren vrijwel altijd weggehaald.
Quasi-identificatoren zeggen op zichzelf niets en in combinatie alles. Postcode, geboortedatum, geslacht, functietitel, afdeling, dienstjaren, opleidingsniveau, de datum van een gebeurtenis. Elk van deze velden past bij duizenden mensen. Drie ervan samen passen vaak bij één.
Het klassieke onderzoek hiernaar is van Latanya Sweeney, die liet zien dat postcode, geboortedatum en geslacht samen het overgrote deel van de Amerikaanse bevolking uniek identificeren. Ze demonstreerde het door uit een "geanonimiseerde" verzameling medische gegevens het dossier van een gouverneur terug te vinden.
Waarom het in organisaties sneller gaat
Dat onderzoek ging over een heel land. Binnen een organisatie werkt het mechanisme identiek en veel efficiënter, omdat de groep kleiner is.
"Een teamleider in de regio Noord" is in een landelijke dataset betekenisloos. Binnen een bedrijf met drie regio's en twaalf teamleiders wijst het vier mensen aan. Voeg "sinds vorig jaar" toe en het is er één.
Daar komt bij dat de lezers voorkennis hebben. Een extern onderzoeker heeft alleen het document. Een collega weet wie er in maart een gesprek had, wie er met zwangerschapsverlof was, en wie er als enige met dat project bezig was. Die voorkennis is geen dataset en werkt wel als sleutel.
Dat is de reden dat herleidbaarheid geen eigenschap van een document is maar van een document plus een publiek. Zie ook anonimiseren, pseudonimiseren, maskeren.
De onderschatte velden
Drie categorieën die bijna altijd blijven staan omdat ze onschuldig lijken.
Datums. De datum van een ziekmelding, een gesprek, een besluit of een incident. Voor de lezer vaak een directe verwijzing naar één gebeurtenis, en daarmee naar één persoon.
Getallen die uniek zijn in een kleine groep. Een bedrag, een aantal dienstjaren, een score, een klantnummer dat niet is weggehaald omdat het "geen persoonsgegeven" is.
Beschrijvingen van gebeurtenissen. "De medewerker die vorig jaar de aanbesteding deed" is geen naam en het is wel een aanwijzing waar precies één persoon op past.
Hoe je het beoordeelt
Niet door naar velden te kijken, maar naar combinaties, en altijd tegen een publiek.
- Wie leest dit? Een extern publiek zonder voorkennis is iets anders dan het MT dat de mensen kent.
- Hoe groot is de groep waaruit deze persoon komt? Bij een team van twaalf is elke eigenschap bijna een identificator.
- Welke combinaties blijven over? Neem de resterende velden en vraag: hoeveel mensen passen hierop? Als het antwoord onder de vijf ligt, is het niet anoniem.
- Kan het generieker? Een leeftijdsklasse in plaats van een geboortedatum. Een kwartaal in plaats van een datum. "Een medewerker" in plaats van een functietitel.
Die vierde stap is het echte werk, en hij kost inhoud. Dat is de afruil die bij anonimiseren hoort: hoe minder herleidbaar, hoe minder bruikbaar. Wie dat niet expliciet maakt, kiest hem impliciet, en meestal in de verkeerde richting.
Waarom dit bij AI-tools extra telt
Bij een document dat je binnen de organisatie deelt, is het publiek bekend en dus in te schatten.
Bij een AI-tool weet je dat niet. De tekst gaat naar een dienst die er nog van alles bij kan halen, in een gesprek dat blijft staan, met een bewaartermijn die je niet zelf bepaalt. De combinatie van velden die intern net acceptabel was, staat daar in een context die je niet overziet.
De praktische regel die daaruit volgt is prettig simpel: haal weg wat de taak niet nodig heeft, en laat de vraag of het "anoniem genoeg" is dan voor wat hij is. Een verslag laten herschrijven lukt zonder afdeling, zonder dienstjaren en zonder datum. Dan hoef je de rekensom niet te maken.