Grip op AI
Blog
AI-DLP 7 min leestijd

Waarom "haal de namen eruit" niet genoeg is

Postcode, geboortedatum en geslacht samen identificeren de meeste mensen. Over quasi-identificatoren, en waarom anonimiseren een rekensom is.

Abstracte vervaagde kaartjes in teal
Snel antwoord

Een naam is een directe identificator: hij wijst in zijn eentje één persoon aan. Er zijn ook quasi-identificatoren, gegevens die op zichzelf niets zeggen en in combinatie wel: postcode, geboortedatum, geslacht, functietitel, de datum van een gebeurtenis. Onderzoek van Latanya Sweeney liet zien dat postcode, geboortedatum en geslacht samen het overgrote deel van de Amerikaanse bevolking uniek identificeren. Namen weghalen is daarom een eerste stap en zelden de laatste. Hoe kleiner de groep waarover je schrijft, hoe sneller een combinatie tot één persoon leidt.

01

Directe identificatoren wijzen alleen een persoon aan, quasi-identificatoren in combinatie

02

Postcode plus geboortedatum plus geslacht identificeert de meeste mensen

03

In een klein team is één functietitel al genoeg

04

Datums van gebeurtenissen zijn onderschatte identificatoren

05

Herleidbaarheid hangt af van de groep, niet alleen van het document

Een HR-afdeling deelt een geanonimiseerd verslag van een klachtenprocedure met het managementteam. De namen zijn eruit. Wat erin staat: een medewerker van de afdeling inkoop, in dienst sinds 2019, die in maart een gesprek had over een reorganisatiebesluit.

De afdeling inkoop heeft veertien mensen. Drie zijn er in 2019 begonnen. Eén daarvan had in maart dat gesprek.

Er staat geen naam in het document, en iedereen aan tafel weet over wie het gaat.

Twee soorten identificerende gegevens

Directe identificatoren wijzen in hun eentje één persoon aan: naam, BSN, e-mailadres, personeelsnummer, telefoonnummer. Die zijn makkelijk te herkennen en worden bij anonimiseren vrijwel altijd weggehaald.

Quasi-identificatoren zeggen op zichzelf niets en in combinatie alles. Postcode, geboortedatum, geslacht, functietitel, afdeling, dienstjaren, opleidingsniveau, de datum van een gebeurtenis. Elk van deze velden past bij duizenden mensen. Drie ervan samen passen vaak bij één.

Het klassieke onderzoek hiernaar is van Latanya Sweeney, die liet zien dat postcode, geboortedatum en geslacht samen het overgrote deel van de Amerikaanse bevolking uniek identificeren. Ze demonstreerde het door uit een "geanonimiseerde" verzameling medische gegevens het dossier van een gouverneur terug te vinden.

Waarom het in organisaties sneller gaat

Dat onderzoek ging over een heel land. Binnen een organisatie werkt het mechanisme identiek en veel efficiënter, omdat de groep kleiner is.

"Een teamleider in de regio Noord" is in een landelijke dataset betekenisloos. Binnen een bedrijf met drie regio's en twaalf teamleiders wijst het vier mensen aan. Voeg "sinds vorig jaar" toe en het is er één.

Daar komt bij dat de lezers voorkennis hebben. Een extern onderzoeker heeft alleen het document. Een collega weet wie er in maart een gesprek had, wie er met zwangerschapsverlof was, en wie er als enige met dat project bezig was. Die voorkennis is geen dataset en werkt wel als sleutel.

Dat is de reden dat herleidbaarheid geen eigenschap van een document is maar van een document plus een publiek. Zie ook anonimiseren, pseudonimiseren, maskeren.

De onderschatte velden

Drie categorieën die bijna altijd blijven staan omdat ze onschuldig lijken.

Datums. De datum van een ziekmelding, een gesprek, een besluit of een incident. Voor de lezer vaak een directe verwijzing naar één gebeurtenis, en daarmee naar één persoon.

Getallen die uniek zijn in een kleine groep. Een bedrag, een aantal dienstjaren, een score, een klantnummer dat niet is weggehaald omdat het "geen persoonsgegeven" is.

Beschrijvingen van gebeurtenissen. "De medewerker die vorig jaar de aanbesteding deed" is geen naam en het is wel een aanwijzing waar precies één persoon op past.

Hoe je het beoordeelt

Niet door naar velden te kijken, maar naar combinaties, en altijd tegen een publiek.

  1. Wie leest dit? Een extern publiek zonder voorkennis is iets anders dan het MT dat de mensen kent.
  2. Hoe groot is de groep waaruit deze persoon komt? Bij een team van twaalf is elke eigenschap bijna een identificator.
  3. Welke combinaties blijven over? Neem de resterende velden en vraag: hoeveel mensen passen hierop? Als het antwoord onder de vijf ligt, is het niet anoniem.
  4. Kan het generieker? Een leeftijdsklasse in plaats van een geboortedatum. Een kwartaal in plaats van een datum. "Een medewerker" in plaats van een functietitel.

Die vierde stap is het echte werk, en hij kost inhoud. Dat is de afruil die bij anonimiseren hoort: hoe minder herleidbaar, hoe minder bruikbaar. Wie dat niet expliciet maakt, kiest hem impliciet, en meestal in de verkeerde richting.

Waarom dit bij AI-tools extra telt

Bij een document dat je binnen de organisatie deelt, is het publiek bekend en dus in te schatten.

Bij een AI-tool weet je dat niet. De tekst gaat naar een dienst die er nog van alles bij kan halen, in een gesprek dat blijft staan, met een bewaartermijn die je niet zelf bepaalt. De combinatie van velden die intern net acceptabel was, staat daar in een context die je niet overziet.

De praktische regel die daaruit volgt is prettig simpel: haal weg wat de taak niet nodig heeft, en laat de vraag of het "anoniem genoeg" is dan voor wat hij is. Een verslag laten herschrijven lukt zonder afdeling, zonder dienstjaren en zonder datum. Dan hoef je de rekensom niet te maken.

FAQ

Veelgestelde vragen

Wat is een quasi-identificator?

Een gegeven dat op zichzelf geen persoon aanwijst maar in combinatie met andere gegevens wel. Postcode, geboortedatum, geslacht, functietitel, dienstjaren en de datum van een gebeurtenis zijn de bekendste voorbeelden.

Hoeveel gegevens heb je nodig om iemand te herleiden?

Vaak minder dan drie. Het klassieke onderzoek van Latanya Sweeney liet zien dat postcode, geboortedatum en geslacht samen het overgrote deel van de Amerikaanse bevolking uniek aanwijzen. In een organisatiecontext gaat het nog sneller, omdat de groep kleiner is.

Waarom maakt de groepsgrootte uit?

Omdat herleidbaarheid relatief is. "Een teamleider in Zwolle" zegt weinig in een landelijke dataset en wijst binnen een afdeling van twaalf mensen precies één persoon aan. Dezelfde bewerking kan in de ene context anoniem opleveren en in de andere niet.

Zijn datums gevaarlijk in een geanonimiseerd document?

Ze worden onderschat. De datum van een gebeurtenis, een ziekmelding, een gesprek of een besluit is vaak bekend bij de mensen die het document lezen. Daarmee is de datum een sleutel naar de persoon, ook zonder verdere gegevens.

Hoe pak je dit praktisch aan?

Kijk niet naar velden maar naar combinaties, en beoordeel tegen de groep die het document leest. Generaliseer waar het kan: een leeftijdsklasse in plaats van een geboortedatum, een maand in plaats van een datum, een regio in plaats van een postcode.

Portret van Rens Timmermans van BeeSensible

Liever iemand die het laat zien?

Rens, BeeSensible

Ik geef je graag een rondleiding van twintig minuten. Laat je gegevens achter, dan zoek ik een moment dat jou uitkomt. Bellen of mailen mag natuurlijk ook.

Liever eerst iemand spreken? Plan een call.

Wil je een live demo, of een offerte voor 100+ gebruikers? Laat je gegevens achter en we nemen binnen één werkdag contact op.