Grip op AI
Blog
AI-datalekken 8 min leestijd

Wat betekent "we trainen niet op jouw data" precies?

De belofte dekt training. Hij dekt geen opslag, geen menselijke beoordeling, geen logging en geen bewaartermijn. Wat er wél gebeurt met tekst die niet wordt gebruikt om te trainen.

Abstracte golven met stippellijnen
Snel antwoord

"Wij trainen niet op jouw data" betekent één ding: je invoer wordt niet gebruikt om het model beter te maken. Het zegt niets over vier andere dingen die wél gebeuren. Je tekst wordt opgeslagen, meestal in de gespreksgeschiedenis en in technische logs. Medewerkers van de leverancier mogen er in bepaalde gevallen bij, bijvoorbeeld bij vermoeden van misbruik. Er geldt een bewaartermijn die je zelden zelf bepaalt. En die termijn kan opzij worden gezet door een rechter. De trainingsbelofte is echt, hij is alleen veel smaller dan hij klinkt.

01

De belofte gaat alleen over modeltraining, niet over opslag of toegang

02

Menselijke beoordeling bij vermoeden van misbruik staat los van de trainingsinstelling

03

Bewaartermijnen zijn beleid, geen eigenschap van het systeem

04

Een rechterlijk bevel kan een bewaartermijn overrulen, en dat is gebeurd

05

Vraag naar bewaartermijn en toegang, niet alleen naar training

Een compliance-medewerker bij een verzekeraar krijgt de vraag of een AI-assistent mag worden gebruikt voor het samenvatten van schadedossiers. Ze zoekt het na, vindt de zin "wij gebruiken jouw bedrijfsgegevens niet om onze modellen te trainen", zet er een vinkje bij en gaat door naar het volgende punt op de lijst.

Die zin klopt. Hij is alleen het antwoord op één vraag, en zij had er vijf.

Wat de belofte precies dekt

"Wij trainen niet op jouw data" betekent: wat jij intypt wordt niet gebruikt als leermateriaal om het model beter te maken. Bij zakelijke abonnementen is dat inmiddels de standaard bij de grote aanbieders, en het is een echte toezegging die contractueel vastligt.

Het gaat over één levensloop van je tekst: de weg naar het trainingsproces. Je tekst heeft nog vier andere levenslopen, en daar zegt de belofte niets over.

Eén: opslag

Je gesprek wordt bewaard. Dat moet ook wel, want anders kun je je geschiedenis niet terugzien en kan de dienst geen context vasthouden binnen een gesprek. Ook zonder training staat je tekst dus ergens in een database, gekoppeld aan je account.

Dat is niet stiekem en het staat gewoon in de voorwaarden. Maar het is wel een ander antwoord dan "je tekst is nergens". Voor een DPIA is dat verschil bepalend: opslag is een verwerking, en die heeft een grondslag, een doel en een bewaartermijn nodig.

Twee: menselijke beoordeling

Vrijwel elke aanbieder houdt zich het recht voor om gesprekken door mensen te laten bekijken. Meestal bij een vermoeden van misbruik, bij een veiligheidsmelding, of om de kwaliteit van de dienst te controleren.

Dat recht staat volledig los van de trainingsinstelling. Je kunt training uitzetten en toch onder deze bepaling vallen. In de praktijk gebeurt het zelden en bij een klein deel van de gesprekken, maar "zelden" is iets anders dan "niet", en in een risicobeoordeling hoort het onderscheid thuis.

Drie: technische logs

Naast het gesprek zelf loggen diensten het gebruik: welk account, welk tijdstip, welke hoeveelheid tekst, welke fouten. Bij API-gebruik zit daar vaak ook de inhoud van het verzoek bij, tenzij je een aparte afspraak hebt over minimale opslag.

Die logs vallen buiten de gespreksgeschiedenis die jij ziet, en ze hebben vaak een eigen bewaartermijn. Verwijder je een gesprek in de interface, dan is de bijbehorende logregel daarmee niet weg.

Vier: de bewaartermijn, en wie daarover gaat

De gebruikelijke afspraak is dat verwijderde gesprekken nog ongeveer dertig dagen in de systemen blijven staan voordat ze definitief verdwijnen. Bij zakelijke abonnementen kun je die termijn soms zelf instellen.

Belangrijk detail: dat is beleid, geen eigenschap van het systeem. In de rechtszaak van The New York Times tegen OpenAI moest het bedrijf uitvoerlogs bewaren die gebruikers hadden gewist, inclusief tijdelijke chats en verzoeken via de API. Enterprise-klanten en API-klanten met een aparte afspraak over minimale opslag vielen erbuiten, de rest niet.

Dat is de scherpste illustratie van het punt van dit stuk. De trainingsbelofte werd niet geschonden. Er werd op die gesprekken nog steeds niet getraind. En toch stond er tekst bewaard waarvan gebruikers dachten dat hij weg was.

Waarom dit onderscheid ertoe doet

Onder de AVG is het niet interessant of iets "training" heet. Wat telt is of persoonsgegevens worden verwerkt, door wie, waarvoor, en hoe lang. Elk van de vier punten hierboven is een verwerking.

Voor je verwerkersovereenkomst betekent dat: de trainingsclausule is één artikel. De bewaartermijn, de toegang door personeel van de leverancier, de subverwerkers en de doorgifte zijn er nog vier, en die zijn samen belangrijker.

Er is nog een tweede reden. De vraag of een model dat op persoonsgegevens is getraind zelf persoonsgegevens bevat, is niet triviaal. De Europese privacytoezichthouders concludeerden in hun opinie over AI-modellen dat een model niet zomaar als anoniem kan worden beschouwd en dat je dat per geval moet beoordelen. Ook aan de andere kant van de trainingsvraag is het antwoord dus minder eenvoudig dan het klinkt.

Wat je in plaats daarvan vraagt

Vier vragen die samen wél een beeld geven:

  1. Hoe lang bewaren jullie mijn invoer, en kan ik die termijn zelf instellen?
  2. Wie binnen jullie organisatie kan bij mijn gesprekken, en onder welke voorwaarden?
  3. Wat gebeurt er met technische logs, en gelden daar dezelfde termijnen voor?
  4. Onder welke rechtsmacht vallen jullie, en wat doen jullie bij een vordering?

Als een leverancier op alle vier een helder antwoord heeft, is de trainingsvraag bijna een bijzaak. Kan hij alleen de trainingsvraag beantwoorden, dan weet je precies één ding.

Waar dit voor de dagelijkse praktijk op neerkomt: de instelling regelt wat de leverancier met jouw tekst mag doen, en niet wat er in die tekst staat. Dat tweede is het enige dat nog te veranderen is op het moment dat iemand op verzenden staat te drukken.

FAQ

Veelgestelde vragen

Betekent "niet trainen" dat mijn tekst niet wordt opgeslagen?

Nee. Training en opslag zijn twee verschillende dingen. Vrijwel alle AI-diensten bewaren je gesprekken, ook als er niet op wordt getraind, al was het maar om je geschiedenis te kunnen tonen en om misbruik te kunnen onderzoeken. De trainingsinstelling verandert daar niets aan.

Kan een medewerker van de leverancier mijn gesprekken lezen?

In bepaalde gevallen wel. Vrijwel elke aanbieder houdt zich het recht voor om gesprekken te laten beoordelen bij een vermoeden van misbruik of een veiligheidsmelding. Dat recht staat los van de trainingsinstelling en verdwijnt niet als je die uitzet.

Hoe lang blijven mijn gesprekken bewaard?

Meestal blijven verwijderde gesprekken nog ongeveer dertig dagen in de systemen staan voordat ze definitief weg zijn. Bij zakelijke abonnementen kun je die termijn soms zelf instellen. Bij gratis accounts vrijwel nooit.

Kan een bewaartermijn worden overruled?

Ja. In de rechtszaak van The New York Times tegen OpenAI kreeg het bedrijf het bevel om uitvoerlogs te bewaren die gebruikers hadden gewist, inclusief tijdelijke chats. Een bewaartermijn is beleid van de leverancier, geen natuurwet.

Wat vraag ik dan wel aan een AI-leverancier?

Vier dingen naast training: hoe lang bewaar je mijn invoer, wie binnen jouw organisatie kan erbij en onder welke voorwaarden, wat gebeurt er met technische logs, en onder welke rechtsmacht val je. Die vier bepalen samen het werkelijke risico. Training is er daar één van.

Portret van Rens Timmermans van BeeSensible

Liever iemand die het laat zien?

Rens, BeeSensible

Ik geef je graag een rondleiding van twintig minuten. Laat je gegevens achter, dan zoek ik een moment dat jou uitkomt. Bellen of mailen mag natuurlijk ook.

Liever eerst iemand spreken? Plan een call.

Wil je een live demo, of een offerte voor 100+ gebruikers? Laat je gegevens achter en we nemen binnen één werkdag contact op.