Grip op AI
Blog
AI-datalekken 8 min leestijd

Wat gebeurt er als je een pdf uploadt naar een chatbot?

Stap voor stap: wat er met je bestand gebeurt tussen het moment dat je het sleept en het moment dat er een samenvatting verschijnt. En waarom "alleen samenvatten" niet bestaat.

Abstracte kaders met ronde hoeken
Snel antwoord

Je bestand gaat in zijn geheel naar de server van de aanbieder. Daar wordt de tekstlaag eruit gehaald, in stukken geknipt en aan het gesprek toegevoegd, samen met eventuele metadata. Vanaf dat moment is de inhoud gewone gesprekstekst: hij telt mee in het context window, hij komt in je gespreksgeschiedenis, en hij valt onder dezelfde bewaartermijn als alles wat je typt. Bij een gescande pdf gaat het anders: zonder tekstlaag is er niets te lezen, tenzij de dienst tekstherkenning toepast. "Ik heb het alleen laten samenvatten" beschrijft wat jij vroeg, niet wat er is verstuurd.

01

Het hele bestand gaat naar de server, niet alleen het deel dat je nodig hebt

02

De tekstlaag wordt uitgelezen en aan het gesprek toegevoegd als gewone tekst

03

Metadata zoals auteur en bestandspad kan meekomen zonder dat je het ziet

04

Wat er in de wijzigingen of opmerkingen staat, hoort ook bij het bestand

05

Samenvatten is geen aparte, veiligere verwerking: alles gaat mee

Een beleidsmedewerker sleept een conceptrapport van veertig pagina's in een chatvenster met de vraag: maak hier een samenvatting van een half A4 van. Wat ze nodig heeft, is de conclusie. Wat ze heeft verstuurd, is veertig pagina's, drie bijlagen met namen erin, en de opmerkingen van twee collega's die in de kantlijn nog openstonden.

Dat verschil ontstaat niet omdat iemand slordig is. Het ontstaat omdat de handeling "upload dit" er anders uitziet dan wat hij feitelijk doet.

Stap 1: het bestand verlaat je computer

Zodra je een bestand loslaat in het venster, wordt het complete bestand geüpload naar de servers van de aanbieder. Niet een deel, niet een uittreksel: de bytes van het bestand zoals het op je schijf stond.

Dit is het moment waarop de gegevens je organisatie verlaten. Alles wat daarna gebeurt, gebeurt aan de andere kant.

Stap 2: de tekstlaag wordt eruit gehaald

Een pdf is geen tekstbestand. Het is een verzameling instructies om iets te tekenen op een pagina, met daarnaast meestal een tekstlaag die vertelt welke letters waar staan.

De dienst leest die tekstlaag uit. Wat daar mee naar buiten komt, is niet altijd wat je op het scherm ziet:

  • Tekst onder afbeeldingen. Als iemand een zwarte rechthoek over een naam heeft getekend, staat de naam nog in de tekstlaag. Zie waarom een zwart vlak over tekst geen redactie is.
  • Voetnoten, kopteksten, bijlagen. Alles wat in het document zit, ook wat jij niet had gelezen.
  • Opmerkingen en wijzigingen. Bij een pdf die uit Word is geëxporteerd zonder de opmerkingen te verwijderen, komen die gewoon mee.
  • Metadata. Auteursnaam, organisatie, aanmaakdatum, gebruikte software, en soms het volledige bestandspad van de computer waarop het document is gemaakt.

Bij een gescande pdf ligt het anders. Dan is er geen tekstlaag en is de pagina een afbeelding. Sommige diensten passen dan automatisch tekstherkenning toe en verwerken hem alsnog als tekst, andere melden dat ze er niets mee kunnen. Reken er niet op dat een scan onleesbaar is.

Stap 3: de tekst wordt in stukken geknipt

De uitgelezen tekst wordt opgedeeld in stukken en aan het gesprek toegevoegd. Vanaf dat moment is er geen onderscheid meer tussen "tekst die jij hebt getypt" en "tekst die uit een bestand komt". Het is allemaal gesprekstekst.

Dat heeft twee gevolgen die mensen zelden verwachten.

Het eerste: de inhoud telt mee in het context window. Een document van veertig pagina's vult een flink deel van de beschikbare ruimte, waardoor er minder overblijft voor het gesprek erna.

Het tweede: de inhoud reist mee bij elke volgende vraag in datzelfde gesprek. Stel je vijf vervolgvragen, dan wordt het document vijf keer opnieuw meegestuurd naar het model.

Stap 4: het blijft staan

Het geüploade bestand en de uitgelezen tekst komen in je gespreksgeschiedenis. Daarvoor gelden de gewone regels van de dienst: de bewaartermijn, de mogelijkheid tot menselijke beoordeling bij vermoeden van misbruik, en bij een consumentenaccount standaard het gebruik voor training.

Bij veel diensten blijft het originele bestand ook los bewaard, gekoppeld aan het gesprek, zodat je het later kunt terugzien. Verwijder je het gesprek, dan volgt het bestand meestal, maar niet altijd meteen. Hoe die lagen werken staat in wat een chatgeschiedenis technisch gezien is.

Waarom "alleen samenvatten" niet bestaat

Dit is de kern van het misverstand, en hij is begrijpelijk.

In je hoofd is samenvatten een kleine taak: je vraagt om weinig, dus je geeft weinig. Technisch is het omgekeerd. Om te kunnen samenvatten moet het model het geheel zien. De beknoptheid zit in het antwoord, niet in de invoer.

Hetzelfde geldt voor "haal er even de datums uit" of "controleer dit op tegenstrijdigheden". Het zijn kleine vragen over een groot document, en het hele document gaat mee.

Vergelijk het met plakken. Als je twee alinea's plakt, gaan er twee alinea's. Dat is de enige situatie waarin jij bepaalt wat er wordt verstuurd. Bij een upload bepaalt het bestand dat.

Wat je ervoor kunt doen

Drie vragen, in deze volgorde:

  1. Heeft de taak het hele document nodig? Vaak niet. Voor een toon-check is één alinea genoeg. Voor een vertaling van de conclusie hoeft de bijlage niet mee.
  2. Zitten er gegevens in die de taak niet nodig heeft? Namen, dossiernummers, bedragen, adressen. Haal ze eruit of vervang ze door een aanduiding, en houd de structuur intact zodat het model de tekst nog begrijpt.
  3. Klopt wat er niet op de pagina staat? Metadata, opmerkingen, wijzigingen bijhouden. Zie wat er in een pdf achterblijft als je alleen de tekst weghaalt.

Wie die drie vragen stelt, uploadt uiteindelijk vaker een fragment dan een dossier. Dat is beter voor het antwoord, want het model raakt minder afgeleid, en het scheelt precies de gegevens waarvan achteraf niemand kan uitleggen waarom ze de deur uit gingen.

FAQ

Veelgestelde vragen

Gaat mijn hele pdf naar de AI, of alleen het deel dat nodig is?

Het hele bestand gaat naar de server. Daarna bepaalt de dienst welke delen aan het model worden voorgelegd, maar dat gebeurt pas nadat het bestand is aangekomen en uitgelezen. De selectie vindt aan hun kant plaats, niet aan die van jou.

Wat gebeurt er met een gescande pdf?

Een gescande pdf is een afbeelding zonder tekstlaag. Zonder tekstherkenning valt er niets uit te lezen. Sommige diensten passen die herkenning automatisch toe en verwerken de pagina dan alsnog als tekst, andere niet. Ga er niet vanuit dat een scan onleesbaar is.

Komt de metadata van mijn document ook mee?

Vaak wel. Een pdf bevat velden zoals auteur, organisatie, aanmaakdatum, gebruikte software en soms het volledige bestandspad van de computer waarop hij is gemaakt. Dat zijn gegevens die niet op de pagina staan en wel in het bestand zitten.

Is samenvatten veiliger dan de tekst plakken?

Nee, het is meestal minder veilig. Bij plakken kies je wat er meegaat. Bij uploaden gaat het complete document mee, inclusief de bijlagen, de voetnoten en de pagina's die je zelf niet had gelezen.

Wat kan ik het beste doen voordat ik een document upload?

Kijk of de taak het hele document nodig heeft. Meestal niet. Gaat het toch om het geheel, verwijder dan eerst de gegevens die de taak niet nodig heeft en controleer de metadata. Zie de gids over het anonimiseren van een pdf voordat je hem deelt.

Portret van Rens Timmermans van BeeSensible

Liever iemand die het laat zien?

Rens, BeeSensible

Ik geef je graag een rondleiding van twintig minuten. Laat je gegevens achter, dan zoek ik een moment dat jou uitkomt. Bellen of mailen mag natuurlijk ook.

Liever eerst iemand spreken? Plan een call.

Wil je een live demo, of een offerte voor 100+ gebruikers? Laat je gegevens achter en we nemen binnen één werkdag contact op.