Een beleidsmedewerker sleept een conceptrapport van veertig pagina's in een chatvenster met de vraag: maak hier een samenvatting van een half A4 van. Wat ze nodig heeft, is de conclusie. Wat ze heeft verstuurd, is veertig pagina's, drie bijlagen met namen erin, en de opmerkingen van twee collega's die in de kantlijn nog openstonden.
Dat verschil ontstaat niet omdat iemand slordig is. Het ontstaat omdat de handeling "upload dit" er anders uitziet dan wat hij feitelijk doet.
Stap 1: het bestand verlaat je computer
Zodra je een bestand loslaat in het venster, wordt het complete bestand geüpload naar de servers van de aanbieder. Niet een deel, niet een uittreksel: de bytes van het bestand zoals het op je schijf stond.
Dit is het moment waarop de gegevens je organisatie verlaten. Alles wat daarna gebeurt, gebeurt aan de andere kant.
Stap 2: de tekstlaag wordt eruit gehaald
Een pdf is geen tekstbestand. Het is een verzameling instructies om iets te tekenen op een pagina, met daarnaast meestal een tekstlaag die vertelt welke letters waar staan.
De dienst leest die tekstlaag uit. Wat daar mee naar buiten komt, is niet altijd wat je op het scherm ziet:
- Tekst onder afbeeldingen. Als iemand een zwarte rechthoek over een naam heeft getekend, staat de naam nog in de tekstlaag. Zie waarom een zwart vlak over tekst geen redactie is.
- Voetnoten, kopteksten, bijlagen. Alles wat in het document zit, ook wat jij niet had gelezen.
- Opmerkingen en wijzigingen. Bij een pdf die uit Word is geëxporteerd zonder de opmerkingen te verwijderen, komen die gewoon mee.
- Metadata. Auteursnaam, organisatie, aanmaakdatum, gebruikte software, en soms het volledige bestandspad van de computer waarop het document is gemaakt.
Bij een gescande pdf ligt het anders. Dan is er geen tekstlaag en is de pagina een afbeelding. Sommige diensten passen dan automatisch tekstherkenning toe en verwerken hem alsnog als tekst, andere melden dat ze er niets mee kunnen. Reken er niet op dat een scan onleesbaar is.
Stap 3: de tekst wordt in stukken geknipt
De uitgelezen tekst wordt opgedeeld in stukken en aan het gesprek toegevoegd. Vanaf dat moment is er geen onderscheid meer tussen "tekst die jij hebt getypt" en "tekst die uit een bestand komt". Het is allemaal gesprekstekst.
Dat heeft twee gevolgen die mensen zelden verwachten.
Het eerste: de inhoud telt mee in het context window. Een document van veertig pagina's vult een flink deel van de beschikbare ruimte, waardoor er minder overblijft voor het gesprek erna.
Het tweede: de inhoud reist mee bij elke volgende vraag in datzelfde gesprek. Stel je vijf vervolgvragen, dan wordt het document vijf keer opnieuw meegestuurd naar het model.
Stap 4: het blijft staan
Het geüploade bestand en de uitgelezen tekst komen in je gespreksgeschiedenis. Daarvoor gelden de gewone regels van de dienst: de bewaartermijn, de mogelijkheid tot menselijke beoordeling bij vermoeden van misbruik, en bij een consumentenaccount standaard het gebruik voor training.
Bij veel diensten blijft het originele bestand ook los bewaard, gekoppeld aan het gesprek, zodat je het later kunt terugzien. Verwijder je het gesprek, dan volgt het bestand meestal, maar niet altijd meteen. Hoe die lagen werken staat in wat een chatgeschiedenis technisch gezien is.
Waarom "alleen samenvatten" niet bestaat
Dit is de kern van het misverstand, en hij is begrijpelijk.
In je hoofd is samenvatten een kleine taak: je vraagt om weinig, dus je geeft weinig. Technisch is het omgekeerd. Om te kunnen samenvatten moet het model het geheel zien. De beknoptheid zit in het antwoord, niet in de invoer.
Hetzelfde geldt voor "haal er even de datums uit" of "controleer dit op tegenstrijdigheden". Het zijn kleine vragen over een groot document, en het hele document gaat mee.
Vergelijk het met plakken. Als je twee alinea's plakt, gaan er twee alinea's. Dat is de enige situatie waarin jij bepaalt wat er wordt verstuurd. Bij een upload bepaalt het bestand dat.
Wat je ervoor kunt doen
Drie vragen, in deze volgorde:
- Heeft de taak het hele document nodig? Vaak niet. Voor een toon-check is één alinea genoeg. Voor een vertaling van de conclusie hoeft de bijlage niet mee.
- Zitten er gegevens in die de taak niet nodig heeft? Namen, dossiernummers, bedragen, adressen. Haal ze eruit of vervang ze door een aanduiding, en houd de structuur intact zodat het model de tekst nog begrijpt.
- Klopt wat er niet op de pagina staat? Metadata, opmerkingen, wijzigingen bijhouden. Zie wat er in een pdf achterblijft als je alleen de tekst weghaalt.
Wie die drie vragen stelt, uploadt uiteindelijk vaker een fragment dan een dossier. Dat is beter voor het antwoord, want het model raakt minder afgeleid, en het scheelt precies de gegevens waarvan achteraf niemand kan uitleggen waarom ze de deur uit gingen.