In januari 2019 dienden de advocaten van Paul Manafort een processtuk in bij een Amerikaanse rechtbank. De gevoelige passages waren zwart gemaakt. Binnen een paar uur hadden journalisten die passages gewoon gelezen: de tekst stond nog onder de zwarte balken en kon worden geselecteerd en geplakt.
Het was geen slordige advocaat en geen kapotte software. Het was een misverstand over hoe een pdf in elkaar zit, en dat misverstand komt dagelijks voor bij mensen die zorgvuldig proberen te zijn.
Een pdf bestaat uit lagen
Een pdf is geen plaatje van een pagina. Het is een verzameling instructies: teken deze letter hier, deze lijn daar, deze afbeelding op die plek.
Grofweg zijn er twee dingen die er tegelijk in zitten:
- De tekstlaag. Welke letters er staan, in welk lettertype, op welke coördinaten. Dit is wat je selecteert als je met je muis over de pagina sleept, en dit is wat zoekmachines en AI-tools uitlezen.
- De tekenlaag. Vormen, lijnen, afbeeldingen, kaders. Alles wat wordt getekend.
Als je in een pdf-lezer een zwarte rechthoek over een naam tekent, voeg je iets toe aan de tekenlaag. Er wordt niets verwijderd. De naam staat nog exact waar hij stond, en hij is nog steeds selecteerbaar.
Wat je hebt gedaan, is de tekst onzichtbaar maken voor het oog. Niet voor de computer.
Dezelfde fout in andere vormen
Het patroon herhaalt zich in elk programma waar mensen mee werken:
- Zwarte markeerstift in Word. Een markering is opmaak. De tekst blijft staan. Opmaak weghalen of kopiëren geeft de inhoud terug.
- Witte tekst op witte achtergrond. Onzichtbaar, volledig aanwezig.
- Een afbeelding over de tekst plakken. De afbeelding staat erboven, de tekst eronder.
- Kolommen verbergen in een spreadsheet. Verborgen is niet weg. Eén klik en ze zijn terug.
- Een dia met een vak eroverheen in een presentatie. Zelfde verhaal, en bij export naar pdf gaat het gewoon mee.
Wat al deze gevallen delen: de handeling voelt definitief omdat het resultaat er definitief uitziet.
Waarom dit bij AI-tools erger uitpakt
Bij een document dat je naar een collega stuurt, moet iemand actief gaan zitten selecteren en plakken om de fout te vinden. Dat gebeurt zelden.
Bij een AI-tool gebeurt het automatisch. De tool leest de tekstlaag uit om te kunnen samenvatten of doorzoeken. De zwarte rechthoek is voor het uitleesproces gewoon een vorm die genegeerd wordt. De naam eronder komt er in volle glorie doorheen.
En je merkt het niet, want het antwoord noemt de naam waarschijnlijk niet. Je vroeg om een samenvatting, niet om de namen. Wat er is verstuurd, zie je niet terug in wat je krijgt. Zie ook wat gebeurt er als je een pdf uploadt naar een chatbot.
Wat wel werkt
Drie stappen, in deze volgorde.
Gebruik een echte redactiefunctie. Programma's die pdf's bewerken hebben een aparte functie die de onderliggende inhoud daadwerkelijk verwijdert in plaats van hem te bedekken. Zoek naar "redigeren" of "redact", niet naar de tekengereedschappen.
Maak het document daarna plat. Bij veel programma's is er een aparte stap die het bestand opnieuw opbouwt zonder de bewerkingsgeschiedenis. Zonder die stap kan de vorige versie soms nog worden teruggehaald.
Controleer het resultaat. Dit is de stap die iedereen overslaat en die het hele verschil maakt. Open het bestand, selecteer alles, kopieer het, plak het in een lege tekstverwerker. Wat daar verschijnt, is wat er werkelijk in staat. Zoek dan nog even op een naam of een nummer dat weg had moeten zijn.
Die controle kost dertig seconden en hij is de enige manier om zeker te weten dat je niet naar een plaatje van veiligheid zit te kijken.
En dan is er nog een laag die je met geen enkele redactiefunctie ziet: de gegevens die niet op de pagina staan maar wel in het bestand zitten. Zie wat er in een pdf achterblijft als je alleen de tekst weghaalt.