Een gemeente stuurt een geanonimiseerd rapport naar een journalist. De namen in de tekst zijn netjes weggehaald. In de documenteigenschappen staat de auteur, en in het bestandspad staat de map waarin het stuk stond: de achternaam van de betrokken ambtenaar en de naam van het dossier.
Er is niets misgegaan met de redactie. Er is alleen gekeken naar wat er op de pagina staat.
Wat er in het bestand zit zonder op de pagina te staan
Een pdf draagt een set velden mee die je alleen ziet als je ernaar zoekt:
- Auteur en organisatie. Meestal automatisch overgenomen uit de instellingen van het programma waarmee het document is gemaakt.
- Titel, onderwerp en trefwoorden. Vaak nog de werktitel uit een eerdere versie.
- Aanmaakdatum en datum van laatste wijziging. Inclusief tijdstip.
- Gebruikte software. Welk programma, welke versie.
- Het bestandspad. Bij sommige exportroutes komt het volledige pad van het bronbestand mee.
- XMP-velden. Een uitgebreidere set die programma's onderling gebruiken en waar van alles in kan staan, tot en met de bewerkingsgeschiedenis.
Dat bestandspad is het onderschatte veld. Iets als C:/Users/j.dewilde/Dossiers/Fusie-Noordkant/concept-v4.docx bevat een gebruikersnaam, een projectnaam en een versienummer, en geen daarvan stond op de pagina.
Wat er meekomt uit de bron
Naast de standaardvelden hangt het ervan af waar het document vandaan komt.
Uit Word. Opmerkingen in de kantlijn en bijgehouden wijzigingen kunnen meekomen in de export, afhankelijk van de instellingen. Wie een concept met commentaar van drie collega's exporteert zonder die eerst te accepteren of te verwijderen, deelt dat commentaar mee. Zie ook wat er bij "opslaan als pdf" niet wordt weggehaald.
Uit een systeem. Exports uit een dossier- of zaaksysteem bevatten soms interne verwijzingen: zaaknummers, gebruikers-id's, de naam van de sjabloon.
Uit een scanner. Apparaatnaam, soms een apparaatnummer en de instellingen waarmee is gescand.
Waarom redactie hier niet bij komt
Dit is het punt dat mensen verrast, en het is eigenlijk logisch.
Redactie werkt op de inhoud van de pagina: die passage moet weg, dus die tekst wordt verwijderd. De documenteigenschappen staan daar volledig buiten. Ze zijn geen onderdeel van de pagina, dus een gereedschap dat de pagina bewerkt raakt ze niet aan.
Je kunt dus een document perfect redigeren volgens alle regels uit waarom een zwart vlak over tekst geen redactie is, en nog steeds de naam van de opsteller meesturen.
Metadata verwijderen is een aparte handeling, met een aparte knop, in vrijwel elk programma.
Waarom AI-tools dit meelezen
Bij het uitlezen van een geüpload bestand pakken diensten meestal meer dan alleen de zichtbare tekst. Wat er precies wordt meegenomen verschilt per aanbieder en staat zelden gedocumenteerd.
De veilige aanname is dus: wat in het bestand zit, gaat naar de dienst. Niet omdat er iets misgaat, maar omdat je het bestand hebt verstuurd en niet de pagina.
Dat is ook meteen het praktische argument om metadata te controleren vóór een upload en niet alleen vóór een verzending naar buiten. Een interne upload naar een chatbot is een externe verzending.
Wat je doet voordat je deelt
- Open de documenteigenschappen. In vrijwel elke pdf-lezer onder bestand of documenteigenschappen. Kijk naar auteur, titel, en of er een pad in staat.
- Draai een controle op verborgen informatie. De meeste pdf-programma's hebben een functie die metadata, ingesloten bestanden, opmerkingen en verborgen lagen opspoort.
- Verwijder wat er niet in hoeft. Auteur en organisatie hebben zelden een functie in een gedeeld document.
- Controleer opnieuw na bewerking. Sommige programma's schrijven hun eigen naam en een nieuwe wijzigingsdatum terug zodra je opslaat.
Vier stappen, en samen kosten ze een minuut. Dat is de verhouding waar het hier om gaat: een minuut controle tegenover een gegeven dat je niet had willen delen en dat je later niet meer terughaalt.