Een rapport van tachtig pagina’s kan binnen enkele seconden veranderen in acht overzichtelijke punten. Dat maakt
ChatGPT,
Gemini Notebook en andere AI-tools aantrekkelijk voor beleidsstukken, onderzoeksrapporten, jaarverslagen en handleidingen.
Toch bewijst een overtuigende samenvatting niet dat de volledige pdf goed is gelezen.
Een belangrijke uitzondering kan in een voetnoot staan. De hoofdconclusie kan alleen gelden voor een bepaalde periode. Een tabel kan een andere eenheid gebruiken dan de lopende tekst. Bij een gescand document kan de AI een verkeerd herkend cijfer probleemloos verwerken alsof het in de bron stond.
Wie een pdf met AI samenvat, moet daarom niet alleen om een samenvatting vragen. Je hebt eerst een kleine controleprocedure nodig.
Een pdf is niet altijd een net tekstdocument
Twee pdf’s die er op het scherm hetzelfde uitzien, kunnen technisch totaal verschillend zijn.
De eerste bevat echte, selecteerbare tekst en een duidelijke documentstructuur. De tweede bestaat uit gescande afbeeldingen van pagina’s. Bij die scan is tekst pas bruikbaar nadat optical character recognition, oftewel OCR, de letters en cijfers heeft herkend.
Daarnaast kan de leesvolgorde afwijken van de visuele volgorde. Adobe legt uit dat structuurcodes in een toegankelijke pdf aangeven wat een kop, alinea, sectie of tabel is en in welke volgorde onderdelen moeten worden gelezen. Bij een ongetagde pdf moet software die structuur zelf afleiden.
Dat kan vooral problemen veroorzaken bij:
- tekst in meerdere kolommen;
- tabellen die over verschillende pagina’s lopen;
- grafieken met labels en legenda’s;
- voetnoten onder aan de pagina;
- kaders en zijbalken;
- bijlagen met een eigen paginanummering;
- gescande of gedraaide pagina’s.
Controleer het bestand voordat je het uploadt
Open de pdf eerst zelf en voer vier simpele controles uit.
1. Kun je de tekst selecteren?
Probeer een volledige zin te selecteren en te kopiëren. Lukt dat niet, dan heb je waarschijnlijk met een scan of beveiligde pdf te maken.
2. Werkt de zoekfunctie?
Zoek naar een opvallend woord dat zichtbaar in het document staat. Levert de zoekfunctie niets op, dan ontbreekt mogelijk een goede tekstlaag.
3. Kloppen de pagina’s?
Controleer het aantal bestandspagina’s én de gedrukte paginanummers. Een rapport kan voorwerk met Romeinse cijfers hebben, waardoor “pagina 25” in de viewer niet dezelfde pagina is als pagina 25 in het document.
4. Waar zit de moeilijke informatie?
Noteer vooraf welke pagina’s tabellen, grafieken, voetnoten, definities en bijlagen bevatten. Juist die pagina’s moet je later afzonderlijk controleren.
Kijk vóór het uploaden ook naar privacy en vertrouwelijkheid. Een technisch leesbare pdf is niet automatisch geschikt om met een externe AI-dienst te delen.
Vraag eerst om een documentkaart
De meest gemaakte fout is direct vragen:
Vat deze pdf samen.
Daarmee laat je de AI zelf bepalen wat belangrijk is, zonder dat je weet welke onderdelen zijn herkend.
Begin liever met een inventarisatie:
Gebruik uitsluitend de bijgevoegde pdf. Maak eerst een documentkaart met titel, auteur, publicatiedatum, zichtbare hoofdstukken, bijlagen en het aantal pagina’s dat je kunt vaststellen. Benoem welke pagina’s tabellen, grafieken en voetnoten bevatten. Meld expliciet welke onderdelen je niet goed kunt lezen. Maak nog geen inhoudelijke samenvatting.
Vergelijk die documentkaart met de inhoudsopgave en de pdf die je zelf voor je hebt. Ontbreekt een hoofdstuk of bijlage? Los dat op voordat je de samenvatting gebruikt.
Laat de samenvatting verwijzen naar pagina’s
Vraag daarna om een samenvatting die controleerbaar blijft:
Vat het document samen in maximaal tien kernpunten. Vermeld bij ieder punt de relevante pdf-pagina. Neem voorwaarden, uitzonderingen en onzekerheden op. Geef bij ieder cijfer de eenheid, periode en vergelijkingsbasis. Gebruik geen informatie buiten het document en meld het wanneer de bron iets niet duidelijk maakt.
Paginaverwijzingen maken een antwoord niet automatisch correct. Ze maken het wel veel sneller om een bewering in de oorspronkelijke bron terug te vinden.
Gemini Notebook, voorheen NotebookLM, is specifiek gebouwd rond aangeleverde bronnen en toont citaten die terugverwijzen naar bronpassages. ChatGPT kan volgens de officiële OpenAI-documentatie eveneens pdf’s uploaden, samenvatten, vergelijken en als bronmateriaal gebruiken.
Geen van beide mogelijkheden maakt handmatige controle overbodig. Lees ook onze vergelijking tussen
Gemini Notebook en ChatGPT voor je eigen documenten.
Behandel tabellen als een aparte taak
Vraag de AI niet alleen wat een tabel “betekent”. Laat eerst vaststellen wat er letterlijk staat.
Een geschikte vervolgvraag is:
Analyseer uitsluitend de tabel op pagina 17. Noteer de titel, kolomkoppen, rijlabels, eenheden, periode en eventuele voetnoten. Neem de waarden letterlijk over in een nieuwe tabel. Bereken niets voordat je hebt aangegeven welke cellen onduidelijk zijn.
Controleer vervolgens:
- Staan percentages en absolute aantallen niet door elkaar?
- Is de eenheid euro, duizend euro of miljoen euro?
- Vergelijkt de tabel maanden, kwartalen of jaren?
- Zijn negatieve bedragen als minteken of tussen haakjes weergegeven?
- Telt “totaal” werkelijk op tot de getoonde onderdelen?
- Verwijst een sterretje naar een beperking onder de tabel?
Laat de AI pas daarna rekenen of conclusies trekken.
Vergeet voetnoten en bijlagen niet
Voetnoten bevatten regelmatig precies de informatie die een korte samenvatting minder spectaculair maar wel correct maakt.
Vraag daarom afzonderlijk:
Geef een overzicht van alle voetnoten en eindnoten die de interpretatie van cijfers, conclusies of aanbevelingen veranderen. Vermeld per noot de pagina en leg uit bij welk tekst- of tabelonderdeel deze hoort.
Voer dezelfde controle uit voor:
- definities;
- methodologische beperkingen;
- belangenconflicten;
- peildata;
- uitsluitingen uit een onderzoeksgroep;
- bijlagen met rekenmethoden;
- disclaimerteksten.
Vraag ook welke hoofdstukken níét in de eerste samenvatting terugkwamen. Dat is vaak informatiever dan de algemene vraag of de samenvatting “compleet” is.
Gebruik eerst OCR bij gescande documenten
Bij een scan moet tekstherkenning plaatsvinden voordat een betrouwbare tekstanalyse mogelijk is.
Adobe Acrobat kan met Scan & OCR een doorzoekbare tekstlaag aan een gescande pdf toevoegen. Adobe adviseert daarna de herkende tekst te controleren, omdat OCR onduidelijke woorden verkeerd kan omzetten.
Let vooral op:
- namen;
- datums;
- decimalen;
- negatieve bedragen;
- procenttekens;
- tabelkoppen;
- letters die op cijfers lijken, zoals O en 0.
Een OCR-fout van 8,1 naar 81 kan in een keurig geformuleerde samenvatting volledig onopvallend blijven.
Wanneer één complexe pagina slecht wordt gelezen, kan een duidelijke afbeelding van die specifieke pagina helpen. Controleer wel eerst of je die afbeelding volgens de privacy- en beveiligingsregels mag uploaden.
Doe een steekproef voordat je de samenvatting gebruikt
Controleer minimaal drie verschillende soorten beweringen:
- een belangrijk cijfer;
- een centrale conclusie;
- een uitzondering of beperking.
Zoek de genoemde pagina op en vergelijk de formulering met de bron. Let daarbij op woorden als “mogelijk”, “gemiddeld”, “onder de onderzochte groep” en “na correctie”. Zulke voorwaarden verdwijnen gemakkelijk uit een korte samenvatting.
Voor een belangrijke pdf kun je ook twee afzonderlijke controles laten uitvoeren:
- eerst een neutrale samenvatting;
- daarna een kritische controle gericht op ontbrekende voorwaarden, tabellen en bijlagen.
Onze
vijfminutencheck voor AI-teksten is hiervoor een bruikbaar vervolg.
Gebruik AI als leesassistent, niet als vervanging van de bron
Voor een interne eerste indruk hoeft niet ieder detail even zwaar te worden gecontroleerd. Dat verandert zodra de samenvatting wordt gebruikt voor een contract, investering, medisch besluit, bestuursstuk of advies aan een klant.
Dan moet de oorspronkelijke pdf leidend blijven.
AI is vooral goed in het versnellen van de eerste lezing, het vinden van onderwerpen en het ordenen van vragen. Het is veel minder geschikt als bewijs dat iedere tabel, voetnoot en uitzondering volledig is verwerkt.
Veelgestelde vragen
Kan ChatGPT iedere pdf samenvatten?
ChatGPT ondersteunt pdf-bestanden, maar het resultaat hangt af van de inhoud, scan- en tekstkwaliteit, structuur en beschikbare context. Controleer altijd of alle onderdelen toegankelijk waren.
Welke AI is het beste voor lange documenten?
Gemini Notebook is sterk gericht op werken vanuit geselecteerde bronnen en broncitaten. ChatGPT is breed inzetbaar voor samenvatten, vergelijken en vervolgopdrachten. De beste keuze hangt af van het document en de gewenste workflow.
Wat moet ik doen met een gescande pdf?
Voer eerst OCR uit, controleer de herkende tekst en let extra op namen, cijfers en tabellen. Upload niet blind een slecht leesbare scan.
Kun je een AI-samenvatting gebruiken voor een juridisch of financieel besluit?
Niet zonder controle van de oorspronkelijke bron en, wanneer nodig, een deskundige. AI kan voorwaarden, voetnoten of nuances missen.