SecurityTechInsider AI-veiligheid & governance
EN/ NL
Governance

AI-samenvattingen van lange dossiers: waarom claim-voor-claim controle nodig is

Studies uit 2025-2026 laten zien dat AI-samenvattingen van lange en meerdere documenten fors kunnen afwijken van de bron. Zo controleert u ze verantwoord.

4 september 2026 3 min
Illustratie bij dit artikel: AI-samenvattingen van lange dossiers.
Professionals moeten AI-samenvattingen van lange dossiers claim voor claim tegen de bron toetsen en hoog-impact stukken door een mens laten controleren. Beeld: SecurityTechInsider — originele redactionele illustratie

U moet elke claim in een AI-samenvatting van lange of meerdere documenten tegen de brontekst toetsen en hoog-impact stukken door een mens laten controleren. Hallucinatiepercentages lopen van enkele procenten tot boven de 40 procent, afhankelijk van domein en opzet.

De aanleiding is een analyse van 4 september 2026 van hallucinaties bij samenvattingen van meerdere bronnen, die aantoont dat een groot deel van de gegenereerde inzichten niet door de brondocumenten wordt gedragen. In het nieuwsdomein bereiken hallucinatiepercentages tot ongeveer 45 procent; bij medische consulten zelfs tot circa 75 procent. Modellen produceren bovendien in meer dan 20 procent van de gevallen samenvattingen voor subtopics die helemaal niet in de bron voorkomen. In onze inschatting is dit geen theoretische kanttekening maar een concreet werkrisico voor iedereen die dossiers laat samenvatten.

Hoe groot is het hallucinatierisico voor uw domein?

De hallucinatiepercentages lopen sterk uiteen per taak en domein. Goed gestructureerde samenvattingen van korte teksten scoren laag op benchmarks—enkele procenten tot ongeveer 3 procent voor topmodellen. Klinische casus-samenvattingen daarentegen bereiken zonder mitigatie percentages tot ongeveer 64 procent. De belangrijkste les is niet één getal maar de spreiding zelf: een lage benchmarkscore op korte, goed gestructureerde teksten zegt weinig over een lang, rommelig, domeinspecifiek dossier. Wie zich op generieke accuracystatistieken verlaat, meet de verkeerde situatie.

Een ander patroon maakt het risico nog acuter: hallucinatiepercentages verschuiven systematisch naar het einde van lange outputs. Dit effect neemt toe naarmate de samenvatting langer wordt. Klassieke gemiddelde metrieken maskeren dit, omdat het begin vaak wel klopt. De praktische consequentie is ongemakkelijk: professionals lezen slotparagrafen en conclusies vaak juist vluchtiger, terwijl daar de kans op niet-ondersteunde beweringen het grootst is.

Welke controleaanpak werkt betrouwbaar?

Een herhaalbare methode komt uit peer-reviewed onderzoek: de Question-Sort-Evaluate-aanpak. Uit de samenvatting worden vragen gegenereerd, die worden gesorteerd op belang en vervolgens beantwoord op basis van de brontekst. Wijkt het antwoord uit de samenvatting af van het antwoord uit de bron, dan is de claim verdacht. Dit kader werkt omdat hallucinatie expliciet wordt gedefinieerd als tekst die niet door de brontekst wordt gedragen.

Vertaald naar dagelijkse praktijk komt dat neer op deze stappen:

  1. Genereer vragen uit de samenvatting — zet de kernbeweringen om in toetsbare vragen.
  2. Sorteer op impact en risico — bepaal welke claims voor uw werkcontext het meest kritisch zijn.
  3. Beantwoord vragen uit de brontekst — zoek de antwoorden rechtstreeks in de originele documenten.
  4. Vergelijk en markeer afwijkingen — label claims als verdacht als ze niet door de bron worden gedragen.
  5. Zet menselijke review in voor hoog-impact stukken — laat een mens de eindrapportage goedkeuren.
  6. Documenteer het verificatieproces — leg vast welke claims zijn getoetst en wat het resultaat was.

Kan een geoptimaliseerd model menselijke controle vervangen?

Nee. Onderzoek naar ontslagbrieven uit elektronische patiëntendossiers toont aan dat een fijn-getuned model in ongeveer 6 procent van de samenvattingen ten minste één feitelijke inconsistentie bevatte. Na menselijke verificatie werd 94 procent klinisch acceptabel bevonden. Vooral bij atypische casussen bleven fouten voorkomen. Deze conclusie is breder toepasbaar dan de zorg: in juridische dossiers, verzekeringsclaims en compliance-rapportages levert AI een eerste concept, maar de eindbeslissing en eindrapportage vragen een aantoonbaar menselijk controlepunt.

Hoe maakt u uw controle aantoonbaar?

Betrouwbaarheid wordt pas geloofwaardig als u kunt laten zien wat er gecontroleerd is. Per lang document moet u vastleggen welke samenvatting door welk model is gemaakt, welke claims tegen de bron zijn getoetst, welke als mogelijk hallucinatief zijn gelabeld en waar en door wie menselijke review heeft plaatsgevonden. Dit controleerbare spoor is essentieel voor audits, geschillen of incidentonderzoek.

Een gelaagde verificatiestack kan dit ondersteunen door een taak door geselecteerde onafhankelijke modellen te leiden en verificatiestappen, correcties en bronnen zichtbaar te maken voor inspectie. Dit garandeert geen juistheid en neemt hallucinaties niet weg; het maakt controle mogelijk. Het professionele eindoordeel blijft bij u. De kern blijft: behandel een AI-samenvatting van gevoelig materiaal als een verifieerbare claimreeks, niet als een snellere leesfunctie.

Tooling kan verificatiestappen structureren en hallucinaties zichtbaar maken. Maar het oordeel over wat acceptabel is, wat nader onderzoek vereist en wat niet kan worden gebruikt, blijft uw eigen professionele verantwoordelijkheid. Geen tool neemt u die af.

Bronnen: Dit artikel is gebaseerd op berichtgeving en richtlijnen van arXiv, alphaXiv, Scientific Reports (Nature), PubMed Central en Inferya.

Marit Halversen

Geschreven door

Marit Halversen

Schrijft over AI-governance en regelgeving, met de nadruk op hoe verplichtingen neerslaan in architectuur in plaats van in papierwerk.