AI-confidence als workflow-signaal, niet als bewijs
Confidence scores van AI zijn vaak overmoedig en misleidend op zichzelf. Zo gebruikt u ze als signaal voor decompositie, subgroep-audits en deferral bij gevoelig
U moet confidence scores van AI-modellen behandelen als routeringssignaal voor werkstroomkeuze, niet als bewijs van juistheid. Lage of onzekere scores moeten aanleiding geven tot verduidelijking, controle of doorverwijzing naar een sterker model, afhankelijk van de aard van de onzekerheid.
De aanleiding is een analyse van 21 september 2026 van hoe AI-confidence scores zich gedragen onder verschillende taaktypen en subgroepen, die aantoont dat modellen systematisch overmoedig kunnen zijn en dat hun calibratie afhangt van taakmoeilijkheid en populatiegroep. Het onderzoek gebruikt taalmodellen als concrete casus, waarbij het onderscheid tussen gerapporteerde zekerheid en werkelijke accuratesse centraal staat. In onze inschatting betekent dit voor wie met gevoelige of hoog-trust informatie werkt dat een hoge score geen garantie biedt en dat de meest gevaarlijke situatie optreedt wanneer een model hoog zeker is over een moeilijke taak — precies omdat die combinatie het minst wordt gecontroleerd.
Waarom een gemiddelde score niet volstaat
Een enkele confidence-waarde verbergt meerdere bronnen van onzekerheid. Onderzoek toont aan dat modellen zowel epistemische onzekerheid (onvolledig begrip van het domein) als aleatoire onzekerheid (inherente ambiguïteit in de taak) kunnen vertonen, en dat deze zich anders manifesteren per subgroep. Een model kan globaal goed gecalibreerd lijken terwijl het binnen bepaalde populatiegroepen tegelijk overmoedig en onderzeker is. Dit betekent dat u niet kunt vertrouwen op een gemiddelde nauwkeurigheid zonder de verdeling van fouten per taaktype en per groep te kennen.
Welke vormen van onzekerheid moet u onderscheiden?
- Epistemische onzekerheid — het model kent het domein onvoldoende en kan daarom geen betrouwbare voorspelling doen.
- Aleatoire onzekerheid — de taak zelf is ambiguë of bevat tegenstrijdige signalen die geen model volledig kan oplossen.
- Calibratiefout — de gerapporteerde zekerheid wijkt af van de werkelijke nauwkeurigheid, vooral bij moeilijkere taken.
- Grouping loss — binnen subgroepen kan het model systematisch anders presteren dan het globale gemiddelde suggereert.
- Beslissingsrisico — de consequenties van een fout zijn hoger dan de score aangeeft, ongeacht de statistische nauwkeurigheid.
Deze onderscheidingen bepalen wat u moet doen. Bij epistemische onzekerheid loont het om het model meer context te geven of de vraag te verduidelijken. Bij aleatoire onzekerheid ligt de verantwoordelijkheid bij wie de vraag stelt. Bij hoog beslissingsrisico is menselijke controle het uitgangspunt, ongeacht wat de score zegt.
Welke controles moet u kunnen aantonen?
- Documenteer per workflow welk model en welke taakmoeilijkheid van toepassing zijn — zodat u weet of calibratiefouten waarschijnlijk zijn.
- Koppel confidence-drempels aan taaktype, niet aan een universele waarde — want dezelfde score betekent iets anders voor gemakkelijke en moeilijke taken.
- Controleer de verdeling van scores en fouten per subgroep — om grouping loss op te sporen voordat het in productie gaat.
- Zet een routeringsmechanisme in dat lage of onzekere scores doorverwijst naar verduidelijking, herformulering of een sterker model — in plaats van ze als eindoordeel te accepteren.
- Gebruik multi-model verificatie waar mogelijk — onenigheid tussen modellen is een sterker signaal dan een enkele hoge score van één model.
Hoe past dit in uw verificatielaag?
Een verificatielaag tegen hallucinaties moet de confidence score niet als bewijs gebruiken, maar als input voor routeringskeuze. Dit betekent dat u niet zegt: "score boven 85% is goed genoeg", maar: "score boven 85% op deze taakmoeilijkheid in deze subgroep rechtvaardigt deze handeling, ondersteund door deze aanvullende controle". Dit vraagt om verificatie buiten het model zelf. Multi-model verificatie kan hier helpen, omdat onenigheid tussen modellen aangeeft dat de vraag moeilijker is dan één score suggereert.
De praktische invulling verschilt per context. Voor hoog-trust omgevingen geldt: lage scores moeten standaard naar menselijke controle gaan, ongeacht de taak. Voor routinetaken kan u scores gebruiken om werk efficiënt in te delen, maar moet u periodiek controleren of de verdeling van fouten per subgroep stabiel blijft. Het veld werkt actief aan betere calibratie in modellen zelf, maar dat verandert niet aan de regel: het eindoordeel blijft bij u.
Werktuigen kunnen u helpen scores per taaktype en subgroep te monitoren en routeringsregels in te stellen. Wat werktuigen niet kunnen doen, is bepalen welk risico acceptabel is of wanneer menselijke oordeel nodig is. Die beslissing blijft uw professionele verantwoordelijkheid.
Bronnen: Dit artikel is gebaseerd op berichtgeving en richtlijnen van arXiv, ICLR, OpenReview, MIT News en ACL Anthology.
Geschreven door
Marit Halversen
Schrijft over AI-governance en regelgeving, met de nadruk op hoe verplichtingen neerslaan in architectuur in plaats van in papierwerk.