Grounding: hoe je voorkomt dat een AI-agent antwoorden verzint voor je klanten
Hallucinatie is geen mysterieus modelgebrek — het is een ontwerpfout met bekende oorzaken en bekende oplossingen. Retrieval-grounding, beslisgrenzen, betrouwbaarheidsdrempels en validatie van bronvermeldingen.
De vraag die elke operator in het eerste gesprek stelt: wat voorkomt dat hij iets verzint tegen een klant?
Het is de juiste vraag, en het eerlijke antwoord is niet "het model is tegenwoordig heel goed". Taalmodellen produceren vloeiende tekst die past bij hun trainingsverdeling. Is het juiste antwoord voor hen niet beschikbaar, dan blijft die vloeiende output gewoon komen — hij houdt alleen op waar te zijn, en hij arriveert in exact hetzelfde zelfverzekerde register als al het andere.
Dit los je niet op met een beter model of een strengere prompt. Je lost het op met systeemontwerp. Vier lagen, in volgorde van belang.
Laag 1: Veranker het antwoord in live data
De meeste hallucinaties in een zakelijke context zijn geen creatieve fictie — het is het model dat uit algemene kennis antwoordt terwijl het je database had moeten lezen.
"Je bestelling is dinsdag verzonden" is een hallucinatie als het model dat afleidde uit typische patronen in plaats van uit je fulfilmentrecord. Het is een feit als hij het record heeft gelezen.
Dus: het model hoort nooit de bron van waarheid te zijn voor iets wat een systeem al weet. Orderstatus komt uit het ordersysteem. Beleid komt uit het beleidsdocument. Voorraad komt uit voorraad. Prijzen komen uit de catalogus. De taak van het model is vinden, combineren en verwoorden — niet onthouden.
In de praktijk betekent dat retrieval over je live systemen, en meedogenloos zijn over wat er in het contextvenster staat. De meest voorkomende grounding-fout die we zien is niet ontbrekende retrieval — het is verouderde retrieval. Drie versies van het retourbeleid in de index en geen besef van welke geldt, dus citeert de agent in 2026 de versie uit 2023 aan een klant. Voorzie je documenten van versie en datum, filter op actueel, en behandel "welk document is gezaghebbend" als een datavraagstuk dat van jou is — niet als iets wat het model maar moet uitzoeken.
Laag 2: Beperk wat de agent kán doen
Grounding bepaalt wat de agent zegt. Beslisgrenzen bepalen wat hij doet, en dat is de laag waardoor je 's nachts slaapt.
Werk met een toegestane lijst, niet met een verbodslijst. De agent mag een terugbetaling doen tot €X op een order jonger dan Y dagen met bevestigde levering. Daarbuiten kan hij het niet — niet omdat we het verboden hebben, maar omdat de tool de aanroep weigert. De grens leeft in code, waar hij getest kan worden, niet in een prompt, waar erover te discussiëren valt.
Codeer het beleid daar waar het afdwingbaar is. Is je retourtermijn 30 dagen, dan berekent de controleer_retourrecht-tool het recht uit de orderdatum en geeft een beslissing terug. Hij overhandigt het model geen beleidsdocument in de hoop dat het goed komt. Alles wat te berekenen valt, hoort berekend te worden.
Laat onomkeerbare acties bevestigen. Omkeerbaarheid is een goed sorteercriterium. Data lezen, een antwoord opstellen, tracking opzoeken — laat maar draaien. Een e-mail versturen, geld overmaken, een record verwijderen, iets publiceren — die krijgen een poort, hetzij een mens, hetzij een harde regel.
Gebruik gestructureerde output waar de vorm telt. Heb je een classificatie nodig, beperk het antwoord dan tot een enum. Heb je velden nodig, beperk tot een schema. Een model dat maar één van zes waarden kan uitspreken, kan geen zevende verzinnen.
Laag 3: Laat hem het niet weten
Het waardevolste gedrag dat je in een agent kunt bouwen, is een werkend escalatiepad.
Modellen zijn getraind om behulpzaam te zijn, en behulpzaamheid trekt hard richting een antwoord produceren. Zonder ingrijpen is dat precies de druk die zelfverzekerde fictie oplevert. Je moet de agent ergens anders naartoe kunnen sturen.
Zet een relevantiedrempel op retrieval. Scoorde niets boven de drempel, dan is het juiste gedrag niet antwoorden op basis van wat er toevallig terugkwam. Het is escaleren.
Instrueer positief, niet alleen negatief. "Verzin niets" is zwak. "Bevat de opgehaalde context het antwoord niet, zeg dan dat je het niet hebt en draag over aan een mens met een samenvatting van wat de klant vroeg" is een concrete, controleerbare instructie met een actie eraan vast.
Escaleer op sentiment, niet alleen op onzekerheid. Sommige gesprekken horen de automatisering te verlaten, ongeacht of de agent het antwoord weet — juridische dreigementen, overlijden, veiligheidskwesties, iedereen die twee keer om een mens heeft gevraagd. Detecteer die op een apart pad met eigen regels en een eigen eval-set.
Maak overdracht goedkoop en goed. Een escalatie die een ruwe transcriptie op een medewerker dumpt, is een belasting. Een die aankomt met een geschreven samenvatting, de opgehaalde context, de al ondernomen acties en de concrete blokkade, is een cadeau. Is de overdracht echt goed, dan kun je de drempel behoudend zetten zonder dat iemand het erg vindt — en een behoudende drempel houdt je uit de problemen.
Laag 4: Verifieer vóór het de deur uit gaat
De laatste laag vangt wat de eerste drie misten.
Dwing bronvermelding af, en valideer die dan. Verplicht het model de bron te citeren bij elke feitelijke bewering. Controleer vervolgens in code dat de geciteerde bron voorkwam in wat je hebt meegestuurd, en dat de bewering daar staat. Ongeciteerde of onverifieerbare beweringen worden verwijderd of gemarkeerd. Daarmee verandert hallucinatie van een onzichtbare fout in een gedetecteerde — en dat is het hele spel.
Controleer berekende waarden dubbel. Terugbetalingsbedragen, bezorgdata, kortingsberekeningen — herbereken ze deterministisch en vergelijk. Verschillen het getal van het model en dat van jou, dan wint dat van jou en wordt het verschil gelogd. Modellen zijn geen rekenmachines en horen niet als zodanig vertrouwd te worden.
Draai een goedkope verificatieslag op output met hoge inzet. Een tweede, kleiner model dat controleert "wordt elke bewering hier gedekt door deze context?" vangt een significant deel van de fouten voor een fractie van de kosten van de hoofdaanroep. Zet het in waar de kosten van een fout dat rechtvaardigen.
Wat niet werkt
Een paar dingen die voortdurend worden voorgesteld en het niet overleven in productie:
Harder prompten. "Je MAG NIET hallucineren. Dit is KRITIEK." Moderne modellen volgen instructies nauwgezet, wat betekent dat agressieve taal vooral overdreven voorzichtig gedrag oplevert op gevallen die prima gingen — meer onnodige escalaties, meer slagen om de arm, meer weigeringen om vragen te beantwoorden die het had kunnen beantwoorden. Het creëert geen kennis die het model niet heeft.
Het model vragen of het zeker weet. Zelfgerapporteerde zekerheid correleert zwak met correctheid. Een model dat een orderdatum heeft gehallucineerd, bevestigt die datum met evenveel overtuiging. Zekerheid moet uit het systeem komen — retrieval-scores, validatieresultaten, grenscontroles — niet uit introspectie.
Temperatuur nul. Dat maakt output deterministischer, niet waarder. Je krijgt betrouwbaar hetzelfde foute antwoord.
Wachten op een beter model. De modelkwaliteit is enorm vooruitgegaan en de faalwijze blijft bestaan, want hij is structureel: een systeem dat het feit niet krijgt aangereikt, kan het feit niet produceren. Betere modellen hallucineren minder vaak en even overtuigend.
De eerlijke versie
Geen enkel systeem bereikt nul. Wat een goed gebouwd systeem wél bereikt: hallucinaties worden zeldzaam, en wanneer ze optreden worden ze gedetecteerd in plaats van verstuurd — omdat een citaat niet valideerde, of een berekende waarde niet klopte, of een retrieval-score onder de drempel viel.
Dat is de echte lat. Niet "hij heeft nooit iets fout" maar "als hij iets fout heeft, weten wij het, en ziet een mens het vóór de klant".
Elke operator met wie we werken accepteert die lat onmiddellijk — want het is dezelfde lat waarop hun menselijke team functioneert, en dat menselijke team komt niet met een auditlog.
Elke AIMAGENTIC-agent wordt geleverd met verankerde retrieval, beslisgrenzen in code en een uitgeschreven escalatiepad. Plan een auditgesprek en we brengen die van jou in kaart.