INZICHT · ORGANISATIES

Ik zie het overal: een agent die “niet mag versturen zonder menselijke goedkeuring”. Op papier human-in-the-loop. In de praktijk een knop zonder context, zonder tijd en zonder escalatie.

Dat is geen controle. Dat is approval theater. En theater houdt geen foute mail, boeking of recordwijziging tegen.

In het kort

  • Een Approve-knop zonder why, risk of diff is rubber-stamping, geen human-in-the-loop.
  • Echte oversight vraagt tijd, context, competentie en de mogelijkheid om terug te draaien.
  • Werk met risicotiers: auto laag, must-review hoog, sample deep review ertussen.
  • Meet reject/approve-ratio’s. Als bijna alles groen is, heb je theater, geen gate.

Wat er gebeurde

Een team waar ik mee werkte had een nette regel: de agent mag geen klantmail versturen, geen afspraak boeken en geen CRM-record wijzigen zonder menselijke goedkeuring. In de demo zag dat er solide uit. “Human-in-the-loop”, stond op de slide.

In productie lag de wachtrij vol. De reviewer kreeg een scherm met onderwerpregel, drie regels samenvatting en een groene knop. Geen waarom. Geen risicoscore. Geen diff van wat er precies zou veranderen. Geen link naar het bronbericht. De gemiddelde klik duurde iets van twee seconden.

Tot er een verkeerde actie doorheen gleed. Verkeerde klant. Verkeerde toon. Verkeerd veld. Iedereen kon laten zien dat er “een mens had goedgekeurd”. Niemand kon laten zien dat die mens iets had kunnen beoordelen. De knop was het bewijs. Niet de beoordeling.

Ik zie dit bij kleinere teams én bij grotere organisaties. Niet omdat reviewers lui zijn. Omdat het proces de mens tot rubberstamp maakt. Volume omhoog, context omlaag, verantwoordelijkheid blijft wel in de auditlog staan.

Als je human-in-the-loop alleen een knop is, heb je geen controle. Je hebt een alibi.

Waarom dit relevant is

Echte human-in-the-loop is geen UX-label. Het is een beslissing met vier voorwaarden: tijd om te kijken, context om te begrijpen, competentie om te oordelen, en ruimte om te escaleren of terug te draaien. Mist één van die vier, dan is de mens theater.

NIST AI RMF (Map 3.5) vraagt dat processen voor human oversight worden gedefinieerd, beoordeeld en gedocumenteerd. Niet alleen “iemand klikt mee”. In het Generative AI Profile waarschuwt NIST expliciet voor automation bias: te veel vertrouwen in wat het systeem voorstelt. Exact wat gebeurt als de UI alleen een groene knop toont.

Artikel 14 van de EU AI Act zegt het voor high-risk systemen nog scherper: mensen moeten output kunnen interpreteren, automation bias herkennen, output negeren of terugdraaien, en het systeem veilig kunnen stoppen. Een knop zonder die mogelijkheden voldoet niet aan die bedoeling, ook als jullie flow “formeel” niet high-risk is. De les is bruikbaar voor elke agent die iets doet met klanten, geld of records.

Drie plekken waar approval theater het hardst pijn doet:

Dit raakt agent governance licht: wie mag wat, wanneer, met welke stop. Maar de kern vandaag is smaller. Jullie review-stap zelf. Als die stap geen echte beoordeling toelaat, helpt geen governance-slide. Zelfde patroon als bij prompt versiebeheer: het label klinkt volwassen, het proces niet.

Zonder baseline blijft “wij hebben HITL” een verhaal, zoals bij ROI zonder baseline. Meet of mensen daadwerkelijk afwijzen, escaleren en corrigeren. Anders koop je schijnveiligheid.

2s
klik ≠ beoordeling
4
voorwaarden: tijd, context, competentie, reverse
3
tiers: auto / sample / must-review

Wat je nu kunt doen: human-in-the-loop die wél werkt

Geen nieuw platform als eis. Wel zes gewoonten die van een knop weer een beoordeling maken.

  1. Risicotiers, niet één wachtrij. Laag risico mag auto (met logging). Middel: steekproef deep review. Hoog: must-review vóór actie. Zonder tiering verstikt volume elke serieuze blik.
  2. Context in het scherm, niet ernaast. Toon why (korte rationale), risk-tier, bronnen, en een diff van mail/record/boeking. Zonder diff is Approve theater.
  3. Tijd budgetteren. Als de queue sneller groeit dan reviewers aankunnen, verhoog je geen “discipline”. Je verlaagt de drempel of splitst tiers. Meet median review-tijd. Twee seconden is een rode vlag.
  4. Train reviewers op afwijzen. Automation bias is normaal. Oefen cases waar Approve fout is. Maak Reject en Escalate even zichtbaar als Approve. Beloon goede stops, niet alleen throughput.
  5. Audit de ratio’s. Approve/reject/escalate per week. Bijna 100% approve zonder escalaties? Dan is HITL een sticker. Koppel incidenten terug: welke goedgekeurde acties hadden eruit gemoeten?
  6. Reverse en stop zijn onderdeel van de loop. Kun je binnen minuten terugdraaien of pauzeren? Zo niet, dan is oversight te laat. Voor high-risk flows past dit bij wat Artikel 14 bedoelt met override en stop.

Wat “goed genoeg” vandaag al is

Je hoeft geen enterprise control tower te bouwen. Begin met één agent-flow: drie tiers, één review-UI met diff, één dashboard met ratio’s, één rollback-pad. Dat is al serieus human-in-the-loop. Later kun je sampling, training en governance-rollen aanscherpen.

Voor oversight die aansluit op jullie risico’s helpt vaak de EU AI Act deployer quick scan of gerichte AI-modeloptimalisatie meer dan nóg een Approve-knop. Wil je agents met echte reviewgates in plaats van theater? Kijk naar managed AI-agents of plan een kort gesprek via contact.

Wil je human-in-the-loop die controle is, geen knop?

We helpen teams risicotiers, review-context en rollback neerzetten. Geen hype. Wel oversight die een foute actie nog kan stoppen.

Leave a Reply

Your email address will not be published. Required fields are marked *