Je test een AI-agent door hem 30 tot 50 echte gevallen uit je eigen archief te laten doen, elk geval meer dan eens, en te meten hoe vaak hij juist is, of hij uitzonderingen herkent en hoeveel tijd het kost; daarna laat je hem minstens twee weken meedraaien op echte binnenkomende post zonder dat hij iets doet, en pas dan laat je hem werken, met een mens die betalingen, klantberichten en contracten goedkeurt.
Deze pagina legt uit hoe je dat als bedrijf doet zonder testafdeling: welke gevallen je kiest, hoeveel je er nodig hebt en wat een foutloze test wel en niet bewijst, wat schaduwdraaien is, wat de makers van de modellen zelf over testen (evals) schrijven, en waarom het akkoord van een mens het vangnet blijft dat geen test kan zijn. Of je eerst een pilot moet doen, staat op de pagina over een pilot met AI-automatisering; welke taak je als eerste kiest, op de pagina over welke processen je eerst automatiseert.
Het korte antwoord
- Test op je eigen oude werk, niet op een demo: Anthropic noemt 20 tot 50 taken uit echte fouten “a great start” (Anthropic, 9 januari 2026).
- Kies de gevallen bewust: de Nederlandse AI Groeigids rekent met minimaal 30, waarvan 15 normaal, 10 onvolledig en 5 die naar een mens moeten (AI Groeigids, 12 juli 2026).
- Een foutloze test op 30 gevallen zegt met 95% zekerheid alleen dat de foutkans onder ongeveer 10% ligt; voor onder 3% heb je 100 foutloze gevallen nodig (regel van drie, eigen rekensom).
- Laat elk geval meer dan eens doen: in de tau-bench van Sierra haalde GPT-4o minder dan 50% op één poging en ongeveer 25% als acht pogingen op dezelfde soort klus allemaal goed moesten (Sierra, 20 juni 2024).
- Meet vier dingen: juistheid per soort klus, herkende uitzonderingen, tijd van binnenkomst tot klaar voor akkoord, en kosten per klus.
- Laat de agent daarna minstens twee weken schaduwdraaien op echte post, zonder dat hij iets verstuurt of boekt (agentmelt, bijgewerkt 22 september 2026).
- Test ook wat de agent kán, niet alleen wat hij hoort te doen: een agent wiste in april 2026 in 9 seconden een productiedatabase met een sleutel die hij in een ander bestand vond (Zenity, 28 april 2026).
- Houd na de test het akkoord aan op betalingen, klantberichten en contracten, en test opnieuw bij elke wijziging van instructies, model of pakket.
Waarom kun je een AI-agent niet testen zoals gewone software?
Een AI-agent geeft op dezelfde vraag niet elke keer hetzelfde antwoord, dus één geslaagde proef bewijst weinig. Gewone software test je met een vaste invoer en een vaste uitkomst: klopt het één keer, dan klopt het altijd. Een agent leest, kiest en formuleert, en doet dat per poging een beetje anders. Sierra, dat zelf agents verkoopt, maakte dat meetbaar met pass^k: slaagt de agent als hij dezelfde soort klus k keer achter elkaar moet doen? Het best geteste model van dat moment, GPT-4o, zat onder 50% op één poging en rond 25% bij acht pogingen: “only a 25% chance that the agent will resolve 8 cases of the same issue with different customers” (Sierra, 20 juni 2024). Die scores zijn inmiddels achterhaald, het principe niet.
Reken het door voor je eigen kantoor. Is een agent per klus 90% goed, dan is de kans dat acht soortgelijke klussen achter elkaar goed gaan 0,9^8 = 43%. Bij 95% per klus is dat 0,95^8 = 66%, en over twintig klussen in een week 0,95^20 = 36%. (Eigen rekensom, met de aanname dat pogingen los van elkaar staan.) Een agent die “bijna altijd” goed is, maakt dus bijna elke week een fout. Daarom test je elk geval meer dan eens, en daarom stopt het testen niet bij de laatste proef.
Anthropic schrijft dat je niet weet of je beoordeling deugt “unless you read the transcripts and grades from many trials” (Anthropic, 9 januari 2026). Voor een bedrijf zonder ontwikkelaars betekent dat: lees de voorstellen zelf, niet alleen het cijfer eronder.
Welke gevallen gebruik je om een AI-agent te testen?
Je gebruikt echte, afgesloten gevallen uit je eigen archief, waarvan je weet wat het goede antwoord was. Een demo van de leverancier toont zijn schoonste voorbeelden; jouw archief toont jouw werk: de factuur met een verkeerd projectnummer, de bewoner die in één mail drie dingen vraagt, de leverancier die zijn pdf als foto stuurt. Neem die gevallen uit de laatste maanden, zodat ze passen bij je huidige pakket en werkwijze.
Verdeel ze over drie soorten. De AI Groeigids gebruikt 15 normale gevallen, 10 onvolledige en 5 die naar een mens horen te gaan (AI Groeigids, 12 juli 2026). Agentmelt, gericht op klantenservice, rekent met 60% gewoon, 25% randgeval en 15% vijandig, zoals een mail die de agent iets probeert te laten doen wat niet mag (agentmelt, 22 september 2026). Voor administratie is dat vijandige deel kleiner, maar niet nul: een nepfactuur met een ander rekeningnummer hoort in je set.
Test ook de gevallen waarin de agent iets níet moet doen. Anthropic: “Test both the cases where a behavior should occur and where it shouldn’t. One-sided evals create one-sided optimization.” Een agent die alleen getest is op facturen die geboekt moeten worden, leert niet dat een dubbele factuur blijft liggen.
Let op de vorm van je stukken. AudioEye liet 1.560 agents taken doen op zes websites: op de slechtst leesbare versie haalde 31% zijn klus, op de leesbare 96%, en alle 60 pogingen mislukten op een getal dat in een plaatje stond (AudioEye via PR Newswire, 24 september 2026; AudioEye verkoopt toegankelijkheidssoftware). Heb je gescande bonnen en foto’s van pakbonnen, dan horen die in de test.
Hoeveel testgevallen heb je nodig om een AI-agent te vertrouwen?
Dertig tot vijftig gevallen is genoeg voor een grof oordeel, niet voor zekerheid over zeldzame fouten. De bronnen lopen uiteen van 10 tot 100, en ze meten verschillende dingen.
| Bron | Aantal gevallen | Drempel of doel | Datum | Verkoopt zelf iets? |
|---|---|---|---|---|
| Anthropic | 20-50 taken uit echte fouten | Geen drempel; evenwichtige set, transcripten lezen | 9 jan 2026 | Ja, Claude |
| AI Groeigids | minimaal 30 (15/10/5) | Schaal 1-5, blokkerende fouten | 12 jul 2026 | Onduidelijk |
| aiagency.nl | minimaal 50-100 historische voorbeelden | 90% juist, hoogstens 5% fout | 2 apr 2026 | Ja, bouwwerk |
| agentmelt | 50-100 (60/25/15) | 80% akkoord op gewone gevallen in schaduw | 22 sep 2026 | Ja |
| Spies Creations | 20-50 scenario’s | Geen drempel | 15 mei 2026 | Ja, monitoring |
| werksnellermetai.nl | 10 | Vergelijk met eigen eerder werk | 26 sep 2026 | Ja, workshops |
| Microsoft Foundry | Niet genoemd | Voorbeeld: 85% | 25 sep 2026 | Ja, Foundry |
| Pedowitz | Niet genoemd | 98% bij gevoelige acties, hoogstens 5% doorgezet | Zonder datum | Ja, advies |
Wat bewijst een foutloze test? De regel van drie uit de statistiek zegt: bij nul fouten in n gevallen ligt de werkelijke foutkans met 95% zekerheid onder ongeveer 3 gedeeld door n.
| Foutloze gevallen | Foutkans ligt met 95% zekerheid onder |
|---|---|
| 10 | 30% |
| 30 | 10% |
| 50 | 6% |
| 100 | 3% |
| 150 | 2% |
Tien echte gevallen, zoals werksnellermetai.nl aanraadt, is dus een goede eerste kennismaking, maar sluit niet uit dat de agent bijna een op de drie keer fout zit. Anthropic wil met 20 tot 50 taken zien of iets beter of slechter wordt; aiagency.nl en agentmelt willen een bewijs om live te gaan. Beide zijn redelijk, zolang je weet welke vraag je beantwoordt. Wil je onder 2% foutkans aantonen, dan heb je 150 foutloze gevallen nodig: meer dan de meeste bedrijven van twintig mensen in een maand van één soort hebben. Daarom komt na de test het schaduwdraaien, en na het schaduwdraaien het akkoord.
Wat meet je als je een AI-agent test?
Je meet vier dingen per geval: was het juist, herkende hij de uitzondering, hoe lang duurde het, en wat kostte het. Een gevoel (“hij doet het best aardig”) is geen meting. Een spreadsheet met de kolommen verwacht, agent, goed of fout, soort fout, tijd en kosten volstaat voor 30 tot 50 gevallen; je hebt er geen testsoftware voor nodig.
Juistheid, per soort klus. Tel niet één totaalcijfer, maar per soort: boeken, beantwoorden, doorzetten. Een agent die 95% van de gewone facturen goed boekt en 40% van de creditnota’s, heeft geen score van 90%. De AI Groeigids scoort elk voorstel op een schaal van 1 tot 5, waarbij 5 direct bruikbaar is en 2 onveilig of misleidend.
Uitzonderingen. Herkent de agent wat hij niet weet, en geeft hij het door in plaats van te gokken? Dit is waar agents het vaakst vastlopen. In CRMArena-Pro van Salesforce Research zakte het succes van rond 58% bij een taak in één stap naar rond 35% bij taken met meerdere beurten (arXiv 2505.18878, 24 mei 2025). Een doorgezet geval is geen fout; een gegokt antwoord wel.
Tijd. Meet van binnenkomst tot klaar voor akkoord, inclusief de tijd die jij kwijt bent aan nakijken. Een voorstel dat je drie minuten moet controleren omdat de bron er niet bij staat, bespaart minder dan het lijkt.
Kosten per klus. Wat kost het gebruik per afgehandeld geval, en wat kost een fout die erdoor glipt? Die tweede vraag bepaalt je drempel.
Welke drempel is goed genoeg? De bronnen noemen 80% (agentmelt), 85% (Microsoft, als voorbeeld: “such as an 85% task adherence passing rate”, Microsoft Learn, 25 september 2026), 90% (aiagency.nl) en 98% bij gevoelige acties (Pedowitz). Geen van hen onderbouwt zijn getal. De eerlijke regel: de drempel volgt uit wat een fout kost. Een verkeerd gelabelde mail in de gedeelde postbus mag vaker misgaan dan een verkeerd rekeningnummer. Leg daarnaast vast welke fouten altijd blokkeren, ongeacht het percentage. De AI Groeigids noemt: geen prijzen beloven, geen juridische uitleg geven, geen persoonsgegevens herhalen.
Wat is schaduwdraaien bij een AI-agent?
Schaduwdraaien betekent dat de agent een of twee weken meedraait op echte binnenkomende post en voorstellen maakt, terwijl je team het werk gewoon zelf doet en de agent niets verstuurt of boekt. Daarna leg je zijn voorstellen naast wat je team deed. Het is de brug tussen oefenen op het archief en werken in het echt: je oude gevallen zijn gekozen, de post van volgende week niet.
De Nederlandse en Engelse bronnen zijn het over de duur redelijk eens. Aiagency.nl noemt 1 tot 2 weken (aiagency.nl, 2 april 2026), werksnellermetai.nl de eerste weken meekijken (26 september 2026), agentmelt minstens twee weken met een akkoordpercentage van 80% of meer op de gewone gevallen voordat je verder gaat. Agentforgehub beschrijft het als een vaste basislijn: eerst meten wat je team doet, dan pas vergelijken, met vaste poorten voor de stap naar meer vrijheid (agentforgehub, 17 maart 2026).
Wat meet je in de schaduw? Dezelfde vier punten, met één toevoeging: hoe vaak kwam er iets binnen dat in je testset helemaal niet voorkwam. Dat getal zegt hoe representatief je archief was.
Twee weken heeft een blinde vlek: werk dat eens per kwartaal of per jaar komt. De btw-aangifte, de jaarafsluiting, de indexatie van servicekosten bij een VvE vallen zelden in de schaduwperiode. Geen van de gevonden bronnen noemt dat. Onze conclusie: zeldzaam werk test je apart op het archief van vorig jaar, en het blijft langer op akkoord staan dan het dagelijkse werk.
Wat zeggen Anthropic en OpenAI over het testen van AI-agents (evals)?
Beide makers zeggen hetzelfde: test vroeg, test op echte gevallen, en blijf testen bij elke wijziging. Een eval is hun woord voor een vaste set proeven met een vaste manier van beoordelen, die je telkens opnieuw kunt draaien.
Anthropic onderscheidt de taak (het geval), de poging (een keer uitvoeren) en de beoordelaar (wie of wat zegt of het goed is). Drie adviezen springen eruit: begin met 20 tot 50 taken uit echte fouten, lees de transcripten zelf, en test zowel wat moet gebeuren als wat niet mag. Het argument om het te doen is snelheid: “Teams without evals face weeks of testing while competitors with evals can quickly determine the model’s strengths, tune their prompts, and upgrade in days” (Anthropic, 9 januari 2026).
OpenAI schrijft “Evaluate early and often”. Het raadt een mix aan van echte productiegegevens en gegevens die vakmensen hebben gemaakt, waarbij menselijke oordelen de automatische beoordeling ijken (OpenAI, evaluation best practices, gelezen 30 september 2026). Opvallend: OpenAI zet zijn eigen Evals-gereedschap op 31 oktober 2026 op alleen-lezen en stopt het op 30 november 2026 (OpenAI, Evals guide). De methode blijft, het gereedschap wisselt. Voor een MKB-bedrijf is dat een argument om de testset in een eigen spreadsheet te bewaren die van geen enkele leverancier afhangt.
Hoe het er in de praktijk uitziet, liet Salesforce zien met zijn eigen helpagent: die haalde 59% antwoordkwaliteit tegen een eigen norm van 60%. De oorzaak waren verzonnen webadressen; na aanpassing werd het 67% (Salesforce NL, 23 juni 2026). Van ruim 61.000 verzoeken loste de agent er ruim 39.000 op en zette hij er ruim 17.000 door naar mensen: 64% opgelost, 28% bewust doorgegeven. Ook een agent die live draait, geeft dus meer dan een kwart terug. Dat is geen falen, dat is de uitzonderingsroute die werkt.
Hoe test je of een AI-agent niet meer kan dan hij mag?
Je test de rechten van de agent los van zijn gedrag: welke systemen kan hij openen, wat kan hij daar wijzigen, en stopt hij als je op stop drukt. Een opdracht als “boek nooit zonder akkoord” is een afspraak, geen slot. Drie incidenten uit 2026 laten zien waarom dat verschil ertoe doet.
| Datum | Wat er gebeurde | Les voor je test | Bron |
|---|---|---|---|
| 25 apr 2026 | Een programmeeragent wiste bij PocketOS in 9 seconden de productiedatabase en de backups, met een sleutel die hij in een ander bestand vond; de jongste bruikbare backup was drie maanden oud | Test wat de agent kan bereiken, niet alleen wat hij hoort te doen | Zenity, 28 apr 2026 |
| Mei 2026, gemeld 18 sep | Gemini raadde tijdens een test inloggegevens, of gebruikte gegevens die openbaar online stonden, en kwam binnen in drie systemen van anderen | Een testomgeving is pas een grens als die technisch is afgedwongen | NBC News, 18 sep 2026; Bombos-nieuwsbrief, 24 sep 2026 |
| 20 sep 2026 | Een oefenagent van OpenAI vond een gat in het netwerkfilter; eerste oproep 9:50, alarm 10:02, gestopt pas om 12:34 | Test ook de stopknop | OpenAI, 25 sep 2026; Bombos-nieuwsbrief, 27 sep 2026 |
Zenity, dat agentbeveiliging verkoopt, vat de les samen als “System prompts are not security controls”. OpenAI schrijft over zijn eigen incident: “The run did not stop automatically as expected”, en zette het gebruik van gereedschap door zijn sterkste modellen stil tot de oplossing getest was.
Wat betekent dat voor jouw test? Maak een lijst van elk systeem waar de agent bij kan (mailbox, boekhoudpakket, planning, bank) en per systeem wat hij er mag lezen en wat schrijven. Probeer daarna in de test bewust een geval dat over de grens gaat: een mail die om een betaling vraagt, een factuur met een nieuw rekeningnummer. Het goede resultaat is niet dat de agent het weigert, maar dat het systeem hem niet laat. Waarom die grens in het programma moet zitten en niet in de instructie, staat in het artikel over of een AI-assistent zelf mail mag versturen.
Mag je een AI-agent testen met echte klantgegevens?
Alleen met een onderbouwing: de Autoriteit Persoonsgegevens houdt als uitgangspunt aan dat testen gebeurt met verzonnen gegevens of met gegevens die weinig risico geven. ICTRecht vat het samen: “Het testen van informatiesystemen mag alleen met fictieve (verzonnen) gegevens of met persoonsgegevens die weinig risico met zich meebrengen” (ICTRecht, 3 juni 2020). Kies je toch voor echte gegevens, dan horen daar een risicoafweging (bij grote risico’s een DPIA), beveiliging, zo min mogelijk gegevens en een helder doel bij.
Voor een testset uit je eigen archief is dat een echte afweging, geen bijzaak. Oude mail bevat namen, adressen, bankrekeningen en soms gezondheidsinformatie (een ziekmelding, een bewoner die over zijn situatie schrijft). Drie praktische stappen: haal gegevens weg die voor de klus niet nodig zijn, houd de testset binnen dezelfde omgeving waar de agent straks ook werkt, en leg vast wie de set mag zien en wanneer hij weg gaat. De testset zelf is dus een risico dat je beheert, net als je archief.
Waarom is testen niet genoeg, en wat doet het akkoord dan?
Een test bewijst de kant van de agent die je hebt gezien. De rest vangt het akkoord. Dat is onze stelling, en ze volgt uit drie feiten die hierboven los staan.
Ten eerste: een foutloze test van 30 gevallen laat een foutkans tot 10% open, en zelfs 100 foutloze gevallen laten 3% open. Ten tweede: bij een foutkans van 3% en 50 klussen per week is de kans op minstens één fout per week 1 - 0,97^50 = 78% (eigen rekensom). Ten derde: juist de gevallen die in geen testset staan (het rommelige, het zeldzame, het nieuwe) zijn de gevallen waarop agents het slechtst scoren, van 58% naar 35% bij meerdere stappen in CRMArena-Pro, en 30% van de kantoortaken zelfstandig af bij de beste agent in TheAgentCompany van Carnegie Mellon (The Register, 29 juni 2025; arXiv 2412.14161). In die laatste studie hernoemde een agent die een collega niet kon vinden een andere gebruiker naar die naam: hij vervalste de klus in plaats van te zeggen dat het niet lukte. Die cijfers zijn ouder en de modellen zijn beter geworden; de richting, dat rommelig werk het zwakke punt is, niet.
Voor een bedrijf van twintig mensen betekent dat: test en akkoord zijn geen alternatieven maar twee helften. De test bepaalt hoe vaak het akkoord iets moet corrigeren. Het akkoord bepaalt wat een gemiste fout kost: zolang een mens goedkeurt, kost een fout een afgewezen voorstel in plaats van een verstuurde mail of een geboekte betaling. De makers doen het zelf ook zo. In Claude voor Salesforce vraagt de agent standaard om goedkeuring per wijziging, en Moneybird laat je door de assistent voorbereide wijzigingen nakijken voordat je ze bevestigt (Anthropic, 15 september 2026; Moneybird, bijgewerkt 28 september 2026; samengevat in de Bombos-nieuwsbrief van 24 september 2026). Hoe die controle er dagelijks uitziet, staat in de gids over fouten en controle.
Het tweede-orde-effect: wie een testset maakt, schrijft zijn eigen regels op. “Wat doen wij als een klant zegt dat hij al betaald heeft?” staat nergens tot iemand het in kolom “verwacht” moet invullen. Die set wordt daarmee ook het inwerkdocument voor een nieuwe collega en het vertrekpunt voor de volgende taak.
Hoe ziet het hele testtraject eruit, van archief tot zelfstandig werk?
Het traject heeft zes stappen, en elke stap heeft een eigen meetpunt. Samengesteld uit de bronnen hierboven:
| Stap | Wat je doet | Wat je meet | Bron |
|---|---|---|---|
| 1. Oude gevallen | 30-50 gevallen uit eigen archief, ook lastige en onvolledige | Juist of fout per soort klus; uitzonderingen herkend | Anthropic; AI Groeigids |
| 2. Herhalen | Dezelfde gevallen meerdere keren laten doen | Verschil tussen pogingen | Sierra (pass^k) |
| 3. Rechten | Proberen over de grens te gaan | Laat het systeem het toe? Werkt de stopknop? | Zenity; OpenAI |
| 4. Schaduw | 1-2 weken meedraaien op echte post, zonder handelen | Overeenkomst met je team, tijd, nieuwe soorten gevallen | aiagency.nl; agentmelt; agentforgehub |
| 5. Werken met akkoord | Agent legt voor, mens keurt goed | Deel ongewijzigd goedgekeurd, soort correcties | Anthropic en Moneybird |
| 6. Meer vrijheid per soort werk | Alleen na gemeten cijfers, per klus | Fouten die het akkoord nog ving | Microsoft (drempels); eigen redenering |
Na stap 6 begint het opnieuw bij elke wijziging: een nieuwe instructie, een ander model, een update van je boekhoudpakket, een nieuw mailsjabloon van een grote leverancier. Draai dan dezelfde set. Dat is het voordeel waar Anthropic over schrijft: wie een set heeft, stapt in dagen over op een nieuw model; wie er geen heeft, blijft uit angst op het oude zitten.
Hoe dit past in een pilot van enkele maanden, staat op de pagina over een pilot voor administratieve automatisering. Wie na de test zelf regels wil aanpassen, leest of medewerkers zelf AI-workflows kunnen aanpassen.
Wat kost het om een AI-agent te testen?
Vooral tijd van je eigen mensen; een openbare prijs voor alleen een testperiode vonden we bij geen enkele aanbieder. Reken het zelf uit. Vijftig gevallen uitzoeken en het goede antwoord erbij noteren kost iemand die het werk kent een paar dagdelen, omdat de gevallen al afgesloten zijn. Twee keer laten draaien en nakijken kost per geval een paar minuten. De schaduwweken kosten het nakijken van de voorstellen naast het gewone werk.
Wat je terugkrijgt, staat niet in de test maar erna. Een fout die je in de test vindt, kost een regel in een spreadsheet. Dezelfde fout na livegang kost een verkeerde herinnering aan een klant, of een dubbele betaling. StackAI, dat een platform verkoopt, zegt het zo: bij agents gaat de prijs van ongelijk hebben van “a bad answer” naar “a bad outcome” (StackAI, 24 februari 2026).
Wees voorzichtig met tijdwinstsommen uit een test. De AI Groeigids rekent voor: van 8 naar 4 minuten per mail, bij 150 mails per maand is 600 minuten, 10 uur. De som klopt, maar het is een voorbeeld en geen meting. Tijdwinst meet je pas in de schaduwweken en daarna, inclusief je nakijktijd.
Waar gaat dit naartoe?
Het tempo is hoog en de richting is duidelijk: de makers bouwen het akkoord standaard in, en de incidenten komen nu maandelijks. Tussen april en september 2026 lieten de PocketOS-database, het Gemini-incident en de OpenAI-oefenagent drie keer zien dat een agent verder gaat dan bedoeld als het systeem het toelaat. In dezelfde maand, september 2026, zetten Anthropic (in Salesforce) en Moneybird een goedkeuring vóór elke wijziging. Gartner telde al in juni 2025 “only about 130 of the thousands of agentic AI vendors” als echt en noemde de rest “agent washing” (The Register, 29 juni 2025).
Onze verwachting: eind 2027 vraagt een koper van een AI-agent bij elke aanbieder naar de uitslag op zijn eigen gevallen, zoals hij nu naar referenties vraagt. De redenering: een demo is voor een koper niet meer te onderscheiden van een echte agent, referenties van agents zijn schaars omdat de markt jong is, en een test op 30 tot 50 eigen gevallen kost een paar dagdelen. Dat maakt de eigen test het goedkoopste bewijs dat er is. Het tweede deel van de verwachting: de testset gaat mee van model naar model, want makers stoppen hun gereedschap (OpenAI Evals op 30 november 2026) terwijl de methode blijft.
Wat die verwachting zou breken: als een onafhankelijke partij een standaardtest voor MKB-administratie uitbrengt die kopers vertrouwen, dan hoeft niemand meer zelf te testen. Die zien we nog niet.
Tegen die tijd wil Bombos dat jouw testset niet los bestaat, maar vanzelf groeit uit het werk: elk voorstel dat je goedkeurt of verbetert, is een getest geval met het goede antwoord erbij.
Wat kan testen (nog) niet?
Een test vindt de fouten in de gevallen die je hebt gekozen, en geen andere. Dat is de belangrijkste grens, en de rest volgt eruit.
- Zeldzame fouten blijven onzichtbaar. Met 50 foutloze gevallen kan de foutkans nog 6% zijn. Een kleiner bedrijf heeft niet genoeg gevallen van één soort om onder de 2% te komen.
- Zeldzaam werk valt buiten de schaduw. Twee weken schaduwdraaien zien geen jaarafsluiting.
- Een test veroudert. Een nieuw model, een update van je pakket of een nieuwe factuurvorm van een leverancier maakt de oude uitslag onbetrouwbaar tot je opnieuw test.
- De drempels zijn niet onderbouwd. 80%, 85%, 90% en 98% komen van partijen die zelf iets verkopen, en geen van hen legt uit waarom. Je moet je eigen drempel kiezen op basis van wat een fout kost.
- Wat alleen in iemands hoofd zit, kun je niet testen. Als het goede antwoord nergens staat, kun je de kolom “verwacht” niet invullen. Dat vraagt eerst het vastleggen van die kennis.
- Een geslaagde test haalt de verantwoordelijkheid niet weg. Wat je bedrijf verstuurt, blijft van je bedrijf, ook na een goede test.
Hoe pakt Bombos dit aan?
Bombos begint elke nieuwe taak op voorstellen, zodat de eerste weken lijken op schaduwdraaien, met één verschil: een voorstel dat je goedkeurt, wordt ook uitgevoerd. Bombos leest wat binnenkomt, zoekt in je eigen systemen de klant en het dossier erbij en legt een voorstel klaar, met erbij waarop het gebaseerd is. Je keurt goed, past aan of wijst af, in Bombos. Pas na je akkoord staat het resultaat in je mail of je pakket. Elke correctie geldt daarna als regel, ook voor je collega’s. Zo ontstaat de testset uit je eigen werk: elk voorstel is een geval met het goede antwoord erbij.
De akkoordgrens is het vangnet van hierboven, en die zit in het programma, niet in een instructie. Een betaling, een bericht aan een klant en een contract wachten standaard op jouw akkoord. Je kunt die grens zelf niet uitzetten; wil je hem er voor een soort werk toch af, dan doet Bombos dat op jouw verzoek, op eigen risico. Zelfstandigheid verdient een werker per soort werk, niet in één keer. Bombos werkt met meerdere agents: Chef verdeelt wat binnenkomt over de specialisten, Wegwijzer helpt je de grenzen in te stellen en stelt voor wat Bombos kan overnemen. Het model eronder is wisselbaar; wat Bombos leert, zit in je goedkeuringen en correcties.
Wat alleen in iemands hoofd zit, vindt Bombos niet. Daarom interviewt Bombos je: het stelt de vragen om die kennis vast te leggen, zodat de kolom “verwacht” er de volgende keer wel is.
Wil je eerst op je eigen oude gevallen zien wat een voorstel waard is, neem er dan tien tot twintig mee naar het eerste gesprek. De pilot kost 2.000 euro voor drie maanden, daarna 1.000 euro per maand; in die drie maanden nemen we je terugkerende werk stap voor stap uit handen en begeleiden de makers je. Daarna leert je eigen team Bombos de volgende, zonder technisch te zijn. Het doel is hetzelfde als van de test: met hetzelfde team meer werk doen, van een hogere kwaliteit.
Bronnen
Elke bron is op 30 september 2026 geopend en elk citaat staat er letterlijk in.
- Anthropic, “Demystifying evals for AI agents”, https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents, 9 januari 2026.
- Anthropic, “Bringing Salesforce into Claude”, https://claude.com/blog/salesforce-in-claude, 15 september 2026.
- OpenAI, “Evaluation best practices”, https://developers.openai.com/api/docs/guides/evaluation-best-practices, levend document, gelezen 30 september 2026.
- OpenAI, “Evals guide”, https://developers.openai.com/api/docs/guides/evals, levend document, gelezen 30 september 2026.
- OpenAI, “An agent used DNS to reach an external chatbot”, https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/, 25 september 2026.
- Microsoft Learn, “Evaluate your AI agents”, https://learn.microsoft.com/en-us/azure/foundry/observability/how-to/evaluate-agent, bijgewerkt 25 september 2026.
- Moneybird, “Model Context Protocol (MCP)”, https://developer.moneybird.com/tools/mcp, bijgewerkt 28 september 2026.
- Salesforce NL, “Je AI-agent evalueren”, https://www.salesforce.com/nl/blog/ai-agent-evaluation-3/, 23 juni 2026.
- Sierra, “tau-bench: Benchmarking AI agents for the real-world”, https://sierra.ai/blog/benchmarking-ai-agents, 20 juni 2024.
- Salesforce Research, “CRMArena-Pro”, https://arxiv.org/abs/2505.18878, 24 mei 2025.
- Carnegie Mellon University, “TheAgentCompany”, https://arxiv.org/abs/2412.14161, 18 december 2024 (versie 3, 10 september 2025).
- The Register, “AI agents get office tasks wrong around 70% of the time”, https://www.theregister.com/2025/06/29/ai_agents_fail_a_lot/, 29 juni 2025.
- Zenity, “AI Agent Destroys Production Database in 9 Seconds”, https://zenity.io/blog/current-events/ai-agent-database-deletion-pocketos, 28 april 2026.
- NBC News, “Google says its AI model gained unauthorized access to three outside systems”, https://www.nbcnews.com/tech/tech-news/google-says-ai-model-gained-unauthorized-access-three-systems-rcna598651, 18 september 2026.
- AudioEye via PR Newswire, https://www.prnewswire.com/news-releases/audioeye-study-finds-up-to-68-drop-in-ai-agent-task-completion-on-inaccessible-websites-302888585.html, 24 september 2026.
- AI Groeigids, “AI-agent sandbox voor MKB in 2026: test met oude cases vóór livegang”, https://aigroeigids.nl/artikel/ai-agent-sandbox-mkb-2026-testen-met-oude-cases-voor-livegang, 12 juli 2026.
- aiagency.nl, “AI Agent Bouwen: Stap-voor-Stap”, https://www.aiagency.nl/blog/ai-agent-bouwen-stap-voor-stap, 2 april 2026.
- werksnellermetai.nl, “AI agent maken”, https://www.werksnellermetai.nl/ai-agent-maken/, 26 september 2026.
- Spies Creations, “Hoe weet u of uw AI-agent het goed doet?”, https://spiescreations.nl/ai-agent-observability-mkb/, 15 mei 2026.
- agentforgehub, “Shadow Mode for AI Agents”, https://www.agentforgehub.com/posts/shadow-mode-for-ai-agents, 17 maart 2026.
- agentmelt, “How to Test AI Agents Before Launch”, https://agentmelt.com/blog/how-to-test-ai-agents-before-launch/, 11 april 2026, bijgewerkt 22 september 2026.
- The Pedowitz Group, “How do I test AI agents before deployment?”, https://www.pedowitzgroup.com/how-do-i-test-ai-agents-before-deployment-safe-rollouts, zonder datum.
- StackAI, “How to evaluate and test AI agents before deploying to production”, https://www.stackai.com/insights/how-to-evaluate-and-test-ai-agents-before-deploying-to-production, 24 februari 2026.
- ICTRecht, “Testen met persoonsgegevens: mag dit eigenlijk wel?”, https://www.ictrecht.nl/blog/testen-met-persoonsgegevens-mag-dit-eigenlijk-wel, 3 juni 2020.
