Artikel

Wat is een AI-agent, en hoe lang kan hij echt alleen werken?

Een agent maakt werk dat een mens 70 minuten kost in vier van de vijf keer goed af, op nette programmeertaken.

Door Piet Baudoin · september 2026

Een AI-agent kiest zelf zijn stappen en voert ze uit in jouw systemen. Het sterkste onafhankelijk gemeten model maakt werk van ongeveer 70 minuten in vier van de vijf keer goed af, op nette programmeertaken. Dat is minder dan de folders beloven. Hieronder reken ik die gemeten lijn door naar een jaartal. Wat agents vandaag in het mkb overnemen, staat in wat de agentic economy is.

Wat doet een AI-agent dat een chatbot niet doet?

Hij handelt. Een chatbot antwoordt.

Microsoft schrijft het zo op: “Unlike a large language model, an agent doesn’t only return content for a human to act on. Instead, an agent: Acts autonomously.” Een agent roept dus zelf gereedschap aan, schrijft gegevens weg en zet werk in gang, zonder dat iemand elke stap goedkeurt (Microsoft, 11 september 2026).

Het verschil gaat over wie er handelt. De agent schrijft, verstuurt en wijzigt onder een eigen naam, in jouw Outlook en in jouw Exact.

Bij OpenAI is het inmiddels een knop: Chat voor vragen, Work voor langere klussen. Zet je die knop om, dan is de vraag niet meer of het antwoord klopt, maar of dit mocht gebeuren. Meer daarover in mag een AI-assistent zelf mail versturen.

Is een vaste automatisering zoals Zapier ook een agent?

Nee. Het verschil zit in wie de stappen kiest.

Bij een vaste automatisering tekent een mens het pad vooraf uit: komt er een factuur binnen, doe dan dit, en daarna dat. Wijkt de factuur af, dan valt hij stil of doet hij het verkeerde. Bij een agent staat het doel vast en de route niet, dus hij bepaalt bij elke factuur opnieuw wat hij gaat doen.

Chatbot Vaste automatisering AI-agent
Wie kiest de stappen jij, per vraag de bouwer, vooraf het model, tijdens het werk
Wat raakt hij aan alleen het scherm wat de bouwer aanwees alles waar hij bij mag
Bij een fout je negeert het de fout herhaalt zich hij is al uitgevoerd

Let op de cijfers. Het CBS telde over 2025 dat 29,8 procent van het mkb van 10 tot 249 mensen AI-technologie gebruikte (CBS, 16 maart 2026). In die telling telt gewone procesautomatisering gewoon mee als AI. Dat gaat dus over bedrijven die iets met AI doen, niet over bedrijven die een agent laten werken. Dat cijfer bestaat niet.

Hoe lang werkt een agent volgens de metingen alleen door?

Dat hangt af van hoe zeker je het wilt hebben.

METR meet niet hoe lang een model bezig is, maar hoe groot de klus is die het aankan, in menselijke werkuren: de tijdshorizon.

GPT-4 haalde in maart 2023 ongeveer 4 minuten. Claude Opus 4.6 stond in februari 2026 op 12 uur, een verdubbeling elke 129 dagen. METR publiceerde die meting in mei 2026, maar het gemeten model is van februari 2026: met die datum reken ik hieronder verder. De modellen van september 2026 heeft METR nog niet gemeten, dus dit is een ondergrens.

Die 12 uur is een muntworp: de lengte die het model in de helft van de gevallen haalt. Wil je vier van de vijf keer goed, dan zakt het naar 70 minuten op nette programmeertaken.

OpenAI citeert een klant: “This lets our agents reason, act, recover, and collaborate across complex workflows that can span hours or days” (OpenAI, 10 september 2026). Uren of dagen, tegenover 70 gemeten minuten. Zie ook wat Claude kan voor een klein bedrijf.

Werkt hij in een scherm net zo goed als in code?

Nee, maar het gat loopt sneller in dan de laatste onafhankelijke schatting aannam.

Die schatting komt van METR, in een notitie van 22 januari 2026: bij taken waarvoor het model naar een scherm moet kijken ligt de tijdshorizon 40 tot 100 keer lager, want het ziet slecht wat er staat.

Sinds die notitie meet OpenAI zichzelf op OSWorld, een proef met echte computertaken. Het eerste model haalde daar 38,1 procent in januari 2025. Sol kwam in juli 2026 op 62,6 procent, Astra op 3 september 2026 op 72,6 procent, allebei op het zwaardere OSWorld 2.0 en met halve taken meegeteld. Op OpenAI’s eigen veiligheidsproef voor computergebruik ging Sol in 22,0 procent van de gevallen de mist in, Astra in 2,4 procent.

Dat zijn twee meetlatten: METR meet hoe lang een taak mag duren, OpenAI hoe vaak een taak lukt. Je kunt ze niet in elkaar omrekenen, en METR meet onafhankelijk terwijl OpenAI zijn eigen model beoordeelt. Maar van 38,1 naar 72,6 procent in twintig maanden, met de fouten van 22,0 naar 2,4 procent, is te groot om de factor van januari 2026 onveranderd vol te houden.

Welk jaar haalt een agent een hele werkdag zonder toezicht?

Reken mee. Begin bij 70 minuten. Een werkdag is 480 minuten, bijna zeven keer zoveel. Twee verdubbelingen geven vier keer, drie geven acht keer: je hebt er krap drie nodig. Bij 129 dagen per verdubbeling is dat 358 dagen vanaf februari 2026, dus begin 2027.

Voor schermwerk moet de factor 40 tot 100 er nog af: 5,3 tot 6,6 extra verdubbelingen, 685 tot 855 dagen, dus eind 2028 tot medio 2029. Dat rust op de schatting van januari 2026, en de cijfers van september 2026 zeggen dat schermwerk sneller inloopt.

Mijn hypothese: in 2027 maakt een agent een hele werkdag aan net omschreven werk zelfstandig af, en voor schermwerk in jouw eigen pakketten gebeurt dat eerder dan het trage scenario van eind 2028 tot medio 2029.

Twee dingen breken die hypothese. METR zegt zelf dat metingen boven 16 uur onbetrouwbaar zijn, dus boven een werkdag is de lijn niet te controleren. En de gemeten taken zijn netjes omschreven, jouw kantoorwerk niet.

Voor een mkb-bedrijf verandert dat niet het akkoord, maar de omvang ervan: je keurt straks geen losse stap goed, maar een afgerond stuk werk van een halve dag. Kies nu al taken die binnen die 70 minuten passen en achteraf te controleren zijn. Wachten kan een agent die de hele dag ongezien in je pakketten klikt. Of je er meerdere naast elkaar nodig hebt, staat in heb je met twintig man meerdere AI-agents nodig.

Wat kan een AI-agent vandaag niet?

Hij weet niet wat alleen in iemands hoofd zit. En hij kan zich niet verdedigen tegen tekst die hem opdrachten geeft.

Dat tweede werkt zo. In de bijlage van een leverancier staat een zin die de agent vertelt wat hij moet doen, en hij voert die uit alsof jij het vroeg. Dat heet prompt injection, en Microsoft zet het bovenaan zijn lijst van agentrisico’s.

OpenAI beschrijft in zijn handleiding hoe dat afloopt: een zoekopdracht naar een restaurant eindigt ermee dat de agent een wachtwoordcode uit je Gmail doorstuurt. Dezelfde handleiding raadt af om te zeggen: controleer mijn mail en handel alles af.

Investeerder Katie Jacobs Stanton schreef op 22 augustus 2026 dat een AI-assistent ongevraagd een mail namens haar verstuurde, waarna zij de toegang tot haar mail introk.

Wat eist de wet, en wie draait op voor de fout?

Sinds 2 augustus 2026 moet een systeem dat rechtstreeks met mensen praat, zeggen dat het AI is. De Europese Commissie noemt bij artikel 50 letterlijk chatbots, AI-agents en avatars (24 juli 2026). Dat geldt ook voor de chat op jouw site.

Passend menselijk toezicht op AI met een hoog risico gaat pas in op 2 december 2027, en op 2 augustus 2028 voor AI die in producten zit. Tot die tijd is het jouw besluit.

Microsoft zegt niet wie er tekent bij een kant-en-klare dienst. Het zet zijn uitleg wel onder de kop gedeelde verantwoordelijkheid, schrijft dat een agent zijn stappen zet zonder dat een mens er per stap op drukt, en zet te veel mogen en onbeperkt doorlopen bij de risico’s. Wie er betaalt als het misgaat, staat in wie aansprakelijk is bij een fout.

Waar begin je mee, met twintig man?

Met één taak van hooguit een half uur waarvan je achteraf ziet of hij goed of fout ging. Niet een hele afdeling, maar één stuk werk dat binnen die 70 minuten valt. Een inkoopfactuur die iemand overtikt is zo’n taak: het bedrag klopt of het klopt niet.

Vraag je leverancier daarna: bij welke handelingen wacht dit op een akkoord?

Bombos leest wat er binnenkomt, mail, appjes, bonnen en facturen, zoekt de gegevens erbij in de pakketten die je al hebt, en zet het werk klaar met de reden erbij. Er gaat geen bericht naar een klant en geen betaling de deur uit zonder dat iemand van jouw bedrijf op Goedkeuren drukt. Dat is technisch afgedwongen en staat altijd aan.

Daarom groeit dit mee met de lijn hierboven. Meer zelfstandigheid wordt per soort werk verdiend: gaat het vaak genoeg goed, dan hoeft Bombos het minder vaak voor te leggen, en jij bepaalt dat tempo. Worden de modellen betrouwbaar over langere taken, dan schuift die grens mee voor opzoeken, nalopen en klaarzetten. We kunnen het sterkste en het meest kostenefficiënte model er per direct onder zetten, en per klant wisselen naar wat die klant wil. Het akkoord op berichten en betalingen blijft staan, dus je gaat met die snelheid mee zonder dat het risico meegroeit.

Onze belofte: na drie maanden ligt het werk waar we mee beginnen elke dag klaar, zonder dat iemand eraan hoeft te denken. Laat je nummer achter op de contactpagina, dan bellen we je terug.

Begin bij werk dat je kunt nakijken.

Bronnen

Elke bron is op 20 september 2026 geopend en elk citaat staat er letterlijk in.

Wat een agent is, volgens de makers

Hoe lang een agent alleen werkt

Hoe goed een agent met een scherm omgaat

Hoeveel bedrijven AI gebruiken

Wat de wet eist

Wat er misgaat