AI & agents · 26 augustus 2026

Wat kost een agent voor iemand anders?

Eén AI-agent, één gebruiker, één maand. De rekening bestaat uit tokens, zoekopdrachten en draaitijd — maar welke knop je omzet bepaalt de uitkomst veel sterker dan welk model je kiest. Draai aan de schuifjes en kijk mee.

De bevinding

Sessie-hygiëne is een grotere kostenknop dan modelkeuze. Een gesprek dat nooit opnieuw begint, laat de context over dagen doorgroeien — en dan betaal je bij élke aanroep de volle historie, ook bij een berichtje van drie woorden. Bij de instellingen hieronder scheelt wel of niet resetten , terwijl het duurste naar het goedkoopste model springen scheelt.

De rekenaar

Begin bij een profiel, verfijn daarna zelf. Alles rekent in je browser; er gaat niets weg.

Gebruiksprofiel
Model
Levensduur van de cache
25
Wat de gebruiker per dag vraagt.
6
De agent-lus: één vraag is zelden één aanroep.
25.000
Systeemprompt, geheugen en gereedschapsbeschrijvingen samen.
1.500
Hoeveel de historie per beurt aandikt.
600
1,0
$10 per 1.000 zoekopdrachten.
60
Draaitijd telt alleen als de agent écht werkt, niet als hij wacht.
10 berichten
Uiterst rechts: nooit resetten.
per gebruiker per maand

    De vier knoppen, op volgorde van effect

    Elke factor hieronder is uitgerekend bij jouw huidige instellingen: hoeveel duurder wordt het als je die ene knop de verkeerde kant op zet, terwijl al het andere gelijk blijft.

    Waarom een sessie die nooit reset ontspoort

    De grafiek volgt dezelfde maand twee keer: één keer met de reset die je hebt ingesteld, één keer zonder enige reset. De kosten per bericht zijn in het begin bijna gelijk. Het verschil ontstaat doordat de historie in het tweede geval blijft aangroeien, zodat elk volgend bericht een grotere context meesleept dan het vorige.

    met reset (elke 10 berichten) zonder reset

    De cache van vijf minuten overleeft geen mens

    Een gecachte prefix is bij het schrijven duurder dan gewone invoer en bij het lezen een tiende van de prijs. Dat verdient zich terug zodra hij ten minste één keer gelezen wordt — en precies daar zit het lek. De standaardcache leeft vijf minuten, en een mens antwoordt niet binnen vijf minuten. Bij een conversationele agent verloopt de cache dus structureel tussen twee berichten door: je betaalt elke beurt de volle schrijfprijs en leest hem nooit terug.

    De cache van een uur kost tweemaal de basisprijs om te schrijven in plaats van 1,25 maal, maar wordt bij een normaal gespreksritme wél gelezen. Per saldo is dat de goedkopere kant.

    TariefOpus 5Sonnet 5Haiku 4.5
    Invoer$5,00$2,00$1,00
    Cache schrijven, 5 min (1,25×)$6,25$2,50$1,25
    Cache schrijven, 1 uur (2×)$10,00$4,00$2,00
    Cache lezen (0,1×)$0,50$0,20$0,10
    Uitvoer$25,00$10,00$5,00
    Contextvenster1M1M200K

    Bedragen per miljoen tokens, in dollars. Het contextvenster staat er niet voor de sier: op een model van 200K loopt een niet-resettende sessie veel eerder tegen zijn plafond, waarna compactie ingrijpt. Dat dempt de kosten, maar alleen doordat er informatie verdwijnt.

    Wat er níet in zit, en wat wel

    Hoe je de verrassing technisch afvangt

    Er bestaat sinds kort een harde, door het platform afgedwongen dollargrens per sessie. Je zet hem mee bij het aanmaken:

    session = client.beta.sessions.create(
        agent=AGENT_ID, environment_id=ENV_ID,
        budget={"type": "limit",
                "max_list_cost": {"amount": "2500", "currency": "USD"}},  # "2500" = $25,00
    )

    Het tegenargument staat bovenaan, niet onderaan. Financieel is de grens een oplossing. Operationeel verplaatst hij de verrassing alleen. Een agent die halverwege een taak stilvalt omdat het budget op is, is voor een niet-technische gebruiker gewoon een kapotte agent — en hij kan zichzelf niet deblokkeren. Zet je de grens laag genoeg om je creditcard te beschermen, dan word je de helpdesk. Zet je hem hoog genoeg om dat te voorkomen, dan bescherm je niets. De echte kostenvraag is niet financieel maar operationeel.

    Wat vraag je dan?

    Drie manieren om de rekening te beleggen, en wat elk ervan werkelijk oplost:

    OptieWat het oplostWat het kost
    Jij betaaltGeen drempel voor de gebruikerElke gebruiker is een open kraan
    Gebruiker brengt eigen sleutel meeGeen enkel risico voor jouOnhaalbaar behalve bij een technische klant
    Doorbelasten met margeDe enige route die schaaltJe moet een prijs noemen vóór je weet wat iemand doet

    De derde, met de harde grens als vangnet. Een startprijs van rond het dubbele van je kostenschatting is geen winst maar buffer: de spreiding over de profielen is groot genoeg dat één intensieve gebruiker een krappe marge in één maand opeet.

    En dan de zin die het ongemakkelijk maakt: bij normaal gebruik op een fatsoenlijk model is dit de prijsklasse van een betaalde zakelijke gebruikersplek, niet van een klein abonnementje. Wie rekent op "een agent draait toch bijna gratis" heeft een businessmodel dat op licht gebruik staat — en dat is een aanname, geen meting.

    Waar dit vandaan komt

    Wat het model wel en niet doet

    Het rekent per gebruikersbericht, niet per model-aanroep — dat is het punt: één vraag aan een agent die iets regelt kost meerdere aanroepen, en de kosten schalen met dat aantal. Binnen een bericht groeit de context per aanroep mee met de voorgaande uitvoer en het teruggegeven gereedschapsresultaat. De volledige context loopt telkens onder een cache-breekpunt door; er wordt geen ongecachte invoer verondersteld. Compactie is benaderd als een hard plafond op de historie, niet als een samenvattende stap met eigen kosten.

    Rekent volledig in je browser. De getallen zijn lijstprijzen van 26 augustus 2026 en veranderen; het patroon eronder — context maal aanroepen domineert — verandert niet.