Eén AI-agent, één gebruiker, één maand. De rekening bestaat uit tokens, zoekopdrachten en draaitijd — maar welke knop je omzet bepaalt de uitkomst veel sterker dan welk model je kiest. Draai aan de schuifjes en kijk mee.
Sessie-hygiëne is een grotere kostenknop dan modelkeuze. Een gesprek dat nooit opnieuw begint, laat de context over dagen doorgroeien — en dan betaal je bij élke aanroep de volle historie, ook bij een berichtje van drie woorden. Bij de instellingen hieronder scheelt wel of niet resetten —, terwijl het duurste naar het goedkoopste model springen — scheelt.
Begin bij een profiel, verfijn daarna zelf. Alles rekent in je browser; er gaat niets weg.
—
Elke factor hieronder is uitgerekend bij jouw huidige instellingen: hoeveel duurder wordt het als je die ene knop de verkeerde kant op zet, terwijl al het andere gelijk blijft.
De grafiek volgt dezelfde maand twee keer: één keer met de reset die je hebt ingesteld, één keer zonder enige reset. De kosten per bericht zijn in het begin bijna gelijk. Het verschil ontstaat doordat de historie in het tweede geval blijft aangroeien, zodat elk volgend bericht een grotere context meesleept dan het vorige.
—
Een gecachte prefix is bij het schrijven duurder dan gewone invoer en bij het lezen een tiende van de prijs. Dat verdient zich terug zodra hij ten minste één keer gelezen wordt — en precies daar zit het lek. De standaardcache leeft vijf minuten, en een mens antwoordt niet binnen vijf minuten. Bij een conversationele agent verloopt de cache dus structureel tussen twee berichten door: je betaalt elke beurt de volle schrijfprijs en leest hem nooit terug.
De cache van een uur kost tweemaal de basisprijs om te schrijven in plaats van 1,25 maal, maar wordt bij een normaal gespreksritme wél gelezen. Per saldo is dat de goedkopere kant.
| Tarief | Opus 5 | Sonnet 5 | Haiku 4.5 |
|---|---|---|---|
| Invoer | $5,00 | $2,00 | $1,00 |
| Cache schrijven, 5 min (1,25×) | $6,25 | $2,50 | $1,25 |
| Cache schrijven, 1 uur (2×) | $10,00 | $4,00 | $2,00 |
| Cache lezen (0,1×) | $0,50 | $0,20 | $0,10 |
| Uitvoer | $25,00 | $10,00 | $5,00 |
| Contextvenster | 1M | 1M | 200K |
Bedragen per miljoen tokens, in dollars. Het contextvenster staat er niet voor de sier: op een model van 200K loopt een niet-resettende sessie veel eerder tegen zijn plafond, waarna compactie ingrijpt. Dat dempt de kosten, maar alleen doordat er informatie verdwijnt.
Er bestaat sinds kort een harde, door het platform afgedwongen dollargrens per sessie. Je zet hem mee bij het aanmaken:
session = client.beta.sessions.create(
agent=AGENT_ID, environment_id=ENV_ID,
budget={"type": "limit",
"max_list_cost": {"amount": "2500", "currency": "USD"}}, # "2500" = $25,00
)
"2500" is $25,00; "25.00" wordt geweigerd. Alleen dollars.Het tegenargument staat bovenaan, niet onderaan. Financieel is de grens een oplossing. Operationeel verplaatst hij de verrassing alleen. Een agent die halverwege een taak stilvalt omdat het budget op is, is voor een niet-technische gebruiker gewoon een kapotte agent — en hij kan zichzelf niet deblokkeren. Zet je de grens laag genoeg om je creditcard te beschermen, dan word je de helpdesk. Zet je hem hoog genoeg om dat te voorkomen, dan bescherm je niets. De echte kostenvraag is niet financieel maar operationeel.
Drie manieren om de rekening te beleggen, en wat elk ervan werkelijk oplost:
| Optie | Wat het oplost | Wat het kost |
|---|---|---|
| Jij betaalt | Geen drempel voor de gebruiker | Elke gebruiker is een open kraan |
| Gebruiker brengt eigen sleutel mee | Geen enkel risico voor jou | Onhaalbaar behalve bij een technische klant |
| Doorbelasten met marge | De enige route die schaalt | Je moet een prijs noemen vóór je weet wat iemand doet |
De derde, met de harde grens als vangnet. Een startprijs van rond het dubbele van je kostenschatting is geen winst maar buffer: de spreiding over de profielen is groot genoeg dat één intensieve gebruiker een krappe marge in één maand opeet.
En dan de zin die het ongemakkelijk maakt: bij normaal gebruik op een fatsoenlijk model is dit de prijsklasse van een betaalde zakelijke gebruikersplek, niet van een klein abonnementje. Wie rekent op "een agent draait toch bijna gratis" heeft een businessmodel dat op licht gebruik staat — en dat is een aanname, geen meting.
Het rekent per gebruikersbericht, niet per model-aanroep — dat is het punt: één vraag aan een agent die iets regelt kost meerdere aanroepen, en de kosten schalen met dat aantal. Binnen een bericht groeit de context per aanroep mee met de voorgaande uitvoer en het teruggegeven gereedschapsresultaat. De volledige context loopt telkens onder een cache-breekpunt door; er wordt geen ongecachte invoer verondersteld. Compactie is benaderd als een hard plafond op de historie, niet als een samenvattende stap met eigen kosten.
Rekent volledig in je browser. De getallen zijn lijstprijzen van 26 augustus 2026 en veranderen; het patroon eronder — context maal aanroepen domineert — verandert niet.