Wie meer dan één AI-agent draait, komt vroeg of laat bij deze vraag. En verwart bijna altijd twee dingen die los van elkaar staan: het harnas (de software die de agent draait) en het model (de LLM eronder). Dat zijn twee onafhankelijke keuze-assen — en ze kosten je heel verschillende dingen. De ene vrijmaken is goedkoop en bijna altijd de moeite. De andere vermeerderen is duur en zelden terecht.
Interactieve uitleg · alles draait in je browser · geen account, geen netwerk-calls
01 De knoop: twee dingen die versmelten
Waarom "ik heb een tweede agent nodig" bijna nooit betekent wat je denkt.
Het harnas (Engels: harness) is de hele softwarelaag rond het kale model die er een agent van maakt: de lus, de tool-runtime, het context-management, de permissies, het laden van instructie, skills en geheugen. Kortom — alles wat niet het model is. Het is wat je installeert en draait.
Het model is de kale LLM eronder: het ding dat tokens leest en schrijft. Claude, Qwen, Grok, Gemini, een lokaal model op je eigen machine.
In de praktijk lopen die twee steeds samen op. "Ik draai Claude Code" betekent stilzwijgend "Claude Code mét een Claude-model". En dus voelt elke uitbreiding als één beweging: meer. Maar er zijn twee richtingen, en ze lossen verschillende problemen op:
→ de model-as: kosten, kwaliteit, lock-in↓ de harnas-as: wat de software kan
De model-as gaat over kosten, kwaliteit en lock-in. Een goedkoop model voor bulkwerk, een sterk model voor de moeilijke call, een lokaal model voor bijna nul marginale kosten — en niet vastzitten aan één leverancier. De harnas-as gaat over capabilities die in de software zitten, niet in het model: een leerloop, een bepaalde tool-integratie, een gateway naar een chat-app. Dat verschil kun je niet oplossen door een ander model te kiezen.
De dure fout: je merkt dat je fleet tekortschiet, je concludeert "ik heb er een tweede harnas bij nodig", en je bouwt dubbel onderhoud in — terwijl je eigenlijk een ander model bedoelde. Eén string veranderen was genoeg geweest. De rest van deze pagina is bedoeld om die verwarring uit je systeem te halen.
02 Het rooster: harnas × model
Zet de assen naast elkaar en elke cel is een werkende combinatie. Tik er een aan.
aanbevolen default alleen bij echte gap zelden logisch
Model direct (één leverancier)
Model via een gateway
Model lokaal (eigen machine)
Je huidige harnas
Een tweede harnas erbij
Het punt van het rooster: je beweegt onafhankelijk over beide assen. Een ander model kiezen verandert niets aan je harnas; een ander harnas kiezen verandert niets aan welk model je eronder hangt. Horizontaal schuiven kost je één string. Verticaal schuiven kost je een tweede systeem om te onderhouden.
03 De gateway: één stekkerdoos voor alle modellen
Hoe je de model-as vrijmaakt — en wat dat werkelijk kost.
Een LLM-gateway is één API-endpoint waarachter honderden modellen hangen. Je harnas praat tegen dat ene endpoint alsof het één model is; per call kies je met een enkele string wélk model de call afhandelt. OpenRouter is de bekendste gehoste variant — een drop-in vervanger voor de OpenAI-API, dus bestaande SDK's werken zonder codewijziging. LiteLLM doet hetzelfde als open, zelf-gehoste laag: dezelfde rol, je eigen server, geen tussenpartij.
POST https://openrouter.ai/api/v1/chat/completions · { "model": "anthropic/claude-…", … }
jouw harnas
→
gateway
→
Claude
Qwen
Grok
Gemini
Kies een model en stuur de call. Let op wat er verandert: alleen de string.
Welke as maakt dit vrij? Alleen de model-as. Je harnas zit niet meer vastgeschroefd aan één leverancier — van model wisselen is één string veranderen, geen herbouw. Dat is een hedge, geen luxe: als een model duurder wordt, verdwijnt, of niet langer beschikbaar is voor jouw type gebruik, zwenk je zonder één regel van je fleet te herbouwen. Wat een gateway niet doet: je harnas leert er niets nieuws van. Capabilities die in de software zitten, blijven ontbreken.
Wat kost de gateway je?
Een veelgehoord misverstand is dat een gateway een opslag op elk token rekent. Bij OpenRouter is dat niet zo: de tokenprijzen van de onderliggende aanbieders gaan er zonder markup doorheen. De fee zit op het opwaarderen van je tegoed — en juist daar zit een venijnig detail: het minimum van $0,80 maakt kleine stortingen relatief duur.
Fee
$1,38
Effectief tarief
5,5%
Op de tokens zelf betaal je 0% markup — je krijgt de prijs van de onderliggende aanbieder.
Waar draai je wat
Met de model-as vrij wordt "welk model" een keuze per taak in plaats van een fundament. Bulk- en routinewerk naar een goedkoop of lokaal model. De moeilijkste call naar het sterkste model dat je kunt betalen. Gevoelige data die je machine niet mag verlaten: lokaal, waar de marginale kosten bijna nul zijn — je betaalt in RAM en stroom, niet per token. En dat alles achter één endpoint, zodat de keuze omkeerbaar blijft.
04 De as-kiezer
Welke as moet jij verschuiven? Beantwoord de vraag over je échte pijn.
VRAAG 1Wat loopt er concreet mis?
VRAAG 2Kun je die ontbrekende capability concreet aanwijzen?
Kies hierboven je pijn — de aanbeveling verschijnt hier.
05 Drie koppelvlakken, van los naar strak
Besluit je tóch tot een tweede harnas: zó laat je ze samenwerken. Meer koppeling betekent méér kunnen, maar ook meer opzet en meer broosheid.
Vuistregel: begin bestand-gebaseerd. Een gedeelde map of takenlijst die je toch al hebt is een prima koppelvlak, en het is verreweg het robuustste: er breekt niets als één harnas even niet draait. Ga pas naar een directe aanroep of een protocol als je een concrete pijn kunt benoemen die de bestandsroute niet oplost — wachten op een resultaat, een echte return-waarde, gestructureerde foutafhandeling. Bouw geen protocol-brug omdat het kan.
06 Wat het je kost aan onderhoud
De eerlijke tegenhanger. Elk extra harnas is een extra ding dat kan breken — en een extra plek waar de fout kan zitten.
Laag — één harnas, één plek om te debuggen
Let op wat de meter doet. Zet de gateway aan: de last beweegt nauwelijks — de model-as vrijmaken is bijna gratis. Zet een tweede harnas erbij: de meter springt. Dat is geen toeval, dat is de hele les. Dubbel onderhoud (elk harnas heeft eigen config, geheugen, update-cyclus en failure-modes), cascade-fouten over de grens heen, en een debug-vraag die je niet meer in één systeem kunt beantwoorden: zit de fout in harnas A, in harnas B, of in het koppelvlak ertussen?
07 De vuistregel
Als je één ding meeneemt: verwar de twee assen niet.
De model-as vrijmaken
De harnas-as vermeerderen
Wat je doet
Een gateway tussen je harnas en het model
Een tweede harnas naast je eerste
Lost op
Kosten, kwaliteit per taak, lock-in, lokaal draaien
Een capability die in de software zit, niet in de LLM
Kost je
Eén endpoint en een sleutel; een fee op je tegoed
Dubbel onderhoud, een koppelvlak, drie plekken om te debuggen
Omkeerbaar?
Ja — één string terug
Nauwelijks; je bouwt er workflow omheen
Verdict
Goedkoop, bijna altijd de moeite
Duur, alleen bij een aanwijsbare gap
Default: één harnas, model-as vrij via een gateway. Voeg een tweede harnas pas toe als je een concreet ding kunt aanwijzen dat het eerste principieel niet kan. En als je merkt dat je "een tweede harnas" wilt terwijl je eigenlijk "een ander model" bedoelt — dan heb je de assen verward, en bouw je onderhoudslast in voor niets.
08 Bronnen & zekerheid
Wat geverifieerd is bij de bron, en wat een ontwerp-vuistregel blijft.
GeverifieerdOpenRouter — geen markup op tokens: de prijzen van de onderliggende aanbieders gaan er ongewijzigd doorheen. De fee zit op het kopen van tegoed: 5,5% met een minimum van $0,80 via kaart, 5% via crypto. Bij een eigen sleutel (BYOK) zijn de eerste 1 miljoen verzoeken per maand gratis, daarna 5%. Drop-in vervanger voor de OpenAI-API; modellen worden gekozen met een leverancier/model-slug op https://openrouter.ai/api/v1. openrouter.ai/docs/faq
GeverifieerdLiteLLM — open-source gateway/proxy met één OpenAI-compatibele interface naar 100+ LLM-aanbieders, zelf te hosten, met kostenregistratie, load-balancing, fallbacks en logging. docs.litellm.ai
GeverifieerdModel Context Protocol (MCP) — een open standaard om AI-applicaties met externe systemen te verbinden; in de eigen documentatie omschreven als "een USB-C-poort voor AI-applicaties". Breed ondersteund door clients en servers. modelcontextprotocol.io
Ontwerp-vuistregel"Harnas × model als twee assen" en "begin bestand-gebaseerd" — dit zijn ordenende principes, geen gemeten feiten. Ze houden stand zolang je harnassen echt losstaan; in een strak geïntegreerde stack (een harnas dat alleen met één model werkt) vervalt de onafhankelijkheid van de assen. De onderhoudslast-meter is een didactisch model, geen voorspelling.
Aan verandering onderhevigTarieven en fees — gateway-fees, modelprijzen en gratis-tier-grenzen wijzigen regelmatig. De percentages hierboven zijn gecontroleerd in juli 2026; controleer ze bij de bron voordat je erop rekent.
Geen aankoop- of architectuuradvies. Een oriëntatie voor wie meer dan één agent draait en wil weten welke knop hij eigenlijk omdraait.