Er is een nieuwe generatie AI die écht kan bellen en gebeld worden — een afspraak maken, de wacht doorstaan, of aan de deur je oproepen screenen. Deze gids laat zien hoe zo'n voice-agent onder de motorkap werkt, welk platform bij welke klus past, en waar de techniek nog stukloopt.
En er is een reden dat dit mij raakt: telefoneren is voor iemand die slecht hoort een klein struikelblok dat elke week terugkomt. Geen ondertiteling, matige lijn, geen gezicht om van te liplezen. Een AI die het gesprek namens je voert — of live ondertitelt — is dan niet speelgoed maar toegankelijkheid. Ik houd het daarbij eerlijk: wanneer helpt het echt, en wanneer niet.
Een bel-AI werkt in twee richtingen. Ze delen dezelfde techniek, maar lossen een ander probleem op.
Bel namens mij. Jij geeft de opdracht in tekst — "boek een tafel voor twee om 19:00" — de agent belt, praat met de mens aan de andere kant, past zich aan hun antwoorden aan, en rapporteert het resultaat schriftelijk terug.
Neem op / screen voor mij. De agent beantwoordt binnenkomende oproepen: vraagt waar het over gaat, filtert spam eruit, plant een afspraak in, of verbindt door — 24/7, en met een geschreven transcript zodat jij achteraf leest wat er is gezegd.
Google's Call Screen, Hold for Me en de spraak-Duplex bewezen jaren geleden al dat een AI menselijk-klinkend kan bellen. In 2026 rolt Google call-screening breder uit naar Android. Wat nieuw is: bouwplatforms (Vapi, Retell, Bland, ElevenLabs) maken het nu voor iedereen bouwbaar — in het Nederlands.
Bijna elke voice-agent is een cascade: het gesprek loopt telkens door dezelfde keten. Druk op play en volg één beurt.
Zonder streaming zijn de stappen na elkaar en tellen alle wachttijden op: eerst het hele transcript, dán het hele LLM-antwoord, dán al het geluid → seconden stilte. Met streaming overlappen de fasen: de gebruiker hoort al audio terwijl het model nog denkt. Alleen zo haal je onder de seconde.
Mensen laten in een gesprek gemiddeld maar ~200 ms stilte tussen beurten gemeten. Een agent haalt dat niet, maar onder ~1 seconde voelt natuurlijk. Schuif aan de knoppen en zie waar je uitkomt.
Dan moet het LLM zijn hele zin afmaken en de TTS al het geluid renderen vóór er iets klinkt — de teller schiet naar 2–4 seconden en de meter kleurt rood. Dat is precies waarom elke serieuze voice-agent overal streamt.
De component-getallen zijn realistische schatting-ranges uit leveranciers- en industriebronnen; behandel ze als orde van grootte, niet als exacte meting. Alleen de menselijke ~200 ms beurtwissel is peer-reviewed.
Te vroeg beslissen → de agent kletst er dwars doorheen. Te laat → ongemakkelijke stilte. Deze ene afweging bepaalt méér dan wat ook of een agent "menselijk" voelt.
Je zegt tegen de agent: "Mijn nummer is nul zes… eh…" — wat doet de detector?
Wacht X ms stilte. Simpel maar bot: een timeout van 800 ms voegt bijna een seconde toe aan elke beurt; korter en de agent valt mensen in de rede die even nadenken.
Een lichtgewicht model leest het deel-transcript en voorspelt of de zin áf is. Kan eerder afronden bij een complete zin, of juist langer wachten na "mijn nummer is…". Modern = de twee gecombineerd.
Terwijl de agent praat, blijft de detectie aan. Begin jij te praten, dan wordt het geluid binnen ~100–150 ms afgekapt en de rest van het antwoord weggegooid. De kunst: een echte onderbreking onderscheiden van een "mhm" of "ja" waarop de agent juist niet moet stoppen.
Er is geen "beste" — het hangt af van wat jij zwaar laat wegen. Schuif je prioriteiten of kies een profiel; de ranglijst schuift live mee.
Scores zijn een gewogen inschatting op basis van openbare docs/pricing (juli 2026) schatting. Nederlands zit bij de meeste platforms in de onderliggende STT/TTS-provider, niet in het platform zelf — test altijd met een echte NL-belproef.
Ja — maar via twee verschillende mechanismen die je niet moet verwarren. En voor sommige gesprekken blijft de oude oplossing beter.
Je houdt zelf de regie; een dienst zet live om wat de ander zegt in tekst.
Je omzeilt het audiokanaal helemaal: tekst erin, de agent belt, resultaat schriftelijk terug.
Sterk bij afgebakende, transactionele klussen — afspraak boeken of bevestigen, in de wacht blijven. Geen luisterdruk, geen slechte lijn, geen gemiste visuele cues. opkomend
Bij een écht tweegesprek — de arts stelt een terugvraag, de situatie verandert onderweg — wil je zélf de regie. Dan is live-ondertiteling (A) of een menselijke relay-tolk passender dan een agent die namens je onderhandelt. "Bel namens mij" schittert bij transactie, niet bij nuance.
Onmisbaar om eerlijk te blijven: waar het stukloopt, wat de wet zegt, en dat het niet gratis is.
Een AI-systeem dat direct met mensen praat, moet zó ontworpen zijn dat de persoon weet dat hij met een AI communiceert — tenzij dat overduidelijk is. Bij een telefoongesprek betekent dat: meld het aan het begin. (In o.a. Californië geldt met SB 1001 een vergelijkbare bot-disclosure.) zeker
Geen gratis dienst — de kosten stapelen per minuut (STT + LLM + TTS + telefonie). Marktbreed grofweg $0,07–0,35/min schatting. Een gesprek van 5 minuten kost al snel €0,50–€1,00; lange wachtrijen lopen hard op. Voor incidenteel privégebruik prima, maar geen verwaarloosbare post.
Cijfers zijn momentopnames van juli 2026 en verouderingsgevoelig — deze markt herprijst elk kwartaal. Herverifieer prijzen vóór je iets vastlegt.