📞 Voice-AI uitgelegd

Laat een AI je telefoontjes doen

Er is een nieuwe generatie AI die écht kan bellen en gebeld worden — een afspraak maken, de wacht doorstaan, of aan de deur je oproepen screenen. Deze gids laat zien hoe zo'n voice-agent onder de motorkap werkt, welk platform bij welke klus past, en waar de techniek nog stukloopt.

En er is een reden dat dit mij raakt: telefoneren is voor iemand die slecht hoort een klein struikelblok dat elke week terugkomt. Geen ondertiteling, matige lijn, geen gezicht om van te liplezen. Een AI die het gesprek namens je voert — of live ondertitelt — is dan niet speelgoed maar toegankelijkheid. Ik houd het daarbij eerlijk: wanneer helpt het echt, en wanneer niet.

🧭 Twee kanten van hetzelfde ding

Een bel-AI werkt in twee richtingen. Ze delen dezelfde techniek, maar lossen een ander probleem op.

Uitgaand

Bel namens mij. Jij geeft de opdracht in tekst — "boek een tafel voor twee om 19:00" — de agent belt, praat met de mens aan de andere kant, past zich aan hun antwoorden aan, en rapporteert het resultaat schriftelijk terug.

  • Afspraak maken / bevestigen
  • Openingstijden of voorraad checken
  • In de wacht blijven tot een mens opneemt

Inkomend

Neem op / screen voor mij. De agent beantwoordt binnenkomende oproepen: vraagt waar het over gaat, filtert spam eruit, plant een afspraak in, of verbindt door — 24/7, en met een geschreven transcript zodat jij achteraf leest wat er is gezegd.

  • Receptie / klantenservice
  • Call-screening (spam eruit)
  • Boodschap aannemen + transcriberen
Het bestaat al mainstream

Google's Call Screen, Hold for Me en de spraak-Duplex bewezen jaren geleden al dat een AI menselijk-klinkend kan bellen. In 2026 rolt Google call-screening breder uit naar Android. Wat nieuw is: bouwplatforms (Vapi, Retell, Bland, ElevenLabs) maken het nu voor iedereen bouwbaar — in het Nederlands.

⚙️ Hoe werkt het? De lus, stap voor stap

Bijna elke voice-agent is een cascade: het gesprek loopt telkens door dezelfde keten. Druk op play en volg één beurt.

📞Lijn
🎚️Endpointing
✍️STT
🧠LLM
🔊TTS
📞Terug
Tot eerste antwoord:
Waarom "streaming" de hele truc is

Zonder streaming zijn de stappen na elkaar en tellen alle wachttijden op: eerst het hele transcript, dán het hele LLM-antwoord, dán al het geluid → seconden stilte. Met streaming overlappen de fasen: de gebruiker hoort al audio terwijl het model nog denkt. Alleen zo haal je onder de seconde.

⏱️ Latency-budget: wanneer voelt een gesprek kapot?

Mensen laten in een gesprek gemiddeld maar ~200 ms stilte tussen beurten gemeten. Een agent haalt dat niet, maar onder ~1 seconde voelt natuurlijk. Schuif aan de knoppen en zie waar je uitkomt.

Streaming door de hele pijplijn aan
80 ms
300 ms
120 ms
300 ms
snel model gebalanceerd premium/redenerend
90 ms
050090015002500 ms+
Zet streaming eens uit

Dan moet het LLM zijn hele zin afmaken en de TTS al het geluid renderen vóór er iets klinkt — de teller schiet naar 2–4 seconden en de meter kleurt rood. Dat is precies waarom elke serieuze voice-agent overal streamt.

De component-getallen zijn realistische schatting-ranges uit leveranciers- en industriebronnen; behandel ze als orde van grootte, niet als exacte meting. Alleen de menselijke ~200 ms beurtwissel is peer-reviewed.

🤔 Het moeilijkste stukje: "ben je klaar met praten?"

Te vroeg beslissen → de agent kletst er dwars doorheen. Te laat → ongemakkelijke stilte. Deze ene afweging bepaalt méér dan wat ook of een agent "menselijk" voelt.

Je zegt tegen de agent: "Mijn nummer is nul zes… eh…" — wat doet de detector?

Stilte-timeout

Wacht X ms stilte. Simpel maar bot: een timeout van 800 ms voegt bijna een seconde toe aan elke beurt; korter en de agent valt mensen in de rede die even nadenken.

Semantisch model

Een lichtgewicht model leest het deel-transcript en voorspelt of de zin áf is. Kan eerder afronden bij een complete zin, of juist langer wachten na "mijn nummer is…". Modern = de twee gecombineerd.

Barge-in — de agent moet kunnen zwijgen

Terwijl de agent praat, blijft de detectie aan. Begin jij te praten, dan wordt het geluid binnen ~100–150 ms afgekapt en de rest van het antwoord weggegooid. De kunst: een echte onderbreking onderscheiden van een "mhm" of "ja" waarop de agent juist niet moet stoppen.

🧩 Welk platform past bij jou?

Er is geen "beste" — het hangt af van wat jij zwaar laat wegen. Schuif je prioriteiten of kies een profiel; de ranglijst schuift live mee.

Zelf sleutelen & tunen Snel live, weinig gedoe Voorspelbare kosten Beste stem-kwaliteit Data in eigen hand
6
6
5
6
4
7

Scores zijn een gewogen inschatting op basis van openbare docs/pricing (juli 2026) schatting. Nederlands zit bij de meeste platforms in de onderliggende STT/TTS-provider, niet in het platform zelf — test altijd met een echte NL-belproef.

🦻 Helpt dit slechthorenden echt? Eerlijk antwoord

Ja — maar via twee verschillende mechanismen die je niet moet verwarren. En voor sommige gesprekken blijft de oude oplossing beter.

A · Jij belt, AI ondertitelt

Je houdt zelf de regie; een dienst zet live om wat de ander zegt in tekst.

  • Google Live Caption (Pixel): ondertitelt ook telefoongesprekken, on-device zeker
  • Apple Live Captions: on-device, maar voor gewone cellulaire gesprekken wisselend/beperkt let op
  • RogerVoice (ook NL): ondertitelt de ander én zet jouw tekst om in spraak; kan naar hoortoestel/CI streamen zeker
  • KPN Teletolk: gratis NL relay-dienst (tekst of NGT-tolk), 07:00–22:00, verlengd t/m 2028 zeker

B · AI belt namens jou

Je omzeilt het audiokanaal helemaal: tekst erin, de agent belt, resultaat schriftelijk terug.

Sterk bij afgebakende, transactionele klussen — afspraak boeken of bevestigen, in de wacht blijven. Geen luisterdruk, geen slechte lijn, geen gemiste visuele cues. opkomend

Wanneer B juist níét de beste keuze is

Bij een écht tweegesprek — de arts stelt een terugvraag, de situatie verandert onderweg — wil je zélf de regie. Dan is live-ondertiteling (A) of een menselijke relay-tolk passender dan een agent die namens je onderhandelt. "Bel namens mij" schittert bij transactie, niet bij nuance.

⚖️ Grenzen, ethiek & wat het kost

Onmisbaar om eerlijk te blijven: waar het stukloopt, wat de wet zegt, en dat het niet gratis is.

Waar het stukloopt

De wet: je moet het melden

EU AI Act, artikel 50 — vanaf 2 augustus 2026

Een AI-systeem dat direct met mensen praat, moet zó ontworpen zijn dat de persoon weet dat hij met een AI communiceert — tenzij dat overduidelijk is. Bij een telefoongesprek betekent dat: meld het aan het begin. (In o.a. Californië geldt met SB 1001 een vergelijkbare bot-disclosure.) zeker

Wat het kost

Geen gratis dienst — de kosten stapelen per minuut (STT + LLM + TTS + telefonie). Marktbreed grofweg $0,07–0,35/min schatting. Een gesprek van 5 minuten kost al snel €0,50–€1,00; lange wachtrijen lopen hard op. Voor incidenteel privégebruik prima, maar geen verwaarloosbare post.

📚 Bronnen & zekerheid

Cijfers zijn momentopnames van juli 2026 en verouderingsgevoelig — deze markt herprijst elk kwartaal. Herverifieer prijzen vóór je iets vastlegt.

Gedestilleerd uit een nachtelijke research-ronde (drie parallelle bron-agents). Educatieve oriëntatie, geen juridisch of aankoopadvies. 100% client-side — geen account, geen tracking, niets verlaat je toestel.