AI · voice agents · Anna

Ligt het aan het model?

Een voice agent die traag antwoordt, lijkt een traag model te hebben. Vaak zit de vertraging ergens anders. Deze tijdas haalt één beurt uit elkaar: welk deel is een instelling in je eigen app, welk deel het platform, en wat lost een model met eigen beurtwisseling nog op?

De bevinding

Anna, een iOS-assistent op de realtime spraak-API van xAI, deed er op 11 september 2026 2,85 tot 3,06 seconden over van het einde van een korte vraag tot het eerste geluid. De onafhankelijke benchmark geeft hetzelfde model 0,70 seconde. Het verschil zit grotendeels buiten het model. Ruim een seconde komt uit één instelling in de app: een stilte-drempel van 1300 ms. Ongeveer een seconde zit in de einddetectie van het platform.

Wie van model wisselt zonder die twee te scheiden, schrijft het nieuwe model een winst toe die deels uit de eigen bouw komt.

Eén beurt op de tijdas

De standaardstand is Anna's meting: een stilte-drempel van 1300 ms, einddetectie van ongeveer 1,1 s ná die drempel, en een rest van ongeveer 0,5 s voor de antwoordstart en het netwerk. Samen 2,9 s, midden in de gemeten 2,85 tot 3,06. Met de drempel op 300 ms geeft dezelfde som 1,9 s; gemeten was 1,70 tot 2,04. Zet de schuifjes op je eigen metingen, of speel met B: dezelfde agent met een kortere drempel.

De wachttijd na je laatste woord
Zoveel stilte wacht de agent voor hij je beurt afsluit. Een instelling in je app.
Dezelfde agent, alleen deze ene instelling anders.
De tijd die het platform ná de drempel nog nodig heeft. Bij xAI circa 1,1 s.
Van afgesloten beurt tot het eerste stukje audio. Hier zit het model.
De vraag: «Zet een afspraak … bij de tandarts … volgende week dinsdag»

De pauzes zijn een voorbeeld. Anna's drempel staat op 1300 ms omdat een kortere drempel denkpauzes afkapte.

A · nu
B · zelfde model, bijgestelde drempel
C · model met eigen beurtwisseling0,80–1,34 s
Niet gemeten. De ondergrens is OpenAI's eigen opgave voor de beurtwisseling van GPT-Live-1, de bovengrens de modeltijd uit de benchmark. Hoe goed zo'n model lange denkpauzes laat staan, is ook niet gemeten.
Jij praat Denkpauze ✂ Hier sluit de agent je beurt af Stilte-drempel · instelling Einddetectie · platform Antwoordstart · model en netwerk Onzekerheidsband Het antwoord Einde van je vraag
Tik op een blok voor de waarde.
Als tabel
ScenarioStilte-drempelEinddetectieAntwoordstartEerste geluidDenkpauzes

Een mens wacht geen 1,3 seconde. In gesprekken wisselen mensen doorgaans binnen een paar honderd milliseconden van beurt, in alle tien talen die Stivers en collega's in 2009 vergeleken: ze horen aan de zin zelf dat die af is. Een vaste stilte-drempel hoort dat niet, die telt alleen stilte. Daarom is het een dilemma: kort instellen kapt denkpauzes af, lang instellen kost elke beurt tijd. Een model dat zelf bepaalt wanneer je klaar bent, hoeft die keuze niet te maken.

Vier verdachten die het niet waren

Bij een trage agent wijst de vinger al snel naar de eigen server, het token of het redeneren. Gemeten op dezelfde dag vielen ze alle vier af.

De tokenserver

Het ophalen van een kortlevend token kost 0,22 tot 0,26 s, en alleen bij starten en herverbinden. De audio zelf gaat rechtstreeks naar xAI. gemeten

Het verlopen token

Het token verloopt na vijf minuten, maar een sessie bleef 420 s open zonder één herverbinding. gemeten

Redeneren op «high»

Op een simpele vraag geen verschil met «none»: 1,72 tot 1,93 s tegen 1,70 tot 2,04 s. Bij zwaardere vragen kan dat anders zijn. gemeten

De audiobuffers

De microfoon levert blokken van circa 85 ms en elk ontvangen stukje audio wordt direct afgespeeld, precies zoals xAI adviseert. nagelezen

En bij een vraag met tools?

Bij een agendavraag komt er per tool-ronde tijd bij. De agent speelt eerst zijn tussenzin helemaal uit («even kijken…»), dan draait de tool, dan volgt een nieuwe antwoordstart. xAI levert de tool-aanroep pas als alle audio van die beurt verstuurd is, en raadt zelf aan met het vervolg te wachten tot het uitspelen klaar is: anders lopen twee antwoorden door elkaar. Geschat 1 tot 3 s extra per agendavraag. niet gemeten

Twee daarvan zijn eigen keuzes: een datum-tool die bij élke datumvraag verplicht als eerste moet draaien, en een agendavenster dat standaard 120 dagen terugkijkt en dus veel uitvoer oplevert. Bij een model met delegatie werkt de backend terwijl het gesprek doorloopt. Je hoort dan eerder iets, maar het antwoord zelf komt niet sneller dan de backend.

Ook niet gemeten: de lengte van de prompt. Anna's systeemprompt is 10 KB, met daarnaast een persona en tooldefinities, terwijl xAI voor 2.0 juist een veel kortere prompt aanraadt.

Onderbreken: zwijgen is het probleem niet

Praat je door de agent heen, dan gebeuren er drie dingen na elkaar.

  1. Het platform hoort je. xAI meldt het begin van je spraak 0,26 tot 0,44 s na je eerste klank, en de app leegt meteen de afspeelwachtrij. Dat deel werkt goed.
  2. Jij praat uit. Zolang je praat, wacht de agent.
  3. De agent reageert pas 2,90 s na je laatste woord. Een onderbreking is voor het platform gewoon een nieuwe beurt, dus de stilte-drempel, de einddetectie en de antwoordstart uit A gelden opnieuw.

In de benchmark voor door elkaar praten (Full Duplex Bench) liggen de modellen dicht bij elkaar: GPT-Live-1 haalt 97,3 en 94,9 procent met twee verschillende backends, Grok 2.0 95,1, en alleen de verouderde Grok 1.0 zakt naar 77,8. Afkappen kunnen ze allemaal. Het trage stuk komt erna, en daar zit weer de drempel.

Een kanttekening die niet gemeten is: Anna's spraakgevoeligheid staat op 0,5, terwijl de xAI-standaard inmiddels 0,85 is. Via de luidspreker kan een lage waarde de agent op zijn eigen stem laten reageren.

Altijd-aan: telt de stilte mee?

Een assistent die de hele avond meeluistert, heeft een sessie die uren openstaat terwijl er maar af en toe gesproken wordt. Of die stille minuten op de rekening komen, bepaalt de prijs meer dan het tarief zelf. Voor de twee actuele modellen is dat onbekend.

Model
Als alleen spraak telt
Als de hele sessie telt

Tarieven per minuut: GPT-Live-1 kost $ 0,05 voor de spraaklaag, plus de tokens van het backend-model. In de testlast van Artificial Analysis kwam dat samen op $ 4,47 tot $ 5,83 per uur, afhankelijk van de backend; het gearceerde stuk is die bandbreedte. Grok 2.0 kost $ 0,08 en Grok 1.0 $ 0,05. Een maand is hier 30 dagen. Bij telefonie komt daar de lijn bij: circa $ 0,024 per minuut naar een Nederlands mobiel nummer via Twilio.

Wat de benchmark meet, en wat je hoort

Artificial Analysis definieert «time to first audio» als de tijd tot het eerste audiotoken, over een vaste set gesproken vragen. Hoe het einde van de beurt wordt bepaald, staat er niet bij. De 0,70 s van Grok 2.0 is dus de snelheid van het model, niet wat iemand aan de andere kant hoort. Anna's gemeten eind-tot-eind is ruim vier keer zo lang. OpenAI noemt voor GPT-Live-1 een beurtwisseling van 0,8 s, maar dat is weer een andere maat.

MaatGPT-Live-1Grok 2.0 (Anna nu)Grok 1.0 (verouderd)
Tijd tot eerste audiotoken1,24 s (Sol) · 1,34 s (Astra)0,70 s1,25 s
Door elkaar praten (Full Duplex Bench)97,3% · 94,9%95,1%77,8%
Tools tijdens spraak (τ-Voice)59,3% · 67,9%56,5%52,1%
Tarief$ 0,05/min plus backend$ 0,08/min$ 0,05/min
Hoe tools lopenvia een apart backend-model, terwijl het gesprek doorlooptin hetzelfde model, pas na alle audioals Grok 2.0
Nederlandsvloeiend in OpenAI's demo, geen officiële taallijstniet op de taallijst van xAIwerkte in de praktijk

Gemeten door Artificial Analysis op 11 september 2026, één dag na de API-lancering van GPT-Live-1. Sol en Astra zijn de twee backend-modellen waarmee GPT-Live-1 is getest, op een lage en een middelhoge instelling. matig

Welk model draai je eigenlijk?

Anna's configuratie noemde grok-voice-think-fast-1.0, maar die waarde werd nergens gebruikt. De app verbindt zonder model-parameter, en dan kiest xAI zelf. Het eerste bericht van de server verklapt wat er echt draait:

/v1/realtime                                   → grok-voice-think-fast-2.0
/v1/realtime?model=grok-voice-think-fast-1.0   → grok-voice-think-fast-1.0
/v1/realtime?model=grok-voice-latest           → grok-voice-think-fast-2.0

Vermoedelijk draait Anna sinds 5 augustus 2026 op 2.0, toen xAI de alias grok-voice-latest verlegde. Bewijzen kan dat niet. Twee gevolgen: 2.0 kost $ 0,08 per minuut in plaats van $ 0,05, en als 2.0 stopt, schuift Anna zonder nieuwe build door naar de opvolger, met mogelijk een andere stem, ander gedrag en een andere prijs. xAI raadt zelf aan in productie een versie vast te zetten.

Zeven controles vóór je van model wisselt

De eerste vier maken de vergelijking eerlijk, de laatste drie gaan over de overstap zelf. Vink af wat je al hebt.

Eerlijk vergelijken
De overstap zelf

Wat een overstap vraagt

Een schatting, geen plan. GPT-Live-1 is alleen de spraaklaag: luisteren, praten, onderbreken en de beurtwisseling. Denkwerk en tool-aanroepen gaan naar een apart tekstmodel of naar je eigen backend. Grok Voice doet dat alles in één model, en dat verschil bepaalt de ombouw.

App · 2 tot 4 werkdagen

Ruwweg 615 van de 1.327 regels in Anna's spraakclient zijn protocolwerk: sessieconfiguratie, berichten, tools bundelen, onderbreken en herverbinden. Dat moet opnieuw. De tool-implementaties en de audio-engine blijven bruikbaar.

Server · een halve tot een hele dag

Een nieuw endpoint dat de sleutel bewaart, als verbindingsbroker voor WebRTC of als doorgeefluik voor WebSocket. Dat laatste is een extra hop in de audiostroom, het eerste vraagt een WebRTC-bibliotheek in de app.

Telefonie · een halve tot een hele dag

Twilio publiceerde op 10 september een tutorial met dezelfde opzet als Anna's belproef: Media Streams, Node en μ-law-audio. Wel met een ander endpoint en sessieformaat, dus het is meer dan een adres omzetten.

Samen komen app en server op 2½ tot 5 dagen, met telefonie erbij op 3 tot 6. laag

Het sterkste argument tegen

Ruim een seconde van het verschil zit in Anna's eigen instelling en in haar toolopbouw. Wie overstapt zonder dat te scheiden, betaalt dagen werk en een nieuwe transportlaag voor een winst die deels uit de bouw komt. Een eerlijke vergelijking, beide op de iPhone en Anna ook met een kortere drempel, is veel goedkoper.

Het sterkste argument voor

In een eigen test van OpenAI's demo klonk GPT-Live-1 veel sneller, beter te onderbreken en vloeiend in het Nederlands. Die waarneming weegt zwaarder dan een benchmark over modelsnelheid. Bovendien lost een model met eigen beurtwisseling precies het dilemma van de vaste drempel op, en werkt het aan tools terwijl het gesprek doorloopt.

Stand op 11 september 2026

Onduidelijk, met de gesprekservaring aan de kant van GPT-Live-1. Of het na een eerlijke vergelijking nog duidelijk wint, is niet gemeten. Wint het dan nog, dan is het de dagen werk waard, met één open vraag: of de stilte meetelt.

Waar dit vandaan komt