Een voice agent die traag antwoordt, lijkt een traag model te hebben. Vaak zit de vertraging ergens anders. Deze tijdas haalt één beurt uit elkaar: welk deel is een instelling in je eigen app, welk deel het platform, en wat lost een model met eigen beurtwisseling nog op?
Anna, een iOS-assistent op de realtime spraak-API van xAI, deed er op 11 september 2026 2,85 tot 3,06 seconden over van het einde van een korte vraag tot het eerste geluid. De onafhankelijke benchmark geeft hetzelfde model 0,70 seconde. Het verschil zit grotendeels buiten het model. Ruim een seconde komt uit één instelling in de app: een stilte-drempel van 1300 ms. Ongeveer een seconde zit in de einddetectie van het platform.
Wie van model wisselt zonder die twee te scheiden, schrijft het nieuwe model een winst toe die deels uit de eigen bouw komt.
De standaardstand is Anna's meting: een stilte-drempel van 1300 ms, einddetectie van ongeveer 1,1 s ná die drempel, en een rest van ongeveer 0,5 s voor de antwoordstart en het netwerk. Samen 2,9 s, midden in de gemeten 2,85 tot 3,06. Met de drempel op 300 ms geeft dezelfde som 1,9 s; gemeten was 1,70 tot 2,04. Zet de schuifjes op je eigen metingen, of speel met B: dezelfde agent met een kortere drempel.
De pauzes zijn een voorbeeld. Anna's drempel staat op 1300 ms omdat een kortere drempel denkpauzes afkapte.
| Scenario | Stilte-drempel | Einddetectie | Antwoordstart | Eerste geluid | Denkpauzes |
|---|
Een mens wacht geen 1,3 seconde. In gesprekken wisselen mensen doorgaans binnen een paar honderd milliseconden van beurt, in alle tien talen die Stivers en collega's in 2009 vergeleken: ze horen aan de zin zelf dat die af is. Een vaste stilte-drempel hoort dat niet, die telt alleen stilte. Daarom is het een dilemma: kort instellen kapt denkpauzes af, lang instellen kost elke beurt tijd. Een model dat zelf bepaalt wanneer je klaar bent, hoeft die keuze niet te maken.
Bij een trage agent wijst de vinger al snel naar de eigen server, het token of het redeneren. Gemeten op dezelfde dag vielen ze alle vier af.
Het ophalen van een kortlevend token kost 0,22 tot 0,26 s, en alleen bij starten en herverbinden. De audio zelf gaat rechtstreeks naar xAI. gemeten
Het token verloopt na vijf minuten, maar een sessie bleef 420 s open zonder één herverbinding. gemeten
Op een simpele vraag geen verschil met «none»: 1,72 tot 1,93 s tegen 1,70 tot 2,04 s. Bij zwaardere vragen kan dat anders zijn. gemeten
De microfoon levert blokken van circa 85 ms en elk ontvangen stukje audio wordt direct afgespeeld, precies zoals xAI adviseert. nagelezen
Bij een agendavraag komt er per tool-ronde tijd bij. De agent speelt eerst zijn tussenzin helemaal uit («even kijken…»), dan draait de tool, dan volgt een nieuwe antwoordstart. xAI levert de tool-aanroep pas als alle audio van die beurt verstuurd is, en raadt zelf aan met het vervolg te wachten tot het uitspelen klaar is: anders lopen twee antwoorden door elkaar. Geschat 1 tot 3 s extra per agendavraag. niet gemeten
Twee daarvan zijn eigen keuzes: een datum-tool die bij élke datumvraag verplicht als eerste moet draaien, en een agendavenster dat standaard 120 dagen terugkijkt en dus veel uitvoer oplevert. Bij een model met delegatie werkt de backend terwijl het gesprek doorloopt. Je hoort dan eerder iets, maar het antwoord zelf komt niet sneller dan de backend.
Ook niet gemeten: de lengte van de prompt. Anna's systeemprompt is 10 KB, met daarnaast een persona en tooldefinities, terwijl xAI voor 2.0 juist een veel kortere prompt aanraadt.
Praat je door de agent heen, dan gebeuren er drie dingen na elkaar.
In de benchmark voor door elkaar praten (Full Duplex Bench) liggen de modellen dicht bij elkaar: GPT-Live-1 haalt 97,3 en 94,9 procent met twee verschillende backends, Grok 2.0 95,1, en alleen de verouderde Grok 1.0 zakt naar 77,8. Afkappen kunnen ze allemaal. Het trage stuk komt erna, en daar zit weer de drempel.
Een kanttekening die niet gemeten is: Anna's spraakgevoeligheid staat op 0,5, terwijl de xAI-standaard inmiddels 0,85 is. Via de luidspreker kan een lage waarde de agent op zijn eigen stem laten reageren.
Een assistent die de hele avond meeluistert, heeft een sessie die uren openstaat terwijl er maar af en toe gesproken wordt. Of die stille minuten op de rekening komen, bepaalt de prijs meer dan het tarief zelf. Voor de twee actuele modellen is dat onbekend.
Tarieven per minuut: GPT-Live-1 kost $ 0,05 voor de spraaklaag, plus de tokens van het backend-model. In de testlast van Artificial Analysis kwam dat samen op $ 4,47 tot $ 5,83 per uur, afhankelijk van de backend; het gearceerde stuk is die bandbreedte. Grok 2.0 kost $ 0,08 en Grok 1.0 $ 0,05. Een maand is hier 30 dagen. Bij telefonie komt daar de lijn bij: circa $ 0,024 per minuut naar een Nederlands mobiel nummer via Twilio.
Artificial Analysis definieert «time to first audio» als de tijd tot het eerste audiotoken, over een vaste set gesproken vragen. Hoe het einde van de beurt wordt bepaald, staat er niet bij. De 0,70 s van Grok 2.0 is dus de snelheid van het model, niet wat iemand aan de andere kant hoort. Anna's gemeten eind-tot-eind is ruim vier keer zo lang. OpenAI noemt voor GPT-Live-1 een beurtwisseling van 0,8 s, maar dat is weer een andere maat.
| Maat | GPT-Live-1 | Grok 2.0 (Anna nu) | Grok 1.0 (verouderd) |
|---|---|---|---|
| Tijd tot eerste audiotoken | 1,24 s (Sol) · 1,34 s (Astra) | 0,70 s | 1,25 s |
| Door elkaar praten (Full Duplex Bench) | 97,3% · 94,9% | 95,1% | 77,8% |
| Tools tijdens spraak (τ-Voice) | 59,3% · 67,9% | 56,5% | 52,1% |
| Tarief | $ 0,05/min plus backend | $ 0,08/min | $ 0,05/min |
| Hoe tools lopen | via een apart backend-model, terwijl het gesprek doorloopt | in hetzelfde model, pas na alle audio | als Grok 2.0 |
| Nederlands | vloeiend in OpenAI's demo, geen officiële taallijst | niet op de taallijst van xAI | werkte in de praktijk |
Gemeten door Artificial Analysis op 11 september 2026, één dag na de API-lancering van GPT-Live-1. Sol en Astra zijn de twee backend-modellen waarmee GPT-Live-1 is getest, op een lage en een middelhoge instelling. matig
Anna's configuratie noemde grok-voice-think-fast-1.0, maar die waarde werd nergens gebruikt. De app verbindt zonder model-parameter, en dan kiest xAI zelf. Het eerste bericht van de server verklapt wat er echt draait:
/v1/realtime → grok-voice-think-fast-2.0 /v1/realtime?model=grok-voice-think-fast-1.0 → grok-voice-think-fast-1.0 /v1/realtime?model=grok-voice-latest → grok-voice-think-fast-2.0
Vermoedelijk draait Anna sinds 5 augustus 2026 op 2.0, toen xAI de alias grok-voice-latest verlegde. Bewijzen kan dat niet. Twee gevolgen: 2.0 kost $ 0,08 per minuut in plaats van $ 0,05, en als 2.0 stopt, schuift Anna zonder nieuwe build door naar de opvolger, met mogelijk een andere stem, ander gedrag en een andere prijs. xAI raadt zelf aan in productie een versie vast te zetten.
De eerste vier maken de vergelijking eerlijk, de laatste drie gaan over de overstap zelf. Vink af wat je al hebt.
Een schatting, geen plan. GPT-Live-1 is alleen de spraaklaag: luisteren, praten, onderbreken en de beurtwisseling. Denkwerk en tool-aanroepen gaan naar een apart tekstmodel of naar je eigen backend. Grok Voice doet dat alles in één model, en dat verschil bepaalt de ombouw.
Ruwweg 615 van de 1.327 regels in Anna's spraakclient zijn protocolwerk: sessieconfiguratie, berichten, tools bundelen, onderbreken en herverbinden. Dat moet opnieuw. De tool-implementaties en de audio-engine blijven bruikbaar.
Een nieuw endpoint dat de sleutel bewaart, als verbindingsbroker voor WebRTC of als doorgeefluik voor WebSocket. Dat laatste is een extra hop in de audiostroom, het eerste vraagt een WebRTC-bibliotheek in de app.
Twilio publiceerde op 10 september een tutorial met dezelfde opzet als Anna's belproef: Media Streams, Node en μ-law-audio. Wel met een ander endpoint en sessieformaat, dus het is meer dan een adres omzetten.
Samen komen app en server op 2½ tot 5 dagen, met telefonie erbij op 3 tot 6. laag
Ruim een seconde van het verschil zit in Anna's eigen instelling en in haar toolopbouw. Wie overstapt zonder dat te scheiden, betaalt dagen werk en een nieuwe transportlaag voor een winst die deels uit de bouw komt. Een eerlijke vergelijking, beide op de iPhone en Anna ook met een kortere drempel, is veel goedkoper.
In een eigen test van OpenAI's demo klonk GPT-Live-1 veel sneller, beter te onderbreken en vloeiend in het Nederlands. Die waarneming weegt zwaarder dan een benchmark over modelsnelheid. Bovendien lost een model met eigen beurtwisseling precies het dilemma van de vaste drempel op, en werkt het aan tools terwijl het gesprek doorloopt.
Onduidelijk, met de gesprekservaring aan de kant van GPT-Live-1. Of het na een eerlijke vergelijking nog duidelijk wint, is niet gemeten. Wint het dan nog, dan is het de dagen werk waard, met één open vraag: of de stilte meetelt.