Versta · engine-onderzoek · 15 sep 2026

De tweede stem valt weg

Ruim vier maanden heette het de stille-resume-bug: na een stilte zou de ondertiteling blijven hangen. Een geautomatiseerde proef van 14 september laat iets anders zien. Apple's spraakherkenner verstaat twee stemmen elk apart bijna foutloos. Wisselen ze elkaar af, met hooguit 0,2 seconde pauze, dan verdwijnt de tweede stem vrijwel helemaal van het scherm. Er komt geen foutmelding, de herkenner herstart niet, en de app blijft gewoon op «luisteren» staan.

92 en 96 procentElke stem apart, zes zinnen, geteld op wat er uiteindelijk op het scherm staat. Ook de Vlaamse stem, dus aan het accent ligt het niet.
0 van 25 woordenZoveel haalt de tweede stem als die om en om met de eerste praat. De rig meldde 20 procent, maar die woorden stonden er al.
0 herstarts, 0 foutenDe herkenner loopt gewoon door en laat de andere spreker weg alsof die er niet was. Daarom ziet het eruit als een haper.
1 · De proef

Speel de proef af

Vier runs uit de eval-rig van Versta, gedraaid in de nacht van 14 september. Dezelfde zes zinnen, twee synthetische stemmen van Apple (Xander spreekt Nederlands, Ellen Vlaams), digitaal ingevoerd in de herkenner die Versta in de App Store gebruikt: SFSpeechRecognizer voor nl-NL, op het toestel zelf.

Xander Ellen Scherm verandert Scherm staat stil terwijl er gesproken wordt
24,0 s
Nu gezegd
Scherm staat stil
Herkenner
Op het scherm
Wat er gezegd is
    2 · Tellen

    Twee manieren van tellen

    De rig telt een woord als gevangen zodra het ergens in de tussenversies van de herkenner opduikt, binnen een venster rond de zin. Dat is bewust ruim, want de vraag was of de herkenner iets überhaupt opving. Maar die tussenversies zijn cumulatief: ze bevatten de hele tekst tot dan toe. Woorden als «zin», «in» en «de» uit de eerste zin tellen dus ook mee voor elke zin daarna.

    De strenge telling legt de uiteindelijke tekst op het scherm naast het script, woord voor woord en in de goede volgorde, en rekent elk woord maar één keer toe.

    Zoals de rig teltStreng, via uitlijningBalkkleur: de stem

    3 · Verklaringen

    Drie verklaringen tegen zeven waarnemingen

    Kies een verklaring. Per waarneming zie je of die ermee strookt. Eén strijdige meting is genoeg om een verklaring voor dít verschijnsel te laten vallen; een waarneming die bij alle drie past, onderscheidt niets.

    4 · De naam

    Hoe een naam het onderzoek de verkeerde kant op stuurde

    Het woord «stille-resume» was in gebruik op 8 mei en bleef staan tot de proef van 14 september: ruim vier maanden. In die tijd wezen de meldingen steeds weer naar een tweede spreker, terwijl het bouwwerk zich op de stilte richtte.

    De les die de naam verbergt

    Een gat in de log is pas een haper als je weet dat er op dat moment gesproken werd. Vanaf het scherm zien een stilte en een weggevallen stem er precies hetzelfde uit: tekst die niet meer verandert. De rig weet per zin tot op de milliseconde wanneer er gesproken wordt, een veldlog weet dat niet. Juist daarom kon de verkeerde naam zo lang blijven staan.

    5 · Wat nu

    De volgende proeven liggen al klaar

    Een run kost twintig seconden en geen mens. Vier van de acht meetfixtures uit de sprekerwissel-set zijn nog niet gedraaid, en elk ervan haalt één verklaring los van de rest.

    De toets die het meest oplevert

    Bouw bij elke stemwissel een verse herkenner. Verschijnt Ellen dan wél op het scherm, dan is de spreker-verklaring zo goed als rond. Dan werkt de «engine-rearm» uit de externe review misschien ook, maar om een andere reden dan bedoeld: hij bouwt eveneens een verse herkenner. Die fix is nog niet samengevoegd.

    Voor wie Versta nu gebruikt

    Staat de tekst stil terwijl iemand anders is gaan praten, druk dan op de reset-knop. Die bouwt de herkenner opnieuw op. In het veld hielp dat; in de rig is het nog niet gemeten, dus neem het als waarschijnlijk, niet als zeker.

    Waarom niet gewoon de nieuwe herkenner van Apple?

    Omdat die nog steeds geen Nederlands kent. Op 15 september, een dag na de release van iOS 27, gemeten op de iPhone zelf: de nieuwe SpeechTranscriber ondersteunt 45 talen, 15 meer dan onder iOS 26, en alle 15 nieuwe zijn Indiaas. Versta blijft dus op de oude herkenner, en de haper moet daarbinnen worden opgelost of omzeild.

    6 · Verantwoording

    Waar dit op rust, en wat het niet zegt