Ruim vier maanden heette het de stille-resume-bug: na een stilte zou de ondertiteling blijven hangen. Een geautomatiseerde proef van 14 september laat iets anders zien. Apple's spraakherkenner verstaat twee stemmen elk apart bijna foutloos. Wisselen ze elkaar af, met hooguit 0,2 seconde pauze, dan verdwijnt de tweede stem vrijwel helemaal van het scherm. Er komt geen foutmelding, de herkenner herstart niet, en de app blijft gewoon op «luisteren» staan.
92 en 96 procentElke stem apart, zes zinnen, geteld op wat er uiteindelijk op het scherm staat. Ook de Vlaamse stem, dus aan het accent ligt het niet.
0 van 25 woordenZoveel haalt de tweede stem als die om en om met de eerste praat. De rig meldde 20 procent, maar die woorden stonden er al.
0 herstarts, 0 foutenDe herkenner loopt gewoon door en laat de andere spreker weg alsof die er niet was. Daarom ziet het eruit als een haper.
1 · De proef
Speel de proef af
Vier runs uit de eval-rig van Versta, gedraaid in de nacht van 14 september. Dezelfde zes zinnen, twee synthetische stemmen van Apple (Xander spreekt Nederlands, Ellen Vlaams), digitaal ingevoerd in de herkenner die Versta in de App Store gebruikt: SFSpeechRecognizer voor nl-NL, op het toestel zelf.
XanderEllenScherm verandertScherm staat stil terwijl er gesproken wordt
24,0 s
Nu gezegd–
Scherm staat stil–
Herkenner–
Op het schermWat er gezegd is2 · Tellen
Twee manieren van tellen
De rig telt een woord als gevangen zodra het ergens in de tussenversies van de herkenner opduikt, binnen een venster rond de zin. Dat is bewust ruim, want de vraag was of de herkenner iets überhaupt opving. Maar die tussenversies zijn cumulatief: ze bevatten de hele tekst tot dan toe. Woorden als «zin», «in» en «de» uit de eerste zin tellen dus ook mee voor elke zin daarna.
De strenge telling legt de uiteindelijke tekst op het scherm naast het script, woord voor woord en in de goede volgorde, en rekent elk woord maar één keer toe.
Zoals de rig teltStreng, via uitlijningBalkkleur: de stem
3 · Verklaringen
Drie verklaringen tegen zeven waarnemingen
Kies een verklaring. Per waarneming zie je of die ermee strookt. Eén strijdige meting is genoeg om een verklaring voor dít verschijnsel te laten vallen; een waarneming die bij alle drie past, onderscheidt niets.
4 · De naam
Hoe een naam het onderzoek de verkeerde kant op stuurde
Het woord «stille-resume» was in gebruik op 8 mei en bleef staan tot de proef van 14 september: ruim vier maanden. In die tijd wezen de meldingen steeds weer naar een tweede spreker, terwijl het bouwwerk zich op de stilte richtte.
29 apr 2026Een tester met twee kinderen merkt dat de tweede spreker duidelijk slechter wordt opgepikt.
30 apr 2026Een tweede tester loopt tegen problemen aan zodra er meerdere mensen praten.
7 mei 2026Aanlooptijd, stilte en het vastzitten op één spreker worden samengenomen tot één oorzaak: de automatische versterking.
8 mei 2026Een extern AI-advies noemt versterking die zich na 30 tot 60 seconden stilte bijstelt, plus een tijdslimiet van rond de 60 seconden per taak, en raadt een timer aan die de taak herstart. De naam stille-resume is dan al in gebruik.
Mei 2026Vier stilte-varianten gebouwd: herstarten op een timer, taken rouleren, wachten op een stemdrempel en zachte ruis in de stiltes. Geen ervan doet het beter dan de kale versie.
2 jun 2026Het meet-lab in babble-ruis: de herkenner zit op de verkeerde spreker. De stilte-strategieën helpen niet, want er is geen stilte.
7 jun 2026Nog een waakhond die de taak herstart zodra de herkenner zwijgt: 21 herstarts in één sessie, zinsbeginnen kwijt. Teruggedraaid.
20 jul 2026Een dove gebruiker installeert de app op een terras en ziet het binnen een paar minuten: een stilte plus een sprekerwissel, daarna is de reset-knop nodig.
20 aug 2026Dubbele tekst gevonden: bij een sprekerwissel herziet de herkenner juist het begin van de zin. Opgelost met deduplicatie.
12 sep 2026Op de Kennisdag DFNA9 hapert de ondertiteling binnen 10 à 20 seconden, bij meerdere stemmen en lawaai. Dat past bij geen van beide stilte-verklaringen.
13 sep 2026Een reviewdocument voor een externe code-review zet de vijf verworpen aanpakken op een rij, nog onder de oude naam.
14 sep 2026De rig reproduceert het in twintig seconden per run, zonder mens en zonder microfoon. De trigger is de wissel, niet de stilte.
De les die de naam verbergt
Een gat in de log is pas een haper als je weet dat er op dat moment gesproken werd. Vanaf het scherm zien een stilte en een weggevallen stem er precies hetzelfde uit: tekst die niet meer verandert. De rig weet per zin tot op de milliseconde wanneer er gesproken wordt, een veldlog weet dat niet. Juist daarom kon de verkeerde naam zo lang blijven staan.
5 · Wat nu
De volgende proeven liggen al klaar
Een run kost twintig seconden en geen mens. Vier van de acht meetfixtures uit de sprekerwissel-set zijn nog niet gedraaid, en elk ervan haalt één verklaring los van de rest.
De toets die het meest oplevert
Bouw bij elke stemwissel een verse herkenner. Verschijnt Ellen dan wél op het scherm, dan is de spreker-verklaring zo goed als rond. Dan werkt de «engine-rearm» uit de externe review misschien ook, maar om een andere reden dan bedoeld: hij bouwt eveneens een verse herkenner. Die fix is nog niet samengevoegd.
Voor wie Versta nu gebruikt
Staat de tekst stil terwijl iemand anders is gaan praten, druk dan op de reset-knop. Die bouwt de herkenner opnieuw op. In het veld hielp dat; in de rig is het nog niet gemeten, dus neem het als waarschijnlijk, niet als zeker.
Waarom niet gewoon de nieuwe herkenner van Apple?
Omdat die nog steeds geen Nederlands kent. Op 15 september, een dag na de release van iOS 27, gemeten op de iPhone zelf: de nieuwe SpeechTranscriber ondersteunt 45 talen, 15 meer dan onder iOS 26, en alle 15 nieuwe zijn Indiaas. Versta blijft dus op de oude herkenner, en de haper moet daarbinnen worden opgelost of omzeild.
6 · Verantwoording
Waar dit op rust, en wat het niet zegt
Vier runbestanden van de Versta-eval-rig, 14 september 2026 tussen 00:54 en 00:57, met elke tussenversie van de herkenner en het tijdstip waarop die binnenkwam. De rig zelf is niet openbaar.
Het experimentenlogboek van Versta (14 en 15 september), het reviewdocument van 13 september met de vijf verworpen aanpakken, en de veldmeldingen van 29 en 30 april, 20 juli en 12 september.
Eén run per fixture. Hoeveel de uitkomst tussen runs schommelt, is niet gemeten.
Synthetische stemmen, digitaal ingevoerd: geen ruimte, geen microfoon. Voor de oorzaak is dat een voordeel, want het invoerpad valt als verklaring weg. Voor de omvang is het een beperking: in een echte zaal kan het erger of minder erg uitpakken.
De strenge telling is een herberekening op dezelfde runs (de langste gemeenschappelijke woordreeks tussen script en scherm), geen maat uit de rig zelf.
«Spreker-adaptatie» is de naam voor een vermoeden, niet voor een aangetoond mechanisme. Zekerheid: gemiddeld voor die naam, hoog dat de trigger de wissel is en niet de stilte.