North star: midden op de dansvloer van een house-/technofeest de spraak van een ander live ondertitelen. Elk experiment hieronder is daaraan afgemeten — van de eerste baseline (23 apr 2026) tot de CoreAI-Parakeet-voorbereiding (8 aug 2026).
–
experimenten
–
sporen
–
geshipt
apr–aug
2026
Koerswijziging 2/3 juni. De nachtelijke experiment-pipeline (18 mei – 2 jun, de vorige versie van deze pagina) is opgeheven: een WER-meting met ground-truth bewees dat de stilte-experimenten het verkeerde probleem aanpakten. De hefboom in lawaai is mic-richting/SNR, niet software — een externe richtmic halveert de fout (13,3% → 6,0%), geen enkele software-truc verslaat Apple's kale baseline. Nieuwe aanpak: engine-forks, handmatig getest.
Stand nu. Versta 2.0 (V·Switch: Apple / Whisper / Parakeet, door de gebruiker te kiezen) staat op TestFlight. CoreAI-Parakeet is klaargezet als vierde engine en wacht op de iOS 27-release (~sept; besluit 8 aug: geen beta's op de toestellen). De geplande capture-meting op het Orbit-festival (25 jul) is er niet van gekomen — de mic-vraag staat nog open.
Filter op spoor
De experimenten (nieuwste boven, tik voor detail)
Geen experimenten in deze combinatie van filters.
Kernbeslissingen — de "waarom" die blijft staan
Productie blijft Apple SFSpeechRecognizer. Apple's nieuwe SpeechAnalyzer (iOS 26) heeft géén Nederlands; de oude SF-API is de enige die NL on-device doet.
NL-only positionering. Apple Live Captions ondersteunt geen NL — dat is Versta's monopolie-window. Engels-werk geparkeerd.
4 mei 2026
De hefboom in lawaai is mic-richting/SNR, niet software. Bewezen met de WER-meting: richtmic 13,3% → 6,0%, Voice Isolation als enige gratis interne-mic-winst (→ 11,3%). Software-energie heeft een laag plafond.
2/3 jun 2026 — het kanteldocument van dit logboek
Streaming < re-transcribe voor NL. Zelfde leverancier, grootteklasse, SDK en taal: Parakeet (re-transcribe) goed, Nemotron (streaming) slecht. Onafhankelijk bevestigd door een externe FluidAudio-consument die voor NL óók op re-transcribe terugvalt.
8 jun, bevestigd 23 jun 2026
App Store = alleen bewezen-werkende engines. Hard release-criterium sinds de iPad-probe: per toestel per model onvoorspelbaar (M1 iPad: Whisper faalt definitief, Parakeet vlekkeloos) → spec-grenzen zijn dood, alleen empirisch bewijs telt. Waarschuwen mag op TestFlight, niet in de App Store.
10 jun 2026
Model-klaarzetgrens: ≤ ~0,6 GB. Los van RAM-piek maakt de ANE-compile-duur grote modellen op élk toestel onbruikbaar als live-default; ~1,4 GB Whisper-Turbo zette al veel te lang klaar op het snelste toestel.
23 jun 2026
Audio-modus: .voiceChat + voice processing. Apple's maximale stem-in-lawaai-stack; in de 4-modi-test geen praktijkverschil gemerkt, dus de theoretische winnaar gekozen.
10 mei 2026, hardcoded vanaf v1.2
Stille-resume-bug = AGC-recalibratie tijdens stilte. Niet op te lossen met task-rotatie (watchdog-backfire bewees het). De kost is vooral een demo-/first-impression-kost bij nieuwe gebruikers, geen groot WER-verlies.
herbevestigd in het veld, 19/20 jul 2026 · herzien 14 sep 2026: de trigger blijkt een sprekerwissel (proef)
De forks op de iPhone
Versta (productie)Apple SF · LIVE in de App Store, v1.3
De referentie. Stille-resume-bug speelt nog; log is schoon sinds build 1780443185.
De engine-agnostische merge: Apple-fallback verbergt de model-compile achter een werkende app, naadloze promotie met tekstbehoud, party-modus, opslag + wis-functie, laadpad-hardening. Wacht op de bewezen-werkend-gate vóór App Store-release.
Beste schermweergave in stilte; corrigeert achteraf. Cold-start-schrik van mei (12 min) bleek een first-compile-artefact — re-launch is nu seconden. Lawaai-test open.
Écht streaming-NL on-device — maar de kwaliteit viel door de mand, ook op de beste latency-tier. De engine blijft herbruikbaar zodra er een beter streaming-NL-model verschijnt.
CoreAI-ParakeetApple CoreAI-runtime · wacht op iOS 27 (~sept 2026)
Vierde V·Switch-engine, klaargezet 8 aug: Apple's officiële export-recipe + Swift-runtime (PR #136 op Onno's model-request). Zelfde gewichten als V·Parakeet — verwachte winst zit in runtime en klaarzet-tijd, niet accuratesse.
Structurele grenzen (alle engines)
Bij ~100 dB zakt élke engine volledig in. Dan is de onboard-mic-SNR de bottleneck, niet de engine (festival 9/10 mei). Externe mic dicht bij de mond is de enige uitweg.
Losse cijfers en woorden met pauzes falen universeel. Zonder taalcontext valt elke engine terug; cijfers-in-flow werken wél. Niet te tunen.
Proper nouns driften naar de NL-prior. "Claude" → "Kloot", "Parakeet" → "parakiet".
Model-engines zijn vermoedelijk high-end-only. De eerste ANE-compile van een 600 MB-model piekt op ~2,33 GB — boven de jetsam-limiet van 4 GB-toestellen. Mitigatie is een device-gate, geen code-fix.
De volgende battle: capture / SNR
Closeness is de grootste gratis hefboom. Elke halvering van mond-tot-mic-afstand ≈ +6 dB SNR. UX-richting: laat de ander in de onderkant van de telefoon praten.
Hoorapparaat-mic + in-oor-spraak. Op de dansvloer praat men tóch al in je oor, en dáár zit de mic — mond op ~5 cm in plaats van armlengte. Werkt al zonder code; thuis-pre-test met het ground-truth-protocol beslist of dit kern-feature of leuke theorie is.
Voice Isolation op een écht feest. Alle metingen tot nu zijn op kamervolume; of de ML-denoise bij 100 dB meer of juist minder doet is dé open meetvraag sinds de Orbit-kans passeerde.
RØDE-richtmic + USB-C-verlengsnoer. De bewezen verdubbelaar (WER 13,3% → 6,0%); het verlengsnoertje maakt hem een losse handmic bij de mond van de spreker terwijl de telefoon leesscherm blijft.
Zenden-modus. Mond bij de mic, tekst tonen aan de ander — werkte op het festival waar ontvangen-modus instortte. Kandidaat voor een eigen UI-spoor.