Een startup scant met ultrasound je tong terwijl je zonder geluid praat, en leest daar de woorden uit af. Geen stem, geen microfoon, geen last van herrie. Precies het probleem waar Versta op vastloopt. Kan dit de oplossing zijn β en wat zou het kosten om er een Nederlandse versie van te bouwen?
Elke spraak-naar-tekst-engine β hoe goed ook β meet uiteindelijk luchtΒtrillingen. Zit er te veel andere trilling omheen (een cafΓ©, een dansvloer, een fabriekshal), dan verdrinkt de stem en raadt het model maar wat. In Versta's eigen meetreeks liep de foutmarge (word error rate) van 6% met een goede richtmicrofoon op tot 86% zodra de mic de zaalherrie meepakte in plaats van de spreker. Dat is geen zwakke engine β dat is een natuurwet: er valt niets te verstaan wat er akoestisch niet Γs.
Een niet-akoestische modaliteit stapt buiten die wet. Als je de woorden aflezt van de beweging waarmee ze gevormd worden β de tong, de lippen, de spieren β dan maakt het niet uit hoe hard de omgeving schreeuwt. De signaal-ruisverhouding is geen factor meer, want er is geen akoestisch signaal om te vervuilen.
De demo van startup Aleph Neuro (juli 2026): een ultrasound-probe onder de kin filmt de tong terwijl je geluidloos articuleert. Speel de keten af.
De maat voor "hoe goed" is de word error rate (WER): het percentage woorden dat fout gaat. Lager is beter. Het opvallende aan de Aleph-demo is niet zozeer de eindscore, maar hoe wΓ©inig data ervoor nodig was.
Ultrasound is niet de enige route naar spraak-in-lawaai of stille invoer. Elk heeft een andere balans. Schuif hieronder wat jij belangrijk vindt en de ranglijst schuift mee β er is geen absolute winnaar, alleen een beste match bij jouw prioriteiten.
Scores (0β10) zijn mijn eigen inschatting op basis van de onderzoeksliteratuur en de Aleph-demo, bedoeld om de afweging te tonen, niet als meetwaarde. laag vertrouwen op de absolute getallen; de onderlinge verhoudingen zijn robuuster.
Aleph's model is Engels (Amerikaans accent) en werkt niet zomaar op Nederlands. Stel je zou het willen namaken voor NL β voor Versta of als los experiment. Twee knoppen bepalen bijna alles: welke probe je koopt, en hoeveel Nederlandse data je verzamelt.
Aleph's anker: ~50 u β 15,6% WER (Engels). Onder ~20 u zakt de kwaliteit snel; Whisper is al meertalig, dus transfer-learning scheelt tegenover vanaf nul.
Eerlijk antwoord: op termijn een gamechanger, vandaag nog niet inzetbaar.
Het past bovendien in een lijn die ik al liep: de keel-microfoon ving trillingen op bij de bron; silent speech gaat een stap verder en heeft de trilling niet eens meer nodig. Als Aleph's patch-belofte uitkomt, verschuift Versta's frontlinie van "betere microfoon" naar "andere zintuiglijke input" β en dan is het akoestische plafond geen plafond meer.
β Versta Cockpit β de productstand β STT-engine-gids
| Claim | Status |
|---|---|
| 15,6% WER op 50 uur, open vocabulaire, generaliseert naar nieuwe sprekers | Aleph's eigen blog, juli 2026 bron β niet onafhankelijk gereproduceerd |
| Amerikaans accent werkt; ander accent worstelt | Door Aleph zelf benoemd bron β NL zou eigen data vergen |
| Probe koppelt aan iPhone (Butterfly/Clarius) | Bestaande producten doen dit voor echografie plausibel β silent speech-pipeline is niet plug-and-play |
| Prijzen probes (β¬300 budget β $3.500 iPhone-native) | Marktschatting schatting β varieert sterk, check bij leverancier |
| Effort NL-versie: 2β4 maanden met klein ML-team | Redenering, geen ervaring gok β data-verzameling is de wildcard |
| Cross-sessie robuustheid | Het onopgeloste kernprobleem van het hele veld literatuur β probe telkens iets anders = drift |
β’ Aleph Neuro β Silent speech with ultrasound (primaire bron: WER, architectuur, roadmap) hoog
β’ Onderzoekslijn silent speech: SottoVoce (ultrasound-SSI), AlterEgo (EMG, MIT) β voor de modaliteiten-vergelijking context
β’ Kosten-, iPhone- en NL-trainingsschattingen: eigen research-ronde (Grok, 8 jul 2026), als richtgetal schatting