Spraak zonder geluid

Een startup scant met ultrasound je tong terwijl je zonder geluid praat, en leest daar de woorden uit af. Geen stem, geen microfoon, geen last van herrie. Precies het probleem waar Versta op vastloopt. Kan dit de oplossing zijn β€” en wat zou het kosten om er een Nederlandse versie van te bouwen?

πŸ”‡ Silent speech interface πŸŽ™οΈ Versta-spoor β™Ώ Toegankelijkheid πŸ§ͺ Nog prototype

Waarom dit hier ligt

Versta zet spraak live om in ondertitels, on-device, in het Nederlands β€” bedacht voor luide omgevingen en slechthorendheid. Maar Γ©lke akoestische aanpak heeft dezelfde bodem: in echt lawaai zit de stem Γ³nder de ruis en is er niets meer te verstaan. Silent speech omzeilt dat door de stem helemaal niet meer te horen, maar de tongbeweging te zien. Het is een variant op de keel-microfoon waar ik eerder naar keek β€” maar dan directer. Deze pagina legt uit hoe het werkt, weegt het tegen de alternatieven, en rekent door wat een eigen versie zou vergen.

1 De akoestische bodem

Elke spraak-naar-tekst-engine β€” hoe goed ook β€” meet uiteindelijk luchtΒ­trillingen. Zit er te veel andere trilling omheen (een cafΓ©, een dansvloer, een fabriekshal), dan verdrinkt de stem en raadt het model maar wat. In Versta's eigen meetreeks liep de foutmarge (word error rate) van 6% met een goede richtmicrofoon op tot 86% zodra de mic de zaalherrie meepakte in plaats van de spreker. Dat is geen zwakke engine β€” dat is een natuurwet: er valt niets te verstaan wat er akoestisch niet Γ­s.

Een niet-akoestische modaliteit stapt buiten die wet. Als je de woorden aflezt van de beweging waarmee ze gevormd worden β€” de tong, de lippen, de spieren β€” dan maakt het niet uit hoe hard de omgeving schreeuwt. De signaal-ruisverhouding is geen factor meer, want er is geen akoestisch signaal om te vervuilen.

2 Hoe je een tong leest

De demo van startup Aleph Neuro (juli 2026): een ultrasound-probe onder de kin filmt de tong terwijl je geluidloos articuleert. Speel de keten af.

🀫
Stil articulerenJe vormt de woorden met mond en tong, zonder stem te geven.
↓
πŸ“‘
Ultrasound onder de kinEen probe (submentaal, met gel) stuurt geluidsgolven omhoog door de mondbodem.
↓
πŸ‘…
Tong-videoDe echo tekent de tong scherp en direct af β€” frame voor frame, als een filmpje.
↓
🧠
ResNet-18-encoderEen klein beeldmodel (2+1D) perst de video tot een reeks embeddings.
↓
πŸ”—
Uitlijnen op spraakDie embeddings worden in dezelfde ruimte gelegd als Whisper's spraak-embeddings.
↓
πŸ“
Whisper-decoder β†’ tekstDe kleinste Whisper-decoder leest de uitgelijnde beeldreeks als was het spraak.
6 stappen · van tong naar tekst, zonder één decibel.

De kern: zien is schoner dan raden

Ultrasound ziet de tong direct. Dat is het grote verschil met de meeste alternatieven (spier-elektroden, radar), die de tongstand alleen indirect en met ruis kunnen afleiden. Een schoner signaal betekent dat een klein model met wéínig data al ver komt β€” en dat is precies wat de cijfers laten zien.

3 Waarom 50 uur genoeg bleek

De maat voor "hoe goed" is de word error rate (WER): het percentage woorden dat fout gaat. Lager is beter. Het opvallende aan de Aleph-demo is niet zozeer de eindscore, maar hoe wΓ©inig data ervoor nodig was.

Ultrasound, oude aanpak eerdere TaL-dataset β€” de lat waarover heen gesprongen werd
83,8%
Aleph β€” 15.000 voorbeelden begin van hun training: model raadt nog volledig mis
102%
Aleph β€” 50.000 voorbeelden (~50 uur) eindstand van de demo, open vocabulaire
15,6%
Liplezen β€” beste ter wereld ter vergelijking: haalt 12,5% β€” maar pas op 1 miljoen uur data
12,5%

De echte kop van het verhaal

Liplezen haalt iets minder fouten (12,5%), maar heeft daar 1 miljoen uur aan video voor nodig. Ultrasound komt tot 15,6% op 50 uur β€” een factor 20.000 minder. Dat komt doordat de tong direct in beeld staat in plaats van via de buitenkant van het gezicht afgeleid te moeten worden. Voor wie een eigen taal wil bouwen is dat het hele punt: de databerg is klein genoeg om te overwegen.

4 Vijf manieren om zonder herrie te praten

Ultrasound is niet de enige route naar spraak-in-lawaai of stille invoer. Elk heeft een andere balans. Schuif hieronder wat jij belangrijk vindt en de ranglijst schuift mee β€” er is geen absolute winnaar, alleen een beste match bij jouw prioriteiten.

Voor Versta in extreem lawaai Discreet op kantoor Wat werkt vandaag al

Scores (0–10) zijn mijn eigen inschatting op basis van de onderzoeksliteratuur en de Aleph-demo, bedoeld om de afweging te tonen, niet als meetwaarde. laag vertrouwen op de absolute getallen; de onderlinge verhoudingen zijn robuuster.

5 Wat kost een Nederlandse versie?

Aleph's model is Engels (Amerikaans accent) en werkt niet zomaar op Nederlands. Stel je zou het willen namaken voor NL β€” voor Versta of als los experiment. Twee knoppen bepalen bijna alles: welke probe je koopt, en hoeveel Nederlandse data je verzamelt.

Ultrasound-probe

Nederlandse trainingsdata

Aleph's anker: ~50 u β†’ 15,6% WER (Engels). Onder ~20 u zakt de kwaliteit snel; Whisper is al meertalig, dus transfer-learning scheelt tegenover vanaf nul.

De data is 70–80% van het werk

De probe kopen en het model trainen is het makkelijke deel. Het venijn zit in het verzamelen: sprekers werven, de probe telkens consistent plaatsen, gel aanbrengen, en zorgen dat mensen niet moe worden, mompelen of de probe scheef houden β€” precies de problemen die Aleph zelf noemt. Reken op weken tot maanden, niet dagen.

6 Zou dit Versta Γ©cht helpen?

Eerlijk antwoord: op termijn een gamechanger, vandaag nog niet inzetbaar.

Wat het wint

Volledige onafhankelijkheid van akoestiek. Op een dansvloer of in een fabriek, waar Versta's mic nu kapotgaat (86% WER), maakt de omgevingsherrie letterlijk niet uit. Het is de enige aanpak die het SNR-probleem niet verbetert maar elimineert.

Wat het (nu) blokkeert

Een probe met gel onder je kin is geen ondertitel-bril. Aleph noemt het expliciet een prototype: te groot, te zwaar, gel nodig, en gevoelig voor accent. Hun eigen roadmap β€” mini-patch met hydrogel β€” is nog toekomst.

Het past bovendien in een lijn die ik al liep: de keel-microfoon ving trillingen op bij de bron; silent speech gaat een stap verder en heeft de trilling niet eens meer nodig. Als Aleph's patch-belofte uitkomt, verschuift Versta's frontlinie van "betere microfoon" naar "andere zintuiglijke input" β€” en dan is het akoestische plafond geen plafond meer.

β†’ Versta Cockpit β€” de productstand   β†’ STT-engine-gids

7 Grenzen & eerlijkheid

ClaimStatus
15,6% WER op 50 uur, open vocabulaire, generaliseert naar nieuwe sprekersAleph's eigen blog, juli 2026 bron β€” niet onafhankelijk gereproduceerd
Amerikaans accent werkt; ander accent worsteltDoor Aleph zelf benoemd bron β€” NL zou eigen data vergen
Probe koppelt aan iPhone (Butterfly/Clarius)Bestaande producten doen dit voor echografie plausibel β€” silent speech-pipeline is niet plug-and-play
Prijzen probes (€300 budget β†’ $3.500 iPhone-native)Marktschatting schatting β€” varieert sterk, check bij leverancier
Effort NL-versie: 2–4 maanden met klein ML-teamRedenering, geen ervaring gok β€” data-verzameling is de wildcard
Cross-sessie robuustheidHet onopgeloste kernprobleem van het hele veld literatuur β€” probe telkens iets anders = drift

Bronnen

β€’ Aleph Neuro β€” Silent speech with ultrasound (primaire bron: WER, architectuur, roadmap) hoog

β€’ Onderzoekslijn silent speech: SottoVoce (ultrasound-SSI), AlterEgo (EMG, MIT) β€” voor de modaliteiten-vergelijking context

β€’ Kosten-, iPhone- en NL-trainingsschattingen: eigen research-ronde (Grok, 8 jul 2026), als richtgetal schatting

Spraak zonder geluid Β· Nachtelijke Maker Β· 9 juli 2026 Β· 100% client-side, geen account, niets verlaat je toestel Β· Geen medisch of aankoopadvies β€” een oriΓ«ntatie op een veelbelovend maar nog onrijp veld.