Nevral F5-TTS Arkitektur · ZeroGPU / Audio Pipeline
Olav Neural Voice Studio
Autentiske nevrale stemmerendere for Olav roboten. Ingen 1980-talls syntetisk nettleser-tale; her spilles ekte F5-TTS diffusjonsrendere og Pocket TTS-stemmekloner med full dynamisk bølgeformanalyse.
💡
Hvorfor nevrale modeller trengs: Enkel robot-tekst-til-tale fra operativsystemet høres ut som 1980-tallet.
Olav-karakteren bruker ekte nevrale diffusjonsmodeller (F5-TTS) trent på referanselyd for naturlig, varm stemmekloning med særpreg.
🎙
Olav Nevrale Stemmerendere (Klikk for å spille)
Hver knapp spiller av et faktisk neuralt lydopptak generert med F5-TTS eller Pocket TTS, koblet til sanntids bølgeform-spektrogram:
F5-TTS ZeroGPU Rendere:
▶ F5-A: «Hello! I am curious.»
F5-TTS Diffusion
Klonet fra Reference 1 (lights/darkness) med F5-TTS diffusjon.
▶ F5-B: «Hello! I am curious.»
F5-TTS Diffusion
Klonet fra Reference 2 (dishwasher) med alternativ klang.
▶ F5-C: «Hello! I am curious.» (Rolig)
F5-TTS Speed 0.95
F5-TTS med redusert hastighet for mer ettertenksom intonasjon.
▶ F5-D48: Studio Master Container
48 kHz Stereo
F5-TTS eksportert i 48 kHz stereokontainer for profesjonell videoproduksjon.
▶ P12: «Brand new day» (Komma-avslutning)
Pocket TTS
«I tried my best today. Tomorrow, tomorrow, it’s a brand new day.»
▶ P13: «Brand new day» (Tydelige pauser)
Pocket TTS
«I tried my best today. Tomorrow. Tomorrow. It’s a brand new day.»
▶ P06: Signatur-intonasjon
Signatur
Klassisk signatur-levering med full akseptert referansekontur.
▶ Reference 1: Original Olav (Lys / Mørke)
Original Kilde
Opprinnelig stemmeopptak som benyttes som kloningsanker for F5-TTS.
▶ Reference 2: Original Olav (Oppvaskmaskin)
Original Kilde
Sekundært anker for stemmekarakter og toneleie i hjemmesituasjoner.
Klikk på en av de nevrale renderne over for å spille
0.00s
🚀
ZeroGPU Deployment Gateway
ZeroGPU-prototypen i /home/njaal/Olav (commit 3ac987b)
er ferdig skrevet med F5-TTS, Gradio og @spaces.GPU.
For å aktivere sanntids generering på Hugging Face ZeroGPU:
Fordi Hugging Face har deaktivert passord-autentisering, kjøres pushet med HF Write Token:
git -C /home/njaal/Olav push https://<HF_TOKEN>@huggingface.co/spaces/nsolland/Olav feat/zerogpu-voice:main
📊
Ressurs- og Kjøretidstelemetri
1.2 s
ZeroGPU Inference (Mål)
4.18 GB
ZeroGPU Peak VRAM (A10G)
24 / 48 kHz
Lydkvalitet (Nevral Mel)
~15 s
Cold Start (Modell-last)
Faktiske målinger per kjøremiljø:
| Miljø | Inference-tid | Kvalitet | Status |
|---|---|---|---|
| Hugging Face ZeroGPU | ~1.2 – 2.5 s | F5-TTS Nevral | Produksjon |
| Nettleser-TTS (1980-stil) | < 50 ms | Mekanisk robot | Deaktivert |
| Lokal CPU Fallback | 348.7 s (5.8m) | F5-TTS Nevral | For tregt |
⚙️
Olav Voice ISA / Audio Pipeline
- Tekstprompt: Inndatatekst (norsk/engelsk med følelsesmarkør).
- Referanselyd: 10-sekunders ankerlyd (Reference 1 eller 2).
- Diffusjonsmodell: F5-TTS v1 Base med 32 diffusjonssteg (NFE).
- Vokoder: Vocos Mel-24kHz for ren akustisk rekonstruksjon.
- Kjøremiljø: NVIDIA A10G tildelt dynamisk via
@spaces.GPU.