VALO
OLAV NEURAL VOICE STUDIO
Build Order BO-0065 · F5-TTS & ZeroGPU Architecture
Nevral F5-TTS Arkitektur · ZeroGPU / Audio Pipeline

Olav Neural Voice Studio

Autentiske nevrale stemmerendere for Olav roboten. Ingen 1980-talls syntetisk nettleser-tale; her spilles ekte F5-TTS diffusjonsrendere og Pocket TTS-stemmekloner med full dynamisk bølgeformanalyse.

💡
Hvorfor nevrale modeller trengs: Enkel robot-tekst-til-tale fra operativsystemet høres ut som 1980-tallet. Olav-karakteren bruker ekte nevrale diffusjonsmodeller (F5-TTS) trent på referanselyd for naturlig, varm stemmekloning med særpreg.
Følelsesantenne: GLAD (Grønn)
Posisjon: 15° oppoverbøyd · Modus: Standard varm robot
Nevral modell: F5-TTS v1 Base + Vocos Mel-24kHz · Samplerate: 24 000 / 48 000 Hz
🎙 Olav Nevrale Stemmerendere (Klikk for å spille)

Hver knapp spiller av et faktisk neuralt lydopptak generert med F5-TTS eller Pocket TTS, koblet til sanntids bølgeform-spektrogram:

F5-A: «Hello! I am curious.» F5-TTS Diffusion
Klonet fra Reference 1 (lights/darkness) med F5-TTS diffusjon.
Lengde: 1.75s24 kHz WAV
F5-B: «Hello! I am curious.» F5-TTS Diffusion
Klonet fra Reference 2 (dishwasher) med alternativ klang.
Lengde: 2.61s24 kHz WAV
F5-C: «Hello! I am curious.» (Rolig) F5-TTS Speed 0.95
F5-TTS med redusert hastighet for mer ettertenksom intonasjon.
Lengde: 1.85s24 kHz WAV
F5-D48: Studio Master Container 48 kHz Stereo
F5-TTS eksportert i 48 kHz stereokontainer for profesjonell videoproduksjon.
Lengde: 1.75s48 kHz Stereo WAV
P12: «Brand new day» (Komma-avslutning) Pocket TTS
«I tried my best today. Tomorrow, tomorrow, it’s a brand new day.»
Lengde: 7.92s24 kHz Mono WAV
P13: «Brand new day» (Tydelige pauser) Pocket TTS
«I tried my best today. Tomorrow. Tomorrow. It’s a brand new day.»
Lengde: 8.72s24 kHz Mono WAV
P06: Signatur-intonasjon Signatur
Klassisk signatur-levering med full akseptert referansekontur.
Lengde: 8.72s24 kHz Mono WAV
Reference 1: Original Olav (Lys / Mørke) Original Kilde
Opprinnelig stemmeopptak som benyttes som kloningsanker for F5-TTS.
Lengde: 10.0s48 kHz Master
Reference 2: Original Olav (Oppvaskmaskin) Original Kilde
Sekundært anker for stemmekarakter og toneleie i hjemmesituasjoner.
Lengde: 10.0s48 kHz Master
Klikk på en av de nevrale renderne over for å spille 0.00s
🚀 ZeroGPU Deployment Gateway

ZeroGPU-prototypen i /home/njaal/Olav (commit 3ac987b) er ferdig skrevet med F5-TTS, Gradio og @spaces.GPU.

For å aktivere sanntids generering på Hugging Face ZeroGPU:
Fordi Hugging Face har deaktivert passord-autentisering, kjøres pushet med HF Write Token:
git -C /home/njaal/Olav push https://<HF_TOKEN>@huggingface.co/spaces/nsolland/Olav feat/zerogpu-voice:main
📊 Ressurs- og Kjøretidstelemetri
1.2 s
ZeroGPU Inference (Mål)
4.18 GB
ZeroGPU Peak VRAM (A10G)
24 / 48 kHz
Lydkvalitet (Nevral Mel)
~15 s
Cold Start (Modell-last)
Faktiske målinger per kjøremiljø:
Miljø Inference-tid Kvalitet Status
Hugging Face ZeroGPU ~1.2 – 2.5 s F5-TTS Nevral Produksjon
Nettleser-TTS (1980-stil) < 50 ms Mekanisk robot Deaktivert
Lokal CPU Fallback 348.7 s (5.8m) F5-TTS Nevral For tregt
⚙️ Olav Voice ISA / Audio Pipeline
  1. Tekstprompt: Inndatatekst (norsk/engelsk med følelsesmarkør).
  2. Referanselyd: 10-sekunders ankerlyd (Reference 1 eller 2).
  3. Diffusjonsmodell: F5-TTS v1 Base med 32 diffusjonssteg (NFE).
  4. Vokoder: Vocos Mel-24kHz for ren akustisk rekonstruksjon.
  5. Kjøremiljø: NVIDIA A10G tildelt dynamisk via @spaces.GPU.