Thorsten-Voice Kokoro — Hessisch

Deutsches Kokoro-82M (StyleTTS2) Fine-Tune auf hessischer Aussprache, basierend auf dem Thorsten-Voice Hessisch-Datensatz (2.106 Sätze, CC0). Trainiert als Fine-Tune vom Standard-Deutsch-Modell (Thorsten-Voice/Kokoro, Epoche 5) über 10 zusätzliche Epochen.

Empfohlener Checkpoint

model_ep7.pth (Alias: model.pth) — im Hörvergleich gegenüber Epoche 5, 9 und 10 favorisiert, bei nahezu identischem Validation-Loss (0.291 vs. 0.290 bei Epoche 9/10). Alle 10 Epochen liegen im Repo, jeweils mit eigenem Voicepack, falls du selbst vergleichen möchtest.

Epoche Val-Loss Dur-Loss F0-Loss
1 0.326 0.499 2.529
2 0.327 0.474 2.520
3 0.327 0.473 2.550
4 0.298 0.474 2.524
5 0.301 0.469 2.487
6 0.295 0.452 2.561
7 0.291 0.476 2.530
8 0.292 0.468 2.449
9 0.290 0.457 2.501
10 0.290 0.473 2.505

Nutzung

inference.py ist eigenständig — es lädt Modell, Config und Voicepack automatisch von diesem Repo herunter, es sind keine lokalen Dateien oder ein Checkout des Trainings-Repos nötig.

pip install torch soundfile numpy huggingface_hub

# Wichtig: kokoro-Fork zuerst installieren, danach den misaki-Fork mit --force-reinstall --no-deps,
# da die kokoro-Installation sonst den misaki-Fork mit der PyPI-Standardversion
# überschreibt (die kein deutsches G2P-Modul enthält).
pip install git+https://github.com/semidark/kokoro.git
pip install --force-reinstall --no-deps git+https://github.com/semidark/misaki.git@6d252a2e
# Empfohlener Checkpoint (Epoche 7)
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav

# Explizit eine andere Epoche wählen
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep10
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep3

Bekannter technischer Hinweis

Der zugrundeliegende Datensatz enthält standarddeutsche Texte, gesprochen in hessischer Aussprache. Das Modell wurde daher mit standarddeutscher G2P-Phonemisierung trainiert — das dialektale Klangbild kommt ausschließlich aus der Audioseite, nicht aus einer angepassten Phonetik-Transkription.

Downloads last month
31
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Thorsten-Voice/Kokoro-Hessisch

Finetuned
(1)
this model