Thorsten-Voice Kokoro — Hessisch
Deutsches Kokoro-82M (StyleTTS2) Fine-Tune auf hessischer Aussprache, basierend auf dem Thorsten-Voice Hessisch-Datensatz (2.106 Sätze, CC0). Trainiert als Fine-Tune vom Standard-Deutsch-Modell (Thorsten-Voice/Kokoro, Epoche 5) über 10 zusätzliche Epochen.
Empfohlener Checkpoint
model_ep7.pth (Alias: model.pth) — im Hörvergleich gegenüber Epoche 5, 9 und 10
favorisiert, bei nahezu identischem Validation-Loss (0.291 vs. 0.290 bei Epoche 9/10).
Alle 10 Epochen liegen im Repo, jeweils mit eigenem Voicepack, falls du selbst
vergleichen möchtest.
| Epoche | Val-Loss | Dur-Loss | F0-Loss |
|---|---|---|---|
| 1 | 0.326 | 0.499 | 2.529 |
| 2 | 0.327 | 0.474 | 2.520 |
| 3 | 0.327 | 0.473 | 2.550 |
| 4 | 0.298 | 0.474 | 2.524 |
| 5 | 0.301 | 0.469 | 2.487 |
| 6 | 0.295 | 0.452 | 2.561 |
| 7 | 0.291 | 0.476 | 2.530 |
| 8 | 0.292 | 0.468 | 2.449 |
| 9 | 0.290 | 0.457 | 2.501 |
| 10 | 0.290 | 0.473 | 2.505 |
Nutzung
inference.py ist eigenständig — es lädt Modell, Config und Voicepack automatisch von
diesem Repo herunter, es sind keine lokalen Dateien oder ein Checkout des Trainings-Repos
nötig.
pip install torch soundfile numpy huggingface_hub
# Wichtig: kokoro-Fork zuerst installieren, danach den misaki-Fork mit --force-reinstall --no-deps,
# da die kokoro-Installation sonst den misaki-Fork mit der PyPI-Standardversion
# überschreibt (die kein deutsches G2P-Modul enthält).
pip install git+https://github.com/semidark/kokoro.git
pip install --force-reinstall --no-deps git+https://github.com/semidark/misaki.git@6d252a2e
# Empfohlener Checkpoint (Epoche 7)
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav
# Explizit eine andere Epoche wählen
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep10
python inference.py "Hallo, hier spricht der Thorsten in charmantem hessischen Dialekt." output.wav ep3
Bekannter technischer Hinweis
Der zugrundeliegende Datensatz enthält standarddeutsche Texte, gesprochen in hessischer Aussprache. Das Modell wurde daher mit standarddeutscher G2P-Phonemisierung trainiert — das dialektale Klangbild kommt ausschließlich aus der Audioseite, nicht aus einer angepassten Phonetik-Transkription.
- Downloads last month
- 31
Model tree for Thorsten-Voice/Kokoro-Hessisch
Base model
Thorsten-Voice/Kokoro