You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Log in or Sign Up to review the conditions and access this model content.

BlueTTS β€” Malagasy (plt), clonage zero-shot preserve

Finetune de BlueTTS (base notmax123/blue-v2) pour parler malgache (Plateau Malagasy, plt) sans perdre la capacite de clonage vocal zero-shot du modele de base.

Chaque checkpoint est publie avec son bundle ONNX (inference CPU), ses audios d'evaluation et ses metriques β€” rien n'est efface, tu peux choisir le tien.

Le probleme resolu

Finetuner un TTS de clonage sur peu de locuteurs detruit l'espace locuteur : le modele oublie le clonage et repete des syllabes. Un run precedent sur 4 voix l'a montre sans ambiguite : sim_ecapa s'effondrait de 0.45 a 0.22 en 1 000 steps.

La parade retenue : entrainer sur 524 voix distinctes parlant un malgache a accent natif (mimba/multivoice-plt, 26 200 clips), pour que le modele apprenne a separer le contenu du locuteur. La diversite remplace le gel.

Evolution

evolution

step loss sim moy min max vues inedites
0 0.304 0.314 0.130 0.494 0.349 0.280
1000 0.269 0.408 0.305 0.542 0.406 0.410
2000 0.266 0.406 0.316 0.533 0.404 0.408
3000 0.265 0.400 0.280 0.553 0.401 0.399
4000 0.264 0.395 0.280 0.520 0.390 0.401
5000 0.263 0.384 0.284 0.519 0.372 0.396
6000 0.263 0.403 0.320 0.524 0.385 0.420
7000 0.263 0.398 0.276 0.537 0.387 0.409
8000 0.263 0.388 0.291 0.543 0.375 0.401
9000 0.261 0.390 0.264 0.529 0.389 0.391
10000 0.262 0.393 0.280 0.510 0.389 0.396
11000 0.261 0.385 0.288 0.500 0.371 0.399
12000 0.261 0.390 0.242 0.495 0.386 0.393
13000 0.261 0.387 0.275 0.531 0.382 0.392
  • sim moy β€” similarite locuteur ECAPA-TDNN (speechbrain/spkrec-ecapa-voxceleb), cosinus entre l'audio genere et l'audio de reference, moyenne sur 4 references x N phrases.
  • vues / inedites β€” phrases d'evaluation initiales vs phrases jamais vues a l'entrainement (mesure de generalisation).

Au step 13000, les phrases inedites obtiennent 0.392 contre 0.382 pour les phrases d'evaluation initiales : l'ecart (+0.010) montre que le modele generalise et ne recite pas son corpus.

Ecoute β€” checkpoint 13000

4 voix de reference x plusieurs phrases malgaches, generees via le bundle ONNX de ce checkpoint.

voix1_p1

voix1_p2

voix1_p3

voix1_p4

voix2_p1

voix2_p2

voix2_p3

voix2_p4

voix3_p1

voix3_p2

voix3_p3

voix3_p4

voix4_p1

voix4_p2

voix4_p3

voix4_p4

Recette d'entrainement

Base notmax123/blue-v2 (AE blue_codec.safetensors)
Dataset mimba/multivoice-plt β€” 26 197 clips, 524 locuteurs (50 chacun)
Texte IPA pre-phonemise (text_phonemized), plt
Duration Predictor reentraine de zero sur les 524 voix, 15 000 steps (loss 1.3 -> 0.059)
TTL finetune, batch 7 x accumulation 8 (batch effectif 56)
LR 2.5e-4, reduit a 1.25e-4 apres plateau de loss + baisse de sim_ecapa
Checkpoints tous les 1 000 steps, exportes en ONNX et evalues automatiquement

Pourquoi le DP est reentraine : c'est lui qui portait le begaiement du run 4-voix (il est conditionne par le locuteur). Sur 524 voix, il apprend un rythme robuste.

Utilisation (ONNX, CPU)

from huggingface_hub import snapshot_download
d = snapshot_download("mimba/bluetts-plt_gel", allow_patterns=["eval/step_13000/onnx/*"])
# -> text_encoder / vector_estimator / vocoder / duration_predictor
#    + codec_encoder / style_encoder / duration_style_encoder (clonage zero-shot)

Parametres de production (worker Mimba) : total_step=8..16, speed=0.95, cfg_scale=4.0, pace_blend=0.30. Normaliser la sortie avant ecriture (RMS 0.08 / peak 0.95) : le vocodeur sort a un pic ~1.5 et s'ecrete sinon.

Le vocabulaire BlueTTS ne contient pas les marqueurs de prenasalisation malgaches m en exposant et n en exposant : les remplacer par m / n avant encodage.

Limites

  • Fidelite de clonage inferieure a la base : sim_ecapa passe de ~0.35 (step 0) a ~0.32 apres finetune. La degradation a ete stoppee (LR reduit), pas annulee.
  • Variable selon la voix : certaines references se clonent nettement moins bien (voir l'ecart min/max du tableau) β€” tester avec ses propres references.
  • Monolingue : entraine pour le malgache uniquement.
  • Donnees synthetiques : le corpus multi-voix est genere (OmniVoice + OpenVoice), seul l'accent provient de locuteurs natifs reels.

Licence

cc-by-nc-sa-4.0 β€” usage non commercial. Verifier independamment les licences de BlueTTS, OmniVoice et OpenVoice avant tout usage commercial.

Contact : @Mimba
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for mimba/plt_gel_lr_bas

Quantized
(3)
this model

Dataset used to train mimba/plt_gel_lr_bas