LatinX-TTS / config.json
LuisChary's picture
Upload config.json
0e1f0ed verified
Raw
History Blame Contribute Delete
3.58 kB
{
"_name_or_path": "LuisChary/LatinX-TTS",
"model_type": "latinx_tts",
"architectures": [
"LatinXTTS"
],
"library_name": "latinx-inference",
"pipeline_tag": "text-to-speech",
"task": "text-to-speech",
"license": "cc-by-nc-4.0",
"paper": {
"title": "LatinX: Aligning a Multilingual TTS Model with Direct Preference Optimization",
"arxiv": "2509.05863"
},
"authors": [
"Luis Felipe Chary",
"Miguel Arjona Ramirez"
],
"description": "LatinX is a multilingual, voice-preserving text-to-speech model component designed for cascaded speech-to-speech translation research.",
"supported_languages": [
"pt",
"en",
"es",
"fr",
"it",
"ro"
],
"language_names": {
"pt": "Portuguese",
"en": "English",
"es": "Spanish",
"fr": "French",
"it": "Italian",
"ro": "Romanian"
},
"audio": {
"sampling_rate": 16000,
"channels": 1,
"format": "waveform"
},
"inference": {
"repository": "https://github.com/luischary/latinx-inference",
"entrypoint": "scripts/run_inference.py",
"recommended_usage": "Use the accompanying latinx-inference repository rather than loading this repository directly with a generic Transformers pipeline.",
"supports_reference_audio_conditioning": true,
"recommended_mode": "reference_audio_conditioning"
},
"components": {
"text_normalization": {
"description": "Language-aware text normalization, including numeric value expansion in the inference repository."
},
"g2p": {
"description": "Grapheme-to-phoneme conversion module.",
"checkpoint": "g2p.pt"
},
"phoneme_tokenizer": {
"description": "Phoneme-level tokenization used before acoustic token generation."
},
"acoustic_model": {
"description": "Autoregressive decoder-only acoustic-token generator.",
"checkpoint": "ar_decoder.pt",
"parameter_count": "approximately 210M",
"context_length": 8192
},
"acoustic_codec": {
"description": "VQ acoustic autoencoder used to decode generated acoustic tokens.",
"checkpoint": "vq_autoencoder.pt",
"mel_bins": 80,
"temporal_downsampling": 4,
"codebook_size": 4096,
"nominal_bitrate_kbps": 7.5
},
"vocoder": {
"description": "HiFi-GAN waveform synthesizer.",
"checkpoint": "hifi.pt"
}
},
"checkpoint_files": [
"g2p.pt",
"ar_decoder.pt",
"vq_autoencoder.pt",
"hifi.pt"
],
"training": {
"alignment_method": "Direct Preference Optimization",
"training_code_included": false
},
"limitations": {
"long_form_generation": false,
"requires_sentence_chunking_for_long_text": true,
"unconditioned_generation_may_be_less_stable": true,
"pronunciation_and_prosody_may_vary_by_language_speaker_and_domain": true
},
"responsible_use": {
"requires_consent_for_reference_voice": true,
"synthetic_speech_disclosure_recommended": true,
"disallowed_uses": [
"impersonation",
"deceptive voice cloning",
"non-consensual voice cloning",
"fraud",
"harassment",
"misinformation",
"commercial use"
]
}
}