my-custom-voice / scripts /04_train.sh
mohameddalii's picture
Upload folder using huggingface_hub
4cd3cad verified
Raw
History Blame Contribute Delete
880 Bytes
#!/usr/bin/env bash
set -e
DEVICE="cuda:0"
TOKENIZER_MODEL_PATH="Qwen/Qwen3-TTS-Tokenizer-12Hz"
INIT_MODEL_PATH="TTS-ORG/mans_model_mostafa/checkpoint-epoch-0"
RAW_JSONL="train_raw.jsonl"
TRAIN_JSONL="train_with_codes.jsonl"
OUTPUT_DIR="output_mostafa"
BATCH_SIZE=1
LR=2e-6
EPOCHS=4
SPEAKER_NAME="mostafa_speaker"
HF_REPO="TTS-ORG/mans_model_mostafa"
# Step 1: tokenize audio into codec codes
python prepare_data.py \
--device ${DEVICE} \
--tokenizer_model_path ${TOKENIZER_MODEL_PATH} \
--input_jsonl ${RAW_JSONL} \
--output_jsonl ${TRAIN_JSONL}
# Step 2: fine-tune with per-epoch HF push
python scripts/train_with_push.py \
--init_model_path ${INIT_MODEL_PATH} \
--output_model_path ${OUTPUT_DIR} \
--train_jsonl ${TRAIN_JSONL} \
--batch_size ${BATCH_SIZE} \
--lr ${LR} \
--num_epochs ${EPOCHS} \
--speaker_name ${SPEAKER_NAME} \
--hf_repo ${HF_REPO}