| #!/bin/bash |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| |
| set -e |
| M=/scratch/prep/manifests |
| SRC=/scratch/models/asrafrica_ln109 |
| ENC=/scratch/models/afr_enc |
|
|
| echo "########## attente du GPU ##########" |
| while pgrep -f "train_wbert.py|train_xlsr.py" > /dev/null; do sleep 60; done |
| echo "GPU libre a $(date -u '+%H:%M UTC')"; sleep 20 |
|
|
| echo "########## preparation de l'encodeur (sans vocabulaire) ##########" |
| rm -rf $ENC && mkdir -p $ENC |
| cp $SRC/config.json $SRC/model.safetensors $ENC/ 2>/dev/null || cp $SRC/config.json $SRC/pytorch_model.bin $ENC/ |
| ls $ENC |
| [ -f $ENC/vocab.json ] && echo "ERREUR: vocab.json present, il serait herite" && exit 1 |
| echo "OK : pas de vocab.json => train_wbert reconstruira le notre depuis le texte WAXAL" |
|
|
| echo "########## entrainement depuis l'encodeur asr-africa ##########" |
| SAVE_LIMIT=12 LOAD_BEST=0 IGNORE_MISMATCH=1 /root/venv/bin/python /root/train_wbert.py \ |
| --lang lin --out /scratch/runs/afr \ |
| --init $ENC \ |
| --train $M/waxal_lin_train.jsonl $M/waxal_sna_train.jsonl \ |
| --eval $M/waxal_lin_validation.jsonl \ |
| --lr 5e-5 --epochs 6 --bs 4 --grad_accum 15 --warmup 300 --eval_steps 200 |
|
|
| echo "AFR_TRAIN_DONE" |
|
|
| echo "########## moyennage de fin de trajectoire + decodage lingala ##########" |
| RUN=/scratch/runs/afr BASE=/root/sub_XRL10.csv /root/venv/bin/python /root/swa_avg.py || true |
|
|
| echo "AFR_ALL_DONE" |
|
|