nllb-kin-fr / README.md
Expendadeur's picture
Upload folder using huggingface_hub
361dbb7 verified
|
Raw
History Blame Contribute Delete
2.63 kB
---
license: cc-by-nc-4.0
language:
- rn
- fr
base_model: facebook/nllb-200-distilled-600M
tags:
- translation
- nllb
- kirundi
- kinyarwanda
- burundi
- low-resource
pipeline_tag: translation
---
# BiTremplin — NLLB fine-tune Kirundi <-> Francais
Modele de traduction **Kirundi <-> Francais**, fine-tune a partir de
[facebook/nllb-200-distilled-600M](https://huggingface.co/facebook/nllb-200-distilled-600M)
dans le cadre du projet **BiTremplin** (Burundian Intelligent Translation
Platform for Learning and Multilingual Knowledge Accessibility).
## ⚠️ A savoir avant d'utiliser ce modele
NLLB-200 n'a pas de code de langue dedie au **Kirundi** (Burundi). Ce modele
reutilise le slot `kin_Latn`, qui est officiellement celui du **Kinyarwanda**
(Rwanda) dans NLLB-200 — une langue proche mais distincte. Apres ce
fine-tuning, `kin_Latn` produit du **Kirundi**, pas du Kinyarwanda standard.
Ne pas utiliser ce modele pour du Kinyarwanda ; utiliser le NLLB-200 de base
pour cet usage.
## Utilisation
```python
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
model_name = "Expendadeur/nllb-kin-fr"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)
tokenizer.src_lang = "kin_Latn" # Kirundi (voir avertissement ci-dessus)
inputs = tokenizer("Amakuru yawe ni meza", return_tensors="pt")
generated = model.generate(
**inputs,
forced_bos_token_id=tokenizer.convert_tokens_to_ids("fra_Latn"),
)
print(tokenizer.batch_decode(generated, skip_special_tokens=True))
```
## Donnees d'entrainement
**Phase 1 (supervisee)** :
- Corpus biblique aligne Kirundi-Francais (BibleNLP/ebible + corpus perso), ~30 900 versets
- Corpus personnalise multi-domaines (education, sante, finance, administration, etc.), 500 phrases dupliquees x15
- Entrainement **bidirectionnel** (Kin->Fr et Fr->Kin combines), 57720 exemples au total
**Phase 2 (enrichissement, rétro-traduction)** :
- Phrases extraites de KIRNEWS (huggingface.co/datasets/kinnews_kirnews, actualites
Kirundi, licence MIT), retro-traduites vers le francais par le modele phase 1,
filtrees pour la qualite, 1993 paires synthetiques ajoutees
- Objectif : reduire la dependance au registre biblique (voir ecart de BLEU par
domaine dans metriques_par_domaine.csv)
## Metriques (jeu de test, jamais vu a l'entrainement)
Metriques completes (BLEU, chrF++, TER dans les deux sens, et par domaine)
disponibles dans `metriques_finales.csv` et `metriques_par_domaine.csv`,
inclus dans ce depot.
## Licence
CC-BY-NC-4.0 (heritee du modele de base NLLB-200) — **usage non commercial**.