| --- |
| license: cc-by-nc-4.0 |
| language: |
| - rn |
| - fr |
| base_model: facebook/nllb-200-distilled-600M |
| tags: |
| - translation |
| - nllb |
| - kirundi |
| - kinyarwanda |
| - burundi |
| - low-resource |
| pipeline_tag: translation |
| --- |
| |
| # BiTremplin — NLLB fine-tune Kirundi <-> Francais |
|
|
| Modele de traduction **Kirundi <-> Francais**, fine-tune a partir de |
| [facebook/nllb-200-distilled-600M](https://huggingface.co/facebook/nllb-200-distilled-600M) |
| dans le cadre du projet **BiTremplin** (Burundian Intelligent Translation |
| Platform for Learning and Multilingual Knowledge Accessibility). |
|
|
| ## ⚠️ A savoir avant d'utiliser ce modele |
|
|
| NLLB-200 n'a pas de code de langue dedie au **Kirundi** (Burundi). Ce modele |
| reutilise le slot `kin_Latn`, qui est officiellement celui du **Kinyarwanda** |
| (Rwanda) dans NLLB-200 — une langue proche mais distincte. Apres ce |
| fine-tuning, `kin_Latn` produit du **Kirundi**, pas du Kinyarwanda standard. |
| Ne pas utiliser ce modele pour du Kinyarwanda ; utiliser le NLLB-200 de base |
| pour cet usage. |
|
|
| ## Utilisation |
|
|
| ```python |
| from transformers import AutoModelForSeq2SeqLM, AutoTokenizer |
| |
| model_name = "Expendadeur/nllb-kin-fr" |
| tokenizer = AutoTokenizer.from_pretrained(model_name) |
| model = AutoModelForSeq2SeqLM.from_pretrained(model_name) |
| |
| tokenizer.src_lang = "kin_Latn" # Kirundi (voir avertissement ci-dessus) |
| inputs = tokenizer("Amakuru yawe ni meza", return_tensors="pt") |
| generated = model.generate( |
| **inputs, |
| forced_bos_token_id=tokenizer.convert_tokens_to_ids("fra_Latn"), |
| ) |
| print(tokenizer.batch_decode(generated, skip_special_tokens=True)) |
| ``` |
|
|
| ## Donnees d'entrainement |
|
|
| **Phase 1 (supervisee)** : |
| - Corpus biblique aligne Kirundi-Francais (BibleNLP/ebible + corpus perso), ~30 900 versets |
| - Corpus personnalise multi-domaines (education, sante, finance, administration, etc.), 500 phrases dupliquees x15 |
| - Entrainement **bidirectionnel** (Kin->Fr et Fr->Kin combines), 57720 exemples au total |
|
|
| **Phase 2 (enrichissement, rétro-traduction)** : |
| - Phrases extraites de KIRNEWS (huggingface.co/datasets/kinnews_kirnews, actualites |
| Kirundi, licence MIT), retro-traduites vers le francais par le modele phase 1, |
| filtrees pour la qualite, 1993 paires synthetiques ajoutees |
| - Objectif : reduire la dependance au registre biblique (voir ecart de BLEU par |
| domaine dans metriques_par_domaine.csv) |
| |
| ## Metriques (jeu de test, jamais vu a l'entrainement) |
| |
| Metriques completes (BLEU, chrF++, TER dans les deux sens, et par domaine) |
| disponibles dans `metriques_finales.csv` et `metriques_par_domaine.csv`, |
| inclus dans ce depot. |
|
|
| ## Licence |
|
|
| CC-BY-NC-4.0 (heritee du modele de base NLLB-200) — **usage non commercial**. |
|
|