--- license: cc-by-nc-4.0 language: - rn - fr base_model: facebook/nllb-200-distilled-600M tags: - translation - nllb - kirundi - kinyarwanda - burundi - low-resource pipeline_tag: translation --- # BiTremplin — NLLB fine-tune Kirundi <-> Francais Modele de traduction **Kirundi <-> Francais**, fine-tune a partir de [facebook/nllb-200-distilled-600M](https://huggingface.co/facebook/nllb-200-distilled-600M) dans le cadre du projet **BiTremplin** (Burundian Intelligent Translation Platform for Learning and Multilingual Knowledge Accessibility). ## ⚠️ A savoir avant d'utiliser ce modele NLLB-200 n'a pas de code de langue dedie au **Kirundi** (Burundi). Ce modele reutilise le slot `kin_Latn`, qui est officiellement celui du **Kinyarwanda** (Rwanda) dans NLLB-200 — une langue proche mais distincte. Apres ce fine-tuning, `kin_Latn` produit du **Kirundi**, pas du Kinyarwanda standard. Ne pas utiliser ce modele pour du Kinyarwanda ; utiliser le NLLB-200 de base pour cet usage. ## Utilisation ```python from transformers import AutoModelForSeq2SeqLM, AutoTokenizer model_name = "Expendadeur/nllb-kin-fr" tokenizer = AutoTokenizer.from_pretrained(model_name) model = AutoModelForSeq2SeqLM.from_pretrained(model_name) tokenizer.src_lang = "kin_Latn" # Kirundi (voir avertissement ci-dessus) inputs = tokenizer("Amakuru yawe ni meza", return_tensors="pt") generated = model.generate( **inputs, forced_bos_token_id=tokenizer.convert_tokens_to_ids("fra_Latn"), ) print(tokenizer.batch_decode(generated, skip_special_tokens=True)) ``` ## Donnees d'entrainement **Phase 1 (supervisee)** : - Corpus biblique aligne Kirundi-Francais (BibleNLP/ebible + corpus perso), ~30 900 versets - Corpus personnalise multi-domaines (education, sante, finance, administration, etc.), 500 phrases dupliquees x15 - Entrainement **bidirectionnel** (Kin->Fr et Fr->Kin combines), 57720 exemples au total **Phase 2 (enrichissement, rétro-traduction)** : - Phrases extraites de KIRNEWS (huggingface.co/datasets/kinnews_kirnews, actualites Kirundi, licence MIT), retro-traduites vers le francais par le modele phase 1, filtrees pour la qualite, 1993 paires synthetiques ajoutees - Objectif : reduire la dependance au registre biblique (voir ecart de BLEU par domaine dans metriques_par_domaine.csv) ## Metriques (jeu de test, jamais vu a l'entrainement) Metriques completes (BLEU, chrF++, TER dans les deux sens, et par domaine) disponibles dans `metriques_finales.csv` et `metriques_par_domaine.csv`, inclus dans ce depot. ## Licence CC-BY-NC-4.0 (heritee du modele de base NLLB-200) — **usage non commercial**.