Millésime 2026

Millésime 2026 — 4B

Millésime 2026 4B est un modèle de langue de 4 milliards de paramètres, spécialisé pour le français, construit à partir de Qwen/Qwen3-4B-Instruct-2507.

Il obtient le meilleur score FR-MT-Bench de son panel d'évaluation — et ce avec quatre juges LLM différents, devant des modèles de 8B et 9B paramètres — et se place en tête des modèles 4B sur la moyenne des benchmarks français agrégés.

Le modèle est également disponible sur Ollama (F16, Q8_0, Q4_K_M) et en GGUF.


Philosophie du projet Millésime

Le projet Millésime repose sur trois principes :

  1. L'excellence en langue française. Les modèles Millésime visent à surpasser les modèles de taille équivalente sur les principaux benchmarks francophones.
  2. Une gamme complète, avec un accent sur les petits modèles. Le projet vise plusieurs tailles (1.7B, 4B, 14B, 32B). Un effort particulier est porté sur les SLM (Small Language Models), qui représentent une part importante des téléchargements sur Hugging Face et répondent à un besoin réel de modèles légers, exécutables localement.
  3. Une chaîne de données propre. Les modèles Millésime ne sont entraînés que sur des données dont les conditions d'utilisation autorisent le fine-tuning. De nombreux projets s'appuient sur des corpus contenant des sorties de modèles dont les conditions d'utilisation interdisent explicitement cet usage ; les datasets du projet Millésime sont filtrés en amont pour écarter ces données.

Caractéristiques

Modèle de base Qwen/Qwen3-4B-Instruct-2507
Paramètres ~4 milliards
Fenêtre de contexte 262 144 tokens
Langue cible Français
Licence Apache 2.0
Mode de génération Sans chaîne de pensée (non-thinking)
Formats disponibles Safetensors (ce dépôt) · Ollama

Pipeline d'entraînement

Le modèle est le fruit d'un pipeline en trois phases :

Phase Méthode Données
1 Fine-tuning supervisé (SFT) borekboissy/Millesime-2026-SFT
2 Optimisation par préférences (DPO) borekboissy/Millesime-2026-comparIA-DPO
3 Fusion de modèles (TIES) Fusion des deux modèles issus des phases 1 et 2

Phase 1 — SFT. L'objectif était d'injecter un maximum de culture générale française : plus de 38 000 exemples répartis sur 14 catégories et 280 sous-catégories (histoire et culture, langue française, droit et administration, sciences, philosophie, raisonnement, écriture et style…), générés synthétiquement puis fact-checkés.

Phase 2 — DPO. Alignement sur des préférences humaines réelles issues de l'arène publique Compar:IA du ministère de la Culture, filtrées pour ne conserver que des paires exploitables (préférence nette, tour unique, français, modèles à licence permissive, ratio de longueur maîtrisé).

Phase 3 — Fusion TIES. Les deux modèles issus des phases 1 et 2 sont fusionnés par la méthode TIES, qui combine leurs apports respectifs — connaissances françaises d'un côté, alignement sur les préférences de l'autre — en limitant les interférences entre les deux jeux de deltas de poids.


Résultats

FR-MT-Bench

Un score FR-MT-Bench dépend autant du juge que du modèle évalué : chaque juge LLM porte ses propres biais (préférences de style, sensibilité à la longueur, affinité pour les modèles de sa propre famille). Pour neutraliser ce risque, chaque modèle du panel a été évalué par quatre juges LLM issus de quatre familles différentes, tous appelés via OpenRouter : GPT-5.6-Sol, Claude Opus 5, Gemini 3.1 Pro et Grok 4.6.

Modèle GPT-5.6-Sol Claude Opus 5 Gemini 3.1 Pro Grok 4.6 Moyenne
Millésime 2026 4B 6.475 6.344 6.638 6.844 6.575
Chocolatine-2.1-4B 6.363 5.956 6.544 6.613 6.369
Qwen3-4B-Instruct-2507 (modèle de base) 6.288 6.094 6.419 6.644 6.361
Ministral-3-8B-Instruct-2512 (8B) 6.113 6.113 6.238 6.606 6.267
gemma-3-4b-it 6.106 5.819 6.075 6.350 6.087
Qwen3.5-9B (9B) 5.906 5.844 6.444 6.050 6.061
Phi-4-mini-instruct 5.375 5.156 5.175 5.313 5.255
Qwen3.5-4B 4.806 4.613 5.000 5.019 4.859
Lucie-7B-Instruct-v1.1 (7B) 3.769 3.275 3.131 3.494 3.417

Lecture des résultats. Millésime 2026 4B arrive premier du panel chez les quatre juges, sans exception, avec une avance sur le deuxième comprise entre +0.09 (Gemini 3.1 Pro) et +0.23 point (Claude Opus 5). C'est le point le plus solide de cette évaluation : les quatre juges sont en net désaccord sur l'ordre des places suivantes — Chocolatine est deuxième pour GPT-5.6-Sol et Gemini mais quatrième pour Claude, Qwen3.5-9B oscille entre la 3ᵉ et la 6ᵉ place — alors qu'ils convergent tous sur la première. Le modèle gagne environ +0.21 point sur son modèle de base en moyenne, et devance des modèles de 8B et 9B paramètres.

Benchmarks académiques

Évaluations menées avec Lighteval (IFEval-fr, GPQA-fr) et lm-evaluation-harness (French Bench, Global-MMLU-fr).

Modèle IFEval-fr GPQA-fr ARC-C BoolQA Grammaire HellaSwag XWinograd Global-MMLU-fr Moyenne
Ministral-3-8B-Instruct-2512 (8B) 44.7 42.6 56.7 93.3 79.0 70.4 73.5 71.2 68.60
Qwen3.5-9B (9B) 25.7 27.9 51.9 50.0 72.3 69.2 77.1 73.8 63.31
Millésime 2026 4B 69.1 27.4 48.3 90.4 73.1 58.3 67.5 65.0 63.09
Qwen3.5-4B 66.7 20.3 45.9 50.0 73.9 62.6 74.7 70.0 62.78
Chocolatine-2.1-4B 68.6 23.9 48.0 88.8 71.4 58.1 66.3 64.5 61.84
Qwen3-4B-Instruct-2507 (modèle de base) 68.2 24.4 47.2 87.6 71.4 56.8 67.5 63.0 60.86
Phi-4-mini-instruct 37.9 31.0 48.8 88.8 69.7 58.9 77.1 59.8 59.46
gemma-3-4b-it 61.9 28.9 50.9 50.0 71.4 63.4 77.1 57.8 57.36
Lucie-7B-Instruct-v1.1 (7B) 21.3 21.8 43.6 54.5 82.4 53.5 67.5 48.5 48.31

La colonne « Moyenne » est une moyenne simple, non pondérée, de l'ensemble des métriques disponibles (y compris le détail par domaine de Global-MMLU-fr). Elle est indicative et ne doit pas être lue comme un score composite normalisé.

Lecture des résultats. Millésime 2026 4B est le meilleur modèle 4B du panel et devance également Lucie-7B. Il obtient le meilleur score IFEval-fr de tout le panel (69.1), soit une nette avance sur le suivi d'instructions en français. Il reste devancé sur la moyenne globale par Ministral-3-8B (8B) et, très marginalement, par Qwen3.5-9B (9B) — deux modèles deux fois plus gros — principalement sur les tâches de connaissance pure (GPQA-fr, Global-MMLU-fr).

Protocole d'évaluation

Tous les modèles ont été évalués avec la chaîne de pensée désactivée (non-thinking). Plusieurs benchmarks imposent une limite de tokens en sortie que les modèles à raisonnement explicite consommaient parfois intégralement dans leur chaîne de réflexion, sans produire de réponse finale exploitable. Désactiver le raisonnement garantit une comparaison équitable entre tous les modèles du panel.


Empreinte carbone

L'empreinte de chaque phase d'entraînement a été mesurée avec la librairie Python CodeCarbon. Les relevés bruts sont disponibles dans le répertoire emissions/ de ce dépôt (phase1.csv, phase2.csv, phase3.csv).

Phase Durée Énergie consommée Émissions
Phase 1 — SFT 55.9 min 1.716 kWh 634 g CO₂eq
Phase 2 — DPO 62.2 min 1.732 kWh 640 g CO₂eq
Phase 3 — Fusion TIES 1.1 min 0.019 kWh 7 g CO₂eq
Total 1 h 59 3.47 kWh 1.28 kg CO₂eq

Matériel utilisé : 4 × NVIDIA B200, Intel Xeon Platinum 8559C (192 cœurs), 1996 Go de RAM — instance cloud localisée aux États-Unis.


Utilisation

Avec transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "borekboissy/Millesime-2026-4b"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
)

messages = [
    {"role": "user", "content": "Explique-moi l'origine de l'expression « tomber dans les pommes »."},
]

inputs = tokenizer.apply_chat_template(
    messages,
    add_generation_prompt=True,
    return_tensors="pt",
).to(model.device)

outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.8)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))

Le modèle fonctionne en mode non-thinking : il répond directement, sans chaîne de raisonnement explicite.

Avec Ollama

Millésime 2026 4B est publié sur Ollama : borekboissy/Millesime-2026. Trois variantes sont disponibles, toutes avec la fenêtre de contexte complète de 256K tokens.

Tag Précision Taille
4b-q4_k_m Q4_K_M 2.5 Go
4b-q8_0 Q8_0 4.3 Go
4b-f16 F16 8.1 Go
ollama run borekboissy/Millesime-2026:4b-q4_k_m

Quantifications GGUF (communauté)

Le modèle a été repris et quantifié au format GGUF par mradermacher. Deux dépôts sont disponibles :

Dépôt Type Contenu
mradermacher/Millesime-2026-4b-GGUF Quantifications statiques De Q2_K (1.8 Go) à f16 (8.2 Go), en passant par Q4_K_M (2.6 Go) et Q8_0 (4.4 Go)
mradermacher/Millesime-2026-4b-i1-GGUF Quantifications pondérées (imatrix) Quantifications calibrées par matrice d'importance, souvent préférables à taille équivalente, en particulier dans les basses précisions

Ces dépôts sont produits et maintenus indépendamment, sans intervention de l'auteur du modèle : les signaler ici relève de l'information et non d'une garantie de qualité ou de support. Merci malgré tout à ce pipeline (et à la personne derrière) d'avoir rendu Millésime immédiatement utilisable dans llama.cpp, LM Studio, Jan et les autres outils de l'écosystème GGUF.

# llama.cpp, directement depuis Hugging Face
llama cli -hf mradermacher/Millesime-2026-4b-GGUF:Q4_K_M

Limitations et axes d'amélioration

Ce modèle est une première itération, et plusieurs limites sont identifiées et assumées :

  • Biais de longueur du dataset SFT. Le corpus Millesime-2026-SFT produit des réponses de longueur comparable qu'il s'agisse d'une question simple ou d'une question complexe. Le modèle a hérité de ce biais et peut se montrer inutilement verbeux sur des questions triviales. La refonte de ce dataset est le chantier prioritaire de la prochaine itération.
  • Absence de raisonnement explicite. Les corpus d'entraînement ne contiennent aucune trace de chaîne de pensée (thinking) ; le modèle n'est pas conçu pour ce mode de fonctionnement.
  • Absence de données de tool calling. Les corpus ne contiennent pas d'exemples d'appel d'outils ; les capacités natives du modèle de base sur ce point n'ont pas été renforcées et pourraient avoir été partiellement diluées par le fine-tuning.
  • Connaissances pures. Sur les benchmarks de connaissance encyclopédique (GPQA-fr, Global-MMLU-fr), le modèle reste en retrait par rapport à des modèles deux fois plus gros — une limite structurelle liée à sa taille.
  • Modèle de base. Tous les modèles « Millésime 2026 » reposent sur la famille Qwen3. Les itérations futures pourront s'appuyer sur des générations de modèles de base plus récentes.

Ces axes alimenteront un futur « Millésime 2027 ».


Licence et attributions

Ce modèle est distribué sous licence Apache 2.0, en cohérence avec la licence du modèle de base Qwen3-4B-Instruct-2507.

Les données de préférence utilisées en phase 2 sont dérivées du dataset Compar:IA Arena du ministère de la Culture (Etalab 2.0 / CC-BY-4.0), que nous remercions pour la mise à disposition de ce corpus de préférences francophones.


Citation

@misc{boissy2026millesime4b,
  author       = {Boissy, Borek},
  title        = {Millésime 2026 4B: A French-Specialized Small Language Model},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/borekboissy/Millesime-2026-4b}}
}

Auteur / Contact

Borek Boissy

Downloads last month
539
Safetensors
Model size
4B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for borekboissy/Millesime-2026-4b

Finetuned
(1957)
this model
Quantizations
2 models

Datasets used to train borekboissy/Millesime-2026-4b