Instructions to use borekboissy/Millesime-2026-4b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use borekboissy/Millesime-2026-4b with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="borekboissy/Millesime-2026-4b") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("borekboissy/Millesime-2026-4b") model = AutoModelForCausalLM.from_pretrained("borekboissy/Millesime-2026-4b", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use borekboissy/Millesime-2026-4b with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "borekboissy/Millesime-2026-4b" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "borekboissy/Millesime-2026-4b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/borekboissy/Millesime-2026-4b
- SGLang
How to use borekboissy/Millesime-2026-4b with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "borekboissy/Millesime-2026-4b" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "borekboissy/Millesime-2026-4b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "borekboissy/Millesime-2026-4b" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "borekboissy/Millesime-2026-4b", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use borekboissy/Millesime-2026-4b with Docker Model Runner:
docker model run hf.co/borekboissy/Millesime-2026-4b
Millésime 2026 — 4B
Millésime 2026 4B est un modèle de langue de 4 milliards de paramètres, spécialisé pour le français, construit à partir de Qwen/Qwen3-4B-Instruct-2507.
Il obtient le meilleur score FR-MT-Bench de son panel d'évaluation — et ce avec quatre juges LLM différents, devant des modèles de 8B et 9B paramètres — et se place en tête des modèles 4B sur la moyenne des benchmarks français agrégés.
Le modèle est également disponible sur Ollama (F16, Q8_0, Q4_K_M) et en GGUF.
Philosophie du projet Millésime
Le projet Millésime repose sur trois principes :
- L'excellence en langue française. Les modèles Millésime visent à surpasser les modèles de taille équivalente sur les principaux benchmarks francophones.
- Une gamme complète, avec un accent sur les petits modèles. Le projet vise plusieurs tailles (1.7B, 4B, 14B, 32B). Un effort particulier est porté sur les SLM (Small Language Models), qui représentent une part importante des téléchargements sur Hugging Face et répondent à un besoin réel de modèles légers, exécutables localement.
- Une chaîne de données propre. Les modèles Millésime ne sont entraînés que sur des données dont les conditions d'utilisation autorisent le fine-tuning. De nombreux projets s'appuient sur des corpus contenant des sorties de modèles dont les conditions d'utilisation interdisent explicitement cet usage ; les datasets du projet Millésime sont filtrés en amont pour écarter ces données.
Caractéristiques
| Modèle de base | Qwen/Qwen3-4B-Instruct-2507 |
| Paramètres | ~4 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Langue cible | Français |
| Licence | Apache 2.0 |
| Mode de génération | Sans chaîne de pensée (non-thinking) |
| Formats disponibles | Safetensors (ce dépôt) · Ollama |
Pipeline d'entraînement
Le modèle est le fruit d'un pipeline en trois phases :
| Phase | Méthode | Données |
|---|---|---|
| 1 | Fine-tuning supervisé (SFT) | borekboissy/Millesime-2026-SFT |
| 2 | Optimisation par préférences (DPO) | borekboissy/Millesime-2026-comparIA-DPO |
| 3 | Fusion de modèles (TIES) | Fusion des deux modèles issus des phases 1 et 2 |
Phase 1 — SFT. L'objectif était d'injecter un maximum de culture générale française : plus de 38 000 exemples répartis sur 14 catégories et 280 sous-catégories (histoire et culture, langue française, droit et administration, sciences, philosophie, raisonnement, écriture et style…), générés synthétiquement puis fact-checkés.
Phase 2 — DPO. Alignement sur des préférences humaines réelles issues de l'arène publique Compar:IA du ministère de la Culture, filtrées pour ne conserver que des paires exploitables (préférence nette, tour unique, français, modèles à licence permissive, ratio de longueur maîtrisé).
Phase 3 — Fusion TIES. Les deux modèles issus des phases 1 et 2 sont fusionnés par la méthode TIES, qui combine leurs apports respectifs — connaissances françaises d'un côté, alignement sur les préférences de l'autre — en limitant les interférences entre les deux jeux de deltas de poids.
Résultats
FR-MT-Bench
Un score FR-MT-Bench dépend autant du juge que du modèle évalué : chaque juge LLM porte ses propres biais (préférences de style, sensibilité à la longueur, affinité pour les modèles de sa propre famille). Pour neutraliser ce risque, chaque modèle du panel a été évalué par quatre juges LLM issus de quatre familles différentes, tous appelés via OpenRouter : GPT-5.6-Sol, Claude Opus 5, Gemini 3.1 Pro et Grok 4.6.
| Modèle | GPT-5.6-Sol | Claude Opus 5 | Gemini 3.1 Pro | Grok 4.6 | Moyenne |
|---|---|---|---|---|---|
| Millésime 2026 4B | 6.475 | 6.344 | 6.638 | 6.844 | 6.575 |
| Chocolatine-2.1-4B | 6.363 | 5.956 | 6.544 | 6.613 | 6.369 |
| Qwen3-4B-Instruct-2507 (modèle de base) | 6.288 | 6.094 | 6.419 | 6.644 | 6.361 |
| Ministral-3-8B-Instruct-2512 (8B) | 6.113 | 6.113 | 6.238 | 6.606 | 6.267 |
| gemma-3-4b-it | 6.106 | 5.819 | 6.075 | 6.350 | 6.087 |
| Qwen3.5-9B (9B) | 5.906 | 5.844 | 6.444 | 6.050 | 6.061 |
| Phi-4-mini-instruct | 5.375 | 5.156 | 5.175 | 5.313 | 5.255 |
| Qwen3.5-4B | 4.806 | 4.613 | 5.000 | 5.019 | 4.859 |
| Lucie-7B-Instruct-v1.1 (7B) | 3.769 | 3.275 | 3.131 | 3.494 | 3.417 |
Lecture des résultats. Millésime 2026 4B arrive premier du panel chez les quatre juges, sans exception, avec une avance sur le deuxième comprise entre +0.09 (Gemini 3.1 Pro) et +0.23 point (Claude Opus 5). C'est le point le plus solide de cette évaluation : les quatre juges sont en net désaccord sur l'ordre des places suivantes — Chocolatine est deuxième pour GPT-5.6-Sol et Gemini mais quatrième pour Claude, Qwen3.5-9B oscille entre la 3ᵉ et la 6ᵉ place — alors qu'ils convergent tous sur la première. Le modèle gagne environ +0.21 point sur son modèle de base en moyenne, et devance des modèles de 8B et 9B paramètres.
Benchmarks académiques
Évaluations menées avec Lighteval (IFEval-fr, GPQA-fr) et lm-evaluation-harness (French Bench, Global-MMLU-fr).
| Modèle | IFEval-fr | GPQA-fr | ARC-C | BoolQA | Grammaire | HellaSwag | XWinograd | Global-MMLU-fr | Moyenne |
|---|---|---|---|---|---|---|---|---|---|
| Ministral-3-8B-Instruct-2512 (8B) | 44.7 | 42.6 | 56.7 | 93.3 | 79.0 | 70.4 | 73.5 | 71.2 | 68.60 |
| Qwen3.5-9B (9B) | 25.7 | 27.9 | 51.9 | 50.0 | 72.3 | 69.2 | 77.1 | 73.8 | 63.31 |
| Millésime 2026 4B | 69.1 | 27.4 | 48.3 | 90.4 | 73.1 | 58.3 | 67.5 | 65.0 | 63.09 |
| Qwen3.5-4B | 66.7 | 20.3 | 45.9 | 50.0 | 73.9 | 62.6 | 74.7 | 70.0 | 62.78 |
| Chocolatine-2.1-4B | 68.6 | 23.9 | 48.0 | 88.8 | 71.4 | 58.1 | 66.3 | 64.5 | 61.84 |
| Qwen3-4B-Instruct-2507 (modèle de base) | 68.2 | 24.4 | 47.2 | 87.6 | 71.4 | 56.8 | 67.5 | 63.0 | 60.86 |
| Phi-4-mini-instruct | 37.9 | 31.0 | 48.8 | 88.8 | 69.7 | 58.9 | 77.1 | 59.8 | 59.46 |
| gemma-3-4b-it | 61.9 | 28.9 | 50.9 | 50.0 | 71.4 | 63.4 | 77.1 | 57.8 | 57.36 |
| Lucie-7B-Instruct-v1.1 (7B) | 21.3 | 21.8 | 43.6 | 54.5 | 82.4 | 53.5 | 67.5 | 48.5 | 48.31 |
La colonne « Moyenne » est une moyenne simple, non pondérée, de l'ensemble des métriques disponibles (y compris le détail par domaine de Global-MMLU-fr). Elle est indicative et ne doit pas être lue comme un score composite normalisé.
Lecture des résultats. Millésime 2026 4B est le meilleur modèle 4B du panel et devance également Lucie-7B. Il obtient le meilleur score IFEval-fr de tout le panel (69.1), soit une nette avance sur le suivi d'instructions en français. Il reste devancé sur la moyenne globale par Ministral-3-8B (8B) et, très marginalement, par Qwen3.5-9B (9B) — deux modèles deux fois plus gros — principalement sur les tâches de connaissance pure (GPQA-fr, Global-MMLU-fr).
Protocole d'évaluation
Tous les modèles ont été évalués avec la chaîne de pensée désactivée (non-thinking). Plusieurs benchmarks imposent une limite de tokens en sortie que les modèles à raisonnement explicite consommaient parfois intégralement dans leur chaîne de réflexion, sans produire de réponse finale exploitable. Désactiver le raisonnement garantit une comparaison équitable entre tous les modèles du panel.
Empreinte carbone
L'empreinte de chaque phase d'entraînement a été mesurée avec la librairie Python CodeCarbon. Les relevés bruts sont disponibles dans le répertoire emissions/ de ce dépôt (phase1.csv, phase2.csv, phase3.csv).
| Phase | Durée | Énergie consommée | Émissions |
|---|---|---|---|
| Phase 1 — SFT | 55.9 min | 1.716 kWh | 634 g CO₂eq |
| Phase 2 — DPO | 62.2 min | 1.732 kWh | 640 g CO₂eq |
| Phase 3 — Fusion TIES | 1.1 min | 0.019 kWh | 7 g CO₂eq |
| Total | 1 h 59 | 3.47 kWh | 1.28 kg CO₂eq |
Matériel utilisé : 4 × NVIDIA B200, Intel Xeon Platinum 8559C (192 cœurs), 1996 Go de RAM — instance cloud localisée aux États-Unis.
Utilisation
Avec transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "borekboissy/Millesime-2026-4b"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
)
messages = [
{"role": "user", "content": "Explique-moi l'origine de l'expression « tomber dans les pommes »."},
]
inputs = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(inputs, max_new_tokens=512, temperature=0.7, top_p=0.8)
print(tokenizer.decode(outputs[0][inputs.shape[-1]:], skip_special_tokens=True))
Le modèle fonctionne en mode non-thinking : il répond directement, sans chaîne de raisonnement explicite.
Avec Ollama
Millésime 2026 4B est publié sur Ollama : borekboissy/Millesime-2026. Trois variantes sont disponibles, toutes avec la fenêtre de contexte complète de 256K tokens.
ollama run borekboissy/Millesime-2026:4b-q4_k_m
Quantifications GGUF (communauté)
Le modèle a été repris et quantifié au format GGUF par mradermacher. Deux dépôts sont disponibles :
| Dépôt | Type | Contenu |
|---|---|---|
mradermacher/Millesime-2026-4b-GGUF |
Quantifications statiques | De Q2_K (1.8 Go) à f16 (8.2 Go), en passant par Q4_K_M (2.6 Go) et Q8_0 (4.4 Go) |
mradermacher/Millesime-2026-4b-i1-GGUF |
Quantifications pondérées (imatrix) | Quantifications calibrées par matrice d'importance, souvent préférables à taille équivalente, en particulier dans les basses précisions |
Ces dépôts sont produits et maintenus indépendamment, sans intervention de l'auteur du modèle : les signaler ici relève de l'information et non d'une garantie de qualité ou de support. Merci malgré tout à ce pipeline (et à la personne derrière) d'avoir rendu Millésime immédiatement utilisable dans llama.cpp, LM Studio, Jan et les autres outils de l'écosystème GGUF.
# llama.cpp, directement depuis Hugging Face
llama cli -hf mradermacher/Millesime-2026-4b-GGUF:Q4_K_M
Limitations et axes d'amélioration
Ce modèle est une première itération, et plusieurs limites sont identifiées et assumées :
- Biais de longueur du dataset SFT. Le corpus
Millesime-2026-SFTproduit des réponses de longueur comparable qu'il s'agisse d'une question simple ou d'une question complexe. Le modèle a hérité de ce biais et peut se montrer inutilement verbeux sur des questions triviales. La refonte de ce dataset est le chantier prioritaire de la prochaine itération. - Absence de raisonnement explicite. Les corpus d'entraînement ne contiennent aucune trace de chaîne de pensée (thinking) ; le modèle n'est pas conçu pour ce mode de fonctionnement.
- Absence de données de tool calling. Les corpus ne contiennent pas d'exemples d'appel d'outils ; les capacités natives du modèle de base sur ce point n'ont pas été renforcées et pourraient avoir été partiellement diluées par le fine-tuning.
- Connaissances pures. Sur les benchmarks de connaissance encyclopédique (GPQA-fr, Global-MMLU-fr), le modèle reste en retrait par rapport à des modèles deux fois plus gros — une limite structurelle liée à sa taille.
- Modèle de base. Tous les modèles « Millésime 2026 » reposent sur la famille Qwen3. Les itérations futures pourront s'appuyer sur des générations de modèles de base plus récentes.
Ces axes alimenteront un futur « Millésime 2027 ».
Licence et attributions
Ce modèle est distribué sous licence Apache 2.0, en cohérence avec la licence du modèle de base Qwen3-4B-Instruct-2507.
Les données de préférence utilisées en phase 2 sont dérivées du dataset Compar:IA Arena du ministère de la Culture (Etalab 2.0 / CC-BY-4.0), que nous remercions pour la mise à disposition de ce corpus de préférences francophones.
Citation
@misc{boissy2026millesime4b,
author = {Boissy, Borek},
title = {Millésime 2026 4B: A French-Specialized Small Language Model},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/borekboissy/Millesime-2026-4b}}
}
Auteur / Contact
Borek Boissy
- Hugging Face : huggingface.co/borekboissy
- LinkedIn : linkedin.com/in/borek-boissy-b15a393
- Downloads last month
- 539
