HuggingFaceTB
/

SmolLM3-3B-Base

Text Generation

Transformers.js

Model card Files Files and versions

eliebak HF Staff commited on Jul 8, 2025

Commit

d37c9b9

·

verified ·

1 Parent(s): b6b408d

Update README.md

Files changed (1) hide show

README.md +1 -1

README.md CHANGED Viewed

@@ -35,7 +35,7 @@ SmolLM3 is a 3B parameter language model designed to push the boundaries of smal
 ![image/png](https://cdn-uploads.huggingface.co/production/uploads/61c141342aac764ce1654e43/Zcm_016pWeyFr_uIkT7Ki.png)
-The model is a decoder-only transformer using GQA and NoRope, it was pretrained on 11.2T tokens with a staged curriculum of web, code, math and reasoning data. Post-training included midtraining on 140B reasoning tokens followed by supervised fine-tuning and alignment via Anchored Preference Optimization (APO).
 ### Key features
 - Instruct model optimized for **hybrid reasoning**

 ![image/png](https://cdn-uploads.huggingface.co/production/uploads/61c141342aac764ce1654e43/Zcm_016pWeyFr_uIkT7Ki.png)
+The model is a decoder-only transformer using GQA and NoPE, it was pretrained on 11.2T tokens with a staged curriculum of web, code, math and reasoning data. Post-training included midtraining on 140B reasoning tokens followed by supervised fine-tuning and alignment via Anchored Preference Optimization (APO).
 ### Key features
 - Instruct model optimized for **hybrid reasoning**