muradil211 commited on
Commit
444bdbe
·
verified ·
1 Parent(s): 4236e7e

docs: clarify online reinforcement learning stage

Browse files
Files changed (1) hide show
  1. README.md +1 -1
README.md CHANGED
@@ -32,7 +32,7 @@ tags:
32
  | Field | Details |
33
  |---|---|
34
  | 🧠 Base family | Qwen3-4B-Instruct |
35
- | 🪜 Curriculum stage | Stage 3 — Boundary-Guided Online Learning |
36
  | 🧱 Starting point | ToolWeave Stage 2 update 25 |
37
  | 🎛️ Training signal | Verified online data synthesis + multi-turn Progress Reward |
38
  | ✅ Release status | Final ToolWeave Stage 3 model |
 
32
  | Field | Details |
33
  |---|---|
34
  | 🧠 Base family | Qwen3-4B-Instruct |
35
+ | 🪜 Curriculum stage | Stage 3 — Boundary-Guided Online Reinforcement Learning |
36
  | 🧱 Starting point | ToolWeave Stage 2 update 25 |
37
  | 🎛️ Training signal | Verified online data synthesis + multi-turn Progress Reward |
38
  | ✅ Release status | Final ToolWeave Stage 3 model |