MauroPello/reasoning-gym-verl-datasets
Viewer • Updated • 214k • 58
Qwen3-1.7B-RL-final is a reinforcement learning (RL) post-trained version of Qwen/Qwen3-1.7B. It is optimized for multilingual reasoning, mathematics, and algorithmic problem-solving.
This model was trained using the veRL framework with GRPO (Group Relative Policy Optimization) on procedural datasets generated by the Reasoning Gym (r-gym) framework.
rg_reward.py:compute_score)reasoning-gym containing multiple algorithmic and logic tasks across multiple languages, available at MauroPello/reasoning-gym-verl-datasets. The training set was dynamically interleaved across tasks and languages to maintain a balanced data distribution.1e-62564096819220.001We evaluated the model against the base Qwen/Qwen3-1.7B across several benchmarks, showing substantial improvements in reasoning accuracy, particularly on the Reasoning Gym validation split and held-out validation tasks/languages.
| Benchmark / Dataset | Base model Accuracy | RL model Accuracy | Absolute Improvement |
|---|---|---|---|
Reasoning Gym Validation Split (val.parquet) |
35.29% | 50.51% | +15.22% |
Held Out Languages (Dutch nl, Turkish tr) |
30.20% | 36.60% | +6.40% |
| Held Out Tasks | 37.88% | 40.29% | +2.41% |
| MMLU Pro Lite (Multilingual subset) | 38.48% | 38.97% | +0.49% |
| Polymath (Multilingual Mathematics) | 33.24% | 33.44% | +0.20% |