Ancient Language GRPO — Pilot 2 Step 100
注释与断句任务最强 checkpoint:tibetan_annotation +2.69pp。
模型信息
- 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
- 训练方法: GRPO + LoRA rank=64
- Reward: BLEU-2 + BERTScore (batched)
- 训练步数: 100 / 200
- 超参数: gen=16, temp=1.0, β=0.02, lr=2e-6
训练 Bucket (6 个)
| Bucket | 任务 | 训练样本数 | test_final_new Δ |
|---|---|---|---|
| tibetan__annotation | 注释 | 5,273 | +2.69pp ✅ |
| traditional_mongolian__annotation | 注释 | 2,403 | +0.36pp |
| xishuangbanna_dai__annotation | 注释 | 1,823 | -1.33pp |
| tangut__segmentation | 断句 | 3,305 | +0.25pp |
| zhuang__segmentation | 断句 | 222 | +1.24pp ✅ |
| uyghur__restoration | 修复 | 4,335 | +0.98pp ✅ |
总训练数据: 30,113 samples
评测结果 (sacrebleu sentence-BLEU-2, 0-100)
| Bucket | Baseline | This Model | Δ |
|---|---|---|---|
| tibetan / annotation | 61.09 | 63.78 | +2.69pp ✅ |
| zhuang / segmentation | 66.67 | 67.91 | +1.24pp ✅ |
| uyghur / restoration | 89.04 | 90.02 | +0.98pp ✅ |
| uyghur / translation | 31.88 | 32.22 | +0.34pp |
| traditional_mongolian / annotation | 59.65 | 60.01 | +0.36pp |
| tangut / segmentation | 84.72 | 84.97 | +0.25pp |
最佳用途: 注释和断句任务(尤其是藏文注释)
与 Pilot 3 的区别
| 参数 | Pilot 2 (本模型) | Pilot 3 |
|---|---|---|
| β (KL penalty) | 0.02 (更保守) | 0.01 (更探索) |
| Bucket 数 | 6 | 10 |
| 翻译 bucket | 无 | 4 个 |
| 最大单 bucket 提升 | +2.69pp | +1.54pp |
| 特点 | annotation/segmentation 专精 | 覆盖广、translation 涨点 |
β=0.02 对注释/断句/修复类任务更有效(这些任务需要保守探索),而翻译任务需要 β=0.01 的更激进探索。
使用方式
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100")
- Downloads last month
- 29
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for MooreMuaMu/ancient-rl-grpo-pilot2-step100
Base model
zisuh/round2-10lang-passk-15k-sft-0608