Ancient Language GRPO — Pilot 2 Step 100

注释与断句任务最强 checkpoint:tibetan_annotation +2.69pp。

模型信息

  • 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
  • 训练方法: GRPO + LoRA rank=64
  • Reward: BLEU-2 + BERTScore (batched)
  • 训练步数: 100 / 200
  • 超参数: gen=16, temp=1.0, β=0.02, lr=2e-6

训练 Bucket (6 个)

Bucket 任务 训练样本数 test_final_new Δ
tibetan__annotation 注释 5,273 +2.69pp
traditional_mongolian__annotation 注释 2,403 +0.36pp
xishuangbanna_dai__annotation 注释 1,823 -1.33pp
tangut__segmentation 断句 3,305 +0.25pp
zhuang__segmentation 断句 222 +1.24pp
uyghur__restoration 修复 4,335 +0.98pp

总训练数据: 30,113 samples

评测结果 (sacrebleu sentence-BLEU-2, 0-100)

Bucket Baseline This Model Δ
tibetan / annotation 61.09 63.78 +2.69pp
zhuang / segmentation 66.67 67.91 +1.24pp
uyghur / restoration 89.04 90.02 +0.98pp
uyghur / translation 31.88 32.22 +0.34pp
traditional_mongolian / annotation 59.65 60.01 +0.36pp
tangut / segmentation 84.72 84.97 +0.25pp

最佳用途: 注释和断句任务(尤其是藏文注释)

与 Pilot 3 的区别

参数 Pilot 2 (本模型) Pilot 3
β (KL penalty) 0.02 (更保守) 0.01 (更探索)
Bucket 数 6 10
翻译 bucket 4 个
最大单 bucket 提升 +2.69pp +1.54pp
特点 annotation/segmentation 专精 覆盖广、translation 涨点

β=0.02 对注释/断句/修复类任务更有效(这些任务需要保守探索),而翻译任务需要 β=0.01 的更激进探索。

使用方式

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot2-step100")
Downloads last month
29
Safetensors
Model size
15B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MooreMuaMu/ancient-rl-grpo-pilot2-step100

Finetuned
(3)
this model