Syncopate-AgenticRL / README.md
SamWang0405's picture
底座与出处链:SFT merged 底座 ×2(不可比特复现的真身,重合并实测 4.9e-4 抖动)+ SFT LoRA adapter ×2;README 结构与用法改为单仓库 subfolder 口径
e2b6e22
|
Raw
History Blame Contribute Delete
3.37 kB
metadata
license: mit
base_model: Qwen/Qwen3-4B
tags:
  - lora
  - peft
  - reinforcement-learning
  - agentic
  - verl
  - tool-use
language:
  - zh

Syncopate · Async Agentic RL — 模型资产库

多轮工具调用广告投放 Agent 的 异步 RL 后训练产物库。训练系统与全部实验报告在 GitHub:ChaoyuWang04/Syncopate_Async_AgenticRL ——本仓库存放那边 .gitignore 掉的权重类资产(PEFT adapter),文档/代码/证据 JSON 去 GitHub 看。

栈:verl 0.8 · FSDP(DDP) · vLLM 0.12 · LoRA r32 · 4×RTX 5090(无 P2P)。

资产索引

bases/Qwen3-4B-sft-v13-e1/           ★★ SFT merged 底座(RL adapter 的锚;bf16 合并不可
bases/Qwen3-4B-sft-v13r2-e1/            比特复现——实测重合并 max|Δ|=4.9e-4 > RL 信号 1.3e-5
                                        ⇒ 这两份权重是唯一真身,一切配对评测锚于此)
sft/v13 · sft/v13r2                   SFT 的 LoRA adapter(出处链存档,非重建配方)
cand_v13r2_e1/step_{25,50,75,100}/   ★ 晋级候选(RL 400 步全绿):任务分 vs SFT +0.186(t≈16)
                                        峰值在 step 100–200 区间,四档留作过训回落研究
adapters/                             全部实验臂 adapter(GitHub _audit/*.json 评测的证据本体)
  e14c_ctrl64        E14 对照臂(sync4/0.1)
  e14s_s16_t01 等    E14/R2 陈旧度剂量扫描五臂(结论:杀吞吐的是同步频率非阈值)
  e14x_seed2/3       s16/0.1 多种子复核臂(晋级默认的最后手续)
  e14x_graphgate     CUDA graph 精度闸单变量臂
  e17a/b_kl_*        KL 开关两臂(结论:砍 KL 省 15.4%、任务分无差异 ⇒ 已默认关)
  r1_seqis/tokenis   IS 聚合口径两臂
  e20f_lr1e4         lr 上限基线

关键数字(尺子与证据链见 GitHub E 报告)

主题 数字 出处
候选 vs SFT(343 case 冻结评测配对) +0.186(t≈16) E22/candidate
训练吞吐(PrefixGrouper 等 14 处接线) 端到端 2.31× E26
执行层收官(同步频率+CUDA graph+乒乓修理) 单日同尺子 12.84→9.23 s/gstep(−28%) E14
权重同步(LoRA adapter 推送修复) 载荷 8.4GB→252MiB(33×)· 0.97s E22
serving 量化曲线(bf16→FP8→FP4 五臂) fp8 KV:并发 **+50%**;FP4 权重对 4B 判死 E19 §8

用法

from transformers import AutoModelForCausalLM
from peft import PeftModel
REPO = "SamWang0405/Syncopate-AgenticRL"
base = AutoModelForCausalLM.from_pretrained(REPO, subfolder="bases/Qwen3-4B-sft-v13r2-e1")
model = PeftModel.from_pretrained(base, REPO, subfolder="cand_v13r2_e1/step_100")

vLLM serving(先下到本地再起):

huggingface-cli download SamWang0405/Syncopate-AgenticRL \
  --include "bases/Qwen3-4B-sft-v13r2-e1/*" "cand_v13r2_e1/step_100/*" --local-dir ./syncopate
vllm serve ./syncopate/bases/Qwen3-4B-sft-v13r2-e1 \
  --enable-lora --lora-modules candidate=./syncopate/cand_v13r2_e1/step_100

⚠️ 复现注意:评测配对必须用 GitHub _audit/ 里的冻结基线与 compare 尺子; adapter 只在对应底座上有意义(adapter_config.json 里有记录),跨底座贴用数字作废。