Instructions to use SamWang0405/Syncopate-AgenticRL with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use SamWang0405/Syncopate-AgenticRL with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
底座与出处链:SFT merged 底座 ×2(不可比特复现的真身,重合并实测 4.9e-4 抖动)+ SFT LoRA adapter ×2;README 结构与用法改为单仓库 subfolder 口径
e2b6e22 | license: mit | |
| base_model: Qwen/Qwen3-4B | |
| tags: | |
| - lora | |
| - peft | |
| - reinforcement-learning | |
| - agentic | |
| - verl | |
| - tool-use | |
| language: | |
| - zh | |
| # Syncopate · Async Agentic RL — 模型资产库 | |
| 多轮工具调用广告投放 Agent 的 **异步 RL 后训练**产物库。训练系统与全部实验报告在 | |
| GitHub:[ChaoyuWang04/Syncopate_Async_AgenticRL](https://github.com/ChaoyuWang04/Syncopate_Async_AgenticRL) | |
| ——本仓库存放那边 `.gitignore` 掉的**权重类资产**(PEFT adapter),文档/代码/证据 JSON 去 GitHub 看。 | |
| 栈:verl 0.8 · FSDP(DDP) · vLLM 0.12 · LoRA r32 · 4×RTX 5090(无 P2P)。 | |
| ## 资产索引 | |
| ``` | |
| bases/Qwen3-4B-sft-v13-e1/ ★★ SFT merged 底座(RL adapter 的锚;bf16 合并不可 | |
| bases/Qwen3-4B-sft-v13r2-e1/ 比特复现——实测重合并 max|Δ|=4.9e-4 > RL 信号 1.3e-5 | |
| ⇒ 这两份权重是唯一真身,一切配对评测锚于此) | |
| sft/v13 · sft/v13r2 SFT 的 LoRA adapter(出处链存档,非重建配方) | |
| cand_v13r2_e1/step_{25,50,75,100}/ ★ 晋级候选(RL 400 步全绿):任务分 vs SFT +0.186(t≈16) | |
| 峰值在 step 100–200 区间,四档留作过训回落研究 | |
| adapters/ 全部实验臂 adapter(GitHub _audit/*.json 评测的证据本体) | |
| e14c_ctrl64 E14 对照臂(sync4/0.1) | |
| e14s_s16_t01 等 E14/R2 陈旧度剂量扫描五臂(结论:杀吞吐的是同步频率非阈值) | |
| e14x_seed2/3 s16/0.1 多种子复核臂(晋级默认的最后手续) | |
| e14x_graphgate CUDA graph 精度闸单变量臂 | |
| e17a/b_kl_* KL 开关两臂(结论:砍 KL 省 15.4%、任务分无差异 ⇒ 已默认关) | |
| r1_seqis/tokenis IS 聚合口径两臂 | |
| e20f_lr1e4 lr 上限基线 | |
| ``` | |
| ## 关键数字(尺子与证据链见 GitHub E 报告) | |
| | 主题 | 数字 | 出处 | | |
| |---|---|---| | |
| | 候选 vs SFT(343 case 冻结评测配对) | **+0.186(t≈16)** | E22/candidate | | |
| | 训练吞吐(PrefixGrouper 等 14 处接线) | 端到端 **2.31×** | E26 | | |
| | 执行层收官(同步频率+CUDA graph+乒乓修理) | 单日同尺子 **12.84→9.23 s/gstep(−28%)** | E14 | | |
| | 权重同步(LoRA adapter 推送修复) | 载荷 8.4GB→252MiB(33×)· 0.97s | E22 | | |
| | serving 量化曲线(bf16→FP8→FP4 五臂) | fp8 KV:并发 **+50%**;FP4 权重对 4B 判死 | E19 §8 | | |
| ## 用法 | |
| ```python | |
| from transformers import AutoModelForCausalLM | |
| from peft import PeftModel | |
| REPO = "SamWang0405/Syncopate-AgenticRL" | |
| base = AutoModelForCausalLM.from_pretrained(REPO, subfolder="bases/Qwen3-4B-sft-v13r2-e1") | |
| model = PeftModel.from_pretrained(base, REPO, subfolder="cand_v13r2_e1/step_100") | |
| ``` | |
| vLLM serving(先下到本地再起): | |
| ```bash | |
| huggingface-cli download SamWang0405/Syncopate-AgenticRL \ | |
| --include "bases/Qwen3-4B-sft-v13r2-e1/*" "cand_v13r2_e1/step_100/*" --local-dir ./syncopate | |
| vllm serve ./syncopate/bases/Qwen3-4B-sft-v13r2-e1 \ | |
| --enable-lora --lora-modules candidate=./syncopate/cand_v13r2_e1/step_100 | |
| ``` | |
| ⚠️ 复现注意:评测配对必须用 GitHub `_audit/` 里的冻结基线与 `compare` 尺子; | |
| adapter 只在**对应底座**上有意义(`adapter_config.json` 里有记录),跨底座贴用数字作废。 | |