phase2-12k-3ep: Qwen3-32B summary-domain EAGLE-3 draft head (TP4@12288, 3ep, dual-trim)
Browse files- .gitattributes +1 -0
- README.md +54 -0
- config.json +31 -0
- config_deploy.json +31 -0
- config_train.json +36 -0
- data/heldout.jsonl +0 -0
- data/heldout_topics_locked.json +17 -0
- data/manifest.json +30 -0
- data/train_main.jsonl +3 -0
- model.safetensors +3 -0
- training_state.pt +3 -0
.gitattributes
CHANGED
|
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
data/train_main.jsonl filter=lfs diff=lfs merge=lfs -text
|
README.md
ADDED
|
@@ -0,0 +1,54 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# phase2-12k-3ep:二期域训 EAGLE-3 权重 + 训练数据(自包含)
|
| 2 |
+
|
| 3 |
+
二期最终产出:Qwen3-32B 的 summary 域训 EAGLE-3 draft head,TP4@12288 + 双裁剪,3 epoch。
|
| 4 |
+
|
| 5 |
+
## 内容
|
| 6 |
+
|
| 7 |
+
| 文件 | 说明 |
|
| 8 |
+
|---|---|
|
| 9 |
+
| `model.safetensors` | 权重本体(1.4G,= runs/qwen3-32b-summary-12k-trim-r1/epoch_2_step_5760) |
|
| 10 |
+
| `config.json` | 训练时的 draft config |
|
| 11 |
+
| `config_deploy.json` | 部署用 config(= AngelSlim config,避开新 transformers rope 解析差异) |
|
| 12 |
+
| `training_state.pt` | 优化器/scheduler 状态(续训用) |
|
| 13 |
+
| `data/train_main.jsonl` | **训练数据**,7,681 条(指纹 3a1078d2,zh 3935/en 3725/mix 21,≤12288 token) |
|
| 14 |
+
| `data/heldout.jsonl` | 评测集(46 条,15 个 drbench topic,题面隔离,从未进训练) |
|
| 15 |
+
| `data/heldout_topics_locked.json` | 锁定的 heldout topic 清单(保证一期/二期评测可比) |
|
| 16 |
+
| `data/manifest.json` | 数据统计 |
|
| 17 |
+
|
| 18 |
+
## 谱系
|
| 19 |
+
|
| 20 |
+
- **起点**:AngelSlim/Qwen3-32B_eagle3(腾讯开源第三方 head,warm-start,非本产出);
|
| 21 |
+
- **一期**:TP4@8192,3,607 条,2 epoch(见 runs/qwen3-32b-summary-8k-tp4-r1);
|
| 22 |
+
- **二期(本目录)**:TP4@12288,7,681 条(监督 ×2.08),3 epoch,双裁剪省 7.05GiB/卡解锁 12288。
|
| 23 |
+
|
| 24 |
+
## 训练配置(复现)
|
| 25 |
+
|
| 26 |
+
```
|
| 27 |
+
--target-model-path /data/yilin/huggingface/Qwen3-32B
|
| 28 |
+
--ckpt-dir /data/yilin/huggingface/Qwen3-32B-eagle3-angelslim # warm-start
|
| 29 |
+
--train-data-path data/train_main.jsonl
|
| 30 |
+
--chat-template qwen3-instruct
|
| 31 |
+
--target-model-backend sglang --tp-size 4 --sglang-mem-fraction-static 0.44
|
| 32 |
+
--max-length 12288 --ttt-length 3 --attention-backend flex_attention
|
| 33 |
+
--shard-target-output --trim-loss-positions --trim-prompt-rows # 双裁剪
|
| 34 |
+
--learning-rate 2e-5 --num-epochs 3 --warmup-ratio 0.05 --max-grad-norm 0.5
|
| 35 |
+
--draft-accumulation-steps 16 --save-interval 120
|
| 36 |
+
```
|
| 37 |
+
|
| 38 |
+
训练框架:SpecForge 本地 fork(四补丁 ropebuf/chunk-acc/nocompile/ckpt-norm + 位置维裁剪 A+B-i),见 exp-docx/eagle-spec-decode/phase2-trimming-work.md。
|
| 39 |
+
|
| 40 |
+
## 部署(vLLM 零转换)
|
| 41 |
+
|
| 42 |
+
```
|
| 43 |
+
vllm serve /data/yilin/huggingface/Qwen3-32B --tensor-parallel-size 4 \
|
| 44 |
+
--speculative-config '{"method":"eagle3","model":"<本目录>","num_speculative_tokens":3}'
|
| 45 |
+
```
|
| 46 |
+
(部署时用 config_deploy.json 替换 config.json,或直接指向本目录——已含可加载 config)
|
| 47 |
+
|
| 48 |
+
## 训练指标
|
| 49 |
+
|
| 50 |
+
逐 epoch 训练 acc:0.44 → 0.47 → 0.48;全程 0 OOM。
|
| 51 |
+
|
| 52 |
+
## 评测结果
|
| 53 |
+
|
| 54 |
+
见 exp-docx/paper-submission/experiment-data-summary.md。核心:DRGym 英文长 prompt 上干净 held-out **1.303×**(碾压 suffix 0.976× 净减速);DRBench 中文短 prompt 上 1.11%/18.4%(输 suffix)。
|
config.json
ADDED
|
@@ -0,0 +1,31 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"LlamaForCausalLMEagle3"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 151643,
|
| 8 |
+
"eos_token_id": 151645,
|
| 9 |
+
"head_dim": 80,
|
| 10 |
+
"hidden_act": "silu",
|
| 11 |
+
"hidden_size": 5120,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 25600,
|
| 14 |
+
"max_position_embeddings": 40960,
|
| 15 |
+
"max_window_layers": 64,
|
| 16 |
+
"model_type": "llama",
|
| 17 |
+
"num_attention_heads": 64,
|
| 18 |
+
"num_hidden_layers": 1,
|
| 19 |
+
"num_key_value_heads": 8,
|
| 20 |
+
"rms_norm_eps": 1e-06,
|
| 21 |
+
"rope_scaling": null,
|
| 22 |
+
"rope_theta": 1000000,
|
| 23 |
+
"sliding_window": null,
|
| 24 |
+
"tie_word_embeddings": false,
|
| 25 |
+
"torch_dtype": "bfloat16",
|
| 26 |
+
"transformers_version": "4.51.0",
|
| 27 |
+
"use_cache": true,
|
| 28 |
+
"use_sliding_window": false,
|
| 29 |
+
"vocab_size": 151936,
|
| 30 |
+
"draft_vocab_size": 32000
|
| 31 |
+
}
|
config_deploy.json
ADDED
|
@@ -0,0 +1,31 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"LlamaForCausalLMEagle3"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 151643,
|
| 8 |
+
"eos_token_id": 151645,
|
| 9 |
+
"head_dim": 80,
|
| 10 |
+
"hidden_act": "silu",
|
| 11 |
+
"hidden_size": 5120,
|
| 12 |
+
"initializer_range": 0.02,
|
| 13 |
+
"intermediate_size": 25600,
|
| 14 |
+
"max_position_embeddings": 40960,
|
| 15 |
+
"max_window_layers": 64,
|
| 16 |
+
"model_type": "llama",
|
| 17 |
+
"num_attention_heads": 64,
|
| 18 |
+
"num_hidden_layers": 1,
|
| 19 |
+
"num_key_value_heads": 8,
|
| 20 |
+
"rms_norm_eps": 1e-06,
|
| 21 |
+
"rope_scaling": null,
|
| 22 |
+
"rope_theta": 1000000,
|
| 23 |
+
"sliding_window": null,
|
| 24 |
+
"tie_word_embeddings": false,
|
| 25 |
+
"torch_dtype": "bfloat16",
|
| 26 |
+
"transformers_version": "4.51.0",
|
| 27 |
+
"use_cache": true,
|
| 28 |
+
"use_sliding_window": false,
|
| 29 |
+
"vocab_size": 151936,
|
| 30 |
+
"draft_vocab_size": 32000
|
| 31 |
+
}
|
config_train.json
ADDED
|
@@ -0,0 +1,36 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"architectures": [
|
| 3 |
+
"LlamaForCausalLMEagle3"
|
| 4 |
+
],
|
| 5 |
+
"attention_bias": false,
|
| 6 |
+
"attention_dropout": 0.0,
|
| 7 |
+
"bos_token_id": 151643,
|
| 8 |
+
"draft_vocab_size": 32000,
|
| 9 |
+
"dtype": "bfloat16",
|
| 10 |
+
"eos_token_id": 151645,
|
| 11 |
+
"head_dim": 80,
|
| 12 |
+
"hidden_act": "silu",
|
| 13 |
+
"hidden_size": 5120,
|
| 14 |
+
"initializer_range": 0.02,
|
| 15 |
+
"intermediate_size": 25600,
|
| 16 |
+
"max_position_embeddings": 40960,
|
| 17 |
+
"max_window_layers": 64,
|
| 18 |
+
"mlp_bias": false,
|
| 19 |
+
"model_type": "llama",
|
| 20 |
+
"num_attention_heads": 64,
|
| 21 |
+
"num_hidden_layers": 1,
|
| 22 |
+
"num_key_value_heads": 8,
|
| 23 |
+
"pad_token_id": null,
|
| 24 |
+
"pretraining_tp": 1,
|
| 25 |
+
"rms_norm_eps": 1e-06,
|
| 26 |
+
"rope_parameters": {
|
| 27 |
+
"rope_theta": 1000000,
|
| 28 |
+
"rope_type": "default"
|
| 29 |
+
},
|
| 30 |
+
"sliding_window": null,
|
| 31 |
+
"tie_word_embeddings": false,
|
| 32 |
+
"transformers_version": "5.8.1",
|
| 33 |
+
"use_cache": true,
|
| 34 |
+
"use_sliding_window": false,
|
| 35 |
+
"vocab_size": 151936
|
| 36 |
+
}
|
data/heldout.jsonl
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/heldout_topics_locked.json
ADDED
|
@@ -0,0 +1,17 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
[
|
| 2 |
+
"What specific genetic or physiological adaptations enable certain bird species to adjust their migration routes in response to climate change or habitat loss?",
|
| 3 |
+
"中国中产阶层的收入和资产分布是否存在显著的城乡差异?具体数据如何?",
|
| 4 |
+
"中国中产阶层的负债水平如何影响其实际财务状况和消费行为?是否存在地域或代际差异?",
|
| 5 |
+
"在中西部地区,中产阶层的形成面临哪些结构性障碍(如教育、职业、收入等),如何通过政策干预促进其发展?",
|
| 6 |
+
"在当前经济环境下,中国中产阶层的负债水平和财务稳定性是否正在下降?",
|
| 7 |
+
"在科技金融、绿色金融、养老金融等新兴领域中,哪些细分赛道在政策支持和市场需求的双重驱动下最具投资潜力?",
|
| 8 |
+
"在绿色金融和养老金融成为银行业战略性增长极的背景下,哪些细分领域(如绿色信贷、绿色债券、碳金融产品)最具增长潜力?",
|
| 9 |
+
"在量子计算与人工智能融合领域,哪些团队的算法设计和实验验证最有可能在工业界(如金融、医药、物流)实现实际应用落地?",
|
| 10 |
+
"如何在AI心理咨询系统中实现数据隐私保护与伦理治理,以增强用户信任并确保服务的公平性?",
|
| 11 |
+
"如何量化800V高压平台与碳化硅电驱技术在不同动力系统(如纯电、增程、插混)中的成本与性能临界点?",
|
| 12 |
+
"当前材料数据库在规模、一致性和可访问性方面存在哪些具体限制?如何构建一个全面的‘材料大数据库’以支持更广泛的机器学习模型训练?",
|
| 13 |
+
"艺术生如何通过跨学科合作、新兴行业参与及自主创业等方式突破传统就业领域,实现多元化职业发展?",
|
| 14 |
+
"请汇总具身智能代表性公司的商业化进展、融资情况以及核心团队背景,分析其市场竞争力和未来潜力。",
|
| 15 |
+
"金融科技如何具体赋能投行、PE和固收等传统金融业务,提升其效率和竞争力?",
|
| 16 |
+
"针对不同年龄段的用户,如何调整游戏难度和内容以提高用户留存率?"
|
| 17 |
+
]
|
data/manifest.json
ADDED
|
@@ -0,0 +1,30 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"maxlen": 12288,
|
| 3 |
+
"n_dedup_filtered": 7798,
|
| 4 |
+
"n_train_main": 7681,
|
| 5 |
+
"n_train_longtail": 71,
|
| 6 |
+
"n_heldout": 46,
|
| 7 |
+
"n_qtopics": 2537,
|
| 8 |
+
"lang_main": {
|
| 9 |
+
"en": 3725,
|
| 10 |
+
"zh": 3935,
|
| 11 |
+
"mix": 21
|
| 12 |
+
},
|
| 13 |
+
"heldout_topics": [
|
| 14 |
+
"What specific genetic or physiological adaptations enable certain bird species to adjust their migration routes in response to climate change or habitat loss?",
|
| 15 |
+
"中国中产阶层的收入和资产分布是否存在显著的城乡差异?具体数据如何?",
|
| 16 |
+
"中国中产阶层的负债水平如何影响其实际财务状况和消费行为?是否存在地域或代际差异?",
|
| 17 |
+
"在中西部地区,中产阶层的形成面临哪些结构性障碍(如教育、职业、收入等),如何通过政策干预促进其发展?",
|
| 18 |
+
"在当前经济环境下,中国中产阶层的负债水平和财务稳定性是否正在下降?",
|
| 19 |
+
"在科技金融、绿色金融、养老金融等新兴领域中,哪些细分赛道在政策支持和市场需求的双重驱动下最具投资潜力?",
|
| 20 |
+
"在绿色金融和养老金融成为银行业战略性增长极的背景下,哪些细分领域(如绿色信贷、绿色债券、碳金融产品)最具增长潜力?",
|
| 21 |
+
"在量子计算与人工智能融合领域,哪些团队的算法设计和实验验证最有可能在工业界(如金融、医药、物流)实现实际应用落地?",
|
| 22 |
+
"如何在AI心理咨询系统中实现数据隐私保护与伦理治理,以增强用户信任并确保服务的公平性?",
|
| 23 |
+
"如何量化800V高压平台与碳化硅电驱技术在不同动力系统(如纯电、增程、插混)中的成本与性能临界点?",
|
| 24 |
+
"当前材料数据库在规模、一致性和可访问性方面存在哪些具体限制?如何构建一个全面的‘材料大数据库’以支持更广泛的机器学习模型训练?",
|
| 25 |
+
"艺术生如何通过跨学科合作、新兴行业参与及自主创业等方式突破传统就业领域,实现多元化职业发展?",
|
| 26 |
+
"请汇总具身智能代表性公司的商业化进展、融资情况以及核心团队背景,分析其市场竞争力和未来潜力。",
|
| 27 |
+
"金融科技如何具体赋能投行、PE和固收等传统金融业务,提升其效率和竞争力?",
|
| 28 |
+
"针对不同年龄段的用户,如何调整游戏难度和内容以提高用户留存率?"
|
| 29 |
+
]
|
| 30 |
+
}
|
data/train_main.jsonl
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:41b3be540729541478b7cc02a53c1dfa08f828876f9ecc70b36af062d7c900d3
|
| 3 |
+
size 270758265
|
model.safetensors
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:927d74202e2b6c396394466311556569c5e5fb6df57274cff9d1b70ad0ad3169
|
| 3 |
+
size 1455349624
|
training_state.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:64af6098711bd44f9d749091a3b2d49a2b4c9e92f8ad10ef85e9caa979e044ef
|
| 3 |
+
size 4439
|