julyanghar commited on
Commit
a896197
·
verified ·
1 Parent(s): dd530f3

phase2-12k-3ep: Qwen3-32B summary-domain EAGLE-3 draft head (TP4@12288, 3ep, dual-trim)

Browse files
.gitattributes CHANGED
@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ data/train_main.jsonl filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,54 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # phase2-12k-3ep:二期域训 EAGLE-3 权重 + 训练数据(自包含)
2
+
3
+ 二期最终产出:Qwen3-32B 的 summary 域训 EAGLE-3 draft head,TP4@12288 + 双裁剪,3 epoch。
4
+
5
+ ## 内容
6
+
7
+ | 文件 | 说明 |
8
+ |---|---|
9
+ | `model.safetensors` | 权重本体(1.4G,= runs/qwen3-32b-summary-12k-trim-r1/epoch_2_step_5760) |
10
+ | `config.json` | 训练时的 draft config |
11
+ | `config_deploy.json` | 部署用 config(= AngelSlim config,避开新 transformers rope 解析差异) |
12
+ | `training_state.pt` | 优化器/scheduler 状态(续训用) |
13
+ | `data/train_main.jsonl` | **训练数据**,7,681 条(指纹 3a1078d2,zh 3935/en 3725/mix 21,≤12288 token) |
14
+ | `data/heldout.jsonl` | 评测集(46 条,15 个 drbench topic,题面隔离,从未进训练) |
15
+ | `data/heldout_topics_locked.json` | 锁定的 heldout topic 清单(保证一期/二期评测可比) |
16
+ | `data/manifest.json` | 数据统计 |
17
+
18
+ ## 谱系
19
+
20
+ - **起点**:AngelSlim/Qwen3-32B_eagle3(腾讯开源第三方 head,warm-start,非本产出);
21
+ - **一期**:TP4@8192,3,607 条,2 epoch(见 runs/qwen3-32b-summary-8k-tp4-r1);
22
+ - **二期(本目录)**:TP4@12288,7,681 条(监督 ×2.08),3 epoch,双裁剪省 7.05GiB/卡解锁 12288。
23
+
24
+ ## 训练配置(复现)
25
+
26
+ ```
27
+ --target-model-path /data/yilin/huggingface/Qwen3-32B
28
+ --ckpt-dir /data/yilin/huggingface/Qwen3-32B-eagle3-angelslim # warm-start
29
+ --train-data-path data/train_main.jsonl
30
+ --chat-template qwen3-instruct
31
+ --target-model-backend sglang --tp-size 4 --sglang-mem-fraction-static 0.44
32
+ --max-length 12288 --ttt-length 3 --attention-backend flex_attention
33
+ --shard-target-output --trim-loss-positions --trim-prompt-rows # 双裁剪
34
+ --learning-rate 2e-5 --num-epochs 3 --warmup-ratio 0.05 --max-grad-norm 0.5
35
+ --draft-accumulation-steps 16 --save-interval 120
36
+ ```
37
+
38
+ 训练框架:SpecForge 本地 fork(四补丁 ropebuf/chunk-acc/nocompile/ckpt-norm + 位置维裁剪 A+B-i),见 exp-docx/eagle-spec-decode/phase2-trimming-work.md。
39
+
40
+ ## 部署(vLLM 零转换)
41
+
42
+ ```
43
+ vllm serve /data/yilin/huggingface/Qwen3-32B --tensor-parallel-size 4 \
44
+ --speculative-config '{"method":"eagle3","model":"<本目录>","num_speculative_tokens":3}'
45
+ ```
46
+ (部署时用 config_deploy.json 替换 config.json,或直接指向本目录——已含可加载 config)
47
+
48
+ ## 训练指标
49
+
50
+ 逐 epoch 训练 acc:0.44 → 0.47 → 0.48;全程 0 OOM。
51
+
52
+ ## 评测结果
53
+
54
+ 见 exp-docx/paper-submission/experiment-data-summary.md。核心:DRGym 英文长 prompt 上干净 held-out **1.303×**(碾压 suffix 0.976× 净减速);DRBench 中文短 prompt 上 1.11%/18.4%(输 suffix)。
config.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLMEagle3"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 151643,
8
+ "eos_token_id": 151645,
9
+ "head_dim": 80,
10
+ "hidden_act": "silu",
11
+ "hidden_size": 5120,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 25600,
14
+ "max_position_embeddings": 40960,
15
+ "max_window_layers": 64,
16
+ "model_type": "llama",
17
+ "num_attention_heads": 64,
18
+ "num_hidden_layers": 1,
19
+ "num_key_value_heads": 8,
20
+ "rms_norm_eps": 1e-06,
21
+ "rope_scaling": null,
22
+ "rope_theta": 1000000,
23
+ "sliding_window": null,
24
+ "tie_word_embeddings": false,
25
+ "torch_dtype": "bfloat16",
26
+ "transformers_version": "4.51.0",
27
+ "use_cache": true,
28
+ "use_sliding_window": false,
29
+ "vocab_size": 151936,
30
+ "draft_vocab_size": 32000
31
+ }
config_deploy.json ADDED
@@ -0,0 +1,31 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLMEagle3"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 151643,
8
+ "eos_token_id": 151645,
9
+ "head_dim": 80,
10
+ "hidden_act": "silu",
11
+ "hidden_size": 5120,
12
+ "initializer_range": 0.02,
13
+ "intermediate_size": 25600,
14
+ "max_position_embeddings": 40960,
15
+ "max_window_layers": 64,
16
+ "model_type": "llama",
17
+ "num_attention_heads": 64,
18
+ "num_hidden_layers": 1,
19
+ "num_key_value_heads": 8,
20
+ "rms_norm_eps": 1e-06,
21
+ "rope_scaling": null,
22
+ "rope_theta": 1000000,
23
+ "sliding_window": null,
24
+ "tie_word_embeddings": false,
25
+ "torch_dtype": "bfloat16",
26
+ "transformers_version": "4.51.0",
27
+ "use_cache": true,
28
+ "use_sliding_window": false,
29
+ "vocab_size": 151936,
30
+ "draft_vocab_size": 32000
31
+ }
config_train.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "LlamaForCausalLMEagle3"
4
+ ],
5
+ "attention_bias": false,
6
+ "attention_dropout": 0.0,
7
+ "bos_token_id": 151643,
8
+ "draft_vocab_size": 32000,
9
+ "dtype": "bfloat16",
10
+ "eos_token_id": 151645,
11
+ "head_dim": 80,
12
+ "hidden_act": "silu",
13
+ "hidden_size": 5120,
14
+ "initializer_range": 0.02,
15
+ "intermediate_size": 25600,
16
+ "max_position_embeddings": 40960,
17
+ "max_window_layers": 64,
18
+ "mlp_bias": false,
19
+ "model_type": "llama",
20
+ "num_attention_heads": 64,
21
+ "num_hidden_layers": 1,
22
+ "num_key_value_heads": 8,
23
+ "pad_token_id": null,
24
+ "pretraining_tp": 1,
25
+ "rms_norm_eps": 1e-06,
26
+ "rope_parameters": {
27
+ "rope_theta": 1000000,
28
+ "rope_type": "default"
29
+ },
30
+ "sliding_window": null,
31
+ "tie_word_embeddings": false,
32
+ "transformers_version": "5.8.1",
33
+ "use_cache": true,
34
+ "use_sliding_window": false,
35
+ "vocab_size": 151936
36
+ }
data/heldout.jsonl ADDED
The diff for this file is too large to render. See raw diff
 
data/heldout_topics_locked.json ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [
2
+ "What specific genetic or physiological adaptations enable certain bird species to adjust their migration routes in response to climate change or habitat loss?",
3
+ "中国中产阶层的收入和资产分布是否存在显著的城乡差异?具体数据如何?",
4
+ "中国中产阶层的负债水平如何影响其实际财务状况和消费行为?是否存在地域或代际差异?",
5
+ "在中西部地区,中产阶层的形成面临哪些结构性障碍(如教育、职业、收入等),如何通过政策干预促进其发展?",
6
+ "在当前经济环境下,中国中产阶层的负债水平和财务稳定性是否正在下降?",
7
+ "在科技金融、绿色金融、养老金融等新兴领域中,哪些细分赛道在政策支持和市场需求的双重驱动下最具投资潜力?",
8
+ "在绿色金融和养老金融成为银行业战略性增长极的背景下,哪些细分领域(如绿色信贷、绿色债券、碳金融产品)最具增长潜力?",
9
+ "在量子计算与人工智能融合领域,哪些团队的算法设计和实验验证最有可能在工业界(如金融、医药、物流)实现实际应用落地?",
10
+ "如何在AI心理咨询系统中实现数据隐私保护与伦理治理,以增强用户信任并确保服务的公平性?",
11
+ "如何量化800V高压平台与碳化硅电驱技术在不同动力系统(如纯电、增程、插混)中的成本与性能临界点?",
12
+ "当前材料数据库在规模、一致性和可访问性方面存在哪些具体限制?如何构建一个全面的‘材料大数据库’以支持更广泛的机器学习模型训练?",
13
+ "艺术生如何通过跨学科合作、新兴行业参与及自主创业等方式突破传统就业领域,实现多元化职业发展?",
14
+ "请汇总具身智能代表性公司的商业化进展、融资情况以及核心团队背景,分析其市场竞争力和未来潜力。",
15
+ "金融科技如何具体赋能投行、PE和固收等传统金融业务,提升其效率和竞争力?",
16
+ "针对不同年龄段的用户,如何调整游戏难度和内容以提高用户留存率?"
17
+ ]
data/manifest.json ADDED
@@ -0,0 +1,30 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "maxlen": 12288,
3
+ "n_dedup_filtered": 7798,
4
+ "n_train_main": 7681,
5
+ "n_train_longtail": 71,
6
+ "n_heldout": 46,
7
+ "n_qtopics": 2537,
8
+ "lang_main": {
9
+ "en": 3725,
10
+ "zh": 3935,
11
+ "mix": 21
12
+ },
13
+ "heldout_topics": [
14
+ "What specific genetic or physiological adaptations enable certain bird species to adjust their migration routes in response to climate change or habitat loss?",
15
+ "中国中产阶层的收入和资产分布是否存在显著的城乡差异?具体数据如何?",
16
+ "中国中产阶层的负债水平如何影响其实际财务状况和消费行为?是否存在地域或代际差异?",
17
+ "在中西部地区,中产阶层的形成面临哪些结构性障碍(如教育、职业、收入等),如何通过政策干预促进其发展?",
18
+ "在当前经济环境下,中国中产阶层的负债水平和财务稳定性是否正在下降?",
19
+ "在科技金融、绿色金融、养老金融等新兴领域中,哪些细分赛道在政策支持和市场需求的双重驱动下最具投资潜力?",
20
+ "在绿色金融和养老金融成为银行业战略性增长极的背景下,哪些细分领域(如绿色信贷、绿色债券、碳金融产品)最具增长潜力?",
21
+ "在量子计算与人工智能融合领域,哪些团队的算法设计和实验验证最有可能在工业界(如金融、医药、物流)实现实际应用落地?",
22
+ "如何在AI心理咨询系统中实现数据隐私保护与伦理治理,以增强用户信任并确保服务的公平性?",
23
+ "如何量化800V高压平台与碳化硅电驱技术在不同动力系统(如纯电、增程、插混)中的成本与性能临界点?",
24
+ "当前材料数据库在规模、一致性和可访问性方面存在哪些具体限制?如何构建一个全面的‘材料大数据库’以支持更广泛的机器学习模型训练?",
25
+ "艺术生如何通过跨学科合作、新兴行业参与及自主创业等方式突破传统就业领域,实现多元化职业发展?",
26
+ "请汇总具身智能代表性公司的商业化进展、融资情况以及核心团队背景,分析其市场竞争力和未来潜力。",
27
+ "金融科技如何具体赋能投行、PE和固收等传统金融业务,提升其效率和竞争力?",
28
+ "针对不同年龄段的用户,如何调整游戏难度和内容以提高用户留存率?"
29
+ ]
30
+ }
data/train_main.jsonl ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:41b3be540729541478b7cc02a53c1dfa08f828876f9ecc70b36af062d7c900d3
3
+ size 270758265
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:927d74202e2b6c396394466311556569c5e5fb6df57274cff9d1b70ad0ad3169
3
+ size 1455349624
training_state.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:64af6098711bd44f9d749091a3b2d49a2b4c9e92f8ad10ef85e9caa979e044ef
3
+ size 4439