YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
Qwen3-30B MoE 校准数据与 Hybrid 权重
本仓库包含用于 Qwen3-30B-A3B-Instruct 模型的 MoE(Mixture-of-Experts)相关校准数据和部分重构后的专家权重矩阵。
这些数据主要用于:
- MoE 路由分析
- 专家选择分布研究
- MoE 权重压缩与重构实验
- 推理加速相关实验
文件说明
1. MoE 校准数据
qwen3_layer0_moe_calib.pt
该文件保存了在 第 0 层 MoE 之前收集的校准数据。
数据来源:
- 使用 WikiText 数据集
- 在模型 forward 过程中通过 forward hook 捕获
文件中包含以下内容:
| 字段 | 含义 | 形状 |
|---|---|---|
x |
进入 MoE 层之前的 hidden activation | [num_tokens, hidden_dim] |
expert_ids |
每个 token 选择的 Top-K 专家 ID | [num_tokens, 8] |
routing_scores |
Top-K 专家的路由权重 | [num_tokens, 8] |
说明:
Qwen3 使用 Top-8 MoE 路由机制,即每个 token 会选择 8 个专家进行计算。
该校准数据主要用于:
- 分析专家负载分布
- 估计专家重要性
- MoE 压缩算法的 calibration
Hybrid Expert 权重文件
文件
model_layers_0_mlp_gate_proj_Hybrid_for_speed_test.safetensors
该文件保存了 Qwen3-30B-A3B-Instruct 模型第 0 层 MoE 中 gate projection 的压缩权重,用于推理速度测试与 MoE 压缩研究。
与原始模型不同,本文件中的专家权重并不是直接存储为稠密矩阵,而是通过 矩阵分解形式存储。
权重表示形式
每个 expert 的权重矩阵表示为:
[ W = C \times B ]
其中:
| 矩阵 | 维度 |
|---|---|
| B | [k, d_in] |
| C | [d_out, k] |
| W | [d_out, d_in] |
其中:
d_in = hidden size
d_out = expert hidden size
k = 中间分解维度
文件中保存的是 所有 expert 的 C 和 B 矩阵。
文件内部 tensor 结构如下:
expert_0_C
expert_0_B
expert_1_C
expert_1_B
...
expert_N_C
expert_N_B
每个 expert 对应一对 (C, B) 矩阵。
推理计算方式
原始线性层计算:
[ y = W x ]
由于:
[ W = C B ]
推理时计算变为:
[ y = C (B x) ]
即:
1️⃣ 先计算
z = B x
2️⃣ 再计算
y = C z
为了提升推理效率,本文件中的矩阵采用 结构化 block sparsity。
具体结构:
block size = 4 × 4
在 C 和 B 矩阵中: 若一个 4×4 block 全部为 0 则表示该 block 被剪枝
在当前配置下:
block sparsity = 4 × 4 overall compression ≈ 50%
即相比原始稠密权重:
参数量减少约 50%