YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Qwen3-30B MoE 校准数据与 Hybrid 权重

本仓库包含用于 Qwen3-30B-A3B-Instruct 模型的 MoE(Mixture-of-Experts)相关校准数据和部分重构后的专家权重矩阵。

这些数据主要用于:

  • MoE 路由分析
  • 专家选择分布研究
  • MoE 权重压缩与重构实验
  • 推理加速相关实验

文件说明

1. MoE 校准数据

qwen3_layer0_moe_calib.pt

该文件保存了在 第 0 层 MoE 之前收集的校准数据

数据来源:

  • 使用 WikiText 数据集
  • 在模型 forward 过程中通过 forward hook 捕获

文件中包含以下内容:

字段 含义 形状
x 进入 MoE 层之前的 hidden activation [num_tokens, hidden_dim]
expert_ids 每个 token 选择的 Top-K 专家 ID [num_tokens, 8]
routing_scores Top-K 专家的路由权重 [num_tokens, 8]

说明:

Qwen3 使用 Top-8 MoE 路由机制,即每个 token 会选择 8 个专家进行计算。

该校准数据主要用于:

  • 分析专家负载分布
  • 估计专家重要性
  • MoE 压缩算法的 calibration

Hybrid Expert 权重文件

文件

model_layers_0_mlp_gate_proj_Hybrid_for_speed_test.safetensors

该文件保存了 Qwen3-30B-A3B-Instruct 模型第 0 层 MoE 中 gate projection 的压缩权重,用于推理速度测试与 MoE 压缩研究。

与原始模型不同,本文件中的专家权重并不是直接存储为稠密矩阵,而是通过 矩阵分解形式存储。


权重表示形式

每个 expert 的权重矩阵表示为:

[ W = C \times B ]

其中:

矩阵 维度
B [k, d_in]
C [d_out, k]
W [d_out, d_in]

其中:

d_in  = hidden size
d_out = expert hidden size
k     = 中间分解维度

文件中保存的是 所有 expert 的 C 和 B 矩阵

文件内部 tensor 结构如下:

expert_0_C
expert_0_B
expert_1_C
expert_1_B
...
expert_N_C
expert_N_B

每个 expert 对应一对 (C, B) 矩阵。


推理计算方式

原始线性层计算:

[ y = W x ]

由于:

[ W = C B ]

推理时计算变为:

[ y = C (B x) ]

即:

1️⃣ 先计算

z = B x

2️⃣ 再计算

y = C z

为了提升推理效率,本文件中的矩阵采用 结构化 block sparsity。

具体结构:

block size = 4 × 4

在 C 和 B 矩阵中: 若一个 4×4 block 全部为 0 则表示该 block 被剪枝

在当前配置下:

block sparsity = 4 × 4 overall compression ≈ 50%

即相比原始稠密权重:

参数量减少约 50%

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support