File size: 1,205 Bytes
23d0137
20dbb39
 
 
 
 
 
23d0137
 
20dbb39
23d0137
20dbb39
23d0137
20dbb39
 
 
 
 
 
23d0137
20dbb39
e82576d
6f08a42
 
e82576d
6f08a42
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
---
base_model: Qwen/Qwen3.8-Flash-Next
library_name: compressed-tensors
tags:
- moe
- expert-pruning
- compressed-tensors
---

# Qwen3.8-Flash-Next - 50% Expert Pruned

50% of the MoE experts pruned by router-weight magnitude using [compressed-tensors](https://github.com/vllm-project/compressed-tensors).

- **Base model:** [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next)
- **Sparsity:** 50% of routed experts removed per layer (512 -> 256 experts)
- **Layers pruned:** all 48 language model layers
- **MTP layer:** retained exactly as-is
- **Shared experts:** untouched
- **Vision tower:** untouched (dense ViT MLP, no MoE experts)

## Reproduction

```python
from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner

convert_checkpoint(
    model_stub="Qwen/Qwen3.8-Flash-Next",
    save_directory="Qwen3.8-Flash-Next-MEP50",
    converter=MagnitudeExpertPruner.from_pretrained(
        "Qwen/Qwen3.8-Flash-Next",
        router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$",
        expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$",
        sparsity=0.5,
    ),
    max_workers=8,
)
```