File size: 1,205 Bytes
23d0137 20dbb39 23d0137 20dbb39 23d0137 20dbb39 23d0137 20dbb39 23d0137 20dbb39 e82576d 6f08a42 e82576d 6f08a42 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 | ---
base_model: Qwen/Qwen3.8-Flash-Next
library_name: compressed-tensors
tags:
- moe
- expert-pruning
- compressed-tensors
---
# Qwen3.8-Flash-Next - 50% Expert Pruned
50% of the MoE experts pruned by router-weight magnitude using [compressed-tensors](https://github.com/vllm-project/compressed-tensors).
- **Base model:** [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next)
- **Sparsity:** 50% of routed experts removed per layer (512 -> 256 experts)
- **Layers pruned:** all 48 language model layers
- **MTP layer:** retained exactly as-is
- **Shared experts:** untouched
- **Vision tower:** untouched (dense ViT MLP, no MoE experts)
## Reproduction
```python
from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner
convert_checkpoint(
model_stub="Qwen/Qwen3.8-Flash-Next",
save_directory="Qwen3.8-Flash-Next-MEP50",
converter=MagnitudeExpertPruner.from_pretrained(
"Qwen/Qwen3.8-Flash-Next",
router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$",
expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$",
sparsity=0.5,
),
max_workers=8,
)
```
|