| --- |
| base_model: Qwen/Qwen3.8-Flash-Next |
| library_name: compressed-tensors |
| tags: |
| - moe |
| - expert-pruning |
| - compressed-tensors |
| --- |
| |
| # Qwen3.8-Flash-Next - 50% Expert Pruned |
|
|
| 50% of the MoE experts pruned by router-weight magnitude using [compressed-tensors](https://github.com/vllm-project/compressed-tensors). |
|
|
| - **Base model:** [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) |
| - **Sparsity:** 50% of routed experts removed per layer (512 -> 256 experts) |
| - **Layers pruned:** all 48 language model layers |
| - **MTP layer:** retained exactly as-is |
| - **Shared experts:** untouched |
| - **Vision tower:** untouched (dense ViT MLP, no MoE experts) |
|
|
| ## Reproduction |
|
|
| ```python |
| from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner |
| |
| convert_checkpoint( |
| model_stub="Qwen/Qwen3.8-Flash-Next", |
| save_directory="Qwen3.8-Flash-Next-MEP50", |
| converter=MagnitudeExpertPruner.from_pretrained( |
| "Qwen/Qwen3.8-Flash-Next", |
| router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$", |
| expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$", |
| sparsity=0.5, |
| ), |
| max_workers=8, |
| ) |
| ``` |
|
|