Qwen3.8-Flash-Next - 50% Expert Pruned
50% of the MoE experts pruned by router-weight magnitude using compressed-tensors.
- Base model: Qwen/Qwen3.8-Flash-Next
- Sparsity: 50% of routed experts removed per layer (512 -> 256 experts)
- Layers pruned: all 48 language model layers
- MTP layer: retained exactly as-is
- Shared experts: untouched
- Vision tower: untouched (dense ViT MLP, no MoE experts)
Reproduction
from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner
convert_checkpoint(
model_stub="Qwen/Qwen3.8-Flash-Next",
save_directory="Qwen3.8-Flash-Next-MEP50",
converter=MagnitudeExpertPruner.from_pretrained(
"Qwen/Qwen3.8-Flash-Next",
router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$",
expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$",
sparsity=0.5,
),
max_workers=8,
)
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for inference-optimization/Qwen3.8-Flash-Next-MEP50
Base model
Qwen/Qwen3.8-Flash-Next