Qwen3.8-Flash-Next - 50% Expert Pruned

50% of the MoE experts pruned by router-weight magnitude using compressed-tensors.

  • Base model: Qwen/Qwen3.8-Flash-Next
  • Sparsity: 50% of routed experts removed per layer (512 -> 256 experts)
  • Layers pruned: all 48 language model layers
  • MTP layer: retained exactly as-is
  • Shared experts: untouched
  • Vision tower: untouched (dense ViT MLP, no MoE experts)

Reproduction

from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner

convert_checkpoint(
    model_stub="Qwen/Qwen3.8-Flash-Next",
    save_directory="Qwen3.8-Flash-Next-MEP50",
    converter=MagnitudeExpertPruner.from_pretrained(
        "Qwen/Qwen3.8-Flash-Next",
        router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$",
        expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$",
        sparsity=0.5,
    ),
    max_workers=8,
)
Downloads last month
-
Safetensors
Model size
118B params
Tensor type
BF16
·
I64
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for inference-optimization/Qwen3.8-Flash-Next-MEP50

Finetuned
(15)
this model