--- base_model: Qwen/Qwen3.8-Flash-Next library_name: compressed-tensors tags: - moe - expert-pruning - compressed-tensors --- # Qwen3.8-Flash-Next - 50% Expert Pruned 50% of the MoE experts pruned by router-weight magnitude using [compressed-tensors](https://github.com/vllm-project/compressed-tensors). - **Base model:** [Qwen/Qwen3.8-Flash-Next](https://huggingface.co/Qwen/Qwen3.8-Flash-Next) - **Sparsity:** 50% of routed experts removed per layer (512 -> 256 experts) - **Layers pruned:** all 48 language model layers - **MTP layer:** retained exactly as-is - **Shared experts:** untouched - **Vision tower:** untouched (dense ViT MLP, no MoE experts) ## Reproduction ```python from compressed_tensors.entrypoints.convert import convert_checkpoint, MagnitudeExpertPruner convert_checkpoint( model_stub="Qwen/Qwen3.8-Flash-Next", save_directory="Qwen3.8-Flash-Next-MEP50", converter=MagnitudeExpertPruner.from_pretrained( "Qwen/Qwen3.8-Flash-Next", router_pattern=r"language_model\.layers\.\d+\.mlp\.gate\.weight$", expert_pattern=r"language_model\.layers\.\d+\.mlp\.experts\.(gate_up_proj|down_proj)$", sparsity=0.5, ), max_workers=8, ) ```