grouped-moe-gemv / build.toml
liangsu9988's picture
Add native SM110 backend and validation
4a45a53 verified
Raw
History Blame
1.39 kB
[general]
name = "grouped-moe-gemv"
license = "Apache-2.0"
version = 2
backends = ["cuda"]
[general.cuda]
minver = "12.8"
[general.hub]
repo-id = "flashrt/grouped-moe-gemv"
[torch]
include = ["csrc"]
src = [
"torch-ext/torch_binding.cpp",
"torch-ext/torch_binding.h",
]
[kernel.grouped_moe_gemv]
backend = "cuda"
depends = ["torch", "cutlass_4_0"]
include = ["csrc"]
cuda-minver = "12.8"
cuda-capabilities = ["12.0a"]
src = [
"csrc/kernels/nexn2_w4a16_gemv.cu",
"csrc/kernels/nexn2_w4a16_gemv.cuh",
"csrc/kernels/nexn2_moe_grouped_w4a16.cu",
"csrc/kernels/nexn2_moe_grouped_w4a16.cuh",
"csrc/kernels/grouped_w4a4_gemv_sm120.cu",
"csrc/kernels/grouped_w4a4_gemv_sm120.cuh",
"csrc/kernels/quantize_activations_nvfp4.cu",
"csrc/kernels/quantize_activations_nvfp4.cuh",
]
[kernel.grouped_moe_gemv_sm110]
backend = "cuda"
depends = ["torch", "cutlass_4_0"]
include = ["csrc"]
cuda-minver = "13.0"
cuda-capabilities = ["11.0a"]
src = [
"csrc/kernels/w4a16_edge_sm120.cu",
"csrc/kernels/w4a16_edge_sm120.cuh",
"csrc/kernels/fp4_e2m1_compat.cuh",
"csrc/kernels/sm110_dispatch.cu",
"csrc/kernels/nexn2_w4a16_gemv.cuh",
"csrc/kernels/nexn2_moe_grouped_w4a16.cuh",
"csrc/kernels/grouped_w4a4_gemv_sm120.cuh",
"csrc/kernels/quantize_activations_nvfp4.cu",
"csrc/kernels/quantize_activations_nvfp4.cuh",
]
cuda-flags = [
"-DFLASHRT_W4A16_EDGE_UNROLL=2",
]