| [general] |
| name = "grouped-moe-gemv" |
| license = "Apache-2.0" |
| version = 2 |
| backends = ["cuda"] |
|
|
| [general.cuda] |
| minver = "12.8" |
|
|
| [general.hub] |
| repo-id = "flashrt/grouped-moe-gemv" |
|
|
| [torch] |
| include = ["csrc"] |
| src = [ |
| "torch-ext/torch_binding.cpp", |
| "torch-ext/torch_binding.h", |
| ] |
|
|
| [kernel.grouped_moe_gemv] |
| backend = "cuda" |
| depends = ["torch", "cutlass_4_0"] |
| include = ["csrc"] |
| cuda-minver = "12.8" |
| cuda-capabilities = ["12.0a"] |
| src = [ |
| "csrc/kernels/nexn2_w4a16_gemv.cu", |
| "csrc/kernels/nexn2_w4a16_gemv.cuh", |
| "csrc/kernels/nexn2_moe_grouped_w4a16.cu", |
| "csrc/kernels/nexn2_moe_grouped_w4a16.cuh", |
| "csrc/kernels/grouped_w4a4_gemv_sm120.cu", |
| "csrc/kernels/grouped_w4a4_gemv_sm120.cuh", |
| "csrc/kernels/quantize_activations_nvfp4.cu", |
| "csrc/kernels/quantize_activations_nvfp4.cuh", |
| ] |
|
|
| [kernel.grouped_moe_gemv_sm110] |
| backend = "cuda" |
| depends = ["torch", "cutlass_4_0"] |
| include = ["csrc"] |
| cuda-minver = "13.0" |
| cuda-capabilities = ["11.0a"] |
| src = [ |
| "csrc/kernels/w4a16_edge_sm120.cu", |
| "csrc/kernels/w4a16_edge_sm120.cuh", |
| "csrc/kernels/fp4_e2m1_compat.cuh", |
| "csrc/kernels/sm110_dispatch.cu", |
| "csrc/kernels/nexn2_w4a16_gemv.cuh", |
| "csrc/kernels/nexn2_moe_grouped_w4a16.cuh", |
| "csrc/kernels/grouped_w4a4_gemv_sm120.cuh", |
| "csrc/kernels/quantize_activations_nvfp4.cu", |
| "csrc/kernels/quantize_activations_nvfp4.cuh", |
| ] |
| cuda-flags = [ |
| "-DFLASHRT_W4A16_EDGE_UNROLL=2", |
| ] |
|
|