[general] name = "grouped-moe-gemv" license = "Apache-2.0" version = 2 backends = ["cuda"] [general.cuda] minver = "12.8" [general.hub] repo-id = "flashrt/grouped-moe-gemv" [torch] include = ["csrc"] src = [ "torch-ext/torch_binding.cpp", "torch-ext/torch_binding.h", ] [kernel.grouped_moe_gemv] backend = "cuda" depends = ["torch", "cutlass_4_0"] include = ["csrc"] cuda-minver = "12.8" cuda-capabilities = ["12.0a"] src = [ "csrc/kernels/nexn2_w4a16_gemv.cu", "csrc/kernels/nexn2_w4a16_gemv.cuh", "csrc/kernels/nexn2_moe_grouped_w4a16.cu", "csrc/kernels/nexn2_moe_grouped_w4a16.cuh", "csrc/kernels/grouped_w4a4_gemv_sm120.cu", "csrc/kernels/grouped_w4a4_gemv_sm120.cuh", "csrc/kernels/quantize_activations_nvfp4.cu", "csrc/kernels/quantize_activations_nvfp4.cuh", ] [kernel.grouped_moe_gemv_sm110] backend = "cuda" depends = ["torch", "cutlass_4_0"] include = ["csrc"] cuda-minver = "13.0" cuda-capabilities = ["11.0a"] src = [ "csrc/kernels/w4a16_edge_sm120.cu", "csrc/kernels/w4a16_edge_sm120.cuh", "csrc/kernels/fp4_e2m1_compat.cuh", "csrc/kernels/sm110_dispatch.cu", "csrc/kernels/nexn2_w4a16_gemv.cuh", "csrc/kernels/nexn2_moe_grouped_w4a16.cuh", "csrc/kernels/grouped_w4a4_gemv_sm120.cuh", "csrc/kernels/quantize_activations_nvfp4.cu", "csrc/kernels/quantize_activations_nvfp4.cuh", ] cuda-flags = [ "-DFLASHRT_W4A16_EDGE_UNROLL=2", ]