| [general] |
| name = "fp8-gemm" |
| version = 1 |
| edition = 5 |
| license = "Apache-2.0" |
| backends = ["cuda"] |
|
|
| [general.cuda] |
| minver = "12.8" |
|
|
| [general.hub] |
| repo-id = "flashrt/fp8-gemm" |
|
|
| [torch] |
| include = ["csrc"] |
| src = [ |
| "torch-ext/torch_binding.cpp", |
| "torch-ext/torch_binding.h", |
| ] |
|
|
| [kernel.fp8_gemm_sm110] |
| backend = "cuda" |
| cuda-capabilities = ["11.0a"] |
| cuda-flags = [ |
| "--expt-relaxed-constexpr", |
| "-O3", |
| "--use_fast_math", |
| ] |
| cuda-minver = "13" |
| depends = [ |
| "torch", |
| "cutlass_4_5", |
| ] |
| include = ["csrc"] |
| src = [ |
| "csrc/gemm_types_sm110.h", |
| "csrc/cutlass_sm110_fp8_gemm.cu", |
| "csrc/cutlass_sm110_fp8_gemm.cuh", |
| "csrc/cublaslt_fp8_bias_sm110.cu", |
| "csrc/cublaslt_fp8_bias_sm110.cuh", |
| ] |
|
|
| [kernel.fp8_gemm_sm89] |
| backend = "cuda" |
| cuda-capabilities = ["8.9"] |
| cuda-minver = "12.8" |
| depends = ["torch"] |
| include = ["csrc"] |
| src = [ |
| "csrc/fp8_block128_gemm_mma_sm89.cu", |
| "csrc/fp8_block128_gemm_mma_sm89.cuh", |
| "csrc/fp8_bs_gemm_device.cuh", |
| "csrc/fp8_gemv_m1_sm89.cu", |
| "csrc/fp8_gemv_m1_sm89.cuh", |
| ] |
|
|
| [kernel.fp8_gemm] |
| backend = "cuda" |
| cuda-capabilities = ["12.0a"] |
| cuda-minver = "12.8" |
| depends = [ |
| "torch", |
| "cutlass_4_0", |
| ] |
| include = ["csrc"] |
| src = [ |
| "csrc/fp8_gemv_m1_sm120.cu", |
| "csrc/fp8_gemv_m1_sm120.cuh", |
| "csrc/fp8_smallM_handtuned_sm120.cu", |
| "csrc/fp8_smallM_handtuned_sm120.cuh", |
| "csrc/fp8_smallM_handtuned_ldmatrix_sm120.cu", |
| "csrc/fp8_smallM_handtuned_ldmatrix_sm120.cuh", |
| "csrc/cutlass_sm120_block128_fp8_gemm.cu", |
| "csrc/cutlass_sm120_block128_fp8_gemm.cuh", |
| ] |
|
|