Krea-2-Turbo-OrbitQuant-W4A4 / benchmark /a40-linear-kernel-microbench.json
WaveCut's picture
Add corrected native-size comparison and A40 diagnostics
96430e9 verified
Raw
History Blame Contribute Delete
1.1 kB
{
"model": "WaveCut/Krea-2-Turbo-OrbitQuant-W4A4",
"revision": "49e89c37f51cb394b4ee199196d9df8bcd042475",
"gpu": "NVIDIA A40",
"capability": [
8,
6
],
"torch": "2.8.0+cu128",
"layer": "transformer_blocks.0.ff.gate",
"shape": {
"rows": 16418,
"in_features": 6144,
"out_features": 16384
},
"int_mm_chunked": {
"samples_seconds": [
0.021558222826570272,
0.020911033730953932
],
"median_seconds": 0.021234628278762102,
"peak_allocated_mib": 7793.1279296875,
"activation_backend": "triton_cuda_packed_w4",
"native_w4a4_enabled": true,
"output_mean": 0.001386194839142263,
"output_std": 1.7071678638458252
},
"native_direct_packed": {
"samples_seconds": [
0.057071581948548555,
0.05693301185965538
],
"median_seconds": 0.05700229690410197,
"peak_allocated_mib": 7459.9912109375,
"activation_backend": "triton_cuda_packed_w4",
"native_w4a4_enabled": true,
"output_mean": 0.0013861971674486995,
"output_std": 1.7071678638458252
},
"direct_over_int_mm": 2.684402861015139
}