HRM_sudoku / benchmark_results /results.json
Code2aum's picture
Upload folder using huggingface_hub
5dc80b3 verified
Raw
History Blame Contribute Delete
17.5 kB
[
{
"batch_size": 1,
"seq_len": 64,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 1,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.233289670944213,
"total_inference_latency_min_ms": 12.15283203125,
"total_inference_latency_max_ms": 12.321791648864746,
"total_inference_latency_std_ms": 0.05471266632900291,
"throughput_samples_per_sec": 81.74416096556112,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 116.29345703125,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 23.0,
"gpu_power_w": 62.07,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 1,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1864.8816029230754,
"l_level_latency_min_us": 1843.9680337905884,
"l_level_latency_max_us": 1886.2080574035645,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1861.43679022789,
"h_level_latency_min_us": 1850.3680229187012,
"h_level_latency_max_us": 1875.9679794311523,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.600086498260499,
"total_inference_latency_min_ms": 11.553088188171387,
"total_inference_latency_max_ms": 11.630592346191406,
"total_inference_latency_std_ms": 0.022018860122281114,
"throughput_samples_per_sec": 86.20625373353516,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 132.66845703125,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 9.9823999684304,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 820.2239871025085,
"triton_dram_probe_latency_us": 53.247999399900436,
"gpu_utilization_pct": 19.0,
"gpu_power_w": 90.58,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9981527981777578,
"memory_efficiency": 0.9986629635146693
},
"speedup": 1.0545860733692518,
"memory_savings_mb": -16.375,
"throughput_improvement": 1.0545860733692518
},
{
"batch_size": 1,
"seq_len": 128,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 1,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.75871524810791,
"total_inference_latency_min_ms": 12.291104316711426,
"total_inference_latency_max_ms": 13.331456184387207,
"total_inference_latency_std_ms": 0.491103465039144,
"throughput_samples_per_sec": 78.37779749401476,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 133.57763671875,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 22.0,
"gpu_power_w": 91.94,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 1,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1880.560537179311,
"l_level_latency_min_us": 1853.6959886550903,
"l_level_latency_max_us": 1905.6639671325684,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1872.9376077651978,
"h_level_latency_min_us": 1849.2159843444824,
"h_level_latency_max_us": 1890.3039693832397,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.684232091903686,
"total_inference_latency_min_ms": 11.551487922668457,
"total_inference_latency_max_ms": 11.770879745483398,
"total_inference_latency_std_ms": 0.06819341259194193,
"throughput_samples_per_sec": 85.58542762026497,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 150.07763671875,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 10.091200051829219,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 47.10400104522705,
"triton_dram_probe_latency_us": 38.94399851560593,
"gpu_utilization_pct": 14.0,
"gpu_power_w": 95.82,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9959464589076472,
"memory_efficiency": 0.9986589251294146
},
"speedup": 1.0919601003945105,
"memory_savings_mb": -16.5,
"throughput_improvement": 1.0919601003945105
},
{
"batch_size": 8,
"seq_len": 64,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 8,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.226089572906494,
"total_inference_latency_min_ms": 12.181280136108398,
"total_inference_latency_max_ms": 12.269696235656738,
"total_inference_latency_std_ms": 0.02198156350662233,
"throughput_samples_per_sec": 654.3384090468568,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 158.31396484375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 25.0,
"gpu_power_w": 100.16,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 8,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1842.8634683291118,
"l_level_latency_min_us": 1817.6000118255615,
"l_level_latency_max_us": 1919.103980064392,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1826.6352117061615,
"h_level_latency_min_us": 1815.551996231079,
"h_level_latency_max_us": 1835.8080387115479,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.43253436088562,
"total_inference_latency_min_ms": 11.369471549987793,
"total_inference_latency_max_ms": 11.523072242736816,
"total_inference_latency_std_ms": 0.04659291036998755,
"throughput_samples_per_sec": 699.7573545346668,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 175.56396484375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 9.712000098079443,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 46.08000069856644,
"triton_dram_probe_latency_us": 40.95999896526337,
"gpu_utilization_pct": 26.0,
"gpu_power_w": 104.38,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9911939995003188,
"memory_efficiency": 0.9986813194349485
},
"speedup": 1.0694120119801154,
"memory_savings_mb": -17.25,
"throughput_improvement": 1.0694120119801154
},
{
"batch_size": 8,
"seq_len": 128,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 8,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.09585280418396,
"total_inference_latency_min_ms": 12.034048080444336,
"total_inference_latency_max_ms": 12.1693115234375,
"total_inference_latency_std_ms": 0.03280009762608858,
"throughput_samples_per_sec": 661.3837097317187,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 186.99365234375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 37.0,
"gpu_power_w": 112.76,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 8,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1827.0586788654327,
"l_level_latency_min_us": 1786.8800163269043,
"l_level_latency_max_us": 1932.2880506515503,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1811.8864059448242,
"h_level_latency_min_us": 1794.7200536727905,
"h_level_latency_max_us": 1830.7520151138306,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.355580854415894,
"total_inference_latency_min_ms": 11.258879661560059,
"total_inference_latency_max_ms": 11.465632438659668,
"total_inference_latency_std_ms": 0.05902572924729382,
"throughput_samples_per_sec": 704.4994089306321,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 204.24365234375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 9.579200064763427,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 47.16800153255463,
"triton_dram_probe_latency_us": 39.93599861860275,
"gpu_utilization_pct": 33.0,
"gpu_power_w": 118.67,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9916957933009408,
"memory_efficiency": 0.9986882554925227
},
"speedup": 1.0651901438824412,
"memory_savings_mb": -17.25,
"throughput_improvement": 1.0651901438824412
},
{
"batch_size": 32,
"seq_len": 64,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 32,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.013897466659547,
"total_inference_latency_min_ms": 11.935744285583496,
"total_inference_latency_max_ms": 12.108991622924805,
"total_inference_latency_std_ms": 0.04052232974770088,
"throughput_samples_per_sec": 2663.581913263787,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 228.25927734375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 50.0,
"gpu_power_w": 137.35,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 32,
"seq_len": 64,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1848.9973326524098,
"l_level_latency_min_us": 1829.6960592269897,
"l_level_latency_max_us": 1885.4399919509888,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1829.4048011302948,
"h_level_latency_min_us": 1820.9600448608398,
"h_level_latency_max_us": 1836.0320329666138,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.482071924209595,
"total_inference_latency_min_ms": 11.442208290100098,
"total_inference_latency_max_ms": 11.52511978149414,
"total_inference_latency_std_ms": 0.022921052595205035,
"throughput_samples_per_sec": 2786.953453281283,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 247.38427734375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 9.636800037696958,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 46.08000069856644,
"triton_dram_probe_latency_us": 40.95999896526337,
"gpu_utilization_pct": 45.0,
"gpu_power_w": 162.51,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9894036994125842,
"memory_efficiency": 0.9986952672353347
},
"speedup": 1.046317907252315,
"memory_savings_mb": -19.125,
"throughput_improvement": 1.046317907252315
},
{
"batch_size": 32,
"seq_len": 128,
"baseline": {
"model_name": "HRM_Baseline",
"batch_size": 32,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 0,
"l_level_latency_min_us": 0,
"l_level_latency_max_us": 0,
"l_level_latency_std_us": 0,
"h_level_latency_mean_us": 0,
"h_level_latency_min_us": 0,
"h_level_latency_max_us": 0,
"h_level_latency_std_us": 0,
"total_inference_latency_mean_ms": 12.027006340026855,
"total_inference_latency_min_ms": 11.971232414245605,
"total_inference_latency_max_ms": 12.089983940124512,
"total_inference_latency_std_ms": 0.02667638763107568,
"throughput_samples_per_sec": 2660.678733784433,
"sram_peak_mb": 0,
"dram_peak_mb": 0,
"total_gpu_memory_mb": 292.13427734375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 0,
"sram_hit_rate": 0,
"triton_sram_probe_latency_us": 0,
"triton_dram_probe_latency_us": 0,
"gpu_utilization_pct": 84.0,
"gpu_power_w": 210.32,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0,
"memory_efficiency": 1.0
},
"tiered": {
"model_name": "HRM_Tiered",
"batch_size": 32,
"seq_len": 128,
"hidden_size": 512,
"H_cycles": 2,
"L_cycles": 2,
"H_layers": 4,
"L_layers": 4,
"num_iterations": 20,
"warmup_iterations": 5,
"l_level_latency_mean_us": 1828.7717362244923,
"l_level_latency_min_us": 1806.175947189331,
"l_level_latency_max_us": 1862.6240491867065,
"l_level_latency_std_us": 0.0,
"h_level_latency_mean_us": 1824.127995967865,
"h_level_latency_min_us": 1806.3360452651978,
"h_level_latency_max_us": 1875.7760524749756,
"h_level_latency_std_us": 0.0,
"total_inference_latency_mean_ms": 11.574174451828004,
"total_inference_latency_min_ms": 11.528096199035645,
"total_inference_latency_max_ms": 11.638784408569336,
"total_inference_latency_std_ms": 0.03262226881630495,
"throughput_samples_per_sec": 2764.7760220985765,
"sram_peak_mb": 0.0,
"dram_peak_mb": 0.0,
"total_gpu_memory_mb": 312.38427734375,
"h_l_transfer_mean_us": 0,
"l_h_transfer_mean_us": 9.51200001873076,
"sram_hit_rate": 0.0,
"triton_sram_probe_latency_us": 49.15200173854828,
"triton_dram_probe_latency_us": 40.70400074124336,
"gpu_utilization_pct": 78.0,
"gpu_power_w": 245.59,
"gpu_temperature_c": null,
"h_over_l_latency_ratio": 0.9974607327067432,
"memory_efficiency": 0.9987005384933674
},
"speedup": 1.0391243358291815,
"memory_savings_mb": -20.25,
"throughput_improvement": 1.0391243358291815
}
]