onnx-genai-example-gemma4-e2b / performance.json
justinchuby's picture
Publish metadata-complete Gemma-4 E2B-it text decoder (fp16 CUDA): canonical inference_metadata.yaml + policies + L4/L5 parity; supersedes prior metadata-less multimodal export
23835eb verified
Raw
History Blame Contribute Delete
728 Bytes
{
"L4_target_all_positions": {
"max_abs": 0.875,
"mean_abs": 0.10214074701070786,
"top1_argmax_agree": 1.0,
"top5_overlap": 0.9733333333333334,
"mean_cosine": 0.9999542951583862,
"rows": 15,
"first_argmax_divergence_row": -1
},
"L4_target_last_position": {
"max_abs": 0.5,
"mean_abs": 0.12014371156692505,
"top1_argmax_agree": 1.0,
"top5_overlap": 1.0,
"mean_cosine": 0.9999983906745911,
"rows": 1,
"first_argmax_divergence_row": -1
},
"L5_target_greedy": {
"match_hf_32of32": true,
"decode_tok_per_s": 151.3577534174498,
"prefill_ms": 174.04913902282715,
"onnx_vram_used_mb": 21963
},
"runtime": "ONNX Runtime CUDA InferenceSession (H200)"
}