Publish metadata-complete Gemma-4 E2B-it text decoder (fp16 CUDA): canonical inference_metadata.yaml + policies + L4/L5 parity; supersedes prior metadata-less multimodal export
23835eb verified | { | |
| "L4_target_all_positions": { | |
| "max_abs": 0.875, | |
| "mean_abs": 0.10214074701070786, | |
| "top1_argmax_agree": 1.0, | |
| "top5_overlap": 0.9733333333333334, | |
| "mean_cosine": 0.9999542951583862, | |
| "rows": 15, | |
| "first_argmax_divergence_row": -1 | |
| }, | |
| "L4_target_last_position": { | |
| "max_abs": 0.5, | |
| "mean_abs": 0.12014371156692505, | |
| "top1_argmax_agree": 1.0, | |
| "top5_overlap": 1.0, | |
| "mean_cosine": 0.9999983906745911, | |
| "rows": 1, | |
| "first_argmax_divergence_row": -1 | |
| }, | |
| "L5_target_greedy": { | |
| "match_hf_32of32": true, | |
| "decode_tok_per_s": 151.3577534174498, | |
| "prefill_ms": 174.04913902282715, | |
| "onnx_vram_used_mb": 21963 | |
| }, | |
| "runtime": "ONNX Runtime CUDA InferenceSession (H200)" | |
| } |