Add unified prefill+token-step decoder graph (fp16, weight-deduplicated) 0b8ed45 verified aufklarer commited on Jun 14
text_prefill INT8: symmetric activations (TRT EP compatible) 54f1f77 verified aufklarer commited on Jun 12
text_prefill INT8: switch to QDQ (TRT-friendly), drop MatMulNBits sidecar f89bf98 verified aufklarer commited on Jun 12
LM graphs: fp16-weight/fp32-compute defaults + MatMulNBits int8 variants, replacing dynamic-INT8 beb97b9 verified aufklarer commited on Jun 10
token-step INT8: MatMulNBits weight-only (block=32, fp32 accum) replacing dynamic quant fc21f50 verified aufklarer commited on Jun 10
text-prefill INT8: MatMulNBits weight-only (block=32, fp32 accum) replacing dynamic quant 88c7ca6 verified aufklarer commited on Jun 10
voxcpm2 ONNX (INT8 weights, FP32 activations) — real-weights export 3c2e14b verified aufklarer commited on Jun 3