magiccodingman's picture
Upload folder using huggingface_hub
16121ff verified
|
Raw
History Blame Contribute Delete
1.02 kB
metadata
license: apache-2.0
language:
  - en
  - zh
library_name: sentence-transformers
pipeline_tag: sentence-similarity
base_model: infgrad/Jasper-Token-Compression-600M
tags:
  - sentence-transformers
  - feature-extraction
  - sentence-similarity
  - text-embeddings
  - embeddings
  - retrieval
  - mteb
  - qwen3
  - onnx
  - onnxruntime
  - cpu
  - int-8

Jasper Token Compression 600M — ONNX INT-8

ONNX export of infgrad/Jasper-Token-Compression-600M.

Precision: INT8 (Dynamic)
Quantization: Dynamic INT8
Model size: 583.56 MiB

Dynamic INT8 ONNX export optimized for fast CPU inference. This is a text embedding model.

Benchmarks

Tokens Median latency Tokens/s
32 44.362 ms 721.3
128 48.609 ms 2,633.3
512 63.180 ms 8,103.8
1024 84.619 ms 12,101.3

Fidelity

Median cosine similarity versus FP32: ~0.988–0.992.

Attribution

Original model: infgrad/Jasper-Token-Compression-600M