magiccodingman's picture
Upload folder using huggingface_hub
879aca3 verified
|
Raw
History Blame Contribute Delete
1.04 kB
metadata
license: apache-2.0
language:
  - en
  - zh
library_name: sentence-transformers
pipeline_tag: sentence-similarity
base_model: infgrad/Jasper-Token-Compression-600M
tags:
  - sentence-transformers
  - feature-extraction
  - sentence-similarity
  - text-embeddings
  - embeddings
  - retrieval
  - mteb
  - qwen3
  - onnx
  - onnxruntime
  - cpu
  - int-4

Jasper Token Compression 600M — ONNX INT-4

ONNX export of infgrad/Jasper-Token-Compression-600M.

Precision: INT4
Quantization: INT4
Model size: 317.15 MiB

INT4 ONNX export intended for highly compact CPU/local deployment while retaining the original model's 2048-dimensional embeddings.

Benchmarks

Tokens Median latency Tokens/s
32 57.347 ms 558.0
128 65.343 ms 1,958.9
512 96.749 ms 5,292.0
1024 137.314 ms 7,457.4

Fidelity

Median cosine similarity versus FP32: ~0.981–0.986.

Attribution

Original model: infgrad/Jasper-Token-Compression-600M