KURE-v1 ONNX (INT8)

nlpai-lab/KURE-v1 (BGE-M3 ν•œκ΅­μ–΄ νŒŒμΈνŠœλ‹)의 ONNX INT8 λ³€ν™˜λ³Έ. μ˜¨λ””λ°”μ΄μŠ€(μ—£μ§€) ν•œκ΅­μ–΄ μ˜λ―Έκ²€μƒ‰ μž„λ² λ”μš©.

μŠ€νŽ™

  • μ–‘μžν™”: int8 동적 μ–‘μžν™” κ°€μ€‘μΉ˜ + fp32 좜λ ₯ (onnxruntime.quantization.quantize_dynamic, QInt8). ~568MB.
  • κ·Έλž˜ν”„: opset 17, XLM-RoBERTa.
  • μž…λ ₯: input_ids, attention_mask (2-input, 동적 batch/seq). 좜λ ₯: last_hidden_state [batch, seq, 1024].
  • 풀링: λͺ¨λΈμ€ last_hidden_state 만 좜λ ₯ β€” 풀링/μ •κ·œν™”(masked mean pool + L2)λŠ” μ†ŒλΉ„μΈ‘μ—μ„œ μˆ˜ν–‰. 1024-dim.
  • ν† ν¬λ‚˜μ΄μ €: XLM-R SentencePiece (sentencepiece.bpe.model 동봉 β€” xlm-roberta-large/BGE-M3 와 동일, sha256 cfc8146a…).

생성 방법 (μž¬ν˜„)

python export_embedder_onnx.py --model nlpai-lab/KURE-v1 --out ./kure-v1 --dtype int8

torch.onnx.export(legacy, eager attention) β†’ quantize_dynamic(QInt8). μž…μΆœλ ₯ 이름은 μ†ŒλΉ„ C++ μž„λ² λ” 계약 κ³ μ •.

λΌμ΄μ„ μŠ€

원본 nlpai-lab/KURE-v1 (MIT) 의 νŒŒμƒ. MIT, μ›μ €μž‘μž ν‘œκΈ°.

Downloads last month
9
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for LaraAI-Labs/KURE-v1-onnx-int8

Base model

BAAI/bge-m3
Quantized
(4)
this model