Sentence Similarity
sentence-transformers
Safetensors
Korean
English
bert
embedding
retrieval
mteb
korean
Instructions to use NGA-KR/ja-embed-sts with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use NGA-KR/ja-embed-sts with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("NGA-KR/ja-embed-sts") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
NGA-KR/ja-embed-sts
Korean dense text embedding model (337M parameters), fine-tuned from cl-nagoya/ruri-large-v2.
Training data (zero-shot on MTEB(kor))
This model was trained only on public English retrieval datasets โ no Korean benchmark train splits were used:
- JSTS
- JSICK
Consequently, the model is 100% zero-shot on MTEB(kor, v1) and MTEB(kor, v2) (declared via training_datasets in the MTEB model metadata).
Usage
from sentence_transformers import SentenceTransformer
model = SentenceTransformer("NGA-KR/ja-embed-sts")
q = model.encode(["์ ์ธ ๊ณ์ฝ์์ ๊ธฐ๊ฐ์ ์ ์ผ์ผ๋ฉด ์ผ๋ง ๋์ ์ ํจํด?"], prompt_name="query")
d = model.encode(["์๋์ฐจ ๊ณ์ฝ ๊ธฐ๊ฐ์ ์ ํ์ง ์์ ๊ฒฝ์ฐ 2๋
์ผ๋ก ๋ณธ๋ค..."], prompt_name="document")
print(q @ d.T)
Prompts are stored in the model config: query: for queries, passage: for documents.
Evaluation
Evaluated with mteb on MTEB(kor, v2) (20 tasks). See the MTEB leaderboard entry for full per-task scores.
Training details
- Base: cl-nagoya/ruri-large-v2 (ModernBERT-style Korean encoder, mean pooling, L2-normalised)
- Objective: contrastive (CachedMultipleNegativesRankingLoss), in-batch + 1 hard negative
- Batch 2048, lr 2e-5, cosine schedule, 1 epoch, bf16
- Max sequence length: 512
License
apache-2.0. Base model license: see cl-nagoya/ruri-large-v2.
- Downloads last month
- -
Model tree for NGA-KR/ja-embed-sts
Base model
tohoku-nlp/bert-large-japanese-v2 Finetuned
cl-nagoya/ruri-pt-large-v2 Finetuned
cl-nagoya/ruri-large-v2