Sentence Similarity
sentence-transformers
Safetensors
Chinese
bert
feature-extraction
retrieval
meteorology
rag
text-embeddings-inference
Instructions to use nmcsitian/bge-meteo-zh-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use nmcsitian/bge-meteo-zh-v2 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("nmcsitian/bge-meteo-zh-v2") sentences = [ "那是 個快樂的人", "那是 條快樂的狗", "那是 個非常幸福的人", "今天是晴天" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Upload README.md with huggingface_hub
Browse files
README.md
CHANGED
|
@@ -13,10 +13,12 @@ tags:
|
|
| 13 |
library_name: sentence-transformers
|
| 14 |
---
|
| 15 |
|
| 16 |
-
# BGE-Meteo-zh-
|
| 17 |
|
| 18 |
面向**中文气象领域 RAG 检索**的领域自适应嵌入模型,基于 [BAAI/bge-large-zh-v1.5](https://huggingface.co/BAAI/bge-large-zh-v1.5) 微调。
|
| 19 |
|
|
|
|
|
|
|
| 20 |
## 训练配方
|
| 21 |
|
| 22 |
- 框架:FlagEmbedding,InfoNCE 对比学习(温度 τ=0.02)
|
|
@@ -34,7 +36,7 @@ library_name: sentence-transformers
|
|
| 34 |
```python
|
| 35 |
from sentence_transformers import SentenceTransformer
|
| 36 |
|
| 37 |
-
model = SentenceTransformer("nmcsitian/bge-meteo-zh-
|
| 38 |
PREFIX = "为这个句子生成表示以用于检索相关文章:"
|
| 39 |
|
| 40 |
q_emb = model.encode([PREFIX + "副热带高压对华南降水有什么影响?"], normalize_embeddings=True)
|
|
@@ -54,14 +56,19 @@ score = (q_emb @ d_emb.T)
|
|
| 54 |
|
| 55 |
## 适用边界(请务必阅读)
|
| 56 |
|
| 57 |
-
- 微调收益随**领域距离衰减**:在气象邻近领域(区域预报、行业气象服务等)大幅优于基座;在更远领域(如新能源电力预测、金融保险文本)单路向量可能**低于基座**(负迁移
|
| 58 |
-
- 生产环境建议与 BM25 做加权 RRF 融合部署:融合可
|
| 59 |
- 通用(非气象)检索任务请直接使用基座模型
|
| 60 |
|
| 61 |
-
## 消融模型
|
| 62 |
-
|
| 63 |
-
论文消融研究的 8 个对照模型(3 训练语料配置 × 3 随机种子,嵌套训练集设计)见 [nmcsitian/bge-meteo-zh-v4-ablations](https://huggingface.co/nmcsitian/bge-meteo-zh-v4-ablations)。
|
| 64 |
-
|
| 65 |
## 引用
|
| 66 |
|
| 67 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 13 |
library_name: sentence-transformers
|
| 14 |
---
|
| 15 |
|
| 16 |
+
# BGE-Meteo-zh-v2
|
| 17 |
|
| 18 |
面向**中文气象领域 RAG 检索**的领域自适应嵌入模型,基于 [BAAI/bge-large-zh-v1.5](https://huggingface.co/BAAI/bge-large-zh-v1.5) 微调。
|
| 19 |
|
| 20 |
+
**版本关系**:[nmcsitian/bge-meteo-zh](https://huggingface.co/nmcsitian/bge-meteo-zh)(未标版本号)为 v1;本仓库为 **v2 全量重训版**——训练语料 53→58 本、训练/评测划分全部重做(嵌套设计、ISBN 级零泄漏审计)、评测体系升级为 6 域留一交叉验证。v2 检索行为与 v1 有实质差异,建议在自有场景重新评测后切换。
|
| 21 |
+
|
| 22 |
## 训练配方
|
| 23 |
|
| 24 |
- 框架:FlagEmbedding,InfoNCE 对比学习(温度 τ=0.02)
|
|
|
|
| 36 |
```python
|
| 37 |
from sentence_transformers import SentenceTransformer
|
| 38 |
|
| 39 |
+
model = SentenceTransformer("nmcsitian/bge-meteo-zh-v2")
|
| 40 |
PREFIX = "为这个句子生成表示以用于检索相关文章:"
|
| 41 |
|
| 42 |
q_emb = model.encode([PREFIX + "副热带高压对华南降水有什么影响?"], normalize_embeddings=True)
|
|
|
|
| 56 |
|
| 57 |
## 适用边界(请务必阅读)
|
| 58 |
|
| 59 |
+
- 微调收益随**领域距离衰减**:在气象邻近领域(区域预报、行业气象服务等)大幅优于基座;在更远领域(如新能源电力预测、金融保险文本)单路向量可能**低于基座**(负迁移)
|
| 60 |
+
- 生产环境建议与 BM25 做加权 RRF 融合部署:融合可有效对冲远域/外部分布上的向量端劣势
|
| 61 |
- 通用(非气象)检索任务请直接使用基座模型
|
| 62 |
|
|
|
|
|
|
|
|
|
|
|
|
|
| 63 |
## 引用
|
| 64 |
|
| 65 |
+
如在研究或产品中使用本模型,请引用本仓库:
|
| 66 |
+
|
| 67 |
+
```
|
| 68 |
+
@misc{bge-meteo-zh-v2,
|
| 69 |
+
title = {BGE-Meteo-zh-v2: Domain-Adaptive Chinese Meteorological Embedding},
|
| 70 |
+
author = {nmcsitian},
|
| 71 |
+
year = {2026},
|
| 72 |
+
url = {https://huggingface.co/nmcsitian/bge-meteo-zh-v2}
|
| 73 |
+
}
|
| 74 |
+
```
|