Feature Extraction
Transformers
PyTorch
ONNX
Safetensors
English
Chinese
xlm-roberta
text-classification
mteb
Eval Results (legacy)
text-embeddings-inference
Instructions to use BAAI/bge-reranker-large with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use BAAI/bge-reranker-large with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="BAAI/bge-reranker-large")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("BAAI/bge-reranker-large") model = AutoModelForSequenceClassification.from_pretrained("BAAI/bge-reranker-large", device_map="auto") - Inference
- Notebooks
- Google Colab
- Kaggle
finetune bge-reranker 資料集準備相關問題
#23
by Rebecca19990101 - opened
你好,我正在準備微調Reranker的訓練資料集,目的是想試試看透過微調Rernker能不能進一步降低LLM生成回答時的幻覺問題。因為目前於一些看似可以當作回答參考,實際不能回答的段落,bge-reranker 仍無法太準確地進行評分。
我想嘗試使用RAG Retrieve回來的段落作為pos & neg。關於資料集我想請問一些問題:
- query跟pos跟neg是否有特定字數建議?如果pos跟neg約500會不會造成訓練效果不佳?
- query能否是問句
- 請問pos跟neg中如果有部分雜訊句子(跟問題不相關的),您建議將這些雜訊也放入資料集中嗎?還是pos必須是絕對正確的?