Feature Extraction
sentence-transformers
PyTorch
Russian
xlm-roberta
quantization
int8
cpu-optimized
text-embeddings-inference
Instructions to use koryl/bge-m3-quantized-int8 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use koryl/bge-m3-quantized-int8 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("koryl/bge-m3-quantized-int8") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
| language: ru | |
| license: apache-2.0 | |
| tags: | |
| - sentence-transformers | |
| - feature-extraction | |
| - quantization | |
| - int8 | |
| - cpu-optimized | |
| # Quantized BGE-M3 (INT8) | |
| Это динамически квантованная (INT8) версия модели `BAAI/bge-m3`, оптимизированная для быстрого инференса на CPU. | |
| ## Особенности | |
| - Размер весов уменьшен примерно в 2 раза. | |
| - Скорость инференса на CPU увеличена. | |
| - Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик). | |
| ## Использование | |
| ```python | |
| import torch | |
| from sentence_transformers import SentenceTransformer | |
| # 1. Загружаем базовую архитектуру и веса на CPU | |
| model = SentenceTransformer('BAAI/bge-m3', device='cpu') | |
| # 2. Заменяем веса на квантованные (скачанные из этого репозитория) | |
| # model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu')) | |
| # 3. Применяем динамическую квантизацию (обязательный шаг!) | |
| model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8) | |
| # Теперь модель готова к работе | |
| embeddings = model.encode(["Пример текста"]) | |
| ``` | |