koryl's picture
Upload INT8 quantized BGE-M3 model
b258f96 verified
|
Raw
History Blame Contribute Delete
1.51 kB
---
language: ru
license: apache-2.0
tags:
- sentence-transformers
- feature-extraction
- quantization
- int8
- cpu-optimized
---
# Quantized BGE-M3 (INT8)
Это динамически квантованная (INT8) версия модели `BAAI/bge-m3`, оптимизированная для быстрого инференса на CPU.
## Особенности
- Размер весов уменьшен примерно в 2 раза.
- Скорость инференса на CPU увеличена.
- Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик).
## Использование
```python
import torch
from sentence_transformers import SentenceTransformer
# 1. Загружаем базовую архитектуру и веса на CPU
model = SentenceTransformer('BAAI/bge-m3', device='cpu')
# 2. Заменяем веса на квантованные (скачанные из этого репозитория)
# model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))
# 3. Применяем динамическую квантизацию (обязательный шаг!)
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)
# Теперь модель готова к работе
embeddings = model.encode(["Пример текста"])
```