koryl's picture
Upload INT8 quantized BGE-M3 model
b258f96 verified
|
Raw
History Blame Contribute Delete
1.51 kB
metadata
language: ru
license: apache-2.0
tags:
  - sentence-transformers
  - feature-extraction
  - quantization
  - int8
  - cpu-optimized

Quantized BGE-M3 (INT8)

Это динамически квантованная (INT8) версия модели BAAI/bge-m3, оптимизированная для быстрого инференса на CPU.

Особенности

  • Размер весов уменьшен примерно в 2 раза.
  • Скорость инференса на CPU увеличена.
  • Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик).

Использование

import torch
from sentence_transformers import SentenceTransformer

# 1. Загружаем базовую архитектуру и веса на CPU
model = SentenceTransformer('BAAI/bge-m3', device='cpu')

# 2. Заменяем веса на квантованные (скачанные из этого репозитория)
# model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu'))

# 3. Применяем динамическую квантизацию (обязательный шаг!)
model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8)

# Теперь модель готова к работе
embeddings = model.encode(["Пример текста"])