--- language: ru license: apache-2.0 tags: - sentence-transformers - feature-extraction - quantization - int8 - cpu-optimized --- # Quantized BGE-M3 (INT8) Это динамически квантованная (INT8) версия модели `BAAI/bge-m3`, оптимизированная для быстрого инференса на CPU. ## Особенности - Размер весов уменьшен примерно в 2 раза. - Скорость инференса на CPU увеличена. - Качество эмбеддингов сохраняется на уровне, близком к исходной модели (незначительная деградация метрик). ## Использование ```python import torch from sentence_transformers import SentenceTransformer # 1. Загружаем базовую архитектуру и веса на CPU model = SentenceTransformer('BAAI/bge-m3', device='cpu') # 2. Заменяем веса на квантованные (скачанные из этого репозитория) # model.load_state_dict(torch.load('pytorch_model.bin', map_location='cpu')) # 3. Применяем динамическую квантизацию (обязательный шаг!) model = torch.quantization.quantize_dynamic(model, {torch.nn.Linear}, dtype=torch.qint8) # Теперь модель готова к работе embeddings = model.encode(["Пример текста"]) ```