BGE-M3 Dynamic INT8

Динамически квантизованная CPU-версия модели BAAI/bge-m3.

Квантизация

  • метод: PyTorch dynamic quantization;
  • квантизованные модули: torch.nn.Linear;
  • тип параметров: torch.qint8;
  • устройство выполнения: CPU;
  • максимальная длина последовательности: 128.

Содержимое репозитория

  • bge_m3_quantized_state_dict.pt — квантованный state_dict;
  • load_quantized_model.py — скрипт восстановления модели;
  • quantization_config.json — параметры квантизации;
  • requirements.txt — зависимости.

Пример загрузки

from load_quantized_model import load_model

model = load_model()

embeddings = model.encode(
    ["Первый текст", "Второй текст"],
    batch_size=4,
    show_progress_bar=False,
    normalize_embeddings=True,
    convert_to_numpy=True,
    device="cpu",
)

print(embeddings.shape)

Важно

Checkpoint содержит только state_dict и не является автономной моделью.

При загрузке сначала создаётся исходная модель BAAI/bge-m3, затем применяется динамическая INT8-квантизация и загружается state_dict.

Модель предназначена для учебных экспериментов на CPU.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Musyysysy/bge-m3-dynamic-int8

Base model

BAAI/bge-m3
Finetuned
(518)
this model