Ling-3.0-tiny-oQ8e / README.md
djrsystemservices's picture
Upload Ling-3.0-tiny-oQ8e via oMLX
ca2fe57 verified
|
Raw
History Blame Contribute Delete
1.32 kB
metadata
library_name: mlx
base_model: inclusionAI/Ling-3.0-tiny
license: mit
pipeline_tag: text-generation
tags:
  - mlx
  - omlx
  - oqe
  - quantized

Ling-3.0-tiny-oQ8e

This is an oQ8e MLX conversion produced with oMLX.

Source and credit

Please follow the original model's license, acceptable-use policy, and attribution requirements.

Conversion

  • Quantization: oQ8e (enhanced=True)
  • Importance calibration: imatrix, 128 samples × 512 tokens
  • oMLX version: 0.6.0.dev1

oQe uses an imatrix sensitivity calibration to assign precision selectively, rather than applying a uniform bit-width to every tensor. The generated oq_imatrix_report.json records the resulting quantization allocation.

python run_oqe_conversion.py Ling-3.0-tiny-bf16 --models-dir /path/to/models --oq-level 8.0 --imatrix-samples 128 --imatrix-seq-length 512 --source-repo https://huggingface.co/inclusionAI/Ling-3.0-tiny

Files

  • model*.safetensors: quantized MLX weights
  • model.safetensors.index.json: shard index
  • config.json: model configuration
  • oq_imatrix_report.json: imatrix calibration and quantization report