Ling-3.0-tiny-oQ8e / README.md
djrsystemservices's picture
Upload Ling-3.0-tiny-oQ8e via oMLX
ca2fe57 verified
|
Raw
History Blame Contribute Delete
1.32 kB
---
library_name: mlx
base_model: inclusionAI/Ling-3.0-tiny
license: mit
pipeline_tag: text-generation
tags:
- mlx
- omlx
- oqe
- quantized
---
# Ling-3.0-tiny-oQ8e
This is an oQ8e MLX conversion produced with oMLX.
## Source and credit
- Original local source checkpoint: `Ling-3.0-tiny-bf16`
- Source repository / credit: [https://huggingface.co/inclusionAI/Ling-3.0-tiny](https://huggingface.co/inclusionAI/Ling-3.0-tiny)
Please follow the original model's license, acceptable-use policy, and
attribution requirements.
## Conversion
- Quantization: oQ8e (`enhanced=True`)
- Importance calibration: imatrix, 128 samples × 512 tokens
- oMLX version: 0.6.0.dev1
oQe uses an imatrix sensitivity calibration to assign precision selectively,
rather than applying a uniform bit-width to every tensor. The generated
`oq_imatrix_report.json` records the resulting quantization allocation.
```bash
python run_oqe_conversion.py Ling-3.0-tiny-bf16 --models-dir /path/to/models --oq-level 8.0 --imatrix-samples 128 --imatrix-seq-length 512 --source-repo https://huggingface.co/inclusionAI/Ling-3.0-tiny
```
## Files
- `model*.safetensors`: quantized MLX weights
- `model.safetensors.index.json`: shard index
- `config.json`: model configuration
- `oq_imatrix_report.json`: imatrix calibration and quantization report