Qwen3.5-35B-A3B (3bit MLX Quantization)

This is the Qwen3.5-35B-A3B model, natively quantized to 3bit for the MLX framework by Apple. This version allows running a massive model on standard Apple Silicon Macs without experiencing immediate OOM (Out Of Memory) issues.

馃専 Experi锚ncia de Uso & Performance no Mac (Apple Silicon)

A vers茫o em 3-bits comprime severamente os pesos do modelo. Apesar de rodar incrivelmente r谩pido e caber em espa莽os menores de mem贸ria, observei uma degrada莽茫o um pouco maior na intelig锚ncia pura se comparado ao formato 3.5-bits ou superior.

Durante os testes locais para valida莽茫o dessa quantiza莽茫o, obtivemos os seguintes resultados de performance:

  • Pico de Mem贸ria (VRAM): Usou cerca de ~15.3 GB de mem贸ria unificada, deixando o sistema saud谩vel e sem swap pesado.
  • Velocidade de Gera莽茫o: Atingiu aproximadamente ~65 tokens/sec (Pode variar conforme o hardware e a temperatura do chip).
  • Estabilidade: Para evitar o erro kIOGPUCommandBufferCallbackErrorTimeout (GPU Timeout) comum no Mac ao processar tensores gigantes, o processo de quantiza莽茫o deste modelo foi roteado cirurgicamente pela CPU. Isso garantiu integridade e sucesso total na convers茫o.

馃殌 Como usar com oMLX (Recomendado)

oMLX is a high-performance serving engine for MLX models that exposes an OpenAI-compatible API.

1. Fa莽a o download para o seu cache local:

python -c "from huggingface_hub import snapshot_download; snapshot_download('faelfernandes/Qwen3.5-35B-A3B-3bit')"

2. Inicie o servidor oMLX:

omlx serve --model-dir ~/.cache/huggingface/hub/models--faelfernandes--Qwen3.5-35B-A3B-3bit/snapshots/main

3. Teste via API (Padr茫o OpenAI):

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.5-35B-A3B-3bit",
    "messages": [{"role": "user", "content": "Explique a teoria da relatividade."}],
    "temperature": 0.7
  }'

馃捇 Como usar direto com MLX-LM no Python

1. Instale as depend锚ncias:

pip install mlx-lm huggingface_hub

2. Script de Infer锚ncia:

from mlx_lm import load, generate

model, tokenizer = load("faelfernandes/Qwen3.5-35B-A3B-3bit")
response = generate(model, tokenizer, prompt="Explain quantum mechanics in one paragraph.", max_tokens=500)
print(response)

鈿欙笍 Detalhes da Quantiza莽茫o

  • Modelo Base: Qwen/Qwen3.5-35B-A3B
  • Quantiza莽茫o: 3bit
  • Framework: Apple MLX
  • Processamento: Convers茫o via CPU para m谩xima integridade e estabilidade.

Quantizado e otimizado com foco na experi锚ncia do usu谩rio de Mac. Por Rafael Fernandes 馃嚙馃嚪

Downloads last month
-
Safetensors
Model size
4B params
Tensor type
BF16
U32
F32
MLX
Hardware compatibility
Log In to add your hardware

3-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 馃檵 Ask for provider support