Instructions to use cudo528/Darwin-9B-Opus-mlx-4bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use cudo528/Darwin-9B-Opus-mlx-4bit with MLX:
# Make sure mlx-lm is installed # pip install --upgrade mlx-lm # if on a CUDA device, also pip install mlx[cuda] # Generate text with mlx-lm from mlx_lm import load, generate model, tokenizer = load("cudo528/Darwin-9B-Opus-mlx-4bit") prompt = "Once upon a time in" text = generate(model, tokenizer, prompt=prompt, verbose=True) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- MLX LM
How to use cudo528/Darwin-9B-Opus-mlx-4bit with MLX LM:
Generate or start a chat session
# Install MLX LM uv tool install mlx-lm # Generate some text mlx_lm.generate --model "cudo528/Darwin-9B-Opus-mlx-4bit" --prompt "Once upon a time"
Darwin-9B-Opus (MLX 4-bit Optimized)
This repository provides an MLX-optimized 4-bit quantized version of FINAL-Bench/Darwin-9B-Opus, an ultra-efficient advanced reasoning model.
μ§νμ λ¨Έμ§(Evolutionary Merge) λ° λ μ΄μ΄λ³ λ¨Έμ§(Layer-wise Merge) κΈ°λ²μ΄ μ μ©λ 9B 체κΈμ κ°λ ₯ν λͺ¨λΈμ Apple Silicon(Mac) νκ²½μμ νλμ¨μ΄ 리μμ€λ₯Ό μ΅μννλ©° ꡬλν μ μλλ‘ 4-bitλ‘ μμν λ° ν¬λ§· λ³νμ μλ£ν λ²μ μ λλ€.
β οΈ Hugging Face View Note: νκΉ νμ΄μ€ μμ€ν μ΄ MLX 4λΉνΈ ν¨νΉ ν¬λ§·(
U32/BF16)μ νμ±νλ κ³Όμ μμ νλΌλ―Έν° μ λ° ν μ νμ μ΄ μΌμμ μΌλ‘ λ€λ₯΄κ² νκΈ°λ μ μμΌλ, μ€μ 4λΉνΈ μμν κ°μ€μΉκ° μ μ μ μ©λ νμΌμ λλ€. λ§₯λΆ λ‘컬 νκ²½μμ μ μμ μΈ λ©λͺ¨λ¦¬ μ μ μ¨λ‘ ꡬλλ©λλ€.
π Key Features
- Extreme Efficiency (4-bit): 9B 체κΈμ κ°μ€μΉλ₯Ό 4λΉνΈλ‘ μ κ΅νκ² μμΆνμ¬, VRAM(ν΅ν© λ©λͺ¨λ¦¬)μ΄ μ μ Mac κΈ°κΈ°μμλ κ°λ³κ³ λΉ λ₯΄κ² μΆλ‘ (Inference)μ μνν©λλ€.
- Top-Tier 9B Reasoning: νλμ½μ΄ λ°μ¬κΈ μΆλ‘ ν
μ€νΈμΈ **GPQA Diamondμμ 82.5%**λΌλ μ²΄κΈ νκ΄΄ μμ€μ κ³ λμ μ κΈ°λ‘νμ΅λλ€. κΉμ μ¬κ³ κ³Όμ (
<thought>)μ ν΅ν κ³ λλ λ Όλ¦¬ μΆλ‘ μ΄ κ°λ₯ν©λλ€. - Agentic Capabilities: μ½λ© μμ΄μ νΈ(Coding Agent) μ±λ₯κ³Ό μ κ΅ν λꡬ νΈμΆ(Tool Calling) μΈν°νμ΄μ€λ₯Ό κΈ°λ³Έ λ΄μ₯νκ³ μμ΅λλ€.
- Global Multilingual: νκ΅μ΄, μμ΄, μ€κ΅μ΄, μΌλ³Έμ΄, νλμ€μ΄, λ μΌμ΄ λ± 10κ° μ΄μμ λ€κ΅μ΄ νκ²½μ μλ²½νκ² μ§μν©λλ€.
π οΈ Installation
μ΄ λͺ¨λΈμ λ‘컬 νκ²½μμ ꡬλνλ €λ©΄ μ΅μ λ²μ μ mlx-lm λΌμ΄λΈλ¬λ¦¬κ° νμν©λλ€.
pip install -U mlx-lm
π» How to Use
1. Python APIλ₯Ό μ΄μ©ν μΆλ‘ μ½λ
from mlx_lm import load, generate
# λ³ΈμΈμ νκΉ
νμ΄μ€ μ μ₯μ μμ΄λ/μ΄λ¦μΌλ‘ μμ νμ¬ μ¬μ©νμΈμ.
model, tokenizer = load("cudo528/Darwin-9B-Opus-mlx-4bit")
prompt = "μνμ κ·λ©λ²μ μ리λ₯Ό μ€νμλ μ΄ν΄ν μ μκ² μ¬μ΄ λΉμ λ₯Ό λ€μ΄ νκ΅μ΄λ‘ μ€λͺ
ν΄μ€."
response = generate(
model,
tokenizer,
prompt=prompt,
max_tokens=2048,
verbose=True # λͺ¨λΈμ μ¬μΈ΅ μ¬κ³ κ³Όμ (<thought>)μ ν°λ―Έλμμ μ€μκ°μΌλ‘ λ³΄λ €λ©΄ True
)
print(response)
2. ν°λ―Έλ(CLI) νκ²½μμ μ¦μ μ€ν
mlx_lm.generate --model cudo528/Darwin-9B-Opus-mlx-4bit --prompt "Write a Python script for a simple custom neural network layer." --max-tokens 1024
π Architecture & Lineage
- Original Base Model: FINAL-Bench/Darwin-9B-Opus
- Quantization Bit: 4-bit
- Format: MLX Formatted (
.safetensorspacked) - License: Apache-2.0
Model tree for cudo528/Darwin-9B-Opus-mlx-4bit
Base model
FINAL-Bench/Darwin-9B-OpusEvaluation results
- Accuracy on GPQA Diamondself-reported82.500