Aurora Clary 0.6
Collection
2 items • Updated
How to use AuroraSystem/Clary-0.6-0.6B with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="AuroraSystem/Clary-0.6-0.6B") # Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("AuroraSystem/Clary-0.6-0.6B")
model = AutoModelForCausalLM.from_pretrained("AuroraSystem/Clary-0.6-0.6B", device_map="auto")How to use AuroraSystem/Clary-0.6-0.6B with vLLM:
# Install vLLM from pip:
pip install vllm
# Start the vLLM server:
vllm serve "AuroraSystem/Clary-0.6-0.6B"
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:8000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "AuroraSystem/Clary-0.6-0.6B",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'docker model run hf.co/AuroraSystem/Clary-0.6-0.6B
How to use AuroraSystem/Clary-0.6-0.6B with SGLang:
# Install SGLang from pip:
pip install sglang
# Start the SGLang server:
python3 -m sglang.launch_server \
--model-path "AuroraSystem/Clary-0.6-0.6B" \
--host 0.0.0.0 \
--port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "AuroraSystem/Clary-0.6-0.6B",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'docker run --gpus all \
--shm-size 32g \
-p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=<secret>" \
--ipc=host \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server \
--model-path "AuroraSystem/Clary-0.6-0.6B" \
--host 0.0.0.0 \
--port 30000
# Call the server using curl (OpenAI-compatible API):
curl -X POST "http://localhost:30000/v1/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "AuroraSystem/Clary-0.6-0.6B",
"prompt": "Once upon a time,",
"max_tokens": 512,
"temperature": 0.5
}'How to use AuroraSystem/Clary-0.6-0.6B with Docker Model Runner:
docker model run hf.co/AuroraSystem/Clary-0.6-0.6B
| Файл | Описание |
|---|---|
config.json |
конфиг LLM |
model.safetensors |
Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json |
токенизатор |
projector.safetensors |
vision-проектор (768→2048→2048→1024) |
clip_vision/ |
CLIP ViT-B/32 vision encoder |
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Напиши факториал на Python"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))
Для картинок нужен CLIP + проектор. Архитектура:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> ответ
/think (Qwen3 thinking)Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).
| File | Description |
|---|---|
config.json |
LLM config |
model.safetensors |
Qwen3-0.6B + LoRA (merged) |
tokenizer.json / tokenizer_config.json |
tokenizer |
projector.safetensors |
vision projector (768→2048→2048→1024) |
clip_vision/ |
CLIP ViT-B/32 vision encoder |
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Write a Python factorial function"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))
For images you need CLIP + projector. Architecture:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> answer
/think mode (Qwen3 thinking)Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).