✦ TÁLTOS-27B ✦ FP8

A Táltos-27B FP8 kvantált változata

Méret VRAM Minőség


Ez a Táltos-27B FP8 (W8A8) változata: a súlyok csatornánkénti, az aktivációk tokenenkénti dinamikus skálázással. A méret feleződik, a minőségromlás gyakorlatilag mérhetetlen.

Ez a változat akkor kell, ha egyetlen 40 GB körüli kártyán szeretnéd futtatni. L40S, A6000, A100 40 GB, RTX 6000 Ada.

Indítás

vllm serve Flashtond22/Taltos-27B-FP8 \
  --served-model-name taltos \
  --max-model-len 32768 \
  --reasoning-parser qwen3
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="-")

válasz = client.chat.completions.create(
    model="taltos",
    messages=[{"role": "user", "content": "Írj egy udvarias felmondólevelet."}],
)
print(válasz.choices[0].message.content)

Változatok

Változat Méret VRAM Ajánlott hardver
bf16 56 GB ~58 GB H100, 2 × A100
FP8 (ez) 30 GB ~32 GB L40S, A6000, A100 40 GB
GGUF 10 GB-tól 12 GB-tól Ollama, llama.cpp, CPU

A modell leírása, mérési eredményei és használati útmutatója az alap repóban.

✦ TÁLTOS-27B ✦

Magyar fejlesztés

Downloads last month
37
Safetensors
Model size
28B params
Tensor type
BF16
·
F8_E4M3
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Flashtond22/Taltos-27B-FP8

Base model

Qwen/Qwen3.8-27B
Quantized
(3)
this model