Instructions to use Flashtond22/Taltos-27B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Flashtond22/Taltos-27B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="Flashtond22/Taltos-27B") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("Flashtond22/Taltos-27B") model = AutoModelForMultimodalLM.from_pretrained("Flashtond22/Taltos-27B", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Flashtond22/Taltos-27B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Flashtond22/Taltos-27B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Flashtond22/Taltos-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/Flashtond22/Taltos-27B
- SGLang
How to use Flashtond22/Taltos-27B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Flashtond22/Taltos-27B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Flashtond22/Taltos-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Flashtond22/Taltos-27B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Flashtond22/Taltos-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use Flashtond22/Taltos-27B with Docker Model Runner:
docker model run hf.co/Flashtond22/Taltos-27B
✦ TÁLTOS-27B ✦
Magyar nyelvre hangolt, gondolkodó, képlátó nyelvi modell
„A táltos tud, lát és magyaráz."
Gondolkodó mód · Képértés · 262 144 token · Egy GPU-n futtatható
Mire való
A Táltos-27B akkor a jó választás, ha magyarul kell dolgoznod, és számít, hogy a szöveg úgy szóljon, ahogy egy magyar ember írná. A hangolása három dologra ment el: természetes magyar fogalmazásra, magyar nyelvű gondolatmenetre, és arra, hogy a modell megmondja, ha valamiben bizonytalan.
| ✍️ Fogalmazás | 🧠 Gondolkodás | 👁️ Képértés | 📚 Hosszú szöveg |
|---|---|---|---|
| Levél, összefoglaló, átirat, hivatalos szöveg magyarul | Lépésenkénti levezetés magyar nyelven | Képek és videók értelmezése | 262 144 token egy menetben |
Specifikáció
| Tulajdonság | Érték |
|---|---|
| Paraméterszám | 27,8 milliárd (dense) |
| Architektúra | 64 réteg, hibrid Gated DeltaNet + Gated Attention |
| Kontextusablak | 262 144 token |
| Multimodalitás | Kép és videó bemenet |
| Gondolkodó mód | Kapcsolható (enable_thinking) |
| Alapmodell | Qwen/Qwen3.8-27B |
| Licenc | Apache 2.0 |
| Kiadás | 2026. augusztus |
Eredmények
Fej-fej melletti összehasonlítás az alapmodellel, 55 magyar feladaton (érettségi példák, fogalmazás, nyelvtan, kultúra, érvelés). A győztest egy független modellcsalád (Gemma-4-31B) választotta ki, a válaszok sorrendje véletlenítve.
| Kimenetel | Arány |
|---|---|
| 🏆 Táltos-27B a jobb | 50,9 % |
| Alapmodell a jobb | 40,0 % |
| Holtverseny | 9,1 % |
| Összesített preferencia | 55,5 % |
Ahol a legnagyobb a különbség: érettségi feladatok (18 : 13), érvelés és vita (2 : 0), hamis állítások kiigazítása.
| Nyelvi mutató | Alapmodell | Táltos-27B |
|---|---|---|
| Magyar ékezetsűrűség | 0,0728 | 0,0753 |
| Átlagos válaszhossz | 1 775 kar. | 1 649 kar. |
A magyar nyelvtani pontosság érezhetően javult. Egy panaszlevél-feladatban az alapmodell olyan alakokat adott vissza, mint „felhívni a figyelmetükre" vagy „a fizetendő összegetől", a Táltos ezeket helyesen írja.
Így készült
magyar feladat
│
▼
┌──────────────┐ ┌───────────────────┐ ┌──────────────────┐
│ szakmai │───────▶│ anyanyelvi │───────▶│ magyar │
│ vázlat │ │ magyar szöveg │ │ gondolatmenet │
└──────────────┘ └───────────────────┘ └──────────────────┘
A tanítóadat saját fejlesztésű, háromlépcsős eljárással készült. A kulcsötlet, hogy a nyelvi modellek az átfogalmazásban lényegesen erősebbek, mint a nyílt végű magyar szövegalkotásban, így a tartalmi minőség és a magyar megformálás szétválasztható és külön-külön maximalizálható.
Erre épült egy célzott finomhangolás, amely a teljes hálózatot érinti, majd az eredmény visszaolvadt az alapmodellbe. A tanítás egyetlen NVIDIA L40S GPU-n futott le.
Használat
vLLM (ajánlott)
vllm serve Flashtond22/Taltos-27B \
--served-model-name taltos \
--max-model-len 32768 \
--reasoning-parser qwen3
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="-")
válasz = client.chat.completions.create(
model="taltos",
messages=[{"role": "user", "content": "Foglald össze három mondatban, mi volt a kiegyezés."}],
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print(válasz.choices[0].message.content)
Transformers
from transformers import AutoModelForCausalLM, AutoProcessor
import torch
MODEL = "Flashtond22/Taltos-27B"
proc = AutoProcessor.from_pretrained(MODEL)
model = AutoModelForCausalLM.from_pretrained(MODEL, dtype=torch.bfloat16, device_map="auto")
üzenetek = [{"role": "user", "content": "Miért különleges a magyar magánhangzó-harmónia?"}]
prompt = proc.apply_chat_template(üzenetek, add_generation_prompt=True,
enable_thinking=True, tokenize=False)
be = proc(prompt, return_tensors="pt").to(model.device)
ki = model.generate(**be, max_new_tokens=1200, temperature=0.7, top_p=0.92)
print(proc.decode(ki[0][be.input_ids.shape[1]:], skip_special_tokens=True))
Ajánlott rendszerüzenet
Te vagy a Táltos, magyar nyelvre hangolt mesterséges intelligencia.
Természetes, anyanyelvi magyarsággal válaszolsz: helyes szórenddel,
ragozással, tükörfordítás nélkül. Pontos vagy és lényegre törő.
Ha valamit nem tudsz, azt megmondod ahelyett, hogy kitalálnád.
Ajánlott paraméterek: temperature = 0.7, top_p = 0.92. Gondolkodó módban adj legalább 2000 token keretet.
Változatok és hardverigény
Minden formátum elkészült, hogy a lehető legtöbb gépen elfusson.
| Formátum | Repó | Méret | VRAM | Mire jó |
|---|---|---|---|---|
| bf16 | Taltos-27B | 56 GB | ~58 GB | Szerver, továbbtanítás, maximális minőség |
| FP8 | Taltos-27B-FP8 | 30 GB | ~32 GB | vLLM egyetlen 40 GB-os kártyán |
| GGUF | Taltos-27B-GGUF | 10 GB-tól | 12 GB-tól | Otthoni gép, Ollama, LM Studio, CPU |
GGUF változatok
| Kvantálás | Méret | VRAM | Minőség | Kinek |
|---|---|---|---|---|
Q8_0 |
29 GB | 31 GB | 🟢🟢🟢🟢🟢 | Gyakorlatilag az eredeti |
Q6_K |
23 GB | 25 GB | 🟢🟢🟢🟢🟢 | A különbség alig mérhető |
Q5_K_M |
20 GB | 22 GB | 🟢🟢🟢🟢 | 24 GB-os kártyán elfér |
Q4_K_M |
17 GB | 19 GB | 🟢🟢🟢🟢 | A legjobb arány, ezt ajánljuk |
Q3_K_M |
13 GB | 15 GB | 🟡🟡🟡 | Hosszú levezetéseknél már hibázik |
Q2_K |
10 GB | 12 GB | 🟠🟠 | Csak ha a hardver mást nem enged |
Hol romlik a minőség.
Q4_K_Mfölött a különbség a legtöbb feladatban észrevehetetlen.Q3_K_M-nél megjelennek az első hibák a hosszabb matematikai levezetésekben és a ritkább szakszavaknál, beszélgetésre és fogalmazásra viszont még jó.Q2_K-nál a romlás egyértelmű: a magyar nyelvhelyesség nagyrészt megmarad, de a tényszerű pontosság és a többlépéses gondolkodás gyengül.
Mind a hat változat elérhető és letölthető.
Indítás egy paranccsal (Ollama)
ollama run hf.co/Flashtond22/Taltos-27B-GGUF:Q4_K_M
Korlátok
A Táltos-27B a magyar nyelvi teljesítményre lett hangolva. A világtudás, a matematikai és programozási képesség az alapmodelltől származik, ezeken a hangolás nem változtatott.
Nincs internet-hozzáférése, ezért a friss eseményekről nem tud. Konkrét számoknál, dátumoknál és ritka neveknél tévedhet, ilyenkor érdemes ellenőrizni a választ. Orvosi, jogi vagy pénzügyi döntés egyedüli alapjaként ne használd.
Licenc és eredet
A Táltos-27B a Qwen/Qwen3.8-27B modellből származik, amelyet az Alibaba Tongyi Lab adott ki Apache 2.0 licenc alatt. A Táltos-27B szintén Apache 2.0 licencű: szabadon használható, módosítható és üzleti célra is alkalmazható.
✦ TÁLTOS-27B ✦
Magyar fejlesztés
🇬🇧 English
Táltos-27B is a 27.8B-parameter Hungarian-specialised language model built on Qwen/Qwen3.8-27B (Apache 2.0). It keeps the base model's knowledge, reasoning, vision capability and 262K context window, and adds native-quality Hungarian phrasing plus Hungarian-language chain-of-thought.
Training approach. Instruction data was produced with a three-stage in-house pipeline that separates content quality from Hungarian phrasing, exploiting the fact that language models are considerably stronger at rewriting than at open-ended Hungarian generation. A targeted fine-tune across the full network followed, then merged back into the base weights. Everything ran on a single NVIDIA L40S.
Results. In head-to-head comparison on 55 Hungarian tasks judged by an independent model family (Gemma-4-31B, randomised answer order), Táltos-27B was preferred in 55.5 % of cases. The largest gains appear on secondary-school exam problems, argumentation, and correcting false premises. Hungarian grammatical accuracy improved noticeably.
Limitations. World knowledge, maths and coding come from the base model and are unchanged. No internet access, so recent events are unknown. Verify specific figures, dates and rare names. Not for sole reliance in medical, legal or financial decisions.
Apache 2.0, same as the base model.
- Downloads last month
- 78