HunMamba2-370M (WSD Scheduler)
Ez egy magyar nyelvre optimalizált, 370 millió paraméteres kauzális nyelvi modell, amely a Mamba2 (State Space Model) architektúrán alapul. A modellt egy magas minőségű, előfeldolgozott magyar korpuszon (Europarl és FineWeb-HQ keveréke) tanítottuk, Warmup-Stable-Decay (WSD) ütemező használatával.
Modell leírása
- Architektúra:
Mamba2ForCausalLM - Alapmodell:
AntonV/mamba2-370m-hf - Tokenizáló:
magyar-nlp-szine-java/qwen-50k-1.68(50k szókincs, magyar nyelvre optimalizálva) - Kontextus ablak: 2048 token
- Paraméterek száma: ~370M
Használat
A modell a Hugging Face transformers könyvtár segítségével tölthető be és futtatható.
import torch
from transformers import AutoTokenizer, Mamba2ForCausalLM
model_id = "username/hun_mamba2_350_stream_wsd"
tokenizer = AutoTokenizer.from_pretrained("magyar-nlp-szine-java/qwen-50k-1.68")
if tokenizer.pad_token is None:
tokenizer.pad_token = tokenizer.eos_token
model = Mamba2ForCausalLM.from_pretrained(
model_id,
device_map="auto"
)
prompt = "A Mamba architektúra előnyei a természetes nyelvfeldolgozásban:"
inputs = tokenizer(prompt, return_tensors="pt", padding=True).to(model.device)
with torch.no_grad():
output = model.generate(
**inputs,
max_new_tokens=128,
do_sample=True,
temperature=0.7,
top_p=0.9,
pad_token_id=tokenizer.pad_token_id
)
print(tokenizer.decode(output[0], skip_special_tokens=True))
Tanítási részletek
A tanítás streaming adathalmazon történt, amely lehetővé tette a nagy mennyiségű adat hatékony feldolgozását anélkül, hogy a teljes korpuszt a memóriába kellett volna tölteni. Adathalmaz
Név: magyar-nlp-szine-java/euparl_FinewebHQ_FULL_LABELED_PRETRAIN_shuffled_2
Méret: 13,271,728 minta (text chunks)
Típus: Előtanítási (pretrain) korpusz, Europarl és FineWeb-HQ forrásokból, címkézve és keverve.
Hyperparaméterek
Optimalizáló: AdamW (alapértelmezett Trainer)
Tanítási epochok: 2
Effektív batch méret: 64 (batch_size=2 * grad_accum=32 * num_gpus=1)
Maximális szekvencia hossz: 2048
Learning Rate: 8e-4
Weight Decay: 0.01
Max Grad Norm: 1.5
Precision: FP32
(Scheduler)
A modell egy Warmup-Stable-Decay (WSD) ütemezőt használt, amely bizonyítottan jobb generalizációt biztosít a State Space Modellek (Mamba) esetében a hagyományos Cosine Decay-jel szemben.
Warmup lépések: 2027 (~1% a teljes lépésszámnak)
Stabil fázis: A maximális learning rate (8e-4) fenntartása a tanítás 90%-ában.
Decay fázis: Lineáris csökkenés az utolsó 10%-ban (num_decay_steps).
Korlátozások és Torzítások (Limitations and Biases)
A modell kauzális nyelvi modell, így elsősorban szöveggenerálásra (text generation) és next-token prediction feladatokra alkalmas.
Mivel a tanítás során az eval_strategy="no" volt beállítva, a perplexity (PPL) és egyéb kiértékelési metrikák nem kerültek automatikusan naplózásra a validációs halmazon a futtatás közben (bár a W&B integráció a training loss-t és a lépésenkénti PPL-t rögzítette).
A generált szövegek tükrözhetik az alapadathalmaz (Europarl, FineWeb) esetleges torzításait és stilisztikai sajátosságait.
Idézet (Citation)
Ha használod ezt a modellt a kutatásodban vagy alkalmazásodban, kérlek hivatkozz az alap Mamba2 architektúrára és a felhasznált magyar adathalmazokra.
@article{dao2024transformers, title={Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality}, author={Dao, Tri and Gu, Albert}, journal={arXiv preprint arXiv:2405.21060}, year={2024} }
- Downloads last month
- 423
Model tree for magyar-nlp-szine-java/mamba2-370_cont_pretrain_v1
Base model
AntonV/mamba2-370m-hf