HunMamba2-370M (WSD Scheduler)

Ez egy magyar nyelvre optimalizált, 370 millió paraméteres kauzális nyelvi modell, amely a Mamba2 (State Space Model) architektúrán alapul. A modellt egy magas minőségű, előfeldolgozott magyar korpuszon (Europarl és FineWeb-HQ keveréke) tanítottuk, Warmup-Stable-Decay (WSD) ütemező használatával.

Modell leírása

  • Architektúra: Mamba2ForCausalLM
  • Alapmodell: AntonV/mamba2-370m-hf
  • Tokenizáló: magyar-nlp-szine-java/qwen-50k-1.68 (50k szókincs, magyar nyelvre optimalizálva)
  • Kontextus ablak: 2048 token
  • Paraméterek száma: ~370M

Használat

A modell a Hugging Face transformers könyvtár segítségével tölthető be és futtatható.

import torch
from transformers import AutoTokenizer, Mamba2ForCausalLM

model_id = "username/hun_mamba2_350_stream_wsd"

tokenizer = AutoTokenizer.from_pretrained("magyar-nlp-szine-java/qwen-50k-1.68")
if tokenizer.pad_token is None:
    tokenizer.pad_token = tokenizer.eos_token

model = Mamba2ForCausalLM.from_pretrained(
    model_id, 
    device_map="auto"
)

prompt = "A Mamba architektúra előnyei a természetes nyelvfeldolgozásban:"
inputs = tokenizer(prompt, return_tensors="pt", padding=True).to(model.device)

with torch.no_grad():
    output = model.generate(
        **inputs,
        max_new_tokens=128,
        do_sample=True,
        temperature=0.7,
        top_p=0.9,
        pad_token_id=tokenizer.pad_token_id
    )

print(tokenizer.decode(output[0], skip_special_tokens=True))

Tanítási részletek

A tanítás streaming adathalmazon történt, amely lehetővé tette a nagy mennyiségű adat hatékony feldolgozását anélkül, hogy a teljes korpuszt a memóriába kellett volna tölteni. Adathalmaz

Név: magyar-nlp-szine-java/euparl_FinewebHQ_FULL_LABELED_PRETRAIN_shuffled_2
Méret: 13,271,728 minta (text chunks)
Típus: Előtanítási (pretrain) korpusz, Europarl és FineWeb-HQ forrásokból, címkézve és keverve.

Hyperparaméterek

Optimalizáló: AdamW (alapértelmezett Trainer)
Tanítási epochok: 2
Effektív batch méret: 64 (batch_size=2 * grad_accum=32 * num_gpus=1)
Maximális szekvencia hossz: 2048
Learning Rate: 8e-4
Weight Decay: 0.01
Max Grad Norm: 1.5
Precision: FP32 

(Scheduler)

A modell egy Warmup-Stable-Decay (WSD) ütemezőt használt, amely bizonyítottan jobb generalizációt biztosít a State Space Modellek (Mamba) esetében a hagyományos Cosine Decay-jel szemben.

Warmup lépések: 2027 (~1% a teljes lépésszámnak)
Stabil fázis: A maximális learning rate (8e-4) fenntartása a tanítás 90%-ában.
Decay fázis: Lineáris csökkenés az utolsó 10%-ban (num_decay_steps).

Korlátozások és Torzítások (Limitations and Biases)

A modell kauzális nyelvi modell, így elsősorban szöveggenerálásra (text generation) és next-token prediction feladatokra alkalmas.
Mivel a tanítás során az eval_strategy="no" volt beállítva, a perplexity (PPL) és egyéb kiértékelési metrikák nem kerültek automatikusan naplózásra a validációs halmazon a futtatás közben (bár a W&B integráció a training loss-t és a lépésenkénti PPL-t rögzítette).
A generált szövegek tükrözhetik az alapadathalmaz (Europarl, FineWeb) esetleges torzításait és stilisztikai sajátosságait.

Idézet (Citation)

Ha használod ezt a modellt a kutatásodban vagy alkalmazásodban, kérlek hivatkozz az alap Mamba2 architektúrára és a felhasznált magyar adathalmazokra.

@article{dao2024transformers, title={Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality}, author={Dao, Tri and Gu, Albert}, journal={arXiv preprint arXiv:2405.21060}, year={2024} }

Downloads last month
423
Safetensors
Model size
0.4B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for magyar-nlp-szine-java/mamba2-370_cont_pretrain_v1

Finetuned
(1)
this model

Paper for magyar-nlp-szine-java/mamba2-370_cont_pretrain_v1