miniQwen_v2 / config.json
chhatramani's picture
Upload trained model and tokenizer
4766562 verified
Raw
History Blame Contribute Delete
913 Bytes
{
"d_model": 384,
"n_heads": 8,
"n_layers": 6,
"d_ff": 1536,
"batch_size": 20,
"max_steps": 30000,
"n_kv_heads": 4,
"sliding_window": 4096,
"attention_bias": false,
"rms_norm_eps": 1e-06,
"gradient_accumulation_steps": 4,
"muon_lr": 0.01,
"max_seq_len": 512,
"num_documents": 2000,
"max_tokens": 500000,
"eval_every": 500,
"eval_steps": 100,
"weight_decay": 0.1,
"dropout": 0.1,
"grad_clip": 1.0,
"use_amp": true,
"vocab_size": 63982,
"model_type": "minimal_llm",
"architectures": [
"MinimalLLM"
],
"tokenizer_class": "TokenizersBackend",
"pad_token_id": 63982,
"eos_token_id": 63982,
"bos_token_id": 63982,
"unk_token_id": 1,
"torch_dtype": "float32",
"transformers_version": "5.13.1",
"special_tokens_map": {
"bos_token": "<|endoftext|>",
"eos_token": "<|endoftext|>",
"unk_token": "<unk>",
"pad_token": "<|endoftext|>"
}
}