{ "d_model": 384, "n_heads": 8, "n_layers": 6, "d_ff": 1536, "batch_size": 20, "max_steps": 30000, "n_kv_heads": 4, "sliding_window": 4096, "attention_bias": false, "rms_norm_eps": 1e-06, "gradient_accumulation_steps": 4, "muon_lr": 0.01, "max_seq_len": 512, "num_documents": 2000, "max_tokens": 500000, "eval_every": 500, "eval_steps": 100, "weight_decay": 0.1, "dropout": 0.1, "grad_clip": 1.0, "use_amp": true, "vocab_size": 63982, "model_type": "minimal_llm", "architectures": [ "MinimalLLM" ], "tokenizer_class": "TokenizersBackend", "pad_token_id": 63982, "eos_token_id": 63982, "bos_token_id": 63982, "unk_token_id": 1, "torch_dtype": "float32", "transformers_version": "5.13.1", "special_tokens_map": { "bos_token": "<|endoftext|>", "eos_token": "<|endoftext|>", "unk_token": "", "pad_token": "<|endoftext|>" } }