{ "architectures": [ "BDH" ], "vocab_size": 256, "n_layer": 8, "n_embd": 256, "n_head": 4, "mlp_internal_dim_multiplier": 768, "dropout": 0.1, "seq_len": 2048, "model_type": "bdh", "size_m": 150, "training": { "steps": 30000, "data": "research-mix-v1 970M tok byte-level (80% EN fineweb-edu / 20% PL speakleash)", "optimizer": "AdamW lr=1e-3 wd=0.1 cos->1e-4 warmup1000", "clip": "ZClip", "final_val_loss": 1.099 } }