{ "architectures": [ "SupraBrainForCausalLM" ], "attn_every": 4, "attn_head_dim": 64, "attn_num_heads": 6, "attn_num_kv_heads": 2, "attn_window": 256, "auto_map": { "AutoConfig": "modeling_suprabrain.SupraBrainConfig", "AutoModelForCausalLM": "modeling_suprabrain.SupraBrainForCausalLM" }, "bos_token_id": 0, "ce_chunk": 1024, "compile_blocks": true, "dtype": "float32", "emb_shortcut": true, "eos_token_id": 2, "full_attn_layers": [ 19 ], "gdn_conv_size": 4, "gdn_gate_rank": 32, "gdn_head_dim": 128, "gdn_num_heads": 3, "grad_ckpt": false, "hidden_size": 384, "initializer_range": 0.02, "intermediate_size": 1152, "logit_softcap": 0.0, "max_position_embeddings": 1024, "mlp_act": "rational", "model_type": "suprabrain", "norm_eps": 1e-05, "num_hidden_layers": 28, "pad_token_id": 1, "rope_theta": 10000.0, "surprise": true, "surprise_win": 16, "tie_word_embeddings": true, "transformers_version": "5.8.1", "unembed_rank": 32, "use_cache": false, "value_residual": true, "vocab_size": 23808, "z_loss": 0.0001 }