{ "activation": "swiglu", "architecture": "MicroLoopForDiffusionLM", "architectures": [ "MicroLoopForDiffusionLM" ], "attention_implementation": "sdpa", "attention_output_gate": false, "attn_res_block_size": null, "auto_map": { "AutoConfig": "configuration_microloop.MicroLoopConfig", "AutoModelForCausalLM": "modeling_microloop.MicroLoopForDiffusionLM" }, "bos_token_id": 1, "diffusion": { "fallback_block_size": 16, "objective": "absorbing_mask_mdlm", "primary_block_size": 32, "training_block_sizes": { "16": 0.35, "32": 0.6, "64": 0.05 } }, "dropout": 0.0, "dtype": "float32", "eos_token_id": 2, "head_dimension": 40, "hidden_size": 240, "intermediate_size": 640, "is_decoder": true, "looping": { "layers": [ 4, 5, 6 ], "maximum_serving_loops": 3, "training_loop_counts": [ 1 ] }, "max_position_embeddings": 2048, "model_type": "microloop_diffusion", "mtp_enabled": false, "normalization": "rmsnorm", "num_attention_heads": 6, "num_hidden_layers": 14, "num_key_value_heads": 2, "pad_token_id": 0, "positional_encoding": "rope", "qk_norm": "per_head", "rms_norm_eps": 1e-05, "rope_theta": 10000.0, "swiglu_clamp": { "enabled": true, "gate_max": 10.0, "linear_max": 10.0, "linear_min": -10.0 }, "target_parameters": 10000000, "tie_word_embeddings": true, "tokenizer": { "required_special_tokens": [ "", "", "", "", "", "", "", "", "" ], "type": "byte_level_bpe", "vocabulary_size": 4096 }, "transformers_version": "5.14.1", "use_cache": false, "vocab_size": 4096 }