{ "model_type": "log_linear_gdn2_370M", "arch": "log-linear GDN-2 (fla chunk_log_linear_attn)", "tokens_trained": 999292928, "global_batch_tokens": 2097152, "micro_batch_size": 32, "grad_accum": 2, "seq_len": 4096, "num_params": "370M", "tokenizer": "TinyLlama/TinyLlama_v1.1", "corpus": "fineweb-edu", "note": "global_batch=2M (4x larger than vanilla/SSC/GRM 0.5M). Faster eval only, not directly comparable to vanilla 1B." }