| { | |
| "model_type": "log_linear_gdn2_370M", | |
| "arch": "log-linear GDN-2 (fla chunk_log_linear_attn)", | |
| "tokens_trained": 999292928, | |
| "global_batch_tokens": 2097152, | |
| "micro_batch_size": 32, | |
| "grad_accum": 2, | |
| "seq_len": 4096, | |
| "num_params": "370M", | |
| "tokenizer": "TinyLlama/TinyLlama_v1.1", | |
| "corpus": "fineweb-edu", | |
| "note": "global_batch=2M (4x larger than vanilla/SSC/GRM 0.5M). Faster eval only, not directly comparable to vanilla 1B." | |
| } |