{ "data_dir": "/dev/shm/data/fineweb-edu-25B", "batch_size": 8, "seq_len": 1024, "max_iters": 2730, "gradient_accumulation_steps": 192, "seed": 1337, "optimizer": "muon", "learning_rate": 0.0006, "min_lr": 6e-05, "weight_decay": 0.1, "beta1": 0.9, "beta2": 0.95, "grad_clip": 1.0, "warmup_iters": 200, "lr_decay_iters": 2730, "muon_lr": 0.012, "muon_min_lr": 0.00015, "adamw_lr": 0.012, "adamw_min_lr": 0.00015, "muon_momentum": 0.95, "muon_nesterov": true, "muon_ns_steps": 5, "muon_weight_decay": 0.0, "lr_schedule": "linear_warmdown", "warmdown_frac": 0.3, "parity_target": 0.0, "parity_margin": 0.03, "parity_warmdown_iters": 1500, "parity_trigger_iter": -1, "retain_from_iter": -1, "save_at_val": [], "device": "cuda", "dtype": "bfloat16", "compile": true, "n_layer": 12, "n_head": 8, "n_embd": 1024, "block_size": 1024, "vocab_size": 50304, "pos_encoding": "learned", "rope_theta": 10000.0, "sparsity_mode": "topk", "rmsnorm_affine": true, "topk_dict_size": 65536, "topk_k": 48, "cayley_levels": [], "cayley_per_parent_budget": false, "cayley_seed": 42, "cayley_backend": "auto", "cayley_locations": [ "mlp_in" ], "cayley_score_standardize": false, "cayley_forward_standardized": false, "cayley_score_std_ema_beta": 0.99, "cayley_replaces_pre_rmsnorm": false, "cayley_richardson_refine": false, "cayley_matching_pursuit": false, "tied_block_init": false, "dead_threshold_c": 0.1, "resume": true, "out_dir": "/dev/shm/out/topk-small-65k-wallclock-matched", "eval_interval": 250, "eval_iters": 100, "log_interval": 10, "wandb_project": "sparse-nanogpt", "wandb_run_name": "topk-small-65k-wallclock-matched", "wandb_step_offset": 0, "quick_eval_interval": 0, "quick_eval_timeout": 900, "hierarchy_eval_enabled": true, "hierarchy_eval_iters": null }