| { |
| "data_dir": "/dev/shm/data/fineweb-edu-25B", |
| "batch_size": 8, |
| "seq_len": 1024, |
| "max_iters": 2730, |
| "gradient_accumulation_steps": 192, |
| "seed": 1337, |
| "optimizer": "muon", |
| "learning_rate": 0.0006, |
| "min_lr": 6e-05, |
| "weight_decay": 0.1, |
| "beta1": 0.9, |
| "beta2": 0.95, |
| "grad_clip": 1.0, |
| "warmup_iters": 200, |
| "lr_decay_iters": 2730, |
| "muon_lr": 0.012, |
| "muon_min_lr": 0.00015, |
| "adamw_lr": 0.012, |
| "adamw_min_lr": 0.00015, |
| "muon_momentum": 0.95, |
| "muon_nesterov": true, |
| "muon_ns_steps": 5, |
| "muon_weight_decay": 0.0, |
| "lr_schedule": "linear_warmdown", |
| "warmdown_frac": 0.3, |
| "parity_target": 0.0, |
| "parity_margin": 0.03, |
| "parity_warmdown_iters": 1500, |
| "parity_trigger_iter": -1, |
| "retain_from_iter": -1, |
| "save_at_val": [], |
| "device": "cuda", |
| "dtype": "bfloat16", |
| "compile": true, |
| "n_layer": 12, |
| "n_head": 8, |
| "n_embd": 1024, |
| "block_size": 1024, |
| "vocab_size": 50304, |
| "pos_encoding": "learned", |
| "rope_theta": 10000.0, |
| "sparsity_mode": "topk", |
| "rmsnorm_affine": true, |
| "topk_dict_size": 65536, |
| "topk_k": 48, |
| "cayley_levels": [], |
| "cayley_per_parent_budget": false, |
| "cayley_seed": 42, |
| "cayley_backend": "auto", |
| "cayley_locations": [ |
| "mlp_in" |
| ], |
| "cayley_score_standardize": false, |
| "cayley_forward_standardized": false, |
| "cayley_score_std_ema_beta": 0.99, |
| "cayley_replaces_pre_rmsnorm": false, |
| "cayley_richardson_refine": false, |
| "cayley_matching_pursuit": false, |
| "tied_block_init": false, |
| "dead_threshold_c": 0.1, |
| "resume": true, |
| "out_dir": "/dev/shm/out/topk-small-65k-wallclock-matched", |
| "eval_interval": 250, |
| "eval_iters": 100, |
| "log_interval": 10, |
| "wandb_project": "sparse-nanogpt", |
| "wandb_run_name": "topk-small-65k-wallclock-matched", |
| "wandb_step_offset": 0, |
| "quick_eval_interval": 0, |
| "quick_eval_timeout": 900, |
| "hierarchy_eval_enabled": true, |
| "hierarchy_eval_iters": null |
| } |