maze-transformer / experiments /eval_selfplay_ref.json
Hana-ame's picture
feat: unified experiment launcher — every experiment = one JSON config (experiments/*.json); launch.py dispatches rl_nav/rl_rnn/rl_ctx/evaluate/random; 11 configs + 11 tests
ec6c2c6
Raw
History Blame Contribute Delete
360 Bytes
{
"name": "eval_selfplay_ref",
"task": "evaluate",
"note": "Q2 对照:废弃的 selfplay 权重(自产 obs 训练)在 forced-obs 协议下的表现",
"checkpoint": "checkpoints/l2_d64_maze_selfplay_final.pt",
"model_type": "gpt",
"n_trials": 24,
"seed": 7,
"budget_scale": 2.0,
"sizes": ["5x5", "6x6", "7x7"],
"include_random": true
}