| /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available. |
| warnings.warn('Grouped GEMM not available.') |
| wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc. |
| wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login |
| wandb: setting up run d06of2kq |
| wandb: Tracking run with wandb version 0.28.0 |
| wandb: Run data is saved locally in outputs/healed/grid_math/glean_keep75_s1224/wandb/run-20260716_151441-d06of2kq |
| wandb: Run `wandb offline` to turn off syncing. |
| wandb: Syncing run glean-math-keep75-s1224 |
| wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-grid |
| wandb: π View run at https://wandb.ai/hbfreed/glean-grid/runs/d06of2kq |
|
Loading checkpoint shards: 0%| | 0/3 [00:00<?, ?it/s]
Loading checkpoint shards: 33%|ββββ | 1/3 [00:00<00:00, 7.53it/s]
Loading checkpoint shards: 67%|βββββββ | 2/3 [00:00<00:00, 7.24it/s]
Loading checkpoint shards: 100%|ββββββββββ| 3/3 [00:00<00:00, 10.37it/s] |
| 12115 cached top-128 chat trajectories / 6,476,634 unique tokens | 53 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False |
| {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03449597280910239, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 0.68359375, "lr": 6e-06, "finish_rate": 0.907, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 236}, "mem_gb": 21.78} |
| The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results. |
| [eval step 1] sample: 'To solve the given system of equations, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(r\\) such that each letter represents a non-zero digit and the equations are satisfied.\n\nThe equa' |
| {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06011146203293465, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 0.89453125, "lr": 9e-06, "finish_rate": 0.781, "comp_len": 558.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 215}, "mem_gb": 22.1} |
| {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.050602795191947374, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 0.8671875, "lr": 1.2e-05, "finish_rate": 0.825, "comp_len": 553.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 217}, "mem_gb": 21.98} |
| {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0385761997969045, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 0.69140625, "lr": 1.5e-05, "finish_rate": 0.8, "comp_len": 585.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 205}, "mem_gb": 22.03} |
| {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028516700802991787, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 0.53515625, "lr": 1.8e-05, "finish_rate": 0.834, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 229}, "mem_gb": 22.01} |
| {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09759791274744396, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 3.328125, "lr": 2.1e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 223}, "mem_gb": 22.08} |
| {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.037956103402220956, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.53125, "lr": 2.4e-05, "finish_rate": 0.708, "comp_len": 594.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 202}, "mem_gb": 22.12} |
| {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04556338287966016, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.51953125, "lr": 2.7000000000000002e-05, "finish_rate": 0.77, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 209}, "mem_gb": 22.09} |
| {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03176342047526656, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 528.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 227}, "mem_gb": 22.06} |
| {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03453842100337303, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 230}, "mem_gb": 22.14} |
| [eval step 10] sample: "To solve the given system of equations, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit. Let's break down the problem step-by" |
| {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.030750091298886884, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 231}, "mem_gb": 21.99} |
| {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.033893703076041615, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 489.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 245}, "mem_gb": 22.06} |
| {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03699809879013337, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.81, "comp_len": 571.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 210}, "mem_gb": 22.07} |
| {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03643371430290863, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.758, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 211}, "mem_gb": 22.07} |
| {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03376166817937822, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.819, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 221}, "mem_gb": 22.12} |
| {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.025529393225275757, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.35546875, "lr": 3e-05, "finish_rate": 0.912, "comp_len": 480.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 250}, "mem_gb": 21.94} |
| {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028599764375450712, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.337890625, "lr": 3e-05, "finish_rate": 0.79, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 229}, "mem_gb": 22.11} |
| {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.021392232792646005, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.28515625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 480.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 250}, "mem_gb": 22.08} |
| {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028017116936428162, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.337890625, "lr": 3e-05, "finish_rate": 0.844, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 231}, "mem_gb": 21.96} |
| {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.024294521242644015, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.844, "comp_len": 535.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 224}, "mem_gb": 22.0} |
| [eval step 20] sample: "To solve the problem, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the given equations are satisfied.\n\nLet's break dow" |
| {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03302676243637689, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.802, "comp_len": 566.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 212}, "mem_gb": 22.04} |
| {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.029354514089599253, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.365234375, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 238}, "mem_gb": 22.0} |
| {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023834507278733267, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.302734375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 257}, "mem_gb": 21.88} |
| {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.024567021203033317, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.310546875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 528.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 227}, "mem_gb": 22.07} |
| {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.025116141962097025, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.2890625, "lr": 3e-05, "finish_rate": 0.838, "comp_len": 526.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 228}, "mem_gb": 22.09} |
| {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02764747820661093, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.328125, "lr": 3e-05, "finish_rate": 0.803, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 233}, "mem_gb": 22.09} |
| {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.024866033803291308, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.306640625, "lr": 3e-05, "finish_rate": 0.863, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 233}, "mem_gb": 22.08} |
| {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.033120558351837096, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.359375, "lr": 3e-05, "finish_rate": 0.731, "comp_len": 609.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 197}, "mem_gb": 22.18} |
| {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.031153174231007386, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.3125, "lr": 3e-05, "finish_rate": 0.862, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 239}, "mem_gb": 21.93} |
| {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02932017131882409, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 535.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 224}, "mem_gb": 21.98} |
| [eval step 30] sample: "To solve the given system of equations, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit. Let's break down the problem step-by" |
| {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028374534969303446, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.337890625, "lr": 3e-05, "finish_rate": 0.788, "comp_len": 553.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 217}, "mem_gb": 22.09} |
| {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02549648174579876, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.30859375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 497.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 241}, "mem_gb": 22.09} |
| {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.021897728413917746, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.29296875, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 550.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 218}, "mem_gb": 22.06} |
| {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.026583122743371254, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.310546875, "lr": 3e-05, "finish_rate": 0.767, "comp_len": 582.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 206}, "mem_gb": 22.07} |
| {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.024209661411851022, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 232}, "mem_gb": 22.12} |
| {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.030011083026354513, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.36328125, "lr": 3e-05, "finish_rate": 0.771, "comp_len": 550.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 218}, "mem_gb": 22.14} |
| {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02819100455886995, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.3125, "lr": 3e-05, "finish_rate": 0.779, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 213}, "mem_gb": 22.1} |
| {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023883562099013943, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.283203125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 248}, "mem_gb": 22.07} |
| {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.01988168048077884, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.283203125, "lr": 3e-05, "finish_rate": 0.803, "comp_len": 550.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 218}, "mem_gb": 22.13} |
| {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.022642062246473506, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.26171875, "lr": 3e-05, "finish_rate": 0.851, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 221}, "mem_gb": 22.08} |
| [eval step 40] sample: 'To solve the given system of equations, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the equations are satisfied.\n\nLet' |
| {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.019084759334203165, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.259765625, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 236}, "mem_gb": 22.02} |
| {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02037259669423414, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.267578125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 246}, "mem_gb": 21.94} |
| {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023210749543830754, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.3203125, "lr": 3e-05, "finish_rate": 0.838, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 234}, "mem_gb": 22.19} |
| {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023896971165249123, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.333984375, "lr": 3e-05, "finish_rate": 0.748, "comp_len": 594.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 202}, "mem_gb": 22.07} |
| {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.022854564331177, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.28125, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 553.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 217}, "mem_gb": 22.09} |
| {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.019078410341955412, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.267578125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 535.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 224}, "mem_gb": 22.09} |
| {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02562954197395593, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.333984375, "lr": 3e-05, "finish_rate": 0.753, "comp_len": 558.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 215}, "mem_gb": 22.1} |
| {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.018489539842109663, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.2578125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 259}, "mem_gb": 22.02} |
| {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02005737902369971, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.265625, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 571.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 210}, "mem_gb": 22.09} |
| {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02531634767386131, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.3125, "lr": 3e-05, "finish_rate": 0.77, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 213}, "mem_gb": 22.14} |
| [eval step 50] sample: "To solve the problem, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(r\\) such that each letter represents a non-zero digit and the given equations are satisfied.\n\nLet's break down the" |
| checkpoint snapshot queued -> outputs/healed/grid_math/glean_keep75_s1224/step0050 |
| {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.020402686214788506, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.259765625, "lr": 3e-05, "finish_rate": 0.815, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 222}, "mem_gb": 22.05} |
| {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.021501830867379126, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.3359375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 510.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 235}, "mem_gb": 22.1} |
| {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.021905474028519046, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.287109375, "lr": 3e-05, "finish_rate": 0.798, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 208}, "mem_gb": 22.06} |
| {"step": 54, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014909254243193814, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.22265625, "lr": 3e-05, "finish_rate": 0.733, "comp_len": 628.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 191}, "mem_gb": 22.1} |
| {"step": 55, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014094466440717225, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.2060546875, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 219}, "mem_gb": 22.09} |
| {"step": 56, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01839226848000738, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.778, "comp_len": 579.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 207}, "mem_gb": 22.1} |
| {"step": 57, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.024518809633422643, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.755, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 208}, "mem_gb": 22.05} |
| {"step": 58, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01596627751175935, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.2734375, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 219}, "mem_gb": 22.09} |
| {"step": 59, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.0172666053055902, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.2412109375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 246}, "mem_gb": 21.96} |
| {"step": 60, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.024067298068331244, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.294921875, "lr": 3e-05, "finish_rate": 0.704, "comp_len": 582.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 206}, "mem_gb": 22.12} |
| [eval step 60] sample: "To solve the problem, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), \\(p\\), and \\(r\\) such that each letter represents a non-zero digit and the given equations are satisfied.\n\nLet's br" |
| {"step": 61, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.02249295396681021, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 233}, "mem_gb": 22.1} |
| {"step": 62, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01704160064985044, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.2119140625, "lr": 3e-05, "finish_rate": 0.847, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 229}, "mem_gb": 21.96} |
| {"step": 63, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015235947330253354, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.2216796875, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 236}, "mem_gb": 21.99} |
| {"step": 64, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01926329362227116, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.232421875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 239}, "mem_gb": 21.88} |
| {"step": 65, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014964974110476518, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.208984375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 497.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.6, "frames": {"chat": 241}, "mem_gb": 22.0} |
| {"step": 66, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.016025373026115508, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.2080078125, "lr": 3e-05, "finish_rate": 0.863, "comp_len": 531.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 226}, "mem_gb": 21.97} |
| {"step": 67, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.013881851029904404, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.203125, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 234}, "mem_gb": 22.09} |
| {"step": 68, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01412244028544907, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.1884765625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 257}, "mem_gb": 22.08} |
| {"step": 69, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.022030819237659066, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.76, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 208}, "mem_gb": 22.14} |
| {"step": 70, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.019699824277381414, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.240234375, "lr": 3e-05, "finish_rate": 0.763, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 211}, "mem_gb": 22.11} |
| [eval step 70] sample: 'To solve the problem, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that the given equations are satisfied:\n\n\\[\n\\begin{align*}\na + b &= k \\\\\nk + m &= p \\\\\n' |
| {"step": 71, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01967962834225036, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.251953125, "lr": 3e-05, "finish_rate": 0.806, "comp_len": 528.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 227}, "mem_gb": 22.1} |
| {"step": 72, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01805762037136592, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.255859375, "lr": 3e-05, "finish_rate": 0.796, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 211}, "mem_gb": 22.07} |
| {"step": 73, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015984567630795452, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.2255859375, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 238}, "mem_gb": 22.09} |
| {"step": 74, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014909437761079366, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.2080078125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 237}, "mem_gb": 22.13} |
| {"step": 75, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.019546328436707457, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.244140625, "lr": 3e-05, "finish_rate": 0.721, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 208}, "mem_gb": 22.13} |
| {"step": 76, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014784362400711204, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.2080078125, "lr": 3e-05, "finish_rate": 0.801, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 221}, "mem_gb": 22.22} |
| {"step": 77, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01612296600251575, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.2275390625, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 232}, "mem_gb": 22.05} |
| {"step": 78, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.017424311850770997, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.2421875, "lr": 3e-05, "finish_rate": 0.764, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 208}, "mem_gb": 22.09} |
| {"step": 79, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01336280028744368, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.2080078125, "lr": 3e-05, "finish_rate": 0.837, "comp_len": 528.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 227}, "mem_gb": 22.01} |
| {"step": 80, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015608607143598298, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.22265625, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 221}, "mem_gb": 22.03} |
| [eval step 80] sample: 'To solve the given system of equations for \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\), we will follow these steps:\n\n1. **Understand the Equations:**\n \\[\n \\begin{align*}\n a + b &= k \\\\\n' |
| {"step": 81, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014382271881537357, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.2080078125, "lr": 3e-05, "finish_rate": 0.815, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 232}, "mem_gb": 22.1} |
| {"step": 82, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.017395038500472824, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.2333984375, "lr": 3e-05, "finish_rate": 0.822, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 219}, "mem_gb": 22.1} |
| {"step": 83, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01632010119668363, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.232421875, "lr": 3e-05, "finish_rate": 0.713, "comp_len": 615.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 195}, "mem_gb": 22.19} |
| {"step": 84, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.016265608747016328, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.2216796875, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 555.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 216}, "mem_gb": 22.1} |
| {"step": 85, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.017849171374470462, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.2421875, "lr": 3e-05, "finish_rate": 0.788, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 208}, "mem_gb": 21.98} |
| {"step": 86, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.013051833534993541, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.2060546875, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 510.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 235}, "mem_gb": 21.97} |
| {"step": 87, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015104487207427155, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.232421875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 533.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 225}, "mem_gb": 22.08} |
| {"step": 88, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.019873610892542637, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.2412109375, "lr": 3e-05, "finish_rate": 0.77, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 213}, "mem_gb": 22.18} |
| {"step": 89, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014629409632699875, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.22265625, "lr": 3e-05, "finish_rate": 0.922, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 257}, "mem_gb": 21.85} |
| {"step": 90, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.02160333691588603, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.236328125, "lr": 3e-05, "finish_rate": 0.792, "comp_len": 566.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 212}, "mem_gb": 22.12} |
| [eval step 90] sample: "To solve this problem, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that the given equations are satisfied. Let's break down the problem step-by-step:\n\n1. **Define Variable" |
| {"step": 91, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01650589420837738, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.234375, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 221}, "mem_gb": 22.09} |
| {"step": 92, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.013465291119840307, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.1826171875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 242}, "mem_gb": 22.09} |
| {"step": 93, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01404507189298941, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.212890625, "lr": 3e-05, "finish_rate": 0.836, "comp_len": 545.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 220}, "mem_gb": 22.05} |
| {"step": 94, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01276353889235373, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.1923828125, "lr": 3e-05, "finish_rate": 0.896, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 240}, "mem_gb": 21.95} |
| {"step": 95, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01450902842770641, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.2109375, "lr": 3e-05, "finish_rate": 0.728, "comp_len": 582.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 206}, "mem_gb": 22.08} |
| {"step": 96, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01776092460920336, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.21875, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 531.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 226}, "mem_gb": 22.09} |
| {"step": 97, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.02220483287217406, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.24609375, "lr": 3e-05, "finish_rate": 0.877, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 244}, "mem_gb": 21.88} |
| {"step": 98, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.017873613287787884, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.234375, "lr": 3e-05, "finish_rate": 0.804, "comp_len": 535.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 224}, "mem_gb": 22.1} |
| {"step": 99, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014570516015263274, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.212890625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 271}, "mem_gb": 21.82} |
| {"step": 100, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015648798539291603, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.23046875, "lr": 3e-05, "finish_rate": 0.856, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 236}, "mem_gb": 22.1} |
| [eval step 100] sample: "To solve the given system of equations, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the equations hold true.\n\nLet's break " |
| checkpoint snapshot queued -> outputs/healed/grid_math/glean_keep75_s1224/step0100 |
| {"step": 101, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01392048208489238, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.205078125, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 232}, "mem_gb": 21.97} |
| {"step": 102, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.01582302356507086, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.234375, "lr": 3e-05, "finish_rate": 0.79, "comp_len": 571.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 210}, "mem_gb": 22.03} |
| {"step": 103, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.015148047948399714, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.2333984375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 553.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 217}, "mem_gb": 22.0} |
| {"step": 104, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.016510671148794547, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.22265625, "lr": 3e-05, "finish_rate": 0.839, "comp_len": 535.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 224}, "mem_gb": 22.12} |
| {"step": 105, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.020347583135644283, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.287109375, "lr": 3e-05, "finish_rate": 0.749, "comp_len": 591.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 203}, "mem_gb": 21.96} |
| {"step": 106, "epoch": 1, "training_mode": "off-policy", "forward_topk_kl": 0.014199156087749482, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.2041015625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 239}, "mem_gb": 22.06} |
| {"step": 107, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.008977783386060036, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.1494140625, "lr": 3e-05, "finish_rate": 0.902, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 254}, "mem_gb": 21.98} |
| {"step": 108, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010862475730893979, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.19140625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 497.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 241}, "mem_gb": 22.07} |
| {"step": 109, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014401656335553464, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.2099609375, "lr": 3e-05, "finish_rate": 0.746, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 213}, "mem_gb": 22.1} |
| {"step": 110, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014489341427544909, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.2138671875, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 221}, "mem_gb": 22.15} |
| [eval step 110] sample: "To solve this problem, we need to determine the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that the given equations are satisfied. Let's break down the problem step-by-step:\n\n1. **Understand" |
| {"step": 111, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.013501541669142898, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.1865234375, "lr": 3e-05, "finish_rate": 0.745, "comp_len": 612.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 196}, "mem_gb": 22.11} |
| {"step": 112, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.008731955103940951, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.13671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 270}, "mem_gb": 21.91} |
| {"step": 113, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010822844643716235, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.181640625, "lr": 3e-05, "finish_rate": 0.815, "comp_len": 555.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 216}, "mem_gb": 22.09} |
| {"step": 114, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.011418462452020807, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.1728515625, "lr": 3e-05, "finish_rate": 0.775, "comp_len": 600.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 200}, "mem_gb": 22.06} |
| {"step": 115, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010639629699802026, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.1640625, "lr": 3e-05, "finish_rate": 0.767, "comp_len": 582.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 206}, "mem_gb": 22.01} |
| {"step": 116, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009322874530012874, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.140625, "lr": 3e-05, "finish_rate": 0.902, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 234}, "mem_gb": 22.04} |
| {"step": 117, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.01033369288703737, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.1552734375, "lr": 3e-05, "finish_rate": 0.823, "comp_len": 558.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 215}, "mem_gb": 22.05} |
| {"step": 118, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.01243805469731257, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.197265625, "lr": 3e-05, "finish_rate": 0.922, "comp_len": 470.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 255}, "mem_gb": 22.03} |
| {"step": 119, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010969508257628574, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.2890625, "lr": 3e-05, "finish_rate": 0.892, "comp_len": 480.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 250}, "mem_gb": 21.92} |
| {"step": 120, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009528974813098709, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.146484375, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 242}, "mem_gb": 22.09} |
| [eval step 120] sample: "To solve this problem, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the given equations are satisfied.\n\nLet's break down th" |
| {"step": 121, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.012388043802530349, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.1689453125, "lr": 3e-05, "finish_rate": 0.729, "comp_len": 603.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 199}, "mem_gb": 22.1} |
| {"step": 122, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.015805441350703282, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.2158203125, "lr": 3e-05, "finish_rate": 0.784, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 208}, "mem_gb": 22.13} |
| {"step": 123, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.012433360835929245, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.2177734375, "lr": 3e-05, "finish_rate": 0.764, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 208}, "mem_gb": 22.07} |
| {"step": 124, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014551944470048572, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.208984375, "lr": 3e-05, "finish_rate": 0.732, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 209}, "mem_gb": 22.22} |
| {"step": 125, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009675193485268392, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.16796875, "lr": 3e-05, "finish_rate": 0.855, "comp_len": 510.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 235}, "mem_gb": 22.05} |
| {"step": 126, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.011770741490732569, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.1943359375, "lr": 3e-05, "finish_rate": 0.74, "comp_len": 588.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 204}, "mem_gb": 22.04} |
| {"step": 127, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014998916014590457, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.275390625, "lr": 3e-05, "finish_rate": 0.745, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 208}, "mem_gb": 22.1} |
| {"step": 128, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.011279444927962807, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.1845703125, "lr": 3e-05, "finish_rate": 0.825, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 240}, "mem_gb": 22.09} |
| {"step": 129, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010361070156555312, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.18359375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 246}, "mem_gb": 22.08} |
| {"step": 130, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009969970819191076, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.1513671875, "lr": 3e-05, "finish_rate": 0.909, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 243}, "mem_gb": 21.91} |
| [eval step 130] sample: "To solve this problem, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(r\\) such that each letter represents a non-zero digit and the given equations are satisfied.\n\nLet's break down th" |
| {"step": 131, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.01188105622678607, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.162109375, "lr": 3e-05, "finish_rate": 0.745, "comp_len": 576.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 208}, "mem_gb": 22.1} |
| {"step": 132, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.013685301415641636, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.1875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 219}, "mem_gb": 22.1} |
| {"step": 133, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014316876399792575, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.193359375, "lr": 3e-05, "finish_rate": 0.782, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 211}, "mem_gb": 22.11} |
| {"step": 134, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014087832710818232, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.2236328125, "lr": 3e-05, "finish_rate": 0.862, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 232}, "mem_gb": 22.07} |
| {"step": 135, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.01439627331920977, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.1748046875, "lr": 3e-05, "finish_rate": 0.804, "comp_len": 560.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 214}, "mem_gb": 22.1} |
| {"step": 136, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010959521841653623, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.1640625, "lr": 3e-05, "finish_rate": 0.819, "comp_len": 531.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 226}, "mem_gb": 21.99} |
| {"step": 137, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010081585236514609, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.1787109375, "lr": 3e-05, "finish_rate": 0.819, "comp_len": 571.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 210}, "mem_gb": 22.1} |
| {"step": 138, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010659327802799332, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.1826171875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 550.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 218}, "mem_gb": 21.93} |
| {"step": 139, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010789314434929595, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.158203125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 233}, "mem_gb": 22.08} |
| {"step": 140, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.014221973552062022, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.185546875, "lr": 3e-05, "finish_rate": 0.786, "comp_len": 558.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 215}, "mem_gb": 22.1} |
| [eval step 140] sample: "To solve the given system of equations, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the equations hold true.\n\nLet's break " |
| {"step": 141, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010910056351528813, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.169921875, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 233}, "mem_gb": 22.08} |
| {"step": 142, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.011350942074880004, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.1953125, "lr": 3e-05, "finish_rate": 0.766, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 209}, "mem_gb": 22.03} |
| {"step": 143, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.00926427476175207, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.158203125, "lr": 3e-05, "finish_rate": 0.908, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 262}, "mem_gb": 21.97} |
| {"step": 144, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.011766176097157102, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.1787109375, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 249}, "mem_gb": 22.06} |
| {"step": 145, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.013218875605349118, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.1904296875, "lr": 3e-05, "finish_rate": 0.819, "comp_len": 528.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 227}, "mem_gb": 22.09} |
| {"step": 146, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009844068101909943, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.150390625, "lr": 3e-05, "finish_rate": 0.814, "comp_len": 543.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 221}, "mem_gb": 22.09} |
| {"step": 147, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.010795413363662859, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.1689453125, "lr": 3e-05, "finish_rate": 0.859, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 234}, "mem_gb": 22.1} |
| {"step": 148, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.01047869203084847, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.197265625, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 213}, "mem_gb": 22.05} |
| {"step": 149, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.009803685631471066, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.1435546875, "lr": 3e-05, "finish_rate": 0.836, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 213}, "mem_gb": 21.99} |
| {"step": 150, "epoch": 2, "training_mode": "off-policy", "forward_topk_kl": 0.00903664315190787, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.1455078125, "lr": 3e-05, "finish_rate": 0.906, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 234}, "mem_gb": 22.02} |
| [eval step 150] sample: "To solve the given system of equations, we need to find the values of \\(a\\), \\(b\\), \\(k\\), \\(m\\), and \\(p\\) such that each letter represents a non-zero digit and the equations are satisfied.\n\nLet's br" |
| checkpoint snapshot queued -> outputs/healed/grid_math/glean_keep75_s1224/step0150 |
| wandb: updating run metadata |
| wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml |
| wandb: |
| wandb: Run history: |
| wandb: comp_len ββββββββ
β
βββββ
ββββββββββ
β
βββββ
β
ββ
βββ
β
βββ
|
| wandb: cumulative_loss_tokens ββββββββββββββββββββββββ
β
βββββββββββββββ |
| wandb: epoch ββββββββββββββββββ
β
β
β
β
β
β
β
β
β
β
β
β
β
β
ββββββββ |
| wandb: finish_rate ββ
ββββββ
βββββββββββ
βββββ
βββ
β
ββββββββ
βββ
β |
| wandb: forward_topk_kl β
βββββββββββββββββββββββββββββββββββββββ |
| wandb: grad_norm ββ
ββββββββββββββββββββββββββββββββββββββ |
| wandb: lr ββββββββββββββββββββββββββββββββββββββββ |
| wandb: mem_gb βββββ
βββββββββ
ββββ
βββββββ
βββββββ
β
β
ββββββ |
| wandb: step ββββββββββββββββββββ
β
β
β
β
β
β
β
β
ββββββββββββ |
| wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ |
| wandb: +3 ... |
| wandb: |
| wandb: Run summary: |
| wandb: comp_len 512.8 |
| wandb: cumulative_loss_tokens 18000000 |
| wandb: epoch 2 |
| wandb: finish_rate 0.906 |
| wandb: forward_topk_kl 0.00904 |
| wandb: grad_norm 0.14551 |
| wandb: lr 3e-05 |
| wandb: mem_gb 22.02 |
| wandb: step 150 |
| wandb: t_data_s 0 |
| wandb: +4 ... |
| wandb: |
| wandb: π View run glean-math-keep75-s1224 at: https://wandb.ai/hbfreed/glean-grid/runs/d06of2kq |
| wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-grid |
| wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s) |
| wandb: Find logs at: outputs/healed/grid_math/glean_keep75_s1224/wandb/run-20260716_151441-d06of2kq/logs |
| { |
| "correct": 905, |
| "accuracy": 0.686125852918878, |
| "finished": 1314, |
| "finish_rate": 0.9962092494313874, |
| "mean_completion_tokens": 113.11675511751326 |
| } |
| saved item-level results -> outputs/evals/grid_math/glean_keep75_s1224_step100_chat.json |
| { |
| "correct": 912, |
| "accuracy": 0.6914329037149356, |
| "finished": 1314, |
| "finish_rate": 0.9962092494313874, |
| "mean_completion_tokens": 113.21000758150113 |
| } |
| saved item-level results -> outputs/evals/grid_math/glean_keep75_s1224_step150_chat.json |
| |