hbfreed commited on
Commit
4e816d8
Β·
verified Β·
1 Parent(s): 9d757f9

Add files using upload-large-folder tool

Browse files
This view is limited to 50 files because it contains too many changes. Β  See raw diff
Files changed (50) hide show
  1. healed/canary_512_g4/args.json +44 -0
  2. healed/canary_512_g4/train_log.jsonl +7 -0
  3. healed/canary_512_g4/vllm_server.log +265 -0
  4. healed/grid_general/gengrid.log +160 -0
  5. healed/grid_general/glean_keep25_s1224.console.log +213 -0
  6. healed/grid_general/glean_keep25_s1224.eval.log +0 -0
  7. healed/grid_general/glean_keep25_s1225.console.log +213 -0
  8. healed/grid_general/glean_keep25_s1225.eval.log +0 -0
  9. healed/grid_general/glean_keep25_s1226.console.log +212 -0
  10. healed/grid_general/glean_keep25_s1226.eval.log +0 -0
  11. healed/grid_general/glean_keep50_s1224.console.log +216 -0
  12. healed/grid_general/glean_keep50_s1224.eval.log +0 -0
  13. healed/grid_general/glean_keep50_s1225.console.log +216 -0
  14. healed/grid_general/glean_keep50_s1225.eval.log +0 -0
  15. healed/grid_general/glean_keep50_s1226.console.log +216 -0
  16. healed/grid_general/glean_keep50_s1226.eval.log +0 -0
  17. healed/grid_general/glean_keep75_s1224.console.log +216 -0
  18. healed/grid_general/glean_keep75_s1224.eval.log +0 -0
  19. healed/grid_general/glean_keep75_s1225.console.log +215 -0
  20. healed/grid_general/glean_keep75_s1225.eval.log +0 -0
  21. healed/grid_general/glean_keep75_s1226.console.log +215 -0
  22. healed/grid_general/glean_keep75_s1226.eval.log +0 -0
  23. healed/grid_general/reap_keep25_s1224.console.log +213 -0
  24. healed/grid_general/reap_keep25_s1224.eval.log +0 -0
  25. healed/grid_general/reap_keep25_s1225.console.log +213 -0
  26. healed/grid_general/reap_keep25_s1225.eval.log +0 -0
  27. healed/grid_general/reap_keep25_s1226.console.log +213 -0
  28. healed/grid_general/reap_keep25_s1226.eval.log +0 -0
  29. healed/grid_general/reap_keep50_s1224.console.log +215 -0
  30. healed/grid_general/reap_keep50_s1224.eval.log +0 -0
  31. healed/grid_general/reap_keep50_s1225.console.log +216 -0
  32. healed/grid_general/reap_keep50_s1225.eval.log +70 -0
  33. healed/grid_general/reap_keep50_s1226.console.log +217 -0
  34. healed/grid_general/reap_keep50_s1226.eval.log +0 -0
  35. healed/grid_general/reap_keep75_s1224.console.log +216 -0
  36. healed/grid_general/reap_keep75_s1224.eval.log +0 -0
  37. healed/grid_general/reap_keep75_s1225.console.log +392 -0
  38. healed/grid_general/reap_keep75_s1225.eval.log +0 -0
  39. healed/grid_general/reap_keep75_s1226.console.log +215 -0
  40. healed/grid_general/reap_keep75_s1226.eval.log +71 -0
  41. healed/grid_general/uniform_keep25_s1224.console.log +212 -0
  42. healed/grid_general/uniform_keep25_s1224.eval.log +0 -0
  43. healed/grid_general/uniform_keep25_s1225.console.log +212 -0
  44. healed/grid_general/uniform_keep25_s1225.eval.log +0 -0
  45. healed/grid_general/uniform_keep25_s1226.console.log +213 -0
  46. healed/grid_general/uniform_keep25_s1226.eval.log +0 -0
  47. healed/grid_general/uniform_keep50_s1224.console.log +215 -0
  48. healed/grid_general/uniform_keep50_s1224.eval.log +0 -0
  49. healed/grid_general/uniform_keep50_s1225.console.log +216 -0
  50. healed/grid_general/uniform_keep50_s1225.eval.log +0 -0
healed/canary_512_g4/args.json ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "student": "outputs/pruned/glean-0125inst-math-keep5",
3
+ "teacher": "allenai/OLMoE-1B-7B-0125-Instruct",
4
+ "dataset": "allenai/RLVR-MATH",
5
+ "dataset_sources": null,
6
+ "max_difficulty": null,
7
+ "teacher_device": "cuda:0",
8
+ "student_device": "cuda:1",
9
+ "lr": 3e-05,
10
+ "optimizer": "adamw8bit",
11
+ "weight_decay": 0.1,
12
+ "epochs": 4,
13
+ "prompts_per_step": 256,
14
+ "group_size": 4,
15
+ "rollout_batch": 64,
16
+ "micro_batch": 4,
17
+ "max_new_tokens": 512,
18
+ "max_prompt_len": 1024,
19
+ "warmup_steps": 5,
20
+ "max_grad_norm": 1.0,
21
+ "eval_every": 10,
22
+ "gsm8k_every": 5,
23
+ "gsm8k_n": 64,
24
+ "gsm8k_batch": 16,
25
+ "save_every": 25,
26
+ "out_dir": "outputs/healed/canary_512_g4",
27
+ "sweep": 5,
28
+ "wandb": false,
29
+ "wandb_project": "glean-heal",
30
+ "wandb_run_name": null,
31
+ "debug": false,
32
+ "resume_from": null,
33
+ "start_step": 0,
34
+ "no_grad_checkpointing": false,
35
+ "seed": 1223,
36
+ "rollout_engine": "vllm",
37
+ "vllm_gpu": "GPU-864c54df-0130-7780-e271-8a5551d1733f",
38
+ "vllm_port": 8377,
39
+ "vllm_refresh_every": 1,
40
+ "vllm_serve_bin": "vllm-plugin/.venv25/bin/python",
41
+ "vllm_gpu_mem_util": 0.85,
42
+ "vllm_refresh_mode": "reload",
43
+ "vllm_live_dir": "/dev/shm/glean_vllm_live"
44
+ }
healed/canary_512_g4/train_log.jsonl ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {"step": 1, "epoch": 0, "reverse_kl": 0.30979594500512125, "tokens": 104839, "grad_norm": 4.75, "lr": 1.2e-05, "finish_rate": 0.461, "comp_len": 409.5, "t_rollout_s": 36.5, "t_step_s": 149.9, "t_refresh_s": 0.4, "mem_gb": 16.88}
2
+ {"step": 1, "gsm8k_quick": 0.484375, "gsm8k_n": 64, "t_eval_s": 46.3}
3
+ {"step": 2, "epoch": 0, "reverse_kl": 0.31237369027154915, "tokens": 97970, "grad_norm": 4.3125, "lr": 1.8e-05, "finish_rate": 0.586, "comp_len": 382.7, "t_rollout_s": 34.5, "t_step_s": 135.4, "t_refresh_s": 0.4, "mem_gb": 18.64}
4
+ {"step": 3, "epoch": 0, "reverse_kl": 0.21176254702495886, "tokens": 100793, "grad_norm": 3.734375, "lr": 2.4e-05, "finish_rate": 0.52, "comp_len": 393.7, "t_rollout_s": 35.2, "t_step_s": 136.0, "t_refresh_s": 0.4, "mem_gb": 17.01}
5
+ {"step": 4, "epoch": 0, "reverse_kl": 0.22271002861383504, "tokens": 81381, "grad_norm": 4.75, "lr": 3e-05, "finish_rate": 0.703, "comp_len": 317.9, "t_rollout_s": 30.9, "t_step_s": 126.4, "t_refresh_s": 0.4, "mem_gb": 16.89}
6
+ {"step": 5, "epoch": 0, "reverse_kl": 0.19559442095853996, "tokens": 91708, "grad_norm": 2.578125, "lr": 3e-05, "finish_rate": 0.629, "comp_len": 358.2, "t_rollout_s": 33.8, "t_step_s": 120.9, "t_refresh_s": 0.0, "mem_gb": 17.05}
7
+ {"step": 5, "gsm8k_quick": 0.453125, "gsm8k_n": 64, "t_eval_s": 33.7}
healed/canary_512_g4/vllm_server.log ADDED
@@ -0,0 +1,265 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339]
2
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] β–ˆ β–ˆ β–ˆβ–„ β–„β–ˆ
3
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] β–„β–„ β–„β–ˆ β–ˆ β–ˆ β–ˆ β–€β–„β–€ β–ˆ version 0.25.0
4
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] β–ˆβ–„β–ˆβ–€ β–ˆ β–ˆ β–ˆ β–ˆ model outputs/pruned/glean-0125inst-math-keep5
5
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] β–€β–€ β–€β–€β–€β–€β–€ β–€β–€β–€β–€β–€ β–€ β–€
6
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339]
7
+ (APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:273] non-default args: {'model_tag': 'outputs/pruned/glean-0125inst-math-keep5', 'host': '127.0.0.1', 'port': 8377, 'model': 'outputs/pruned/glean-0125inst-math-keep5', 'max_model_len': 2048, 'enforce_eager': True, 'served_model_name': ['student'], 'gpu_memory_utilization': 0.85}
8
+ (APIServer pid=313310) INFO 07-12 09:45:06 [model.py:619] Resolved architecture: OlmoeForCausalLM
9
+ (APIServer pid=313310) INFO 07-12 09:45:06 [model.py:1776] Using max model len 2048
10
+ (APIServer pid=313310) INFO 07-12 09:45:06 [vllm.py:1042] Asynchronous scheduling is enabled.
11
+ (APIServer pid=313310) WARNING 07-12 09:45:06 [vllm.py:1096] Enforce eager set, disabling torch.compile and CUDAGraphs. This is equivalent to setting -cc.mode=none -cc.cudagraph_mode=none
12
+ (APIServer pid=313310) WARNING 07-12 09:45:06 [vllm.py:1144] Inductor compilation was disabled by user settings, optimizations settings that are only active during inductor compilation will be ignored.
13
+ (APIServer pid=313310) INFO 07-12 09:45:06 [kernel.py:292] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'])
14
+ (APIServer pid=313310) INFO 07-12 09:45:06 [vllm.py:1322] Cudagraph is disabled under eager mode
15
+ (APIServer pid=313310) INFO 07-12 09:45:06 [compilation.py:312] Enabled custom fusions: norm_quant, act_quant
16
+ (EngineCore pid=313432) INFO 07-12 09:45:13 [core.py:114] Initializing a V1 LLM engine (v0.25.0) with config: model='outputs/pruned/glean-0125inst-math-keep5', speculative_config=None, tokenizer='outputs/pruned/glean-0125inst-math-keep5', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=False, dtype=torch.bfloat16, max_seq_len=2048, download_dir=None, load_format=auto, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=None, quantization_config=None, enforce_eager=True, enable_return_routed_experts=False, kv_cache_dtype=auto, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False, jit_monitor_mode='warn', jit_monitor_verbose=False), seed=0, served_model_name=student, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['all'], 'ir_enable_torch_wrap': False, 'splitting_ops': [], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': [], 'compile_ranges_endpoints': [2048], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'size_asserts': False, 'alignment_asserts': False, 'scalar_asserts': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.NONE: 0>, 'cudagraph_num_of_warmups': 0, 'cudagraph_capture_sizes': [], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': True, 'fuse_act_quant': True, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False, 'fuse_rope_kvcache_cat_mla': False, 'fuse_act_padding': False}, 'max_cudagraph_capture_size': 0, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native']), enable_flashinfer_autotune=True, enable_cutedsl_warmup=True, moe_backend='auto', linear_backend='auto')
17
+ (EngineCore pid=313432) INFO 07-12 09:45:14 [parallel_state.py:1607] world_size=1 rank=0 local_rank=0 distributed_init_method=tcp://192.168.0.15:44129 backend=nccl
18
+ (EngineCore pid=313432) INFO 07-12 09:45:14 [parallel_state.py:1942] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, EP rank 0, EPLB rank N/A
19
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [topk_topp_sampler.py:55] Using FlashInfer for top-p & top-k sampling.
20
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [gpu_model_runner.py:5209] Starting to load model outputs/pruned/glean-0125inst-math-keep5...
21
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [cuda.py:476] Using FLASH_ATTN attention backend out of potential backends: ['FLASH_ATTN', 'FLASHINFER', 'TRITON_ATTN', 'FLEX_ATTENTION'].
22
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [flash_attn.py:718] Using FlashAttention version 2
23
+ (EngineCore pid=313432) /home/henry/Documents/PythonProjects/megablocks-variable/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
24
+ (EngineCore pid=313432) warnings.warn('Grouped GEMM not available.')
25
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [weight_utils.py:849] Filesystem type for checkpoints: EXT4. Checkpoint size: 6.89 GiB. Available RAM: 103.24 GiB.
26
+ (EngineCore pid=313432) INFO 07-12 09:45:15 [weight_utils.py:872] Auto-prefetch is disabled because the filesystem (EXT4) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
27
+ (EngineCore pid=313432)
28
+ (EngineCore pid=313432)
29
+ (EngineCore pid=313432)
30
+ (EngineCore pid=313432)
31
+ (EngineCore pid=313432)
32
+ (EngineCore pid=313432) INFO 07-12 09:45:21 [default_loader.py:430] Loading weights took 5.17 seconds
33
+ (EngineCore pid=313432) INFO 07-12 09:45:21 [gpu_model_runner.py:5306] Model loading took 6.89 GiB memory and 5.349585 seconds
34
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [gpu_worker.py:538] Available KV cache memory: 12.81 GiB
35
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [kv_cache_utils.py:2146] GPU KV cache size: 104,960 tokens
36
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [kv_cache_utils.py:2147] Maximum concurrency for 2,048 tokens per request: 51.25x
37
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [cutedsl_warmup.py:97] Skipping CuTeDSL warmup because no compile units were requested.
38
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [jit_monitor.py:73] Kernel JIT monitor activated; monitored JIT compilations during inference will use mode=warn.
39
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [core.py:344] init engine (profile, create kv cache, warmup model) took 2.10 s
40
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [vllm.py:1042] Asynchronous scheduling is enabled.
41
+ (EngineCore pid=313432) WARNING 07-12 09:45:23 [vllm.py:1096] Enforce eager set, disabling torch.compile and CUDAGraphs. This is equivalent to setting -cc.mode=none -cc.cudagraph_mode=none
42
+ (EngineCore pid=313432) WARNING 07-12 09:45:23 [vllm.py:1144] Inductor compilation was disabled by user settings, optimizations settings that are only active during inductor compilation will be ignored.
43
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [kernel.py:292] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'])
44
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [vllm.py:1322] Cudagraph is disabled under eager mode
45
+ (EngineCore pid=313432) INFO 07-12 09:45:23 [compilation.py:312] Enabled custom fusions: norm_quant, act_quant
46
+ (APIServer pid=313310) INFO 07-12 09:45:23 [api_server.py:612] Supported tasks: ['generate']
47
+ (APIServer pid=313310) WARNING 07-12 09:45:23 [__init__.py:36] SECURITY WARNING: Development endpoints are enabled! This should NOT be used in production!
48
+ (APIServer pid=313310) INFO 07-12 09:45:24 [hf.py:548] Detected the chat template content format to be 'string'. You can set `--chat-template-content-format` to override this.
49
+ (APIServer pid=313310) INFO 07-12 09:45:24 [api_server.py:616] Starting vLLM server on http://127.0.0.1:8377
50
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:37] Available routes are:
51
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /openapi.json, Methods: HEAD, GET
52
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /docs, Methods: HEAD, GET
53
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /docs/oauth2-redirect, Methods: HEAD, GET
54
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /redoc, Methods: HEAD, GET
55
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /load, Methods: GET
56
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /version, Methods: GET
57
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /health, Methods: GET
58
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /metrics, Methods: GET
59
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /tokenize, Methods: POST
60
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /detokenize, Methods: POST
61
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/models, Methods: GET
62
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /ping, Methods: GET
63
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /ping, Methods: POST
64
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /invocations, Methods: POST
65
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_prefix_cache, Methods: POST
66
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_mm_cache, Methods: POST
67
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_encoder_cache, Methods: POST
68
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /pause, Methods: POST
69
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /resume, Methods: POST
70
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_paused, Methods: GET
71
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /init_weight_transfer_engine, Methods: POST
72
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /start_weight_update, Methods: POST
73
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /update_weights, Methods: POST
74
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /finish_weight_update, Methods: POST
75
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /get_world_size, Methods: GET
76
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /collective_rpc, Methods: POST
77
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /server_info, Methods: GET
78
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /sleep, Methods: POST
79
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /wake_up, Methods: POST
80
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_sleeping, Methods: GET
81
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions, Methods: POST
82
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/batch, Methods: POST
83
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses, Methods: POST
84
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses/{response_id}, Methods: GET
85
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses/{response_id}/cancel, Methods: POST
86
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions, Methods: POST
87
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/messages, Methods: POST
88
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/messages/count_tokens, Methods: POST
89
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /generative_scoring, Methods: POST
90
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /scale_elastic_ep, Methods: POST
91
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_scaling_elastic_ep, Methods: POST
92
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/render, Methods: POST
93
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions/render, Methods: POST
94
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/derender, Methods: POST
95
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions/derender, Methods: POST
96
+ (APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /inference/v1/generate, Methods: POST
97
+ (APIServer pid=313310) INFO: Started server process [313310]
98
+ (APIServer pid=313310) INFO: Waiting for application startup.
99
+ (APIServer pid=313310) INFO: Application startup complete.
100
+ (APIServer pid=313310) INFO: 127.0.0.1:45706 - "GET /health HTTP/1.1" 200 OK
101
+ (APIServer pid=313310) INFO 07-12 09:45:34 [loggers.py:273] Engine 000: Avg prompt throughput: 761.1 tokens/s, Avg generation throughput: 1012.8 tokens/s, Running: 256 reqs, Waiting: 0 reqs, GPU KV cache usage: 19.5%, Prefix cache hit rate: 94.9%
102
+ (APIServer pid=313310) INFO 07-12 09:45:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3440.7 tokens/s, Running: 229 reqs, Waiting: 0 reqs, GPU KV cache usage: 48.7%, Prefix cache hit rate: 94.9%
103
+ (APIServer pid=313310) INFO 07-12 09:45:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2944.2 tokens/s, Running: 187 reqs, Waiting: 0 reqs, GPU KV cache usage: 65.3%, Prefix cache hit rate: 94.9%
104
+ (APIServer pid=313310) INFO 07-12 09:46:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2466.3 tokens/s, Running: 144 reqs, Waiting: 0 reqs, GPU KV cache usage: 71.7%, Prefix cache hit rate: 94.9%
105
+ (APIServer pid=313310) INFO: 127.0.0.1:60678 - "POST /v1/completions HTTP/1.1" 200 OK
106
+ (APIServer pid=313310) INFO 07-12 09:46:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 563.3 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.9%
107
+ (APIServer pid=313310) INFO 07-12 09:46:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.9%
108
+ (EngineCore pid=313432) INFO 07-12 09:48:00 [gpu_model_runner.py:5484] Reloading weights inplace...
109
+ (EngineCore pid=313432) INFO 07-12 09:48:00 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 81.72 GiB.
110
+ (EngineCore pid=313432) INFO 07-12 09:48:00 [weight_utils.py:872] Auto-prefetch is disabled because the filesystem (TMPFS) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
111
+ (EngineCore pid=313432)
112
+ (EngineCore pid=313432)
113
+ (EngineCore pid=313432)
114
+ (EngineCore pid=313432)
115
+ (EngineCore pid=313432)
116
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] RotaryEmbedding: Failed to load weights
117
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
118
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
119
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
120
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
121
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
122
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
123
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
124
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
125
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
126
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
127
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
128
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
129
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
130
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
131
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
132
+ (EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
133
+ (EngineCore pid=313432) INFO 07-12 09:48:00 [gpu_model_runner.py:5506] Reloading and processing weights took 0.38 seconds
134
+ (APIServer pid=313310) INFO: 127.0.0.1:59108 - "POST /collective_rpc HTTP/1.1" 200 OK
135
+ (APIServer pid=313310) INFO 07-12 09:48:00 [api_router.py:38] Resetting prefix cache...
136
+ (EngineCore pid=313432) INFO 07-12 09:48:00 [block_pool.py:685] Successfully reset prefix cache
137
+ (APIServer pid=313310) INFO: 127.0.0.1:59112 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
138
+ (APIServer pid=313310) INFO 07-12 09:48:54 [loggers.py:273] Engine 000: Avg prompt throughput: 722.2 tokens/s, Avg generation throughput: 1657.4 tokens/s, Running: 255 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.1%, Prefix cache hit rate: 95.3%
139
+ (APIServer pid=313310) INFO 07-12 09:49:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3331.0 tokens/s, Running: 210 reqs, Waiting: 0 reqs, GPU KV cache usage: 49.4%, Prefix cache hit rate: 95.3%
140
+ (APIServer pid=313310) INFO 07-12 09:49:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2774.3 tokens/s, Running: 160 reqs, Waiting: 0 reqs, GPU KV cache usage: 61.4%, Prefix cache hit rate: 95.3%
141
+ (APIServer pid=313310) INFO: 127.0.0.1:34838 - "POST /v1/completions HTTP/1.1" 200 OK
142
+ (APIServer pid=313310) INFO 07-12 09:49:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2032.8 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.3%
143
+ (APIServer pid=313310) INFO 07-12 09:49:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.3%
144
+ (EngineCore pid=313432) INFO 07-12 09:51:04 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 81.16 GiB.
145
+ (EngineCore pid=313432)
146
+ (EngineCore pid=313432)
147
+ (EngineCore pid=313432)
148
+ (EngineCore pid=313432)
149
+ (EngineCore pid=313432)
150
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] RotaryEmbedding: Failed to load weights
151
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
152
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
153
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
154
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
155
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
156
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
157
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
158
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
159
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
160
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
161
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
162
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
163
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
164
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
165
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
166
+ (EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
167
+ (EngineCore pid=313432) INFO 07-12 09:51:04 [gpu_model_runner.py:5506] Reloading and processing weights took 0.36 seconds
168
+ (APIServer pid=313310) INFO: 127.0.0.1:34692 - "POST /collective_rpc HTTP/1.1" 200 OK
169
+ (APIServer pid=313310) INFO 07-12 09:51:04 [api_router.py:38] Resetting prefix cache...
170
+ (EngineCore pid=313432) INFO 07-12 09:51:04 [block_pool.py:685] Successfully reset prefix cache
171
+ (APIServer pid=313310) INFO: 127.0.0.1:34700 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
172
+ (APIServer pid=313310) INFO 07-12 09:51:14 [loggers.py:273] Engine 000: Avg prompt throughput: 708.4 tokens/s, Avg generation throughput: 3214.8 tokens/s, Running: 236 reqs, Waiting: 0 reqs, GPU KV cache usage: 37.3%, Prefix cache hit rate: 95.4%
173
+ (APIServer pid=313310) INFO 07-12 09:51:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3086.4 tokens/s, Running: 193 reqs, Waiting: 0 reqs, GPU KV cache usage: 57.4%, Prefix cache hit rate: 95.4%
174
+ (APIServer pid=313310) INFO 07-12 09:51:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2572.9 tokens/s, Running: 147 reqs, Waiting: 0 reqs, GPU KV cache usage: 65.6%, Prefix cache hit rate: 95.4%
175
+ (APIServer pid=313310) INFO: 127.0.0.1:34708 - "POST /v1/completions HTTP/1.1" 200 OK
176
+ (APIServer pid=313310) INFO 07-12 09:51:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1204.1 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.4%
177
+ (APIServer pid=313310) INFO 07-12 09:51:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.4%
178
+ (EngineCore pid=313432) INFO 07-12 09:53:20 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 80.95 GiB.
179
+ (EngineCore pid=313432)
180
+ (EngineCore pid=313432)
181
+ (EngineCore pid=313432)
182
+ (EngineCore pid=313432)
183
+ (EngineCore pid=313432)
184
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] RotaryEmbedding: Failed to load weights
185
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
186
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
187
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
188
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
189
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
190
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
191
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
192
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
193
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
194
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
195
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
196
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
197
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
198
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
199
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
200
+ (EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
201
+ (EngineCore pid=313432) INFO 07-12 09:53:20 [gpu_model_runner.py:5506] Reloading and processing weights took 0.37 seconds
202
+ (APIServer pid=313310) INFO: 127.0.0.1:46922 - "POST /collective_rpc HTTP/1.1" 200 OK
203
+ (APIServer pid=313310) INFO 07-12 09:53:20 [api_router.py:38] Resetting prefix cache...
204
+ (EngineCore pid=313432) INFO 07-12 09:53:20 [block_pool.py:685] Successfully reset prefix cache
205
+ (APIServer pid=313310) INFO: 127.0.0.1:46934 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
206
+ (APIServer pid=313310) INFO 07-12 09:53:24 [loggers.py:273] Engine 000: Avg prompt throughput: 653.6 tokens/s, Avg generation throughput: 1152.1 tokens/s, Running: 253 reqs, Waiting: 0 reqs, GPU KV cache usage: 18.9%, Prefix cache hit rate: 95.7%
207
+ (APIServer pid=313310) INFO 07-12 09:53:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3232.5 tokens/s, Running: 175 reqs, Waiting: 0 reqs, GPU KV cache usage: 38.9%, Prefix cache hit rate: 95.7%
208
+ (APIServer pid=313310) INFO 07-12 09:53:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2418.4 tokens/s, Running: 112 reqs, Waiting: 0 reqs, GPU KV cache usage: 44.4%, Prefix cache hit rate: 95.7%
209
+ (APIServer pid=313310) INFO: 127.0.0.1:46942 - "POST /v1/completions HTTP/1.1" 200 OK
210
+ (APIServer pid=313310) INFO 07-12 09:53:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1334.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.7%
211
+ (APIServer pid=313310) INFO 07-12 09:54:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.7%
212
+ (EngineCore pid=313432) INFO 07-12 09:55:26 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 80.88 GiB.
213
+ (EngineCore pid=313432)
214
+ (EngineCore pid=313432)
215
+ (EngineCore pid=313432)
216
+ (EngineCore pid=313432)
217
+ (EngineCore pid=313432)
218
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] RotaryEmbedding: Failed to load weights
219
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
220
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
221
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
222
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
223
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
224
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
225
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
226
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
227
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
228
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
229
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
230
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
231
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
232
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
233
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
234
+ (EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
235
+ (EngineCore pid=313432) INFO 07-12 09:55:27 [gpu_model_runner.py:5506] Reloading and processing weights took 0.36 seconds
236
+ (APIServer pid=313310) INFO: 127.0.0.1:60246 - "POST /collective_rpc HTTP/1.1" 200 OK
237
+ (APIServer pid=313310) INFO 07-12 09:55:27 [api_router.py:38] Resetting prefix cache...
238
+ (EngineCore pid=313432) INFO 07-12 09:55:27 [block_pool.py:685] Successfully reset prefix cache
239
+ (APIServer pid=313310) INFO: 127.0.0.1:60248 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
240
+ (APIServer pid=313310) INFO 07-12 09:55:34 [loggers.py:273] Engine 000: Avg prompt throughput: 867.9 tokens/s, Avg generation throughput: 2331.0 tokens/s, Running: 238 reqs, Waiting: 0 reqs, GPU KV cache usage: 30.9%, Prefix cache hit rate: 94.6%
241
+ (APIServer pid=313310) INFO 07-12 09:55:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3106.6 tokens/s, Running: 182 reqs, Waiting: 0 reqs, GPU KV cache usage: 49.8%, Prefix cache hit rate: 94.6%
242
+ (APIServer pid=313310) INFO 07-12 09:55:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2462.0 tokens/s, Running: 127 reqs, Waiting: 0 reqs, GPU KV cache usage: 55.3%, Prefix cache hit rate: 94.6%
243
+ (APIServer pid=313310) INFO: 127.0.0.1:60262 - "POST /v1/completions HTTP/1.1" 200 OK
244
+ (APIServer pid=313310) INFO 07-12 09:56:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1270.7 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.6%
245
+ (APIServer pid=313310) INFO 07-12 09:56:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.6%
246
+ (EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1214] [shutdown] EngineCore: trigger received signal=SIGTERM
247
+ (APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:100] [shutdown] API server: shutdown triggered
248
+ (APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:116] [shutdown] API server: stopping engine client mode=abort timeout=0s
249
+ (EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1333] [shutdown] EngineCore: start mode=abort timeout=0s
250
+ (EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1364] [shutdown] EngineCore: request processing complete; starting resource teardown
251
+ (EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1227] [shutdown] EngineCore: exiting busy loop
252
+ (APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:655] [shutdown] MPClient: start timeout=0s
253
+ (APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:657] [shutdown] MPClient: stopping engine manager
254
+ (APIServer pid=313310) WARNING 07-12 09:58:17 [utils.py:626] [shutdown] Process manager: force killing remaining processes count=1
255
+ (APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:659] [shutdown] MPClient: engine manager stopped
256
+ (APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:660] [shutdown] MPClient: cleaning up background resources
257
+ (APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:662] [shutdown] MPClient: complete
258
+ (APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:125] [shutdown] API server: engine client stopped
259
+ (APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:128] [shutdown] API server: signalling HTTP server shutdown
260
+ (APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:149] [shutdown] API server: shutting down FastAPI HTTP server
261
+ (APIServer pid=313310) INFO: Shutting down
262
+ (APIServer pid=313310) INFO: Waiting for application shutdown.
263
+ (APIServer pid=313310) INFO: Application shutdown complete.
264
+ /home/henry/.local/share/uv/python/cpython-3.12.12-linux-x86_64-gnu/lib/python3.12/multiprocessing/resource_tracker.py:279: UserWarning: resource_tracker: There appear to be 1 leaked semaphore objects to clean up at shutdown
265
+ warnings.warn('resource_tracker: There appear to be %d '
healed/grid_general/gengrid.log ADDED
@@ -0,0 +1,160 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-07-17T12:49:16-07:00 ###### GENERAL HEAL GRID START ######
2
+ 2026-07-17T12:49:16-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
3
+ 2026-07-17T12:49:16-07:00 HEAL glean_keep25_s1224 on GPU 0
4
+ 2026-07-17T12:51:46-07:00 HEAL glean_keep25_s1225 on GPU 1
5
+ 2026-07-17T12:54:16-07:00 HEAL glean_keep25_s1226 on GPU 2
6
+ 2026-07-17T14:37:21-07:00 EVAL glean_keep25_s1225 on GPU 1 (port 8421)
7
+ 2026-07-17T14:38:49-07:00 EVAL glean_keep25_s1226 on GPU 2 (port 8422)
8
+ 2026-07-17T14:46:16-07:00 EVAL glean_keep25_s1224 on GPU 0 (port 8420)
9
+ 2026-07-17T14:54:32-07:00 glean_keep25_s1225 done -> outputs/evals/general_suite/healed/glean_keep25_s1225/student/results_2026-07-17T14-54-29.755565.json
10
+ 2026-07-17T14:54:32-07:00 HEAL reap_keep25_s1225 on GPU 1
11
+ 2026-07-17T14:54:47-07:00 glean_keep25_s1226 done -> outputs/evals/general_suite/healed/glean_keep25_s1226/student/results_2026-07-17T14-54-44.918246.json
12
+ 2026-07-17T14:54:47-07:00 HEAL reap_keep25_s1226 on GPU 2
13
+ 2026-07-17T15:01:02-07:00 glean_keep25_s1224 done -> outputs/evals/general_suite/healed/glean_keep25_s1224/student/results_2026-07-17T14-56-42.779609.json
14
+ 2026-07-17T15:01:02-07:00 HEAL reap_keep25_s1224 on GPU 0
15
+ 2026-07-17T17:15:39-07:00 EVAL reap_keep25_s1226 on GPU 2 (port 8422)
16
+ 2026-07-17T17:17:04-07:00 EVAL reap_keep25_s1225 on GPU 1 (port 8421)
17
+ 2026-07-17T17:27:41-07:00 reap_keep25_s1226 done -> outputs/evals/general_suite/healed/reap_keep25_s1226/student/results_2026-07-17T17-27-38.590201.json
18
+ 2026-07-17T17:27:41-07:00 HEAL uniform_keep25_s1226 on GPU 2
19
+ 2026-07-17T17:29:13-07:00 reap_keep25_s1225 done -> outputs/evals/general_suite/healed/reap_keep25_s1225/student/results_2026-07-17T17-29-11.051064.json
20
+ 2026-07-17T17:29:13-07:00 HEAL uniform_keep25_s1225 on GPU 1
21
+ 2026-07-17T17:31:30-07:00 EVAL reap_keep25_s1224 on GPU 0 (port 8420)
22
+ 2026-07-17T17:45:54-07:00 reap_keep25_s1224 done -> outputs/evals/general_suite/healed/reap_keep25_s1224/student/results_2026-07-17T17-45-52.249309.json
23
+ 2026-07-17T17:45:54-07:00 HEAL uniform_keep25_s1224 on GPU 0
24
+ 2026-07-17T19:01:19-07:00 EVAL uniform_keep25_s1226 on GPU 2 (port 8422)
25
+ 2026-07-17T19:03:56-07:00 EVAL uniform_keep25_s1225 on GPU 1 (port 8421)
26
+ 2026-07-17T19:16:25-07:00 uniform_keep25_s1226 done -> outputs/evals/general_suite/healed/uniform_keep25_s1226/student/results_2026-07-17T19-16-23.025416.json
27
+ 2026-07-17T19:16:25-07:00 lane GPU2 (rung 25) complete
28
+ 2026-07-17T19:19:15-07:00 uniform_keep25_s1225 done -> outputs/evals/general_suite/healed/uniform_keep25_s1225/student/results_2026-07-17T19-19-12.985404.json
29
+ 2026-07-17T19:19:15-07:00 lane GPU1 (rung 25) complete
30
+ 2026-07-17T19:34:39-07:00 EVAL uniform_keep25_s1224 on GPU 0 (port 8420)
31
+ 2026-07-18T07:28:17-07:00 ###### GENERAL HEAL GRID START ######
32
+ 2026-07-18T07:28:17-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
33
+ 2026-07-18T07:28:17-07:00 glean_keep25_s1224 already evaled, skip
34
+ 2026-07-18T07:28:17-07:00 reap_keep25_s1224 already evaled, skip
35
+ 2026-07-18T07:28:17-07:00 uniform_keep25_s1224 already evaled, skip
36
+ 2026-07-18T07:28:17-07:00 lane GPU0 (rung 25) complete
37
+ 2026-07-18T07:30:47-07:00 glean_keep25_s1225 already evaled, skip
38
+ 2026-07-18T07:30:47-07:00 reap_keep25_s1225 already evaled, skip
39
+ 2026-07-18T07:30:47-07:00 uniform_keep25_s1225 already evaled, skip
40
+ 2026-07-18T07:30:47-07:00 lane GPU1 (rung 25) complete
41
+ 2026-07-18T07:33:17-07:00 glean_keep25_s1226 already evaled, skip
42
+ 2026-07-18T07:33:17-07:00 reap_keep25_s1226 already evaled, skip
43
+ 2026-07-18T07:33:17-07:00 uniform_keep25_s1226 already evaled, skip
44
+ 2026-07-18T07:33:17-07:00 lane GPU2 (rung 25) complete
45
+ 2026-07-18T07:35:47-07:00 === RUNG keep-25 COMPLETE ===
46
+ 2026-07-18T07:35:47-07:00 === RUNG keep-50 on 3 GPUs (0 1 2), 9 cells ===
47
+ 2026-07-18T07:35:47-07:00 HEAL glean_keep50_s1224 on GPU 0
48
+ 2026-07-18T07:38:17-07:00 HEAL glean_keep50_s1225 on GPU 1
49
+ 2026-07-18T07:40:47-07:00 HEAL glean_keep50_s1226 on GPU 2
50
+ 2026-07-18T09:48:07-07:00 EVAL glean_keep50_s1225 on GPU 1 (port 8421)
51
+ 2026-07-18T09:49:18-07:00 EVAL glean_keep50_s1226 on GPU 2 (port 8422)
52
+ 2026-07-18T10:02:01-07:00 EVAL glean_keep50_s1224 on GPU 0 (port 8420)
53
+ 2026-07-18T10:02:49-07:00 glean_keep50_s1225 done -> outputs/evals/general_suite/healed/glean_keep50_s1225/student/results_2026-07-18T09-58-04.824177.json
54
+ 2026-07-18T10:02:49-07:00 HEAL reap_keep50_s1225 on GPU 1
55
+ 2026-07-18T10:03:36-07:00 glean_keep50_s1226 done -> outputs/evals/general_suite/healed/glean_keep50_s1226/student/results_2026-07-18T09-59-02.269145.json
56
+ 2026-07-18T10:03:36-07:00 HEAL reap_keep50_s1226 on GPU 2
57
+ 2026-07-18T10:15:23-07:00 EVAL glean_keep50_s1224 step100 on GPU 0 (port 8420)
58
+ 2026-07-18T10:29:22-07:00 glean_keep50_s1224 done -> outputs/evals/general_suite/healed/glean_keep50_s1224/student/results_2026-07-18T10-11-54.989656.json
59
+ 2026-07-18T10:29:22-07:00 HEAL reap_keep50_s1224 on GPU 0
60
+ 2026-07-18T12:35:16-07:00 EVAL reap_keep50_s1226 on GPU 2 (port 8422)
61
+ 2026-07-18T12:36:25-07:00 EVAL reap_keep50_s1225 on GPU 1 (port 8421)
62
+ 2026-07-18T12:45:14-07:00 reap_keep50_s1226 done -> outputs/evals/general_suite/healed/reap_keep50_s1226/student/results_2026-07-18T12-41-23.273535.json
63
+ 2026-07-18T12:45:14-07:00 HEAL uniform_keep50_s1226 on GPU 2
64
+ 2026-07-18T12:46:34-07:00 reap_keep50_s1225 done -> outputs/evals/general_suite/healed/reap_keep50_s1225/student/results_2026-07-18T12-42-34.448591.json
65
+ 2026-07-18T12:46:34-07:00 HEAL uniform_keep50_s1225 on GPU 1
66
+ 2026-07-18T13:19:55-07:00 EVAL reap_keep50_s1224 on GPU 0 (port 8420)
67
+ 2026-07-18T13:32:15-07:00 EVAL reap_keep50_s1224 step100 on GPU 0 (port 8420)
68
+ 2026-07-18T13:44:07-07:00 reap_keep50_s1224 done -> outputs/evals/general_suite/healed/reap_keep50_s1224/student/results_2026-07-18T13-32-13.179265.json
69
+ 2026-07-18T13:44:07-07:00 HEAL uniform_keep50_s1224 on GPU 0
70
+ 2026-07-18T14:45:53-07:00 EVAL uniform_keep50_s1226 on GPU 2 (port 8422)
71
+ 2026-07-18T14:48:15-07:00 EVAL uniform_keep50_s1225 on GPU 1 (port 8421)
72
+ 2026-07-18T14:58:35-07:00 uniform_keep50_s1226 done -> outputs/evals/general_suite/healed/uniform_keep50_s1226/student/results_2026-07-18T14-58-32.761745.json
73
+ 2026-07-18T14:58:35-07:00 lane GPU2 (rung 50) complete
74
+ 2026-07-18T15:01:22-07:00 uniform_keep50_s1225 done -> outputs/evals/general_suite/healed/uniform_keep50_s1225/student/results_2026-07-18T14-57-45.707275.json
75
+ 2026-07-18T15:01:22-07:00 lane GPU1 (rung 50) complete
76
+ 2026-07-18T15:57:10-07:00 EVAL uniform_keep50_s1224 on GPU 0 (port 8420)
77
+ 2026-07-18T16:10:17-07:00 EVAL uniform_keep50_s1224 step100 on GPU 0 (port 8420)
78
+ 2026-07-18T16:23:54-07:00 uniform_keep50_s1224 done -> outputs/evals/general_suite/healed/uniform_keep50_s1224/student/results_2026-07-18T16-10-14.760456.json
79
+ 2026-07-18T16:23:54-07:00 lane GPU0 (rung 50) complete
80
+ 2026-07-18T16:23:54-07:00 === RUNG keep-50 COMPLETE ===
81
+ 2026-07-18T16:23:54-07:00 === RUNG keep-75 on 2 GPUs (0 1), 9 cells ===
82
+ 2026-07-18T16:23:54-07:00 HEAL glean_keep75_s1224 on GPU 0
83
+ 2026-07-18T16:26:24-07:00 HEAL glean_keep75_s1225 on GPU 1
84
+ 2026-07-18T18:56:00-07:00 EVAL glean_keep75_s1224 on GPU 0 (port 8420)
85
+ 2026-07-18T19:05:45-07:00 EVAL glean_keep75_s1225 on GPU 1 (port 8421)
86
+ 2026-07-18T19:09:27-07:00 EVAL glean_keep75_s1224 step100 on GPU 0 (port 8420)
87
+ 2026-07-18T19:19:41-07:00 glean_keep75_s1225 done -> outputs/evals/general_suite/healed/glean_keep75_s1225/student/results_2026-07-18T19-16-03.625490.json
88
+ 2026-07-18T19:19:41-07:00 HEAL reap_keep75_s1224 on GPU 1
89
+ 2026-07-18T19:23:11-07:00 glean_keep75_s1224 done -> outputs/evals/general_suite/healed/glean_keep75_s1224/student/results_2026-07-18T19-05-59.656656.json
90
+ 2026-07-18T19:23:11-07:00 HEAL glean_keep75_s1226 on GPU 0
91
+ 2026-07-18T22:05:21-07:00 EVAL reap_keep75_s1224 on GPU 1 (port 8421)
92
+ 2026-07-18T22:14:46-07:00 EVAL reap_keep75_s1224 step100 on GPU 1 (port 8421)
93
+ 2026-07-18T22:24:15-07:00 reap_keep75_s1224 done -> outputs/evals/general_suite/healed/reap_keep75_s1224/student/results_2026-07-18T22-11-41.709032.json
94
+ 2026-07-18T22:24:15-07:00 HEAL reap_keep75_s1226 on GPU 1
95
+ 2026-07-18T22:26:48-07:00 EVAL glean_keep75_s1226 on GPU 0 (port 8420)
96
+ 2026-07-18T22:40:19-07:00 glean_keep75_s1226 done -> outputs/evals/general_suite/healed/glean_keep75_s1226/student/results_2026-07-18T22-36-41.957915.json
97
+ 2026-07-18T22:40:19-07:00 HEAL reap_keep75_s1225 on GPU 0
98
+ 2026-07-19T00:19:17-07:00 reap_keep75_s1225 HEAL FAILED (no step150)
99
+ 2026-07-19T00:19:17-07:00 HEAL uniform_keep75_s1224 on GPU 0
100
+ 2026-07-19T01:12:55-07:00 EVAL reap_keep75_s1226 on GPU 1 (port 8421)
101
+ 2026-07-19T01:22:06-07:00 reap_keep75_s1226 done -> outputs/evals/general_suite/healed/reap_keep75_s1226/student/results_2026-07-19T01-22-04.019724.json
102
+ 2026-07-19T01:22:06-07:00 HEAL uniform_keep75_s1225 on GPU 1
103
+ 2026-07-19T01:49:38-07:00 uniform_keep75_s1225 HEAL FAILED (no step150)
104
+ 2026-07-19T01:49:38-07:00 lane GPU1 (rung 75) complete
105
+ 2026-07-19T02:45:32-07:00 EVAL uniform_keep75_s1224 on GPU 0 (port 8420)
106
+ 2026-07-19T02:58:55-07:00 EVAL uniform_keep75_s1224 step100 on GPU 0 (port 8420)
107
+ 2026-07-19T03:12:33-07:00 uniform_keep75_s1224 done -> outputs/evals/general_suite/healed/uniform_keep75_s1224/student/results_2026-07-19T02-58-53.335416.json
108
+ 2026-07-19T03:12:33-07:00 HEAL uniform_keep75_s1226 on GPU 0
109
+ 2026-07-19T05:37:29-07:00 EVAL uniform_keep75_s1226 on GPU 0 (port 8420)
110
+ 2026-07-19T05:51:02-07:00 uniform_keep75_s1226 done -> outputs/evals/general_suite/healed/uniform_keep75_s1226/student/results_2026-07-19T05-50-59.443956.json
111
+ 2026-07-19T05:51:02-07:00 lane GPU0 (rung 75) complete
112
+ 2026-07-19T05:51:02-07:00 === RUNG keep-75 COMPLETE ===
113
+ 2026-07-19T05:51:02-07:00 ###### GENERAL HEAL GRID COMPLETE ######
114
+ 2026-07-19T07:42:25-07:00 ###### GENERAL HEAL GRID START ######
115
+ 2026-07-19T07:42:25-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
116
+ 2026-07-19T07:42:25-07:00 glean_keep25_s1224 already evaled, skip
117
+ 2026-07-19T07:42:25-07:00 reap_keep25_s1224 already evaled, skip
118
+ 2026-07-19T07:42:25-07:00 uniform_keep25_s1224 already evaled, skip
119
+ 2026-07-19T07:42:25-07:00 lane GPU0 (rung 25) complete
120
+ 2026-07-19T07:44:55-07:00 glean_keep25_s1225 already evaled, skip
121
+ 2026-07-19T07:44:55-07:00 reap_keep25_s1225 already evaled, skip
122
+ 2026-07-19T07:44:55-07:00 uniform_keep25_s1225 already evaled, skip
123
+ 2026-07-19T07:44:55-07:00 lane GPU1 (rung 25) complete
124
+ 2026-07-19T07:47:25-07:00 glean_keep25_s1226 already evaled, skip
125
+ 2026-07-19T07:47:25-07:00 reap_keep25_s1226 already evaled, skip
126
+ 2026-07-19T07:47:25-07:00 uniform_keep25_s1226 already evaled, skip
127
+ 2026-07-19T07:47:25-07:00 lane GPU2 (rung 25) complete
128
+ 2026-07-19T07:49:55-07:00 === RUNG keep-25 COMPLETE ===
129
+ 2026-07-19T07:49:55-07:00 === RUNG keep-50 on 3 GPUs (0 1 2), 9 cells ===
130
+ 2026-07-19T07:49:55-07:00 glean_keep50_s1224 already evaled, skip
131
+ 2026-07-19T07:49:55-07:00 reap_keep50_s1224 already evaled, skip
132
+ 2026-07-19T07:49:55-07:00 uniform_keep50_s1224 already evaled, skip
133
+ 2026-07-19T07:49:55-07:00 lane GPU0 (rung 50) complete
134
+ 2026-07-19T07:52:25-07:00 glean_keep50_s1225 already evaled, skip
135
+ 2026-07-19T07:52:25-07:00 reap_keep50_s1225 already evaled, skip
136
+ 2026-07-19T07:52:25-07:00 uniform_keep50_s1225 already evaled, skip
137
+ 2026-07-19T07:52:25-07:00 lane GPU1 (rung 50) complete
138
+ 2026-07-19T07:54:55-07:00 glean_keep50_s1226 already evaled, skip
139
+ 2026-07-19T07:54:55-07:00 reap_keep50_s1226 already evaled, skip
140
+ 2026-07-19T07:54:55-07:00 uniform_keep50_s1226 already evaled, skip
141
+ 2026-07-19T07:54:55-07:00 lane GPU2 (rung 50) complete
142
+ 2026-07-19T07:57:25-07:00 === RUNG keep-50 COMPLETE ===
143
+ 2026-07-19T07:57:25-07:00 === RUNG keep-75 on 2 GPUs (0 1), 9 cells ===
144
+ 2026-07-19T07:57:25-07:00 glean_keep75_s1224 already evaled, skip
145
+ 2026-07-19T07:57:25-07:00 glean_keep75_s1226 already evaled, skip
146
+ 2026-07-19T07:57:25-07:00 HEAL reap_keep75_s1225 on GPU 0
147
+ 2026-07-19T07:59:55-07:00 glean_keep75_s1225 already evaled, skip
148
+ 2026-07-19T07:59:55-07:00 reap_keep75_s1224 already evaled, skip
149
+ 2026-07-19T07:59:55-07:00 reap_keep75_s1226 already evaled, skip
150
+ 2026-07-19T07:59:55-07:00 HEAL uniform_keep75_s1225 on GPU 1
151
+ 2026-07-19T10:54:23-07:00 EVAL reap_keep75_s1225 on GPU 0 (port 8420)
152
+ 2026-07-19T11:04:17-07:00 reap_keep75_s1225 done -> outputs/evals/general_suite/healed/reap_keep75_s1225/student/results_2026-07-19T11-01-06.595488.json
153
+ 2026-07-19T11:04:17-07:00 uniform_keep75_s1224 already evaled, skip
154
+ 2026-07-19T11:04:17-07:00 uniform_keep75_s1226 already evaled, skip
155
+ 2026-07-19T11:04:17-07:00 lane GPU0 (rung 75) complete
156
+ 2026-07-19T11:52:31-07:00 EVAL uniform_keep75_s1225 on GPU 1 (port 8421)
157
+ 2026-07-19T12:05:59-07:00 uniform_keep75_s1225 done -> outputs/evals/general_suite/healed/uniform_keep75_s1225/student/results_2026-07-19T12-05-54.836521.json
158
+ 2026-07-19T12:05:59-07:00 lane GPU1 (rung 75) complete
159
+ 2026-07-19T12:05:59-07:00 === RUNG keep-75 COMPLETE ===
160
+ 2026-07-19T12:05:59-07:00 ###### GENERAL HEAL GRID COMPLETE ######
healed/grid_general/glean_keep25_s1224.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run lpq2f0lo
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1224/wandb/run-20260717_124922-lpq2f0lo
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep25_s1224
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/lpq2f0lo
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.230232952358822, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 18.125, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 259}, "mem_gb": 9.93}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'The rank of the matrix is 4.\n\n\n\nExplanation:\nThe matrix contains four distinct integers: 12, -16, 4, and -8. Each of these integers is different. Therefore, the rank of the matrix is 4.\n\n\n\n\n\n\n\n\n\n\n\n\n'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7555008484855295, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 23.5, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 348}, "mem_gb": 9.59}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5307058254199724, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 13.375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 370}, "mem_gb": 9.74}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7830725133789083, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.1875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 244}, "mem_gb": 9.98}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1955481514299908, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.28125, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 320}, "mem_gb": 9.9}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3044716434742014, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.71875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 378}, "mem_gb": 9.49}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.452664390789966, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.84375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 384}, "mem_gb": 9.99}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2374622819642227, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 324}, "mem_gb": 9.84}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5717071391055981, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 239}, "mem_gb": 10.0}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1515966722741724, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.546875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 306}, "mem_gb": 9.74}
25
+ [eval step 10] sample: 'To compute the rank of a 4x4 matrix, we need to determine the number of linearly independent rows or columns in the matrix. The rank of a matrix is the number of linearly independent rows or columns.\n'
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1663353991595407, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 329}, "mem_gb": 9.78}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5732789917799334, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.34375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 254}, "mem_gb": 10.01}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9218004519566894, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.984375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.9, "frames": {"chat": 273}, "mem_gb": 9.98}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3943379741191864, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 236}, "mem_gb": 9.9}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1741832443614801, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 381}, "mem_gb": 9.64}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4743189287646363, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 266}, "mem_gb": 9.83}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7200682055724164, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 308}, "mem_gb": 9.82}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5685026399575174, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 273}, "mem_gb": 10.0}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.965660633458073, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 368}, "mem_gb": 9.63}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1254668449434142, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.2109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 339}, "mem_gb": 9.88}
36
+ [eval step 20] sample: 'To determine the rank of a 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the given matrix. This is done by performing row reduction (or elimination) operati'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6083429135009646, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 298}, "mem_gb": 9.8}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9495863987863064, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 350}, "mem_gb": 9.53}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5129962862101693, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 246}, "mem_gb": 9.97}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9368743329118937, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.0546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 375}, "mem_gb": 9.7}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9464652672618628, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 352}, "mem_gb": 9.76}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9558642008572816, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 396}, "mem_gb": 9.71}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7860169070002934, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 362}, "mem_gb": 9.57}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0082796115246913, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 369}, "mem_gb": 9.77}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.009116009711971, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 399}, "mem_gb": 9.62}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4846179143540561, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 247}, "mem_gb": 9.9}
47
+ [eval step 30] sample: 'To determine the rank of a 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. This involves performing row reduction (or elimination) operations to r'
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22527380605190991, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 230}, "mem_gb": 9.83}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4463476555825521, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 263}, "mem_gb": 10.0}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4649241888465981, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 264}, "mem_gb": 9.99}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8147876140392075, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 328}, "mem_gb": 9.85}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4231523534525807, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 281}, "mem_gb": 9.93}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3249024557450165, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 237}, "mem_gb": 9.91}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039089362307141, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 278}, "mem_gb": 10.0}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8169043293373038, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 310}, "mem_gb": 9.87}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5213651200753792, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 295}, "mem_gb": 9.81}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5716980821558585, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 329}, "mem_gb": 9.83}
58
+ [eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the matrix as follows:\n\\[\nA = \\begin{pmatrix}\n12 & -16"
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.515681032132109, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 263}, "mem_gb": 9.94}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5583567329570651, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 315}, "mem_gb": 9.83}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7827952124347289, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 354}, "mem_gb": 9.78}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33834826097066206, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 259}, "mem_gb": 9.95}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.535996689457198, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 275}, "mem_gb": 9.81}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.761962819148538, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 334}, "mem_gb": 9.67}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7991849290193369, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 374}, "mem_gb": 9.53}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6587553056004146, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 311}, "mem_gb": 9.7}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5646433477637668, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 259}, "mem_gb": 10.0}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6755613154624899, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 305}, "mem_gb": 9.99}
69
+ [eval step 50] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. For a 4x4 matrix, we can use various methods, including row reduction (Gaussian elimin'
70
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6236642312885573, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 298}, "mem_gb": 9.96}
71
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8659690618770818, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 364}, "mem_gb": 9.74}
72
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4402219339902823, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 302}, "mem_gb": 9.85}
73
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8718686241495113, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 316}, "mem_gb": 9.61}
74
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9186581234411647, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 312}, "mem_gb": 9.7}
75
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6314163563566904, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 330}, "mem_gb": 9.86}
76
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6280176534157247, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 321}, "mem_gb": 9.86}
77
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.676628557317083, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 344}, "mem_gb": 9.89}
78
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7451332750880469, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 353}, "mem_gb": 9.57}
79
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3671483270462292, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 272}, "mem_gb": 10.0}
80
+ [eval step 60] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. \n\nLet's start by converting the matrix into row-echelon form (REF) using Gaussian elimina"
81
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8607330310590565, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 317}, "mem_gb": 9.74}
82
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35653378598367175, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 292}, "mem_gb": 9.74}
83
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1951703331221516, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 229}, "mem_gb": 9.86}
84
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.786070414811559, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 359}, "mem_gb": 9.86}
85
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7170421186082065, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 358}, "mem_gb": 9.59}
86
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8479278815058371, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 315}, "mem_gb": 9.97}
87
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5007196825118114, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 264}, "mem_gb": 10.05}
88
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7986173901910583, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 337}, "mem_gb": 9.71}
89
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39695811266700426, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 251}, "mem_gb": 10.01}
90
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.58340040049615, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 298}, "mem_gb": 9.73}
91
+ [eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's start by writing down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n"
92
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4847553086879974, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 264}, "mem_gb": 9.95}
93
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48543966890014706, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 305}, "mem_gb": 9.96}
94
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46550742264433453, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 322}, "mem_gb": 9.74}
95
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7916732936594635, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 361}, "mem_gb": 9.72}
96
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5088260187707531, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 321}, "mem_gb": 9.9}
97
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6609323742570355, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 307}, "mem_gb": 9.8}
98
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7717183587286621, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 327}, "mem_gb": 9.89}
99
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8418425931031506, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 356}, "mem_gb": 9.51}
100
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3909381251984586, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 283}, "mem_gb": 9.86}
101
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7662618677861989, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 401}, "mem_gb": 9.61}
102
+ [eval step 80] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( n \\) if it has \\( n \\) linearly independent rows or col'
103
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5011390567759052, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 288}, "mem_gb": 9.81}
104
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6264763125145808, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 323}, "mem_gb": 9.85}
105
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.858884850747635, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 336}, "mem_gb": 9.74}
106
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6986745096847415, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 329}, "mem_gb": 9.64}
107
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6883494295466691, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 343}, "mem_gb": 9.63}
108
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.714498685978353, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 336}, "mem_gb": 9.75}
109
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6667983782338599, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 9.98}
110
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41439470696250597, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 281}, "mem_gb": 9.82}
111
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5404754282862569, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 299}, "mem_gb": 9.69}
112
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6631877648853386, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 328}, "mem_gb": 9.88}
113
+ [eval step 90] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's break down the problem into smaller steps and solve it using Python and SymPy.\n\n###"
114
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5152765134019777, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 271}, "mem_gb": 9.98}
115
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5397345383686324, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 269}, "mem_gb": 10.08}
116
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8142568668286005, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 370}, "mem_gb": 9.63}
117
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8570075749141475, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 352}, "mem_gb": 9.69}
118
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7482497710308681, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 330}, "mem_gb": 9.89}
119
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6091186967118022, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 334}, "mem_gb": 9.62}
120
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6094944001651058, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 336}, "mem_gb": 9.75}
121
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44065201980068036, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 309}, "mem_gb": 9.84}
122
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.750593746100987, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 391}, "mem_gb": 9.73}
123
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3937398470057795, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 264}, "mem_gb": 10.12}
124
+ [eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's start by writing down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16"
125
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6405833819416662, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 349}, "mem_gb": 9.68}
126
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6110699118683736, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 312}, "mem_gb": 9.73}
127
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22543682222130398, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 229}, "mem_gb": 10.0}
128
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.571418999376893, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 288}, "mem_gb": 10.0}
129
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7974187780410051, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 351}, "mem_gb": 9.66}
130
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3170151141561568, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 223}, "mem_gb": 10.02}
131
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1569358562398081, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.7, "frames": {"chat": 213}, "mem_gb": 9.99}
132
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7303174932712689, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 380}, "mem_gb": 9.84}
133
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41821051687517513, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 271}, "mem_gb": 10.02}
134
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7821986571711799, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 340}, "mem_gb": 9.91}
135
+ [eval step 110] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
136
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8301274567630142, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 366}, "mem_gb": 9.61}
137
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.299316186900499, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 233}, "mem_gb": 10.0}
138
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5317195191866407, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.6, "frames": {"chat": 312}, "mem_gb": 9.86}
139
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7483980015807474, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 363}, "mem_gb": 9.58}
140
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7562728609332194, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 323}, "mem_gb": 9.85}
141
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8216717583857477, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 346}, "mem_gb": 9.59}
142
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7373267066142212, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 1.0234375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 318}, "mem_gb": 9.74}
143
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5497194940060377, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 275}, "mem_gb": 9.92}
144
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6847652262626837, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 345}, "mem_gb": 9.67}
145
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.686522659535706, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 377}, "mem_gb": 9.82}
146
+ [eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
147
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5571660259227579, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 294}, "mem_gb": 10.04}
148
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7721854376189411, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 338}, "mem_gb": 9.73}
149
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.775954254207636, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 352}, "mem_gb": 9.63}
150
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7303574244684229, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 347}, "mem_gb": 9.68}
151
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4477207079838961, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 310}, "mem_gb": 9.66}
152
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8195232594630371, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 358}, "mem_gb": 9.69}
153
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.472922162405774, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 319}, "mem_gb": 9.97}
154
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31340620313100515, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 269}, "mem_gb": 10.0}
155
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6118611890931304, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 310}, "mem_gb": 9.85}
156
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3994562356161264, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 259}, "mem_gb": 10.03}
157
+ [eval step 130] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
158
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39424919714008766, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 265}, "mem_gb": 10.0}
159
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7736657298201074, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 337}, "mem_gb": 9.55}
160
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4310107218934844, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 290}, "mem_gb": 9.81}
161
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6810150410573309, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 349}, "mem_gb": 9.75}
162
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43771783427683014, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 291}, "mem_gb": 9.84}
163
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6974321913416808, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 342}, "mem_gb": 9.71}
164
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8007760579209775, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 338}, "mem_gb": 9.66}
165
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7884519690003247, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 356}, "mem_gb": 9.62}
166
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3688757979504764, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 265}, "mem_gb": 10.0}
167
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6384047362486521, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 353}, "mem_gb": 9.71}
168
+ [eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
169
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6027499658275396, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 316}, "mem_gb": 9.9}
170
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5025881632997654, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 289}, "mem_gb": 10.05}
171
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5405622877730056, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 331}, "mem_gb": 9.69}
172
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5336027219651267, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 320}, "mem_gb": 10.0}
173
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48749642031074814, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 272}, "mem_gb": 9.74}
174
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8456337846264244, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 368}, "mem_gb": 9.66}
175
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6977787470727538, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 328}, "mem_gb": 9.68}
176
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6741483884370575, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 326}, "mem_gb": 9.9}
177
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.779587540318879, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 364}, "mem_gb": 9.84}
178
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49224459458068015, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 296}, "mem_gb": 9.88}
179
+ [eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
180
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1224/step0150
181
+ wandb: updating run metadata
182
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–β–β–β–†β–…β–β–‚β–‡β–…β–…β–…β–‚β–β–„β–β–„β–‡β–ƒβ–ƒβ–ƒβ–‚β–ƒβ–ƒβ–‚β–‚β–‚β–‡β–ˆβ–…β–‡β–ƒβ–β–ƒβ–…β–…β–‚β–…β–ƒβ–ƒβ–„
186
+ wandb: cumulative_loss_tokens β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–ˆβ–ˆβ–‡β–ƒβ–ˆβ–…β–„β–…β–ƒβ–‡β–ˆβ–ˆβ–‡β–ˆβ–‡β–ˆβ–„β–ˆβ–…β–„β–‡β–ˆβ–ˆβ–…β–ˆβ–ˆβ–‚β–β–ˆβ–ˆβ–ˆβ–ˆβ–†β–…β–ˆβ–ˆβ–ƒβ–ˆβ–†β–ˆ
189
+ wandb: forward_topk_kl β–†β–ƒβ–„β–„β–‡β–ˆβ–†β–ˆβ–‚β–„β–†β–…β–„β–ƒβ–…β–β–…β–†β–„β–…β–‡β–…β–…β–„β–„β–…β–ƒβ–…β–‚β–†β–†β–†β–„β–‚β–…β–ƒβ–…β–‚β–…β–„
190
+ wandb: grad_norm β–ˆβ–ƒβ–ƒβ–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–…β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–‚β–†β–‡β–„β–‡β–‚β–‚β–„β–‚β–‡β–…β–…β–†β–ƒβ–β–…β–…β–…β–…β–‡β–„β–†β–…β–‚β–„β–…β–ˆβ–ƒβ–ƒβ–‡β–…β–ƒβ–…β–‚β–ƒβ–β–…β–ˆβ–‡β–ƒ
193
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: t_data_s β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 405.4
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.97
202
+ wandb: forward_topk_kl 0.49224
203
+ wandb: grad_norm 0.625
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.88
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run glean_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/lpq2f0lo
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1224/wandb/run-20260717_124922-lpq2f0lo/logs
healed/grid_general/glean_keep25_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep25_s1225.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run 8j8lz7cs
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1225/wandb/run-20260717_125152-8j8lz7cs
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep25_s1225
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/8j8lz7cs
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.808664998525381, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 23.5, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 331}, "mem_gb": 9.8}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: "To solve this problem, we'll break it into parts and then sum up the contributions over the respective periods.\n\n\n\n1. **Calculate the contribution from the salary:**\n - The salary contribution is $2"
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6490384441773096, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 20.25, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 342}, "mem_gb": 9.62}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8595948845709365, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 15.0, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 358}, "mem_gb": 9.66}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4889224458272259, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 9.6875, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 344}, "mem_gb": 9.75}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0059059998517235, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 6.5625, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 267}, "mem_gb": 10.06}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6072625180219611, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 4.8125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.8, "frames": {"chat": 248}, "mem_gb": 9.89}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2357142568791906, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 5.59375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 329}, "mem_gb": 9.89}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2724269317929944, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.515625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 339}, "mem_gb": 9.85}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4072858887024224, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 354}, "mem_gb": 9.84}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7663721626664202, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 2.078125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 279}, "mem_gb": 9.98}
25
+ [eval step 10] sample: 'To solve this problem, we need to determine how many months it takes for Jamie to reach their goal of $1,000,000, taking into account both the savings from their salary and the investment account.\n\n1.'
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9231008924469352, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.0, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 318}, "mem_gb": 9.91}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6380429365500808, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 265}, "mem_gb": 9.99}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5771318466238677, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 254}, "mem_gb": 9.94}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8742825336570541, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 2.640625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 315}, "mem_gb": 9.97}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.120795498397698, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 5.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 300}, "mem_gb": 9.76}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7312215218304347, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.40625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 276}, "mem_gb": 9.97}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0663405254211278, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 356}, "mem_gb": 9.91}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0379273822988073, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 304}, "mem_gb": 9.72}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0042938261387249, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 375}, "mem_gb": 9.63}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5647936842045437, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 294}, "mem_gb": 9.99}
36
+ [eval step 20] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000 from their salary and investment account, starting with $50,000.\n\n### Step-by-Step Solution:\n\n1. **Calcul'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9247926180583735, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 299}, "mem_gb": 10.01}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7130216178910186, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 305}, "mem_gb": 9.78}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.418694871489207, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 262}, "mem_gb": 9.84}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.603906989720588, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 303}, "mem_gb": 9.9}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9305493552699685, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 380}, "mem_gb": 9.78}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5438824022031079, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 282}, "mem_gb": 9.73}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8633251890461892, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 362}, "mem_gb": 9.75}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8607526977756371, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 307}, "mem_gb": 9.99}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5916882254637778, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 282}, "mem_gb": 9.85}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.86052832568114, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 337}, "mem_gb": 9.88}
47
+ [eval step 30] sample: "To solve this problem, we need to determine how many months Jamie will save $2,500 each month from their salary to reach a total of $1,000,000, starting with $50,000.\n\nLet's break down the problem int"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5451407793821146, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 275}, "mem_gb": 9.94}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9271899215554198, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 318}, "mem_gb": 9.75}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9928629991871615, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 385}, "mem_gb": 9.78}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.060265746624271, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 316}, "mem_gb": 9.73}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4527844850036005, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 266}, "mem_gb": 10.02}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9415984902149688, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 371}, "mem_gb": 9.76}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979632269239674, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 262}, "mem_gb": 9.96}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9448449456247191, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 348}, "mem_gb": 9.78}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21057665411898246, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 222}, "mem_gb": 10.02}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.868826575763151, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 408}, "mem_gb": 9.59}
58
+ [eval step 40] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the savings from their salary and the interest earned in the investment account.\n\n**Step'
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8230532644172509, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 334}, "mem_gb": 9.65}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47232350602597, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 312}, "mem_gb": 9.7}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8151439497067904, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 352}, "mem_gb": 9.69}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7589573763786505, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 371}, "mem_gb": 9.5}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5294070899101595, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 284}, "mem_gb": 9.95}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3935093100932737, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 287}, "mem_gb": 10.01}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3682084949952861, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 285}, "mem_gb": 9.91}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2808545169170325, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.5, "frames": {"chat": 252}, "mem_gb": 10.0}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7845809511312594, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 360}, "mem_gb": 9.79}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8424313151545202, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 359}, "mem_gb": 9.78}
69
+ [eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the savings from their salary and the interest earned in their investment account.\n\n**St'
70
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8550375819439069, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 363}, "mem_gb": 9.54}
71
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.764513291883717, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 361}, "mem_gb": 9.63}
72
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4931147550482924, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 286}, "mem_gb": 9.81}
73
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8408041382790854, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 367}, "mem_gb": 9.66}
74
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9257178456825514, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 352}, "mem_gb": 9.69}
75
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5609224415198589, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 314}, "mem_gb": 9.65}
76
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7388688722477605, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 372}, "mem_gb": 9.62}
77
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.705404400226598, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 334}, "mem_gb": 9.76}
78
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8756686551661541, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 368}, "mem_gb": 9.71}
79
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6709957558674117, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 354}, "mem_gb": 9.85}
80
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their savings rate and investment earnings.\n\n**Step 1: Calculate the total amount Jamie needs to s'
81
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3953444012318427, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 293}, "mem_gb": 9.74}
82
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25339365453707674, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 231}, "mem_gb": 9.91}
83
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6489625876778116, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 302}, "mem_gb": 9.87}
84
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4221036484990269, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 263}, "mem_gb": 10.01}
85
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4714730351532499, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 252}, "mem_gb": 9.95}
86
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6591646950072299, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 344}, "mem_gb": 9.98}
87
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6125024421208849, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 313}, "mem_gb": 9.9}
88
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7075878290592382, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 358}, "mem_gb": 9.6}
89
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3412743373590832, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 267}, "mem_gb": 9.82}
90
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7347268351024637, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 300}, "mem_gb": 9.7}
91
+ [eval step 70] sample: "To solve this problem, we need to account for both the savings from the salary and the interest earned in the investment account. Here's how we can break it down:\n\n1. **Savings from Salary:**\n - Jam"
92
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5927675150064131, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 348}, "mem_gb": 9.63}
93
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7361111811776956, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 329}, "mem_gb": 9.72}
94
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.403465011487777, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 269}, "mem_gb": 9.88}
95
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7740006979161252, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 358}, "mem_gb": 9.55}
96
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4715089300878346, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 302}, "mem_gb": 9.81}
97
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7797536961656064, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 381}, "mem_gb": 9.83}
98
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8289630578834564, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 379}, "mem_gb": 9.77}
99
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7941317317076028, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 351}, "mem_gb": 9.6}
100
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6950912625260651, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 330}, "mem_gb": 9.8}
101
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7434162690609694, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 316}, "mem_gb": 9.83}
102
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate the tot'
103
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47566973968750487, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 276}, "mem_gb": 10.01}
104
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3946109107866883, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 240}, "mem_gb": 9.94}
105
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46658366727797934, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 288}, "mem_gb": 9.85}
106
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4257884032201022, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 271}, "mem_gb": 9.84}
107
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6815474520326903, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 357}, "mem_gb": 9.79}
108
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8438355850890279, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 354}, "mem_gb": 9.77}
109
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.837819870460406, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 302}, "mem_gb": 10.01}
110
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6064989772940675, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 297}, "mem_gb": 9.99}
111
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22212638277349372, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.5, "frames": {"chat": 219}, "mem_gb": 10.01}
112
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7732856466734161, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 306}, "mem_gb": 9.72}
113
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate Monthly Savings**\n\nJamie saves'
114
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7946177243828774, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 343}, "mem_gb": 9.65}
115
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7305633843132605, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 341}, "mem_gb": 9.77}
116
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45646875621403254, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 318}, "mem_gb": 9.71}
117
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8368425393072267, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 346}, "mem_gb": 9.6}
118
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4000354012981678, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 277}, "mem_gb": 10.08}
119
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39692016389817, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 270}, "mem_gb": 9.81}
120
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4675862306990971, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 257}, "mem_gb": 10.0}
121
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7792795856350412, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 363}, "mem_gb": 9.6}
122
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7666938890318696, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 356}, "mem_gb": 9.74}
123
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6893483106290922, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 323}, "mem_gb": 9.77}
124
+ [eval step 100] sample: "To solve this problem, we need to account for both the savings from the salary and the interest from the investment account. Here's how we can break it down:\n\n1. **Savings from Salary:**\n Jamie save"
125
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36820247387966765, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 243}, "mem_gb": 10.03}
126
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7245171230147283, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 307}, "mem_gb": 9.71}
127
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6720854982158169, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 346}, "mem_gb": 9.94}
128
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531413590718061, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 273}, "mem_gb": 9.94}
129
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46155412019652625, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 302}, "mem_gb": 9.87}
130
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6441218554573134, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 337}, "mem_gb": 10.0}
131
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979432533910498, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 280}, "mem_gb": 9.88}
132
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8506731971150885, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 331}, "mem_gb": 9.78}
133
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5165925833797083, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 314}, "mem_gb": 9.88}
134
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8715233616360774, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 294}, "mem_gb": 9.81}
135
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to grow their savings from $50,000 to $1,000,000, given that they save $2,500 each month and earn an interest of $300 per'
136
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41161180766212446, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 274}, "mem_gb": 9.94}
137
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6689115083934118, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 365}, "mem_gb": 9.66}
138
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4316471886374677, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 323}, "mem_gb": 9.73}
139
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2950278613418962, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 234}, "mem_gb": 10.01}
140
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35773489913015316, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 267}, "mem_gb": 10.01}
141
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46336869763278715, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 304}, "mem_gb": 9.78}
142
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.707697455116113, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 373}, "mem_gb": 9.7}
143
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4384852448521182, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 300}, "mem_gb": 9.98}
144
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7770776163614045, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 331}, "mem_gb": 9.82}
145
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34997980083189906, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 259}, "mem_gb": 9.96}
146
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their savings and investment details.\n\n**Step 1: Calculate '
147
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6869527579843998, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 358}, "mem_gb": 9.58}
148
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.792673924513782, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 354}, "mem_gb": 9.84}
149
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3958263121607403, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 279}, "mem_gb": 9.9}
150
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8055727958844354, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 354}, "mem_gb": 9.65}
151
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7518758239301543, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 334}, "mem_gb": 9.86}
152
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7586497875315448, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 327}, "mem_gb": 9.72}
153
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7333687149317314, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 365}, "mem_gb": 9.82}
154
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41114167728517204, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 252}, "mem_gb": 10.03}
155
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33496633312044044, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 256}, "mem_gb": 9.99}
156
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42111990845073016, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 302}, "mem_gb": 9.77}
157
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their savings and investment details.\n\n**Step 1: Calculate '
158
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6953495802962532, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 350}, "mem_gb": 9.67}
159
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.428776480944703, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 292}, "mem_gb": 9.79}
160
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6902216596338898, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 356}, "mem_gb": 9.6}
161
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49320213941087326, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 347}, "mem_gb": 9.77}
162
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42928083049748095, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 330}, "mem_gb": 9.96}
163
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7220965905600538, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 363}, "mem_gb": 9.82}
164
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6609605204746127, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 354}, "mem_gb": 9.68}
165
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3630611923115328, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 270}, "mem_gb": 9.95}
166
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6802514189558103, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 343}, "mem_gb": 9.72}
167
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18309974884192148, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.9, "frames": {"chat": 232}, "mem_gb": 9.91}
168
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000 from their savings and investment account, given their monthly savings and the interest earned.\n\n**Ste'
169
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6306400136097023, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 346}, "mem_gb": 9.86}
170
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5116529365332797, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 306}, "mem_gb": 9.95}
171
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34303080869025243, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 273}, "mem_gb": 9.99}
172
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3763906318192681, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 266}, "mem_gb": 9.82}
173
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5723603961752107, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 299}, "mem_gb": 10.01}
174
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40002196048907934, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 259}, "mem_gb": 10.1}
175
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4529625337978825, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 325}, "mem_gb": 9.83}
176
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42111575560091685, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 271}, "mem_gb": 9.91}
177
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6778534247227634, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 359}, "mem_gb": 9.69}
178
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6548494756745795, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 345}, "mem_gb": 9.75}
179
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000 from their savings and investment account, given their monthly savings and the interest earned.\n\n**Ste'
180
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1225/step0150
181
+ wandb: updating run metadata
182
+ wandb: uploading wandb-summary.json; uploading config.yaml; uploading output.log
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–‚β–‚β–‚β–„β–β–„β–„β–β–„β–…β–ƒβ–β–‡β–‚β–„β–‚β–„β–β–β–ƒβ–‡β–„β–‚β–‚β–†β–‚β–ƒβ–…β–β–ƒβ–†β–‚β–ƒβ–„β–‚β–‚β–ˆβ–„β–„β–‚
186
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–ˆβ–ˆβ–†β–‡β–…β–†β–„β–ˆβ–„β–β–ˆβ–„β–…β–ƒβ–ˆβ–‡β–„β–‡β–‡β–ˆβ–ˆβ–„β–‚β–†β–…β–ˆβ–‚β–ˆβ–ˆβ–ˆβ–ˆβ–„β–ƒβ–‡β–†β–ˆβ–ˆβ–…β–‡β–ˆ
189
+ wandb: forward_topk_kl β–ˆβ–‡β–…β–„β–…β–‚β–…β–ƒβ–ƒβ–„β–…β–β–„β–„β–„β–ƒβ–„β–ƒβ–„β–„β–ƒβ–‚β–‚β–„β–„β–„β–„β–ƒβ–‚β–ƒβ–‚β–‚β–„β–„β–‚β–‚β–„β–β–‚β–‚
190
+ wandb: grad_norm β–ˆβ–„β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–‚β–ƒβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–†β–…β–‡β–‡β–‡β–„β–ˆβ–ˆβ–…β–„β–‡β–‡β–ˆβ–†β–β–ƒβ–ƒβ–‚β–„β–ƒβ–„β–†β–ˆβ–‡β–β–ˆβ–ƒβ–ˆβ–‚β–„β–†β–…β–„β–ˆβ–ˆβ–…β–†β–…β–ƒβ–…
193
+ wandb: step β–β–β–β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆ
194
+ wandb: t_data_s β–ˆβ–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 347.8
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.997
202
+ wandb: forward_topk_kl 0.65485
203
+ wandb: grad_norm 0.71875
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.75
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run glean_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/8j8lz7cs
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1225/wandb/run-20260717_125152-8j8lz7cs/logs
healed/grid_general/glean_keep25_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep25_s1226.console.log ADDED
@@ -0,0 +1,212 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1226/wandb/run-20260717_125422-n3zawkef
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run glean_keep25_s1226
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/n3zawkef
11
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
12
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3049798537532489, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 20.25, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 308}, "mem_gb": 9.9}
13
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
14
+ [eval step 1] sample: 'To solve the problem, we start by expressing the terms in the arithmetic sequence in terms based on the common difference $d$. \n\nGiven $a_1 + 3a_8 + a_{15} = 120$, we can write $a_1 + 3a_8 + a_{15} = '
15
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7685427623917659, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 12.0625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 31.1, "frames": {"chat": 211}, "mem_gb": 10.0}
16
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1137424003382523, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 11.4375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 281}, "mem_gb": 9.99}
17
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5672404122143984, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 10.4375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 367}, "mem_gb": 9.54}
18
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4930382081245384, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 8.6875, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 312}, "mem_gb": 9.7}
19
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1676590049035847, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.03125, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 271}, "mem_gb": 10.02}
20
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8520871777494748, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 5.53125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 269}, "mem_gb": 9.98}
21
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3022827628118296, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 352}, "mem_gb": 9.51}
22
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6229442936435342, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.59375, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 243}, "mem_gb": 9.99}
23
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8070648494549095, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.984375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 293}, "mem_gb": 9.91}
24
+ [eval step 10] sample: 'To solve the problem, we need to determine the common term \\(a_n\\) of the arithmetic sequence and then use the given equation to find \\(2a_9 - a_{10}\\).\n\n### Step 1: Find the common term \\(a_n\\)\n\nThe '
25
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5384568912597995, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.609375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 242}, "mem_gb": 9.99}
26
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1970970566250383, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 2.140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 353}, "mem_gb": 9.69}
27
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0940787013653666, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 338}, "mem_gb": 9.69}
28
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6186913937936227, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 259}, "mem_gb": 9.99}
29
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9969246197288235, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.40625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 385}, "mem_gb": 9.54}
30
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9412323618650437, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.3984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 355}, "mem_gb": 9.71}
31
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8982679812351863, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 328}, "mem_gb": 9.61}
32
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9415252021573484, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 355}, "mem_gb": 9.76}
33
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0632766890684142, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.2109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 367}, "mem_gb": 9.63}
34
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9678205758832396, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 343}, "mem_gb": 9.67}
35
+ [eval step 20] sample: 'in the arithmetic sequence {a_n} where a_1 is the first term and a_n is the n-th term, we have the equation a_1 + 3a_8 + a_15 = 120. to find the value of 2a_9 - a_{10}, we need to'
36
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3117956129783144, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 244}, "mem_gb": 10.0}
37
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6047114803902804, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 339}, "mem_gb": 9.83}
38
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6115298296865697, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 298}, "mem_gb": 9.98}
39
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9722748226304849, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 398}, "mem_gb": 9.86}
40
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8721042871873825, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.1484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 362}, "mem_gb": 9.96}
41
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5642432114346574, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 313}, "mem_gb": 9.83}
42
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0008940587684512, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 324}, "mem_gb": 9.75}
43
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.599433847203975, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 314}, "mem_gb": 9.8}
44
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9312462906735639, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 345}, "mem_gb": 9.72}
45
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4619468034664169, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 262}, "mem_gb": 9.91}
46
+ [eval step 30] sample: "in the arithmetic sequence {a_n} where a_1 + 3a_8 + a_15 = 120, we need to find the value of 2a_9 - a_10.\n\nfirst, let's express the terms of the sequence in terms of a_n.\n\na_"
47
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.022420195945104, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 373}, "mem_gb": 9.7}
48
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8509250005868574, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 334}, "mem_gb": 9.69}
49
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.613825674328208, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 327}, "mem_gb": 9.85}
50
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2256598541000858, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 238}, "mem_gb": 10.01}
51
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7586643088450035, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 310}, "mem_gb": 9.74}
52
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8141867193845411, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 347}, "mem_gb": 9.75}
53
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8366180024611454, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 304}, "mem_gb": 9.67}
54
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7748054912365973, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 343}, "mem_gb": 9.69}
55
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8812485810771584, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 314}, "mem_gb": 9.69}
56
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7946364376689617, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 300}, "mem_gb": 9.79}
57
+ [eval step 40] sample: "in an arithmetic sequence, let's denote the first term as \\(a_1\\) and the common difference as \\(d\\). the general term \\(a_n\\) can be expressed as \\(a_n = a_1 + (n-1)d\\).\n\nwe are given the equation \\("
58
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6385889235652983, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 318}, "mem_gb": 9.83}
59
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49948651599921284, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 279}, "mem_gb": 9.87}
60
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8268414446524034, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 364}, "mem_gb": 9.93}
61
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5464487102142845, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 256}, "mem_gb": 10.0}
62
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9580063865864028, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 340}, "mem_gb": 9.7}
63
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4799229547051092, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 283}, "mem_gb": 9.93}
64
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8148563946018617, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 349}, "mem_gb": 9.71}
65
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979148532440265, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 297}, "mem_gb": 9.79}
66
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.004111134706748, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 359}, "mem_gb": 9.76}
67
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6419923638241987, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 342}, "mem_gb": 9.8}
68
+ [eval step 50] sample: 'in the arithmetic sequence {a_n} where a_1 is the first term and a_n is the n-th term, we have the equation: a_1 + 3a_8 + a_{15} = 120. to find the value of 2a_9 - a_{10}, we'
69
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45401846340596674, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 269}, "mem_gb": 9.97}
70
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.611486088803721, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 324}, "mem_gb": 9.95}
71
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46173349438166866, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 281}, "mem_gb": 9.94}
72
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5997989413438986, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 287}, "mem_gb": 9.99}
73
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7524433438550681, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 296}, "mem_gb": 10.0}
74
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5106750715066989, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 267}, "mem_gb": 10.05}
75
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47578693767903996, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 249}, "mem_gb": 9.96}
76
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8217364189067855, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 363}, "mem_gb": 9.65}
77
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5243174418509627, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 299}, "mem_gb": 9.79}
78
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8042325482209524, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 331}, "mem_gb": 9.67}
79
+ [eval step 60] sample: "in an arithmetic sequence, the sum of the first term and the eighth term is equal to 120. let's denote the first term as $a_1$ and the common difference as $d$. the terms of the sequence can be expres"
80
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44887882145475594, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 280}, "mem_gb": 9.88}
81
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.807150111862272, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 350}, "mem_gb": 9.86}
82
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8128710226175686, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 321}, "mem_gb": 9.63}
83
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43036911633176106, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 281}, "mem_gb": 9.93}
84
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9279526206891984, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 331}, "mem_gb": 9.6}
85
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6769559304581955, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 318}, "mem_gb": 9.98}
86
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5426464771968623, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 309}, "mem_gb": 9.99}
87
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4952886541346088, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 304}, "mem_gb": 9.88}
88
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34394927999929836, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 279}, "mem_gb": 9.9}
89
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1868917819891125, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 248}, "mem_gb": 9.9}
90
+ [eval step 70] sample: "to solve the problem, let's start by defining the terms of the arithmetic sequence. an arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). the \\(n\\)-th term can b"
91
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.591868079894657, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 268}, "mem_gb": 9.88}
92
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5950536540173615, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 299}, "mem_gb": 9.98}
93
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6303575264502937, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 322}, "mem_gb": 9.84}
94
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4065308028669097, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 248}, "mem_gb": 10.01}
95
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6363326350304609, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 326}, "mem_gb": 9.91}
96
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5638598193736126, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 314}, "mem_gb": 9.67}
97
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19234278509002178, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 232}, "mem_gb": 10.0}
98
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8111088057644665, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 330}, "mem_gb": 9.73}
99
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531506898276508, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 292}, "mem_gb": 9.88}
100
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7231203843460728, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 312}, "mem_gb": 9.91}
101
+ [eval step 80] sample: 'to solve the problem, we start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequenc'
102
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8621283940074345, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 382}, "mem_gb": 9.71}
103
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8443827647795901, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 360}, "mem_gb": 9.58}
104
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15145623211329803, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.3, "frames": {"chat": 222}, "mem_gb": 9.85}
105
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7994886162946622, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 342}, "mem_gb": 9.9}
106
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7824750316541642, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 337}, "mem_gb": 9.7}
107
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5115409725200385, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 304}, "mem_gb": 9.95}
108
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5065575876029208, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 326}, "mem_gb": 9.84}
109
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6966159891559432, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 310}, "mem_gb": 9.9}
110
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6638838457557683, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 328}, "mem_gb": 9.72}
111
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7697006537141899, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 347}, "mem_gb": 9.55}
112
+ [eval step 90] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\(a_1\\) is the first'
113
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6509984627686441, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 330}, "mem_gb": 9.84}
114
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18987354269406448, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.3, "frames": {"chat": 209}, "mem_gb": 10.04}
115
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7727640258224681, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 399}, "mem_gb": 9.62}
116
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7771029068230341, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 351}, "mem_gb": 9.7}
117
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060310102191443, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 322}, "mem_gb": 9.71}
118
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7615831184712549, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 333}, "mem_gb": 9.6}
119
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5635918581945821, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 330}, "mem_gb": 9.88}
120
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15579697014677027, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 238}, "mem_gb": 9.92}
121
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36495352867400893, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 297}, "mem_gb": 9.82}
122
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.680414218877318, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 345}, "mem_gb": 9.79}
123
+ [eval step 100] sample: "to solve the problem, let's start by defining the terms of the arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the first"
124
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969258860856295, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 304}, "mem_gb": 9.93}
125
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6580879160174479, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 326}, "mem_gb": 9.93}
126
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7947875859295328, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 347}, "mem_gb": 9.86}
127
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7254189917428419, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 325}, "mem_gb": 9.75}
128
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4551183176329359, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 299}, "mem_gb": 9.93}
129
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8312028536933164, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 345}, "mem_gb": 9.71}
130
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.724544562044243, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 344}, "mem_gb": 9.6}
131
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5546102614038313, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 344}, "mem_gb": 9.87}
132
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5019063033918539, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 288}, "mem_gb": 9.93}
133
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49880629771401486, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 303}, "mem_gb": 9.63}
134
+ [eval step 110] sample: 'to solve the problem, we start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequenc'
135
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3420428987864405, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 284}, "mem_gb": 9.82}
136
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8548884526256472, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 369}, "mem_gb": 9.72}
137
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3923035353373736, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 269}, "mem_gb": 9.98}
138
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7426191418388237, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 341}, "mem_gb": 9.73}
139
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7612711408747981, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 384}, "mem_gb": 9.5}
140
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6557121880043298, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 358}, "mem_gb": 9.67}
141
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7544703280287485, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 342}, "mem_gb": 9.84}
142
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8084232264186566, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 365}, "mem_gb": 9.66}
143
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.728432120089233, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 337}, "mem_gb": 9.89}
144
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6394298695983986, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 333}, "mem_gb": 10.0}
145
+ [eval step 120] sample: 'to find the value of \\(2a_9 - a_{10}\\) in the arithmetic sequence \\(\\{a_n\\}\\) given that \\(a_1 + 3a_8 + a_{15} = 120\\), we need to follow these steps:\n\n1. **express \\(a_'
146
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4417629444235315, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 293}, "mem_gb": 10.04}
147
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4356932476295779, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 291}, "mem_gb": 9.8}
148
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6644023360354205, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 341}, "mem_gb": 9.83}
149
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.450215597385789, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 300}, "mem_gb": 9.76}
150
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38972865528166295, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 270}, "mem_gb": 9.99}
151
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31303780065358927, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 259}, "mem_gb": 10.01}
152
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7344888858980809, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 355}, "mem_gb": 9.58}
153
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7927602957720558, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 388}, "mem_gb": 9.94}
154
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6738013232462108, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 318}, "mem_gb": 9.65}
155
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7895144004153709, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 383}, "mem_gb": 9.78}
156
+ [eval step 130] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is "
157
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45289700272611033, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 300}, "mem_gb": 9.79}
158
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4185119778055077, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 295}, "mem_gb": 9.88}
159
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45578845382295546, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 306}, "mem_gb": 9.62}
160
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5891319619006787, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 303}, "mem_gb": 9.88}
161
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2952498745908961, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 272}, "mem_gb": 9.95}
162
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40067317202935615, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 248}, "mem_gb": 9.94}
163
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4329392775816222, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 282}, "mem_gb": 9.93}
164
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6656839586149901, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 362}, "mem_gb": 9.5}
165
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7296052422739565, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 374}, "mem_gb": 9.85}
166
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41005820041863866, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 280}, "mem_gb": 10.03}
167
+ [eval step 140] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
168
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30482135014347733, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 276}, "mem_gb": 9.87}
169
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40865951122101396, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 246}, "mem_gb": 10.01}
170
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7642517018852134, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 360}, "mem_gb": 9.54}
171
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.725740426915201, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 365}, "mem_gb": 9.72}
172
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5890660974250486, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 338}, "mem_gb": 9.8}
173
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3256117796968669, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 276}, "mem_gb": 9.91}
174
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17430296553187072, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 209}, "mem_gb": 9.99}
175
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6998802567265928, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 379}, "mem_gb": 9.59}
176
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6028760781408598, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 307}, "mem_gb": 9.93}
177
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42197037402546655, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 293}, "mem_gb": 9.97}
178
+ [eval step 150] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
179
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1226/step0150
180
+ wandb: updating run metadata
181
+ wandb: uploading summary, console lines 168-168
182
+ wandb:
183
+ wandb: Run history:
184
+ wandb: comp_len β–…β–†β–‡β–…β–‡β–‚β–ƒβ–ƒβ–β–ƒβ–„β–ƒβ–‚β–†β–‡β–ƒβ–‡β–‡β–ˆβ–…β–ƒβ–„β–ƒβ–„β–β–„β–‚β–ƒβ–ƒβ–…β–‚β–†β–ƒβ–β–ƒβ–ƒβ–„β–‡β–‚β–…
185
+ wandb: cumulative_loss_tokens β–β–β–β–β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–ˆ
186
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
187
+ wandb: finish_rate β–β–ˆβ–†β–ˆβ–ˆβ–…β–ˆβ–ˆβ–‡β–ˆβ–…β–‡β–†β–‡β–†β–†β–ˆβ–ƒβ–†β–ˆβ–‡β–†β–ˆβ–‡β–†β–ˆβ–‡β–…β–…β–ˆβ–ˆβ–‡β–…β–…β–ˆβ–‡β–…β–…β–„β–ˆ
188
+ wandb: forward_topk_kl β–†β–ˆβ–†β–†β–ƒβ–ƒβ–†β–„β–…β–„β–„β–ƒβ–„β–ƒβ–ƒβ–„β–„β–ƒβ–„β–ƒβ–β–„β–ƒβ–β–„β–„β–ƒβ–„β–ƒβ–ƒβ–„β–„β–„β–„β–„β–ƒβ–‚β–‚β–„β–‚
189
+ wandb: grad_norm β–ˆβ–…β–ƒβ–β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
190
+ wandb: lr β–β–„β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
191
+ wandb: mem_gb β–‡β–‡β–β–„β–‡β–†β–ƒβ–ˆβ–…β–ƒβ–‚β–‡β–†β–†β–†β–†β–‡β–‡β–…β–β–ƒβ–ƒβ–…β–…β–…β–ˆβ–…β–…β–‡β–ˆβ–ƒβ–„β–…β–†β–‡β–ˆβ–…β–†β–‡β–‡
192
+ wandb: step β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–ˆβ–ˆ
193
+ wandb: t_data_s β–ˆβ–…β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: +3 ...
195
+ wandb:
196
+ wandb: Run summary:
197
+ wandb: comp_len 409.6
198
+ wandb: cumulative_loss_tokens 18000000
199
+ wandb: epoch 0
200
+ wandb: finish_rate 0.942
201
+ wandb: forward_topk_kl 0.42197
202
+ wandb: grad_norm 0.60938
203
+ wandb: lr 3e-05
204
+ wandb: mem_gb 9.97
205
+ wandb: step 150
206
+ wandb: t_data_s 0
207
+ wandb: +4 ...
208
+ wandb:
209
+ wandb: πŸš€ View run glean_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/n3zawkef
210
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
211
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
212
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1226/wandb/run-20260717_125422-n3zawkef/logs
healed/grid_general/glean_keep25_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep50_s1224.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run 09wxy7fc
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1224/wandb/run-20260718_073554-09wxy7fc
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep50_s1224
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/09wxy7fc
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41026050324359287, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.46875, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 259}, "mem_gb": 15.93}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: "To compute the rank of a given 4x4 matrix, we determine the maximum number of linearly independent rows or columns. Let's start by writing the matrix:\n\n\\[ A = \\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 &"
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6125910406349848, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 4.0, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 348}, "mem_gb": 15.64}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5558083608713001, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.65625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 370}, "mem_gb": 15.79}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21421229442053785, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.703125, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 244}, "mem_gb": 16.02}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42800646155917393, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 2.015625, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 320}, "mem_gb": 15.94}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5072242975796263, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.0625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 378}, "mem_gb": 15.54}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5623697880142678, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.7109375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 384}, "mem_gb": 16.04}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5245557690681268, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.6875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 324}, "mem_gb": 15.88}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19431947070813427, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 239}, "mem_gb": 16.05}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4868344773328553, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.1875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 306}, "mem_gb": 15.79}
26
+ [eval step 10] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's analyze the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -"
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49339593205762405, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 329}, "mem_gb": 15.82}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2315545183274895, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 254}, "mem_gb": 16.05}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039000242040182, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 273}, "mem_gb": 16.03}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14603102097815523, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.7, "frames": {"chat": 236}, "mem_gb": 15.95}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5283165326805165, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 381}, "mem_gb": 15.68}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18666007972145454, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 266}, "mem_gb": 15.88}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30335749817738933, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 308}, "mem_gb": 15.87}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2528139771472663, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 273}, "mem_gb": 16.05}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4353269448962373, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 368}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5400869541162004, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 339}, "mem_gb": 15.92}
37
+ [eval step 20] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's start by reducing the matrix to row-echelon form (REF) or row-intercept form (RIF)."
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2673527224904237, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 298}, "mem_gb": 15.85}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42571741502949345, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 350}, "mem_gb": 15.57}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22796272560587774, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 246}, "mem_gb": 16.02}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4381943601517628, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 375}, "mem_gb": 15.75}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4388858132005359, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 352}, "mem_gb": 15.8}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44192338454971714, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 396}, "mem_gb": 15.76}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36236347859626017, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 362}, "mem_gb": 15.61}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.463430282891728, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 369}, "mem_gb": 15.82}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4662565063331276, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 399}, "mem_gb": 15.67}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22530132904412845, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 247}, "mem_gb": 15.95}
48
+ [eval step 30] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's analyze the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -"
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08528111579132577, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 230}, "mem_gb": 15.88}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18954650380682822, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 263}, "mem_gb": 16.05}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2115665530679437, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 264}, "mem_gb": 16.04}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3928269195322103, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 328}, "mem_gb": 15.9}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18860378520867477, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 281}, "mem_gb": 15.97}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13190081692673267, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 237}, "mem_gb": 15.96}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17077195692410072, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 278}, "mem_gb": 16.05}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38257827037526293, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 310}, "mem_gb": 15.92}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22061063767167896, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 295}, "mem_gb": 15.86}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2498053479500736, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 329}, "mem_gb": 15.87}
59
+ [eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Formulate the Matrix**:\n \\"
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23681824228313442, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 263}, "mem_gb": 15.99}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26467789245061574, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 315}, "mem_gb": 15.87}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36451303250255684, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 354}, "mem_gb": 15.82}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16006798961240176, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 259}, "mem_gb": 16.0}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23957160875654468, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 275}, "mem_gb": 15.85}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34685020303507336, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 334}, "mem_gb": 15.72}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37954779932778326, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 374}, "mem_gb": 15.57}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3203222113084979, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 311}, "mem_gb": 15.75}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2674280841496773, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 259}, "mem_gb": 16.05}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3195787520647049, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 305}, "mem_gb": 16.04}
70
+ [eval step 50] sample: "To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is defined as the maximum number of linearly independent rows or columns in the matrix.\n\nLet's repres"
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28261407673442734, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 298}, "mem_gb": 16.01}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4267853798161571, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 364}, "mem_gb": 15.79}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19721985776678969, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 302}, "mem_gb": 15.89}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4182707277630766, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 316}, "mem_gb": 15.65}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43091711902953683, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 312}, "mem_gb": 15.75}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31012510406343885, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 330}, "mem_gb": 15.9}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045633674311141, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 321}, "mem_gb": 15.91}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30578674541981893, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 344}, "mem_gb": 15.94}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3581601472315068, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 353}, "mem_gb": 15.61}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17521235730432283, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 272}, "mem_gb": 16.04}
82
+ [eval step 60] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3977586137867843, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 317}, "mem_gb": 15.79}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15510378736282388, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 292}, "mem_gb": 15.79}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07634465584444503, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 229}, "mem_gb": 15.9}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38854067337010056, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 359}, "mem_gb": 15.91}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33608994229706, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 358}, "mem_gb": 15.63}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4052233465592687, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 315}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24311472296013187, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 264}, "mem_gb": 16.09}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39123050851753605, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 337}, "mem_gb": 15.76}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18062976350033036, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 251}, "mem_gb": 16.05}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29068873614870633, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 298}, "mem_gb": 15.78}
93
+ [eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22665819143780197, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 264}, "mem_gb": 16.0}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22798893289885794, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 305}, "mem_gb": 16.01}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21353942297726558, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 322}, "mem_gb": 15.79}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3646789829758306, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 361}, "mem_gb": 15.77}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25135638570307445, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 321}, "mem_gb": 15.95}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3001220568033711, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 307}, "mem_gb": 15.85}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3653722489182527, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 327}, "mem_gb": 15.94}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41658282146000614, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 356}, "mem_gb": 15.56}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18712107114459697, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 283}, "mem_gb": 15.9}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3677279804726752, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 401}, "mem_gb": 15.66}
104
+ [eval step 80] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix \\( A \\) as follows:\n\\[ A = \\begin"
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22647504430717477, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 288}, "mem_gb": 15.85}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30207622203271217, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 323}, "mem_gb": 15.89}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41436750751448176, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 336}, "mem_gb": 15.78}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33888237207851685, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 329}, "mem_gb": 15.69}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3288877253720537, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 343}, "mem_gb": 15.67}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3539777154279873, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 336}, "mem_gb": 15.79}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32270204152623194, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 314}, "mem_gb": 16.03}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19293650152059272, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 281}, "mem_gb": 15.86}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2548869115995243, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 299}, "mem_gb": 15.74}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32871011509491754, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 328}, "mem_gb": 15.93}
115
+ [eval step 90] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24049307317749286, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 271}, "mem_gb": 16.03}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2500695445594067, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 269}, "mem_gb": 16.13}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41031095662157363, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 370}, "mem_gb": 15.68}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4378245968754093, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 352}, "mem_gb": 15.74}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3705204147895798, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 330}, "mem_gb": 15.94}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2865605506530808, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 1.28125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 334}, "mem_gb": 15.66}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2915421401655922, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 336}, "mem_gb": 15.8}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.208741261095802, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 309}, "mem_gb": 15.89}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3683408903537318, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 391}, "mem_gb": 15.77}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18484274740877252, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 264}, "mem_gb": 16.17}
126
+ [eval step 100] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3254158294330351, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 349}, "mem_gb": 15.72}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31245640341866143, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 312}, "mem_gb": 15.78}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1010662712728139, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 229}, "mem_gb": 16.04}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27768244563263533, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 288}, "mem_gb": 16.05}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37915563974818217, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 351}, "mem_gb": 15.7}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12691036371852582, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 223}, "mem_gb": 16.07}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06251050735600293, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.341796875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 213}, "mem_gb": 16.03}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3438070843582042, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 380}, "mem_gb": 15.88}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19785756601657098, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 271}, "mem_gb": 16.07}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.392524952324635, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 340}, "mem_gb": 15.96}
138
+ [eval step 110] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly indepe'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39372597963521255, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 366}, "mem_gb": 15.65}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12795156174354877, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 233}, "mem_gb": 16.05}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2615191206465631, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 312}, "mem_gb": 15.91}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36459084595150004, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 363}, "mem_gb": 15.62}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3736453896711891, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 323}, "mem_gb": 15.9}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3901250712420481, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 346}, "mem_gb": 15.64}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36104256626622133, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 318}, "mem_gb": 15.79}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27432062879757335, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 275}, "mem_gb": 15.97}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33292323357574644, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 345}, "mem_gb": 15.72}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32694811743755514, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 377}, "mem_gb": 15.86}
149
+ [eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26787347213877366, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 294}, "mem_gb": 16.09}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3789762637352571, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 338}, "mem_gb": 15.78}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38668672952881705, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 352}, "mem_gb": 15.68}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3450175064574927, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 347}, "mem_gb": 15.73}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21579163084252118, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 310}, "mem_gb": 15.71}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40773547251814357, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 15.73}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21900573283399766, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 319}, "mem_gb": 16.01}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14443418615746, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 16.04}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28653879117236164, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 310}, "mem_gb": 15.9}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18174955978657428, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 259}, "mem_gb": 16.07}
160
+ [eval step 130] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as follows:\n\\[ A = \\begin{bma"
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18174413637655476, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 265}, "mem_gb": 16.05}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38424231208128234, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 337}, "mem_gb": 15.6}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19688730391527837, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 290}, "mem_gb": 15.86}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32914502366026865, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 349}, "mem_gb": 15.79}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20545787117381892, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 291}, "mem_gb": 15.89}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3427318941450057, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 342}, "mem_gb": 15.76}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41065252649138373, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 338}, "mem_gb": 15.7}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38238009223972136, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 356}, "mem_gb": 15.67}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17387144767005616, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 265}, "mem_gb": 16.05}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3056366472713649, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 353}, "mem_gb": 15.76}
171
+ [eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as follows:\n\\[ A = \\begin{bma"
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2851792412651082, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 316}, "mem_gb": 15.95}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25289674596640593, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 289}, "mem_gb": 16.1}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2580651386136189, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 331}, "mem_gb": 15.73}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2536245377596778, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 320}, "mem_gb": 16.05}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22945189654111553, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 272}, "mem_gb": 15.78}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4198826794961778, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 368}, "mem_gb": 15.7}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34152062557879836, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 328}, "mem_gb": 15.73}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33140167462996517, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 326}, "mem_gb": 15.95}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38146266262708234, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 364}, "mem_gb": 15.89}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23909615996540523, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 296}, "mem_gb": 15.93}
182
+ [eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the steps:\n\n1. **Formulate the Matrix:**\n \\[\n A ="
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–‚β–‡β–…β–β–…β–‚β–‚β–β–‚β–ˆβ–…β–‚β–…β–„β–ƒβ–„β–ƒβ–ƒβ–„β–…β–ƒβ–β–†β–‚β–„β–‚β–‚β–β–‚β–„β–†β–‚β–ƒβ–ƒβ–‚β–ƒβ–ƒβ–…β–ƒβ–„
189
+ wandb: cumulative_loss_tokens β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–ˆβ–‡β–ˆβ–…β–‚β–ˆβ–„β–‡β–ˆβ–ˆβ–ƒβ–†β–ˆβ–‡β–ˆβ–ˆβ–…β–†β–†β–‡β–ˆβ–ƒβ–ˆβ–ˆβ–‡β–ˆβ–‡β–β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ƒβ–ˆβ–†β–‡β–‡
192
+ wandb: forward_topk_kl β–ˆβ–‚β–β–‡β–…β–ƒβ–‚β–†β–ˆβ–†β–†β–‚β–β–‚β–…β–„β–ƒβ–ƒβ–†β–ƒβ–‚β–…β–‚β–…β–…β–β–ƒβ–‚β–…β–ƒβ–…β–ƒβ–„β–ƒβ–‚β–„β–…β–ƒβ–†β–‚
193
+ wandb: grad_norm β–ˆβ–…β–ƒβ–‚β–β–β–‚β–‚β–‚β–‚β–‚β–β–β–β–β–β–β–β–‚β–‚β–β–β–β–β–β–‚β–β–ƒβ–β–β–β–β–‚β–‚β–β–β–‚β–β–β–
194
+ wandb: lr β–β–‚β–ƒβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–‡β–β–‡β–‡β–†β–‡β–‡β–„β–†β–…β–…β–‡β–…β–„β–†β–„β–‚β–‡β–‡β–β–ƒβ–‡β–†β–ƒβ–‚β–…β–ƒβ–ˆβ–‡β–ˆβ–…β–‚β–ƒβ–ƒβ–‡β–ƒβ–ˆβ–‡β–„β–…
196
+ wandb: step β–β–β–β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–„β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 405.4
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.97
205
+ wandb: forward_topk_kl 0.2391
206
+ wandb: grad_norm 0.48047
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 15.93
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run glean_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/09wxy7fc
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1224/wandb/run-20260718_073554-09wxy7fc/logs
healed/grid_general/glean_keep50_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep50_s1225.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run 5uic08kb
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1225/wandb/run-20260718_073824-5uic08kb
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep50_s1225
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/5uic08kb
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6853121227722615, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 4.5625, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 331}, "mem_gb": 15.8}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: "To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both the monthly savings and the interest earned on the growing savings.\n\nLet's denote \\( n \\) as"
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6300968874294932, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 4.15625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 342}, "mem_gb": 15.67}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.692082746409749, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 4.1875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.71}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5611744172318528, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.96875, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 344}, "mem_gb": 15.79}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35070478902595736, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.8359375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 267}, "mem_gb": 16.11}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16416748266015202, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.3203125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 248}, "mem_gb": 15.94}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48838783907449496, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.5546875, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 329}, "mem_gb": 15.93}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5164903825346381, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.46875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 339}, "mem_gb": 15.89}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5744703302371936, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.3359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 354}, "mem_gb": 15.89}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3220325999762863, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 279}, "mem_gb": 16.02}
26
+ [eval step 10] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investment account.\n\n1. **Monthly Sav'
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39639907065903146, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 318}, "mem_gb": 15.95}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2601489280415078, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 265}, "mem_gb": 16.04}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2406185398230329, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 254}, "mem_gb": 15.98}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363238035394003, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 315}, "mem_gb": 16.01}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49244476905980455, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 300}, "mem_gb": 15.81}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31747139668446034, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 276}, "mem_gb": 16.01}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4976991202985247, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 356}, "mem_gb": 15.95}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45945094148851934, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 304}, "mem_gb": 15.77}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4641048119674747, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 375}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23674259848222137, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 294}, "mem_gb": 16.04}
37
+ [eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41813104864781103, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 299}, "mem_gb": 16.05}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3198011468975184, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 305}, "mem_gb": 15.83}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.185373840557194, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 262}, "mem_gb": 15.88}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2695752582576436, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 303}, "mem_gb": 15.94}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44112187557655075, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 380}, "mem_gb": 15.82}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22534518425241112, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 282}, "mem_gb": 15.78}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4030095595076059, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 362}, "mem_gb": 15.79}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40417502531719707, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 307}, "mem_gb": 16.04}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26630948204637195, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 282}, "mem_gb": 15.9}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.404437967997541, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 337}, "mem_gb": 15.93}
48
+ [eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2456684964166023, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 275}, "mem_gb": 15.99}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43714953695784015, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 318}, "mem_gb": 15.8}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48897211201159907, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 385}, "mem_gb": 15.83}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5083572860651339, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 316}, "mem_gb": 15.78}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20059632252743467, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 266}, "mem_gb": 16.07}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44036612436138095, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 371}, "mem_gb": 15.8}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22354543038383126, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 262}, "mem_gb": 16.01}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4603919888367876, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 348}, "mem_gb": 15.83}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08354806087507556, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 222}, "mem_gb": 16.07}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3995035542997842, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 408}, "mem_gb": 15.63}
59
+ [eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and investment earnings.\n\n**Step 1: Calculate the '
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3865900962865601, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 334}, "mem_gb": 15.7}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20412868370236828, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 312}, "mem_gb": 15.75}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38240270777683083, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 2.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 352}, "mem_gb": 15.73}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33955983549657587, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 371}, "mem_gb": 15.54}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23050914932532857, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 284}, "mem_gb": 15.99}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17779509922672684, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 287}, "mem_gb": 16.06}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16358218302348007, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 285}, "mem_gb": 15.95}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11037308089152599, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 252}, "mem_gb": 16.04}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38853509445575374, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 360}, "mem_gb": 15.83}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41493850585259495, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 359}, "mem_gb": 15.82}
70
+ [eval step 50] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4150059717571751, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 363}, "mem_gb": 15.58}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.356912271811751, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 361}, "mem_gb": 15.67}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21980295595508068, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 286}, "mem_gb": 15.86}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40459172328654674, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 367}, "mem_gb": 15.71}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4347790555938457, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 352}, "mem_gb": 15.74}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2564696355306543, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 314}, "mem_gb": 15.69}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3645872671695737, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 372}, "mem_gb": 15.66}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32099489957615734, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 334}, "mem_gb": 15.81}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42441788537126657, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 368}, "mem_gb": 15.75}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3157586787485828, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 354}, "mem_gb": 15.9}
82
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17141324029487248, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 293}, "mem_gb": 15.79}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11631773663458105, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 231}, "mem_gb": 15.95}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3005876206895957, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 302}, "mem_gb": 15.92}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2012761780796883, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 263}, "mem_gb": 16.06}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2171035258341891, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 252}, "mem_gb": 15.99}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31330071536609905, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 344}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29038542925980876, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 313}, "mem_gb": 15.95}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3494604504799781, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 358}, "mem_gb": 15.65}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1609218665544875, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 267}, "mem_gb": 15.87}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3441237420997582, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 300}, "mem_gb": 15.74}
93
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27720354586439205, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 348}, "mem_gb": 15.68}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3511818683579564, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 329}, "mem_gb": 15.77}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1929187020015282, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 269}, "mem_gb": 15.93}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38554286157476403, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.6}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22364256096049212, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 302}, "mem_gb": 15.86}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.379288532902052, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 381}, "mem_gb": 15.87}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41174931660033764, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 379}, "mem_gb": 15.82}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3892458708143172, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 351}, "mem_gb": 15.64}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3370368604900936, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 330}, "mem_gb": 15.84}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35013818602425356, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 316}, "mem_gb": 15.87}
104
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22324992848370845, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 276}, "mem_gb": 16.05}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1766008067708773, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 240}, "mem_gb": 15.99}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21798422811301424, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 288}, "mem_gb": 15.9}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2075130866493409, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 271}, "mem_gb": 15.89}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3159274495856216, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 357}, "mem_gb": 15.84}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41152762305407475, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 354}, "mem_gb": 15.81}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39856506082707394, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 302}, "mem_gb": 16.05}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2919200394155768, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 297}, "mem_gb": 16.04}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09611441166807587, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 219}, "mem_gb": 16.06}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3893690294975725, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 306}, "mem_gb": 15.76}
115
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the total'
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38563687218427656, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 343}, "mem_gb": 15.7}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.361127767519032, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 341}, "mem_gb": 15.81}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21086774204637235, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 318}, "mem_gb": 15.76}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38588710091318934, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 346}, "mem_gb": 15.65}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19287135322925944, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 277}, "mem_gb": 16.13}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18192729682745412, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 270}, "mem_gb": 15.86}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23325805287010346, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 257}, "mem_gb": 16.04}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36902173152739803, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 363}, "mem_gb": 15.65}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.374097685023242, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 356}, "mem_gb": 15.79}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33262620056254477, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 323}, "mem_gb": 15.82}
126
+ [eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the total'
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16448043116433547, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 243}, "mem_gb": 16.07}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3484302015217642, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 307}, "mem_gb": 15.75}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3274071234525802, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 346}, "mem_gb": 15.99}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21096278094189863, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 273}, "mem_gb": 15.99}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21774797727145875, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 302}, "mem_gb": 15.92}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32626048213625325, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 337}, "mem_gb": 16.05}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2417104805881468, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 280}, "mem_gb": 15.93}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.405092308748172, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 331}, "mem_gb": 15.83}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24347472621266109, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 314}, "mem_gb": 15.93}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4211603428164497, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 294}, "mem_gb": 15.86}
138
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18866508930400014, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 274}, "mem_gb": 15.99}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33154945716994505, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 365}, "mem_gb": 15.71}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20360647340489862, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 323}, "mem_gb": 15.77}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1340352246530354, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 234}, "mem_gb": 16.06}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17894358484946812, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 267}, "mem_gb": 16.06}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22424391842950137, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 304}, "mem_gb": 15.82}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3561152476095905, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 373}, "mem_gb": 15.75}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20931611265816416, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 300}, "mem_gb": 16.03}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37135114704612643, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 331}, "mem_gb": 15.87}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1569274458857719, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 259}, "mem_gb": 16.01}
149
+ [eval step 120] sample: 'To solve this problem we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n1. **Initial Savings:**\n Jam'
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3248357699602532, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 358}, "mem_gb": 15.63}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39332515030226983, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 354}, "mem_gb": 15.88}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18586578806418305, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 279}, "mem_gb": 15.95}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39211959884545455, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 354}, "mem_gb": 15.7}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.364780769649862, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 334}, "mem_gb": 15.9}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38099857076462357, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 327}, "mem_gb": 15.77}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34246316302871954, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 365}, "mem_gb": 15.87}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19133322554122037, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 252}, "mem_gb": 16.08}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1562701092961089, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 256}, "mem_gb": 16.04}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20471605217938002, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 302}, "mem_gb": 15.81}
160
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n1. **Initial Savings:** Jamie'
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33671943904329094, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 350}, "mem_gb": 15.72}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19857066868400822, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 292}, "mem_gb": 15.84}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3459093042377072, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 356}, "mem_gb": 15.65}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2339350832606045, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 347}, "mem_gb": 15.82}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21164681599900748, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 330}, "mem_gb": 16.01}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3498723207845663, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 363}, "mem_gb": 15.87}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32028547865971924, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 354}, "mem_gb": 15.73}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17074598619239406, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 270}, "mem_gb": 15.99}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33173287250131056, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 343}, "mem_gb": 15.77}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07786983747505583, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 232}, "mem_gb": 15.96}
171
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3108461571379565, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 346}, "mem_gb": 15.91}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2508645673315041, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 306}, "mem_gb": 15.99}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1583715583874844, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 273}, "mem_gb": 16.04}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17659224952206326, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 266}, "mem_gb": 15.86}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2698487444297721, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 299}, "mem_gb": 16.06}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18426784236074115, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 259}, "mem_gb": 16.14}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21372967740772292, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 325}, "mem_gb": 15.88}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20076305093116437, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 271}, "mem_gb": 15.95}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3275998032643149, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 359}, "mem_gb": 15.74}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31545391854941845, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 345}, "mem_gb": 15.8}
182
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading output.log; uploading config.yaml
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–ƒβ–„β–†β–„β–…β–‚β–„β–…β–‚β–…β–†β–‚β–β–ƒβ–„β–‚β–‚β–ƒβ–ˆβ–ƒβ–„β–‚β–†β–„β–„β–„β–…β–†β–‚β–‚β–‚β–„β–ƒβ–…β–‚β–†β–ˆβ–ƒβ–„β–†
189
+ wandb: cumulative_loss_tokens β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–ˆβ–ƒβ–„β–†β–‡β–†β–ˆβ–„β–ˆβ–„β–ˆβ–„β–…β–…β–ˆβ–ˆβ–ˆβ–‡β–†β–ˆβ–ˆβ–…β–β–ˆβ–‚β–ƒβ–ˆβ–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–‡β–‡β–ƒβ–‡β–†β–‡β–ˆ
192
+ wandb: forward_topk_kl β–ˆβ–…β–‚β–‚β–…β–„β–ƒβ–β–‚β–„β–…β–…β–β–…β–‚β–ƒβ–‚β–β–„β–‚β–„β–„β–β–ƒβ–‚β–ƒβ–ƒβ–‚β–‚β–ƒβ–ƒβ–‚β–„β–„β–„β–β–‚β–‚β–β–ƒ
193
+ wandb: grad_norm β–ˆβ–‡β–ƒβ–‚β–‚β–‚β–β–‚β–‚β–β–„β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: lr β–β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–‚β–ƒβ–…β–‡β–„β–†β–„β–„β–†β–‡β–ˆβ–ƒβ–†β–β–ƒβ–†β–ˆβ–‡β–†β–…β–†β–β–…β–ˆβ–ƒβ–‡β–†β–†β–‡β–…β–†β–…β–ˆβ–…β–„β–‡β–„β–†β–…β–…
196
+ wandb: step β–β–β–β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s β–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 347.8
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.997
205
+ wandb: forward_topk_kl 0.31545
206
+ wandb: grad_norm 0.57812
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 15.8
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run glean_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/5uic08kb
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1225/wandb/run-20260718_073824-5uic08kb/logs
healed/grid_general/glean_keep50_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep50_s1226.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run frl49wbd
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1226/wandb/run-20260718_074054-frl49wbd
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep50_s1226
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/frl49wbd
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44869900887217373, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.21875, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 308}, "mem_gb": 15.9}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence. in an arithmetic sequence, each term can be written as \\(a_n = a_1 + (n-1)d\\), where \\(a_1\\) is the first term and"
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17543124351594597, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 2.46875, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 211}, "mem_gb": 16.04}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3475665108046184, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 2.625, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 281}, "mem_gb": 16.04}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6226910541420803, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 3.453125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 367}, "mem_gb": 15.59}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5943815913854787, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.0, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 312}, "mem_gb": 15.75}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4530718907893946, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.0, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 271}, "mem_gb": 16.06}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3028890410714472, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.2109375, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 269}, "mem_gb": 16.03}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5222243581845115, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.421875, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 352}, "mem_gb": 15.55}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2287902546222632, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 243}, "mem_gb": 16.04}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33752491750195623, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 293}, "mem_gb": 15.96}
26
+ [eval step 10] sample: 'to solve this problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is a constant plus a multiple of the common difference \\(d\\).\n\ngiven: \\(a_1 '
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19984550218141328, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 242}, "mem_gb": 16.04}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5291998529329895, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 353}, "mem_gb": 15.73}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5019098932476714, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 338}, "mem_gb": 15.74}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25008603849976013, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 259}, "mem_gb": 16.04}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539178870101149, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 385}, "mem_gb": 15.59}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4183598988139381, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 355}, "mem_gb": 15.76}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3862020888838296, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 328}, "mem_gb": 15.66}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41443256092270214, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 355}, "mem_gb": 15.81}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49797730628168213, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 367}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45042725155310087, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 343}, "mem_gb": 15.72}
37
+ [eval step 20] sample: "to solve the problem, let's first define the terms of the arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, d, to the previous term. the nth term, "
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13549072327846662, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 244}, "mem_gb": 16.04}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26835141508476806, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 339}, "mem_gb": 15.88}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2722277679784844, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 298}, "mem_gb": 16.03}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43167479179799556, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 398}, "mem_gb": 15.91}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3850022841591388, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 362}, "mem_gb": 16.01}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2518655974011868, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 313}, "mem_gb": 15.88}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4621668093803028, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 324}, "mem_gb": 15.79}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.280701087506488, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 314}, "mem_gb": 15.85}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41350211371698725, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 345}, "mem_gb": 15.77}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20802579678967595, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 262}, "mem_gb": 15.95}
48
+ [eval step 30] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n"
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48709205540517964, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 373}, "mem_gb": 15.75}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39114601502027363, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 334}, "mem_gb": 15.74}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27895974984830246, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 327}, "mem_gb": 15.89}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08200886152926833, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 238}, "mem_gb": 16.06}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3507984774490508, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 310}, "mem_gb": 15.79}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3963928083232604, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 347}, "mem_gb": 15.79}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38558109682003655, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 304}, "mem_gb": 15.72}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3600832198057324, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 343}, "mem_gb": 15.74}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41817362005176645, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 314}, "mem_gb": 15.73}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37550266109164804, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 300}, "mem_gb": 15.84}
59
+ [eval step 40] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n"
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2913182435174162, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 318}, "mem_gb": 15.88}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22799230576027185, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 279}, "mem_gb": 15.91}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3969371100135148, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 364}, "mem_gb": 15.98}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2563201005956779, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 256}, "mem_gb": 16.04}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47089617665515593, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 340}, "mem_gb": 15.75}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21948082380862907, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 283}, "mem_gb": 15.97}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3883261705008025, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 349}, "mem_gb": 15.76}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2240029728865251, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 297}, "mem_gb": 15.83}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48095803306822976, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 359}, "mem_gb": 15.81}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29586242280608666, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 342}, "mem_gb": 15.85}
70
+ [eval step 50] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20192650931620348, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 269}, "mem_gb": 16.01}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29287745077215754, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 324}, "mem_gb": 16.0}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22127733794112378, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 281}, "mem_gb": 15.99}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2794108554124211, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 287}, "mem_gb": 16.04}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33820742860746883, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 296}, "mem_gb": 16.05}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2369547254734983, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 267}, "mem_gb": 16.1}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2225485686838006, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 249}, "mem_gb": 16.0}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4115783252310939, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 363}, "mem_gb": 15.7}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24995575077252774, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 299}, "mem_gb": 15.84}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3965945136911546, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 331}, "mem_gb": 15.71}
82
+ [eval step 60] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20255451678559183, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 280}, "mem_gb": 15.93}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4033780362981372, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 350}, "mem_gb": 15.91}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3944911534689056, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 321}, "mem_gb": 15.67}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1912760569188744, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.6, "frames": {"chat": 281}, "mem_gb": 15.98}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4371471691887205, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 331}, "mem_gb": 15.65}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32823067393902067, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 318}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2570057192940265, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 309}, "mem_gb": 16.04}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24806714043632772, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 304}, "mem_gb": 15.93}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16365481722277278, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 279}, "mem_gb": 15.95}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07891491067543005, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 248}, "mem_gb": 15.95}
93
+ [eval step 70] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2977734725339028, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 268}, "mem_gb": 15.92}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2854304425325555, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 299}, "mem_gb": 16.02}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31991045414293184, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 322}, "mem_gb": 15.89}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18673701543998905, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 248}, "mem_gb": 16.06}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3047368516534256, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 326}, "mem_gb": 15.95}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2689833647923544, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 314}, "mem_gb": 15.71}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0794600971087503, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 232}, "mem_gb": 16.05}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4005749209942917, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 330}, "mem_gb": 15.78}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20405239165046563, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 292}, "mem_gb": 15.93}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3368046442796166, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 312}, "mem_gb": 15.95}
104
+ [eval step 80] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42961703496236975, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 382}, "mem_gb": 15.76}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43118461382541184, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 360}, "mem_gb": 15.63}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06022632997267258, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 222}, "mem_gb": 15.9}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.402991567757912, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 342}, "mem_gb": 15.94}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3791474818292384, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 337}, "mem_gb": 15.74}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23975354432749252, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 304}, "mem_gb": 16.0}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2543715253418622, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 326}, "mem_gb": 15.89}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33665994153826806, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 310}, "mem_gb": 15.95}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3190385383001218, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 328}, "mem_gb": 15.77}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39211579211782666, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 347}, "mem_gb": 15.6}
115
+ [eval step 90] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33030152970769755, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 330}, "mem_gb": 15.89}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07952974937635784, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 209}, "mem_gb": 16.09}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3742790118503384, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 399}, "mem_gb": 15.67}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3494311219643181, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 351}, "mem_gb": 15.75}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23376409873225104, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 322}, "mem_gb": 15.75}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3735027327584879, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 333}, "mem_gb": 15.64}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2787454779221055, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 330}, "mem_gb": 15.93}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.061159985738170025, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 238}, "mem_gb": 15.96}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16986236091982573, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 297}, "mem_gb": 15.87}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3347933178626622, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 345}, "mem_gb": 15.83}
126
+ [eval step 100] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24143627146867414, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 304}, "mem_gb": 15.98}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31860805926332253, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 326}, "mem_gb": 15.98}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38730974985752253, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 347}, "mem_gb": 15.91}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3456509570107795, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 325}, "mem_gb": 15.79}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2139598764131777, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 299}, "mem_gb": 15.98}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42429975788677887, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 345}, "mem_gb": 15.76}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35727461708355696, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 344}, "mem_gb": 15.65}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27024903512711945, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 344}, "mem_gb": 15.91}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24413219656674193, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 288}, "mem_gb": 15.98}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2337545271008586, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 303}, "mem_gb": 15.68}
138
+ [eval step 110] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16061405883897095, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 284}, "mem_gb": 15.87}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4218301228441919, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 369}, "mem_gb": 15.77}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18443894734882438, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 269}, "mem_gb": 16.02}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3631597420537534, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 341}, "mem_gb": 15.78}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363742006980783, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 384}, "mem_gb": 15.55}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32249795291616273, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.71}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3660209851158783, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 342}, "mem_gb": 15.89}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39867758954390886, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 365}, "mem_gb": 15.71}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3542415585770582, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 337}, "mem_gb": 15.94}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31506782625516255, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 333}, "mem_gb": 16.04}
149
+ [eval step 120] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21195444455550363, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 293}, "mem_gb": 16.08}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19597419150111575, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 291}, "mem_gb": 15.84}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3235887088594958, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 341}, "mem_gb": 15.88}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20579119833717122, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 300}, "mem_gb": 15.81}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1839096085038657, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 270}, "mem_gb": 16.03}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14394291903308282, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 259}, "mem_gb": 16.05}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3542349284733646, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 355}, "mem_gb": 15.63}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39433789508063344, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 388}, "mem_gb": 15.98}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32491954805937906, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 318}, "mem_gb": 15.7}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3814142351918854, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 383}, "mem_gb": 15.83}
160
+ [eval step 130] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20706040653378394, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 300}, "mem_gb": 15.84}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19251177511254014, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 295}, "mem_gb": 15.93}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20804391421643087, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 306}, "mem_gb": 15.67}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2800164740239891, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 303}, "mem_gb": 15.93}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1362138627278153, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 272}, "mem_gb": 15.99}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19676655354738856, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 248}, "mem_gb": 15.99}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.214534022665179, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 282}, "mem_gb": 15.98}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3332282754495119, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 362}, "mem_gb": 15.54}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3743262184455991, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 374}, "mem_gb": 15.9}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18988548532904437, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 280}, "mem_gb": 16.07}
171
+ [eval step 140] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103970303904886, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 276}, "mem_gb": 15.92}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1973365015062814, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 246}, "mem_gb": 16.06}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38401385176287345, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 360}, "mem_gb": 15.59}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37136507782653594, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 365}, "mem_gb": 15.77}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2997990082692355, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 338}, "mem_gb": 15.85}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1491951719417237, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 276}, "mem_gb": 15.96}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0753031477817179, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 209}, "mem_gb": 16.04}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3350944878866586, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 379}, "mem_gb": 15.64}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2944304664655899, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 307}, "mem_gb": 15.98}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19635752345559498, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 293}, "mem_gb": 16.02}
182
+ [eval step 150] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–ˆβ–‚β–„β–‚β–‚β–†β–β–ƒβ–ƒβ–‚β–‚β–…β–ƒβ–†β–ƒβ–„β–ƒβ–†β–…β–†β–‡β–„β–‚β–ƒβ–ƒβ–„β–‚β–ƒβ–„β–‚β–‚β–…β–‚β–‚β–β–ƒβ–„β–‚β–‚β–„
189
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–ˆβ–†β–ˆβ–ˆβ–†β–†β–…β–ƒβ–‡β–ˆβ–„β–ˆβ–…β–†β–ˆβ–ˆβ–…β–…β–ƒβ–ˆβ–ƒβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–†β–β–…β–ˆβ–ˆβ–ˆβ–„β–ˆβ–‡β–†β–‚β–β–ˆβ–…
192
+ wandb: forward_topk_kl β–ˆβ–„β–†β–„β–‡β–„β–β–„β–ƒβ–†β–„β–ƒβ–„β–„β–†β–…β–„β–…β–†β–ƒβ–†β–„β–†β–…β–β–„β–†β–…β–…β–†β–…β–†β–†β–…β–…β–ƒβ–ƒβ–†β–ƒβ–„
193
+ wandb: grad_norm β–ˆβ–…β–ƒβ–„β–ƒβ–‚β–ƒβ–‚β–‚β–‚β–‚β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–β–‚β–β–‚β–β–β–β–
194
+ wandb: lr β–β–…β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–†β–‡β–ƒβ–‚β–„β–†β–„β–„β–ˆβ–„β–…β–„β–„β–‡β–ƒβ–†β–…β–ƒβ–„β–†β–‡β–†β–…β–ˆβ–ƒβ–†β–‡β–‚β–ƒβ–…β–‡β–β–…β–…β–„β–‚β–ƒβ–…β–†β–‡
196
+ wandb: step β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 409.6
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.942
205
+ wandb: forward_topk_kl 0.19636
206
+ wandb: grad_norm 0.48438
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 16.02
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run glean_keep50_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/frl49wbd
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1226/wandb/run-20260718_074054-frl49wbd/logs
healed/grid_general/glean_keep50_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep75_s1224.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run kv8yaoo0
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1224/wandb/run-20260718_162400-kv8yaoo0
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run glean_keep75_s1224
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/kv8yaoo0
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13071662265943984, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.8671875, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 259}, "mem_gb": 21.93}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19075942706478138, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.75, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 348}, "mem_gb": 21.69}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1705795612147854, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.4296875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 370}, "mem_gb": 21.84}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06008550936671284, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 0.87890625, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 244}, "mem_gb": 22.07}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1344583847473686, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 0.83984375, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 320}, "mem_gb": 21.99}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15855688806849066, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.88671875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 378}, "mem_gb": 21.59}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19471264466413607, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.9296875, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 384}, "mem_gb": 22.08}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18414592282387118, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.9140625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 324}, "mem_gb": 21.93}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06543553998661228, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 239}, "mem_gb": 22.09}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1578231074643011, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 306}, "mem_gb": 21.83}
26
+ [eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be full rank if all its rows (or columns) are linearly independent'
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16721250823534403, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 329}, "mem_gb": 21.87}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08395308416405071, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 254}, "mem_gb": 22.1}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14978939464626212, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 273}, "mem_gb": 22.08}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04955570665385264, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 236}, "mem_gb": 22.0}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18713464791399118, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 381}, "mem_gb": 21.73}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06574699827601822, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 266}, "mem_gb": 21.93}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10364587014786278, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 308}, "mem_gb": 21.92}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09299309689359118, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 273}, "mem_gb": 22.1}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15576760284970514, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 368}, "mem_gb": 21.72}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.206906852022931, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 339}, "mem_gb": 21.97}
37
+ [eval step 20] sample: 'To find the rank of a matrix, we need to determine the linearly independent rows or columns. A matrix is row-rank-reduced if it has no row with a leading coefficient of zero, and column-rank-reduced i'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09841488832480584, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 298}, "mem_gb": 21.89}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16010128328893333, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 350}, "mem_gb": 21.62}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08130882709440775, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 246}, "mem_gb": 22.06}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16791759062743902, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 375}, "mem_gb": 21.79}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16707210486374485, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 352}, "mem_gb": 21.85}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1613398754464152, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 396}, "mem_gb": 21.8}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13418258246804277, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 362}, "mem_gb": 21.66}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17745140370444085, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 369}, "mem_gb": 21.87}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17475421091622362, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 399}, "mem_gb": 21.72}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10206446115411819, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 247}, "mem_gb": 21.99}
48
+ [eval step 30] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's start by examining the rows:\n\n1. **Row 1:** \\(12, -16, 4, 16\\)\n2. **Row 2:** \\( -"
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.034929789173509924, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 230}, "mem_gb": 21.93}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07229219114347361, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 263}, "mem_gb": 22.1}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08192805289736328, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 22.09}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14597586551186006, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 328}, "mem_gb": 21.95}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07461191782305639, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 281}, "mem_gb": 22.02}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04791002737303885, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 237}, "mem_gb": 22.01}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06077066037804665, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 278}, "mem_gb": 22.1}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13445928165198615, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 310}, "mem_gb": 21.97}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07629239365962179, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 295}, "mem_gb": 21.91}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09102327948374053, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 329}, "mem_gb": 21.92}
59
+ [eval step 40] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. We can do this by using Python and the `numpy` library, which provides a'
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08641363691365501, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 263}, "mem_gb": 22.04}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1031499079908089, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 315}, "mem_gb": 21.92}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13387496521947906, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 354}, "mem_gb": 21.87}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0709399001534873, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 259}, "mem_gb": 22.04}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09207004138532406, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 275}, "mem_gb": 21.9}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12805168654941954, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 334}, "mem_gb": 21.77}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14048558220930088, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 374}, "mem_gb": 21.62}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12331899496933135, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 311}, "mem_gb": 21.79}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09510794661102506, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 259}, "mem_gb": 22.1}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12337971659527781, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 305}, "mem_gb": 22.08}
70
+ [eval step 50] sample: "To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the st"
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10608506205414112, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 298}, "mem_gb": 22.06}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16433386120260693, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 364}, "mem_gb": 21.84}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07193030385592332, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 302}, "mem_gb": 21.94}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15113193254228682, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 316}, "mem_gb": 21.7}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15811622174900647, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 312}, "mem_gb": 21.8}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12920384376960187, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 330}, "mem_gb": 21.95}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1187352925280109, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 321}, "mem_gb": 21.95}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10613751531397769, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 344}, "mem_gb": 21.99}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1312722167108984, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 353}, "mem_gb": 21.66}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0695360666809293, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 272}, "mem_gb": 22.09}
82
+ [eval step 60] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1455455080981211, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 317}, "mem_gb": 21.84}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05710575391312595, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 292}, "mem_gb": 21.84}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02620867559579977, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.28515625, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 229}, "mem_gb": 21.95}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14117729600436674, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 359}, "mem_gb": 21.96}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1221605477043738, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 358}, "mem_gb": 21.68}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14994822358403664, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 315}, "mem_gb": 22.06}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09590656752044645, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 264}, "mem_gb": 22.14}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13905403746368053, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 337}, "mem_gb": 21.81}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07033825809750706, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 251}, "mem_gb": 22.1}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11051185541416829, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 298}, "mem_gb": 21.83}
93
+ [eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08863176402659155, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 22.04}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08975313320999655, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 305}, "mem_gb": 22.06}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0785589623926906, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 322}, "mem_gb": 21.83}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13083661611887315, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 361}, "mem_gb": 21.82}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09676426596191401, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 321}, "mem_gb": 22.0}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10705909703215584, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 307}, "mem_gb": 21.89}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13818720473113158, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 327}, "mem_gb": 21.99}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15953805777930344, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 356}, "mem_gb": 21.61}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07479683817312277, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 283}, "mem_gb": 21.95}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13747099903764515, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 401}, "mem_gb": 21.7}
104
+ [eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08265764909470454, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 288}, "mem_gb": 21.9}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11676787589995656, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 323}, "mem_gb": 21.94}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1520628171203658, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 336}, "mem_gb": 21.83}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12861729065453012, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 329}, "mem_gb": 21.74}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12267830976805029, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 343}, "mem_gb": 21.72}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1380810285254692, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 336}, "mem_gb": 21.84}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12063934380811019, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 314}, "mem_gb": 22.08}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07519182774128857, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 281}, "mem_gb": 21.91}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09502988699192647, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 299}, "mem_gb": 21.79}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12705368615441645, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 328}, "mem_gb": 21.98}
115
+ [eval step 90] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0862862615711987, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 271}, "mem_gb": 22.08}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09148024477822085, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 269}, "mem_gb": 22.18}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.164310840678898, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 370}, "mem_gb": 21.72}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17390583124776993, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 352}, "mem_gb": 21.78}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1377207483136716, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 330}, "mem_gb": 21.99}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10440747004504859, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 334}, "mem_gb": 21.71}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10925455036055452, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 336}, "mem_gb": 21.85}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08199445860886481, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 309}, "mem_gb": 21.93}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13870517097897828, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 391}, "mem_gb": 21.82}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07164855895055613, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 264}, "mem_gb": 22.22}
126
+ [eval step 100] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1266370743949432, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 349}, "mem_gb": 21.77}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12119940490340038, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 312}, "mem_gb": 21.82}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03902455932382339, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.314453125, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 229}, "mem_gb": 22.09}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10270367020117895, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 288}, "mem_gb": 22.09}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14584330164432371, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 351}, "mem_gb": 21.75}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04243294466808438, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.341796875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 223}, "mem_gb": 22.12}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023869071152953742, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.291015625, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 213}, "mem_gb": 22.08}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12585831281617285, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 380}, "mem_gb": 21.93}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0734616152417846, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 271}, "mem_gb": 22.11}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15622796851478826, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 340}, "mem_gb": 22.01}
138
+ [eval step 110] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14512051825829161, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 366}, "mem_gb": 21.7}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.044982116243173366, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.33203125, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 233}, "mem_gb": 22.09}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09624799026324957, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 312}, "mem_gb": 21.96}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14220688819591887, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 363}, "mem_gb": 21.67}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14360804684354614, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 323}, "mem_gb": 21.94}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1414443791443327, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 346}, "mem_gb": 21.69}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13968993815806074, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 318}, "mem_gb": 21.83}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11073779288476022, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 275}, "mem_gb": 22.02}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.126646263968572, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 345}, "mem_gb": 21.76}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12029666416899612, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 377}, "mem_gb": 21.91}
149
+ [eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is rank-deficient if it has fewer linearly independent rows or '
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09910357171046393, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 294}, "mem_gb": 22.14}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103205797392876, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 338}, "mem_gb": 21.83}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15231768526208275, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 352}, "mem_gb": 21.73}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1330686989673491, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 347}, "mem_gb": 21.78}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08382959511203614, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 310}, "mem_gb": 21.76}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1573630730092215, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 358}, "mem_gb": 21.78}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07736654975072015, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 319}, "mem_gb": 22.06}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.052959537454197805, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.353515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 269}, "mem_gb": 22.09}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10328283424891221, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 310}, "mem_gb": 21.94}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06663515242016874, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 259}, "mem_gb": 22.12}
160
+ [eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\"
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06518598229006553, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 265}, "mem_gb": 22.1}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1502952246360791, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 337}, "mem_gb": 21.64}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07359331269300698, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 290}, "mem_gb": 21.91}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12302973660406036, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 349}, "mem_gb": 21.84}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07360859731266585, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 291}, "mem_gb": 21.94}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12916730738196056, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 342}, "mem_gb": 21.8}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17012806373077136, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 338}, "mem_gb": 21.75}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14694349039436008, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 356}, "mem_gb": 21.71}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06565651553365558, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 265}, "mem_gb": 22.09}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11438166577975886, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 353}, "mem_gb": 21.81}
171
+ [eval step 140] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11060065792566165, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 316}, "mem_gb": 21.99}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09960311313181494, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 289}, "mem_gb": 22.14}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09936332012518154, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 331}, "mem_gb": 21.78}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09064436243596331, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 320}, "mem_gb": 22.1}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08683979377732612, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 272}, "mem_gb": 21.83}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17217374604499588, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 368}, "mem_gb": 21.75}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12800495204334147, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 328}, "mem_gb": 21.78}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12136686044478168, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 326}, "mem_gb": 21.99}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14625438564123275, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 364}, "mem_gb": 21.93}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0935579854795166, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 296}, "mem_gb": 21.97}
182
+ [eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading summary, console lines 171-171
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–„β–‡β–β–ƒβ–ˆβ–ˆβ–‡β–ƒβ–†β–†β–„β–‡β–…β–„β–ƒβ–„β–‡β–‡β–„β–„β–‚β–†β–ƒβ–ƒβ–†β–‚β–ƒβ–ƒβ–ƒβ–β–„β–„β–…β–ƒβ–„β–…β–…β–ƒβ–ƒβ–ƒ
189
+ wandb: cumulative_loss_tokens β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–ƒβ–ˆβ–ˆβ–„β–ˆβ–…β–„β–‚β–…β–ƒβ–„β–‡β–ˆβ–ˆβ–†β–ˆβ–‡β–ˆβ–ˆβ–ˆβ–†β–ˆβ–‡β–‡β–ˆβ–ˆβ–‡β–‡β–β–†β–ˆβ–ˆβ–ˆβ–‡β–†β–ˆβ–‚β–ˆβ–ˆβ–ˆ
192
+ wandb: forward_topk_kl β–…β–…β–†β–ˆβ–ˆβ–‡β–ƒβ–β–ˆβ–‚β–„β–‡β–‚β–†β–„β–ƒβ–„β–…β–†β–‚β–†β–…β–†β–…β–„β–ƒβ–…β–‚β–β–β–†β–†β–…β–ƒβ–ƒβ–‡β–‚β–„β–„β–ƒ
193
+ wandb: grad_norm β–†β–†β–†β–„β–…β–‚β–‚β–„β–„β–ƒβ–ˆβ–ƒβ–‚β–‚β–‚β–ƒβ–‚β–‚β–ƒβ–‚β–ƒβ–‚β–‚β–β–ƒβ–‚β–‚β–ƒβ–‚β–ƒβ–β–ƒβ–‚β–β–‚β–ƒβ–‚β–‚β–‚β–‚
194
+ wandb: lr β–β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–ˆβ–ˆβ–†β–„β–ƒβ–ˆβ–ˆβ–†β–‡β–†β–†β–ƒβ–ˆβ–‡β–„β–β–ˆβ–„β–†β–†β–ˆβ–„β–„β–‚β–‚β–ƒβ–‚β–…β–„β–ƒβ–ˆβ–ˆβ–†β–ƒβ–ƒβ–ˆβ–β–ƒβ–†β–…
196
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 405.4
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.97
205
+ wandb: forward_topk_kl 0.09356
206
+ wandb: grad_norm 0.41406
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 21.97
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run glean_keep75_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/kv8yaoo0
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1224/wandb/run-20260718_162400-kv8yaoo0/logs
healed/grid_general/glean_keep75_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep75_s1225.console.log ADDED
@@ -0,0 +1,215 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1225/wandb/run-20260718_162630-suscdijy
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run glean_keep75_s1225
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/suscdijy
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22111648944811896, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.9453125, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 331}, "mem_gb": 21.8}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: "To solve this problem we need to consider both the monthly savings and the interest earned on the investment account. Let's break it down step-by-step:\n\n1. **Initial Savings:**\n Jamie starts with $5"
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20739211166581759, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.765625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 342}, "mem_gb": 21.72}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2209934898734403, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.75, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 21.75}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1873948453382589, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.234375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 344}, "mem_gb": 21.84}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10151976801240817, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 0.7890625, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 267}, "mem_gb": 22.15}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04757711379414735, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.57421875, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 248}, "mem_gb": 21.99}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1647617442355336, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.79296875, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 329}, "mem_gb": 21.98}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17157698108962116, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.8125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 339}, "mem_gb": 21.94}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18935150277211021, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 354}, "mem_gb": 21.94}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11263611569224546, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 279}, "mem_gb": 22.07}
25
+ [eval step 10] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13158609575961405, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 318}, "mem_gb": 22.0}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09245108005555036, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 265}, "mem_gb": 22.09}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08413456361761006, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 254}, "mem_gb": 22.03}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13070056756052653, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 315}, "mem_gb": 22.06}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17809998495957505, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 300}, "mem_gb": 21.85}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12099112552187095, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 276}, "mem_gb": 22.06}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19513164097640354, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 356}, "mem_gb": 22.0}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15956264482447877, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 304}, "mem_gb": 21.81}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17090653341195236, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 375}, "mem_gb": 21.73}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08869710400897698, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 294}, "mem_gb": 22.09}
36
+ [eval step 20] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15638344656505312, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 299}, "mem_gb": 22.1}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12055374830563863, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 305}, "mem_gb": 21.88}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07345050730570996, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 262}, "mem_gb": 21.93}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10048658993549955, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 303}, "mem_gb": 21.99}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16752728424686938, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 380}, "mem_gb": 21.87}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07310452284355028, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 282}, "mem_gb": 21.82}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14664142841110006, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 362}, "mem_gb": 21.84}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14827515455516987, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 307}, "mem_gb": 22.08}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10104854320368419, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 282}, "mem_gb": 21.95}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14813115498276117, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 337}, "mem_gb": 21.98}
47
+ [eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings total of $1,000,000, starting from an initial savings of $50,000, with monthly savings of $2,500 and a'
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08812641109892477, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 275}, "mem_gb": 22.03}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16168197835070702, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 318}, "mem_gb": 21.85}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18779974681317496, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 385}, "mem_gb": 21.87}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18032465255840993, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 316}, "mem_gb": 21.82}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07333130201975194, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 266}, "mem_gb": 22.11}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16189229198264268, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.3, "frames": {"chat": 371}, "mem_gb": 21.85}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07895646804651867, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 262}, "mem_gb": 22.05}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17505176945934073, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.3, "frames": {"chat": 348}, "mem_gb": 21.88}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03176176859846649, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 222}, "mem_gb": 22.12}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14499215378852873, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 408}, "mem_gb": 21.68}
58
+ [eval step 40] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1439369252748477, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 334}, "mem_gb": 21.75}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0706772371889092, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 312}, "mem_gb": 21.79}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14474734909307832, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 352}, "mem_gb": 21.78}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11817377693428037, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 371}, "mem_gb": 21.59}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08205563750300401, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 284}, "mem_gb": 22.04}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06395803977077982, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 287}, "mem_gb": 22.1}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06253780153614158, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 285}, "mem_gb": 22.0}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03680590559190605, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.33203125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 252}, "mem_gb": 22.09}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14121348284740623, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 360}, "mem_gb": 21.88}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15307914910099157, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 359}, "mem_gb": 21.87}
69
+ [eval step 50] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step'
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14933904542151527, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 363}, "mem_gb": 21.63}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12488553350229437, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 361}, "mem_gb": 21.72}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07843442128324726, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 286}, "mem_gb": 21.91}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15271823925731393, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 367}, "mem_gb": 21.76}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1547942965360048, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 352}, "mem_gb": 21.79}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09296400288581692, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 314}, "mem_gb": 21.74}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13976919506203073, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 372}, "mem_gb": 21.71}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11570093697020783, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 334}, "mem_gb": 21.86}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15998193920060683, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 368}, "mem_gb": 21.8}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11672706741454701, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 354}, "mem_gb": 21.95}
81
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06066959252501838, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 293}, "mem_gb": 21.84}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05333657562431569, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 231}, "mem_gb": 22.0}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1172690767421232, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 302}, "mem_gb": 21.96}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08245002971144859, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 263}, "mem_gb": 22.11}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07935726706857482, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 252}, "mem_gb": 22.04}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11996434357226826, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 344}, "mem_gb": 22.07}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10608412687256932, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 313}, "mem_gb": 21.99}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13292832461064683, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 358}, "mem_gb": 21.7}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.058491427368693984, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 267}, "mem_gb": 21.92}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12371690684755643, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 300}, "mem_gb": 21.79}
92
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10120161286913014, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 348}, "mem_gb": 21.72}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13300567625317103, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 329}, "mem_gb": 21.81}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08815251566586085, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 269}, "mem_gb": 21.98}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14700993717334543, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 358}, "mem_gb": 21.65}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08780325295242947, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 302}, "mem_gb": 21.9}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15126645126342775, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 381}, "mem_gb": 21.92}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16602870603888295, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 379}, "mem_gb": 21.87}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1479064573767595, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 2.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 351}, "mem_gb": 21.69}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12383289006313619, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 330}, "mem_gb": 21.89}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13381629625046626, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 316}, "mem_gb": 21.92}
103
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08777398953228258, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 276}, "mem_gb": 22.1}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07588460938346883, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 240}, "mem_gb": 22.04}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08674834172253808, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 288}, "mem_gb": 21.95}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0853487105220401, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 271}, "mem_gb": 21.93}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11503733798294949, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 357}, "mem_gb": 21.88}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15167251249333688, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 354}, "mem_gb": 21.86}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1492915164715455, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 302}, "mem_gb": 22.1}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1165785896692425, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 297}, "mem_gb": 22.08}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.040747156729688865, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 219}, "mem_gb": 22.11}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1541989786786881, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 306}, "mem_gb": 21.81}
114
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14793864214128505, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 343}, "mem_gb": 21.75}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1409232384520117, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 341}, "mem_gb": 21.86}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07915917732289526, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 318}, "mem_gb": 21.81}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13964604461910204, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 346}, "mem_gb": 21.69}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07686658267939153, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 277}, "mem_gb": 22.17}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06977991890592966, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 270}, "mem_gb": 21.9}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10083707856455973, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 257}, "mem_gb": 22.09}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13963890134370885, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 363}, "mem_gb": 21.69}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14385810780053337, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 356}, "mem_gb": 21.83}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13153254311414592, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 323}, "mem_gb": 21.86}
125
+ [eval step 100] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both the monthly savings from their salary and the interest earned from their investment '
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06175670235753059, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 243}, "mem_gb": 22.12}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12986055870184984, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 307}, "mem_gb": 21.8}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13002900751053045, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 346}, "mem_gb": 22.03}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.083841623769328, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 273}, "mem_gb": 22.04}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08284003194456455, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 302}, "mem_gb": 21.96}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13057155935082895, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 337}, "mem_gb": 22.1}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09851139658095781, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 280}, "mem_gb": 21.97}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14711742097334937, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 331}, "mem_gb": 21.87}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0923692204245987, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 314}, "mem_gb": 21.98}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15357590574178223, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 294}, "mem_gb": 21.9}
137
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07093229558913347, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 274}, "mem_gb": 22.04}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.122054125573067, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 365}, "mem_gb": 21.76}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07806385687385142, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 323}, "mem_gb": 21.82}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.053346825325737396, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 234}, "mem_gb": 22.1}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06765599786348175, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 267}, "mem_gb": 22.11}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08791090544823868, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 304}, "mem_gb": 21.87}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14018318482727432, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 373}, "mem_gb": 21.79}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08132816180216614, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 300}, "mem_gb": 22.08}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14348885650614587, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 331}, "mem_gb": 21.92}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.060424468856607565, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 259}, "mem_gb": 22.06}
148
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11844724626628837, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 358}, "mem_gb": 21.67}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15814292623492268, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 354}, "mem_gb": 21.93}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07169985630032606, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 279}, "mem_gb": 22.0}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1502783228988759, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 354}, "mem_gb": 21.75}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14168044462169055, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 334}, "mem_gb": 21.95}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1427589185612121, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 327}, "mem_gb": 21.81}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12058290783953077, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 365}, "mem_gb": 21.92}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0739571741439014, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 252}, "mem_gb": 22.12}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05989120363375017, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 256}, "mem_gb": 22.09}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08655550488675168, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 302}, "mem_gb": 21.86}
159
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12712168140066787, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 350}, "mem_gb": 21.77}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07436676307577485, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 292}, "mem_gb": 21.88}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13760671476287145, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 356}, "mem_gb": 21.7}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08557242370104262, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 347}, "mem_gb": 21.86}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08368868318758128, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 330}, "mem_gb": 22.06}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12720819443305956, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 363}, "mem_gb": 21.91}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12082518962655837, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.0, "frames": {"chat": 354}, "mem_gb": 21.78}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06660643954688372, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 270}, "mem_gb": 22.04}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12762515747703923, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 343}, "mem_gb": 21.82}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.030163056720176246, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 232}, "mem_gb": 22.01}
170
+ [eval step 140] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned from the investment account.\n\n**Step 1: '
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12121607892350293, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 346}, "mem_gb": 21.95}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09290275220452653, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 306}, "mem_gb": 22.04}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05772588231681536, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 273}, "mem_gb": 22.08}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06758122839964927, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.3671875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 266}, "mem_gb": 21.91}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10201068616132251, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 299}, "mem_gb": 22.11}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06552851478964246, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 259}, "mem_gb": 22.19}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08131732919542119, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 325}, "mem_gb": 21.92}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07450551387115847, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 271}, "mem_gb": 22.0}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1205579935764273, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 359}, "mem_gb": 21.79}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11683979006973096, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 345}, "mem_gb": 21.85}
181
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading config.yaml
185
+ wandb:
186
+ wandb: Run history:
187
+ wandb: comp_len β–‚β–†β–‚β–ƒβ–†β–„β–‚β–„β–…β–ƒβ–β–ƒβ–„β–„β–β–ƒβ–…β–†β–‚β–„β–„β–‚β–…β–‚β–„β–„β–…β–ƒβ–ˆβ–†β–β–ƒβ–†β–‚β–‡β–ƒβ–‚β–†β–†β–‚
188
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆ
189
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
190
+ wandb: finish_rate β–ˆβ–ˆβ–‡β–ˆβ–‡β–ˆβ–†β–‡β–ˆβ–ˆβ–β–ˆβ–ˆβ–ˆβ–…β–‡β–„β–ˆβ–†β–ˆβ–ˆβ–„β–‚β–ˆβ–…β–ˆβ–ˆβ–ˆβ–ˆβ–…β–‚β–„β–ˆβ–ƒβ–ˆβ–ˆβ–‡β–ˆβ–‡β–ˆ
191
+ wandb: forward_topk_kl β–ˆβ–‡β–†β–ƒβ–„β–‡β–‚β–†β–…β–‚β–†β–…β–†β–‚β–‚β–…β–‚β–…β–…β–„β–„β–‚β–…β–„β–‚β–…β–‚β–ƒβ–…β–‚β–…β–‚β–‚β–…β–β–‚β–„β–ƒβ–β–„
192
+ wandb: grad_norm β–„β–ƒβ–‚β–‚β–‚β–‚β–‚β–‚β–β–‚β–‚β–‚β–β–‚β–‚β–β–ƒβ–‚β–β–β–β–ˆβ–β–β–β–β–β–β–‚β–‚β–β–β–‚β–β–β–β–β–β–β–
193
+ wandb: lr β–β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: mem_gb β–‚β–ƒβ–†β–…β–‡β–†β–‡β–„β–„β–„β–†β–„β–β–‚β–†β–‚β–ƒβ–ƒβ–β–„β–…β–‡β–…β–„β–‡β–‡β–‚β–ˆβ–…β–‡β–†β–„β–†β–ƒβ–‡β–ƒβ–‚β–‡β–‡β–ƒ
195
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
196
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
197
+ wandb: +3 ...
198
+ wandb:
199
+ wandb: Run summary:
200
+ wandb: comp_len 347.8
201
+ wandb: cumulative_loss_tokens 18000000
202
+ wandb: epoch 0
203
+ wandb: finish_rate 0.997
204
+ wandb: forward_topk_kl 0.11684
205
+ wandb: grad_norm 0.47656
206
+ wandb: lr 3e-05
207
+ wandb: mem_gb 21.85
208
+ wandb: step 150
209
+ wandb: t_data_s 0
210
+ wandb: +4 ...
211
+ wandb:
212
+ wandb: πŸš€ View run glean_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/suscdijy
213
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
214
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
215
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1225/wandb/run-20260718_162630-suscdijy/logs
healed/grid_general/glean_keep75_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/glean_keep75_s1226.console.log ADDED
@@ -0,0 +1,215 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1226/wandb/run-20260718_192317-q973uip1
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run glean_keep75_s1226
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/q973uip1
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1413160980346768, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.75, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 308}, "mem_gb": 21.9}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\( d \\). the \\"
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04849519984136957, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.265625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 211}, "mem_gb": 22.09}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1057090827699906, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.515625, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 281}, "mem_gb": 22.09}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20369750064744924, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.515625, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 367}, "mem_gb": 21.63}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1861306351597576, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.0625, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 312}, "mem_gb": 21.8}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1492766888952038, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.87890625, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 271}, "mem_gb": 22.11}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09697009395253844, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.6953125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 269}, "mem_gb": 22.08}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18224880321479092, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.765625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 352}, "mem_gb": 21.6}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07065487672941138, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 243}, "mem_gb": 22.09}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12280961040410523, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 293}, "mem_gb": 22.01}
25
+ [eval step 10] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06721969474758953, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 242}, "mem_gb": 22.09}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18982516884515063, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 353}, "mem_gb": 21.78}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18828471876895056, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 338}, "mem_gb": 21.78}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08397472261761625, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 259}, "mem_gb": 22.08}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16453956262846478, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 385}, "mem_gb": 21.64}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1512448895484209, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 355}, "mem_gb": 21.8}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13268581481428507, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 328}, "mem_gb": 21.71}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14356467844688645, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 355}, "mem_gb": 21.86}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1773852861534183, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 367}, "mem_gb": 21.73}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15869609248543468, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 343}, "mem_gb": 21.77}
36
+ [eval step 20] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term \\"
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07111443312324894, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 244}, "mem_gb": 22.09}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10239945090222173, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 339}, "mem_gb": 21.93}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10481588966808825, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 298}, "mem_gb": 22.08}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15125719757280312, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 398}, "mem_gb": 21.95}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13876289220652543, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 362}, "mem_gb": 22.06}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09728015474545924, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 313}, "mem_gb": 21.93}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16174195971769903, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 324}, "mem_gb": 21.84}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11227309670362932, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 314}, "mem_gb": 21.9}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1496671024374043, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 345}, "mem_gb": 21.82}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0877499234606085, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 262}, "mem_gb": 22.0}
47
+ [eval step 30] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18145805544837687, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 373}, "mem_gb": 21.79}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1443175487255988, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 334}, "mem_gb": 21.79}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1004882241464608, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 327}, "mem_gb": 21.94}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0275851215143688, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.333984375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 238}, "mem_gb": 22.1}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12761550147404585, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 310}, "mem_gb": 21.84}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14843029471280364, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 347}, "mem_gb": 21.84}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13815048004087682, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 304}, "mem_gb": 21.76}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13358069184031338, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 343}, "mem_gb": 21.79}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15010506374416874, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 314}, "mem_gb": 21.78}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13925395173551514, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 300}, "mem_gb": 21.88}
58
+ [eval step 40] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1083768343289538, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 318}, "mem_gb": 21.92}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08460797195690684, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 279}, "mem_gb": 21.96}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1537272752489584, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 364}, "mem_gb": 22.02}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1061037359959446, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 256}, "mem_gb": 22.09}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1837975141172142, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 340}, "mem_gb": 21.79}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08009947391541208, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 283}, "mem_gb": 22.02}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14230651331756575, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 349}, "mem_gb": 21.8}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08268892391519621, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 297}, "mem_gb": 21.88}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16595241406840894, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 359}, "mem_gb": 21.85}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10582465117862448, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 342}, "mem_gb": 21.89}
69
+ [eval step 50] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07470876316506571, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 269}, "mem_gb": 22.06}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10869510563722191, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 324}, "mem_gb": 22.05}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08518406727248803, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 281}, "mem_gb": 22.04}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09822068768725731, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 287}, "mem_gb": 22.08}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12007080832890546, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 296}, "mem_gb": 22.09}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0840601130682199, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 267}, "mem_gb": 22.15}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0830530796768687, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 249}, "mem_gb": 22.05}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16557893410891605, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 363}, "mem_gb": 21.75}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09872415286762795, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 299}, "mem_gb": 21.88}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15187458796397163, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 331}, "mem_gb": 21.76}
81
+ [eval step 60] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07433416724340836, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 280}, "mem_gb": 21.97}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16020082334758093, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 350}, "mem_gb": 21.96}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13970972021511602, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 321}, "mem_gb": 21.72}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06836845907570484, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 281}, "mem_gb": 22.02}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16352739405889685, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 331}, "mem_gb": 21.7}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11902664954640592, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 318}, "mem_gb": 22.07}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09364758191780809, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 309}, "mem_gb": 22.09}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10470447588497772, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 304}, "mem_gb": 21.97}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0693966237762943, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 279}, "mem_gb": 22.0}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02911017654616541, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.34765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 248}, "mem_gb": 22.0}
92
+ [eval step 70] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11099985734704727, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 268}, "mem_gb": 21.97}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10305993815530091, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 299}, "mem_gb": 22.07}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11933142734871556, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 322}, "mem_gb": 21.93}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06709553298743752, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.35546875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 248}, "mem_gb": 22.1}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11146160014714114, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 326}, "mem_gb": 22.0}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1007795615594058, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 314}, "mem_gb": 21.76}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028291584209896005, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.328125, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 232}, "mem_gb": 22.1}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15302979311901144, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 330}, "mem_gb": 21.83}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07534985212577351, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 292}, "mem_gb": 21.98}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12400587685474505, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 312}, "mem_gb": 22.0}
103
+ [eval step 80] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.163432472588378, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.4, "frames": {"chat": 382}, "mem_gb": 21.81}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1656620658460694, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 360}, "mem_gb": 21.67}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02293366577536799, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 426.4, "frames": {"chat": 222}, "mem_gb": 21.94}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1488103632712892, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 451.8, "frames": {"chat": 342}, "mem_gb": 21.99}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14048245466801648, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 459.1, "frames": {"chat": 337}, "mem_gb": 21.79}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08949292343774966, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 490.7, "frames": {"chat": 304}, "mem_gb": 22.04}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0962977189412651, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 448.4, "frames": {"chat": 326}, "mem_gb": 21.94}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12742471727432372, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 310}, "mem_gb": 22.0}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12377240428469764, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 328}, "mem_gb": 21.82}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15952133797959736, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 347}, "mem_gb": 21.65}
114
+ [eval step 90] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1332611817421081, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 330}, "mem_gb": 21.94}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03117541796125782, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 209}, "mem_gb": 22.14}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14521490836364684, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 399}, "mem_gb": 21.72}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12175604587808872, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 351}, "mem_gb": 21.8}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08692466896735132, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 322}, "mem_gb": 21.8}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14002212731780794, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 333}, "mem_gb": 21.69}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10281148330651534, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 330}, "mem_gb": 21.97}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02200900837377024, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.2734375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 238}, "mem_gb": 22.01}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06418654550995367, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 297}, "mem_gb": 21.92}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13064617172250678, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 345}, "mem_gb": 21.88}
125
+ [eval step 100] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08860973457853155, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 304}, "mem_gb": 22.03}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1211775447745885, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 326}, "mem_gb": 22.03}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14466580771614487, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 347}, "mem_gb": 21.95}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1286898497606162, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 325}, "mem_gb": 21.84}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07902086545533966, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 299}, "mem_gb": 22.03}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16233786880969225, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 345}, "mem_gb": 21.8}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13559324684312257, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 344}, "mem_gb": 21.69}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09932501186232548, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 344}, "mem_gb": 21.96}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09514856690616191, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 288}, "mem_gb": 22.02}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0850360783191165, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 303}, "mem_gb": 21.73}
137
+ [eval step 110] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06375691673830151, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 284}, "mem_gb": 21.92}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15935028244269392, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 369}, "mem_gb": 21.81}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07107018628746736, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 22.07}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13741801153526953, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 341}, "mem_gb": 21.83}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13155154890369158, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 384}, "mem_gb": 21.6}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12168247848381289, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 358}, "mem_gb": 21.76}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13569500965482245, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 342}, "mem_gb": 21.93}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1514469413602104, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 365}, "mem_gb": 21.75}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13520857937311132, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 337}, "mem_gb": 21.99}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11999537091556316, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 333}, "mem_gb": 22.09}
148
+ [eval step 120] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0808612868486438, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 293}, "mem_gb": 22.13}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06993180109107246, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 291}, "mem_gb": 21.89}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12544284139291073, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 341}, "mem_gb": 21.92}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07498731323514754, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 300}, "mem_gb": 21.86}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0719582883243061, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 270}, "mem_gb": 22.08}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0536270107534326, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 259}, "mem_gb": 22.1}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13416044807817476, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 355}, "mem_gb": 21.67}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15425396803029193, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 388}, "mem_gb": 22.03}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12761535915248096, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 318}, "mem_gb": 21.74}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14441497259632063, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 383}, "mem_gb": 21.88}
159
+ [eval step 130] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07577277182651838, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 21.89}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07005898589462352, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 295}, "mem_gb": 21.98}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07240092389283236, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 306}, "mem_gb": 21.71}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10792480116698425, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 303}, "mem_gb": 21.97}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.052931241141119974, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 272}, "mem_gb": 22.04}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07667474498679706, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 248}, "mem_gb": 22.04}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08408431772824067, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 282}, "mem_gb": 22.03}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13470493362446626, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 362}, "mem_gb": 21.59}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1445563850287969, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 374}, "mem_gb": 21.95}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07023882402332189, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 280}, "mem_gb": 22.12}
170
+ [eval step 140] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05532636799375371, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.35546875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 276}, "mem_gb": 21.96}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07462077040801135, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 246}, "mem_gb": 22.1}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.153857332631868, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 360}, "mem_gb": 21.63}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15233792337393387, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 365}, "mem_gb": 21.81}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12471409813507926, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 338}, "mem_gb": 21.9}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.056699273616044474, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 276}, "mem_gb": 22.01}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02889200972855712, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.3125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 209}, "mem_gb": 22.09}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12253848117648934, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 379}, "mem_gb": 21.69}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10938656153276097, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 307}, "mem_gb": 22.03}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07230857622489954, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 293}, "mem_gb": 22.06}
181
+ [eval step 150] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading summary, console lines 171-171
185
+ wandb:
186
+ wandb: Run history:
187
+ wandb: comp_len β–„β–β–…β–‚β–β–β–†β–‚β–ƒβ–…β–ƒβ–ƒβ–…β–„β–„β–†β–‚β–„β–ƒβ–ƒβ–†β–‡β–‚β–‚β–ƒβ–‚β–ƒβ–‚β–†β–ƒβ–„β–‚β–β–ƒβ–…β–ƒβ–„β–†β–‚β–ˆ
188
+ wandb: cumulative_loss_tokens β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
189
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
190
+ wandb: finish_rate β–‡β–β–†β–ˆβ–†β–„β–ˆβ–ˆβ–ˆβ–‡β–ˆβ–ˆβ–‡β–ˆβ–†β–†β–†β–…β–†β–‡β–ˆβ–ˆβ–ƒβ–‡β–ˆβ–ˆβ–‡β–ˆβ–†β–‡β–‡β–…β–ˆβ–‡β–ˆβ–ˆβ–‡β–„β–…β–†
191
+ wandb: forward_topk_kl β–†β–ˆβ–‡β–‡β–†β–‡β–ƒβ–„β–…β–„β–…β–ƒβ–†β–ƒβ–„β–‡β–†β–†β–†β–…β–„β–…β–„β–†β–…β–†β–β–β–…β–…β–…β–„β–ƒβ–…β–‚β–‚β–ƒβ–ƒβ–†β–‚
192
+ wandb: grad_norm β–ˆβ–‡β–…β–ƒβ–ƒβ–ƒβ–‚β–‚β–ƒβ–‚β–β–‚β–‚β–β–‚β–‚β–‚β–‚β–β–‚β–‚β–‚β–β–β–‚β–‚β–‚β–‚β–‚β–β–‚β–‚β–‚β–‚β–‚β–β–β–β–β–‚
193
+ wandb: lr β–β–ƒβ–…β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: mem_gb β–‡β–β–β–ƒβ–ƒβ–‡β–†β–…β–†β–„β–…β–†β–‡β–‡β–…β–‡β–‡β–ƒβ–‡β–†β–†β–ˆβ–†β–‚β–‡β–‚β–…β–ƒβ–ƒβ–ˆβ–„β–‚β–†β–‚β–†β–ˆβ–†β–ˆβ–β–‡
195
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆ
196
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
197
+ wandb: +3 ...
198
+ wandb:
199
+ wandb: Run summary:
200
+ wandb: comp_len 409.6
201
+ wandb: cumulative_loss_tokens 18000000
202
+ wandb: epoch 0
203
+ wandb: finish_rate 0.942
204
+ wandb: forward_topk_kl 0.07231
205
+ wandb: grad_norm 0.40234
206
+ wandb: lr 3e-05
207
+ wandb: mem_gb 22.06
208
+ wandb: step 150
209
+ wandb: t_data_s 0
210
+ wandb: +4 ...
211
+ wandb:
212
+ wandb: πŸš€ View run glean_keep75_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/q973uip1
213
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
214
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
215
+ wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1226/wandb/run-20260718_192317-q973uip1/logs
healed/grid_general/glean_keep75_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep25_s1224.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run ydhbbk1z
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1224/wandb/run-20260717_150109-ydhbbk1z
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run reap_keep25_s1224
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/ydhbbk1z
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.714513613096873, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 90.5, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 259}, "mem_gb": 9.93}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'POR:5GYUI Oisse\nlt g intro- N1(numbersialudild)\n\nnou natorls:1[n-in-,orler acday.#-=1 \n"""\n"""Mnel=>and"130-lc4-'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 7.052694697197278, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 71.5, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 348}, "mem_gb": 9.59}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.581489293889205, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 66.0, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 370}, "mem_gb": 9.74}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.8654761122624075, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 57.0, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 244}, "mem_gb": 9.97}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.814938292272886, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 39.0, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 320}, "mem_gb": 9.89}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.5225257198294, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 37.0, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 378}, "mem_gb": 9.49}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.168571872454882, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 44.25, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 384}, "mem_gb": 9.98}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.3614308606823284, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 35.75, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 324}, "mem_gb": 9.83}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9847333917876084, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 23.75, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 239}, "mem_gb": 10.0}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.441437253133456, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 16.625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 306}, "mem_gb": 9.74}
25
+ [eval step 10] sample: 'Compute the rank of the given 4x4 matrix:\n[[12, -16, 4, 16],\n[--9, 11, -1, -10],\n[-0, 1, -2, -10],\n[-0, 4, -8, -8]}\n\nCompute'
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.360720735937357, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 13.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 329}, "mem_gb": 9.77}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3320580815384786, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 7.03125, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 254}, "mem_gb": 10.0}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7477209083815415, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 6.5625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 273}, "mem_gb": 9.98}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.905339217838645, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.40625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 236}, "mem_gb": 9.9}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.894308428629736, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 381}, "mem_gb": 9.63}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8942556741168102, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 2.53125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 266}, "mem_gb": 9.83}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2078631315603852, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 2.671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 308}, "mem_gb": 9.82}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9374638251105945, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.9375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 273}, "mem_gb": 10.0}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.447662654795746, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 2.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 368}, "mem_gb": 9.63}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6041733922436834, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 2.46875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 339}, "mem_gb": 9.87}
36
+ [eval step 20] sample: 'To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of columns in the matrix.\n\nGiven matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9353083563171327, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.78125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 298}, "mem_gb": 9.8}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3508124507144093, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 2.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 350}, "mem_gb": 9.52}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7905151057086885, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.421875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 246}, "mem_gb": 9.97}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2881518234315017, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 375}, "mem_gb": 9.7}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.305539540750285, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 352}, "mem_gb": 9.75}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.27691397592475, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 396}, "mem_gb": 9.71}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0702742205070952, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 362}, "mem_gb": 9.56}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3215352043059965, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.3828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 369}, "mem_gb": 9.77}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.310362931372722, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 399}, "mem_gb": 9.62}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6964659744882956, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.3984375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 247}, "mem_gb": 9.89}
47
+ [eval step 30] sample: "To solve this problem, we need to find the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of linearly independent columns in the matrix.\n\nLet's break down the matrix step-by-"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3749437816654642, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 230}, "mem_gb": 9.83}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6364695584422598, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 263}, "mem_gb": 10.0}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6319580947947999, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 9.99}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0467302889599155, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.359375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 328}, "mem_gb": 9.85}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5760055315182855, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 281}, "mem_gb": 9.92}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4677317438756426, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 237}, "mem_gb": 9.91}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5605393174094458, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 278}, "mem_gb": 10.0}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0259025651920586, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 1.4765625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 310}, "mem_gb": 9.87}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6856813535400667, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 295}, "mem_gb": 9.81}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7459171565882862, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.953125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 329}, "mem_gb": 9.82}
58
+ [eval step 40] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix.\n\nGiven the matrix:\n\n\\[\nA = \\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6777477626826615, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 263}, "mem_gb": 9.94}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7141052765981605, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 315}, "mem_gb": 9.82}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9809643868823846, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 354}, "mem_gb": 9.77}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44921137073797485, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 259}, "mem_gb": 9.95}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6806124305025985, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 275}, "mem_gb": 9.8}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9492775865232572, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 334}, "mem_gb": 9.67}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0005501222976794, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 374}, "mem_gb": 9.52}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8096208624659728, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 311}, "mem_gb": 9.69}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7187964733070383, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 259}, "mem_gb": 10.0}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8398557908189793, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 305}, "mem_gb": 9.99}
69
+ [eval step 50] sample: 'To determine the rank of a matrix, we need to understand that the rank of a matrix is the maximum number of linearly independent rows or columns. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 &'
70
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7746725684193273, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 298}, "mem_gb": 9.96}
71
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0570293922627965, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 364}, "mem_gb": 9.74}
72
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5696624719357739, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 302}, "mem_gb": 9.84}
73
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.045973034708202, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 316}, "mem_gb": 9.6}
74
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0977590525440872, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 312}, "mem_gb": 9.7}
75
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7650056727120653, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 330}, "mem_gb": 9.85}
76
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.775473134911557, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 321}, "mem_gb": 9.86}
77
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8324109628355751, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 344}, "mem_gb": 9.89}
78
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8997549999526392, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 353}, "mem_gb": 9.56}
79
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4661473550739388, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 272}, "mem_gb": 9.99}
80
+ [eval step 60] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. \n\nLet's break down the problem step-by-step:\n\n1. **Matrix Definition:**\n \\[\n A = \\beg"
81
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0232317148663104, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 317}, "mem_gb": 9.74}
82
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.468317110635216, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 292}, "mem_gb": 9.74}
83
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27947916939407585, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 229}, "mem_gb": 9.85}
84
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9512269954226911, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 359}, "mem_gb": 9.86}
85
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8734925457065305, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 358}, "mem_gb": 9.58}
86
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9860965913433581, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 315}, "mem_gb": 9.97}
87
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6221852849562963, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 264}, "mem_gb": 10.04}
88
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9487652655401577, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 337}, "mem_gb": 9.71}
89
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4952909258775413, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 251}, "mem_gb": 10.0}
90
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6961152751598507, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 298}, "mem_gb": 9.73}
91
+ [eval step 70] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step:\n\n1. **Understand the "
92
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5788077697403728, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 264}, "mem_gb": 9.94}
93
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6019827347854774, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 305}, "mem_gb": 9.96}
94
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5746000899684925, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 322}, "mem_gb": 9.73}
95
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.940524634005626, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 361}, "mem_gb": 9.72}
96
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6179622926815723, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 321}, "mem_gb": 9.9}
97
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7707402221990128, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 307}, "mem_gb": 9.79}
98
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9255422383996348, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 327}, "mem_gb": 9.89}
99
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9841452605754137, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 356}, "mem_gb": 9.51}
100
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4795566956318915, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 283}, "mem_gb": 9.85}
101
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.903388200679173, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 401}, "mem_gb": 9.61}
102
+ [eval step 80] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the problem step-by-step:\n\n1. **Understand the Matrix:**"
103
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.60415241121271, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 288}, "mem_gb": 9.8}
104
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7414309971912454, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 323}, "mem_gb": 9.84}
105
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0112706265526514, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 336}, "mem_gb": 9.73}
106
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8384464806109667, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 329}, "mem_gb": 9.64}
107
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8245212999915084, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 343}, "mem_gb": 9.62}
108
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8487811851590872, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 336}, "mem_gb": 9.74}
109
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7976679800941299, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 314}, "mem_gb": 9.98}
110
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5121657419648021, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 281}, "mem_gb": 9.81}
111
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6462947391952077, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 299}, "mem_gb": 9.69}
112
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7679498924406867, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 328}, "mem_gb": 9.88}
113
+ [eval step 90] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step using Python and the sympy library:"
114
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060429289376984, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 271}, "mem_gb": 9.98}
115
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6353122635553281, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 269}, "mem_gb": 10.08}
116
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9505948884276052, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 370}, "mem_gb": 9.62}
117
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9914112706638872, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 352}, "mem_gb": 9.68}
118
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8775602666936815, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 330}, "mem_gb": 9.89}
119
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7306022960850348, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 334}, "mem_gb": 9.61}
120
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7210784587609271, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 336}, "mem_gb": 9.75}
121
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5393692284641166, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 309}, "mem_gb": 9.84}
122
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8877559786563118, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 391}, "mem_gb": 9.72}
123
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4869788068047414, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 264}, "mem_gb": 10.12}
124
+ [eval step 100] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
125
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678291204962879, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 349}, "mem_gb": 9.67}
126
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7157938474825273, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 312}, "mem_gb": 9.73}
127
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2847380786302189, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 229}, "mem_gb": 9.99}
128
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6860836447392901, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 288}, "mem_gb": 9.99}
129
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9254306713115424, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 351}, "mem_gb": 9.65}
130
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38883627386627095, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 223}, "mem_gb": 10.02}
131
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20738879148984948, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 213}, "mem_gb": 9.98}
132
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.858752869273598, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 380}, "mem_gb": 9.83}
133
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5064401058585694, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 271}, "mem_gb": 10.02}
134
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8971811090276887, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 340}, "mem_gb": 9.91}
135
+ [eval step 110] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Check for Linear Independenc"
136
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9605931589500357, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 366}, "mem_gb": 9.6}
137
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363283141590779, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 233}, "mem_gb": 9.99}
138
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6373608725018178, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 312}, "mem_gb": 9.86}
139
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.868706948846206, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 363}, "mem_gb": 9.57}
140
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8705472689797481, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 323}, "mem_gb": 9.85}
141
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9444174962684512, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 346}, "mem_gb": 9.59}
142
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8539180674185356, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 318}, "mem_gb": 9.74}
143
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6539584430909405, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 275}, "mem_gb": 9.92}
144
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.81154930332837, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 345}, "mem_gb": 9.67}
145
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8077557143279662, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 377}, "mem_gb": 9.81}
146
+ [eval step 120] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and the `"
147
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.664052238414685, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 294}, "mem_gb": 10.04}
148
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8953628696876268, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 338}, "mem_gb": 9.73}
149
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9028469905288269, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 352}, "mem_gb": 9.63}
150
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8481589727750669, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 347}, "mem_gb": 9.68}
151
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5397243623769532, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 310}, "mem_gb": 9.66}
152
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9418989515272279, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 358}, "mem_gb": 9.68}
153
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5691563136459639, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 319}, "mem_gb": 9.96}
154
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38915702238492667, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 269}, "mem_gb": 9.99}
155
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7045213386001066, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 310}, "mem_gb": 9.85}
156
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4709877991588786, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 259}, "mem_gb": 10.02}
157
+ [eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and the `"
158
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47775340601628025, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 265}, "mem_gb": 10.0}
159
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8888590919742981, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 337}, "mem_gb": 9.55}
160
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161087991711995, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 290}, "mem_gb": 9.81}
161
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7807277385645857, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 349}, "mem_gb": 9.74}
162
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161208944985022, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 291}, "mem_gb": 9.84}
163
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.807752444401135, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 342}, "mem_gb": 9.71}
164
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9198165919067959, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 338}, "mem_gb": 9.65}
165
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9056239002672335, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 356}, "mem_gb": 9.62}
166
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4489221845626831, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 265}, "mem_gb": 10.0}
167
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.747275248721987, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 353}, "mem_gb": 9.71}
168
+ [eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step:\n\n1. **Understand t"
169
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7047750924723843, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 316}, "mem_gb": 9.9}
170
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5933609875383166, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 289}, "mem_gb": 10.05}
171
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6415846698864053, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 331}, "mem_gb": 9.68}
172
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6330735582390179, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 320}, "mem_gb": 10.0}
173
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5657251183000703, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 272}, "mem_gb": 9.73}
174
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9686935982390618, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 368}, "mem_gb": 9.65}
175
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7965175971987347, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 328}, "mem_gb": 9.68}
176
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7893025688592344, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 326}, "mem_gb": 9.9}
177
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8914329555117836, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 364}, "mem_gb": 9.83}
178
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5755241934151699, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 296}, "mem_gb": 9.88}
179
+ [eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and th"
180
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1224/step0150
181
+ wandb: updating run metadata
182
+ wandb: uploading summary, console lines 167-168; uploading output.log; uploading wandb-summary.json; uploading config.yaml
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–…β–‚β–†β–‚β–†β–ƒβ–‚β–β–†β–…β–„β–ƒβ–ƒβ–…β–ƒβ–„β–β–…β–…β–ƒβ–β–‚β–‚β–‚β–„β–„β–‚β–ƒβ–β–ˆβ–‡β–‚β–ƒβ–„β–‚β–‚β–β–‚β–„β–ƒ
186
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–†β–ˆβ–ˆβ–„β–ˆβ–ˆβ–‚β–ˆβ–ˆβ–‚β–†β–ˆβ–ˆβ–ˆβ–ƒβ–‡β–„β–ˆβ–ˆβ–ˆβ–…β–‡β–‡β–ˆβ–ˆβ–‡β–ˆβ–β–‡β–†β–‚β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–†β–ƒβ–ˆβ–ˆ
189
+ wandb: forward_topk_kl β–ˆβ–ˆβ–‡β–†β–‚β–ƒβ–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–β–‚β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–‚β–‚β–‚
190
+ wandb: grad_norm β–ˆβ–‡β–…β–ƒβ–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–‚β–…β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–‚β–‡β–‡β–†β–‡β–„β–ƒβ–β–…β–„β–†β–„β–†β–…β–…β–‡β–†β–„β–…β–‚β–ƒβ–ˆβ–„β–…β–ƒβ–‡β–‡β–‡β–†β–„β–ƒβ–ƒβ–†β–β–„β–‚β–†β–ˆβ–‚β–…
193
+ wandb: step β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: t_data_s β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 405.4
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.97
202
+ wandb: forward_topk_kl 0.57552
203
+ wandb: grad_norm 0.60938
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.88
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run reap_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/ydhbbk1z
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1224/wandb/run-20260717_150109-ydhbbk1z/logs
healed/grid_general/reap_keep25_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep25_s1225.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1225/wandb/run-20260717_145438-hv788gr3
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run reap_keep25_s1225
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/hv788gr3
11
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
12
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 7.128950115287304, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 74.0, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 331}, "mem_gb": 9.8}
13
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
14
+ [eval step 1] sample: '$0 Cisory1 are not to be$ inovy_$nos_frP-loadingD = "ny\'\'els|[m_e_O(aude_of$Thurs.dips]{\n in_tw. Common\n posaki.po\'\'%$_'
15
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.942640358825525, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 72.0, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 342}, "mem_gb": 9.62}
16
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.675844058255355, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 61.25, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 358}, "mem_gb": 9.66}
17
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.735853639324506, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 46.0, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 344}, "mem_gb": 9.74}
18
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.655631678853433, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 39.75, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 267}, "mem_gb": 10.06}
19
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.5528146819194157, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 36.75, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 248}, "mem_gb": 9.89}
20
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.760948654184739, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 34.75, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 329}, "mem_gb": 9.88}
21
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.41242672910889, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 26.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 339}, "mem_gb": 9.84}
22
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.1154985622068248, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 19.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 354}, "mem_gb": 9.84}
23
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9232669208347797, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 12.3125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 279}, "mem_gb": 9.97}
24
+ [eval step 10] sample: '```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n'
25
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9393300044973691, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 11.4375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 318}, "mem_gb": 9.9}
26
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.429900641532739, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 9.0, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 265}, "mem_gb": 9.99}
27
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2097010329162081, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 5.5, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 254}, "mem_gb": 9.93}
28
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5392255229488014, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.75, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 315}, "mem_gb": 9.96}
29
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7722159353325764, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.59375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 300}, "mem_gb": 9.76}
30
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2301947377219795, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 3.375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 276}, "mem_gb": 9.96}
31
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6280564738233885, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 3.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 356}, "mem_gb": 9.9}
32
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.54189958041658, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 3.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 304}, "mem_gb": 9.71}
33
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4908135216305654, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 2.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 375}, "mem_gb": 9.63}
34
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8951119984914859, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.8125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 294}, "mem_gb": 9.99}
35
+ [eval step 20] sample: 'To solve this problem, we need to determine the number of months it takes for the savings to achieve the goal of $1,000,000$ given that the savings are at an average interest of $300 per month$.\n\nHere'
36
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3273236130041381, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 2.6875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 299}, "mem_gb": 10.0}
37
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0711809298033517, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 2.015625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 305}, "mem_gb": 9.78}
38
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6670237951979041, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.65625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 262}, "mem_gb": 9.83}
39
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8823200252845883, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.3671875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 303}, "mem_gb": 9.89}
40
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2808297750733793, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 380}, "mem_gb": 9.77}
41
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7838890937705835, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.1171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 282}, "mem_gb": 9.73}
42
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1743150849359731, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 4.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 362}, "mem_gb": 9.74}
43
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.165311704517901, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 307}, "mem_gb": 9.98}
44
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8248838950661321, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 282}, "mem_gb": 9.85}
45
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1389709412602087, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 337}, "mem_gb": 9.88}
46
+ [eval step 30] sample: "To solve this problem, we need to calculate the total savings after a month when the savings are $2,500 and the interest is $300.\n\nLet's break down the steps:\n\n1. Calculate the monthly savings:\n \\[\n"
47
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7580995838927725, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 275}, "mem_gb": 9.94}
48
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2029403526728353, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.2890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 318}, "mem_gb": 9.75}
49
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2629171270715693, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.3046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 385}, "mem_gb": 9.77}
50
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3238717241488398, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 316}, "mem_gb": 9.73}
51
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6397200959076484, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 266}, "mem_gb": 10.02}
52
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1893244242064656, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 371}, "mem_gb": 9.75}
53
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6626384412189325, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 262}, "mem_gb": 9.96}
54
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1702854688776037, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 348}, "mem_gb": 9.78}
55
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3203757806905856, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 222}, "mem_gb": 10.02}
56
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0980271197738747, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 408}, "mem_gb": 9.58}
57
+ [eval step 40] sample: 'To solve this problem, we need to determine the number of months Jamie will need to save to reach their goal of $1,000,000 from their current savings of $50,000, given their monthly salary of $2,500.\n'
58
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0561500041663647, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 334}, "mem_gb": 9.65}
59
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6361587373973181, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 312}, "mem_gb": 9.7}
60
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0296403087812165, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 352}, "mem_gb": 9.68}
61
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9499083398210506, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 371}, "mem_gb": 9.49}
62
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6781676426404466, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 284}, "mem_gb": 9.94}
63
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5214851166649411, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 287}, "mem_gb": 10.01}
64
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49592071714811026, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 285}, "mem_gb": 9.9}
65
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3948383016883085, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 252}, "mem_gb": 9.99}
66
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9748743114174654, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 360}, "mem_gb": 9.78}
67
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0411278635108223, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 359}, "mem_gb": 9.77}
68
+ [eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to account for both the savings and the investment account.\n\n**Step 1: Calculate the total savings needed'
69
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0491146349890779, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 363}, "mem_gb": 9.53}
70
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9546433091374735, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 361}, "mem_gb": 9.62}
71
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6374567762491604, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 286}, "mem_gb": 9.81}
72
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0135388727781673, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 367}, "mem_gb": 9.66}
73
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.096224354492873, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 352}, "mem_gb": 9.69}
74
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6951992062970996, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 314}, "mem_gb": 9.64}
75
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8984716710316638, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 372}, "mem_gb": 9.61}
76
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8798148108810186, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 334}, "mem_gb": 9.76}
77
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0336331131102516, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 368}, "mem_gb": 9.7}
78
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8133979804584136, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 354}, "mem_gb": 9.85}
79
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will spend to reach their financial goal of $1,000,000.\n\n1. **Calculate the monthly savings:**\n Jamie saves $2,500 each month.\n\n2. *'
80
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5131581351992984, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 293}, "mem_gb": 9.74}
81
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3558243869268646, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 231}, "mem_gb": 9.9}
82
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7909357976041734, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 302}, "mem_gb": 9.87}
83
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5200257582156609, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 263}, "mem_gb": 10.01}
84
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5733421744725357, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 252}, "mem_gb": 9.94}
85
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.802759750326102, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 344}, "mem_gb": 9.97}
86
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7588450347247223, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 313}, "mem_gb": 9.9}
87
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8533306148003786, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 358}, "mem_gb": 9.6}
88
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4426924922268838, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 267}, "mem_gb": 9.82}
89
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8630647399668893, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 300}, "mem_gb": 9.69}
90
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their financial goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a'
91
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7241944041704138, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 348}, "mem_gb": 9.63}
92
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8729624584329625, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 329}, "mem_gb": 9.72}
93
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49168946098834276, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 269}, "mem_gb": 9.88}
94
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9146341895855963, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 358}, "mem_gb": 9.55}
95
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5776157709396134, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 302}, "mem_gb": 9.8}
96
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9203825087978195, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 381}, "mem_gb": 9.82}
97
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9808039169403414, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 379}, "mem_gb": 9.77}
98
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9484098423243811, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 351}, "mem_gb": 9.59}
99
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.833038824570179, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 330}, "mem_gb": 9.79}
100
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.877945280479764, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 316}, "mem_gb": 9.82}
101
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a total of '
102
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5905011812818547, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 276}, "mem_gb": 10.0}
103
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5015565091780076, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 240}, "mem_gb": 9.94}
104
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5682198712281262, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 288}, "mem_gb": 9.85}
105
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5228158781567589, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 271}, "mem_gb": 9.84}
106
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8173860358398408, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 357}, "mem_gb": 9.79}
107
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9893660034631069, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 354}, "mem_gb": 9.76}
108
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9627823415289323, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 302}, "mem_gb": 10.0}
109
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7299780883704623, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 297}, "mem_gb": 9.99}
110
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2917365302247927, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 219}, "mem_gb": 10.01}
111
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9113752805821598, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 306}, "mem_gb": 9.71}
112
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000.\n\n**Step 1: Calculate the monthly savings from the salary.**\n\nJamie saves $2,500 e'
113
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9350021305881441, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 343}, "mem_gb": 9.65}
114
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8736250073991716, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 341}, "mem_gb": 9.76}
115
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5577829840183258, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 318}, "mem_gb": 9.71}
116
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9784254392961661, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 346}, "mem_gb": 9.6}
117
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4898327454172075, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 277}, "mem_gb": 10.08}
118
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49629658286403866, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 270}, "mem_gb": 9.81}
119
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.567912393829599, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 257}, "mem_gb": 9.99}
120
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9093468950852752, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 363}, "mem_gb": 9.6}
121
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8974562967235222, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 356}, "mem_gb": 9.73}
122
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8161376313265413, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 323}, "mem_gb": 9.77}
123
+ [eval step 100] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings of $50,000.\n\nHere are the ste'
124
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4597786546919495, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 243}, "mem_gb": 10.02}
125
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8502584563302497, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 307}, "mem_gb": 9.7}
126
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7940917789945999, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 346}, "mem_gb": 9.94}
127
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5417744047090411, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 273}, "mem_gb": 9.94}
128
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5624297013904278, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 302}, "mem_gb": 9.87}
129
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7359248608457546, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 337}, "mem_gb": 10.0}
130
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5976522656540076, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 280}, "mem_gb": 9.87}
131
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9708657983879249, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 331}, "mem_gb": 9.77}
132
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.621043157870695, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 314}, "mem_gb": 9.88}
133
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9878804231689622, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 294}, "mem_gb": 9.81}
134
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and investment interest.\n\n**Step 1: Calculate the mon'
135
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5001237283087026, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 274}, "mem_gb": 9.94}
136
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7752035559450586, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 365}, "mem_gb": 9.66}
137
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5251564120012646, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 323}, "mem_gb": 9.72}
138
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3639715613210574, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 234}, "mem_gb": 10.01}
139
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4192159344536563, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 267}, "mem_gb": 10.01}
140
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.567089419877405, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 304}, "mem_gb": 9.77}
141
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8359038252736132, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 373}, "mem_gb": 9.7}
142
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5316978300289561, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 9.98}
143
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.894701361332337, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 331}, "mem_gb": 9.82}
144
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4196397037681813, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 259}, "mem_gb": 9.96}
145
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their financial goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a'
146
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8061647728700811, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 358}, "mem_gb": 9.58}
147
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9037879503688464, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 354}, "mem_gb": 9.83}
148
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4666864868506168, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 279}, "mem_gb": 9.9}
149
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387770713350425, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 354}, "mem_gb": 9.65}
150
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8794751821829627, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 334}, "mem_gb": 9.85}
151
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8755004875550667, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 327}, "mem_gb": 9.72}
152
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8391853122260422, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 365}, "mem_gb": 9.82}
153
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49682699765600263, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 252}, "mem_gb": 10.02}
154
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4077576435037578, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 256}, "mem_gb": 9.99}
155
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.508540836275369, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 302}, "mem_gb": 9.76}
156
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate the mon'
157
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8144513827263067, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 350}, "mem_gb": 9.67}
158
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202635715613763, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 292}, "mem_gb": 9.79}
159
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8058739880256355, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 356}, "mem_gb": 9.6}
160
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5866575760807842, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 347}, "mem_gb": 9.76}
161
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5179159301963945, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 330}, "mem_gb": 9.96}
162
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.85121752653718, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 363}, "mem_gb": 9.82}
163
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7743317221516123, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 354}, "mem_gb": 9.68}
164
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44354114747531714, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 270}, "mem_gb": 9.94}
165
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7892652089830487, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 343}, "mem_gb": 9.72}
166
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23516690385279557, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 232}, "mem_gb": 9.91}
167
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their savings plan.\n\n**Step 1: Calculate the monthly savings from the salar'
168
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7412611307131748, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 346}, "mem_gb": 9.86}
169
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5961444109828522, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 306}, "mem_gb": 9.94}
170
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41770563813019546, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 273}, "mem_gb": 9.99}
171
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45850400070821246, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 266}, "mem_gb": 9.81}
172
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6739403530483444, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 299}, "mem_gb": 10.01}
173
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48320755306941765, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 259}, "mem_gb": 10.09}
174
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5405310631979257, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 325}, "mem_gb": 9.83}
175
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48942058433977265, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 271}, "mem_gb": 9.9}
176
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7915086919846634, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 359}, "mem_gb": 9.69}
177
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7640738337163503, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 345}, "mem_gb": 9.75}
178
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their savings plan.\n\n**Step 1: Calculate the monthly savings from the salar'
179
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1225/step0150
180
+ wandb: updating run metadata
181
+ wandb: uploading output.log; uploading wandb-summary.json
182
+ wandb: uploading summary
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–‚β–‚β–†β–†β–ƒβ–„β–β–…β–…β–β–…β–…β–‡β–‚β–‚β–„β–‚β–ƒβ–†β–‚β–‚β–„β–β–ƒβ–…β–„β–‚β–…β–„β–„β–„β–‚β–ƒβ–„β–‚β–‚β–‚β–‚β–ˆβ–…
186
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–ˆβ–ˆβ–ˆβ–‚β–‡β–‡β–†β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‡β–„β–‡β–ˆβ–ˆβ–ˆβ–β–ˆβ–ˆβ–‚β–ˆβ–ƒβ–ˆβ–‡β–…β–‡β–„β–ˆβ–ˆβ–ˆβ–ƒβ–ƒβ–‡β–ˆβ–„
189
+ wandb: forward_topk_kl β–ˆβ–‡β–†β–ƒβ–ƒβ–‚β–‚β–‚β–‚β–‚β–β–β–‚β–‚β–‚β–‚β–β–β–‚β–‚β–β–‚β–β–‚β–‚β–β–‚β–‚β–‚β–β–‚β–β–‚β–β–β–β–‚β–β–β–
190
+ wandb: grad_norm β–ˆβ–†β–„β–ƒβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–„β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–…β–ƒβ–ˆβ–…β–‡β–„β–„β–„β–„β–„β–†β–„β–‚β–β–„β–„β–†β–‡β–…β–„β–„β–‚β–†β–…β–‡β–‚β–ˆβ–…β–‡β–‡β–†β–„β–†β–ƒβ–ƒβ–ƒβ–„β–‡β–‚β–…
193
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: t_data_s β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 347.8
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.997
202
+ wandb: forward_topk_kl 0.76407
203
+ wandb: grad_norm 0.70703
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.75
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run reap_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/hv788gr3
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1225/wandb/run-20260717_145438-hv788gr3/logs
healed/grid_general/reap_keep25_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep25_s1226.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run vqz2kgs7
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1226/wandb/run-20260717_145453-vqz2kgs7
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run reap_keep25_s1226
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/vqz2kgs7
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.747652878097693, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 82.0, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 308}, "mem_gb": 9.9}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: '//\n0 -> 3 *< Q-a) Ostpunk; Gnote_2::returnp intole_pim1Util by 10; 1-"\nspr1 U; =@"May/juics/1na-full; 2:109;398 ath.5clib";99w1'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.232488486345609, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 93.5, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 211}, "mem_gb": 9.99}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.061427371287346, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 72.5, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 281}, "mem_gb": 9.99}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.71384426343441, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 46.5, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 367}, "mem_gb": 9.54}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.221357237867514, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 38.75, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 312}, "mem_gb": 9.7}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.206255900446574, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 31.75, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 271}, "mem_gb": 10.01}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.2155107744832834, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 43.0, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 269}, "mem_gb": 9.98}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.326668211084604, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 21.75, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 352}, "mem_gb": 9.5}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.974914269675811, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 23.5, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 243}, "mem_gb": 9.99}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.023210922032595, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 13.8125, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 293}, "mem_gb": 9.91}
25
+ [eval step 10] sample: "In the given problem, we need to solve the equation $2a_9 - a_{10} = 120$. To solve this equation, we need to find the value of $a_9$ and $a_{10}$.\n\nLet's solve the equation $2a_9 - a_{10}"
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3795957569027941, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 20.125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 242}, "mem_gb": 9.99}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.2639496262669563, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 11.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 353}, "mem_gb": 9.68}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.950070663708945, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 6.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 338}, "mem_gb": 9.69}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2327765369668604, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 259}, "mem_gb": 9.99}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.703943703211844, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 6.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 385}, "mem_gb": 9.54}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.556053177499771, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 3.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 355}, "mem_gb": 9.71}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4719423054784537, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 3.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 328}, "mem_gb": 9.61}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4998059349169335, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 2.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 355}, "mem_gb": 9.76}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.574684210223208, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 3.265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 367}, "mem_gb": 9.63}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.44301956722488, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 2.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 343}, "mem_gb": 9.67}
36
+ [eval step 20] sample: "To solve the given problem, we need to find the value of $2a_9 - a_{10}$ for the arithmetic sequence $\\{a_n\\}$ where $a_1 + 3a_8 + a_{15} = 120$.\n\nLet's break down the problem step-by-step:"
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060264107381305, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 2.3125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 244}, "mem_gb": 9.99}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387292437978089, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.59375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 339}, "mem_gb": 9.83}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9390911949257056, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.7109375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 298}, "mem_gb": 9.98}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3454288875885307, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 398}, "mem_gb": 9.85}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2313447310273846, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 362}, "mem_gb": 9.96}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8142161580753823, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.5078125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 313}, "mem_gb": 9.83}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3254079354730746, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 324}, "mem_gb": 9.74}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8449620561227202, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 314}, "mem_gb": 9.8}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2496078112500408, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 345}, "mem_gb": 9.72}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6646942165167381, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 262}, "mem_gb": 9.9}
47
+ [eval step 30] sample: "To solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the condition \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nLet's break down the problem into manageable steps:\n\n1. **Understand the"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.31275063808014, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.3515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 373}, "mem_gb": 9.69}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1270205962436894, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 334}, "mem_gb": 9.69}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8339329546173414, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 327}, "mem_gb": 9.84}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3569904074287663, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 238}, "mem_gb": 10.01}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9680246362812817, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.4140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 310}, "mem_gb": 9.74}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0438821207616478, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.3125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 347}, "mem_gb": 9.74}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0721264234431087, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 304}, "mem_gb": 9.67}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9972125167831779, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 343}, "mem_gb": 9.69}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0908659540044765, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 1.1171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 314}, "mem_gb": 9.68}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0047147725195935, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 300}, "mem_gb": 9.78}
58
+ [eval step 40] sample: 'To solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the arithmetic sequence \\(a_n\\) where \\(a_1 = a_1\\) and \\(a_n = a_1 + n \\cdot d\\) for \\(n = 1, 2'
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8308810647596916, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 318}, "mem_gb": 9.83}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6653663211459915, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 279}, "mem_gb": 9.86}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0325467725853126, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 1.171875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 364}, "mem_gb": 9.93}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7074600060718755, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 256}, "mem_gb": 9.99}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1623743304225305, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 340}, "mem_gb": 9.7}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6259365370091051, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 283}, "mem_gb": 9.92}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0017336319215595, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 349}, "mem_gb": 9.71}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.639943171165511, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 297}, "mem_gb": 9.78}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.196731882277752, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 359}, "mem_gb": 9.75}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7932594400240729, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 342}, "mem_gb": 9.8}
69
+ [eval step 50] sample: 'to solve the given problem, we need to find the value of \\(2a_9 - a_{10}\\) in the arithmetic sequence \\( \\{a_n\\} \\) where \\(a_1 = a_2 = \\ldots = a_8 = a_9 = a_{10} = a_{'
70
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5727845859162509, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 269}, "mem_gb": 9.96}
71
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7544932430081069, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 324}, "mem_gb": 9.95}
72
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5894824164722114, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 281}, "mem_gb": 9.94}
73
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7401960951608916, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 287}, "mem_gb": 9.99}
74
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181216617378096, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 296}, "mem_gb": 10.0}
75
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6431532166372985, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 267}, "mem_gb": 10.05}
76
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6043601217896988, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 249}, "mem_gb": 9.95}
77
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9893959043489148, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 363}, "mem_gb": 9.65}
78
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6542036985296756, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 299}, "mem_gb": 9.78}
79
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9601789214624713, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 1.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 331}, "mem_gb": 9.66}
80
+ [eval step 60] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the equation \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nlet's break down the problem into manageable steps:\n\n1. **Understand the"
81
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.573710584735622, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 280}, "mem_gb": 9.87}
82
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9686885283327351, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 350}, "mem_gb": 9.86}
83
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9752434714576851, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 321}, "mem_gb": 9.62}
84
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5452988885341833, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 281}, "mem_gb": 9.92}
85
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0939042176867524, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 331}, "mem_gb": 9.6}
86
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.820505879665787, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 318}, "mem_gb": 9.97}
87
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6797064025110254, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 309}, "mem_gb": 9.99}
88
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6054685526964565, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 304}, "mem_gb": 9.88}
89
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43610732698477805, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 279}, "mem_gb": 9.9}
90
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26056571491559344, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 248}, "mem_gb": 9.9}
91
+ [eval step 70] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the equation \\(a_1 + 3a_8 + a_{15} = 120\\). let's break down the problem step-by-step:\n\n1. **Identify the"
92
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7074562644996991, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 268}, "mem_gb": 9.87}
93
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7105215648694585, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 299}, "mem_gb": 9.97}
94
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7532352743474146, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 322}, "mem_gb": 9.84}
95
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5121163977663343, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 248}, "mem_gb": 10.01}
96
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678209176074714, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 326}, "mem_gb": 9.9}
97
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6905371769316494, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 314}, "mem_gb": 9.66}
98
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2690901036346952, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 232}, "mem_gb": 10.0}
99
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9465876299445828, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 330}, "mem_gb": 9.73}
100
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5562330529862394, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 292}, "mem_gb": 9.88}
101
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8603651309904953, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 312}, "mem_gb": 9.9}
102
+ [eval step 80] sample: 'to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the condition \\(a_1 + 3a_8 + a_{15} = 120\\) in the arithmetic sequence \\(\\{a_n\\}\\).\n\nin an arithmetic sequence, the n'
103
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0142922517254949, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 382}, "mem_gb": 9.71}
104
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9864219302162528, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 360}, "mem_gb": 9.58}
105
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21507695685382933, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 222}, "mem_gb": 9.85}
106
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9336277782452603, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 342}, "mem_gb": 9.89}
107
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9161342721832295, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 337}, "mem_gb": 9.69}
108
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6159662167626123, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 304}, "mem_gb": 9.94}
109
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6122953878027076, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 326}, "mem_gb": 9.84}
110
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8241867267180234, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 310}, "mem_gb": 9.9}
111
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7898566617957006, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 328}, "mem_gb": 9.72}
112
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.907182421168685, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 347}, "mem_gb": 9.55}
113
+ [eval step 90] sample: 'to solve the problem, we need to find the common difference \\(d\\) of the arithmetic sequence and then use it to determine \\(a_9\\) and \\(a_{10}\\).\n\n1. **find the common difference \\(d\\):**\n the commo'
114
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7663650030173361, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 330}, "mem_gb": 9.84}
115
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25742624729710323, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 209}, "mem_gb": 10.04}
116
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.895072185566028, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 399}, "mem_gb": 9.62}
117
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8862974390603602, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 351}, "mem_gb": 9.7}
118
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060778897795827, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 322}, "mem_gb": 9.7}
119
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9001690731755148, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 333}, "mem_gb": 9.59}
120
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6704351394177724, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 330}, "mem_gb": 9.88}
121
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21891150226301204, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 238}, "mem_gb": 9.91}
122
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4576743530792495, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 297}, "mem_gb": 9.82}
123
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8080495124759773, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 345}, "mem_gb": 9.78}
124
+ [eval step 100] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) in the given arithmetic sequence \\(\\{a_n\\}\\) where \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nlet's break down the problem into"
125
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5883223211187869, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 304}, "mem_gb": 9.93}
126
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.783417216323254, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 326}, "mem_gb": 9.93}
127
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9326095950538913, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 347}, "mem_gb": 9.86}
128
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8375195046778768, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 325}, "mem_gb": 9.74}
129
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5487626382143547, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 299}, "mem_gb": 9.93}
130
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9692270187509556, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 345}, "mem_gb": 9.7}
131
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8542588974570234, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 344}, "mem_gb": 9.6}
132
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6672126911155879, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 344}, "mem_gb": 9.86}
133
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5984686968117953, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 288}, "mem_gb": 9.93}
134
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6063315958853811, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 303}, "mem_gb": 9.63}
135
+ [eval step 110] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is given by the formula \\(a_n = a_1 + (n-1)d\\), where \\(a_1\\) is the first te'
136
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4173564679083725, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 284}, "mem_gb": 9.82}
137
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9816539483932157, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 369}, "mem_gb": 9.71}
138
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47619884120635686, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 269}, "mem_gb": 9.97}
139
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8739178444378078, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 341}, "mem_gb": 9.73}
140
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8934685535871113, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 384}, "mem_gb": 9.5}
141
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7676749315333863, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 358}, "mem_gb": 9.66}
142
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8769308571000894, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 342}, "mem_gb": 9.84}
143
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9392689205416789, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 365}, "mem_gb": 9.66}
144
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8395026402180393, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 337}, "mem_gb": 9.89}
145
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7431816121825328, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 333}, "mem_gb": 9.99}
146
+ [eval step 120] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is given by the formula:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the fi'
147
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.540203549628829, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 293}, "mem_gb": 10.03}
148
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5269571568710729, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 291}, "mem_gb": 9.79}
149
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7746928217470646, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 341}, "mem_gb": 9.83}
150
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5469128709019472, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 300}, "mem_gb": 9.76}
151
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46755872129276393, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 270}, "mem_gb": 9.98}
152
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3837562215766559, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 259}, "mem_gb": 10.0}
153
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8566545920529713, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 355}, "mem_gb": 9.58}
154
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181099114379535, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 388}, "mem_gb": 9.93}
155
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7934858187317848, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 318}, "mem_gb": 9.65}
156
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9216169714945058, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 383}, "mem_gb": 9.78}
157
+ [eval step 130] sample: "to solve the problem, let's first define the terms of the arithmetic sequence. in an arithmetic sequence, each term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the first term an"
158
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5428718562576299, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 300}, "mem_gb": 9.79}
159
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5079142917865888, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 295}, "mem_gb": 9.88}
160
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5414958303313081, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 306}, "mem_gb": 9.62}
161
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6852540198124946, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 303}, "mem_gb": 9.88}
162
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36944927832894026, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 272}, "mem_gb": 9.94}
163
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47709123675115406, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 248}, "mem_gb": 9.94}
164
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5209648989812782, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 282}, "mem_gb": 9.93}
165
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7825215920180082, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 362}, "mem_gb": 9.49}
166
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8411890809422979, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 374}, "mem_gb": 9.85}
167
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48550046064505975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 280}, "mem_gb": 10.02}
168
+ [eval step 140] sample: "to solve the problem, let's break it down step-by-step:\n\n1. **understand the arithmetic sequence:**\n an arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). The "
169
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37706969851826627, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 276}, "mem_gb": 9.87}
170
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49631428986427684, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 246}, "mem_gb": 10.01}
171
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8765898440801849, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 360}, "mem_gb": 9.54}
172
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8345980124605199, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 365}, "mem_gb": 9.72}
173
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6841340245318288, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 338}, "mem_gb": 9.8}
174
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40420900719463826, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 276}, "mem_gb": 9.91}
175
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22862344996624936, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 209}, "mem_gb": 9.99}
176
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8112275027054051, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 379}, "mem_gb": 9.59}
177
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.710655534057195, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 307}, "mem_gb": 9.93}
178
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5077782722345243, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 293}, "mem_gb": 9.97}
179
+ [eval step 150] sample: "to solve the problem, let's denote the first term of the arithmetic sequence as \\(a_1\\) and the common difference as \\(d\\). the general term of the sequence is given by \\(a_n = a_1 + (n-1)d\\).\n\nwe are"
180
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1226/step0150
181
+ wandb: updating run metadata
182
+ wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–‚β–ƒβ–…β–„β–‚β–ƒβ–‚β–‚β–‚β–β–„β–„β–…β–‚β–‚β–„β–†β–„β–ƒβ–ƒβ–‚β–‚β–ƒβ–ˆβ–‚β–„β–‚β–ƒβ–‚β–ƒβ–‚β–…β–…β–‚β–ƒβ–„β–‚β–β–„β–„
186
+ wandb: cumulative_loss_tokens β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–ˆβ–ˆβ–‡β–…β–ˆβ–ˆβ–β–ˆβ–ˆβ–†β–†β–„β–ˆβ–ˆβ–ˆβ–ƒβ–ˆβ–…β–ˆβ–‡β–ˆβ–…β–‡β–†β–ˆβ–‡β–†β–‡β–‚β–ˆβ–ˆβ–†β–ˆβ–ˆβ–ˆβ–…β–„β–„β–β–„
189
+ wandb: forward_topk_kl β–ˆβ–ˆβ–…β–„β–„β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–‚β–ƒβ–ƒβ–‚β–ƒβ–ƒβ–ƒβ–β–β–‚β–ƒβ–ƒβ–‚β–‚β–‚β–β–‚β–‚β–β–ƒβ–β–‚β–‚β–β–β–‚β–‚
190
+ wandb: grad_norm β–ˆβ–‡β–„β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–‚β–„β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–‡β–‚β–„β–†β–ƒβ–†β–…β–„β–†β–ƒβ–„β–ƒβ–†β–…β–„β–‡β–ˆβ–…β–‚β–†β–†β–„β–‚β–†β–ƒβ–‚β–ˆβ–…β–„β–‚β–…β–„β–β–‡β–…β–ƒβ–†β–β–†β–‚
193
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆ
194
+ wandb: t_data_s β–β–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 409.6
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.942
202
+ wandb: forward_topk_kl 0.50778
203
+ wandb: grad_norm 0.65625
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.97
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run reap_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/vqz2kgs7
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1226/wandb/run-20260717_145453-vqz2kgs7/logs
healed/grid_general/reap_keep25_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep50_s1224.console.log ADDED
@@ -0,0 +1,215 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1224/wandb/run-20260718_102929-n9gbbs5p
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run reap_keep50_s1224
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/n9gbbs5p
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8349037809635202, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 9.5625, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 259}, "mem_gb": 15.93}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'To compute the rank of a matrix, we need to determine the highest powers of the variables involved in each term. The matrix provided has 4 rows and each of the 4 columns is a set of coefficients.\n\nTo '
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.139459627494216, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 10.6875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 348}, "mem_gb": 15.64}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.018460661153247, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 9.5625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 370}, "mem_gb": 15.79}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5092730569645763, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 5.53125, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 244}, "mem_gb": 16.02}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7775122467224796, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 6.0, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 320}, "mem_gb": 15.94}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8680597942702473, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 378}, "mem_gb": 15.54}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.896623771194617, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.84375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.0, "frames": {"chat": 384}, "mem_gb": 16.03}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8145596144163361, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.84375, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.8, "frames": {"chat": 324}, "mem_gb": 15.88}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3368055146301786, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.90625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 239}, "mem_gb": 16.05}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7155885353672008, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 306}, "mem_gb": 15.79}
25
+ [eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here, we have a 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 '
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6740345688946545, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 329}, "mem_gb": 15.82}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3404211208855733, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 254}, "mem_gb": 16.05}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5482246124852449, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 273}, "mem_gb": 16.03}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22686570997896294, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 236}, "mem_gb": 15.95}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7000601489031066, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.7, "frames": {"chat": 381}, "mem_gb": 15.68}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2720708797098448, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 266}, "mem_gb": 15.88}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4152260002292072, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 308}, "mem_gb": 15.87}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.336649879567946, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 273}, "mem_gb": 16.05}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5538853720378131, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.7, "frames": {"chat": 368}, "mem_gb": 15.68}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6661646114046375, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 339}, "mem_gb": 15.92}
36
+ [eval step 20] sample: 'To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent rows or columns. This is equivalent to the maximum number of non-zero rows or columns.\n\nGiven th'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35526760604058705, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 298}, "mem_gb": 15.85}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5416611029299597, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 350}, "mem_gb": 15.57}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045030346101771, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 246}, "mem_gb": 16.02}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5459773595308886, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 375}, "mem_gb": 15.75}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5566543429891269, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 352}, "mem_gb": 15.8}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5540592834822834, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 81.4, "frames": {"chat": 396}, "mem_gb": 15.76}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4514535936313992, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.3, "frames": {"chat": 362}, "mem_gb": 15.61}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5831260033368444, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 369}, "mem_gb": 15.82}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5801059120136003, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.3, "frames": {"chat": 399}, "mem_gb": 15.67}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28126204585041853, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 247}, "mem_gb": 15.94}
47
+ [eval step 30] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.126586661240831, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 230}, "mem_gb": 15.88}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24978271153829992, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 263}, "mem_gb": 16.05}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27792473615227886, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 264}, "mem_gb": 16.04}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48515384566228215, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 328}, "mem_gb": 15.9}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24788905388092, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 281}, "mem_gb": 15.97}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18400198239218443, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 237}, "mem_gb": 15.96}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2326898601119717, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 278}, "mem_gb": 16.05}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45623999547163646, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 310}, "mem_gb": 15.92}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2833551954619664, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 295}, "mem_gb": 15.86}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32313640279310446, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 329}, "mem_gb": 15.87}
58
+ [eval step 40] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. In this 4x4 matrix, we will perform row reduction (Gaussian elimination) to simplify the '
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30249153745993973, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 263}, "mem_gb": 15.99}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3287658990745743, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 315}, "mem_gb": 15.87}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4506818622214099, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 354}, "mem_gb": 15.82}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20713084133341908, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 259}, "mem_gb": 16.0}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30595886317944776, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 275}, "mem_gb": 15.85}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43811505159850544, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.4, "frames": {"chat": 334}, "mem_gb": 15.72}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4716399714846785, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.9, "frames": {"chat": 374}, "mem_gb": 15.57}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3850763324101766, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 311}, "mem_gb": 15.74}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3342623191562792, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 259}, "mem_gb": 16.05}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39605423392181593, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 305}, "mem_gb": 16.03}
69
+ [eval step 50] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35507478237356993, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 298}, "mem_gb": 16.01}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5130167560436453, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 364}, "mem_gb": 15.79}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25245845035606373, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 302}, "mem_gb": 15.89}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5107129311724256, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.9, "frames": {"chat": 316}, "mem_gb": 15.65}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5209058323521167, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.9, "frames": {"chat": 312}, "mem_gb": 15.75}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3738536888614918, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 330}, "mem_gb": 15.9}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37849073103020586, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 321}, "mem_gb": 15.91}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37791894324719905, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 344}, "mem_gb": 15.94}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42402005026017625, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.5, "frames": {"chat": 353}, "mem_gb": 15.61}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21896603283386987, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 272}, "mem_gb": 16.04}
81
+ [eval step 60] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's start by converting the given matrix into a form that makes it e"
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4837913077905153, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 317}, "mem_gb": 15.79}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2093587558383122, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 292}, "mem_gb": 15.79}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11212632849545529, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 229}, "mem_gb": 15.9}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.465559051544033, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.7, "frames": {"chat": 359}, "mem_gb": 15.91}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4106670856825386, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 358}, "mem_gb": 15.63}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4706965514367446, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.7, "frames": {"chat": 315}, "mem_gb": 16.01}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29511433315618585, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 264}, "mem_gb": 16.09}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46083249899068224, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.4, "frames": {"chat": 337}, "mem_gb": 15.76}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22988721587564795, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 251}, "mem_gb": 16.05}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3435360108250131, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 298}, "mem_gb": 15.78}
92
+ [eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Let's break down the problem step-by-step:\n\n1. **Understand the Matrix:**\n \\[\n A ="
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28409134445302187, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 264}, "mem_gb": 15.99}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2890075812650534, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 305}, "mem_gb": 16.01}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2703116375102972, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 322}, "mem_gb": 15.78}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46161023991561184, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.3, "frames": {"chat": 361}, "mem_gb": 15.77}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3054883354100088, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 321}, "mem_gb": 15.95}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36705931260818614, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 307}, "mem_gb": 15.84}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4416380636246875, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 327}, "mem_gb": 15.94}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49655664794829985, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 356}, "mem_gb": 15.56}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23637733536499242, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 283}, "mem_gb": 15.9}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4459838384080678, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.0, "frames": {"chat": 401}, "mem_gb": 15.66}
103
+ [eval step 80] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2848321669723218, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 288}, "mem_gb": 15.85}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363661674802502, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 323}, "mem_gb": 15.89}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4990646729867905, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 336}, "mem_gb": 15.78}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41408709604268273, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 329}, "mem_gb": 15.69}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039575271243229, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.5, "frames": {"chat": 343}, "mem_gb": 15.67}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42506934663237383, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.0, "frames": {"chat": 336}, "mem_gb": 15.79}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3934861131834487, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 314}, "mem_gb": 16.03}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2444304669896451, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 281}, "mem_gb": 15.86}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.314850464147826, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 299}, "mem_gb": 15.74}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38792538973269985, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 328}, "mem_gb": 15.93}
114
+ [eval step 90] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Let's break down the problem step-by-step:\n\n1. **Write down the given ma"
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29001890432341026, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 271}, "mem_gb": 16.03}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30289251801352945, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 269}, "mem_gb": 16.13}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48946453408229473, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.7, "frames": {"chat": 370}, "mem_gb": 15.67}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5111911306904628, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 352}, "mem_gb": 15.73}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43810866481767347, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 330}, "mem_gb": 15.94}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35366226060989625, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 334}, "mem_gb": 15.66}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3517854278709119, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 336}, "mem_gb": 15.8}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2601615757802501, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 309}, "mem_gb": 15.89}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4435581100319202, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.2, "frames": {"chat": 391}, "mem_gb": 15.77}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22976263756578166, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 264}, "mem_gb": 16.17}
125
+ [eval step 100] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38276564593724904, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 349}, "mem_gb": 15.72}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3592020490471274, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 312}, "mem_gb": 15.78}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13044111168198289, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 229}, "mem_gb": 16.04}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33574905013817674, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 288}, "mem_gb": 16.04}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4574560937942937, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.3, "frames": {"chat": 351}, "mem_gb": 15.7}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16570775660319875, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 223}, "mem_gb": 16.07}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08919320489432042, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 213}, "mem_gb": 16.03}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4128553018726098, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 81.9, "frames": {"chat": 380}, "mem_gb": 15.88}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24188531191752602, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 271}, "mem_gb": 16.07}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45949921899692464, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 340}, "mem_gb": 15.96}
137
+ [eval step 110] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4739295674396058, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.1, "frames": {"chat": 366}, "mem_gb": 15.65}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1607788675147419, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 233}, "mem_gb": 16.04}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3169212877132309, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 312}, "mem_gb": 15.91}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4396179571894308, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 363}, "mem_gb": 15.62}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4510127164368207, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 323}, "mem_gb": 15.9}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45662027690509954, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 346}, "mem_gb": 15.64}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4306134762711823, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 318}, "mem_gb": 15.79}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33146525783942393, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 275}, "mem_gb": 15.97}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39841553350395215, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 345}, "mem_gb": 15.72}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39074151002867147, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 377}, "mem_gb": 15.86}
148
+ [eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\(k\\) if it has \\(k\\) linearly independen'
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32592700511608275, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 294}, "mem_gb": 16.09}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4495919180097058, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 338}, "mem_gb": 15.78}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4638373790469952, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 352}, "mem_gb": 15.68}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4138206214962527, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 347}, "mem_gb": 15.73}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2632615118196855, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 310}, "mem_gb": 15.71}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48551804332186776, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 358}, "mem_gb": 15.73}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27313385103152443, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 319}, "mem_gb": 16.01}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1830635212512066, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 269}, "mem_gb": 16.04}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3405882237064652, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 310}, "mem_gb": 15.9}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22905850299953792, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 259}, "mem_gb": 16.07}
159
+ [eval step 130] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2272606820096572, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 265}, "mem_gb": 16.05}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45574589725496867, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 337}, "mem_gb": 15.6}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24671173994854714, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 290}, "mem_gb": 15.86}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3949909395231555, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.5, "frames": {"chat": 349}, "mem_gb": 15.79}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.252015067408296, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 291}, "mem_gb": 15.89}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4136106402097891, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.6, "frames": {"chat": 342}, "mem_gb": 15.76}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4838084203484779, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 338}, "mem_gb": 15.7}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44722535916535805, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.5, "frames": {"chat": 356}, "mem_gb": 15.67}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21482619681727763, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 265}, "mem_gb": 16.05}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3745011051883921, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.9, "frames": {"chat": 353}, "mem_gb": 15.76}
170
+ [eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34821248879296085, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 316}, "mem_gb": 15.95}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3081258514010037, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 289}, "mem_gb": 16.1}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32100094701781245, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.4, "frames": {"chat": 331}, "mem_gb": 15.73}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31246353600776444, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 320}, "mem_gb": 16.05}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2774946627909628, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 272}, "mem_gb": 15.78}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49581608901175983, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.4, "frames": {"chat": 368}, "mem_gb": 15.7}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3986292206962903, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 328}, "mem_gb": 15.73}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3940341844805827, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 326}, "mem_gb": 15.94}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.447204483768406, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.6, "frames": {"chat": 364}, "mem_gb": 15.88}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2826799458518935, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 296}, "mem_gb": 15.93}
181
+ [eval step 150] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading output.log
185
+ wandb:
186
+ wandb: Run history:
187
+ wandb: comp_len β–†β–‡β–ƒβ–ƒβ–‡β–…β–‚β–„β–‚β–β–β–†β–†β–‚β–…β–ˆβ–‚β–†β–„β–†β–ƒβ–ƒβ–‚β–…β–β–ƒβ–β–†β–ˆβ–‚β–‚β–…β–‚β–„β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–‚
188
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆ
189
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
190
+ wandb: finish_rate β–ˆβ–ˆβ–ˆβ–ƒβ–‡β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ƒβ–β–…β–†β–†β–ˆβ–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–β–ˆβ–‡β–ˆβ–†β–‡β–ˆβ–ˆβ–ˆβ–ˆ
191
+ wandb: forward_topk_kl β–‡β–ˆβ–„β–ƒβ–„β–„β–ƒβ–„β–„β–‚β–‚β–‚β–ƒβ–„β–ƒβ–‚β–„β–ƒβ–ƒβ–ƒβ–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–‚β–ƒβ–‚β–β–ƒβ–ƒβ–‚β–β–‚β–β–‚β–‚β–ƒβ–ƒ
192
+ wandb: grad_norm β–‡β–ˆβ–β–β–β–β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
193
+ wandb: lr ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
194
+ wandb: mem_gb β–†β–‚β–„β–†β–β–…β–ƒβ–†β–ˆβ–ˆβ–…β–†β–†β–†β–‡β–…β–„β–ˆβ–†β–ˆβ–†β–†β–‡β–‡β–„β–„β–ƒβ–ˆβ–†β–ˆβ–†β–„β–ˆβ–†β–‚β–‚β–ƒβ–ƒβ–„β–„
195
+ wandb: step β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
196
+ wandb: t_data_s β–ƒβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–ˆβ–β–β–β–β–
197
+ wandb: +3 ...
198
+ wandb:
199
+ wandb: Run summary:
200
+ wandb: comp_len 405.4
201
+ wandb: cumulative_loss_tokens 18000000
202
+ wandb: epoch 0
203
+ wandb: finish_rate 0.97
204
+ wandb: forward_topk_kl 0.28268
205
+ wandb: grad_norm 0.46875
206
+ wandb: lr 3e-05
207
+ wandb: mem_gb 15.93
208
+ wandb: step 150
209
+ wandb: t_data_s 0
210
+ wandb: +4 ...
211
+ wandb:
212
+ wandb: πŸš€ View run reap_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/n9gbbs5p
213
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
214
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
215
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1224/wandb/run-20260718_102929-n9gbbs5p/logs
healed/grid_general/reap_keep50_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep50_s1225.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run s7308ckw
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1225/wandb/run-20260718_100256-s7308ckw
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run reap_keep50_s1225
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/s7308ckw
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2118627337018648, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 10.5, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 331}, "mem_gb": 15.8}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: 'To solve this problem, we need to account for two main components:\n\n1. **Month-specific Savings:** Each month, Jamie saves $2,500.\n2. **Investment Account Interest:** The investment account earns an i'
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.150410816463828, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 10.8125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 342}, "mem_gb": 15.67}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.220105654741327, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 10.75, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 358}, "mem_gb": 15.71}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0147432551393907, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.4375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 344}, "mem_gb": 15.79}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6852638306491077, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 5.59375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 267}, "mem_gb": 16.11}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4048705829699834, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 3.90625, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 248}, "mem_gb": 15.94}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7823408988844603, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.0, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 329}, "mem_gb": 15.93}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.794171616469572, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.546875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 339}, "mem_gb": 15.89}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8094027272744104, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 354}, "mem_gb": 15.89}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4597484048336744, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.5234375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 279}, "mem_gb": 16.02}
26
+ [eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to consider both the monthly savings from their salary and the monthly interest earned from th'
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5500058561362327, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.4453125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 318}, "mem_gb": 15.95}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37018651990617313, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 265}, "mem_gb": 16.04}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3370069943304484, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 254}, "mem_gb": 15.98}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48349834372481953, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 315}, "mem_gb": 16.01}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6240516229675462, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 300}, "mem_gb": 15.81}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42785762843911845, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 276}, "mem_gb": 16.01}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6250575007808705, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 356}, "mem_gb": 15.95}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5829799992421021, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 304}, "mem_gb": 15.76}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5814512345301608, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 375}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31850894228362786, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 294}, "mem_gb": 16.04}
37
+ [eval step 20] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to account for both the monthly savings from their salary and the monthly interest earned from'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5290105964959909, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 299}, "mem_gb": 16.05}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4174972528837621, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 305}, "mem_gb": 15.83}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2511404076213017, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 262}, "mem_gb": 15.88}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3464033624632905, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 303}, "mem_gb": 15.94}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5479913083476324, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 380}, "mem_gb": 15.82}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2987395618863404, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 282}, "mem_gb": 15.78}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5009952769170205, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 362}, "mem_gb": 15.79}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5059114760584509, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 307}, "mem_gb": 16.03}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3410507912961766, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 282}, "mem_gb": 15.9}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49266887007188054, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 337}, "mem_gb": 15.93}
48
+ [eval step 30] sample: 'To solve this problem, we need to determine how many months Jamie will need to save up to $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calc'
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31623490650722136, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 275}, "mem_gb": 15.99}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5300685605037957, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 318}, "mem_gb": 15.8}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5864380038592965, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 385}, "mem_gb": 15.82}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5975985054233421, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 316}, "mem_gb": 15.78}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25674703964541357, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 266}, "mem_gb": 16.07}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5447978479556118, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 371}, "mem_gb": 15.8}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2872440747608741, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 262}, "mem_gb": 16.01}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5500326780298104, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 348}, "mem_gb": 15.83}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12142534275489549, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 222}, "mem_gb": 16.07}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4838363621559615, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.8, "frames": {"chat": 408}, "mem_gb": 15.63}
59
+ [eval step 40] sample: 'To solve this problem, we need to determine how many months Jamie will need to save up to $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Ste'
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4777134612377733, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 334}, "mem_gb": 15.7}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26782671902769556, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 312}, "mem_gb": 15.75}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4760510028068597, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 352}, "mem_gb": 15.73}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42649951168627787, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 371}, "mem_gb": 15.54}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2969963993587221, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 284}, "mem_gb": 15.99}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22966945569099237, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 287}, "mem_gb": 16.05}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2118602636490638, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 285}, "mem_gb": 15.95}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15490674128712464, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 252}, "mem_gb": 16.04}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47005372033851844, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 360}, "mem_gb": 15.83}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5073588792838156, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 359}, "mem_gb": 15.82}
70
+ [eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investment account.\n\n**Step 1: Ca'
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5008223924842974, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 363}, "mem_gb": 15.58}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44054835544905313, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 1.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 361}, "mem_gb": 15.67}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2815114374967292, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 286}, "mem_gb": 15.86}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4827713771665469, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 367}, "mem_gb": 15.71}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.519183269465963, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 352}, "mem_gb": 15.74}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31538972213622185, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 314}, "mem_gb": 15.69}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4330355774303277, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 372}, "mem_gb": 15.66}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.409724437400202, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 334}, "mem_gb": 15.81}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5026768700672003, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 368}, "mem_gb": 15.75}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38679745998779935, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 354}, "mem_gb": 15.9}
82
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22925734120135505, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 293}, "mem_gb": 15.79}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14540314386067912, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 231}, "mem_gb": 15.95}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36792308059328543, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 302}, "mem_gb": 15.92}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24380717406840996, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 263}, "mem_gb": 16.06}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26298768116074306, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 252}, "mem_gb": 15.99}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3842186267701288, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 344}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35946134569734955, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 313}, "mem_gb": 15.95}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4248026422705812, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 358}, "mem_gb": 15.65}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20273535147358973, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 267}, "mem_gb": 15.87}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42167736749344814, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 300}, "mem_gb": 15.74}
93
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34507594328727575, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 348}, "mem_gb": 15.68}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41975577813948817, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 329}, "mem_gb": 15.76}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23490072903412704, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 269}, "mem_gb": 15.93}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4565903594189013, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 15.6}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27466420506577316, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 302}, "mem_gb": 15.85}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4560155922047794, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 381}, "mem_gb": 15.87}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4927666504467527, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 379}, "mem_gb": 15.82}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4642649358433361, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 351}, "mem_gb": 15.64}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4108597922249387, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 330}, "mem_gb": 15.84}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42124488395067555, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 316}, "mem_gb": 15.87}
104
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calculate '
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27904270700061073, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 276}, "mem_gb": 16.05}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.228957851316873, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 240}, "mem_gb": 15.99}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2720102588892604, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 288}, "mem_gb": 15.9}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2596345935956885, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 271}, "mem_gb": 15.89}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3888280489258468, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 357}, "mem_gb": 15.84}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4793000365299794, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 354}, "mem_gb": 15.81}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45695780246462675, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 302}, "mem_gb": 16.05}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35061701405482987, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 297}, "mem_gb": 16.04}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12848962151346108, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 219}, "mem_gb": 16.06}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45795105344994613, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 306}, "mem_gb": 15.76}
115
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calculate '
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4660177219842871, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 343}, "mem_gb": 15.7}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.440598049429059, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 341}, "mem_gb": 15.81}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26334237359333784, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 318}, "mem_gb": 15.76}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4686895727276802, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 346}, "mem_gb": 15.65}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23776705487283567, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 277}, "mem_gb": 16.13}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2274061721213162, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 270}, "mem_gb": 15.86}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27925217832649746, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 257}, "mem_gb": 16.04}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4476326099673286, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 363}, "mem_gb": 15.65}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44962425051319105, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 356}, "mem_gb": 15.78}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4079832135882539, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 323}, "mem_gb": 15.82}
126
+ [eval step 100] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investments.\n\n1. **Initial Saving'
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21304549249478927, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 243}, "mem_gb": 16.07}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42356742757900306, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 307}, "mem_gb": 15.75}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39062247862250854, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 346}, "mem_gb": 15.98}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609021251362438, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 273}, "mem_gb": 15.99}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2717229096738932, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 302}, "mem_gb": 15.92}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3833931121779916, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 337}, "mem_gb": 16.05}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2972465774985651, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 280}, "mem_gb": 15.92}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48391689189759396, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 331}, "mem_gb": 15.82}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2929912401107761, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 314}, "mem_gb": 15.93}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5003761465976636, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 294}, "mem_gb": 15.86}
138
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23486283350847661, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 274}, "mem_gb": 15.99}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39262658507184434, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 365}, "mem_gb": 15.71}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2590717626190123, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 323}, "mem_gb": 15.77}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17572917435330648, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 234}, "mem_gb": 16.06}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21280498463530093, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 267}, "mem_gb": 16.06}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27839327207648507, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 304}, "mem_gb": 15.82}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42427136177998037, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 373}, "mem_gb": 15.75}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25785485418687265, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 300}, "mem_gb": 16.03}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4411768509555608, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 331}, "mem_gb": 15.87}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20015170131123936, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 259}, "mem_gb": 16.01}
149
+ [eval step 120] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to consider both their monthly savings and the interest earned on their investments.\n\n1. **Ini'
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3958116344372742, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 358}, "mem_gb": 15.63}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45832438057934244, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 354}, "mem_gb": 15.88}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22538287167791277, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 279}, "mem_gb": 15.95}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46269915350402396, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 354}, "mem_gb": 15.7}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43738762830769023, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 334}, "mem_gb": 15.9}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4478856424608578, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 327}, "mem_gb": 15.77}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4040108132199384, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 365}, "mem_gb": 15.87}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23853765527879198, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 252}, "mem_gb": 16.07}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1997395895224375, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 256}, "mem_gb": 16.04}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25159407720764476, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 302}, "mem_gb": 15.81}
160
+ [eval step 130] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investments.\n\n**Step 1: Calculate'
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3980298271117111, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 350}, "mem_gb": 15.72}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25072645187126474, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 292}, "mem_gb": 15.84}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41198305238584676, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 356}, "mem_gb": 15.65}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28235954644468925, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 347}, "mem_gb": 15.81}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25859243848128244, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 330}, "mem_gb": 16.01}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41869445193819704, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 363}, "mem_gb": 15.87}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3864614545663198, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.6, "frames": {"chat": 354}, "mem_gb": 15.73}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21688409688224394, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 270}, "mem_gb": 15.99}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3943046940716915, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 343}, "mem_gb": 15.77}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10573625054787844, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.359375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 232}, "mem_gb": 15.96}
171
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Step 1: C'
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37246566852809243, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 346}, "mem_gb": 15.91}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3026869731923876, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 306}, "mem_gb": 15.99}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20036992888413369, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 273}, "mem_gb": 16.04}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22028152877579754, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 266}, "mem_gb": 15.86}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3245444508772343, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 299}, "mem_gb": 16.06}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22970188966635616, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 259}, "mem_gb": 16.14}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2618037860292631, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 325}, "mem_gb": 15.88}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2416598789668642, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 271}, "mem_gb": 15.95}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39239266892479113, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 359}, "mem_gb": 15.74}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37762522945559274, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 345}, "mem_gb": 15.8}
182
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Step 1: C'
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–‚β–‚β–‚β–ƒβ–†β–„β–β–ƒβ–β–ƒβ–ˆβ–‚β–„β–‚β–‚β–β–ƒβ–…β–ƒβ–…β–‚β–„β–‚β–ƒβ–†β–‚β–…β–„β–β–‚β–‚β–‚β–‚β–‚β–‡β–ƒβ–…β–„β–†β–‚
189
+ wandb: cumulative_loss_tokens β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–ˆβ–ƒβ–‚β–ˆβ–‚β–…β–ˆβ–ˆβ–ˆβ–„β–β–‡β–ˆβ–ˆβ–ˆβ–‡β–†β–‡β–ˆβ–ˆβ–…β–‡β–ˆβ–„β–ˆβ–…β–†β–…β–‡β–‚β–ˆβ–ƒβ–ƒβ–‡β–ˆβ–‡β–‚β–…β–‡β–ˆ
192
+ wandb: forward_topk_kl β–„β–ˆβ–ƒβ–…β–†β–†β–ƒβ–…β–…β–†β–…β–ƒβ–‚β–‚β–…β–‚β–„β–ƒβ–‚β–‚β–„β–‚β–…β–„β–β–‚β–„β–ƒβ–ƒβ–‚β–ƒβ–„β–„β–„β–„β–„β–‚β–β–‚β–ƒ
193
+ wandb: grad_norm β–ˆβ–ˆβ–†β–ƒβ–ƒβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: lr β–β–‚β–…β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–„β–ˆβ–†β–‡β–‡β–‡β–†β–‡β–„β–„β–„β–‡β–β–‡β–‡β–…β–…β–†β–‚β–…β–‚β–…β–…β–‚β–ˆβ–„β–…β–ƒβ–‡β–…β–„β–…β–‡β–„β–…β–‡β–ƒβ–„β–†β–‡
196
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 347.8
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.997
205
+ wandb: forward_topk_kl 0.37763
206
+ wandb: grad_norm 0.54688
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 15.8
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run reap_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/s7308ckw
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1225/wandb/run-20260718_100256-s7308ckw/logs
healed/grid_general/reap_keep50_s1225.eval.log ADDED
@@ -0,0 +1,70 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
0
  0%| | 0/1319 [00:00<?, ?it/s]
1
  14%|β–ˆβ– | 191/1319 [00:00<00:00, 1907.98it/s]
2
  29%|β–ˆβ–ˆβ–‰ | 386/1319 [00:00<00:00, 1930.42it/s]
3
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 582/1319 [00:00<00:00, 1942.92it/s]
4
  59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 778/1319 [00:00<00:00, 1949.23it/s]
5
  74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 975/1319 [00:00<00:00, 1956.61it/s]
6
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 1172/1319 [00:00<00:00, 1959.74it/s]
 
 
7
  0%| | 0/500 [00:00<?, ?it/s]
8
  8%|β–Š | 42/500 [00:00<00:01, 411.98it/s]
9
  17%|β–ˆβ–‹ | 84/500 [00:00<00:00, 416.46it/s]
10
  25%|β–ˆβ–ˆβ–Œ | 127/500 [00:00<00:00, 419.60it/s]
11
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:00<00:00, 421.81it/s]
12
  43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 213/500 [00:00<00:00, 422.94it/s]
13
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 256/500 [00:00<00:00, 424.17it/s]
14
  60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 299/500 [00:00<00:00, 425.10it/s]
15
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 342/500 [00:00<00:00, 425.92it/s]
16
  77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 386/500 [00:00<00:00, 427.56it/s]
17
  86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 429/500 [00:01<00:00, 428.29it/s]
18
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 473/500 [00:01<00:00, 429.00it/s]
 
 
19
  0%| | 0/541 [00:00<?, ?it/s]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
20
  0%| | 0/164 [00:00<?, ?it/s]
21
  98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 161/164 [00:00<00:00, 1609.71it/s]
 
 
22
  0%| | 0/500 [00:00<?, ?it/s]
23
  3%|β–Ž | 17/500 [00:00<00:02, 162.54it/s]
24
  7%|β–‹ | 34/500 [00:00<00:02, 162.50it/s]
25
  10%|β–ˆ | 51/500 [00:00<00:02, 162.99it/s]
26
  14%|β–ˆβ–Ž | 68/500 [00:00<00:02, 163.37it/s]
27
  17%|β–ˆβ–‹ | 85/500 [00:00<00:02, 163.60it/s]
28
  20%|β–ˆβ–ˆ | 102/500 [00:00<00:02, 163.91it/s]
29
  24%|β–ˆβ–ˆβ– | 119/500 [00:00<00:02, 163.90it/s]
30
  27%|β–ˆβ–ˆβ–‹ | 136/500 [00:00<00:02, 164.28it/s]
31
  31%|β–ˆβ–ˆβ–ˆ | 153/500 [00:00<00:02, 164.28it/s]
32
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:01<00:02, 164.51it/s]
33
  37%|β–ˆβ–ˆβ–ˆβ–‹ | 187/500 [00:01<00:01, 164.67it/s]
34
  41%|β–ˆβ–ˆβ–ˆβ–ˆ | 204/500 [00:01<00:01, 164.68it/s]
35
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 221/500 [00:01<00:01, 164.69it/s]
36
  48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 238/500 [00:01<00:01, 164.43it/s]
37
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 255/500 [00:01<00:01, 164.33it/s]
38
  54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 272/500 [00:01<00:01, 164.61it/s]
39
  58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 289/500 [00:01<00:01, 164.50it/s]
40
  61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 306/500 [00:01<00:01, 164.72it/s]
41
  65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 323/500 [00:01<00:01, 164.97it/s]
42
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 340/500 [00:02<00:00, 164.99it/s]
43
  71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 357/500 [00:02<00:00, 165.08it/s]
44
  75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 374/500 [00:02<00:00, 165.37it/s]
45
  78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 391/500 [00:02<00:00, 165.09it/s]
46
  82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 408/500 [00:02<00:00, 164.97it/s]
47
  85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 425/500 [00:02<00:00, 165.16it/s]
48
  88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 442/500 [00:02<00:00, 165.13it/s]
49
  92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 459/500 [00:02<00:00, 164.93it/s]
50
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 476/500 [00:02<00:00, 164.69it/s]
51
  99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 493/500 [00:02<00:00, 164.87it/s]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-07-18T12:36:25-07:00 serving outputs/healed/grid_general/reap_keep50_s1225/step0150 on GPU 1 port 8421
2
+ 2026-07-18T12:36:25-07:00 waiting for server /health ...
3
+ 2026-07-18T12:36:50-07:00 server up; chat pass [gsm8k_cot_zeroshot,minerva_math500,ifeval]
4
+ 2026-07-18:12:36:58 INFO [_cli.run:388] Selected Tasks: ['gsm8k_cot_zeroshot', 'minerva_math500', 'ifeval']
5
+ 2026-07-18:12:36:59 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
6
+ 2026-07-18:12:36:59 WARNING [evaluator:226] generation_kwargs: {'max_gen_toks': 1280} specified through cli, these settings will update set parameters in yaml tasks. Ensure 'do_sample=True' for non-greedy decoding!
7
+ 2026-07-18:12:36:59 INFO [evaluator:239] Initializing local-chat-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
8
+ 2026-07-18:12:36:59 INFO [models.api_models:179] Using max length 2048 - 1
9
+ 2026-07-18:12:36:59 INFO [models.api_models:200] Using tokenizer None
10
+ 2026-07-18:12:37:04 INFO [evaluator_utils:446] Selected tasks:
11
+ 2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: gsm8k_cot_zeroshot (gsm8k/gsm8k-cot-zeroshot.yaml)
12
+ 2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: ifeval (ifeval/ifeval.yaml)
13
+ 2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: minerva_math500 (minerva_math/minerva_math500.yaml)
14
+ 2026-07-18:12:37:04 INFO [evaluator:314] gsm8k_cot_zeroshot: Using gen_kwargs: {'until': ['Q:', '</s>', '<|im_end|>'], 'do_sample': False, 'max_gen_toks': 1280}
15
+ 2026-07-18:12:37:04 INFO [evaluator:314] minerva_math500: Using gen_kwargs: {'until': ['Problem:'], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
16
+ 2026-07-18:12:37:04 INFO [evaluator:314] ifeval: Using gen_kwargs: {'until': [], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
17
+ 2026-07-18:12:37:04 INFO [api.task:312] Building contexts for gsm8k_cot_zeroshot on rank 0...
18
+
19
  0%| | 0/1319 [00:00<?, ?it/s]
20
  14%|β–ˆβ– | 191/1319 [00:00<00:00, 1907.98it/s]
21
  29%|β–ˆβ–ˆβ–‰ | 386/1319 [00:00<00:00, 1930.42it/s]
22
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 582/1319 [00:00<00:00, 1942.92it/s]
23
  59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 778/1319 [00:00<00:00, 1949.23it/s]
24
  74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 975/1319 [00:00<00:00, 1956.61it/s]
25
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 1172/1319 [00:00<00:00, 1959.74it/s]
26
+ 2026-07-18:12:37:05 INFO [api.task:312] Building contexts for minerva_math500 on rank 0...
27
+
28
  0%| | 0/500 [00:00<?, ?it/s]
29
  8%|β–Š | 42/500 [00:00<00:01, 411.98it/s]
30
  17%|β–ˆβ–‹ | 84/500 [00:00<00:00, 416.46it/s]
31
  25%|β–ˆβ–ˆβ–Œ | 127/500 [00:00<00:00, 419.60it/s]
32
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:00<00:00, 421.81it/s]
33
  43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 213/500 [00:00<00:00, 422.94it/s]
34
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 256/500 [00:00<00:00, 424.17it/s]
35
  60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 299/500 [00:00<00:00, 425.10it/s]
36
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 342/500 [00:00<00:00, 425.92it/s]
37
  77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 386/500 [00:00<00:00, 427.56it/s]
38
  86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 429/500 [00:01<00:00, 428.29it/s]
39
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 473/500 [00:01<00:00, 429.00it/s]
40
+ 2026-07-18:12:37:06 INFO [api.task:312] Building contexts for ifeval on rank 0...
41
+
42
  0%| | 0/541 [00:00<?, ?it/s]
43
+ 2026-07-18:12:37:06 INFO [evaluator:585] Running generate_until requests
44
+ 2026-07-18:12:37:06 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
45
+
46
+
47
+
48
+ 2026-07-18:12:42:34 INFO [loggers.evaluation_tracker:247] Saving results aggregated
49
+ 2026-07-18:12:42:34 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep50_s1225/student/*.jsonl
50
+ local-chat-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({'max_gen_toks': 1280}), limit: None, num_fewshot: None, batch_size: 1
51
+ | Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
52
+ |------------------|------:|----------------|-----:|-----------------------|---|-----:|---|------|
53
+ |gsm8k_cot_zeroshot| 3|flexible-extract| 0|exact_match |↑ |0.3184|Β± |0.0128|
54
+ | | |strict-match | 0|exact_match |↑ |0.0106|Β± |0.0028|
55
+ |ifeval | 4|none | 0|inst_level_loose_acc |↑ |0.6655|Β± | N/A|
56
+ | | |none | 0|inst_level_strict_acc |↑ |0.6355|Β± | N/A|
57
+ | | |none | 0|prompt_level_loose_acc |↑ |0.5453|Β± |0.0214|
58
+ | | |none | 0|prompt_level_strict_acc|↑ |0.5102|Β± |0.0215|
59
+ |minerva_math500 | 3|none | 4|exact_match |↑ |0.0900|Β± |0.0128|
60
+ | | |none | 4|math_verify |↑ |0.1440|Β± |0.0157|
61
+
62
+ 2026-07-18T12:42:36-07:00 code pass [humaneval,mbpp] via /v1/completions (function-continuation)
63
+ 2026-07-18:12:42:43 INFO [_cli.run:388] Selected Tasks: ['humaneval', 'mbpp']
64
+ 2026-07-18:12:42:44 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
65
+ 2026-07-18:12:42:44 INFO [evaluator:239] Initializing local-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep50_s1225/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
66
+ 2026-07-18:12:42:44 INFO [models.openai_completions:42] Remote tokenizer not supported. Using huggingface tokenizer backend.
67
+ 2026-07-18:12:42:44 INFO [models.api_models:179] Using max length 2048 - 1
68
+ 2026-07-18:12:42:44 INFO [models.api_models:200] Using tokenizer huggingface
69
+ 2026-07-18:12:42:52 INFO [evaluator_utils:446] Selected tasks:
70
+ 2026-07-18:12:42:52 INFO [evaluator_utils:480] Task: humaneval (humaneval/humaneval.yaml)
71
+ 2026-07-18:12:42:52 INFO [evaluator_utils:480] Task: mbpp (mbpp/mbpp.yaml)
72
+ 2026-07-18:12:42:52 INFO [evaluator:314] humaneval: Using gen_kwargs: {'until': ['\nclass', '\ndef', '\n#', '\nif', '\nprint'], 'max_gen_toks': 1024, 'do_sample': False}
73
+ 2026-07-18:12:42:52 INFO [evaluator:314] mbpp: Using gen_kwargs: {'until': ['[DONE]'], 'do_sample': False}
74
+ 2026-07-18:12:42:52 INFO [api.task:312] Building contexts for humaneval on rank 0...
75
+
76
  0%| | 0/164 [00:00<?, ?it/s]
77
  98%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 161/164 [00:00<00:00, 1609.71it/s]
78
+ 2026-07-18:12:42:52 INFO [api.task:312] Building contexts for mbpp on rank 0...
79
+
80
  0%| | 0/500 [00:00<?, ?it/s]
81
  3%|β–Ž | 17/500 [00:00<00:02, 162.54it/s]
82
  7%|β–‹ | 34/500 [00:00<00:02, 162.50it/s]
83
  10%|β–ˆ | 51/500 [00:00<00:02, 162.99it/s]
84
  14%|β–ˆβ–Ž | 68/500 [00:00<00:02, 163.37it/s]
85
  17%|β–ˆβ–‹ | 85/500 [00:00<00:02, 163.60it/s]
86
  20%|β–ˆβ–ˆ | 102/500 [00:00<00:02, 163.91it/s]
87
  24%|β–ˆβ–ˆβ– | 119/500 [00:00<00:02, 163.90it/s]
88
  27%|β–ˆβ–ˆβ–‹ | 136/500 [00:00<00:02, 164.28it/s]
89
  31%|β–ˆβ–ˆβ–ˆ | 153/500 [00:00<00:02, 164.28it/s]
90
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:01<00:02, 164.51it/s]
91
  37%|β–ˆβ–ˆβ–ˆβ–‹ | 187/500 [00:01<00:01, 164.67it/s]
92
  41%|β–ˆβ–ˆβ–ˆβ–ˆ | 204/500 [00:01<00:01, 164.68it/s]
93
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 221/500 [00:01<00:01, 164.69it/s]
94
  48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 238/500 [00:01<00:01, 164.43it/s]
95
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 255/500 [00:01<00:01, 164.33it/s]
96
  54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 272/500 [00:01<00:01, 164.61it/s]
97
  58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 289/500 [00:01<00:01, 164.50it/s]
98
  61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 306/500 [00:01<00:01, 164.72it/s]
99
  65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 323/500 [00:01<00:01, 164.97it/s]
100
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 340/500 [00:02<00:00, 164.99it/s]
101
  71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 357/500 [00:02<00:00, 165.08it/s]
102
  75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 374/500 [00:02<00:00, 165.37it/s]
103
  78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 391/500 [00:02<00:00, 165.09it/s]
104
  82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 408/500 [00:02<00:00, 164.97it/s]
105
  85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 425/500 [00:02<00:00, 165.16it/s]
106
  88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 442/500 [00:02<00:00, 165.13it/s]
107
  92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 459/500 [00:02<00:00, 164.93it/s]
108
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 476/500 [00:02<00:00, 164.69it/s]
109
  99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š| 493/500 [00:02<00:00, 164.87it/s]
110
+ 2026-07-18:12:42:55 INFO [evaluator:585] Running generate_until requests
111
+ 2026-07-18:12:42:55 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
112
+
113
+
114
+ 2026-07-18:12:46:31 INFO [loggers.evaluation_tracker:247] Saving results aggregated
115
+ 2026-07-18:12:46:31 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep50_s1225/student/*.jsonl
116
+ local-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep50_s1225/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({}), limit: None, num_fewshot: None, batch_size: 1
117
+ | Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
118
+ |---------|------:|-----------|-----:|---------|---|-----:|---|-----:|
119
+ |humaneval| 1|create_test| 0|pass@1 |↑ |0.2378|Β± |0.0333|
120
+ |mbpp | 1|none | 3|pass_at_1|↑ |0.2180|Β± |0.0185|
121
+
122
+ 2026-07-18T12:46:32-07:00 lm_eval exit=0 -> outputs/evals/general_suite/healed/reap_keep50_s1225
healed/grid_general/reap_keep50_s1226.console.log ADDED
@@ -0,0 +1,217 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run o0n3wlu6
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1226/wandb/run-20260718_100342-o0n3wlu6
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run reap_keep50_s1226
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/o0n3wlu6
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8803540725124379, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 9.625, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 308}, "mem_gb": 15.9}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: 'To solve the given problem, we need to understand the properties of an arithmetic sequence. \n\n1. **Under the given condition:**\n \\[a_1 + 3a_8 + a_{15} = 120\\]\n\n2. **Objective:**\n Find \\(2a_9 - a'
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5245416656317811, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 7.5625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 211}, "mem_gb": 16.04}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7376569056948026, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 7.9375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 281}, "mem_gb": 16.04}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0425827999557058, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.0, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 367}, "mem_gb": 15.59}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0140658880367874, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.8125, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 312}, "mem_gb": 15.75}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7786726121418178, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.46875, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 271}, "mem_gb": 16.06}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5371215664693465, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.390625, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 269}, "mem_gb": 16.03}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8027348423482229, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.53125, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 352}, "mem_gb": 15.55}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38005650374094646, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 243}, "mem_gb": 16.04}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4923551563156769, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.5703125, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 293}, "mem_gb": 15.96}
26
+ [eval step 10] sample: 'To solve the problem, we need to understand the properties of an arithmetic sequence. In an arithmetic sequence, each term can be expressed as:\n\\[ a_n = a_1 + (n-1)d \\]\nwhere \\( a_1 \\) is the first te'
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30476141565479337, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 242}, "mem_gb": 16.04}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7059471693091095, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 353}, "mem_gb": 15.73}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6465659825122605, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 338}, "mem_gb": 15.74}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34863743216705817, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 259}, "mem_gb": 16.04}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5902533355700473, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 385}, "mem_gb": 15.59}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5514633375123144, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 355}, "mem_gb": 15.75}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5126457059609393, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 328}, "mem_gb": 15.66}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5420009215599547, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 355}, "mem_gb": 15.81}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6401449499430756, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 367}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5762424655330678, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 343}, "mem_gb": 15.72}
37
+ [eval step 20] sample: 'in an arithmetic sequence, the terms can be expressed as follows:\n\na_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 + 3a_8 + a_15 = 120.'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18428315997235478, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 244}, "mem_gb": 16.04}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3499387068385879, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 339}, "mem_gb": 15.88}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3543776503519155, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 298}, "mem_gb": 16.03}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5345170649668202, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 398}, "mem_gb": 15.9}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4978335596371442, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 362}, "mem_gb": 16.01}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32800316587444395, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 313}, "mem_gb": 15.88}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5755675832235565, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 324}, "mem_gb": 15.79}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35423008082595964, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 314}, "mem_gb": 15.85}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5179929546431948, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 345}, "mem_gb": 15.77}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27091556184059007, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 262}, "mem_gb": 15.95}
48
+ [eval step 30] sample: 'in an arithmetic sequence, the terms can be expressed as follows:\n\na_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 + 3a_8 + a_15 = 120.'
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.577119707132255, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 373}, "mem_gb": 15.74}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48509374340387684, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 334}, "mem_gb": 15.74}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3503109037802865, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 327}, "mem_gb": 15.89}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12506881032409145, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 238}, "mem_gb": 16.06}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4309783675464491, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 310}, "mem_gb": 15.79}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4856793941443165, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 347}, "mem_gb": 15.79}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48103460386345787, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 304}, "mem_gb": 15.72}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539403932945182, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 343}, "mem_gb": 15.74}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5047299618404358, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 314}, "mem_gb": 15.73}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4582703509811933, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 300}, "mem_gb": 15.83}
59
+ [eval step 40] sample: 'in an arithmetic sequence, the terms can be expressed as follows: a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.370719632548963, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 318}, "mem_gb": 15.88}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29393145427610723, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 279}, "mem_gb": 15.91}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4841774621979023, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 364}, "mem_gb": 15.98}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32296518924826134, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 256}, "mem_gb": 16.04}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.570301607248187, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 340}, "mem_gb": 15.75}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2790704633633296, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 283}, "mem_gb": 15.97}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4757030893900121, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 349}, "mem_gb": 15.76}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28745832533594223, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 297}, "mem_gb": 15.83}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5774708951790817, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 359}, "mem_gb": 15.8}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36503237710408865, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 342}, "mem_gb": 15.85}
70
+ [eval step 50] sample: 'in an arithmetic sequence, the terms can be represented as follows: a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need '
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2517585934319223, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 16.01}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3566328674788276, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 324}, "mem_gb": 16.0}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27923091744172074, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 281}, "mem_gb": 15.99}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3481388681463897, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 287}, "mem_gb": 16.04}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41609524348185706, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 296}, "mem_gb": 16.05}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29090916095875824, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 267}, "mem_gb": 16.1}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27961073563074074, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 249}, "mem_gb": 16.0}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4881344231818803, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 363}, "mem_gb": 15.7}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31574329399553436, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 299}, "mem_gb": 15.83}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47885576662253587, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 331}, "mem_gb": 15.71}
82
+ [eval step 60] sample: 'in an arithmetic sequence, the nth term can be expressed as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609119995918125, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 280}, "mem_gb": 15.92}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48466926071469985, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 350}, "mem_gb": 15.91}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47754268602561206, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 321}, "mem_gb": 15.67}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2465799712936394, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 281}, "mem_gb": 15.97}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5282968313955392, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 331}, "mem_gb": 15.65}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4012415755114829, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 318}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3264350763700902, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 309}, "mem_gb": 16.04}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045971091615036, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 304}, "mem_gb": 15.93}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.206257420444116, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 279}, "mem_gb": 15.95}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11195049509825185, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 248}, "mem_gb": 15.95}
93
+ [eval step 70] sample: 'in an arithmetic sequence, the nth term can be expressed as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3543535236385961, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 268}, "mem_gb": 15.92}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3358878048156388, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 299}, "mem_gb": 16.02}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3787086397775449, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 322}, "mem_gb": 15.88}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23657592692331722, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 248}, "mem_gb": 16.06}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3605229274411375, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 326}, "mem_gb": 15.95}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32776349373565367, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 314}, "mem_gb": 15.71}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1119552330814302, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 232}, "mem_gb": 16.05}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46964268895580125, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 330}, "mem_gb": 15.78}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2551336821261793, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 292}, "mem_gb": 15.93}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42451596441746997, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 312}, "mem_gb": 15.95}
104
+ [eval step 80] sample: 'in an arithmetic sequence, each term is the sum of the previous term and a constant difference, denoted as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 +'
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5049197539076209, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 382}, "mem_gb": 15.76}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5066151228363315, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 360}, "mem_gb": 15.63}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08825671870829538, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 222}, "mem_gb": 15.89}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47393432003228614, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 342}, "mem_gb": 15.94}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44907177470792087, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 337}, "mem_gb": 15.74}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29662999662371975, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 304}, "mem_gb": 15.99}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30810854892162604, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 326}, "mem_gb": 15.89}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39736867315458757, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 310}, "mem_gb": 15.95}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3866154748741227, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 328}, "mem_gb": 15.77}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46558151512009405, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 347}, "mem_gb": 15.6}
115
+ [eval step 90] sample: 'in an arithmetic sequence, each term is obtained by adding a constant difference to the previous term. let the first term be $a_1$ and the common difference be $d$. then, the terms of the sequence can'
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3922062694163993, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 330}, "mem_gb": 15.89}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11213775708892693, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 209}, "mem_gb": 16.09}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44183869125631947, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 399}, "mem_gb": 15.67}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4175340923215573, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 351}, "mem_gb": 15.75}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2900481648554094, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 322}, "mem_gb": 15.75}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4496474737109306, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 333}, "mem_gb": 15.64}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3320286479762755, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 330}, "mem_gb": 15.93}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08734862082016964, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 238}, "mem_gb": 15.96}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21075038343292352, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 297}, "mem_gb": 15.87}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3970769523902796, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 345}, "mem_gb": 15.83}
126
+ [eval step 100] sample: 'in an arithmetic sequence, each term is given by the formula \\( a_n = a_1 + (n-1)d \\), where \\( a_1 \\) is the first term and \\( d \\) is the common difference.\n\nwe are given the equation \\( a_1 + 3a'
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.287641732741644, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 304}, "mem_gb": 15.98}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38429266269846507, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 326}, "mem_gb": 15.98}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46583052609575293, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 347}, "mem_gb": 15.91}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4203300688823064, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 325}, "mem_gb": 15.79}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26020686544825633, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 299}, "mem_gb": 15.98}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4902439262590992, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 345}, "mem_gb": 15.75}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42703017073019095, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 344}, "mem_gb": 15.65}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32948422564820695, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 344}, "mem_gb": 15.91}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30353012832074117, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 288}, "mem_gb": 15.98}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2923359860416502, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 303}, "mem_gb": 15.68}
138
+ [eval step 110] sample: 'in an arithmetic sequence, each term is given by the formula \\( a_n = a_1 + (n-1)d \\), where \\( a_1 \\) is the first term and \\( d \\) is the common difference.\n\nwe are given the equation \\( a_1 + 3a'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2037433411721761, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 284}, "mem_gb": 15.87}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4946847830141584, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 369}, "mem_gb": 15.76}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2326797963919739, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 269}, "mem_gb": 16.02}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4447052156049137, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 341}, "mem_gb": 15.78}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43583181944663324, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 384}, "mem_gb": 15.55}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38500864298517506, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 358}, "mem_gb": 15.71}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43370534232476105, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 342}, "mem_gb": 15.89}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47076233574878423, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 365}, "mem_gb": 15.71}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4276117646556348, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 337}, "mem_gb": 15.94}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3754852831015984, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 333}, "mem_gb": 16.04}
149
+ [eval step 120] sample: 'in an arithmetic sequence, each term is obtained by adding a constant difference to the previous term. let the first term be $a_1$ and the common difference be $d$. the $n$-th term of the sequence can'
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26361574191426235, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 293}, "mem_gb": 16.08}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24020869141261403, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 291}, "mem_gb": 15.84}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38429353994509824, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 341}, "mem_gb": 15.87}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2554638585098398, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 300}, "mem_gb": 15.81}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2246168749174724, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 270}, "mem_gb": 16.03}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1842907473299342, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 259}, "mem_gb": 16.05}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4298636924965928, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 355}, "mem_gb": 15.62}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4622928888415297, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 388}, "mem_gb": 15.98}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3934170277511701, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 318}, "mem_gb": 15.7}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4545871971178179, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 383}, "mem_gb": 15.83}
160
+ [eval step 130] sample: 'in an arithmetic sequence, each term can be expressed as $a_n = a_1 + (n-1)d$, where $a_1$ is the first term and $d$ is the common difference. given the equation $a_1 + 3a_8 + a_{15} ='
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2575471988634827, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 15.84}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24139552542498957, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 295}, "mem_gb": 15.93}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2574606940655969, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 306}, "mem_gb": 15.67}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33667906954844173, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 303}, "mem_gb": 15.93}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17280556662414845, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 272}, "mem_gb": 15.99}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23784746413075675, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 248}, "mem_gb": 15.99}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26652159887754046, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 282}, "mem_gb": 15.98}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39917195659261195, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 362}, "mem_gb": 15.54}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43901363371691354, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 374}, "mem_gb": 15.9}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23722182946366568, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 280}, "mem_gb": 16.07}
171
+ [eval step 140] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the previous term plus a constant difference, denoted as $d$. the $n$-th "
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1807478553803948, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 276}, "mem_gb": 15.92}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24345059381338457, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 246}, "mem_gb": 16.06}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4581963272950302, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 360}, "mem_gb": 15.59}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4408426818853865, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 365}, "mem_gb": 15.77}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.356927572813537, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 338}, "mem_gb": 15.85}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18863985311680784, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 276}, "mem_gb": 15.96}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10042948584845289, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 209}, "mem_gb": 16.04}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4000309775177389, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 379}, "mem_gb": 15.64}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3480989918136969, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 307}, "mem_gb": 15.98}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24423585990754268, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 293}, "mem_gb": 16.02}
182
+ [eval step 150] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms. if \\(a_1\\) is the first term and \\(d\\)"
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
186
+ wandb: uploading data
187
+ wandb:
188
+ wandb: Run history:
189
+ wandb: comp_len β–ˆβ–„β–…β–†β–„β–‚β–β–‚β–‚β–‚β–ƒβ–ƒβ–„β–β–„β–ƒβ–ƒβ–†β–ƒβ–„β–‡β–ƒβ–‚β–‚β–‚β–‚β–ƒβ–‚β–†β–‚β–ƒβ–β–‚β–„β–‚β–„β–„β–„β–‚β–„
190
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
191
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
192
+ wandb: finish_rate β–ˆβ–ˆβ–β–ˆβ–ˆβ–†β–ˆβ–ƒβ–ˆβ–‡β–ˆβ–ˆβ–†β–ˆβ–ˆβ–„β–‡β–ˆβ–ƒβ–ˆβ–ˆβ–‡β–ˆβ–β–‡β–ˆβ–†β–‡β–ƒβ–ˆβ–ˆβ–†β–‡β–‡β–ˆβ–†β–…β–ˆβ–ˆβ–ˆ
193
+ wandb: forward_topk_kl β–‡β–…β–ˆβ–ƒβ–…β–ƒβ–†β–…β–…β–…β–†β–ƒβ–†β–ƒβ–…β–ƒβ–ƒβ–ƒβ–β–„β–β–ƒβ–„β–…β–β–„β–ƒβ–β–…β–„β–‚β–‚β–„β–„β–…β–ƒβ–‚β–‚β–β–ƒ
194
+ wandb: grad_norm β–ˆβ–†β–‡β–‡β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
195
+ wandb: lr β–β–…β–†β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
196
+ wandb: mem_gb β–ˆβ–β–ˆβ–‡β–ˆβ–‚β–…β–ˆβ–…β–„β–…β–‡β–…β–‡β–‡β–…β–†β–‡β–†β–†β–‚β–‡β–†β–„β–…β–ƒβ–ƒβ–‚β–†β–…β–‡β–ƒβ–‡β–…β–…β–β–ƒβ–†β–‚β–…
197
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆ
198
+ wandb: t_data_s β–ˆβ–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
199
+ wandb: +3 ...
200
+ wandb:
201
+ wandb: Run summary:
202
+ wandb: comp_len 409.6
203
+ wandb: cumulative_loss_tokens 18000000
204
+ wandb: epoch 0
205
+ wandb: finish_rate 0.942
206
+ wandb: forward_topk_kl 0.24424
207
+ wandb: grad_norm 0.45898
208
+ wandb: lr 3e-05
209
+ wandb: mem_gb 16.02
210
+ wandb: step 150
211
+ wandb: t_data_s 0
212
+ wandb: +4 ...
213
+ wandb:
214
+ wandb: πŸš€ View run reap_keep50_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/o0n3wlu6
215
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
216
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
217
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1226/wandb/run-20260718_100342-o0n3wlu6/logs
healed/grid_general/reap_keep50_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep75_s1224.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1224/wandb/run-20260718_191947-wgcis861
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run reap_keep75_s1224
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/wgcis861
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1873658725475582, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 2.484375, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 259}, "mem_gb": 21.93}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. We can do this by performing row reduction (or Gaussian elimination) to transform the mat'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27989488012346747, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 2.734375, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 348}, "mem_gb": 21.69}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2562543364167524, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 2.46875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 370}, "mem_gb": 21.84}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10009050508008029, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.46875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 244}, "mem_gb": 22.07}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1936520132654036, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.578125, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 320}, "mem_gb": 21.99}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22987501155068166, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.640625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 378}, "mem_gb": 21.59}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25268974237848696, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.4921875, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 384}, "mem_gb": 22.08}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.255581365201467, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.4375, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 324}, "mem_gb": 21.93}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09212276532261943, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 239}, "mem_gb": 22.1}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2332037605868187, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 306}, "mem_gb": 21.84}
25
+ [eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be full rank if it has rank equal to the minimum of the number of '
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22265962155194333, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 329}, "mem_gb": 21.87}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11031593802776188, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 254}, "mem_gb": 22.1}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1915364201122274, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 273}, "mem_gb": 22.08}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06717586185860758, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 236}, "mem_gb": 22.0}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23346983922738582, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 381}, "mem_gb": 21.73}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08174875815298098, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 266}, "mem_gb": 21.93}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13084362343273437, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 308}, "mem_gb": 21.92}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11916340049126496, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 273}, "mem_gb": 22.1}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19706835948467877, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 368}, "mem_gb": 21.73}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26277435475029054, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 339}, "mem_gb": 21.97}
36
+ [eval step 20] sample: 'To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent row vectors. This involves reducing the matrix to row-echelon form (REF) and identifying the lea'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12363467963938601, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 298}, "mem_gb": 21.9}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.190306089666641, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 350}, "mem_gb": 21.62}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09987625321104812, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 246}, "mem_gb": 22.07}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20257040274753235, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 375}, "mem_gb": 21.8}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20374540116178494, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.6, "frames": {"chat": 352}, "mem_gb": 21.85}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1947504082653982, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.7, "frames": {"chat": 396}, "mem_gb": 21.81}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16843741359647052, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 362}, "mem_gb": 21.66}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2105110317436047, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 369}, "mem_gb": 21.87}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21023132975681996, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 399}, "mem_gb": 21.72}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.123267681810384, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 247}, "mem_gb": 21.99}
47
+ [eval step 30] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Row Reduction to Row Echelon Form (REF)**:\n "
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04471613788570588, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 230}, "mem_gb": 21.93}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0868360648374694, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 263}, "mem_gb": 22.1}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10159225756400264, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 264}, "mem_gb": 22.09}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18209796229211303, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 328}, "mem_gb": 21.95}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09340377695357116, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 281}, "mem_gb": 22.02}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.060203925158362835, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 237}, "mem_gb": 22.01}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0755095823372559, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 278}, "mem_gb": 22.1}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17438754756432026, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 310}, "mem_gb": 21.97}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09410194004089571, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 295}, "mem_gb": 21.91}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11445019369409419, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 329}, "mem_gb": 21.92}
58
+ [eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as:\n\\[ A = \\begin{pmatrix}\n12"
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10687232487322762, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 263}, "mem_gb": 22.04}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.131437020917912, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 315}, "mem_gb": 21.92}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16547962574744596, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 354}, "mem_gb": 21.87}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08571877144188621, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 259}, "mem_gb": 22.05}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11487598667480052, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 275}, "mem_gb": 21.9}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1526387256359371, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 334}, "mem_gb": 21.77}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1695261684531501, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 374}, "mem_gb": 21.62}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1499260142687553, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 311}, "mem_gb": 21.79}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1233547725815326, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 259}, "mem_gb": 22.1}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1450087027960457, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 305}, "mem_gb": 22.08}
69
+ [eval step 50] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & "
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12619501014033643, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 298}, "mem_gb": 22.06}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.200404087631125, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 364}, "mem_gb": 21.84}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08946410632994957, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 302}, "mem_gb": 21.94}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17898882940830663, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 316}, "mem_gb": 21.7}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1911006489981897, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 312}, "mem_gb": 21.8}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15108458322715015, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 330}, "mem_gb": 21.95}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14891134254783392, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 321}, "mem_gb": 21.96}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1267671151664729, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 344}, "mem_gb": 21.99}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16068638868291552, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 353}, "mem_gb": 21.66}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0870077589156106, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 272}, "mem_gb": 22.09}
81
+ [eval step 60] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than i'
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17761957487501204, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 317}, "mem_gb": 21.84}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06813746920924169, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 292}, "mem_gb": 21.84}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0341937465865165, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.287109375, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 229}, "mem_gb": 21.95}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16766208313619718, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 359}, "mem_gb": 21.96}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1477175132743238, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 358}, "mem_gb": 21.68}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18516349187276016, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 315}, "mem_gb": 22.06}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11799809287215272, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 264}, "mem_gb": 22.14}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17208621730594895, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.3, "frames": {"chat": 337}, "mem_gb": 21.81}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08624628668630806, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 251}, "mem_gb": 22.1}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14355475744690435, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 298}, "mem_gb": 21.83}
92
+ [eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Row Reduction (Gaussian Elimination):**\n "
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1100898157506405, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 264}, "mem_gb": 22.04}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10513536257176505, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 305}, "mem_gb": 22.06}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09678585653822713, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 322}, "mem_gb": 21.83}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15489849325778585, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 361}, "mem_gb": 21.82}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12131552501470627, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 321}, "mem_gb": 22.0}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13028004938957746, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 307}, "mem_gb": 21.89}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16787009909562767, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 327}, "mem_gb": 21.99}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1937187968663561, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 356}, "mem_gb": 21.61}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08899544142593319, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 283}, "mem_gb": 21.95}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16648278532453503, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.5, "frames": {"chat": 401}, "mem_gb": 21.71}
103
+ [eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09835249316293436, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 288}, "mem_gb": 21.9}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1394834956632151, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 323}, "mem_gb": 21.94}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18267308879733707, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 336}, "mem_gb": 21.83}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1505348251045216, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 329}, "mem_gb": 21.74}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14841092484351248, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 343}, "mem_gb": 21.72}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1670957286581242, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 336}, "mem_gb": 21.84}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1463558290997365, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 314}, "mem_gb": 22.08}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08961212306939997, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 281}, "mem_gb": 21.91}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11369646250194249, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 299}, "mem_gb": 21.79}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15054527740851045, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 328}, "mem_gb": 21.98}
114
+ [eval step 90] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of full rank if all its rows (or columns) are lin'
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10570568347213169, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 271}, "mem_gb": 22.08}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11207106284011777, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 269}, "mem_gb": 22.18}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19176901529369256, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 370}, "mem_gb": 21.72}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.200458272660772, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 352}, "mem_gb": 21.78}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17114766156881428, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 330}, "mem_gb": 21.99}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12207698177928882, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 334}, "mem_gb": 21.71}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12966958915465512, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 336}, "mem_gb": 21.85}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09668313371852662, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 309}, "mem_gb": 21.94}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16547617942097909, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.1, "frames": {"chat": 391}, "mem_gb": 21.82}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0852213893647616, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 264}, "mem_gb": 22.22}
125
+ [eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & "
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14912181334650765, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 349}, "mem_gb": 21.77}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14887319083894449, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 312}, "mem_gb": 21.83}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0483703385195074, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.306640625, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 229}, "mem_gb": 22.09}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1253449940949523, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 288}, "mem_gb": 22.09}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17186788550638593, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 351}, "mem_gb": 21.75}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05532257166073347, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.328125, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 223}, "mem_gb": 22.12}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03140789915128456, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.294921875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 213}, "mem_gb": 22.08}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15115452178712002, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.3, "frames": {"chat": 380}, "mem_gb": 21.93}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09043114711657788, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 271}, "mem_gb": 22.11}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18969596414649859, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 340}, "mem_gb": 22.01}
137
+ [eval step 110] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of full rank if all its rows (or columns) are linear'
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1750133204760806, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 366}, "mem_gb": 21.7}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05395613063708103, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 233}, "mem_gb": 22.09}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12163264965891528, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 312}, "mem_gb": 21.96}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17119687434742228, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 363}, "mem_gb": 21.67}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16860832793383548, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 323}, "mem_gb": 21.95}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1706812752948453, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 346}, "mem_gb": 21.69}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16357084634642427, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 318}, "mem_gb": 21.84}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12760271622771396, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 275}, "mem_gb": 22.02}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.145948747621368, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 345}, "mem_gb": 21.77}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1450525258542892, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 377}, "mem_gb": 21.91}
148
+ [eval step 120] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1"
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11816860233771925, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 294}, "mem_gb": 22.14}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16353510830309242, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 338}, "mem_gb": 21.83}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18016940437387674, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 352}, "mem_gb": 21.73}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15826112236181894, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.0, "frames": {"chat": 347}, "mem_gb": 21.78}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10110068176521454, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 1.484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 310}, "mem_gb": 21.76}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1936153787978304, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.7, "frames": {"chat": 358}, "mem_gb": 21.78}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09523940229162885, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 319}, "mem_gb": 22.06}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06792385750228229, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.353515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 269}, "mem_gb": 22.09}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12652876620485137, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 310}, "mem_gb": 21.95}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08150330542761366, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 259}, "mem_gb": 22.12}
159
+ [eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1"
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07982180994842202, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 265}, "mem_gb": 22.1}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17891147567131557, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 337}, "mem_gb": 21.65}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08981655380092561, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 290}, "mem_gb": 21.91}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1507600719051901, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.6, "frames": {"chat": 349}, "mem_gb": 21.84}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09113996521788649, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 291}, "mem_gb": 21.94}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1560885852477203, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 342}, "mem_gb": 21.81}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19789823096484566, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 338}, "mem_gb": 21.75}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1761994122691918, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.7, "frames": {"chat": 356}, "mem_gb": 21.71}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07923250444449174, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 265}, "mem_gb": 22.09}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1345104466229522, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.2, "frames": {"chat": 353}, "mem_gb": 21.81}
170
+ [eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13114069964168593, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 316}, "mem_gb": 22.0}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11726701095427076, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 289}, "mem_gb": 22.15}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1138644701910826, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 331}, "mem_gb": 21.78}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10702105035733742, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 320}, "mem_gb": 22.1}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10355366102789218, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 272}, "mem_gb": 21.83}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19566748774093576, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.4, "frames": {"chat": 368}, "mem_gb": 21.75}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15470146789173594, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 328}, "mem_gb": 21.78}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1427797764064744, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 326}, "mem_gb": 21.99}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1717408910106557, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 364}, "mem_gb": 21.93}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11370671968573394, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 296}, "mem_gb": 21.98}
181
+ [eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
185
+ wandb: uploading summary, console lines 171-171
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–‚β–‡β–ƒβ–‚β–‚β–β–‚β–β–ƒβ–†β–„β–„β–ƒβ–‚β–„β–ƒβ–„β–ƒβ–…β–…β–ƒβ–„β–‚β–ƒβ–„β–…β–†β–ˆβ–ƒβ–…β–‚β–‚β–‚β–†β–…β–‚β–„β–ƒβ–‚β–„
189
+ wandb: cumulative_loss_tokens β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–β–†β–ƒβ–‚β–ˆβ–β–ˆβ–ˆβ–„β–ƒβ–…β–β–„β–‡β–‡β–ˆβ–‡β–†β–‡β–‡β–„β–†β–‡β–ˆβ–‡β–ˆβ–ˆβ–ˆβ–ˆβ–‡β–ˆβ–…β–ˆβ–ˆβ–ˆβ–…β–ˆβ–ˆβ–ˆβ–‡
192
+ wandb: forward_topk_kl β–†β–ˆβ–ƒβ–‡β–ˆβ–†β–†β–…β–†β–β–‚β–ƒβ–„β–…β–…β–ƒβ–…β–…β–…β–β–†β–…β–ƒβ–…β–ƒβ–…β–…β–„β–‚β–β–ƒβ–…β–„β–„β–‚β–‚β–ƒβ–†β–ƒβ–„
193
+ wandb: grad_norm β–ˆβ–…β–…β–ƒβ–‚β–‚β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–‚β–β–β–β–β–β–β–‚β–β–β–β–‚β–‚β–‚β–β–‚β–‚β–β–β–‚β–β–β–
194
+ wandb: lr β–β–‚β–…β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–„β–ˆβ–β–ˆβ–‡β–ˆβ–‡β–ˆβ–†β–„β–‡β–„β–ƒβ–„β–†β–†β–†β–„β–β–†β–†β–ƒβ–„β–ˆβ–†β–„β–ˆβ–ˆβ–†β–‚β–…β–‡β–ˆβ–…β–„β–ƒβ–ƒβ–„β–ˆβ–†
196
+ wandb: step β–β–β–β–β–β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆ
197
+ wandb: t_data_s β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 405.4
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.97
205
+ wandb: forward_topk_kl 0.11371
206
+ wandb: grad_norm 0.42773
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 21.98
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run reap_keep75_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/wgcis861
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1224/wandb/run-20260718_191947-wgcis861/logs
healed/grid_general/reap_keep75_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep75_s1225.console.log ADDED
@@ -0,0 +1,392 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run eyetgo3a
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260718_224025-eyetgo3a
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run reap_keep75_s1225
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/eyetgo3a
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32691152300952625, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.09375, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 331}, "mem_gb": 21.8}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: 'To determine how many months it will take for Jamie to reach the savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned.\n\n1. **Initial Savings:**\n - Jamie s'
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3199042237383003, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 3.28125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 342}, "mem_gb": 21.72}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3276988255869287, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.171875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 358}, "mem_gb": 21.76}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2653813190323611, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.359375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 344}, "mem_gb": 21.84}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16577702154777943, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.421875, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 267}, "mem_gb": 22.16}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07628021648065186, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.87109375, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 248}, "mem_gb": 21.99}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22926093437794284, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.328125, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 329}, "mem_gb": 21.98}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23873148627749954, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.265625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 339}, "mem_gb": 21.94}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24488673688516333, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 354}, "mem_gb": 21.94}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14254065898017337, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 279}, "mem_gb": 22.07}
26
+ [eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17979874870991333, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 318}, "mem_gb": 22.0}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12242380664556597, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 265}, "mem_gb": 22.09}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10949978814693168, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 254}, "mem_gb": 22.03}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16167643672154905, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 315}, "mem_gb": 22.06}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23289925298504532, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 300}, "mem_gb": 21.86}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14982427687635647, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 276}, "mem_gb": 22.06}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23245559696989754, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 356}, "mem_gb": 22.0}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19985329620527725, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 304}, "mem_gb": 21.81}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20904093375516433, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 375}, "mem_gb": 21.73}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11546105957857022, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 294}, "mem_gb": 22.09}
37
+ [eval step 20] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19831337091407428, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 299}, "mem_gb": 22.1}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14949486692990177, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 305}, "mem_gb": 21.88}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09090689937220886, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 262}, "mem_gb": 21.93}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12780333354215448, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 303}, "mem_gb": 21.99}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21190356762927645, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 380}, "mem_gb": 21.87}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09783557223896495, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 282}, "mem_gb": 21.83}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18497481243492414, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 362}, "mem_gb": 21.84}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1856384761373202, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 307}, "mem_gb": 22.08}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12597426218503777, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 282}, "mem_gb": 21.95}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1817345579418664, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 337}, "mem_gb": 21.98}
48
+ [eval step 30] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11014159770294403, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 275}, "mem_gb": 22.04}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18914651696265986, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 318}, "mem_gb": 21.85}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23652538478126128, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 385}, "mem_gb": 21.87}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23049329001403723, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 316}, "mem_gb": 21.83}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09107681101333971, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 266}, "mem_gb": 22.12}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19664210549537092, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 371}, "mem_gb": 21.85}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10261952416292236, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 262}, "mem_gb": 22.06}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21949122376873467, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 348}, "mem_gb": 21.88}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04237283055443938, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 222}, "mem_gb": 22.12}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1793475973547126, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 75.8, "frames": {"chat": 408}, "mem_gb": 21.68}
59
+ [eval step 40] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17456044655498118, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 334}, "mem_gb": 21.75}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08869157117024686, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 312}, "mem_gb": 21.8}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1764846066198622, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 352}, "mem_gb": 21.78}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14268789846193977, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 371}, "mem_gb": 21.59}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10607967147635451, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 284}, "mem_gb": 22.04}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07848575267903507, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 287}, "mem_gb": 22.1}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07426931333943891, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.373046875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 285}, "mem_gb": 22.0}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0474071029479693, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.3203125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 252}, "mem_gb": 22.09}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17111980931263726, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 360}, "mem_gb": 21.88}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19600136266113258, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 359}, "mem_gb": 21.87}
70
+ [eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1808290124348132, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 363}, "mem_gb": 21.63}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14661304474386075, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 361}, "mem_gb": 21.72}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09502901013823381, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 286}, "mem_gb": 21.91}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.188380916898263, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 367}, "mem_gb": 21.76}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19296414749057342, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 352}, "mem_gb": 21.79}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10843863764797958, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 314}, "mem_gb": 21.74}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17145762857797867, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 372}, "mem_gb": 21.71}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13833932032308852, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 334}, "mem_gb": 21.86}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19346887857085093, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 368}, "mem_gb": 21.8}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1387528518877613, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 354}, "mem_gb": 21.95}
82
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07273584785660107, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 293}, "mem_gb": 21.84}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05641446691872552, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 231}, "mem_gb": 22.0}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14254065000315508, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 302}, "mem_gb": 21.97}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09710669839001881, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 263}, "mem_gb": 22.11}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09882783080255612, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 252}, "mem_gb": 22.04}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14380706306064192, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 344}, "mem_gb": 22.07}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12891555527728826, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 313}, "mem_gb": 22.0}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1599420048183296, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 358}, "mem_gb": 21.7}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07303028860920265, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.365234375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 267}, "mem_gb": 21.92}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1577588624805988, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 300}, "mem_gb": 21.79}
93
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12018602301462863, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 348}, "mem_gb": 21.73}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1682743690628869, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 329}, "mem_gb": 21.81}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10312192343715579, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 269}, "mem_gb": 21.98}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.176240423058051, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 358}, "mem_gb": 21.65}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10181706533844893, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 302}, "mem_gb": 21.9}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18092844381683196, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.0, "frames": {"chat": 381}, "mem_gb": 21.92}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.192465716847172, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.7, "frames": {"chat": 379}, "mem_gb": 21.87}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17654183121492775, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 351}, "mem_gb": 21.69}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1458736981579568, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 330}, "mem_gb": 21.89}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15538068436005464, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 316}, "mem_gb": 21.92}
104
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10480584769328125, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 276}, "mem_gb": 22.1}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08371606114126431, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 240}, "mem_gb": 22.04}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09988837329157008, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 288}, "mem_gb": 21.95}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09842254393965316, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 271}, "mem_gb": 21.94}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1379458233404594, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 357}, "mem_gb": 21.89}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17790844371654868, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 354}, "mem_gb": 21.86}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1805020492810756, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 302}, "mem_gb": 22.1}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13745868044605788, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 297}, "mem_gb": 22.09}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05132270212679481, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 219}, "mem_gb": 22.11}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1766696895766693, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 306}, "mem_gb": 21.81}
115
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17392939229660356, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 343}, "mem_gb": 21.75}
117
+ wandb: updating run metadata
118
+ wandb: uploading wandb-summary.json
119
+ wandb:
120
+ wandb: Run history:
121
+ wandb: comp_len β–…β–ƒβ–…β–…β–†β–‚β–ƒβ–„β–ƒβ–ƒβ–‚β–‚β–ƒβ–β–…β–…β–‚β–ˆβ–‚β–β–„β–„β–†β–‚β–‚β–„β–ƒβ–β–‚β–β–„β–‡β–ƒβ–…β–‚β–β–…β–„β–…β–ˆ
122
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
123
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
124
+ wandb: finish_rate β–ˆβ–‡β–ˆβ–†β–…β–ˆβ–ˆβ–†β–‡β–…β–ˆβ–ˆβ–…β–‡β–„β–ˆβ–ƒβ–ˆβ–β–‡β–…β–ƒβ–ˆβ–ˆβ–ˆβ–‡β–ˆβ–ˆβ–‡β–ƒβ–‡β–ˆβ–†β–‡β–ˆβ–„β–‚β–†β–ˆβ–ˆ
125
+ wandb: forward_topk_kl β–ˆβ–‚β–‡β–…β–„β–†β–†β–ƒβ–†β–„β–ƒβ–…β–…β–„β–…β–‡β–ƒβ–ƒβ–β–…β–„β–ƒβ–‚β–β–…β–ƒβ–†β–„β–†β–„β–„β–…β–†β–„β–…β–‚β–ƒβ–ƒβ–…β–…
126
+ wandb: grad_norm β–ˆβ–†β–„β–‚β–‚β–‚β–‚β–‚β–β–β–‚β–‚β–β–‚β–β–β–‚β–β–β–β–‚β–‚β–β–‚β–β–‚β–β–β–β–β–‚β–‚β–‚β–‚β–β–β–β–‚β–‚β–‚
127
+ wandb: lr β–β–„β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
128
+ wandb: mem_gb β–ƒβ–„β–†β–†β–…β–†β–„β–‡β–†β–ƒβ–†β–„β–‡β–…β–†β–„β–ˆβ–‡β–„β–ˆβ–ˆβ–„β–„β–‚β–ƒβ–„β–†β–†β–‚β–…β–β–„β–ˆβ–‡β–…β–„β–ˆβ–ˆβ–ˆβ–‚
129
+ wandb: step β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
130
+ wandb: t_data_s β–ˆβ–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
131
+ wandb: +3 ...
132
+ wandb:
133
+ wandb: Run summary:
134
+ wandb: comp_len 349.9
135
+ wandb: cumulative_loss_tokens 10920000
136
+ wandb: epoch 0
137
+ wandb: finish_rate 0.997
138
+ wandb: forward_topk_kl 0.17393
139
+ wandb: grad_norm 0.51953
140
+ wandb: lr 3e-05
141
+ wandb: mem_gb 21.75
142
+ wandb: step 91
143
+ wandb: t_data_s 0
144
+ wandb: +4 ...
145
+ wandb:
146
+ wandb: πŸš€ View run reap_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/eyetgo3a
147
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
148
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
149
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260718_224025-eyetgo3a/logs
150
+ Traceback (most recent call last):
151
+ File "/home/henry/Documents/PythonProjects/variable-reap/scripts/11_distill_on_policy.py", line 1099, in <module>
152
+ main()
153
+ File "/home/henry/Documents/PythonProjects/variable-reap/scripts/11_distill_on_policy.py", line 905, in main
154
+ opt.step()
155
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/optim/lr_scheduler.py", line 166, in wrapper
156
+ return func.__get__(opt, opt.__class__)(*args, **kwargs)
157
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
158
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/optim/optimizer.py", line 535, in wrapper
159
+ out = func(*args, **kwargs)
160
+ ^^^^^^^^^^^^^^^^^^^^^
161
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/utils/_contextlib.py", line 124, in decorate_context
162
+ return func(*args, **kwargs)
163
+ ^^^^^^^^^^^^^^^^^^^^^
164
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/bitsandbytes/optim/optimizer.py", line 329, in step
165
+ sync_gpu(p)
166
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/bitsandbytes/utils.py", line 203, in sync_gpu
167
+ torch.cuda.synchronize()
168
+ File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/cuda/__init__.py", line 1181, in synchronize
169
+ return torch._C._cuda_synchronize()
170
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^
171
+ torch.AcceleratorError: CUDA error: an illegal memory access was encountered
172
+ Search for `cudaErrorIllegalAddress' in https://docs.nvidia.com/cuda/cuda-runtime-api/group__CUDART__TYPES.html for more information.
173
+ CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect.
174
+ For debugging consider passing CUDA_LAUNCH_BLOCKING=1
175
+ Compile with `TORCH_USE_CUDA_DSA` to enable device-side assertions.
176
+
177
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
178
+ warnings.warn('Grouped GEMM not available.')
179
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
180
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
181
+ wandb: setting up run 726qmwib
182
+ wandb: Tracking run with wandb version 0.28.0
183
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260719_075731-726qmwib
184
+ wandb: Run `wandb offline` to turn off syncing.
185
+ wandb: Syncing run reap_keep75_s1225
186
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
187
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/726qmwib
188
+
189
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
190
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32691152300952625, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.09375, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 331}, "mem_gb": 21.8}
191
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
192
+ [eval step 1] sample: 'To determine how many months it will take for Jamie to reach the savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned.\n\n1. **Initial Savings:**\n - Jamie s'
193
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3204413974587495, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 3.21875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 342}, "mem_gb": 21.72}
194
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3277132033892907, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.046875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 358}, "mem_gb": 21.76}
195
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2655149221446986, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.328125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 344}, "mem_gb": 21.84}
196
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16589509377960737, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.734375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 267}, "mem_gb": 22.16}
197
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07710085937269032, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.890625, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 248}, "mem_gb": 21.99}
198
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22985986243913262, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.3359375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 329}, "mem_gb": 21.98}
199
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23923230728444952, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.265625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 339}, "mem_gb": 21.94}
200
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24544233199153095, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 354}, "mem_gb": 21.94}
201
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14266173163352844, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 279}, "mem_gb": 22.07}
202
+ [eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the monthly savings and the interest earned from the investment account.\n\n1. **Initial S'
203
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17983991835253935, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 318}, "mem_gb": 22.0}
204
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1222650872319316, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 265}, "mem_gb": 22.09}
205
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10940296062845736, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 254}, "mem_gb": 22.03}
206
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1617978121754403, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 315}, "mem_gb": 22.06}
207
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23280616224833453, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 300}, "mem_gb": 21.86}
208
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14960211009665703, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 276}, "mem_gb": 22.06}
209
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23242386436782156, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 356}, "mem_gb": 22.0}
210
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19974000631744662, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 304}, "mem_gb": 21.81}
211
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20908848262146737, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 375}, "mem_gb": 21.73}
212
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11517996143201988, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 294}, "mem_gb": 22.09}
213
+ [eval step 20] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
214
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1984305429960601, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 299}, "mem_gb": 22.1}
215
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14950802131282787, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 305}, "mem_gb": 21.88}
216
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09098600198030472, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 262}, "mem_gb": 21.93}
217
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1277543721450027, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 303}, "mem_gb": 21.99}
218
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21198563021691516, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 380}, "mem_gb": 21.87}
219
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09757902880194597, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 282}, "mem_gb": 21.83}
220
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18501614496229837, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 362}, "mem_gb": 21.84}
221
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1858227088752979, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 307}, "mem_gb": 22.08}
222
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12581108036795632, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 282}, "mem_gb": 21.95}
223
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18155879081459717, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 337}, "mem_gb": 21.98}
224
+ [eval step 30] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
225
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11021925988085568, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 275}, "mem_gb": 22.04}
226
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18907624520876756, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 318}, "mem_gb": 21.85}
227
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23649629666583302, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 385}, "mem_gb": 21.87}
228
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23063863416416572, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 316}, "mem_gb": 21.83}
229
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09021445648100537, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 266}, "mem_gb": 22.12}
230
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1968003571683541, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 371}, "mem_gb": 21.85}
231
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10242197343863857, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 262}, "mem_gb": 22.06}
232
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21980781616549938, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 348}, "mem_gb": 21.88}
233
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0421492039794568, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 222}, "mem_gb": 22.12}
234
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17934104606625623, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 408}, "mem_gb": 21.68}
235
+ [eval step 40] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
236
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1745406913840212, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 334}, "mem_gb": 21.75}
237
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0887768059037781, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 312}, "mem_gb": 21.8}
238
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1765092570914266, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 352}, "mem_gb": 21.78}
239
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14278184356411608, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 371}, "mem_gb": 21.59}
240
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10633178555291767, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 284}, "mem_gb": 22.04}
241
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07849379130930174, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 287}, "mem_gb": 22.1}
242
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07412011598904307, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 285}, "mem_gb": 22.0}
243
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04752968616990838, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 252}, "mem_gb": 22.09}
244
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17119333899899697, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 360}, "mem_gb": 21.88}
245
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19618007138742444, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 359}, "mem_gb": 21.87}
246
+ [eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
247
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0050
248
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18106145054665393, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 363}, "mem_gb": 21.63}
249
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1466660416925326, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 361}, "mem_gb": 21.72}
250
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09496376970338946, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 286}, "mem_gb": 21.91}
251
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18861636217481767, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 367}, "mem_gb": 21.76}
252
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1929176153196953, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 352}, "mem_gb": 21.79}
253
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10857351156738587, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 314}, "mem_gb": 21.74}
254
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17179327207415676, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 372}, "mem_gb": 21.71}
255
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13828528916342184, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 334}, "mem_gb": 21.86}
256
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1934574418642558, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 368}, "mem_gb": 21.8}
257
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13872208223210958, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.2, "frames": {"chat": 354}, "mem_gb": 21.95}
258
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
259
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07282470223386772, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 293}, "mem_gb": 21.84}
260
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05511146459502634, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 231}, "mem_gb": 22.0}
261
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14260098348222672, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 302}, "mem_gb": 21.97}
262
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09689047932531684, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 263}, "mem_gb": 22.11}
263
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09878590247315976, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 252}, "mem_gb": 22.04}
264
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14381015191225646, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 344}, "mem_gb": 22.07}
265
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12872717676356746, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 313}, "mem_gb": 22.0}
266
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16005633975585612, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 358}, "mem_gb": 21.7}
267
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0729602546342571, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.36328125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 267}, "mem_gb": 21.92}
268
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15748900420886153, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 300}, "mem_gb": 21.79}
269
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
270
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1200829417138826, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 348}, "mem_gb": 21.73}
271
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16852690591571542, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 329}, "mem_gb": 21.81}
272
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10322219723120021, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 269}, "mem_gb": 21.98}
273
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.176379284829041, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 358}, "mem_gb": 21.65}
274
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10208238901442382, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 302}, "mem_gb": 21.9}
275
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18105531681833478, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 381}, "mem_gb": 21.92}
276
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19246259786584413, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.4, "frames": {"chat": 379}, "mem_gb": 21.87}
277
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17693757277773695, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 351}, "mem_gb": 21.69}
278
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1459769781083179, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 330}, "mem_gb": 21.89}
279
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15510034691765903, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 316}, "mem_gb": 21.92}
280
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
281
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10449264020716462, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 276}, "mem_gb": 22.1}
282
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08365943221724592, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 240}, "mem_gb": 22.04}
283
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09963281719138226, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 288}, "mem_gb": 21.95}
284
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09849991907519288, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 271}, "mem_gb": 21.94}
285
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1379186164772138, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 357}, "mem_gb": 21.89}
286
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17796021613105356, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 354}, "mem_gb": 21.86}
287
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18031149352506423, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 302}, "mem_gb": 22.1}
288
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1371509729277032, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 297}, "mem_gb": 22.09}
289
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05048233754617783, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 432.7, "frames": {"chat": 219}, "mem_gb": 22.11}
290
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17669401001554602, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 452.0, "frames": {"chat": 306}, "mem_gb": 21.81}
291
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
292
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1738818720478875, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 343}, "mem_gb": 21.75}
293
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16398584036001315, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 341}, "mem_gb": 21.86}
294
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09698023379047711, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 318}, "mem_gb": 21.81}
295
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16411329029093807, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 346}, "mem_gb": 21.7}
296
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09234091526917958, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 277}, "mem_gb": 22.18}
297
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08427056088553121, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 270}, "mem_gb": 21.91}
298
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11769790423917584, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 257}, "mem_gb": 22.09}
299
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1652106897005656, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 363}, "mem_gb": 21.7}
300
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16613955449733572, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 356}, "mem_gb": 21.83}
301
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1572983751707788, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 323}, "mem_gb": 21.87}
302
+ [eval step 100] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
303
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0100
304
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07396288264322405, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 243}, "mem_gb": 22.12}
305
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15377106406676272, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 307}, "mem_gb": 21.8}
306
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15408880591623794, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 346}, "mem_gb": 22.03}
307
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10063538956348785, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 273}, "mem_gb": 22.04}
308
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09539629515723791, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 302}, "mem_gb": 21.97}
309
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15479961506209025, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 337}, "mem_gb": 22.1}
310
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11479741301567604, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 280}, "mem_gb": 21.97}
311
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1800875462678106, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 331}, "mem_gb": 21.87}
312
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1100006240118683, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 314}, "mem_gb": 21.98}
313
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17935109357194354, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 294}, "mem_gb": 21.91}
314
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
315
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08094486156906157, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 274}, "mem_gb": 22.04}
316
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14713477355417173, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 365}, "mem_gb": 21.76}
317
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09244580864451515, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 323}, "mem_gb": 21.82}
318
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06983842617548071, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 234}, "mem_gb": 22.1}
319
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09373808058573244, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 267}, "mem_gb": 22.11}
320
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10429944481253624, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 304}, "mem_gb": 21.87}
321
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16862349049216135, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.0, "frames": {"chat": 373}, "mem_gb": 21.8}
322
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10003006101381033, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 300}, "mem_gb": 22.08}
323
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17443383389748632, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.8, "frames": {"chat": 331}, "mem_gb": 21.92}
324
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0799219426064752, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 259}, "mem_gb": 22.06}
325
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
326
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1439664171350499, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 358}, "mem_gb": 21.67}
327
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18628301387413715, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 354}, "mem_gb": 21.93}
328
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08841487010531128, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 279}, "mem_gb": 22.0}
329
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17705591263951112, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 354}, "mem_gb": 21.75}
330
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16324466195267937, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 334}, "mem_gb": 21.95}
331
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16651589091358085, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 327}, "mem_gb": 21.82}
332
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15119830299920092, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 365}, "mem_gb": 21.92}
333
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08960195419403413, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 252}, "mem_gb": 22.12}
334
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07137346615381539, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 256}, "mem_gb": 22.09}
335
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10397039002155264, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 302}, "mem_gb": 21.86}
336
+ [eval step 130] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
337
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1565368466370739, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 350}, "mem_gb": 21.77}
338
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08637186304094115, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 292}, "mem_gb": 21.89}
339
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16638688029507176, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 356}, "mem_gb": 21.7}
340
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10226424861007835, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 347}, "mem_gb": 21.86}
341
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10496823356381307, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 330}, "mem_gb": 22.06}
342
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15377609162183167, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.6, "frames": {"chat": 363}, "mem_gb": 21.92}
343
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14029487463639428, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 354}, "mem_gb": 21.78}
344
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07951566191191474, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 270}, "mem_gb": 22.04}
345
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15175273126789057, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 343}, "mem_gb": 21.82}
346
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03845967609772148, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.296875, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 232}, "mem_gb": 22.01}
347
+ [eval step 140] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
348
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14632255258143415, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 346}, "mem_gb": 21.96}
349
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11298904120076138, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 306}, "mem_gb": 22.04}
350
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06970870715503891, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 273}, "mem_gb": 22.09}
351
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08088071228267314, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.36328125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 266}, "mem_gb": 21.91}
352
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12068498143667045, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 299}, "mem_gb": 22.11}
353
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07787700651586056, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 259}, "mem_gb": 22.19}
354
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09737688761447401, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 325}, "mem_gb": 21.93}
355
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09278960750096787, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 271}, "mem_gb": 22.0}
356
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.148417767790736, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 359}, "mem_gb": 21.79}
357
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13472050697378193, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 345}, "mem_gb": 21.85}
358
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
359
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0150
360
+ wandb: updating run metadata
361
+ wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
362
+ wandb:
363
+ wandb: Run history:
364
+ wandb: comp_len β–‚β–‚β–‚β–‚β–ƒβ–†β–„β–…β–„β–„β–‚β–ƒβ–…β–ˆβ–‚β–‚β–β–„β–†β–…β–β–‚β–„β–„β–‚β–†β–β–‡β–…β–„β–ƒβ–…β–ƒβ–„β–‚β–‚β–‚β–β–‚β–‡
365
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆ
366
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
367
+ wandb: finish_rate β–ˆβ–ˆβ–ƒβ–„β–…β–†β–†β–…β–‡β–ˆβ–β–„β–ˆβ–†β–ˆβ–‡β–‡β–†β–‡β–†β–ˆβ–ˆβ–†β–β–ˆβ–ˆβ–†β–…β–ˆβ–‡β–„β–„β–ˆβ–†β–ˆβ–‡β–‡β–ˆβ–†β–…
368
+ wandb: forward_topk_kl β–ˆβ–‡β–„β–…β–‡β–ƒβ–ƒβ–…β–‡β–‚β–†β–…β–‚β–…β–ƒβ–…β–…β–†β–„β–β–ƒβ–…β–…β–ƒβ–‚β–ƒβ–ƒβ–‚β–…β–‚β–…β–‚β–…β–„β–ƒβ–ƒβ–‚β–„β–β–‚
369
+ wandb: grad_norm β–‡β–…β–‡β–ˆβ–…β–ƒβ–†β–β–ƒβ–…β–†β–„β–‡β–ƒβ–„β–„β–ƒβ–‡β–†β–…β–…β–„β–β–‚β–‚β–„β–„β–β–‚β–†β–†β–†β–„β–…β–…β–β–…β–‚β–β–ƒ
370
+ wandb: lr β–β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
371
+ wandb: mem_gb β–…β–…β–‡β–†β–‡β–…β–„β–‡β–†β–„β–ƒβ–†β–‡β–„β–‚β–‚β–‚β–…β–…β–„β–ƒβ–„β–‡β–‡β–β–ƒβ–ƒβ–†β–…β–‡β–„β–‡β–„β–β–…β–ƒβ–†β–‡β–ˆβ–ƒ
372
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
373
+ wandb: t_data_s β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
374
+ wandb: +3 ...
375
+ wandb:
376
+ wandb: Run summary:
377
+ wandb: comp_len 347.8
378
+ wandb: cumulative_loss_tokens 18000000
379
+ wandb: epoch 0
380
+ wandb: finish_rate 0.997
381
+ wandb: forward_topk_kl 0.13472
382
+ wandb: grad_norm 0.44531
383
+ wandb: lr 3e-05
384
+ wandb: mem_gb 21.85
385
+ wandb: step 150
386
+ wandb: t_data_s 0
387
+ wandb: +4 ...
388
+ wandb:
389
+ wandb: πŸš€ View run reap_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/726qmwib
390
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
391
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
392
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260719_075731-726qmwib/logs
healed/grid_general/reap_keep75_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/reap_keep75_s1226.console.log ADDED
@@ -0,0 +1,215 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1226/wandb/run-20260718_222421-e1pary2f
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run reap_keep75_s1226
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/e1pary2f
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21339355171055843, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 2.484375, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 308}, "mem_gb": 21.9}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'to solve the problem, we start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term after the first is the sum of the previous term and a constant difference'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08570967371991525, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.828125, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 211}, "mem_gb": 22.09}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15798813338739176, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.859375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 281}, "mem_gb": 22.09}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28115320148520795, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.328125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 367}, "mem_gb": 21.64}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2748614232963572, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 2.125, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 312}, "mem_gb": 21.8}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20843626715947564, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.5859375, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 271}, "mem_gb": 22.11}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13717436392015467, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.046875, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 269}, "mem_gb": 22.08}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23247054230508704, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.1640625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 352}, "mem_gb": 21.6}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09589892327293444, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 243}, "mem_gb": 22.09}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16148524984003354, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 293}, "mem_gb": 22.01}
25
+ [eval step 10] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as 'd' to the previous "
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09165873881246274, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 242}, "mem_gb": 22.09}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23489283894393592, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 353}, "mem_gb": 21.78}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24218674629465678, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 338}, "mem_gb": 21.79}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10968186240528399, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 259}, "mem_gb": 22.09}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20747447708491237, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.2, "frames": {"chat": 385}, "mem_gb": 21.64}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19886801433678095, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 355}, "mem_gb": 21.8}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16934168874891475, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 328}, "mem_gb": 21.71}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18825231397490327, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 355}, "mem_gb": 21.86}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23047101900981118, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 367}, "mem_gb": 21.73}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1967306533376376, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 343}, "mem_gb": 21.77}
36
+ [eval step 20] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07757113480734018, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 244}, "mem_gb": 22.09}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12775906186740224, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 339}, "mem_gb": 21.93}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12339796086361943, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 298}, "mem_gb": 22.08}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1888264758167478, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 398}, "mem_gb": 21.95}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16893158456018814, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 362}, "mem_gb": 22.06}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11852987345949126, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 313}, "mem_gb": 21.93}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19280489345251892, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 324}, "mem_gb": 21.84}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13332238358338364, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 314}, "mem_gb": 21.9}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17708334889138738, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 345}, "mem_gb": 21.82}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10290615278265129, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 262}, "mem_gb": 22.0}
47
+ [eval step 30] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2178021610117207, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.6, "frames": {"chat": 373}, "mem_gb": 21.79}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17037619132616869, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 334}, "mem_gb": 21.79}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12282716621927296, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 327}, "mem_gb": 21.94}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03687003609900518, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 238}, "mem_gb": 22.11}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15524751814192472, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 310}, "mem_gb": 21.84}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18105133875377166, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 347}, "mem_gb": 21.84}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1646992900542294, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 304}, "mem_gb": 21.77}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.159970140185114, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 343}, "mem_gb": 21.79}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18663683338764434, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 314}, "mem_gb": 21.78}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16988412837162614, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 300}, "mem_gb": 21.88}
58
+ [eval step 40] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13071964375670067, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 318}, "mem_gb": 21.93}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10204326672830308, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 279}, "mem_gb": 21.96}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1806036195647282, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 364}, "mem_gb": 22.03}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12377153321631873, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 256}, "mem_gb": 22.09}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22053155760841134, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 340}, "mem_gb": 21.8}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09844875509299648, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 283}, "mem_gb": 22.02}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17452649503555148, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 349}, "mem_gb": 21.81}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09820603294240621, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 297}, "mem_gb": 21.88}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2192861270866512, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 359}, "mem_gb": 21.85}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1297758882647846, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 342}, "mem_gb": 21.9}
69
+ [eval step 50] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term of an arithmetic sequence is given "
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08983801361528847, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 269}, "mem_gb": 22.06}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13292347453905579, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 324}, "mem_gb": 22.05}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1078397901494056, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 281}, "mem_gb": 22.04}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12415957074062899, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 287}, "mem_gb": 22.09}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14848729074448347, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 296}, "mem_gb": 22.1}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09668254272442621, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 267}, "mem_gb": 22.15}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10191790316258557, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 249}, "mem_gb": 22.05}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20133889614247408, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 363}, "mem_gb": 21.75}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11543285792957371, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 299}, "mem_gb": 21.88}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17723260801960714, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 331}, "mem_gb": 21.76}
81
+ [eval step 60] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term \\"
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09029280027657126, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 280}, "mem_gb": 21.97}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1855729695724634, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 350}, "mem_gb": 21.96}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17494222469696155, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 321}, "mem_gb": 21.72}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08138270763379987, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 281}, "mem_gb": 22.02}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19231459852407376, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 331}, "mem_gb": 21.7}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14845991262866495, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 318}, "mem_gb": 22.07}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11320564163395513, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 309}, "mem_gb": 22.09}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12363248293256619, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 304}, "mem_gb": 21.98}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07999568365996237, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 279}, "mem_gb": 22.0}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.035355653623794205, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 248}, "mem_gb": 22.0}
92
+ [eval step 70] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13093761252564534, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 268}, "mem_gb": 21.97}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13084131622950082, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 299}, "mem_gb": 22.07}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15114655604578245, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 322}, "mem_gb": 21.93}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07716252460344694, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 248}, "mem_gb": 22.11}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13525091139217063, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 326}, "mem_gb": 22.0}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12427869928680982, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 314}, "mem_gb": 21.76}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03455742899927621, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.34765625, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 232}, "mem_gb": 22.1}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1846243053221299, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 330}, "mem_gb": 21.83}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09233185301547249, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 292}, "mem_gb": 21.98}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14634254051093787, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 312}, "mem_gb": 22.0}
103
+ [eval step 80] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2008646516823365, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 382}, "mem_gb": 21.81}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2060785713472093, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 360}, "mem_gb": 21.68}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028743446196095708, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.27734375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 222}, "mem_gb": 21.94}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1851775901362921, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 342}, "mem_gb": 21.99}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17315657157028716, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 337}, "mem_gb": 21.79}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10658308911252146, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 304}, "mem_gb": 22.04}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11648266767509437, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 326}, "mem_gb": 21.94}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15414538710528675, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 310}, "mem_gb": 22.0}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1451933480039394, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 328}, "mem_gb": 21.82}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1895755969556359, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 347}, "mem_gb": 21.65}
114
+ [eval step 90] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15673857571422123, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 330}, "mem_gb": 21.94}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03880907623837702, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.3203125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 209}, "mem_gb": 22.14}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17243695646196913, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.2, "frames": {"chat": 399}, "mem_gb": 21.72}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15324395594488208, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 351}, "mem_gb": 21.8}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10666468353889262, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 322}, "mem_gb": 21.8}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1611110176460507, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 333}, "mem_gb": 21.69}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1268739534505798, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 330}, "mem_gb": 21.97}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02843061860909996, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.26953125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 238}, "mem_gb": 22.01}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0764691783014064, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 297}, "mem_gb": 21.92}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15686011528218322, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 345}, "mem_gb": 21.88}
125
+ [eval step 100] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11419236063311497, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 304}, "mem_gb": 22.03}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14519470161789408, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 326}, "mem_gb": 22.03}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16841031535008613, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 347}, "mem_gb": 21.96}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1541788148588113, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 325}, "mem_gb": 21.84}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09568467679819248, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 299}, "mem_gb": 22.03}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1954670337013318, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 345}, "mem_gb": 21.8}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15920826774354402, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 344}, "mem_gb": 21.7}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11787689346734745, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 344}, "mem_gb": 21.96}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11341061721870986, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 288}, "mem_gb": 22.03}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10040821242108165, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 303}, "mem_gb": 21.73}
137
+ [eval step 110] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07638031504630732, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 284}, "mem_gb": 21.92}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18989112039782727, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.6, "frames": {"chat": 369}, "mem_gb": 21.81}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08842680087072465, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 269}, "mem_gb": 22.07}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16966252027726733, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 341}, "mem_gb": 21.83}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16082782854254668, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.9, "frames": {"chat": 384}, "mem_gb": 21.6}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14551100756071197, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 358}, "mem_gb": 21.76}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16481925481576473, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 342}, "mem_gb": 21.94}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18291292693126016, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 365}, "mem_gb": 21.76}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15789786164620892, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 337}, "mem_gb": 21.99}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1396825625940226, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 333}, "mem_gb": 22.09}
148
+ [eval step 120] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09663339759473068, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 293}, "mem_gb": 22.13}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08743804314477215, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 291}, "mem_gb": 21.89}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1487297839136018, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 341}, "mem_gb": 21.92}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09316545087745569, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 300}, "mem_gb": 21.86}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08440170214573542, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 270}, "mem_gb": 22.08}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06541701220278628, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 259}, "mem_gb": 22.1}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15731950736865402, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 355}, "mem_gb": 21.67}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.185189329845272, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.5, "frames": {"chat": 388}, "mem_gb": 22.03}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15172325409349674, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 318}, "mem_gb": 21.75}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1692313569753586, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.1, "frames": {"chat": 383}, "mem_gb": 21.88}
159
+ [eval step 130] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09437454479509809, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 300}, "mem_gb": 21.89}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08504273481372122, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 295}, "mem_gb": 21.98}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08973973676030679, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 306}, "mem_gb": 21.72}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13043954259552992, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 303}, "mem_gb": 21.97}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06347171953148209, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.345703125, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 272}, "mem_gb": 22.04}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09128343445532955, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 248}, "mem_gb": 22.04}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10043286757688039, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 282}, "mem_gb": 22.03}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15493765193327952, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.8, "frames": {"chat": 362}, "mem_gb": 21.59}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16514440122226565, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.6, "frames": {"chat": 374}, "mem_gb": 21.95}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08445933128128139, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 280}, "mem_gb": 22.12}
170
+ [eval step 140] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06675967077338137, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 276}, "mem_gb": 21.97}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0885775870092834, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 246}, "mem_gb": 22.11}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18335347756737222, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 360}, "mem_gb": 21.64}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17761860483808753, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.4, "frames": {"chat": 365}, "mem_gb": 21.82}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1455773277927966, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 338}, "mem_gb": 21.9}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06648420962695964, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 276}, "mem_gb": 22.01}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.036196198924879235, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 209}, "mem_gb": 22.09}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14141823298179854, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 379}, "mem_gb": 21.69}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13381415352725112, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 307}, "mem_gb": 22.03}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08819010019679553, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 293}, "mem_gb": 22.07}
181
+ [eval step 150] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading summary
185
+ wandb:
186
+ wandb: Run history:
187
+ wandb: comp_len β–ƒβ–…β–‚β–„β–‚β–‚β–‚β–†β–„β–β–‚β–„β–ƒβ–‚β–„β–…β–‚β–„β–„β–ƒβ–…β–ƒβ–β–‡β–‚β–ˆβ–‚β–ƒβ–‚β–„β–…β–β–‚β–‚β–„β–„β–ƒβ–‚β–„β–ˆ
188
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
189
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
190
+ wandb: finish_rate β–…β–ˆβ–„β–β–†β–‚β–ˆβ–ˆβ–ˆβ–ˆβ–…β–‡β–„β–ˆβ–‡β–†β–„β–ˆβ–†β–ˆβ–ƒβ–‚β–ƒβ–‡β–ˆβ–ˆβ–ˆβ–β–‡β–…β–‡β–‡β–ˆβ–ˆβ–ˆβ–„β–‡β–ˆβ–‚β–‚
191
+ wandb: forward_topk_kl β–†β–ƒβ–ˆβ–†β–…β–„β–„β–…β–„β–…β–ƒβ–ƒβ–…β–ƒβ–ƒβ–ƒβ–†β–…β–‚β–ƒβ–„β–„β–†β–β–ƒβ–β–‚β–ƒβ–†β–…β–†β–…β–ƒβ–ƒβ–„β–…β–…β–„β–‚β–ƒ
192
+ wandb: grad_norm β–ˆβ–ƒβ–‚β–ƒβ–ƒβ–ƒβ–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–‚β–β–‚β–‚β–‚β–β–β–‚β–‚β–‚β–β–β–‚β–‚β–β–‚β–β–‚β–‚β–β–β–‚β–β–‚β–‚β–
193
+ wandb: lr β–β–…β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: mem_gb β–ˆβ–ˆβ–‡β–„β–…β–†β–„β–„β–ˆβ–„β–„β–†β–‡β–ˆβ–‡β–‡β–‚β–‡β–†β–‡β–ƒβ–ˆβ–†β–ƒβ–„β–‡β–…β–‡β–„β–‚β–…β–„β–β–…β–…β–…β–β–„β–‡β–‡
195
+ wandb: step β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
196
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
197
+ wandb: +3 ...
198
+ wandb:
199
+ wandb: Run summary:
200
+ wandb: comp_len 409.6
201
+ wandb: cumulative_loss_tokens 18000000
202
+ wandb: epoch 0
203
+ wandb: finish_rate 0.942
204
+ wandb: forward_topk_kl 0.08819
205
+ wandb: grad_norm 0.41016
206
+ wandb: lr 3e-05
207
+ wandb: mem_gb 22.07
208
+ wandb: step 150
209
+ wandb: t_data_s 0
210
+ wandb: +4 ...
211
+ wandb:
212
+ wandb: πŸš€ View run reap_keep75_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/e1pary2f
213
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
214
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
215
+ wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1226/wandb/run-20260718_222421-e1pary2f/logs
healed/grid_general/reap_keep75_s1226.eval.log ADDED
@@ -0,0 +1,71 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
0
  0%| | 0/1319 [00:00<?, ?it/s]
1
  14%|β–ˆβ– | 190/1319 [00:00<00:00, 1898.35it/s]
2
  29%|β–ˆβ–ˆβ–‰ | 385/1319 [00:00<00:00, 1927.09it/s]
3
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 580/1319 [00:00<00:00, 1936.55it/s]
4
  59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 776/1319 [00:00<00:00, 1942.22it/s]
5
  74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 972/1319 [00:00<00:00, 1948.34it/s]
6
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 1168/1319 [00:00<00:00, 1949.98it/s]
 
 
7
  0%| | 0/500 [00:00<?, ?it/s]
8
  8%|β–Š | 42/500 [00:00<00:01, 410.77it/s]
9
  17%|β–ˆβ–‹ | 84/500 [00:00<00:01, 415.71it/s]
10
  25%|β–ˆβ–ˆβ–Œ | 127/500 [00:00<00:00, 418.02it/s]
11
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:00<00:00, 419.88it/s]
12
  43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 213/500 [00:00<00:00, 421.19it/s]
13
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 256/500 [00:00<00:00, 422.45it/s]
14
  60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 299/500 [00:00<00:00, 423.30it/s]
15
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 342/500 [00:00<00:00, 424.03it/s]
16
  77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 385/500 [00:00<00:00, 425.22it/s]
17
  86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 428/500 [00:01<00:00, 425.80it/s]
18
  94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 471/500 [00:01<00:00, 426.57it/s]
 
 
19
  0%| | 0/541 [00:00<?, ?it/s]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
20
  0%| | 0/164 [00:00<?, ?it/s]
21
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 146/164 [00:00<00:00, 1459.75it/s]
 
 
22
  0%| | 0/500 [00:00<?, ?it/s]
23
  3%|β–Ž | 17/500 [00:00<00:02, 161.95it/s]
24
  7%|β–‹ | 34/500 [00:00<00:02, 163.46it/s]
25
  10%|β–ˆ | 51/500 [00:00<00:02, 164.02it/s]
26
  14%|β–ˆβ–Ž | 68/500 [00:00<00:02, 164.36it/s]
27
  17%|β–ˆβ–‹ | 85/500 [00:00<00:02, 164.64it/s]
28
  20%|β–ˆβ–ˆ | 102/500 [00:00<00:02, 164.98it/s]
29
  24%|β–ˆβ–ˆβ– | 119/500 [00:00<00:02, 165.17it/s]
30
  27%|β–ˆβ–ˆβ–‹ | 136/500 [00:00<00:02, 164.40it/s]
31
  31%|β–ˆβ–ˆβ–ˆ | 153/500 [00:00<00:02, 164.81it/s]
32
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:01<00:01, 165.18it/s]
33
  37%|β–ˆβ–ˆβ–ˆβ–‹ | 187/500 [00:01<00:01, 165.53it/s]
34
  41%|β–ˆβ–ˆβ–ˆβ–ˆ | 204/500 [00:01<00:01, 165.67it/s]
35
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 221/500 [00:01<00:01, 165.77it/s]
36
  48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 238/500 [00:01<00:01, 165.84it/s]
37
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 255/500 [00:01<00:01, 165.90it/s]
38
  54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 272/500 [00:01<00:01, 166.13it/s]
39
  58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 289/500 [00:01<00:01, 166.25it/s]
40
  61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 306/500 [00:01<00:01, 166.20it/s]
41
  65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 323/500 [00:01<00:01, 166.33it/s]
42
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 340/500 [00:02<00:00, 166.42it/s]
43
  71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 357/500 [00:02<00:00, 166.47it/s]
44
  75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 374/500 [00:02<00:00, 166.52it/s]
45
  78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 391/500 [00:02<00:00, 166.41it/s]
46
  82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 408/500 [00:02<00:00, 166.43it/s]
47
  85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 425/500 [00:02<00:00, 166.38it/s]
48
  88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 442/500 [00:02<00:00, 166.50it/s]
49
  92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 459/500 [00:02<00:00, 166.52it/s]
50
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 476/500 [00:02<00:00, 166.41it/s]
51
  99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆοΏ½οΏ½| 493/500 [00:02<00:00, 166.52it/s]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-07-19T01:12:55-07:00 serving outputs/healed/grid_general/reap_keep75_s1226/step0150 on GPU 1 port 8421
2
+ 2026-07-19T01:12:55-07:00 waiting for server /health ...
3
+ 2026-07-19T01:13:25-07:00 server up; chat pass [gsm8k_cot_zeroshot,minerva_math500,ifeval]
4
+ 2026-07-19:01:13:33 INFO [_cli.run:388] Selected Tasks: ['gsm8k_cot_zeroshot', 'minerva_math500', 'ifeval']
5
+ 2026-07-19:01:13:34 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
6
+ 2026-07-19:01:13:34 WARNING [evaluator:226] generation_kwargs: {'max_gen_toks': 1280} specified through cli, these settings will update set parameters in yaml tasks. Ensure 'do_sample=True' for non-greedy decoding!
7
+ 2026-07-19:01:13:34 INFO [evaluator:239] Initializing local-chat-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
8
+ 2026-07-19:01:13:34 INFO [models.api_models:179] Using max length 2048 - 1
9
+ 2026-07-19:01:13:34 INFO [models.api_models:200] Using tokenizer None
10
+ 2026-07-19:01:13:39 INFO [evaluator_utils:446] Selected tasks:
11
+ 2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: gsm8k_cot_zeroshot (gsm8k/gsm8k-cot-zeroshot.yaml)
12
+ 2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: ifeval (ifeval/ifeval.yaml)
13
+ 2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: minerva_math500 (minerva_math/minerva_math500.yaml)
14
+ 2026-07-19:01:13:39 INFO [evaluator:314] gsm8k_cot_zeroshot: Using gen_kwargs: {'until': ['Q:', '</s>', '<|im_end|>'], 'do_sample': False, 'max_gen_toks': 1280}
15
+ 2026-07-19:01:13:39 INFO [evaluator:314] minerva_math500: Using gen_kwargs: {'until': ['Problem:'], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
16
+ 2026-07-19:01:13:39 INFO [evaluator:314] ifeval: Using gen_kwargs: {'until': [], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
17
+ 2026-07-19:01:13:39 INFO [api.task:312] Building contexts for gsm8k_cot_zeroshot on rank 0...
18
+
19
  0%| | 0/1319 [00:00<?, ?it/s]
20
  14%|β–ˆβ– | 190/1319 [00:00<00:00, 1898.35it/s]
21
  29%|β–ˆβ–ˆβ–‰ | 385/1319 [00:00<00:00, 1927.09it/s]
22
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 580/1319 [00:00<00:00, 1936.55it/s]
23
  59%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 776/1319 [00:00<00:00, 1942.22it/s]
24
  74%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 972/1319 [00:00<00:00, 1948.34it/s]
25
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 1168/1319 [00:00<00:00, 1949.98it/s]
26
+ 2026-07-19:01:13:40 INFO [api.task:312] Building contexts for minerva_math500 on rank 0...
27
+
28
  0%| | 0/500 [00:00<?, ?it/s]
29
  8%|β–Š | 42/500 [00:00<00:01, 410.77it/s]
30
  17%|β–ˆβ–‹ | 84/500 [00:00<00:01, 415.71it/s]
31
  25%|β–ˆβ–ˆβ–Œ | 127/500 [00:00<00:00, 418.02it/s]
32
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:00<00:00, 419.88it/s]
33
  43%|β–ˆβ–ˆβ–ˆβ–ˆβ–Ž | 213/500 [00:00<00:00, 421.19it/s]
34
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 256/500 [00:00<00:00, 422.45it/s]
35
  60%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 299/500 [00:00<00:00, 423.30it/s]
36
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 342/500 [00:00<00:00, 424.03it/s]
37
  77%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‹ | 385/500 [00:00<00:00, 425.22it/s]
38
  86%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 428/500 [00:01<00:00, 425.80it/s]
39
  94%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 471/500 [00:01<00:00, 426.57it/s]
40
+ 2026-07-19:01:13:41 INFO [api.task:312] Building contexts for ifeval on rank 0...
41
+
42
  0%| | 0/541 [00:00<?, ?it/s]
43
+ 2026-07-19:01:13:41 INFO [evaluator:585] Running generate_until requests
44
+ 2026-07-19:01:13:41 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
45
+
46
+
47
+
48
+ 2026-07-19:01:19:00 ERROR [tasks.ifeval.instructions:189] Unable to detect language for text ****** due to No features in text.
49
+ 2026-07-19:01:19:02 INFO [loggers.evaluation_tracker:247] Saving results aggregated
50
+ 2026-07-19:01:19:02 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep75_s1226/student/*.jsonl
51
+ local-chat-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({'max_gen_toks': 1280}), limit: None, num_fewshot: None, batch_size: 1
52
+ | Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
53
+ |------------------|------:|----------------|-----:|-----------------------|---|-----:|---|------|
54
+ |gsm8k_cot_zeroshot| 3|flexible-extract| 0|exact_match |↑ |0.6687|Β± |0.0130|
55
+ | | |strict-match | 0|exact_match |↑ |0.0417|Β± |0.0055|
56
+ |ifeval | 4|none | 0|inst_level_loose_acc |↑ |0.7374|Β± | N/A|
57
+ | | |none | 0|inst_level_strict_acc |↑ |0.7110|Β± | N/A|
58
+ | | |none | 0|prompt_level_loose_acc |↑ |0.6322|Β± |0.0208|
59
+ | | |none | 0|prompt_level_strict_acc|↑ |0.6063|Β± |0.0210|
60
+ |minerva_math500 | 3|none | 4|exact_match |↑ |0.1380|Β± |0.0154|
61
+ | | |none | 4|math_verify |↑ |0.2180|Β± |0.0185|
62
+
63
+ 2026-07-19T01:19:04-07:00 code pass [humaneval,mbpp] via /v1/completions (function-continuation)
64
+ 2026-07-19:01:19:11 INFO [_cli.run:388] Selected Tasks: ['humaneval', 'mbpp']
65
+ 2026-07-19:01:19:12 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
66
+ 2026-07-19:01:19:12 INFO [evaluator:239] Initializing local-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep75_s1226/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
67
+ 2026-07-19:01:19:12 INFO [models.openai_completions:42] Remote tokenizer not supported. Using huggingface tokenizer backend.
68
+ 2026-07-19:01:19:12 INFO [models.api_models:179] Using max length 2048 - 1
69
+ 2026-07-19:01:19:12 INFO [models.api_models:200] Using tokenizer huggingface
70
+ 2026-07-19:01:19:18 INFO [evaluator_utils:446] Selected tasks:
71
+ 2026-07-19:01:19:18 INFO [evaluator_utils:480] Task: humaneval (humaneval/humaneval.yaml)
72
+ 2026-07-19:01:19:18 INFO [evaluator_utils:480] Task: mbpp (mbpp/mbpp.yaml)
73
+ 2026-07-19:01:19:18 INFO [evaluator:314] humaneval: Using gen_kwargs: {'until': ['\nclass', '\ndef', '\n#', '\nif', '\nprint'], 'max_gen_toks': 1024, 'do_sample': False}
74
+ 2026-07-19:01:19:18 INFO [evaluator:314] mbpp: Using gen_kwargs: {'until': ['[DONE]'], 'do_sample': False}
75
+ 2026-07-19:01:19:18 INFO [api.task:312] Building contexts for humaneval on rank 0...
76
+
77
  0%| | 0/164 [00:00<?, ?it/s]
78
  89%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–‰ | 146/164 [00:00<00:00, 1459.75it/s]
79
+ 2026-07-19:01:19:19 INFO [api.task:312] Building contexts for mbpp on rank 0...
80
+
81
  0%| | 0/500 [00:00<?, ?it/s]
82
  3%|β–Ž | 17/500 [00:00<00:02, 161.95it/s]
83
  7%|β–‹ | 34/500 [00:00<00:02, 163.46it/s]
84
  10%|β–ˆ | 51/500 [00:00<00:02, 164.02it/s]
85
  14%|β–ˆβ–Ž | 68/500 [00:00<00:02, 164.36it/s]
86
  17%|β–ˆβ–‹ | 85/500 [00:00<00:02, 164.64it/s]
87
  20%|β–ˆβ–ˆ | 102/500 [00:00<00:02, 164.98it/s]
88
  24%|β–ˆβ–ˆβ– | 119/500 [00:00<00:02, 165.17it/s]
89
  27%|β–ˆβ–ˆβ–‹ | 136/500 [00:00<00:02, 164.40it/s]
90
  31%|β–ˆβ–ˆβ–ˆ | 153/500 [00:00<00:02, 164.81it/s]
91
  34%|β–ˆβ–ˆβ–ˆβ– | 170/500 [00:01<00:01, 165.18it/s]
92
  37%|β–ˆβ–ˆβ–ˆβ–‹ | 187/500 [00:01<00:01, 165.53it/s]
93
  41%|β–ˆβ–ˆβ–ˆβ–ˆ | 204/500 [00:01<00:01, 165.67it/s]
94
  44%|β–ˆβ–ˆβ–ˆβ–ˆβ– | 221/500 [00:01<00:01, 165.77it/s]
95
  48%|β–ˆβ–ˆβ–ˆβ–ˆβ–Š | 238/500 [00:01<00:01, 165.84it/s]
96
  51%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 255/500 [00:01<00:01, 165.90it/s]
97
  54%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 272/500 [00:01<00:01, 166.13it/s]
98
  58%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 289/500 [00:01<00:01, 166.25it/s]
99
  61%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ | 306/500 [00:01<00:01, 166.20it/s]
100
  65%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 323/500 [00:01<00:01, 166.33it/s]
101
  68%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 340/500 [00:02<00:00, 166.42it/s]
102
  71%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 357/500 [00:02<00:00, 166.47it/s]
103
  75%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 374/500 [00:02<00:00, 166.52it/s]
104
  78%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 391/500 [00:02<00:00, 166.41it/s]
105
  82%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ– | 408/500 [00:02<00:00, 166.43it/s]
106
  85%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ | 425/500 [00:02<00:00, 166.38it/s]
107
  88%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Š | 442/500 [00:02<00:00, 166.50it/s]
108
  92%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–| 459/500 [00:02<00:00, 166.52it/s]
109
  95%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–Œ| 476/500 [00:02<00:00, 166.41it/s]
110
  99%|β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆοΏ½οΏ½| 493/500 [00:02<00:00, 166.52it/s]
111
+ 2026-07-19:01:19:22 INFO [evaluator:585] Running generate_until requests
112
+ 2026-07-19:01:19:22 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
113
+
114
+
115
+ 2026-07-19:01:22:04 INFO [loggers.evaluation_tracker:247] Saving results aggregated
116
+ 2026-07-19:01:22:04 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep75_s1226/student/*.jsonl
117
+ local-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep75_s1226/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({}), limit: None, num_fewshot: None, batch_size: 1
118
+ | Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
119
+ |---------|------:|-----------|-----:|---------|---|-----:|---|-----:|
120
+ |humaneval| 1|create_test| 0|pass@1 |↑ |0.3232|Β± |0.0366|
121
+ |mbpp | 1|none | 3|pass_at_1|↑ |0.2680|Β± |0.0198|
122
+
123
+ 2026-07-19T01:22:05-07:00 lm_eval exit=0 -> outputs/evals/general_suite/healed/reap_keep75_s1226
healed/grid_general/uniform_keep25_s1224.console.log ADDED
@@ -0,0 +1,212 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1224/wandb/run-20260717_174601-ig8p922u
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run uniform_keep25_s1224
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/ig8p922u
11
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
12
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.562714012611409, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 14.0625, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 259}, "mem_gb": 9.93}
13
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
14
+ [eval step 1] sample: 'To solve the problem, we first treat the matrix as follows:\n\n\\[ [12, -16, 4, 16] \\]\n\\[ [-9, 11, -1, -10] \\]\n\\[ [0, 1, -2, -8] \\]\n\nNext, we treat'
15
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.007942330916723, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 18.125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 348}, "mem_gb": 9.59}
16
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8284729678712786, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 14.9375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 370}, "mem_gb": 9.74}
17
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.139117633214593, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 9.25, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 31.6, "frames": {"chat": 244}, "mem_gb": 9.98}
18
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4628105710600814, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 8.4375, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 320}, "mem_gb": 9.9}
19
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4928981926833589, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.78125, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 378}, "mem_gb": 9.5}
20
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5638923177098234, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.09375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 384}, "mem_gb": 9.99}
21
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3281159411018093, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 324}, "mem_gb": 9.84}
22
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8018940414384007, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 239}, "mem_gb": 10.0}
23
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2515785626843572, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.578125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 306}, "mem_gb": 9.74}
24
+ [eval step 10] sample: "To solve this problem, we need to determine the rank of the given matrix. The rank of a matrix is defined by the number of non-zero elements in the matrix.\n\nLet's break down the problem:\n\n1. **Matrix*"
25
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3283900368700425, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 3.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 329}, "mem_gb": 9.78}
26
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7883826109138627, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.9921875, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 254}, "mem_gb": 10.01}
27
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0816897711279492, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 2.109375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 273}, "mem_gb": 9.98}
28
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6135015807601313, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.7, "frames": {"chat": 236}, "mem_gb": 9.9}
29
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3105962486989797, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 381}, "mem_gb": 9.64}
30
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6666335937586924, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 266}, "mem_gb": 9.83}
31
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9004511144821843, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 308}, "mem_gb": 9.82}
32
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7443993991047144, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 273}, "mem_gb": 10.0}
33
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.133398624741286, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.2734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 368}, "mem_gb": 9.63}
34
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2558532213958602, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 339}, "mem_gb": 9.88}
35
+ [eval step 20] sample: 'To compute the rank of a 4x4 matrix \\( A \\) given by \\([12, -16, 4, 16]\\), \\([-9, 11, -1, -10]\\), \\([0, 1, -2, -2]\\), and \\([0, 4, -8'
36
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7775650892155865, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 298}, "mem_gb": 9.8}
37
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0902612226290007, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 350}, "mem_gb": 9.53}
38
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6757159860300521, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.9765625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 246}, "mem_gb": 9.97}
39
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0760687224897245, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 375}, "mem_gb": 9.7}
40
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0879509686164557, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 352}, "mem_gb": 9.76}
41
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1019300509187082, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 396}, "mem_gb": 9.71}
42
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349442116856576, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 362}, "mem_gb": 9.57}
43
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1320429676694175, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 369}, "mem_gb": 9.77}
44
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1115945567950607, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 399}, "mem_gb": 9.62}
45
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6293747738944366, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 247}, "mem_gb": 9.9}
46
+ [eval step 30] sample: 'To compute the rank of a 4x4 matrix, we need to determine the number of linearly independent rows (or equivalently, the number of non-zero rows) in the matrix. The rank of a matrix is given by the num'
47
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37254366254458826, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 230}, "mem_gb": 9.83}
48
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5862284223752717, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 263}, "mem_gb": 10.0}
49
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.606637933870405, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 264}, "mem_gb": 9.99}
50
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9400521790258587, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 328}, "mem_gb": 9.85}
51
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5495978371700893, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 281}, "mem_gb": 9.93}
52
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4820209278317789, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 237}, "mem_gb": 9.92}
53
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5574739918556064, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 278}, "mem_gb": 10.0}
54
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9362318514594188, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 310}, "mem_gb": 9.88}
55
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6705026273014024, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 2.421875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 295}, "mem_gb": 9.81}
56
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7008066074669361, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 329}, "mem_gb": 9.83}
57
+ [eval step 40] sample: "To compute the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Let's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n12 &"
58
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6580265941616148, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 263}, "mem_gb": 9.94}
59
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6893753549223145, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 315}, "mem_gb": 9.83}
60
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9123652948531011, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 354}, "mem_gb": 9.78}
61
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531729037904491, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 259}, "mem_gb": 9.95}
62
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.663369363786156, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 275}, "mem_gb": 9.81}
63
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8982400885956362, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 334}, "mem_gb": 9.67}
64
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9199835396355639, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 374}, "mem_gb": 9.53}
65
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7805620063818991, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 311}, "mem_gb": 9.7}
66
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6897149990312755, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 259}, "mem_gb": 10.0}
67
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8139691390002767, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 305}, "mem_gb": 9.99}
68
+ [eval step 50] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-one if its rows and columns are linearly independent.\n\nGiven the matrix:'
69
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7557955997183919, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 298}, "mem_gb": 9.96}
70
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9865281463935971, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 364}, "mem_gb": 9.74}
71
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5802756533251454, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 302}, "mem_gb": 9.85}
72
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9891807129281263, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 316}, "mem_gb": 9.61}
73
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0376329787383476, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.9765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 312}, "mem_gb": 9.7}
74
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7526272877338653, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 330}, "mem_gb": 9.86}
75
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7383014962325494, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 321}, "mem_gb": 9.86}
76
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7980097688106199, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 344}, "mem_gb": 9.89}
77
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8585373521504303, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 353}, "mem_gb": 9.57}
78
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.468816747770831, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 272}, "mem_gb": 10.0}
79
+ [eval step 60] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-one if its rows are linearly independent.\n\nGiven the matrix:\n\\[\n\\begin{b'
80
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9529689540425936, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 317}, "mem_gb": 9.74}
81
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48802215769477186, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 292}, "mem_gb": 9.74}
82
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33381707844672104, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 229}, "mem_gb": 9.86}
83
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9166388065235068, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 359}, "mem_gb": 9.86}
84
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8499598869919777, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 358}, "mem_gb": 9.59}
85
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9463473704521854, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 315}, "mem_gb": 9.97}
86
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6282305336457987, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 264}, "mem_gb": 10.05}
87
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.922659195908159, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 337}, "mem_gb": 9.71}
88
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5095197800409049, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 251}, "mem_gb": 10.01}
89
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.669520335036392, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 298}, "mem_gb": 9.73}
90
+ [eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
91
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5728330836306016, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 264}, "mem_gb": 9.95}
92
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5831253407930335, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 305}, "mem_gb": 9.97}
93
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5809162937528143, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 322}, "mem_gb": 9.74}
94
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9200140699006617, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 361}, "mem_gb": 9.72}
95
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6170258167617023, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 321}, "mem_gb": 9.9}
96
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.745773715874056, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 307}, "mem_gb": 9.8}
97
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8853268439628184, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 327}, "mem_gb": 9.89}
98
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.948744330672423, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 356}, "mem_gb": 9.51}
99
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49534344591063756, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 283}, "mem_gb": 9.86}
100
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8756721441843858, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 401}, "mem_gb": 9.61}
101
+ [eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
102
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6122044404866794, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 288}, "mem_gb": 9.81}
103
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7559761947674056, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 323}, "mem_gb": 9.85}
104
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9562726962727804, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 336}, "mem_gb": 9.74}
105
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8279093881650518, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 329}, "mem_gb": 9.65}
106
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8101193031098693, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 343}, "mem_gb": 9.63}
107
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8255183496457835, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 336}, "mem_gb": 9.75}
108
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7889219066008926, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 9.98}
109
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.535852443348368, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 281}, "mem_gb": 9.82}
110
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6584771569675455, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 299}, "mem_gb": 9.7}
111
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7581487553476045, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 328}, "mem_gb": 9.88}
112
+ [eval step 90] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to row echelon form (REF)*"
113
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6072904303981612, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 271}, "mem_gb": 9.98}
114
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6448348898903777, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 269}, "mem_gb": 10.08}
115
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9165014602435132, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 370}, "mem_gb": 9.63}
116
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9641176627212514, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 352}, "mem_gb": 9.69}
117
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8529148819399377, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 330}, "mem_gb": 9.89}
118
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.739900295054478, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 334}, "mem_gb": 9.62}
119
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7255623794448872, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 336}, "mem_gb": 9.75}
120
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5624238331573704, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 309}, "mem_gb": 9.84}
121
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8828203936658799, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 391}, "mem_gb": 9.73}
122
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5177519494578242, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 264}, "mem_gb": 10.12}
123
+ [eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to row echelon form (REF)*"
124
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7520200645218292, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 349}, "mem_gb": 9.68}
125
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7038256925971558, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 312}, "mem_gb": 9.73}
126
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3220016950596124, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 229}, "mem_gb": 10.0}
127
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6865760278018812, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 288}, "mem_gb": 10.0}
128
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8872082994326949, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 351}, "mem_gb": 9.66}
129
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42892621867458025, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 223}, "mem_gb": 10.02}
130
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25722685280982405, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 213}, "mem_gb": 9.99}
131
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8519970328888545, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 380}, "mem_gb": 9.84}
132
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5298828945804387, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 271}, "mem_gb": 10.02}
133
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8754717887451251, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 340}, "mem_gb": 9.91}
134
+ [eval step 110] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n \\[\n"
135
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9062268243078142, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 366}, "mem_gb": 9.61}
136
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3772926119524986, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 233}, "mem_gb": 10.0}
137
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6391503562025725, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 312}, "mem_gb": 9.86}
138
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8348384991370141, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 363}, "mem_gb": 9.58}
139
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8460269746944308, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 323}, "mem_gb": 9.85}
140
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9184032143781583, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 346}, "mem_gb": 9.6}
141
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8337479645900429, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 318}, "mem_gb": 9.74}
142
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6655272019125521, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 275}, "mem_gb": 9.93}
143
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8020154010264203, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 345}, "mem_gb": 9.67}
144
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7799224477479855, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 377}, "mem_gb": 9.82}
145
+ [eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
146
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6743776638001203, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 294}, "mem_gb": 10.04}
147
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8791592950512965, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 338}, "mem_gb": 9.73}
148
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8868898211166263, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 352}, "mem_gb": 9.63}
149
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8171511985094597, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 347}, "mem_gb": 9.68}
150
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5592160554877172, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 310}, "mem_gb": 9.66}
151
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.917420652448386, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 358}, "mem_gb": 9.69}
152
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5866472002613048, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 319}, "mem_gb": 9.97}
153
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42084977297174436, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.4, "frames": {"chat": 269}, "mem_gb": 10.0}
154
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6944073649110893, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 310}, "mem_gb": 9.85}
155
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5127887724590798, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.0, "frames": {"chat": 259}, "mem_gb": 10.03}
156
+ [eval step 130] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if its rank is less than the number of rows or columns.\n\nGiven'
157
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161035601972291, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.0, "frames": {"chat": 265}, "mem_gb": 10.0}
158
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8862952185201148, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 337}, "mem_gb": 9.55}
159
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5373145978979766, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 290}, "mem_gb": 9.82}
160
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7703774180538953, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 349}, "mem_gb": 9.75}
161
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5381037803484748, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 291}, "mem_gb": 9.84}
162
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8035371189059068, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 342}, "mem_gb": 9.71}
163
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8786542965706438, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 338}, "mem_gb": 9.66}
164
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8855234732630353, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 356}, "mem_gb": 9.62}
165
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48763241036869587, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 265}, "mem_gb": 10.0}
166
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7343015829361975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 353}, "mem_gb": 9.71}
167
+ [eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Form the Matrix:**\n \\[\n "
168
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7160050032602002, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 316}, "mem_gb": 9.9}
169
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.613757470803149, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 289}, "mem_gb": 10.05}
170
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6455232769344001, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 331}, "mem_gb": 9.69}
171
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6440045347951353, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 320}, "mem_gb": 10.0}
172
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5798100992968926, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 272}, "mem_gb": 9.74}
173
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.933260024563844, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 368}, "mem_gb": 9.66}
174
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7830935181960463, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 328}, "mem_gb": 9.68}
175
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7827151989266277, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 326}, "mem_gb": 9.9}
176
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8659792529044053, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 364}, "mem_gb": 9.84}
177
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5851993394732475, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.4, "frames": {"chat": 296}, "mem_gb": 9.88}
178
+ [eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to a row "
179
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1224/step0150
180
+ wandb: updating run metadata
181
+ wandb: uploading summary
182
+ wandb:
183
+ wandb: Run history:
184
+ wandb: comp_len β–‚β–‚β–ƒβ–ˆβ–ƒβ–†β–‚β–‡β–†β–ƒβ–„β–ƒβ–‡β–„β–‚β–ƒβ–‚β–ƒβ–‡β–„β–„β–ƒβ–‚β–„β–ƒβ–…β–ƒβ–„β–†β–β–β–ƒβ–…β–‚β–„β–ƒβ–ƒβ–†β–ƒβ–…
185
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
186
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
187
+ wandb: finish_rate β–ˆβ–ˆβ–†β–ˆβ–‚β–ˆβ–†β–ˆβ–ˆβ–β–ˆβ–ƒβ–β–†β–ƒβ–‚β–†β–ˆβ–†β–ˆβ–„β–†β–ˆβ–„β–‡β–ˆβ–‡β–‡β–‡β–ˆβ–ˆβ–β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–†β–ˆβ–‡
188
+ wandb: forward_topk_kl β–ˆβ–‡β–…β–‚β–„β–‚β–‚β–„β–„β–ƒβ–‚β–ƒβ–ƒβ–β–„β–„β–‚β–ƒβ–‚β–‚β–‚β–ƒβ–‚β–ƒβ–β–„β–β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–‚β–‚β–β–‚β–„β–‚β–ƒβ–ƒ
189
+ wandb: grad_norm β–ˆβ–„β–ƒβ–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
190
+ wandb: lr β–β–‚β–ƒβ–…β–…β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
191
+ wandb: mem_gb β–β–‡β–„β–…β–β–„β–„β–‚β–„β–‡β–…β–…β–…β–β–„β–†β–‡β–„β–„β–‡β–‡β–‡β–„β–„β–†β–‚β–…β–…β–†β–‡β–‡β–ˆβ–‡β–†β–ƒβ–‡β–„β–„β–„β–ˆ
192
+ wandb: step β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆ
193
+ wandb: t_data_s β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: +3 ...
195
+ wandb:
196
+ wandb: Run summary:
197
+ wandb: comp_len 405.4
198
+ wandb: cumulative_loss_tokens 18000000
199
+ wandb: epoch 0
200
+ wandb: finish_rate 0.97
201
+ wandb: forward_topk_kl 0.5852
202
+ wandb: grad_norm 0.70312
203
+ wandb: lr 3e-05
204
+ wandb: mem_gb 9.88
205
+ wandb: step 150
206
+ wandb: t_data_s 0
207
+ wandb: +4 ...
208
+ wandb:
209
+ wandb: πŸš€ View run uniform_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/ig8p922u
210
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
211
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
212
+ wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1224/wandb/run-20260717_174601-ig8p922u/logs
healed/grid_general/uniform_keep25_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/uniform_keep25_s1225.console.log ADDED
@@ -0,0 +1,212 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1225/wandb/run-20260717_172920-exrn8c9o
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run uniform_keep25_s1225
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/exrn8c9o
11
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
12
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.0794557246148586, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 19.25, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 331}, "mem_gb": 9.8}
13
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
14
+ [eval step 1] sample: 'To solve the problem, follow these steps:\n\n1. **Calculate the initial savings**: \n Given $50,000 initial savings, Jamie starts with $2,500 each month. \n \\[ 50,000 = 2,500 \\]\n \\[ \\text{Initial sa'
15
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9382405855561295, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 17.375, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 342}, "mem_gb": 9.62}
16
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.060110138433675, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 16.625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 40.7, "frames": {"chat": 358}, "mem_gb": 9.66}
17
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7511012202739715, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 12.25, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 344}, "mem_gb": 9.75}
18
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2904005969742933, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.78125, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 267}, "mem_gb": 10.06}
19
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8996856569925944, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.78125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.3, "frames": {"chat": 248}, "mem_gb": 9.9}
20
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4077503702804446, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.953125, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 329}, "mem_gb": 9.89}
21
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4160378363728523, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.578125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 339}, "mem_gb": 9.85}
22
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5330558786311497, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 4.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 354}, "mem_gb": 9.84}
23
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9857558427085479, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.09375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 279}, "mem_gb": 9.98}
24
+ [eval step 10] sample: "To solve this problem, we need to determine how many months it will take to reach Jamie's goal of $1,000,000.\n\nFirst, let's calculate the total amount of money Jamie will save from their salary.\n\nJami"
25
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1225586707924804, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.703125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 318}, "mem_gb": 9.91}
26
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8451283432645103, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.9921875, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.4, "frames": {"chat": 265}, "mem_gb": 10.0}
27
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7904104653182129, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.5, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.4, "frames": {"chat": 254}, "mem_gb": 9.94}
28
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.003169925311456, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.8828125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 315}, "mem_gb": 9.97}
29
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.210865019942075, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.65625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 300}, "mem_gb": 9.76}
30
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181811830550433, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 276}, "mem_gb": 9.97}
31
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2043013377028207, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 356}, "mem_gb": 9.91}
32
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2048342113673687, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 304}, "mem_gb": 9.72}
33
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1660428700772425, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.28125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 375}, "mem_gb": 9.64}
34
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7378967291931311, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 294}, "mem_gb": 9.99}
35
+ [eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Initial Savings:**\n Jamie starts with $50,000 in savings.\n\n2. **Saving Rate:**'
36
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0699267786679167, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.484375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 299}, "mem_gb": 10.01}
37
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8490009002623459, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 305}, "mem_gb": 9.78}
38
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5716204827949405, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.0, "frames": {"chat": 262}, "mem_gb": 9.84}
39
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7367404413335026, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 303}, "mem_gb": 9.9}
40
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0723603018666308, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 380}, "mem_gb": 9.78}
41
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6846578739960988, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 282}, "mem_gb": 9.73}
42
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9897605513930321, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 362}, "mem_gb": 9.75}
43
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9729154749530057, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.0546875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 307}, "mem_gb": 9.99}
44
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7216041704551627, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.3, "frames": {"chat": 282}, "mem_gb": 9.85}
45
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9891043894331902, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 337}, "mem_gb": 9.88}
46
+ [eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Calculate the total amount of savings:**\n Jamie starts with $50,000 and can sa'
47
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6974770890879134, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 275}, "mem_gb": 9.94}
48
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0502734605158368, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 318}, "mem_gb": 9.75}
49
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.106791383036971, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.21875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 385}, "mem_gb": 9.78}
50
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1531158730265996, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 316}, "mem_gb": 9.73}
51
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6083217897144456, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 266}, "mem_gb": 10.02}
52
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0765465615568062, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 2.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 371}, "mem_gb": 9.76}
53
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6403039853143195, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 262}, "mem_gb": 9.96}
54
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0429206928466757, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 348}, "mem_gb": 9.79}
55
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34789143809402984, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.8, "frames": {"chat": 222}, "mem_gb": 10.02}
56
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9737905801298717, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 408}, "mem_gb": 9.59}
57
+ [eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Initial Savings:**\n Jamie starts with $50,000 in savings.\n\n2. **Saving Calcula'
58
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.962751345739762, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 334}, "mem_gb": 9.65}
59
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6121108932040632, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 312}, "mem_gb": 9.7}
60
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349620274516444, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 352}, "mem_gb": 9.69}
61
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8773215480993192, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 371}, "mem_gb": 9.5}
62
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.665512923207134, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 284}, "mem_gb": 9.95}
63
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5310426560789346, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 287}, "mem_gb": 10.01}
64
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5122390792146325, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.1, "frames": {"chat": 285}, "mem_gb": 9.91}
65
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4158832591359814, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 252}, "mem_gb": 10.0}
66
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9101235743480424, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 360}, "mem_gb": 9.79}
67
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9504232099909335, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 359}, "mem_gb": 9.78}
68
+ [eval step 50] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in'
69
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.987863897086059, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 363}, "mem_gb": 9.54}
70
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8996826629199087, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 361}, "mem_gb": 9.63}
71
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.623281886620447, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 286}, "mem_gb": 9.82}
72
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.964685377394408, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 367}, "mem_gb": 9.66}
73
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0159950468614698, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 352}, "mem_gb": 9.69}
74
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6757930965072165, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 314}, "mem_gb": 9.65}
75
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8620408787672719, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 372}, "mem_gb": 9.62}
76
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8460559062846005, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 334}, "mem_gb": 9.77}
77
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9600720654624825, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 368}, "mem_gb": 9.71}
78
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7995813532876471, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 354}, "mem_gb": 9.85}
79
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in'
80
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5291700849273553, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 293}, "mem_gb": 9.74}
81
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39443891376455625, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.1, "frames": {"chat": 231}, "mem_gb": 9.91}
82
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7528112872476379, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 302}, "mem_gb": 9.87}
83
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5231343047395348, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 263}, "mem_gb": 10.01}
84
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5671485816498597, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 252}, "mem_gb": 9.95}
85
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.784575092916439, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 344}, "mem_gb": 9.98}
86
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7466721218022208, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 313}, "mem_gb": 9.9}
87
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.825000645390898, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 358}, "mem_gb": 9.6}
88
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4612522759740551, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.3, "frames": {"chat": 267}, "mem_gb": 9.82}
89
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8384202725651364, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 300}, "mem_gb": 9.7}
90
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 '
91
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7152079859041919, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 348}, "mem_gb": 9.63}
92
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8390424176178872, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 329}, "mem_gb": 9.72}
93
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5051660226624459, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 269}, "mem_gb": 9.88}
94
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8928247506640852, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 358}, "mem_gb": 9.56}
95
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6003702151122192, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 302}, "mem_gb": 9.81}
96
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8836967590371768, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 381}, "mem_gb": 9.83}
97
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9381277939031522, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 379}, "mem_gb": 9.77}
98
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8966510118864477, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 351}, "mem_gb": 9.6}
99
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.816065528916195, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 330}, "mem_gb": 9.8}
100
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8439822067389886, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 316}, "mem_gb": 9.83}
101
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount of savings Jamie can save.**\n\nJamie starts with '
102
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5972601027422895, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 276}, "mem_gb": 10.01}
103
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5014377494474253, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.8, "frames": {"chat": 240}, "mem_gb": 9.94}
104
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5757383082607761, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 288}, "mem_gb": 9.85}
105
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5361464524952074, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 271}, "mem_gb": 9.84}
106
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7953305675481757, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 357}, "mem_gb": 9.79}
107
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9502958817032476, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 354}, "mem_gb": 9.77}
108
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8983897976920009, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 302}, "mem_gb": 10.01}
109
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7244445340114335, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 297}, "mem_gb": 9.99}
110
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3383140443430593, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.0, "frames": {"chat": 219}, "mem_gb": 10.01}
111
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8841795220173896, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 306}, "mem_gb": 9.72}
112
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 in savings. The'
113
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9193184819070002, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 343}, "mem_gb": 9.65}
114
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8698648859803876, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 341}, "mem_gb": 9.77}
115
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5649490782976151, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 318}, "mem_gb": 9.72}
116
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9381724646138648, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 346}, "mem_gb": 9.6}
117
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5188041244159142, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 277}, "mem_gb": 10.08}
118
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202522110253572, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 270}, "mem_gb": 9.81}
119
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5844245721923809, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 257}, "mem_gb": 10.0}
120
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8780859741431971, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 363}, "mem_gb": 9.6}
121
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8758002337973565, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 356}, "mem_gb": 9.74}
122
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8031596004160741, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 323}, "mem_gb": 9.77}
123
+ [eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 in savings. The'
124
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969562323934088, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.2, "frames": {"chat": 243}, "mem_gb": 10.03}
125
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8159564161725342, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 307}, "mem_gb": 9.71}
126
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7722952668403585, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 346}, "mem_gb": 9.94}
127
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5512993536607673, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 273}, "mem_gb": 9.94}
128
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5661342446585497, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.2, "frames": {"chat": 302}, "mem_gb": 9.87}
129
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7417649566846589, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 337}, "mem_gb": 10.0}
130
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5996722806531936, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 280}, "mem_gb": 9.88}
131
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9339710600915054, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 331}, "mem_gb": 9.78}
132
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6326806932876508, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 314}, "mem_gb": 9.88}
133
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.951997183012714, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 294}, "mem_gb": 9.81}
134
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings.\n\n**St'
135
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5370836537691455, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.9, "frames": {"chat": 274}, "mem_gb": 9.94}
136
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7816394791742166, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 365}, "mem_gb": 9.66}
137
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5312152186378837, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 323}, "mem_gb": 9.73}
138
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3917661316258212, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.5, "frames": {"chat": 234}, "mem_gb": 10.01}
139
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531616931842019, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.1, "frames": {"chat": 267}, "mem_gb": 10.01}
140
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5786159123295297, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 304}, "mem_gb": 9.78}
141
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8153983991346011, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 373}, "mem_gb": 9.7}
142
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5484141979801158, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 300}, "mem_gb": 9.98}
143
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8510625264505546, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 331}, "mem_gb": 9.82}
144
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4428873334288597, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 259}, "mem_gb": 9.97}
145
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie needs to save.**\n\nJamie starts with $50,000 in savings. T'
146
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7968908243669197, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 358}, "mem_gb": 9.58}
147
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.885246904007097, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 354}, "mem_gb": 9.84}
148
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4794710053768009, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 279}, "mem_gb": 9.91}
149
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9043105863948663, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 354}, "mem_gb": 9.65}
150
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8665179896108807, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 334}, "mem_gb": 9.86}
151
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8613109405379742, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 327}, "mem_gb": 9.72}
152
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8335232547727723, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 365}, "mem_gb": 9.82}
153
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5240228016275913, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.1, "frames": {"chat": 252}, "mem_gb": 10.03}
154
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43466761969849466, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 256}, "mem_gb": 9.99}
155
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5272866128642112, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.6, "frames": {"chat": 302}, "mem_gb": 9.77}
156
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie needs to save.**\n\nJamie starts with $50,000 in savings. T'
157
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7890060139425099, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 350}, "mem_gb": 9.67}
158
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5457840235626946, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 292}, "mem_gb": 9.79}
159
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.79017503865771, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 356}, "mem_gb": 9.6}
160
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5941492146098987, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 347}, "mem_gb": 9.77}
161
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.527144433131814, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.9, "frames": {"chat": 330}, "mem_gb": 9.96}
162
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8337077025167644, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 363}, "mem_gb": 9.82}
163
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7654941257418444, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 354}, "mem_gb": 9.68}
164
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4724469358841578, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 270}, "mem_gb": 9.95}
165
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7949136193686476, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 343}, "mem_gb": 9.72}
166
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2808029476908967, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.4, "frames": {"chat": 232}, "mem_gb": 9.91}
167
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings.\n\n**St'
168
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7310183790621658, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 346}, "mem_gb": 9.86}
169
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.609795872541517, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 306}, "mem_gb": 9.95}
170
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4385337435649087, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 273}, "mem_gb": 9.99}
171
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48237557862314084, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.8, "frames": {"chat": 266}, "mem_gb": 9.82}
172
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6842534519212942, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 299}, "mem_gb": 10.01}
173
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5115972357225915, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 259}, "mem_gb": 10.1}
174
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5499042739481975, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 325}, "mem_gb": 9.83}
175
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5033972233465562, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 1.8515625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.9, "frames": {"chat": 271}, "mem_gb": 9.91}
176
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678621418327093, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 359}, "mem_gb": 9.69}
177
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7568772708850602, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 345}, "mem_gb": 9.75}
178
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings. They '
179
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1225/step0150
180
+ wandb: updating run metadata
181
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
182
+ wandb:
183
+ wandb: Run history:
184
+ wandb: comp_len β–„β–ƒβ–ƒβ–ƒβ–†β–ˆβ–„β–…β–‡β–†β–„β–‡β–‡β–β–…β–‚β–†β–†β–„β–‚β–…β–ƒβ–…β–ƒβ–ƒβ–ƒβ–…β–…β–…β–ƒβ–ƒβ–ƒβ–†β–‡β–„β–‡β–„β–ƒβ–ƒβ–ƒ
185
+ wandb: cumulative_loss_tokens β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆ
186
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
187
+ wandb: finish_rate β–‡β–‡β–…β–ˆβ–ˆβ–‡β–ˆβ–…β–„β–ˆβ–…β–„β–ˆβ–ˆβ–‚β–„β–‡β–†β–ˆβ–ˆβ–ˆβ–†β–…β–β–‡β–ˆβ–ƒβ–ˆβ–‡β–‡β–†β–ˆβ–ˆβ–‡β–‡β–ƒβ–‡β–…β–„β–ˆ
188
+ wandb: forward_topk_kl β–ˆβ–ƒβ–ƒβ–‚β–ƒβ–„β–„β–‚β–‚β–‚β–‚β–β–ƒβ–„β–ƒβ–ƒβ–ƒβ–ƒβ–‚β–‚β–ƒβ–‚β–ƒβ–ƒβ–‚β–β–‚β–‚β–ƒβ–ƒβ–β–‚β–ƒβ–ƒβ–‚β–β–ƒβ–ƒβ–‚β–ƒ
189
+ wandb: grad_norm β–ˆβ–ˆβ–‚β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
190
+ wandb: lr β–β–…β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
191
+ wandb: mem_gb β–„β–‚β–†β–‡β–†β–„β–†β–‡β–…β–„β–‚β–ƒβ–‡β–‚β–…β–‚β–…β–β–„β–„β–„β–‡β–‡β–„β–„β–†β–…β–„β–‡β–„β–†β–‚β–ƒβ–‡β–„β–…β–„β–ˆβ–„β–ƒ
192
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆ
193
+ wandb: t_data_s β–ˆβ–β–β–ˆβ–β–β–β–β–β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: +3 ...
195
+ wandb:
196
+ wandb: Run summary:
197
+ wandb: comp_len 347.8
198
+ wandb: cumulative_loss_tokens 18000000
199
+ wandb: epoch 0
200
+ wandb: finish_rate 0.997
201
+ wandb: forward_topk_kl 0.75688
202
+ wandb: grad_norm 0.75391
203
+ wandb: lr 3e-05
204
+ wandb: mem_gb 9.75
205
+ wandb: step 150
206
+ wandb: t_data_s 0
207
+ wandb: +4 ...
208
+ wandb:
209
+ wandb: πŸš€ View run uniform_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/exrn8c9o
210
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
211
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
212
+ wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1225/wandb/run-20260717_172920-exrn8c9o/logs
healed/grid_general/uniform_keep25_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/uniform_keep25_s1226.console.log ADDED
@@ -0,0 +1,213 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run 35vquuvg
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1226/wandb/run-20260717_172747-35vquuvg
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run uniform_keep25_s1226
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/35vquuvg
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6198377058381837, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 14.1875, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 308}, "mem_gb": 9.9}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: "To solve the problem, first, let's express the arithmetic sequence $\\{a_n\\}$ in terms. The equation given is: $a_1 + 3a_8 + a_{15} = 120$. \n\nWe can start by isolating $a_1$ and $a_{15}$ separately:"
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1278039398397008, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 11.1875, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 27.8, "frames": {"chat": 211}, "mem_gb": 10.0}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4541973999391, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 12.0, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 281}, "mem_gb": 10.0}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8296605550626914, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 13.25, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 367}, "mem_gb": 9.54}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7394707097530364, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 10.75, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 312}, "mem_gb": 9.7}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3919385990172624, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.59375, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 271}, "mem_gb": 10.02}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0466774787882964, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.3125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 269}, "mem_gb": 9.98}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4405667054029803, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 352}, "mem_gb": 9.51}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8640208913827936, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.0, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 30.9, "frames": {"chat": 243}, "mem_gb": 9.99}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9949866053918998, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.046875, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 293}, "mem_gb": 9.91}
25
+ [eval step 10] sample: "To solve this problem, we need to find the value of \\(a_9 - a_{10}\\) given the arithmetic sequence \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nFirst, let's express the terms of the arithmetic sequence \\(a_1 + 3a"
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7550956839062274, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.328125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.2, "frames": {"chat": 242}, "mem_gb": 9.99}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3722707773387433, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 3.421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 353}, "mem_gb": 9.69}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2270169781867415, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 2.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 338}, "mem_gb": 9.69}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8182531326726079, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.796875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 259}, "mem_gb": 9.99}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1896284536235036, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 385}, "mem_gb": 9.54}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.107086871171246, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 355}, "mem_gb": 9.71}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0843177239472668, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 328}, "mem_gb": 9.61}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1169710126459598, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 355}, "mem_gb": 9.77}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2136201079836737, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 367}, "mem_gb": 9.63}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1100827305369079, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 4.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 343}, "mem_gb": 9.67}
36
+ [eval step 20] sample: 'to solve the problem, we need to find the value of $2a_9 - a_{10}$ given the arithmetic sequence $\\{a_n, a_{n+1} = a_n, a_{n+2} = a_{n+1}, a_{n+3} = a_{'
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48773726695353786, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.140625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.0, "frames": {"chat": 244}, "mem_gb": 10.0}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7658182124488055, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 339}, "mem_gb": 9.83}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.773730390801529, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 298}, "mem_gb": 9.98}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0994430319796007, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 398}, "mem_gb": 9.86}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9967648058511317, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 362}, "mem_gb": 9.96}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7214353624875347, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 313}, "mem_gb": 9.83}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1025204305546978, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 324}, "mem_gb": 9.75}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7503103248804808, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 314}, "mem_gb": 9.8}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0916470245361327, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 345}, "mem_gb": 9.73}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6021138668128599, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 262}, "mem_gb": 9.91}
47
+ [eval step 30] sample: 'to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the arithmetic sequence \\(\\{a_n, a_{n+1} = a_n, a_{n+2} = a_{n+1}\\}\\).\n\nthe sequence'
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1386381568533679, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 373}, "mem_gb": 9.7}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9884025979394714, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 334}, "mem_gb": 9.69}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7716704062253237, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 327}, "mem_gb": 9.85}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38816003082059325, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.0, "frames": {"chat": 238}, "mem_gb": 10.01}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8976383726373315, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 310}, "mem_gb": 9.74}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9374686279334128, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 347}, "mem_gb": 9.75}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9745971527382732, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 304}, "mem_gb": 9.67}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9185622260774176, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.94140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 343}, "mem_gb": 9.69}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0123143767920633, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 314}, "mem_gb": 9.69}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9092321241131673, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 300}, "mem_gb": 9.79}
58
+ [eval step 40] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence and the given equation. the arithmetic sequence is defined by the sum of the first and the eig'
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7716472785164913, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 318}, "mem_gb": 9.83}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6538155039491753, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 279}, "mem_gb": 9.87}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9410169425601761, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 364}, "mem_gb": 9.93}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.666910404100269, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 256}, "mem_gb": 10.0}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0627939316359658, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 340}, "mem_gb": 9.7}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6058597680499156, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 283}, "mem_gb": 9.93}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9343802149453511, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 349}, "mem_gb": 9.71}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6380284264487525, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 297}, "mem_gb": 9.79}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0918996284656226, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 359}, "mem_gb": 9.76}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7474090205609798, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 342}, "mem_gb": 9.8}
69
+ [eval step 50] sample: 'in the arithmetic sequence {a_n}, if a_1 + 3a_8 + a_{15} = 120, we need to find the value of a_9 - a_{10}. to solve this, we first express the sequence in terms of the common difference of the first a'
70
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5774158618660022, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.8, "frames": {"chat": 269}, "mem_gb": 9.97}
71
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.727511136507243, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 324}, "mem_gb": 9.96}
72
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.591815117332836, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.3, "frames": {"chat": 281}, "mem_gb": 9.95}
73
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7262308727793395, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 287}, "mem_gb": 9.99}
74
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8758036725302537, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 296}, "mem_gb": 10.0}
75
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6354180803711216, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 267}, "mem_gb": 10.05}
76
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6112754095687221, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 249}, "mem_gb": 9.96}
77
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9578634677429994, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 363}, "mem_gb": 9.65}
78
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6659456232734025, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 299}, "mem_gb": 9.79}
79
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349627352940539, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 331}, "mem_gb": 9.67}
80
+ [eval step 60] sample: 'in the arithmetic sequence {a_n}, if a_1 + 3a_8 + a_{15} = 120, we can find the value of a_9 - a_10. to solve this, we first express a_9 and a_10 in terms of a_n:\n\na'
81
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5694986918556193, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 280}, "mem_gb": 9.88}
82
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.935475990417848, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 350}, "mem_gb": 9.86}
83
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9245277111411094, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 321}, "mem_gb": 9.63}
84
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5552141196810951, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 281}, "mem_gb": 9.93}
85
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9923324734320244, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 331}, "mem_gb": 9.61}
86
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7915697015117854, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 318}, "mem_gb": 9.98}
87
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6781684341014673, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 309}, "mem_gb": 9.99}
88
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5953212155991544, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 304}, "mem_gb": 9.88}
89
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4627537495482713, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 279}, "mem_gb": 9.9}
90
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3126349515615652, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.0, "frames": {"chat": 248}, "mem_gb": 9.91}
91
+ [eval step 70] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given equation. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\ngiven that:\n\n\\[ a_1 + 3'
92
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7028052366066724, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.4, "frames": {"chat": 268}, "mem_gb": 9.88}
93
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6805809060358753, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 299}, "mem_gb": 9.98}
94
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7358988696674506, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 322}, "mem_gb": 9.84}
95
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5234173207546895, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 248}, "mem_gb": 10.01}
96
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7484029913706084, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 326}, "mem_gb": 9.91}
97
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6783317150050153, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 314}, "mem_gb": 9.67}
98
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32216203611418603, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 232}, "mem_gb": 10.0}
99
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8948443909298629, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 330}, "mem_gb": 9.73}
100
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5822775135998924, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 292}, "mem_gb": 9.88}
101
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8399514859688779, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 312}, "mem_gb": 9.91}
102
+ [eval step 80] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given equation. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\nthe given equation is:\n\n\\'
103
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9575093897075703, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 382}, "mem_gb": 9.71}
104
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9348283756031345, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 360}, "mem_gb": 9.58}
105
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25758756727054716, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.8, "frames": {"chat": 222}, "mem_gb": 9.85}
106
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8978787859870742, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 342}, "mem_gb": 9.9}
107
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8793410871063669, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 337}, "mem_gb": 9.7}
108
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6241782809955378, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 304}, "mem_gb": 9.95}
109
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6081606655495863, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 326}, "mem_gb": 9.84}
110
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8173513504152496, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 310}, "mem_gb": 9.9}
111
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7661993961703032, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 328}, "mem_gb": 9.72}
112
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8819279079849521, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 347}, "mem_gb": 9.55}
113
+ [eval step 90] sample: 'to solve the problem, we need to follow these steps:\n\n1. **understand the arithmetic sequence:**\n the arithmetic sequence is defined by the formula:\n \\[\n a_n = a_1 + 3a_n\n \\]\n\n2. **use the giv'
114
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7608344363326828, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 330}, "mem_gb": 9.84}
115
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3073514755656322, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.7, "frames": {"chat": 209}, "mem_gb": 10.04}
116
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8808949546787888, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 399}, "mem_gb": 9.63}
117
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8310232947535813, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 351}, "mem_gb": 9.7}
118
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6046287738657867, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 322}, "mem_gb": 9.71}
119
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8535104629158974, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 333}, "mem_gb": 9.6}
120
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6767037988130004, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 330}, "mem_gb": 9.88}
121
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2665396176737423, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.9, "frames": {"chat": 238}, "mem_gb": 9.92}
122
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4756658501408994, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 297}, "mem_gb": 9.82}
123
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7924712710880985, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 345}, "mem_gb": 9.79}
124
+ [eval step 100] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence. the general formula for the nth term of an arithmetic sequence is given by:\n\n\\[ a_n = a_1 + ('
125
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5913449060489734, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 304}, "mem_gb": 9.93}
126
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7735354417373737, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 326}, "mem_gb": 9.93}
127
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9105205685311307, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 347}, "mem_gb": 9.86}
128
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8203764770704011, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 325}, "mem_gb": 9.75}
129
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.565507434800888, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 299}, "mem_gb": 9.93}
130
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9238667355486502, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 345}, "mem_gb": 9.71}
131
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8346978439378242, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 344}, "mem_gb": 9.6}
132
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6687200761043777, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 344}, "mem_gb": 9.87}
133
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5966480035169671, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 288}, "mem_gb": 9.93}
134
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5915618992409358, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 303}, "mem_gb": 9.64}
135
+ [eval step 110] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence. the general formula for the nth term of an arithmetic sequence is given by:\n\n\\[ a_n = a_1 + ('
136
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4473089533680429, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 284}, "mem_gb": 9.82}
137
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387724594468871, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 369}, "mem_gb": 9.72}
138
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969378318533301, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.8, "frames": {"chat": 269}, "mem_gb": 9.98}
139
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8553870124946038, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 341}, "mem_gb": 9.74}
140
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8735430047041426, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 384}, "mem_gb": 9.5}
141
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7467893767852336, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 358}, "mem_gb": 9.67}
142
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8396447286280493, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 342}, "mem_gb": 9.84}
143
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.902994489998122, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 365}, "mem_gb": 9.66}
144
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8418082291851441, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 337}, "mem_gb": 9.89}
145
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7537819979315002, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 333}, "mem_gb": 10.0}
146
+ [eval step 120] sample: 'to solve the problem, we need to understand the sequence and the given equation. the arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). the general term \\(a_n\\) '
147
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5688487251376112, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 293}, "mem_gb": 10.04}
148
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5338740110569944, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 291}, "mem_gb": 9.8}
149
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7826589779548347, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 341}, "mem_gb": 9.83}
150
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5546559380196034, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 300}, "mem_gb": 9.76}
151
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5030046158757061, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 270}, "mem_gb": 9.99}
152
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40680691962043447, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.7, "frames": {"chat": 259}, "mem_gb": 10.01}
153
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.830503997397547, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 355}, "mem_gb": 9.58}
154
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8946966494401296, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 388}, "mem_gb": 9.94}
155
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7882957464712361, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 318}, "mem_gb": 9.65}
156
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8871899474499126, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 383}, "mem_gb": 9.79}
157
+ [eval step 130] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given condition. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\nthe given condition is:\n'
158
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5582911205784729, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 300}, "mem_gb": 9.79}
159
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5250322484340518, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 295}, "mem_gb": 9.88}
160
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5620724763760964, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 306}, "mem_gb": 9.62}
161
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6797515101924538, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 303}, "mem_gb": 9.88}
162
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4111867822818458, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.5, "frames": {"chat": 272}, "mem_gb": 9.95}
163
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5122231835640967, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 248}, "mem_gb": 9.94}
164
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.540168851786976, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 282}, "mem_gb": 9.93}
165
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7885747328455249, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 362}, "mem_gb": 9.5}
166
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8411877916619181, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 374}, "mem_gb": 9.86}
167
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5197104676648975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 280}, "mem_gb": 10.03}
168
+ [eval step 140] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms, i.e., \\(a_n = a_{n-1} + a_{n-2}\\).\n\ngiv'
169
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4203244868689527, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 276}, "mem_gb": 9.87}
170
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202023733886579, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.6, "frames": {"chat": 246}, "mem_gb": 10.01}
171
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8516633477176229, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 360}, "mem_gb": 9.54}
172
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.813726552273954, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 365}, "mem_gb": 9.72}
173
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6931645369105041, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 338}, "mem_gb": 9.81}
174
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4358943793937564, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 276}, "mem_gb": 9.91}
175
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27220238340807457, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.4, "frames": {"chat": 209}, "mem_gb": 9.99}
176
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8054786739685883, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 379}, "mem_gb": 9.59}
177
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7144403724439442, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 307}, "mem_gb": 9.93}
178
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5410168964619437, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 293}, "mem_gb": 9.97}
179
+ [eval step 150] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms, i.e., \\(a_n = a_{n-1} + a_{n-2}\\).\n\ngiv'
180
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1226/step0150
181
+ wandb: updating run metadata
182
+ wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
183
+ wandb:
184
+ wandb: Run history:
185
+ wandb: comp_len β–„β–ˆβ–ƒβ–β–‚β–„β–‡β–ƒβ–„β–‚β–…β–‚β–…β–‡β–ƒβ–„β–†β–ƒβ–…β–„β–ƒβ–„β–ƒβ–ƒβ–‚β–„β–‚β–…β–‚β–ƒβ–‚β–ƒβ–β–„β–…β–„β–†β–β–ˆβ–
186
+ wandb: cumulative_loss_tokens β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
187
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
188
+ wandb: finish_rate β–†β–ˆβ–„β–ˆβ–ˆβ–ˆβ–…β–ˆβ–‡β–ˆβ–„β–‡β–ˆβ–‡β–†β–ˆβ–†β–‡β–†β–…β–‡β–‡β–ˆβ–‡β–†β–†β–…β–ƒβ–ˆβ–ˆβ–ˆβ–‡β–†β–ˆβ–†β–…β–ˆβ–‡β–†β–
189
+ wandb: forward_topk_kl β–ˆβ–„β–ƒβ–…β–…β–ƒβ–…β–„β–…β–ƒβ–„β–ƒβ–ƒβ–…β–‚β–ƒβ–„β–„β–β–ƒβ–β–‚β–„β–„β–‚β–ƒβ–β–ƒβ–„β–ƒβ–„β–‚β–„β–ƒβ–ƒβ–ƒβ–β–‚β–ƒβ–ƒ
190
+ wandb: grad_norm β–ˆβ–†β–ƒβ–‚β–‚β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
191
+ wandb: lr β–β–ƒβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
192
+ wandb: mem_gb β–ˆβ–‡β–ƒβ–ƒβ–ƒβ–„β–‡β–ˆβ–„β–‡β–‡β–‡β–ƒβ–…β–ƒβ–ƒβ–ƒβ–†β–ˆβ–†β–†β–†β–†β–„β–‚β–ƒβ–‚β–…β–…β–†β–„β–„β–…β–…β–ˆβ–β–†β–…β–‡β–‡
193
+ wandb: step β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
195
+ wandb: +3 ...
196
+ wandb:
197
+ wandb: Run summary:
198
+ wandb: comp_len 409.6
199
+ wandb: cumulative_loss_tokens 18000000
200
+ wandb: epoch 0
201
+ wandb: finish_rate 0.942
202
+ wandb: forward_topk_kl 0.54102
203
+ wandb: grad_norm 0.69141
204
+ wandb: lr 3e-05
205
+ wandb: mem_gb 9.97
206
+ wandb: step 150
207
+ wandb: t_data_s 0
208
+ wandb: +4 ...
209
+ wandb:
210
+ wandb: πŸš€ View run uniform_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/35vquuvg
211
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
212
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
213
+ wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1226/wandb/run-20260717_172747-35vquuvg/logs
healed/grid_general/uniform_keep25_s1226.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/uniform_keep50_s1224.console.log ADDED
@@ -0,0 +1,215 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: Tracking run with wandb version 0.28.0
6
+ wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep50_s1224/wandb/run-20260718_134414-osqsd9b4
7
+ wandb: Run `wandb offline` to turn off syncing.
8
+ wandb: Syncing run uniform_keep50_s1224
9
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
10
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/osqsd9b4
11
+
12
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
13
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6917759428766866, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 6.5, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 259}, "mem_gb": 15.93}
14
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
15
+ [eval step 1] sample: 'To compute the rank of the given 4x4 matrix, we first determine the number of elements (rows) and columns. The matrix given is:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 &'
16
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9499301103445391, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 8.0625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 348}, "mem_gb": 15.64}
17
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8424377281524241, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 17.625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 370}, "mem_gb": 15.79}
18
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4464047732328375, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 3.46875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 244}, "mem_gb": 16.02}
19
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6813110845401883, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.5, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 320}, "mem_gb": 15.94}
20
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7489079088433335, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 3.421875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 378}, "mem_gb": 15.54}
21
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8012765964987377, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 2.5, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 384}, "mem_gb": 16.04}
22
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6909570617862045, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.9140625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 324}, "mem_gb": 15.88}
23
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34498201645724474, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.4765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 239}, "mem_gb": 16.05}
24
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6355094303450237, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.4296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 306}, "mem_gb": 15.79}
25
+ [eval step 10] sample: "To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the steps:\n\n1. **Identify the Matrix:**\n \\[\n "
26
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6753487973206987, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 329}, "mem_gb": 15.83}
27
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36083462419571977, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 254}, "mem_gb": 16.05}
28
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5519874217172464, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 273}, "mem_gb": 16.03}
29
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2718122292951991, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 236}, "mem_gb": 15.95}
30
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6930785834802935, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 381}, "mem_gb": 15.69}
31
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3040310528299461, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 266}, "mem_gb": 15.88}
32
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44223287569036085, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 308}, "mem_gb": 15.87}
33
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3663825685930749, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 273}, "mem_gb": 16.05}
34
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5860139168731868, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 368}, "mem_gb": 15.68}
35
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6743619577939312, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 339}, "mem_gb": 15.93}
36
+ [eval step 20] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's start by writing down the rows of the given matrix:\n\n\\[\n\\begin{bmatr"
37
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3908682078843315, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 298}, "mem_gb": 15.85}
38
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5756209870963047, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 350}, "mem_gb": 15.57}
39
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34066299010645595, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 246}, "mem_gb": 16.02}
40
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5688138205175598, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 375}, "mem_gb": 15.75}
41
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.577202946131366, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 352}, "mem_gb": 15.8}
42
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5892932344843944, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 396}, "mem_gb": 15.76}
43
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4940694273682932, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 362}, "mem_gb": 15.61}
44
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6087611052072918, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 369}, "mem_gb": 15.82}
45
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6013093366716057, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 399}, "mem_gb": 15.67}
46
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3221179998536284, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 247}, "mem_gb": 15.95}
47
+ [eval step 30] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the matrix step-by-step:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
48
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16846333308269582, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 230}, "mem_gb": 15.88}
49
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2899844216653456, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 263}, "mem_gb": 16.05}
50
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31605170328461873, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 264}, "mem_gb": 16.04}
51
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5029458499694243, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 328}, "mem_gb": 15.9}
52
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28057213364044825, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 281}, "mem_gb": 15.97}
53
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23167578200120478, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 237}, "mem_gb": 15.96}
54
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2760685826924319, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 278}, "mem_gb": 16.05}
55
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5016841662073508, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 310}, "mem_gb": 15.92}
56
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33654679746535454, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 295}, "mem_gb": 15.86}
57
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3634161012196913, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 329}, "mem_gb": 15.87}
58
+ [eval step 40] sample: 'To compute the rank of a matrix, we can use various methods such as Gaussian elimination, which is a systematic method to reduce a matrix to its row-echelon form (REF) or reduced row-echelon form (RRE'
59
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33847409060771266, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 263}, "mem_gb": 15.99}
60
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35893658433345454, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 315}, "mem_gb": 15.87}
61
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.487745441975072, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 354}, "mem_gb": 15.83}
62
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24089701755438, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 259}, "mem_gb": 16.0}
63
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.345664977542373, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 275}, "mem_gb": 15.85}
64
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46985326585226384, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 334}, "mem_gb": 15.72}
65
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4985063012317444, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 374}, "mem_gb": 15.57}
66
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4144724924205492, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 311}, "mem_gb": 15.75}
67
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.360805739873896, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 259}, "mem_gb": 16.05}
68
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4351383126423384, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 305}, "mem_gb": 16.04}
69
+ [eval step 50] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to have rank \\( r \\) if it has \\( r \\) linearly independent rows or colu'
70
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0050
71
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40691574598941954, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 298}, "mem_gb": 16.01}
72
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5449615391597773, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 364}, "mem_gb": 15.79}
73
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3007845638130481, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 302}, "mem_gb": 15.89}
74
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.545040809216847, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 316}, "mem_gb": 15.65}
75
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.561124822494636, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 312}, "mem_gb": 15.75}
76
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40858620684330044, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 330}, "mem_gb": 15.9}
77
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3971438911166042, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 321}, "mem_gb": 15.91}
78
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.424083882328247, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 344}, "mem_gb": 15.94}
79
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4671809927133843, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 353}, "mem_gb": 15.61}
80
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24727104306661835, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 272}, "mem_gb": 16.04}
81
+ [eval step 60] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if the number of linearly independent rows or colu'
82
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5186026561640203, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 317}, "mem_gb": 15.79}
83
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25109354469881706, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 292}, "mem_gb": 15.79}
84
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15407238988826671, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 229}, "mem_gb": 15.9}
85
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5034606750626738, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 359}, "mem_gb": 15.91}
86
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4569187254007906, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 358}, "mem_gb": 15.64}
87
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5186631314306209, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 315}, "mem_gb": 16.02}
88
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33726435366347435, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 264}, "mem_gb": 16.09}
89
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060562888608624, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 337}, "mem_gb": 15.76}
90
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26266643292577935, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 251}, "mem_gb": 16.05}
91
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36425970880171904, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 298}, "mem_gb": 15.78}
92
+ [eval step 70] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Let's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n12"
93
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30128917100802066, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 264}, "mem_gb": 16.0}
94
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3152509652536362, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 305}, "mem_gb": 16.01}
95
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30717228043780975, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 322}, "mem_gb": 15.79}
96
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49717818820203347, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 361}, "mem_gb": 15.77}
97
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33153610016955065, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 321}, "mem_gb": 15.95}
98
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3960372977694186, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 307}, "mem_gb": 15.85}
99
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4837863472050677, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 327}, "mem_gb": 15.94}
100
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5269268597591669, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 356}, "mem_gb": 15.56}
101
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2676410052911689, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 283}, "mem_gb": 15.9}
102
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4805018970411892, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 401}, "mem_gb": 15.66}
103
+ [eval step 80] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & "
104
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3271545289649007, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 288}, "mem_gb": 15.85}
105
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40884810679629446, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 323}, "mem_gb": 15.89}
106
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5308478646889329, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 336}, "mem_gb": 15.78}
107
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45252310228614756, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 329}, "mem_gb": 15.69}
108
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4381400734625136, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 343}, "mem_gb": 15.67}
109
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45893981260582806, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 336}, "mem_gb": 15.79}
110
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4356501762141784, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 314}, "mem_gb": 16.03}
111
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2798701721932118, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 281}, "mem_gb": 15.86}
112
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35120579899698495, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 299}, "mem_gb": 15.74}
113
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4144783515694241, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 328}, "mem_gb": 15.93}
114
+ [eval step 90] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n \\[\n \\begin{bmat"
115
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3248693922109281, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 271}, "mem_gb": 16.03}
116
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3479275345440954, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 269}, "mem_gb": 16.13}
117
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5135209150403738, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 370}, "mem_gb": 15.68}
118
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5469659753783296, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 352}, "mem_gb": 15.74}
119
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4665497402111689, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 330}, "mem_gb": 15.94}
120
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40783421545452436, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 334}, "mem_gb": 15.66}
121
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3970873003952826, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 336}, "mem_gb": 15.8}
122
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29955487959031013, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 309}, "mem_gb": 15.89}
123
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4877876743291815, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 391}, "mem_gb": 15.77}
124
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2707466459552447, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 264}, "mem_gb": 16.17}
125
+ [eval step 100] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
126
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0100
127
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4195987428303808, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 349}, "mem_gb": 15.72}
128
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3913418374637142, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 312}, "mem_gb": 15.78}
129
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16448741336986422, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 229}, "mem_gb": 16.04}
130
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37604722545544306, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 288}, "mem_gb": 16.05}
131
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.489004408040829, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 351}, "mem_gb": 15.7}
132
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2118576814339186, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 223}, "mem_gb": 16.07}
133
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1234707356864897, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 213}, "mem_gb": 16.03}
134
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.471965583872733, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 380}, "mem_gb": 15.88}
135
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2796549871960034, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 271}, "mem_gb": 16.07}
136
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4911319158003355, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 340}, "mem_gb": 15.96}
137
+ [eval step 110] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this case, we have a 4x4 matrix.\n\nLet's represent the matrix as follows:\n\n\\[\nA = \\begi"
138
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49902623601458035, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 366}, "mem_gb": 15.66}
139
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1930453141957211, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 233}, "mem_gb": 16.05}
140
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34603738884702323, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 312}, "mem_gb": 15.91}
141
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4646876655772949, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 363}, "mem_gb": 15.62}
142
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46944885184479257, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 323}, "mem_gb": 15.9}
143
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5033070187690978, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 346}, "mem_gb": 15.64}
144
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46177769342667113, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 318}, "mem_gb": 15.79}
145
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36559325879625976, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 275}, "mem_gb": 15.97}
146
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4453597818657756, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 345}, "mem_gb": 15.72}
147
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43486473662207525, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 377}, "mem_gb": 15.86}
148
+ [eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
149
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3694714881522581, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 294}, "mem_gb": 16.09}
150
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4925790473555525, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 338}, "mem_gb": 15.78}
151
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4942110770324866, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 352}, "mem_gb": 15.68}
152
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4440446032938858, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 347}, "mem_gb": 15.73}
153
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3025292081457252, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 310}, "mem_gb": 15.71}
154
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5147223067736874, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 358}, "mem_gb": 15.74}
155
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31496750627619524, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 319}, "mem_gb": 16.01}
156
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22119880944999556, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 269}, "mem_gb": 16.05}
157
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3810055477776254, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 310}, "mem_gb": 15.9}
158
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.275449989147267, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 259}, "mem_gb": 16.08}
159
+ [eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n"
160
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27469143630973997, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 265}, "mem_gb": 16.05}
161
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49383658517226575, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 337}, "mem_gb": 15.6}
162
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2858842681933194, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 290}, "mem_gb": 15.86}
163
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42380685371415067, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 349}, "mem_gb": 15.79}
164
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2827025428744033, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 291}, "mem_gb": 15.89}
165
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44822633866084116, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 342}, "mem_gb": 15.76}
166
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49938472879038504, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 338}, "mem_gb": 15.7}
167
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.492944224542814, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 356}, "mem_gb": 15.67}
168
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609467014649262, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 265}, "mem_gb": 16.05}
169
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4059377191117654, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 353}, "mem_gb": 15.76}
170
+ [eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
171
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3910453383545081, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 316}, "mem_gb": 15.95}
172
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3369911602856281, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 289}, "mem_gb": 16.1}
173
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35459049528371545, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 331}, "mem_gb": 15.74}
174
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3481748200963562, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 320}, "mem_gb": 16.05}
175
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3090666974460706, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 272}, "mem_gb": 15.79}
176
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5301194600745104, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 368}, "mem_gb": 15.7}
177
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4325976529110844, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 328}, "mem_gb": 15.73}
178
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4370371102225035, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 326}, "mem_gb": 15.95}
179
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4871703383412212, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 364}, "mem_gb": 15.89}
180
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31749200204570466, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 296}, "mem_gb": 15.93}
181
+ [eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
182
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0150
183
+ wandb: updating run metadata
184
+ wandb: uploading summary, console lines 171-171
185
+ wandb:
186
+ wandb: Run history:
187
+ wandb: comp_len β–‚β–ƒβ–ƒβ–…β–…β–…β–‚β–β–‡β–…β–„β–ƒβ–…β–…β–…β–‚β–ƒβ–ƒβ–…β–ƒβ–ƒβ–ƒβ–‚β–ƒβ–„β–ƒβ–…β–‚β–ˆβ–…β–ƒβ–‚β–ƒβ–„β–…β–„β–‚β–‚β–‚β–‚
188
+ wandb: cumulative_loss_tokens β–β–β–β–β–β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–„β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
189
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
190
+ wandb: finish_rate β–ˆβ–ˆβ–‡β–ˆβ–β–ˆβ–ˆβ–ƒβ–„β–β–†β–ˆβ–„β–ˆβ–†β–ˆβ–ˆβ–‡β–†β–†β–ˆβ–ˆβ–ˆβ–ˆβ–‡β–†β–ˆβ–‡β–†β–ˆβ–‡β–ˆβ–ˆβ–ˆβ–‡β–ˆβ–ƒβ–‡β–ˆβ–ˆ
191
+ wandb: forward_topk_kl β–†β–ˆβ–†β–…β–†β–ƒβ–„β–‚β–ƒβ–ƒβ–‚β–„β–ƒβ–„β–β–„β–„β–ƒβ–„β–ƒβ–„β–ƒβ–ƒβ–„β–ƒβ–β–β–„β–„β–ƒβ–ƒβ–ƒβ–‚β–„β–‚β–ƒβ–ƒβ–„β–„β–ƒ
192
+ wandb: grad_norm β–ˆβ–ƒβ–‚β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–β–β–‚β–β–β–β–β–β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
193
+ wandb: lr β–β–„β–…β–…β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
194
+ wandb: mem_gb β–…β–„β–…β–ƒβ–†β–„β–…β–†β–…β–‡β–…β–β–„β–…β–†β–‡β–‚β–‡β–„β–β–ƒβ–ƒβ–‚β–„β–…β–†β–ˆβ–„β–ƒβ–ƒβ–‡β–…β–‡β–‚β–…β–„β–†β–ƒβ–„β–†
195
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆ
196
+ wandb: t_data_s β–ˆβ–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
197
+ wandb: +3 ...
198
+ wandb:
199
+ wandb: Run summary:
200
+ wandb: comp_len 405.4
201
+ wandb: cumulative_loss_tokens 18000000
202
+ wandb: epoch 0
203
+ wandb: finish_rate 0.97
204
+ wandb: forward_topk_kl 0.31749
205
+ wandb: grad_norm 0.53125
206
+ wandb: lr 3e-05
207
+ wandb: mem_gb 15.93
208
+ wandb: step 150
209
+ wandb: t_data_s 0
210
+ wandb: +4 ...
211
+ wandb:
212
+ wandb: πŸš€ View run uniform_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/osqsd9b4
213
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
214
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
215
+ wandb: Find logs at: outputs/healed/grid_general/uniform_keep50_s1224/wandb/run-20260718_134414-osqsd9b4/logs
healed/grid_general/uniform_keep50_s1224.eval.log ADDED
The diff for this file is too large to render. See raw diff
 
healed/grid_general/uniform_keep50_s1225.console.log ADDED
@@ -0,0 +1,216 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
2
+ warnings.warn('Grouped GEMM not available.')
3
+ wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
4
+ wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
5
+ wandb: setting up run 056290eo
6
+ wandb: Tracking run with wandb version 0.28.0
7
+ wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep50_s1225/wandb/run-20260718_124640-056290eo
8
+ wandb: Run `wandb offline` to turn off syncing.
9
+ wandb: Syncing run uniform_keep50_s1225
10
+ wandb: ⭐️ View project at https://wandb.ai/hbfreed/glean-general-grid
11
+ wandb: πŸš€ View run at https://wandb.ai/hbfreed/glean-general-grid/runs/056290eo
12
+
13
+ 58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
14
+ {"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0012346531342715, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 8.625, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 331}, "mem_gb": 15.8}
15
+ The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
16
+ [eval step 1] sample: 'To solve this problem, we need to consider both the monthly savings and the interest earned each month.\n\n1. **Initial Savings:** Jamie starts with $50,000.\n\n2. **Total Goal:** Jamie aims to reach $1,0'
17
+ {"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9385142022331555, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 7.6875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 342}, "mem_gb": 15.67}
18
+ {"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0037555417033532, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 6.9375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 358}, "mem_gb": 15.71}
19
+ {"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8459829939559103, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 4.84375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 344}, "mem_gb": 15.79}
20
+ {"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5818770413972437, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.078125, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 267}, "mem_gb": 16.11}
21
+ {"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33641571484518545, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.046875, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 248}, "mem_gb": 15.94}
22
+ {"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7034493155685564, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 2.109375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 329}, "mem_gb": 15.93}
23
+ {"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7088763666328043, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.8125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 339}, "mem_gb": 15.89}
24
+ {"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7796795962753396, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 354}, "mem_gb": 15.89}
25
+ {"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47490170586556196, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.4140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 279}, "mem_gb": 16.02}
26
+ [eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the amount saved and the interest earned each month.\n\n1. **Initial Savings:**\n Jamie s'
27
+ {"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5603851036655406, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.3671875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 318}, "mem_gb": 15.95}
28
+ {"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40979289957657455, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 265}, "mem_gb": 16.04}
29
+ {"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3842074246103565, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 254}, "mem_gb": 15.98}
30
+ {"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5093685679781561, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 315}, "mem_gb": 16.01}
31
+ {"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6256126999858767, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 300}, "mem_gb": 15.81}
32
+ {"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4590370270299415, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 276}, "mem_gb": 16.01}
33
+ {"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6408972399981071, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 356}, "mem_gb": 15.95}
34
+ {"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6301721393890679, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 304}, "mem_gb": 15.77}
35
+ {"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6149119366053492, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 375}, "mem_gb": 15.68}
36
+ {"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35782394987605515, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 294}, "mem_gb": 16.04}
37
+ [eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: Calculate Tota'
38
+ {"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5508201285784443, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 299}, "mem_gb": 16.05}
39
+ {"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4347093193060408, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 305}, "mem_gb": 15.83}
40
+ {"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2738246406914666, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 262}, "mem_gb": 15.89}
41
+ {"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37393212966720263, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 303}, "mem_gb": 15.94}
42
+ {"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5675287476661305, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 380}, "mem_gb": 15.82}
43
+ {"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3302096474437043, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 282}, "mem_gb": 15.78}
44
+ {"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.529561648986737, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 362}, "mem_gb": 15.79}
45
+ {"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5250675880373766, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 307}, "mem_gb": 16.04}
46
+ {"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3746533786466345, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 282}, "mem_gb": 15.9}
47
+ {"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5301477026427165, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 337}, "mem_gb": 15.93}
48
+ [eval step 30] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned in the investment account.\n\n**Step 1: Calculat'
49
+ {"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3571854299719135, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 275}, "mem_gb": 15.99}
50
+ {"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5787230650416265, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 318}, "mem_gb": 15.8}
51
+ {"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.602699743715922, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 385}, "mem_gb": 15.83}
52
+ {"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6341000456605107, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 316}, "mem_gb": 15.78}
53
+ {"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30473607964788874, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 266}, "mem_gb": 16.07}
54
+ {"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.572544208825628, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 371}, "mem_gb": 15.8}
55
+ {"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32806760044911254, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 262}, "mem_gb": 16.01}
56
+ {"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5710632975555956, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 348}, "mem_gb": 15.83}
57
+ {"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16166681660910448, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 222}, "mem_gb": 16.07}
58
+ {"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5282641408917804, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 408}, "mem_gb": 15.64}
59
+ [eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
60
+ {"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5181830599565059, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 4.28125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 334}, "mem_gb": 15.7}
61
+ {"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3118452249342576, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 312}, "mem_gb": 15.75}
62
+ {"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060255770319763, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 352}, "mem_gb": 15.73}
63
+ {"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46762468524898093, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 371}, "mem_gb": 15.55}
64
+ {"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34022865317029255, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 284}, "mem_gb": 15.99}
65
+ {"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2705740574412048, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 287}, "mem_gb": 16.06}
66
+ {"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25679682421001293, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 285}, "mem_gb": 15.95}
67
+ {"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19977544261639316, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 252}, "mem_gb": 16.04}
68
+ {"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5010628154355412, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 360}, "mem_gb": 15.84}
69
+ {"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.520745706422627, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 359}, "mem_gb": 15.83}
70
+ [eval step 50] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calc'
71
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0050
72
+ {"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5451169537675257, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 363}, "mem_gb": 15.58}
73
+ {"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49252958696633575, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 361}, "mem_gb": 15.67}
74
+ {"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32162735090740024, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 286}, "mem_gb": 15.86}
75
+ {"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5231256723885734, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 367}, "mem_gb": 15.71}
76
+ {"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5570450429181258, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 352}, "mem_gb": 15.74}
77
+ {"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35708660811726006, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 15.69}
78
+ {"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46920198745789626, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 372}, "mem_gb": 15.66}
79
+ {"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539165943020334, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 334}, "mem_gb": 15.81}
80
+ {"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5307956311500942, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 368}, "mem_gb": 15.76}
81
+ {"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43559490257781, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 354}, "mem_gb": 15.9}
82
+ [eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
83
+ {"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2686170203344276, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 293}, "mem_gb": 15.79}
84
+ {"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20221849255630125, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 231}, "mem_gb": 15.95}
85
+ {"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40390469683346647, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 302}, "mem_gb": 15.92}
86
+ {"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2807617226639452, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 263}, "mem_gb": 16.06}
87
+ {"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30110994513953726, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 252}, "mem_gb": 16.0}
88
+ {"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4256488866146654, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 344}, "mem_gb": 16.02}
89
+ {"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4049425716850907, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 313}, "mem_gb": 15.95}
90
+ {"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4563928933361545, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 358}, "mem_gb": 15.65}
91
+ {"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23694792136109125, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 267}, "mem_gb": 15.87}
92
+ {"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4430929536218445, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 300}, "mem_gb": 15.75}
93
+ [eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned in their inve'
94
+ {"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3831142380286629, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 348}, "mem_gb": 15.68}
95
+ {"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4549709947705269, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 329}, "mem_gb": 15.77}
96
+ {"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26410754793292535, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 269}, "mem_gb": 15.93}
97
+ {"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5040003249824047, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 358}, "mem_gb": 15.6}
98
+ {"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3173010088674724, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 302}, "mem_gb": 15.86}
99
+ {"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4850937694136053, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 381}, "mem_gb": 15.88}
100
+ {"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5240150058401127, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 379}, "mem_gb": 15.82}
101
+ {"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49111645895807693, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 351}, "mem_gb": 15.64}
102
+ {"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4485870735513046, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 330}, "mem_gb": 15.84}
103
+ {"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46085613527130337, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 316}, "mem_gb": 15.87}
104
+ [eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned from their in'
105
+ {"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32372822478388746, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 276}, "mem_gb": 16.05}
106
+ {"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26338743491986144, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 240}, "mem_gb": 15.99}
107
+ {"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3104773192297357, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 288}, "mem_gb": 15.9}
108
+ {"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28786528626879054, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 271}, "mem_gb": 15.89}
109
+ {"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4272922734250625, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 357}, "mem_gb": 15.84}
110
+ {"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5244793712583992, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 354}, "mem_gb": 15.82}
111
+ {"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.497002431950594, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 302}, "mem_gb": 16.05}
112
+ {"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40084390570086736, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 297}, "mem_gb": 16.04}
113
+ {"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1671384889056906, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 219}, "mem_gb": 16.06}
114
+ {"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4976568130111322, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 306}, "mem_gb": 15.76}
115
+ [eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned in their inve'
116
+ {"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5134388975558182, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 343}, "mem_gb": 15.7}
117
+ {"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48674780464582146, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 341}, "mem_gb": 15.82}
118
+ {"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29540639702435584, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 318}, "mem_gb": 15.76}
119
+ {"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5128412952416886, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 346}, "mem_gb": 15.65}
120
+ {"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27761117947349945, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 277}, "mem_gb": 16.13}
121
+ {"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27264862833109993, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 270}, "mem_gb": 15.86}
122
+ {"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31827018664634477, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 257}, "mem_gb": 16.04}
123
+ {"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47749692158599694, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 363}, "mem_gb": 15.65}
124
+ {"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48287020946058135, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 356}, "mem_gb": 15.79}
125
+ {"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4437348078371336, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 323}, "mem_gb": 15.82}
126
+ [eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
127
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0100
128
+ {"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25946648542390516, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 243}, "mem_gb": 16.07}
129
+ {"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4500130487319082, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 307}, "mem_gb": 15.75}
130
+ {"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4234158966309391, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 346}, "mem_gb": 15.99}
131
+ {"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29989352034293115, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 273}, "mem_gb": 15.99}
132
+ {"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30325903337032845, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 302}, "mem_gb": 15.92}
133
+ {"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.418143850972224, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 337}, "mem_gb": 16.05}
134
+ {"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3265084335938096, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 280}, "mem_gb": 15.93}
135
+ {"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5198403450977678, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 331}, "mem_gb": 15.83}
136
+ {"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.343602961318319, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 314}, "mem_gb": 15.93}
137
+ {"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5266653862896065, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 294}, "mem_gb": 15.86}
138
+ [eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
139
+ {"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2872509206920241, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 274}, "mem_gb": 15.99}
140
+ {"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43661649456371865, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 365}, "mem_gb": 15.71}
141
+ {"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28158201205277195, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 323}, "mem_gb": 15.77}
142
+ {"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20596787228497365, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 234}, "mem_gb": 16.06}
143
+ {"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24601709296579163, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 267}, "mem_gb": 16.06}
144
+ {"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3128123264870917, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 304}, "mem_gb": 15.82}
145
+ {"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45958686599650733, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 21.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 373}, "mem_gb": 15.75}
146
+ {"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2993530566088855, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 300}, "mem_gb": 16.03}
147
+ {"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46588031280909975, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 331}, "mem_gb": 15.87}
148
+ {"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23109093338887518, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 259}, "mem_gb": 16.01}
149
+ [eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
150
+ {"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4344860572297747, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 358}, "mem_gb": 15.63}
151
+ {"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4994027626503259, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 354}, "mem_gb": 15.88}
152
+ {"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25992374626447756, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 279}, "mem_gb": 15.95}
153
+ {"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5045626226827502, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 354}, "mem_gb": 15.7}
154
+ {"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48436241804882885, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 334}, "mem_gb": 15.91}
155
+ {"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48679861746548364, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 327}, "mem_gb": 15.77}
156
+ {"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4536446885818616, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 365}, "mem_gb": 15.87}
157
+ {"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28077293347387267, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 252}, "mem_gb": 16.08}
158
+ {"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2294477305807794, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 256}, "mem_gb": 16.04}
159
+ {"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28099714013809957, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 302}, "mem_gb": 15.82}
160
+ [eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
161
+ {"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43501803406309336, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 350}, "mem_gb": 15.72}
162
+ {"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2883140175284818, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 292}, "mem_gb": 15.84}
163
+ {"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4419534981007998, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 356}, "mem_gb": 15.65}
164
+ {"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32508795569992316, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 347}, "mem_gb": 15.82}
165
+ {"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28389596836206815, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 330}, "mem_gb": 16.01}
166
+ {"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46085288490230836, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 363}, "mem_gb": 15.87}
167
+ {"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42281899355879676, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 354}, "mem_gb": 15.73}
168
+ {"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24912744893214356, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 270}, "mem_gb": 15.99}
169
+ {"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44314692690744995, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 343}, "mem_gb": 15.77}
170
+ {"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103165693245828, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 232}, "mem_gb": 15.96}
171
+ [eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
172
+ {"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40687576603281, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 346}, "mem_gb": 15.91}
173
+ {"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33076479054968805, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 306}, "mem_gb": 16.0}
174
+ {"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23048004940574368, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 273}, "mem_gb": 16.04}
175
+ {"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25523265439958004, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 266}, "mem_gb": 15.86}
176
+ {"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3709006532571589, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 299}, "mem_gb": 16.06}
177
+ {"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27310272046991935, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 259}, "mem_gb": 16.14}
178
+ {"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29872933258082096, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 325}, "mem_gb": 15.88}
179
+ {"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27330009992414467, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 271}, "mem_gb": 15.95}
180
+ {"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41801022604368626, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 359}, "mem_gb": 15.74}
181
+ {"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4207492188954105, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 345}, "mem_gb": 15.8}
182
+ [eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
183
+ checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0150
184
+ wandb: updating run metadata
185
+ wandb: uploading summary, console lines 171-171
186
+ wandb:
187
+ wandb: Run history:
188
+ wandb: comp_len β–‚β–‚β–‚β–…β–†β–„β–…β–ƒβ–„β–„β–ƒβ–‚β–ˆβ–β–‚β–‡β–„β–…β–‚β–„β–β–ƒβ–ƒβ–‚β–„β–†β–ƒβ–…β–…β–‚β–‡β–…β–ƒβ–‚β–†β–ƒβ–β–‡β–…β–‚
189
+ wandb: cumulative_loss_tokens β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–ƒβ–ƒβ–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–†β–†β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆ
190
+ wandb: epoch ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
191
+ wandb: finish_rate β–‚β–ˆβ–‡β–‡β–‡β–ˆβ–†β–ˆβ–‡β–„β–„β–ˆβ–ˆβ–ˆβ–ˆβ–‡β–‡β–†β–ˆβ–†β–„β–‚β–†β–ˆβ–β–ˆβ–ˆβ–ˆβ–ƒβ–‡β–‡β–ˆβ–„β–ˆβ–ˆβ–‡β–‡β–ˆβ–‡β–ˆ
192
+ wandb: forward_topk_kl β–ˆβ–‡β–„β–„β–…β–…β–…β–‚β–‚β–„β–„β–‚β–„β–‚β–‚β–„β–ƒβ–ƒβ–β–ƒβ–ƒβ–ƒβ–ƒβ–‚β–‚β–„β–ƒβ–ƒβ–‚β–‚β–‚β–β–‚β–ƒβ–ƒβ–ƒβ–‚β–‚β–ƒβ–‚
193
+ wandb: grad_norm β–ˆβ–‚β–‚β–‚β–‚β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–β–
194
+ wandb: lr β–β–‚β–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
195
+ wandb: mem_gb β–„β–ƒβ–ˆβ–†β–‡β–ƒβ–‚β–…β–ƒβ–ƒβ–†β–„β–ƒβ–„β–‡β–†β–‡β–„β–‚β–…β–†β–β–„β–„β–‡β–ƒβ–‚β–ƒβ–†β–…β–ƒβ–‚β–…β–ƒβ–†β–†β–…β–ˆβ–…β–„
196
+ wandb: step β–β–β–β–β–β–‚β–‚β–‚β–‚β–‚β–‚β–ƒβ–ƒβ–ƒβ–„β–„β–„β–„β–„β–…β–…β–…β–…β–…β–…β–†β–†β–†β–‡β–‡β–‡β–‡β–‡β–‡β–‡β–ˆβ–ˆβ–ˆβ–ˆβ–ˆ
197
+ wandb: t_data_s ▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁▁
198
+ wandb: +3 ...
199
+ wandb:
200
+ wandb: Run summary:
201
+ wandb: comp_len 347.8
202
+ wandb: cumulative_loss_tokens 18000000
203
+ wandb: epoch 0
204
+ wandb: finish_rate 0.997
205
+ wandb: forward_topk_kl 0.42075
206
+ wandb: grad_norm 0.61328
207
+ wandb: lr 3e-05
208
+ wandb: mem_gb 15.8
209
+ wandb: step 150
210
+ wandb: t_data_s 0
211
+ wandb: +4 ...
212
+ wandb:
213
+ wandb: πŸš€ View run uniform_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/056290eo
214
+ wandb: ⭐️ View project at: https://wandb.ai/hbfreed/glean-general-grid
215
+ wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
216
+ wandb: Find logs at: outputs/healed/grid_general/uniform_keep50_s1225/wandb/run-20260718_124640-056290eo/logs
healed/grid_general/uniform_keep50_s1225.eval.log ADDED
The diff for this file is too large to render. See raw diff