Add files using upload-large-folder tool
Browse filesThis view is limited to 50 files because it contains too many changes. Β See raw diff
- healed/canary_512_g4/args.json +44 -0
- healed/canary_512_g4/train_log.jsonl +7 -0
- healed/canary_512_g4/vllm_server.log +265 -0
- healed/grid_general/gengrid.log +160 -0
- healed/grid_general/glean_keep25_s1224.console.log +213 -0
- healed/grid_general/glean_keep25_s1224.eval.log +0 -0
- healed/grid_general/glean_keep25_s1225.console.log +213 -0
- healed/grid_general/glean_keep25_s1225.eval.log +0 -0
- healed/grid_general/glean_keep25_s1226.console.log +212 -0
- healed/grid_general/glean_keep25_s1226.eval.log +0 -0
- healed/grid_general/glean_keep50_s1224.console.log +216 -0
- healed/grid_general/glean_keep50_s1224.eval.log +0 -0
- healed/grid_general/glean_keep50_s1225.console.log +216 -0
- healed/grid_general/glean_keep50_s1225.eval.log +0 -0
- healed/grid_general/glean_keep50_s1226.console.log +216 -0
- healed/grid_general/glean_keep50_s1226.eval.log +0 -0
- healed/grid_general/glean_keep75_s1224.console.log +216 -0
- healed/grid_general/glean_keep75_s1224.eval.log +0 -0
- healed/grid_general/glean_keep75_s1225.console.log +215 -0
- healed/grid_general/glean_keep75_s1225.eval.log +0 -0
- healed/grid_general/glean_keep75_s1226.console.log +215 -0
- healed/grid_general/glean_keep75_s1226.eval.log +0 -0
- healed/grid_general/reap_keep25_s1224.console.log +213 -0
- healed/grid_general/reap_keep25_s1224.eval.log +0 -0
- healed/grid_general/reap_keep25_s1225.console.log +213 -0
- healed/grid_general/reap_keep25_s1225.eval.log +0 -0
- healed/grid_general/reap_keep25_s1226.console.log +213 -0
- healed/grid_general/reap_keep25_s1226.eval.log +0 -0
- healed/grid_general/reap_keep50_s1224.console.log +215 -0
- healed/grid_general/reap_keep50_s1224.eval.log +0 -0
- healed/grid_general/reap_keep50_s1225.console.log +216 -0
- healed/grid_general/reap_keep50_s1225.eval.log +70 -0
- healed/grid_general/reap_keep50_s1226.console.log +217 -0
- healed/grid_general/reap_keep50_s1226.eval.log +0 -0
- healed/grid_general/reap_keep75_s1224.console.log +216 -0
- healed/grid_general/reap_keep75_s1224.eval.log +0 -0
- healed/grid_general/reap_keep75_s1225.console.log +392 -0
- healed/grid_general/reap_keep75_s1225.eval.log +0 -0
- healed/grid_general/reap_keep75_s1226.console.log +215 -0
- healed/grid_general/reap_keep75_s1226.eval.log +71 -0
- healed/grid_general/uniform_keep25_s1224.console.log +212 -0
- healed/grid_general/uniform_keep25_s1224.eval.log +0 -0
- healed/grid_general/uniform_keep25_s1225.console.log +212 -0
- healed/grid_general/uniform_keep25_s1225.eval.log +0 -0
- healed/grid_general/uniform_keep25_s1226.console.log +213 -0
- healed/grid_general/uniform_keep25_s1226.eval.log +0 -0
- healed/grid_general/uniform_keep50_s1224.console.log +215 -0
- healed/grid_general/uniform_keep50_s1224.eval.log +0 -0
- healed/grid_general/uniform_keep50_s1225.console.log +216 -0
- healed/grid_general/uniform_keep50_s1225.eval.log +0 -0
healed/canary_512_g4/args.json
ADDED
|
@@ -0,0 +1,44 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"student": "outputs/pruned/glean-0125inst-math-keep5",
|
| 3 |
+
"teacher": "allenai/OLMoE-1B-7B-0125-Instruct",
|
| 4 |
+
"dataset": "allenai/RLVR-MATH",
|
| 5 |
+
"dataset_sources": null,
|
| 6 |
+
"max_difficulty": null,
|
| 7 |
+
"teacher_device": "cuda:0",
|
| 8 |
+
"student_device": "cuda:1",
|
| 9 |
+
"lr": 3e-05,
|
| 10 |
+
"optimizer": "adamw8bit",
|
| 11 |
+
"weight_decay": 0.1,
|
| 12 |
+
"epochs": 4,
|
| 13 |
+
"prompts_per_step": 256,
|
| 14 |
+
"group_size": 4,
|
| 15 |
+
"rollout_batch": 64,
|
| 16 |
+
"micro_batch": 4,
|
| 17 |
+
"max_new_tokens": 512,
|
| 18 |
+
"max_prompt_len": 1024,
|
| 19 |
+
"warmup_steps": 5,
|
| 20 |
+
"max_grad_norm": 1.0,
|
| 21 |
+
"eval_every": 10,
|
| 22 |
+
"gsm8k_every": 5,
|
| 23 |
+
"gsm8k_n": 64,
|
| 24 |
+
"gsm8k_batch": 16,
|
| 25 |
+
"save_every": 25,
|
| 26 |
+
"out_dir": "outputs/healed/canary_512_g4",
|
| 27 |
+
"sweep": 5,
|
| 28 |
+
"wandb": false,
|
| 29 |
+
"wandb_project": "glean-heal",
|
| 30 |
+
"wandb_run_name": null,
|
| 31 |
+
"debug": false,
|
| 32 |
+
"resume_from": null,
|
| 33 |
+
"start_step": 0,
|
| 34 |
+
"no_grad_checkpointing": false,
|
| 35 |
+
"seed": 1223,
|
| 36 |
+
"rollout_engine": "vllm",
|
| 37 |
+
"vllm_gpu": "GPU-864c54df-0130-7780-e271-8a5551d1733f",
|
| 38 |
+
"vllm_port": 8377,
|
| 39 |
+
"vllm_refresh_every": 1,
|
| 40 |
+
"vllm_serve_bin": "vllm-plugin/.venv25/bin/python",
|
| 41 |
+
"vllm_gpu_mem_util": 0.85,
|
| 42 |
+
"vllm_refresh_mode": "reload",
|
| 43 |
+
"vllm_live_dir": "/dev/shm/glean_vllm_live"
|
| 44 |
+
}
|
healed/canary_512_g4/train_log.jsonl
ADDED
|
@@ -0,0 +1,7 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"step": 1, "epoch": 0, "reverse_kl": 0.30979594500512125, "tokens": 104839, "grad_norm": 4.75, "lr": 1.2e-05, "finish_rate": 0.461, "comp_len": 409.5, "t_rollout_s": 36.5, "t_step_s": 149.9, "t_refresh_s": 0.4, "mem_gb": 16.88}
|
| 2 |
+
{"step": 1, "gsm8k_quick": 0.484375, "gsm8k_n": 64, "t_eval_s": 46.3}
|
| 3 |
+
{"step": 2, "epoch": 0, "reverse_kl": 0.31237369027154915, "tokens": 97970, "grad_norm": 4.3125, "lr": 1.8e-05, "finish_rate": 0.586, "comp_len": 382.7, "t_rollout_s": 34.5, "t_step_s": 135.4, "t_refresh_s": 0.4, "mem_gb": 18.64}
|
| 4 |
+
{"step": 3, "epoch": 0, "reverse_kl": 0.21176254702495886, "tokens": 100793, "grad_norm": 3.734375, "lr": 2.4e-05, "finish_rate": 0.52, "comp_len": 393.7, "t_rollout_s": 35.2, "t_step_s": 136.0, "t_refresh_s": 0.4, "mem_gb": 17.01}
|
| 5 |
+
{"step": 4, "epoch": 0, "reverse_kl": 0.22271002861383504, "tokens": 81381, "grad_norm": 4.75, "lr": 3e-05, "finish_rate": 0.703, "comp_len": 317.9, "t_rollout_s": 30.9, "t_step_s": 126.4, "t_refresh_s": 0.4, "mem_gb": 16.89}
|
| 6 |
+
{"step": 5, "epoch": 0, "reverse_kl": 0.19559442095853996, "tokens": 91708, "grad_norm": 2.578125, "lr": 3e-05, "finish_rate": 0.629, "comp_len": 358.2, "t_rollout_s": 33.8, "t_step_s": 120.9, "t_refresh_s": 0.0, "mem_gb": 17.05}
|
| 7 |
+
{"step": 5, "gsm8k_quick": 0.453125, "gsm8k_n": 64, "t_eval_s": 33.7}
|
healed/canary_512_g4/vllm_server.log
ADDED
|
@@ -0,0 +1,265 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339]
|
| 2 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] β β ββ ββ
|
| 3 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] ββ ββ β β β βββ β version 0.25.0
|
| 4 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] ββββ β β β β model outputs/pruned/glean-0125inst-math-keep5
|
| 5 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339] ββ βββββ βββββ β β
|
| 6 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:339]
|
| 7 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [api_utils.py:273] non-default args: {'model_tag': 'outputs/pruned/glean-0125inst-math-keep5', 'host': '127.0.0.1', 'port': 8377, 'model': 'outputs/pruned/glean-0125inst-math-keep5', 'max_model_len': 2048, 'enforce_eager': True, 'served_model_name': ['student'], 'gpu_memory_utilization': 0.85}
|
| 8 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [model.py:619] Resolved architecture: OlmoeForCausalLM
|
| 9 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [model.py:1776] Using max model len 2048
|
| 10 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [vllm.py:1042] Asynchronous scheduling is enabled.
|
| 11 |
+
(APIServer pid=313310) WARNING 07-12 09:45:06 [vllm.py:1096] Enforce eager set, disabling torch.compile and CUDAGraphs. This is equivalent to setting -cc.mode=none -cc.cudagraph_mode=none
|
| 12 |
+
(APIServer pid=313310) WARNING 07-12 09:45:06 [vllm.py:1144] Inductor compilation was disabled by user settings, optimizations settings that are only active during inductor compilation will be ignored.
|
| 13 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [kernel.py:292] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'])
|
| 14 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [vllm.py:1322] Cudagraph is disabled under eager mode
|
| 15 |
+
(APIServer pid=313310) INFO 07-12 09:45:06 [compilation.py:312] Enabled custom fusions: norm_quant, act_quant
|
| 16 |
+
(EngineCore pid=313432) INFO 07-12 09:45:13 [core.py:114] Initializing a V1 LLM engine (v0.25.0) with config: model='outputs/pruned/glean-0125inst-math-keep5', speculative_config=None, tokenizer='outputs/pruned/glean-0125inst-math-keep5', skip_tokenizer_init=False, tokenizer_mode=auto, revision=None, tokenizer_revision=None, trust_remote_code=False, dtype=torch.bfloat16, max_seq_len=2048, download_dir=None, load_format=auto, tensor_parallel_size=1, pipeline_parallel_size=1, data_parallel_size=1, decode_context_parallel_size=1, dcp_comm_backend=ag_rs, disable_custom_all_reduce=False, quantization=None, quantization_config=None, enforce_eager=True, enable_return_routed_experts=False, kv_cache_dtype=auto, device_config=cuda, structured_outputs_config=StructuredOutputsConfig(backend='auto', disable_any_whitespace=False, disable_additional_properties=False, reasoning_parser='', reasoning_parser_plugin='', enable_in_reasoning=False), observability_config=ObservabilityConfig(show_hidden_metrics_for_version=None, otlp_traces_endpoint=None, collect_detailed_traces=None, kv_cache_metrics=False, kv_cache_metrics_sample=0.01, cudagraph_metrics=False, enable_layerwise_nvtx_tracing=False, enable_mfu_metrics=False, enable_mm_processor_stats=False, enable_logging_iteration_details=False, jit_monitor_mode='warn', jit_monitor_verbose=False), seed=0, served_model_name=student, enable_prefix_caching=True, enable_chunked_prefill=True, pooler_config=None, compilation_config={'mode': <CompilationMode.NONE: 0>, 'debug_dump_path': None, 'cache_dir': '', 'compile_cache_save_format': 'binary', 'backend': 'inductor', 'custom_ops': ['all'], 'ir_enable_torch_wrap': False, 'splitting_ops': [], 'compile_mm_encoder': False, 'cudagraph_mm_encoder': False, 'encoder_cudagraph_token_budgets': [], 'encoder_cudagraph_max_vision_items_per_batch': 0, 'encoder_cudagraph_max_frames_per_batch': None, 'compile_sizes': [], 'compile_ranges_endpoints': [2048], 'inductor_compile_config': {'enable_auto_functionalized_v2': False, 'size_asserts': False, 'alignment_asserts': False, 'scalar_asserts': False, 'combo_kernels': True, 'benchmark_combo_kernel': True}, 'inductor_passes': {}, 'cudagraph_mode': <CUDAGraphMode.NONE: 0>, 'cudagraph_num_of_warmups': 0, 'cudagraph_capture_sizes': [], 'cudagraph_copy_inputs': False, 'cudagraph_specialize_lora': True, 'use_inductor_graph_partition': False, 'pass_config': {'fuse_norm_quant': True, 'fuse_act_quant': True, 'fuse_attn_quant': False, 'enable_sp': False, 'fuse_gemm_comms': False, 'fuse_allreduce_rms': False, 'fuse_rope_kvcache_cat_mla': False, 'fuse_act_padding': False}, 'max_cudagraph_capture_size': 0, 'dynamic_shapes_config': {'type': <DynamicShapesType.BACKED: 'backed'>, 'evaluate_guards': False, 'assume_32_bit_indexing': False}, 'local_cache_dir': None, 'fast_moe_cold_start': False, 'static_all_moe_layers': []}, kernel_config=KernelConfig(ir_op_priority=IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native']), enable_flashinfer_autotune=True, enable_cutedsl_warmup=True, moe_backend='auto', linear_backend='auto')
|
| 17 |
+
(EngineCore pid=313432) INFO 07-12 09:45:14 [parallel_state.py:1607] world_size=1 rank=0 local_rank=0 distributed_init_method=tcp://192.168.0.15:44129 backend=nccl
|
| 18 |
+
(EngineCore pid=313432) INFO 07-12 09:45:14 [parallel_state.py:1942] rank 0 in world size 1 is assigned as DP rank 0, PP rank 0, PCP rank 0, TP rank 0, EP rank 0, EPLB rank N/A
|
| 19 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [topk_topp_sampler.py:55] Using FlashInfer for top-p & top-k sampling.
|
| 20 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [gpu_model_runner.py:5209] Starting to load model outputs/pruned/glean-0125inst-math-keep5...
|
| 21 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [cuda.py:476] Using FLASH_ATTN attention backend out of potential backends: ['FLASH_ATTN', 'FLASHINFER', 'TRITON_ATTN', 'FLEX_ATTENTION'].
|
| 22 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [flash_attn.py:718] Using FlashAttention version 2
|
| 23 |
+
(EngineCore pid=313432) /home/henry/Documents/PythonProjects/megablocks-variable/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 24 |
+
(EngineCore pid=313432) warnings.warn('Grouped GEMM not available.')
|
| 25 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [weight_utils.py:849] Filesystem type for checkpoints: EXT4. Checkpoint size: 6.89 GiB. Available RAM: 103.24 GiB.
|
| 26 |
+
(EngineCore pid=313432) INFO 07-12 09:45:15 [weight_utils.py:872] Auto-prefetch is disabled because the filesystem (EXT4) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
|
| 27 |
+
(EngineCore pid=313432)
|
| 28 |
+
(EngineCore pid=313432)
|
| 29 |
+
(EngineCore pid=313432)
|
| 30 |
+
(EngineCore pid=313432)
|
| 31 |
+
(EngineCore pid=313432)
|
| 32 |
+
(EngineCore pid=313432) INFO 07-12 09:45:21 [default_loader.py:430] Loading weights took 5.17 seconds
|
| 33 |
+
(EngineCore pid=313432) INFO 07-12 09:45:21 [gpu_model_runner.py:5306] Model loading took 6.89 GiB memory and 5.349585 seconds
|
| 34 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [gpu_worker.py:538] Available KV cache memory: 12.81 GiB
|
| 35 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [kv_cache_utils.py:2146] GPU KV cache size: 104,960 tokens
|
| 36 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [kv_cache_utils.py:2147] Maximum concurrency for 2,048 tokens per request: 51.25x
|
| 37 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [cutedsl_warmup.py:97] Skipping CuTeDSL warmup because no compile units were requested.
|
| 38 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [jit_monitor.py:73] Kernel JIT monitor activated; monitored JIT compilations during inference will use mode=warn.
|
| 39 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [core.py:344] init engine (profile, create kv cache, warmup model) took 2.10 s
|
| 40 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [vllm.py:1042] Asynchronous scheduling is enabled.
|
| 41 |
+
(EngineCore pid=313432) WARNING 07-12 09:45:23 [vllm.py:1096] Enforce eager set, disabling torch.compile and CUDAGraphs. This is equivalent to setting -cc.mode=none -cc.cudagraph_mode=none
|
| 42 |
+
(EngineCore pid=313432) WARNING 07-12 09:45:23 [vllm.py:1144] Inductor compilation was disabled by user settings, optimizations settings that are only active during inductor compilation will be ignored.
|
| 43 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [kernel.py:292] Final IR op priority after setting platform defaults: IrOpPriorityConfig(rms_norm=['vllm_c', 'native'], fused_add_rms_norm=['vllm_c', 'native'])
|
| 44 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [vllm.py:1322] Cudagraph is disabled under eager mode
|
| 45 |
+
(EngineCore pid=313432) INFO 07-12 09:45:23 [compilation.py:312] Enabled custom fusions: norm_quant, act_quant
|
| 46 |
+
(APIServer pid=313310) INFO 07-12 09:45:23 [api_server.py:612] Supported tasks: ['generate']
|
| 47 |
+
(APIServer pid=313310) WARNING 07-12 09:45:23 [__init__.py:36] SECURITY WARNING: Development endpoints are enabled! This should NOT be used in production!
|
| 48 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [hf.py:548] Detected the chat template content format to be 'string'. You can set `--chat-template-content-format` to override this.
|
| 49 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [api_server.py:616] Starting vLLM server on http://127.0.0.1:8377
|
| 50 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:37] Available routes are:
|
| 51 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /openapi.json, Methods: HEAD, GET
|
| 52 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /docs, Methods: HEAD, GET
|
| 53 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /docs/oauth2-redirect, Methods: HEAD, GET
|
| 54 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /redoc, Methods: HEAD, GET
|
| 55 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /load, Methods: GET
|
| 56 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /version, Methods: GET
|
| 57 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /health, Methods: GET
|
| 58 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /metrics, Methods: GET
|
| 59 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /tokenize, Methods: POST
|
| 60 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /detokenize, Methods: POST
|
| 61 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/models, Methods: GET
|
| 62 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /ping, Methods: GET
|
| 63 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /ping, Methods: POST
|
| 64 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /invocations, Methods: POST
|
| 65 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_prefix_cache, Methods: POST
|
| 66 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_mm_cache, Methods: POST
|
| 67 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /reset_encoder_cache, Methods: POST
|
| 68 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /pause, Methods: POST
|
| 69 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /resume, Methods: POST
|
| 70 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_paused, Methods: GET
|
| 71 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /init_weight_transfer_engine, Methods: POST
|
| 72 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /start_weight_update, Methods: POST
|
| 73 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /update_weights, Methods: POST
|
| 74 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /finish_weight_update, Methods: POST
|
| 75 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /get_world_size, Methods: GET
|
| 76 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /collective_rpc, Methods: POST
|
| 77 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /server_info, Methods: GET
|
| 78 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /sleep, Methods: POST
|
| 79 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /wake_up, Methods: POST
|
| 80 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_sleeping, Methods: GET
|
| 81 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions, Methods: POST
|
| 82 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/batch, Methods: POST
|
| 83 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses, Methods: POST
|
| 84 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses/{response_id}, Methods: GET
|
| 85 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/responses/{response_id}/cancel, Methods: POST
|
| 86 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions, Methods: POST
|
| 87 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/messages, Methods: POST
|
| 88 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/messages/count_tokens, Methods: POST
|
| 89 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /generative_scoring, Methods: POST
|
| 90 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /scale_elastic_ep, Methods: POST
|
| 91 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /is_scaling_elastic_ep, Methods: POST
|
| 92 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/render, Methods: POST
|
| 93 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions/render, Methods: POST
|
| 94 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/chat/completions/derender, Methods: POST
|
| 95 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /v1/completions/derender, Methods: POST
|
| 96 |
+
(APIServer pid=313310) INFO 07-12 09:45:24 [launcher.py:46] Route: /inference/v1/generate, Methods: POST
|
| 97 |
+
(APIServer pid=313310) INFO: Started server process [313310]
|
| 98 |
+
(APIServer pid=313310) INFO: Waiting for application startup.
|
| 99 |
+
(APIServer pid=313310) INFO: Application startup complete.
|
| 100 |
+
(APIServer pid=313310) INFO: 127.0.0.1:45706 - "GET /health HTTP/1.1" 200 OK
|
| 101 |
+
(APIServer pid=313310) INFO 07-12 09:45:34 [loggers.py:273] Engine 000: Avg prompt throughput: 761.1 tokens/s, Avg generation throughput: 1012.8 tokens/s, Running: 256 reqs, Waiting: 0 reqs, GPU KV cache usage: 19.5%, Prefix cache hit rate: 94.9%
|
| 102 |
+
(APIServer pid=313310) INFO 07-12 09:45:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3440.7 tokens/s, Running: 229 reqs, Waiting: 0 reqs, GPU KV cache usage: 48.7%, Prefix cache hit rate: 94.9%
|
| 103 |
+
(APIServer pid=313310) INFO 07-12 09:45:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2944.2 tokens/s, Running: 187 reqs, Waiting: 0 reqs, GPU KV cache usage: 65.3%, Prefix cache hit rate: 94.9%
|
| 104 |
+
(APIServer pid=313310) INFO 07-12 09:46:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2466.3 tokens/s, Running: 144 reqs, Waiting: 0 reqs, GPU KV cache usage: 71.7%, Prefix cache hit rate: 94.9%
|
| 105 |
+
(APIServer pid=313310) INFO: 127.0.0.1:60678 - "POST /v1/completions HTTP/1.1" 200 OK
|
| 106 |
+
(APIServer pid=313310) INFO 07-12 09:46:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 563.3 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.9%
|
| 107 |
+
(APIServer pid=313310) INFO 07-12 09:46:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.9%
|
| 108 |
+
(EngineCore pid=313432) INFO 07-12 09:48:00 [gpu_model_runner.py:5484] Reloading weights inplace...
|
| 109 |
+
(EngineCore pid=313432) INFO 07-12 09:48:00 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 81.72 GiB.
|
| 110 |
+
(EngineCore pid=313432) INFO 07-12 09:48:00 [weight_utils.py:872] Auto-prefetch is disabled because the filesystem (TMPFS) is not a recognized network FS (NFS/Lustre). If you want to force prefetching, start vLLM with --safetensors-load-strategy=prefetch.
|
| 111 |
+
(EngineCore pid=313432)
|
| 112 |
+
(EngineCore pid=313432)
|
| 113 |
+
(EngineCore pid=313432)
|
| 114 |
+
(EngineCore pid=313432)
|
| 115 |
+
(EngineCore pid=313432)
|
| 116 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] RotaryEmbedding: Failed to load weights
|
| 117 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 118 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 119 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 120 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 121 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 122 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 123 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 124 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 125 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 126 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 127 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 128 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 129 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 130 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 131 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 132 |
+
(EngineCore pid=313432) WARNING 07-12 09:48:00 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 133 |
+
(EngineCore pid=313432) INFO 07-12 09:48:00 [gpu_model_runner.py:5506] Reloading and processing weights took 0.38 seconds
|
| 134 |
+
(APIServer pid=313310) INFO: 127.0.0.1:59108 - "POST /collective_rpc HTTP/1.1" 200 OK
|
| 135 |
+
(APIServer pid=313310) INFO 07-12 09:48:00 [api_router.py:38] Resetting prefix cache...
|
| 136 |
+
(EngineCore pid=313432) INFO 07-12 09:48:00 [block_pool.py:685] Successfully reset prefix cache
|
| 137 |
+
(APIServer pid=313310) INFO: 127.0.0.1:59112 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
|
| 138 |
+
(APIServer pid=313310) INFO 07-12 09:48:54 [loggers.py:273] Engine 000: Avg prompt throughput: 722.2 tokens/s, Avg generation throughput: 1657.4 tokens/s, Running: 255 reqs, Waiting: 0 reqs, GPU KV cache usage: 24.1%, Prefix cache hit rate: 95.3%
|
| 139 |
+
(APIServer pid=313310) INFO 07-12 09:49:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3331.0 tokens/s, Running: 210 reqs, Waiting: 0 reqs, GPU KV cache usage: 49.4%, Prefix cache hit rate: 95.3%
|
| 140 |
+
(APIServer pid=313310) INFO 07-12 09:49:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2774.3 tokens/s, Running: 160 reqs, Waiting: 0 reqs, GPU KV cache usage: 61.4%, Prefix cache hit rate: 95.3%
|
| 141 |
+
(APIServer pid=313310) INFO: 127.0.0.1:34838 - "POST /v1/completions HTTP/1.1" 200 OK
|
| 142 |
+
(APIServer pid=313310) INFO 07-12 09:49:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2032.8 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.3%
|
| 143 |
+
(APIServer pid=313310) INFO 07-12 09:49:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.3%
|
| 144 |
+
(EngineCore pid=313432) INFO 07-12 09:51:04 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 81.16 GiB.
|
| 145 |
+
(EngineCore pid=313432)
|
| 146 |
+
(EngineCore pid=313432)
|
| 147 |
+
(EngineCore pid=313432)
|
| 148 |
+
(EngineCore pid=313432)
|
| 149 |
+
(EngineCore pid=313432)
|
| 150 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] RotaryEmbedding: Failed to load weights
|
| 151 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 152 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 153 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 154 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 155 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 156 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 157 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 158 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 159 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 160 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 161 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 162 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 163 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 164 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 165 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 166 |
+
(EngineCore pid=313432) WARNING 07-12 09:51:04 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 167 |
+
(EngineCore pid=313432) INFO 07-12 09:51:04 [gpu_model_runner.py:5506] Reloading and processing weights took 0.36 seconds
|
| 168 |
+
(APIServer pid=313310) INFO: 127.0.0.1:34692 - "POST /collective_rpc HTTP/1.1" 200 OK
|
| 169 |
+
(APIServer pid=313310) INFO 07-12 09:51:04 [api_router.py:38] Resetting prefix cache...
|
| 170 |
+
(EngineCore pid=313432) INFO 07-12 09:51:04 [block_pool.py:685] Successfully reset prefix cache
|
| 171 |
+
(APIServer pid=313310) INFO: 127.0.0.1:34700 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
|
| 172 |
+
(APIServer pid=313310) INFO 07-12 09:51:14 [loggers.py:273] Engine 000: Avg prompt throughput: 708.4 tokens/s, Avg generation throughput: 3214.8 tokens/s, Running: 236 reqs, Waiting: 0 reqs, GPU KV cache usage: 37.3%, Prefix cache hit rate: 95.4%
|
| 173 |
+
(APIServer pid=313310) INFO 07-12 09:51:24 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3086.4 tokens/s, Running: 193 reqs, Waiting: 0 reqs, GPU KV cache usage: 57.4%, Prefix cache hit rate: 95.4%
|
| 174 |
+
(APIServer pid=313310) INFO 07-12 09:51:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2572.9 tokens/s, Running: 147 reqs, Waiting: 0 reqs, GPU KV cache usage: 65.6%, Prefix cache hit rate: 95.4%
|
| 175 |
+
(APIServer pid=313310) INFO: 127.0.0.1:34708 - "POST /v1/completions HTTP/1.1" 200 OK
|
| 176 |
+
(APIServer pid=313310) INFO 07-12 09:51:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1204.1 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.4%
|
| 177 |
+
(APIServer pid=313310) INFO 07-12 09:51:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.4%
|
| 178 |
+
(EngineCore pid=313432) INFO 07-12 09:53:20 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 80.95 GiB.
|
| 179 |
+
(EngineCore pid=313432)
|
| 180 |
+
(EngineCore pid=313432)
|
| 181 |
+
(EngineCore pid=313432)
|
| 182 |
+
(EngineCore pid=313432)
|
| 183 |
+
(EngineCore pid=313432)
|
| 184 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] RotaryEmbedding: Failed to load weights
|
| 185 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 186 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 187 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 188 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 189 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 190 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 191 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 192 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 193 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 194 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 195 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 196 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 197 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 198 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 199 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 200 |
+
(EngineCore pid=313432) WARNING 07-12 09:53:20 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 201 |
+
(EngineCore pid=313432) INFO 07-12 09:53:20 [gpu_model_runner.py:5506] Reloading and processing weights took 0.37 seconds
|
| 202 |
+
(APIServer pid=313310) INFO: 127.0.0.1:46922 - "POST /collective_rpc HTTP/1.1" 200 OK
|
| 203 |
+
(APIServer pid=313310) INFO 07-12 09:53:20 [api_router.py:38] Resetting prefix cache...
|
| 204 |
+
(EngineCore pid=313432) INFO 07-12 09:53:20 [block_pool.py:685] Successfully reset prefix cache
|
| 205 |
+
(APIServer pid=313310) INFO: 127.0.0.1:46934 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
|
| 206 |
+
(APIServer pid=313310) INFO 07-12 09:53:24 [loggers.py:273] Engine 000: Avg prompt throughput: 653.6 tokens/s, Avg generation throughput: 1152.1 tokens/s, Running: 253 reqs, Waiting: 0 reqs, GPU KV cache usage: 18.9%, Prefix cache hit rate: 95.7%
|
| 207 |
+
(APIServer pid=313310) INFO 07-12 09:53:34 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3232.5 tokens/s, Running: 175 reqs, Waiting: 0 reqs, GPU KV cache usage: 38.9%, Prefix cache hit rate: 95.7%
|
| 208 |
+
(APIServer pid=313310) INFO 07-12 09:53:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2418.4 tokens/s, Running: 112 reqs, Waiting: 0 reqs, GPU KV cache usage: 44.4%, Prefix cache hit rate: 95.7%
|
| 209 |
+
(APIServer pid=313310) INFO: 127.0.0.1:46942 - "POST /v1/completions HTTP/1.1" 200 OK
|
| 210 |
+
(APIServer pid=313310) INFO 07-12 09:53:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1334.4 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.7%
|
| 211 |
+
(APIServer pid=313310) INFO 07-12 09:54:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 95.7%
|
| 212 |
+
(EngineCore pid=313432) INFO 07-12 09:55:26 [weight_utils.py:849] Filesystem type for checkpoints: TMPFS. Checkpoint size: 6.89 GiB. Available RAM: 80.88 GiB.
|
| 213 |
+
(EngineCore pid=313432)
|
| 214 |
+
(EngineCore pid=313432)
|
| 215 |
+
(EngineCore pid=313432)
|
| 216 |
+
(EngineCore pid=313432)
|
| 217 |
+
(EngineCore pid=313432)
|
| 218 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] RotaryEmbedding: Failed to load weights
|
| 219 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 220 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 221 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 222 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 223 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 224 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 225 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 226 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 227 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 228 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 229 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 230 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 231 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 232 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 233 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 234 |
+
(EngineCore pid=313432) WARNING 07-12 09:55:27 [layerwise.py:264] VllmVariableOlmoeMoE: Failed to load weights
|
| 235 |
+
(EngineCore pid=313432) INFO 07-12 09:55:27 [gpu_model_runner.py:5506] Reloading and processing weights took 0.36 seconds
|
| 236 |
+
(APIServer pid=313310) INFO: 127.0.0.1:60246 - "POST /collective_rpc HTTP/1.1" 200 OK
|
| 237 |
+
(APIServer pid=313310) INFO 07-12 09:55:27 [api_router.py:38] Resetting prefix cache...
|
| 238 |
+
(EngineCore pid=313432) INFO 07-12 09:55:27 [block_pool.py:685] Successfully reset prefix cache
|
| 239 |
+
(APIServer pid=313310) INFO: 127.0.0.1:60248 - "POST /reset_prefix_cache HTTP/1.1" 200 OK
|
| 240 |
+
(APIServer pid=313310) INFO 07-12 09:55:34 [loggers.py:273] Engine 000: Avg prompt throughput: 867.9 tokens/s, Avg generation throughput: 2331.0 tokens/s, Running: 238 reqs, Waiting: 0 reqs, GPU KV cache usage: 30.9%, Prefix cache hit rate: 94.6%
|
| 241 |
+
(APIServer pid=313310) INFO 07-12 09:55:44 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 3106.6 tokens/s, Running: 182 reqs, Waiting: 0 reqs, GPU KV cache usage: 49.8%, Prefix cache hit rate: 94.6%
|
| 242 |
+
(APIServer pid=313310) INFO 07-12 09:55:54 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 2462.0 tokens/s, Running: 127 reqs, Waiting: 0 reqs, GPU KV cache usage: 55.3%, Prefix cache hit rate: 94.6%
|
| 243 |
+
(APIServer pid=313310) INFO: 127.0.0.1:60262 - "POST /v1/completions HTTP/1.1" 200 OK
|
| 244 |
+
(APIServer pid=313310) INFO 07-12 09:56:04 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 1270.7 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.6%
|
| 245 |
+
(APIServer pid=313310) INFO 07-12 09:56:14 [loggers.py:273] Engine 000: Avg prompt throughput: 0.0 tokens/s, Avg generation throughput: 0.0 tokens/s, Running: 0 reqs, Waiting: 0 reqs, GPU KV cache usage: 0.0%, Prefix cache hit rate: 94.6%
|
| 246 |
+
(EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1214] [shutdown] EngineCore: trigger received signal=SIGTERM
|
| 247 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:100] [shutdown] API server: shutdown triggered
|
| 248 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:116] [shutdown] API server: stopping engine client mode=abort timeout=0s
|
| 249 |
+
(EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1333] [shutdown] EngineCore: start mode=abort timeout=0s
|
| 250 |
+
(EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1364] [shutdown] EngineCore: request processing complete; starting resource teardown
|
| 251 |
+
(EngineCore pid=313432) INFO 07-12 09:58:17 [core.py:1227] [shutdown] EngineCore: exiting busy loop
|
| 252 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:655] [shutdown] MPClient: start timeout=0s
|
| 253 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:657] [shutdown] MPClient: stopping engine manager
|
| 254 |
+
(APIServer pid=313310) WARNING 07-12 09:58:17 [utils.py:626] [shutdown] Process manager: force killing remaining processes count=1
|
| 255 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:659] [shutdown] MPClient: engine manager stopped
|
| 256 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:660] [shutdown] MPClient: cleaning up background resources
|
| 257 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [core_client.py:662] [shutdown] MPClient: complete
|
| 258 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:125] [shutdown] API server: engine client stopped
|
| 259 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:128] [shutdown] API server: signalling HTTP server shutdown
|
| 260 |
+
(APIServer pid=313310) INFO 07-12 09:58:17 [launcher.py:149] [shutdown] API server: shutting down FastAPI HTTP server
|
| 261 |
+
(APIServer pid=313310) INFO: Shutting down
|
| 262 |
+
(APIServer pid=313310) INFO: Waiting for application shutdown.
|
| 263 |
+
(APIServer pid=313310) INFO: Application shutdown complete.
|
| 264 |
+
/home/henry/.local/share/uv/python/cpython-3.12.12-linux-x86_64-gnu/lib/python3.12/multiprocessing/resource_tracker.py:279: UserWarning: resource_tracker: There appear to be 1 leaked semaphore objects to clean up at shutdown
|
| 265 |
+
warnings.warn('resource_tracker: There appear to be %d '
|
healed/grid_general/gengrid.log
ADDED
|
@@ -0,0 +1,160 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
2026-07-17T12:49:16-07:00 ###### GENERAL HEAL GRID START ######
|
| 2 |
+
2026-07-17T12:49:16-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
|
| 3 |
+
2026-07-17T12:49:16-07:00 HEAL glean_keep25_s1224 on GPU 0
|
| 4 |
+
2026-07-17T12:51:46-07:00 HEAL glean_keep25_s1225 on GPU 1
|
| 5 |
+
2026-07-17T12:54:16-07:00 HEAL glean_keep25_s1226 on GPU 2
|
| 6 |
+
2026-07-17T14:37:21-07:00 EVAL glean_keep25_s1225 on GPU 1 (port 8421)
|
| 7 |
+
2026-07-17T14:38:49-07:00 EVAL glean_keep25_s1226 on GPU 2 (port 8422)
|
| 8 |
+
2026-07-17T14:46:16-07:00 EVAL glean_keep25_s1224 on GPU 0 (port 8420)
|
| 9 |
+
2026-07-17T14:54:32-07:00 glean_keep25_s1225 done -> outputs/evals/general_suite/healed/glean_keep25_s1225/student/results_2026-07-17T14-54-29.755565.json
|
| 10 |
+
2026-07-17T14:54:32-07:00 HEAL reap_keep25_s1225 on GPU 1
|
| 11 |
+
2026-07-17T14:54:47-07:00 glean_keep25_s1226 done -> outputs/evals/general_suite/healed/glean_keep25_s1226/student/results_2026-07-17T14-54-44.918246.json
|
| 12 |
+
2026-07-17T14:54:47-07:00 HEAL reap_keep25_s1226 on GPU 2
|
| 13 |
+
2026-07-17T15:01:02-07:00 glean_keep25_s1224 done -> outputs/evals/general_suite/healed/glean_keep25_s1224/student/results_2026-07-17T14-56-42.779609.json
|
| 14 |
+
2026-07-17T15:01:02-07:00 HEAL reap_keep25_s1224 on GPU 0
|
| 15 |
+
2026-07-17T17:15:39-07:00 EVAL reap_keep25_s1226 on GPU 2 (port 8422)
|
| 16 |
+
2026-07-17T17:17:04-07:00 EVAL reap_keep25_s1225 on GPU 1 (port 8421)
|
| 17 |
+
2026-07-17T17:27:41-07:00 reap_keep25_s1226 done -> outputs/evals/general_suite/healed/reap_keep25_s1226/student/results_2026-07-17T17-27-38.590201.json
|
| 18 |
+
2026-07-17T17:27:41-07:00 HEAL uniform_keep25_s1226 on GPU 2
|
| 19 |
+
2026-07-17T17:29:13-07:00 reap_keep25_s1225 done -> outputs/evals/general_suite/healed/reap_keep25_s1225/student/results_2026-07-17T17-29-11.051064.json
|
| 20 |
+
2026-07-17T17:29:13-07:00 HEAL uniform_keep25_s1225 on GPU 1
|
| 21 |
+
2026-07-17T17:31:30-07:00 EVAL reap_keep25_s1224 on GPU 0 (port 8420)
|
| 22 |
+
2026-07-17T17:45:54-07:00 reap_keep25_s1224 done -> outputs/evals/general_suite/healed/reap_keep25_s1224/student/results_2026-07-17T17-45-52.249309.json
|
| 23 |
+
2026-07-17T17:45:54-07:00 HEAL uniform_keep25_s1224 on GPU 0
|
| 24 |
+
2026-07-17T19:01:19-07:00 EVAL uniform_keep25_s1226 on GPU 2 (port 8422)
|
| 25 |
+
2026-07-17T19:03:56-07:00 EVAL uniform_keep25_s1225 on GPU 1 (port 8421)
|
| 26 |
+
2026-07-17T19:16:25-07:00 uniform_keep25_s1226 done -> outputs/evals/general_suite/healed/uniform_keep25_s1226/student/results_2026-07-17T19-16-23.025416.json
|
| 27 |
+
2026-07-17T19:16:25-07:00 lane GPU2 (rung 25) complete
|
| 28 |
+
2026-07-17T19:19:15-07:00 uniform_keep25_s1225 done -> outputs/evals/general_suite/healed/uniform_keep25_s1225/student/results_2026-07-17T19-19-12.985404.json
|
| 29 |
+
2026-07-17T19:19:15-07:00 lane GPU1 (rung 25) complete
|
| 30 |
+
2026-07-17T19:34:39-07:00 EVAL uniform_keep25_s1224 on GPU 0 (port 8420)
|
| 31 |
+
2026-07-18T07:28:17-07:00 ###### GENERAL HEAL GRID START ######
|
| 32 |
+
2026-07-18T07:28:17-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
|
| 33 |
+
2026-07-18T07:28:17-07:00 glean_keep25_s1224 already evaled, skip
|
| 34 |
+
2026-07-18T07:28:17-07:00 reap_keep25_s1224 already evaled, skip
|
| 35 |
+
2026-07-18T07:28:17-07:00 uniform_keep25_s1224 already evaled, skip
|
| 36 |
+
2026-07-18T07:28:17-07:00 lane GPU0 (rung 25) complete
|
| 37 |
+
2026-07-18T07:30:47-07:00 glean_keep25_s1225 already evaled, skip
|
| 38 |
+
2026-07-18T07:30:47-07:00 reap_keep25_s1225 already evaled, skip
|
| 39 |
+
2026-07-18T07:30:47-07:00 uniform_keep25_s1225 already evaled, skip
|
| 40 |
+
2026-07-18T07:30:47-07:00 lane GPU1 (rung 25) complete
|
| 41 |
+
2026-07-18T07:33:17-07:00 glean_keep25_s1226 already evaled, skip
|
| 42 |
+
2026-07-18T07:33:17-07:00 reap_keep25_s1226 already evaled, skip
|
| 43 |
+
2026-07-18T07:33:17-07:00 uniform_keep25_s1226 already evaled, skip
|
| 44 |
+
2026-07-18T07:33:17-07:00 lane GPU2 (rung 25) complete
|
| 45 |
+
2026-07-18T07:35:47-07:00 === RUNG keep-25 COMPLETE ===
|
| 46 |
+
2026-07-18T07:35:47-07:00 === RUNG keep-50 on 3 GPUs (0 1 2), 9 cells ===
|
| 47 |
+
2026-07-18T07:35:47-07:00 HEAL glean_keep50_s1224 on GPU 0
|
| 48 |
+
2026-07-18T07:38:17-07:00 HEAL glean_keep50_s1225 on GPU 1
|
| 49 |
+
2026-07-18T07:40:47-07:00 HEAL glean_keep50_s1226 on GPU 2
|
| 50 |
+
2026-07-18T09:48:07-07:00 EVAL glean_keep50_s1225 on GPU 1 (port 8421)
|
| 51 |
+
2026-07-18T09:49:18-07:00 EVAL glean_keep50_s1226 on GPU 2 (port 8422)
|
| 52 |
+
2026-07-18T10:02:01-07:00 EVAL glean_keep50_s1224 on GPU 0 (port 8420)
|
| 53 |
+
2026-07-18T10:02:49-07:00 glean_keep50_s1225 done -> outputs/evals/general_suite/healed/glean_keep50_s1225/student/results_2026-07-18T09-58-04.824177.json
|
| 54 |
+
2026-07-18T10:02:49-07:00 HEAL reap_keep50_s1225 on GPU 1
|
| 55 |
+
2026-07-18T10:03:36-07:00 glean_keep50_s1226 done -> outputs/evals/general_suite/healed/glean_keep50_s1226/student/results_2026-07-18T09-59-02.269145.json
|
| 56 |
+
2026-07-18T10:03:36-07:00 HEAL reap_keep50_s1226 on GPU 2
|
| 57 |
+
2026-07-18T10:15:23-07:00 EVAL glean_keep50_s1224 step100 on GPU 0 (port 8420)
|
| 58 |
+
2026-07-18T10:29:22-07:00 glean_keep50_s1224 done -> outputs/evals/general_suite/healed/glean_keep50_s1224/student/results_2026-07-18T10-11-54.989656.json
|
| 59 |
+
2026-07-18T10:29:22-07:00 HEAL reap_keep50_s1224 on GPU 0
|
| 60 |
+
2026-07-18T12:35:16-07:00 EVAL reap_keep50_s1226 on GPU 2 (port 8422)
|
| 61 |
+
2026-07-18T12:36:25-07:00 EVAL reap_keep50_s1225 on GPU 1 (port 8421)
|
| 62 |
+
2026-07-18T12:45:14-07:00 reap_keep50_s1226 done -> outputs/evals/general_suite/healed/reap_keep50_s1226/student/results_2026-07-18T12-41-23.273535.json
|
| 63 |
+
2026-07-18T12:45:14-07:00 HEAL uniform_keep50_s1226 on GPU 2
|
| 64 |
+
2026-07-18T12:46:34-07:00 reap_keep50_s1225 done -> outputs/evals/general_suite/healed/reap_keep50_s1225/student/results_2026-07-18T12-42-34.448591.json
|
| 65 |
+
2026-07-18T12:46:34-07:00 HEAL uniform_keep50_s1225 on GPU 1
|
| 66 |
+
2026-07-18T13:19:55-07:00 EVAL reap_keep50_s1224 on GPU 0 (port 8420)
|
| 67 |
+
2026-07-18T13:32:15-07:00 EVAL reap_keep50_s1224 step100 on GPU 0 (port 8420)
|
| 68 |
+
2026-07-18T13:44:07-07:00 reap_keep50_s1224 done -> outputs/evals/general_suite/healed/reap_keep50_s1224/student/results_2026-07-18T13-32-13.179265.json
|
| 69 |
+
2026-07-18T13:44:07-07:00 HEAL uniform_keep50_s1224 on GPU 0
|
| 70 |
+
2026-07-18T14:45:53-07:00 EVAL uniform_keep50_s1226 on GPU 2 (port 8422)
|
| 71 |
+
2026-07-18T14:48:15-07:00 EVAL uniform_keep50_s1225 on GPU 1 (port 8421)
|
| 72 |
+
2026-07-18T14:58:35-07:00 uniform_keep50_s1226 done -> outputs/evals/general_suite/healed/uniform_keep50_s1226/student/results_2026-07-18T14-58-32.761745.json
|
| 73 |
+
2026-07-18T14:58:35-07:00 lane GPU2 (rung 50) complete
|
| 74 |
+
2026-07-18T15:01:22-07:00 uniform_keep50_s1225 done -> outputs/evals/general_suite/healed/uniform_keep50_s1225/student/results_2026-07-18T14-57-45.707275.json
|
| 75 |
+
2026-07-18T15:01:22-07:00 lane GPU1 (rung 50) complete
|
| 76 |
+
2026-07-18T15:57:10-07:00 EVAL uniform_keep50_s1224 on GPU 0 (port 8420)
|
| 77 |
+
2026-07-18T16:10:17-07:00 EVAL uniform_keep50_s1224 step100 on GPU 0 (port 8420)
|
| 78 |
+
2026-07-18T16:23:54-07:00 uniform_keep50_s1224 done -> outputs/evals/general_suite/healed/uniform_keep50_s1224/student/results_2026-07-18T16-10-14.760456.json
|
| 79 |
+
2026-07-18T16:23:54-07:00 lane GPU0 (rung 50) complete
|
| 80 |
+
2026-07-18T16:23:54-07:00 === RUNG keep-50 COMPLETE ===
|
| 81 |
+
2026-07-18T16:23:54-07:00 === RUNG keep-75 on 2 GPUs (0 1), 9 cells ===
|
| 82 |
+
2026-07-18T16:23:54-07:00 HEAL glean_keep75_s1224 on GPU 0
|
| 83 |
+
2026-07-18T16:26:24-07:00 HEAL glean_keep75_s1225 on GPU 1
|
| 84 |
+
2026-07-18T18:56:00-07:00 EVAL glean_keep75_s1224 on GPU 0 (port 8420)
|
| 85 |
+
2026-07-18T19:05:45-07:00 EVAL glean_keep75_s1225 on GPU 1 (port 8421)
|
| 86 |
+
2026-07-18T19:09:27-07:00 EVAL glean_keep75_s1224 step100 on GPU 0 (port 8420)
|
| 87 |
+
2026-07-18T19:19:41-07:00 glean_keep75_s1225 done -> outputs/evals/general_suite/healed/glean_keep75_s1225/student/results_2026-07-18T19-16-03.625490.json
|
| 88 |
+
2026-07-18T19:19:41-07:00 HEAL reap_keep75_s1224 on GPU 1
|
| 89 |
+
2026-07-18T19:23:11-07:00 glean_keep75_s1224 done -> outputs/evals/general_suite/healed/glean_keep75_s1224/student/results_2026-07-18T19-05-59.656656.json
|
| 90 |
+
2026-07-18T19:23:11-07:00 HEAL glean_keep75_s1226 on GPU 0
|
| 91 |
+
2026-07-18T22:05:21-07:00 EVAL reap_keep75_s1224 on GPU 1 (port 8421)
|
| 92 |
+
2026-07-18T22:14:46-07:00 EVAL reap_keep75_s1224 step100 on GPU 1 (port 8421)
|
| 93 |
+
2026-07-18T22:24:15-07:00 reap_keep75_s1224 done -> outputs/evals/general_suite/healed/reap_keep75_s1224/student/results_2026-07-18T22-11-41.709032.json
|
| 94 |
+
2026-07-18T22:24:15-07:00 HEAL reap_keep75_s1226 on GPU 1
|
| 95 |
+
2026-07-18T22:26:48-07:00 EVAL glean_keep75_s1226 on GPU 0 (port 8420)
|
| 96 |
+
2026-07-18T22:40:19-07:00 glean_keep75_s1226 done -> outputs/evals/general_suite/healed/glean_keep75_s1226/student/results_2026-07-18T22-36-41.957915.json
|
| 97 |
+
2026-07-18T22:40:19-07:00 HEAL reap_keep75_s1225 on GPU 0
|
| 98 |
+
2026-07-19T00:19:17-07:00 reap_keep75_s1225 HEAL FAILED (no step150)
|
| 99 |
+
2026-07-19T00:19:17-07:00 HEAL uniform_keep75_s1224 on GPU 0
|
| 100 |
+
2026-07-19T01:12:55-07:00 EVAL reap_keep75_s1226 on GPU 1 (port 8421)
|
| 101 |
+
2026-07-19T01:22:06-07:00 reap_keep75_s1226 done -> outputs/evals/general_suite/healed/reap_keep75_s1226/student/results_2026-07-19T01-22-04.019724.json
|
| 102 |
+
2026-07-19T01:22:06-07:00 HEAL uniform_keep75_s1225 on GPU 1
|
| 103 |
+
2026-07-19T01:49:38-07:00 uniform_keep75_s1225 HEAL FAILED (no step150)
|
| 104 |
+
2026-07-19T01:49:38-07:00 lane GPU1 (rung 75) complete
|
| 105 |
+
2026-07-19T02:45:32-07:00 EVAL uniform_keep75_s1224 on GPU 0 (port 8420)
|
| 106 |
+
2026-07-19T02:58:55-07:00 EVAL uniform_keep75_s1224 step100 on GPU 0 (port 8420)
|
| 107 |
+
2026-07-19T03:12:33-07:00 uniform_keep75_s1224 done -> outputs/evals/general_suite/healed/uniform_keep75_s1224/student/results_2026-07-19T02-58-53.335416.json
|
| 108 |
+
2026-07-19T03:12:33-07:00 HEAL uniform_keep75_s1226 on GPU 0
|
| 109 |
+
2026-07-19T05:37:29-07:00 EVAL uniform_keep75_s1226 on GPU 0 (port 8420)
|
| 110 |
+
2026-07-19T05:51:02-07:00 uniform_keep75_s1226 done -> outputs/evals/general_suite/healed/uniform_keep75_s1226/student/results_2026-07-19T05-50-59.443956.json
|
| 111 |
+
2026-07-19T05:51:02-07:00 lane GPU0 (rung 75) complete
|
| 112 |
+
2026-07-19T05:51:02-07:00 === RUNG keep-75 COMPLETE ===
|
| 113 |
+
2026-07-19T05:51:02-07:00 ###### GENERAL HEAL GRID COMPLETE ######
|
| 114 |
+
2026-07-19T07:42:25-07:00 ###### GENERAL HEAL GRID START ######
|
| 115 |
+
2026-07-19T07:42:25-07:00 === RUNG keep-25 on 3 GPUs (0 1 2), 9 cells ===
|
| 116 |
+
2026-07-19T07:42:25-07:00 glean_keep25_s1224 already evaled, skip
|
| 117 |
+
2026-07-19T07:42:25-07:00 reap_keep25_s1224 already evaled, skip
|
| 118 |
+
2026-07-19T07:42:25-07:00 uniform_keep25_s1224 already evaled, skip
|
| 119 |
+
2026-07-19T07:42:25-07:00 lane GPU0 (rung 25) complete
|
| 120 |
+
2026-07-19T07:44:55-07:00 glean_keep25_s1225 already evaled, skip
|
| 121 |
+
2026-07-19T07:44:55-07:00 reap_keep25_s1225 already evaled, skip
|
| 122 |
+
2026-07-19T07:44:55-07:00 uniform_keep25_s1225 already evaled, skip
|
| 123 |
+
2026-07-19T07:44:55-07:00 lane GPU1 (rung 25) complete
|
| 124 |
+
2026-07-19T07:47:25-07:00 glean_keep25_s1226 already evaled, skip
|
| 125 |
+
2026-07-19T07:47:25-07:00 reap_keep25_s1226 already evaled, skip
|
| 126 |
+
2026-07-19T07:47:25-07:00 uniform_keep25_s1226 already evaled, skip
|
| 127 |
+
2026-07-19T07:47:25-07:00 lane GPU2 (rung 25) complete
|
| 128 |
+
2026-07-19T07:49:55-07:00 === RUNG keep-25 COMPLETE ===
|
| 129 |
+
2026-07-19T07:49:55-07:00 === RUNG keep-50 on 3 GPUs (0 1 2), 9 cells ===
|
| 130 |
+
2026-07-19T07:49:55-07:00 glean_keep50_s1224 already evaled, skip
|
| 131 |
+
2026-07-19T07:49:55-07:00 reap_keep50_s1224 already evaled, skip
|
| 132 |
+
2026-07-19T07:49:55-07:00 uniform_keep50_s1224 already evaled, skip
|
| 133 |
+
2026-07-19T07:49:55-07:00 lane GPU0 (rung 50) complete
|
| 134 |
+
2026-07-19T07:52:25-07:00 glean_keep50_s1225 already evaled, skip
|
| 135 |
+
2026-07-19T07:52:25-07:00 reap_keep50_s1225 already evaled, skip
|
| 136 |
+
2026-07-19T07:52:25-07:00 uniform_keep50_s1225 already evaled, skip
|
| 137 |
+
2026-07-19T07:52:25-07:00 lane GPU1 (rung 50) complete
|
| 138 |
+
2026-07-19T07:54:55-07:00 glean_keep50_s1226 already evaled, skip
|
| 139 |
+
2026-07-19T07:54:55-07:00 reap_keep50_s1226 already evaled, skip
|
| 140 |
+
2026-07-19T07:54:55-07:00 uniform_keep50_s1226 already evaled, skip
|
| 141 |
+
2026-07-19T07:54:55-07:00 lane GPU2 (rung 50) complete
|
| 142 |
+
2026-07-19T07:57:25-07:00 === RUNG keep-50 COMPLETE ===
|
| 143 |
+
2026-07-19T07:57:25-07:00 === RUNG keep-75 on 2 GPUs (0 1), 9 cells ===
|
| 144 |
+
2026-07-19T07:57:25-07:00 glean_keep75_s1224 already evaled, skip
|
| 145 |
+
2026-07-19T07:57:25-07:00 glean_keep75_s1226 already evaled, skip
|
| 146 |
+
2026-07-19T07:57:25-07:00 HEAL reap_keep75_s1225 on GPU 0
|
| 147 |
+
2026-07-19T07:59:55-07:00 glean_keep75_s1225 already evaled, skip
|
| 148 |
+
2026-07-19T07:59:55-07:00 reap_keep75_s1224 already evaled, skip
|
| 149 |
+
2026-07-19T07:59:55-07:00 reap_keep75_s1226 already evaled, skip
|
| 150 |
+
2026-07-19T07:59:55-07:00 HEAL uniform_keep75_s1225 on GPU 1
|
| 151 |
+
2026-07-19T10:54:23-07:00 EVAL reap_keep75_s1225 on GPU 0 (port 8420)
|
| 152 |
+
2026-07-19T11:04:17-07:00 reap_keep75_s1225 done -> outputs/evals/general_suite/healed/reap_keep75_s1225/student/results_2026-07-19T11-01-06.595488.json
|
| 153 |
+
2026-07-19T11:04:17-07:00 uniform_keep75_s1224 already evaled, skip
|
| 154 |
+
2026-07-19T11:04:17-07:00 uniform_keep75_s1226 already evaled, skip
|
| 155 |
+
2026-07-19T11:04:17-07:00 lane GPU0 (rung 75) complete
|
| 156 |
+
2026-07-19T11:52:31-07:00 EVAL uniform_keep75_s1225 on GPU 1 (port 8421)
|
| 157 |
+
2026-07-19T12:05:59-07:00 uniform_keep75_s1225 done -> outputs/evals/general_suite/healed/uniform_keep75_s1225/student/results_2026-07-19T12-05-54.836521.json
|
| 158 |
+
2026-07-19T12:05:59-07:00 lane GPU1 (rung 75) complete
|
| 159 |
+
2026-07-19T12:05:59-07:00 === RUNG keep-75 COMPLETE ===
|
| 160 |
+
2026-07-19T12:05:59-07:00 ###### GENERAL HEAL GRID COMPLETE ######
|
healed/grid_general/glean_keep25_s1224.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run lpq2f0lo
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1224/wandb/run-20260717_124922-lpq2f0lo
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep25_s1224
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/lpq2f0lo
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.230232952358822, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 18.125, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 259}, "mem_gb": 9.93}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'The rank of the matrix is 4.\n\n\n\nExplanation:\nThe matrix contains four distinct integers: 12, -16, 4, and -8. Each of these integers is different. Therefore, the rank of the matrix is 4.\n\n\n\n\n\n\n\n\n\n\n\n\n'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7555008484855295, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 23.5, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 348}, "mem_gb": 9.59}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5307058254199724, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 13.375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 370}, "mem_gb": 9.74}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7830725133789083, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.1875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 244}, "mem_gb": 9.98}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1955481514299908, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.28125, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 320}, "mem_gb": 9.9}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3044716434742014, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.71875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 378}, "mem_gb": 9.49}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.452664390789966, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.84375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 384}, "mem_gb": 9.99}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2374622819642227, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 324}, "mem_gb": 9.84}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5717071391055981, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 239}, "mem_gb": 10.0}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1515966722741724, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.546875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 306}, "mem_gb": 9.74}
|
| 25 |
+
[eval step 10] sample: 'To compute the rank of a 4x4 matrix, we need to determine the number of linearly independent rows or columns in the matrix. The rank of a matrix is the number of linearly independent rows or columns.\n'
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1663353991595407, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 329}, "mem_gb": 9.78}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5732789917799334, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.34375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 254}, "mem_gb": 10.01}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9218004519566894, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.984375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.9, "frames": {"chat": 273}, "mem_gb": 9.98}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3943379741191864, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 236}, "mem_gb": 9.9}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1741832443614801, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 381}, "mem_gb": 9.64}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4743189287646363, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 266}, "mem_gb": 9.83}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7200682055724164, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 308}, "mem_gb": 9.82}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5685026399575174, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 273}, "mem_gb": 10.0}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.965660633458073, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 368}, "mem_gb": 9.63}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1254668449434142, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.2109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 339}, "mem_gb": 9.88}
|
| 36 |
+
[eval step 20] sample: 'To determine the rank of a 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the given matrix. This is done by performing row reduction (or elimination) operati'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6083429135009646, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 298}, "mem_gb": 9.8}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9495863987863064, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 350}, "mem_gb": 9.53}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5129962862101693, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 246}, "mem_gb": 9.97}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9368743329118937, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.0546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 375}, "mem_gb": 9.7}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9464652672618628, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 352}, "mem_gb": 9.76}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9558642008572816, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 396}, "mem_gb": 9.71}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7860169070002934, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 362}, "mem_gb": 9.57}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0082796115246913, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 369}, "mem_gb": 9.77}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.009116009711971, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 399}, "mem_gb": 9.62}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4846179143540561, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 247}, "mem_gb": 9.9}
|
| 47 |
+
[eval step 30] sample: 'To determine the rank of a 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. This involves performing row reduction (or elimination) operations to r'
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22527380605190991, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 230}, "mem_gb": 9.83}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4463476555825521, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 263}, "mem_gb": 10.0}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4649241888465981, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 264}, "mem_gb": 9.99}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8147876140392075, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 328}, "mem_gb": 9.85}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4231523534525807, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 281}, "mem_gb": 9.93}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3249024557450165, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 237}, "mem_gb": 9.91}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039089362307141, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 278}, "mem_gb": 10.0}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8169043293373038, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 310}, "mem_gb": 9.87}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5213651200753792, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 295}, "mem_gb": 9.81}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5716980821558585, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 329}, "mem_gb": 9.83}
|
| 58 |
+
[eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the matrix as follows:\n\\[\nA = \\begin{pmatrix}\n12 & -16"
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.515681032132109, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 263}, "mem_gb": 9.94}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5583567329570651, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 315}, "mem_gb": 9.83}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7827952124347289, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 354}, "mem_gb": 9.78}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33834826097066206, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 259}, "mem_gb": 9.95}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.535996689457198, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 275}, "mem_gb": 9.81}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.761962819148538, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 334}, "mem_gb": 9.67}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7991849290193369, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 374}, "mem_gb": 9.53}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6587553056004146, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 311}, "mem_gb": 9.7}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5646433477637668, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 259}, "mem_gb": 10.0}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6755613154624899, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 305}, "mem_gb": 9.99}
|
| 69 |
+
[eval step 50] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. For a 4x4 matrix, we can use various methods, including row reduction (Gaussian elimin'
|
| 70 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6236642312885573, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 298}, "mem_gb": 9.96}
|
| 71 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8659690618770818, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 364}, "mem_gb": 9.74}
|
| 72 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4402219339902823, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 302}, "mem_gb": 9.85}
|
| 73 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8718686241495113, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 316}, "mem_gb": 9.61}
|
| 74 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9186581234411647, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 75 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6314163563566904, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 330}, "mem_gb": 9.86}
|
| 76 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6280176534157247, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 321}, "mem_gb": 9.86}
|
| 77 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.676628557317083, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 344}, "mem_gb": 9.89}
|
| 78 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7451332750880469, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 353}, "mem_gb": 9.57}
|
| 79 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3671483270462292, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 272}, "mem_gb": 10.0}
|
| 80 |
+
[eval step 60] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. \n\nLet's start by converting the matrix into row-echelon form (REF) using Gaussian elimina"
|
| 81 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8607330310590565, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 317}, "mem_gb": 9.74}
|
| 82 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35653378598367175, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 292}, "mem_gb": 9.74}
|
| 83 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1951703331221516, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 229}, "mem_gb": 9.86}
|
| 84 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.786070414811559, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 359}, "mem_gb": 9.86}
|
| 85 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7170421186082065, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 358}, "mem_gb": 9.59}
|
| 86 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8479278815058371, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 315}, "mem_gb": 9.97}
|
| 87 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5007196825118114, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 264}, "mem_gb": 10.05}
|
| 88 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7986173901910583, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 337}, "mem_gb": 9.71}
|
| 89 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39695811266700426, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 251}, "mem_gb": 10.01}
|
| 90 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.58340040049615, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 298}, "mem_gb": 9.73}
|
| 91 |
+
[eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's start by writing down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n"
|
| 92 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4847553086879974, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 264}, "mem_gb": 9.95}
|
| 93 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48543966890014706, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 305}, "mem_gb": 9.96}
|
| 94 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46550742264433453, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 322}, "mem_gb": 9.74}
|
| 95 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7916732936594635, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 361}, "mem_gb": 9.72}
|
| 96 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5088260187707531, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 321}, "mem_gb": 9.9}
|
| 97 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6609323742570355, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 307}, "mem_gb": 9.8}
|
| 98 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7717183587286621, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 327}, "mem_gb": 9.89}
|
| 99 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8418425931031506, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 356}, "mem_gb": 9.51}
|
| 100 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3909381251984586, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 283}, "mem_gb": 9.86}
|
| 101 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7662618677861989, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 401}, "mem_gb": 9.61}
|
| 102 |
+
[eval step 80] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( n \\) if it has \\( n \\) linearly independent rows or col'
|
| 103 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5011390567759052, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 288}, "mem_gb": 9.81}
|
| 104 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6264763125145808, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 323}, "mem_gb": 9.85}
|
| 105 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.858884850747635, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 336}, "mem_gb": 9.74}
|
| 106 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6986745096847415, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 329}, "mem_gb": 9.64}
|
| 107 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6883494295466691, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 343}, "mem_gb": 9.63}
|
| 108 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.714498685978353, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 336}, "mem_gb": 9.75}
|
| 109 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6667983782338599, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 9.98}
|
| 110 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41439470696250597, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 281}, "mem_gb": 9.82}
|
| 111 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5404754282862569, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 299}, "mem_gb": 9.69}
|
| 112 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6631877648853386, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 328}, "mem_gb": 9.88}
|
| 113 |
+
[eval step 90] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's break down the problem into smaller steps and solve it using Python and SymPy.\n\n###"
|
| 114 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5152765134019777, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 271}, "mem_gb": 9.98}
|
| 115 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5397345383686324, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 269}, "mem_gb": 10.08}
|
| 116 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8142568668286005, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 370}, "mem_gb": 9.63}
|
| 117 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8570075749141475, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 118 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7482497710308681, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 330}, "mem_gb": 9.89}
|
| 119 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6091186967118022, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 334}, "mem_gb": 9.62}
|
| 120 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6094944001651058, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 336}, "mem_gb": 9.75}
|
| 121 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44065201980068036, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 309}, "mem_gb": 9.84}
|
| 122 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.750593746100987, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 391}, "mem_gb": 9.73}
|
| 123 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3937398470057795, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 264}, "mem_gb": 10.12}
|
| 124 |
+
[eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's start by writing down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16"
|
| 125 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6405833819416662, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 349}, "mem_gb": 9.68}
|
| 126 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6110699118683736, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 312}, "mem_gb": 9.73}
|
| 127 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22543682222130398, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 229}, "mem_gb": 10.0}
|
| 128 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.571418999376893, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 288}, "mem_gb": 10.0}
|
| 129 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7974187780410051, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 351}, "mem_gb": 9.66}
|
| 130 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3170151141561568, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 223}, "mem_gb": 10.02}
|
| 131 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1569358562398081, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.7, "frames": {"chat": 213}, "mem_gb": 9.99}
|
| 132 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7303174932712689, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 380}, "mem_gb": 9.84}
|
| 133 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41821051687517513, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 271}, "mem_gb": 10.02}
|
| 134 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7821986571711799, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 340}, "mem_gb": 9.91}
|
| 135 |
+
[eval step 110] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 136 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8301274567630142, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 366}, "mem_gb": 9.61}
|
| 137 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.299316186900499, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 233}, "mem_gb": 10.0}
|
| 138 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5317195191866407, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.6, "frames": {"chat": 312}, "mem_gb": 9.86}
|
| 139 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7483980015807474, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 363}, "mem_gb": 9.58}
|
| 140 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7562728609332194, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 323}, "mem_gb": 9.85}
|
| 141 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8216717583857477, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 346}, "mem_gb": 9.59}
|
| 142 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7373267066142212, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 1.0234375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 318}, "mem_gb": 9.74}
|
| 143 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5497194940060377, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 275}, "mem_gb": 9.92}
|
| 144 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6847652262626837, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 345}, "mem_gb": 9.67}
|
| 145 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.686522659535706, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 377}, "mem_gb": 9.82}
|
| 146 |
+
[eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 147 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5571660259227579, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 294}, "mem_gb": 10.04}
|
| 148 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7721854376189411, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 338}, "mem_gb": 9.73}
|
| 149 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.775954254207636, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 352}, "mem_gb": 9.63}
|
| 150 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7303574244684229, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 347}, "mem_gb": 9.68}
|
| 151 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4477207079838961, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 310}, "mem_gb": 9.66}
|
| 152 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8195232594630371, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 358}, "mem_gb": 9.69}
|
| 153 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.472922162405774, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 319}, "mem_gb": 9.97}
|
| 154 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31340620313100515, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 269}, "mem_gb": 10.0}
|
| 155 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6118611890931304, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 310}, "mem_gb": 9.85}
|
| 156 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3994562356161264, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 259}, "mem_gb": 10.03}
|
| 157 |
+
[eval step 130] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
|
| 158 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39424919714008766, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 159 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7736657298201074, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 337}, "mem_gb": 9.55}
|
| 160 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4310107218934844, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 290}, "mem_gb": 9.81}
|
| 161 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6810150410573309, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 349}, "mem_gb": 9.75}
|
| 162 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43771783427683014, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 291}, "mem_gb": 9.84}
|
| 163 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6974321913416808, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 342}, "mem_gb": 9.71}
|
| 164 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8007760579209775, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 338}, "mem_gb": 9.66}
|
| 165 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7884519690003247, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 356}, "mem_gb": 9.62}
|
| 166 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3688757979504764, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 167 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6384047362486521, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 353}, "mem_gb": 9.71}
|
| 168 |
+
[eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 169 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6027499658275396, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 316}, "mem_gb": 9.9}
|
| 170 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5025881632997654, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 289}, "mem_gb": 10.05}
|
| 171 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5405622877730056, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 331}, "mem_gb": 9.69}
|
| 172 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5336027219651267, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 320}, "mem_gb": 10.0}
|
| 173 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48749642031074814, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 272}, "mem_gb": 9.74}
|
| 174 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8456337846264244, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 368}, "mem_gb": 9.66}
|
| 175 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6977787470727538, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 328}, "mem_gb": 9.68}
|
| 176 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6741483884370575, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 326}, "mem_gb": 9.9}
|
| 177 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.779587540318879, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 364}, "mem_gb": 9.84}
|
| 178 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49224459458068015, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 296}, "mem_gb": 9.88}
|
| 179 |
+
[eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 180 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1224/step0150
|
| 181 |
+
wandb: updating run metadata
|
| 182 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len βββββ
ββββ
β
β
ββββββββββββββββββ
βββββ
β
ββ
βββ
|
| 186 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββ
β
β
β
β
β
βββββββββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate ββββββ
ββ
βββββββββββ
βββββ
ββββββββββ
ββββββ
|
| 189 |
+
wandb: forward_topk_kl ββββββββββββ
βββ
ββ
βββ
ββ
β
βββ
ββ
βββββββ
ββ
ββ
β
|
| 190 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb βββββββββββ
β
ββββ
β
β
β
ββββ
βββ
βββββ
ββ
ββββ
βββ
|
| 193 |
+
wandb: step βββββββββββββββββββββββββββ
β
β
βββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 405.4
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.97
|
| 202 |
+
wandb: forward_topk_kl 0.49224
|
| 203 |
+
wandb: grad_norm 0.625
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.88
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run glean_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/lpq2f0lo
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1224/wandb/run-20260717_124922-lpq2f0lo/logs
|
healed/grid_general/glean_keep25_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep25_s1225.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run 8j8lz7cs
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1225/wandb/run-20260717_125152-8j8lz7cs
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep25_s1225
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/8j8lz7cs
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.808664998525381, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 23.5, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 331}, "mem_gb": 9.8}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: "To solve this problem, we'll break it into parts and then sum up the contributions over the respective periods.\n\n\n\n1. **Calculate the contribution from the salary:**\n - The salary contribution is $2"
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6490384441773096, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 20.25, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 342}, "mem_gb": 9.62}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8595948845709365, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 15.0, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 358}, "mem_gb": 9.66}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4889224458272259, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 9.6875, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 344}, "mem_gb": 9.75}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0059059998517235, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 6.5625, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 267}, "mem_gb": 10.06}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6072625180219611, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 4.8125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.8, "frames": {"chat": 248}, "mem_gb": 9.89}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2357142568791906, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 5.59375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 329}, "mem_gb": 9.89}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2724269317929944, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.515625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 339}, "mem_gb": 9.85}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4072858887024224, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 354}, "mem_gb": 9.84}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7663721626664202, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 2.078125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 279}, "mem_gb": 9.98}
|
| 25 |
+
[eval step 10] sample: 'To solve this problem, we need to determine how many months it takes for Jamie to reach their goal of $1,000,000, taking into account both the savings from their salary and the investment account.\n\n1.'
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9231008924469352, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.0, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 318}, "mem_gb": 9.91}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6380429365500808, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 265}, "mem_gb": 9.99}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5771318466238677, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 254}, "mem_gb": 9.94}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8742825336570541, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 2.640625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 315}, "mem_gb": 9.97}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.120795498397698, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 5.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7312215218304347, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.40625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 276}, "mem_gb": 9.97}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0663405254211278, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 356}, "mem_gb": 9.91}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0379273822988073, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 304}, "mem_gb": 9.72}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0042938261387249, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 375}, "mem_gb": 9.63}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5647936842045437, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 294}, "mem_gb": 9.99}
|
| 36 |
+
[eval step 20] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000 from their salary and investment account, starting with $50,000.\n\n### Step-by-Step Solution:\n\n1. **Calcul'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9247926180583735, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 299}, "mem_gb": 10.01}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7130216178910186, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 305}, "mem_gb": 9.78}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.418694871489207, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 262}, "mem_gb": 9.84}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.603906989720588, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 303}, "mem_gb": 9.9}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9305493552699685, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 380}, "mem_gb": 9.78}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5438824022031079, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 282}, "mem_gb": 9.73}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8633251890461892, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 362}, "mem_gb": 9.75}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8607526977756371, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 307}, "mem_gb": 9.99}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5916882254637778, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 282}, "mem_gb": 9.85}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.86052832568114, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 337}, "mem_gb": 9.88}
|
| 47 |
+
[eval step 30] sample: "To solve this problem, we need to determine how many months Jamie will save $2,500 each month from their salary to reach a total of $1,000,000, starting with $50,000.\n\nLet's break down the problem int"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5451407793821146, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 275}, "mem_gb": 9.94}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9271899215554198, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 318}, "mem_gb": 9.75}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9928629991871615, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 385}, "mem_gb": 9.78}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.060265746624271, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 316}, "mem_gb": 9.73}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4527844850036005, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 266}, "mem_gb": 10.02}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9415984902149688, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 371}, "mem_gb": 9.76}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979632269239674, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 262}, "mem_gb": 9.96}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9448449456247191, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 348}, "mem_gb": 9.78}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21057665411898246, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 222}, "mem_gb": 10.02}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.868826575763151, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 408}, "mem_gb": 9.59}
|
| 58 |
+
[eval step 40] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the savings from their salary and the interest earned in the investment account.\n\n**Step'
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8230532644172509, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 334}, "mem_gb": 9.65}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47232350602597, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8151439497067904, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7589573763786505, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 371}, "mem_gb": 9.5}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5294070899101595, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 284}, "mem_gb": 9.95}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3935093100932737, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 287}, "mem_gb": 10.01}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3682084949952861, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 285}, "mem_gb": 9.91}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2808545169170325, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.5, "frames": {"chat": 252}, "mem_gb": 10.0}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7845809511312594, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 360}, "mem_gb": 9.79}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8424313151545202, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 359}, "mem_gb": 9.78}
|
| 69 |
+
[eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the savings from their salary and the interest earned in their investment account.\n\n**St'
|
| 70 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8550375819439069, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 363}, "mem_gb": 9.54}
|
| 71 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.764513291883717, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 361}, "mem_gb": 9.63}
|
| 72 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4931147550482924, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 286}, "mem_gb": 9.81}
|
| 73 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8408041382790854, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 367}, "mem_gb": 9.66}
|
| 74 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9257178456825514, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 75 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5609224415198589, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 314}, "mem_gb": 9.65}
|
| 76 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7388688722477605, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 372}, "mem_gb": 9.62}
|
| 77 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.705404400226598, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 334}, "mem_gb": 9.76}
|
| 78 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8756686551661541, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 368}, "mem_gb": 9.71}
|
| 79 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6709957558674117, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 354}, "mem_gb": 9.85}
|
| 80 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their savings rate and investment earnings.\n\n**Step 1: Calculate the total amount Jamie needs to s'
|
| 81 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3953444012318427, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 293}, "mem_gb": 9.74}
|
| 82 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25339365453707674, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 231}, "mem_gb": 9.91}
|
| 83 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6489625876778116, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 84 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4221036484990269, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 263}, "mem_gb": 10.01}
|
| 85 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4714730351532499, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 252}, "mem_gb": 9.95}
|
| 86 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6591646950072299, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 344}, "mem_gb": 9.98}
|
| 87 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6125024421208849, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 313}, "mem_gb": 9.9}
|
| 88 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7075878290592382, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 358}, "mem_gb": 9.6}
|
| 89 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3412743373590832, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 267}, "mem_gb": 9.82}
|
| 90 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7347268351024637, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 300}, "mem_gb": 9.7}
|
| 91 |
+
[eval step 70] sample: "To solve this problem, we need to account for both the savings from the salary and the interest earned in the investment account. Here's how we can break it down:\n\n1. **Savings from Salary:**\n - Jam"
|
| 92 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5927675150064131, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 348}, "mem_gb": 9.63}
|
| 93 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7361111811776956, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 329}, "mem_gb": 9.72}
|
| 94 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.403465011487777, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 269}, "mem_gb": 9.88}
|
| 95 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7740006979161252, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 358}, "mem_gb": 9.55}
|
| 96 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4715089300878346, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 302}, "mem_gb": 9.81}
|
| 97 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7797536961656064, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 381}, "mem_gb": 9.83}
|
| 98 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8289630578834564, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 379}, "mem_gb": 9.77}
|
| 99 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7941317317076028, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 351}, "mem_gb": 9.6}
|
| 100 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6950912625260651, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 330}, "mem_gb": 9.8}
|
| 101 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7434162690609694, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 316}, "mem_gb": 9.83}
|
| 102 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate the tot'
|
| 103 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47566973968750487, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 276}, "mem_gb": 10.01}
|
| 104 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3946109107866883, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 240}, "mem_gb": 9.94}
|
| 105 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46658366727797934, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 288}, "mem_gb": 9.85}
|
| 106 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4257884032201022, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 271}, "mem_gb": 9.84}
|
| 107 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6815474520326903, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 357}, "mem_gb": 9.79}
|
| 108 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8438355850890279, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 354}, "mem_gb": 9.77}
|
| 109 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.837819870460406, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 302}, "mem_gb": 10.01}
|
| 110 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6064989772940675, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 297}, "mem_gb": 9.99}
|
| 111 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22212638277349372, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.5, "frames": {"chat": 219}, "mem_gb": 10.01}
|
| 112 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7732856466734161, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 306}, "mem_gb": 9.72}
|
| 113 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate Monthly Savings**\n\nJamie saves'
|
| 114 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7946177243828774, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 343}, "mem_gb": 9.65}
|
| 115 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7305633843132605, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 341}, "mem_gb": 9.77}
|
| 116 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45646875621403254, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 318}, "mem_gb": 9.71}
|
| 117 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8368425393072267, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 346}, "mem_gb": 9.6}
|
| 118 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4000354012981678, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 277}, "mem_gb": 10.08}
|
| 119 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39692016389817, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 270}, "mem_gb": 9.81}
|
| 120 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4675862306990971, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 257}, "mem_gb": 10.0}
|
| 121 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7792795856350412, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 363}, "mem_gb": 9.6}
|
| 122 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7666938890318696, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 356}, "mem_gb": 9.74}
|
| 123 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6893483106290922, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 323}, "mem_gb": 9.77}
|
| 124 |
+
[eval step 100] sample: "To solve this problem, we need to account for both the savings from the salary and the interest from the investment account. Here's how we can break it down:\n\n1. **Savings from Salary:**\n Jamie save"
|
| 125 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36820247387966765, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 243}, "mem_gb": 10.03}
|
| 126 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7245171230147283, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 307}, "mem_gb": 9.71}
|
| 127 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6720854982158169, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 346}, "mem_gb": 9.94}
|
| 128 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531413590718061, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 273}, "mem_gb": 9.94}
|
| 129 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46155412019652625, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 130 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6441218554573134, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 337}, "mem_gb": 10.0}
|
| 131 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979432533910498, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 280}, "mem_gb": 9.88}
|
| 132 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8506731971150885, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 331}, "mem_gb": 9.78}
|
| 133 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5165925833797083, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 314}, "mem_gb": 9.88}
|
| 134 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8715233616360774, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 294}, "mem_gb": 9.81}
|
| 135 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to grow their savings from $50,000 to $1,000,000, given that they save $2,500 each month and earn an interest of $300 per'
|
| 136 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41161180766212446, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 274}, "mem_gb": 9.94}
|
| 137 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6689115083934118, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 138 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4316471886374677, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 323}, "mem_gb": 9.73}
|
| 139 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2950278613418962, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 234}, "mem_gb": 10.01}
|
| 140 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35773489913015316, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 267}, "mem_gb": 10.01}
|
| 141 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46336869763278715, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 304}, "mem_gb": 9.78}
|
| 142 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.707697455116113, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 373}, "mem_gb": 9.7}
|
| 143 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4384852448521182, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 300}, "mem_gb": 9.98}
|
| 144 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7770776163614045, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 331}, "mem_gb": 9.82}
|
| 145 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34997980083189906, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 259}, "mem_gb": 9.96}
|
| 146 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their savings and investment details.\n\n**Step 1: Calculate '
|
| 147 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6869527579843998, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 358}, "mem_gb": 9.58}
|
| 148 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.792673924513782, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 354}, "mem_gb": 9.84}
|
| 149 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3958263121607403, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 279}, "mem_gb": 9.9}
|
| 150 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8055727958844354, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 354}, "mem_gb": 9.65}
|
| 151 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7518758239301543, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 334}, "mem_gb": 9.86}
|
| 152 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7586497875315448, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 327}, "mem_gb": 9.72}
|
| 153 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7333687149317314, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 365}, "mem_gb": 9.82}
|
| 154 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41114167728517204, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 252}, "mem_gb": 10.03}
|
| 155 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33496633312044044, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 256}, "mem_gb": 9.99}
|
| 156 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42111990845073016, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 302}, "mem_gb": 9.77}
|
| 157 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their savings and investment details.\n\n**Step 1: Calculate '
|
| 158 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6953495802962532, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 350}, "mem_gb": 9.67}
|
| 159 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.428776480944703, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 292}, "mem_gb": 9.79}
|
| 160 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6902216596338898, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 356}, "mem_gb": 9.6}
|
| 161 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49320213941087326, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 347}, "mem_gb": 9.77}
|
| 162 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42928083049748095, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 330}, "mem_gb": 9.96}
|
| 163 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7220965905600538, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 363}, "mem_gb": 9.82}
|
| 164 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6609605204746127, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 354}, "mem_gb": 9.68}
|
| 165 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3630611923115328, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 270}, "mem_gb": 9.95}
|
| 166 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6802514189558103, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 343}, "mem_gb": 9.72}
|
| 167 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18309974884192148, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.9, "frames": {"chat": 232}, "mem_gb": 9.91}
|
| 168 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000 from their savings and investment account, given their monthly savings and the interest earned.\n\n**Ste'
|
| 169 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6306400136097023, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 346}, "mem_gb": 9.86}
|
| 170 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5116529365332797, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 306}, "mem_gb": 9.95}
|
| 171 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34303080869025243, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 273}, "mem_gb": 9.99}
|
| 172 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3763906318192681, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 266}, "mem_gb": 9.82}
|
| 173 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5723603961752107, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 299}, "mem_gb": 10.01}
|
| 174 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40002196048907934, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 259}, "mem_gb": 10.1}
|
| 175 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4529625337978825, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 325}, "mem_gb": 9.83}
|
| 176 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42111575560091685, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 271}, "mem_gb": 9.91}
|
| 177 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6778534247227634, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 359}, "mem_gb": 9.69}
|
| 178 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6548494756745795, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 345}, "mem_gb": 9.75}
|
| 179 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000 from their savings and investment account, given their monthly savings and the interest earned.\n\n**Ste'
|
| 180 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1225/step0150
|
| 181 |
+
wandb: updating run metadata
|
| 182 |
+
wandb: uploading wandb-summary.json; uploading config.yaml; uploading output.log
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len ββββββββββ
ββββββββββββββββββ
ββββββββββββ
|
| 186 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββ
β
β
β
βββββββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate βββββ
ββββββββ
ββββββββββββ
βββββββββββββ
ββ
|
| 189 |
+
wandb: forward_topk_kl βββ
ββ
ββ
ββββ
βββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb ββ
βββββββ
βββββββββββββββββββββββ
ββββ
ββ
ββ
|
| 193 |
+
wandb: step βββββββββββββββββββββ
β
β
β
β
β
ββββββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 347.8
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.997
|
| 202 |
+
wandb: forward_topk_kl 0.65485
|
| 203 |
+
wandb: grad_norm 0.71875
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.75
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run glean_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/8j8lz7cs
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1225/wandb/run-20260717_125152-8j8lz7cs/logs
|
healed/grid_general/glean_keep25_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep25_s1226.console.log
ADDED
|
@@ -0,0 +1,212 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep25_s1226/wandb/run-20260717_125422-n3zawkef
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run glean_keep25_s1226
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/n3zawkef
|
| 11 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 12 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3049798537532489, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 20.25, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 308}, "mem_gb": 9.9}
|
| 13 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 14 |
+
[eval step 1] sample: 'To solve the problem, we start by expressing the terms in the arithmetic sequence in terms based on the common difference $d$. \n\nGiven $a_1 + 3a_8 + a_{15} = 120$, we can write $a_1 + 3a_8 + a_{15} = '
|
| 15 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7685427623917659, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 12.0625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 31.1, "frames": {"chat": 211}, "mem_gb": 10.0}
|
| 16 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1137424003382523, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 11.4375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 281}, "mem_gb": 9.99}
|
| 17 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5672404122143984, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 10.4375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 367}, "mem_gb": 9.54}
|
| 18 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4930382081245384, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 8.6875, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 19 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1676590049035847, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.03125, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 271}, "mem_gb": 10.02}
|
| 20 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8520871777494748, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 5.53125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 269}, "mem_gb": 9.98}
|
| 21 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3022827628118296, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 352}, "mem_gb": 9.51}
|
| 22 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6229442936435342, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.59375, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 243}, "mem_gb": 9.99}
|
| 23 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8070648494549095, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.984375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 293}, "mem_gb": 9.91}
|
| 24 |
+
[eval step 10] sample: 'To solve the problem, we need to determine the common term \\(a_n\\) of the arithmetic sequence and then use the given equation to find \\(2a_9 - a_{10}\\).\n\n### Step 1: Find the common term \\(a_n\\)\n\nThe '
|
| 25 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5384568912597995, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.609375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 242}, "mem_gb": 9.99}
|
| 26 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1970970566250383, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 2.140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 353}, "mem_gb": 9.69}
|
| 27 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0940787013653666, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 338}, "mem_gb": 9.69}
|
| 28 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6186913937936227, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 259}, "mem_gb": 9.99}
|
| 29 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9969246197288235, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.40625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 385}, "mem_gb": 9.54}
|
| 30 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9412323618650437, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.3984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 355}, "mem_gb": 9.71}
|
| 31 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8982679812351863, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 328}, "mem_gb": 9.61}
|
| 32 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9415252021573484, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 355}, "mem_gb": 9.76}
|
| 33 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0632766890684142, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.2109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 367}, "mem_gb": 9.63}
|
| 34 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9678205758832396, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 343}, "mem_gb": 9.67}
|
| 35 |
+
[eval step 20] sample: 'in the arithmetic sequence {a_n} where a_1 is the first term and a_n is the n-th term, we have the equation a_1 + 3a_8 + a_15 = 120. to find the value of 2a_9 - a_{10}, we need to'
|
| 36 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3117956129783144, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 244}, "mem_gb": 10.0}
|
| 37 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6047114803902804, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 339}, "mem_gb": 9.83}
|
| 38 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6115298296865697, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 298}, "mem_gb": 9.98}
|
| 39 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9722748226304849, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 398}, "mem_gb": 9.86}
|
| 40 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8721042871873825, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.1484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 362}, "mem_gb": 9.96}
|
| 41 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5642432114346574, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 313}, "mem_gb": 9.83}
|
| 42 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0008940587684512, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 324}, "mem_gb": 9.75}
|
| 43 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.599433847203975, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 314}, "mem_gb": 9.8}
|
| 44 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9312462906735639, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 345}, "mem_gb": 9.72}
|
| 45 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4619468034664169, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 262}, "mem_gb": 9.91}
|
| 46 |
+
[eval step 30] sample: "in the arithmetic sequence {a_n} where a_1 + 3a_8 + a_15 = 120, we need to find the value of 2a_9 - a_10.\n\nfirst, let's express the terms of the sequence in terms of a_n.\n\na_"
|
| 47 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.022420195945104, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 373}, "mem_gb": 9.7}
|
| 48 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8509250005868574, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 334}, "mem_gb": 9.69}
|
| 49 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.613825674328208, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 327}, "mem_gb": 9.85}
|
| 50 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2256598541000858, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 238}, "mem_gb": 10.01}
|
| 51 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7586643088450035, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 310}, "mem_gb": 9.74}
|
| 52 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8141867193845411, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 347}, "mem_gb": 9.75}
|
| 53 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8366180024611454, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 304}, "mem_gb": 9.67}
|
| 54 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7748054912365973, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 343}, "mem_gb": 9.69}
|
| 55 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8812485810771584, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 314}, "mem_gb": 9.69}
|
| 56 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7946364376689617, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 300}, "mem_gb": 9.79}
|
| 57 |
+
[eval step 40] sample: "in an arithmetic sequence, let's denote the first term as \\(a_1\\) and the common difference as \\(d\\). the general term \\(a_n\\) can be expressed as \\(a_n = a_1 + (n-1)d\\).\n\nwe are given the equation \\("
|
| 58 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6385889235652983, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 318}, "mem_gb": 9.83}
|
| 59 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49948651599921284, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 279}, "mem_gb": 9.87}
|
| 60 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8268414446524034, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 364}, "mem_gb": 9.93}
|
| 61 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5464487102142845, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 256}, "mem_gb": 10.0}
|
| 62 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9580063865864028, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 340}, "mem_gb": 9.7}
|
| 63 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4799229547051092, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 283}, "mem_gb": 9.93}
|
| 64 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8148563946018617, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 349}, "mem_gb": 9.71}
|
| 65 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4979148532440265, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 297}, "mem_gb": 9.79}
|
| 66 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.004111134706748, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 359}, "mem_gb": 9.76}
|
| 67 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6419923638241987, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 342}, "mem_gb": 9.8}
|
| 68 |
+
[eval step 50] sample: 'in the arithmetic sequence {a_n} where a_1 is the first term and a_n is the n-th term, we have the equation: a_1 + 3a_8 + a_{15} = 120. to find the value of 2a_9 - a_{10}, we'
|
| 69 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45401846340596674, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 269}, "mem_gb": 9.97}
|
| 70 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.611486088803721, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 324}, "mem_gb": 9.95}
|
| 71 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46173349438166866, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 281}, "mem_gb": 9.94}
|
| 72 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5997989413438986, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 287}, "mem_gb": 9.99}
|
| 73 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7524433438550681, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 296}, "mem_gb": 10.0}
|
| 74 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5106750715066989, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 267}, "mem_gb": 10.05}
|
| 75 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47578693767903996, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 249}, "mem_gb": 9.96}
|
| 76 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8217364189067855, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 363}, "mem_gb": 9.65}
|
| 77 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5243174418509627, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 299}, "mem_gb": 9.79}
|
| 78 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8042325482209524, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 331}, "mem_gb": 9.67}
|
| 79 |
+
[eval step 60] sample: "in an arithmetic sequence, the sum of the first term and the eighth term is equal to 120. let's denote the first term as $a_1$ and the common difference as $d$. the terms of the sequence can be expres"
|
| 80 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44887882145475594, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 280}, "mem_gb": 9.88}
|
| 81 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.807150111862272, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 350}, "mem_gb": 9.86}
|
| 82 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8128710226175686, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 321}, "mem_gb": 9.63}
|
| 83 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43036911633176106, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 281}, "mem_gb": 9.93}
|
| 84 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9279526206891984, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 331}, "mem_gb": 9.6}
|
| 85 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6769559304581955, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 318}, "mem_gb": 9.98}
|
| 86 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5426464771968623, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 309}, "mem_gb": 9.99}
|
| 87 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4952886541346088, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 304}, "mem_gb": 9.88}
|
| 88 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34394927999929836, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 279}, "mem_gb": 9.9}
|
| 89 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1868917819891125, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 248}, "mem_gb": 9.9}
|
| 90 |
+
[eval step 70] sample: "to solve the problem, let's start by defining the terms of the arithmetic sequence. an arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). the \\(n\\)-th term can b"
|
| 91 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.591868079894657, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 268}, "mem_gb": 9.88}
|
| 92 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5950536540173615, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 299}, "mem_gb": 9.98}
|
| 93 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6303575264502937, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 322}, "mem_gb": 9.84}
|
| 94 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4065308028669097, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 248}, "mem_gb": 10.01}
|
| 95 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6363326350304609, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 326}, "mem_gb": 9.91}
|
| 96 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5638598193736126, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 314}, "mem_gb": 9.67}
|
| 97 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19234278509002178, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 232}, "mem_gb": 10.0}
|
| 98 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8111088057644665, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 330}, "mem_gb": 9.73}
|
| 99 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531506898276508, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 292}, "mem_gb": 9.88}
|
| 100 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7231203843460728, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 312}, "mem_gb": 9.91}
|
| 101 |
+
[eval step 80] sample: 'to solve the problem, we start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequenc'
|
| 102 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8621283940074345, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 382}, "mem_gb": 9.71}
|
| 103 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8443827647795901, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 360}, "mem_gb": 9.58}
|
| 104 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15145623211329803, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.3, "frames": {"chat": 222}, "mem_gb": 9.85}
|
| 105 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7994886162946622, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 342}, "mem_gb": 9.9}
|
| 106 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7824750316541642, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 337}, "mem_gb": 9.7}
|
| 107 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5115409725200385, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 304}, "mem_gb": 9.95}
|
| 108 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5065575876029208, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 326}, "mem_gb": 9.84}
|
| 109 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6966159891559432, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 310}, "mem_gb": 9.9}
|
| 110 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6638838457557683, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 328}, "mem_gb": 9.72}
|
| 111 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7697006537141899, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 347}, "mem_gb": 9.55}
|
| 112 |
+
[eval step 90] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\(a_1\\) is the first'
|
| 113 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6509984627686441, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 330}, "mem_gb": 9.84}
|
| 114 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18987354269406448, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.3, "frames": {"chat": 209}, "mem_gb": 10.04}
|
| 115 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7727640258224681, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 399}, "mem_gb": 9.62}
|
| 116 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7771029068230341, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 351}, "mem_gb": 9.7}
|
| 117 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060310102191443, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 322}, "mem_gb": 9.71}
|
| 118 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7615831184712549, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 333}, "mem_gb": 9.6}
|
| 119 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5635918581945821, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 330}, "mem_gb": 9.88}
|
| 120 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15579697014677027, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 238}, "mem_gb": 9.92}
|
| 121 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36495352867400893, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 297}, "mem_gb": 9.82}
|
| 122 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.680414218877318, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 345}, "mem_gb": 9.79}
|
| 123 |
+
[eval step 100] sample: "to solve the problem, let's start by defining the terms of the arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the first"
|
| 124 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969258860856295, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 304}, "mem_gb": 9.93}
|
| 125 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6580879160174479, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 326}, "mem_gb": 9.93}
|
| 126 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7947875859295328, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 347}, "mem_gb": 9.86}
|
| 127 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7254189917428419, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 325}, "mem_gb": 9.75}
|
| 128 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4551183176329359, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 299}, "mem_gb": 9.93}
|
| 129 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8312028536933164, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 345}, "mem_gb": 9.71}
|
| 130 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.724544562044243, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 344}, "mem_gb": 9.6}
|
| 131 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5546102614038313, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 344}, "mem_gb": 9.87}
|
| 132 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5019063033918539, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 288}, "mem_gb": 9.93}
|
| 133 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49880629771401486, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 303}, "mem_gb": 9.63}
|
| 134 |
+
[eval step 110] sample: 'to solve the problem, we start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequenc'
|
| 135 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3420428987864405, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 284}, "mem_gb": 9.82}
|
| 136 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8548884526256472, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 369}, "mem_gb": 9.72}
|
| 137 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3923035353373736, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 269}, "mem_gb": 9.98}
|
| 138 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7426191418388237, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 341}, "mem_gb": 9.73}
|
| 139 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7612711408747981, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 384}, "mem_gb": 9.5}
|
| 140 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6557121880043298, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 358}, "mem_gb": 9.67}
|
| 141 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7544703280287485, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 342}, "mem_gb": 9.84}
|
| 142 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8084232264186566, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 143 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.728432120089233, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 337}, "mem_gb": 9.89}
|
| 144 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6394298695983986, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 333}, "mem_gb": 10.0}
|
| 145 |
+
[eval step 120] sample: 'to find the value of \\(2a_9 - a_{10}\\) in the arithmetic sequence \\(\\{a_n\\}\\) given that \\(a_1 + 3a_8 + a_{15} = 120\\), we need to follow these steps:\n\n1. **express \\(a_'
|
| 146 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4417629444235315, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 293}, "mem_gb": 10.04}
|
| 147 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4356932476295779, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 291}, "mem_gb": 9.8}
|
| 148 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6644023360354205, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 341}, "mem_gb": 9.83}
|
| 149 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.450215597385789, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 150 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38972865528166295, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 270}, "mem_gb": 9.99}
|
| 151 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31303780065358927, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 259}, "mem_gb": 10.01}
|
| 152 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7344888858980809, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 355}, "mem_gb": 9.58}
|
| 153 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7927602957720558, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 388}, "mem_gb": 9.94}
|
| 154 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6738013232462108, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 318}, "mem_gb": 9.65}
|
| 155 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7895144004153709, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 383}, "mem_gb": 9.78}
|
| 156 |
+
[eval step 130] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, the nth term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is "
|
| 157 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45289700272611033, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 300}, "mem_gb": 9.79}
|
| 158 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4185119778055077, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 295}, "mem_gb": 9.88}
|
| 159 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45578845382295546, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 306}, "mem_gb": 9.62}
|
| 160 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5891319619006787, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 303}, "mem_gb": 9.88}
|
| 161 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2952498745908961, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 272}, "mem_gb": 9.95}
|
| 162 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40067317202935615, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 248}, "mem_gb": 9.94}
|
| 163 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4329392775816222, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 282}, "mem_gb": 9.93}
|
| 164 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6656839586149901, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 362}, "mem_gb": 9.5}
|
| 165 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7296052422739565, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 374}, "mem_gb": 9.85}
|
| 166 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41005820041863866, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 280}, "mem_gb": 10.03}
|
| 167 |
+
[eval step 140] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
|
| 168 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30482135014347733, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 276}, "mem_gb": 9.87}
|
| 169 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40865951122101396, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 246}, "mem_gb": 10.01}
|
| 170 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7642517018852134, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 360}, "mem_gb": 9.54}
|
| 171 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.725740426915201, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 365}, "mem_gb": 9.72}
|
| 172 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5890660974250486, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 338}, "mem_gb": 9.8}
|
| 173 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3256117796968669, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 276}, "mem_gb": 9.91}
|
| 174 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17430296553187072, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 209}, "mem_gb": 9.99}
|
| 175 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6998802567265928, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 379}, "mem_gb": 9.59}
|
| 176 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6028760781408598, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 307}, "mem_gb": 9.93}
|
| 177 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42197037402546655, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 293}, "mem_gb": 9.97}
|
| 178 |
+
[eval step 150] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
|
| 179 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep25_s1226/step0150
|
| 180 |
+
wandb: updating run metadata
|
| 181 |
+
wandb: uploading summary, console lines 168-168
|
| 182 |
+
wandb:
|
| 183 |
+
wandb: Run history:
|
| 184 |
+
wandb: comp_len β
βββ
ββββββββββββββββ
ββββββββββ
ββββββββββ
|
| 185 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
β
ββββββββββββββ
|
| 186 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 187 |
+
wandb: finish_rate ββββββ
βββββ
βββββββββββββββββ
β
ββββ
β
βββ
β
ββ
|
| 188 |
+
wandb: forward_topk_kl βββββββββ
βββββββββββββββββββββββββββββββ
|
| 189 |
+
wandb: grad_norm ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: mem_gb βββββββββ
ββββββββββ
ββββ
β
β
ββ
β
βββββ
ββββ
βββ
|
| 192 |
+
wandb: step βββββββββββββββββββββββ
β
β
β
β
β
ββββββββββββ
|
| 193 |
+
wandb: t_data_s ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: +3 ...
|
| 195 |
+
wandb:
|
| 196 |
+
wandb: Run summary:
|
| 197 |
+
wandb: comp_len 409.6
|
| 198 |
+
wandb: cumulative_loss_tokens 18000000
|
| 199 |
+
wandb: epoch 0
|
| 200 |
+
wandb: finish_rate 0.942
|
| 201 |
+
wandb: forward_topk_kl 0.42197
|
| 202 |
+
wandb: grad_norm 0.60938
|
| 203 |
+
wandb: lr 3e-05
|
| 204 |
+
wandb: mem_gb 9.97
|
| 205 |
+
wandb: step 150
|
| 206 |
+
wandb: t_data_s 0
|
| 207 |
+
wandb: +4 ...
|
| 208 |
+
wandb:
|
| 209 |
+
wandb: π View run glean_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/n3zawkef
|
| 210 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 211 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 212 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep25_s1226/wandb/run-20260717_125422-n3zawkef/logs
|
healed/grid_general/glean_keep25_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep50_s1224.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run 09wxy7fc
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1224/wandb/run-20260718_073554-09wxy7fc
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep50_s1224
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/09wxy7fc
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41026050324359287, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.46875, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 259}, "mem_gb": 15.93}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: "To compute the rank of a given 4x4 matrix, we determine the maximum number of linearly independent rows or columns. Let's start by writing the matrix:\n\n\\[ A = \\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 &"
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6125910406349848, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 4.0, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 348}, "mem_gb": 15.64}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5558083608713001, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.65625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 370}, "mem_gb": 15.79}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21421229442053785, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.703125, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 244}, "mem_gb": 16.02}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42800646155917393, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 2.015625, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 320}, "mem_gb": 15.94}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5072242975796263, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.0625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 378}, "mem_gb": 15.54}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5623697880142678, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.7109375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 384}, "mem_gb": 16.04}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5245557690681268, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.6875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 324}, "mem_gb": 15.88}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19431947070813427, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 239}, "mem_gb": 16.05}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4868344773328553, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.1875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 306}, "mem_gb": 15.79}
|
| 26 |
+
[eval step 10] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's analyze the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -"
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49339593205762405, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 329}, "mem_gb": 15.82}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2315545183274895, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 254}, "mem_gb": 16.05}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039000242040182, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 273}, "mem_gb": 16.03}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14603102097815523, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.7, "frames": {"chat": 236}, "mem_gb": 15.95}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5283165326805165, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 381}, "mem_gb": 15.68}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18666007972145454, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 266}, "mem_gb": 15.88}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30335749817738933, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 308}, "mem_gb": 15.87}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2528139771472663, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 273}, "mem_gb": 16.05}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4353269448962373, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 368}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5400869541162004, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 339}, "mem_gb": 15.92}
|
| 37 |
+
[eval step 20] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's start by reducing the matrix to row-echelon form (REF) or row-intercept form (RIF)."
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2673527224904237, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 298}, "mem_gb": 15.85}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42571741502949345, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 350}, "mem_gb": 15.57}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22796272560587774, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 246}, "mem_gb": 16.02}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4381943601517628, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 375}, "mem_gb": 15.75}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4388858132005359, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 352}, "mem_gb": 15.8}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44192338454971714, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 396}, "mem_gb": 15.76}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36236347859626017, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 362}, "mem_gb": 15.61}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.463430282891728, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 369}, "mem_gb": 15.82}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4662565063331276, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 399}, "mem_gb": 15.67}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22530132904412845, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 247}, "mem_gb": 15.95}
|
| 48 |
+
[eval step 30] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. Let's analyze the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -"
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08528111579132577, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 230}, "mem_gb": 15.88}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18954650380682822, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 263}, "mem_gb": 16.05}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2115665530679437, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 264}, "mem_gb": 16.04}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3928269195322103, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 328}, "mem_gb": 15.9}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18860378520867477, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 281}, "mem_gb": 15.97}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13190081692673267, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 237}, "mem_gb": 15.96}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17077195692410072, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 278}, "mem_gb": 16.05}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38257827037526293, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 310}, "mem_gb": 15.92}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22061063767167896, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 295}, "mem_gb": 15.86}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2498053479500736, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 329}, "mem_gb": 15.87}
|
| 59 |
+
[eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Formulate the Matrix**:\n \\"
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23681824228313442, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 263}, "mem_gb": 15.99}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26467789245061574, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 315}, "mem_gb": 15.87}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36451303250255684, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 354}, "mem_gb": 15.82}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16006798961240176, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 259}, "mem_gb": 16.0}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23957160875654468, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 275}, "mem_gb": 15.85}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34685020303507336, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 334}, "mem_gb": 15.72}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37954779932778326, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 374}, "mem_gb": 15.57}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3203222113084979, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 311}, "mem_gb": 15.75}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2674280841496773, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 259}, "mem_gb": 16.05}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3195787520647049, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 305}, "mem_gb": 16.04}
|
| 70 |
+
[eval step 50] sample: "To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is defined as the maximum number of linearly independent rows or columns in the matrix.\n\nLet's repres"
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28261407673442734, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 298}, "mem_gb": 16.01}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4267853798161571, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 364}, "mem_gb": 15.79}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19721985776678969, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 302}, "mem_gb": 15.89}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4182707277630766, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 316}, "mem_gb": 15.65}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43091711902953683, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31012510406343885, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 330}, "mem_gb": 15.9}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045633674311141, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 321}, "mem_gb": 15.91}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30578674541981893, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 344}, "mem_gb": 15.94}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3581601472315068, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 353}, "mem_gb": 15.61}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17521235730432283, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 272}, "mem_gb": 16.04}
|
| 82 |
+
[eval step 60] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3977586137867843, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 317}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15510378736282388, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 292}, "mem_gb": 15.79}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07634465584444503, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 229}, "mem_gb": 15.9}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38854067337010056, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 359}, "mem_gb": 15.91}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33608994229706, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 358}, "mem_gb": 15.63}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4052233465592687, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 315}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24311472296013187, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 264}, "mem_gb": 16.09}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39123050851753605, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 337}, "mem_gb": 15.76}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18062976350033036, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 251}, "mem_gb": 16.05}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29068873614870633, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 298}, "mem_gb": 15.78}
|
| 93 |
+
[eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22665819143780197, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 264}, "mem_gb": 16.0}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22798893289885794, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 305}, "mem_gb": 16.01}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21353942297726558, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 322}, "mem_gb": 15.79}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3646789829758306, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 361}, "mem_gb": 15.77}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25135638570307445, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 321}, "mem_gb": 15.95}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3001220568033711, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 307}, "mem_gb": 15.85}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3653722489182527, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 327}, "mem_gb": 15.94}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41658282146000614, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 356}, "mem_gb": 15.56}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18712107114459697, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 283}, "mem_gb": 15.9}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3677279804726752, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 401}, "mem_gb": 15.66}
|
| 104 |
+
[eval step 80] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix \\( A \\) as follows:\n\\[ A = \\begin"
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22647504430717477, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 288}, "mem_gb": 15.85}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30207622203271217, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 323}, "mem_gb": 15.89}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41436750751448176, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 336}, "mem_gb": 15.78}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33888237207851685, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 329}, "mem_gb": 15.69}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3288877253720537, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 343}, "mem_gb": 15.67}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3539777154279873, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 336}, "mem_gb": 15.79}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32270204152623194, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 314}, "mem_gb": 16.03}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19293650152059272, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 281}, "mem_gb": 15.86}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2548869115995243, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 299}, "mem_gb": 15.74}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32871011509491754, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 328}, "mem_gb": 15.93}
|
| 115 |
+
[eval step 90] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24049307317749286, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 271}, "mem_gb": 16.03}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2500695445594067, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 269}, "mem_gb": 16.13}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41031095662157363, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 370}, "mem_gb": 15.68}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4378245968754093, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 352}, "mem_gb": 15.74}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3705204147895798, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 330}, "mem_gb": 15.94}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2865605506530808, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 1.28125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 334}, "mem_gb": 15.66}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2915421401655922, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 336}, "mem_gb": 15.8}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.208741261095802, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 309}, "mem_gb": 15.89}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3683408903537318, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 391}, "mem_gb": 15.77}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18484274740877252, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 264}, "mem_gb": 16.17}
|
| 126 |
+
[eval step 100] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3254158294330351, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 349}, "mem_gb": 15.72}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31245640341866143, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 312}, "mem_gb": 15.78}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1010662712728139, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 229}, "mem_gb": 16.04}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27768244563263533, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 288}, "mem_gb": 16.05}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37915563974818217, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 351}, "mem_gb": 15.7}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12691036371852582, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 223}, "mem_gb": 16.07}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06251050735600293, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.341796875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 213}, "mem_gb": 16.03}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3438070843582042, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 380}, "mem_gb": 15.88}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19785756601657098, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 271}, "mem_gb": 16.07}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.392524952324635, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 340}, "mem_gb": 15.96}
|
| 138 |
+
[eval step 110] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly indepe'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39372597963521255, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 366}, "mem_gb": 15.65}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12795156174354877, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 233}, "mem_gb": 16.05}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2615191206465631, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 312}, "mem_gb": 15.91}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36459084595150004, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 363}, "mem_gb": 15.62}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3736453896711891, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 323}, "mem_gb": 15.9}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3901250712420481, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 346}, "mem_gb": 15.64}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36104256626622133, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 318}, "mem_gb": 15.79}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27432062879757335, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 275}, "mem_gb": 15.97}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33292323357574644, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 345}, "mem_gb": 15.72}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32694811743755514, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 377}, "mem_gb": 15.86}
|
| 149 |
+
[eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26787347213877366, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 294}, "mem_gb": 16.09}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3789762637352571, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 338}, "mem_gb": 15.78}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38668672952881705, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 352}, "mem_gb": 15.68}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3450175064574927, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 347}, "mem_gb": 15.73}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21579163084252118, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 310}, "mem_gb": 15.71}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40773547251814357, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 15.73}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21900573283399766, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 319}, "mem_gb": 16.01}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14443418615746, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 16.04}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28653879117236164, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 310}, "mem_gb": 15.9}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18174955978657428, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 259}, "mem_gb": 16.07}
|
| 160 |
+
[eval step 130] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as follows:\n\\[ A = \\begin{bma"
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18174413637655476, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38424231208128234, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 337}, "mem_gb": 15.6}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19688730391527837, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 290}, "mem_gb": 15.86}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32914502366026865, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 349}, "mem_gb": 15.79}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20545787117381892, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 291}, "mem_gb": 15.89}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3427318941450057, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 342}, "mem_gb": 15.76}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41065252649138373, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 338}, "mem_gb": 15.7}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38238009223972136, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 356}, "mem_gb": 15.67}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17387144767005616, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3056366472713649, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 353}, "mem_gb": 15.76}
|
| 171 |
+
[eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as follows:\n\\[ A = \\begin{bma"
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2851792412651082, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 316}, "mem_gb": 15.95}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25289674596640593, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 289}, "mem_gb": 16.1}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2580651386136189, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 331}, "mem_gb": 15.73}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2536245377596778, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 320}, "mem_gb": 16.05}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22945189654111553, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 272}, "mem_gb": 15.78}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4198826794961778, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 368}, "mem_gb": 15.7}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34152062557879836, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 328}, "mem_gb": 15.73}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33140167462996517, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 326}, "mem_gb": 15.95}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38146266262708234, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 364}, "mem_gb": 15.89}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23909615996540523, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 296}, "mem_gb": 15.93}
|
| 182 |
+
[eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the steps:\n\n1. **Formulate the Matrix:**\n \\[\n A ="
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1224/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len βββ
ββ
ββββββ
ββ
βββββββ
ββββββββββββββββββ
ββ
|
| 189 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
βββββββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate ββββ
βββββββββββββ
βββββββββββββββββββββββ
|
| 192 |
+
wandb: forward_topk_kl βββββ
ββββββββββ
βββββββ
ββ
β
ββββ
ββ
ββββββ
βββ
|
| 193 |
+
wandb: grad_norm ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb ββββββββββ
β
ββ
βββββββββββββ
βββββ
βββββββββ
|
| 196 |
+
wandb: step ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 405.4
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.97
|
| 205 |
+
wandb: forward_topk_kl 0.2391
|
| 206 |
+
wandb: grad_norm 0.48047
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 15.93
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run glean_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/09wxy7fc
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1224/wandb/run-20260718_073554-09wxy7fc/logs
|
healed/grid_general/glean_keep50_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep50_s1225.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run 5uic08kb
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1225/wandb/run-20260718_073824-5uic08kb
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep50_s1225
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/5uic08kb
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6853121227722615, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 4.5625, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 331}, "mem_gb": 15.8}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: "To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both the monthly savings and the interest earned on the growing savings.\n\nLet's denote \\( n \\) as"
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6300968874294932, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 4.15625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 342}, "mem_gb": 15.67}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.692082746409749, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 4.1875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.71}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5611744172318528, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.96875, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 344}, "mem_gb": 15.79}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35070478902595736, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.8359375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 267}, "mem_gb": 16.11}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16416748266015202, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.3203125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 248}, "mem_gb": 15.94}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48838783907449496, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.5546875, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 329}, "mem_gb": 15.93}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5164903825346381, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.46875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 339}, "mem_gb": 15.89}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5744703302371936, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.3359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 354}, "mem_gb": 15.89}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3220325999762863, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 279}, "mem_gb": 16.02}
|
| 26 |
+
[eval step 10] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investment account.\n\n1. **Monthly Sav'
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39639907065903146, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.9921875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 318}, "mem_gb": 15.95}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2601489280415078, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 265}, "mem_gb": 16.04}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2406185398230329, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 254}, "mem_gb": 15.98}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363238035394003, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 315}, "mem_gb": 16.01}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49244476905980455, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 300}, "mem_gb": 15.81}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31747139668446034, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 276}, "mem_gb": 16.01}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4976991202985247, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 356}, "mem_gb": 15.95}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45945094148851934, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 304}, "mem_gb": 15.77}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4641048119674747, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 375}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23674259848222137, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 294}, "mem_gb": 16.04}
|
| 37 |
+
[eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41813104864781103, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 299}, "mem_gb": 16.05}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3198011468975184, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 305}, "mem_gb": 15.83}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.185373840557194, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 262}, "mem_gb": 15.88}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2695752582576436, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 303}, "mem_gb": 15.94}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44112187557655075, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 380}, "mem_gb": 15.82}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22534518425241112, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 282}, "mem_gb": 15.78}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4030095595076059, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 362}, "mem_gb": 15.79}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40417502531719707, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 307}, "mem_gb": 16.04}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26630948204637195, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 282}, "mem_gb": 15.9}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.404437967997541, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 337}, "mem_gb": 15.93}
|
| 48 |
+
[eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2456684964166023, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 275}, "mem_gb": 15.99}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43714953695784015, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 318}, "mem_gb": 15.8}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48897211201159907, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 385}, "mem_gb": 15.83}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5083572860651339, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 316}, "mem_gb": 15.78}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20059632252743467, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 266}, "mem_gb": 16.07}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44036612436138095, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 371}, "mem_gb": 15.8}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22354543038383126, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 262}, "mem_gb": 16.01}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4603919888367876, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 348}, "mem_gb": 15.83}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08354806087507556, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 222}, "mem_gb": 16.07}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3995035542997842, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 408}, "mem_gb": 15.63}
|
| 59 |
+
[eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and investment earnings.\n\n**Step 1: Calculate the '
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3865900962865601, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 334}, "mem_gb": 15.7}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20412868370236828, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38240270777683083, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 2.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 352}, "mem_gb": 15.73}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33955983549657587, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 371}, "mem_gb": 15.54}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23050914932532857, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 284}, "mem_gb": 15.99}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17779509922672684, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 287}, "mem_gb": 16.06}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16358218302348007, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 285}, "mem_gb": 15.95}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11037308089152599, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 252}, "mem_gb": 16.04}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38853509445575374, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 360}, "mem_gb": 15.83}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41493850585259495, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 359}, "mem_gb": 15.82}
|
| 70 |
+
[eval step 50] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned on their investment.\n\n**St'
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4150059717571751, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 363}, "mem_gb": 15.58}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.356912271811751, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 361}, "mem_gb": 15.67}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21980295595508068, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 286}, "mem_gb": 15.86}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40459172328654674, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 367}, "mem_gb": 15.71}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4347790555938457, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 352}, "mem_gb": 15.74}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2564696355306543, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 314}, "mem_gb": 15.69}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3645872671695737, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 372}, "mem_gb": 15.66}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32099489957615734, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 334}, "mem_gb": 15.81}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42441788537126657, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 368}, "mem_gb": 15.75}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3157586787485828, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 354}, "mem_gb": 15.9}
|
| 82 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17141324029487248, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 293}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11631773663458105, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 231}, "mem_gb": 15.95}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3005876206895957, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2012761780796883, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 263}, "mem_gb": 16.06}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2171035258341891, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 252}, "mem_gb": 15.99}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31330071536609905, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 344}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29038542925980876, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 313}, "mem_gb": 15.95}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3494604504799781, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 358}, "mem_gb": 15.65}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1609218665544875, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 267}, "mem_gb": 15.87}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3441237420997582, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 300}, "mem_gb": 15.74}
|
| 93 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27720354586439205, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 348}, "mem_gb": 15.68}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3511818683579564, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 329}, "mem_gb": 15.77}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1929187020015282, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 269}, "mem_gb": 15.93}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38554286157476403, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.6}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22364256096049212, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 302}, "mem_gb": 15.86}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.379288532902052, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 381}, "mem_gb": 15.87}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41174931660033764, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 379}, "mem_gb": 15.82}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3892458708143172, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 351}, "mem_gb": 15.64}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3370368604900936, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 330}, "mem_gb": 15.84}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35013818602425356, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 316}, "mem_gb": 15.87}
|
| 104 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, starting with $50,000 and saving $2,500 each month, along with an additional $'
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22324992848370845, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 276}, "mem_gb": 16.05}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1766008067708773, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 240}, "mem_gb": 15.99}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21798422811301424, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 288}, "mem_gb": 15.9}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2075130866493409, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 271}, "mem_gb": 15.89}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3159274495856216, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 357}, "mem_gb": 15.84}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41152762305407475, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 354}, "mem_gb": 15.81}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39856506082707394, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 302}, "mem_gb": 16.05}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2919200394155768, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 297}, "mem_gb": 16.04}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09611441166807587, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 219}, "mem_gb": 16.06}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3893690294975725, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 306}, "mem_gb": 15.76}
|
| 115 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the total'
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38563687218427656, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 343}, "mem_gb": 15.7}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.361127767519032, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 341}, "mem_gb": 15.81}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21086774204637235, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 318}, "mem_gb": 15.76}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38588710091318934, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 346}, "mem_gb": 15.65}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19287135322925944, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 277}, "mem_gb": 16.13}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18192729682745412, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 270}, "mem_gb": 15.86}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23325805287010346, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 257}, "mem_gb": 16.04}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36902173152739803, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 363}, "mem_gb": 15.65}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.374097685023242, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 356}, "mem_gb": 15.79}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33262620056254477, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 323}, "mem_gb": 15.82}
|
| 126 |
+
[eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the total'
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16448043116433547, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 243}, "mem_gb": 16.07}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3484302015217642, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 307}, "mem_gb": 15.75}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3274071234525802, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 346}, "mem_gb": 15.99}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21096278094189863, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 273}, "mem_gb": 15.99}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21774797727145875, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32626048213625325, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 337}, "mem_gb": 16.05}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2417104805881468, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 280}, "mem_gb": 15.93}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.405092308748172, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 331}, "mem_gb": 15.83}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24347472621266109, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 314}, "mem_gb": 15.93}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4211603428164497, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 294}, "mem_gb": 15.86}
|
| 138 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18866508930400014, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 274}, "mem_gb": 15.99}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33154945716994505, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 365}, "mem_gb": 15.71}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20360647340489862, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 323}, "mem_gb": 15.77}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1340352246530354, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 234}, "mem_gb": 16.06}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17894358484946812, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 267}, "mem_gb": 16.06}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22424391842950137, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 304}, "mem_gb": 15.82}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3561152476095905, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 373}, "mem_gb": 15.75}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20931611265816416, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 300}, "mem_gb": 16.03}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37135114704612643, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 331}, "mem_gb": 15.87}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1569274458857719, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 259}, "mem_gb": 16.01}
|
| 149 |
+
[eval step 120] sample: 'To solve this problem we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n1. **Initial Savings:**\n Jam'
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3248357699602532, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 358}, "mem_gb": 15.63}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39332515030226983, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 354}, "mem_gb": 15.88}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18586578806418305, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 279}, "mem_gb": 15.95}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39211959884545455, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 354}, "mem_gb": 15.7}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.364780769649862, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 334}, "mem_gb": 15.9}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38099857076462357, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 327}, "mem_gb": 15.77}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34246316302871954, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 365}, "mem_gb": 15.87}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19133322554122037, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 252}, "mem_gb": 16.08}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1562701092961089, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 256}, "mem_gb": 16.04}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20471605217938002, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 302}, "mem_gb": 15.81}
|
| 160 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n1. **Initial Savings:** Jamie'
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33671943904329094, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 350}, "mem_gb": 15.72}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19857066868400822, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 292}, "mem_gb": 15.84}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3459093042377072, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 356}, "mem_gb": 15.65}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2339350832606045, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 347}, "mem_gb": 15.82}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21164681599900748, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 330}, "mem_gb": 16.01}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3498723207845663, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 363}, "mem_gb": 15.87}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32028547865971924, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 354}, "mem_gb": 15.73}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17074598619239406, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 270}, "mem_gb": 15.99}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33173287250131056, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 343}, "mem_gb": 15.77}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07786983747505583, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 232}, "mem_gb": 15.96}
|
| 171 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3108461571379565, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 346}, "mem_gb": 15.91}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2508645673315041, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 306}, "mem_gb": 15.99}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1583715583874844, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 273}, "mem_gb": 16.04}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17659224952206326, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 266}, "mem_gb": 15.86}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2698487444297721, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 299}, "mem_gb": 16.06}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18426784236074115, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 259}, "mem_gb": 16.14}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21372967740772292, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 325}, "mem_gb": 15.88}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20076305093116437, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 271}, "mem_gb": 15.95}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3275998032643149, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 359}, "mem_gb": 15.74}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31545391854941845, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 345}, "mem_gb": 15.8}
|
| 182 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000 given their monthly savings and investment earnings.\n\n**Step 1: Calculate the month'
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1225/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading output.log; uploading config.yaml
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len βββββ
βββ
ββ
βββββββββββββββββ
βββββββ
ββββββ
|
| 189 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββ
β
β
β
β
β
βββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate βββββββββββββ
β
ββββββββ
ββββββββββββββββββ
|
| 192 |
+
wandb: forward_topk_kl ββ
βββ
ββββββ
β
ββ
ββββββββββββββββββββββββββ
|
| 193 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb βββ
βββββββββββββββββ
βββ
βββββββ
ββ
ββ
βββββ
β
|
| 196 |
+
wandb: step βββββββββββββββββ
β
β
β
β
β
β
β
β
βββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 347.8
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.997
|
| 205 |
+
wandb: forward_topk_kl 0.31545
|
| 206 |
+
wandb: grad_norm 0.57812
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 15.8
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run glean_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/5uic08kb
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1225/wandb/run-20260718_073824-5uic08kb/logs
|
healed/grid_general/glean_keep50_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep50_s1226.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run frl49wbd
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep50_s1226/wandb/run-20260718_074054-frl49wbd
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep50_s1226
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/frl49wbd
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44869900887217373, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.21875, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 308}, "mem_gb": 15.9}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence. in an arithmetic sequence, each term can be written as \\(a_n = a_1 + (n-1)d\\), where \\(a_1\\) is the first term and"
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17543124351594597, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 2.46875, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 211}, "mem_gb": 16.04}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3475665108046184, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 2.625, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 281}, "mem_gb": 16.04}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6226910541420803, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 3.453125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 367}, "mem_gb": 15.59}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5943815913854787, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.0, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4530718907893946, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.0, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 271}, "mem_gb": 16.06}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3028890410714472, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.2109375, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 269}, "mem_gb": 16.03}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5222243581845115, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.421875, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 352}, "mem_gb": 15.55}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2287902546222632, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 243}, "mem_gb": 16.04}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33752491750195623, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 293}, "mem_gb": 15.96}
|
| 26 |
+
[eval step 10] sample: 'to solve this problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is a constant plus a multiple of the common difference \\(d\\).\n\ngiven: \\(a_1 '
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19984550218141328, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 242}, "mem_gb": 16.04}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5291998529329895, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 353}, "mem_gb": 15.73}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5019098932476714, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 338}, "mem_gb": 15.74}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25008603849976013, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 259}, "mem_gb": 16.04}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539178870101149, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 385}, "mem_gb": 15.59}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4183598988139381, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 355}, "mem_gb": 15.76}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3862020888838296, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 328}, "mem_gb": 15.66}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41443256092270214, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 355}, "mem_gb": 15.81}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49797730628168213, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 367}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45042725155310087, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 343}, "mem_gb": 15.72}
|
| 37 |
+
[eval step 20] sample: "to solve the problem, let's first define the terms of the arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, d, to the previous term. the nth term, "
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13549072327846662, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 244}, "mem_gb": 16.04}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26835141508476806, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 339}, "mem_gb": 15.88}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2722277679784844, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 298}, "mem_gb": 16.03}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43167479179799556, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 398}, "mem_gb": 15.91}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3850022841591388, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 362}, "mem_gb": 16.01}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2518655974011868, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 313}, "mem_gb": 15.88}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4621668093803028, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 324}, "mem_gb": 15.79}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.280701087506488, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 314}, "mem_gb": 15.85}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41350211371698725, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 345}, "mem_gb": 15.77}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20802579678967595, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 262}, "mem_gb": 15.95}
|
| 48 |
+
[eval step 30] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n"
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48709205540517964, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 373}, "mem_gb": 15.75}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39114601502027363, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 334}, "mem_gb": 15.74}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27895974984830246, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 327}, "mem_gb": 15.89}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08200886152926833, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 238}, "mem_gb": 16.06}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3507984774490508, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 310}, "mem_gb": 15.79}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3963928083232604, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 347}, "mem_gb": 15.79}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38558109682003655, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 304}, "mem_gb": 15.72}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3600832198057324, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 343}, "mem_gb": 15.74}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41817362005176645, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 314}, "mem_gb": 15.73}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37550266109164804, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 300}, "mem_gb": 15.84}
|
| 59 |
+
[eval step 40] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n"
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2913182435174162, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 318}, "mem_gb": 15.88}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22799230576027185, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 279}, "mem_gb": 15.91}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3969371100135148, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 364}, "mem_gb": 15.98}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2563201005956779, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 256}, "mem_gb": 16.04}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47089617665515593, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 340}, "mem_gb": 15.75}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21948082380862907, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 283}, "mem_gb": 15.97}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3883261705008025, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 349}, "mem_gb": 15.76}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2240029728865251, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 297}, "mem_gb": 15.83}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48095803306822976, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 359}, "mem_gb": 15.81}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29586242280608666, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 342}, "mem_gb": 15.85}
|
| 70 |
+
[eval step 50] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20192650931620348, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 269}, "mem_gb": 16.01}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29287745077215754, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 324}, "mem_gb": 16.0}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22127733794112378, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 281}, "mem_gb": 15.99}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2794108554124211, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 287}, "mem_gb": 16.04}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33820742860746883, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 296}, "mem_gb": 16.05}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2369547254734983, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 267}, "mem_gb": 16.1}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2225485686838006, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 249}, "mem_gb": 16.0}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4115783252310939, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 363}, "mem_gb": 15.7}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24995575077252774, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 299}, "mem_gb": 15.84}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3965945136911546, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 331}, "mem_gb": 15.71}
|
| 82 |
+
[eval step 60] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20255451678559183, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 280}, "mem_gb": 15.93}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4033780362981372, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 350}, "mem_gb": 15.91}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3944911534689056, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 321}, "mem_gb": 15.67}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1912760569188744, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.6, "frames": {"chat": 281}, "mem_gb": 15.98}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4371471691887205, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 331}, "mem_gb": 15.65}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32823067393902067, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 318}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2570057192940265, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 309}, "mem_gb": 16.04}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24806714043632772, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 304}, "mem_gb": 15.93}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16365481722277278, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 279}, "mem_gb": 15.95}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07891491067543005, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 248}, "mem_gb": 15.95}
|
| 93 |
+
[eval step 70] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2977734725339028, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 268}, "mem_gb": 15.92}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2854304425325555, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 299}, "mem_gb": 16.02}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31991045414293184, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 322}, "mem_gb": 15.89}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18673701543998905, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 248}, "mem_gb": 16.06}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3047368516534256, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 326}, "mem_gb": 15.95}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2689833647923544, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 314}, "mem_gb": 15.71}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0794600971087503, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 232}, "mem_gb": 16.05}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4005749209942917, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 330}, "mem_gb": 15.78}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20405239165046563, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 292}, "mem_gb": 15.93}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3368046442796166, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 312}, "mem_gb": 15.95}
|
| 104 |
+
[eval step 80] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42961703496236975, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 382}, "mem_gb": 15.76}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43118461382541184, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 360}, "mem_gb": 15.63}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06022632997267258, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 222}, "mem_gb": 15.9}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.402991567757912, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 342}, "mem_gb": 15.94}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3791474818292384, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 337}, "mem_gb": 15.74}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23975354432749252, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 304}, "mem_gb": 16.0}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2543715253418622, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 326}, "mem_gb": 15.89}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33665994153826806, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 310}, "mem_gb": 15.95}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3190385383001218, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 328}, "mem_gb": 15.77}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39211579211782666, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 347}, "mem_gb": 15.6}
|
| 115 |
+
[eval step 90] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33030152970769755, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 330}, "mem_gb": 15.89}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07952974937635784, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 209}, "mem_gb": 16.09}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3742790118503384, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 399}, "mem_gb": 15.67}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3494311219643181, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 351}, "mem_gb": 15.75}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23376409873225104, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 322}, "mem_gb": 15.75}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3735027327584879, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 333}, "mem_gb": 15.64}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2787454779221055, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 330}, "mem_gb": 15.93}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.061159985738170025, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 238}, "mem_gb": 15.96}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16986236091982573, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 297}, "mem_gb": 15.87}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3347933178626622, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 345}, "mem_gb": 15.83}
|
| 126 |
+
[eval step 100] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24143627146867414, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 304}, "mem_gb": 15.98}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31860805926332253, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 326}, "mem_gb": 15.98}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38730974985752253, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 347}, "mem_gb": 15.91}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3456509570107795, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 325}, "mem_gb": 15.79}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2139598764131777, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 299}, "mem_gb": 15.98}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42429975788677887, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 345}, "mem_gb": 15.76}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35727461708355696, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 344}, "mem_gb": 15.65}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27024903512711945, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 344}, "mem_gb": 15.91}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24413219656674193, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 288}, "mem_gb": 15.98}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2337545271008586, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 303}, "mem_gb": 15.68}
|
| 138 |
+
[eval step 110] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16061405883897095, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 284}, "mem_gb": 15.87}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4218301228441919, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 369}, "mem_gb": 15.77}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18443894734882438, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 269}, "mem_gb": 16.02}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3631597420537534, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 341}, "mem_gb": 15.78}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363742006980783, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 384}, "mem_gb": 15.55}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32249795291616273, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 358}, "mem_gb": 15.71}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3660209851158783, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 342}, "mem_gb": 15.89}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39867758954390886, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 365}, "mem_gb": 15.71}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3542415585770582, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 337}, "mem_gb": 15.94}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31506782625516255, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 333}, "mem_gb": 16.04}
|
| 149 |
+
[eval step 120] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21195444455550363, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 293}, "mem_gb": 16.08}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19597419150111575, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 291}, "mem_gb": 15.84}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3235887088594958, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 341}, "mem_gb": 15.88}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20579119833717122, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 300}, "mem_gb": 15.81}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1839096085038657, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 270}, "mem_gb": 16.03}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14394291903308282, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 259}, "mem_gb": 16.05}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3542349284733646, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 355}, "mem_gb": 15.63}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39433789508063344, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 388}, "mem_gb": 15.98}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32491954805937906, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 318}, "mem_gb": 15.7}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3814142351918854, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 383}, "mem_gb": 15.83}
|
| 160 |
+
[eval step 130] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20706040653378394, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 300}, "mem_gb": 15.84}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19251177511254014, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 295}, "mem_gb": 15.93}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20804391421643087, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 306}, "mem_gb": 15.67}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2800164740239891, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 303}, "mem_gb": 15.93}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1362138627278153, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 272}, "mem_gb": 15.99}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19676655354738856, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 248}, "mem_gb": 15.99}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.214534022665179, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 282}, "mem_gb": 15.98}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3332282754495119, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 362}, "mem_gb": 15.54}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3743262184455991, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 374}, "mem_gb": 15.9}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18988548532904437, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 280}, "mem_gb": 16.07}
|
| 171 |
+
[eval step 140] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103970303904886, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 276}, "mem_gb": 15.92}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1973365015062814, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 246}, "mem_gb": 16.06}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38401385176287345, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 360}, "mem_gb": 15.59}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37136507782653594, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 365}, "mem_gb": 15.77}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2997990082692355, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 338}, "mem_gb": 15.85}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1491951719417237, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 276}, "mem_gb": 15.96}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0753031477817179, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 209}, "mem_gb": 16.04}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3350944878866586, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 379}, "mem_gb": 15.64}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2944304664655899, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 307}, "mem_gb": 15.98}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19635752345559498, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 293}, "mem_gb": 16.02}
|
| 182 |
+
[eval step 150] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\(d\\). the \\(n\\)-th "
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep50_s1226/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len ββββββββββββ
βββββββ
βββββββββββββ
ββββββββ
|
| 189 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββ
β
β
β
β
β
β
β
βββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate βββββββ
ββββββ
ββββ
β
βββββββββββ
βββββββββββ
|
| 192 |
+
wandb: forward_topk_kl ββββββββββββββββ
ββ
ββββββ
ββββ
β
ββ
βββ
β
βββββ
|
| 193 |
+
wandb: grad_norm ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb βββββββββββ
ββββββ
ββββββ
βββββββ
βββ
β
ββββ
ββ
|
| 196 |
+
wandb: step ββββββββββββββββββββ
β
β
β
β
β
βββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 409.6
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.942
|
| 205 |
+
wandb: forward_topk_kl 0.19636
|
| 206 |
+
wandb: grad_norm 0.48438
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 16.02
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run glean_keep50_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/frl49wbd
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep50_s1226/wandb/run-20260718_074054-frl49wbd/logs
|
healed/grid_general/glean_keep50_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep75_s1224.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run kv8yaoo0
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1224/wandb/run-20260718_162400-kv8yaoo0
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run glean_keep75_s1224
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/kv8yaoo0
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13071662265943984, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.8671875, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 259}, "mem_gb": 21.93}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19075942706478138, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.75, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 348}, "mem_gb": 21.69}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1705795612147854, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.4296875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 370}, "mem_gb": 21.84}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06008550936671284, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 0.87890625, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 244}, "mem_gb": 22.07}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1344583847473686, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 0.83984375, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 320}, "mem_gb": 21.99}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15855688806849066, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.88671875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 378}, "mem_gb": 21.59}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19471264466413607, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.9296875, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 384}, "mem_gb": 22.08}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18414592282387118, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.9140625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 324}, "mem_gb": 21.93}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06543553998661228, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 239}, "mem_gb": 22.09}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1578231074643011, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 306}, "mem_gb": 21.83}
|
| 26 |
+
[eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be full rank if all its rows (or columns) are linearly independent'
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16721250823534403, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 329}, "mem_gb": 21.87}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08395308416405071, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 254}, "mem_gb": 22.1}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14978939464626212, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 273}, "mem_gb": 22.08}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04955570665385264, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 236}, "mem_gb": 22.0}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18713464791399118, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 381}, "mem_gb": 21.73}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06574699827601822, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 266}, "mem_gb": 21.93}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10364587014786278, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 308}, "mem_gb": 21.92}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09299309689359118, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 273}, "mem_gb": 22.1}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15576760284970514, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 368}, "mem_gb": 21.72}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.206906852022931, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 339}, "mem_gb": 21.97}
|
| 37 |
+
[eval step 20] sample: 'To find the rank of a matrix, we need to determine the linearly independent rows or columns. A matrix is row-rank-reduced if it has no row with a leading coefficient of zero, and column-rank-reduced i'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09841488832480584, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 298}, "mem_gb": 21.89}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16010128328893333, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 350}, "mem_gb": 21.62}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08130882709440775, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 246}, "mem_gb": 22.06}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16791759062743902, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 375}, "mem_gb": 21.79}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16707210486374485, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 352}, "mem_gb": 21.85}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1613398754464152, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 396}, "mem_gb": 21.8}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13418258246804277, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 362}, "mem_gb": 21.66}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17745140370444085, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 369}, "mem_gb": 21.87}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17475421091622362, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 399}, "mem_gb": 21.72}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10206446115411819, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 247}, "mem_gb": 21.99}
|
| 48 |
+
[eval step 30] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's start by examining the rows:\n\n1. **Row 1:** \\(12, -16, 4, 16\\)\n2. **Row 2:** \\( -"
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.034929789173509924, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 230}, "mem_gb": 21.93}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07229219114347361, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 263}, "mem_gb": 22.1}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08192805289736328, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 22.09}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14597586551186006, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 328}, "mem_gb": 21.95}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07461191782305639, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 281}, "mem_gb": 22.02}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04791002737303885, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 237}, "mem_gb": 22.01}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06077066037804665, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 278}, "mem_gb": 22.1}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13445928165198615, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 310}, "mem_gb": 21.97}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07629239365962179, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 295}, "mem_gb": 21.91}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09102327948374053, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 329}, "mem_gb": 21.92}
|
| 59 |
+
[eval step 40] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. We can do this by using Python and the `numpy` library, which provides a'
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08641363691365501, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 263}, "mem_gb": 22.04}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1031499079908089, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 315}, "mem_gb": 21.92}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13387496521947906, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 354}, "mem_gb": 21.87}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0709399001534873, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 259}, "mem_gb": 22.04}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09207004138532406, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 275}, "mem_gb": 21.9}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12805168654941954, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 334}, "mem_gb": 21.77}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14048558220930088, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 374}, "mem_gb": 21.62}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12331899496933135, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 311}, "mem_gb": 21.79}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09510794661102506, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 259}, "mem_gb": 22.1}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12337971659527781, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 305}, "mem_gb": 22.08}
|
| 70 |
+
[eval step 50] sample: "To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the st"
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10608506205414112, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 298}, "mem_gb": 22.06}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16433386120260693, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 364}, "mem_gb": 21.84}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07193030385592332, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 302}, "mem_gb": 21.94}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15113193254228682, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 316}, "mem_gb": 21.7}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15811622174900647, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12920384376960187, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 330}, "mem_gb": 21.95}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1187352925280109, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 321}, "mem_gb": 21.95}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10613751531397769, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 344}, "mem_gb": 21.99}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1312722167108984, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 353}, "mem_gb": 21.66}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0695360666809293, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 272}, "mem_gb": 22.09}
|
| 82 |
+
[eval step 60] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1455455080981211, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 317}, "mem_gb": 21.84}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05710575391312595, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 292}, "mem_gb": 21.84}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02620867559579977, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.28515625, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.4, "frames": {"chat": 229}, "mem_gb": 21.95}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14117729600436674, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 359}, "mem_gb": 21.96}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1221605477043738, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 358}, "mem_gb": 21.68}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14994822358403664, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 315}, "mem_gb": 22.06}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09590656752044645, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 264}, "mem_gb": 22.14}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13905403746368053, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 337}, "mem_gb": 21.81}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07033825809750706, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 251}, "mem_gb": 22.1}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11051185541416829, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 298}, "mem_gb": 21.83}
|
| 93 |
+
[eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 & 1'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08863176402659155, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 22.04}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08975313320999655, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 305}, "mem_gb": 22.06}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0785589623926906, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 322}, "mem_gb": 21.83}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13083661611887315, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 361}, "mem_gb": 21.82}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09676426596191401, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 321}, "mem_gb": 22.0}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10705909703215584, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 307}, "mem_gb": 21.89}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13818720473113158, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 327}, "mem_gb": 21.99}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15953805777930344, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 356}, "mem_gb": 21.61}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07479683817312277, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 283}, "mem_gb": 21.95}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13747099903764515, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 401}, "mem_gb": 21.7}
|
| 104 |
+
[eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08265764909470454, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 288}, "mem_gb": 21.9}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11676787589995656, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 323}, "mem_gb": 21.94}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1520628171203658, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 336}, "mem_gb": 21.83}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12861729065453012, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 329}, "mem_gb": 21.74}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12267830976805029, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 343}, "mem_gb": 21.72}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1380810285254692, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 336}, "mem_gb": 21.84}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12063934380811019, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 314}, "mem_gb": 22.08}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07519182774128857, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 281}, "mem_gb": 21.91}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09502988699192647, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 299}, "mem_gb": 21.79}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12705368615441645, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 328}, "mem_gb": 21.98}
|
| 115 |
+
[eval step 90] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0862862615711987, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 271}, "mem_gb": 22.08}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09148024477822085, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 269}, "mem_gb": 22.18}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.164310840678898, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 370}, "mem_gb": 21.72}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17390583124776993, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 352}, "mem_gb": 21.78}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1377207483136716, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 330}, "mem_gb": 21.99}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10440747004504859, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 334}, "mem_gb": 21.71}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10925455036055452, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 336}, "mem_gb": 21.85}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08199445860886481, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 309}, "mem_gb": 21.93}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13870517097897828, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 391}, "mem_gb": 21.82}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07164855895055613, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 264}, "mem_gb": 22.22}
|
| 126 |
+
[eval step 100] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1266370743949432, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 349}, "mem_gb": 21.77}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12119940490340038, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 312}, "mem_gb": 21.82}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03902455932382339, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.314453125, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 229}, "mem_gb": 22.09}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10270367020117895, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 288}, "mem_gb": 22.09}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14584330164432371, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 351}, "mem_gb": 21.75}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04243294466808438, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.341796875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 223}, "mem_gb": 22.12}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.023869071152953742, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.291015625, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 213}, "mem_gb": 22.08}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12585831281617285, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 380}, "mem_gb": 21.93}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0734616152417846, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 271}, "mem_gb": 22.11}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15622796851478826, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 340}, "mem_gb": 22.01}
|
| 138 |
+
[eval step 110] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independe'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14512051825829161, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 366}, "mem_gb": 21.7}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.044982116243173366, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.33203125, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 233}, "mem_gb": 22.09}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09624799026324957, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 312}, "mem_gb": 21.96}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14220688819591887, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 363}, "mem_gb": 21.67}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14360804684354614, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 323}, "mem_gb": 21.94}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1414443791443327, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 346}, "mem_gb": 21.69}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13968993815806074, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 318}, "mem_gb": 21.83}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11073779288476022, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 275}, "mem_gb": 22.02}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.126646263968572, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 345}, "mem_gb": 21.76}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12029666416899612, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 377}, "mem_gb": 21.91}
|
| 149 |
+
[eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is rank-deficient if it has fewer linearly independent rows or '
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09910357171046393, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 294}, "mem_gb": 22.14}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103205797392876, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 338}, "mem_gb": 21.83}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15231768526208275, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 352}, "mem_gb": 21.73}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1330686989673491, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 347}, "mem_gb": 21.78}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08382959511203614, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 310}, "mem_gb": 21.76}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1573630730092215, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 358}, "mem_gb": 21.78}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07736654975072015, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 319}, "mem_gb": 22.06}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.052959537454197805, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.353515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 269}, "mem_gb": 22.09}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10328283424891221, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 310}, "mem_gb": 21.94}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06663515242016874, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 259}, "mem_gb": 22.12}
|
| 160 |
+
[eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\"
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06518598229006553, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 265}, "mem_gb": 22.1}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1502952246360791, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 337}, "mem_gb": 21.64}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07359331269300698, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 290}, "mem_gb": 21.91}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12302973660406036, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 349}, "mem_gb": 21.84}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07360859731266585, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 291}, "mem_gb": 21.94}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12916730738196056, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 342}, "mem_gb": 21.8}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17012806373077136, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 338}, "mem_gb": 21.75}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14694349039436008, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 356}, "mem_gb": 21.71}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06565651553365558, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 265}, "mem_gb": 22.09}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11438166577975886, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 353}, "mem_gb": 21.81}
|
| 171 |
+
[eval step 140] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11060065792566165, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 316}, "mem_gb": 21.99}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09960311313181494, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 289}, "mem_gb": 22.14}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09936332012518154, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 331}, "mem_gb": 21.78}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09064436243596331, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 320}, "mem_gb": 22.1}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08683979377732612, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 272}, "mem_gb": 21.83}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17217374604499588, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 368}, "mem_gb": 21.75}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12800495204334147, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 328}, "mem_gb": 21.78}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12136686044478168, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 326}, "mem_gb": 21.99}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14625438564123275, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 364}, "mem_gb": 21.93}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0935579854795166, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 296}, "mem_gb": 21.97}
|
| 182 |
+
[eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1224/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading summary, console lines 171-171
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len βββββββββββββ
ββββββββββββββββββββ
βββ
β
βββ
|
| 189 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
βββββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate ββββββ
βββ
βββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: forward_topk_kl β
β
ββββββββββββββββ
ββββ
ββ
βββ
ββββββ
βββββββ
|
| 193 |
+
wandb: grad_norm βββββ
βββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb ββββββββββββββββββββββββββββ
ββββββββββββ
|
| 196 |
+
wandb: step ββββββββββββββββββββ
β
β
β
βββββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 405.4
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.97
|
| 205 |
+
wandb: forward_topk_kl 0.09356
|
| 206 |
+
wandb: grad_norm 0.41406
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 21.97
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run glean_keep75_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/kv8yaoo0
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1224/wandb/run-20260718_162400-kv8yaoo0/logs
|
healed/grid_general/glean_keep75_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep75_s1225.console.log
ADDED
|
@@ -0,0 +1,215 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1225/wandb/run-20260718_162630-suscdijy
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run glean_keep75_s1225
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/suscdijy
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22111648944811896, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.9453125, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 331}, "mem_gb": 21.8}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: "To solve this problem we need to consider both the monthly savings and the interest earned on the investment account. Let's break it down step-by-step:\n\n1. **Initial Savings:**\n Jamie starts with $5"
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20739211166581759, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.765625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 342}, "mem_gb": 21.72}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2209934898734403, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.75, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 21.75}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1873948453382589, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.234375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 344}, "mem_gb": 21.84}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10151976801240817, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 0.7890625, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 267}, "mem_gb": 22.15}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04757711379414735, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.57421875, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 248}, "mem_gb": 21.99}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1647617442355336, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.79296875, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 329}, "mem_gb": 21.98}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17157698108962116, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.8125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 339}, "mem_gb": 21.94}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18935150277211021, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 354}, "mem_gb": 21.94}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11263611569224546, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 279}, "mem_gb": 22.07}
|
| 25 |
+
[eval step 10] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13158609575961405, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 318}, "mem_gb": 22.0}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09245108005555036, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 265}, "mem_gb": 22.09}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08413456361761006, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 254}, "mem_gb": 22.03}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13070056756052653, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 315}, "mem_gb": 22.06}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17809998495957505, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 300}, "mem_gb": 21.85}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12099112552187095, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 276}, "mem_gb": 22.06}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19513164097640354, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 356}, "mem_gb": 22.0}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15956264482447877, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 304}, "mem_gb": 21.81}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17090653341195236, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 375}, "mem_gb": 21.73}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08869710400897698, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 294}, "mem_gb": 22.09}
|
| 36 |
+
[eval step 20] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15638344656505312, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 299}, "mem_gb": 22.1}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12055374830563863, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 305}, "mem_gb": 21.88}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07345050730570996, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 262}, "mem_gb": 21.93}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10048658993549955, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 303}, "mem_gb": 21.99}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16752728424686938, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 380}, "mem_gb": 21.87}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07310452284355028, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 282}, "mem_gb": 21.82}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14664142841110006, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 362}, "mem_gb": 21.84}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14827515455516987, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 307}, "mem_gb": 22.08}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10104854320368419, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 282}, "mem_gb": 21.95}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14813115498276117, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 337}, "mem_gb": 21.98}
|
| 47 |
+
[eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings total of $1,000,000, starting from an initial savings of $50,000, with monthly savings of $2,500 and a'
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08812641109892477, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 275}, "mem_gb": 22.03}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16168197835070702, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 318}, "mem_gb": 21.85}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18779974681317496, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 385}, "mem_gb": 21.87}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18032465255840993, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 316}, "mem_gb": 21.82}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07333130201975194, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 266}, "mem_gb": 22.11}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16189229198264268, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.3, "frames": {"chat": 371}, "mem_gb": 21.85}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07895646804651867, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 262}, "mem_gb": 22.05}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17505176945934073, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.3, "frames": {"chat": 348}, "mem_gb": 21.88}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03176176859846649, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 222}, "mem_gb": 22.12}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14499215378852873, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 408}, "mem_gb": 21.68}
|
| 58 |
+
[eval step 40] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1439369252748477, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 334}, "mem_gb": 21.75}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0706772371889092, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 312}, "mem_gb": 21.79}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14474734909307832, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 352}, "mem_gb": 21.78}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11817377693428037, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 371}, "mem_gb": 21.59}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08205563750300401, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 284}, "mem_gb": 22.04}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06395803977077982, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 287}, "mem_gb": 22.1}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06253780153614158, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 285}, "mem_gb": 22.0}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03680590559190605, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.33203125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 252}, "mem_gb": 22.09}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14121348284740623, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 360}, "mem_gb": 21.88}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15307914910099157, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 359}, "mem_gb": 21.87}
|
| 69 |
+
[eval step 50] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step'
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14933904542151527, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 363}, "mem_gb": 21.63}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12488553350229437, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 361}, "mem_gb": 21.72}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07843442128324726, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 286}, "mem_gb": 21.91}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15271823925731393, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 367}, "mem_gb": 21.76}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1547942965360048, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 352}, "mem_gb": 21.79}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09296400288581692, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 314}, "mem_gb": 21.74}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13976919506203073, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 372}, "mem_gb": 21.71}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11570093697020783, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 334}, "mem_gb": 21.86}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15998193920060683, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 368}, "mem_gb": 21.8}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11672706741454701, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 354}, "mem_gb": 21.95}
|
| 81 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06066959252501838, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 293}, "mem_gb": 21.84}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05333657562431569, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 231}, "mem_gb": 22.0}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1172690767421232, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 302}, "mem_gb": 21.96}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08245002971144859, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 263}, "mem_gb": 22.11}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07935726706857482, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 252}, "mem_gb": 22.04}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11996434357226826, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 344}, "mem_gb": 22.07}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10608412687256932, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 313}, "mem_gb": 21.99}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13292832461064683, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 358}, "mem_gb": 21.7}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.058491427368693984, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 267}, "mem_gb": 21.92}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12371690684755643, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 300}, "mem_gb": 21.79}
|
| 92 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10120161286913014, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 348}, "mem_gb": 21.72}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13300567625317103, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 329}, "mem_gb": 21.81}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08815251566586085, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 269}, "mem_gb": 21.98}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14700993717334543, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 358}, "mem_gb": 21.65}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08780325295242947, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 302}, "mem_gb": 21.9}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15126645126342775, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 381}, "mem_gb": 21.92}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16602870603888295, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 379}, "mem_gb": 21.87}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1479064573767595, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 2.203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 351}, "mem_gb": 21.69}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12383289006313619, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 330}, "mem_gb": 21.89}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13381629625046626, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 316}, "mem_gb": 21.92}
|
| 103 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach a savings goal of $1,000,000, given their monthly savings and the interest earned from their investment account.'
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08777398953228258, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 276}, "mem_gb": 22.1}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07588460938346883, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 240}, "mem_gb": 22.04}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08674834172253808, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 288}, "mem_gb": 21.95}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0853487105220401, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 271}, "mem_gb": 21.93}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11503733798294949, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 357}, "mem_gb": 21.88}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15167251249333688, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 354}, "mem_gb": 21.86}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1492915164715455, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 302}, "mem_gb": 22.1}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1165785896692425, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 297}, "mem_gb": 22.08}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.040747156729688865, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 219}, "mem_gb": 22.11}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1541989786786881, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 306}, "mem_gb": 21.81}
|
| 114 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14793864214128505, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 343}, "mem_gb": 21.75}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1409232384520117, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 341}, "mem_gb": 21.86}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07915917732289526, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 318}, "mem_gb": 21.81}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13964604461910204, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 346}, "mem_gb": 21.69}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07686658267939153, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 277}, "mem_gb": 22.17}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06977991890592966, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 270}, "mem_gb": 21.9}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10083707856455973, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 257}, "mem_gb": 22.09}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13963890134370885, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 363}, "mem_gb": 21.69}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14385810780053337, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 356}, "mem_gb": 21.83}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13153254311414592, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 323}, "mem_gb": 21.86}
|
| 125 |
+
[eval step 100] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both the monthly savings from their salary and the interest earned from their investment '
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06175670235753059, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 243}, "mem_gb": 22.12}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12986055870184984, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 307}, "mem_gb": 21.8}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13002900751053045, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 346}, "mem_gb": 22.03}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.083841623769328, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 273}, "mem_gb": 22.04}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08284003194456455, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 302}, "mem_gb": 21.96}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13057155935082895, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 337}, "mem_gb": 22.1}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09851139658095781, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 280}, "mem_gb": 21.97}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14711742097334937, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 331}, "mem_gb": 21.87}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0923692204245987, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 314}, "mem_gb": 21.98}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15357590574178223, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 294}, "mem_gb": 21.9}
|
| 137 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07093229558913347, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 274}, "mem_gb": 22.04}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.122054125573067, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 365}, "mem_gb": 21.76}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07806385687385142, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 323}, "mem_gb": 21.82}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.053346825325737396, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 234}, "mem_gb": 22.1}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06765599786348175, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 267}, "mem_gb": 22.11}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08791090544823868, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 304}, "mem_gb": 21.87}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14018318482727432, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 373}, "mem_gb": 21.79}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08132816180216614, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 300}, "mem_gb": 22.08}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14348885650614587, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 331}, "mem_gb": 21.92}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.060424468856607565, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 259}, "mem_gb": 22.06}
|
| 148 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11844724626628837, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 358}, "mem_gb": 21.67}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15814292623492268, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 354}, "mem_gb": 21.93}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07169985630032606, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 279}, "mem_gb": 22.0}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1502783228988759, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 354}, "mem_gb": 21.75}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14168044462169055, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 334}, "mem_gb": 21.95}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1427589185612121, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 327}, "mem_gb": 21.81}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12058290783953077, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 365}, "mem_gb": 21.92}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0739571741439014, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 252}, "mem_gb": 22.12}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05989120363375017, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 256}, "mem_gb": 22.09}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08655550488675168, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 302}, "mem_gb": 21.86}
|
| 159 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12712168140066787, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 350}, "mem_gb": 21.77}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07436676307577485, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 292}, "mem_gb": 21.88}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13760671476287145, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 356}, "mem_gb": 21.7}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08557242370104262, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 347}, "mem_gb": 21.86}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08368868318758128, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 330}, "mem_gb": 22.06}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12720819443305956, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 363}, "mem_gb": 21.91}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12082518962655837, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.0, "frames": {"chat": 354}, "mem_gb": 21.78}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06660643954688372, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 270}, "mem_gb": 22.04}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12762515747703923, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 343}, "mem_gb": 21.82}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.030163056720176246, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 232}, "mem_gb": 22.01}
|
| 170 |
+
[eval step 140] sample: 'To determine how many months it will take Jamie to reach their savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned from the investment account.\n\n**Step 1: '
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12121607892350293, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 346}, "mem_gb": 21.95}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09290275220452653, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 306}, "mem_gb": 22.04}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05772588231681536, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 273}, "mem_gb": 22.08}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06758122839964927, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.3671875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 266}, "mem_gb": 21.91}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10201068616132251, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 299}, "mem_gb": 22.11}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06552851478964246, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 259}, "mem_gb": 22.19}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08131732919542119, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 325}, "mem_gb": 21.92}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07450551387115847, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 271}, "mem_gb": 22.0}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1205579935764273, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 359}, "mem_gb": 21.79}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11683979006973096, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 345}, "mem_gb": 21.85}
|
| 181 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1225/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading config.yaml
|
| 185 |
+
wandb:
|
| 186 |
+
wandb: Run history:
|
| 187 |
+
wandb: comp_len βββββββββ
ββββββββ
ββββββ
ββββ
βββββββββββββ
|
| 188 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββββ
β
β
βββββββββββββββ
|
| 189 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: finish_rate βββββββββββββββ
ββββββββββ
βββββ
ββββββββββ
|
| 191 |
+
wandb: forward_topk_kl βββββββββ
βββ
ββββ
ββ
β
ββββ
βββ
βββ
ββ
βββ
ββββββ
|
| 192 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: mem_gb ββββ
βββββββββββββββββ
ββ
ββββββ
βββββββββββ
|
| 195 |
+
wandb: step βββββββββββββββββββββ
β
β
β
β
βββββββββββββββ
|
| 196 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: +3 ...
|
| 198 |
+
wandb:
|
| 199 |
+
wandb: Run summary:
|
| 200 |
+
wandb: comp_len 347.8
|
| 201 |
+
wandb: cumulative_loss_tokens 18000000
|
| 202 |
+
wandb: epoch 0
|
| 203 |
+
wandb: finish_rate 0.997
|
| 204 |
+
wandb: forward_topk_kl 0.11684
|
| 205 |
+
wandb: grad_norm 0.47656
|
| 206 |
+
wandb: lr 3e-05
|
| 207 |
+
wandb: mem_gb 21.85
|
| 208 |
+
wandb: step 150
|
| 209 |
+
wandb: t_data_s 0
|
| 210 |
+
wandb: +4 ...
|
| 211 |
+
wandb:
|
| 212 |
+
wandb: π View run glean_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/suscdijy
|
| 213 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 214 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 215 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1225/wandb/run-20260718_162630-suscdijy/logs
|
healed/grid_general/glean_keep75_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/glean_keep75_s1226.console.log
ADDED
|
@@ -0,0 +1,215 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/glean_keep75_s1226/wandb/run-20260718_192317-q973uip1
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run glean_keep75_s1226
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/q973uip1
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1413160980346768, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 1.75, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 308}, "mem_gb": 21.9}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as \\( d \\). the \\"
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04849519984136957, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.265625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 211}, "mem_gb": 22.09}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1057090827699906, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.515625, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 281}, "mem_gb": 22.09}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20369750064744924, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.515625, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 367}, "mem_gb": 21.63}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1861306351597576, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.0625, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1492766888952038, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.87890625, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 271}, "mem_gb": 22.11}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09697009395253844, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 0.6953125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 269}, "mem_gb": 22.08}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18224880321479092, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 0.765625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 352}, "mem_gb": 21.6}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07065487672941138, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 243}, "mem_gb": 22.09}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12280961040410523, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 293}, "mem_gb": 22.01}
|
| 25 |
+
[eval step 10] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequ"
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06721969474758953, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 242}, "mem_gb": 22.09}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18982516884515063, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 353}, "mem_gb": 21.78}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18828471876895056, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 338}, "mem_gb": 21.78}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08397472261761625, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 259}, "mem_gb": 22.08}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16453956262846478, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 385}, "mem_gb": 21.64}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1512448895484209, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 355}, "mem_gb": 21.8}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13268581481428507, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 328}, "mem_gb": 21.71}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14356467844688645, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 355}, "mem_gb": 21.86}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1773852861534183, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 367}, "mem_gb": 21.73}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15869609248543468, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 343}, "mem_gb": 21.77}
|
| 36 |
+
[eval step 20] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term \\"
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07111443312324894, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 244}, "mem_gb": 22.09}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10239945090222173, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 339}, "mem_gb": 21.93}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10481588966808825, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 298}, "mem_gb": 22.08}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15125719757280312, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 398}, "mem_gb": 21.95}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13876289220652543, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 362}, "mem_gb": 22.06}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09728015474545924, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 313}, "mem_gb": 21.93}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16174195971769903, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 324}, "mem_gb": 21.84}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11227309670362932, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 314}, "mem_gb": 21.9}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1496671024374043, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 345}, "mem_gb": 21.82}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0877499234606085, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 262}, "mem_gb": 22.0}
|
| 47 |
+
[eval step 30] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18145805544837687, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 373}, "mem_gb": 21.79}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1443175487255988, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 334}, "mem_gb": 21.79}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1004882241464608, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 327}, "mem_gb": 21.94}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0275851215143688, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.333984375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 238}, "mem_gb": 22.1}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12761550147404585, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 310}, "mem_gb": 21.84}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14843029471280364, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 347}, "mem_gb": 21.84}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13815048004087682, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 304}, "mem_gb": 21.76}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13358069184031338, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 343}, "mem_gb": 21.79}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15010506374416874, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 314}, "mem_gb": 21.78}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13925395173551514, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 300}, "mem_gb": 21.88}
|
| 58 |
+
[eval step 40] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1083768343289538, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 318}, "mem_gb": 21.92}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08460797195690684, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 279}, "mem_gb": 21.96}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1537272752489584, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 364}, "mem_gb": 22.02}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1061037359959446, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 256}, "mem_gb": 22.09}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1837975141172142, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 340}, "mem_gb": 21.79}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08009947391541208, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 283}, "mem_gb": 22.02}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14230651331756575, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 349}, "mem_gb": 21.8}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08268892391519621, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 297}, "mem_gb": 21.88}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16595241406840894, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 359}, "mem_gb": 21.85}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10582465117862448, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 342}, "mem_gb": 21.89}
|
| 69 |
+
[eval step 50] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07470876316506571, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 269}, "mem_gb": 22.06}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10869510563722191, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 324}, "mem_gb": 22.05}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08518406727248803, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 281}, "mem_gb": 22.04}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09822068768725731, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 287}, "mem_gb": 22.08}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12007080832890546, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 296}, "mem_gb": 22.09}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0840601130682199, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 267}, "mem_gb": 22.15}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0830530796768687, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 249}, "mem_gb": 22.05}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16557893410891605, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 363}, "mem_gb": 21.75}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09872415286762795, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 299}, "mem_gb": 21.88}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15187458796397163, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 331}, "mem_gb": 21.76}
|
| 81 |
+
[eval step 60] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07433416724340836, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 280}, "mem_gb": 21.97}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16020082334758093, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 350}, "mem_gb": 21.96}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13970972021511602, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 321}, "mem_gb": 21.72}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06836845907570484, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 281}, "mem_gb": 22.02}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16352739405889685, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 331}, "mem_gb": 21.7}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11902664954640592, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 318}, "mem_gb": 22.07}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09364758191780809, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 309}, "mem_gb": 22.09}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10470447588497772, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 304}, "mem_gb": 21.97}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0693966237762943, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 279}, "mem_gb": 22.0}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02911017654616541, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.34765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 248}, "mem_gb": 22.0}
|
| 92 |
+
[eval step 70] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11099985734704727, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 268}, "mem_gb": 21.97}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10305993815530091, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 299}, "mem_gb": 22.07}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11933142734871556, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 322}, "mem_gb": 21.93}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06709553298743752, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.35546875, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 248}, "mem_gb": 22.1}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11146160014714114, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 326}, "mem_gb": 22.0}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1007795615594058, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 314}, "mem_gb": 21.76}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028291584209896005, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.328125, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 232}, "mem_gb": 22.1}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15302979311901144, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 330}, "mem_gb": 21.83}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07534985212577351, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 292}, "mem_gb": 21.98}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12400587685474505, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 312}, "mem_gb": 22.0}
|
| 103 |
+
[eval step 80] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.163432472588378, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.4, "frames": {"chat": 382}, "mem_gb": 21.81}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1656620658460694, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 360}, "mem_gb": 21.67}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02293366577536799, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.30078125, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 426.4, "frames": {"chat": 222}, "mem_gb": 21.94}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1488103632712892, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 451.8, "frames": {"chat": 342}, "mem_gb": 21.99}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14048245466801648, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 459.1, "frames": {"chat": 337}, "mem_gb": 21.79}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08949292343774966, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 490.7, "frames": {"chat": 304}, "mem_gb": 22.04}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0962977189412651, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 448.4, "frames": {"chat": 326}, "mem_gb": 21.94}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12742471727432372, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 310}, "mem_gb": 22.0}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12377240428469764, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 328}, "mem_gb": 21.82}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15952133797959736, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 347}, "mem_gb": 21.65}
|
| 114 |
+
[eval step 90] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1332611817421081, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 330}, "mem_gb": 21.94}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03117541796125782, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 209}, "mem_gb": 22.14}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14521490836364684, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 399}, "mem_gb": 21.72}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12175604587808872, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 351}, "mem_gb": 21.8}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08692466896735132, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 322}, "mem_gb": 21.8}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14002212731780794, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 333}, "mem_gb": 21.69}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10281148330651534, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 330}, "mem_gb": 21.97}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02200900837377024, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.2734375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 238}, "mem_gb": 22.01}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06418654550995367, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 297}, "mem_gb": 21.92}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13064617172250678, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 345}, "mem_gb": 21.88}
|
| 125 |
+
[eval step 100] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08860973457853155, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 304}, "mem_gb": 22.03}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1211775447745885, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 326}, "mem_gb": 22.03}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14466580771614487, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 347}, "mem_gb": 21.95}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1286898497606162, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 325}, "mem_gb": 21.84}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07902086545533966, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 299}, "mem_gb": 22.03}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16233786880969225, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 345}, "mem_gb": 21.8}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13559324684312257, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 344}, "mem_gb": 21.69}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09932501186232548, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 344}, "mem_gb": 21.96}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09514856690616191, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 288}, "mem_gb": 22.02}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0850360783191165, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 303}, "mem_gb": 21.73}
|
| 137 |
+
[eval step 110] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06375691673830151, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 284}, "mem_gb": 21.92}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15935028244269392, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 369}, "mem_gb": 21.81}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07107018628746736, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 22.07}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13741801153526953, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 341}, "mem_gb": 21.83}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13155154890369158, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 384}, "mem_gb": 21.6}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12168247848381289, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 358}, "mem_gb": 21.76}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13569500965482245, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 342}, "mem_gb": 21.93}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1514469413602104, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 365}, "mem_gb": 21.75}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13520857937311132, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 337}, "mem_gb": 21.99}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11999537091556316, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 333}, "mem_gb": 22.09}
|
| 148 |
+
[eval step 120] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0808612868486438, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 293}, "mem_gb": 22.13}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06993180109107246, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 291}, "mem_gb": 21.89}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12544284139291073, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 341}, "mem_gb": 21.92}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07498731323514754, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 300}, "mem_gb": 21.86}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0719582883243061, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 270}, "mem_gb": 22.08}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0536270107534326, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 259}, "mem_gb": 22.1}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13416044807817476, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 355}, "mem_gb": 21.67}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15425396803029193, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 388}, "mem_gb": 22.03}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12761535915248096, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 318}, "mem_gb": 21.74}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14441497259632063, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 383}, "mem_gb": 21.88}
|
| 159 |
+
[eval step 130] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07577277182651838, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 21.89}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07005898589462352, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 295}, "mem_gb": 21.98}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07240092389283236, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 306}, "mem_gb": 21.71}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10792480116698425, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 303}, "mem_gb": 21.97}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.052931241141119974, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 272}, "mem_gb": 22.04}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07667474498679706, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 248}, "mem_gb": 22.04}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08408431772824067, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 282}, "mem_gb": 22.03}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13470493362446626, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 362}, "mem_gb": 21.59}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1445563850287969, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 374}, "mem_gb": 21.95}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07023882402332189, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 280}, "mem_gb": 22.12}
|
| 170 |
+
[eval step 140] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05532636799375371, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.35546875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 276}, "mem_gb": 21.96}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07462077040801135, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.0, "frames": {"chat": 246}, "mem_gb": 22.1}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.153857332631868, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 360}, "mem_gb": 21.63}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15233792337393387, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 365}, "mem_gb": 21.81}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12471409813507926, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 338}, "mem_gb": 21.9}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.056699273616044474, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 276}, "mem_gb": 22.01}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02889200972855712, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.3125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 209}, "mem_gb": 22.09}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12253848117648934, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 379}, "mem_gb": 21.69}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10938656153276097, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 307}, "mem_gb": 22.03}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07230857622489954, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 293}, "mem_gb": 22.06}
|
| 181 |
+
[eval step 150] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term i"
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/glean_keep75_s1226/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading summary, console lines 171-171
|
| 185 |
+
wandb:
|
| 186 |
+
wandb: Run history:
|
| 187 |
+
wandb: comp_len βββ
βββββββ
βββ
ββββββββββββββββββββββ
βββββ
|
| 188 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββ
β
β
β
β
β
βββββββββββββ
|
| 189 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: finish_rate ββββββββββββββββββ
ββββββββββββββ
βββββββ
β
|
| 191 |
+
wandb: forward_topk_kl βββββββββ
ββ
βββββββββ
ββ
βββ
ββββ
β
β
βββ
ββββββ
|
| 192 |
+
wandb: grad_norm βββ
βββββββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: lr βββ
βββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: mem_gb ββββββββ
βββ
ββββ
ββββββββββββ
βββββββββββββ
|
| 195 |
+
wandb: step ββββββββββββββββββββββββ
β
β
β
β
β
βββββββββββ
|
| 196 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: +3 ...
|
| 198 |
+
wandb:
|
| 199 |
+
wandb: Run summary:
|
| 200 |
+
wandb: comp_len 409.6
|
| 201 |
+
wandb: cumulative_loss_tokens 18000000
|
| 202 |
+
wandb: epoch 0
|
| 203 |
+
wandb: finish_rate 0.942
|
| 204 |
+
wandb: forward_topk_kl 0.07231
|
| 205 |
+
wandb: grad_norm 0.40234
|
| 206 |
+
wandb: lr 3e-05
|
| 207 |
+
wandb: mem_gb 22.06
|
| 208 |
+
wandb: step 150
|
| 209 |
+
wandb: t_data_s 0
|
| 210 |
+
wandb: +4 ...
|
| 211 |
+
wandb:
|
| 212 |
+
wandb: π View run glean_keep75_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/q973uip1
|
| 213 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 214 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 215 |
+
wandb: Find logs at: outputs/healed/grid_general/glean_keep75_s1226/wandb/run-20260718_192317-q973uip1/logs
|
healed/grid_general/glean_keep75_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep25_s1224.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run ydhbbk1z
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1224/wandb/run-20260717_150109-ydhbbk1z
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run reap_keep25_s1224
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/ydhbbk1z
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.714513613096873, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 90.5, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 259}, "mem_gb": 9.93}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'POR:5GYUI Oisse\nlt g intro- N1(numbersialudild)\n\nnou natorls:1[n-in-,orler acday.#-=1 \n"""\n"""Mnel=>and"130-lc4-'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 7.052694697197278, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 71.5, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 348}, "mem_gb": 9.59}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.581489293889205, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 66.0, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 370}, "mem_gb": 9.74}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.8654761122624075, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 57.0, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 244}, "mem_gb": 9.97}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.814938292272886, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 39.0, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 320}, "mem_gb": 9.89}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.5225257198294, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 37.0, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 378}, "mem_gb": 9.49}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.168571872454882, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 44.25, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 384}, "mem_gb": 9.98}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.3614308606823284, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 35.75, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 324}, "mem_gb": 9.83}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9847333917876084, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 23.75, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 239}, "mem_gb": 10.0}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.441437253133456, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 16.625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 306}, "mem_gb": 9.74}
|
| 25 |
+
[eval step 10] sample: 'Compute the rank of the given 4x4 matrix:\n[[12, -16, 4, 16],\n[--9, 11, -1, -10],\n[-0, 1, -2, -10],\n[-0, 4, -8, -8]}\n\nCompute'
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.360720735937357, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 13.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 329}, "mem_gb": 9.77}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3320580815384786, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 7.03125, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 254}, "mem_gb": 10.0}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7477209083815415, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 6.5625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 273}, "mem_gb": 9.98}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.905339217838645, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.40625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 236}, "mem_gb": 9.9}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.894308428629736, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 381}, "mem_gb": 9.63}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8942556741168102, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 2.53125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 266}, "mem_gb": 9.83}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2078631315603852, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 2.671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 308}, "mem_gb": 9.82}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9374638251105945, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.9375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 273}, "mem_gb": 10.0}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.447662654795746, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 2.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 368}, "mem_gb": 9.63}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6041733922436834, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 2.46875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 339}, "mem_gb": 9.87}
|
| 36 |
+
[eval step 20] sample: 'To solve this problem, we need to determine the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of columns in the matrix.\n\nGiven matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9353083563171327, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.78125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 298}, "mem_gb": 9.8}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3508124507144093, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 2.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 350}, "mem_gb": 9.52}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7905151057086885, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.421875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 246}, "mem_gb": 9.97}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2881518234315017, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 375}, "mem_gb": 9.7}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.305539540750285, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 352}, "mem_gb": 9.75}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.27691397592475, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 396}, "mem_gb": 9.71}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0702742205070952, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 362}, "mem_gb": 9.56}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3215352043059965, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.3828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 369}, "mem_gb": 9.77}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.310362931372722, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 399}, "mem_gb": 9.62}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6964659744882956, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.3984375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 247}, "mem_gb": 9.89}
|
| 47 |
+
[eval step 30] sample: "To solve this problem, we need to find the rank of the given 4x4 matrix. The rank of a matrix is the maximum number of linearly independent columns in the matrix.\n\nLet's break down the matrix step-by-"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3749437816654642, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 230}, "mem_gb": 9.83}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6364695584422598, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 263}, "mem_gb": 10.0}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6319580947947999, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 264}, "mem_gb": 9.99}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0467302889599155, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.359375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 328}, "mem_gb": 9.85}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5760055315182855, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 281}, "mem_gb": 9.92}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4677317438756426, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 237}, "mem_gb": 9.91}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5605393174094458, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 278}, "mem_gb": 10.0}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0259025651920586, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 1.4765625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 310}, "mem_gb": 9.87}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6856813535400667, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 295}, "mem_gb": 9.81}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7459171565882862, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.953125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 329}, "mem_gb": 9.82}
|
| 58 |
+
[eval step 40] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix.\n\nGiven the matrix:\n\n\\[\nA = \\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6777477626826615, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 263}, "mem_gb": 9.94}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7141052765981605, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 315}, "mem_gb": 9.82}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9809643868823846, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 354}, "mem_gb": 9.77}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44921137073797485, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 259}, "mem_gb": 9.95}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6806124305025985, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 275}, "mem_gb": 9.8}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9492775865232572, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 334}, "mem_gb": 9.67}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0005501222976794, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 374}, "mem_gb": 9.52}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8096208624659728, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 311}, "mem_gb": 9.69}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7187964733070383, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 259}, "mem_gb": 10.0}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8398557908189793, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 305}, "mem_gb": 9.99}
|
| 69 |
+
[eval step 50] sample: 'To determine the rank of a matrix, we need to understand that the rank of a matrix is the maximum number of linearly independent rows or columns. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 &'
|
| 70 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7746725684193273, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 298}, "mem_gb": 9.96}
|
| 71 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0570293922627965, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 364}, "mem_gb": 9.74}
|
| 72 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5696624719357739, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 302}, "mem_gb": 9.84}
|
| 73 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.045973034708202, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 316}, "mem_gb": 9.6}
|
| 74 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0977590525440872, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 75 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7650056727120653, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 330}, "mem_gb": 9.85}
|
| 76 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.775473134911557, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 321}, "mem_gb": 9.86}
|
| 77 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8324109628355751, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 344}, "mem_gb": 9.89}
|
| 78 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8997549999526392, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 353}, "mem_gb": 9.56}
|
| 79 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4661473550739388, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 272}, "mem_gb": 9.99}
|
| 80 |
+
[eval step 60] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. \n\nLet's break down the problem step-by-step:\n\n1. **Matrix Definition:**\n \\[\n A = \\beg"
|
| 81 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0232317148663104, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 317}, "mem_gb": 9.74}
|
| 82 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.468317110635216, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 292}, "mem_gb": 9.74}
|
| 83 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27947916939407585, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 229}, "mem_gb": 9.85}
|
| 84 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9512269954226911, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 359}, "mem_gb": 9.86}
|
| 85 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8734925457065305, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 358}, "mem_gb": 9.58}
|
| 86 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9860965913433581, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 315}, "mem_gb": 9.97}
|
| 87 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6221852849562963, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 264}, "mem_gb": 10.04}
|
| 88 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9487652655401577, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 337}, "mem_gb": 9.71}
|
| 89 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4952909258775413, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 251}, "mem_gb": 10.0}
|
| 90 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6961152751598507, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 298}, "mem_gb": 9.73}
|
| 91 |
+
[eval step 70] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step:\n\n1. **Understand the "
|
| 92 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5788077697403728, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 264}, "mem_gb": 9.94}
|
| 93 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6019827347854774, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 305}, "mem_gb": 9.96}
|
| 94 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5746000899684925, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 322}, "mem_gb": 9.73}
|
| 95 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.940524634005626, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 361}, "mem_gb": 9.72}
|
| 96 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6179622926815723, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 321}, "mem_gb": 9.9}
|
| 97 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7707402221990128, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 307}, "mem_gb": 9.79}
|
| 98 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9255422383996348, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 327}, "mem_gb": 9.89}
|
| 99 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9841452605754137, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 356}, "mem_gb": 9.51}
|
| 100 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4795566956318915, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 283}, "mem_gb": 9.85}
|
| 101 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.903388200679173, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 401}, "mem_gb": 9.61}
|
| 102 |
+
[eval step 80] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the problem step-by-step:\n\n1. **Understand the Matrix:**"
|
| 103 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.60415241121271, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 288}, "mem_gb": 9.8}
|
| 104 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7414309971912454, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 323}, "mem_gb": 9.84}
|
| 105 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0112706265526514, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 336}, "mem_gb": 9.73}
|
| 106 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8384464806109667, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 329}, "mem_gb": 9.64}
|
| 107 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8245212999915084, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 343}, "mem_gb": 9.62}
|
| 108 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8487811851590872, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 336}, "mem_gb": 9.74}
|
| 109 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7976679800941299, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 314}, "mem_gb": 9.98}
|
| 110 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5121657419648021, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 281}, "mem_gb": 9.81}
|
| 111 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6462947391952077, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 299}, "mem_gb": 9.69}
|
| 112 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7679498924406867, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 328}, "mem_gb": 9.88}
|
| 113 |
+
[eval step 90] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step using Python and the sympy library:"
|
| 114 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060429289376984, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 271}, "mem_gb": 9.98}
|
| 115 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6353122635553281, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 269}, "mem_gb": 10.08}
|
| 116 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9505948884276052, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 370}, "mem_gb": 9.62}
|
| 117 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9914112706638872, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 352}, "mem_gb": 9.68}
|
| 118 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8775602666936815, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 330}, "mem_gb": 9.89}
|
| 119 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7306022960850348, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 334}, "mem_gb": 9.61}
|
| 120 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7210784587609271, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 336}, "mem_gb": 9.75}
|
| 121 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5393692284641166, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 309}, "mem_gb": 9.84}
|
| 122 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8877559786563118, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 391}, "mem_gb": 9.72}
|
| 123 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4869788068047414, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 264}, "mem_gb": 10.12}
|
| 124 |
+
[eval step 100] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
|
| 125 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678291204962879, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 349}, "mem_gb": 9.67}
|
| 126 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7157938474825273, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 312}, "mem_gb": 9.73}
|
| 127 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2847380786302189, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 229}, "mem_gb": 9.99}
|
| 128 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6860836447392901, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 288}, "mem_gb": 9.99}
|
| 129 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9254306713115424, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 351}, "mem_gb": 9.65}
|
| 130 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38883627386627095, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 223}, "mem_gb": 10.02}
|
| 131 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20738879148984948, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 213}, "mem_gb": 9.98}
|
| 132 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.858752869273598, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 380}, "mem_gb": 9.83}
|
| 133 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5064401058585694, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 271}, "mem_gb": 10.02}
|
| 134 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8971811090276887, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 340}, "mem_gb": 9.91}
|
| 135 |
+
[eval step 110] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Check for Linear Independenc"
|
| 136 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9605931589500357, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 366}, "mem_gb": 9.6}
|
| 137 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363283141590779, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 233}, "mem_gb": 9.99}
|
| 138 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6373608725018178, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 312}, "mem_gb": 9.86}
|
| 139 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.868706948846206, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 363}, "mem_gb": 9.57}
|
| 140 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8705472689797481, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 323}, "mem_gb": 9.85}
|
| 141 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9444174962684512, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 346}, "mem_gb": 9.59}
|
| 142 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8539180674185356, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 318}, "mem_gb": 9.74}
|
| 143 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6539584430909405, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 275}, "mem_gb": 9.92}
|
| 144 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.81154930332837, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 345}, "mem_gb": 9.67}
|
| 145 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8077557143279662, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 377}, "mem_gb": 9.81}
|
| 146 |
+
[eval step 120] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and the `"
|
| 147 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.664052238414685, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 294}, "mem_gb": 10.04}
|
| 148 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8953628696876268, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 338}, "mem_gb": 9.73}
|
| 149 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9028469905288269, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 352}, "mem_gb": 9.63}
|
| 150 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8481589727750669, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 347}, "mem_gb": 9.68}
|
| 151 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5397243623769532, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 310}, "mem_gb": 9.66}
|
| 152 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9418989515272279, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 358}, "mem_gb": 9.68}
|
| 153 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5691563136459639, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 319}, "mem_gb": 9.96}
|
| 154 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38915702238492667, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 269}, "mem_gb": 9.99}
|
| 155 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7045213386001066, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 310}, "mem_gb": 9.85}
|
| 156 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4709877991588786, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 259}, "mem_gb": 10.02}
|
| 157 |
+
[eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and the `"
|
| 158 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47775340601628025, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 159 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8888590919742981, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 337}, "mem_gb": 9.55}
|
| 160 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161087991711995, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 290}, "mem_gb": 9.81}
|
| 161 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7807277385645857, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 349}, "mem_gb": 9.74}
|
| 162 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161208944985022, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 291}, "mem_gb": 9.84}
|
| 163 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.807752444401135, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 342}, "mem_gb": 9.71}
|
| 164 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9198165919067959, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 338}, "mem_gb": 9.65}
|
| 165 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9056239002672335, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 356}, "mem_gb": 9.62}
|
| 166 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4489221845626831, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 167 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.747275248721987, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 353}, "mem_gb": 9.71}
|
| 168 |
+
[eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step:\n\n1. **Understand t"
|
| 169 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7047750924723843, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 316}, "mem_gb": 9.9}
|
| 170 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5933609875383166, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 289}, "mem_gb": 10.05}
|
| 171 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6415846698864053, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 331}, "mem_gb": 9.68}
|
| 172 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6330735582390179, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 320}, "mem_gb": 10.0}
|
| 173 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5657251183000703, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 272}, "mem_gb": 9.73}
|
| 174 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9686935982390618, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 368}, "mem_gb": 9.65}
|
| 175 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7965175971987347, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 328}, "mem_gb": 9.68}
|
| 176 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7893025688592344, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 326}, "mem_gb": 9.9}
|
| 177 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8914329555117836, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 364}, "mem_gb": 9.83}
|
| 178 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5755241934151699, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 296}, "mem_gb": 9.88}
|
| 179 |
+
[eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can approach this problem step-by-step using Python and th"
|
| 180 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1224/step0150
|
| 181 |
+
wandb: updating run metadata
|
| 182 |
+
wandb: uploading summary, console lines 167-168; uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len β
βββββββββ
ββββ
ββββ
β
βββββββββββββββββββββ
|
| 186 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
β
β
β
ββββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate βββββββββββββββββββββ
βββββββββββββββββββ
|
| 189 |
+
wandb: forward_topk_kl ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: grad_norm βββ
βββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr βββ
βββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb βββββββββ
βββββ
β
ββββ
βββββ
ββββββββββββββββ
|
| 193 |
+
wandb: step ββββββββββββββββββββββββ
β
β
β
β
β
βββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 405.4
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.97
|
| 202 |
+
wandb: forward_topk_kl 0.57552
|
| 203 |
+
wandb: grad_norm 0.60938
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.88
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run reap_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/ydhbbk1z
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1224/wandb/run-20260717_150109-ydhbbk1z/logs
|
healed/grid_general/reap_keep25_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep25_s1225.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1225/wandb/run-20260717_145438-hv788gr3
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run reap_keep25_s1225
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/hv788gr3
|
| 11 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 12 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 7.128950115287304, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 74.0, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 331}, "mem_gb": 9.8}
|
| 13 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 14 |
+
[eval step 1] sample: '$0 Cisory1 are not to be$ inovy_$nos_frP-loadingD = "ny\'\'els|[m_e_O(aude_of$Thurs.dips]{\n in_tw. Common\n posaki.po\'\'%$_'
|
| 15 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.942640358825525, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 72.0, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 342}, "mem_gb": 9.62}
|
| 16 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.675844058255355, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 61.25, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 358}, "mem_gb": 9.66}
|
| 17 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.735853639324506, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 46.0, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 344}, "mem_gb": 9.74}
|
| 18 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.655631678853433, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 39.75, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 267}, "mem_gb": 10.06}
|
| 19 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.5528146819194157, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 36.75, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 248}, "mem_gb": 9.89}
|
| 20 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.760948654184739, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 34.75, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 329}, "mem_gb": 9.88}
|
| 21 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.41242672910889, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 26.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 339}, "mem_gb": 9.84}
|
| 22 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.1154985622068248, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 19.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 354}, "mem_gb": 9.84}
|
| 23 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9232669208347797, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 12.3125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 279}, "mem_gb": 9.97}
|
| 24 |
+
[eval step 10] sample: '```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n```\n'
|
| 25 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9393300044973691, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 11.4375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 318}, "mem_gb": 9.9}
|
| 26 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.429900641532739, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 9.0, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 265}, "mem_gb": 9.99}
|
| 27 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2097010329162081, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 5.5, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 254}, "mem_gb": 9.93}
|
| 28 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5392255229488014, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.75, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 315}, "mem_gb": 9.96}
|
| 29 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7722159353325764, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 4.59375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 30 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2301947377219795, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 3.375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 276}, "mem_gb": 9.96}
|
| 31 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6280564738233885, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 3.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 356}, "mem_gb": 9.9}
|
| 32 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.54189958041658, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 3.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 304}, "mem_gb": 9.71}
|
| 33 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4908135216305654, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 2.390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 375}, "mem_gb": 9.63}
|
| 34 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8951119984914859, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.8125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 294}, "mem_gb": 9.99}
|
| 35 |
+
[eval step 20] sample: 'To solve this problem, we need to determine the number of months it takes for the savings to achieve the goal of $1,000,000$ given that the savings are at an average interest of $300 per month$.\n\nHere'
|
| 36 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3273236130041381, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 2.6875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 299}, "mem_gb": 10.0}
|
| 37 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0711809298033517, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 2.015625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 305}, "mem_gb": 9.78}
|
| 38 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6670237951979041, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.65625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 262}, "mem_gb": 9.83}
|
| 39 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8823200252845883, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.3671875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 303}, "mem_gb": 9.89}
|
| 40 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2808297750733793, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 380}, "mem_gb": 9.77}
|
| 41 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7838890937705835, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.1171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 282}, "mem_gb": 9.73}
|
| 42 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1743150849359731, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 4.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 362}, "mem_gb": 9.74}
|
| 43 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.165311704517901, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.828125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 307}, "mem_gb": 9.98}
|
| 44 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8248838950661321, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 282}, "mem_gb": 9.85}
|
| 45 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1389709412602087, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 337}, "mem_gb": 9.88}
|
| 46 |
+
[eval step 30] sample: "To solve this problem, we need to calculate the total savings after a month when the savings are $2,500 and the interest is $300.\n\nLet's break down the steps:\n\n1. Calculate the monthly savings:\n \\[\n"
|
| 47 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7580995838927725, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 275}, "mem_gb": 9.94}
|
| 48 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2029403526728353, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.2890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 318}, "mem_gb": 9.75}
|
| 49 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2629171270715693, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.3046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 385}, "mem_gb": 9.77}
|
| 50 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3238717241488398, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.3203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 316}, "mem_gb": 9.73}
|
| 51 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6397200959076484, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 266}, "mem_gb": 10.02}
|
| 52 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1893244242064656, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.1796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 371}, "mem_gb": 9.75}
|
| 53 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6626384412189325, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 262}, "mem_gb": 9.96}
|
| 54 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1702854688776037, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 348}, "mem_gb": 9.78}
|
| 55 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3203757806905856, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 222}, "mem_gb": 10.02}
|
| 56 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0980271197738747, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 408}, "mem_gb": 9.58}
|
| 57 |
+
[eval step 40] sample: 'To solve this problem, we need to determine the number of months Jamie will need to save to reach their goal of $1,000,000 from their current savings of $50,000, given their monthly salary of $2,500.\n'
|
| 58 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0561500041663647, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 1.109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 334}, "mem_gb": 9.65}
|
| 59 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6361587373973181, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 60 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0296403087812165, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 352}, "mem_gb": 9.68}
|
| 61 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9499083398210506, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 371}, "mem_gb": 9.49}
|
| 62 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6781676426404466, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 284}, "mem_gb": 9.94}
|
| 63 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5214851166649411, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 287}, "mem_gb": 10.01}
|
| 64 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49592071714811026, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 285}, "mem_gb": 9.9}
|
| 65 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3948383016883085, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 252}, "mem_gb": 9.99}
|
| 66 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9748743114174654, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 360}, "mem_gb": 9.78}
|
| 67 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0411278635108223, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 359}, "mem_gb": 9.77}
|
| 68 |
+
[eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to account for both the savings and the investment account.\n\n**Step 1: Calculate the total savings needed'
|
| 69 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0491146349890779, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 363}, "mem_gb": 9.53}
|
| 70 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9546433091374735, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 361}, "mem_gb": 9.62}
|
| 71 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6374567762491604, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 286}, "mem_gb": 9.81}
|
| 72 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0135388727781673, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 367}, "mem_gb": 9.66}
|
| 73 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.096224354492873, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 74 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6951992062970996, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 314}, "mem_gb": 9.64}
|
| 75 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8984716710316638, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 372}, "mem_gb": 9.61}
|
| 76 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8798148108810186, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 334}, "mem_gb": 9.76}
|
| 77 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0336331131102516, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 368}, "mem_gb": 9.7}
|
| 78 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8133979804584136, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 354}, "mem_gb": 9.85}
|
| 79 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will spend to reach their financial goal of $1,000,000.\n\n1. **Calculate the monthly savings:**\n Jamie saves $2,500 each month.\n\n2. *'
|
| 80 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5131581351992984, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 293}, "mem_gb": 9.74}
|
| 81 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3558243869268646, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 231}, "mem_gb": 9.9}
|
| 82 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7909357976041734, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 83 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5200257582156609, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 263}, "mem_gb": 10.01}
|
| 84 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5733421744725357, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 252}, "mem_gb": 9.94}
|
| 85 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.802759750326102, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 344}, "mem_gb": 9.97}
|
| 86 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7588450347247223, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 313}, "mem_gb": 9.9}
|
| 87 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8533306148003786, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 358}, "mem_gb": 9.6}
|
| 88 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4426924922268838, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 267}, "mem_gb": 9.82}
|
| 89 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8630647399668893, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 300}, "mem_gb": 9.69}
|
| 90 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their financial goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a'
|
| 91 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7241944041704138, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 348}, "mem_gb": 9.63}
|
| 92 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8729624584329625, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 329}, "mem_gb": 9.72}
|
| 93 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49168946098834276, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 269}, "mem_gb": 9.88}
|
| 94 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9146341895855963, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 358}, "mem_gb": 9.55}
|
| 95 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5776157709396134, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 302}, "mem_gb": 9.8}
|
| 96 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9203825087978195, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 381}, "mem_gb": 9.82}
|
| 97 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9808039169403414, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 379}, "mem_gb": 9.77}
|
| 98 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9484098423243811, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 351}, "mem_gb": 9.59}
|
| 99 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.833038824570179, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 330}, "mem_gb": 9.79}
|
| 100 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.877945280479764, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 316}, "mem_gb": 9.82}
|
| 101 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a total of '
|
| 102 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5905011812818547, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 276}, "mem_gb": 10.0}
|
| 103 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5015565091780076, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 240}, "mem_gb": 9.94}
|
| 104 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5682198712281262, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 288}, "mem_gb": 9.85}
|
| 105 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5228158781567589, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 271}, "mem_gb": 9.84}
|
| 106 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8173860358398408, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 357}, "mem_gb": 9.79}
|
| 107 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9893660034631069, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 354}, "mem_gb": 9.76}
|
| 108 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9627823415289323, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 302}, "mem_gb": 10.0}
|
| 109 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7299780883704623, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 297}, "mem_gb": 9.99}
|
| 110 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2917365302247927, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 219}, "mem_gb": 10.01}
|
| 111 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9113752805821598, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 306}, "mem_gb": 9.71}
|
| 112 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000.\n\n**Step 1: Calculate the monthly savings from the salary.**\n\nJamie saves $2,500 e'
|
| 113 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9350021305881441, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 343}, "mem_gb": 9.65}
|
| 114 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8736250073991716, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 341}, "mem_gb": 9.76}
|
| 115 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5577829840183258, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 318}, "mem_gb": 9.71}
|
| 116 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9784254392961661, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 346}, "mem_gb": 9.6}
|
| 117 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4898327454172075, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 277}, "mem_gb": 10.08}
|
| 118 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49629658286403866, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 270}, "mem_gb": 9.81}
|
| 119 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.567912393829599, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 257}, "mem_gb": 9.99}
|
| 120 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9093468950852752, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 363}, "mem_gb": 9.6}
|
| 121 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8974562967235222, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 356}, "mem_gb": 9.73}
|
| 122 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8161376313265413, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 323}, "mem_gb": 9.77}
|
| 123 |
+
[eval step 100] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings of $50,000.\n\nHere are the ste'
|
| 124 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4597786546919495, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.5, "frames": {"chat": 243}, "mem_gb": 10.02}
|
| 125 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8502584563302497, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 307}, "mem_gb": 9.7}
|
| 126 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7940917789945999, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 346}, "mem_gb": 9.94}
|
| 127 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5417744047090411, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 273}, "mem_gb": 9.94}
|
| 128 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5624297013904278, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 129 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7359248608457546, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 337}, "mem_gb": 10.0}
|
| 130 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5976522656540076, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 280}, "mem_gb": 9.87}
|
| 131 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9708657983879249, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 331}, "mem_gb": 9.77}
|
| 132 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.621043157870695, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 314}, "mem_gb": 9.88}
|
| 133 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9878804231689622, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 294}, "mem_gb": 9.81}
|
| 134 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and investment interest.\n\n**Step 1: Calculate the mon'
|
| 135 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5001237283087026, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 274}, "mem_gb": 9.94}
|
| 136 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7752035559450586, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 137 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5251564120012646, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 323}, "mem_gb": 9.72}
|
| 138 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3639715613210574, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 234}, "mem_gb": 10.01}
|
| 139 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4192159344536563, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 267}, "mem_gb": 10.01}
|
| 140 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.567089419877405, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 304}, "mem_gb": 9.77}
|
| 141 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8359038252736132, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 373}, "mem_gb": 9.7}
|
| 142 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5316978300289561, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 9.98}
|
| 143 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.894701361332337, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 331}, "mem_gb": 9.82}
|
| 144 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4196397037681813, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 259}, "mem_gb": 9.96}
|
| 145 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their financial goal of $1,000,000.\n\n**Step 1: Calculate the total savings needed.**\n\nJamie wants to save a'
|
| 146 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8061647728700811, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 358}, "mem_gb": 9.58}
|
| 147 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9037879503688464, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 354}, "mem_gb": 9.83}
|
| 148 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4666864868506168, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 279}, "mem_gb": 9.9}
|
| 149 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387770713350425, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 354}, "mem_gb": 9.65}
|
| 150 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8794751821829627, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 334}, "mem_gb": 9.85}
|
| 151 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8755004875550667, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 327}, "mem_gb": 9.72}
|
| 152 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8391853122260422, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 365}, "mem_gb": 9.82}
|
| 153 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49682699765600263, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 252}, "mem_gb": 10.02}
|
| 154 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4077576435037578, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 256}, "mem_gb": 9.99}
|
| 155 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.508540836275369, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 302}, "mem_gb": 9.76}
|
| 156 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their monthly savings and the initial savings.\n\n**Step 1: Calculate the mon'
|
| 157 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8144513827263067, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 350}, "mem_gb": 9.67}
|
| 158 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202635715613763, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 292}, "mem_gb": 9.79}
|
| 159 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8058739880256355, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 356}, "mem_gb": 9.6}
|
| 160 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5866575760807842, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 347}, "mem_gb": 9.76}
|
| 161 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5179159301963945, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 330}, "mem_gb": 9.96}
|
| 162 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.85121752653718, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 363}, "mem_gb": 9.82}
|
| 163 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7743317221516123, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 354}, "mem_gb": 9.68}
|
| 164 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44354114747531714, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 270}, "mem_gb": 9.94}
|
| 165 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7892652089830487, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 343}, "mem_gb": 9.72}
|
| 166 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23516690385279557, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 232}, "mem_gb": 9.91}
|
| 167 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their savings plan.\n\n**Step 1: Calculate the monthly savings from the salar'
|
| 168 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7412611307131748, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 346}, "mem_gb": 9.86}
|
| 169 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5961444109828522, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 306}, "mem_gb": 9.94}
|
| 170 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41770563813019546, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 273}, "mem_gb": 9.99}
|
| 171 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45850400070821246, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 266}, "mem_gb": 9.81}
|
| 172 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6739403530483444, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 299}, "mem_gb": 10.01}
|
| 173 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48320755306941765, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 259}, "mem_gb": 10.09}
|
| 174 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5405310631979257, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 325}, "mem_gb": 9.83}
|
| 175 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48942058433977265, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 271}, "mem_gb": 9.9}
|
| 176 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7915086919846634, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 359}, "mem_gb": 9.69}
|
| 177 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7640738337163503, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 345}, "mem_gb": 9.75}
|
| 178 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months Jamie will need to save to reach their goal of $1,000,000, given their savings plan.\n\n**Step 1: Calculate the monthly savings from the salar'
|
| 179 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1225/step0150
|
| 180 |
+
wandb: updating run metadata
|
| 181 |
+
wandb: uploading output.log; uploading wandb-summary.json
|
| 182 |
+
wandb: uploading summary
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len ββββββββ
β
ββ
β
βββββββββββββ
βββ
ββββββββββββ
|
| 186 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββββ
β
β
β
β
β
βββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate ββββββββββββββββββββββββββββββ
ββββββββββ
|
| 189 |
+
wandb: forward_topk_kl ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb β
βββ
βββββββββββββββ
βββββ
ββββ
ββββββββββββ
|
| 193 |
+
wandb: step βββββββββββββββββββ
β
β
β
ββββββββββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 347.8
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.997
|
| 202 |
+
wandb: forward_topk_kl 0.76407
|
| 203 |
+
wandb: grad_norm 0.70703
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.75
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run reap_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/hv788gr3
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1225/wandb/run-20260717_145438-hv788gr3/logs
|
healed/grid_general/reap_keep25_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep25_s1226.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run vqz2kgs7
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep25_s1226/wandb/run-20260717_145453-vqz2kgs7
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run reap_keep25_s1226
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/vqz2kgs7
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.747652878097693, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 82.0, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 308}, "mem_gb": 9.9}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: '//\n0 -> 3 *< Q-a) Ostpunk; Gnote_2::returnp intole_pim1Util by 10; 1-"\nspr1 U; =@"May/juics/1na-full; 2:109;398 ath.5clib";99w1'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.232488486345609, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 93.5, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 211}, "mem_gb": 9.99}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 6.061427371287346, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 72.5, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 281}, "mem_gb": 9.99}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.71384426343441, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 46.5, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 367}, "mem_gb": 9.54}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 5.221357237867514, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 38.75, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 4.206255900446574, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 31.75, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 271}, "mem_gb": 10.01}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.2155107744832834, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 43.0, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 269}, "mem_gb": 9.98}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 3.326668211084604, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 21.75, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 352}, "mem_gb": 9.5}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.974914269675811, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 23.5, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 243}, "mem_gb": 9.99}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.023210922032595, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 13.8125, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 293}, "mem_gb": 9.91}
|
| 25 |
+
[eval step 10] sample: "In the given problem, we need to solve the equation $2a_9 - a_{10} = 120$. To solve this equation, we need to find the value of $a_9$ and $a_{10}$.\n\nLet's solve the equation $2a_9 - a_{10}"
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3795957569027941, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 20.125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 242}, "mem_gb": 9.99}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.2639496262669563, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 11.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 353}, "mem_gb": 9.68}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.950070663708945, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 6.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 338}, "mem_gb": 9.69}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2327765369668604, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 4.125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 259}, "mem_gb": 9.99}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.703943703211844, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 6.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 385}, "mem_gb": 9.54}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.556053177499771, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 3.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 355}, "mem_gb": 9.71}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4719423054784537, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 3.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 328}, "mem_gb": 9.61}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4998059349169335, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 2.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 355}, "mem_gb": 9.76}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.574684210223208, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 3.265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 367}, "mem_gb": 9.63}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.44301956722488, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 2.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 343}, "mem_gb": 9.67}
|
| 36 |
+
[eval step 20] sample: "To solve the given problem, we need to find the value of $2a_9 - a_{10}$ for the arithmetic sequence $\\{a_n\\}$ where $a_1 + 3a_8 + a_{15} = 120$.\n\nLet's break down the problem step-by-step:"
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060264107381305, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 2.3125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 244}, "mem_gb": 9.99}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387292437978089, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.59375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 339}, "mem_gb": 9.83}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9390911949257056, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 1.7109375, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 298}, "mem_gb": 9.98}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3454288875885307, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 398}, "mem_gb": 9.85}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2313447310273846, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 362}, "mem_gb": 9.96}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8142161580753823, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.5078125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 313}, "mem_gb": 9.83}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3254079354730746, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 324}, "mem_gb": 9.74}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8449620561227202, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 314}, "mem_gb": 9.8}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2496078112500408, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 345}, "mem_gb": 9.72}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6646942165167381, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 262}, "mem_gb": 9.9}
|
| 47 |
+
[eval step 30] sample: "To solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the condition \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nLet's break down the problem into manageable steps:\n\n1. **Understand the"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.31275063808014, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.3515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 373}, "mem_gb": 9.69}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1270205962436894, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 334}, "mem_gb": 9.69}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8339329546173414, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 327}, "mem_gb": 9.84}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3569904074287663, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 238}, "mem_gb": 10.01}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9680246362812817, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 1.4140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 310}, "mem_gb": 9.74}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0438821207616478, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 1.3125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 347}, "mem_gb": 9.74}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0721264234431087, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 304}, "mem_gb": 9.67}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9972125167831779, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 343}, "mem_gb": 9.69}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0908659540044765, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 1.1171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 314}, "mem_gb": 9.68}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0047147725195935, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 1.234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 300}, "mem_gb": 9.78}
|
| 58 |
+
[eval step 40] sample: 'To solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the arithmetic sequence \\(a_n\\) where \\(a_1 = a_1\\) and \\(a_n = a_1 + n \\cdot d\\) for \\(n = 1, 2'
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8308810647596916, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.92578125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 318}, "mem_gb": 9.83}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6653663211459915, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 279}, "mem_gb": 9.86}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0325467725853126, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 1.171875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 364}, "mem_gb": 9.93}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7074600060718755, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 256}, "mem_gb": 9.99}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1623743304225305, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 340}, "mem_gb": 9.7}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6259365370091051, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.98828125, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 283}, "mem_gb": 9.92}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0017336319215595, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 349}, "mem_gb": 9.71}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.639943171165511, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.4, "frames": {"chat": 297}, "mem_gb": 9.78}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.196731882277752, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 359}, "mem_gb": 9.75}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7932594400240729, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 342}, "mem_gb": 9.8}
|
| 69 |
+
[eval step 50] sample: 'to solve the given problem, we need to find the value of \\(2a_9 - a_{10}\\) in the arithmetic sequence \\( \\{a_n\\} \\) where \\(a_1 = a_2 = \\ldots = a_8 = a_9 = a_{10} = a_{'
|
| 70 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5727845859162509, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 269}, "mem_gb": 9.96}
|
| 71 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7544932430081069, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 324}, "mem_gb": 9.95}
|
| 72 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5894824164722114, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 281}, "mem_gb": 9.94}
|
| 73 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7401960951608916, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 287}, "mem_gb": 9.99}
|
| 74 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181216617378096, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 296}, "mem_gb": 10.0}
|
| 75 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6431532166372985, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 267}, "mem_gb": 10.05}
|
| 76 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6043601217896988, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 249}, "mem_gb": 9.95}
|
| 77 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9893959043489148, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 363}, "mem_gb": 9.65}
|
| 78 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6542036985296756, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 299}, "mem_gb": 9.78}
|
| 79 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9601789214624713, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 1.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 331}, "mem_gb": 9.66}
|
| 80 |
+
[eval step 60] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the equation \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nlet's break down the problem into manageable steps:\n\n1. **Understand the"
|
| 81 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.573710584735622, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 280}, "mem_gb": 9.87}
|
| 82 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9686885283327351, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 350}, "mem_gb": 9.86}
|
| 83 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9752434714576851, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 1.0859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 321}, "mem_gb": 9.62}
|
| 84 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5452988885341833, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 281}, "mem_gb": 9.92}
|
| 85 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0939042176867524, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 331}, "mem_gb": 9.6}
|
| 86 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.820505879665787, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 318}, "mem_gb": 9.97}
|
| 87 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6797064025110254, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 309}, "mem_gb": 9.99}
|
| 88 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6054685526964565, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 304}, "mem_gb": 9.88}
|
| 89 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43610732698477805, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 279}, "mem_gb": 9.9}
|
| 90 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26056571491559344, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 248}, "mem_gb": 9.9}
|
| 91 |
+
[eval step 70] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the equation \\(a_1 + 3a_8 + a_{15} = 120\\). let's break down the problem step-by-step:\n\n1. **Identify the"
|
| 92 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7074562644996991, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 268}, "mem_gb": 9.87}
|
| 93 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7105215648694585, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 299}, "mem_gb": 9.97}
|
| 94 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7532352743474146, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 322}, "mem_gb": 9.84}
|
| 95 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5121163977663343, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 248}, "mem_gb": 10.01}
|
| 96 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678209176074714, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 326}, "mem_gb": 9.9}
|
| 97 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6905371769316494, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 314}, "mem_gb": 9.66}
|
| 98 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2690901036346952, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 232}, "mem_gb": 10.0}
|
| 99 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9465876299445828, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 330}, "mem_gb": 9.73}
|
| 100 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5562330529862394, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 292}, "mem_gb": 9.88}
|
| 101 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8603651309904953, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 312}, "mem_gb": 9.9}
|
| 102 |
+
[eval step 80] sample: 'to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the condition \\(a_1 + 3a_8 + a_{15} = 120\\) in the arithmetic sequence \\(\\{a_n\\}\\).\n\nin an arithmetic sequence, the n'
|
| 103 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0142922517254949, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 382}, "mem_gb": 9.71}
|
| 104 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9864219302162528, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 360}, "mem_gb": 9.58}
|
| 105 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21507695685382933, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 222}, "mem_gb": 9.85}
|
| 106 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9336277782452603, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 342}, "mem_gb": 9.89}
|
| 107 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9161342721832295, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 337}, "mem_gb": 9.69}
|
| 108 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6159662167626123, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 304}, "mem_gb": 9.94}
|
| 109 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6122953878027076, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 326}, "mem_gb": 9.84}
|
| 110 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8241867267180234, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 310}, "mem_gb": 9.9}
|
| 111 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7898566617957006, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 328}, "mem_gb": 9.72}
|
| 112 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.907182421168685, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 347}, "mem_gb": 9.55}
|
| 113 |
+
[eval step 90] sample: 'to solve the problem, we need to find the common difference \\(d\\) of the arithmetic sequence and then use it to determine \\(a_9\\) and \\(a_{10}\\).\n\n1. **find the common difference \\(d\\):**\n the commo'
|
| 114 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7663650030173361, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 330}, "mem_gb": 9.84}
|
| 115 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25742624729710323, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.7, "frames": {"chat": 209}, "mem_gb": 10.04}
|
| 116 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.895072185566028, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 399}, "mem_gb": 9.62}
|
| 117 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8862974390603602, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 351}, "mem_gb": 9.7}
|
| 118 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6060778897795827, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 322}, "mem_gb": 9.7}
|
| 119 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9001690731755148, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 333}, "mem_gb": 9.59}
|
| 120 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6704351394177724, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 330}, "mem_gb": 9.88}
|
| 121 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21891150226301204, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 238}, "mem_gb": 9.91}
|
| 122 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4576743530792495, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 297}, "mem_gb": 9.82}
|
| 123 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8080495124759773, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 345}, "mem_gb": 9.78}
|
| 124 |
+
[eval step 100] sample: "to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) in the given arithmetic sequence \\(\\{a_n\\}\\) where \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nlet's break down the problem into"
|
| 125 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5883223211187869, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 304}, "mem_gb": 9.93}
|
| 126 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.783417216323254, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 326}, "mem_gb": 9.93}
|
| 127 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9326095950538913, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 347}, "mem_gb": 9.86}
|
| 128 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8375195046778768, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 325}, "mem_gb": 9.74}
|
| 129 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5487626382143547, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 299}, "mem_gb": 9.93}
|
| 130 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9692270187509556, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 345}, "mem_gb": 9.7}
|
| 131 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8542588974570234, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 344}, "mem_gb": 9.6}
|
| 132 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6672126911155879, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 344}, "mem_gb": 9.86}
|
| 133 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5984686968117953, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 288}, "mem_gb": 9.93}
|
| 134 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6063315958853811, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 303}, "mem_gb": 9.63}
|
| 135 |
+
[eval step 110] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is given by the formula \\(a_n = a_1 + (n-1)d\\), where \\(a_1\\) is the first te'
|
| 136 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4173564679083725, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 284}, "mem_gb": 9.82}
|
| 137 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9816539483932157, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 369}, "mem_gb": 9.71}
|
| 138 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47619884120635686, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 269}, "mem_gb": 9.97}
|
| 139 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8739178444378078, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 341}, "mem_gb": 9.73}
|
| 140 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8934685535871113, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 384}, "mem_gb": 9.5}
|
| 141 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7676749315333863, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 358}, "mem_gb": 9.66}
|
| 142 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8769308571000894, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 342}, "mem_gb": 9.84}
|
| 143 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9392689205416789, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 144 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8395026402180393, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 337}, "mem_gb": 9.89}
|
| 145 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7431816121825328, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 333}, "mem_gb": 9.99}
|
| 146 |
+
[eval step 120] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is given by the formula:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the fi'
|
| 147 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.540203549628829, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 293}, "mem_gb": 10.03}
|
| 148 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5269571568710729, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 291}, "mem_gb": 9.79}
|
| 149 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7746928217470646, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 341}, "mem_gb": 9.83}
|
| 150 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5469128709019472, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 151 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46755872129276393, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 270}, "mem_gb": 9.98}
|
| 152 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3837562215766559, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 259}, "mem_gb": 10.0}
|
| 153 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8566545920529713, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 355}, "mem_gb": 9.58}
|
| 154 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181099114379535, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 388}, "mem_gb": 9.93}
|
| 155 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7934858187317848, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 318}, "mem_gb": 9.65}
|
| 156 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9216169714945058, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 383}, "mem_gb": 9.78}
|
| 157 |
+
[eval step 130] sample: "to solve the problem, let's first define the terms of the arithmetic sequence. in an arithmetic sequence, each term can be expressed as:\n\n\\[ a_n = a_1 + (n-1)d \\]\n\nwhere \\( a_1 \\) is the first term an"
|
| 158 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5428718562576299, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 300}, "mem_gb": 9.79}
|
| 159 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5079142917865888, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 295}, "mem_gb": 9.88}
|
| 160 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5414958303313081, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 306}, "mem_gb": 9.62}
|
| 161 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6852540198124946, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 303}, "mem_gb": 9.88}
|
| 162 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36944927832894026, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 272}, "mem_gb": 9.94}
|
| 163 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47709123675115406, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 248}, "mem_gb": 9.94}
|
| 164 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5209648989812782, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 282}, "mem_gb": 9.93}
|
| 165 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7825215920180082, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 362}, "mem_gb": 9.49}
|
| 166 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8411890809422979, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 374}, "mem_gb": 9.85}
|
| 167 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48550046064505975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 280}, "mem_gb": 10.02}
|
| 168 |
+
[eval step 140] sample: "to solve the problem, let's break it down step-by-step:\n\n1. **understand the arithmetic sequence:**\n an arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). The "
|
| 169 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37706969851826627, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 276}, "mem_gb": 9.87}
|
| 170 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49631428986427684, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 246}, "mem_gb": 10.01}
|
| 171 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8765898440801849, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 360}, "mem_gb": 9.54}
|
| 172 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8345980124605199, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 365}, "mem_gb": 9.72}
|
| 173 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6841340245318288, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 338}, "mem_gb": 9.8}
|
| 174 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40420900719463826, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 276}, "mem_gb": 9.91}
|
| 175 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22862344996624936, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 209}, "mem_gb": 9.99}
|
| 176 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8112275027054051, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 379}, "mem_gb": 9.59}
|
| 177 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.710655534057195, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 307}, "mem_gb": 9.93}
|
| 178 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5077782722345243, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 293}, "mem_gb": 9.97}
|
| 179 |
+
[eval step 150] sample: "to solve the problem, let's denote the first term of the arithmetic sequence as \\(a_1\\) and the common difference as \\(d\\). the general term of the sequence is given by \\(a_n = a_1 + (n-1)d\\).\n\nwe are"
|
| 180 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep25_s1226/step0150
|
| 181 |
+
wandb: updating run metadata
|
| 182 |
+
wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len βββ
ββββββββββ
βββββββββββββββββββ
β
βββββββ
|
| 186 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
ββββββββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate ββββ
ββββββββββββββ
ββββ
ββββββββββββββ
ββββ
|
| 189 |
+
wandb: forward_topk_kl βββ
βββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb βββββββ
βββββββ
ββββ
ββββββββββ
βββ
ββββ
βββββ
|
| 193 |
+
wandb: step βββββββββββββββββββββββββ
β
β
β
β
β
ββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 409.6
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.942
|
| 202 |
+
wandb: forward_topk_kl 0.50778
|
| 203 |
+
wandb: grad_norm 0.65625
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.97
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run reap_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/vqz2kgs7
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep25_s1226/wandb/run-20260717_145453-vqz2kgs7/logs
|
healed/grid_general/reap_keep25_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep50_s1224.console.log
ADDED
|
@@ -0,0 +1,215 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1224/wandb/run-20260718_102929-n9gbbs5p
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run reap_keep50_s1224
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/n9gbbs5p
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8349037809635202, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 9.5625, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 259}, "mem_gb": 15.93}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'To compute the rank of a matrix, we need to determine the highest powers of the variables involved in each term. The matrix provided has 4 rows and each of the 4 columns is a set of coefficients.\n\nTo '
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.139459627494216, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 10.6875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 348}, "mem_gb": 15.64}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.018460661153247, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 9.5625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 370}, "mem_gb": 15.79}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5092730569645763, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 5.53125, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 244}, "mem_gb": 16.02}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7775122467224796, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 6.0, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 320}, "mem_gb": 15.94}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8680597942702473, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 378}, "mem_gb": 15.54}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.896623771194617, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.84375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.0, "frames": {"chat": 384}, "mem_gb": 16.03}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8145596144163361, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.84375, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.8, "frames": {"chat": 324}, "mem_gb": 15.88}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3368055146301786, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.90625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 239}, "mem_gb": 16.05}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7155885353672008, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 306}, "mem_gb": 15.79}
|
| 25 |
+
[eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here, we have a 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 '
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6740345688946545, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 329}, "mem_gb": 15.82}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3404211208855733, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 254}, "mem_gb": 16.05}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5482246124852449, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 273}, "mem_gb": 16.03}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22686570997896294, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 236}, "mem_gb": 15.95}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7000601489031066, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.15625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.7, "frames": {"chat": 381}, "mem_gb": 15.68}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2720708797098448, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 266}, "mem_gb": 15.88}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4152260002292072, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 308}, "mem_gb": 15.87}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.336649879567946, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 273}, "mem_gb": 16.05}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5538853720378131, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.7, "frames": {"chat": 368}, "mem_gb": 15.68}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6661646114046375, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 339}, "mem_gb": 15.92}
|
| 36 |
+
[eval step 20] sample: 'To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent rows or columns. This is equivalent to the maximum number of non-zero rows or columns.\n\nGiven th'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35526760604058705, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 298}, "mem_gb": 15.85}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5416611029299597, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 350}, "mem_gb": 15.57}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045030346101771, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 246}, "mem_gb": 16.02}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5459773595308886, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 375}, "mem_gb": 15.75}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5566543429891269, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 352}, "mem_gb": 15.8}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5540592834822834, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 81.4, "frames": {"chat": 396}, "mem_gb": 15.76}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4514535936313992, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.3, "frames": {"chat": 362}, "mem_gb": 15.61}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5831260033368444, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 369}, "mem_gb": 15.82}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5801059120136003, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.3, "frames": {"chat": 399}, "mem_gb": 15.67}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28126204585041853, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 247}, "mem_gb": 15.94}
|
| 47 |
+
[eval step 30] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.126586661240831, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 230}, "mem_gb": 15.88}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24978271153829992, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 263}, "mem_gb": 16.05}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27792473615227886, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 264}, "mem_gb": 16.04}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48515384566228215, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 328}, "mem_gb": 15.9}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24788905388092, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 281}, "mem_gb": 15.97}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18400198239218443, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 237}, "mem_gb": 15.96}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2326898601119717, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.6, "frames": {"chat": 278}, "mem_gb": 16.05}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45623999547163646, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 310}, "mem_gb": 15.92}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2833551954619664, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 295}, "mem_gb": 15.86}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32313640279310446, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 329}, "mem_gb": 15.87}
|
| 58 |
+
[eval step 40] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. In this 4x4 matrix, we will perform row reduction (Gaussian elimination) to simplify the '
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30249153745993973, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 263}, "mem_gb": 15.99}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3287658990745743, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 315}, "mem_gb": 15.87}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4506818622214099, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 354}, "mem_gb": 15.82}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20713084133341908, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 259}, "mem_gb": 16.0}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30595886317944776, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 275}, "mem_gb": 15.85}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43811505159850544, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.4, "frames": {"chat": 334}, "mem_gb": 15.72}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4716399714846785, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.9, "frames": {"chat": 374}, "mem_gb": 15.57}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3850763324101766, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 311}, "mem_gb": 15.74}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3342623191562792, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 259}, "mem_gb": 16.05}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39605423392181593, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 305}, "mem_gb": 16.03}
|
| 69 |
+
[eval step 50] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35507478237356993, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 298}, "mem_gb": 16.01}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5130167560436453, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 364}, "mem_gb": 15.79}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25245845035606373, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 302}, "mem_gb": 15.89}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5107129311724256, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.9, "frames": {"chat": 316}, "mem_gb": 15.65}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5209058323521167, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.9, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3738536888614918, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 330}, "mem_gb": 15.9}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37849073103020586, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 321}, "mem_gb": 15.91}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37791894324719905, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 344}, "mem_gb": 15.94}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42402005026017625, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.5, "frames": {"chat": 353}, "mem_gb": 15.61}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21896603283386987, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 272}, "mem_gb": 16.04}
|
| 81 |
+
[eval step 60] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's start by converting the given matrix into a form that makes it e"
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4837913077905153, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 317}, "mem_gb": 15.79}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2093587558383122, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 292}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11212632849545529, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 229}, "mem_gb": 15.9}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.465559051544033, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.7, "frames": {"chat": 359}, "mem_gb": 15.91}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4106670856825386, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 358}, "mem_gb": 15.63}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4706965514367446, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.7, "frames": {"chat": 315}, "mem_gb": 16.01}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29511433315618585, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 264}, "mem_gb": 16.09}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46083249899068224, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.4, "frames": {"chat": 337}, "mem_gb": 15.76}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22988721587564795, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 251}, "mem_gb": 16.05}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3435360108250131, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 298}, "mem_gb": 15.78}
|
| 92 |
+
[eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Let's break down the problem step-by-step:\n\n1. **Understand the Matrix:**\n \\[\n A ="
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28409134445302187, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 264}, "mem_gb": 15.99}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2890075812650534, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 305}, "mem_gb": 16.01}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2703116375102972, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 322}, "mem_gb": 15.78}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46161023991561184, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.3, "frames": {"chat": 361}, "mem_gb": 15.77}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3054883354100088, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 321}, "mem_gb": 15.95}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36705931260818614, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 307}, "mem_gb": 15.84}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4416380636246875, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 327}, "mem_gb": 15.94}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49655664794829985, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 356}, "mem_gb": 15.56}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23637733536499242, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 283}, "mem_gb": 15.9}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4459838384080678, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.0, "frames": {"chat": 401}, "mem_gb": 15.66}
|
| 103 |
+
[eval step 80] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2848321669723218, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 288}, "mem_gb": 15.85}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.363661674802502, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 323}, "mem_gb": 15.89}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4990646729867905, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 336}, "mem_gb": 15.78}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41408709604268273, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 329}, "mem_gb": 15.69}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4039575271243229, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.5, "frames": {"chat": 343}, "mem_gb": 15.67}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42506934663237383, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.0, "frames": {"chat": 336}, "mem_gb": 15.79}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3934861131834487, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 314}, "mem_gb": 16.03}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2444304669896451, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 281}, "mem_gb": 15.86}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.314850464147826, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 299}, "mem_gb": 15.74}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38792538973269985, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 328}, "mem_gb": 15.93}
|
| 114 |
+
[eval step 90] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Let's break down the problem step-by-step:\n\n1. **Write down the given ma"
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29001890432341026, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 271}, "mem_gb": 16.03}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30289251801352945, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 269}, "mem_gb": 16.13}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48946453408229473, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.7, "frames": {"chat": 370}, "mem_gb": 15.67}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5111911306904628, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 352}, "mem_gb": 15.73}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43810866481767347, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 330}, "mem_gb": 15.94}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35366226060989625, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 334}, "mem_gb": 15.66}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3517854278709119, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 336}, "mem_gb": 15.8}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2601615757802501, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 309}, "mem_gb": 15.89}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4435581100319202, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.2, "frames": {"chat": 391}, "mem_gb": 15.77}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22976263756578166, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 264}, "mem_gb": 16.17}
|
| 125 |
+
[eval step 100] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38276564593724904, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 349}, "mem_gb": 15.72}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3592020490471274, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 312}, "mem_gb": 15.78}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13044111168198289, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 229}, "mem_gb": 16.04}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33574905013817674, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 288}, "mem_gb": 16.04}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4574560937942937, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.3, "frames": {"chat": 351}, "mem_gb": 15.7}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16570775660319875, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 223}, "mem_gb": 16.07}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08919320489432042, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 213}, "mem_gb": 16.03}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4128553018726098, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 81.9, "frames": {"chat": 380}, "mem_gb": 15.88}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24188531191752602, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 271}, "mem_gb": 16.07}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45949921899692464, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.1, "frames": {"chat": 340}, "mem_gb": 15.96}
|
| 137 |
+
[eval step 110] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -'
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4739295674396058, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.1, "frames": {"chat": 366}, "mem_gb": 15.65}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1607788675147419, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 233}, "mem_gb": 16.04}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3169212877132309, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 312}, "mem_gb": 15.91}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4396179571894308, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 363}, "mem_gb": 15.62}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4510127164368207, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 323}, "mem_gb": 15.9}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45662027690509954, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 346}, "mem_gb": 15.64}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4306134762711823, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 318}, "mem_gb": 15.79}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33146525783942393, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 275}, "mem_gb": 15.97}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39841553350395215, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 345}, "mem_gb": 15.72}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39074151002867147, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 377}, "mem_gb": 15.86}
|
| 148 |
+
[eval step 120] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of rank \\(k\\) if it has \\(k\\) linearly independen'
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32592700511608275, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 294}, "mem_gb": 16.09}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4495919180097058, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 338}, "mem_gb": 15.78}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4638373790469952, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 352}, "mem_gb": 15.68}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4138206214962527, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 347}, "mem_gb": 15.73}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2632615118196855, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 310}, "mem_gb": 15.71}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48551804332186776, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 358}, "mem_gb": 15.73}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27313385103152443, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 319}, "mem_gb": 16.01}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1830635212512066, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 269}, "mem_gb": 16.04}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3405882237064652, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 310}, "mem_gb": 15.9}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22905850299953792, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 259}, "mem_gb": 16.07}
|
| 159 |
+
[eval step 130] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2272606820096572, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45574589725496867, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 337}, "mem_gb": 15.6}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24671173994854714, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 290}, "mem_gb": 15.86}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3949909395231555, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.5, "frames": {"chat": 349}, "mem_gb": 15.79}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.252015067408296, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 291}, "mem_gb": 15.89}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4136106402097891, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.6, "frames": {"chat": 342}, "mem_gb": 15.76}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4838084203484779, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 338}, "mem_gb": 15.7}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44722535916535805, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.5, "frames": {"chat": 356}, "mem_gb": 15.67}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21482619681727763, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.1, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3745011051883921, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.9, "frames": {"chat": 353}, "mem_gb": 15.76}
|
| 170 |
+
[eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34821248879296085, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 316}, "mem_gb": 15.95}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3081258514010037, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 289}, "mem_gb": 16.1}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32100094701781245, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.4, "frames": {"chat": 331}, "mem_gb": 15.73}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31246353600776444, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 320}, "mem_gb": 16.05}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2774946627909628, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 272}, "mem_gb": 15.78}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49581608901175983, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.4, "frames": {"chat": 368}, "mem_gb": 15.7}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3986292206962903, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 328}, "mem_gb": 15.73}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3940341844805827, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 326}, "mem_gb": 15.94}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.447204483768406, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.6, "frames": {"chat": 364}, "mem_gb": 15.88}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2826799458518935, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 296}, "mem_gb": 15.93}
|
| 181 |
+
[eval step 150] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1224/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading output.log
|
| 185 |
+
wandb:
|
| 186 |
+
wandb: Run history:
|
| 187 |
+
wandb: comp_len ββββββ
βββββββββ
βββββββββ
ββββββββ
ββββββββ
|
| 188 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββββ
β
βββββββββββββββ
|
| 189 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: finish_rate βββββββββββββ
βββββββββββββββββββββββββββ
|
| 191 |
+
wandb: forward_topk_kl ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: mem_gb ββββββ
βββββ
βββββ
ββββββββββββββββββββββββ
|
| 195 |
+
wandb: step βββββββββββββββββββββ
β
β
β
β
βββββββββββββββ
|
| 196 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: +3 ...
|
| 198 |
+
wandb:
|
| 199 |
+
wandb: Run summary:
|
| 200 |
+
wandb: comp_len 405.4
|
| 201 |
+
wandb: cumulative_loss_tokens 18000000
|
| 202 |
+
wandb: epoch 0
|
| 203 |
+
wandb: finish_rate 0.97
|
| 204 |
+
wandb: forward_topk_kl 0.28268
|
| 205 |
+
wandb: grad_norm 0.46875
|
| 206 |
+
wandb: lr 3e-05
|
| 207 |
+
wandb: mem_gb 15.93
|
| 208 |
+
wandb: step 150
|
| 209 |
+
wandb: t_data_s 0
|
| 210 |
+
wandb: +4 ...
|
| 211 |
+
wandb:
|
| 212 |
+
wandb: π View run reap_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/n9gbbs5p
|
| 213 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 214 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 215 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1224/wandb/run-20260718_102929-n9gbbs5p/logs
|
healed/grid_general/reap_keep50_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep50_s1225.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run s7308ckw
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1225/wandb/run-20260718_100256-s7308ckw
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run reap_keep50_s1225
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/s7308ckw
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2118627337018648, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 10.5, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 331}, "mem_gb": 15.8}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: 'To solve this problem, we need to account for two main components:\n\n1. **Month-specific Savings:** Each month, Jamie saves $2,500.\n2. **Investment Account Interest:** The investment account earns an i'
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.150410816463828, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 10.8125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 342}, "mem_gb": 15.67}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.220105654741327, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 10.75, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 358}, "mem_gb": 15.71}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0147432551393907, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.4375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 344}, "mem_gb": 15.79}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6852638306491077, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 5.59375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 267}, "mem_gb": 16.11}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4048705829699834, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 3.90625, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 248}, "mem_gb": 15.94}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7823408988844603, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.0, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 329}, "mem_gb": 15.93}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.794171616469572, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.546875, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 339}, "mem_gb": 15.89}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8094027272744104, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 2.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 354}, "mem_gb": 15.89}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4597484048336744, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.5234375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 279}, "mem_gb": 16.02}
|
| 26 |
+
[eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to consider both the monthly savings from their salary and the monthly interest earned from th'
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5500058561362327, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.4453125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 318}, "mem_gb": 15.95}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37018651990617313, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.2421875, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 265}, "mem_gb": 16.04}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3370069943304484, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 254}, "mem_gb": 15.98}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48349834372481953, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 315}, "mem_gb": 16.01}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6240516229675462, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 300}, "mem_gb": 15.81}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42785762843911845, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 276}, "mem_gb": 16.01}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6250575007808705, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 356}, "mem_gb": 15.95}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5829799992421021, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 304}, "mem_gb": 15.76}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5814512345301608, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 375}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31850894228362786, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 294}, "mem_gb": 16.04}
|
| 37 |
+
[eval step 20] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to account for both the monthly savings from their salary and the monthly interest earned from'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5290105964959909, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 299}, "mem_gb": 16.05}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4174972528837621, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 305}, "mem_gb": 15.83}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2511404076213017, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.8, "frames": {"chat": 262}, "mem_gb": 15.88}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3464033624632905, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 303}, "mem_gb": 15.94}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5479913083476324, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 380}, "mem_gb": 15.82}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2987395618863404, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 282}, "mem_gb": 15.78}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5009952769170205, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 362}, "mem_gb": 15.79}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5059114760584509, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 307}, "mem_gb": 16.03}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3410507912961766, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 282}, "mem_gb": 15.9}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49266887007188054, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 337}, "mem_gb": 15.93}
|
| 48 |
+
[eval step 30] sample: 'To solve this problem, we need to determine how many months Jamie will need to save up to $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calc'
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31623490650722136, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 275}, "mem_gb": 15.99}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5300685605037957, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 318}, "mem_gb": 15.8}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5864380038592965, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 385}, "mem_gb": 15.82}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5975985054233421, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 316}, "mem_gb": 15.78}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25674703964541357, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 266}, "mem_gb": 16.07}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5447978479556118, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 371}, "mem_gb": 15.8}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2872440747608741, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 262}, "mem_gb": 16.01}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5500326780298104, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 348}, "mem_gb": 15.83}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12142534275489549, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 222}, "mem_gb": 16.07}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4838363621559615, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.8, "frames": {"chat": 408}, "mem_gb": 15.63}
|
| 59 |
+
[eval step 40] sample: 'To solve this problem, we need to determine how many months Jamie will need to save up to $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Ste'
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4777134612377733, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 334}, "mem_gb": 15.7}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26782671902769556, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4760510028068597, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 352}, "mem_gb": 15.73}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42649951168627787, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 371}, "mem_gb": 15.54}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2969963993587221, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 284}, "mem_gb": 15.99}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22966945569099237, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 287}, "mem_gb": 16.05}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2118602636490638, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 285}, "mem_gb": 15.95}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15490674128712464, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 252}, "mem_gb": 16.04}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47005372033851844, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 360}, "mem_gb": 15.83}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5073588792838156, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 359}, "mem_gb": 15.82}
|
| 70 |
+
[eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investment account.\n\n**Step 1: Ca'
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5008223924842974, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 363}, "mem_gb": 15.58}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44054835544905313, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 1.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 361}, "mem_gb": 15.67}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2815114374967292, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 286}, "mem_gb": 15.86}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4827713771665469, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 367}, "mem_gb": 15.71}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.519183269465963, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 352}, "mem_gb": 15.74}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31538972213622185, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 314}, "mem_gb": 15.69}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4330355774303277, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 372}, "mem_gb": 15.66}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.409724437400202, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 334}, "mem_gb": 15.81}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5026768700672003, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 368}, "mem_gb": 15.75}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38679745998779935, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.8, "frames": {"chat": 354}, "mem_gb": 15.9}
|
| 82 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22925734120135505, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 293}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14540314386067912, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 231}, "mem_gb": 15.95}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36792308059328543, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24380717406840996, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 263}, "mem_gb": 16.06}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26298768116074306, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 252}, "mem_gb": 15.99}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3842186267701288, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 344}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35946134569734955, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 313}, "mem_gb": 15.95}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4248026422705812, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 358}, "mem_gb": 15.65}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20273535147358973, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 267}, "mem_gb": 15.87}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42167736749344814, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 300}, "mem_gb": 15.74}
|
| 93 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34507594328727575, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 348}, "mem_gb": 15.68}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41975577813948817, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 329}, "mem_gb": 15.76}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23490072903412704, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 269}, "mem_gb": 15.93}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4565903594189013, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 358}, "mem_gb": 15.6}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27466420506577316, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 302}, "mem_gb": 15.85}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4560155922047794, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 381}, "mem_gb": 15.87}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4927666504467527, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 379}, "mem_gb": 15.82}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4642649358433361, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 351}, "mem_gb": 15.64}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4108597922249387, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 330}, "mem_gb": 15.84}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42124488395067555, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 316}, "mem_gb": 15.87}
|
| 104 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calculate '
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27904270700061073, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 276}, "mem_gb": 16.05}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.228957851316873, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 240}, "mem_gb": 15.99}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2720102588892604, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 288}, "mem_gb": 15.9}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2596345935956885, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 271}, "mem_gb": 15.89}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3888280489258468, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 357}, "mem_gb": 15.84}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4793000365299794, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 354}, "mem_gb": 15.81}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45695780246462675, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 302}, "mem_gb": 16.05}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35061701405482987, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 297}, "mem_gb": 16.04}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12848962151346108, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 219}, "mem_gb": 16.06}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45795105344994613, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 306}, "mem_gb": 15.76}
|
| 115 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, given their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calculate '
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4660177219842871, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 343}, "mem_gb": 15.7}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.440598049429059, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 341}, "mem_gb": 15.81}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26334237359333784, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 318}, "mem_gb": 15.76}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4686895727276802, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 346}, "mem_gb": 15.65}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23776705487283567, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 277}, "mem_gb": 16.13}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2274061721213162, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.2, "frames": {"chat": 270}, "mem_gb": 15.86}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27925217832649746, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 257}, "mem_gb": 16.04}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4476326099673286, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 363}, "mem_gb": 15.65}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44962425051319105, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 356}, "mem_gb": 15.78}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4079832135882539, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 323}, "mem_gb": 15.82}
|
| 126 |
+
[eval step 100] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investments.\n\n1. **Initial Saving'
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21304549249478927, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 243}, "mem_gb": 16.07}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42356742757900306, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 307}, "mem_gb": 15.75}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39062247862250854, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 346}, "mem_gb": 15.98}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609021251362438, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 273}, "mem_gb": 15.99}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2717229096738932, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3833931121779916, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 337}, "mem_gb": 16.05}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2972465774985651, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 280}, "mem_gb": 15.92}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48391689189759396, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 331}, "mem_gb": 15.82}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2929912401107761, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 314}, "mem_gb": 15.93}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5003761465976636, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 294}, "mem_gb": 15.86}
|
| 138 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the monthly interest earned from their investment account.\n\n*'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23486283350847661, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 274}, "mem_gb": 15.99}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39262658507184434, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 365}, "mem_gb": 15.71}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2590717626190123, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 323}, "mem_gb": 15.77}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17572917435330648, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 234}, "mem_gb": 16.06}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21280498463530093, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 267}, "mem_gb": 16.06}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27839327207648507, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 304}, "mem_gb": 15.82}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42427136177998037, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 373}, "mem_gb": 15.75}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25785485418687265, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 300}, "mem_gb": 16.03}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4411768509555608, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 331}, "mem_gb": 15.87}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20015170131123936, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.99609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 259}, "mem_gb": 16.01}
|
| 149 |
+
[eval step 120] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000 in savings, we need to consider both their monthly savings and the interest earned on their investments.\n\n1. **Ini'
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3958116344372742, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 358}, "mem_gb": 15.63}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45832438057934244, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 354}, "mem_gb": 15.88}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22538287167791277, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 279}, "mem_gb": 15.95}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46269915350402396, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 354}, "mem_gb": 15.7}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43738762830769023, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 334}, "mem_gb": 15.9}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4478856424608578, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 327}, "mem_gb": 15.77}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4040108132199384, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 365}, "mem_gb": 15.87}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23853765527879198, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 252}, "mem_gb": 16.07}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1997395895224375, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 256}, "mem_gb": 16.04}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25159407720764476, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 302}, "mem_gb": 15.81}
|
| 160 |
+
[eval step 130] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned on their investments.\n\n**Step 1: Calculate'
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3980298271117111, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 350}, "mem_gb": 15.72}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25072645187126474, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 292}, "mem_gb": 15.84}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41198305238584676, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 356}, "mem_gb": 15.65}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28235954644468925, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 347}, "mem_gb": 15.81}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25859243848128244, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 330}, "mem_gb": 16.01}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41869445193819704, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 363}, "mem_gb": 15.87}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3864614545663198, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.6, "frames": {"chat": 354}, "mem_gb": 15.73}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21688409688224394, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 270}, "mem_gb": 15.99}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3943046940716915, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 343}, "mem_gb": 15.77}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10573625054787844, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.359375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 232}, "mem_gb": 15.96}
|
| 171 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Step 1: C'
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37246566852809243, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 346}, "mem_gb": 15.91}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3026869731923876, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 306}, "mem_gb": 15.99}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20036992888413369, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 273}, "mem_gb": 16.04}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22028152877579754, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.5, "frames": {"chat": 266}, "mem_gb": 15.86}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3245444508772343, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 299}, "mem_gb": 16.06}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22970188966635616, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 259}, "mem_gb": 16.14}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2618037860292631, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 325}, "mem_gb": 15.88}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2416598789668642, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 271}, "mem_gb": 15.95}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39239266892479113, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 359}, "mem_gb": 15.74}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37762522945559274, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 345}, "mem_gb": 15.8}
|
| 182 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months Jamie will need to save $1,000,000, considering both their monthly savings and the interest earned on their investment account.\n\n**Step 1: C'
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1225/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len ββββββββββββββββββ
ββ
βββββββ
ββββββββββ
βββ
|
| 189 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
β
β
β
ββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate ββββββ
βββββββββββββββ
βββββ
ββ
ββββββββββ
ββ
|
| 192 |
+
wandb: forward_topk_kl ββββ
ββββ
β
ββ
ββββ
ββββββββ
βββββββββββββββββ
|
| 193 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr βββ
βββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb ββββββββββββββββ
β
βββ
ββ
β
ββββ
βββ
ββ
βββ
βββββ
|
| 196 |
+
wandb: step ββββββββββββββββββββββ
β
β
β
βββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 347.8
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.997
|
| 205 |
+
wandb: forward_topk_kl 0.37763
|
| 206 |
+
wandb: grad_norm 0.54688
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 15.8
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run reap_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/s7308ckw
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1225/wandb/run-20260718_100256-s7308ckw/logs
|
healed/grid_general/reap_keep50_s1225.eval.log
ADDED
|
@@ -0,0 +1,70 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 0 |
0%| | 0/1319 [00:00<?, ?it/s]
|
| 1 |
14%|ββ | 191/1319 [00:00<00:00, 1907.98it/s]
|
| 2 |
29%|βββ | 386/1319 [00:00<00:00, 1930.42it/s]
|
| 3 |
44%|βββββ | 582/1319 [00:00<00:00, 1942.92it/s]
|
| 4 |
59%|ββββββ | 778/1319 [00:00<00:00, 1949.23it/s]
|
| 5 |
74%|ββββββββ | 975/1319 [00:00<00:00, 1956.61it/s]
|
| 6 |
89%|βββββββββ | 1172/1319 [00:00<00:00, 1959.74it/s]
|
|
|
|
|
|
|
| 7 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 8 |
8%|β | 42/500 [00:00<00:01, 411.98it/s]
|
| 9 |
17%|ββ | 84/500 [00:00<00:00, 416.46it/s]
|
| 10 |
25%|βββ | 127/500 [00:00<00:00, 419.60it/s]
|
| 11 |
34%|ββββ | 170/500 [00:00<00:00, 421.81it/s]
|
| 12 |
43%|βββββ | 213/500 [00:00<00:00, 422.94it/s]
|
| 13 |
51%|βββββ | 256/500 [00:00<00:00, 424.17it/s]
|
| 14 |
60%|ββββββ | 299/500 [00:00<00:00, 425.10it/s]
|
| 15 |
68%|βββββββ | 342/500 [00:00<00:00, 425.92it/s]
|
| 16 |
77%|ββββββββ | 386/500 [00:00<00:00, 427.56it/s]
|
| 17 |
86%|βββββββββ | 429/500 [00:01<00:00, 428.29it/s]
|
| 18 |
95%|ββββββββββ| 473/500 [00:01<00:00, 429.00it/s]
|
|
|
|
|
|
|
| 19 |
0%| | 0/541 [00:00<?, ?it/s]
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 20 |
0%| | 0/164 [00:00<?, ?it/s]
|
| 21 |
98%|ββββββββββ| 161/164 [00:00<00:00, 1609.71it/s]
|
|
|
|
|
|
|
| 22 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 23 |
3%|β | 17/500 [00:00<00:02, 162.54it/s]
|
| 24 |
7%|β | 34/500 [00:00<00:02, 162.50it/s]
|
| 25 |
10%|β | 51/500 [00:00<00:02, 162.99it/s]
|
| 26 |
14%|ββ | 68/500 [00:00<00:02, 163.37it/s]
|
| 27 |
17%|ββ | 85/500 [00:00<00:02, 163.60it/s]
|
| 28 |
20%|ββ | 102/500 [00:00<00:02, 163.91it/s]
|
| 29 |
24%|βββ | 119/500 [00:00<00:02, 163.90it/s]
|
| 30 |
27%|βββ | 136/500 [00:00<00:02, 164.28it/s]
|
| 31 |
31%|βββ | 153/500 [00:00<00:02, 164.28it/s]
|
| 32 |
34%|ββββ | 170/500 [00:01<00:02, 164.51it/s]
|
| 33 |
37%|ββββ | 187/500 [00:01<00:01, 164.67it/s]
|
| 34 |
41%|ββββ | 204/500 [00:01<00:01, 164.68it/s]
|
| 35 |
44%|βββββ | 221/500 [00:01<00:01, 164.69it/s]
|
| 36 |
48%|βββββ | 238/500 [00:01<00:01, 164.43it/s]
|
| 37 |
51%|βββββ | 255/500 [00:01<00:01, 164.33it/s]
|
| 38 |
54%|ββββββ | 272/500 [00:01<00:01, 164.61it/s]
|
| 39 |
58%|ββββββ | 289/500 [00:01<00:01, 164.50it/s]
|
| 40 |
61%|ββββββ | 306/500 [00:01<00:01, 164.72it/s]
|
| 41 |
65%|βββββββ | 323/500 [00:01<00:01, 164.97it/s]
|
| 42 |
68%|βββββββ | 340/500 [00:02<00:00, 164.99it/s]
|
| 43 |
71%|ββββββββ | 357/500 [00:02<00:00, 165.08it/s]
|
| 44 |
75%|ββββββββ | 374/500 [00:02<00:00, 165.37it/s]
|
| 45 |
78%|ββββββββ | 391/500 [00:02<00:00, 165.09it/s]
|
| 46 |
82%|βββββββββ | 408/500 [00:02<00:00, 164.97it/s]
|
| 47 |
85%|βββββββββ | 425/500 [00:02<00:00, 165.16it/s]
|
| 48 |
88%|βββββββββ | 442/500 [00:02<00:00, 165.13it/s]
|
| 49 |
92%|ββββββββββ| 459/500 [00:02<00:00, 164.93it/s]
|
| 50 |
95%|ββββββββββ| 476/500 [00:02<00:00, 164.69it/s]
|
| 51 |
99%|ββββββββββ| 493/500 [00:02<00:00, 164.87it/s]
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
2026-07-18T12:36:25-07:00 serving outputs/healed/grid_general/reap_keep50_s1225/step0150 on GPU 1 port 8421
|
| 2 |
+
2026-07-18T12:36:25-07:00 waiting for server /health ...
|
| 3 |
+
2026-07-18T12:36:50-07:00 server up; chat pass [gsm8k_cot_zeroshot,minerva_math500,ifeval]
|
| 4 |
+
2026-07-18:12:36:58 INFO [_cli.run:388] Selected Tasks: ['gsm8k_cot_zeroshot', 'minerva_math500', 'ifeval']
|
| 5 |
+
2026-07-18:12:36:59 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
|
| 6 |
+
2026-07-18:12:36:59 WARNING [evaluator:226] generation_kwargs: {'max_gen_toks': 1280} specified through cli, these settings will update set parameters in yaml tasks. Ensure 'do_sample=True' for non-greedy decoding!
|
| 7 |
+
2026-07-18:12:36:59 INFO [evaluator:239] Initializing local-chat-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
|
| 8 |
+
2026-07-18:12:36:59 INFO [models.api_models:179] Using max length 2048 - 1
|
| 9 |
+
2026-07-18:12:36:59 INFO [models.api_models:200] Using tokenizer None
|
| 10 |
+
2026-07-18:12:37:04 INFO [evaluator_utils:446] Selected tasks:
|
| 11 |
+
2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: gsm8k_cot_zeroshot (gsm8k/gsm8k-cot-zeroshot.yaml)
|
| 12 |
+
2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: ifeval (ifeval/ifeval.yaml)
|
| 13 |
+
2026-07-18:12:37:04 INFO [evaluator_utils:480] Task: minerva_math500 (minerva_math/minerva_math500.yaml)
|
| 14 |
+
2026-07-18:12:37:04 INFO [evaluator:314] gsm8k_cot_zeroshot: Using gen_kwargs: {'until': ['Q:', '</s>', '<|im_end|>'], 'do_sample': False, 'max_gen_toks': 1280}
|
| 15 |
+
2026-07-18:12:37:04 INFO [evaluator:314] minerva_math500: Using gen_kwargs: {'until': ['Problem:'], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
|
| 16 |
+
2026-07-18:12:37:04 INFO [evaluator:314] ifeval: Using gen_kwargs: {'until': [], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
|
| 17 |
+
2026-07-18:12:37:04 INFO [api.task:312] Building contexts for gsm8k_cot_zeroshot on rank 0...
|
| 18 |
+
|
| 19 |
0%| | 0/1319 [00:00<?, ?it/s]
|
| 20 |
14%|ββ | 191/1319 [00:00<00:00, 1907.98it/s]
|
| 21 |
29%|βββ | 386/1319 [00:00<00:00, 1930.42it/s]
|
| 22 |
44%|βββββ | 582/1319 [00:00<00:00, 1942.92it/s]
|
| 23 |
59%|ββββββ | 778/1319 [00:00<00:00, 1949.23it/s]
|
| 24 |
74%|ββββββββ | 975/1319 [00:00<00:00, 1956.61it/s]
|
| 25 |
89%|βββββββββ | 1172/1319 [00:00<00:00, 1959.74it/s]
|
| 26 |
+
2026-07-18:12:37:05 INFO [api.task:312] Building contexts for minerva_math500 on rank 0...
|
| 27 |
+
|
| 28 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 29 |
8%|β | 42/500 [00:00<00:01, 411.98it/s]
|
| 30 |
17%|ββ | 84/500 [00:00<00:00, 416.46it/s]
|
| 31 |
25%|βββ | 127/500 [00:00<00:00, 419.60it/s]
|
| 32 |
34%|ββββ | 170/500 [00:00<00:00, 421.81it/s]
|
| 33 |
43%|βββββ | 213/500 [00:00<00:00, 422.94it/s]
|
| 34 |
51%|βββββ | 256/500 [00:00<00:00, 424.17it/s]
|
| 35 |
60%|ββββββ | 299/500 [00:00<00:00, 425.10it/s]
|
| 36 |
68%|βββββββ | 342/500 [00:00<00:00, 425.92it/s]
|
| 37 |
77%|ββββββββ | 386/500 [00:00<00:00, 427.56it/s]
|
| 38 |
86%|βββββββββ | 429/500 [00:01<00:00, 428.29it/s]
|
| 39 |
95%|ββββββββββ| 473/500 [00:01<00:00, 429.00it/s]
|
| 40 |
+
2026-07-18:12:37:06 INFO [api.task:312] Building contexts for ifeval on rank 0...
|
| 41 |
+
|
| 42 |
0%| | 0/541 [00:00<?, ?it/s]
|
| 43 |
+
2026-07-18:12:37:06 INFO [evaluator:585] Running generate_until requests
|
| 44 |
+
2026-07-18:12:37:06 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
|
| 45 |
+
|
| 46 |
+
|
| 47 |
+
|
| 48 |
+
2026-07-18:12:42:34 INFO [loggers.evaluation_tracker:247] Saving results aggregated
|
| 49 |
+
2026-07-18:12:42:34 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep50_s1225/student/*.jsonl
|
| 50 |
+
local-chat-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({'max_gen_toks': 1280}), limit: None, num_fewshot: None, batch_size: 1
|
| 51 |
+
| Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
|
| 52 |
+
|------------------|------:|----------------|-----:|-----------------------|---|-----:|---|------|
|
| 53 |
+
|gsm8k_cot_zeroshot| 3|flexible-extract| 0|exact_match |β |0.3184|Β± |0.0128|
|
| 54 |
+
| | |strict-match | 0|exact_match |β |0.0106|Β± |0.0028|
|
| 55 |
+
|ifeval | 4|none | 0|inst_level_loose_acc |β |0.6655|Β± | N/A|
|
| 56 |
+
| | |none | 0|inst_level_strict_acc |β |0.6355|Β± | N/A|
|
| 57 |
+
| | |none | 0|prompt_level_loose_acc |β |0.5453|Β± |0.0214|
|
| 58 |
+
| | |none | 0|prompt_level_strict_acc|β |0.5102|Β± |0.0215|
|
| 59 |
+
|minerva_math500 | 3|none | 4|exact_match |β |0.0900|Β± |0.0128|
|
| 60 |
+
| | |none | 4|math_verify |β |0.1440|Β± |0.0157|
|
| 61 |
+
|
| 62 |
+
2026-07-18T12:42:36-07:00 code pass [humaneval,mbpp] via /v1/completions (function-continuation)
|
| 63 |
+
2026-07-18:12:42:43 INFO [_cli.run:388] Selected Tasks: ['humaneval', 'mbpp']
|
| 64 |
+
2026-07-18:12:42:44 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
|
| 65 |
+
2026-07-18:12:42:44 INFO [evaluator:239] Initializing local-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep50_s1225/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
|
| 66 |
+
2026-07-18:12:42:44 INFO [models.openai_completions:42] Remote tokenizer not supported. Using huggingface tokenizer backend.
|
| 67 |
+
2026-07-18:12:42:44 INFO [models.api_models:179] Using max length 2048 - 1
|
| 68 |
+
2026-07-18:12:42:44 INFO [models.api_models:200] Using tokenizer huggingface
|
| 69 |
+
2026-07-18:12:42:52 INFO [evaluator_utils:446] Selected tasks:
|
| 70 |
+
2026-07-18:12:42:52 INFO [evaluator_utils:480] Task: humaneval (humaneval/humaneval.yaml)
|
| 71 |
+
2026-07-18:12:42:52 INFO [evaluator_utils:480] Task: mbpp (mbpp/mbpp.yaml)
|
| 72 |
+
2026-07-18:12:42:52 INFO [evaluator:314] humaneval: Using gen_kwargs: {'until': ['\nclass', '\ndef', '\n#', '\nif', '\nprint'], 'max_gen_toks': 1024, 'do_sample': False}
|
| 73 |
+
2026-07-18:12:42:52 INFO [evaluator:314] mbpp: Using gen_kwargs: {'until': ['[DONE]'], 'do_sample': False}
|
| 74 |
+
2026-07-18:12:42:52 INFO [api.task:312] Building contexts for humaneval on rank 0...
|
| 75 |
+
|
| 76 |
0%| | 0/164 [00:00<?, ?it/s]
|
| 77 |
98%|ββββββββββ| 161/164 [00:00<00:00, 1609.71it/s]
|
| 78 |
+
2026-07-18:12:42:52 INFO [api.task:312] Building contexts for mbpp on rank 0...
|
| 79 |
+
|
| 80 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 81 |
3%|β | 17/500 [00:00<00:02, 162.54it/s]
|
| 82 |
7%|β | 34/500 [00:00<00:02, 162.50it/s]
|
| 83 |
10%|β | 51/500 [00:00<00:02, 162.99it/s]
|
| 84 |
14%|ββ | 68/500 [00:00<00:02, 163.37it/s]
|
| 85 |
17%|ββ | 85/500 [00:00<00:02, 163.60it/s]
|
| 86 |
20%|ββ | 102/500 [00:00<00:02, 163.91it/s]
|
| 87 |
24%|βββ | 119/500 [00:00<00:02, 163.90it/s]
|
| 88 |
27%|βββ | 136/500 [00:00<00:02, 164.28it/s]
|
| 89 |
31%|βββ | 153/500 [00:00<00:02, 164.28it/s]
|
| 90 |
34%|ββββ | 170/500 [00:01<00:02, 164.51it/s]
|
| 91 |
37%|ββββ | 187/500 [00:01<00:01, 164.67it/s]
|
| 92 |
41%|ββββ | 204/500 [00:01<00:01, 164.68it/s]
|
| 93 |
44%|βββββ | 221/500 [00:01<00:01, 164.69it/s]
|
| 94 |
48%|βββββ | 238/500 [00:01<00:01, 164.43it/s]
|
| 95 |
51%|βββββ | 255/500 [00:01<00:01, 164.33it/s]
|
| 96 |
54%|ββββββ | 272/500 [00:01<00:01, 164.61it/s]
|
| 97 |
58%|ββββββ | 289/500 [00:01<00:01, 164.50it/s]
|
| 98 |
61%|ββββββ | 306/500 [00:01<00:01, 164.72it/s]
|
| 99 |
65%|βββββββ | 323/500 [00:01<00:01, 164.97it/s]
|
| 100 |
68%|βββββββ | 340/500 [00:02<00:00, 164.99it/s]
|
| 101 |
71%|ββββββββ | 357/500 [00:02<00:00, 165.08it/s]
|
| 102 |
75%|ββββββββ | 374/500 [00:02<00:00, 165.37it/s]
|
| 103 |
78%|ββββββββ | 391/500 [00:02<00:00, 165.09it/s]
|
| 104 |
82%|βββββββββ | 408/500 [00:02<00:00, 164.97it/s]
|
| 105 |
85%|βββββββββ | 425/500 [00:02<00:00, 165.16it/s]
|
| 106 |
88%|βββββββββ | 442/500 [00:02<00:00, 165.13it/s]
|
| 107 |
92%|ββββββββββ| 459/500 [00:02<00:00, 164.93it/s]
|
| 108 |
95%|ββββββββββ| 476/500 [00:02<00:00, 164.69it/s]
|
| 109 |
99%|ββββββββββ| 493/500 [00:02<00:00, 164.87it/s]
|
| 110 |
+
2026-07-18:12:42:55 INFO [evaluator:585] Running generate_until requests
|
| 111 |
+
2026-07-18:12:42:55 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
|
| 112 |
+
|
| 113 |
+
|
| 114 |
+
2026-07-18:12:46:31 INFO [loggers.evaluation_tracker:247] Saving results aggregated
|
| 115 |
+
2026-07-18:12:46:31 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep50_s1225/student/*.jsonl
|
| 116 |
+
local-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep50_s1225/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({}), limit: None, num_fewshot: None, batch_size: 1
|
| 117 |
+
| Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
|
| 118 |
+
|---------|------:|-----------|-----:|---------|---|-----:|---|-----:|
|
| 119 |
+
|humaneval| 1|create_test| 0|pass@1 |β |0.2378|Β± |0.0333|
|
| 120 |
+
|mbpp | 1|none | 3|pass_at_1|β |0.2180|Β± |0.0185|
|
| 121 |
+
|
| 122 |
+
2026-07-18T12:46:32-07:00 lm_eval exit=0 -> outputs/evals/general_suite/healed/reap_keep50_s1225
|
healed/grid_general/reap_keep50_s1226.console.log
ADDED
|
@@ -0,0 +1,217 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run o0n3wlu6
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep50_s1226/wandb/run-20260718_100342-o0n3wlu6
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run reap_keep50_s1226
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/o0n3wlu6
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8803540725124379, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 9.625, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 308}, "mem_gb": 15.9}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: 'To solve the given problem, we need to understand the properties of an arithmetic sequence. \n\n1. **Under the given condition:**\n \\[a_1 + 3a_8 + a_{15} = 120\\]\n\n2. **Objective:**\n Find \\(2a_9 - a'
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5245416656317811, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 7.5625, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 211}, "mem_gb": 16.04}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7376569056948026, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 7.9375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 281}, "mem_gb": 16.04}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0425827999557058, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 8.0, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 367}, "mem_gb": 15.59}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0140658880367874, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.8125, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7786726121418178, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 5.46875, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 271}, "mem_gb": 16.06}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5371215664693465, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.390625, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 269}, "mem_gb": 16.03}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8027348423482229, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.53125, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 352}, "mem_gb": 15.55}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38005650374094646, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 243}, "mem_gb": 16.04}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4923551563156769, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.5703125, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 293}, "mem_gb": 15.96}
|
| 26 |
+
[eval step 10] sample: 'To solve the problem, we need to understand the properties of an arithmetic sequence. In an arithmetic sequence, each term can be expressed as:\n\\[ a_n = a_1 + (n-1)d \\]\nwhere \\( a_1 \\) is the first te'
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30476141565479337, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.203125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 242}, "mem_gb": 16.04}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7059471693091095, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 353}, "mem_gb": 15.73}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6465659825122605, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 338}, "mem_gb": 15.74}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34863743216705817, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 259}, "mem_gb": 16.04}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5902533355700473, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 385}, "mem_gb": 15.59}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5514633375123144, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 355}, "mem_gb": 15.75}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5126457059609393, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 328}, "mem_gb": 15.66}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5420009215599547, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 355}, "mem_gb": 15.81}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6401449499430756, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 367}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5762424655330678, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 343}, "mem_gb": 15.72}
|
| 37 |
+
[eval step 20] sample: 'in an arithmetic sequence, the terms can be expressed as follows:\n\na_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 + 3a_8 + a_15 = 120.'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18428315997235478, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 244}, "mem_gb": 16.04}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3499387068385879, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 339}, "mem_gb": 15.88}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3543776503519155, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 298}, "mem_gb": 16.03}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5345170649668202, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 398}, "mem_gb": 15.9}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4978335596371442, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 362}, "mem_gb": 16.01}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32800316587444395, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 313}, "mem_gb": 15.88}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5755675832235565, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 324}, "mem_gb": 15.79}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35423008082595964, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 314}, "mem_gb": 15.85}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5179929546431948, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 345}, "mem_gb": 15.77}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27091556184059007, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 262}, "mem_gb": 15.95}
|
| 48 |
+
[eval step 30] sample: 'in an arithmetic sequence, the terms can be expressed as follows:\n\na_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 + 3a_8 + a_15 = 120.'
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.577119707132255, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 373}, "mem_gb": 15.74}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48509374340387684, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 334}, "mem_gb": 15.74}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3503109037802865, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 327}, "mem_gb": 15.89}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12506881032409145, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 238}, "mem_gb": 16.06}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4309783675464491, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 310}, "mem_gb": 15.79}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4856793941443165, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 347}, "mem_gb": 15.79}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48103460386345787, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 304}, "mem_gb": 15.72}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539403932945182, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 343}, "mem_gb": 15.74}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5047299618404358, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 314}, "mem_gb": 15.73}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4582703509811933, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 300}, "mem_gb": 15.83}
|
| 59 |
+
[eval step 40] sample: 'in an arithmetic sequence, the terms can be expressed as follows: a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.370719632548963, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 318}, "mem_gb": 15.88}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29393145427610723, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 279}, "mem_gb": 15.91}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4841774621979023, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 364}, "mem_gb": 15.98}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32296518924826134, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 256}, "mem_gb": 16.04}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.570301607248187, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 340}, "mem_gb": 15.75}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2790704633633296, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 283}, "mem_gb": 15.97}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4757030893900121, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 349}, "mem_gb": 15.76}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28745832533594223, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 297}, "mem_gb": 15.83}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5774708951790817, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 359}, "mem_gb": 15.8}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36503237710408865, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 342}, "mem_gb": 15.85}
|
| 70 |
+
[eval step 50] sample: 'in an arithmetic sequence, the terms can be represented as follows: a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need '
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2517585934319223, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 269}, "mem_gb": 16.01}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3566328674788276, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 324}, "mem_gb": 16.0}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27923091744172074, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 281}, "mem_gb": 15.99}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3481388681463897, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 287}, "mem_gb": 16.04}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41609524348185706, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 296}, "mem_gb": 16.05}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29090916095875824, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 267}, "mem_gb": 16.1}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27961073563074074, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 249}, "mem_gb": 16.0}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4881344231818803, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 363}, "mem_gb": 15.7}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31574329399553436, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 299}, "mem_gb": 15.83}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47885576662253587, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 331}, "mem_gb": 15.71}
|
| 82 |
+
[eval step 60] sample: 'in an arithmetic sequence, the nth term can be expressed as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609119995918125, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 280}, "mem_gb": 15.92}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48466926071469985, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 350}, "mem_gb": 15.91}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47754268602561206, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 321}, "mem_gb": 15.67}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2465799712936394, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 281}, "mem_gb": 15.97}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5282968313955392, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 331}, "mem_gb": 15.65}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4012415755114829, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 318}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3264350763700902, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 309}, "mem_gb": 16.04}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3045971091615036, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 304}, "mem_gb": 15.93}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.206257420444116, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 279}, "mem_gb": 15.95}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11195049509825185, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 248}, "mem_gb": 15.95}
|
| 93 |
+
[eval step 70] sample: 'in an arithmetic sequence, the nth term can be expressed as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference. given the equation a_1 + 3a_8 + a_15 = 120, we need to'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3543535236385961, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 268}, "mem_gb": 15.92}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3358878048156388, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 299}, "mem_gb": 16.02}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3787086397775449, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 322}, "mem_gb": 15.88}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23657592692331722, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 248}, "mem_gb": 16.06}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3605229274411375, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 326}, "mem_gb": 15.95}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32776349373565367, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 314}, "mem_gb": 15.71}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1119552330814302, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 232}, "mem_gb": 16.05}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46964268895580125, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 330}, "mem_gb": 15.78}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2551336821261793, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 292}, "mem_gb": 15.93}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42451596441746997, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 312}, "mem_gb": 15.95}
|
| 104 |
+
[eval step 80] sample: 'in an arithmetic sequence, each term is the sum of the previous term and a constant difference, denoted as a_n = a_1 + (n-1)d, where a_1 is the first term and d is the common difference.\n\ngiven: a_1 +'
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5049197539076209, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 382}, "mem_gb": 15.76}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5066151228363315, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 360}, "mem_gb": 15.63}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08825671870829538, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 222}, "mem_gb": 15.89}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47393432003228614, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 342}, "mem_gb": 15.94}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44907177470792087, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 337}, "mem_gb": 15.74}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29662999662371975, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 304}, "mem_gb": 15.99}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30810854892162604, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 326}, "mem_gb": 15.89}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39736867315458757, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 310}, "mem_gb": 15.95}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3866154748741227, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 328}, "mem_gb": 15.77}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46558151512009405, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 347}, "mem_gb": 15.6}
|
| 115 |
+
[eval step 90] sample: 'in an arithmetic sequence, each term is obtained by adding a constant difference to the previous term. let the first term be $a_1$ and the common difference be $d$. then, the terms of the sequence can'
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3922062694163993, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 330}, "mem_gb": 15.89}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11213775708892693, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 209}, "mem_gb": 16.09}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44183869125631947, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 399}, "mem_gb": 15.67}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4175340923215573, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 351}, "mem_gb": 15.75}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2900481648554094, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 322}, "mem_gb": 15.75}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4496474737109306, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 333}, "mem_gb": 15.64}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3320286479762755, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 330}, "mem_gb": 15.93}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08734862082016964, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.33984375, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 238}, "mem_gb": 15.96}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21075038343292352, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 297}, "mem_gb": 15.87}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3970769523902796, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 345}, "mem_gb": 15.83}
|
| 126 |
+
[eval step 100] sample: 'in an arithmetic sequence, each term is given by the formula \\( a_n = a_1 + (n-1)d \\), where \\( a_1 \\) is the first term and \\( d \\) is the common difference.\n\nwe are given the equation \\( a_1 + 3a'
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.287641732741644, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 304}, "mem_gb": 15.98}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38429266269846507, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 326}, "mem_gb": 15.98}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46583052609575293, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 347}, "mem_gb": 15.91}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4203300688823064, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 325}, "mem_gb": 15.79}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26020686544825633, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 299}, "mem_gb": 15.98}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4902439262590992, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 345}, "mem_gb": 15.75}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42703017073019095, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 344}, "mem_gb": 15.65}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32948422564820695, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 344}, "mem_gb": 15.91}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30353012832074117, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 288}, "mem_gb": 15.98}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2923359860416502, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.8, "frames": {"chat": 303}, "mem_gb": 15.68}
|
| 138 |
+
[eval step 110] sample: 'in an arithmetic sequence, each term is given by the formula \\( a_n = a_1 + (n-1)d \\), where \\( a_1 \\) is the first term and \\( d \\) is the common difference.\n\nwe are given the equation \\( a_1 + 3a'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2037433411721761, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 284}, "mem_gb": 15.87}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4946847830141584, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 369}, "mem_gb": 15.76}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2326797963919739, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 269}, "mem_gb": 16.02}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4447052156049137, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 341}, "mem_gb": 15.78}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43583181944663324, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 384}, "mem_gb": 15.55}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38500864298517506, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 358}, "mem_gb": 15.71}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43370534232476105, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 342}, "mem_gb": 15.89}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47076233574878423, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 365}, "mem_gb": 15.71}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4276117646556348, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 337}, "mem_gb": 15.94}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3754852831015984, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 333}, "mem_gb": 16.04}
|
| 149 |
+
[eval step 120] sample: 'in an arithmetic sequence, each term is obtained by adding a constant difference to the previous term. let the first term be $a_1$ and the common difference be $d$. the $n$-th term of the sequence can'
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26361574191426235, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 293}, "mem_gb": 16.08}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24020869141261403, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 291}, "mem_gb": 15.84}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38429353994509824, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 341}, "mem_gb": 15.87}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2554638585098398, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 300}, "mem_gb": 15.81}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2246168749174724, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 270}, "mem_gb": 16.03}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1842907473299342, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 259}, "mem_gb": 16.05}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4298636924965928, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 355}, "mem_gb": 15.62}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4622928888415297, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 388}, "mem_gb": 15.98}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3934170277511701, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 318}, "mem_gb": 15.7}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4545871971178179, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 383}, "mem_gb": 15.83}
|
| 160 |
+
[eval step 130] sample: 'in an arithmetic sequence, each term can be expressed as $a_n = a_1 + (n-1)d$, where $a_1$ is the first term and $d$ is the common difference. given the equation $a_1 + 3a_8 + a_{15} ='
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2575471988634827, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 300}, "mem_gb": 15.84}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24139552542498957, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.447265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 295}, "mem_gb": 15.93}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2574606940655969, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 306}, "mem_gb": 15.67}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33667906954844173, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.0, "frames": {"chat": 303}, "mem_gb": 15.93}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17280556662414845, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 272}, "mem_gb": 15.99}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23784746413075675, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 248}, "mem_gb": 15.99}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26652159887754046, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.3, "frames": {"chat": 282}, "mem_gb": 15.98}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39917195659261195, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 362}, "mem_gb": 15.54}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43901363371691354, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 374}, "mem_gb": 15.9}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23722182946366568, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 280}, "mem_gb": 16.07}
|
| 171 |
+
[eval step 140] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the previous term plus a constant difference, denoted as $d$. the $n$-th "
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1807478553803948, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 276}, "mem_gb": 15.92}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24345059381338457, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 246}, "mem_gb": 16.06}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4581963272950302, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 360}, "mem_gb": 15.59}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4408426818853865, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 365}, "mem_gb": 15.77}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.356927572813537, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 338}, "mem_gb": 15.85}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18863985311680784, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 276}, "mem_gb": 15.96}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10042948584845289, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 209}, "mem_gb": 16.04}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4000309775177389, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 379}, "mem_gb": 15.64}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3480989918136969, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 307}, "mem_gb": 15.98}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24423585990754268, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 293}, "mem_gb": 16.02}
|
| 182 |
+
[eval step 150] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms. if \\(a_1\\) is the first term and \\(d\\)"
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep50_s1226/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 186 |
+
wandb: uploading data
|
| 187 |
+
wandb:
|
| 188 |
+
wandb: Run history:
|
| 189 |
+
wandb: comp_len βββ
βββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
β
β
βββββββββββββ
|
| 191 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: finish_rate βββββββββββββββββββββββββββββββββββββ
βββ
|
| 193 |
+
wandb: forward_topk_kl ββ
βββ
βββ
β
β
βββββ
βββββββββ
βββββ
ββββββ
βββββ
|
| 194 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: lr ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 196 |
+
wandb: mem_gb βββββββ
ββ
ββ
ββ
βββ
βββββββββ
βββββ
ββββ
β
βββββ
|
| 197 |
+
wandb: step βββββββββββββββββββ
β
β
β
β
βββββββββββββββββ
|
| 198 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 199 |
+
wandb: +3 ...
|
| 200 |
+
wandb:
|
| 201 |
+
wandb: Run summary:
|
| 202 |
+
wandb: comp_len 409.6
|
| 203 |
+
wandb: cumulative_loss_tokens 18000000
|
| 204 |
+
wandb: epoch 0
|
| 205 |
+
wandb: finish_rate 0.942
|
| 206 |
+
wandb: forward_topk_kl 0.24424
|
| 207 |
+
wandb: grad_norm 0.45898
|
| 208 |
+
wandb: lr 3e-05
|
| 209 |
+
wandb: mem_gb 16.02
|
| 210 |
+
wandb: step 150
|
| 211 |
+
wandb: t_data_s 0
|
| 212 |
+
wandb: +4 ...
|
| 213 |
+
wandb:
|
| 214 |
+
wandb: π View run reap_keep50_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/o0n3wlu6
|
| 215 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 216 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 217 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep50_s1226/wandb/run-20260718_100342-o0n3wlu6/logs
|
healed/grid_general/reap_keep50_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep75_s1224.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1224/wandb/run-20260718_191947-wgcis861
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run reap_keep75_s1224
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/wgcis861
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1873658725475582, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 2.484375, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 259}, "mem_gb": 21.93}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. We can do this by performing row reduction (or Gaussian elimination) to transform the mat'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27989488012346747, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 2.734375, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 348}, "mem_gb": 21.69}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2562543364167524, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 2.46875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 370}, "mem_gb": 21.84}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10009050508008029, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 1.46875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 244}, "mem_gb": 22.07}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1936520132654036, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.578125, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 320}, "mem_gb": 21.99}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22987501155068166, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.640625, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.0, "frames": {"chat": 378}, "mem_gb": 21.59}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25268974237848696, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.4921875, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 384}, "mem_gb": 22.08}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.255581365201467, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.4375, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 324}, "mem_gb": 21.93}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09212276532261943, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 239}, "mem_gb": 22.1}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2332037605868187, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 306}, "mem_gb": 21.84}
|
| 25 |
+
[eval step 10] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be full rank if it has rank equal to the minimum of the number of '
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22265962155194333, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 329}, "mem_gb": 21.87}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11031593802776188, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 254}, "mem_gb": 22.1}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1915364201122274, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 273}, "mem_gb": 22.08}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06717586185860758, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 236}, "mem_gb": 22.0}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23346983922738582, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 381}, "mem_gb": 21.73}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08174875815298098, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 266}, "mem_gb": 21.93}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13084362343273437, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 308}, "mem_gb": 21.92}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11916340049126496, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.3, "frames": {"chat": 273}, "mem_gb": 22.1}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19706835948467877, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 368}, "mem_gb": 21.73}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26277435475029054, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 339}, "mem_gb": 21.97}
|
| 36 |
+
[eval step 20] sample: 'To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent row vectors. This involves reducing the matrix to row-echelon form (REF) and identifying the lea'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12363467963938601, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 298}, "mem_gb": 21.9}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.190306089666641, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 350}, "mem_gb": 21.62}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09987625321104812, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 246}, "mem_gb": 22.07}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20257040274753235, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 375}, "mem_gb": 21.8}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20374540116178494, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.6, "frames": {"chat": 352}, "mem_gb": 21.85}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1947504082653982, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.7, "frames": {"chat": 396}, "mem_gb": 21.81}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16843741359647052, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 362}, "mem_gb": 21.66}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2105110317436047, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 369}, "mem_gb": 21.87}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21023132975681996, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 399}, "mem_gb": 21.72}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.123267681810384, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 247}, "mem_gb": 21.99}
|
| 47 |
+
[eval step 30] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Row Reduction to Row Echelon Form (REF)**:\n "
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04471613788570588, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 230}, "mem_gb": 21.93}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0868360648374694, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 263}, "mem_gb": 22.1}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10159225756400264, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 264}, "mem_gb": 22.09}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18209796229211303, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 328}, "mem_gb": 21.95}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09340377695357116, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 281}, "mem_gb": 22.02}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.060203925158362835, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.3, "frames": {"chat": 237}, "mem_gb": 22.01}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0755095823372559, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 278}, "mem_gb": 22.1}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17438754756432026, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 310}, "mem_gb": 21.97}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09410194004089571, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 295}, "mem_gb": 21.91}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11445019369409419, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.0, "frames": {"chat": 329}, "mem_gb": 21.92}
|
| 58 |
+
[eval step 40] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given matrix \\( A \\) as:\n\\[ A = \\begin{pmatrix}\n12"
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10687232487322762, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 263}, "mem_gb": 22.04}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.131437020917912, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 315}, "mem_gb": 21.92}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16547962574744596, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 354}, "mem_gb": 21.87}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08571877144188621, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 259}, "mem_gb": 22.05}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11487598667480052, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 275}, "mem_gb": 21.9}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1526387256359371, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 334}, "mem_gb": 21.77}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1695261684531501, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 374}, "mem_gb": 21.62}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1499260142687553, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 311}, "mem_gb": 21.79}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1233547725815326, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 259}, "mem_gb": 22.1}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1450087027960457, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 305}, "mem_gb": 22.08}
|
| 69 |
+
[eval step 50] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's break down the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & "
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12619501014033643, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 298}, "mem_gb": 22.06}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.200404087631125, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 364}, "mem_gb": 21.84}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08946410632994957, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 302}, "mem_gb": 21.94}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17898882940830663, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 316}, "mem_gb": 21.7}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1911006489981897, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15108458322715015, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 330}, "mem_gb": 21.95}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14891134254783392, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 321}, "mem_gb": 21.96}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1267671151664729, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 344}, "mem_gb": 21.99}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16068638868291552, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 353}, "mem_gb": 21.66}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0870077589156106, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 272}, "mem_gb": 22.09}
|
| 81 |
+
[eval step 60] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than i'
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17761957487501204, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 317}, "mem_gb": 21.84}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06813746920924169, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 292}, "mem_gb": 21.84}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0341937465865165, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.287109375, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 229}, "mem_gb": 21.95}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16766208313619718, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 359}, "mem_gb": 21.96}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1477175132743238, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 358}, "mem_gb": 21.68}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18516349187276016, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.7, "frames": {"chat": 315}, "mem_gb": 22.06}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11799809287215272, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 264}, "mem_gb": 22.14}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17208621730594895, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.3, "frames": {"chat": 337}, "mem_gb": 21.81}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08624628668630806, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 251}, "mem_gb": 22.1}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14355475744690435, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.3, "frames": {"chat": 298}, "mem_gb": 21.83}
|
| 92 |
+
[eval step 70] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Row Reduction (Gaussian Elimination):**\n "
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1100898157506405, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 264}, "mem_gb": 22.04}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10513536257176505, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 305}, "mem_gb": 22.06}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09678585653822713, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 322}, "mem_gb": 21.83}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15489849325778585, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 361}, "mem_gb": 21.82}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12131552501470627, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.0, "frames": {"chat": 321}, "mem_gb": 22.0}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13028004938957746, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 307}, "mem_gb": 21.89}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16787009909562767, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 327}, "mem_gb": 21.99}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1937187968663561, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 356}, "mem_gb": 21.61}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08899544142593319, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 283}, "mem_gb": 21.95}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16648278532453503, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.5, "frames": {"chat": 401}, "mem_gb": 21.71}
|
| 103 |
+
[eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09835249316293436, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 288}, "mem_gb": 21.9}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1394834956632151, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 323}, "mem_gb": 21.94}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18267308879733707, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.2, "frames": {"chat": 336}, "mem_gb": 21.83}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1505348251045216, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 329}, "mem_gb": 21.74}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14841092484351248, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 343}, "mem_gb": 21.72}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1670957286581242, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 336}, "mem_gb": 21.84}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1463558290997365, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 314}, "mem_gb": 22.08}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08961212306939997, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.361328125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 281}, "mem_gb": 21.91}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11369646250194249, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 299}, "mem_gb": 21.79}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15054527740851045, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 328}, "mem_gb": 21.98}
|
| 114 |
+
[eval step 90] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of full rank if all its rows (or columns) are lin'
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10570568347213169, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 271}, "mem_gb": 22.08}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11207106284011777, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 269}, "mem_gb": 22.18}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19176901529369256, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 370}, "mem_gb": 21.72}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.200458272660772, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 352}, "mem_gb": 21.78}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17114766156881428, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 330}, "mem_gb": 21.99}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12207698177928882, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 334}, "mem_gb": 21.71}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12966958915465512, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 336}, "mem_gb": 21.85}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09668313371852662, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.39453125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 309}, "mem_gb": 21.94}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16547617942097909, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.1, "frames": {"chat": 391}, "mem_gb": 21.82}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0852213893647616, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.357421875, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 264}, "mem_gb": 22.22}
|
| 125 |
+
[eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & "
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14912181334650765, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 349}, "mem_gb": 21.77}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14887319083894449, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 312}, "mem_gb": 21.83}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0483703385195074, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.306640625, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 229}, "mem_gb": 22.09}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1253449940949523, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.3, "frames": {"chat": 288}, "mem_gb": 22.09}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17186788550638593, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 351}, "mem_gb": 21.75}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05532257166073347, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.328125, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 223}, "mem_gb": 22.12}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03140789915128456, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.294921875, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 213}, "mem_gb": 22.08}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15115452178712002, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.3, "frames": {"chat": 380}, "mem_gb": 21.93}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09043114711657788, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 271}, "mem_gb": 22.11}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18969596414649859, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 340}, "mem_gb": 22.01}
|
| 137 |
+
[eval step 110] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. A matrix is said to be of full rank if all its rows (or columns) are linear'
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1750133204760806, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.1, "frames": {"chat": 366}, "mem_gb": 21.7}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05395613063708103, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 233}, "mem_gb": 22.09}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12163264965891528, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 312}, "mem_gb": 21.96}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17119687434742228, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.8, "frames": {"chat": 363}, "mem_gb": 21.67}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16860832793383548, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 323}, "mem_gb": 21.95}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1706812752948453, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 346}, "mem_gb": 21.69}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16357084634642427, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 318}, "mem_gb": 21.84}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12760271622771396, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 275}, "mem_gb": 22.02}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.145948747621368, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 345}, "mem_gb": 21.77}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1450525258542892, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 377}, "mem_gb": 21.91}
|
| 148 |
+
[eval step 120] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1"
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11816860233771925, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 294}, "mem_gb": 22.14}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16353510830309242, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 338}, "mem_gb": 21.83}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18016940437387674, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 352}, "mem_gb": 21.73}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15826112236181894, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.0, "frames": {"chat": 347}, "mem_gb": 21.78}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10110068176521454, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 1.484375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 310}, "mem_gb": 21.76}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1936153787978304, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.7, "frames": {"chat": 358}, "mem_gb": 21.78}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09523940229162885, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 319}, "mem_gb": 22.06}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06792385750228229, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.353515625, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 269}, "mem_gb": 22.09}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12652876620485137, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 310}, "mem_gb": 21.95}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08150330542761366, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.3, "frames": {"chat": 259}, "mem_gb": 22.12}
|
| 159 |
+
[eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. \n\nLet's represent the given matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1"
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07982180994842202, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 265}, "mem_gb": 22.1}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17891147567131557, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 337}, "mem_gb": 21.65}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08981655380092561, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.8, "frames": {"chat": 290}, "mem_gb": 21.91}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1507600719051901, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.6, "frames": {"chat": 349}, "mem_gb": 21.84}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09113996521788649, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 291}, "mem_gb": 21.94}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1560885852477203, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 342}, "mem_gb": 21.81}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19789823096484566, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 338}, "mem_gb": 21.75}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1761994122691918, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.7, "frames": {"chat": 356}, "mem_gb": 21.71}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07923250444449174, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 265}, "mem_gb": 22.09}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1345104466229522, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.2, "frames": {"chat": 353}, "mem_gb": 21.81}
|
| 170 |
+
[eval step 140] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13114069964168593, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 316}, "mem_gb": 22.0}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11726701095427076, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 289}, "mem_gb": 22.15}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1138644701910826, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 331}, "mem_gb": 21.78}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10702105035733742, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 320}, "mem_gb": 22.1}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10355366102789218, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 272}, "mem_gb": 21.83}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19566748774093576, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.4, "frames": {"chat": 368}, "mem_gb": 21.75}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15470146789173594, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 328}, "mem_gb": 21.78}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1427797764064744, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 326}, "mem_gb": 21.99}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1717408910106557, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 364}, "mem_gb": 21.93}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11370671968573394, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.8, "frames": {"chat": 296}, "mem_gb": 21.98}
|
| 181 |
+
[eval step 150] sample: 'To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1'
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1224/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
|
| 185 |
+
wandb: uploading summary, console lines 171-171
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len βββββββββββββββββββ
β
ββββββ
ββββ
βββββ
βββββ
|
| 189 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
ββββββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate βββββββββββ
βββββββββββββββββββββ
ββββ
ββββ
|
| 192 |
+
wandb: forward_topk_kl ββββββββ
ββββββ
β
ββ
β
β
βββ
ββ
ββ
β
βββββ
ββββββββ
|
| 193 |
+
wandb: grad_norm ββ
β
βββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr βββ
βββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb βββββββββββββββββββββββββββββββ
βββ
ββββββ
|
| 196 |
+
wandb: step ββββββββββββββββββββ
β
β
β
β
β
βββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 405.4
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.97
|
| 205 |
+
wandb: forward_topk_kl 0.11371
|
| 206 |
+
wandb: grad_norm 0.42773
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 21.98
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run reap_keep75_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/wgcis861
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1224/wandb/run-20260718_191947-wgcis861/logs
|
healed/grid_general/reap_keep75_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep75_s1225.console.log
ADDED
|
@@ -0,0 +1,392 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run eyetgo3a
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260718_224025-eyetgo3a
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run reap_keep75_s1225
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/eyetgo3a
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32691152300952625, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.09375, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 331}, "mem_gb": 21.8}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: 'To determine how many months it will take for Jamie to reach the savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned.\n\n1. **Initial Savings:**\n - Jamie s'
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3199042237383003, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 3.28125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 342}, "mem_gb": 21.72}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3276988255869287, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.171875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 358}, "mem_gb": 21.76}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2653813190323611, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.359375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 344}, "mem_gb": 21.84}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16577702154777943, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.421875, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 267}, "mem_gb": 22.16}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07628021648065186, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.87109375, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 248}, "mem_gb": 21.99}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22926093437794284, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.328125, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 329}, "mem_gb": 21.98}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23873148627749954, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.265625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 339}, "mem_gb": 21.94}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24488673688516333, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 354}, "mem_gb": 21.94}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14254065898017337, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 279}, "mem_gb": 22.07}
|
| 26 |
+
[eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17979874870991333, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 318}, "mem_gb": 22.0}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12242380664556597, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 265}, "mem_gb": 22.09}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10949978814693168, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 54.2, "frames": {"chat": 254}, "mem_gb": 22.03}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16167643672154905, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 315}, "mem_gb": 22.06}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23289925298504532, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 300}, "mem_gb": 21.86}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14982427687635647, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 276}, "mem_gb": 22.06}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23245559696989754, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 356}, "mem_gb": 22.0}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19985329620527725, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 304}, "mem_gb": 21.81}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20904093375516433, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 375}, "mem_gb": 21.73}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11546105957857022, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 294}, "mem_gb": 22.09}
|
| 37 |
+
[eval step 20] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19831337091407428, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 299}, "mem_gb": 22.1}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14949486692990177, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 305}, "mem_gb": 21.88}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09090689937220886, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 262}, "mem_gb": 21.93}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12780333354215448, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 303}, "mem_gb": 21.99}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21190356762927645, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 380}, "mem_gb": 21.87}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09783557223896495, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 282}, "mem_gb": 21.83}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18497481243492414, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 362}, "mem_gb": 21.84}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1856384761373202, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.1, "frames": {"chat": 307}, "mem_gb": 22.08}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12597426218503777, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 282}, "mem_gb": 21.95}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1817345579418664, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 337}, "mem_gb": 21.98}
|
| 48 |
+
[eval step 30] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11014159770294403, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 275}, "mem_gb": 22.04}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18914651696265986, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 318}, "mem_gb": 21.85}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23652538478126128, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 385}, "mem_gb": 21.87}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23049329001403723, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.6, "frames": {"chat": 316}, "mem_gb": 21.83}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09107681101333971, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 266}, "mem_gb": 22.12}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19664210549537092, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.5, "frames": {"chat": 371}, "mem_gb": 21.85}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10261952416292236, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.6, "frames": {"chat": 262}, "mem_gb": 22.06}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21949122376873467, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.2, "frames": {"chat": 348}, "mem_gb": 21.88}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04237283055443938, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 222}, "mem_gb": 22.12}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1793475973547126, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 75.8, "frames": {"chat": 408}, "mem_gb": 21.68}
|
| 59 |
+
[eval step 40] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17456044655498118, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.5, "frames": {"chat": 334}, "mem_gb": 21.75}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08869157117024686, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1764846066198622, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.0, "frames": {"chat": 352}, "mem_gb": 21.78}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14268789846193977, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 371}, "mem_gb": 21.59}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10607967147635451, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 284}, "mem_gb": 22.04}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07848575267903507, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.396484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 287}, "mem_gb": 22.1}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07426931333943891, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.373046875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 285}, "mem_gb": 22.0}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0474071029479693, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.3203125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 252}, "mem_gb": 22.09}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17111980931263726, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 360}, "mem_gb": 21.88}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19600136266113258, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.5, "frames": {"chat": 359}, "mem_gb": 21.87}
|
| 70 |
+
[eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1808290124348132, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 363}, "mem_gb": 21.63}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14661304474386075, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 361}, "mem_gb": 21.72}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09502901013823381, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 286}, "mem_gb": 21.91}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.188380916898263, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 367}, "mem_gb": 21.76}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19296414749057342, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 352}, "mem_gb": 21.79}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10843863764797958, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.2, "frames": {"chat": 314}, "mem_gb": 21.74}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17145762857797867, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 372}, "mem_gb": 21.71}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13833932032308852, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.3, "frames": {"chat": 334}, "mem_gb": 21.86}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19346887857085093, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 368}, "mem_gb": 21.8}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1387528518877613, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 354}, "mem_gb": 21.95}
|
| 82 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07273584785660107, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.3, "frames": {"chat": 293}, "mem_gb": 21.84}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05641446691872552, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 231}, "mem_gb": 22.0}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14254065000315508, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 302}, "mem_gb": 21.97}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09710669839001881, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.8, "frames": {"chat": 263}, "mem_gb": 22.11}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09882783080255612, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 252}, "mem_gb": 22.04}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14380706306064192, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 344}, "mem_gb": 22.07}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12891555527728826, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 313}, "mem_gb": 22.0}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1599420048183296, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 358}, "mem_gb": 21.7}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07303028860920265, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.365234375, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 267}, "mem_gb": 21.92}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1577588624805988, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 300}, "mem_gb": 21.79}
|
| 93 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12018602301462863, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.455078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 348}, "mem_gb": 21.73}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1682743690628869, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 329}, "mem_gb": 21.81}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10312192343715579, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 269}, "mem_gb": 21.98}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.176240423058051, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 358}, "mem_gb": 21.65}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10181706533844893, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.6, "frames": {"chat": 302}, "mem_gb": 21.9}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18092844381683196, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.0, "frames": {"chat": 381}, "mem_gb": 21.92}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.192465716847172, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 78.7, "frames": {"chat": 379}, "mem_gb": 21.87}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17654183121492775, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 351}, "mem_gb": 21.69}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1458736981579568, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 330}, "mem_gb": 21.89}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15538068436005464, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.1, "frames": {"chat": 316}, "mem_gb": 21.92}
|
| 104 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment '
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10480584769328125, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.1, "frames": {"chat": 276}, "mem_gb": 22.1}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08371606114126431, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 240}, "mem_gb": 22.04}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09988837329157008, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 288}, "mem_gb": 21.95}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09842254393965316, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.8, "frames": {"chat": 271}, "mem_gb": 21.94}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1379458233404594, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 357}, "mem_gb": 21.89}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17790844371654868, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 354}, "mem_gb": 21.86}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1805020492810756, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 302}, "mem_gb": 22.1}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13745868044605788, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 297}, "mem_gb": 22.09}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05132270212679481, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 219}, "mem_gb": 22.11}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1766696895766693, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 306}, "mem_gb": 21.81}
|
| 115 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17392939229660356, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 343}, "mem_gb": 21.75}
|
| 117 |
+
wandb: updating run metadata
|
| 118 |
+
wandb: uploading wandb-summary.json
|
| 119 |
+
wandb:
|
| 120 |
+
wandb: Run history:
|
| 121 |
+
wandb: comp_len β
ββ
β
βββββββββββ
β
ββββββββββββββββββ
βββ
ββ
β
|
| 122 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββββ
β
β
β
β
β
β
β
ββββββββββ
|
| 123 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 124 |
+
wandb: finish_rate βββββ
βββββ
βββ
ββββββββ
βββββββββββββββββββ
|
| 125 |
+
wandb: forward_topk_kl ββββ
ββββββββ
β
ββ
βββββ
βββββ
βββββββ
βββ
ββββ
β
|
| 126 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 127 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 128 |
+
wandb: mem_gb βββββ
βββββββββ
ββββββββββββββββ
βββββ
βββββ
|
| 129 |
+
wandb: step ββββββββββββββββββ
β
β
β
β
β
β
ββββββββββββββββ
|
| 130 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 131 |
+
wandb: +3 ...
|
| 132 |
+
wandb:
|
| 133 |
+
wandb: Run summary:
|
| 134 |
+
wandb: comp_len 349.9
|
| 135 |
+
wandb: cumulative_loss_tokens 10920000
|
| 136 |
+
wandb: epoch 0
|
| 137 |
+
wandb: finish_rate 0.997
|
| 138 |
+
wandb: forward_topk_kl 0.17393
|
| 139 |
+
wandb: grad_norm 0.51953
|
| 140 |
+
wandb: lr 3e-05
|
| 141 |
+
wandb: mem_gb 21.75
|
| 142 |
+
wandb: step 91
|
| 143 |
+
wandb: t_data_s 0
|
| 144 |
+
wandb: +4 ...
|
| 145 |
+
wandb:
|
| 146 |
+
wandb: π View run reap_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/eyetgo3a
|
| 147 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 148 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 149 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260718_224025-eyetgo3a/logs
|
| 150 |
+
Traceback (most recent call last):
|
| 151 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/scripts/11_distill_on_policy.py", line 1099, in <module>
|
| 152 |
+
main()
|
| 153 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/scripts/11_distill_on_policy.py", line 905, in main
|
| 154 |
+
opt.step()
|
| 155 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/optim/lr_scheduler.py", line 166, in wrapper
|
| 156 |
+
return func.__get__(opt, opt.__class__)(*args, **kwargs)
|
| 157 |
+
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
|
| 158 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/optim/optimizer.py", line 535, in wrapper
|
| 159 |
+
out = func(*args, **kwargs)
|
| 160 |
+
^^^^^^^^^^^^^^^^^^^^^
|
| 161 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/utils/_contextlib.py", line 124, in decorate_context
|
| 162 |
+
return func(*args, **kwargs)
|
| 163 |
+
^^^^^^^^^^^^^^^^^^^^^
|
| 164 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/bitsandbytes/optim/optimizer.py", line 329, in step
|
| 165 |
+
sync_gpu(p)
|
| 166 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/bitsandbytes/utils.py", line 203, in sync_gpu
|
| 167 |
+
torch.cuda.synchronize()
|
| 168 |
+
File "/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/torch/cuda/__init__.py", line 1181, in synchronize
|
| 169 |
+
return torch._C._cuda_synchronize()
|
| 170 |
+
^^^^^^^^^^^^^^^^^^^^^^^^^^^^
|
| 171 |
+
torch.AcceleratorError: CUDA error: an illegal memory access was encountered
|
| 172 |
+
Search for `cudaErrorIllegalAddress' in https://docs.nvidia.com/cuda/cuda-runtime-api/group__CUDART__TYPES.html for more information.
|
| 173 |
+
CUDA kernel errors might be asynchronously reported at some other API call, so the stacktrace below might be incorrect.
|
| 174 |
+
For debugging consider passing CUDA_LAUNCH_BLOCKING=1
|
| 175 |
+
Compile with `TORCH_USE_CUDA_DSA` to enable device-side assertions.
|
| 176 |
+
|
| 177 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 178 |
+
warnings.warn('Grouped GEMM not available.')
|
| 179 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 180 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 181 |
+
wandb: setting up run 726qmwib
|
| 182 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 183 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260719_075731-726qmwib
|
| 184 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 185 |
+
wandb: Syncing run reap_keep75_s1225
|
| 186 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 187 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/726qmwib
|
| 188 |
+
|
| 189 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 190 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32691152300952625, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 3.09375, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 331}, "mem_gb": 21.8}
|
| 191 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 192 |
+
[eval step 1] sample: 'To determine how many months it will take for Jamie to reach the savings goal of $1,000,000, we need to consider both the monthly savings and the interest earned.\n\n1. **Initial Savings:**\n - Jamie s'
|
| 193 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3204413974587495, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 3.21875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 342}, "mem_gb": 21.72}
|
| 194 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3277132033892907, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 3.046875, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 358}, "mem_gb": 21.76}
|
| 195 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2655149221446986, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.328125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 344}, "mem_gb": 21.84}
|
| 196 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16589509377960737, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 1.734375, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 267}, "mem_gb": 22.16}
|
| 197 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07710085937269032, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 0.890625, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 248}, "mem_gb": 21.99}
|
| 198 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22985986243913262, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.3359375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 329}, "mem_gb": 21.98}
|
| 199 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23923230728444952, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.265625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 339}, "mem_gb": 21.94}
|
| 200 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24544233199153095, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.5, "frames": {"chat": 354}, "mem_gb": 21.94}
|
| 201 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14266173163352844, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 279}, "mem_gb": 22.07}
|
| 202 |
+
[eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the monthly savings and the interest earned from the investment account.\n\n1. **Initial S'
|
| 203 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17983991835253935, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 318}, "mem_gb": 22.0}
|
| 204 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1222650872319316, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 265}, "mem_gb": 22.09}
|
| 205 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10940296062845736, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 254}, "mem_gb": 22.03}
|
| 206 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1617978121754403, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 315}, "mem_gb": 22.06}
|
| 207 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23280616224833453, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 300}, "mem_gb": 21.86}
|
| 208 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14960211009665703, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 276}, "mem_gb": 22.06}
|
| 209 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23242386436782156, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 356}, "mem_gb": 22.0}
|
| 210 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19974000631744662, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 304}, "mem_gb": 21.81}
|
| 211 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20908848262146737, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.0, "frames": {"chat": 375}, "mem_gb": 21.73}
|
| 212 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11517996143201988, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 294}, "mem_gb": 22.09}
|
| 213 |
+
[eval step 20] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 214 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1984305429960601, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 299}, "mem_gb": 22.1}
|
| 215 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14950802131282787, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 305}, "mem_gb": 21.88}
|
| 216 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09098600198030472, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.4296875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.1, "frames": {"chat": 262}, "mem_gb": 21.93}
|
| 217 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1277543721450027, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.1, "frames": {"chat": 303}, "mem_gb": 21.99}
|
| 218 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21198563021691516, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 380}, "mem_gb": 21.87}
|
| 219 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09757902880194597, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 282}, "mem_gb": 21.83}
|
| 220 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18501614496229837, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 362}, "mem_gb": 21.84}
|
| 221 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1858227088752979, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 307}, "mem_gb": 22.08}
|
| 222 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12581108036795632, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 282}, "mem_gb": 21.95}
|
| 223 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18155879081459717, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 337}, "mem_gb": 21.98}
|
| 224 |
+
[eval step 30] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 225 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11021925988085568, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 275}, "mem_gb": 22.04}
|
| 226 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18907624520876756, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 318}, "mem_gb": 21.85}
|
| 227 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23649629666583302, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 385}, "mem_gb": 21.87}
|
| 228 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23063863416416572, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 316}, "mem_gb": 21.83}
|
| 229 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09021445648100537, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.9, "frames": {"chat": 266}, "mem_gb": 22.12}
|
| 230 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1968003571683541, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 371}, "mem_gb": 21.85}
|
| 231 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10242197343863857, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.2, "frames": {"chat": 262}, "mem_gb": 22.06}
|
| 232 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21980781616549938, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 348}, "mem_gb": 21.88}
|
| 233 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0421492039794568, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 222}, "mem_gb": 22.12}
|
| 234 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17934104606625623, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 73.5, "frames": {"chat": 408}, "mem_gb": 21.68}
|
| 235 |
+
[eval step 40] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n1.'
|
| 236 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1745406913840212, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.1, "frames": {"chat": 334}, "mem_gb": 21.75}
|
| 237 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0887768059037781, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.7, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 238 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1765092570914266, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 352}, "mem_gb": 21.78}
|
| 239 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14278184356411608, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 371}, "mem_gb": 21.59}
|
| 240 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10633178555291767, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.7, "frames": {"chat": 284}, "mem_gb": 22.04}
|
| 241 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07849379130930174, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 287}, "mem_gb": 22.1}
|
| 242 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07412011598904307, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 285}, "mem_gb": 22.0}
|
| 243 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.04752968616990838, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 252}, "mem_gb": 22.09}
|
| 244 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17119333899899697, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 360}, "mem_gb": 21.88}
|
| 245 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19618007138742444, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 359}, "mem_gb": 21.87}
|
| 246 |
+
[eval step 50] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: '
|
| 247 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0050
|
| 248 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18106145054665393, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.3, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 363}, "mem_gb": 21.63}
|
| 249 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1466660416925326, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 361}, "mem_gb": 21.72}
|
| 250 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09496376970338946, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 286}, "mem_gb": 21.91}
|
| 251 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18861636217481767, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.4, "frames": {"chat": 367}, "mem_gb": 21.76}
|
| 252 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1929176153196953, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.2, "frames": {"chat": 352}, "mem_gb": 21.79}
|
| 253 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10857351156738587, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 314}, "mem_gb": 21.74}
|
| 254 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17179327207415676, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 372}, "mem_gb": 21.71}
|
| 255 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13828528916342184, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 334}, "mem_gb": 21.86}
|
| 256 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1934574418642558, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 368}, "mem_gb": 21.8}
|
| 257 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13872208223210958, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.2, "frames": {"chat": 354}, "mem_gb": 21.95}
|
| 258 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 259 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07282470223386772, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.6, "frames": {"chat": 293}, "mem_gb": 21.84}
|
| 260 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05511146459502634, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 231}, "mem_gb": 22.0}
|
| 261 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14260098348222672, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 302}, "mem_gb": 21.97}
|
| 262 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09689047932531684, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.3, "frames": {"chat": 263}, "mem_gb": 22.11}
|
| 263 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09878590247315976, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 252}, "mem_gb": 22.04}
|
| 264 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14381015191225646, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 344}, "mem_gb": 22.07}
|
| 265 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12872717676356746, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.490234375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 313}, "mem_gb": 22.0}
|
| 266 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16005633975585612, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 358}, "mem_gb": 21.7}
|
| 267 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0729602546342571, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.36328125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 267}, "mem_gb": 21.92}
|
| 268 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15748900420886153, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 300}, "mem_gb": 21.79}
|
| 269 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
|
| 270 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1200829417138826, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 348}, "mem_gb": 21.73}
|
| 271 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16852690591571542, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 329}, "mem_gb": 21.81}
|
| 272 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10322219723120021, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.8, "frames": {"chat": 269}, "mem_gb": 21.98}
|
| 273 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.176379284829041, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 358}, "mem_gb": 21.65}
|
| 274 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10208238901442382, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 302}, "mem_gb": 21.9}
|
| 275 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18105531681833478, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 381}, "mem_gb": 21.92}
|
| 276 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19246259786584413, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.4, "frames": {"chat": 379}, "mem_gb": 21.87}
|
| 277 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17693757277773695, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.7, "frames": {"chat": 351}, "mem_gb": 21.69}
|
| 278 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1459769781083179, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 330}, "mem_gb": 21.89}
|
| 279 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15510034691765903, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 316}, "mem_gb": 21.92}
|
| 280 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned from their investment acco'
|
| 281 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10449264020716462, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 276}, "mem_gb": 22.1}
|
| 282 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08365943221724592, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.4, "frames": {"chat": 240}, "mem_gb": 22.04}
|
| 283 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09963281719138226, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.9, "frames": {"chat": 288}, "mem_gb": 21.95}
|
| 284 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09849991907519288, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.47265625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 271}, "mem_gb": 21.94}
|
| 285 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1379186164772138, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.2, "frames": {"chat": 357}, "mem_gb": 21.89}
|
| 286 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17796021613105356, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 354}, "mem_gb": 21.86}
|
| 287 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18031149352506423, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 302}, "mem_gb": 22.1}
|
| 288 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1371509729277032, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.466796875, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.7, "frames": {"chat": 297}, "mem_gb": 22.09}
|
| 289 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.05048233754617783, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 432.7, "frames": {"chat": 219}, "mem_gb": 22.11}
|
| 290 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17669401001554602, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 452.0, "frames": {"chat": 306}, "mem_gb": 21.81}
|
| 291 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 292 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1738818720478875, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 343}, "mem_gb": 21.75}
|
| 293 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16398584036001315, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 341}, "mem_gb": 21.86}
|
| 294 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09698023379047711, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 318}, "mem_gb": 21.81}
|
| 295 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16411329029093807, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.2, "frames": {"chat": 346}, "mem_gb": 21.7}
|
| 296 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09234091526917958, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 277}, "mem_gb": 22.18}
|
| 297 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08427056088553121, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.7, "frames": {"chat": 270}, "mem_gb": 21.91}
|
| 298 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11769790423917584, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 257}, "mem_gb": 22.09}
|
| 299 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1652106897005656, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 363}, "mem_gb": 21.7}
|
| 300 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16613955449733572, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.6, "frames": {"chat": 356}, "mem_gb": 21.83}
|
| 301 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1572983751707788, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.1, "frames": {"chat": 323}, "mem_gb": 21.87}
|
| 302 |
+
[eval step 100] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 303 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0100
|
| 304 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07396288264322405, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.37109375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 243}, "mem_gb": 22.12}
|
| 305 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15377106406676272, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 307}, "mem_gb": 21.8}
|
| 306 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15408880591623794, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.1, "frames": {"chat": 346}, "mem_gb": 22.03}
|
| 307 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10063538956348785, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 273}, "mem_gb": 22.04}
|
| 308 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09539629515723791, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 302}, "mem_gb": 21.97}
|
| 309 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15479961506209025, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.4765625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 337}, "mem_gb": 22.1}
|
| 310 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11479741301567604, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.4, "frames": {"chat": 280}, "mem_gb": 21.97}
|
| 311 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1800875462678106, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.3, "frames": {"chat": 331}, "mem_gb": 21.87}
|
| 312 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1100006240118683, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.5, "frames": {"chat": 314}, "mem_gb": 21.98}
|
| 313 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17935109357194354, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 294}, "mem_gb": 21.91}
|
| 314 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 315 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08094486156906157, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.392578125, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 274}, "mem_gb": 22.04}
|
| 316 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14713477355417173, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.7, "frames": {"chat": 365}, "mem_gb": 21.76}
|
| 317 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09244580864451515, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.388671875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.1, "frames": {"chat": 323}, "mem_gb": 21.82}
|
| 318 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06983842617548071, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 234}, "mem_gb": 22.1}
|
| 319 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09373808058573244, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.4, "frames": {"chat": 267}, "mem_gb": 22.11}
|
| 320 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10429944481253624, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.4, "frames": {"chat": 304}, "mem_gb": 21.87}
|
| 321 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16862349049216135, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 77.0, "frames": {"chat": 373}, "mem_gb": 21.8}
|
| 322 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10003006101381033, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 300}, "mem_gb": 22.08}
|
| 323 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17443383389748632, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.8, "frames": {"chat": 331}, "mem_gb": 21.92}
|
| 324 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0799219426064752, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.4, "frames": {"chat": 259}, "mem_gb": 22.06}
|
| 325 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 326 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1439664171350499, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 358}, "mem_gb": 21.67}
|
| 327 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18628301387413715, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 354}, "mem_gb": 21.93}
|
| 328 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08841487010531128, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.8, "frames": {"chat": 279}, "mem_gb": 22.0}
|
| 329 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17705591263951112, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.6, "frames": {"chat": 354}, "mem_gb": 21.75}
|
| 330 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16324466195267937, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 334}, "mem_gb": 21.95}
|
| 331 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16651589091358085, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 327}, "mem_gb": 21.82}
|
| 332 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15119830299920092, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 365}, "mem_gb": 21.92}
|
| 333 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08960195419403413, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.7, "frames": {"chat": 252}, "mem_gb": 22.12}
|
| 334 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07137346615381539, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.0, "frames": {"chat": 256}, "mem_gb": 22.09}
|
| 335 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10397039002155264, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 302}, "mem_gb": 21.86}
|
| 336 |
+
[eval step 130] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 337 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1565368466370739, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.1, "frames": {"chat": 350}, "mem_gb": 21.77}
|
| 338 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08637186304094115, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.400390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 292}, "mem_gb": 21.89}
|
| 339 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16638688029507176, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.8, "frames": {"chat": 356}, "mem_gb": 21.7}
|
| 340 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10226424861007835, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 347}, "mem_gb": 21.86}
|
| 341 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10496823356381307, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 330}, "mem_gb": 22.06}
|
| 342 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15377609162183167, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.478515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.6, "frames": {"chat": 363}, "mem_gb": 21.92}
|
| 343 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14029487463639428, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 354}, "mem_gb": 21.78}
|
| 344 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07951566191191474, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.37890625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.9, "frames": {"chat": 270}, "mem_gb": 22.04}
|
| 345 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15175273126789057, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.1, "frames": {"chat": 343}, "mem_gb": 21.82}
|
| 346 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03845967609772148, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.296875, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 232}, "mem_gb": 22.01}
|
| 347 |
+
[eval step 140] sample: 'To determine how many months it will take for Jamie to reach their savings goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**'
|
| 348 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14632255258143415, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.470703125, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.0, "frames": {"chat": 346}, "mem_gb": 21.96}
|
| 349 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11298904120076138, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.9, "frames": {"chat": 306}, "mem_gb": 22.04}
|
| 350 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06970870715503891, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.5, "frames": {"chat": 273}, "mem_gb": 22.09}
|
| 351 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08088071228267314, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.36328125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 266}, "mem_gb": 21.91}
|
| 352 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12068498143667045, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 299}, "mem_gb": 22.11}
|
| 353 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07787700651586056, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.0, "frames": {"chat": 259}, "mem_gb": 22.19}
|
| 354 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09737688761447401, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.412109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 325}, "mem_gb": 21.93}
|
| 355 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09278960750096787, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.384765625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 271}, "mem_gb": 22.0}
|
| 356 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.148417767790736, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.45703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 359}, "mem_gb": 21.79}
|
| 357 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13472050697378193, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 345}, "mem_gb": 21.85}
|
| 358 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take for Jamie to reach their savings goal of $1,000,000, considering both their monthly savings and the interest earned from their '
|
| 359 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1225/step0150
|
| 360 |
+
wandb: updating run metadata
|
| 361 |
+
wandb: uploading config.yaml; uploading output.log; uploading wandb-summary.json
|
| 362 |
+
wandb:
|
| 363 |
+
wandb: Run history:
|
| 364 |
+
wandb: comp_len ββββββββ
βββββ
βββββββ
βββββββββ
βββ
ββββββββ
|
| 365 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββββ
β
β
β
β
βββββββββββββ
|
| 366 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 367 |
+
wandb: finish_rate βββββ
βββ
ββββββββββββββββββββ
ββββββββββββ
|
| 368 |
+
wandb: forward_topk_kl ββββ
ββββ
ββββ
ββ
ββ
β
βββββ
β
ββββββ
ββ
ββ
βββββββ
|
| 369 |
+
wandb: grad_norm ββ
βββ
βββββ
ββββββββββ
β
βββββββββββββ
β
ββ
βββ
|
| 370 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 371 |
+
wandb: mem_gb β
β
ββββ
ββββββββββββ
β
ββββββββββ
ββββββ
βββββ
|
| 372 |
+
wandb: step ββββββββββββββββββββββββ
β
β
β
β
β
β
ββββββββββ
|
| 373 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 374 |
+
wandb: +3 ...
|
| 375 |
+
wandb:
|
| 376 |
+
wandb: Run summary:
|
| 377 |
+
wandb: comp_len 347.8
|
| 378 |
+
wandb: cumulative_loss_tokens 18000000
|
| 379 |
+
wandb: epoch 0
|
| 380 |
+
wandb: finish_rate 0.997
|
| 381 |
+
wandb: forward_topk_kl 0.13472
|
| 382 |
+
wandb: grad_norm 0.44531
|
| 383 |
+
wandb: lr 3e-05
|
| 384 |
+
wandb: mem_gb 21.85
|
| 385 |
+
wandb: step 150
|
| 386 |
+
wandb: t_data_s 0
|
| 387 |
+
wandb: +4 ...
|
| 388 |
+
wandb:
|
| 389 |
+
wandb: π View run reap_keep75_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/726qmwib
|
| 390 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 391 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 392 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1225/wandb/run-20260719_075731-726qmwib/logs
|
healed/grid_general/reap_keep75_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/reap_keep75_s1226.console.log
ADDED
|
@@ -0,0 +1,215 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/reap_keep75_s1226/wandb/run-20260718_222421-e1pary2f
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run reap_keep75_s1226
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/e1pary2f
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 5.31B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.21339355171055843, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 2.484375, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 308}, "mem_gb": 21.9}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'to solve the problem, we start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term after the first is the sum of the previous term and a constant difference'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08570967371991525, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 1.828125, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 211}, "mem_gb": 22.09}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15798813338739176, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 1.859375, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.4, "frames": {"chat": 281}, "mem_gb": 22.09}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28115320148520795, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 2.328125, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.9, "frames": {"chat": 367}, "mem_gb": 21.64}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2748614232963572, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 2.125, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.9, "frames": {"chat": 312}, "mem_gb": 21.8}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20843626715947564, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 1.5859375, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 271}, "mem_gb": 22.11}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13717436392015467, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 1.046875, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.7, "frames": {"chat": 269}, "mem_gb": 22.08}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23247054230508704, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.1640625, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.8, "frames": {"chat": 352}, "mem_gb": 21.6}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09589892327293444, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 243}, "mem_gb": 22.09}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16148524984003354, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 293}, "mem_gb": 22.01}
|
| 25 |
+
[eval step 10] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as 'd' to the previous "
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09165873881246274, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 242}, "mem_gb": 22.09}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23489283894393592, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 353}, "mem_gb": 21.78}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24218674629465678, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 338}, "mem_gb": 21.79}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10968186240528399, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 259}, "mem_gb": 22.09}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20747447708491237, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.2, "frames": {"chat": 385}, "mem_gb": 21.64}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19886801433678095, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.7, "frames": {"chat": 355}, "mem_gb": 21.8}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16934168874891475, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 328}, "mem_gb": 21.71}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18825231397490327, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.7, "frames": {"chat": 355}, "mem_gb": 21.86}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23047101900981118, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.4, "frames": {"chat": 367}, "mem_gb": 21.73}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1967306533376376, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 343}, "mem_gb": 21.77}
|
| 36 |
+
[eval step 20] sample: "to solve the problem, let's first understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the previous t"
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07757113480734018, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 244}, "mem_gb": 22.09}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12775906186740224, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.6, "frames": {"chat": 339}, "mem_gb": 21.93}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12339796086361943, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 298}, "mem_gb": 22.08}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1888264758167478, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 398}, "mem_gb": 21.95}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16893158456018814, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 362}, "mem_gb": 22.06}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11852987345949126, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.6, "frames": {"chat": 313}, "mem_gb": 21.93}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19280489345251892, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 324}, "mem_gb": 21.84}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13332238358338364, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 314}, "mem_gb": 21.9}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17708334889138738, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 345}, "mem_gb": 21.82}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10290615278265129, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 262}, "mem_gb": 22.0}
|
| 47 |
+
[eval step 30] sample: "to solve the problem, let's start by understanding the properties of an arithmetic sequence. in an arithmetic sequence, each term is obtained by adding a constant difference, denoted as d, to the prev"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2178021610117207, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.6, "frames": {"chat": 373}, "mem_gb": 21.79}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17037619132616869, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 334}, "mem_gb": 21.79}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12282716621927296, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.453125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 327}, "mem_gb": 21.94}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03687003609900518, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 238}, "mem_gb": 22.11}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15524751814192472, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 310}, "mem_gb": 21.84}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18105133875377166, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.3, "frames": {"chat": 347}, "mem_gb": 21.84}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1646992900542294, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 304}, "mem_gb": 21.77}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.159970140185114, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 343}, "mem_gb": 21.79}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18663683338764434, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 314}, "mem_gb": 21.78}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16988412837162614, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.4, "frames": {"chat": 300}, "mem_gb": 21.88}
|
| 58 |
+
[eval step 40] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13071964375670067, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.46484375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 318}, "mem_gb": 21.93}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10204326672830308, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.4609375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 279}, "mem_gb": 21.96}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1806036195647282, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 364}, "mem_gb": 22.03}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12377153321631873, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.6, "frames": {"chat": 256}, "mem_gb": 22.09}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22053155760841134, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.4, "frames": {"chat": 340}, "mem_gb": 21.8}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09844875509299648, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.5, "frames": {"chat": 283}, "mem_gb": 22.02}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17452649503555148, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 349}, "mem_gb": 21.81}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09820603294240621, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.408203125, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.2, "frames": {"chat": 297}, "mem_gb": 21.88}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2192861270866512, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.7, "frames": {"chat": 359}, "mem_gb": 21.85}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1297758882647846, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 342}, "mem_gb": 21.9}
|
| 69 |
+
[eval step 50] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term of an arithmetic sequence is given "
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08983801361528847, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 269}, "mem_gb": 22.06}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13292347453905579, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 324}, "mem_gb": 22.05}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1078397901494056, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.4453125, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 281}, "mem_gb": 22.04}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12415957074062899, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 287}, "mem_gb": 22.09}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14848729074448347, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 296}, "mem_gb": 22.1}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09668254272442621, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.5, "frames": {"chat": 267}, "mem_gb": 22.15}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10191790316258557, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.443359375, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.2, "frames": {"chat": 249}, "mem_gb": 22.05}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20133889614247408, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.6, "frames": {"chat": 363}, "mem_gb": 21.75}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11543285792957371, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.41796875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 299}, "mem_gb": 21.88}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17723260801960714, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.4, "frames": {"chat": 331}, "mem_gb": 21.76}
|
| 81 |
+
[eval step 60] sample: "to solve the problem, let's start by expressing the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nin an arithmetic sequence, the \\(n\\)-th term \\"
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09029280027657126, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.5, "frames": {"chat": 280}, "mem_gb": 21.97}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1855729695724634, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 350}, "mem_gb": 21.96}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17494222469696155, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 321}, "mem_gb": 21.72}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08138270763379987, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.7, "frames": {"chat": 281}, "mem_gb": 22.02}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19231459852407376, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.5, "frames": {"chat": 331}, "mem_gb": 21.7}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14845991262866495, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 318}, "mem_gb": 22.07}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11320564163395513, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 309}, "mem_gb": 22.09}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12363248293256619, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.4140625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 304}, "mem_gb": 21.98}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07999568365996237, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.0, "frames": {"chat": 279}, "mem_gb": 22.0}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.035355653623794205, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.322265625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 248}, "mem_gb": 22.0}
|
| 92 |
+
[eval step 70] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13093761252564534, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.6, "frames": {"chat": 268}, "mem_gb": 21.97}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13084131622950082, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 299}, "mem_gb": 22.07}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15114655604578245, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 322}, "mem_gb": 21.93}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07716252460344694, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.3515625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.1, "frames": {"chat": 248}, "mem_gb": 22.11}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13525091139217063, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.0, "frames": {"chat": 326}, "mem_gb": 22.0}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.12427869928680982, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 314}, "mem_gb": 21.76}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03455742899927621, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.34765625, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 232}, "mem_gb": 22.1}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1846243053221299, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 330}, "mem_gb": 21.83}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09233185301547249, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.8, "frames": {"chat": 292}, "mem_gb": 21.98}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14634254051093787, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.7, "frames": {"chat": 312}, "mem_gb": 22.0}
|
| 103 |
+
[eval step 80] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2008646516823365, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.8, "frames": {"chat": 382}, "mem_gb": 21.81}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2060785713472093, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.2, "frames": {"chat": 360}, "mem_gb": 21.68}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.028743446196095708, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.27734375, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 222}, "mem_gb": 21.94}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1851775901362921, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.9, "frames": {"chat": 342}, "mem_gb": 21.99}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17315657157028716, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.2, "frames": {"chat": 337}, "mem_gb": 21.79}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10658308911252146, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.0, "frames": {"chat": 304}, "mem_gb": 22.04}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11648266767509437, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.0, "frames": {"chat": 326}, "mem_gb": 21.94}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15414538710528675, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.6, "frames": {"chat": 310}, "mem_gb": 22.0}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1451933480039394, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.4921875, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 328}, "mem_gb": 21.82}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1895755969556359, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 347}, "mem_gb": 21.65}
|
| 114 |
+
[eval step 90] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe general term \\(a_n\\) of an arithmetic sequence i"
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15673857571422123, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 330}, "mem_gb": 21.94}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.03880907623837702, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.3203125, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 209}, "mem_gb": 22.14}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17243695646196913, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.2, "frames": {"chat": 399}, "mem_gb": 21.72}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15324395594488208, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.7, "frames": {"chat": 351}, "mem_gb": 21.8}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10666468353889262, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 322}, "mem_gb": 21.8}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1611110176460507, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 333}, "mem_gb": 21.69}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1268739534505798, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.44921875, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 330}, "mem_gb": 21.97}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.02843061860909996, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.26953125, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 238}, "mem_gb": 22.01}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0764691783014064, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.369140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 297}, "mem_gb": 21.92}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15686011528218322, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 345}, "mem_gb": 21.88}
|
| 125 |
+
[eval step 100] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11419236063311497, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.435546875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 304}, "mem_gb": 22.03}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14519470161789408, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.474609375, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.2, "frames": {"chat": 326}, "mem_gb": 22.03}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16841031535008613, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 347}, "mem_gb": 21.96}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1541788148588113, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 325}, "mem_gb": 21.84}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09568467679819248, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.44140625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.8, "frames": {"chat": 299}, "mem_gb": 22.03}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1954670337013318, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.9, "frames": {"chat": 345}, "mem_gb": 21.8}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15920826774354402, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 344}, "mem_gb": 21.7}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11787689346734745, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.42578125, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 344}, "mem_gb": 21.96}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.11341061721870986, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.421875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.5, "frames": {"chat": 288}, "mem_gb": 22.03}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10040821242108165, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.40234375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.1, "frames": {"chat": 303}, "mem_gb": 21.73}
|
| 137 |
+
[eval step 110] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.07638031504630732, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.390625, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 284}, "mem_gb": 21.92}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18989112039782727, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 76.6, "frames": {"chat": 369}, "mem_gb": 21.81}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08842680087072465, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.3, "frames": {"chat": 269}, "mem_gb": 22.07}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16966252027726733, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.3, "frames": {"chat": 341}, "mem_gb": 21.83}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16082782854254668, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.9, "frames": {"chat": 384}, "mem_gb": 21.6}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14551100756071197, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.5, "frames": {"chat": 358}, "mem_gb": 21.76}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16481925481576473, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.6, "frames": {"chat": 342}, "mem_gb": 21.94}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18291292693126016, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.3, "frames": {"chat": 365}, "mem_gb": 21.76}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15789786164620892, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.0, "frames": {"chat": 337}, "mem_gb": 21.99}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1396825625940226, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.462890625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 71.5, "frames": {"chat": 333}, "mem_gb": 22.09}
|
| 148 |
+
[eval step 120] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09663339759473068, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.423828125, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 72.1, "frames": {"chat": 293}, "mem_gb": 22.13}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08743804314477215, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.3828125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.4, "frames": {"chat": 291}, "mem_gb": 21.89}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1487297839136018, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.486328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 341}, "mem_gb": 21.92}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09316545087745569, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.431640625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 300}, "mem_gb": 21.86}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08440170214573542, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.8, "frames": {"chat": 270}, "mem_gb": 22.08}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06541701220278628, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.349609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.4, "frames": {"chat": 259}, "mem_gb": 22.1}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15731950736865402, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 74.9, "frames": {"chat": 355}, "mem_gb": 21.67}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.185189329845272, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.5, "frames": {"chat": 388}, "mem_gb": 22.03}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15172325409349674, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 70.8, "frames": {"chat": 318}, "mem_gb": 21.75}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1692313569753586, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 79.1, "frames": {"chat": 383}, "mem_gb": 21.88}
|
| 159 |
+
[eval step 130] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09437454479509809, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.404296875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.7, "frames": {"chat": 300}, "mem_gb": 21.89}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08504273481372122, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.375, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 295}, "mem_gb": 21.98}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08973973676030679, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 306}, "mem_gb": 21.72}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13043954259552992, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.4, "frames": {"chat": 303}, "mem_gb": 21.97}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06347171953148209, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.345703125, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.1, "frames": {"chat": 272}, "mem_gb": 22.04}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.09128343445532955, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.3984375, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.8, "frames": {"chat": 248}, "mem_gb": 22.04}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.10043286757688039, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.416015625, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 282}, "mem_gb": 22.03}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15493765193327952, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.8, "frames": {"chat": 362}, "mem_gb": 21.59}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16514440122226565, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 80.6, "frames": {"chat": 374}, "mem_gb": 21.95}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08445933128128139, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.40625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.4, "frames": {"chat": 280}, "mem_gb": 22.12}
|
| 170 |
+
[eval step 140] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06675967077338137, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.376953125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 276}, "mem_gb": 21.97}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.0885775870092834, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.38671875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.5, "frames": {"chat": 246}, "mem_gb": 22.11}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.18335347756737222, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.0, "frames": {"chat": 360}, "mem_gb": 21.64}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.17761860483808753, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.4, "frames": {"chat": 365}, "mem_gb": 21.82}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1455773277927966, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.427734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.6, "frames": {"chat": 338}, "mem_gb": 21.9}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.06648420962695964, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 276}, "mem_gb": 22.01}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.036196198924879235, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.330078125, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 209}, "mem_gb": 22.09}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14141823298179854, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 75.7, "frames": {"chat": 379}, "mem_gb": 21.69}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.13381415352725112, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.9, "frames": {"chat": 307}, "mem_gb": 22.03}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.08819010019679553, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.41015625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 293}, "mem_gb": 22.07}
|
| 181 |
+
[eval step 150] sample: "to solve the problem, let's first express the terms of the arithmetic sequence in terms of the first term \\(a_1\\) and the common difference \\(d\\).\n\nthe \\(n\\)-th term of an arithmetic sequence is given"
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/reap_keep75_s1226/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading summary
|
| 185 |
+
wandb:
|
| 186 |
+
wandb: Run history:
|
| 187 |
+
wandb: comp_len ββ
ββββββββββββββ
βββββ
ββββββββββ
βββββββββ
|
| 188 |
+
wandb: cumulative_loss_tokens ββββββββββββββββββββββββββ
β
βββββββββββββ
|
| 189 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: finish_rate β
ββββββββββ
βββββββββββββββββββ
ββββββββββ
|
| 191 |
+
wandb: forward_topk_kl βββββ
βββ
ββ
βββ
βββββ
ββββββββββββ
ββ
ββββ
β
βββ
|
| 192 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: lr ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: mem_gb βββββ
ββββββββββββββββββββββ
ββββ
βββ
β
β
ββββ
|
| 195 |
+
wandb: step βββββββββββββββββββββ
β
β
β
ββββββββββββββββ
|
| 196 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: +3 ...
|
| 198 |
+
wandb:
|
| 199 |
+
wandb: Run summary:
|
| 200 |
+
wandb: comp_len 409.6
|
| 201 |
+
wandb: cumulative_loss_tokens 18000000
|
| 202 |
+
wandb: epoch 0
|
| 203 |
+
wandb: finish_rate 0.942
|
| 204 |
+
wandb: forward_topk_kl 0.08819
|
| 205 |
+
wandb: grad_norm 0.41016
|
| 206 |
+
wandb: lr 3e-05
|
| 207 |
+
wandb: mem_gb 22.07
|
| 208 |
+
wandb: step 150
|
| 209 |
+
wandb: t_data_s 0
|
| 210 |
+
wandb: +4 ...
|
| 211 |
+
wandb:
|
| 212 |
+
wandb: π View run reap_keep75_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/e1pary2f
|
| 213 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 214 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 215 |
+
wandb: Find logs at: outputs/healed/grid_general/reap_keep75_s1226/wandb/run-20260718_222421-e1pary2f/logs
|
healed/grid_general/reap_keep75_s1226.eval.log
ADDED
|
@@ -0,0 +1,71 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 0 |
0%| | 0/1319 [00:00<?, ?it/s]
|
| 1 |
14%|ββ | 190/1319 [00:00<00:00, 1898.35it/s]
|
| 2 |
29%|βββ | 385/1319 [00:00<00:00, 1927.09it/s]
|
| 3 |
44%|βββββ | 580/1319 [00:00<00:00, 1936.55it/s]
|
| 4 |
59%|ββββββ | 776/1319 [00:00<00:00, 1942.22it/s]
|
| 5 |
74%|ββββββββ | 972/1319 [00:00<00:00, 1948.34it/s]
|
| 6 |
89%|βββββββββ | 1168/1319 [00:00<00:00, 1949.98it/s]
|
|
|
|
|
|
|
| 7 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 8 |
8%|β | 42/500 [00:00<00:01, 410.77it/s]
|
| 9 |
17%|ββ | 84/500 [00:00<00:01, 415.71it/s]
|
| 10 |
25%|βββ | 127/500 [00:00<00:00, 418.02it/s]
|
| 11 |
34%|ββββ | 170/500 [00:00<00:00, 419.88it/s]
|
| 12 |
43%|βββββ | 213/500 [00:00<00:00, 421.19it/s]
|
| 13 |
51%|βββββ | 256/500 [00:00<00:00, 422.45it/s]
|
| 14 |
60%|ββββββ | 299/500 [00:00<00:00, 423.30it/s]
|
| 15 |
68%|βββββββ | 342/500 [00:00<00:00, 424.03it/s]
|
| 16 |
77%|ββββββββ | 385/500 [00:00<00:00, 425.22it/s]
|
| 17 |
86%|βββββββββ | 428/500 [00:01<00:00, 425.80it/s]
|
| 18 |
94%|ββββββββββ| 471/500 [00:01<00:00, 426.57it/s]
|
|
|
|
|
|
|
| 19 |
0%| | 0/541 [00:00<?, ?it/s]
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 20 |
0%| | 0/164 [00:00<?, ?it/s]
|
| 21 |
89%|βββββββββ | 146/164 [00:00<00:00, 1459.75it/s]
|
|
|
|
|
|
|
| 22 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 23 |
3%|β | 17/500 [00:00<00:02, 161.95it/s]
|
| 24 |
7%|β | 34/500 [00:00<00:02, 163.46it/s]
|
| 25 |
10%|β | 51/500 [00:00<00:02, 164.02it/s]
|
| 26 |
14%|ββ | 68/500 [00:00<00:02, 164.36it/s]
|
| 27 |
17%|ββ | 85/500 [00:00<00:02, 164.64it/s]
|
| 28 |
20%|ββ | 102/500 [00:00<00:02, 164.98it/s]
|
| 29 |
24%|βββ | 119/500 [00:00<00:02, 165.17it/s]
|
| 30 |
27%|βββ | 136/500 [00:00<00:02, 164.40it/s]
|
| 31 |
31%|βββ | 153/500 [00:00<00:02, 164.81it/s]
|
| 32 |
34%|ββββ | 170/500 [00:01<00:01, 165.18it/s]
|
| 33 |
37%|ββββ | 187/500 [00:01<00:01, 165.53it/s]
|
| 34 |
41%|ββββ | 204/500 [00:01<00:01, 165.67it/s]
|
| 35 |
44%|βββββ | 221/500 [00:01<00:01, 165.77it/s]
|
| 36 |
48%|βββββ | 238/500 [00:01<00:01, 165.84it/s]
|
| 37 |
51%|βββββ | 255/500 [00:01<00:01, 165.90it/s]
|
| 38 |
54%|ββββββ | 272/500 [00:01<00:01, 166.13it/s]
|
| 39 |
58%|ββββββ | 289/500 [00:01<00:01, 166.25it/s]
|
| 40 |
61%|ββββββ | 306/500 [00:01<00:01, 166.20it/s]
|
| 41 |
65%|βββββββ | 323/500 [00:01<00:01, 166.33it/s]
|
| 42 |
68%|βββββββ | 340/500 [00:02<00:00, 166.42it/s]
|
| 43 |
71%|ββββββββ | 357/500 [00:02<00:00, 166.47it/s]
|
| 44 |
75%|ββββββββ | 374/500 [00:02<00:00, 166.52it/s]
|
| 45 |
78%|ββββββββ | 391/500 [00:02<00:00, 166.41it/s]
|
| 46 |
82%|βββββββββ | 408/500 [00:02<00:00, 166.43it/s]
|
| 47 |
85%|βββββββββ | 425/500 [00:02<00:00, 166.38it/s]
|
| 48 |
88%|βββββββββ | 442/500 [00:02<00:00, 166.50it/s]
|
| 49 |
92%|ββββββββββ| 459/500 [00:02<00:00, 166.52it/s]
|
| 50 |
95%|ββββββββββ| 476/500 [00:02<00:00, 166.41it/s]
|
| 51 |
99%|βββββββββοΏ½οΏ½| 493/500 [00:02<00:00, 166.52it/s]
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
2026-07-19T01:12:55-07:00 serving outputs/healed/grid_general/reap_keep75_s1226/step0150 on GPU 1 port 8421
|
| 2 |
+
2026-07-19T01:12:55-07:00 waiting for server /health ...
|
| 3 |
+
2026-07-19T01:13:25-07:00 server up; chat pass [gsm8k_cot_zeroshot,minerva_math500,ifeval]
|
| 4 |
+
2026-07-19:01:13:33 INFO [_cli.run:388] Selected Tasks: ['gsm8k_cot_zeroshot', 'minerva_math500', 'ifeval']
|
| 5 |
+
2026-07-19:01:13:34 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
|
| 6 |
+
2026-07-19:01:13:34 WARNING [evaluator:226] generation_kwargs: {'max_gen_toks': 1280} specified through cli, these settings will update set parameters in yaml tasks. Ensure 'do_sample=True' for non-greedy decoding!
|
| 7 |
+
2026-07-19:01:13:34 INFO [evaluator:239] Initializing local-chat-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
|
| 8 |
+
2026-07-19:01:13:34 INFO [models.api_models:179] Using max length 2048 - 1
|
| 9 |
+
2026-07-19:01:13:34 INFO [models.api_models:200] Using tokenizer None
|
| 10 |
+
2026-07-19:01:13:39 INFO [evaluator_utils:446] Selected tasks:
|
| 11 |
+
2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: gsm8k_cot_zeroshot (gsm8k/gsm8k-cot-zeroshot.yaml)
|
| 12 |
+
2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: ifeval (ifeval/ifeval.yaml)
|
| 13 |
+
2026-07-19:01:13:39 INFO [evaluator_utils:480] Task: minerva_math500 (minerva_math/minerva_math500.yaml)
|
| 14 |
+
2026-07-19:01:13:39 INFO [evaluator:314] gsm8k_cot_zeroshot: Using gen_kwargs: {'until': ['Q:', '</s>', '<|im_end|>'], 'do_sample': False, 'max_gen_toks': 1280}
|
| 15 |
+
2026-07-19:01:13:39 INFO [evaluator:314] minerva_math500: Using gen_kwargs: {'until': ['Problem:'], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
|
| 16 |
+
2026-07-19:01:13:39 INFO [evaluator:314] ifeval: Using gen_kwargs: {'until': [], 'do_sample': False, 'temperature': 0.0, 'max_gen_toks': 1280}
|
| 17 |
+
2026-07-19:01:13:39 INFO [api.task:312] Building contexts for gsm8k_cot_zeroshot on rank 0...
|
| 18 |
+
|
| 19 |
0%| | 0/1319 [00:00<?, ?it/s]
|
| 20 |
14%|ββ | 190/1319 [00:00<00:00, 1898.35it/s]
|
| 21 |
29%|βββ | 385/1319 [00:00<00:00, 1927.09it/s]
|
| 22 |
44%|βββββ | 580/1319 [00:00<00:00, 1936.55it/s]
|
| 23 |
59%|ββββββ | 776/1319 [00:00<00:00, 1942.22it/s]
|
| 24 |
74%|ββββββββ | 972/1319 [00:00<00:00, 1948.34it/s]
|
| 25 |
89%|βββββββββ | 1168/1319 [00:00<00:00, 1949.98it/s]
|
| 26 |
+
2026-07-19:01:13:40 INFO [api.task:312] Building contexts for minerva_math500 on rank 0...
|
| 27 |
+
|
| 28 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 29 |
8%|β | 42/500 [00:00<00:01, 410.77it/s]
|
| 30 |
17%|ββ | 84/500 [00:00<00:01, 415.71it/s]
|
| 31 |
25%|βββ | 127/500 [00:00<00:00, 418.02it/s]
|
| 32 |
34%|ββββ | 170/500 [00:00<00:00, 419.88it/s]
|
| 33 |
43%|βββββ | 213/500 [00:00<00:00, 421.19it/s]
|
| 34 |
51%|βββββ | 256/500 [00:00<00:00, 422.45it/s]
|
| 35 |
60%|ββββββ | 299/500 [00:00<00:00, 423.30it/s]
|
| 36 |
68%|βββββββ | 342/500 [00:00<00:00, 424.03it/s]
|
| 37 |
77%|ββββββββ | 385/500 [00:00<00:00, 425.22it/s]
|
| 38 |
86%|βββββββββ | 428/500 [00:01<00:00, 425.80it/s]
|
| 39 |
94%|ββββββββββ| 471/500 [00:01<00:00, 426.57it/s]
|
| 40 |
+
2026-07-19:01:13:41 INFO [api.task:312] Building contexts for ifeval on rank 0...
|
| 41 |
+
|
| 42 |
0%| | 0/541 [00:00<?, ?it/s]
|
| 43 |
+
2026-07-19:01:13:41 INFO [evaluator:585] Running generate_until requests
|
| 44 |
+
2026-07-19:01:13:41 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
|
| 45 |
+
|
| 46 |
+
|
| 47 |
+
|
| 48 |
+
2026-07-19:01:19:00 ERROR [tasks.ifeval.instructions:189] Unable to detect language for text ****** due to No features in text.
|
| 49 |
+
2026-07-19:01:19:02 INFO [loggers.evaluation_tracker:247] Saving results aggregated
|
| 50 |
+
2026-07-19:01:19:02 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep75_s1226/student/*.jsonl
|
| 51 |
+
local-chat-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/chat/completions', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({'max_gen_toks': 1280}), limit: None, num_fewshot: None, batch_size: 1
|
| 52 |
+
| Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
|
| 53 |
+
|------------------|------:|----------------|-----:|-----------------------|---|-----:|---|------|
|
| 54 |
+
|gsm8k_cot_zeroshot| 3|flexible-extract| 0|exact_match |β |0.6687|Β± |0.0130|
|
| 55 |
+
| | |strict-match | 0|exact_match |β |0.0417|Β± |0.0055|
|
| 56 |
+
|ifeval | 4|none | 0|inst_level_loose_acc |β |0.7374|Β± | N/A|
|
| 57 |
+
| | |none | 0|inst_level_strict_acc |β |0.7110|Β± | N/A|
|
| 58 |
+
| | |none | 0|prompt_level_loose_acc |β |0.6322|Β± |0.0208|
|
| 59 |
+
| | |none | 0|prompt_level_strict_acc|β |0.6063|Β± |0.0210|
|
| 60 |
+
|minerva_math500 | 3|none | 4|exact_match |β |0.1380|Β± |0.0154|
|
| 61 |
+
| | |none | 4|math_verify |β |0.2180|Β± |0.0185|
|
| 62 |
+
|
| 63 |
+
2026-07-19T01:19:04-07:00 code pass [humaneval,mbpp] via /v1/completions (function-continuation)
|
| 64 |
+
2026-07-19:01:19:11 INFO [_cli.run:388] Selected Tasks: ['humaneval', 'mbpp']
|
| 65 |
+
2026-07-19:01:19:12 INFO [evaluator:214] Setting random seed to 0 | Setting numpy seed to 1234 | Setting torch manual seed to 1234 | Setting fewshot manual seed to 1234
|
| 66 |
+
2026-07-19:01:19:12 INFO [evaluator:239] Initializing local-completions model, with arguments: {'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep75_s1226/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}
|
| 67 |
+
2026-07-19:01:19:12 INFO [models.openai_completions:42] Remote tokenizer not supported. Using huggingface tokenizer backend.
|
| 68 |
+
2026-07-19:01:19:12 INFO [models.api_models:179] Using max length 2048 - 1
|
| 69 |
+
2026-07-19:01:19:12 INFO [models.api_models:200] Using tokenizer huggingface
|
| 70 |
+
2026-07-19:01:19:18 INFO [evaluator_utils:446] Selected tasks:
|
| 71 |
+
2026-07-19:01:19:18 INFO [evaluator_utils:480] Task: humaneval (humaneval/humaneval.yaml)
|
| 72 |
+
2026-07-19:01:19:18 INFO [evaluator_utils:480] Task: mbpp (mbpp/mbpp.yaml)
|
| 73 |
+
2026-07-19:01:19:18 INFO [evaluator:314] humaneval: Using gen_kwargs: {'until': ['\nclass', '\ndef', '\n#', '\nif', '\nprint'], 'max_gen_toks': 1024, 'do_sample': False}
|
| 74 |
+
2026-07-19:01:19:18 INFO [evaluator:314] mbpp: Using gen_kwargs: {'until': ['[DONE]'], 'do_sample': False}
|
| 75 |
+
2026-07-19:01:19:18 INFO [api.task:312] Building contexts for humaneval on rank 0...
|
| 76 |
+
|
| 77 |
0%| | 0/164 [00:00<?, ?it/s]
|
| 78 |
89%|βββββββββ | 146/164 [00:00<00:00, 1459.75it/s]
|
| 79 |
+
2026-07-19:01:19:19 INFO [api.task:312] Building contexts for mbpp on rank 0...
|
| 80 |
+
|
| 81 |
0%| | 0/500 [00:00<?, ?it/s]
|
| 82 |
3%|β | 17/500 [00:00<00:02, 161.95it/s]
|
| 83 |
7%|β | 34/500 [00:00<00:02, 163.46it/s]
|
| 84 |
10%|β | 51/500 [00:00<00:02, 164.02it/s]
|
| 85 |
14%|ββ | 68/500 [00:00<00:02, 164.36it/s]
|
| 86 |
17%|ββ | 85/500 [00:00<00:02, 164.64it/s]
|
| 87 |
20%|ββ | 102/500 [00:00<00:02, 164.98it/s]
|
| 88 |
24%|βββ | 119/500 [00:00<00:02, 165.17it/s]
|
| 89 |
27%|βββ | 136/500 [00:00<00:02, 164.40it/s]
|
| 90 |
31%|βββ | 153/500 [00:00<00:02, 164.81it/s]
|
| 91 |
34%|ββββ | 170/500 [00:01<00:01, 165.18it/s]
|
| 92 |
37%|ββββ | 187/500 [00:01<00:01, 165.53it/s]
|
| 93 |
41%|ββββ | 204/500 [00:01<00:01, 165.67it/s]
|
| 94 |
44%|βββββ | 221/500 [00:01<00:01, 165.77it/s]
|
| 95 |
48%|βββββ | 238/500 [00:01<00:01, 165.84it/s]
|
| 96 |
51%|βββββ | 255/500 [00:01<00:01, 165.90it/s]
|
| 97 |
54%|ββββββ | 272/500 [00:01<00:01, 166.13it/s]
|
| 98 |
58%|ββββββ | 289/500 [00:01<00:01, 166.25it/s]
|
| 99 |
61%|ββββββ | 306/500 [00:01<00:01, 166.20it/s]
|
| 100 |
65%|βββββββ | 323/500 [00:01<00:01, 166.33it/s]
|
| 101 |
68%|βββββββ | 340/500 [00:02<00:00, 166.42it/s]
|
| 102 |
71%|ββββββββ | 357/500 [00:02<00:00, 166.47it/s]
|
| 103 |
75%|ββββββββ | 374/500 [00:02<00:00, 166.52it/s]
|
| 104 |
78%|ββββββββ | 391/500 [00:02<00:00, 166.41it/s]
|
| 105 |
82%|βββββββββ | 408/500 [00:02<00:00, 166.43it/s]
|
| 106 |
85%|βββββββββ | 425/500 [00:02<00:00, 166.38it/s]
|
| 107 |
88%|βββββββββ | 442/500 [00:02<00:00, 166.50it/s]
|
| 108 |
92%|ββββββββββ| 459/500 [00:02<00:00, 166.52it/s]
|
| 109 |
95%|ββββββββββ| 476/500 [00:02<00:00, 166.41it/s]
|
| 110 |
99%|βββββββββοΏ½οΏ½| 493/500 [00:02<00:00, 166.52it/s]
|
| 111 |
+
2026-07-19:01:19:22 INFO [evaluator:585] Running generate_until requests
|
| 112 |
+
2026-07-19:01:19:22 INFO [models.api_models:747] Tokenized requests are disabled. Context + generation length is not checked.
|
| 113 |
+
|
| 114 |
+
|
| 115 |
+
2026-07-19:01:22:04 INFO [loggers.evaluation_tracker:247] Saving results aggregated
|
| 116 |
+
2026-07-19:01:22:04 INFO [loggers.evaluation_tracker:119] Saving per-task samples to outputs/evals/general_suite/healed/reap_keep75_s1226/student/*.jsonl
|
| 117 |
+
local-completions ({'model': 'student', 'base_url': 'http://127.0.0.1:8421/v1/completions', 'tokenizer': 'outputs/healed/grid_general/reap_keep75_s1226/step0150', 'num_concurrent': 48, 'tokenized_requests': False, 'max_retries': 3}), gen_kwargs: ({}), limit: None, num_fewshot: None, batch_size: 1
|
| 118 |
+
| Tasks |Version| Filter |n-shot| Metric | |Value | |Stderr|
|
| 119 |
+
|---------|------:|-----------|-----:|---------|---|-----:|---|-----:|
|
| 120 |
+
|humaneval| 1|create_test| 0|pass@1 |β |0.3232|Β± |0.0366|
|
| 121 |
+
|mbpp | 1|none | 3|pass_at_1|β |0.2680|Β± |0.0198|
|
| 122 |
+
|
| 123 |
+
2026-07-19T01:22:05-07:00 lm_eval exit=0 -> outputs/evals/general_suite/healed/reap_keep75_s1226
|
healed/grid_general/uniform_keep25_s1224.console.log
ADDED
|
@@ -0,0 +1,212 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1224/wandb/run-20260717_174601-ig8p922u
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run uniform_keep25_s1224
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/ig8p922u
|
| 11 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 12 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.562714012611409, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 14.0625, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 259}, "mem_gb": 9.93}
|
| 13 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 14 |
+
[eval step 1] sample: 'To solve the problem, we first treat the matrix as follows:\n\n\\[ [12, -16, 4, 16] \\]\n\\[ [-9, 11, -1, -10] \\]\n\\[ [0, 1, -2, -8] \\]\n\nNext, we treat'
|
| 15 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.007942330916723, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 18.125, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 348}, "mem_gb": 9.59}
|
| 16 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8284729678712786, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 14.9375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 370}, "mem_gb": 9.74}
|
| 17 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.139117633214593, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 9.25, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 31.6, "frames": {"chat": 244}, "mem_gb": 9.98}
|
| 18 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4628105710600814, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 8.4375, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 320}, "mem_gb": 9.9}
|
| 19 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4928981926833589, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.78125, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 378}, "mem_gb": 9.5}
|
| 20 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5638923177098234, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 4.09375, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 384}, "mem_gb": 9.99}
|
| 21 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3281159411018093, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 324}, "mem_gb": 9.84}
|
| 22 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8018940414384007, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 239}, "mem_gb": 10.0}
|
| 23 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2515785626843572, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.578125, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 306}, "mem_gb": 9.74}
|
| 24 |
+
[eval step 10] sample: "To solve this problem, we need to determine the rank of the given matrix. The rank of a matrix is defined by the number of non-zero elements in the matrix.\n\nLet's break down the problem:\n\n1. **Matrix*"
|
| 25 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3283900368700425, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 3.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 329}, "mem_gb": 9.78}
|
| 26 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7883826109138627, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.9921875, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 254}, "mem_gb": 10.01}
|
| 27 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0816897711279492, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 2.109375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 273}, "mem_gb": 9.98}
|
| 28 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6135015807601313, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.7, "frames": {"chat": 236}, "mem_gb": 9.9}
|
| 29 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3105962486989797, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 381}, "mem_gb": 9.64}
|
| 30 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6666335937586924, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 266}, "mem_gb": 9.83}
|
| 31 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9004511144821843, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 308}, "mem_gb": 9.82}
|
| 32 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7443993991047144, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 273}, "mem_gb": 10.0}
|
| 33 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.133398624741286, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.2734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 368}, "mem_gb": 9.63}
|
| 34 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2558532213958602, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.1953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 339}, "mem_gb": 9.88}
|
| 35 |
+
[eval step 20] sample: 'To compute the rank of a 4x4 matrix \\( A \\) given by \\([12, -16, 4, 16]\\), \\([-9, 11, -1, -10]\\), \\([0, 1, -2, -2]\\), and \\([0, 4, -8'
|
| 36 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7775650892155865, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 298}, "mem_gb": 9.8}
|
| 37 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0902612226290007, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.1328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 350}, "mem_gb": 9.53}
|
| 38 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6757159860300521, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.9765625, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 246}, "mem_gb": 9.97}
|
| 39 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0760687224897245, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.2, "frames": {"chat": 375}, "mem_gb": 9.7}
|
| 40 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0879509686164557, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 352}, "mem_gb": 9.76}
|
| 41 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1019300509187082, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 396}, "mem_gb": 9.71}
|
| 42 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349442116856576, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 362}, "mem_gb": 9.57}
|
| 43 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1320429676694175, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 369}, "mem_gb": 9.77}
|
| 44 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1115945567950607, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.4, "frames": {"chat": 399}, "mem_gb": 9.62}
|
| 45 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6293747738944366, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 1.078125, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 247}, "mem_gb": 9.9}
|
| 46 |
+
[eval step 30] sample: 'To compute the rank of a 4x4 matrix, we need to determine the number of linearly independent rows (or equivalently, the number of non-zero rows) in the matrix. The rank of a matrix is given by the num'
|
| 47 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37254366254458826, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 230}, "mem_gb": 9.83}
|
| 48 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5862284223752717, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 263}, "mem_gb": 10.0}
|
| 49 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.606637933870405, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 264}, "mem_gb": 9.99}
|
| 50 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9400521790258587, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.96875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 328}, "mem_gb": 9.85}
|
| 51 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5495978371700893, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 281}, "mem_gb": 9.93}
|
| 52 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4820209278317789, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 237}, "mem_gb": 9.92}
|
| 53 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5574739918556064, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 278}, "mem_gb": 10.0}
|
| 54 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9362318514594188, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 310}, "mem_gb": 9.88}
|
| 55 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6705026273014024, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 2.421875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 295}, "mem_gb": 9.81}
|
| 56 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7008066074669361, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 329}, "mem_gb": 9.83}
|
| 57 |
+
[eval step 40] sample: "To compute the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix. Let's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n12 &"
|
| 58 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6580265941616148, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 263}, "mem_gb": 9.94}
|
| 59 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6893753549223145, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 315}, "mem_gb": 9.83}
|
| 60 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9123652948531011, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.1, "frames": {"chat": 354}, "mem_gb": 9.78}
|
| 61 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531729037904491, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 259}, "mem_gb": 9.95}
|
| 62 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.663369363786156, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 275}, "mem_gb": 9.81}
|
| 63 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8982400885956362, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 334}, "mem_gb": 9.67}
|
| 64 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9199835396355639, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 374}, "mem_gb": 9.53}
|
| 65 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7805620063818991, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 311}, "mem_gb": 9.7}
|
| 66 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6897149990312755, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 259}, "mem_gb": 10.0}
|
| 67 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8139691390002767, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 305}, "mem_gb": 9.99}
|
| 68 |
+
[eval step 50] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-one if its rows and columns are linearly independent.\n\nGiven the matrix:'
|
| 69 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7557955997183919, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 298}, "mem_gb": 9.96}
|
| 70 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9865281463935971, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 364}, "mem_gb": 9.74}
|
| 71 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5802756533251454, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 302}, "mem_gb": 9.85}
|
| 72 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9891807129281263, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 316}, "mem_gb": 9.61}
|
| 73 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0376329787383476, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.9765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 74 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7526272877338653, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.4, "frames": {"chat": 330}, "mem_gb": 9.86}
|
| 75 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7383014962325494, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 321}, "mem_gb": 9.86}
|
| 76 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7980097688106199, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.3, "frames": {"chat": 344}, "mem_gb": 9.89}
|
| 77 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8585373521504303, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.6, "frames": {"chat": 353}, "mem_gb": 9.57}
|
| 78 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.468816747770831, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 272}, "mem_gb": 10.0}
|
| 79 |
+
[eval step 60] sample: 'To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns. A matrix is rank-one if its rows are linearly independent.\n\nGiven the matrix:\n\\[\n\\begin{b'
|
| 80 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9529689540425936, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 317}, "mem_gb": 9.74}
|
| 81 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48802215769477186, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 292}, "mem_gb": 9.74}
|
| 82 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33381707844672104, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 229}, "mem_gb": 9.86}
|
| 83 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9166388065235068, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 359}, "mem_gb": 9.86}
|
| 84 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8499598869919777, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 358}, "mem_gb": 9.59}
|
| 85 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9463473704521854, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 315}, "mem_gb": 9.97}
|
| 86 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6282305336457987, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 264}, "mem_gb": 10.05}
|
| 87 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.922659195908159, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 337}, "mem_gb": 9.71}
|
| 88 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5095197800409049, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 251}, "mem_gb": 10.01}
|
| 89 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.669520335036392, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 298}, "mem_gb": 9.73}
|
| 90 |
+
[eval step 70] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 91 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5728330836306016, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 264}, "mem_gb": 9.95}
|
| 92 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5831253407930335, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 305}, "mem_gb": 9.97}
|
| 93 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5809162937528143, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 322}, "mem_gb": 9.74}
|
| 94 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9200140699006617, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 361}, "mem_gb": 9.72}
|
| 95 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6170258167617023, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 321}, "mem_gb": 9.9}
|
| 96 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.745773715874056, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 307}, "mem_gb": 9.8}
|
| 97 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8853268439628184, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 327}, "mem_gb": 9.89}
|
| 98 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.948744330672423, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 356}, "mem_gb": 9.51}
|
| 99 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49534344591063756, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 283}, "mem_gb": 9.86}
|
| 100 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8756721441843858, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 401}, "mem_gb": 9.61}
|
| 101 |
+
[eval step 80] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nGiven the matrix:\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & '
|
| 102 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6122044404866794, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 288}, "mem_gb": 9.81}
|
| 103 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7559761947674056, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 323}, "mem_gb": 9.85}
|
| 104 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9562726962727804, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.7, "frames": {"chat": 336}, "mem_gb": 9.74}
|
| 105 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8279093881650518, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 329}, "mem_gb": 9.65}
|
| 106 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8101193031098693, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 343}, "mem_gb": 9.63}
|
| 107 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8255183496457835, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 336}, "mem_gb": 9.75}
|
| 108 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7889219066008926, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 9.98}
|
| 109 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.535852443348368, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 281}, "mem_gb": 9.82}
|
| 110 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6584771569675455, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 299}, "mem_gb": 9.7}
|
| 111 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7581487553476045, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 328}, "mem_gb": 9.88}
|
| 112 |
+
[eval step 90] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to row echelon form (REF)*"
|
| 113 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6072904303981612, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 271}, "mem_gb": 9.98}
|
| 114 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6448348898903777, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 269}, "mem_gb": 10.08}
|
| 115 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9165014602435132, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 370}, "mem_gb": 9.63}
|
| 116 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9641176627212514, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 117 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8529148819399377, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 330}, "mem_gb": 9.89}
|
| 118 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.739900295054478, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.3, "frames": {"chat": 334}, "mem_gb": 9.62}
|
| 119 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7255623794448872, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 336}, "mem_gb": 9.75}
|
| 120 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5624238331573704, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 309}, "mem_gb": 9.84}
|
| 121 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8828203936658799, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 391}, "mem_gb": 9.73}
|
| 122 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5177519494578242, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 264}, "mem_gb": 10.12}
|
| 123 |
+
[eval step 100] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to row echelon form (REF)*"
|
| 124 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7520200645218292, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 349}, "mem_gb": 9.68}
|
| 125 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7038256925971558, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 312}, "mem_gb": 9.73}
|
| 126 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3220016950596124, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 229}, "mem_gb": 10.0}
|
| 127 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6865760278018812, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 288}, "mem_gb": 10.0}
|
| 128 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8872082994326949, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.8, "frames": {"chat": 351}, "mem_gb": 9.66}
|
| 129 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42892621867458025, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 223}, "mem_gb": 10.02}
|
| 130 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25722685280982405, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.7, "frames": {"chat": 213}, "mem_gb": 9.99}
|
| 131 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8519970328888545, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 380}, "mem_gb": 9.84}
|
| 132 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5298828945804387, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 271}, "mem_gb": 10.02}
|
| 133 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8754717887451251, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 340}, "mem_gb": 9.91}
|
| 134 |
+
[eval step 110] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n \\[\n"
|
| 135 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9062268243078142, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 366}, "mem_gb": 9.61}
|
| 136 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3772926119524986, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 233}, "mem_gb": 10.0}
|
| 137 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6391503562025725, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 312}, "mem_gb": 9.86}
|
| 138 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8348384991370141, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 363}, "mem_gb": 9.58}
|
| 139 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8460269746944308, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 323}, "mem_gb": 9.85}
|
| 140 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9184032143781583, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 346}, "mem_gb": 9.6}
|
| 141 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8337479645900429, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 318}, "mem_gb": 9.74}
|
| 142 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6655272019125521, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 275}, "mem_gb": 9.93}
|
| 143 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8020154010264203, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 345}, "mem_gb": 9.67}
|
| 144 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7799224477479855, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 377}, "mem_gb": 9.82}
|
| 145 |
+
[eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
|
| 146 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6743776638001203, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 294}, "mem_gb": 10.04}
|
| 147 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8791592950512965, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 338}, "mem_gb": 9.73}
|
| 148 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8868898211166263, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 352}, "mem_gb": 9.63}
|
| 149 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8171511985094597, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 347}, "mem_gb": 9.68}
|
| 150 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5592160554877172, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 310}, "mem_gb": 9.66}
|
| 151 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.917420652448386, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 358}, "mem_gb": 9.69}
|
| 152 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5866472002613048, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 319}, "mem_gb": 9.97}
|
| 153 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42084977297174436, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.4, "frames": {"chat": 269}, "mem_gb": 10.0}
|
| 154 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6944073649110893, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 310}, "mem_gb": 9.85}
|
| 155 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5127887724590798, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.0, "frames": {"chat": 259}, "mem_gb": 10.03}
|
| 156 |
+
[eval step 130] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if its rank is less than the number of rows or columns.\n\nGiven'
|
| 157 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5161035601972291, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.0, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 158 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8862952185201148, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 337}, "mem_gb": 9.55}
|
| 159 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5373145978979766, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 290}, "mem_gb": 9.82}
|
| 160 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7703774180538953, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.0, "frames": {"chat": 349}, "mem_gb": 9.75}
|
| 161 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5381037803484748, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 291}, "mem_gb": 9.84}
|
| 162 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8035371189059068, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 342}, "mem_gb": 9.71}
|
| 163 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8786542965706438, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 338}, "mem_gb": 9.66}
|
| 164 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8855234732630353, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.2, "frames": {"chat": 356}, "mem_gb": 9.62}
|
| 165 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48763241036869587, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 166 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7343015829361975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 353}, "mem_gb": 9.71}
|
| 167 |
+
[eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Form the Matrix:**\n \\[\n "
|
| 168 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7160050032602002, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.6, "frames": {"chat": 316}, "mem_gb": 9.9}
|
| 169 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.613757470803149, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 289}, "mem_gb": 10.05}
|
| 170 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6455232769344001, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 331}, "mem_gb": 9.69}
|
| 171 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6440045347951353, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 320}, "mem_gb": 10.0}
|
| 172 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5798100992968926, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 272}, "mem_gb": 9.74}
|
| 173 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.933260024563844, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 368}, "mem_gb": 9.66}
|
| 174 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7830935181960463, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 328}, "mem_gb": 9.68}
|
| 175 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7827151989266277, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 326}, "mem_gb": 9.9}
|
| 176 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8659792529044053, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 364}, "mem_gb": 9.84}
|
| 177 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5851993394732475, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.4, "frames": {"chat": 296}, "mem_gb": 9.88}
|
| 178 |
+
[eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Convert the matrix to a row "
|
| 179 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1224/step0150
|
| 180 |
+
wandb: updating run metadata
|
| 181 |
+
wandb: uploading summary
|
| 182 |
+
wandb:
|
| 183 |
+
wandb: Run history:
|
| 184 |
+
wandb: comp_len ββββββββββββββββββββββββββ
βββββββ
βββββββ
|
| 185 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββ
β
β
β
β
βββββββββββββββ
|
| 186 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 187 |
+
wandb: finish_rate ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: forward_topk_kl βββ
βββββββββββββββββββββββββββββββββββββ
|
| 189 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: lr ββββ
β
βββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: mem_gb ββββ
βββββββ
β
β
ββββββββββββββ
β
ββββββββββββ
|
| 192 |
+
wandb: step βββββββββββββββββββββ
β
β
β
β
β
ββββββββββββββ
|
| 193 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: +3 ...
|
| 195 |
+
wandb:
|
| 196 |
+
wandb: Run summary:
|
| 197 |
+
wandb: comp_len 405.4
|
| 198 |
+
wandb: cumulative_loss_tokens 18000000
|
| 199 |
+
wandb: epoch 0
|
| 200 |
+
wandb: finish_rate 0.97
|
| 201 |
+
wandb: forward_topk_kl 0.5852
|
| 202 |
+
wandb: grad_norm 0.70312
|
| 203 |
+
wandb: lr 3e-05
|
| 204 |
+
wandb: mem_gb 9.88
|
| 205 |
+
wandb: step 150
|
| 206 |
+
wandb: t_data_s 0
|
| 207 |
+
wandb: +4 ...
|
| 208 |
+
wandb:
|
| 209 |
+
wandb: π View run uniform_keep25_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/ig8p922u
|
| 210 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 211 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 212 |
+
wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1224/wandb/run-20260717_174601-ig8p922u/logs
|
healed/grid_general/uniform_keep25_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/uniform_keep25_s1225.console.log
ADDED
|
@@ -0,0 +1,212 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1225/wandb/run-20260717_172920-exrn8c9o
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run uniform_keep25_s1225
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/exrn8c9o
|
| 11 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 12 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.0794557246148586, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 19.25, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 331}, "mem_gb": 9.8}
|
| 13 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 14 |
+
[eval step 1] sample: 'To solve the problem, follow these steps:\n\n1. **Calculate the initial savings**: \n Given $50,000 initial savings, Jamie starts with $2,500 each month. \n \\[ 50,000 = 2,500 \\]\n \\[ \\text{Initial sa'
|
| 15 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.9382405855561295, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 17.375, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 342}, "mem_gb": 9.62}
|
| 16 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 2.060110138433675, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 16.625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 40.7, "frames": {"chat": 358}, "mem_gb": 9.66}
|
| 17 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7511012202739715, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 12.25, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 344}, "mem_gb": 9.75}
|
| 18 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2904005969742933, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 7.78125, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 267}, "mem_gb": 10.06}
|
| 19 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8996856569925944, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.78125, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.3, "frames": {"chat": 248}, "mem_gb": 9.9}
|
| 20 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4077503702804446, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.953125, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 329}, "mem_gb": 9.89}
|
| 21 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4160378363728523, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 3.578125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 339}, "mem_gb": 9.85}
|
| 22 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.5330558786311497, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 4.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 354}, "mem_gb": 9.84}
|
| 23 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9857558427085479, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.09375, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 279}, "mem_gb": 9.98}
|
| 24 |
+
[eval step 10] sample: "To solve this problem, we need to determine how many months it will take to reach Jamie's goal of $1,000,000.\n\nFirst, let's calculate the total amount of money Jamie will save from their salary.\n\nJami"
|
| 25 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1225586707924804, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.703125, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 318}, "mem_gb": 9.91}
|
| 26 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8451283432645103, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.9921875, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.4, "frames": {"chat": 265}, "mem_gb": 10.0}
|
| 27 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7904104653182129, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.5, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.4, "frames": {"chat": 254}, "mem_gb": 9.94}
|
| 28 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.003169925311456, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.8828125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 315}, "mem_gb": 9.97}
|
| 29 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.210865019942075, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.65625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 30 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9181811830550433, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.515625, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 276}, "mem_gb": 9.97}
|
| 31 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2043013377028207, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.4375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 356}, "mem_gb": 9.91}
|
| 32 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2048342113673687, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 304}, "mem_gb": 9.72}
|
| 33 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1660428700772425, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.28125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 375}, "mem_gb": 9.64}
|
| 34 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7378967291931311, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 294}, "mem_gb": 9.99}
|
| 35 |
+
[eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Initial Savings:**\n Jamie starts with $50,000 in savings.\n\n2. **Saving Rate:**'
|
| 36 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0699267786679167, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.484375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 299}, "mem_gb": 10.01}
|
| 37 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8490009002623459, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 1.09375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 305}, "mem_gb": 9.78}
|
| 38 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5716204827949405, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.0, "frames": {"chat": 262}, "mem_gb": 9.84}
|
| 39 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7367404413335026, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 303}, "mem_gb": 9.9}
|
| 40 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0723603018666308, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 380}, "mem_gb": 9.78}
|
| 41 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6846578739960988, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 282}, "mem_gb": 9.73}
|
| 42 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9897605513930321, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.0703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 362}, "mem_gb": 9.75}
|
| 43 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9729154749530057, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 1.0546875, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 307}, "mem_gb": 9.99}
|
| 44 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7216041704551627, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.3, "frames": {"chat": 282}, "mem_gb": 9.85}
|
| 45 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9891043894331902, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 337}, "mem_gb": 9.88}
|
| 46 |
+
[eval step 30] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Calculate the total amount of savings:**\n Jamie starts with $50,000 and can sa'
|
| 47 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6974770890879134, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 275}, "mem_gb": 9.94}
|
| 48 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0502734605158368, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 318}, "mem_gb": 9.75}
|
| 49 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.106791383036971, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 1.21875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 385}, "mem_gb": 9.78}
|
| 50 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1531158730265996, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 316}, "mem_gb": 9.73}
|
| 51 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6083217897144456, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 266}, "mem_gb": 10.02}
|
| 52 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0765465615568062, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 2.078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 371}, "mem_gb": 9.76}
|
| 53 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6403039853143195, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 262}, "mem_gb": 9.96}
|
| 54 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0429206928466757, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 348}, "mem_gb": 9.79}
|
| 55 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34789143809402984, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.8, "frames": {"chat": 222}, "mem_gb": 10.02}
|
| 56 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9737905801298717, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 408}, "mem_gb": 9.59}
|
| 57 |
+
[eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n1. **Initial Savings:**\n Jamie starts with $50,000 in savings.\n\n2. **Saving Calcula'
|
| 58 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.962751345739762, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 334}, "mem_gb": 9.65}
|
| 59 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6121108932040632, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 60 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349620274516444, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.9296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 61 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8773215480993192, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 371}, "mem_gb": 9.5}
|
| 62 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.665512923207134, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 284}, "mem_gb": 9.95}
|
| 63 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5310426560789346, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 287}, "mem_gb": 10.01}
|
| 64 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5122390792146325, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.1, "frames": {"chat": 285}, "mem_gb": 9.91}
|
| 65 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4158832591359814, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 252}, "mem_gb": 10.0}
|
| 66 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9101235743480424, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 360}, "mem_gb": 9.79}
|
| 67 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9504232099909335, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 359}, "mem_gb": 9.78}
|
| 68 |
+
[eval step 50] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in'
|
| 69 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.987863897086059, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 363}, "mem_gb": 9.54}
|
| 70 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8996826629199087, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 361}, "mem_gb": 9.63}
|
| 71 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.623281886620447, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.76953125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 286}, "mem_gb": 9.82}
|
| 72 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.964685377394408, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 367}, "mem_gb": 9.66}
|
| 73 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0159950468614698, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 352}, "mem_gb": 9.69}
|
| 74 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6757930965072165, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 314}, "mem_gb": 9.65}
|
| 75 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8620408787672719, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 372}, "mem_gb": 9.62}
|
| 76 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8460559062846005, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 334}, "mem_gb": 9.77}
|
| 77 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9600720654624825, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 368}, "mem_gb": 9.71}
|
| 78 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7995813532876471, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 354}, "mem_gb": 9.85}
|
| 79 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in'
|
| 80 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5291700849273553, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 293}, "mem_gb": 9.74}
|
| 81 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.39443891376455625, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.1, "frames": {"chat": 231}, "mem_gb": 9.91}
|
| 82 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7528112872476379, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 83 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5231343047395348, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 263}, "mem_gb": 10.01}
|
| 84 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5671485816498597, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 252}, "mem_gb": 9.95}
|
| 85 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.784575092916439, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.84765625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 344}, "mem_gb": 9.98}
|
| 86 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7466721218022208, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 313}, "mem_gb": 9.9}
|
| 87 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.825000645390898, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 358}, "mem_gb": 9.6}
|
| 88 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4612522759740551, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.3, "frames": {"chat": 267}, "mem_gb": 9.82}
|
| 89 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8384202725651364, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 300}, "mem_gb": 9.7}
|
| 90 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 '
|
| 91 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7152079859041919, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 348}, "mem_gb": 9.63}
|
| 92 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8390424176178872, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 329}, "mem_gb": 9.72}
|
| 93 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5051660226624459, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 269}, "mem_gb": 9.88}
|
| 94 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8928247506640852, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 358}, "mem_gb": 9.56}
|
| 95 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6003702151122192, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 302}, "mem_gb": 9.81}
|
| 96 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8836967590371768, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 381}, "mem_gb": 9.83}
|
| 97 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9381277939031522, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 379}, "mem_gb": 9.77}
|
| 98 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8966510118864477, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 351}, "mem_gb": 9.6}
|
| 99 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.816065528916195, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 330}, "mem_gb": 9.8}
|
| 100 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8439822067389886, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 316}, "mem_gb": 9.83}
|
| 101 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their goal of $1,000,000.\n\n**Step 1: Calculate the total amount of savings Jamie can save.**\n\nJamie starts with '
|
| 102 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5972601027422895, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 276}, "mem_gb": 10.01}
|
| 103 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5014377494474253, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.8, "frames": {"chat": 240}, "mem_gb": 9.94}
|
| 104 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5757383082607761, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 288}, "mem_gb": 9.85}
|
| 105 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5361464524952074, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 271}, "mem_gb": 9.84}
|
| 106 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7953305675481757, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 357}, "mem_gb": 9.79}
|
| 107 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9502958817032476, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 1.03125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 354}, "mem_gb": 9.77}
|
| 108 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8983897976920009, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 302}, "mem_gb": 10.01}
|
| 109 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7244445340114335, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 297}, "mem_gb": 9.99}
|
| 110 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3383140443430593, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.0, "frames": {"chat": 219}, "mem_gb": 10.01}
|
| 111 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8841795220173896, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 306}, "mem_gb": 9.72}
|
| 112 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 in savings. The'
|
| 113 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9193184819070002, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.8828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 343}, "mem_gb": 9.65}
|
| 114 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8698648859803876, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 341}, "mem_gb": 9.77}
|
| 115 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5649490782976151, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 318}, "mem_gb": 9.72}
|
| 116 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9381724646138648, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 346}, "mem_gb": 9.6}
|
| 117 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5188041244159142, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 277}, "mem_gb": 10.08}
|
| 118 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202522110253572, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 270}, "mem_gb": 9.81}
|
| 119 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5844245721923809, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.0, "frames": {"chat": 257}, "mem_gb": 10.0}
|
| 120 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8780859741431971, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 363}, "mem_gb": 9.6}
|
| 121 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8758002337973565, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.91796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 356}, "mem_gb": 9.74}
|
| 122 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8031596004160741, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 323}, "mem_gb": 9.77}
|
| 123 |
+
[eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount of savings needed.**\n\nJamie starts with $50,000 in savings. The'
|
| 124 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969562323934088, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.2, "frames": {"chat": 243}, "mem_gb": 10.03}
|
| 125 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8159564161725342, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 307}, "mem_gb": 9.71}
|
| 126 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7722952668403585, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 346}, "mem_gb": 9.94}
|
| 127 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5512993536607673, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 273}, "mem_gb": 9.94}
|
| 128 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5661342446585497, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.2, "frames": {"chat": 302}, "mem_gb": 9.87}
|
| 129 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7417649566846589, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 337}, "mem_gb": 10.0}
|
| 130 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5996722806531936, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 280}, "mem_gb": 9.88}
|
| 131 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9339710600915054, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 331}, "mem_gb": 9.78}
|
| 132 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6326806932876508, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 314}, "mem_gb": 9.88}
|
| 133 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.951997183012714, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.86328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 294}, "mem_gb": 9.81}
|
| 134 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings.\n\n**St'
|
| 135 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5370836537691455, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.9, "frames": {"chat": 274}, "mem_gb": 9.94}
|
| 136 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7816394791742166, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 137 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5312152186378837, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 323}, "mem_gb": 9.73}
|
| 138 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3917661316258212, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.5, "frames": {"chat": 234}, "mem_gb": 10.01}
|
| 139 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4531616931842019, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.1, "frames": {"chat": 267}, "mem_gb": 10.01}
|
| 140 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5786159123295297, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 304}, "mem_gb": 9.78}
|
| 141 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8153983991346011, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 373}, "mem_gb": 9.7}
|
| 142 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5484141979801158, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 300}, "mem_gb": 9.98}
|
| 143 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8510625264505546, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.6, "frames": {"chat": 331}, "mem_gb": 9.82}
|
| 144 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4428873334288597, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.9375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 259}, "mem_gb": 9.97}
|
| 145 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie needs to save.**\n\nJamie starts with $50,000 in savings. T'
|
| 146 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7968908243669197, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 358}, "mem_gb": 9.58}
|
| 147 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.885246904007097, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.85546875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 354}, "mem_gb": 9.84}
|
| 148 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4794710053768009, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 279}, "mem_gb": 9.91}
|
| 149 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9043105863948663, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 354}, "mem_gb": 9.65}
|
| 150 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8665179896108807, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 334}, "mem_gb": 9.86}
|
| 151 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8613109405379742, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 327}, "mem_gb": 9.72}
|
| 152 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8335232547727723, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 365}, "mem_gb": 9.82}
|
| 153 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5240228016275913, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.1, "frames": {"chat": 252}, "mem_gb": 10.03}
|
| 154 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43466761969849466, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 256}, "mem_gb": 9.99}
|
| 155 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5272866128642112, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.6, "frames": {"chat": 302}, "mem_gb": 9.77}
|
| 156 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie needs to save.**\n\nJamie starts with $50,000 in savings. T'
|
| 157 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7890060139425099, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 350}, "mem_gb": 9.67}
|
| 158 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5457840235626946, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.7, "frames": {"chat": 292}, "mem_gb": 9.79}
|
| 159 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.79017503865771, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.79296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 356}, "mem_gb": 9.6}
|
| 160 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5941492146098987, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 347}, "mem_gb": 9.77}
|
| 161 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.527144433131814, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.9, "frames": {"chat": 330}, "mem_gb": 9.96}
|
| 162 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8337077025167644, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 363}, "mem_gb": 9.82}
|
| 163 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7654941257418444, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 354}, "mem_gb": 9.68}
|
| 164 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4724469358841578, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 270}, "mem_gb": 9.95}
|
| 165 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7949136193686476, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 343}, "mem_gb": 9.72}
|
| 166 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2808029476908967, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.4, "frames": {"chat": 232}, "mem_gb": 9.91}
|
| 167 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings.\n\n**St'
|
| 168 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7310183790621658, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 346}, "mem_gb": 9.86}
|
| 169 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.609795872541517, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 306}, "mem_gb": 9.95}
|
| 170 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4385337435649087, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.4, "frames": {"chat": 273}, "mem_gb": 9.99}
|
| 171 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48237557862314084, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.8, "frames": {"chat": 266}, "mem_gb": 9.82}
|
| 172 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6842534519212942, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 299}, "mem_gb": 10.01}
|
| 173 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5115972357225915, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 259}, "mem_gb": 10.1}
|
| 174 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5499042739481975, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 325}, "mem_gb": 9.83}
|
| 175 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5033972233465562, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 1.8515625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.9, "frames": {"chat": 271}, "mem_gb": 9.91}
|
| 176 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7678621418327093, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 359}, "mem_gb": 9.69}
|
| 177 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7568772708850602, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.75390625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 345}, "mem_gb": 9.75}
|
| 178 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save $1,000,000.\n\n**Step 1: Calculate the total amount Jamie will save.**\n\nJamie starts with $50,000 in savings. They '
|
| 179 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1225/step0150
|
| 180 |
+
wandb: updating run metadata
|
| 181 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 182 |
+
wandb:
|
| 183 |
+
wandb: Run history:
|
| 184 |
+
wandb: comp_len ββββββββ
βββββββ
ββββββ
ββ
ββββ
β
β
βββββββββββ
|
| 185 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββββββ
β
β
β
β
β
ββββββββββββ
|
| 186 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 187 |
+
wandb: finish_rate βββ
βββββ
βββ
ββββββββββββ
βββββββββββββββ
ββ
|
| 188 |
+
wandb: forward_topk_kl ββββββββββββββββββββββββββββββββββββββββ
|
| 189 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: lr ββ
ββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: mem_gb βββββββββ
ββββββ
ββ
ββββββββββ
βββββββββ
ββββ
|
| 192 |
+
wandb: step βββββββββββββββββββββ
β
β
β
β
β
ββββββββββββββ
|
| 193 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: +3 ...
|
| 195 |
+
wandb:
|
| 196 |
+
wandb: Run summary:
|
| 197 |
+
wandb: comp_len 347.8
|
| 198 |
+
wandb: cumulative_loss_tokens 18000000
|
| 199 |
+
wandb: epoch 0
|
| 200 |
+
wandb: finish_rate 0.997
|
| 201 |
+
wandb: forward_topk_kl 0.75688
|
| 202 |
+
wandb: grad_norm 0.75391
|
| 203 |
+
wandb: lr 3e-05
|
| 204 |
+
wandb: mem_gb 9.75
|
| 205 |
+
wandb: step 150
|
| 206 |
+
wandb: t_data_s 0
|
| 207 |
+
wandb: +4 ...
|
| 208 |
+
wandb:
|
| 209 |
+
wandb: π View run uniform_keep25_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/exrn8c9o
|
| 210 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 211 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 212 |
+
wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1225/wandb/run-20260717_172920-exrn8c9o/logs
|
healed/grid_general/uniform_keep25_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/uniform_keep25_s1226.console.log
ADDED
|
@@ -0,0 +1,213 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run 35vquuvg
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep25_s1226/wandb/run-20260717_172747-35vquuvg
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run uniform_keep25_s1226
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/35vquuvg
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 2.09B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.6198377058381837, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 14.1875, "lr": 6e-06, "finish_rate": 0.945, "comp_len": 389.6, "t_data_s": 0.2, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 308}, "mem_gb": 9.9}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: "To solve the problem, first, let's express the arithmetic sequence $\\{a_n\\}$ in terms. The equation given is: $a_1 + 3a_8 + a_{15} = 120$. \n\nWe can start by isolating $a_1$ and $a_{15}$ separately:"
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1278039398397008, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 11.1875, "lr": 9e-06, "finish_rate": 0.754, "comp_len": 568.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 27.8, "frames": {"chat": 211}, "mem_gb": 10.0}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4541973999391, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 12.0, "lr": 1.2e-05, "finish_rate": 0.915, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 281}, "mem_gb": 10.0}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.8296605550626914, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 13.25, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 367}, "mem_gb": 9.54}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.7394707097530364, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 10.75, "lr": 1.8e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.1, "frames": {"chat": 312}, "mem_gb": 9.7}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3919385990172624, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 6.59375, "lr": 2.1e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.2, "frames": {"chat": 271}, "mem_gb": 10.02}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0466774787882964, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 3.3125, "lr": 2.4e-05, "finish_rate": 0.922, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 269}, "mem_gb": 9.98}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.4405667054029803, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 4.0, "lr": 2.7000000000000002e-05, "finish_rate": 0.989, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.2, "frames": {"chat": 352}, "mem_gb": 9.51}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8640208913827936, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 3.0, "lr": 3e-05, "finish_rate": 0.864, "comp_len": 493.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 30.9, "frames": {"chat": 243}, "mem_gb": 9.99}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9949866053918998, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 3.046875, "lr": 3e-05, "finish_rate": 0.952, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 293}, "mem_gb": 9.91}
|
| 25 |
+
[eval step 10] sample: "To solve this problem, we need to find the value of \\(a_9 - a_{10}\\) given the arithmetic sequence \\(a_1 + 3a_8 + a_{15} = 120\\).\n\nFirst, let's express the terms of the arithmetic sequence \\(a_1 + 3a"
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7550956839062274, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 2.328125, "lr": 3e-05, "finish_rate": 0.872, "comp_len": 495.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.2, "frames": {"chat": 242}, "mem_gb": 9.99}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.3722707773387433, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 3.421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 353}, "mem_gb": 9.69}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2270169781867415, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 2.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 338}, "mem_gb": 9.69}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8182531326726079, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 1.796875, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.3, "frames": {"chat": 259}, "mem_gb": 9.99}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1896284536235036, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 385}, "mem_gb": 9.54}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.107086871171246, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 1.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 355}, "mem_gb": 9.71}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0843177239472668, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 1.34375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 328}, "mem_gb": 9.61}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1169710126459598, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 355}, "mem_gb": 9.77}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.2136201079836737, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 1.296875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 367}, "mem_gb": 9.63}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1100827305369079, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 4.5, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 343}, "mem_gb": 9.67}
|
| 36 |
+
[eval step 20] sample: 'to solve the problem, we need to find the value of $2a_9 - a_{10}$ given the arithmetic sequence $\\{a_n, a_{n+1} = a_n, a_{n+2} = a_{n+1}, a_{n+3} = a_{'
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48773726695353786, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 1.140625, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.0, "frames": {"chat": 244}, "mem_gb": 10.0}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7658182124488055, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.3, "frames": {"chat": 339}, "mem_gb": 9.83}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.773730390801529, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 298}, "mem_gb": 9.98}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0994430319796007, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 1.1640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 301.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 398}, "mem_gb": 9.86}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9967648058511317, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 1.046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 41.4, "frames": {"chat": 362}, "mem_gb": 9.96}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7214353624875347, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 313}, "mem_gb": 9.83}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1025204305546978, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 1.125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 324}, "mem_gb": 9.75}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7503103248804808, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.890625, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 314}, "mem_gb": 9.8}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0916470245361327, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 1.1015625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.4, "frames": {"chat": 345}, "mem_gb": 9.73}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6021138668128599, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.897, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 262}, "mem_gb": 9.91}
|
| 47 |
+
[eval step 30] sample: 'to solve the problem, we need to find the value of \\(2a_9 - a_{10}\\) given the arithmetic sequence \\(\\{a_n, a_{n+1} = a_n, a_{n+2} = a_{n+1}\\}\\).\n\nthe sequence'
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.1386381568533679, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 1.0625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 373}, "mem_gb": 9.7}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9884025979394714, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.95703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 334}, "mem_gb": 9.69}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7716704062253237, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.87890625, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.8, "frames": {"chat": 327}, "mem_gb": 9.85}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.38816003082059325, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 29.0, "frames": {"chat": 238}, "mem_gb": 10.01}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8976383726373315, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 310}, "mem_gb": 9.74}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9374686279334128, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 347}, "mem_gb": 9.75}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9745971527382732, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 304}, "mem_gb": 9.67}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9185622260774176, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.94140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 343}, "mem_gb": 9.69}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0123143767920633, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 314}, "mem_gb": 9.69}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9092321241131673, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.88671875, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 300}, "mem_gb": 9.79}
|
| 58 |
+
[eval step 40] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence and the given equation. the arithmetic sequence is defined by the sum of the first and the eig'
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7716472785164913, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.4, "frames": {"chat": 318}, "mem_gb": 9.83}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6538155039491753, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 279}, "mem_gb": 9.87}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9410169425601761, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 364}, "mem_gb": 9.93}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.666910404100269, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.6, "frames": {"chat": 256}, "mem_gb": 10.0}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0627939316359658, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.8, "frames": {"chat": 340}, "mem_gb": 9.7}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6058597680499156, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 283}, "mem_gb": 9.93}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9343802149453511, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.90625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 349}, "mem_gb": 9.71}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6380284264487525, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 297}, "mem_gb": 9.79}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0918996284656226, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 359}, "mem_gb": 9.76}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7474090205609798, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 342}, "mem_gb": 9.8}
|
| 69 |
+
[eval step 50] sample: 'in the arithmetic sequence {a_n}, if a_1 + 3a_8 + a_{15} = 120, we need to find the value of a_9 - a_{10}. to solve this, we first express the sequence in terms of the common difference of the first a'
|
| 70 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5774158618660022, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.8, "frames": {"chat": 269}, "mem_gb": 9.97}
|
| 71 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.727511136507243, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.91015625, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 370.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 324}, "mem_gb": 9.96}
|
| 72 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.591815117332836, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.94, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.3, "frames": {"chat": 281}, "mem_gb": 9.95}
|
| 73 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7262308727793395, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 287}, "mem_gb": 9.99}
|
| 74 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8758036725302537, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 296}, "mem_gb": 10.0}
|
| 75 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6354180803711216, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.0, "frames": {"chat": 267}, "mem_gb": 10.05}
|
| 76 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6112754095687221, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 481.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 249}, "mem_gb": 9.96}
|
| 77 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9578634677429994, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.94921875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.3, "frames": {"chat": 363}, "mem_gb": 9.65}
|
| 78 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6659456232734025, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.4, "frames": {"chat": 299}, "mem_gb": 9.79}
|
| 79 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9349627352940539, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 331}, "mem_gb": 9.67}
|
| 80 |
+
[eval step 60] sample: 'in the arithmetic sequence {a_n}, if a_1 + 3a_8 + a_{15} = 120, we can find the value of a_9 - a_10. to solve this, we first express a_9 and a_10 in terms of a_n:\n\na'
|
| 81 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5694986918556193, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 280}, "mem_gb": 9.88}
|
| 82 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.935475990417848, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 350}, "mem_gb": 9.86}
|
| 83 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9245277111411094, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.9140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 321}, "mem_gb": 9.63}
|
| 84 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5552141196810951, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.1, "frames": {"chat": 281}, "mem_gb": 9.93}
|
| 85 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9923324734320244, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 331}, "mem_gb": 9.61}
|
| 86 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7915697015117854, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.1, "frames": {"chat": 318}, "mem_gb": 9.98}
|
| 87 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6781684341014673, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 309}, "mem_gb": 9.99}
|
| 88 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5953212155991544, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 304}, "mem_gb": 9.88}
|
| 89 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4627537495482713, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.921, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 279}, "mem_gb": 9.9}
|
| 90 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3126349515615652, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.59765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.0, "frames": {"chat": 248}, "mem_gb": 9.91}
|
| 91 |
+
[eval step 70] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given equation. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\ngiven that:\n\n\\[ a_1 + 3'
|
| 92 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7028052366066724, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.907, "comp_len": 447.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.4, "frames": {"chat": 268}, "mem_gb": 9.88}
|
| 93 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6805809060358753, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.2, "frames": {"chat": 299}, "mem_gb": 9.98}
|
| 94 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7358988696674506, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.0, "frames": {"chat": 322}, "mem_gb": 9.84}
|
| 95 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5234173207546895, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.2, "frames": {"chat": 248}, "mem_gb": 10.01}
|
| 96 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7484029913706084, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 326}, "mem_gb": 9.91}
|
| 97 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6783317150050153, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 314}, "mem_gb": 9.67}
|
| 98 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32216203611418603, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.609375, "lr": 3e-05, "finish_rate": 0.828, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 30.8, "frames": {"chat": 232}, "mem_gb": 10.0}
|
| 99 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8948443909298629, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 330}, "mem_gb": 9.73}
|
| 100 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5822775135998924, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.901, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 292}, "mem_gb": 9.88}
|
| 101 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8399514859688779, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.87109375, "lr": 3e-05, "finish_rate": 0.978, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.7, "frames": {"chat": 312}, "mem_gb": 9.91}
|
| 102 |
+
[eval step 80] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given equation. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\nthe given equation is:\n\n\\'
|
| 103 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9575093897075703, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 314.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.3, "frames": {"chat": 382}, "mem_gb": 9.71}
|
| 104 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9348283756031345, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.8515625, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.7, "frames": {"chat": 360}, "mem_gb": 9.58}
|
| 105 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25758756727054716, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.824, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.8, "frames": {"chat": 222}, "mem_gb": 9.85}
|
| 106 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8978787859870742, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 342}, "mem_gb": 9.9}
|
| 107 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8793410871063669, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 337}, "mem_gb": 9.7}
|
| 108 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6241782809955378, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.7421875, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 304}, "mem_gb": 9.95}
|
| 109 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6081606655495863, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.954, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.1, "frames": {"chat": 326}, "mem_gb": 9.84}
|
| 110 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8173513504152496, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 310}, "mem_gb": 9.9}
|
| 111 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7661993961703032, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.5, "frames": {"chat": 328}, "mem_gb": 9.72}
|
| 112 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8819279079849521, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.8, "frames": {"chat": 347}, "mem_gb": 9.55}
|
| 113 |
+
[eval step 90] sample: 'to solve the problem, we need to follow these steps:\n\n1. **understand the arithmetic sequence:**\n the arithmetic sequence is defined by the formula:\n \\[\n a_n = a_1 + 3a_n\n \\]\n\n2. **use the giv'
|
| 114 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7608344363326828, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 330}, "mem_gb": 9.84}
|
| 115 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3073514755656322, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.751, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.7, "frames": {"chat": 209}, "mem_gb": 10.04}
|
| 116 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8808949546787888, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 399}, "mem_gb": 9.63}
|
| 117 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8310232947535813, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 351}, "mem_gb": 9.7}
|
| 118 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6046287738657867, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.0, "frames": {"chat": 322}, "mem_gb": 9.71}
|
| 119 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8535104629158974, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 333}, "mem_gb": 9.6}
|
| 120 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6767037988130004, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.6, "frames": {"chat": 330}, "mem_gb": 9.88}
|
| 121 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2665396176737423, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.866, "comp_len": 504.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.9, "frames": {"chat": 238}, "mem_gb": 9.92}
|
| 122 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4756658501408994, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.6, "frames": {"chat": 297}, "mem_gb": 9.82}
|
| 123 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7924712710880985, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.7, "frames": {"chat": 345}, "mem_gb": 9.79}
|
| 124 |
+
[eval step 100] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence. the general formula for the nth term of an arithmetic sequence is given by:\n\n\\[ a_n = a_1 + ('
|
| 125 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5913449060489734, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.3, "frames": {"chat": 304}, "mem_gb": 9.93}
|
| 126 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7735354417373737, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 326}, "mem_gb": 9.93}
|
| 127 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9105205685311307, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.8, "frames": {"chat": 347}, "mem_gb": 9.86}
|
| 128 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8203764770704011, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.969, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 325}, "mem_gb": 9.75}
|
| 129 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.565507434800888, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 299}, "mem_gb": 9.93}
|
| 130 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9238667355486502, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 345}, "mem_gb": 9.71}
|
| 131 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8346978439378242, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 344}, "mem_gb": 9.6}
|
| 132 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6687200761043777, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.985, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 344}, "mem_gb": 9.87}
|
| 133 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5966480035169671, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.8, "frames": {"chat": 288}, "mem_gb": 9.93}
|
| 134 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5915618992409358, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.1, "frames": {"chat": 303}, "mem_gb": 9.64}
|
| 135 |
+
[eval step 110] sample: 'to solve the problem, we need to understand the relationship between the terms of the arithmetic sequence. the general formula for the nth term of an arithmetic sequence is given by:\n\n\\[ a_n = a_1 + ('
|
| 136 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4473089533680429, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 284}, "mem_gb": 9.82}
|
| 137 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9387724594468871, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 369}, "mem_gb": 9.72}
|
| 138 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4969378318533301, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 32.8, "frames": {"chat": 269}, "mem_gb": 9.98}
|
| 139 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8553870124946038, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 341}, "mem_gb": 9.74}
|
| 140 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8735430047041426, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.0, "frames": {"chat": 384}, "mem_gb": 9.5}
|
| 141 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7467893767852336, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.4, "frames": {"chat": 358}, "mem_gb": 9.67}
|
| 142 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8396447286280493, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.4, "frames": {"chat": 342}, "mem_gb": 9.84}
|
| 143 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.902994489998122, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.1, "frames": {"chat": 365}, "mem_gb": 9.66}
|
| 144 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8418082291851441, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 337}, "mem_gb": 9.89}
|
| 145 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7537819979315002, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.8671875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 360.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.9, "frames": {"chat": 333}, "mem_gb": 10.0}
|
| 146 |
+
[eval step 120] sample: 'to solve the problem, we need to understand the sequence and the given equation. the arithmetic sequence is defined by the first term \\(a_1\\) and the common difference \\(d\\). the general term \\(a_n\\) '
|
| 147 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5688487251376112, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.765625, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.5, "frames": {"chat": 293}, "mem_gb": 10.04}
|
| 148 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5338740110569944, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.6, "frames": {"chat": 291}, "mem_gb": 9.8}
|
| 149 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7826589779548347, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.8359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.5, "frames": {"chat": 341}, "mem_gb": 9.83}
|
| 150 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5546559380196034, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.8, "frames": {"chat": 300}, "mem_gb": 9.76}
|
| 151 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5030046158757061, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.885, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 270}, "mem_gb": 9.99}
|
| 152 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40680691962043447, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.7, "frames": {"chat": 259}, "mem_gb": 10.01}
|
| 153 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.830503997397547, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 338.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.2, "frames": {"chat": 355}, "mem_gb": 9.58}
|
| 154 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8946966494401296, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.83984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 309.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 388}, "mem_gb": 9.94}
|
| 155 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7882957464712361, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.8, "frames": {"chat": 318}, "mem_gb": 9.65}
|
| 156 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8871899474499126, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 313.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 383}, "mem_gb": 9.79}
|
| 157 |
+
[eval step 130] sample: 'to solve the problem, we need to understand the arithmetic sequence and the given condition. the arithmetic sequence is defined as:\n\n\\[ \\{a_n\\} = \\{a_1, a_2, \\ldots, a_n\\} \\]\n\nthe given condition is:\n'
|
| 158 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5582911205784729, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.3, "frames": {"chat": 300}, "mem_gb": 9.79}
|
| 159 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5250322484340518, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.2, "frames": {"chat": 295}, "mem_gb": 9.88}
|
| 160 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5620724763760964, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.958, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.9, "frames": {"chat": 306}, "mem_gb": 9.62}
|
| 161 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6797515101924538, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.4, "frames": {"chat": 303}, "mem_gb": 9.88}
|
| 162 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4111867822818458, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.934, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.5, "frames": {"chat": 272}, "mem_gb": 9.95}
|
| 163 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5122231835640967, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.879, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.9, "frames": {"chat": 248}, "mem_gb": 9.94}
|
| 164 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.540168851786976, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.933, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 282}, "mem_gb": 9.93}
|
| 165 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7885747328455249, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.6, "frames": {"chat": 362}, "mem_gb": 9.5}
|
| 166 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8411877916619181, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 374}, "mem_gb": 9.86}
|
| 167 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5197104676648975, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.5, "frames": {"chat": 280}, "mem_gb": 10.03}
|
| 168 |
+
[eval step 140] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms, i.e., \\(a_n = a_{n-1} + a_{n-2}\\).\n\ngiv'
|
| 169 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4203244868689527, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.884, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 33.7, "frames": {"chat": 276}, "mem_gb": 9.87}
|
| 170 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5202023733886579, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 31.6, "frames": {"chat": 246}, "mem_gb": 10.01}
|
| 171 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8516633477176229, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.2, "frames": {"chat": 360}, "mem_gb": 9.54}
|
| 172 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.813726552273954, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 365}, "mem_gb": 9.72}
|
| 173 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6931645369105041, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 338}, "mem_gb": 9.81}
|
| 174 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4358943793937564, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.888, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 34.9, "frames": {"chat": 276}, "mem_gb": 9.91}
|
| 175 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27220238340807457, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.761, "comp_len": 574.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 28.4, "frames": {"chat": 209}, "mem_gb": 9.99}
|
| 176 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8054786739685883, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 379}, "mem_gb": 9.59}
|
| 177 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7144403724439442, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.3, "frames": {"chat": 307}, "mem_gb": 9.93}
|
| 178 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5410168964619437, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.942, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.0, "frames": {"chat": 293}, "mem_gb": 9.97}
|
| 179 |
+
[eval step 150] sample: 'to solve the problem, we need to understand the properties of an arithmetic sequence. in an arithmetic sequence, each term is the sum of the previous two terms, i.e., \\(a_n = a_{n-1} + a_{n-2}\\).\n\ngiv'
|
| 180 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep25_s1226/step0150
|
| 181 |
+
wandb: updating run metadata
|
| 182 |
+
wandb: uploading output.log; uploading wandb-summary.json; uploading config.yaml
|
| 183 |
+
wandb:
|
| 184 |
+
wandb: Run history:
|
| 185 |
+
wandb: comp_len βββββββββββ
ββ
ββββββ
βββββββββ
βββββββ
βββββ
|
| 186 |
+
wandb: cumulative_loss_tokens ββββββββββββββββ
β
β
β
β
β
β
β
β
ββββββββββββββββ
|
| 187 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 188 |
+
wandb: finish_rate βββββββ
βββββββββββββ
βββββββ
βββββββββ
ββββ
|
| 189 |
+
wandb: forward_topk_kl ββββ
β
ββ
ββ
βββββ
ββββββββββββββββββββββββββ
|
| 190 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: mem_gb ββββββββββββββ
ββββββββββββββ
β
ββββ
β
ββββ
ββ
|
| 193 |
+
wandb: step ββββββββββββββββββββ
β
β
β
β
ββββββββββββββββ
|
| 194 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: +3 ...
|
| 196 |
+
wandb:
|
| 197 |
+
wandb: Run summary:
|
| 198 |
+
wandb: comp_len 409.6
|
| 199 |
+
wandb: cumulative_loss_tokens 18000000
|
| 200 |
+
wandb: epoch 0
|
| 201 |
+
wandb: finish_rate 0.942
|
| 202 |
+
wandb: forward_topk_kl 0.54102
|
| 203 |
+
wandb: grad_norm 0.69141
|
| 204 |
+
wandb: lr 3e-05
|
| 205 |
+
wandb: mem_gb 9.97
|
| 206 |
+
wandb: step 150
|
| 207 |
+
wandb: t_data_s 0
|
| 208 |
+
wandb: +4 ...
|
| 209 |
+
wandb:
|
| 210 |
+
wandb: π View run uniform_keep25_s1226 at: https://wandb.ai/hbfreed/glean-general-grid/runs/35vquuvg
|
| 211 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 212 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 213 |
+
wandb: Find logs at: outputs/healed/grid_general/uniform_keep25_s1226/wandb/run-20260717_172747-35vquuvg/logs
|
healed/grid_general/uniform_keep25_s1226.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/uniform_keep50_s1224.console.log
ADDED
|
@@ -0,0 +1,215 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 6 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep50_s1224/wandb/run-20260718_134414-osqsd9b4
|
| 7 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 8 |
+
wandb: Syncing run uniform_keep50_s1224
|
| 9 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 10 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/osqsd9b4
|
| 11 |
+
|
| 12 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 13 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6917759428766866, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 6.5, "lr": 6e-06, "finish_rate": 0.869, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.0, "frames": {"chat": 259}, "mem_gb": 15.93}
|
| 14 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 15 |
+
[eval step 1] sample: 'To compute the rank of the given 4x4 matrix, we first determine the number of elements (rows) and columns. The matrix given is:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & 16 \\\\\n-9 & 11 & -1 & -10 \\\\\n0 &'
|
| 16 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9499301103445391, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 8.0625, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 348}, "mem_gb": 15.64}
|
| 17 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8424377281524241, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 17.625, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 58.9, "frames": {"chat": 370}, "mem_gb": 15.79}
|
| 18 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4464047732328375, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 3.46875, "lr": 1.5e-05, "finish_rate": 0.852, "comp_len": 491.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 244}, "mem_gb": 16.02}
|
| 19 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6813110845401883, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.5, "lr": 1.8e-05, "finish_rate": 0.953, "comp_len": 375.0, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 57.1, "frames": {"chat": 320}, "mem_gb": 15.94}
|
| 20 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7489079088433335, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 3.421875, "lr": 2.1e-05, "finish_rate": 0.997, "comp_len": 317.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 66.1, "frames": {"chat": 378}, "mem_gb": 15.54}
|
| 21 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8012765964987377, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 2.5, "lr": 2.4e-05, "finish_rate": 0.997, "comp_len": 312.5, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 67.5, "frames": {"chat": 384}, "mem_gb": 16.04}
|
| 22 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6909570617862045, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.9140625, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 370.4, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 63.2, "frames": {"chat": 324}, "mem_gb": 15.88}
|
| 23 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34498201645724474, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.4765625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 502.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 239}, "mem_gb": 16.05}
|
| 24 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6355094303450237, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.4296875, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 306}, "mem_gb": 15.79}
|
| 25 |
+
[eval step 10] sample: "To determine the rank of a given 4x4 matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the steps:\n\n1. **Identify the Matrix:**\n \\[\n "
|
| 26 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6753487973206987, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.1, "t_rollout_s": 0.0, "t_step_s": 65.6, "frames": {"chat": 329}, "mem_gb": 15.83}
|
| 27 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36083462419571977, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 0.9609375, "lr": 3e-05, "finish_rate": 0.882, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 254}, "mem_gb": 16.05}
|
| 28 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5519874217172464, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 1.2578125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.0, "frames": {"chat": 273}, "mem_gb": 16.03}
|
| 29 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2718122292951991, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 508.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.8, "frames": {"chat": 236}, "mem_gb": 15.95}
|
| 30 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6930785834802935, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.2265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 73.3, "frames": {"chat": 381}, "mem_gb": 15.69}
|
| 31 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3040310528299461, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 266}, "mem_gb": 15.88}
|
| 32 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44223287569036085, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.84375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 389.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.2, "frames": {"chat": 308}, "mem_gb": 15.87}
|
| 33 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3663825685930749, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 0.734375, "lr": 3e-05, "finish_rate": 0.853, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 273}, "mem_gb": 16.05}
|
| 34 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5860139168731868, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.8984375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.5, "frames": {"chat": 368}, "mem_gb": 15.68}
|
| 35 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6743619577939312, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.9453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.0, "frames": {"chat": 339}, "mem_gb": 15.93}
|
| 36 |
+
[eval step 20] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's start by writing down the rows of the given matrix:\n\n\\[\n\\begin{bmatr"
|
| 37 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3908682078843315, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.69921875, "lr": 3e-05, "finish_rate": 0.963, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 298}, "mem_gb": 15.85}
|
| 38 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5756209870963047, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.7890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.2, "frames": {"chat": 350}, "mem_gb": 15.57}
|
| 39 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34066299010645595, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.858, "comp_len": 487.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 246}, "mem_gb": 16.02}
|
| 40 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5688138205175598, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.8046875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.9, "frames": {"chat": 375}, "mem_gb": 15.75}
|
| 41 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.577202946131366, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.80078125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 352}, "mem_gb": 15.8}
|
| 42 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5892932344843944, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.8203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 303.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.9, "frames": {"chat": 396}, "mem_gb": 15.76}
|
| 43 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4940694273682932, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.7734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.2, "frames": {"chat": 362}, "mem_gb": 15.61}
|
| 44 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6087611052072918, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 325.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 369}, "mem_gb": 15.82}
|
| 45 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6013093366716057, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 300.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 399}, "mem_gb": 15.67}
|
| 46 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3221179998536284, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.96484375, "lr": 3e-05, "finish_rate": 0.911, "comp_len": 485.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 247}, "mem_gb": 15.95}
|
| 47 |
+
[eval step 30] sample: "To determine the rank of a matrix, we need to find the maximum number of linearly independent rows or columns in the matrix.\n\nLet's break down the matrix step-by-step:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4"
|
| 48 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16846333308269582, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 521.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 230}, "mem_gb": 15.88}
|
| 49 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2899844216653456, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 263}, "mem_gb": 16.05}
|
| 50 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31605170328461873, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.848, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.0, "frames": {"chat": 264}, "mem_gb": 16.04}
|
| 51 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5029458499694243, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.73046875, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.9, "frames": {"chat": 328}, "mem_gb": 15.9}
|
| 52 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28057213364044825, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.925, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 281}, "mem_gb": 15.97}
|
| 53 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23167578200120478, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.861, "comp_len": 506.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 237}, "mem_gb": 15.96}
|
| 54 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2760685826924319, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.91, "comp_len": 431.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 278}, "mem_gb": 16.05}
|
| 55 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5016841662073508, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.955, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 59.5, "frames": {"chat": 310}, "mem_gb": 15.92}
|
| 56 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33654679746535454, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 406.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 295}, "mem_gb": 15.86}
|
| 57 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3634161012196913, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.9, "frames": {"chat": 329}, "mem_gb": 15.87}
|
| 58 |
+
[eval step 40] sample: 'To compute the rank of a matrix, we can use various methods such as Gaussian elimination, which is a systematic method to reduce a matrix to its row-echelon form (REF) or reduced row-echelon form (RRE'
|
| 59 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33847409060771266, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.3, "frames": {"chat": 263}, "mem_gb": 15.99}
|
| 60 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35893658433345454, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.2, "frames": {"chat": 315}, "mem_gb": 15.87}
|
| 61 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.487745441975072, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.4, "frames": {"chat": 354}, "mem_gb": 15.83}
|
| 62 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24089701755438, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.7265625, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 259}, "mem_gb": 16.0}
|
| 63 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.345664977542373, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.92, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.7, "frames": {"chat": 275}, "mem_gb": 15.85}
|
| 64 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46985326585226384, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.7, "frames": {"chat": 334}, "mem_gb": 15.72}
|
| 65 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4985063012317444, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 68.8, "frames": {"chat": 374}, "mem_gb": 15.57}
|
| 66 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4144724924205492, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.8125, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 385.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.9, "frames": {"chat": 311}, "mem_gb": 15.75}
|
| 67 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.360805739873896, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.1, "frames": {"chat": 259}, "mem_gb": 16.05}
|
| 68 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4351383126423384, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 60.3, "frames": {"chat": 305}, "mem_gb": 16.04}
|
| 69 |
+
[eval step 50] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to have rank \\( r \\) if it has \\( r \\) linearly independent rows or colu'
|
| 70 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0050
|
| 71 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40691574598941954, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.946, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.7, "frames": {"chat": 298}, "mem_gb": 16.01}
|
| 72 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5449615391597773, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.73828125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 66.3, "frames": {"chat": 364}, "mem_gb": 15.79}
|
| 73 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3007845638130481, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.9, "frames": {"chat": 302}, "mem_gb": 15.89}
|
| 74 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.545040809216847, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.7, "frames": {"chat": 316}, "mem_gb": 15.65}
|
| 75 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.561124822494636, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.3, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 76 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40858620684330044, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 65.3, "frames": {"chat": 330}, "mem_gb": 15.9}
|
| 77 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3971438911166042, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 321}, "mem_gb": 15.91}
|
| 78 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.424083882328247, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 64.7, "frames": {"chat": 344}, "mem_gb": 15.94}
|
| 79 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4671809927133843, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 69.4, "frames": {"chat": 353}, "mem_gb": 15.61}
|
| 80 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24727104306661835, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.484375, "lr": 3e-05, "finish_rate": 0.89, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 272}, "mem_gb": 16.04}
|
| 81 |
+
[eval step 60] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if the number of linearly independent rows or colu'
|
| 82 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5186026561640203, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 378.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 58.8, "frames": {"chat": 317}, "mem_gb": 15.79}
|
| 83 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25109354469881706, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 292}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.15407238988826671, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.439453125, "lr": 3e-05, "finish_rate": 0.886, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 229}, "mem_gb": 15.9}
|
| 85 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5034606750626738, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 67.9, "frames": {"chat": 359}, "mem_gb": 15.91}
|
| 86 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4569187254007906, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.0, "frames": {"chat": 358}, "mem_gb": 15.64}
|
| 87 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5186631314306209, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 61.5, "frames": {"chat": 315}, "mem_gb": 16.02}
|
| 88 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33726435366347435, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 264}, "mem_gb": 16.09}
|
| 89 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060562888608624, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 63.5, "frames": {"chat": 337}, "mem_gb": 15.76}
|
| 90 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26266643292577935, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 478.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.1, "frames": {"chat": 251}, "mem_gb": 16.05}
|
| 91 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36425970880171904, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 402.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 298}, "mem_gb": 15.78}
|
| 92 |
+
[eval step 70] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Let's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n12"
|
| 93 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30128917100802066, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.5078125, "lr": 3e-05, "finish_rate": 0.917, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 264}, "mem_gb": 16.0}
|
| 94 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3152509652536362, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 305}, "mem_gb": 16.01}
|
| 95 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30717228043780975, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.953, "comp_len": 372.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 322}, "mem_gb": 15.79}
|
| 96 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49717818820203347, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 62.2, "frames": {"chat": 361}, "mem_gb": 15.77}
|
| 97 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33153610016955065, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 373.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 321}, "mem_gb": 15.95}
|
| 98 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3960372977694186, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 307}, "mem_gb": 15.85}
|
| 99 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4837863472050677, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.9, "frames": {"chat": 327}, "mem_gb": 15.94}
|
| 100 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5269268597591669, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.8, "frames": {"chat": 356}, "mem_gb": 15.56}
|
| 101 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2676410052911689, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.915, "comp_len": 424.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 283}, "mem_gb": 15.9}
|
| 102 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4805018970411892, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.998, "comp_len": 299.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.1, "frames": {"chat": 401}, "mem_gb": 15.66}
|
| 103 |
+
[eval step 80] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix:\n\n\\[\n\\begin{bmatrix}\n12 & -16 & 4 & "
|
| 104 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3271545289649007, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 288}, "mem_gb": 15.85}
|
| 105 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40884810679629446, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.1, "frames": {"chat": 323}, "mem_gb": 15.89}
|
| 106 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5308478646889329, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.71484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.2, "frames": {"chat": 336}, "mem_gb": 15.78}
|
| 107 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45252310228614756, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 329}, "mem_gb": 15.69}
|
| 108 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4381400734625136, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 343}, "mem_gb": 15.67}
|
| 109 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45893981260582806, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 336}, "mem_gb": 15.79}
|
| 110 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4356501762141784, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.984, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 314}, "mem_gb": 16.03}
|
| 111 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2798701721932118, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 427.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 281}, "mem_gb": 15.86}
|
| 112 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35120579899698495, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 299}, "mem_gb": 15.74}
|
| 113 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4144783515694241, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 328}, "mem_gb": 15.93}
|
| 114 |
+
[eval step 90] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n \\[\n \\begin{bmat"
|
| 115 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3248693922109281, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.919, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 271}, "mem_gb": 16.03}
|
| 116 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3479275345440954, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.874, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.0, "frames": {"chat": 269}, "mem_gb": 16.13}
|
| 117 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5135209150403738, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 324.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 370}, "mem_gb": 15.68}
|
| 118 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5469659753783296, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 352}, "mem_gb": 15.74}
|
| 119 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4665497402111689, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 330}, "mem_gb": 15.94}
|
| 120 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40783421545452436, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 334}, "mem_gb": 15.66}
|
| 121 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3970873003952826, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 357.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 336}, "mem_gb": 15.8}
|
| 122 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29955487959031013, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 388.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.3, "frames": {"chat": 309}, "mem_gb": 15.89}
|
| 123 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4877876743291815, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 306.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 391}, "mem_gb": 15.77}
|
| 124 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2707466459552447, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.83, "comp_len": 454.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.2, "frames": {"chat": 264}, "mem_gb": 16.17}
|
| 125 |
+
[eval step 100] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is said to be of rank \\( r \\) if it has \\( r \\) linearly independent rows or col'
|
| 126 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0100
|
| 127 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4195987428303808, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.2, "frames": {"chat": 349}, "mem_gb": 15.72}
|
| 128 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3913418374637142, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 312}, "mem_gb": 15.78}
|
| 129 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16448741336986422, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.419921875, "lr": 3e-05, "finish_rate": 0.817, "comp_len": 524.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.6, "frames": {"chat": 229}, "mem_gb": 16.04}
|
| 130 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37604722545544306, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.938, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 288}, "mem_gb": 16.05}
|
| 131 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.489004408040829, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 351}, "mem_gb": 15.7}
|
| 132 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2118576814339186, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.812, "comp_len": 538.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.5, "frames": {"chat": 223}, "mem_gb": 16.07}
|
| 133 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1234707356864897, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.380859375, "lr": 3e-05, "finish_rate": 0.793, "comp_len": 563.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 35.0, "frames": {"chat": 213}, "mem_gb": 16.03}
|
| 134 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.471965583872733, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 380}, "mem_gb": 15.88}
|
| 135 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2796549871960034, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.893, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 38.9, "frames": {"chat": 271}, "mem_gb": 16.07}
|
| 136 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4911319158003355, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 352.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 340}, "mem_gb": 15.96}
|
| 137 |
+
[eval step 110] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. In this case, we have a 4x4 matrix.\n\nLet's represent the matrix as follows:\n\n\\[\nA = \\begi"
|
| 138 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49902623601458035, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 366}, "mem_gb": 15.66}
|
| 139 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1930453141957211, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.43359375, "lr": 3e-05, "finish_rate": 0.854, "comp_len": 515.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.5, "frames": {"chat": 233}, "mem_gb": 16.05}
|
| 140 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34603738884702323, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 312}, "mem_gb": 15.91}
|
| 141 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4646876655772949, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.9, "frames": {"chat": 363}, "mem_gb": 15.62}
|
| 142 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46944885184479257, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 323}, "mem_gb": 15.9}
|
| 143 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5033070187690978, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.4, "frames": {"chat": 346}, "mem_gb": 15.64}
|
| 144 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46177769342667113, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.975, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 318}, "mem_gb": 15.79}
|
| 145 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.36559325879625976, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.935, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 275}, "mem_gb": 15.97}
|
| 146 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4453597818657756, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 345}, "mem_gb": 15.72}
|
| 147 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43486473662207525, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 318.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.2, "frames": {"chat": 377}, "mem_gb": 15.86}
|
| 148 |
+
[eval step 120] sample: 'To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns. A matrix is rank-deficient if it has fewer linearly independent rows or columns than its '
|
| 149 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3694714881522581, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 294}, "mem_gb": 16.09}
|
| 150 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4925790473555525, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 338}, "mem_gb": 15.78}
|
| 151 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4942110770324866, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 352}, "mem_gb": 15.68}
|
| 152 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4440446032938858, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 347}, "mem_gb": 15.73}
|
| 153 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3025292081457252, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.5, "frames": {"chat": 310}, "mem_gb": 15.71}
|
| 154 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5147223067736874, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 358}, "mem_gb": 15.74}
|
| 155 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31496750627619524, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.947, "comp_len": 376.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 319}, "mem_gb": 16.01}
|
| 156 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.22119880944999556, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.46875, "lr": 3e-05, "finish_rate": 0.9, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.0, "frames": {"chat": 269}, "mem_gb": 16.05}
|
| 157 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3810055477776254, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.974, "comp_len": 387.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 310}, "mem_gb": 15.9}
|
| 158 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.275449989147267, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.834, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 259}, "mem_gb": 16.08}
|
| 159 |
+
[eval step 130] sample: "To find the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. \n\nLet's represent the given 4x4 matrix as follows:\n\n\\[\nA = \\begin{bmatrix}\n"
|
| 160 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27469143630973997, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.51953125, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.5, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 161 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49383658517226575, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 337}, "mem_gb": 15.6}
|
| 162 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2858842681933194, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 413.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 290}, "mem_gb": 15.86}
|
| 163 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42380685371415067, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 343.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 349}, "mem_gb": 15.79}
|
| 164 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2827025428744033, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.928, "comp_len": 412.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 291}, "mem_gb": 15.89}
|
| 165 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44822633866084116, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 342}, "mem_gb": 15.76}
|
| 166 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49938472879038504, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 355.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 338}, "mem_gb": 15.7}
|
| 167 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.492944224542814, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 356}, "mem_gb": 15.67}
|
| 168 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2609467014649262, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.86, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.1, "frames": {"chat": 265}, "mem_gb": 16.05}
|
| 169 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4059377191117654, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.62890625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.3, "frames": {"chat": 353}, "mem_gb": 15.76}
|
| 170 |
+
[eval step 140] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
|
| 171 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3910453383545081, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.949, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.5, "frames": {"chat": 316}, "mem_gb": 15.95}
|
| 172 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3369911602856281, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.945, "comp_len": 415.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 289}, "mem_gb": 16.1}
|
| 173 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35459049528371545, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.56640625, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 331}, "mem_gb": 15.74}
|
| 174 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3481748200963562, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.57421875, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 375.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.6, "frames": {"chat": 320}, "mem_gb": 16.05}
|
| 175 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3090666974460706, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.941, "comp_len": 441.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 272}, "mem_gb": 15.79}
|
| 176 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5301194600745104, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 368}, "mem_gb": 15.7}
|
| 177 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4325976529110844, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 365.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 328}, "mem_gb": 15.73}
|
| 178 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4370371102225035, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 368.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.8, "frames": {"chat": 326}, "mem_gb": 15.95}
|
| 179 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4871703383412212, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.67578125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 329.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 364}, "mem_gb": 15.89}
|
| 180 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31749200204570466, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 405.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 296}, "mem_gb": 15.93}
|
| 181 |
+
[eval step 150] sample: "To compute the rank of a matrix, we need to determine the maximum number of linearly independent rows or columns in the matrix. Here's how we can do it step-by-step:\n\n1. **Write down the matrix:**\n "
|
| 182 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1224/step0150
|
| 183 |
+
wandb: updating run metadata
|
| 184 |
+
wandb: uploading summary, console lines 171-171
|
| 185 |
+
wandb:
|
| 186 |
+
wandb: Run history:
|
| 187 |
+
wandb: comp_len ββββ
β
β
ββββ
βββ
β
β
ββββ
ββββββββ
βββ
βββββ
βββββ
|
| 188 |
+
wandb: cumulative_loss_tokens βββββββββββββββββββ
β
β
β
ββββββββββββββββββ
|
| 189 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 190 |
+
wandb: finish_rate ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: forward_topk_kl ββββ
ββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: lr βββ
β
ββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: mem_gb β
ββ
ββββ
ββ
ββ
βββ
βββββββββββ
βββββββ
βββ
βββββ
|
| 195 |
+
wandb: step ββββββββββββββββββββ
β
β
β
β
β
βββββββββββββββ
|
| 196 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 197 |
+
wandb: +3 ...
|
| 198 |
+
wandb:
|
| 199 |
+
wandb: Run summary:
|
| 200 |
+
wandb: comp_len 405.4
|
| 201 |
+
wandb: cumulative_loss_tokens 18000000
|
| 202 |
+
wandb: epoch 0
|
| 203 |
+
wandb: finish_rate 0.97
|
| 204 |
+
wandb: forward_topk_kl 0.31749
|
| 205 |
+
wandb: grad_norm 0.53125
|
| 206 |
+
wandb: lr 3e-05
|
| 207 |
+
wandb: mem_gb 15.93
|
| 208 |
+
wandb: step 150
|
| 209 |
+
wandb: t_data_s 0
|
| 210 |
+
wandb: +4 ...
|
| 211 |
+
wandb:
|
| 212 |
+
wandb: π View run uniform_keep50_s1224 at: https://wandb.ai/hbfreed/glean-general-grid/runs/osqsd9b4
|
| 213 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 214 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 215 |
+
wandb: Find logs at: outputs/healed/grid_general/uniform_keep50_s1224/wandb/run-20260718_134414-osqsd9b4/logs
|
healed/grid_general/uniform_keep50_s1224.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|
healed/grid_general/uniform_keep50_s1225.console.log
ADDED
|
@@ -0,0 +1,216 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
/home/henry/Documents/PythonProjects/variable-reap/.venv/lib/python3.12/site-packages/megablocks/grouped_gemm_util.py:10: UserWarning: Grouped GEMM not available.
|
| 2 |
+
warnings.warn('Grouped GEMM not available.')
|
| 3 |
+
wandb: [wandb.login()] Loaded credentials for https://api.wandb.ai from /home/henry/.netrc.
|
| 4 |
+
wandb: Currently logged in as: hbfreed to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
|
| 5 |
+
wandb: setting up run 056290eo
|
| 6 |
+
wandb: Tracking run with wandb version 0.28.0
|
| 7 |
+
wandb: Run data is saved locally in outputs/healed/grid_general/uniform_keep50_s1225/wandb/run-20260718_124640-056290eo
|
| 8 |
+
wandb: Run `wandb offline` to turn off syncing.
|
| 9 |
+
wandb: Syncing run uniform_keep50_s1225
|
| 10 |
+
wandb: βοΈ View project at https://wandb.ai/hbfreed/glean-general-grid
|
| 11 |
+
wandb: π View run at https://wandb.ai/hbfreed/glean-general-grid/runs/056290eo
|
| 12 |
+
|
| 13 |
+
58360 cached top-128 chat trajectories / 22,295,631 unique tokens | 185 steps/epoch | 150 total steps | student params 3.70B | teacher overlap=False
|
| 14 |
+
{"step": 1, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0012346531342715, "tokens": 120000, "cumulative_loss_tokens": 120000, "grad_norm": 8.625, "lr": 6e-06, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 331}, "mem_gb": 15.8}
|
| 15 |
+
The attention mask is not set and cannot be inferred from input because pad token is same as eos token. As a consequence, you may observe unexpected behavior. Please pass your input's `attention_mask` to obtain reliable results.
|
| 16 |
+
[eval step 1] sample: 'To solve this problem, we need to consider both the monthly savings and the interest earned each month.\n\n1. **Initial Savings:** Jamie starts with $50,000.\n\n2. **Total Goal:** Jamie aims to reach $1,0'
|
| 17 |
+
{"step": 2, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.9385142022331555, "tokens": 120000, "cumulative_loss_tokens": 240000, "grad_norm": 7.6875, "lr": 9e-06, "finish_rate": 0.997, "comp_len": 350.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.5, "frames": {"chat": 342}, "mem_gb": 15.67}
|
| 18 |
+
{"step": 3, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 1.0037555417033532, "tokens": 120000, "cumulative_loss_tokens": 360000, "grad_norm": 6.9375, "lr": 1.2e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.1, "frames": {"chat": 358}, "mem_gb": 15.71}
|
| 19 |
+
{"step": 4, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.8459829939559103, "tokens": 120000, "cumulative_loss_tokens": 480000, "grad_norm": 4.84375, "lr": 1.5e-05, "finish_rate": 0.997, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.4, "frames": {"chat": 344}, "mem_gb": 15.79}
|
| 20 |
+
{"step": 5, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5818770413972437, "tokens": 120000, "cumulative_loss_tokens": 600000, "grad_norm": 3.078125, "lr": 1.8e-05, "finish_rate": 0.861, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 267}, "mem_gb": 16.11}
|
| 21 |
+
{"step": 6, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33641571484518545, "tokens": 120000, "cumulative_loss_tokens": 720000, "grad_norm": 2.046875, "lr": 2.1e-05, "finish_rate": 0.835, "comp_len": 483.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 248}, "mem_gb": 15.94}
|
| 22 |
+
{"step": 7, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7034493155685564, "tokens": 120000, "cumulative_loss_tokens": 840000, "grad_norm": 2.109375, "lr": 2.4e-05, "finish_rate": 0.979, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.2, "frames": {"chat": 329}, "mem_gb": 15.93}
|
| 23 |
+
{"step": 8, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7088763666328043, "tokens": 120000, "cumulative_loss_tokens": 960000, "grad_norm": 1.8125, "lr": 2.7000000000000002e-05, "finish_rate": 0.997, "comp_len": 354.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.8, "frames": {"chat": 339}, "mem_gb": 15.89}
|
| 24 |
+
{"step": 9, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.7796795962753396, "tokens": 120000, "cumulative_loss_tokens": 1080000, "grad_norm": 1.78125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 354}, "mem_gb": 15.89}
|
| 25 |
+
{"step": 10, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47490170586556196, "tokens": 120000, "cumulative_loss_tokens": 1200000, "grad_norm": 1.4140625, "lr": 3e-05, "finish_rate": 0.943, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 279}, "mem_gb": 16.02}
|
| 26 |
+
[eval step 10] sample: 'To determine how many months it will take for Jamie to reach their goal of $1,000,000, we need to consider both the amount saved and the interest earned each month.\n\n1. **Initial Savings:**\n Jamie s'
|
| 27 |
+
{"step": 11, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5603851036655406, "tokens": 120000, "cumulative_loss_tokens": 1320000, "grad_norm": 1.3671875, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 318}, "mem_gb": 15.95}
|
| 28 |
+
{"step": 12, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40979289957657455, "tokens": 120000, "cumulative_loss_tokens": 1440000, "grad_norm": 1.0390625, "lr": 3e-05, "finish_rate": 0.875, "comp_len": 452.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 265}, "mem_gb": 16.04}
|
| 29 |
+
{"step": 13, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3842074246103565, "tokens": 120000, "cumulative_loss_tokens": 1560000, "grad_norm": 0.90234375, "lr": 3e-05, "finish_rate": 0.85, "comp_len": 472.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.3, "frames": {"chat": 254}, "mem_gb": 15.98}
|
| 30 |
+
{"step": 14, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5093685679781561, "tokens": 120000, "cumulative_loss_tokens": 1680000, "grad_norm": 0.98046875, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 381.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 315}, "mem_gb": 16.01}
|
| 31 |
+
{"step": 15, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6256126999858767, "tokens": 120000, "cumulative_loss_tokens": 1800000, "grad_norm": 1.0078125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 300}, "mem_gb": 15.81}
|
| 32 |
+
{"step": 16, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4590370270299415, "tokens": 120000, "cumulative_loss_tokens": 1920000, "grad_norm": 0.921875, "lr": 3e-05, "finish_rate": 0.924, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 276}, "mem_gb": 16.01}
|
| 33 |
+
{"step": 17, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6408972399981071, "tokens": 120000, "cumulative_loss_tokens": 2040000, "grad_norm": 0.97265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 356}, "mem_gb": 15.95}
|
| 34 |
+
{"step": 18, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6301721393890679, "tokens": 120000, "cumulative_loss_tokens": 2160000, "grad_norm": 1.0, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.1, "frames": {"chat": 304}, "mem_gb": 15.77}
|
| 35 |
+
{"step": 19, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6149119366053492, "tokens": 120000, "cumulative_loss_tokens": 2280000, "grad_norm": 0.93359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 320.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 375}, "mem_gb": 15.68}
|
| 36 |
+
{"step": 20, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35782394987605515, "tokens": 120000, "cumulative_loss_tokens": 2400000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.2, "frames": {"chat": 294}, "mem_gb": 16.04}
|
| 37 |
+
[eval step 20] sample: 'To solve this problem, we need to determine how many months it will take Jamie to reach their savings goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: Calculate Tota'
|
| 38 |
+
{"step": 21, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5508201285784443, "tokens": 120000, "cumulative_loss_tokens": 2520000, "grad_norm": 0.78515625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 299}, "mem_gb": 16.05}
|
| 39 |
+
{"step": 22, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4347093193060408, "tokens": 120000, "cumulative_loss_tokens": 2640000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 393.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.9, "frames": {"chat": 305}, "mem_gb": 15.83}
|
| 40 |
+
{"step": 23, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2738246406914666, "tokens": 120000, "cumulative_loss_tokens": 2760000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.931, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 262}, "mem_gb": 15.89}
|
| 41 |
+
{"step": 24, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.37393212966720263, "tokens": 120000, "cumulative_loss_tokens": 2880000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 396.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 303}, "mem_gb": 15.94}
|
| 42 |
+
{"step": 25, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5675287476661305, "tokens": 120000, "cumulative_loss_tokens": 3000000, "grad_norm": 0.89453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 380}, "mem_gb": 15.82}
|
| 43 |
+
{"step": 26, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3302096474437043, "tokens": 120000, "cumulative_loss_tokens": 3120000, "grad_norm": 0.640625, "lr": 3e-05, "finish_rate": 0.95, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 282}, "mem_gb": 15.78}
|
| 44 |
+
{"step": 27, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.529561648986737, "tokens": 120000, "cumulative_loss_tokens": 3240000, "grad_norm": 0.83203125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 331.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 362}, "mem_gb": 15.79}
|
| 45 |
+
{"step": 28, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5250675880373766, "tokens": 120000, "cumulative_loss_tokens": 3360000, "grad_norm": 0.80859375, "lr": 3e-05, "finish_rate": 0.967, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.4, "frames": {"chat": 307}, "mem_gb": 16.04}
|
| 46 |
+
{"step": 29, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3746533786466345, "tokens": 120000, "cumulative_loss_tokens": 3480000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.926, "comp_len": 425.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.0, "frames": {"chat": 282}, "mem_gb": 15.9}
|
| 47 |
+
{"step": 30, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5301477026427165, "tokens": 120000, "cumulative_loss_tokens": 3600000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.979, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 337}, "mem_gb": 15.93}
|
| 48 |
+
[eval step 30] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned in the investment account.\n\n**Step 1: Calculat'
|
| 49 |
+
{"step": 31, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3571854299719135, "tokens": 120000, "cumulative_loss_tokens": 3720000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 436.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.7, "frames": {"chat": 275}, "mem_gb": 15.99}
|
| 50 |
+
{"step": 32, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5787230650416265, "tokens": 120000, "cumulative_loss_tokens": 3840000, "grad_norm": 0.77734375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 318}, "mem_gb": 15.8}
|
| 51 |
+
{"step": 33, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.602699743715922, "tokens": 120000, "cumulative_loss_tokens": 3960000, "grad_norm": 0.82421875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 311.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.9, "frames": {"chat": 385}, "mem_gb": 15.83}
|
| 52 |
+
{"step": 34, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.6341000456605107, "tokens": 120000, "cumulative_loss_tokens": 4080000, "grad_norm": 0.81640625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 316}, "mem_gb": 15.78}
|
| 53 |
+
{"step": 35, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30473607964788874, "tokens": 120000, "cumulative_loss_tokens": 4200000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.887, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 266}, "mem_gb": 16.07}
|
| 54 |
+
{"step": 36, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.572544208825628, "tokens": 120000, "cumulative_loss_tokens": 4320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 371}, "mem_gb": 15.8}
|
| 55 |
+
{"step": 37, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32806760044911254, "tokens": 120000, "cumulative_loss_tokens": 4440000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 458.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.8, "frames": {"chat": 262}, "mem_gb": 16.01}
|
| 56 |
+
{"step": 38, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5710632975555956, "tokens": 120000, "cumulative_loss_tokens": 4560000, "grad_norm": 0.75, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.5, "frames": {"chat": 348}, "mem_gb": 15.83}
|
| 57 |
+
{"step": 39, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.16166681660910448, "tokens": 120000, "cumulative_loss_tokens": 4680000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.811, "comp_len": 540.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 36.9, "frames": {"chat": 222}, "mem_gb": 16.07}
|
| 58 |
+
{"step": 40, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5282641408917804, "tokens": 120000, "cumulative_loss_tokens": 4800000, "grad_norm": 0.74609375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 294.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 57.0, "frames": {"chat": 408}, "mem_gb": 15.64}
|
| 59 |
+
[eval step 40] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
|
| 60 |
+
{"step": 41, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5181830599565059, "tokens": 120000, "cumulative_loss_tokens": 4920000, "grad_norm": 4.28125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.8, "frames": {"chat": 334}, "mem_gb": 15.7}
|
| 61 |
+
{"step": 42, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3118452249342576, "tokens": 120000, "cumulative_loss_tokens": 5040000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 384.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.9, "frames": {"chat": 312}, "mem_gb": 15.75}
|
| 62 |
+
{"step": 43, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5060255770319763, "tokens": 120000, "cumulative_loss_tokens": 5160000, "grad_norm": 0.72265625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 352}, "mem_gb": 15.73}
|
| 63 |
+
{"step": 44, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46762468524898093, "tokens": 120000, "cumulative_loss_tokens": 5280000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 323.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 371}, "mem_gb": 15.55}
|
| 64 |
+
{"step": 45, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.34022865317029255, "tokens": 120000, "cumulative_loss_tokens": 5400000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.898, "comp_len": 422.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 284}, "mem_gb": 15.99}
|
| 65 |
+
{"step": 46, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2705740574412048, "tokens": 120000, "cumulative_loss_tokens": 5520000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 418.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.5, "frames": {"chat": 287}, "mem_gb": 16.06}
|
| 66 |
+
{"step": 47, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25679682421001293, "tokens": 120000, "cumulative_loss_tokens": 5640000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.916, "comp_len": 421.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.6, "frames": {"chat": 285}, "mem_gb": 15.95}
|
| 67 |
+
{"step": 48, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.19977544261639316, "tokens": 120000, "cumulative_loss_tokens": 5760000, "grad_norm": 0.482421875, "lr": 3e-05, "finish_rate": 0.873, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.6, "frames": {"chat": 252}, "mem_gb": 16.04}
|
| 68 |
+
{"step": 49, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5010628154355412, "tokens": 120000, "cumulative_loss_tokens": 5880000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 333.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 360}, "mem_gb": 15.84}
|
| 69 |
+
{"step": 50, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.520745706422627, "tokens": 120000, "cumulative_loss_tokens": 6000000, "grad_norm": 0.71875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 359}, "mem_gb": 15.83}
|
| 70 |
+
[eval step 50] sample: 'To determine how many months it will take Jamie to reach their goal of $1,000,000, we need to consider both their monthly savings and the interest earned from their investment account.\n\n**Step 1: Calc'
|
| 71 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0050
|
| 72 |
+
{"step": 51, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5451169537675257, "tokens": 120000, "cumulative_loss_tokens": 6120000, "grad_norm": 0.69140625, "lr": 3e-05, "finish_rate": 1.0, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 363}, "mem_gb": 15.58}
|
| 73 |
+
{"step": 52, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49252958696633575, "tokens": 120000, "cumulative_loss_tokens": 6240000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 332.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 361}, "mem_gb": 15.67}
|
| 74 |
+
{"step": 53, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32162735090740024, "tokens": 120000, "cumulative_loss_tokens": 6360000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.944, "comp_len": 419.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.0, "frames": {"chat": 286}, "mem_gb": 15.86}
|
| 75 |
+
{"step": 54, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5231256723885734, "tokens": 120000, "cumulative_loss_tokens": 6480000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 327.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.5, "frames": {"chat": 367}, "mem_gb": 15.71}
|
| 76 |
+
{"step": 55, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5570450429181258, "tokens": 120000, "cumulative_loss_tokens": 6600000, "grad_norm": 0.703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 340.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.1, "frames": {"chat": 352}, "mem_gb": 15.74}
|
| 77 |
+
{"step": 56, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.35708660811726006, "tokens": 120000, "cumulative_loss_tokens": 6720000, "grad_norm": 0.5859375, "lr": 3e-05, "finish_rate": 0.962, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.7, "frames": {"chat": 314}, "mem_gb": 15.69}
|
| 78 |
+
{"step": 57, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46920198745789626, "tokens": 120000, "cumulative_loss_tokens": 6840000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 322.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 372}, "mem_gb": 15.66}
|
| 79 |
+
{"step": 58, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4539165943020334, "tokens": 120000, "cumulative_loss_tokens": 6960000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.2, "frames": {"chat": 334}, "mem_gb": 15.81}
|
| 80 |
+
{"step": 59, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5307956311500942, "tokens": 120000, "cumulative_loss_tokens": 7080000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 326.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 368}, "mem_gb": 15.76}
|
| 81 |
+
{"step": 60, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43559490257781, "tokens": 120000, "cumulative_loss_tokens": 7200000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.6, "frames": {"chat": 354}, "mem_gb": 15.9}
|
| 82 |
+
[eval step 60] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
|
| 83 |
+
{"step": 61, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2686170203344276, "tokens": 120000, "cumulative_loss_tokens": 7320000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.973, "comp_len": 409.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 293}, "mem_gb": 15.79}
|
| 84 |
+
{"step": 62, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20221849255630125, "tokens": 120000, "cumulative_loss_tokens": 7440000, "grad_norm": 0.7578125, "lr": 3e-05, "finish_rate": 0.835, "comp_len": 519.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.7, "frames": {"chat": 231}, "mem_gb": 15.95}
|
| 85 |
+
{"step": 63, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40390469683346647, "tokens": 120000, "cumulative_loss_tokens": 7560000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.9, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 86 |
+
{"step": 64, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2807617226639452, "tokens": 120000, "cumulative_loss_tokens": 7680000, "grad_norm": 0.53515625, "lr": 3e-05, "finish_rate": 0.878, "comp_len": 456.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.1, "frames": {"chat": 263}, "mem_gb": 16.06}
|
| 87 |
+
{"step": 65, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30110994513953726, "tokens": 120000, "cumulative_loss_tokens": 7800000, "grad_norm": 0.55078125, "lr": 3e-05, "finish_rate": 0.889, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 252}, "mem_gb": 16.0}
|
| 88 |
+
{"step": 66, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4256488866146654, "tokens": 120000, "cumulative_loss_tokens": 7920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.968, "comp_len": 348.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 344}, "mem_gb": 16.02}
|
| 89 |
+
{"step": 67, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4049425716850907, "tokens": 120000, "cumulative_loss_tokens": 8040000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.981, "comp_len": 383.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.9, "frames": {"chat": 313}, "mem_gb": 15.95}
|
| 90 |
+
{"step": 68, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4563928933361545, "tokens": 120000, "cumulative_loss_tokens": 8160000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.992, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.3, "frames": {"chat": 358}, "mem_gb": 15.65}
|
| 91 |
+
{"step": 69, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23694792136109125, "tokens": 120000, "cumulative_loss_tokens": 8280000, "grad_norm": 0.48046875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.1, "frames": {"chat": 267}, "mem_gb": 15.87}
|
| 92 |
+
{"step": 70, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4430929536218445, "tokens": 120000, "cumulative_loss_tokens": 8400000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.4, "frames": {"chat": 300}, "mem_gb": 15.75}
|
| 93 |
+
[eval step 70] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned in their inve'
|
| 94 |
+
{"step": 71, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3831142380286629, "tokens": 120000, "cumulative_loss_tokens": 8520000, "grad_norm": 0.59375, "lr": 3e-05, "finish_rate": 0.994, "comp_len": 344.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 348}, "mem_gb": 15.68}
|
| 95 |
+
{"step": 72, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4549709947705269, "tokens": 120000, "cumulative_loss_tokens": 8640000, "grad_norm": 0.6171875, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 364.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 329}, "mem_gb": 15.77}
|
| 96 |
+
{"step": 73, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26410754793292535, "tokens": 120000, "cumulative_loss_tokens": 8760000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 446.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.7, "frames": {"chat": 269}, "mem_gb": 15.93}
|
| 97 |
+
{"step": 74, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5040003249824047, "tokens": 120000, "cumulative_loss_tokens": 8880000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 358}, "mem_gb": 15.6}
|
| 98 |
+
{"step": 75, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3173010088674724, "tokens": 120000, "cumulative_loss_tokens": 9000000, "grad_norm": 0.58203125, "lr": 3e-05, "finish_rate": 0.96, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 302}, "mem_gb": 15.86}
|
| 99 |
+
{"step": 76, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4850937694136053, "tokens": 120000, "cumulative_loss_tokens": 9120000, "grad_norm": 0.76171875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 315.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.3, "frames": {"chat": 381}, "mem_gb": 15.88}
|
| 100 |
+
{"step": 77, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5240150058401127, "tokens": 120000, "cumulative_loss_tokens": 9240000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 316.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 56.9, "frames": {"chat": 379}, "mem_gb": 15.82}
|
| 101 |
+
{"step": 78, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.49111645895807693, "tokens": 120000, "cumulative_loss_tokens": 9360000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 341.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.5, "frames": {"chat": 351}, "mem_gb": 15.64}
|
| 102 |
+
{"step": 79, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4485870735513046, "tokens": 120000, "cumulative_loss_tokens": 9480000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 330}, "mem_gb": 15.84}
|
| 103 |
+
{"step": 80, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46085613527130337, "tokens": 120000, "cumulative_loss_tokens": 9600000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.991, "comp_len": 379.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 316}, "mem_gb": 15.87}
|
| 104 |
+
[eval step 80] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned from their in'
|
| 105 |
+
{"step": 81, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32372822478388746, "tokens": 120000, "cumulative_loss_tokens": 9720000, "grad_norm": 0.60546875, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 434.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.0, "frames": {"chat": 276}, "mem_gb": 16.05}
|
| 106 |
+
{"step": 82, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.26338743491986144, "tokens": 120000, "cumulative_loss_tokens": 9840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.833, "comp_len": 500.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.9, "frames": {"chat": 240}, "mem_gb": 15.99}
|
| 107 |
+
{"step": 83, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3104773192297357, "tokens": 120000, "cumulative_loss_tokens": 9960000, "grad_norm": 0.515625, "lr": 3e-05, "finish_rate": 0.948, "comp_len": 416.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.6, "frames": {"chat": 288}, "mem_gb": 15.9}
|
| 108 |
+
{"step": 84, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28786528626879054, "tokens": 120000, "cumulative_loss_tokens": 10080000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.937, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 271}, "mem_gb": 15.89}
|
| 109 |
+
{"step": 85, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4272922734250625, "tokens": 120000, "cumulative_loss_tokens": 10200000, "grad_norm": 0.66015625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 336.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.6, "frames": {"chat": 357}, "mem_gb": 15.84}
|
| 110 |
+
{"step": 86, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5244793712583992, "tokens": 120000, "cumulative_loss_tokens": 10320000, "grad_norm": 0.7109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.9, "frames": {"chat": 354}, "mem_gb": 15.82}
|
| 111 |
+
{"step": 87, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.497002431950594, "tokens": 120000, "cumulative_loss_tokens": 10440000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.927, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 302}, "mem_gb": 16.05}
|
| 112 |
+
{"step": 88, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40084390570086736, "tokens": 120000, "cumulative_loss_tokens": 10560000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 404.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.6, "frames": {"chat": 297}, "mem_gb": 16.04}
|
| 113 |
+
{"step": 89, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.1671384889056906, "tokens": 120000, "cumulative_loss_tokens": 10680000, "grad_norm": 0.451171875, "lr": 3e-05, "finish_rate": 0.799, "comp_len": 547.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.2, "frames": {"chat": 219}, "mem_gb": 16.06}
|
| 114 |
+
{"step": 90, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4976568130111322, "tokens": 120000, "cumulative_loss_tokens": 10800000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.99, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.1, "frames": {"chat": 306}, "mem_gb": 15.76}
|
| 115 |
+
[eval step 90] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned in their inve'
|
| 116 |
+
{"step": 91, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5134388975558182, "tokens": 120000, "cumulative_loss_tokens": 10920000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 343}, "mem_gb": 15.7}
|
| 117 |
+
{"step": 92, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48674780464582146, "tokens": 120000, "cumulative_loss_tokens": 11040000, "grad_norm": 0.671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 351.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 341}, "mem_gb": 15.82}
|
| 118 |
+
{"step": 93, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29540639702435584, "tokens": 120000, "cumulative_loss_tokens": 11160000, "grad_norm": 0.58984375, "lr": 3e-05, "finish_rate": 0.965, "comp_len": 377.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.4, "frames": {"chat": 318}, "mem_gb": 15.76}
|
| 119 |
+
{"step": 94, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5128412952416886, "tokens": 120000, "cumulative_loss_tokens": 11280000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.0, "frames": {"chat": 346}, "mem_gb": 15.65}
|
| 120 |
+
{"step": 95, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27761117947349945, "tokens": 120000, "cumulative_loss_tokens": 11400000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.841, "comp_len": 433.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.2, "frames": {"chat": 277}, "mem_gb": 16.13}
|
| 121 |
+
{"step": 96, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27264862833109993, "tokens": 120000, "cumulative_loss_tokens": 11520000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.956, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.5, "frames": {"chat": 270}, "mem_gb": 15.86}
|
| 122 |
+
{"step": 97, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.31827018664634477, "tokens": 120000, "cumulative_loss_tokens": 11640000, "grad_norm": 0.5625, "lr": 3e-05, "finish_rate": 0.903, "comp_len": 466.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.4, "frames": {"chat": 257}, "mem_gb": 16.04}
|
| 123 |
+
{"step": 98, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.47749692158599694, "tokens": 120000, "cumulative_loss_tokens": 11760000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.9, "frames": {"chat": 363}, "mem_gb": 15.65}
|
| 124 |
+
{"step": 99, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48287020946058135, "tokens": 120000, "cumulative_loss_tokens": 11880000, "grad_norm": 0.6484375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 356}, "mem_gb": 15.79}
|
| 125 |
+
{"step": 100, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4437348078371336, "tokens": 120000, "cumulative_loss_tokens": 12000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.8, "frames": {"chat": 323}, "mem_gb": 15.82}
|
| 126 |
+
[eval step 100] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
|
| 127 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0100
|
| 128 |
+
{"step": 101, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25946648542390516, "tokens": 120000, "cumulative_loss_tokens": 12120000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.868, "comp_len": 493.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.3, "frames": {"chat": 243}, "mem_gb": 16.07}
|
| 129 |
+
{"step": 102, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4500130487319082, "tokens": 120000, "cumulative_loss_tokens": 12240000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 390.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.5, "frames": {"chat": 307}, "mem_gb": 15.75}
|
| 130 |
+
{"step": 103, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4234158966309391, "tokens": 120000, "cumulative_loss_tokens": 12360000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.988, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.7, "frames": {"chat": 346}, "mem_gb": 15.99}
|
| 131 |
+
{"step": 104, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29989352034293115, "tokens": 120000, "cumulative_loss_tokens": 12480000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.905, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.9, "frames": {"chat": 273}, "mem_gb": 15.99}
|
| 132 |
+
{"step": 105, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.30325903337032845, "tokens": 120000, "cumulative_loss_tokens": 12600000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.957, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.3, "frames": {"chat": 302}, "mem_gb": 15.92}
|
| 133 |
+
{"step": 106, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.418143850972224, "tokens": 120000, "cumulative_loss_tokens": 12720000, "grad_norm": 0.6015625, "lr": 3e-05, "finish_rate": 0.97, "comp_len": 356.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.6, "frames": {"chat": 337}, "mem_gb": 16.05}
|
| 134 |
+
{"step": 107, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3265084335938096, "tokens": 120000, "cumulative_loss_tokens": 12840000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.914, "comp_len": 428.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.4, "frames": {"chat": 280}, "mem_gb": 15.93}
|
| 135 |
+
{"step": 108, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5198403450977678, "tokens": 120000, "cumulative_loss_tokens": 12960000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.6, "frames": {"chat": 331}, "mem_gb": 15.83}
|
| 136 |
+
{"step": 109, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.343602961318319, "tokens": 120000, "cumulative_loss_tokens": 13080000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 382.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.4, "frames": {"chat": 314}, "mem_gb": 15.93}
|
| 137 |
+
{"step": 110, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5266653862896065, "tokens": 120000, "cumulative_loss_tokens": 13200000, "grad_norm": 0.6796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 408.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.2, "frames": {"chat": 294}, "mem_gb": 15.86}
|
| 138 |
+
[eval step 110] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
|
| 139 |
+
{"step": 111, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2872509206920241, "tokens": 120000, "cumulative_loss_tokens": 13320000, "grad_norm": 0.52734375, "lr": 3e-05, "finish_rate": 0.894, "comp_len": 438.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.2, "frames": {"chat": 274}, "mem_gb": 15.99}
|
| 140 |
+
{"step": 112, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43661649456371865, "tokens": 120000, "cumulative_loss_tokens": 13440000, "grad_norm": 0.6875, "lr": 3e-05, "finish_rate": 0.995, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.9, "frames": {"chat": 365}, "mem_gb": 15.71}
|
| 141 |
+
{"step": 113, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28158201205277195, "tokens": 120000, "cumulative_loss_tokens": 13560000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.972, "comp_len": 371.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 47.7, "frames": {"chat": 323}, "mem_gb": 15.77}
|
| 142 |
+
{"step": 114, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.20596787228497365, "tokens": 120000, "cumulative_loss_tokens": 13680000, "grad_norm": 0.48828125, "lr": 3e-05, "finish_rate": 0.829, "comp_len": 512.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 39.1, "frames": {"chat": 234}, "mem_gb": 16.06}
|
| 143 |
+
{"step": 115, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24601709296579163, "tokens": 120000, "cumulative_loss_tokens": 13800000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.891, "comp_len": 449.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.1, "frames": {"chat": 267}, "mem_gb": 16.06}
|
| 144 |
+
{"step": 116, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3128123264870917, "tokens": 120000, "cumulative_loss_tokens": 13920000, "grad_norm": 0.55859375, "lr": 3e-05, "finish_rate": 0.961, "comp_len": 394.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 304}, "mem_gb": 15.82}
|
| 145 |
+
{"step": 117, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.45958686599650733, "tokens": 120000, "cumulative_loss_tokens": 14040000, "grad_norm": 21.25, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 321.7, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.4, "frames": {"chat": 373}, "mem_gb": 15.75}
|
| 146 |
+
{"step": 118, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2993530566088855, "tokens": 120000, "cumulative_loss_tokens": 14160000, "grad_norm": 0.5546875, "lr": 3e-05, "finish_rate": 0.87, "comp_len": 400.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.0, "frames": {"chat": 300}, "mem_gb": 16.03}
|
| 147 |
+
{"step": 119, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46588031280909975, "tokens": 120000, "cumulative_loss_tokens": 14280000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.982, "comp_len": 362.5, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.0, "frames": {"chat": 331}, "mem_gb": 15.87}
|
| 148 |
+
{"step": 120, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23109093338887518, "tokens": 120000, "cumulative_loss_tokens": 14400000, "grad_norm": 0.494140625, "lr": 3e-05, "finish_rate": 0.876, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.8, "frames": {"chat": 259}, "mem_gb": 16.01}
|
| 149 |
+
[eval step 120] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save enough money to reach their goal of $1,000,000, given their monthly savings and the interest earned.\n\n**Step 1: C'
|
| 150 |
+
{"step": 121, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4344860572297747, "tokens": 120000, "cumulative_loss_tokens": 14520000, "grad_norm": 0.64453125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 335.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 358}, "mem_gb": 15.63}
|
| 151 |
+
{"step": 122, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4994027626503259, "tokens": 120000, "cumulative_loss_tokens": 14640000, "grad_norm": 0.68359375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.0, "frames": {"chat": 354}, "mem_gb": 15.88}
|
| 152 |
+
{"step": 123, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25992374626447756, "tokens": 120000, "cumulative_loss_tokens": 14760000, "grad_norm": 0.51171875, "lr": 3e-05, "finish_rate": 0.939, "comp_len": 430.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 44.8, "frames": {"chat": 279}, "mem_gb": 15.95}
|
| 153 |
+
{"step": 124, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.5045626226827502, "tokens": 120000, "cumulative_loss_tokens": 14880000, "grad_norm": 0.6953125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.2, "frames": {"chat": 354}, "mem_gb": 15.7}
|
| 154 |
+
{"step": 125, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48436241804882885, "tokens": 120000, "cumulative_loss_tokens": 15000000, "grad_norm": 0.65234375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 359.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 334}, "mem_gb": 15.91}
|
| 155 |
+
{"step": 126, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.48679861746548364, "tokens": 120000, "cumulative_loss_tokens": 15120000, "grad_norm": 0.70703125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 367.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.7, "frames": {"chat": 327}, "mem_gb": 15.77}
|
| 156 |
+
{"step": 127, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4536446885818616, "tokens": 120000, "cumulative_loss_tokens": 15240000, "grad_norm": 0.65625, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 328.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.7, "frames": {"chat": 365}, "mem_gb": 15.87}
|
| 157 |
+
{"step": 128, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28077293347387267, "tokens": 120000, "cumulative_loss_tokens": 15360000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.869, "comp_len": 476.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.3, "frames": {"chat": 252}, "mem_gb": 16.08}
|
| 158 |
+
{"step": 129, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2294477305807794, "tokens": 120000, "cumulative_loss_tokens": 15480000, "grad_norm": 0.49609375, "lr": 3e-05, "finish_rate": 0.867, "comp_len": 468.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.9, "frames": {"chat": 256}, "mem_gb": 16.04}
|
| 159 |
+
{"step": 130, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28099714013809957, "tokens": 120000, "cumulative_loss_tokens": 15600000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.964, "comp_len": 397.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.1, "frames": {"chat": 302}, "mem_gb": 15.82}
|
| 160 |
+
[eval step 130] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
|
| 161 |
+
{"step": 131, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.43501803406309336, "tokens": 120000, "cumulative_loss_tokens": 15720000, "grad_norm": 0.66796875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 342.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 53.8, "frames": {"chat": 350}, "mem_gb": 15.72}
|
| 162 |
+
{"step": 132, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.2883140175284818, "tokens": 120000, "cumulative_loss_tokens": 15840000, "grad_norm": 0.5390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 411.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.7, "frames": {"chat": 292}, "mem_gb": 15.84}
|
| 163 |
+
{"step": 133, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4419534981007998, "tokens": 120000, "cumulative_loss_tokens": 15960000, "grad_norm": 0.63671875, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 337.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 52.7, "frames": {"chat": 356}, "mem_gb": 15.65}
|
| 164 |
+
{"step": 134, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.32508795569992316, "tokens": 120000, "cumulative_loss_tokens": 16080000, "grad_norm": 0.578125, "lr": 3e-05, "finish_rate": 0.977, "comp_len": 345.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 49.3, "frames": {"chat": 347}, "mem_gb": 15.82}
|
| 165 |
+
{"step": 135, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.28389596836206815, "tokens": 120000, "cumulative_loss_tokens": 16200000, "grad_norm": 0.53125, "lr": 3e-05, "finish_rate": 0.976, "comp_len": 363.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 48.5, "frames": {"chat": 330}, "mem_gb": 16.01}
|
| 166 |
+
{"step": 136, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.46085288490230836, "tokens": 120000, "cumulative_loss_tokens": 16320000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 330.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 55.3, "frames": {"chat": 363}, "mem_gb": 15.87}
|
| 167 |
+
{"step": 137, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.42281899355879676, "tokens": 120000, "cumulative_loss_tokens": 16440000, "grad_norm": 0.62109375, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 339.0, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 54.6, "frames": {"chat": 354}, "mem_gb": 15.73}
|
| 168 |
+
{"step": 138, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.24912744893214356, "tokens": 120000, "cumulative_loss_tokens": 16560000, "grad_norm": 0.498046875, "lr": 3e-05, "finish_rate": 0.93, "comp_len": 444.4, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 43.6, "frames": {"chat": 270}, "mem_gb": 15.99}
|
| 169 |
+
{"step": 139, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.44314692690744995, "tokens": 120000, "cumulative_loss_tokens": 16680000, "grad_norm": 0.6328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 349.9, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.0, "frames": {"chat": 343}, "mem_gb": 15.77}
|
| 170 |
+
{"step": 140, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.14103165693245828, "tokens": 120000, "cumulative_loss_tokens": 16800000, "grad_norm": 0.4375, "lr": 3e-05, "finish_rate": 0.845, "comp_len": 517.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 37.7, "frames": {"chat": 232}, "mem_gb": 15.96}
|
| 171 |
+
[eval step 140] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
|
| 172 |
+
{"step": 141, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.40687576603281, "tokens": 120000, "cumulative_loss_tokens": 16920000, "grad_norm": 0.625, "lr": 3e-05, "finish_rate": 0.98, "comp_len": 346.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.6, "frames": {"chat": 346}, "mem_gb": 15.91}
|
| 173 |
+
{"step": 142, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.33076479054968805, "tokens": 120000, "cumulative_loss_tokens": 17040000, "grad_norm": 0.546875, "lr": 3e-05, "finish_rate": 0.951, "comp_len": 392.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.5, "frames": {"chat": 306}, "mem_gb": 16.0}
|
| 174 |
+
{"step": 143, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.23048004940574368, "tokens": 120000, "cumulative_loss_tokens": 17160000, "grad_norm": 0.458984375, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 439.6, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 41.5, "frames": {"chat": 273}, "mem_gb": 16.04}
|
| 175 |
+
{"step": 144, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.25523265439958004, "tokens": 120000, "cumulative_loss_tokens": 17280000, "grad_norm": 0.50390625, "lr": 3e-05, "finish_rate": 0.959, "comp_len": 451.1, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 40.8, "frames": {"chat": 266}, "mem_gb": 15.86}
|
| 176 |
+
{"step": 145, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.3709006532571589, "tokens": 120000, "cumulative_loss_tokens": 17400000, "grad_norm": 0.5703125, "lr": 3e-05, "finish_rate": 0.936, "comp_len": 401.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 45.3, "frames": {"chat": 299}, "mem_gb": 16.06}
|
| 177 |
+
{"step": 146, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27310272046991935, "tokens": 120000, "cumulative_loss_tokens": 17520000, "grad_norm": 0.5234375, "lr": 3e-05, "finish_rate": 0.88, "comp_len": 463.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.9, "frames": {"chat": 259}, "mem_gb": 16.14}
|
| 178 |
+
{"step": 147, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.29872933258082096, "tokens": 120000, "cumulative_loss_tokens": 17640000, "grad_norm": 0.54296875, "lr": 3e-05, "finish_rate": 0.966, "comp_len": 369.2, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 46.9, "frames": {"chat": 325}, "mem_gb": 15.88}
|
| 179 |
+
{"step": 148, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.27330009992414467, "tokens": 120000, "cumulative_loss_tokens": 17760000, "grad_norm": 0.5, "lr": 3e-05, "finish_rate": 0.923, "comp_len": 442.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 42.0, "frames": {"chat": 271}, "mem_gb": 15.95}
|
| 180 |
+
{"step": 149, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.41801022604368626, "tokens": 120000, "cumulative_loss_tokens": 17880000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 334.3, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 50.6, "frames": {"chat": 359}, "mem_gb": 15.74}
|
| 181 |
+
{"step": 150, "epoch": 0, "training_mode": "off-policy", "forward_topk_kl": 0.4207492188954105, "tokens": 120000, "cumulative_loss_tokens": 18000000, "grad_norm": 0.61328125, "lr": 3e-05, "finish_rate": 0.997, "comp_len": 347.8, "t_data_s": 0.0, "t_rollout_s": 0.0, "t_step_s": 51.4, "frames": {"chat": 345}, "mem_gb": 15.8}
|
| 182 |
+
[eval step 150] sample: 'To solve this problem, we need to determine how many months it will take Jamie to save a total of $1,000,000 given their monthly savings and the interest earned from their investment account.\n\n**Step '
|
| 183 |
+
checkpoint snapshot queued -> outputs/healed/grid_general/uniform_keep50_s1225/step0150
|
| 184 |
+
wandb: updating run metadata
|
| 185 |
+
wandb: uploading summary, console lines 171-171
|
| 186 |
+
wandb:
|
| 187 |
+
wandb: Run history:
|
| 188 |
+
wandb: comp_len ββββ
βββ
βββββββββββ
ββββββββββ
β
βββ
βββββββ
β
|
| 189 |
+
wandb: cumulative_loss_tokens βββββββββββββββββ
β
β
β
β
β
ββββββββββββββββββ
|
| 190 |
+
wandb: epoch ββββββββββββββββββββββββββββββββββββββββ
|
| 191 |
+
wandb: finish_rate ββββββββββββββββββββββββββββββββββββββββ
|
| 192 |
+
wandb: forward_topk_kl βββββ
β
β
βββββββββββββββββββββββββββββββββ
|
| 193 |
+
wandb: grad_norm ββββββββββββββββββββββββββββββββββββββββ
|
| 194 |
+
wandb: lr ββββββββββββββββββββββββββββββββββββββββ
|
| 195 |
+
wandb: mem_gb ββββββββ
ββββββββββββ
ββββββββββ
βββ
ββββ
ββ
β
|
| 196 |
+
wandb: step ββββββββββββββββββββ
β
β
β
β
β
βββββββββββββββ
|
| 197 |
+
wandb: t_data_s ββββββββββββββββββββββββββββββββββββββββ
|
| 198 |
+
wandb: +3 ...
|
| 199 |
+
wandb:
|
| 200 |
+
wandb: Run summary:
|
| 201 |
+
wandb: comp_len 347.8
|
| 202 |
+
wandb: cumulative_loss_tokens 18000000
|
| 203 |
+
wandb: epoch 0
|
| 204 |
+
wandb: finish_rate 0.997
|
| 205 |
+
wandb: forward_topk_kl 0.42075
|
| 206 |
+
wandb: grad_norm 0.61328
|
| 207 |
+
wandb: lr 3e-05
|
| 208 |
+
wandb: mem_gb 15.8
|
| 209 |
+
wandb: step 150
|
| 210 |
+
wandb: t_data_s 0
|
| 211 |
+
wandb: +4 ...
|
| 212 |
+
wandb:
|
| 213 |
+
wandb: π View run uniform_keep50_s1225 at: https://wandb.ai/hbfreed/glean-general-grid/runs/056290eo
|
| 214 |
+
wandb: βοΈ View project at: https://wandb.ai/hbfreed/glean-general-grid
|
| 215 |
+
wandb: Synced 5 W&B file(s), 0 media file(s), 0 artifact file(s) and 0 other file(s)
|
| 216 |
+
wandb: Find logs at: outputs/healed/grid_general/uniform_keep50_s1225/wandb/run-20260718_124640-056290eo/logs
|
healed/grid_general/uniform_keep50_s1225.eval.log
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|