File size: 4,141 Bytes
e378262 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 | {
"schema_version": 1,
"status": "complete",
"config_fingerprint": "0667d4ea7a9eeb08101909c8f4b52860faadd491ce6d4ceb8094405e04a5f75e",
"dataset_fingerprint": "6cf9eb3d777a338eb007dcc5606b2aac6605bf899a191ea399ccd77d5527acfb",
"cursor": {
"global_step": 3010,
"micro_step": 24154,
"dataset_epoch": 1,
"sample_offset": 16960,
"accumulation_step": 0
},
"extra": {
"last_metrics": {
"global_step": 3010,
"behavior_loss": 0.006600444903597236,
"behavior_microbatches": 8,
"behavior_singleton_microbatches": 0,
"oom_replayed_as_singletons": false,
"gradient_norm": 0.007156455423682928,
"learning_rate_used": 1e-06,
"step_seconds": 14.206,
"peak_reserved_gib": 24.904,
"optimizer_state_device": "cpu_between_updates",
"weighted_behavior_objective": 0.006600444903597236,
"validation_behavior_loss": 0.01693202504888177,
"lr_window_phase": "minimum_lr_plateau",
"lr_window_start_step": 2940,
"lr_window_end_step": 3010,
"lr_window_point_count": 8,
"lr_window_log_slope_per_step": 1.7980951354151945e-05,
"lr_window_fitted_log_descent": -0.001258666594790636,
"lr_window_relative_descent": -0.0012594590480323742,
"lr_window_residual_mad_scale": 0.002189475291935303,
"lr_window_descent_to_noise": -0.5748713399172849,
"lr_window_accepted": false,
"lr_window_elbow_step": 3000,
"lr_training_window_start_step": 2950,
"lr_training_window_end_step": 3010,
"lr_training_window_point_count": 7,
"lr_training_window_log_slope_per_step": -0.00010182409525911022,
"lr_training_window_fitted_log_descent": 0.006109445715546613,
"lr_training_window_relative_descent": 0.006090821000269142,
"lr_training_window_residual_mad_scale": 0.018786415112912798,
"lr_training_window_descent_to_noise": 0.3252055104088113,
"lr_training_window_accepted": false,
"lr_training_window_elbow_step": 3000,
"lr_window_any_signal_accepted": false,
"validation_interval": 10,
"next_validation_step": 3020,
"learning_rate": 1e-06
},
"reason": "periodic",
"parent": null,
"lr_control": {
"version": 3,
"config": {
"factor": 0.5,
"minimum_learning_rate": 1e-06,
"window_steps": 50,
"probe_every_steps": 10,
"confirmation_steps": 20,
"minimum_descent_to_noise": 1.0,
"minimum_relative_descent": 0.0
},
"state": {
"learning_rate": 1e-06,
"points": [
{
"step": 3010,
"loss": 0.01693202504888177
}
],
"training_points": [],
"training_loss_sum": 0.0,
"training_loss_count": 0,
"last_training_step": 3010,
"window_start_step": 3010,
"next_validation_step": 3020,
"last_analysis": {
"start_step": 2940,
"end_step": 3010,
"point_count": 8,
"log_slope_per_step": 1.7980951354151945e-05,
"fitted_log_descent": -0.001258666594790636,
"relative_descent": -0.0012594590480323742,
"residual_mad_scale": 0.002189475291935303,
"descent_to_noise": -0.5748713399172849,
"accepted": false,
"elbow_step": 3000
},
"last_training_analysis": {
"start_step": 2950,
"end_step": 3010,
"point_count": 7,
"log_slope_per_step": -0.00010182409525911022,
"fitted_log_descent": 0.006109445715546613,
"relative_descent": 0.006090821000269142,
"residual_mad_scale": 0.018786415112912798,
"descent_to_noise": 0.3252055104088113,
"accepted": false,
"elbow_step": 3000
},
"confirming": false,
"pending_rollback": null,
"reductions": 9
}
},
"rollback_replay": null
},
"files": {
"adapters.safetensors": "605e25f84b688ad82da52f79c11c042499db66cc68aa5ecc8f17bc4798546d45",
"training_state.pt": "f8e888df22abf4325ff4bf080c6440602e51ad02fe556d8336cca0259f88d8eb"
}
}
|