File size: 4,111 Bytes
51de1b1 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 | {
"schema_version": 1,
"status": "complete",
"config_fingerprint": "0667d4ea7a9eeb08101909c8f4b52860faadd491ce6d4ceb8094405e04a5f75e",
"dataset_fingerprint": "6cf9eb3d777a338eb007dcc5606b2aac6605bf899a191ea399ccd77d5527acfb",
"cursor": {
"global_step": 1000,
"micro_step": 8021,
"dataset_epoch": 0,
"sample_offset": 16000,
"accumulation_step": 0
},
"extra": {
"last_metrics": {
"global_step": 1000,
"behavior_loss": 0.011761117406422272,
"behavior_microbatches": 8,
"behavior_singleton_microbatches": 0,
"oom_replayed_as_singletons": false,
"gradient_norm": 0.031379587948322296,
"learning_rate_used": 2e-05,
"step_seconds": 12.7,
"peak_reserved_gib": 24.463,
"optimizer_state_device": "cpu_between_updates",
"weighted_behavior_objective": 0.011761117406422272,
"validation_behavior_loss": 0.016935308971442284,
"lr_window_phase": "continue",
"lr_window_start_step": 950,
"lr_window_end_step": 1000,
"lr_window_point_count": 6,
"lr_window_log_slope_per_step": 0.00016107469412269816,
"lr_window_fitted_log_descent": -0.008053734706134907,
"lr_window_relative_descent": -0.008086253267493904,
"lr_window_residual_mad_scale": 0.0012714376993325613,
"lr_window_descent_to_noise": -6.334352607573851,
"lr_window_accepted": false,
"lr_window_elbow_step": 960,
"lr_training_window_start_step": 960,
"lr_training_window_end_step": 1000,
"lr_training_window_point_count": 5,
"lr_training_window_log_slope_per_step": -0.0035170239046830257,
"lr_training_window_fitted_log_descent": 0.14068095618732102,
"lr_training_window_relative_descent": 0.13123355795504654,
"lr_training_window_residual_mad_scale": 0.025747381477782865,
"lr_training_window_descent_to_noise": 5.463893728716183,
"lr_training_window_accepted": true,
"lr_training_window_elbow_step": 1000,
"lr_window_any_signal_accepted": true,
"validation_interval": 10,
"next_validation_step": 1010,
"learning_rate": 2e-05
},
"reason": "periodic",
"parent": null,
"lr_control": {
"version": 3,
"config": {
"factor": 0.5,
"minimum_learning_rate": 1e-06,
"window_steps": 50,
"probe_every_steps": 10,
"confirmation_steps": 20,
"minimum_descent_to_noise": 1.0,
"minimum_relative_descent": 0.0
},
"state": {
"learning_rate": 2e-05,
"points": [
{
"step": 1000,
"loss": 0.016935308971442284
}
],
"training_points": [],
"training_loss_sum": 0.0,
"training_loss_count": 0,
"last_training_step": 1000,
"window_start_step": 1000,
"next_validation_step": 1010,
"last_analysis": {
"start_step": 950,
"end_step": 1000,
"point_count": 6,
"log_slope_per_step": 0.00016107469412269816,
"fitted_log_descent": -0.008053734706134907,
"relative_descent": -0.008086253267493904,
"residual_mad_scale": 0.0012714376993325613,
"descent_to_noise": -6.334352607573851,
"accepted": false,
"elbow_step": 960
},
"last_training_analysis": {
"start_step": 960,
"end_step": 1000,
"point_count": 5,
"log_slope_per_step": -0.0035170239046830257,
"fitted_log_descent": 0.14068095618732102,
"relative_descent": 0.13123355795504654,
"residual_mad_scale": 0.025747381477782865,
"descent_to_noise": 5.463893728716183,
"accepted": true,
"elbow_step": 1000
},
"confirming": false,
"pending_rollback": null,
"reductions": 4
}
},
"rollback_replay": null
},
"files": {
"adapters.safetensors": "4a86181524ab17680c500add76f183acd257840b8a0d18e33807ae379d52925e",
"training_state.pt": "e8d40cf90248f643e98c0c434cb4871e8df7f4264e991c2ddf18a609dbfdabaf"
}
}
|