{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.020380434782608696, "eval_steps": 500, "global_step": 75, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0005434782608695652, "grad_norm": 0.03744836896657944, "learning_rate": 4.966666666666667e-06, "loss": 0.0091, "on_policy_loss": 0.0091, "step": 2 }, { "epoch": 0.0010869565217391304, "grad_norm": 0.029108790680766106, "learning_rate": 4.9000000000000005e-06, "loss": 0.0097, "on_policy_loss": 0.0097, "step": 4 }, { "epoch": 0.0016304347826086956, "grad_norm": 0.02633393555879593, "learning_rate": 4.833333333333333e-06, "loss": 0.013, "on_policy_loss": 0.013, "step": 6 }, { "epoch": 0.002173913043478261, "grad_norm": 0.018148666247725487, "learning_rate": 4.766666666666667e-06, "loss": 0.0099, "on_policy_loss": 0.0099, "step": 8 }, { "epoch": 0.002717391304347826, "grad_norm": 0.02139461226761341, "learning_rate": 4.7e-06, "loss": 0.0118, "on_policy_loss": 0.0118, "step": 10 }, { "epoch": 0.003260869565217391, "grad_norm": 0.028195466846227646, "learning_rate": 4.633333333333334e-06, "loss": 0.0112, "on_policy_loss": 0.0112, "step": 12 }, { "epoch": 0.0038043478260869567, "grad_norm": 0.0212844368070364, "learning_rate": 4.566666666666667e-06, "loss": 0.0114, "on_policy_loss": 0.0114, "step": 14 }, { "epoch": 0.004347826086956522, "grad_norm": 0.03395017609000206, "learning_rate": 4.5e-06, "loss": 0.0109, "on_policy_loss": 0.0109, "step": 16 }, { "epoch": 0.004891304347826087, "grad_norm": 0.03911148011684418, "learning_rate": 4.433333333333334e-06, "loss": 0.009, "on_policy_loss": 0.009, "step": 18 }, { "epoch": 0.005434782608695652, "grad_norm": 0.01619447022676468, "learning_rate": 4.366666666666667e-06, "loss": 0.0133, "on_policy_loss": 0.0133, "step": 20 }, { "epoch": 0.005978260869565218, "grad_norm": 0.02550458535552025, "learning_rate": 4.3e-06, "loss": 0.0104, "on_policy_loss": 0.0104, "step": 22 }, { "epoch": 0.006521739130434782, "grad_norm": 0.03460410609841347, "learning_rate": 4.233333333333334e-06, "loss": 0.0099, "on_policy_loss": 0.0099, "step": 24 }, { "epoch": 0.007065217391304348, "grad_norm": 0.031486913561820984, "learning_rate": 4.166666666666667e-06, "loss": 0.0128, "on_policy_loss": 0.0128, "step": 26 }, { "epoch": 0.007608695652173913, "grad_norm": 0.022056138142943382, "learning_rate": 4.1e-06, "loss": 0.0063, "on_policy_loss": 0.0063, "step": 28 }, { "epoch": 0.008152173913043478, "grad_norm": 0.016603024676442146, "learning_rate": 4.033333333333333e-06, "loss": 0.0074, "on_policy_loss": 0.0074, "step": 30 }, { "epoch": 0.008695652173913044, "grad_norm": 0.017155027016997337, "learning_rate": 3.966666666666667e-06, "loss": 0.0125, "on_policy_loss": 0.0125, "step": 32 }, { "epoch": 0.00923913043478261, "grad_norm": 0.022139370441436768, "learning_rate": 3.900000000000001e-06, "loss": 0.0091, "on_policy_loss": 0.0091, "step": 34 }, { "epoch": 0.009782608695652175, "grad_norm": 0.019025282934308052, "learning_rate": 3.833333333333334e-06, "loss": 0.0088, "on_policy_loss": 0.0088, "step": 36 }, { "epoch": 0.010326086956521738, "grad_norm": 0.018911313265562057, "learning_rate": 3.766666666666667e-06, "loss": 0.0088, "on_policy_loss": 0.0088, "step": 38 }, { "epoch": 0.010869565217391304, "grad_norm": 0.021639954298734665, "learning_rate": 3.7e-06, "loss": 0.0058, "on_policy_loss": 0.0058, "step": 40 }, { "epoch": 0.01141304347826087, "grad_norm": 0.01750766858458519, "learning_rate": 3.633333333333334e-06, "loss": 0.0101, "on_policy_loss": 0.0101, "step": 42 }, { "epoch": 0.011956521739130435, "grad_norm": 0.018655167892575264, "learning_rate": 3.566666666666667e-06, "loss": 0.0057, "on_policy_loss": 0.0057, "step": 44 }, { "epoch": 0.0125, "grad_norm": 0.017098240554332733, "learning_rate": 3.5e-06, "loss": 0.0051, "on_policy_loss": 0.0051, "step": 46 }, { "epoch": 0.013043478260869565, "grad_norm": 0.01902070641517639, "learning_rate": 3.4333333333333336e-06, "loss": 0.0066, "on_policy_loss": 0.0066, "step": 48 }, { "epoch": 0.01358695652173913, "grad_norm": 0.018735554069280624, "learning_rate": 3.366666666666667e-06, "loss": 0.0102, "on_policy_loss": 0.0102, "step": 50 }, { "epoch": 0.014130434782608696, "grad_norm": 0.01960255578160286, "learning_rate": 3.3000000000000006e-06, "loss": 0.0091, "on_policy_loss": 0.0091, "step": 52 }, { "epoch": 0.014673913043478261, "grad_norm": 0.017713133245706558, "learning_rate": 3.2333333333333334e-06, "loss": 0.0099, "on_policy_loss": 0.0099, "step": 54 }, { "epoch": 0.015217391304347827, "grad_norm": 0.017586251720786095, "learning_rate": 3.1666666666666667e-06, "loss": 0.0068, "on_policy_loss": 0.0068, "step": 56 }, { "epoch": 0.01576086956521739, "grad_norm": 0.018474629148840904, "learning_rate": 3.1000000000000004e-06, "loss": 0.0114, "on_policy_loss": 0.0114, "step": 58 }, { "epoch": 0.016304347826086956, "grad_norm": 0.01840766705572605, "learning_rate": 3.0333333333333337e-06, "loss": 0.0056, "on_policy_loss": 0.0056, "step": 60 }, { "epoch": 0.01684782608695652, "grad_norm": 0.017008541151881218, "learning_rate": 2.9666666666666673e-06, "loss": 0.0068, "on_policy_loss": 0.0068, "step": 62 }, { "epoch": 0.017391304347826087, "grad_norm": 0.017770633101463318, "learning_rate": 2.9e-06, "loss": 0.0083, "on_policy_loss": 0.0083, "step": 64 }, { "epoch": 0.017934782608695653, "grad_norm": 0.017109453678131104, "learning_rate": 2.8333333333333335e-06, "loss": 0.0071, "on_policy_loss": 0.0071, "step": 66 }, { "epoch": 0.01847826086956522, "grad_norm": 0.01635884866118431, "learning_rate": 2.766666666666667e-06, "loss": 0.0087, "on_policy_loss": 0.0087, "step": 68 }, { "epoch": 0.019021739130434784, "grad_norm": 0.01571054942905903, "learning_rate": 2.7000000000000004e-06, "loss": 0.0085, "on_policy_loss": 0.0085, "step": 70 }, { "epoch": 0.01956521739130435, "grad_norm": 0.01731751672923565, "learning_rate": 2.6333333333333332e-06, "loss": 0.0065, "on_policy_loss": 0.0065, "step": 72 }, { "epoch": 0.02010869565217391, "grad_norm": 0.015707146376371384, "learning_rate": 2.566666666666667e-06, "loss": 0.0085, "on_policy_loss": 0.0085, "step": 74 } ], "logging_steps": 2, "max_steps": 150, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }