{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 4, "global_step": 23, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.043478260869565216, "grad_norm": 0.18782003223896027, "learning_rate": 0.0, "loss": 1.727783203125, "step": 1 }, { "epoch": 0.08695652173913043, "grad_norm": 0.22847582399845123, "learning_rate": 5e-05, "loss": 1.745361328125, "step": 2 }, { "epoch": 0.13043478260869565, "grad_norm": 0.19071611762046814, "learning_rate": 4.977098244232099e-05, "loss": 1.720703125, "step": 3 }, { "epoch": 0.17391304347826086, "grad_norm": 0.19614891707897186, "learning_rate": 4.90885919063262e-05, "loss": 1.69091796875, "step": 4 }, { "epoch": 0.21739130434782608, "grad_norm": 0.21143198013305664, "learning_rate": 4.796671989547667e-05, "loss": 1.564453125, "step": 5 }, { "epoch": 0.2608695652173913, "grad_norm": 0.0746946781873703, "learning_rate": 4.6428204488701576e-05, "loss": 0.671875, "step": 6 }, { "epoch": 0.30434782608695654, "grad_norm": 0.17559966444969177, "learning_rate": 4.450436542297082e-05, "loss": 1.45751953125, "step": 7 }, { "epoch": 0.30434782608695654, "eval_loss": 1.2763671875, "eval_runtime": 5.828, "eval_samples_per_second": 0.686, "eval_steps_per_second": 0.172, "step": 7 }, { "epoch": 0.34782608695652173, "grad_norm": 0.17109356820583344, "learning_rate": 4.223436651376892e-05, "loss": 1.490234375, "step": 8 }, { "epoch": 0.391304347826087, "grad_norm": 0.6726886630058289, "learning_rate": 3.966441839275095e-05, "loss": 0.9942626953125, "step": 9 }, { "epoch": 0.43478260869565216, "grad_norm": 0.12483895570039749, "learning_rate": 3.6846837792542446e-05, "loss": 1.384033203125, "step": 10 }, { "epoch": 0.4782608695652174, "grad_norm": 0.12765726447105408, "learning_rate": 3.383898252893217e-05, "loss": 1.37548828125, "step": 11 }, { "epoch": 0.4782608695652174, "eval_loss": 1.216796875, "eval_runtime": 5.7998, "eval_samples_per_second": 0.69, "eval_steps_per_second": 0.172, "step": 11 }, { "epoch": 0.5217391304347826, "grad_norm": 0.12192913889884949, "learning_rate": 3.070208386114892e-05, "loss": 1.34033203125, "step": 12 }, { "epoch": 0.5652173913043478, "grad_norm": 0.11237656325101852, "learning_rate": 2.7500000000000004e-05, "loss": 1.315185546875, "step": 13 }, { "epoch": 0.6086956521739131, "grad_norm": 0.12283302843570709, "learning_rate": 2.429791613885109e-05, "loss": 1.434326171875, "step": 14 }, { "epoch": 0.6521739130434783, "grad_norm": 0.13110016286373138, "learning_rate": 2.1161017471067835e-05, "loss": 1.374755859375, "step": 15 }, { "epoch": 0.6521739130434783, "eval_loss": 1.19677734375, "eval_runtime": 5.8081, "eval_samples_per_second": 0.689, "eval_steps_per_second": 0.172, "step": 15 }, { "epoch": 0.6956521739130435, "grad_norm": 0.12423460930585861, "learning_rate": 1.815316220745756e-05, "loss": 1.42333984375, "step": 16 }, { "epoch": 0.7391304347826086, "grad_norm": 0.11869314312934875, "learning_rate": 1.5335581607249064e-05, "loss": 1.456298828125, "step": 17 }, { "epoch": 0.782608695652174, "grad_norm": 0.11196423321962357, "learning_rate": 1.2765633486231088e-05, "loss": 1.33642578125, "step": 18 }, { "epoch": 0.8260869565217391, "grad_norm": 0.1125522181391716, "learning_rate": 1.0495634577029192e-05, "loss": 1.41162109375, "step": 19 }, { "epoch": 0.8260869565217391, "eval_loss": 1.1875, "eval_runtime": 5.8123, "eval_samples_per_second": 0.688, "eval_steps_per_second": 0.172, "step": 19 }, { "epoch": 0.8695652173913043, "grad_norm": 0.10117685049772263, "learning_rate": 8.571795511298423e-06, "loss": 1.38818359375, "step": 20 }, { "epoch": 0.9130434782608695, "grad_norm": 0.11501135677099228, "learning_rate": 7.033280104523337e-06, "loss": 1.3525390625, "step": 21 }, { "epoch": 0.9565217391304348, "grad_norm": 0.12201500684022903, "learning_rate": 5.911408093673812e-06, "loss": 1.329345703125, "step": 22 }, { "epoch": 1.0, "grad_norm": 0.1027703657746315, "learning_rate": 5.229017557679016e-06, "loss": 1.360595703125, "step": 23 }, { "epoch": 1.0, "eval_loss": 1.18359375, "eval_runtime": 5.7934, "eval_samples_per_second": 0.69, "eval_steps_per_second": 0.173, "step": 23 } ], "logging_steps": 1.0, "max_steps": 23, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.74515885224362e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }