{ "best_global_step": 90, "best_metric": 0.4230247437953949, "best_model_checkpoint": "/tmp/checkpoints_/job_dee14721-c20d-4532-9438-f037e42d05fa/checkpoint-90", "epoch": 2.0, "eval_steps": 10, "global_step": 90, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.022222222222222223, "grad_norm": 5.87138032913208, "learning_rate": 0.0, "loss": 3.333970069885254, "step": 1 }, { "epoch": 0.044444444444444446, "grad_norm": NaN, "learning_rate": 1e-05, "loss": 3.8522658348083496, "step": 2 }, { "epoch": 0.06666666666666667, "grad_norm": 6.316606044769287, "learning_rate": 1e-05, "loss": 3.6522226333618164, "step": 3 }, { "epoch": 0.08888888888888889, "grad_norm": 7.078700065612793, "learning_rate": 2e-05, "loss": 3.447444438934326, "step": 4 }, { "epoch": 0.1111111111111111, "grad_norm": 6.362159729003906, "learning_rate": 3e-05, "loss": 3.92345929145813, "step": 5 }, { "epoch": 0.13333333333333333, "grad_norm": 6.476008415222168, "learning_rate": 4e-05, "loss": 3.6273388862609863, "step": 6 }, { "epoch": 0.15555555555555556, "grad_norm": 5.623299598693848, "learning_rate": 5e-05, "loss": 3.505007266998291, "step": 7 }, { "epoch": 0.17777777777777778, "grad_norm": 4.786308288574219, "learning_rate": 4.961538461538462e-05, "loss": 3.331632137298584, "step": 8 }, { "epoch": 0.2, "grad_norm": 5.265624523162842, "learning_rate": 4.923076923076924e-05, "loss": 3.1580982208251953, "step": 9 }, { "epoch": 0.2222222222222222, "grad_norm": 5.30989933013916, "learning_rate": 4.884615384615385e-05, "loss": 3.02443790435791, "step": 10 }, { "epoch": 0.2222222222222222, "eval_loss": 3.1489245891571045, "eval_runtime": 0.6942, "eval_samples_per_second": 28.81, "eval_steps_per_second": 7.202, "step": 10 }, { "epoch": 0.24444444444444444, "grad_norm": 5.131834506988525, "learning_rate": 4.846153846153846e-05, "loss": 2.9736461639404297, "step": 11 }, { "epoch": 0.26666666666666666, "grad_norm": 5.027902603149414, "learning_rate": 4.8076923076923084e-05, "loss": 3.3082339763641357, "step": 12 }, { "epoch": 0.28888888888888886, "grad_norm": 4.972473621368408, "learning_rate": 4.76923076923077e-05, "loss": 3.136728286743164, "step": 13 }, { "epoch": 0.3111111111111111, "grad_norm": 5.016367435455322, "learning_rate": 4.730769230769231e-05, "loss": 3.0399789810180664, "step": 14 }, { "epoch": 0.3333333333333333, "grad_norm": 5.018073558807373, "learning_rate": 4.692307692307693e-05, "loss": 2.875364303588867, "step": 15 }, { "epoch": 0.35555555555555557, "grad_norm": 4.275290012359619, "learning_rate": 4.653846153846154e-05, "loss": 2.5802812576293945, "step": 16 }, { "epoch": 0.37777777777777777, "grad_norm": 5.652186870574951, "learning_rate": 4.615384615384616e-05, "loss": 2.5892136096954346, "step": 17 }, { "epoch": 0.4, "grad_norm": 5.4209089279174805, "learning_rate": 4.576923076923077e-05, "loss": 2.4496333599090576, "step": 18 }, { "epoch": 0.4222222222222222, "grad_norm": 5.391123294830322, "learning_rate": 4.538461538461539e-05, "loss": 2.800614833831787, "step": 19 }, { "epoch": 0.4444444444444444, "grad_norm": 5.081115245819092, "learning_rate": 4.5e-05, "loss": 2.662580728530884, "step": 20 }, { "epoch": 0.4444444444444444, "eval_loss": 2.5146267414093018, "eval_runtime": 0.6885, "eval_samples_per_second": 29.048, "eval_steps_per_second": 7.262, "step": 20 }, { "epoch": 0.4666666666666667, "grad_norm": 6.204960823059082, "learning_rate": 4.461538461538462e-05, "loss": 2.5791611671447754, "step": 21 }, { "epoch": 0.4888888888888889, "grad_norm": 5.024198532104492, "learning_rate": 4.423076923076923e-05, "loss": 2.480907678604126, "step": 22 }, { "epoch": 0.5111111111111111, "grad_norm": 5.818419933319092, "learning_rate": 4.384615384615385e-05, "loss": 2.482961654663086, "step": 23 }, { "epoch": 0.5333333333333333, "grad_norm": 4.510318279266357, "learning_rate": 4.346153846153846e-05, "loss": 2.291290283203125, "step": 24 }, { "epoch": 0.5555555555555556, "grad_norm": 5.408440113067627, "learning_rate": 4.3076923076923084e-05, "loss": 2.196018695831299, "step": 25 }, { "epoch": 0.5777777777777777, "grad_norm": 5.395529270172119, "learning_rate": 4.269230769230769e-05, "loss": 2.4523730278015137, "step": 26 }, { "epoch": 0.6, "grad_norm": 4.714017868041992, "learning_rate": 4.230769230769231e-05, "loss": 2.0109505653381348, "step": 27 }, { "epoch": 0.6222222222222222, "grad_norm": 5.9115118980407715, "learning_rate": 4.192307692307693e-05, "loss": 2.0749101638793945, "step": 28 }, { "epoch": 0.6444444444444445, "grad_norm": 4.3610992431640625, "learning_rate": 4.1538461538461544e-05, "loss": 1.9675894975662231, "step": 29 }, { "epoch": 0.6666666666666666, "grad_norm": 4.657850742340088, "learning_rate": 4.115384615384615e-05, "loss": 1.7926883697509766, "step": 30 }, { "epoch": 0.6666666666666666, "eval_loss": 2.016049861907959, "eval_runtime": 0.7002, "eval_samples_per_second": 28.564, "eval_steps_per_second": 7.141, "step": 30 }, { "epoch": 0.6888888888888889, "grad_norm": 5.570796489715576, "learning_rate": 4.0769230769230773e-05, "loss": 1.9156622886657715, "step": 31 }, { "epoch": 0.7111111111111111, "grad_norm": 4.96622371673584, "learning_rate": 4.038461538461539e-05, "loss": 1.678513765335083, "step": 32 }, { "epoch": 0.7333333333333333, "grad_norm": 5.127869606018066, "learning_rate": 4e-05, "loss": 1.8418490886688232, "step": 33 }, { "epoch": 0.7555555555555555, "grad_norm": 5.629909038543701, "learning_rate": 3.961538461538462e-05, "loss": 1.8050181865692139, "step": 34 }, { "epoch": 0.7777777777777778, "grad_norm": 5.332027912139893, "learning_rate": 3.923076923076923e-05, "loss": 1.5306370258331299, "step": 35 }, { "epoch": 0.8, "grad_norm": 5.3822021484375, "learning_rate": 3.884615384615385e-05, "loss": 1.665320873260498, "step": 36 }, { "epoch": 0.8222222222222222, "grad_norm": 5.958496570587158, "learning_rate": 3.846153846153846e-05, "loss": 1.483096718788147, "step": 37 }, { "epoch": 0.8444444444444444, "grad_norm": 6.1535539627075195, "learning_rate": 3.807692307692308e-05, "loss": 1.7172764539718628, "step": 38 }, { "epoch": 0.8666666666666667, "grad_norm": 6.259358882904053, "learning_rate": 3.769230769230769e-05, "loss": 1.7732570171356201, "step": 39 }, { "epoch": 0.8888888888888888, "grad_norm": 4.751931667327881, "learning_rate": 3.730769230769231e-05, "loss": 1.2387514114379883, "step": 40 }, { "epoch": 0.8888888888888888, "eval_loss": 1.6059402227401733, "eval_runtime": 0.6877, "eval_samples_per_second": 29.081, "eval_steps_per_second": 7.27, "step": 40 }, { "epoch": 0.9111111111111111, "grad_norm": 7.033973217010498, "learning_rate": 3.692307692307693e-05, "loss": 1.7372736930847168, "step": 41 }, { "epoch": 0.9333333333333333, "grad_norm": 6.1621599197387695, "learning_rate": 3.653846153846154e-05, "loss": 1.569137692451477, "step": 42 }, { "epoch": 0.9555555555555556, "grad_norm": 4.52653169631958, "learning_rate": 3.615384615384615e-05, "loss": 1.3664658069610596, "step": 43 }, { "epoch": 0.9777777777777777, "grad_norm": 5.134096622467041, "learning_rate": 3.5769230769230774e-05, "loss": 1.2201919555664062, "step": 44 }, { "epoch": 1.0, "grad_norm": 6.698665142059326, "learning_rate": 3.538461538461539e-05, "loss": 1.447831153869629, "step": 45 }, { "epoch": 1.0222222222222221, "grad_norm": 4.538883209228516, "learning_rate": 3.5e-05, "loss": 1.277827262878418, "step": 46 }, { "epoch": 1.0444444444444445, "grad_norm": 5.439610004425049, "learning_rate": 3.461538461538462e-05, "loss": 1.285160779953003, "step": 47 }, { "epoch": 1.0666666666666667, "grad_norm": 5.188867092132568, "learning_rate": 3.4230769230769234e-05, "loss": 0.9196145534515381, "step": 48 }, { "epoch": 1.0888888888888888, "grad_norm": 5.185536861419678, "learning_rate": 3.384615384615385e-05, "loss": 0.9245643019676208, "step": 49 }, { "epoch": 1.1111111111111112, "grad_norm": 6.820492744445801, "learning_rate": 3.346153846153846e-05, "loss": 1.1991827487945557, "step": 50 }, { "epoch": 1.1111111111111112, "eval_loss": 1.2328484058380127, "eval_runtime": 0.6853, "eval_samples_per_second": 29.185, "eval_steps_per_second": 7.296, "step": 50 }, { "epoch": 1.1333333333333333, "grad_norm": 6.76528263092041, "learning_rate": 3.307692307692308e-05, "loss": 1.1789758205413818, "step": 51 }, { "epoch": 1.1555555555555554, "grad_norm": 6.927876949310303, "learning_rate": 3.269230769230769e-05, "loss": 0.9650276303291321, "step": 52 }, { "epoch": 1.1777777777777778, "grad_norm": 5.535730838775635, "learning_rate": 3.230769230769231e-05, "loss": 0.9436954259872437, "step": 53 }, { "epoch": 1.2, "grad_norm": 5.6094441413879395, "learning_rate": 3.192307692307692e-05, "loss": 0.9939174652099609, "step": 54 }, { "epoch": 1.2222222222222223, "grad_norm": 5.440947532653809, "learning_rate": 3.153846153846154e-05, "loss": 1.0225588083267212, "step": 55 }, { "epoch": 1.2444444444444445, "grad_norm": 5.308763027191162, "learning_rate": 3.115384615384615e-05, "loss": 1.1128517389297485, "step": 56 }, { "epoch": 1.2666666666666666, "grad_norm": 6.255494117736816, "learning_rate": 3.0769230769230774e-05, "loss": 1.0173512697219849, "step": 57 }, { "epoch": 1.2888888888888888, "grad_norm": 5.410623550415039, "learning_rate": 3.0384615384615382e-05, "loss": 0.8253780603408813, "step": 58 }, { "epoch": 1.3111111111111111, "grad_norm": 6.577842712402344, "learning_rate": 3e-05, "loss": 0.919189453125, "step": 59 }, { "epoch": 1.3333333333333333, "grad_norm": 5.62638521194458, "learning_rate": 2.9615384615384616e-05, "loss": 0.8745652437210083, "step": 60 }, { "epoch": 1.3333333333333333, "eval_loss": 0.9308679699897766, "eval_runtime": 0.6899, "eval_samples_per_second": 28.99, "eval_steps_per_second": 7.248, "step": 60 }, { "epoch": 1.3555555555555556, "grad_norm": 5.577669620513916, "learning_rate": 2.9230769230769234e-05, "loss": 0.9851076006889343, "step": 61 }, { "epoch": 1.3777777777777778, "grad_norm": 6.061960220336914, "learning_rate": 2.8846153846153845e-05, "loss": 0.8584026098251343, "step": 62 }, { "epoch": 1.4, "grad_norm": 5.552649021148682, "learning_rate": 2.846153846153846e-05, "loss": 0.7414474487304688, "step": 63 }, { "epoch": 1.4222222222222223, "grad_norm": 5.330775737762451, "learning_rate": 2.807692307692308e-05, "loss": 0.7163383960723877, "step": 64 }, { "epoch": 1.4444444444444444, "grad_norm": 5.08062744140625, "learning_rate": 2.7692307692307694e-05, "loss": 0.6349257826805115, "step": 65 }, { "epoch": 1.4666666666666668, "grad_norm": 6.24244499206543, "learning_rate": 2.7307692307692305e-05, "loss": 0.734074592590332, "step": 66 }, { "epoch": 1.488888888888889, "grad_norm": 5.124273777008057, "learning_rate": 2.6923076923076923e-05, "loss": 0.57187420129776, "step": 67 }, { "epoch": 1.511111111111111, "grad_norm": 7.708939075469971, "learning_rate": 2.6538461538461538e-05, "loss": 0.6959559321403503, "step": 68 }, { "epoch": 1.5333333333333332, "grad_norm": 8.645610809326172, "learning_rate": 2.6153846153846157e-05, "loss": 0.8737912178039551, "step": 69 }, { "epoch": 1.5555555555555556, "grad_norm": 5.395994186401367, "learning_rate": 2.5769230769230768e-05, "loss": 0.7113362550735474, "step": 70 }, { "epoch": 1.5555555555555556, "eval_loss": 0.6864913702011108, "eval_runtime": 0.6965, "eval_samples_per_second": 28.716, "eval_steps_per_second": 7.179, "step": 70 }, { "epoch": 1.5777777777777777, "grad_norm": 5.260697841644287, "learning_rate": 2.5384615384615383e-05, "loss": 0.5419008731842041, "step": 71 }, { "epoch": 1.6, "grad_norm": 4.789445400238037, "learning_rate": 2.5e-05, "loss": 0.6413639783859253, "step": 72 }, { "epoch": 1.6222222222222222, "grad_norm": 6.9997124671936035, "learning_rate": 2.461538461538462e-05, "loss": 0.5860044360160828, "step": 73 }, { "epoch": 1.6444444444444444, "grad_norm": 5.2596564292907715, "learning_rate": 2.423076923076923e-05, "loss": 0.5544954538345337, "step": 74 }, { "epoch": 1.6666666666666665, "grad_norm": 4.984217166900635, "learning_rate": 2.384615384615385e-05, "loss": 0.5622981786727905, "step": 75 }, { "epoch": 1.6888888888888889, "grad_norm": 5.373387813568115, "learning_rate": 2.3461538461538464e-05, "loss": 0.5327613949775696, "step": 76 }, { "epoch": 1.7111111111111112, "grad_norm": 3.9502971172332764, "learning_rate": 2.307692307692308e-05, "loss": 0.47186025977134705, "step": 77 }, { "epoch": 1.7333333333333334, "grad_norm": 5.415130615234375, "learning_rate": 2.2692307692307694e-05, "loss": 0.5782798528671265, "step": 78 }, { "epoch": 1.7555555555555555, "grad_norm": 6.2089104652404785, "learning_rate": 2.230769230769231e-05, "loss": 0.6664197444915771, "step": 79 }, { "epoch": 1.7777777777777777, "grad_norm": 5.193050861358643, "learning_rate": 2.1923076923076924e-05, "loss": 0.5752044916152954, "step": 80 }, { "epoch": 1.7777777777777777, "eval_loss": 0.5675191879272461, "eval_runtime": 0.7073, "eval_samples_per_second": 28.278, "eval_steps_per_second": 7.069, "step": 80 }, { "epoch": 1.8, "grad_norm": 4.315133571624756, "learning_rate": 2.1538461538461542e-05, "loss": 0.4048479199409485, "step": 81 }, { "epoch": 1.8222222222222222, "grad_norm": 5.358142375946045, "learning_rate": 2.1153846153846154e-05, "loss": 0.552968442440033, "step": 82 }, { "epoch": 1.8444444444444446, "grad_norm": 6.099940299987793, "learning_rate": 2.0769230769230772e-05, "loss": 0.4713404178619385, "step": 83 }, { "epoch": 1.8666666666666667, "grad_norm": 6.3764848709106445, "learning_rate": 2.0384615384615387e-05, "loss": 0.44388440251350403, "step": 84 }, { "epoch": 1.8888888888888888, "grad_norm": 5.32869815826416, "learning_rate": 2e-05, "loss": 0.35722827911376953, "step": 85 }, { "epoch": 1.911111111111111, "grad_norm": 4.6434431076049805, "learning_rate": 1.9615384615384617e-05, "loss": 0.37209007143974304, "step": 86 }, { "epoch": 1.9333333333333333, "grad_norm": 5.760197639465332, "learning_rate": 1.923076923076923e-05, "loss": 0.3956947326660156, "step": 87 }, { "epoch": 1.9555555555555557, "grad_norm": 4.9346489906311035, "learning_rate": 1.8846153846153846e-05, "loss": 0.34232836961746216, "step": 88 }, { "epoch": 1.9777777777777779, "grad_norm": 6.571290969848633, "learning_rate": 1.8461538461538465e-05, "loss": 0.5473036170005798, "step": 89 }, { "epoch": 2.0, "grad_norm": 6.914135932922363, "learning_rate": 1.8076923076923076e-05, "loss": 0.43153804540634155, "step": 90 }, { "epoch": 2.0, "eval_loss": 0.4230247437953949, "eval_runtime": 0.7059, "eval_samples_per_second": 28.331, "eval_steps_per_second": 7.083, "step": 90 } ], "logging_steps": 1, "max_steps": 135, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 93362349857280.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }