{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 12, "global_step": 63, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.047619047619047616, "grad_norm": 55.872169494628906, "learning_rate": 0.0, "loss": 11.3984375, "step": 1 }, { "epoch": 0.09523809523809523, "grad_norm": 39.94508361816406, "learning_rate": 2.5e-05, "loss": 8.734375, "step": 2 }, { "epoch": 0.14285714285714285, "grad_norm": 30.2918701171875, "learning_rate": 5e-05, "loss": 6.33984375, "step": 3 }, { "epoch": 0.19047619047619047, "grad_norm": 11.614492416381836, "learning_rate": 4.9970167022408685e-05, "loss": 4.24609375, "step": 4 }, { "epoch": 0.23809523809523808, "grad_norm": 10.849442481994629, "learning_rate": 4.988074720132825e-05, "loss": 2.6611328125, "step": 5 }, { "epoch": 0.2857142857142857, "grad_norm": 6.369261264801025, "learning_rate": 4.9731977662049233e-05, "loss": 1.529296875, "step": 6 }, { "epoch": 0.3333333333333333, "grad_norm": 1.0310866832733154, "learning_rate": 4.9524252914645555e-05, "loss": 2.18267822265625, "step": 7 }, { "epoch": 0.38095238095238093, "grad_norm": 2.9220826625823975, "learning_rate": 4.9258123807804715e-05, "loss": 0.80126953125, "step": 8 }, { "epoch": 0.42857142857142855, "grad_norm": 2.5777978897094727, "learning_rate": 4.8934296068076105e-05, "loss": 0.8701171875, "step": 9 }, { "epoch": 0.47619047619047616, "grad_norm": 2.27763295173645, "learning_rate": 4.855362842841111e-05, "loss": 0.7646484375, "step": 10 }, { "epoch": 0.5238095238095238, "grad_norm": 1.504328727722168, "learning_rate": 4.811713035095761e-05, "loss": 0.79931640625, "step": 11 }, { "epoch": 0.5714285714285714, "grad_norm": 1.8779164552688599, "learning_rate": 4.7625959350147905e-05, "loss": 0.83056640625, "step": 12 }, { "epoch": 0.6190476190476191, "grad_norm": 0.6685611605644226, "learning_rate": 4.70814179231785e-05, "loss": 1.894866943359375, "step": 13 }, { "epoch": 0.6666666666666666, "grad_norm": 1.276977300643921, "learning_rate": 4.648495009602168e-05, "loss": 0.64892578125, "step": 14 }, { "epoch": 0.7142857142857143, "grad_norm": 1.3761838674545288, "learning_rate": 4.5838137594128254e-05, "loss": 0.689208984375, "step": 15 }, { "epoch": 0.7142857142857143, "eval_loss": 1.626708984375, "eval_runtime": 5.6958, "eval_samples_per_second": 0.351, "eval_steps_per_second": 0.176, "step": 15 }, { "epoch": 0.7619047619047619, "grad_norm": 1.0244767665863037, "learning_rate": 4.5142695647975993e-05, "loss": 0.554443359375, "step": 16 }, { "epoch": 0.8095238095238095, "grad_norm": 0.4870399832725525, "learning_rate": 4.44004684445867e-05, "loss": 1.8179779052734375, "step": 17 }, { "epoch": 0.8571428571428571, "grad_norm": 0.820194661617279, "learning_rate": 4.361342423707385e-05, "loss": 1.12042236328125, "step": 18 }, { "epoch": 0.9047619047619048, "grad_norm": 0.8197793364524841, "learning_rate": 4.2783650125189096e-05, "loss": 0.616943359375, "step": 19 }, { "epoch": 0.9523809523809523, "grad_norm": 0.5198944211006165, "learning_rate": 4.191334652070895e-05, "loss": 1.839569091796875, "step": 20 }, { "epoch": 1.0, "grad_norm": 0.34501922130584717, "learning_rate": 4.1004821312338285e-05, "loss": 1.6414794921875, "step": 21 }, { "epoch": 1.0476190476190477, "grad_norm": 0.873728334903717, "learning_rate": 4.006048374560445e-05, "loss": 0.578125, "step": 22 }, { "epoch": 1.0952380952380953, "grad_norm": 0.9984555840492249, "learning_rate": 3.90828380339712e-05, "loss": 0.4749755859375, "step": 23 }, { "epoch": 1.1428571428571428, "grad_norm": 0.9322866797447205, "learning_rate": 3.8074476718114706e-05, "loss": 0.59375, "step": 24 }, { "epoch": 1.1904761904761905, "grad_norm": 1.126771330833435, "learning_rate": 3.7038073790971875e-05, "loss": 0.451416015625, "step": 25 }, { "epoch": 1.2380952380952381, "grad_norm": 0.921955406665802, "learning_rate": 3.597637760679167e-05, "loss": 0.4898681640625, "step": 26 }, { "epoch": 1.2857142857142856, "grad_norm": 1.160629153251648, "learning_rate": 3.4892203592993786e-05, "loss": 0.4130859375, "step": 27 }, { "epoch": 1.2857142857142856, "eval_loss": 1.51025390625, "eval_runtime": 5.4865, "eval_samples_per_second": 0.365, "eval_steps_per_second": 0.182, "step": 27 }, { "epoch": 1.3333333333333333, "grad_norm": 0.5455287098884583, "learning_rate": 3.3788426784161216e-05, "loss": 1.712249755859375, "step": 28 }, { "epoch": 1.380952380952381, "grad_norm": 1.361806869506836, "learning_rate": 3.2667974197965405e-05, "loss": 0.3602294921875, "step": 29 }, { "epoch": 1.4285714285714286, "grad_norm": 1.2242106199264526, "learning_rate": 3.1533817073241556e-05, "loss": 0.5125732421875, "step": 30 }, { "epoch": 1.4761904761904763, "grad_norm": 1.058226466178894, "learning_rate": 3.03889629907974e-05, "loss": 0.3873291015625, "step": 31 }, { "epoch": 1.5238095238095237, "grad_norm": 1.107188105583191, "learning_rate": 2.923644789784955e-05, "loss": 0.5450439453125, "step": 32 }, { "epoch": 1.5714285714285714, "grad_norm": 1.150083303451538, "learning_rate": 2.807932805723725e-05, "loss": 0.51953125, "step": 33 }, { "epoch": 1.619047619047619, "grad_norm": 0.534706175327301, "learning_rate": 2.692067194276276e-05, "loss": 1.4922409057617188, "step": 34 }, { "epoch": 1.6666666666666665, "grad_norm": 1.0580393075942993, "learning_rate": 2.5763552102150456e-05, "loss": 0.4501953125, "step": 35 }, { "epoch": 1.7142857142857144, "grad_norm": 1.0441676378250122, "learning_rate": 2.4611037009202603e-05, "loss": 0.478515625, "step": 36 }, { "epoch": 1.7619047619047619, "grad_norm": 0.8805537819862366, "learning_rate": 2.3466182926758456e-05, "loss": 0.3509521484375, "step": 37 }, { "epoch": 1.8095238095238095, "grad_norm": 0.4713503420352936, "learning_rate": 2.2332025802034607e-05, "loss": 1.53851318359375, "step": 38 }, { "epoch": 1.8571428571428572, "grad_norm": 0.6947212219238281, "learning_rate": 2.1211573215838792e-05, "loss": 0.891815185546875, "step": 39 }, { "epoch": 1.8571428571428572, "eval_loss": 1.4468994140625, "eval_runtime": 5.1599, "eval_samples_per_second": 0.388, "eval_steps_per_second": 0.194, "step": 39 }, { "epoch": 1.9047619047619047, "grad_norm": 0.8006393909454346, "learning_rate": 2.010779640700622e-05, "loss": 0.4466552734375, "step": 40 }, { "epoch": 1.9523809523809523, "grad_norm": 0.47487154603004456, "learning_rate": 1.9023622393208336e-05, "loss": 1.5706024169921875, "step": 41 }, { "epoch": 2.0, "grad_norm": 0.3503785729408264, "learning_rate": 1.796192620902814e-05, "loss": 1.513275146484375, "step": 42 }, { "epoch": 2.0476190476190474, "grad_norm": 0.8355963230133057, "learning_rate": 1.692552328188531e-05, "loss": 0.43603515625, "step": 43 }, { "epoch": 2.0952380952380953, "grad_norm": 0.7735680937767029, "learning_rate": 1.5917161966028815e-05, "loss": 0.34686279296875, "step": 44 }, { "epoch": 2.142857142857143, "grad_norm": 0.7461949586868286, "learning_rate": 1.4939516254395546e-05, "loss": 0.43896484375, "step": 45 }, { "epoch": 2.1904761904761907, "grad_norm": 1.0518755912780762, "learning_rate": 1.399517868766172e-05, "loss": 0.325439453125, "step": 46 }, { "epoch": 2.238095238095238, "grad_norm": 0.8924214243888855, "learning_rate": 1.3086653479291062e-05, "loss": 0.3905029296875, "step": 47 }, { "epoch": 2.2857142857142856, "grad_norm": 0.8009278774261475, "learning_rate": 1.2216349874810906e-05, "loss": 0.30126953125, "step": 48 }, { "epoch": 2.3333333333333335, "grad_norm": 0.5341566801071167, "learning_rate": 1.1386575762926155e-05, "loss": 1.5106887817382812, "step": 49 }, { "epoch": 2.380952380952381, "grad_norm": 0.8630108833312988, "learning_rate": 1.0599531555413309e-05, "loss": 0.266845703125, "step": 50 }, { "epoch": 2.4285714285714284, "grad_norm": 0.8821431994438171, "learning_rate": 9.857304352024019e-06, "loss": 0.3577880859375, "step": 51 }, { "epoch": 2.4285714285714284, "eval_loss": 1.4066162109375, "eval_runtime": 5.4612, "eval_samples_per_second": 0.366, "eval_steps_per_second": 0.183, "step": 51 }, { "epoch": 2.4761904761904763, "grad_norm": 0.6822161674499512, "learning_rate": 9.161862405871748e-06, "loss": 0.29779052734375, "step": 52 }, { "epoch": 2.5238095238095237, "grad_norm": 0.9326254725456238, "learning_rate": 8.515049903978325e-06, "loss": 0.45281982421875, "step": 53 }, { "epoch": 2.571428571428571, "grad_norm": 1.0303138494491577, "learning_rate": 7.918582076821507e-06, "loss": 0.39422607421875, "step": 54 }, { "epoch": 2.619047619047619, "grad_norm": 0.5410661101341248, "learning_rate": 7.374040649852105e-06, "loss": 1.334136962890625, "step": 55 }, { "epoch": 2.6666666666666665, "grad_norm": 0.9201714396476746, "learning_rate": 6.882869649042397e-06, "loss": 0.35498046875, "step": 56 }, { "epoch": 2.7142857142857144, "grad_norm": 0.8627307415008545, "learning_rate": 6.446371571588896e-06, "loss": 0.39990234375, "step": 57 }, { "epoch": 2.761904761904762, "grad_norm": 0.6887866258621216, "learning_rate": 6.065703931923894e-06, "loss": 0.2904052734375, "step": 58 }, { "epoch": 2.8095238095238093, "grad_norm": 0.4894810616970062, "learning_rate": 5.741876192195292e-06, "loss": 1.4284439086914062, "step": 59 }, { "epoch": 2.857142857142857, "grad_norm": 0.7044135332107544, "learning_rate": 5.47574708535445e-06, "loss": 0.8047714233398438, "step": 60 }, { "epoch": 2.9047619047619047, "grad_norm": 0.9605301022529602, "learning_rate": 5.268022337950767e-06, "loss": 0.38262939453125, "step": 61 }, { "epoch": 2.9523809523809526, "grad_norm": 0.49748826026916504, "learning_rate": 5.119252798671747e-06, "loss": 1.4863128662109375, "step": 62 }, { "epoch": 3.0, "grad_norm": 0.3692787289619446, "learning_rate": 5.029832977591314e-06, "loss": 1.4801177978515625, "step": 63 }, { "epoch": 3.0, "eval_loss": 1.3985595703125, "eval_runtime": 5.1407, "eval_samples_per_second": 0.389, "eval_steps_per_second": 0.195, "step": 63 } ], "logging_steps": 1.0, "max_steps": 63, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.3702596321542144e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }