BondShift-Llama-3.3-70B-Instruct / trainer_state.json
prathmeshadsod's picture
Upload 8 files
188a5d8 verified
Raw
History Blame Contribute Delete
39 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 42,
"global_step": 210,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.014285714285714285,
"grad_norm": 0.2320670485496521,
"learning_rate": 0.0,
"loss": 1.4560546875,
"step": 1
},
{
"epoch": 0.02857142857142857,
"grad_norm": 0.19893766939640045,
"learning_rate": 1.4285714285714285e-05,
"loss": 1.416015625,
"step": 2
},
{
"epoch": 0.04285714285714286,
"grad_norm": 0.21485203504562378,
"learning_rate": 2.857142857142857e-05,
"loss": 1.427734375,
"step": 3
},
{
"epoch": 0.05714285714285714,
"grad_norm": 0.17585554718971252,
"learning_rate": 4.2857142857142856e-05,
"loss": 1.4130859375,
"step": 4
},
{
"epoch": 0.07142857142857142,
"grad_norm": 0.14219045639038086,
"learning_rate": 5.714285714285714e-05,
"loss": 1.37109375,
"step": 5
},
{
"epoch": 0.08571428571428572,
"grad_norm": 0.110666424036026,
"learning_rate": 7.142857142857143e-05,
"loss": 1.2802734375,
"step": 6
},
{
"epoch": 0.1,
"grad_norm": 0.07214633375406265,
"learning_rate": 8.571428571428571e-05,
"loss": 1.236328125,
"step": 7
},
{
"epoch": 0.11428571428571428,
"grad_norm": 0.09853629767894745,
"learning_rate": 0.0001,
"loss": 1.21240234375,
"step": 8
},
{
"epoch": 0.12857142857142856,
"grad_norm": 0.09580913931131363,
"learning_rate": 9.999461133085083e-05,
"loss": 1.1611328125,
"step": 9
},
{
"epoch": 0.14285714285714285,
"grad_norm": 0.10751494020223618,
"learning_rate": 9.997844661397017e-05,
"loss": 1.1689453125,
"step": 10
},
{
"epoch": 0.15714285714285714,
"grad_norm": 0.09434256702661514,
"learning_rate": 9.995150972074965e-05,
"loss": 1.14892578125,
"step": 11
},
{
"epoch": 0.17142857142857143,
"grad_norm": 0.10388778895139694,
"learning_rate": 9.99138071024784e-05,
"loss": 1.11669921875,
"step": 12
},
{
"epoch": 0.18571428571428572,
"grad_norm": 0.06100620701909065,
"learning_rate": 9.986534778879803e-05,
"loss": 1.0830078125,
"step": 13
},
{
"epoch": 0.2,
"grad_norm": 0.05543210357427597,
"learning_rate": 9.980614338554001e-05,
"loss": 1.0673828125,
"step": 14
},
{
"epoch": 0.21428571428571427,
"grad_norm": 0.05129709094762802,
"learning_rate": 9.97362080719462e-05,
"loss": 1.03955078125,
"step": 15
},
{
"epoch": 0.22857142857142856,
"grad_norm": 0.05103077366948128,
"learning_rate": 9.965555859727286e-05,
"loss": 1.04150390625,
"step": 16
},
{
"epoch": 0.24285714285714285,
"grad_norm": 0.05306376516819,
"learning_rate": 9.956421427677942e-05,
"loss": 0.9921875,
"step": 17
},
{
"epoch": 0.2571428571428571,
"grad_norm": 0.0529288649559021,
"learning_rate": 9.946219698710239e-05,
"loss": 0.98974609375,
"step": 18
},
{
"epoch": 0.2714285714285714,
"grad_norm": 0.05011645331978798,
"learning_rate": 9.934953116101605e-05,
"loss": 0.970703125,
"step": 19
},
{
"epoch": 0.2857142857142857,
"grad_norm": 0.04930735006928444,
"learning_rate": 9.92262437815809e-05,
"loss": 0.96923828125,
"step": 20
},
{
"epoch": 0.3,
"grad_norm": 0.045997343957424164,
"learning_rate": 9.909236437568131e-05,
"loss": 0.95654296875,
"step": 21
},
{
"epoch": 0.3142857142857143,
"grad_norm": 0.0459485799074173,
"learning_rate": 9.89479250069539e-05,
"loss": 0.962890625,
"step": 22
},
{
"epoch": 0.32857142857142857,
"grad_norm": 0.05136457830667496,
"learning_rate": 9.879296026810846e-05,
"loss": 0.9443359375,
"step": 23
},
{
"epoch": 0.34285714285714286,
"grad_norm": 0.05191263556480408,
"learning_rate": 9.862750727264311e-05,
"loss": 0.9482421875,
"step": 24
},
{
"epoch": 0.35714285714285715,
"grad_norm": 0.045134589076042175,
"learning_rate": 9.845160564595573e-05,
"loss": 0.92578125,
"step": 25
},
{
"epoch": 0.37142857142857144,
"grad_norm": 0.044029735028743744,
"learning_rate": 9.826529751585381e-05,
"loss": 0.91943359375,
"step": 26
},
{
"epoch": 0.38571428571428573,
"grad_norm": 0.052899908274412155,
"learning_rate": 9.806862750246505e-05,
"loss": 0.9345703125,
"step": 27
},
{
"epoch": 0.4,
"grad_norm": 0.04427888244390488,
"learning_rate": 9.786164270755095e-05,
"loss": 0.88037109375,
"step": 28
},
{
"epoch": 0.4142857142857143,
"grad_norm": 0.04433929920196533,
"learning_rate": 9.764439270322611e-05,
"loss": 0.90380859375,
"step": 29
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.04645824059844017,
"learning_rate": 9.741692952008592e-05,
"loss": 0.87646484375,
"step": 30
},
{
"epoch": 0.44285714285714284,
"grad_norm": 0.04405355453491211,
"learning_rate": 9.717930763474537e-05,
"loss": 0.916015625,
"step": 31
},
{
"epoch": 0.45714285714285713,
"grad_norm": 0.05218774825334549,
"learning_rate": 9.693158395679215e-05,
"loss": 0.8779296875,
"step": 32
},
{
"epoch": 0.4714285714285714,
"grad_norm": 0.042239945381879807,
"learning_rate": 9.667381781515695e-05,
"loss": 0.8681640625,
"step": 33
},
{
"epoch": 0.4857142857142857,
"grad_norm": 0.04367329180240631,
"learning_rate": 9.640607094390445e-05,
"loss": 0.85595703125,
"step": 34
},
{
"epoch": 0.5,
"grad_norm": 0.04941326379776001,
"learning_rate": 9.61284074674482e-05,
"loss": 0.8779296875,
"step": 35
},
{
"epoch": 0.5142857142857142,
"grad_norm": 0.052676014602184296,
"learning_rate": 9.584089388519307e-05,
"loss": 0.84716796875,
"step": 36
},
{
"epoch": 0.5285714285714286,
"grad_norm": 0.04546784237027168,
"learning_rate": 9.554359905560886e-05,
"loss": 0.84716796875,
"step": 37
},
{
"epoch": 0.5428571428571428,
"grad_norm": 0.04700865596532822,
"learning_rate": 9.523659417973897e-05,
"loss": 0.8603515625,
"step": 38
},
{
"epoch": 0.5571428571428572,
"grad_norm": 0.04255075752735138,
"learning_rate": 9.4919952784148e-05,
"loss": 0.83642578125,
"step": 39
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.04506116360425949,
"learning_rate": 9.459375070331236e-05,
"loss": 0.8408203125,
"step": 40
},
{
"epoch": 0.5857142857142857,
"grad_norm": 0.044488076120615005,
"learning_rate": 9.425806606145826e-05,
"loss": 0.841796875,
"step": 41
},
{
"epoch": 0.6,
"grad_norm": 0.04531097412109375,
"learning_rate": 9.391297925385118e-05,
"loss": 0.83740234375,
"step": 42
},
{
"epoch": 0.6,
"eval_loss": 0.823486328125,
"eval_runtime": 12.7198,
"eval_samples_per_second": 0.786,
"eval_steps_per_second": 0.157,
"step": 42
},
{
"epoch": 0.6142857142857143,
"grad_norm": 0.04757943004369736,
"learning_rate": 9.355857292754152e-05,
"loss": 0.8017578125,
"step": 43
},
{
"epoch": 0.6285714285714286,
"grad_norm": 0.046234458684921265,
"learning_rate": 9.319493196157092e-05,
"loss": 0.818359375,
"step": 44
},
{
"epoch": 0.6428571428571429,
"grad_norm": 0.04600878804922104,
"learning_rate": 9.282214344664404e-05,
"loss": 0.81640625,
"step": 45
},
{
"epoch": 0.6571428571428571,
"grad_norm": 0.07235831022262573,
"learning_rate": 9.244029666427061e-05,
"loss": 0.818359375,
"step": 46
},
{
"epoch": 0.6714285714285714,
"grad_norm": 0.04685613512992859,
"learning_rate": 9.204948306538293e-05,
"loss": 0.84521484375,
"step": 47
},
{
"epoch": 0.6857142857142857,
"grad_norm": 0.04504545032978058,
"learning_rate": 9.164979624843358e-05,
"loss": 0.806640625,
"step": 48
},
{
"epoch": 0.7,
"grad_norm": 0.04681597277522087,
"learning_rate": 9.124133193697898e-05,
"loss": 0.80126953125,
"step": 49
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.049921900033950806,
"learning_rate": 9.082418795675397e-05,
"loss": 0.79541015625,
"step": 50
},
{
"epoch": 0.7285714285714285,
"grad_norm": 0.04480814188718796,
"learning_rate": 9.039846421224288e-05,
"loss": 0.7666015625,
"step": 51
},
{
"epoch": 0.7428571428571429,
"grad_norm": 0.048868753015995026,
"learning_rate": 8.996426266275271e-05,
"loss": 0.80615234375,
"step": 52
},
{
"epoch": 0.7571428571428571,
"grad_norm": 0.04697711020708084,
"learning_rate": 8.952168729799435e-05,
"loss": 0.787109375,
"step": 53
},
{
"epoch": 0.7714285714285715,
"grad_norm": 0.0476866252720356,
"learning_rate": 8.90708441131773e-05,
"loss": 0.7880859375,
"step": 54
},
{
"epoch": 0.7857142857142857,
"grad_norm": 0.047018349170684814,
"learning_rate": 8.861184108362425e-05,
"loss": 0.77880859375,
"step": 55
},
{
"epoch": 0.8,
"grad_norm": 0.05050313100218773,
"learning_rate": 8.814478813891148e-05,
"loss": 0.76953125,
"step": 56
},
{
"epoch": 0.8142857142857143,
"grad_norm": 0.049961939454078674,
"learning_rate": 8.766979713654089e-05,
"loss": 0.794921875,
"step": 57
},
{
"epoch": 0.8285714285714286,
"grad_norm": 0.04898722842335701,
"learning_rate": 8.718698183515077e-05,
"loss": 0.77880859375,
"step": 58
},
{
"epoch": 0.8428571428571429,
"grad_norm": 0.05006740987300873,
"learning_rate": 8.669645786727083e-05,
"loss": 0.80419921875,
"step": 59
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.05039166659116745,
"learning_rate": 8.619834271162879e-05,
"loss": 0.7734375,
"step": 60
},
{
"epoch": 0.8714285714285714,
"grad_norm": 0.051033422350883484,
"learning_rate": 8.56927556650145e-05,
"loss": 0.755859375,
"step": 61
},
{
"epoch": 0.8857142857142857,
"grad_norm": 0.05211988091468811,
"learning_rate": 8.517981781370884e-05,
"loss": 0.77734375,
"step": 62
},
{
"epoch": 0.9,
"grad_norm": 0.04897433891892433,
"learning_rate": 8.465965200448403e-05,
"loss": 0.76904296875,
"step": 63
},
{
"epoch": 0.9142857142857143,
"grad_norm": 0.05581013858318329,
"learning_rate": 8.413238281518225e-05,
"loss": 0.77392578125,
"step": 64
},
{
"epoch": 0.9285714285714286,
"grad_norm": 0.05405630171298981,
"learning_rate": 8.359813652487964e-05,
"loss": 0.7724609375,
"step": 65
},
{
"epoch": 0.9428571428571428,
"grad_norm": 0.07353562116622925,
"learning_rate": 8.305704108364301e-05,
"loss": 0.77197265625,
"step": 66
},
{
"epoch": 0.9571428571428572,
"grad_norm": 0.05411151796579361,
"learning_rate": 8.250922608188617e-05,
"loss": 0.7568359375,
"step": 67
},
{
"epoch": 0.9714285714285714,
"grad_norm": 0.052922919392585754,
"learning_rate": 8.195482271933352e-05,
"loss": 0.748046875,
"step": 68
},
{
"epoch": 0.9857142857142858,
"grad_norm": 0.054411035031080246,
"learning_rate": 8.139396377359824e-05,
"loss": 0.76025390625,
"step": 69
},
{
"epoch": 1.0,
"grad_norm": 0.053164735436439514,
"learning_rate": 8.082678356838245e-05,
"loss": 0.734375,
"step": 70
},
{
"epoch": 1.0142857142857142,
"grad_norm": 0.05180563032627106,
"learning_rate": 8.025341794130722e-05,
"loss": 0.7333984375,
"step": 71
},
{
"epoch": 1.0285714285714285,
"grad_norm": 0.06838234513998032,
"learning_rate": 7.96740042113799e-05,
"loss": 0.75927734375,
"step": 72
},
{
"epoch": 1.042857142857143,
"grad_norm": 0.051840752363204956,
"learning_rate": 7.908868114610677e-05,
"loss": 0.71728515625,
"step": 73
},
{
"epoch": 1.0571428571428572,
"grad_norm": 0.055688485503196716,
"learning_rate": 7.849758892825868e-05,
"loss": 0.74755859375,
"step": 74
},
{
"epoch": 1.0714285714285714,
"grad_norm": 0.05514116212725639,
"learning_rate": 7.790086912229781e-05,
"loss": 0.76904296875,
"step": 75
},
{
"epoch": 1.0857142857142856,
"grad_norm": 0.06220082938671112,
"learning_rate": 7.729866464047343e-05,
"loss": 0.7509765625,
"step": 76
},
{
"epoch": 1.1,
"grad_norm": 0.055815357714891434,
"learning_rate": 7.6691119708595e-05,
"loss": 0.7529296875,
"step": 77
},
{
"epoch": 1.1142857142857143,
"grad_norm": 0.06340858340263367,
"learning_rate": 7.607837983149056e-05,
"loss": 0.7509765625,
"step": 78
},
{
"epoch": 1.1285714285714286,
"grad_norm": 0.05273920297622681,
"learning_rate": 7.54605917581589e-05,
"loss": 0.7373046875,
"step": 79
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.060172632336616516,
"learning_rate": 7.483790344662363e-05,
"loss": 0.73876953125,
"step": 80
},
{
"epoch": 1.157142857142857,
"grad_norm": 0.05791589617729187,
"learning_rate": 7.42104640284978e-05,
"loss": 0.75341796875,
"step": 81
},
{
"epoch": 1.1714285714285715,
"grad_norm": 0.053483158349990845,
"learning_rate": 7.357842377326747e-05,
"loss": 0.75390625,
"step": 82
},
{
"epoch": 1.1857142857142857,
"grad_norm": 0.05703427270054817,
"learning_rate": 7.294193405230255e-05,
"loss": 0.736328125,
"step": 83
},
{
"epoch": 1.2,
"grad_norm": 0.05676823481917381,
"learning_rate": 7.230114730260413e-05,
"loss": 0.74853515625,
"step": 84
},
{
"epoch": 1.2,
"eval_loss": 0.7371826171875,
"eval_runtime": 12.6958,
"eval_samples_per_second": 0.788,
"eval_steps_per_second": 0.158,
"step": 84
},
{
"epoch": 1.2142857142857142,
"grad_norm": 0.05460375174880028,
"learning_rate": 7.165621699029615e-05,
"loss": 0.7294921875,
"step": 85
},
{
"epoch": 1.2285714285714286,
"grad_norm": 0.058347344398498535,
"learning_rate": 7.100729757387093e-05,
"loss": 0.74560546875,
"step": 86
},
{
"epoch": 1.2428571428571429,
"grad_norm": 0.05723877623677254,
"learning_rate": 7.03545444671969e-05,
"loss": 0.70263671875,
"step": 87
},
{
"epoch": 1.2571428571428571,
"grad_norm": 0.05612649396061897,
"learning_rate": 6.969811400229756e-05,
"loss": 0.71240234375,
"step": 88
},
{
"epoch": 1.2714285714285714,
"grad_norm": 0.05999016389250755,
"learning_rate": 6.90381633919104e-05,
"loss": 0.7080078125,
"step": 89
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.055943626910448074,
"learning_rate": 6.837485069183519e-05,
"loss": 0.708984375,
"step": 90
},
{
"epoch": 1.3,
"grad_norm": 0.05445539951324463,
"learning_rate": 6.770833476308007e-05,
"loss": 0.71484375,
"step": 91
},
{
"epoch": 1.3142857142857143,
"grad_norm": 0.05527206137776375,
"learning_rate": 6.703877523381496e-05,
"loss": 0.732421875,
"step": 92
},
{
"epoch": 1.3285714285714285,
"grad_norm": 0.054216012358665466,
"learning_rate": 6.636633246114108e-05,
"loss": 0.71142578125,
"step": 93
},
{
"epoch": 1.342857142857143,
"grad_norm": 0.058076757937669754,
"learning_rate": 6.569116749268622e-05,
"loss": 0.7333984375,
"step": 94
},
{
"epoch": 1.3571428571428572,
"grad_norm": 0.056523364037275314,
"learning_rate": 6.501344202803414e-05,
"loss": 0.716796875,
"step": 95
},
{
"epoch": 1.3714285714285714,
"grad_norm": 0.05528922751545906,
"learning_rate": 6.433331837999837e-05,
"loss": 0.71484375,
"step": 96
},
{
"epoch": 1.3857142857142857,
"grad_norm": 0.06398510187864304,
"learning_rate": 6.365095943574866e-05,
"loss": 0.73193359375,
"step": 97
},
{
"epoch": 1.4,
"grad_norm": 0.058720558881759644,
"learning_rate": 6.296652861780017e-05,
"loss": 0.68994140625,
"step": 98
},
{
"epoch": 1.4142857142857144,
"grad_norm": 0.055224865674972534,
"learning_rate": 6.228018984487442e-05,
"loss": 0.72314453125,
"step": 99
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.05576997250318527,
"learning_rate": 6.159210749264121e-05,
"loss": 0.6953125,
"step": 100
},
{
"epoch": 1.4428571428571428,
"grad_norm": 0.06290734559297562,
"learning_rate": 6.09024463543514e-05,
"loss": 0.736328125,
"step": 101
},
{
"epoch": 1.457142857142857,
"grad_norm": 0.05929115042090416,
"learning_rate": 6.02113716013694e-05,
"loss": 0.69775390625,
"step": 102
},
{
"epoch": 1.4714285714285715,
"grad_norm": 0.056523021310567856,
"learning_rate": 5.951904874361527e-05,
"loss": 0.70263671875,
"step": 103
},
{
"epoch": 1.4857142857142858,
"grad_norm": 0.06137212738394737,
"learning_rate": 5.8825643589925636e-05,
"loss": 0.6923828125,
"step": 104
},
{
"epoch": 1.5,
"grad_norm": 0.05514180287718773,
"learning_rate": 5.8131322208343166e-05,
"loss": 0.71875,
"step": 105
},
{
"epoch": 1.5142857142857142,
"grad_norm": 0.06357347965240479,
"learning_rate": 5.74362508863438e-05,
"loss": 0.685302734375,
"step": 106
},
{
"epoch": 1.5285714285714285,
"grad_norm": 0.07104372978210449,
"learning_rate": 5.67405960910115e-05,
"loss": 0.6875,
"step": 107
},
{
"epoch": 1.5428571428571427,
"grad_norm": 0.06608453392982483,
"learning_rate": 5.6044524429170006e-05,
"loss": 0.7060546875,
"step": 108
},
{
"epoch": 1.5571428571428572,
"grad_norm": 0.056561872363090515,
"learning_rate": 5.5348202607481105e-05,
"loss": 0.69287109375,
"step": 109
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.056340012699365616,
"learning_rate": 5.465179739251891e-05,
"loss": 0.69189453125,
"step": 110
},
{
"epoch": 1.5857142857142859,
"grad_norm": 0.05912540853023529,
"learning_rate": 5.395547557082999e-05,
"loss": 0.70068359375,
"step": 111
},
{
"epoch": 1.6,
"grad_norm": 0.06018223986029625,
"learning_rate": 5.32594039089885e-05,
"loss": 0.69921875,
"step": 112
},
{
"epoch": 1.6142857142857143,
"grad_norm": 0.0592244416475296,
"learning_rate": 5.2563749113656216e-05,
"loss": 0.667236328125,
"step": 113
},
{
"epoch": 1.6285714285714286,
"grad_norm": 0.05921940505504608,
"learning_rate": 5.186867779165685e-05,
"loss": 0.6845703125,
"step": 114
},
{
"epoch": 1.6428571428571428,
"grad_norm": 0.061107177287340164,
"learning_rate": 5.117435641007439e-05,
"loss": 0.6865234375,
"step": 115
},
{
"epoch": 1.657142857142857,
"grad_norm": 0.0601227767765522,
"learning_rate": 5.048095125638474e-05,
"loss": 0.69091796875,
"step": 116
},
{
"epoch": 1.6714285714285713,
"grad_norm": 0.06221635267138481,
"learning_rate": 4.978862839863061e-05,
"loss": 0.71923828125,
"step": 117
},
{
"epoch": 1.6857142857142857,
"grad_norm": 0.062171511352062225,
"learning_rate": 4.9097553645648594e-05,
"loss": 0.68408203125,
"step": 118
},
{
"epoch": 1.7,
"grad_norm": 0.06688631325960159,
"learning_rate": 4.840789250735879e-05,
"loss": 0.685546875,
"step": 119
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.062123820185661316,
"learning_rate": 4.771981015512559e-05,
"loss": 0.67529296875,
"step": 120
},
{
"epoch": 1.7285714285714286,
"grad_norm": 0.059517137706279755,
"learning_rate": 4.7033471382199836e-05,
"loss": 0.65283203125,
"step": 121
},
{
"epoch": 1.7428571428571429,
"grad_norm": 0.06246113404631615,
"learning_rate": 4.6349040564251346e-05,
"loss": 0.6943359375,
"step": 122
},
{
"epoch": 1.7571428571428571,
"grad_norm": 0.09060859680175781,
"learning_rate": 4.5666681620001625e-05,
"loss": 0.67431640625,
"step": 123
},
{
"epoch": 1.7714285714285714,
"grad_norm": 0.06127085164189339,
"learning_rate": 4.498655797196586e-05,
"loss": 0.6796875,
"step": 124
},
{
"epoch": 1.7857142857142856,
"grad_norm": 0.061497125774621964,
"learning_rate": 4.4308832507313815e-05,
"loss": 0.67431640625,
"step": 125
},
{
"epoch": 1.8,
"grad_norm": 0.06085183098912239,
"learning_rate": 4.3633667538858934e-05,
"loss": 0.6611328125,
"step": 126
},
{
"epoch": 1.8,
"eval_loss": 0.7088623046875,
"eval_runtime": 12.6903,
"eval_samples_per_second": 0.788,
"eval_steps_per_second": 0.158,
"step": 126
},
{
"epoch": 1.8142857142857143,
"grad_norm": 0.05988273769617081,
"learning_rate": 4.296122476618507e-05,
"loss": 0.689453125,
"step": 127
},
{
"epoch": 1.8285714285714287,
"grad_norm": 0.06360983848571777,
"learning_rate": 4.229166523691993e-05,
"loss": 0.673828125,
"step": 128
},
{
"epoch": 1.842857142857143,
"grad_norm": 0.06351760774850845,
"learning_rate": 4.162514930816481e-05,
"loss": 0.70068359375,
"step": 129
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.061407994478940964,
"learning_rate": 4.09618366080896e-05,
"loss": 0.673828125,
"step": 130
},
{
"epoch": 1.8714285714285714,
"grad_norm": 0.06777355074882507,
"learning_rate": 4.0301885997702457e-05,
"loss": 0.6591796875,
"step": 131
},
{
"epoch": 1.8857142857142857,
"grad_norm": 0.059942860156297684,
"learning_rate": 3.9645455532803086e-05,
"loss": 0.68310546875,
"step": 132
},
{
"epoch": 1.9,
"grad_norm": 0.06295284628868103,
"learning_rate": 3.899270242612907e-05,
"loss": 0.67333984375,
"step": 133
},
{
"epoch": 1.9142857142857141,
"grad_norm": 0.06429057568311691,
"learning_rate": 3.834378300970385e-05,
"loss": 0.6806640625,
"step": 134
},
{
"epoch": 1.9285714285714286,
"grad_norm": 0.062211379408836365,
"learning_rate": 3.7698852697395884e-05,
"loss": 0.67724609375,
"step": 135
},
{
"epoch": 1.9428571428571428,
"grad_norm": 0.0751936212182045,
"learning_rate": 3.7058065947697454e-05,
"loss": 0.6796875,
"step": 136
},
{
"epoch": 1.9571428571428573,
"grad_norm": 0.06252847611904144,
"learning_rate": 3.6421576226732544e-05,
"loss": 0.6640625,
"step": 137
},
{
"epoch": 1.9714285714285715,
"grad_norm": 0.06349719315767288,
"learning_rate": 3.57895359715022e-05,
"loss": 0.6572265625,
"step": 138
},
{
"epoch": 1.9857142857142858,
"grad_norm": 0.06345172226428986,
"learning_rate": 3.516209655337639e-05,
"loss": 0.6708984375,
"step": 139
},
{
"epoch": 2.0,
"grad_norm": 0.06399086862802505,
"learning_rate": 3.4539408241841105e-05,
"loss": 0.6455078125,
"step": 140
},
{
"epoch": 2.0142857142857142,
"grad_norm": 0.06483668088912964,
"learning_rate": 3.392162016850945e-05,
"loss": 0.64697265625,
"step": 141
},
{
"epoch": 2.0285714285714285,
"grad_norm": 0.06015940010547638,
"learning_rate": 3.330888029140503e-05,
"loss": 0.6748046875,
"step": 142
},
{
"epoch": 2.0428571428571427,
"grad_norm": 0.06585846096277237,
"learning_rate": 3.2701335359526584e-05,
"loss": 0.634765625,
"step": 143
},
{
"epoch": 2.057142857142857,
"grad_norm": 0.06796801090240479,
"learning_rate": 3.209913087770221e-05,
"loss": 0.66357421875,
"step": 144
},
{
"epoch": 2.0714285714285716,
"grad_norm": 0.06410115957260132,
"learning_rate": 3.1502411071741334e-05,
"loss": 0.68408203125,
"step": 145
},
{
"epoch": 2.085714285714286,
"grad_norm": 0.07315430790185928,
"learning_rate": 3.091131885389324e-05,
"loss": 0.66943359375,
"step": 146
},
{
"epoch": 2.1,
"grad_norm": 0.06741099804639816,
"learning_rate": 3.032599578862011e-05,
"loss": 0.67236328125,
"step": 147
},
{
"epoch": 2.1142857142857143,
"grad_norm": 0.06903790682554245,
"learning_rate": 2.97465820586928e-05,
"loss": 0.66845703125,
"step": 148
},
{
"epoch": 2.1285714285714286,
"grad_norm": 0.06851155310869217,
"learning_rate": 2.9173216431617545e-05,
"loss": 0.66162109375,
"step": 149
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.06491309404373169,
"learning_rate": 2.8606036226401768e-05,
"loss": 0.65966796875,
"step": 150
},
{
"epoch": 2.157142857142857,
"grad_norm": 0.06776642799377441,
"learning_rate": 2.804517728066649e-05,
"loss": 0.6748046875,
"step": 151
},
{
"epoch": 2.1714285714285713,
"grad_norm": 0.06124527007341385,
"learning_rate": 2.749077391811384e-05,
"loss": 0.67822265625,
"step": 152
},
{
"epoch": 2.185714285714286,
"grad_norm": 0.06878867745399475,
"learning_rate": 2.6942958916356998e-05,
"loss": 0.662109375,
"step": 153
},
{
"epoch": 2.2,
"grad_norm": 0.06806619465351105,
"learning_rate": 2.640186347512037e-05,
"loss": 0.671875,
"step": 154
},
{
"epoch": 2.2142857142857144,
"grad_norm": 0.06395353376865387,
"learning_rate": 2.586761718481776e-05,
"loss": 0.65576171875,
"step": 155
},
{
"epoch": 2.2285714285714286,
"grad_norm": 0.07178875803947449,
"learning_rate": 2.5340347995515977e-05,
"loss": 0.67138671875,
"step": 156
},
{
"epoch": 2.242857142857143,
"grad_norm": 0.06459272652864456,
"learning_rate": 2.4820182186291172e-05,
"loss": 0.63134765625,
"step": 157
},
{
"epoch": 2.257142857142857,
"grad_norm": 0.06613647937774658,
"learning_rate": 2.430724433498552e-05,
"loss": 0.64111328125,
"step": 158
},
{
"epoch": 2.2714285714285714,
"grad_norm": 0.06713347882032394,
"learning_rate": 2.3801657288371217e-05,
"loss": 0.63916015625,
"step": 159
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.06648610532283783,
"learning_rate": 2.3303542132729168e-05,
"loss": 0.638671875,
"step": 160
},
{
"epoch": 2.3,
"grad_norm": 0.06578565388917923,
"learning_rate": 2.281301816484925e-05,
"loss": 0.6474609375,
"step": 161
},
{
"epoch": 2.314285714285714,
"grad_norm": 0.0631573498249054,
"learning_rate": 2.2330202863459122e-05,
"loss": 0.6640625,
"step": 162
},
{
"epoch": 2.3285714285714287,
"grad_norm": 0.06323499232530594,
"learning_rate": 2.1855211861088538e-05,
"loss": 0.643798828125,
"step": 163
},
{
"epoch": 2.342857142857143,
"grad_norm": 0.06487427651882172,
"learning_rate": 2.1388158916375755e-05,
"loss": 0.66552734375,
"step": 164
},
{
"epoch": 2.357142857142857,
"grad_norm": 0.06590575724840164,
"learning_rate": 2.0929155886822716e-05,
"loss": 0.6513671875,
"step": 165
},
{
"epoch": 2.3714285714285714,
"grad_norm": 0.06528814882040024,
"learning_rate": 2.0478312702005653e-05,
"loss": 0.65087890625,
"step": 166
},
{
"epoch": 2.3857142857142857,
"grad_norm": 0.06810116022825241,
"learning_rate": 2.003573733724729e-05,
"loss": 0.662109375,
"step": 167
},
{
"epoch": 2.4,
"grad_norm": 0.0618431381881237,
"learning_rate": 1.9601535787757132e-05,
"loss": 0.62939453125,
"step": 168
},
{
"epoch": 2.4,
"eval_loss": 0.6951904296875,
"eval_runtime": 12.6967,
"eval_samples_per_second": 0.788,
"eval_steps_per_second": 0.158,
"step": 168
},
{
"epoch": 2.414285714285714,
"grad_norm": 0.06515216827392578,
"learning_rate": 1.9175812043246033e-05,
"loss": 0.66162109375,
"step": 169
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.06773951649665833,
"learning_rate": 1.8758668063021033e-05,
"loss": 0.634765625,
"step": 170
},
{
"epoch": 2.442857142857143,
"grad_norm": 0.06553688645362854,
"learning_rate": 1.8350203751566436e-05,
"loss": 0.67138671875,
"step": 171
},
{
"epoch": 2.4571428571428573,
"grad_norm": 0.06633678823709488,
"learning_rate": 1.7950516934617083e-05,
"loss": 0.6357421875,
"step": 172
},
{
"epoch": 2.4714285714285715,
"grad_norm": 0.06607075780630112,
"learning_rate": 1.75597033357294e-05,
"loss": 0.64306640625,
"step": 173
},
{
"epoch": 2.4857142857142858,
"grad_norm": 0.06522510200738907,
"learning_rate": 1.717785655335597e-05,
"loss": 0.63232421875,
"step": 174
},
{
"epoch": 2.5,
"grad_norm": 0.06720203161239624,
"learning_rate": 1.680506803842909e-05,
"loss": 0.65966796875,
"step": 175
},
{
"epoch": 2.5142857142857142,
"grad_norm": 0.06660260260105133,
"learning_rate": 1.6441427072458494e-05,
"loss": 0.625732421875,
"step": 176
},
{
"epoch": 2.5285714285714285,
"grad_norm": 0.06615811586380005,
"learning_rate": 1.6087020746148828e-05,
"loss": 0.6298828125,
"step": 177
},
{
"epoch": 2.5428571428571427,
"grad_norm": 0.06593484431505203,
"learning_rate": 1.5741933938541755e-05,
"loss": 0.64501953125,
"step": 178
},
{
"epoch": 2.557142857142857,
"grad_norm": 0.06653065979480743,
"learning_rate": 1.540624929668765e-05,
"loss": 0.63720703125,
"step": 179
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.06582722812891006,
"learning_rate": 1.5080047215852011e-05,
"loss": 0.63525390625,
"step": 180
},
{
"epoch": 2.585714285714286,
"grad_norm": 0.06583766639232635,
"learning_rate": 1.4763405820261036e-05,
"loss": 0.64697265625,
"step": 181
},
{
"epoch": 2.6,
"grad_norm": 0.06714893132448196,
"learning_rate": 1.4456400944391146e-05,
"loss": 0.6455078125,
"step": 182
},
{
"epoch": 2.6142857142857143,
"grad_norm": 0.06695859879255295,
"learning_rate": 1.4159106114806942e-05,
"loss": 0.610107421875,
"step": 183
},
{
"epoch": 2.6285714285714286,
"grad_norm": 0.06631751358509064,
"learning_rate": 1.3871592532551805e-05,
"loss": 0.630859375,
"step": 184
},
{
"epoch": 2.642857142857143,
"grad_norm": 0.06531959772109985,
"learning_rate": 1.3593929056095556e-05,
"loss": 0.630859375,
"step": 185
},
{
"epoch": 2.657142857142857,
"grad_norm": 0.06435287743806839,
"learning_rate": 1.332618218484306e-05,
"loss": 0.6396484375,
"step": 186
},
{
"epoch": 2.6714285714285713,
"grad_norm": 0.06656572967767715,
"learning_rate": 1.3068416043207863e-05,
"loss": 0.66552734375,
"step": 187
},
{
"epoch": 2.685714285714286,
"grad_norm": 0.06637463718652725,
"learning_rate": 1.2820692365254631e-05,
"loss": 0.6328125,
"step": 188
},
{
"epoch": 2.7,
"grad_norm": 0.0676756501197815,
"learning_rate": 1.2583070479914087e-05,
"loss": 0.63427734375,
"step": 189
},
{
"epoch": 2.7142857142857144,
"grad_norm": 0.06691654771566391,
"learning_rate": 1.2355607296773895e-05,
"loss": 0.6240234375,
"step": 190
},
{
"epoch": 2.7285714285714286,
"grad_norm": 0.06870891898870468,
"learning_rate": 1.2138357292449055e-05,
"loss": 0.603515625,
"step": 191
},
{
"epoch": 2.742857142857143,
"grad_norm": 0.06647045165300369,
"learning_rate": 1.1931372497534953e-05,
"loss": 0.6455078125,
"step": 192
},
{
"epoch": 2.757142857142857,
"grad_norm": 0.06754187494516373,
"learning_rate": 1.1734702484146193e-05,
"loss": 0.6279296875,
"step": 193
},
{
"epoch": 2.7714285714285714,
"grad_norm": 0.06615348160266876,
"learning_rate": 1.1548394354044276e-05,
"loss": 0.6328125,
"step": 194
},
{
"epoch": 2.7857142857142856,
"grad_norm": 0.0676516741514206,
"learning_rate": 1.1372492727356887e-05,
"loss": 0.62646484375,
"step": 195
},
{
"epoch": 2.8,
"grad_norm": 0.0679558664560318,
"learning_rate": 1.1207039731891532e-05,
"loss": 0.61669921875,
"step": 196
},
{
"epoch": 2.814285714285714,
"grad_norm": 0.06910320371389389,
"learning_rate": 1.1052074993046102e-05,
"loss": 0.64306640625,
"step": 197
},
{
"epoch": 2.8285714285714287,
"grad_norm": 0.069993756711483,
"learning_rate": 1.0907635624318696e-05,
"loss": 0.627197265625,
"step": 198
},
{
"epoch": 2.842857142857143,
"grad_norm": 0.07021188735961914,
"learning_rate": 1.0773756218419104e-05,
"loss": 0.65234375,
"step": 199
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.06672544032335281,
"learning_rate": 1.0650468838983959e-05,
"loss": 0.63037109375,
"step": 200
},
{
"epoch": 2.8714285714285714,
"grad_norm": 0.06757517904043198,
"learning_rate": 1.0537803012897617e-05,
"loss": 0.61474609375,
"step": 201
},
{
"epoch": 2.8857142857142857,
"grad_norm": 0.06685593724250793,
"learning_rate": 1.043578572322058e-05,
"loss": 0.6396484375,
"step": 202
},
{
"epoch": 2.9,
"grad_norm": 0.0702473595738411,
"learning_rate": 1.0344441402727142e-05,
"loss": 0.63037109375,
"step": 203
},
{
"epoch": 2.914285714285714,
"grad_norm": 0.06869243085384369,
"learning_rate": 1.0263791928053819e-05,
"loss": 0.63720703125,
"step": 204
},
{
"epoch": 2.928571428571429,
"grad_norm": 0.06895088404417038,
"learning_rate": 1.0193856614459998e-05,
"loss": 0.6337890625,
"step": 205
},
{
"epoch": 2.942857142857143,
"grad_norm": 0.06920134276151657,
"learning_rate": 1.013465221120198e-05,
"loss": 0.638671875,
"step": 206
},
{
"epoch": 2.9571428571428573,
"grad_norm": 0.06936103105545044,
"learning_rate": 1.0086192897521601e-05,
"loss": 0.6201171875,
"step": 207
},
{
"epoch": 2.9714285714285715,
"grad_norm": 0.07043518126010895,
"learning_rate": 1.0048490279250354e-05,
"loss": 0.61669921875,
"step": 208
},
{
"epoch": 2.9857142857142858,
"grad_norm": 0.06810513883829117,
"learning_rate": 1.0021553386029838e-05,
"loss": 0.63134765625,
"step": 209
},
{
"epoch": 3.0,
"grad_norm": 0.06843512505292892,
"learning_rate": 1.0005388669149184e-05,
"loss": 0.60400390625,
"step": 210
},
{
"epoch": 3.0,
"eval_loss": 0.6898193359375,
"eval_runtime": 12.7056,
"eval_samples_per_second": 0.787,
"eval_steps_per_second": 0.157,
"step": 210
}
],
"logging_steps": 1.0,
"max_steps": 210,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 0,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.7282139802791051e+19,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}