{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 42, "global_step": 210, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.014285714285714285, "grad_norm": 0.2320670485496521, "learning_rate": 0.0, "loss": 1.4560546875, "step": 1 }, { "epoch": 0.02857142857142857, "grad_norm": 0.19893766939640045, "learning_rate": 1.4285714285714285e-05, "loss": 1.416015625, "step": 2 }, { "epoch": 0.04285714285714286, "grad_norm": 0.21485203504562378, "learning_rate": 2.857142857142857e-05, "loss": 1.427734375, "step": 3 }, { "epoch": 0.05714285714285714, "grad_norm": 0.17585554718971252, "learning_rate": 4.2857142857142856e-05, "loss": 1.4130859375, "step": 4 }, { "epoch": 0.07142857142857142, "grad_norm": 0.14219045639038086, "learning_rate": 5.714285714285714e-05, "loss": 1.37109375, "step": 5 }, { "epoch": 0.08571428571428572, "grad_norm": 0.110666424036026, "learning_rate": 7.142857142857143e-05, "loss": 1.2802734375, "step": 6 }, { "epoch": 0.1, "grad_norm": 0.07214633375406265, "learning_rate": 8.571428571428571e-05, "loss": 1.236328125, "step": 7 }, { "epoch": 0.11428571428571428, "grad_norm": 0.09853629767894745, "learning_rate": 0.0001, "loss": 1.21240234375, "step": 8 }, { "epoch": 0.12857142857142856, "grad_norm": 0.09580913931131363, "learning_rate": 9.999461133085083e-05, "loss": 1.1611328125, "step": 9 }, { "epoch": 0.14285714285714285, "grad_norm": 0.10751494020223618, "learning_rate": 9.997844661397017e-05, "loss": 1.1689453125, "step": 10 }, { "epoch": 0.15714285714285714, "grad_norm": 0.09434256702661514, "learning_rate": 9.995150972074965e-05, "loss": 1.14892578125, "step": 11 }, { "epoch": 0.17142857142857143, "grad_norm": 0.10388778895139694, "learning_rate": 9.99138071024784e-05, "loss": 1.11669921875, "step": 12 }, { "epoch": 0.18571428571428572, "grad_norm": 0.06100620701909065, "learning_rate": 9.986534778879803e-05, "loss": 1.0830078125, "step": 13 }, { "epoch": 0.2, "grad_norm": 0.05543210357427597, "learning_rate": 9.980614338554001e-05, "loss": 1.0673828125, "step": 14 }, { "epoch": 0.21428571428571427, "grad_norm": 0.05129709094762802, "learning_rate": 9.97362080719462e-05, "loss": 1.03955078125, "step": 15 }, { "epoch": 0.22857142857142856, "grad_norm": 0.05103077366948128, "learning_rate": 9.965555859727286e-05, "loss": 1.04150390625, "step": 16 }, { "epoch": 0.24285714285714285, "grad_norm": 0.05306376516819, "learning_rate": 9.956421427677942e-05, "loss": 0.9921875, "step": 17 }, { "epoch": 0.2571428571428571, "grad_norm": 0.0529288649559021, "learning_rate": 9.946219698710239e-05, "loss": 0.98974609375, "step": 18 }, { "epoch": 0.2714285714285714, "grad_norm": 0.05011645331978798, "learning_rate": 9.934953116101605e-05, "loss": 0.970703125, "step": 19 }, { "epoch": 0.2857142857142857, "grad_norm": 0.04930735006928444, "learning_rate": 9.92262437815809e-05, "loss": 0.96923828125, "step": 20 }, { "epoch": 0.3, "grad_norm": 0.045997343957424164, "learning_rate": 9.909236437568131e-05, "loss": 0.95654296875, "step": 21 }, { "epoch": 0.3142857142857143, "grad_norm": 0.0459485799074173, "learning_rate": 9.89479250069539e-05, "loss": 0.962890625, "step": 22 }, { "epoch": 0.32857142857142857, "grad_norm": 0.05136457830667496, "learning_rate": 9.879296026810846e-05, "loss": 0.9443359375, "step": 23 }, { "epoch": 0.34285714285714286, "grad_norm": 0.05191263556480408, "learning_rate": 9.862750727264311e-05, "loss": 0.9482421875, "step": 24 }, { "epoch": 0.35714285714285715, "grad_norm": 0.045134589076042175, "learning_rate": 9.845160564595573e-05, "loss": 0.92578125, "step": 25 }, { "epoch": 0.37142857142857144, "grad_norm": 0.044029735028743744, "learning_rate": 9.826529751585381e-05, "loss": 0.91943359375, "step": 26 }, { "epoch": 0.38571428571428573, "grad_norm": 0.052899908274412155, "learning_rate": 9.806862750246505e-05, "loss": 0.9345703125, "step": 27 }, { "epoch": 0.4, "grad_norm": 0.04427888244390488, "learning_rate": 9.786164270755095e-05, "loss": 0.88037109375, "step": 28 }, { "epoch": 0.4142857142857143, "grad_norm": 0.04433929920196533, "learning_rate": 9.764439270322611e-05, "loss": 0.90380859375, "step": 29 }, { "epoch": 0.42857142857142855, "grad_norm": 0.04645824059844017, "learning_rate": 9.741692952008592e-05, "loss": 0.87646484375, "step": 30 }, { "epoch": 0.44285714285714284, "grad_norm": 0.04405355453491211, "learning_rate": 9.717930763474537e-05, "loss": 0.916015625, "step": 31 }, { "epoch": 0.45714285714285713, "grad_norm": 0.05218774825334549, "learning_rate": 9.693158395679215e-05, "loss": 0.8779296875, "step": 32 }, { "epoch": 0.4714285714285714, "grad_norm": 0.042239945381879807, "learning_rate": 9.667381781515695e-05, "loss": 0.8681640625, "step": 33 }, { "epoch": 0.4857142857142857, "grad_norm": 0.04367329180240631, "learning_rate": 9.640607094390445e-05, "loss": 0.85595703125, "step": 34 }, { "epoch": 0.5, "grad_norm": 0.04941326379776001, "learning_rate": 9.61284074674482e-05, "loss": 0.8779296875, "step": 35 }, { "epoch": 0.5142857142857142, "grad_norm": 0.052676014602184296, "learning_rate": 9.584089388519307e-05, "loss": 0.84716796875, "step": 36 }, { "epoch": 0.5285714285714286, "grad_norm": 0.04546784237027168, "learning_rate": 9.554359905560886e-05, "loss": 0.84716796875, "step": 37 }, { "epoch": 0.5428571428571428, "grad_norm": 0.04700865596532822, "learning_rate": 9.523659417973897e-05, "loss": 0.8603515625, "step": 38 }, { "epoch": 0.5571428571428572, "grad_norm": 0.04255075752735138, "learning_rate": 9.4919952784148e-05, "loss": 0.83642578125, "step": 39 }, { "epoch": 0.5714285714285714, "grad_norm": 0.04506116360425949, "learning_rate": 9.459375070331236e-05, "loss": 0.8408203125, "step": 40 }, { "epoch": 0.5857142857142857, "grad_norm": 0.044488076120615005, "learning_rate": 9.425806606145826e-05, "loss": 0.841796875, "step": 41 }, { "epoch": 0.6, "grad_norm": 0.04531097412109375, "learning_rate": 9.391297925385118e-05, "loss": 0.83740234375, "step": 42 }, { "epoch": 0.6, "eval_loss": 0.823486328125, "eval_runtime": 12.7198, "eval_samples_per_second": 0.786, "eval_steps_per_second": 0.157, "step": 42 }, { "epoch": 0.6142857142857143, "grad_norm": 0.04757943004369736, "learning_rate": 9.355857292754152e-05, "loss": 0.8017578125, "step": 43 }, { "epoch": 0.6285714285714286, "grad_norm": 0.046234458684921265, "learning_rate": 9.319493196157092e-05, "loss": 0.818359375, "step": 44 }, { "epoch": 0.6428571428571429, "grad_norm": 0.04600878804922104, "learning_rate": 9.282214344664404e-05, "loss": 0.81640625, "step": 45 }, { "epoch": 0.6571428571428571, "grad_norm": 0.07235831022262573, "learning_rate": 9.244029666427061e-05, "loss": 0.818359375, "step": 46 }, { "epoch": 0.6714285714285714, "grad_norm": 0.04685613512992859, "learning_rate": 9.204948306538293e-05, "loss": 0.84521484375, "step": 47 }, { "epoch": 0.6857142857142857, "grad_norm": 0.04504545032978058, "learning_rate": 9.164979624843358e-05, "loss": 0.806640625, "step": 48 }, { "epoch": 0.7, "grad_norm": 0.04681597277522087, "learning_rate": 9.124133193697898e-05, "loss": 0.80126953125, "step": 49 }, { "epoch": 0.7142857142857143, "grad_norm": 0.049921900033950806, "learning_rate": 9.082418795675397e-05, "loss": 0.79541015625, "step": 50 }, { "epoch": 0.7285714285714285, "grad_norm": 0.04480814188718796, "learning_rate": 9.039846421224288e-05, "loss": 0.7666015625, "step": 51 }, { "epoch": 0.7428571428571429, "grad_norm": 0.048868753015995026, "learning_rate": 8.996426266275271e-05, "loss": 0.80615234375, "step": 52 }, { "epoch": 0.7571428571428571, "grad_norm": 0.04697711020708084, "learning_rate": 8.952168729799435e-05, "loss": 0.787109375, "step": 53 }, { "epoch": 0.7714285714285715, "grad_norm": 0.0476866252720356, "learning_rate": 8.90708441131773e-05, "loss": 0.7880859375, "step": 54 }, { "epoch": 0.7857142857142857, "grad_norm": 0.047018349170684814, "learning_rate": 8.861184108362425e-05, "loss": 0.77880859375, "step": 55 }, { "epoch": 0.8, "grad_norm": 0.05050313100218773, "learning_rate": 8.814478813891148e-05, "loss": 0.76953125, "step": 56 }, { "epoch": 0.8142857142857143, "grad_norm": 0.049961939454078674, "learning_rate": 8.766979713654089e-05, "loss": 0.794921875, "step": 57 }, { "epoch": 0.8285714285714286, "grad_norm": 0.04898722842335701, "learning_rate": 8.718698183515077e-05, "loss": 0.77880859375, "step": 58 }, { "epoch": 0.8428571428571429, "grad_norm": 0.05006740987300873, "learning_rate": 8.669645786727083e-05, "loss": 0.80419921875, "step": 59 }, { "epoch": 0.8571428571428571, "grad_norm": 0.05039166659116745, "learning_rate": 8.619834271162879e-05, "loss": 0.7734375, "step": 60 }, { "epoch": 0.8714285714285714, "grad_norm": 0.051033422350883484, "learning_rate": 8.56927556650145e-05, "loss": 0.755859375, "step": 61 }, { "epoch": 0.8857142857142857, "grad_norm": 0.05211988091468811, "learning_rate": 8.517981781370884e-05, "loss": 0.77734375, "step": 62 }, { "epoch": 0.9, "grad_norm": 0.04897433891892433, "learning_rate": 8.465965200448403e-05, "loss": 0.76904296875, "step": 63 }, { "epoch": 0.9142857142857143, "grad_norm": 0.05581013858318329, "learning_rate": 8.413238281518225e-05, "loss": 0.77392578125, "step": 64 }, { "epoch": 0.9285714285714286, "grad_norm": 0.05405630171298981, "learning_rate": 8.359813652487964e-05, "loss": 0.7724609375, "step": 65 }, { "epoch": 0.9428571428571428, "grad_norm": 0.07353562116622925, "learning_rate": 8.305704108364301e-05, "loss": 0.77197265625, "step": 66 }, { "epoch": 0.9571428571428572, "grad_norm": 0.05411151796579361, "learning_rate": 8.250922608188617e-05, "loss": 0.7568359375, "step": 67 }, { "epoch": 0.9714285714285714, "grad_norm": 0.052922919392585754, "learning_rate": 8.195482271933352e-05, "loss": 0.748046875, "step": 68 }, { "epoch": 0.9857142857142858, "grad_norm": 0.054411035031080246, "learning_rate": 8.139396377359824e-05, "loss": 0.76025390625, "step": 69 }, { "epoch": 1.0, "grad_norm": 0.053164735436439514, "learning_rate": 8.082678356838245e-05, "loss": 0.734375, "step": 70 }, { "epoch": 1.0142857142857142, "grad_norm": 0.05180563032627106, "learning_rate": 8.025341794130722e-05, "loss": 0.7333984375, "step": 71 }, { "epoch": 1.0285714285714285, "grad_norm": 0.06838234513998032, "learning_rate": 7.96740042113799e-05, "loss": 0.75927734375, "step": 72 }, { "epoch": 1.042857142857143, "grad_norm": 0.051840752363204956, "learning_rate": 7.908868114610677e-05, "loss": 0.71728515625, "step": 73 }, { "epoch": 1.0571428571428572, "grad_norm": 0.055688485503196716, "learning_rate": 7.849758892825868e-05, "loss": 0.74755859375, "step": 74 }, { "epoch": 1.0714285714285714, "grad_norm": 0.05514116212725639, "learning_rate": 7.790086912229781e-05, "loss": 0.76904296875, "step": 75 }, { "epoch": 1.0857142857142856, "grad_norm": 0.06220082938671112, "learning_rate": 7.729866464047343e-05, "loss": 0.7509765625, "step": 76 }, { "epoch": 1.1, "grad_norm": 0.055815357714891434, "learning_rate": 7.6691119708595e-05, "loss": 0.7529296875, "step": 77 }, { "epoch": 1.1142857142857143, "grad_norm": 0.06340858340263367, "learning_rate": 7.607837983149056e-05, "loss": 0.7509765625, "step": 78 }, { "epoch": 1.1285714285714286, "grad_norm": 0.05273920297622681, "learning_rate": 7.54605917581589e-05, "loss": 0.7373046875, "step": 79 }, { "epoch": 1.1428571428571428, "grad_norm": 0.060172632336616516, "learning_rate": 7.483790344662363e-05, "loss": 0.73876953125, "step": 80 }, { "epoch": 1.157142857142857, "grad_norm": 0.05791589617729187, "learning_rate": 7.42104640284978e-05, "loss": 0.75341796875, "step": 81 }, { "epoch": 1.1714285714285715, "grad_norm": 0.053483158349990845, "learning_rate": 7.357842377326747e-05, "loss": 0.75390625, "step": 82 }, { "epoch": 1.1857142857142857, "grad_norm": 0.05703427270054817, "learning_rate": 7.294193405230255e-05, "loss": 0.736328125, "step": 83 }, { "epoch": 1.2, "grad_norm": 0.05676823481917381, "learning_rate": 7.230114730260413e-05, "loss": 0.74853515625, "step": 84 }, { "epoch": 1.2, "eval_loss": 0.7371826171875, "eval_runtime": 12.6958, "eval_samples_per_second": 0.788, "eval_steps_per_second": 0.158, "step": 84 }, { "epoch": 1.2142857142857142, "grad_norm": 0.05460375174880028, "learning_rate": 7.165621699029615e-05, "loss": 0.7294921875, "step": 85 }, { "epoch": 1.2285714285714286, "grad_norm": 0.058347344398498535, "learning_rate": 7.100729757387093e-05, "loss": 0.74560546875, "step": 86 }, { "epoch": 1.2428571428571429, "grad_norm": 0.05723877623677254, "learning_rate": 7.03545444671969e-05, "loss": 0.70263671875, "step": 87 }, { "epoch": 1.2571428571428571, "grad_norm": 0.05612649396061897, "learning_rate": 6.969811400229756e-05, "loss": 0.71240234375, "step": 88 }, { "epoch": 1.2714285714285714, "grad_norm": 0.05999016389250755, "learning_rate": 6.90381633919104e-05, "loss": 0.7080078125, "step": 89 }, { "epoch": 1.2857142857142856, "grad_norm": 0.055943626910448074, "learning_rate": 6.837485069183519e-05, "loss": 0.708984375, "step": 90 }, { "epoch": 1.3, "grad_norm": 0.05445539951324463, "learning_rate": 6.770833476308007e-05, "loss": 0.71484375, "step": 91 }, { "epoch": 1.3142857142857143, "grad_norm": 0.05527206137776375, "learning_rate": 6.703877523381496e-05, "loss": 0.732421875, "step": 92 }, { "epoch": 1.3285714285714285, "grad_norm": 0.054216012358665466, "learning_rate": 6.636633246114108e-05, "loss": 0.71142578125, "step": 93 }, { "epoch": 1.342857142857143, "grad_norm": 0.058076757937669754, "learning_rate": 6.569116749268622e-05, "loss": 0.7333984375, "step": 94 }, { "epoch": 1.3571428571428572, "grad_norm": 0.056523364037275314, "learning_rate": 6.501344202803414e-05, "loss": 0.716796875, "step": 95 }, { "epoch": 1.3714285714285714, "grad_norm": 0.05528922751545906, "learning_rate": 6.433331837999837e-05, "loss": 0.71484375, "step": 96 }, { "epoch": 1.3857142857142857, "grad_norm": 0.06398510187864304, "learning_rate": 6.365095943574866e-05, "loss": 0.73193359375, "step": 97 }, { "epoch": 1.4, "grad_norm": 0.058720558881759644, "learning_rate": 6.296652861780017e-05, "loss": 0.68994140625, "step": 98 }, { "epoch": 1.4142857142857144, "grad_norm": 0.055224865674972534, "learning_rate": 6.228018984487442e-05, "loss": 0.72314453125, "step": 99 }, { "epoch": 1.4285714285714286, "grad_norm": 0.05576997250318527, "learning_rate": 6.159210749264121e-05, "loss": 0.6953125, "step": 100 }, { "epoch": 1.4428571428571428, "grad_norm": 0.06290734559297562, "learning_rate": 6.09024463543514e-05, "loss": 0.736328125, "step": 101 }, { "epoch": 1.457142857142857, "grad_norm": 0.05929115042090416, "learning_rate": 6.02113716013694e-05, "loss": 0.69775390625, "step": 102 }, { "epoch": 1.4714285714285715, "grad_norm": 0.056523021310567856, "learning_rate": 5.951904874361527e-05, "loss": 0.70263671875, "step": 103 }, { "epoch": 1.4857142857142858, "grad_norm": 0.06137212738394737, "learning_rate": 5.8825643589925636e-05, "loss": 0.6923828125, "step": 104 }, { "epoch": 1.5, "grad_norm": 0.05514180287718773, "learning_rate": 5.8131322208343166e-05, "loss": 0.71875, "step": 105 }, { "epoch": 1.5142857142857142, "grad_norm": 0.06357347965240479, "learning_rate": 5.74362508863438e-05, "loss": 0.685302734375, "step": 106 }, { "epoch": 1.5285714285714285, "grad_norm": 0.07104372978210449, "learning_rate": 5.67405960910115e-05, "loss": 0.6875, "step": 107 }, { "epoch": 1.5428571428571427, "grad_norm": 0.06608453392982483, "learning_rate": 5.6044524429170006e-05, "loss": 0.7060546875, "step": 108 }, { "epoch": 1.5571428571428572, "grad_norm": 0.056561872363090515, "learning_rate": 5.5348202607481105e-05, "loss": 0.69287109375, "step": 109 }, { "epoch": 1.5714285714285714, "grad_norm": 0.056340012699365616, "learning_rate": 5.465179739251891e-05, "loss": 0.69189453125, "step": 110 }, { "epoch": 1.5857142857142859, "grad_norm": 0.05912540853023529, "learning_rate": 5.395547557082999e-05, "loss": 0.70068359375, "step": 111 }, { "epoch": 1.6, "grad_norm": 0.06018223986029625, "learning_rate": 5.32594039089885e-05, "loss": 0.69921875, "step": 112 }, { "epoch": 1.6142857142857143, "grad_norm": 0.0592244416475296, "learning_rate": 5.2563749113656216e-05, "loss": 0.667236328125, "step": 113 }, { "epoch": 1.6285714285714286, "grad_norm": 0.05921940505504608, "learning_rate": 5.186867779165685e-05, "loss": 0.6845703125, "step": 114 }, { "epoch": 1.6428571428571428, "grad_norm": 0.061107177287340164, "learning_rate": 5.117435641007439e-05, "loss": 0.6865234375, "step": 115 }, { "epoch": 1.657142857142857, "grad_norm": 0.0601227767765522, "learning_rate": 5.048095125638474e-05, "loss": 0.69091796875, "step": 116 }, { "epoch": 1.6714285714285713, "grad_norm": 0.06221635267138481, "learning_rate": 4.978862839863061e-05, "loss": 0.71923828125, "step": 117 }, { "epoch": 1.6857142857142857, "grad_norm": 0.062171511352062225, "learning_rate": 4.9097553645648594e-05, "loss": 0.68408203125, "step": 118 }, { "epoch": 1.7, "grad_norm": 0.06688631325960159, "learning_rate": 4.840789250735879e-05, "loss": 0.685546875, "step": 119 }, { "epoch": 1.7142857142857144, "grad_norm": 0.062123820185661316, "learning_rate": 4.771981015512559e-05, "loss": 0.67529296875, "step": 120 }, { "epoch": 1.7285714285714286, "grad_norm": 0.059517137706279755, "learning_rate": 4.7033471382199836e-05, "loss": 0.65283203125, "step": 121 }, { "epoch": 1.7428571428571429, "grad_norm": 0.06246113404631615, "learning_rate": 4.6349040564251346e-05, "loss": 0.6943359375, "step": 122 }, { "epoch": 1.7571428571428571, "grad_norm": 0.09060859680175781, "learning_rate": 4.5666681620001625e-05, "loss": 0.67431640625, "step": 123 }, { "epoch": 1.7714285714285714, "grad_norm": 0.06127085164189339, "learning_rate": 4.498655797196586e-05, "loss": 0.6796875, "step": 124 }, { "epoch": 1.7857142857142856, "grad_norm": 0.061497125774621964, "learning_rate": 4.4308832507313815e-05, "loss": 0.67431640625, "step": 125 }, { "epoch": 1.8, "grad_norm": 0.06085183098912239, "learning_rate": 4.3633667538858934e-05, "loss": 0.6611328125, "step": 126 }, { "epoch": 1.8, "eval_loss": 0.7088623046875, "eval_runtime": 12.6903, "eval_samples_per_second": 0.788, "eval_steps_per_second": 0.158, "step": 126 }, { "epoch": 1.8142857142857143, "grad_norm": 0.05988273769617081, "learning_rate": 4.296122476618507e-05, "loss": 0.689453125, "step": 127 }, { "epoch": 1.8285714285714287, "grad_norm": 0.06360983848571777, "learning_rate": 4.229166523691993e-05, "loss": 0.673828125, "step": 128 }, { "epoch": 1.842857142857143, "grad_norm": 0.06351760774850845, "learning_rate": 4.162514930816481e-05, "loss": 0.70068359375, "step": 129 }, { "epoch": 1.8571428571428572, "grad_norm": 0.061407994478940964, "learning_rate": 4.09618366080896e-05, "loss": 0.673828125, "step": 130 }, { "epoch": 1.8714285714285714, "grad_norm": 0.06777355074882507, "learning_rate": 4.0301885997702457e-05, "loss": 0.6591796875, "step": 131 }, { "epoch": 1.8857142857142857, "grad_norm": 0.059942860156297684, "learning_rate": 3.9645455532803086e-05, "loss": 0.68310546875, "step": 132 }, { "epoch": 1.9, "grad_norm": 0.06295284628868103, "learning_rate": 3.899270242612907e-05, "loss": 0.67333984375, "step": 133 }, { "epoch": 1.9142857142857141, "grad_norm": 0.06429057568311691, "learning_rate": 3.834378300970385e-05, "loss": 0.6806640625, "step": 134 }, { "epoch": 1.9285714285714286, "grad_norm": 0.062211379408836365, "learning_rate": 3.7698852697395884e-05, "loss": 0.67724609375, "step": 135 }, { "epoch": 1.9428571428571428, "grad_norm": 0.0751936212182045, "learning_rate": 3.7058065947697454e-05, "loss": 0.6796875, "step": 136 }, { "epoch": 1.9571428571428573, "grad_norm": 0.06252847611904144, "learning_rate": 3.6421576226732544e-05, "loss": 0.6640625, "step": 137 }, { "epoch": 1.9714285714285715, "grad_norm": 0.06349719315767288, "learning_rate": 3.57895359715022e-05, "loss": 0.6572265625, "step": 138 }, { "epoch": 1.9857142857142858, "grad_norm": 0.06345172226428986, "learning_rate": 3.516209655337639e-05, "loss": 0.6708984375, "step": 139 }, { "epoch": 2.0, "grad_norm": 0.06399086862802505, "learning_rate": 3.4539408241841105e-05, "loss": 0.6455078125, "step": 140 }, { "epoch": 2.0142857142857142, "grad_norm": 0.06483668088912964, "learning_rate": 3.392162016850945e-05, "loss": 0.64697265625, "step": 141 }, { "epoch": 2.0285714285714285, "grad_norm": 0.06015940010547638, "learning_rate": 3.330888029140503e-05, "loss": 0.6748046875, "step": 142 }, { "epoch": 2.0428571428571427, "grad_norm": 0.06585846096277237, "learning_rate": 3.2701335359526584e-05, "loss": 0.634765625, "step": 143 }, { "epoch": 2.057142857142857, "grad_norm": 0.06796801090240479, "learning_rate": 3.209913087770221e-05, "loss": 0.66357421875, "step": 144 }, { "epoch": 2.0714285714285716, "grad_norm": 0.06410115957260132, "learning_rate": 3.1502411071741334e-05, "loss": 0.68408203125, "step": 145 }, { "epoch": 2.085714285714286, "grad_norm": 0.07315430790185928, "learning_rate": 3.091131885389324e-05, "loss": 0.66943359375, "step": 146 }, { "epoch": 2.1, "grad_norm": 0.06741099804639816, "learning_rate": 3.032599578862011e-05, "loss": 0.67236328125, "step": 147 }, { "epoch": 2.1142857142857143, "grad_norm": 0.06903790682554245, "learning_rate": 2.97465820586928e-05, "loss": 0.66845703125, "step": 148 }, { "epoch": 2.1285714285714286, "grad_norm": 0.06851155310869217, "learning_rate": 2.9173216431617545e-05, "loss": 0.66162109375, "step": 149 }, { "epoch": 2.142857142857143, "grad_norm": 0.06491309404373169, "learning_rate": 2.8606036226401768e-05, "loss": 0.65966796875, "step": 150 }, { "epoch": 2.157142857142857, "grad_norm": 0.06776642799377441, "learning_rate": 2.804517728066649e-05, "loss": 0.6748046875, "step": 151 }, { "epoch": 2.1714285714285713, "grad_norm": 0.06124527007341385, "learning_rate": 2.749077391811384e-05, "loss": 0.67822265625, "step": 152 }, { "epoch": 2.185714285714286, "grad_norm": 0.06878867745399475, "learning_rate": 2.6942958916356998e-05, "loss": 0.662109375, "step": 153 }, { "epoch": 2.2, "grad_norm": 0.06806619465351105, "learning_rate": 2.640186347512037e-05, "loss": 0.671875, "step": 154 }, { "epoch": 2.2142857142857144, "grad_norm": 0.06395353376865387, "learning_rate": 2.586761718481776e-05, "loss": 0.65576171875, "step": 155 }, { "epoch": 2.2285714285714286, "grad_norm": 0.07178875803947449, "learning_rate": 2.5340347995515977e-05, "loss": 0.67138671875, "step": 156 }, { "epoch": 2.242857142857143, "grad_norm": 0.06459272652864456, "learning_rate": 2.4820182186291172e-05, "loss": 0.63134765625, "step": 157 }, { "epoch": 2.257142857142857, "grad_norm": 0.06613647937774658, "learning_rate": 2.430724433498552e-05, "loss": 0.64111328125, "step": 158 }, { "epoch": 2.2714285714285714, "grad_norm": 0.06713347882032394, "learning_rate": 2.3801657288371217e-05, "loss": 0.63916015625, "step": 159 }, { "epoch": 2.2857142857142856, "grad_norm": 0.06648610532283783, "learning_rate": 2.3303542132729168e-05, "loss": 0.638671875, "step": 160 }, { "epoch": 2.3, "grad_norm": 0.06578565388917923, "learning_rate": 2.281301816484925e-05, "loss": 0.6474609375, "step": 161 }, { "epoch": 2.314285714285714, "grad_norm": 0.0631573498249054, "learning_rate": 2.2330202863459122e-05, "loss": 0.6640625, "step": 162 }, { "epoch": 2.3285714285714287, "grad_norm": 0.06323499232530594, "learning_rate": 2.1855211861088538e-05, "loss": 0.643798828125, "step": 163 }, { "epoch": 2.342857142857143, "grad_norm": 0.06487427651882172, "learning_rate": 2.1388158916375755e-05, "loss": 0.66552734375, "step": 164 }, { "epoch": 2.357142857142857, "grad_norm": 0.06590575724840164, "learning_rate": 2.0929155886822716e-05, "loss": 0.6513671875, "step": 165 }, { "epoch": 2.3714285714285714, "grad_norm": 0.06528814882040024, "learning_rate": 2.0478312702005653e-05, "loss": 0.65087890625, "step": 166 }, { "epoch": 2.3857142857142857, "grad_norm": 0.06810116022825241, "learning_rate": 2.003573733724729e-05, "loss": 0.662109375, "step": 167 }, { "epoch": 2.4, "grad_norm": 0.0618431381881237, "learning_rate": 1.9601535787757132e-05, "loss": 0.62939453125, "step": 168 }, { "epoch": 2.4, "eval_loss": 0.6951904296875, "eval_runtime": 12.6967, "eval_samples_per_second": 0.788, "eval_steps_per_second": 0.158, "step": 168 }, { "epoch": 2.414285714285714, "grad_norm": 0.06515216827392578, "learning_rate": 1.9175812043246033e-05, "loss": 0.66162109375, "step": 169 }, { "epoch": 2.4285714285714284, "grad_norm": 0.06773951649665833, "learning_rate": 1.8758668063021033e-05, "loss": 0.634765625, "step": 170 }, { "epoch": 2.442857142857143, "grad_norm": 0.06553688645362854, "learning_rate": 1.8350203751566436e-05, "loss": 0.67138671875, "step": 171 }, { "epoch": 2.4571428571428573, "grad_norm": 0.06633678823709488, "learning_rate": 1.7950516934617083e-05, "loss": 0.6357421875, "step": 172 }, { "epoch": 2.4714285714285715, "grad_norm": 0.06607075780630112, "learning_rate": 1.75597033357294e-05, "loss": 0.64306640625, "step": 173 }, { "epoch": 2.4857142857142858, "grad_norm": 0.06522510200738907, "learning_rate": 1.717785655335597e-05, "loss": 0.63232421875, "step": 174 }, { "epoch": 2.5, "grad_norm": 0.06720203161239624, "learning_rate": 1.680506803842909e-05, "loss": 0.65966796875, "step": 175 }, { "epoch": 2.5142857142857142, "grad_norm": 0.06660260260105133, "learning_rate": 1.6441427072458494e-05, "loss": 0.625732421875, "step": 176 }, { "epoch": 2.5285714285714285, "grad_norm": 0.06615811586380005, "learning_rate": 1.6087020746148828e-05, "loss": 0.6298828125, "step": 177 }, { "epoch": 2.5428571428571427, "grad_norm": 0.06593484431505203, "learning_rate": 1.5741933938541755e-05, "loss": 0.64501953125, "step": 178 }, { "epoch": 2.557142857142857, "grad_norm": 0.06653065979480743, "learning_rate": 1.540624929668765e-05, "loss": 0.63720703125, "step": 179 }, { "epoch": 2.571428571428571, "grad_norm": 0.06582722812891006, "learning_rate": 1.5080047215852011e-05, "loss": 0.63525390625, "step": 180 }, { "epoch": 2.585714285714286, "grad_norm": 0.06583766639232635, "learning_rate": 1.4763405820261036e-05, "loss": 0.64697265625, "step": 181 }, { "epoch": 2.6, "grad_norm": 0.06714893132448196, "learning_rate": 1.4456400944391146e-05, "loss": 0.6455078125, "step": 182 }, { "epoch": 2.6142857142857143, "grad_norm": 0.06695859879255295, "learning_rate": 1.4159106114806942e-05, "loss": 0.610107421875, "step": 183 }, { "epoch": 2.6285714285714286, "grad_norm": 0.06631751358509064, "learning_rate": 1.3871592532551805e-05, "loss": 0.630859375, "step": 184 }, { "epoch": 2.642857142857143, "grad_norm": 0.06531959772109985, "learning_rate": 1.3593929056095556e-05, "loss": 0.630859375, "step": 185 }, { "epoch": 2.657142857142857, "grad_norm": 0.06435287743806839, "learning_rate": 1.332618218484306e-05, "loss": 0.6396484375, "step": 186 }, { "epoch": 2.6714285714285713, "grad_norm": 0.06656572967767715, "learning_rate": 1.3068416043207863e-05, "loss": 0.66552734375, "step": 187 }, { "epoch": 2.685714285714286, "grad_norm": 0.06637463718652725, "learning_rate": 1.2820692365254631e-05, "loss": 0.6328125, "step": 188 }, { "epoch": 2.7, "grad_norm": 0.0676756501197815, "learning_rate": 1.2583070479914087e-05, "loss": 0.63427734375, "step": 189 }, { "epoch": 2.7142857142857144, "grad_norm": 0.06691654771566391, "learning_rate": 1.2355607296773895e-05, "loss": 0.6240234375, "step": 190 }, { "epoch": 2.7285714285714286, "grad_norm": 0.06870891898870468, "learning_rate": 1.2138357292449055e-05, "loss": 0.603515625, "step": 191 }, { "epoch": 2.742857142857143, "grad_norm": 0.06647045165300369, "learning_rate": 1.1931372497534953e-05, "loss": 0.6455078125, "step": 192 }, { "epoch": 2.757142857142857, "grad_norm": 0.06754187494516373, "learning_rate": 1.1734702484146193e-05, "loss": 0.6279296875, "step": 193 }, { "epoch": 2.7714285714285714, "grad_norm": 0.06615348160266876, "learning_rate": 1.1548394354044276e-05, "loss": 0.6328125, "step": 194 }, { "epoch": 2.7857142857142856, "grad_norm": 0.0676516741514206, "learning_rate": 1.1372492727356887e-05, "loss": 0.62646484375, "step": 195 }, { "epoch": 2.8, "grad_norm": 0.0679558664560318, "learning_rate": 1.1207039731891532e-05, "loss": 0.61669921875, "step": 196 }, { "epoch": 2.814285714285714, "grad_norm": 0.06910320371389389, "learning_rate": 1.1052074993046102e-05, "loss": 0.64306640625, "step": 197 }, { "epoch": 2.8285714285714287, "grad_norm": 0.069993756711483, "learning_rate": 1.0907635624318696e-05, "loss": 0.627197265625, "step": 198 }, { "epoch": 2.842857142857143, "grad_norm": 0.07021188735961914, "learning_rate": 1.0773756218419104e-05, "loss": 0.65234375, "step": 199 }, { "epoch": 2.857142857142857, "grad_norm": 0.06672544032335281, "learning_rate": 1.0650468838983959e-05, "loss": 0.63037109375, "step": 200 }, { "epoch": 2.8714285714285714, "grad_norm": 0.06757517904043198, "learning_rate": 1.0537803012897617e-05, "loss": 0.61474609375, "step": 201 }, { "epoch": 2.8857142857142857, "grad_norm": 0.06685593724250793, "learning_rate": 1.043578572322058e-05, "loss": 0.6396484375, "step": 202 }, { "epoch": 2.9, "grad_norm": 0.0702473595738411, "learning_rate": 1.0344441402727142e-05, "loss": 0.63037109375, "step": 203 }, { "epoch": 2.914285714285714, "grad_norm": 0.06869243085384369, "learning_rate": 1.0263791928053819e-05, "loss": 0.63720703125, "step": 204 }, { "epoch": 2.928571428571429, "grad_norm": 0.06895088404417038, "learning_rate": 1.0193856614459998e-05, "loss": 0.6337890625, "step": 205 }, { "epoch": 2.942857142857143, "grad_norm": 0.06920134276151657, "learning_rate": 1.013465221120198e-05, "loss": 0.638671875, "step": 206 }, { "epoch": 2.9571428571428573, "grad_norm": 0.06936103105545044, "learning_rate": 1.0086192897521601e-05, "loss": 0.6201171875, "step": 207 }, { "epoch": 2.9714285714285715, "grad_norm": 0.07043518126010895, "learning_rate": 1.0048490279250354e-05, "loss": 0.61669921875, "step": 208 }, { "epoch": 2.9857142857142858, "grad_norm": 0.06810513883829117, "learning_rate": 1.0021553386029838e-05, "loss": 0.63134765625, "step": 209 }, { "epoch": 3.0, "grad_norm": 0.06843512505292892, "learning_rate": 1.0005388669149184e-05, "loss": 0.60400390625, "step": 210 }, { "epoch": 3.0, "eval_loss": 0.6898193359375, "eval_runtime": 12.7056, "eval_samples_per_second": 0.787, "eval_steps_per_second": 0.157, "step": 210 } ], "logging_steps": 1.0, "max_steps": 210, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.7282139802791051e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }