{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 52, "global_step": 264, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.007575757575757576, "grad_norm": 0.33429259061813354, "learning_rate": 0.0, "loss": 1.231689453125, "step": 1 }, { "epoch": 0.015151515151515152, "grad_norm": 0.5006925463676453, "learning_rate": 7.142857142857143e-06, "loss": 1.685546875, "step": 2 }, { "epoch": 0.022727272727272728, "grad_norm": 0.4349065124988556, "learning_rate": 1.4285714285714285e-05, "loss": 1.5908203125, "step": 3 }, { "epoch": 0.030303030303030304, "grad_norm": 0.4520890414714813, "learning_rate": 2.1428571428571428e-05, "loss": 1.603515625, "step": 4 }, { "epoch": 0.03787878787878788, "grad_norm": 0.4511120021343231, "learning_rate": 2.857142857142857e-05, "loss": 1.583984375, "step": 5 }, { "epoch": 0.045454545454545456, "grad_norm": 0.45080456137657166, "learning_rate": 3.571428571428572e-05, "loss": 1.48828125, "step": 6 }, { "epoch": 0.05303030303030303, "grad_norm": 0.5375288128852844, "learning_rate": 4.2857142857142856e-05, "loss": 1.6015625, "step": 7 }, { "epoch": 0.06060606060606061, "grad_norm": 0.5009720325469971, "learning_rate": 5e-05, "loss": 1.51513671875, "step": 8 }, { "epoch": 0.06818181818181818, "grad_norm": 0.47150489687919617, "learning_rate": 5.714285714285714e-05, "loss": 1.48046875, "step": 9 }, { "epoch": 0.07575757575757576, "grad_norm": 0.42623651027679443, "learning_rate": 6.428571428571429e-05, "loss": 1.32366943359375, "step": 10 }, { "epoch": 0.08333333333333333, "grad_norm": 0.4326189458370209, "learning_rate": 7.142857142857143e-05, "loss": 1.34423828125, "step": 11 }, { "epoch": 0.09090909090909091, "grad_norm": 0.36637046933174133, "learning_rate": 7.857142857142858e-05, "loss": 1.233642578125, "step": 12 }, { "epoch": 0.09848484848484848, "grad_norm": 0.331664502620697, "learning_rate": 8.571428571428571e-05, "loss": 1.287109375, "step": 13 }, { "epoch": 0.10606060606060606, "grad_norm": 0.3909582197666168, "learning_rate": 9.285714285714286e-05, "loss": 1.4072265625, "step": 14 }, { "epoch": 0.11363636363636363, "grad_norm": 0.28124600648880005, "learning_rate": 0.0001, "loss": 1.3623046875, "step": 15 }, { "epoch": 0.12121212121212122, "grad_norm": 0.24927006661891937, "learning_rate": 9.999644698917173e-05, "loss": 1.35693359375, "step": 16 }, { "epoch": 0.12878787878787878, "grad_norm": 0.1861179620027542, "learning_rate": 9.99857885177485e-05, "loss": 1.353515625, "step": 17 }, { "epoch": 0.13636363636363635, "grad_norm": 0.17025507986545563, "learning_rate": 9.996802626882653e-05, "loss": 1.2822265625, "step": 18 }, { "epoch": 0.14393939393939395, "grad_norm": 0.22721347212791443, "learning_rate": 9.99431630472708e-05, "loss": 1.3330078125, "step": 19 }, { "epoch": 0.15151515151515152, "grad_norm": 0.23746272921562195, "learning_rate": 9.991120277927223e-05, "loss": 1.2744140625, "step": 20 }, { "epoch": 0.1590909090909091, "grad_norm": 0.2563123404979706, "learning_rate": 9.987215051172763e-05, "loss": 1.29736328125, "step": 21 }, { "epoch": 0.16666666666666666, "grad_norm": 0.25374919176101685, "learning_rate": 9.982601241144277e-05, "loss": 1.31103515625, "step": 22 }, { "epoch": 0.17424242424242425, "grad_norm": 0.24282824993133545, "learning_rate": 9.977279576415853e-05, "loss": 1.3349609375, "step": 23 }, { "epoch": 0.18181818181818182, "grad_norm": 0.2210780382156372, "learning_rate": 9.971250897340038e-05, "loss": 1.318359375, "step": 24 }, { "epoch": 0.1893939393939394, "grad_norm": 0.18094603717327118, "learning_rate": 9.964516155915151e-05, "loss": 1.3046875, "step": 25 }, { "epoch": 0.19696969696969696, "grad_norm": 0.17291805148124695, "learning_rate": 9.95707641563493e-05, "loss": 1.275390625, "step": 26 }, { "epoch": 0.20454545454545456, "grad_norm": 0.12008367478847504, "learning_rate": 9.948932851320614e-05, "loss": 1.102142333984375, "step": 27 }, { "epoch": 0.21212121212121213, "grad_norm": 0.11401014029979706, "learning_rate": 9.940086748935406e-05, "loss": 1.2431640625, "step": 28 }, { "epoch": 0.2196969696969697, "grad_norm": 0.09813079237937927, "learning_rate": 9.930539505381426e-05, "loss": 1.18505859375, "step": 29 }, { "epoch": 0.22727272727272727, "grad_norm": 0.09758817404508591, "learning_rate": 9.920292628279099e-05, "loss": 1.21484375, "step": 30 }, { "epoch": 0.23484848484848486, "grad_norm": 0.10868855565786362, "learning_rate": 9.909347735729111e-05, "loss": 1.228515625, "step": 31 }, { "epoch": 0.24242424242424243, "grad_norm": 0.09499826282262802, "learning_rate": 9.897706556056872e-05, "loss": 1.2041015625, "step": 32 }, { "epoch": 0.25, "grad_norm": 0.09282124787569046, "learning_rate": 9.885370927539598e-05, "loss": 1.1943359375, "step": 33 }, { "epoch": 0.25757575757575757, "grad_norm": 0.09949434548616409, "learning_rate": 9.872342798116033e-05, "loss": 1.07257080078125, "step": 34 }, { "epoch": 0.26515151515151514, "grad_norm": 0.12807920575141907, "learning_rate": 9.858624225078841e-05, "loss": 1.26171875, "step": 35 }, { "epoch": 0.2727272727272727, "grad_norm": 0.10821354389190674, "learning_rate": 9.844217374749732e-05, "loss": 1.2041015625, "step": 36 }, { "epoch": 0.2803030303030303, "grad_norm": 0.1073274165391922, "learning_rate": 9.829124522137386e-05, "loss": 1.09130859375, "step": 37 }, { "epoch": 0.2878787878787879, "grad_norm": 0.10323720425367355, "learning_rate": 9.813348050578191e-05, "loss": 1.14697265625, "step": 38 }, { "epoch": 0.29545454545454547, "grad_norm": 0.08878322690725327, "learning_rate": 9.796890451359894e-05, "loss": 1.05615234375, "step": 39 }, { "epoch": 0.30303030303030304, "grad_norm": 0.10852427035570145, "learning_rate": 9.779754323328192e-05, "loss": 1.15966796875, "step": 40 }, { "epoch": 0.3106060606060606, "grad_norm": 0.09462536871433258, "learning_rate": 9.76194237247635e-05, "loss": 1.154296875, "step": 41 }, { "epoch": 0.3181818181818182, "grad_norm": 0.09913163632154465, "learning_rate": 9.743457411517892e-05, "loss": 1.19384765625, "step": 42 }, { "epoch": 0.32575757575757575, "grad_norm": 0.080966055393219, "learning_rate": 9.724302359442434e-05, "loss": 1.1201171875, "step": 43 }, { "epoch": 0.3333333333333333, "grad_norm": 0.07970893383026123, "learning_rate": 9.704480241054755e-05, "loss": 1.212890625, "step": 44 }, { "epoch": 0.3409090909090909, "grad_norm": 0.07800300419330597, "learning_rate": 9.683994186497132e-05, "loss": 1.1826171875, "step": 45 }, { "epoch": 0.3484848484848485, "grad_norm": 0.08582798391580582, "learning_rate": 9.66284743075506e-05, "loss": 1.2060546875, "step": 46 }, { "epoch": 0.3560606060606061, "grad_norm": 0.07266346365213394, "learning_rate": 9.641043313146417e-05, "loss": 1.1083984375, "step": 47 }, { "epoch": 0.36363636363636365, "grad_norm": 0.09038397669792175, "learning_rate": 9.618585276794129e-05, "loss": 1.1845703125, "step": 48 }, { "epoch": 0.3712121212121212, "grad_norm": 0.09399913996458054, "learning_rate": 9.595476868082481e-05, "loss": 1.1875, "step": 49 }, { "epoch": 0.3787878787878788, "grad_norm": 0.07513436675071716, "learning_rate": 9.571721736097089e-05, "loss": 1.16357421875, "step": 50 }, { "epoch": 0.38636363636363635, "grad_norm": 0.07933320850133896, "learning_rate": 9.54732363204867e-05, "loss": 1.1796875, "step": 51 }, { "epoch": 0.3939393939393939, "grad_norm": 0.07782892882823944, "learning_rate": 9.522286408680687e-05, "loss": 1.2119140625, "step": 52 }, { "epoch": 0.4015151515151515, "grad_norm": 0.07191629707813263, "learning_rate": 9.496614019660951e-05, "loss": 1.185546875, "step": 53 }, { "epoch": 0.4090909090909091, "grad_norm": 0.07715420424938202, "learning_rate": 9.47031051895729e-05, "loss": 1.14306640625, "step": 54 }, { "epoch": 0.4166666666666667, "grad_norm": 0.07936612516641617, "learning_rate": 9.443380060197387e-05, "loss": 1.1943359375, "step": 55 }, { "epoch": 0.42424242424242425, "grad_norm": 0.08630044013261795, "learning_rate": 9.415826896012865e-05, "loss": 1.1494140625, "step": 56 }, { "epoch": 0.42424242424242425, "eval_loss": 1.1767578125, "eval_runtime": 2.2352, "eval_samples_per_second": 3.579, "eval_steps_per_second": 0.447, "step": 56 }, { "epoch": 0.4318181818181818, "grad_norm": 0.07743937522172928, "learning_rate": 9.387655377367758e-05, "loss": 1.14404296875, "step": 57 }, { "epoch": 0.4393939393939394, "grad_norm": 0.06784118711948395, "learning_rate": 9.358869952871436e-05, "loss": 1.13134765625, "step": 58 }, { "epoch": 0.44696969696969696, "grad_norm": 0.06836315244436264, "learning_rate": 9.329475168076114e-05, "loss": 1.11572265625, "step": 59 }, { "epoch": 0.45454545454545453, "grad_norm": 0.07465013861656189, "learning_rate": 9.299475664759069e-05, "loss": 1.1376953125, "step": 60 }, { "epoch": 0.4621212121212121, "grad_norm": 0.0738844946026802, "learning_rate": 9.268876180189639e-05, "loss": 1.1220703125, "step": 61 }, { "epoch": 0.4696969696969697, "grad_norm": 0.07709069550037384, "learning_rate": 9.237681546381157e-05, "loss": 1.14453125, "step": 62 }, { "epoch": 0.4772727272727273, "grad_norm": 0.07183508574962616, "learning_rate": 9.205896689327923e-05, "loss": 1.125, "step": 63 }, { "epoch": 0.48484848484848486, "grad_norm": 0.07055969536304474, "learning_rate": 9.173526628227329e-05, "loss": 0.9150390625, "step": 64 }, { "epoch": 0.49242424242424243, "grad_norm": 0.08102235943078995, "learning_rate": 9.140576474687264e-05, "loss": 1.1328125, "step": 65 }, { "epoch": 0.5, "grad_norm": 0.07835587114095688, "learning_rate": 9.107051431918944e-05, "loss": 1.12646484375, "step": 66 }, { "epoch": 0.5075757575757576, "grad_norm": 0.06946656852960587, "learning_rate": 9.07295679391526e-05, "loss": 1.1455078125, "step": 67 }, { "epoch": 0.5151515151515151, "grad_norm": 0.08474933356046677, "learning_rate": 9.038297944614785e-05, "loss": 1.1357421875, "step": 68 }, { "epoch": 0.5227272727272727, "grad_norm": 0.0714707151055336, "learning_rate": 9.003080357051607e-05, "loss": 1.13037109375, "step": 69 }, { "epoch": 0.5303030303030303, "grad_norm": 0.06972786784172058, "learning_rate": 8.967309592491052e-05, "loss": 1.15185546875, "step": 70 }, { "epoch": 0.5378787878787878, "grad_norm": 0.07356660068035126, "learning_rate": 8.930991299551515e-05, "loss": 1.123046875, "step": 71 }, { "epoch": 0.5454545454545454, "grad_norm": 0.08069396018981934, "learning_rate": 8.894131213312467e-05, "loss": 1.134765625, "step": 72 }, { "epoch": 0.553030303030303, "grad_norm": 0.0700419619679451, "learning_rate": 8.85673515440882e-05, "loss": 1.11279296875, "step": 73 }, { "epoch": 0.5606060606060606, "grad_norm": 0.07328810542821884, "learning_rate": 8.818809028111783e-05, "loss": 1.08984375, "step": 74 }, { "epoch": 0.5681818181818182, "grad_norm": 0.07241823524236679, "learning_rate": 8.780358823396352e-05, "loss": 1.041015625, "step": 75 }, { "epoch": 0.5757575757575758, "grad_norm": 0.06917116045951843, "learning_rate": 8.741390611995581e-05, "loss": 1.115234375, "step": 76 }, { "epoch": 0.5833333333333334, "grad_norm": 0.07732143253087997, "learning_rate": 8.701910547441786e-05, "loss": 1.11376953125, "step": 77 }, { "epoch": 0.5909090909090909, "grad_norm": 0.08793466538190842, "learning_rate": 8.661924864094822e-05, "loss": 1.12060546875, "step": 78 }, { "epoch": 0.5984848484848485, "grad_norm": 0.07058653235435486, "learning_rate": 8.621439876157622e-05, "loss": 1.119140625, "step": 79 }, { "epoch": 0.6060606060606061, "grad_norm": 0.07628446072340012, "learning_rate": 8.5804619766791e-05, "loss": 1.11083984375, "step": 80 }, { "epoch": 0.6136363636363636, "grad_norm": 0.07461079210042953, "learning_rate": 8.53899763654461e-05, "loss": 1.09912109375, "step": 81 }, { "epoch": 0.6212121212121212, "grad_norm": 0.07395722717046738, "learning_rate": 8.497053403454133e-05, "loss": 1.09228515625, "step": 82 }, { "epoch": 0.6287878787878788, "grad_norm": 0.07566767185926437, "learning_rate": 8.454635900888305e-05, "loss": 1.13232421875, "step": 83 }, { "epoch": 0.6363636363636364, "grad_norm": 0.07291608303785324, "learning_rate": 8.4117518270625e-05, "loss": 1.111328125, "step": 84 }, { "epoch": 0.6439393939393939, "grad_norm": 0.07590695470571518, "learning_rate": 8.368407953869104e-05, "loss": 1.0595703125, "step": 85 }, { "epoch": 0.6515151515151515, "grad_norm": 0.07056854665279388, "learning_rate": 8.324611125808153e-05, "loss": 1.12353515625, "step": 86 }, { "epoch": 0.6590909090909091, "grad_norm": 0.08102933317422867, "learning_rate": 8.280368258906505e-05, "loss": 1.0751953125, "step": 87 }, { "epoch": 0.6666666666666666, "grad_norm": 0.0732758417725563, "learning_rate": 8.235686339625725e-05, "loss": 1.08251953125, "step": 88 }, { "epoch": 0.6742424242424242, "grad_norm": 0.07417816668748856, "learning_rate": 8.190572423758835e-05, "loss": 1.1328125, "step": 89 }, { "epoch": 0.6818181818181818, "grad_norm": 0.07961579412221909, "learning_rate": 8.14503363531613e-05, "loss": 1.107421875, "step": 90 }, { "epoch": 0.6893939393939394, "grad_norm": 0.07082675397396088, "learning_rate": 8.099077165400204e-05, "loss": 1.04638671875, "step": 91 }, { "epoch": 0.696969696969697, "grad_norm": 0.07951372116804123, "learning_rate": 8.052710271070405e-05, "loss": 1.1015625, "step": 92 }, { "epoch": 0.7045454545454546, "grad_norm": 0.07731400430202484, "learning_rate": 8.005940274196846e-05, "loss": 1.05712890625, "step": 93 }, { "epoch": 0.7121212121212122, "grad_norm": 0.0780235081911087, "learning_rate": 7.958774560304213e-05, "loss": 1.1123046875, "step": 94 }, { "epoch": 0.7196969696969697, "grad_norm": 0.07907724380493164, "learning_rate": 7.911220577405484e-05, "loss": 1.1240234375, "step": 95 }, { "epoch": 0.7272727272727273, "grad_norm": 0.08562244474887848, "learning_rate": 7.863285834825832e-05, "loss": 1.11279296875, "step": 96 }, { "epoch": 0.7348484848484849, "grad_norm": 0.08156926184892654, "learning_rate": 7.814977902016779e-05, "loss": 1.09765625, "step": 97 }, { "epoch": 0.7424242424242424, "grad_norm": 0.08556552231311798, "learning_rate": 7.766304407360924e-05, "loss": 1.06201171875, "step": 98 }, { "epoch": 0.75, "grad_norm": 0.07410125434398651, "learning_rate": 7.717273036967312e-05, "loss": 1.1123046875, "step": 99 }, { "epoch": 0.7575757575757576, "grad_norm": 0.07887564599514008, "learning_rate": 7.667891533457719e-05, "loss": 1.0986328125, "step": 100 }, { "epoch": 0.7651515151515151, "grad_norm": 0.08241984993219376, "learning_rate": 7.618167694743998e-05, "loss": 1.0625, "step": 101 }, { "epoch": 0.7727272727272727, "grad_norm": 0.075218066573143, "learning_rate": 7.568109372796697e-05, "loss": 1.06787109375, "step": 102 }, { "epoch": 0.7803030303030303, "grad_norm": 0.0772901326417923, "learning_rate": 7.517724472405146e-05, "loss": 1.1064453125, "step": 103 }, { "epoch": 0.7878787878787878, "grad_norm": 0.08121981471776962, "learning_rate": 7.4670209499292e-05, "loss": 1.0888671875, "step": 104 }, { "epoch": 0.7954545454545454, "grad_norm": 0.08568460494279861, "learning_rate": 7.416006812042828e-05, "loss": 1.04150390625, "step": 105 }, { "epoch": 0.803030303030303, "grad_norm": 0.08072242885828018, "learning_rate": 7.36469011446978e-05, "loss": 1.0478515625, "step": 106 }, { "epoch": 0.8106060606060606, "grad_norm": 0.07596985250711441, "learning_rate": 7.313078960711483e-05, "loss": 1.10546875, "step": 107 }, { "epoch": 0.8181818181818182, "grad_norm": 0.10650064051151276, "learning_rate": 7.261181500767413e-05, "loss": 1.09326171875, "step": 108 }, { "epoch": 0.8181818181818182, "eval_loss": 1.1123046875, "eval_runtime": 2.2043, "eval_samples_per_second": 3.629, "eval_steps_per_second": 0.454, "step": 108 }, { "epoch": 0.8257575757575758, "grad_norm": 0.08208151906728745, "learning_rate": 7.209005929848107e-05, "loss": 1.10546875, "step": 109 }, { "epoch": 0.8333333333333334, "grad_norm": 0.08447117358446121, "learning_rate": 7.156560487081053e-05, "loss": 1.13671875, "step": 110 }, { "epoch": 0.8409090909090909, "grad_norm": 0.08980458229780197, "learning_rate": 7.103853454209628e-05, "loss": 1.1298828125, "step": 111 }, { "epoch": 0.8484848484848485, "grad_norm": 0.08742181211709976, "learning_rate": 7.050893154285327e-05, "loss": 1.1005859375, "step": 112 }, { "epoch": 0.8560606060606061, "grad_norm": 0.07789453119039536, "learning_rate": 6.99768795035344e-05, "loss": 1.07958984375, "step": 113 }, { "epoch": 0.8636363636363636, "grad_norm": 0.096565380692482, "learning_rate": 6.944246244132443e-05, "loss": 1.0458984375, "step": 114 }, { "epoch": 0.8712121212121212, "grad_norm": 0.08536340296268463, "learning_rate": 6.890576474687263e-05, "loss": 1.08447265625, "step": 115 }, { "epoch": 0.8787878787878788, "grad_norm": 0.09130439907312393, "learning_rate": 6.836687117096657e-05, "loss": 1.068359375, "step": 116 }, { "epoch": 0.8863636363636364, "grad_norm": 0.0798850879073143, "learning_rate": 6.782586681114894e-05, "loss": 0.9716796875, "step": 117 }, { "epoch": 0.8939393939393939, "grad_norm": 0.09666863083839417, "learning_rate": 6.728283709827963e-05, "loss": 1.0810546875, "step": 118 }, { "epoch": 0.9015151515151515, "grad_norm": 0.081708624958992, "learning_rate": 6.673786778304537e-05, "loss": 0.946533203125, "step": 119 }, { "epoch": 0.9090909090909091, "grad_norm": 0.09238912165164948, "learning_rate": 6.619104492241848e-05, "loss": 1.09375, "step": 120 }, { "epoch": 0.9166666666666666, "grad_norm": 0.09275467693805695, "learning_rate": 6.564245486606762e-05, "loss": 0.96533203125, "step": 121 }, { "epoch": 0.9242424242424242, "grad_norm": 0.10164269059896469, "learning_rate": 6.509218424272216e-05, "loss": 1.09130859375, "step": 122 }, { "epoch": 0.9318181818181818, "grad_norm": 0.08422201871871948, "learning_rate": 6.454031994649247e-05, "loss": 1.03857421875, "step": 123 }, { "epoch": 0.9393939393939394, "grad_norm": 0.09149625152349472, "learning_rate": 6.398694912314831e-05, "loss": 1.05517578125, "step": 124 }, { "epoch": 0.946969696969697, "grad_norm": 0.09097972512245178, "learning_rate": 6.343215915635762e-05, "loss": 1.05322265625, "step": 125 }, { "epoch": 0.9545454545454546, "grad_norm": 0.09669139236211777, "learning_rate": 6.287603765388743e-05, "loss": 1.0791015625, "step": 126 }, { "epoch": 0.9621212121212122, "grad_norm": 0.08664537966251373, "learning_rate": 6.231867243376977e-05, "loss": 1.10498046875, "step": 127 }, { "epoch": 0.9696969696969697, "grad_norm": 0.12009935826063156, "learning_rate": 6.176015151043407e-05, "loss": 0.974609375, "step": 128 }, { "epoch": 0.9772727272727273, "grad_norm": 0.09793458133935928, "learning_rate": 6.120056308080872e-05, "loss": 1.07763671875, "step": 129 }, { "epoch": 0.9848484848484849, "grad_norm": 0.09152775257825851, "learning_rate": 6.06399955103937e-05, "loss": 1.06884765625, "step": 130 }, { "epoch": 0.9924242424242424, "grad_norm": 0.09448117762804031, "learning_rate": 6.007853731930667e-05, "loss": 1.11083984375, "step": 131 }, { "epoch": 1.0, "grad_norm": 0.0885840430855751, "learning_rate": 5.951627716830467e-05, "loss": 0.959716796875, "step": 132 }, { "epoch": 1.0075757575757576, "grad_norm": 0.07837975770235062, "learning_rate": 5.8953303844783456e-05, "loss": 0.858642578125, "step": 133 }, { "epoch": 1.0151515151515151, "grad_norm": 0.10188230127096176, "learning_rate": 5.838970624875698e-05, "loss": 1.08935546875, "step": 134 }, { "epoch": 1.0227272727272727, "grad_norm": 0.09374918043613434, "learning_rate": 5.782557337881911e-05, "loss": 1.0625, "step": 135 }, { "epoch": 1.0303030303030303, "grad_norm": 0.08964771032333374, "learning_rate": 5.726099431808963e-05, "loss": 1.03955078125, "step": 136 }, { "epoch": 1.0378787878787878, "grad_norm": 0.08666251599788666, "learning_rate": 5.669605822014706e-05, "loss": 1.048828125, "step": 137 }, { "epoch": 1.0454545454545454, "grad_norm": 0.0832890048623085, "learning_rate": 5.61308542949502e-05, "loss": 1.02880859375, "step": 138 }, { "epoch": 1.053030303030303, "grad_norm": 0.09309335798025131, "learning_rate": 5.556547179475088e-05, "loss": 1.0673828125, "step": 139 }, { "epoch": 1.0606060606060606, "grad_norm": 0.0930396094918251, "learning_rate": 5.500000000000001e-05, "loss": 0.99951171875, "step": 140 }, { "epoch": 1.0681818181818181, "grad_norm": 0.0936756506562233, "learning_rate": 5.443452820524913e-05, "loss": 1.033203125, "step": 141 }, { "epoch": 1.0757575757575757, "grad_norm": 0.08000978827476501, "learning_rate": 5.3869145705049814e-05, "loss": 0.945709228515625, "step": 142 }, { "epoch": 1.0833333333333333, "grad_norm": 0.08305247128009796, "learning_rate": 5.330394177985295e-05, "loss": 1.0087890625, "step": 143 }, { "epoch": 1.0909090909090908, "grad_norm": 0.08222263306379318, "learning_rate": 5.273900568191038e-05, "loss": 0.947265625, "step": 144 }, { "epoch": 1.0984848484848484, "grad_norm": 0.08853105455636978, "learning_rate": 5.2174426621180906e-05, "loss": 0.990234375, "step": 145 }, { "epoch": 1.106060606060606, "grad_norm": 0.11007614433765411, "learning_rate": 5.161029375124303e-05, "loss": 1.0546875, "step": 146 }, { "epoch": 1.1136363636363635, "grad_norm": 0.08950755000114441, "learning_rate": 5.104669615521657e-05, "loss": 1.07275390625, "step": 147 }, { "epoch": 1.121212121212121, "grad_norm": 0.10570712387561798, "learning_rate": 5.048372283169532e-05, "loss": 1.056640625, "step": 148 }, { "epoch": 1.128787878787879, "grad_norm": 0.10939672589302063, "learning_rate": 4.992146268069333e-05, "loss": 1.05615234375, "step": 149 }, { "epoch": 1.1363636363636362, "grad_norm": 0.09200646728277206, "learning_rate": 4.936000448960631e-05, "loss": 1.0712890625, "step": 150 }, { "epoch": 1.143939393939394, "grad_norm": 0.09504993259906769, "learning_rate": 4.87994369191913e-05, "loss": 1.11328125, "step": 151 }, { "epoch": 1.1515151515151516, "grad_norm": 0.09119915962219238, "learning_rate": 4.823984848956593e-05, "loss": 1.03515625, "step": 152 }, { "epoch": 1.1590909090909092, "grad_norm": 0.10821505635976791, "learning_rate": 4.768132756623024e-05, "loss": 1.03955078125, "step": 153 }, { "epoch": 1.1666666666666667, "grad_norm": 0.10071408748626709, "learning_rate": 4.7123962346112584e-05, "loss": 1.06884765625, "step": 154 }, { "epoch": 1.1742424242424243, "grad_norm": 0.09807620942592621, "learning_rate": 4.6567840843642384e-05, "loss": 1.091796875, "step": 155 }, { "epoch": 1.1818181818181819, "grad_norm": 0.10361678898334503, "learning_rate": 4.601305087685169e-05, "loss": 1.0732421875, "step": 156 }, { "epoch": 1.1893939393939394, "grad_norm": 0.09949921071529388, "learning_rate": 4.545968005350756e-05, "loss": 1.0869140625, "step": 157 }, { "epoch": 1.196969696969697, "grad_norm": 0.1019904762506485, "learning_rate": 4.490781575727786e-05, "loss": 1.0546875, "step": 158 }, { "epoch": 1.2045454545454546, "grad_norm": 0.09665553271770477, "learning_rate": 4.43575451339324e-05, "loss": 0.9061279296875, "step": 159 }, { "epoch": 1.2121212121212122, "grad_norm": 0.09645150601863861, "learning_rate": 4.380895507758155e-05, "loss": 1.05322265625, "step": 160 }, { "epoch": 1.2121212121212122, "eval_loss": 1.083984375, "eval_runtime": 2.2092, "eval_samples_per_second": 3.621, "eval_steps_per_second": 0.453, "step": 160 }, { "epoch": 1.2196969696969697, "grad_norm": 0.0945630818605423, "learning_rate": 4.3262132216954656e-05, "loss": 1.00634765625, "step": 161 }, { "epoch": 1.2272727272727273, "grad_norm": 0.10197978466749191, "learning_rate": 4.271716290172038e-05, "loss": 1.025390625, "step": 162 }, { "epoch": 1.2348484848484849, "grad_norm": 0.10562216490507126, "learning_rate": 4.217413318885108e-05, "loss": 1.025390625, "step": 163 }, { "epoch": 1.2424242424242424, "grad_norm": 0.09081273525953293, "learning_rate": 4.163312882903344e-05, "loss": 1.0380859375, "step": 164 }, { "epoch": 1.25, "grad_norm": 0.08740173280239105, "learning_rate": 4.109423525312738e-05, "loss": 1.0419921875, "step": 165 }, { "epoch": 1.2575757575757576, "grad_norm": 0.09267672151327133, "learning_rate": 4.0557537558675583e-05, "loss": 0.90081787109375, "step": 166 }, { "epoch": 1.2651515151515151, "grad_norm": 0.1051904633641243, "learning_rate": 4.00231204964656e-05, "loss": 1.0615234375, "step": 167 }, { "epoch": 1.2727272727272727, "grad_norm": 0.10390182584524155, "learning_rate": 3.949106845714674e-05, "loss": 1.04150390625, "step": 168 }, { "epoch": 1.2803030303030303, "grad_norm": 0.09526224434375763, "learning_rate": 3.896146545790372e-05, "loss": 0.94580078125, "step": 169 }, { "epoch": 1.2878787878787878, "grad_norm": 0.0959937572479248, "learning_rate": 3.843439512918949e-05, "loss": 1.009765625, "step": 170 }, { "epoch": 1.2954545454545454, "grad_norm": 0.10648560523986816, "learning_rate": 3.790994070151895e-05, "loss": 0.97216796875, "step": 171 }, { "epoch": 1.303030303030303, "grad_norm": 0.09567048400640488, "learning_rate": 3.738818499232589e-05, "loss": 1.0234375, "step": 172 }, { "epoch": 1.3106060606060606, "grad_norm": 0.09656581282615662, "learning_rate": 3.686921039288519e-05, "loss": 1.033203125, "step": 173 }, { "epoch": 1.3181818181818181, "grad_norm": 0.11271104216575623, "learning_rate": 3.6353098855302215e-05, "loss": 1.05029296875, "step": 174 }, { "epoch": 1.3257575757575757, "grad_norm": 0.09784029424190521, "learning_rate": 3.583993187957173e-05, "loss": 0.9931640625, "step": 175 }, { "epoch": 1.3333333333333333, "grad_norm": 0.10976437479257584, "learning_rate": 3.532979050070804e-05, "loss": 1.07421875, "step": 176 }, { "epoch": 1.3409090909090908, "grad_norm": 0.0987778902053833, "learning_rate": 3.482275527594856e-05, "loss": 1.03466796875, "step": 177 }, { "epoch": 1.3484848484848486, "grad_norm": 0.10711042582988739, "learning_rate": 3.431890627203305e-05, "loss": 1.0654296875, "step": 178 }, { "epoch": 1.356060606060606, "grad_norm": 0.0991782397031784, "learning_rate": 3.381832305256004e-05, "loss": 1.00244140625, "step": 179 }, { "epoch": 1.3636363636363638, "grad_norm": 0.12253911793231964, "learning_rate": 3.3321084665422807e-05, "loss": 1.02294921875, "step": 180 }, { "epoch": 1.371212121212121, "grad_norm": 0.12328967452049255, "learning_rate": 3.2827269630326885e-05, "loss": 1.02734375, "step": 181 }, { "epoch": 1.378787878787879, "grad_norm": 0.09768681973218918, "learning_rate": 3.233695592639077e-05, "loss": 1.05419921875, "step": 182 }, { "epoch": 1.3863636363636362, "grad_norm": 0.11941851675510406, "learning_rate": 3.185022097983221e-05, "loss": 1.0625, "step": 183 }, { "epoch": 1.393939393939394, "grad_norm": 0.11135486513376236, "learning_rate": 3.1367141651741694e-05, "loss": 1.09814453125, "step": 184 }, { "epoch": 1.4015151515151514, "grad_norm": 0.09698060154914856, "learning_rate": 3.088779422594514e-05, "loss": 1.078125, "step": 185 }, { "epoch": 1.4090909090909092, "grad_norm": 0.10321120172739029, "learning_rate": 3.0412254396957896e-05, "loss": 1.0263671875, "step": 186 }, { "epoch": 1.4166666666666667, "grad_norm": 0.11265275627374649, "learning_rate": 2.994059725803156e-05, "loss": 1.07373046875, "step": 187 }, { "epoch": 1.4242424242424243, "grad_norm": 0.12025588750839233, "learning_rate": 2.947289728929597e-05, "loss": 1.0380859375, "step": 188 }, { "epoch": 1.4318181818181819, "grad_norm": 0.10383759438991547, "learning_rate": 2.900922834599797e-05, "loss": 1.03662109375, "step": 189 }, { "epoch": 1.4393939393939394, "grad_norm": 0.10661465674638748, "learning_rate": 2.854966364683872e-05, "loss": 1.03515625, "step": 190 }, { "epoch": 1.446969696969697, "grad_norm": 0.09079551696777344, "learning_rate": 2.809427576241167e-05, "loss": 1.03564453125, "step": 191 }, { "epoch": 1.4545454545454546, "grad_norm": 0.10627592355012894, "learning_rate": 2.764313660374277e-05, "loss": 1.0234375, "step": 192 }, { "epoch": 1.4621212121212122, "grad_norm": 0.10409808158874512, "learning_rate": 2.7196317410934964e-05, "loss": 1.0361328125, "step": 193 }, { "epoch": 1.4696969696969697, "grad_norm": 0.09841874986886978, "learning_rate": 2.6753888741918488e-05, "loss": 1.04736328125, "step": 194 }, { "epoch": 1.4772727272727273, "grad_norm": 0.10632629692554474, "learning_rate": 2.6315920461308964e-05, "loss": 1.037109375, "step": 195 }, { "epoch": 1.4848484848484849, "grad_norm": 0.0952998474240303, "learning_rate": 2.588248172937502e-05, "loss": 0.846923828125, "step": 196 }, { "epoch": 1.4924242424242424, "grad_norm": 0.11421612650156021, "learning_rate": 2.5453640991116967e-05, "loss": 1.02978515625, "step": 197 }, { "epoch": 1.5, "grad_norm": 0.10957960784435272, "learning_rate": 2.5029465965458683e-05, "loss": 1.02587890625, "step": 198 }, { "epoch": 1.5075757575757576, "grad_norm": 0.09530032426118851, "learning_rate": 2.46100236345539e-05, "loss": 1.05908203125, "step": 199 }, { "epoch": 1.5151515151515151, "grad_norm": 0.11528428643941879, "learning_rate": 2.4195380233209008e-05, "loss": 1.033203125, "step": 200 }, { "epoch": 1.5227272727272727, "grad_norm": 0.1050548404455185, "learning_rate": 2.3785601238423787e-05, "loss": 1.03564453125, "step": 201 }, { "epoch": 1.5303030303030303, "grad_norm": 0.10518501698970795, "learning_rate": 2.3380751359051795e-05, "loss": 1.05615234375, "step": 202 }, { "epoch": 1.5378787878787878, "grad_norm": 0.10230522602796555, "learning_rate": 2.298089452558216e-05, "loss": 1.0546875, "step": 203 }, { "epoch": 1.5454545454545454, "grad_norm": 0.11399275809526443, "learning_rate": 2.258609388004419e-05, "loss": 1.0419921875, "step": 204 }, { "epoch": 1.553030303030303, "grad_norm": 0.10160615295171738, "learning_rate": 2.219641176603649e-05, "loss": 1.0361328125, "step": 205 }, { "epoch": 1.5606060606060606, "grad_norm": 0.10528803616762161, "learning_rate": 2.181190971888218e-05, "loss": 1.00537109375, "step": 206 }, { "epoch": 1.5681818181818183, "grad_norm": 0.0914541482925415, "learning_rate": 2.1432648455911808e-05, "loss": 0.9873046875, "step": 207 }, { "epoch": 1.5757575757575757, "grad_norm": 0.09788926690816879, "learning_rate": 2.1058687866875328e-05, "loss": 1.04248046875, "step": 208 }, { "epoch": 1.5833333333333335, "grad_norm": 0.10901805758476257, "learning_rate": 2.0690087004484844e-05, "loss": 1.03125, "step": 209 }, { "epoch": 1.5909090909090908, "grad_norm": 0.12249114364385605, "learning_rate": 2.0326904075089492e-05, "loss": 1.02685546875, "step": 210 }, { "epoch": 1.5984848484848486, "grad_norm": 0.1073046326637268, "learning_rate": 1.996919642948395e-05, "loss": 1.03955078125, "step": 211 }, { "epoch": 1.606060606060606, "grad_norm": 0.10490427166223526, "learning_rate": 1.961702055385215e-05, "loss": 1.046875, "step": 212 }, { "epoch": 1.606060606060606, "eval_loss": 1.072265625, "eval_runtime": 2.2194, "eval_samples_per_second": 3.605, "eval_steps_per_second": 0.451, "step": 212 }, { "epoch": 1.6136363636363638, "grad_norm": 0.10367228835821152, "learning_rate": 1.927043206084741e-05, "loss": 1.020263671875, "step": 213 }, { "epoch": 1.621212121212121, "grad_norm": 0.10339723527431488, "learning_rate": 1.892948568081055e-05, "loss": 1.01513671875, "step": 214 }, { "epoch": 1.628787878787879, "grad_norm": 0.09706207364797592, "learning_rate": 1.8594235253127375e-05, "loss": 1.078125, "step": 215 }, { "epoch": 1.6363636363636362, "grad_norm": 0.1056489497423172, "learning_rate": 1.8264733717726722e-05, "loss": 1.04931640625, "step": 216 }, { "epoch": 1.643939393939394, "grad_norm": 0.10254838317632675, "learning_rate": 1.7941033106720768e-05, "loss": 0.98974609375, "step": 217 }, { "epoch": 1.6515151515151514, "grad_norm": 0.09696169197559357, "learning_rate": 1.7623184536188424e-05, "loss": 1.06884765625, "step": 218 }, { "epoch": 1.6590909090909092, "grad_norm": 0.10388782620429993, "learning_rate": 1.7311238198103627e-05, "loss": 1.00830078125, "step": 219 }, { "epoch": 1.6666666666666665, "grad_norm": 0.10069543868303299, "learning_rate": 1.7005243352409334e-05, "loss": 1.01708984375, "step": 220 }, { "epoch": 1.6742424242424243, "grad_norm": 0.0987059697508812, "learning_rate": 1.6705248319238876e-05, "loss": 1.06982421875, "step": 221 }, { "epoch": 1.6818181818181817, "grad_norm": 0.11282015591859818, "learning_rate": 1.6411300471285656e-05, "loss": 1.0341796875, "step": 222 }, { "epoch": 1.6893939393939394, "grad_norm": 0.10136653482913971, "learning_rate": 1.6123446226322414e-05, "loss": 0.98681640625, "step": 223 }, { "epoch": 1.696969696969697, "grad_norm": 0.10275169461965561, "learning_rate": 1.5841731039871348e-05, "loss": 1.03662109375, "step": 224 }, { "epoch": 1.7045454545454546, "grad_norm": 0.10096168518066406, "learning_rate": 1.556619939802615e-05, "loss": 0.99609375, "step": 225 }, { "epoch": 1.7121212121212122, "grad_norm": 0.10797571390867233, "learning_rate": 1.529689481042711e-05, "loss": 1.0498046875, "step": 226 }, { "epoch": 1.7196969696969697, "grad_norm": 0.09793099015951157, "learning_rate": 1.50338598033905e-05, "loss": 1.0771484375, "step": 227 }, { "epoch": 1.7272727272727273, "grad_norm": 0.10779029130935669, "learning_rate": 1.4777135913193132e-05, "loss": 1.04248046875, "step": 228 }, { "epoch": 1.7348484848484849, "grad_norm": 0.1068890392780304, "learning_rate": 1.4526763679513303e-05, "loss": 1.03271484375, "step": 229 }, { "epoch": 1.7424242424242424, "grad_norm": 0.10784820467233658, "learning_rate": 1.428278263902913e-05, "loss": 1.0029296875, "step": 230 }, { "epoch": 1.75, "grad_norm": 0.10273246467113495, "learning_rate": 1.4045231319175198e-05, "loss": 1.05859375, "step": 231 }, { "epoch": 1.7575757575757576, "grad_norm": 0.10326556116342545, "learning_rate": 1.3814147232058714e-05, "loss": 1.0439453125, "step": 232 }, { "epoch": 1.7651515151515151, "grad_norm": 0.10401753336191177, "learning_rate": 1.3589566868535836e-05, "loss": 1.0126953125, "step": 233 }, { "epoch": 1.7727272727272727, "grad_norm": 0.09665694832801819, "learning_rate": 1.3371525692449394e-05, "loss": 1.0205078125, "step": 234 }, { "epoch": 1.7803030303030303, "grad_norm": 0.10136399418115616, "learning_rate": 1.3160058135028691e-05, "loss": 1.0517578125, "step": 235 }, { "epoch": 1.7878787878787878, "grad_norm": 0.10064416378736496, "learning_rate": 1.2955197589452462e-05, "loss": 1.03759765625, "step": 236 }, { "epoch": 1.7954545454545454, "grad_norm": 0.1058633103966713, "learning_rate": 1.2756976405575668e-05, "loss": 0.98779296875, "step": 237 }, { "epoch": 1.803030303030303, "grad_norm": 0.1052682176232338, "learning_rate": 1.2565425884821096e-05, "loss": 0.9951171875, "step": 238 }, { "epoch": 1.8106060606060606, "grad_norm": 0.09581825882196426, "learning_rate": 1.2380576275236511e-05, "loss": 1.064453125, "step": 239 }, { "epoch": 1.8181818181818183, "grad_norm": 0.12475554645061493, "learning_rate": 1.2202456766718093e-05, "loss": 1.0390625, "step": 240 }, { "epoch": 1.8257575757575757, "grad_norm": 0.10554253309965134, "learning_rate": 1.2031095486401069e-05, "loss": 1.05712890625, "step": 241 }, { "epoch": 1.8333333333333335, "grad_norm": 0.0999523252248764, "learning_rate": 1.1866519494218084e-05, "loss": 1.0908203125, "step": 242 }, { "epoch": 1.8409090909090908, "grad_norm": 0.1016223132610321, "learning_rate": 1.1708754778626134e-05, "loss": 1.0869140625, "step": 243 }, { "epoch": 1.8484848484848486, "grad_norm": 0.10487925261259079, "learning_rate": 1.1557826252502677e-05, "loss": 1.046875, "step": 244 }, { "epoch": 1.856060606060606, "grad_norm": 0.10017699748277664, "learning_rate": 1.1413757749211602e-05, "loss": 1.03759765625, "step": 245 }, { "epoch": 1.8636363636363638, "grad_norm": 0.10680767148733139, "learning_rate": 1.1276572018839673e-05, "loss": 1.009765625, "step": 246 }, { "epoch": 1.871212121212121, "grad_norm": 0.09949818253517151, "learning_rate": 1.1146290724604024e-05, "loss": 1.04443359375, "step": 247 }, { "epoch": 1.878787878787879, "grad_norm": 0.1087232455611229, "learning_rate": 1.1022934439431295e-05, "loss": 1.02294921875, "step": 248 }, { "epoch": 1.8863636363636362, "grad_norm": 0.09736225754022598, "learning_rate": 1.0906522642708893e-05, "loss": 0.931884765625, "step": 249 }, { "epoch": 1.893939393939394, "grad_norm": 0.11243616044521332, "learning_rate": 1.0797073717209014e-05, "loss": 1.03466796875, "step": 250 }, { "epoch": 1.9015151515151514, "grad_norm": 0.0957452729344368, "learning_rate": 1.0694604946185762e-05, "loss": 0.90380859375, "step": 251 }, { "epoch": 1.9090909090909092, "grad_norm": 0.11622810363769531, "learning_rate": 1.0599132510645939e-05, "loss": 1.0478515625, "step": 252 }, { "epoch": 1.9166666666666665, "grad_norm": 0.09894511848688126, "learning_rate": 1.0510671486793873e-05, "loss": 0.94091796875, "step": 253 }, { "epoch": 1.9242424242424243, "grad_norm": 0.11916989833116531, "learning_rate": 1.0429235843650698e-05, "loss": 1.03564453125, "step": 254 }, { "epoch": 1.9318181818181817, "grad_norm": 0.10247177630662918, "learning_rate": 1.0354838440848503e-05, "loss": 0.99951171875, "step": 255 }, { "epoch": 1.9393939393939394, "grad_norm": 0.10714147984981537, "learning_rate": 1.0287491026599623e-05, "loss": 1.02294921875, "step": 256 }, { "epoch": 1.946969696969697, "grad_norm": 0.10434214025735855, "learning_rate": 1.0227204235841493e-05, "loss": 1.0146484375, "step": 257 }, { "epoch": 1.9545454545454546, "grad_norm": 0.11075802892446518, "learning_rate": 1.0173987588557237e-05, "loss": 1.0380859375, "step": 258 }, { "epoch": 1.9621212121212122, "grad_norm": 0.1054508239030838, "learning_rate": 1.0127849488272375e-05, "loss": 1.07275390625, "step": 259 }, { "epoch": 1.9696969696969697, "grad_norm": 0.12777963280677795, "learning_rate": 1.008879722072778e-05, "loss": 0.939453125, "step": 260 }, { "epoch": 1.9772727272727273, "grad_norm": 0.10826599597930908, "learning_rate": 1.0056836952729215e-05, "loss": 1.04638671875, "step": 261 }, { "epoch": 1.9848484848484849, "grad_norm": 0.10503465682268143, "learning_rate": 1.0031973731173486e-05, "loss": 1.03564453125, "step": 262 }, { "epoch": 1.9924242424242424, "grad_norm": 0.10461784154176712, "learning_rate": 1.0014211482251503e-05, "loss": 1.07080078125, "step": 263 }, { "epoch": 2.0, "grad_norm": 0.10553426295518875, "learning_rate": 1.0003553010828276e-05, "loss": 0.9228515625, "step": 264 }, { "epoch": 2.0, "eval_loss": 1.0654296875, "eval_runtime": 2.2193, "eval_samples_per_second": 3.605, "eval_steps_per_second": 0.451, "step": 264 } ], "logging_steps": 1.0, "max_steps": 264, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 0, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.930198800069034e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }