YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order8
8809011 verified
Raw
History Blame Contribute Delete
141 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 7.0,
"eval_steps": 500,
"global_step": 553,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 1.4297935962677002,
"learning_rate": 0.0,
"loss": 2.1269,
"mean_token_accuracy": 0.5883483290672302,
"num_tokens": 45860.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 1.434566855430603,
"learning_rate": 1.1764705882352942e-05,
"loss": 2.0758,
"mean_token_accuracy": 0.5955607295036316,
"num_tokens": 91607.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 1.34773850440979,
"learning_rate": 2.3529411764705884e-05,
"loss": 2.0995,
"mean_token_accuracy": 0.5925061702728271,
"num_tokens": 138803.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 1.2693862915039062,
"learning_rate": 3.529411764705883e-05,
"loss": 2.0646,
"mean_token_accuracy": 0.592647910118103,
"num_tokens": 185711.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 1.0771547555923462,
"learning_rate": 4.705882352941177e-05,
"loss": 1.9528,
"mean_token_accuracy": 0.6024201512336731,
"num_tokens": 229326.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 0.8461045026779175,
"learning_rate": 5.882352941176471e-05,
"loss": 1.8946,
"mean_token_accuracy": 0.6050652861595154,
"num_tokens": 273139.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 0.5019454956054688,
"learning_rate": 7.058823529411765e-05,
"loss": 1.833,
"mean_token_accuracy": 0.6073743104934692,
"num_tokens": 320421.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 0.5096880197525024,
"learning_rate": 8.23529411764706e-05,
"loss": 1.8264,
"mean_token_accuracy": 0.604993462562561,
"num_tokens": 368788.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.8427304029464722,
"learning_rate": 9.411764705882353e-05,
"loss": 1.8343,
"mean_token_accuracy": 0.6039018630981445,
"num_tokens": 415189.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.8095427751541138,
"learning_rate": 0.00010588235294117647,
"loss": 1.7456,
"mean_token_accuracy": 0.6184370517730713,
"num_tokens": 458774.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.5690692067146301,
"learning_rate": 0.00011764705882352942,
"loss": 1.761,
"mean_token_accuracy": 0.6134573817253113,
"num_tokens": 504300.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.42741021513938904,
"learning_rate": 0.00012941176470588237,
"loss": 1.7408,
"mean_token_accuracy": 0.6172425150871277,
"num_tokens": 550239.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.3621617257595062,
"learning_rate": 0.0001411764705882353,
"loss": 1.7292,
"mean_token_accuracy": 0.6186677813529968,
"num_tokens": 595311.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.356418639421463,
"learning_rate": 0.00015294117647058822,
"loss": 1.7433,
"mean_token_accuracy": 0.618061900138855,
"num_tokens": 643731.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.31577178835868835,
"learning_rate": 0.0001647058823529412,
"loss": 1.7376,
"mean_token_accuracy": 0.6176530718803406,
"num_tokens": 687946.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.28681808710098267,
"learning_rate": 0.00017647058823529413,
"loss": 1.7212,
"mean_token_accuracy": 0.6185654997825623,
"num_tokens": 733740.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.3112754821777344,
"learning_rate": 0.00018823529411764707,
"loss": 1.7352,
"mean_token_accuracy": 0.6181626319885254,
"num_tokens": 780185.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.40416133403778076,
"learning_rate": 0.0002,
"loss": 1.7291,
"mean_token_accuracy": 0.618687093257904,
"num_tokens": 827533.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.45459505915641785,
"learning_rate": 0.0001999982823331779,
"loss": 1.7223,
"mean_token_accuracy": 0.6227962970733643,
"num_tokens": 873543.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.37240275740623474,
"learning_rate": 0.00019999312939171914,
"loss": 1.7479,
"mean_token_accuracy": 0.6146200895309448,
"num_tokens": 923210.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.5440695881843567,
"learning_rate": 0.00019998454135264444,
"loss": 1.6538,
"mean_token_accuracy": 0.6290217638015747,
"num_tokens": 969460.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.2815147638320923,
"learning_rate": 0.0001999725185109816,
"loss": 1.6833,
"mean_token_accuracy": 0.6285157799720764,
"num_tokens": 1014215.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.27108052372932434,
"learning_rate": 0.00019995706127975537,
"loss": 1.6823,
"mean_token_accuracy": 0.6276950836181641,
"num_tokens": 1061587.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.28978854417800903,
"learning_rate": 0.00019993817018997323,
"loss": 1.7345,
"mean_token_accuracy": 0.6147149205207825,
"num_tokens": 1108746.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.26003706455230713,
"learning_rate": 0.0001999158458906071,
"loss": 1.6382,
"mean_token_accuracy": 0.633102297782898,
"num_tokens": 1150650.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.2689721882343292,
"learning_rate": 0.00019989008914857116,
"loss": 1.7528,
"mean_token_accuracy": 0.6133280396461487,
"num_tokens": 1198478.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.29233652353286743,
"learning_rate": 0.00019986090084869545,
"loss": 1.7128,
"mean_token_accuracy": 0.6206752061843872,
"num_tokens": 1248602.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.3018750846385956,
"learning_rate": 0.00019982828199369541,
"loss": 1.7215,
"mean_token_accuracy": 0.6194838285446167,
"num_tokens": 1298225.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.3065217435359955,
"learning_rate": 0.00019979223370413763,
"loss": 1.642,
"mean_token_accuracy": 0.632573127746582,
"num_tokens": 1346783.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.26041898131370544,
"learning_rate": 0.00019975275721840103,
"loss": 1.7038,
"mean_token_accuracy": 0.6213216781616211,
"num_tokens": 1394151.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.25361573696136475,
"learning_rate": 0.00019970985389263467,
"loss": 1.6846,
"mean_token_accuracy": 0.6269124150276184,
"num_tokens": 1440818.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.23808851838111877,
"learning_rate": 0.0001996635252007109,
"loss": 1.7003,
"mean_token_accuracy": 0.6228302121162415,
"num_tokens": 1486970.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.2258971631526947,
"learning_rate": 0.00019961377273417487,
"loss": 1.6915,
"mean_token_accuracy": 0.6242671012878418,
"num_tokens": 1535132.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.23645015060901642,
"learning_rate": 0.00019956059820218982,
"loss": 1.6701,
"mean_token_accuracy": 0.6313917636871338,
"num_tokens": 1581310.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.22955374419689178,
"learning_rate": 0.00019950400343147833,
"loss": 1.6651,
"mean_token_accuracy": 0.6299709677696228,
"num_tokens": 1626838.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.22750572860240936,
"learning_rate": 0.0001994439903662596,
"loss": 1.6982,
"mean_token_accuracy": 0.6246239542961121,
"num_tokens": 1674100.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.22190001606941223,
"learning_rate": 0.00019938056106818261,
"loss": 1.6975,
"mean_token_accuracy": 0.6197924017906189,
"num_tokens": 1722819.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.24010570347309113,
"learning_rate": 0.00019931371771625544,
"loss": 1.6365,
"mean_token_accuracy": 0.6325092911720276,
"num_tokens": 1770008.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.23719368875026703,
"learning_rate": 0.0001992434626067702,
"loss": 1.6906,
"mean_token_accuracy": 0.6234063506126404,
"num_tokens": 1815094.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.22259032726287842,
"learning_rate": 0.00019916979815322433,
"loss": 1.6798,
"mean_token_accuracy": 0.6275040507316589,
"num_tokens": 1865027.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.2300175577402115,
"learning_rate": 0.00019909272688623756,
"loss": 1.6783,
"mean_token_accuracy": 0.6286372542381287,
"num_tokens": 1911967.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.21260212361812592,
"learning_rate": 0.0001990122514534651,
"loss": 1.7155,
"mean_token_accuracy": 0.6216686964035034,
"num_tokens": 1963100.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.2217252254486084,
"learning_rate": 0.00019892837461950652,
"loss": 1.6599,
"mean_token_accuracy": 0.6299470663070679,
"num_tokens": 2010768.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.2244565337896347,
"learning_rate": 0.00019884109926581096,
"loss": 1.7049,
"mean_token_accuracy": 0.622722864151001,
"num_tokens": 2059303.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.23472081124782562,
"learning_rate": 0.00019875042839057798,
"loss": 1.7017,
"mean_token_accuracy": 0.6219018697738647,
"num_tokens": 2103829.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.22766339778900146,
"learning_rate": 0.00019865636510865467,
"loss": 1.7028,
"mean_token_accuracy": 0.6218793392181396,
"num_tokens": 2150558.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.228139728307724,
"learning_rate": 0.0001985589126514286,
"loss": 1.7016,
"mean_token_accuracy": 0.6203511953353882,
"num_tokens": 2201253.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.22668923437595367,
"learning_rate": 0.0001984580743667168,
"loss": 1.6959,
"mean_token_accuracy": 0.6244654059410095,
"num_tokens": 2247382.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.2259022295475006,
"learning_rate": 0.0001983538537186508,
"loss": 1.6974,
"mean_token_accuracy": 0.6239613890647888,
"num_tokens": 2295707.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.22462861239910126,
"learning_rate": 0.0001982462542875576,
"loss": 1.6612,
"mean_token_accuracy": 0.6296576857566833,
"num_tokens": 2340697.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.24034149944782257,
"learning_rate": 0.0001981352797698367,
"loss": 1.6784,
"mean_token_accuracy": 0.6287301182746887,
"num_tokens": 2382717.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.21968059241771698,
"learning_rate": 0.00019802093397783296,
"loss": 1.6612,
"mean_token_accuracy": 0.6290526390075684,
"num_tokens": 2430219.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.23564419150352478,
"learning_rate": 0.0001979032208397059,
"loss": 1.6276,
"mean_token_accuracy": 0.6347538232803345,
"num_tokens": 2473766.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.22665007412433624,
"learning_rate": 0.00019778214439929452,
"loss": 1.6862,
"mean_token_accuracy": 0.6270169615745544,
"num_tokens": 2521674.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.2169383466243744,
"learning_rate": 0.00019765770881597855,
"loss": 1.707,
"mean_token_accuracy": 0.624442458152771,
"num_tokens": 2570612.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.22436678409576416,
"learning_rate": 0.00019752991836453543,
"loss": 1.6428,
"mean_token_accuracy": 0.6327121257781982,
"num_tokens": 2620095.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.23180508613586426,
"learning_rate": 0.00019739877743499352,
"loss": 1.7243,
"mean_token_accuracy": 0.6180028915405273,
"num_tokens": 2665785.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.2244236022233963,
"learning_rate": 0.0001972642905324813,
"loss": 1.6619,
"mean_token_accuracy": 0.6294060349464417,
"num_tokens": 2712064.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.2267381250858307,
"learning_rate": 0.00019712646227707263,
"loss": 1.6287,
"mean_token_accuracy": 0.6353709697723389,
"num_tokens": 2760026.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.23568469285964966,
"learning_rate": 0.00019698529740362785,
"loss": 1.7067,
"mean_token_accuracy": 0.6213864088058472,
"num_tokens": 2806166.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.21780051290988922,
"learning_rate": 0.00019684080076163142,
"loss": 1.6478,
"mean_token_accuracy": 0.630071759223938,
"num_tokens": 2855572.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.23158034682273865,
"learning_rate": 0.00019669297731502507,
"loss": 1.6464,
"mean_token_accuracy": 0.6330370903015137,
"num_tokens": 2900646.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.22072935104370117,
"learning_rate": 0.0001965418321420374,
"loss": 1.6329,
"mean_token_accuracy": 0.6327118277549744,
"num_tokens": 2948656.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.23062308132648468,
"learning_rate": 0.0001963873704350094,
"loss": 1.6534,
"mean_token_accuracy": 0.6293391585350037,
"num_tokens": 2992709.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.21779538691043854,
"learning_rate": 0.00019622959750021605,
"loss": 1.618,
"mean_token_accuracy": 0.6372920274734497,
"num_tokens": 3038992.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.22693635523319244,
"learning_rate": 0.000196068518757684,
"loss": 1.7128,
"mean_token_accuracy": 0.6208335161209106,
"num_tokens": 3085558.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.23582525551319122,
"learning_rate": 0.0001959041397410056,
"loss": 1.6625,
"mean_token_accuracy": 0.6306231617927551,
"num_tokens": 3130170.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.2246374785900116,
"learning_rate": 0.0001957364660971485,
"loss": 1.6385,
"mean_token_accuracy": 0.6291642189025879,
"num_tokens": 3176311.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.22443550825119019,
"learning_rate": 0.0001955655035862617,
"loss": 1.6751,
"mean_token_accuracy": 0.625806450843811,
"num_tokens": 3222875.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.22177176177501678,
"learning_rate": 0.0001953912580814779,
"loss": 1.6653,
"mean_token_accuracy": 0.6286900639533997,
"num_tokens": 3271109.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.2268744707107544,
"learning_rate": 0.0001952137355687116,
"loss": 1.6222,
"mean_token_accuracy": 0.6369240283966064,
"num_tokens": 3317571.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.22358258068561554,
"learning_rate": 0.00019503294214645337,
"loss": 1.6428,
"mean_token_accuracy": 0.633510172367096,
"num_tokens": 3362493.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.2274637073278427,
"learning_rate": 0.00019484888402556045,
"loss": 1.6303,
"mean_token_accuracy": 0.6295872926712036,
"num_tokens": 3412450.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.2235092669725418,
"learning_rate": 0.00019466156752904343,
"loss": 1.6348,
"mean_token_accuracy": 0.6336225867271423,
"num_tokens": 3458150.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.22723203897476196,
"learning_rate": 0.0001944709990918489,
"loss": 1.6353,
"mean_token_accuracy": 0.6303831934928894,
"num_tokens": 3503285.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.23029087483882904,
"learning_rate": 0.00019427718526063856,
"loss": 1.6788,
"mean_token_accuracy": 0.6246349215507507,
"num_tokens": 3550258.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.21722035109996796,
"learning_rate": 0.00019408013269356408,
"loss": 1.6423,
"mean_token_accuracy": 0.6343802809715271,
"num_tokens": 3600054.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.22306939959526062,
"learning_rate": 0.00019387984816003867,
"loss": 1.6825,
"mean_token_accuracy": 0.6262245774269104,
"num_tokens": 3646563.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.24767781794071198,
"learning_rate": 0.00019367633854050422,
"loss": 1.6458,
"mean_token_accuracy": 0.6306663751602173,
"num_tokens": 3693284.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.2704238295555115,
"learning_rate": 0.00019346961082619522,
"loss": 1.5187,
"mean_token_accuracy": 0.6579475402832031,
"num_tokens": 3738689.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.22565050423145294,
"learning_rate": 0.00019325967211889834,
"loss": 1.5333,
"mean_token_accuracy": 0.6507334113121033,
"num_tokens": 3783544.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.21894116699695587,
"learning_rate": 0.0001930465296307087,
"loss": 1.4748,
"mean_token_accuracy": 0.6617191433906555,
"num_tokens": 3830433.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.2757681906223297,
"learning_rate": 0.00019283019068378182,
"loss": 1.5382,
"mean_token_accuracy": 0.6483068466186523,
"num_tokens": 3876830.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.26444658637046814,
"learning_rate": 0.00019261066271008235,
"loss": 1.4792,
"mean_token_accuracy": 0.6634548902511597,
"num_tokens": 3921833.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.23986731469631195,
"learning_rate": 0.0001923879532511287,
"loss": 1.5573,
"mean_token_accuracy": 0.6481124758720398,
"num_tokens": 3968122.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.23939338326454163,
"learning_rate": 0.00019216206995773373,
"loss": 1.5157,
"mean_token_accuracy": 0.6560894846916199,
"num_tokens": 4016466.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.24986766278743744,
"learning_rate": 0.00019193302058974232,
"loss": 1.5496,
"mean_token_accuracy": 0.6462620496749878,
"num_tokens": 4066437.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.23949536681175232,
"learning_rate": 0.00019170081301576444,
"loss": 1.5063,
"mean_token_accuracy": 0.6563820242881775,
"num_tokens": 4114793.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.23770886659622192,
"learning_rate": 0.00019146545521290495,
"loss": 1.4886,
"mean_token_accuracy": 0.6591377854347229,
"num_tokens": 4159441.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.2399303913116455,
"learning_rate": 0.00019122695526648968,
"loss": 1.5237,
"mean_token_accuracy": 0.650536298751831,
"num_tokens": 4208729.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.2637503147125244,
"learning_rate": 0.00019098532136978754,
"loss": 1.498,
"mean_token_accuracy": 0.6567501425743103,
"num_tokens": 4253466.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.2615419924259186,
"learning_rate": 0.00019074056182372907,
"loss": 1.5141,
"mean_token_accuracy": 0.6535509824752808,
"num_tokens": 4302784.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.2541172504425049,
"learning_rate": 0.00019049268503662126,
"loss": 1.4986,
"mean_token_accuracy": 0.6578357815742493,
"num_tokens": 4347917.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.24259509146213531,
"learning_rate": 0.00019024169952385885,
"loss": 1.4655,
"mean_token_accuracy": 0.6630852222442627,
"num_tokens": 4394610.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.2532861530780792,
"learning_rate": 0.00018998761390763154,
"loss": 1.5144,
"mean_token_accuracy": 0.6535828709602356,
"num_tokens": 4443029.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.24317510426044464,
"learning_rate": 0.00018973043691662803,
"loss": 1.5196,
"mean_token_accuracy": 0.6520761847496033,
"num_tokens": 4490704.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.2610395848751068,
"learning_rate": 0.000189470177385736,
"loss": 1.5044,
"mean_token_accuracy": 0.6601476669311523,
"num_tokens": 4534384.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.2677130103111267,
"learning_rate": 0.00018920684425573865,
"loss": 1.4518,
"mean_token_accuracy": 0.6647972464561462,
"num_tokens": 4578669.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.2610534429550171,
"learning_rate": 0.00018894044657300765,
"loss": 1.4535,
"mean_token_accuracy": 0.6645317077636719,
"num_tokens": 4624636.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.2596592903137207,
"learning_rate": 0.00018867099348919217,
"loss": 1.47,
"mean_token_accuracy": 0.6623217463493347,
"num_tokens": 4671958.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.2679537236690521,
"learning_rate": 0.0001883984942609047,
"loss": 1.473,
"mean_token_accuracy": 0.6634280681610107,
"num_tokens": 4718853.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.26461848616600037,
"learning_rate": 0.00018812295824940285,
"loss": 1.5248,
"mean_token_accuracy": 0.6544753909111023,
"num_tokens": 4767695.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.2688470482826233,
"learning_rate": 0.00018784439492026798,
"loss": 1.553,
"mean_token_accuracy": 0.6471455693244934,
"num_tokens": 4813880.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.2555462419986725,
"learning_rate": 0.00018756281384307982,
"loss": 1.4992,
"mean_token_accuracy": 0.656396210193634,
"num_tokens": 4860323.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.27267542481422424,
"learning_rate": 0.0001872782246910879,
"loss": 1.453,
"mean_token_accuracy": 0.6634340882301331,
"num_tokens": 4906274.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.2674024999141693,
"learning_rate": 0.00018699063724087904,
"loss": 1.5336,
"mean_token_accuracy": 0.652473509311676,
"num_tokens": 4954225.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.2559143602848053,
"learning_rate": 0.0001867000613720417,
"loss": 1.4769,
"mean_token_accuracy": 0.6595107316970825,
"num_tokens": 5001336.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.27574166655540466,
"learning_rate": 0.0001864065070668265,
"loss": 1.4803,
"mean_token_accuracy": 0.661461591720581,
"num_tokens": 5047445.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.2721637189388275,
"learning_rate": 0.00018610998440980324,
"loss": 1.4955,
"mean_token_accuracy": 0.6583252549171448,
"num_tokens": 5092745.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.2680104076862335,
"learning_rate": 0.00018581050358751445,
"loss": 1.5764,
"mean_token_accuracy": 0.6440534591674805,
"num_tokens": 5140038.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.2686646580696106,
"learning_rate": 0.00018550807488812562,
"loss": 1.4896,
"mean_token_accuracy": 0.6607694625854492,
"num_tokens": 5185717.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.26218053698539734,
"learning_rate": 0.00018520270870107166,
"loss": 1.5112,
"mean_token_accuracy": 0.6550983786582947,
"num_tokens": 5230040.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.2599179446697235,
"learning_rate": 0.00018489441551669986,
"loss": 1.4914,
"mean_token_accuracy": 0.6583897471427917,
"num_tokens": 5279599.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.25936904549598694,
"learning_rate": 0.00018458320592590975,
"loss": 1.491,
"mean_token_accuracy": 0.6570174098014832,
"num_tokens": 5326817.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.2672724425792694,
"learning_rate": 0.00018426909061978908,
"loss": 1.5042,
"mean_token_accuracy": 0.6552169322967529,
"num_tokens": 5374131.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.26219993829727173,
"learning_rate": 0.00018395208038924667,
"loss": 1.457,
"mean_token_accuracy": 0.664246141910553,
"num_tokens": 5421155.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.2645889222621918,
"learning_rate": 0.00018363218612464158,
"loss": 1.4865,
"mean_token_accuracy": 0.6586675643920898,
"num_tokens": 5468516.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.27145904302597046,
"learning_rate": 0.00018330941881540915,
"loss": 1.5393,
"mean_token_accuracy": 0.6498931646347046,
"num_tokens": 5519116.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.27031463384628296,
"learning_rate": 0.00018298378954968337,
"loss": 1.4729,
"mean_token_accuracy": 0.6622894406318665,
"num_tokens": 5566013.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.2636566460132599,
"learning_rate": 0.0001826553095139159,
"loss": 1.4852,
"mean_token_accuracy": 0.6582340002059937,
"num_tokens": 5613393.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.26901474595069885,
"learning_rate": 0.00018232398999249192,
"loss": 1.4343,
"mean_token_accuracy": 0.6671172976493835,
"num_tokens": 5658581.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.260540634393692,
"learning_rate": 0.00018198984236734246,
"loss": 1.5081,
"mean_token_accuracy": 0.6527827978134155,
"num_tokens": 5708631.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.267051100730896,
"learning_rate": 0.0001816528781175533,
"loss": 1.479,
"mean_token_accuracy": 0.6584655046463013,
"num_tokens": 5757428.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.2814350724220276,
"learning_rate": 0.0001813131088189707,
"loss": 1.4711,
"mean_token_accuracy": 0.6626920104026794,
"num_tokens": 5801689.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.2702229619026184,
"learning_rate": 0.00018097054614380365,
"loss": 1.4945,
"mean_token_accuracy": 0.6577462553977966,
"num_tokens": 5847827.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.2745739221572876,
"learning_rate": 0.000180625201860223,
"loss": 1.504,
"mean_token_accuracy": 0.6541758179664612,
"num_tokens": 5895606.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.2730543315410614,
"learning_rate": 0.0001802770878319571,
"loss": 1.4956,
"mean_token_accuracy": 0.6596698760986328,
"num_tokens": 5942501.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.26320144534111023,
"learning_rate": 0.00017992621601788428,
"loss": 1.4677,
"mean_token_accuracy": 0.6615061163902283,
"num_tokens": 5988684.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.27375948429107666,
"learning_rate": 0.00017957259847162205,
"loss": 1.4883,
"mean_token_accuracy": 0.6593698263168335,
"num_tokens": 6036577.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.27551186084747314,
"learning_rate": 0.00017921624734111292,
"loss": 1.5127,
"mean_token_accuracy": 0.6532179713249207,
"num_tokens": 6082866.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.2854526937007904,
"learning_rate": 0.00017885717486820722,
"loss": 1.4834,
"mean_token_accuracy": 0.6589472889900208,
"num_tokens": 6128184.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.2762332558631897,
"learning_rate": 0.00017849539338824231,
"loss": 1.4762,
"mean_token_accuracy": 0.6631950736045837,
"num_tokens": 6175777.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.28698286414146423,
"learning_rate": 0.0001781309153296192,
"loss": 1.4743,
"mean_token_accuracy": 0.6608595252037048,
"num_tokens": 6221704.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.2894686758518219,
"learning_rate": 0.00017776375321337521,
"loss": 1.4985,
"mean_token_accuracy": 0.65559983253479,
"num_tokens": 6267430.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.2916942834854126,
"learning_rate": 0.00017739391965275404,
"loss": 1.4675,
"mean_token_accuracy": 0.6640766859054565,
"num_tokens": 6309965.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.27421343326568604,
"learning_rate": 0.00017702142735277247,
"loss": 1.497,
"mean_token_accuracy": 0.6565625071525574,
"num_tokens": 6358326.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.2747173309326172,
"learning_rate": 0.00017664628910978375,
"loss": 1.4995,
"mean_token_accuracy": 0.655762255191803,
"num_tokens": 6405160.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.27782154083251953,
"learning_rate": 0.0001762685178110382,
"loss": 1.4358,
"mean_token_accuracy": 0.667519211769104,
"num_tokens": 6449795.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.2791241705417633,
"learning_rate": 0.00017588812643424032,
"loss": 1.5493,
"mean_token_accuracy": 0.6500073671340942,
"num_tokens": 6497300.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.2714492380619049,
"learning_rate": 0.0001755051280471031,
"loss": 1.4895,
"mean_token_accuracy": 0.6580542922019958,
"num_tokens": 6546518.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.27369654178619385,
"learning_rate": 0.00017511953580689888,
"loss": 1.5208,
"mean_token_accuracy": 0.6513364315032959,
"num_tokens": 6593048.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.2905201017856598,
"learning_rate": 0.00017473136296000772,
"loss": 1.5268,
"mean_token_accuracy": 0.6505144238471985,
"num_tokens": 6638988.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.2680700719356537,
"learning_rate": 0.000174340622841462,
"loss": 1.4976,
"mean_token_accuracy": 0.6543448567390442,
"num_tokens": 6686177.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.28409284353256226,
"learning_rate": 0.00017394732887448847,
"loss": 1.4865,
"mean_token_accuracy": 0.6597988605499268,
"num_tokens": 6731379.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.2727820575237274,
"learning_rate": 0.00017355149457004709,
"loss": 1.4922,
"mean_token_accuracy": 0.6577648520469666,
"num_tokens": 6779860.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.2895708382129669,
"learning_rate": 0.0001731531335263669,
"loss": 1.4861,
"mean_token_accuracy": 0.6559346318244934,
"num_tokens": 6822631.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.2730681300163269,
"learning_rate": 0.0001727522594284789,
"loss": 1.5365,
"mean_token_accuracy": 0.6517869830131531,
"num_tokens": 6871240.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.27399033308029175,
"learning_rate": 0.00017234888604774574,
"loss": 1.5494,
"mean_token_accuracy": 0.6449940800666809,
"num_tokens": 6920506.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.28052183985710144,
"learning_rate": 0.00017194302724138903,
"loss": 1.5205,
"mean_token_accuracy": 0.6526179313659668,
"num_tokens": 6968451.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.2830485999584198,
"learning_rate": 0.00017153469695201277,
"loss": 1.534,
"mean_token_accuracy": 0.6482208371162415,
"num_tokens": 7015391.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.2714807689189911,
"learning_rate": 0.0001711239092071248,
"loss": 1.5007,
"mean_token_accuracy": 0.6547030210494995,
"num_tokens": 7061957.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.28191933035850525,
"learning_rate": 0.00017071067811865476,
"loss": 1.506,
"mean_token_accuracy": 0.6569375395774841,
"num_tokens": 7107246.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.2704729437828064,
"learning_rate": 0.00017029501788246924,
"loss": 1.4832,
"mean_token_accuracy": 0.6607176065444946,
"num_tokens": 7155553.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.27189669013023376,
"learning_rate": 0.00016987694277788417,
"loss": 1.4983,
"mean_token_accuracy": 0.6550452709197998,
"num_tokens": 7202255.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.288601279258728,
"learning_rate": 0.0001694564671671743,
"loss": 1.5234,
"mean_token_accuracy": 0.651522159576416,
"num_tokens": 7250081.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.28722238540649414,
"learning_rate": 0.0001690336054950797,
"loss": 1.4838,
"mean_token_accuracy": 0.6596331596374512,
"num_tokens": 7295452.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.28106075525283813,
"learning_rate": 0.00016860837228830974,
"loss": 1.4449,
"mean_token_accuracy": 0.6669970750808716,
"num_tokens": 7340912.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.29809167981147766,
"learning_rate": 0.0001681807821550438,
"loss": 1.3563,
"mean_token_accuracy": 0.6853920221328735,
"num_tokens": 7386725.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.302463173866272,
"learning_rate": 0.00016775084978442955,
"loss": 1.2736,
"mean_token_accuracy": 0.7005270719528198,
"num_tokens": 7431374.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.3087366819381714,
"learning_rate": 0.00016731858994607838,
"loss": 1.2788,
"mean_token_accuracy": 0.6979596018791199,
"num_tokens": 7477018.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.31179991364479065,
"learning_rate": 0.00016688401748955802,
"loss": 1.3065,
"mean_token_accuracy": 0.6944866180419922,
"num_tokens": 7525800.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.3638923466205597,
"learning_rate": 0.00016644714734388217,
"loss": 1.2457,
"mean_token_accuracy": 0.7046037912368774,
"num_tokens": 7573759.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.3726513385772705,
"learning_rate": 0.00016600799451699802,
"loss": 1.215,
"mean_token_accuracy": 0.7081204652786255,
"num_tokens": 7617478.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.316274493932724,
"learning_rate": 0.0001655665740952703,
"loss": 1.2713,
"mean_token_accuracy": 0.6999913454055786,
"num_tokens": 7663624.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.31808707118034363,
"learning_rate": 0.00016512290124296336,
"loss": 1.2328,
"mean_token_accuracy": 0.7067911028862,
"num_tokens": 7708158.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.304767370223999,
"learning_rate": 0.00016467699120171987,
"loss": 1.2526,
"mean_token_accuracy": 0.7050590515136719,
"num_tokens": 7755306.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.28329142928123474,
"learning_rate": 0.00016422885929003758,
"loss": 1.2241,
"mean_token_accuracy": 0.7089524269104004,
"num_tokens": 7803692.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.2999579906463623,
"learning_rate": 0.00016377852090274276,
"loss": 1.2834,
"mean_token_accuracy": 0.7007805109024048,
"num_tokens": 7851547.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.32791537046432495,
"learning_rate": 0.0001633259915104616,
"loss": 1.225,
"mean_token_accuracy": 0.7079063057899475,
"num_tokens": 7896107.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.35149338841438293,
"learning_rate": 0.0001628712866590885,
"loss": 1.1993,
"mean_token_accuracy": 0.7159732580184937,
"num_tokens": 7938836.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.3519878387451172,
"learning_rate": 0.00016241442196925223,
"loss": 1.267,
"mean_token_accuracy": 0.6996027827262878,
"num_tokens": 7985475.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.32906627655029297,
"learning_rate": 0.00016195541313577923,
"loss": 1.2498,
"mean_token_accuracy": 0.7009555697441101,
"num_tokens": 8034933.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.322187215089798,
"learning_rate": 0.00016149427592715432,
"loss": 1.269,
"mean_token_accuracy": 0.6975268721580505,
"num_tokens": 8082912.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.33761700987815857,
"learning_rate": 0.00016103102618497922,
"loss": 1.245,
"mean_token_accuracy": 0.7072176337242126,
"num_tokens": 8129099.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.31815439462661743,
"learning_rate": 0.00016056567982342817,
"loss": 1.2356,
"mean_token_accuracy": 0.7027240991592407,
"num_tokens": 8175931.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.3221277594566345,
"learning_rate": 0.00016009825282870126,
"loss": 1.2474,
"mean_token_accuracy": 0.7036200165748596,
"num_tokens": 8224227.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.32305020093917847,
"learning_rate": 0.00015962876125847535,
"loss": 1.2577,
"mean_token_accuracy": 0.7010858654975891,
"num_tokens": 8273285.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.35282593965530396,
"learning_rate": 0.00015915722124135227,
"loss": 1.2303,
"mean_token_accuracy": 0.7082141041755676,
"num_tokens": 8316689.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.3499389886856079,
"learning_rate": 0.0001586836489763049,
"loss": 1.275,
"mean_token_accuracy": 0.6990365386009216,
"num_tokens": 8365327.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.34207987785339355,
"learning_rate": 0.00015820806073212055,
"loss": 1.2536,
"mean_token_accuracy": 0.702049970626831,
"num_tokens": 8411392.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.32787948846817017,
"learning_rate": 0.0001577304728468422,
"loss": 1.2539,
"mean_token_accuracy": 0.7007697820663452,
"num_tokens": 8460562.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.3327817916870117,
"learning_rate": 0.0001572509017272072,
"loss": 1.2562,
"mean_token_accuracy": 0.7036707401275635,
"num_tokens": 8506693.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.3491711914539337,
"learning_rate": 0.00015676936384808354,
"loss": 1.2257,
"mean_token_accuracy": 0.7093122005462646,
"num_tokens": 8549239.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.33453595638275146,
"learning_rate": 0.00015628587575190395,
"loss": 1.2653,
"mean_token_accuracy": 0.6975212693214417,
"num_tokens": 8594850.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.331360399723053,
"learning_rate": 0.00015580045404809772,
"loss": 1.283,
"mean_token_accuracy": 0.6986226439476013,
"num_tokens": 8642542.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.3299597501754761,
"learning_rate": 0.00015531311541251995,
"loss": 1.2375,
"mean_token_accuracy": 0.704332709312439,
"num_tokens": 8690890.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.3463394343852997,
"learning_rate": 0.00015482387658687875,
"loss": 1.2434,
"mean_token_accuracy": 0.7066888809204102,
"num_tokens": 8737195.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.3440077304840088,
"learning_rate": 0.00015433275437816004,
"loss": 1.2422,
"mean_token_accuracy": 0.7034814357757568,
"num_tokens": 8784251.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.34045225381851196,
"learning_rate": 0.00015383976565805035,
"loss": 1.2669,
"mean_token_accuracy": 0.6978285312652588,
"num_tokens": 8831103.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.34536802768707275,
"learning_rate": 0.00015334492736235705,
"loss": 1.2757,
"mean_token_accuracy": 0.699856698513031,
"num_tokens": 8878611.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.3353114426136017,
"learning_rate": 0.00015284825649042655,
"loss": 1.2864,
"mean_token_accuracy": 0.6976174712181091,
"num_tokens": 8927279.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.3356870710849762,
"learning_rate": 0.00015234977010456047,
"loss": 1.2366,
"mean_token_accuracy": 0.7043005228042603,
"num_tokens": 8974198.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.347060889005661,
"learning_rate": 0.00015184948532942928,
"loss": 1.2653,
"mean_token_accuracy": 0.7007454633712769,
"num_tokens": 9018395.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.33887261152267456,
"learning_rate": 0.0001513474193514842,
"loss": 1.2701,
"mean_token_accuracy": 0.7008969187736511,
"num_tokens": 9069077.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.348005473613739,
"learning_rate": 0.0001508435894183667,
"loss": 1.2134,
"mean_token_accuracy": 0.711205244064331,
"num_tokens": 9113754.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.3352693021297455,
"learning_rate": 0.00015033801283831596,
"loss": 1.2823,
"mean_token_accuracy": 0.6957764029502869,
"num_tokens": 9164557.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.33518290519714355,
"learning_rate": 0.00014983070697957438,
"loss": 1.2649,
"mean_token_accuracy": 0.69664067029953,
"num_tokens": 9211773.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.33229929208755493,
"learning_rate": 0.00014932168926979074,
"loss": 1.2585,
"mean_token_accuracy": 0.7020613551139832,
"num_tokens": 9260300.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.3351842164993286,
"learning_rate": 0.00014881097719542173,
"loss": 1.259,
"mean_token_accuracy": 0.7015478014945984,
"num_tokens": 9309789.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.34552860260009766,
"learning_rate": 0.000148298588301131,
"loss": 1.2738,
"mean_token_accuracy": 0.7004240155220032,
"num_tokens": 9357260.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.3504265546798706,
"learning_rate": 0.0001477845401891867,
"loss": 1.2694,
"mean_token_accuracy": 0.6969807744026184,
"num_tokens": 9406608.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.35586681962013245,
"learning_rate": 0.00014726885051885653,
"loss": 1.2553,
"mean_token_accuracy": 0.7009937167167664,
"num_tokens": 9451253.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.34470343589782715,
"learning_rate": 0.00014675153700580124,
"loss": 1.2595,
"mean_token_accuracy": 0.7024118304252625,
"num_tokens": 9497216.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.335822194814682,
"learning_rate": 0.00014623261742146602,
"loss": 1.2525,
"mean_token_accuracy": 0.7015378475189209,
"num_tokens": 9544033.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.3584577441215515,
"learning_rate": 0.00014571210959246988,
"loss": 1.2333,
"mean_token_accuracy": 0.706198513507843,
"num_tokens": 9586333.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.34092119336128235,
"learning_rate": 0.00014519003139999337,
"loss": 1.2542,
"mean_token_accuracy": 0.7034091353416443,
"num_tokens": 9634298.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.35801050066947937,
"learning_rate": 0.0001446664007791644,
"loss": 1.2988,
"mean_token_accuracy": 0.6928357481956482,
"num_tokens": 9682141.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.3394937515258789,
"learning_rate": 0.00014414123571844178,
"loss": 1.2624,
"mean_token_accuracy": 0.7046942710876465,
"num_tokens": 9731222.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.35818547010421753,
"learning_rate": 0.00014361455425899756,
"loss": 1.2537,
"mean_token_accuracy": 0.7017344832420349,
"num_tokens": 9778851.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.369809627532959,
"learning_rate": 0.00014308637449409706,
"loss": 1.2001,
"mean_token_accuracy": 0.7117389440536499,
"num_tokens": 9822556.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.3590123653411865,
"learning_rate": 0.00014255671456847748,
"loss": 1.2923,
"mean_token_accuracy": 0.6946203708648682,
"num_tokens": 9870151.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.3501306176185608,
"learning_rate": 0.00014202559267772444,
"loss": 1.2468,
"mean_token_accuracy": 0.701853334903717,
"num_tokens": 9916833.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.3504582643508911,
"learning_rate": 0.00014149302706764697,
"loss": 1.279,
"mean_token_accuracy": 0.6964161396026611,
"num_tokens": 9965727.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.3543940782546997,
"learning_rate": 0.00014095903603365066,
"loss": 1.2258,
"mean_token_accuracy": 0.704728364944458,
"num_tokens": 10009527.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.3418155014514923,
"learning_rate": 0.0001404236379201091,
"loss": 1.2177,
"mean_token_accuracy": 0.7080258727073669,
"num_tokens": 10055667.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.34693628549575806,
"learning_rate": 0.00013988685111973384,
"loss": 1.254,
"mean_token_accuracy": 0.7021883726119995,
"num_tokens": 10104077.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.3545077443122864,
"learning_rate": 0.00013934869407294245,
"loss": 1.3069,
"mean_token_accuracy": 0.6918914318084717,
"num_tokens": 10152374.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.3604845702648163,
"learning_rate": 0.00013880918526722497,
"loss": 1.2708,
"mean_token_accuracy": 0.6986167430877686,
"num_tokens": 10198416.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.34998974204063416,
"learning_rate": 0.000138268343236509,
"loss": 1.2194,
"mean_token_accuracy": 0.7079833745956421,
"num_tokens": 10243724.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.3521496057510376,
"learning_rate": 0.0001377261865605227,
"loss": 1.2717,
"mean_token_accuracy": 0.6980299949645996,
"num_tokens": 10290286.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.3567959666252136,
"learning_rate": 0.0001371827338641568,
"loss": 1.2435,
"mean_token_accuracy": 0.7042776942253113,
"num_tokens": 10335000.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.3671683371067047,
"learning_rate": 0.00013663800381682464,
"loss": 1.2715,
"mean_token_accuracy": 0.6983711123466492,
"num_tokens": 10381661.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.3411732614040375,
"learning_rate": 0.00013609201513182075,
"loss": 1.2401,
"mean_token_accuracy": 0.7075390815734863,
"num_tokens": 10427314.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.3450396656990051,
"learning_rate": 0.00013554478656567818,
"loss": 1.2947,
"mean_token_accuracy": 0.6972159147262573,
"num_tokens": 10476119.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.3609869182109833,
"learning_rate": 0.0001349963369175239,
"loss": 1.2503,
"mean_token_accuracy": 0.7017799615859985,
"num_tokens": 10521408.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.3500053584575653,
"learning_rate": 0.0001344466850284333,
"loss": 1.2872,
"mean_token_accuracy": 0.6957990527153015,
"num_tokens": 10569128.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.3592340052127838,
"learning_rate": 0.00013389584978078258,
"loss": 1.2613,
"mean_token_accuracy": 0.7002545595169067,
"num_tokens": 10615151.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.35870033502578735,
"learning_rate": 0.00013334385009760032,
"loss": 1.2487,
"mean_token_accuracy": 0.7038562893867493,
"num_tokens": 10659636.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.3581511676311493,
"learning_rate": 0.00013279070494191737,
"loss": 1.2662,
"mean_token_accuracy": 0.7002348303794861,
"num_tokens": 10703988.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.3540744185447693,
"learning_rate": 0.00013223643331611537,
"loss": 1.2613,
"mean_token_accuracy": 0.7001772522926331,
"num_tokens": 10750306.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.37011268734931946,
"learning_rate": 0.000131681054261274,
"loss": 1.2902,
"mean_token_accuracy": 0.697233259677887,
"num_tokens": 10795550.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.3456755578517914,
"learning_rate": 0.00013112458685651668,
"loss": 1.3182,
"mean_token_accuracy": 0.6913251876831055,
"num_tokens": 10845252.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.34918084740638733,
"learning_rate": 0.00013056705021835546,
"loss": 1.2464,
"mean_token_accuracy": 0.7025464773178101,
"num_tokens": 10892204.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.3588140606880188,
"learning_rate": 0.0001300084635000341,
"loss": 1.3022,
"mean_token_accuracy": 0.6909407377243042,
"num_tokens": 10938188.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.35461536049842834,
"learning_rate": 0.00012944884589086993,
"loss": 1.3174,
"mean_token_accuracy": 0.6889122128486633,
"num_tokens": 10986801.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.3585621416568756,
"learning_rate": 0.00012888821661559508,
"loss": 1.2524,
"mean_token_accuracy": 0.7034770846366882,
"num_tokens": 11033772.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.3551687002182007,
"learning_rate": 0.00012832659493369557,
"loss": 1.0758,
"mean_token_accuracy": 0.739671528339386,
"num_tokens": 11079559.0,
"step": 237
},
{
"epoch": 3.0126582278481013,
"grad_norm": 0.4075370728969574,
"learning_rate": 0.00012776400013875006,
"loss": 1.032,
"mean_token_accuracy": 0.7526733875274658,
"num_tokens": 11127596.0,
"step": 238
},
{
"epoch": 3.0253164556962027,
"grad_norm": 0.3849814832210541,
"learning_rate": 0.0001272004515577668,
"loss": 1.004,
"mean_token_accuracy": 0.7555179595947266,
"num_tokens": 11172559.0,
"step": 239
},
{
"epoch": 3.037974683544304,
"grad_norm": 0.4353029131889343,
"learning_rate": 0.0001266359685505198,
"loss": 0.99,
"mean_token_accuracy": 0.7563720345497131,
"num_tokens": 11218566.0,
"step": 240
},
{
"epoch": 3.050632911392405,
"grad_norm": 0.600694477558136,
"learning_rate": 0.0001260705705088837,
"loss": 0.9818,
"mean_token_accuracy": 0.7581696510314941,
"num_tokens": 11268632.0,
"step": 241
},
{
"epoch": 3.0632911392405062,
"grad_norm": 0.5432077050209045,
"learning_rate": 0.00012550427685616765,
"loss": 1.0269,
"mean_token_accuracy": 0.7526742219924927,
"num_tokens": 11315719.0,
"step": 242
},
{
"epoch": 3.0759493670886076,
"grad_norm": 0.4427173435688019,
"learning_rate": 0.00012493710704644805,
"loss": 0.9989,
"mean_token_accuracy": 0.75676429271698,
"num_tokens": 11362573.0,
"step": 243
},
{
"epoch": 3.088607594936709,
"grad_norm": 0.3981163501739502,
"learning_rate": 0.0001243690805639002,
"loss": 0.9723,
"mean_token_accuracy": 0.7642591595649719,
"num_tokens": 11408853.0,
"step": 244
},
{
"epoch": 3.1012658227848102,
"grad_norm": 0.3880089223384857,
"learning_rate": 0.00012380021692212894,
"loss": 0.9801,
"mean_token_accuracy": 0.7625755667686462,
"num_tokens": 11455555.0,
"step": 245
},
{
"epoch": 3.1139240506329116,
"grad_norm": 0.38175487518310547,
"learning_rate": 0.00012323053566349834,
"loss": 0.9998,
"mean_token_accuracy": 0.7584809064865112,
"num_tokens": 11503963.0,
"step": 246
},
{
"epoch": 3.1265822784810124,
"grad_norm": 0.39173728227615356,
"learning_rate": 0.00012266005635846037,
"loss": 0.9341,
"mean_token_accuracy": 0.7685783505439758,
"num_tokens": 11549537.0,
"step": 247
},
{
"epoch": 3.1392405063291138,
"grad_norm": 0.435289591550827,
"learning_rate": 0.0001220887986048825,
"loss": 0.948,
"mean_token_accuracy": 0.7657555341720581,
"num_tokens": 11595442.0,
"step": 248
},
{
"epoch": 3.151898734177215,
"grad_norm": 0.480478972196579,
"learning_rate": 0.00012151678202737456,
"loss": 0.9671,
"mean_token_accuracy": 0.7640275955200195,
"num_tokens": 11638867.0,
"step": 249
},
{
"epoch": 3.1645569620253164,
"grad_norm": 0.5007439851760864,
"learning_rate": 0.00012094402627661447,
"loss": 0.9631,
"mean_token_accuracy": 0.7621972560882568,
"num_tokens": 11684515.0,
"step": 250
},
{
"epoch": 3.1772151898734178,
"grad_norm": 0.4938323497772217,
"learning_rate": 0.00012037055102867321,
"loss": 0.9863,
"mean_token_accuracy": 0.7565716505050659,
"num_tokens": 11731295.0,
"step": 251
},
{
"epoch": 3.189873417721519,
"grad_norm": 0.46317818760871887,
"learning_rate": 0.00011979637598433899,
"loss": 0.9599,
"mean_token_accuracy": 0.7661996483802795,
"num_tokens": 11775897.0,
"step": 252
},
{
"epoch": 3.2025316455696204,
"grad_norm": 0.4412788152694702,
"learning_rate": 0.00011922152086844023,
"loss": 0.9711,
"mean_token_accuracy": 0.7613348364830017,
"num_tokens": 11821749.0,
"step": 253
},
{
"epoch": 3.2151898734177213,
"grad_norm": 0.4221232235431671,
"learning_rate": 0.00011864600542916813,
"loss": 0.9382,
"mean_token_accuracy": 0.7676687240600586,
"num_tokens": 11868449.0,
"step": 254
},
{
"epoch": 3.2278481012658227,
"grad_norm": 0.4161496162414551,
"learning_rate": 0.00011806984943739821,
"loss": 0.9391,
"mean_token_accuracy": 0.7664811015129089,
"num_tokens": 11915036.0,
"step": 255
},
{
"epoch": 3.240506329113924,
"grad_norm": 0.40381163358688354,
"learning_rate": 0.00011749307268601111,
"loss": 1.0414,
"mean_token_accuracy": 0.7476540207862854,
"num_tokens": 11965079.0,
"step": 256
},
{
"epoch": 3.2531645569620253,
"grad_norm": 0.41820257902145386,
"learning_rate": 0.00011691569498921264,
"loss": 0.9629,
"mean_token_accuracy": 0.7615616917610168,
"num_tokens": 12011784.0,
"step": 257
},
{
"epoch": 3.2658227848101267,
"grad_norm": 0.44741806387901306,
"learning_rate": 0.00011633773618185302,
"loss": 0.977,
"mean_token_accuracy": 0.7589461207389832,
"num_tokens": 12058153.0,
"step": 258
},
{
"epoch": 3.278481012658228,
"grad_norm": 0.4427592158317566,
"learning_rate": 0.00011575921611874565,
"loss": 0.9571,
"mean_token_accuracy": 0.7660679221153259,
"num_tokens": 12104427.0,
"step": 259
},
{
"epoch": 3.291139240506329,
"grad_norm": 0.4691466987133026,
"learning_rate": 0.00011518015467398489,
"loss": 0.9336,
"mean_token_accuracy": 0.7664586901664734,
"num_tokens": 12149528.0,
"step": 260
},
{
"epoch": 3.3037974683544302,
"grad_norm": 0.47362270951271057,
"learning_rate": 0.00011460057174026335,
"loss": 0.9858,
"mean_token_accuracy": 0.7595200538635254,
"num_tokens": 12196598.0,
"step": 261
},
{
"epoch": 3.3164556962025316,
"grad_norm": 0.46093323826789856,
"learning_rate": 0.0001140204872281886,
"loss": 0.9882,
"mean_token_accuracy": 0.7542067766189575,
"num_tokens": 12245036.0,
"step": 262
},
{
"epoch": 3.329113924050633,
"grad_norm": 0.43514880537986755,
"learning_rate": 0.00011343992106559898,
"loss": 1.0037,
"mean_token_accuracy": 0.7565442323684692,
"num_tokens": 12294189.0,
"step": 263
},
{
"epoch": 3.3417721518987342,
"grad_norm": 0.4213711619377136,
"learning_rate": 0.00011285889319687923,
"loss": 0.9712,
"mean_token_accuracy": 0.7629369497299194,
"num_tokens": 12343569.0,
"step": 264
},
{
"epoch": 3.3544303797468356,
"grad_norm": 0.42522549629211426,
"learning_rate": 0.00011227742358227522,
"loss": 0.9892,
"mean_token_accuracy": 0.7599421143531799,
"num_tokens": 12392717.0,
"step": 265
},
{
"epoch": 3.367088607594937,
"grad_norm": 0.43775442242622375,
"learning_rate": 0.00011169553219720828,
"loss": 0.9598,
"mean_token_accuracy": 0.7645099759101868,
"num_tokens": 12437216.0,
"step": 266
},
{
"epoch": 3.379746835443038,
"grad_norm": 0.45032966136932373,
"learning_rate": 0.00011111323903158885,
"loss": 0.988,
"mean_token_accuracy": 0.7559954524040222,
"num_tokens": 12484566.0,
"step": 267
},
{
"epoch": 3.392405063291139,
"grad_norm": 0.4129181206226349,
"learning_rate": 0.00011053056408913001,
"loss": 0.9857,
"mean_token_accuracy": 0.758560299873352,
"num_tokens": 12534891.0,
"step": 268
},
{
"epoch": 3.4050632911392404,
"grad_norm": 0.4736068546772003,
"learning_rate": 0.0001099475273866601,
"loss": 0.9717,
"mean_token_accuracy": 0.7591570615768433,
"num_tokens": 12579893.0,
"step": 269
},
{
"epoch": 3.4177215189873418,
"grad_norm": 0.4686090350151062,
"learning_rate": 0.0001093641489534351,
"loss": 0.9763,
"mean_token_accuracy": 0.7623862028121948,
"num_tokens": 12625552.0,
"step": 270
},
{
"epoch": 3.430379746835443,
"grad_norm": 0.44861164689064026,
"learning_rate": 0.0001087804488304506,
"loss": 0.9643,
"mean_token_accuracy": 0.7631211876869202,
"num_tokens": 12671496.0,
"step": 271
},
{
"epoch": 3.4430379746835444,
"grad_norm": 0.45744118094444275,
"learning_rate": 0.00010819644706975332,
"loss": 0.9521,
"mean_token_accuracy": 0.7642855644226074,
"num_tokens": 12716763.0,
"step": 272
},
{
"epoch": 3.4556962025316453,
"grad_norm": 0.48478421568870544,
"learning_rate": 0.00010761216373375221,
"loss": 0.9767,
"mean_token_accuracy": 0.7615178823471069,
"num_tokens": 12760151.0,
"step": 273
},
{
"epoch": 3.4683544303797467,
"grad_norm": 0.4677796959877014,
"learning_rate": 0.0001070276188945293,
"loss": 0.9978,
"mean_token_accuracy": 0.7565178871154785,
"num_tokens": 12805130.0,
"step": 274
},
{
"epoch": 3.481012658227848,
"grad_norm": 0.4537658095359802,
"learning_rate": 0.00010644283263315014,
"loss": 0.9788,
"mean_token_accuracy": 0.7601967453956604,
"num_tokens": 12851949.0,
"step": 275
},
{
"epoch": 3.4936708860759493,
"grad_norm": 0.4506645202636719,
"learning_rate": 0.00010585782503897388,
"loss": 0.9727,
"mean_token_accuracy": 0.7614617347717285,
"num_tokens": 12898123.0,
"step": 276
},
{
"epoch": 3.5063291139240507,
"grad_norm": 0.42953184247016907,
"learning_rate": 0.00010527261620896323,
"loss": 0.9731,
"mean_token_accuracy": 0.7647458910942078,
"num_tokens": 12945268.0,
"step": 277
},
{
"epoch": 3.518987341772152,
"grad_norm": 0.4598475396633148,
"learning_rate": 0.00010468722624699401,
"loss": 1.0024,
"mean_token_accuracy": 0.7568365931510925,
"num_tokens": 12991371.0,
"step": 278
},
{
"epoch": 3.5316455696202533,
"grad_norm": 0.44531142711639404,
"learning_rate": 0.00010410167526316457,
"loss": 0.9627,
"mean_token_accuracy": 0.7636065483093262,
"num_tokens": 13039004.0,
"step": 279
},
{
"epoch": 3.5443037974683547,
"grad_norm": 0.4507937729358673,
"learning_rate": 0.00010351598337310482,
"loss": 0.9912,
"mean_token_accuracy": 0.7541834115982056,
"num_tokens": 13085920.0,
"step": 280
},
{
"epoch": 3.5569620253164556,
"grad_norm": 0.4690151512622833,
"learning_rate": 0.00010293017069728535,
"loss": 1.0278,
"mean_token_accuracy": 0.7486876845359802,
"num_tokens": 13133610.0,
"step": 281
},
{
"epoch": 3.569620253164557,
"grad_norm": 0.4618782103061676,
"learning_rate": 0.00010234425736032607,
"loss": 0.9648,
"mean_token_accuracy": 0.7642068862915039,
"num_tokens": 13178353.0,
"step": 282
},
{
"epoch": 3.5822784810126582,
"grad_norm": 0.45085033774375916,
"learning_rate": 0.00010175826349030496,
"loss": 1.0038,
"mean_token_accuracy": 0.7567628026008606,
"num_tokens": 13227509.0,
"step": 283
},
{
"epoch": 3.5949367088607596,
"grad_norm": 0.44593507051467896,
"learning_rate": 0.00010117220921806664,
"loss": 0.9988,
"mean_token_accuracy": 0.752589225769043,
"num_tokens": 13276140.0,
"step": 284
},
{
"epoch": 3.607594936708861,
"grad_norm": 0.448966383934021,
"learning_rate": 0.00010058611467653066,
"loss": 0.9782,
"mean_token_accuracy": 0.7603657841682434,
"num_tokens": 13322896.0,
"step": 285
},
{
"epoch": 3.620253164556962,
"grad_norm": 0.43764910101890564,
"learning_rate": 0.0001,
"loss": 0.9499,
"mean_token_accuracy": 0.7665926218032837,
"num_tokens": 13369788.0,
"step": 286
},
{
"epoch": 3.632911392405063,
"grad_norm": 0.46153128147125244,
"learning_rate": 9.941388532346934e-05,
"loss": 0.9586,
"mean_token_accuracy": 0.7638452053070068,
"num_tokens": 13414073.0,
"step": 287
},
{
"epoch": 3.6455696202531644,
"grad_norm": 0.44592994451522827,
"learning_rate": 9.882779078193339e-05,
"loss": 0.9965,
"mean_token_accuracy": 0.7588433027267456,
"num_tokens": 13462931.0,
"step": 288
},
{
"epoch": 3.6582278481012658,
"grad_norm": 0.4681696593761444,
"learning_rate": 9.824173650969507e-05,
"loss": 0.9741,
"mean_token_accuracy": 0.7605555057525635,
"num_tokens": 13509369.0,
"step": 289
},
{
"epoch": 3.670886075949367,
"grad_norm": 0.46631893515586853,
"learning_rate": 9.765574263967396e-05,
"loss": 0.9998,
"mean_token_accuracy": 0.7567450404167175,
"num_tokens": 13553206.0,
"step": 290
},
{
"epoch": 3.6835443037974684,
"grad_norm": 0.44251787662506104,
"learning_rate": 9.706982930271465e-05,
"loss": 0.9894,
"mean_token_accuracy": 0.7563201785087585,
"num_tokens": 13601370.0,
"step": 291
},
{
"epoch": 3.6962025316455698,
"grad_norm": 0.4594095051288605,
"learning_rate": 9.648401662689521e-05,
"loss": 0.9922,
"mean_token_accuracy": 0.7575803995132446,
"num_tokens": 13647210.0,
"step": 292
},
{
"epoch": 3.708860759493671,
"grad_norm": 0.4474162757396698,
"learning_rate": 9.589832473683547e-05,
"loss": 0.9915,
"mean_token_accuracy": 0.7562800049781799,
"num_tokens": 13694726.0,
"step": 293
},
{
"epoch": 3.721518987341772,
"grad_norm": 0.4731695353984833,
"learning_rate": 9.531277375300599e-05,
"loss": 0.9804,
"mean_token_accuracy": 0.758215606212616,
"num_tokens": 13737605.0,
"step": 294
},
{
"epoch": 3.7341772151898733,
"grad_norm": 0.4519980847835541,
"learning_rate": 9.472738379103682e-05,
"loss": 1.004,
"mean_token_accuracy": 0.7548936605453491,
"num_tokens": 13784873.0,
"step": 295
},
{
"epoch": 3.7468354430379747,
"grad_norm": 0.45873039960861206,
"learning_rate": 9.414217496102614e-05,
"loss": 0.9526,
"mean_token_accuracy": 0.7641096711158752,
"num_tokens": 13831802.0,
"step": 296
},
{
"epoch": 3.759493670886076,
"grad_norm": 0.46528834104537964,
"learning_rate": 9.355716736684988e-05,
"loss": 0.9592,
"mean_token_accuracy": 0.7640624642372131,
"num_tokens": 13878035.0,
"step": 297
},
{
"epoch": 3.7721518987341773,
"grad_norm": 0.45268163084983826,
"learning_rate": 9.297238110547074e-05,
"loss": 1.0181,
"mean_token_accuracy": 0.7509171366691589,
"num_tokens": 13927436.0,
"step": 298
},
{
"epoch": 3.7848101265822782,
"grad_norm": 0.4594506323337555,
"learning_rate": 9.238783626624781e-05,
"loss": 0.9415,
"mean_token_accuracy": 0.7657912373542786,
"num_tokens": 13972430.0,
"step": 299
},
{
"epoch": 3.7974683544303796,
"grad_norm": 0.46437937021255493,
"learning_rate": 9.180355293024669e-05,
"loss": 0.9485,
"mean_token_accuracy": 0.766374945640564,
"num_tokens": 14019227.0,
"step": 300
},
{
"epoch": 3.810126582278481,
"grad_norm": 0.4636267125606537,
"learning_rate": 9.121955116954942e-05,
"loss": 0.9802,
"mean_token_accuracy": 0.7597395181655884,
"num_tokens": 14064750.0,
"step": 301
},
{
"epoch": 3.8227848101265822,
"grad_norm": 0.48009157180786133,
"learning_rate": 9.063585104656493e-05,
"loss": 0.9248,
"mean_token_accuracy": 0.7727100253105164,
"num_tokens": 14109629.0,
"step": 302
},
{
"epoch": 3.8354430379746836,
"grad_norm": 0.46061643958091736,
"learning_rate": 9.005247261333993e-05,
"loss": 0.9856,
"mean_token_accuracy": 0.7584598660469055,
"num_tokens": 14157714.0,
"step": 303
},
{
"epoch": 3.848101265822785,
"grad_norm": 0.46670177578926086,
"learning_rate": 8.946943591087e-05,
"loss": 1.0039,
"mean_token_accuracy": 0.7559428811073303,
"num_tokens": 14202874.0,
"step": 304
},
{
"epoch": 3.8607594936708862,
"grad_norm": 0.4689050018787384,
"learning_rate": 8.88867609684112e-05,
"loss": 0.9811,
"mean_token_accuracy": 0.7581244707107544,
"num_tokens": 14247064.0,
"step": 305
},
{
"epoch": 3.8734177215189876,
"grad_norm": 0.44281500577926636,
"learning_rate": 8.830446780279176e-05,
"loss": 0.9928,
"mean_token_accuracy": 0.7555981874465942,
"num_tokens": 14296653.0,
"step": 306
},
{
"epoch": 3.8860759493670884,
"grad_norm": 0.45278170704841614,
"learning_rate": 8.772257641772479e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.7612497806549072,
"num_tokens": 14342518.0,
"step": 307
},
{
"epoch": 3.8987341772151898,
"grad_norm": 0.4528560936450958,
"learning_rate": 8.71411068031208e-05,
"loss": 0.9495,
"mean_token_accuracy": 0.7653767466545105,
"num_tokens": 14389406.0,
"step": 308
},
{
"epoch": 3.911392405063291,
"grad_norm": 0.4473622143268585,
"learning_rate": 8.656007893440106e-05,
"loss": 0.9523,
"mean_token_accuracy": 0.7669484615325928,
"num_tokens": 14437734.0,
"step": 309
},
{
"epoch": 3.9240506329113924,
"grad_norm": 0.4741891324520111,
"learning_rate": 8.597951277181142e-05,
"loss": 1.003,
"mean_token_accuracy": 0.7522197961807251,
"num_tokens": 14485437.0,
"step": 310
},
{
"epoch": 3.9367088607594938,
"grad_norm": 0.4523335099220276,
"learning_rate": 8.539942825973666e-05,
"loss": 0.9808,
"mean_token_accuracy": 0.7603780031204224,
"num_tokens": 14534282.0,
"step": 311
},
{
"epoch": 3.9493670886075947,
"grad_norm": 0.469784677028656,
"learning_rate": 8.481984532601515e-05,
"loss": 0.9904,
"mean_token_accuracy": 0.7573358416557312,
"num_tokens": 14580319.0,
"step": 312
},
{
"epoch": 3.962025316455696,
"grad_norm": 0.47262197732925415,
"learning_rate": 8.424078388125436e-05,
"loss": 0.9906,
"mean_token_accuracy": 0.7568280696868896,
"num_tokens": 14628896.0,
"step": 313
},
{
"epoch": 3.9746835443037973,
"grad_norm": 0.47215375304222107,
"learning_rate": 8.366226381814697e-05,
"loss": 1.0217,
"mean_token_accuracy": 0.7515872716903687,
"num_tokens": 14677943.0,
"step": 314
},
{
"epoch": 3.9873417721518987,
"grad_norm": 0.4638935625553131,
"learning_rate": 8.308430501078739e-05,
"loss": 1.0244,
"mean_token_accuracy": 0.7499192953109741,
"num_tokens": 14727559.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.43590956926345825,
"learning_rate": 8.25069273139889e-05,
"loss": 0.8203,
"mean_token_accuracy": 0.7978315949440002,
"num_tokens": 14774109.0,
"step": 316
},
{
"epoch": 4.012658227848101,
"grad_norm": 0.4966140389442444,
"learning_rate": 8.19301505626018e-05,
"loss": 0.7698,
"mean_token_accuracy": 0.8127477765083313,
"num_tokens": 14821852.0,
"step": 317
},
{
"epoch": 4.025316455696203,
"grad_norm": 0.48176905512809753,
"learning_rate": 8.13539945708319e-05,
"loss": 0.7578,
"mean_token_accuracy": 0.8137043118476868,
"num_tokens": 14867274.0,
"step": 318
},
{
"epoch": 4.037974683544304,
"grad_norm": 0.49787062406539917,
"learning_rate": 8.07784791315598e-05,
"loss": 0.7138,
"mean_token_accuracy": 0.8246570229530334,
"num_tokens": 14913037.0,
"step": 319
},
{
"epoch": 4.050632911392405,
"grad_norm": 0.6012403964996338,
"learning_rate": 8.020362401566103e-05,
"loss": 0.7109,
"mean_token_accuracy": 0.8215330839157104,
"num_tokens": 14959569.0,
"step": 320
},
{
"epoch": 4.063291139240507,
"grad_norm": 0.7662049531936646,
"learning_rate": 7.962944897132678e-05,
"loss": 0.7184,
"mean_token_accuracy": 0.8202931880950928,
"num_tokens": 15006565.0,
"step": 321
},
{
"epoch": 4.075949367088608,
"grad_norm": 0.707722008228302,
"learning_rate": 7.905597372338558e-05,
"loss": 0.7138,
"mean_token_accuracy": 0.8212239146232605,
"num_tokens": 15053218.0,
"step": 322
},
{
"epoch": 4.0886075949367084,
"grad_norm": 0.5710378289222717,
"learning_rate": 7.848321797262548e-05,
"loss": 0.6948,
"mean_token_accuracy": 0.8260384202003479,
"num_tokens": 15101626.0,
"step": 323
},
{
"epoch": 4.10126582278481,
"grad_norm": 0.536343514919281,
"learning_rate": 7.791120139511752e-05,
"loss": 0.7012,
"mean_token_accuracy": 0.8271479606628418,
"num_tokens": 15147012.0,
"step": 324
},
{
"epoch": 4.113924050632911,
"grad_norm": 0.5122034549713135,
"learning_rate": 7.733994364153969e-05,
"loss": 0.7082,
"mean_token_accuracy": 0.8272866010665894,
"num_tokens": 15192996.0,
"step": 325
},
{
"epoch": 4.1265822784810124,
"grad_norm": 0.49738800525665283,
"learning_rate": 7.67694643365017e-05,
"loss": 0.7172,
"mean_token_accuracy": 0.8232470750808716,
"num_tokens": 15238270.0,
"step": 326
},
{
"epoch": 4.139240506329114,
"grad_norm": 0.5137494206428528,
"learning_rate": 7.619978307787108e-05,
"loss": 0.6974,
"mean_token_accuracy": 0.8292660713195801,
"num_tokens": 15281770.0,
"step": 327
},
{
"epoch": 4.151898734177215,
"grad_norm": 0.5142786502838135,
"learning_rate": 7.563091943609984e-05,
"loss": 0.7247,
"mean_token_accuracy": 0.8209677934646606,
"num_tokens": 15328105.0,
"step": 328
},
{
"epoch": 4.1645569620253164,
"grad_norm": 0.5584180951118469,
"learning_rate": 7.506289295355198e-05,
"loss": 0.709,
"mean_token_accuracy": 0.8250913619995117,
"num_tokens": 15374679.0,
"step": 329
},
{
"epoch": 4.177215189873418,
"grad_norm": 0.5827005505561829,
"learning_rate": 7.449572314383237e-05,
"loss": 0.7321,
"mean_token_accuracy": 0.8182151317596436,
"num_tokens": 15421166.0,
"step": 330
},
{
"epoch": 4.189873417721519,
"grad_norm": 0.6163628101348877,
"learning_rate": 7.392942949111633e-05,
"loss": 0.7458,
"mean_token_accuracy": 0.8168110847473145,
"num_tokens": 15469246.0,
"step": 331
},
{
"epoch": 4.2025316455696204,
"grad_norm": 0.5932377576828003,
"learning_rate": 7.336403144948022e-05,
"loss": 0.7449,
"mean_token_accuracy": 0.8152413368225098,
"num_tokens": 15516117.0,
"step": 332
},
{
"epoch": 4.215189873417722,
"grad_norm": 0.5681145787239075,
"learning_rate": 7.279954844223323e-05,
"loss": 0.7052,
"mean_token_accuracy": 0.8263698816299438,
"num_tokens": 15562590.0,
"step": 333
},
{
"epoch": 4.227848101265823,
"grad_norm": 0.5275646448135376,
"learning_rate": 7.223599986124994e-05,
"loss": 0.7144,
"mean_token_accuracy": 0.8233181238174438,
"num_tokens": 15611380.0,
"step": 334
},
{
"epoch": 4.2405063291139244,
"grad_norm": 0.549479067325592,
"learning_rate": 7.167340506630445e-05,
"loss": 0.6902,
"mean_token_accuracy": 0.8262238502502441,
"num_tokens": 15656853.0,
"step": 335
},
{
"epoch": 4.253164556962025,
"grad_norm": 0.5401619672775269,
"learning_rate": 7.111178338440496e-05,
"loss": 0.6795,
"mean_token_accuracy": 0.8296888470649719,
"num_tokens": 15702968.0,
"step": 336
},
{
"epoch": 4.265822784810126,
"grad_norm": 0.5113623738288879,
"learning_rate": 7.055115410913009e-05,
"loss": 0.6953,
"mean_token_accuracy": 0.8251818418502808,
"num_tokens": 15748811.0,
"step": 337
},
{
"epoch": 4.2784810126582276,
"grad_norm": 0.5283024311065674,
"learning_rate": 6.999153649996595e-05,
"loss": 0.7128,
"mean_token_accuracy": 0.8234080672264099,
"num_tokens": 15796380.0,
"step": 338
},
{
"epoch": 4.291139240506329,
"grad_norm": 0.5316226482391357,
"learning_rate": 6.943294978164454e-05,
"loss": 0.6752,
"mean_token_accuracy": 0.8321078419685364,
"num_tokens": 15842956.0,
"step": 339
},
{
"epoch": 4.30379746835443,
"grad_norm": 0.5778771638870239,
"learning_rate": 6.887541314348333e-05,
"loss": 0.7031,
"mean_token_accuracy": 0.8234809637069702,
"num_tokens": 15889134.0,
"step": 340
},
{
"epoch": 4.3164556962025316,
"grad_norm": 0.5819162130355835,
"learning_rate": 6.831894573872601e-05,
"loss": 0.7429,
"mean_token_accuracy": 0.8154833912849426,
"num_tokens": 15936229.0,
"step": 341
},
{
"epoch": 4.329113924050633,
"grad_norm": 0.5713794827461243,
"learning_rate": 6.776356668388464e-05,
"loss": 0.7124,
"mean_token_accuracy": 0.8215630650520325,
"num_tokens": 15981973.0,
"step": 342
},
{
"epoch": 4.341772151898734,
"grad_norm": 0.5627953410148621,
"learning_rate": 6.720929505808265e-05,
"loss": 0.7298,
"mean_token_accuracy": 0.8181149959564209,
"num_tokens": 16031035.0,
"step": 343
},
{
"epoch": 4.3544303797468356,
"grad_norm": 0.5609976053237915,
"learning_rate": 6.665614990239969e-05,
"loss": 0.6939,
"mean_token_accuracy": 0.828144371509552,
"num_tokens": 16077929.0,
"step": 344
},
{
"epoch": 4.367088607594937,
"grad_norm": 0.5497515797615051,
"learning_rate": 6.610415021921747e-05,
"loss": 0.7098,
"mean_token_accuracy": 0.8211853504180908,
"num_tokens": 16124544.0,
"step": 345
},
{
"epoch": 4.379746835443038,
"grad_norm": 0.5421944260597229,
"learning_rate": 6.555331497156672e-05,
"loss": 0.6964,
"mean_token_accuracy": 0.8250083923339844,
"num_tokens": 16172376.0,
"step": 346
},
{
"epoch": 4.3924050632911396,
"grad_norm": 0.535250723361969,
"learning_rate": 6.50036630824761e-05,
"loss": 0.6991,
"mean_token_accuracy": 0.8260812163352966,
"num_tokens": 16217829.0,
"step": 347
},
{
"epoch": 4.405063291139241,
"grad_norm": 0.5412235260009766,
"learning_rate": 6.445521343432188e-05,
"loss": 0.7066,
"mean_token_accuracy": 0.8224402666091919,
"num_tokens": 16263962.0,
"step": 348
},
{
"epoch": 4.417721518987342,
"grad_norm": 0.5575072169303894,
"learning_rate": 6.390798486817929e-05,
"loss": 0.705,
"mean_token_accuracy": 0.8242610096931458,
"num_tokens": 16308410.0,
"step": 349
},
{
"epoch": 4.430379746835443,
"grad_norm": 0.5557534098625183,
"learning_rate": 6.336199618317537e-05,
"loss": 0.7195,
"mean_token_accuracy": 0.8202704787254333,
"num_tokens": 16355133.0,
"step": 350
},
{
"epoch": 4.443037974683544,
"grad_norm": 0.5342419743537903,
"learning_rate": 6.281726613584321e-05,
"loss": 0.6991,
"mean_token_accuracy": 0.8249329924583435,
"num_tokens": 16401842.0,
"step": 351
},
{
"epoch": 4.455696202531645,
"grad_norm": 0.5405949950218201,
"learning_rate": 6.227381343947733e-05,
"loss": 0.6922,
"mean_token_accuracy": 0.8285226821899414,
"num_tokens": 16449370.0,
"step": 352
},
{
"epoch": 4.468354430379747,
"grad_norm": 0.552777886390686,
"learning_rate": 6.173165676349103e-05,
"loss": 0.7142,
"mean_token_accuracy": 0.8212454915046692,
"num_tokens": 16497416.0,
"step": 353
},
{
"epoch": 4.481012658227848,
"grad_norm": 0.5529714226722717,
"learning_rate": 6.119081473277501e-05,
"loss": 0.6991,
"mean_token_accuracy": 0.8240037560462952,
"num_tokens": 16544231.0,
"step": 354
},
{
"epoch": 4.493670886075949,
"grad_norm": 0.5485042929649353,
"learning_rate": 6.065130592705759e-05,
"loss": 0.7307,
"mean_token_accuracy": 0.8205800652503967,
"num_tokens": 16592701.0,
"step": 355
},
{
"epoch": 4.506329113924051,
"grad_norm": 0.5457609295845032,
"learning_rate": 6.01131488802662e-05,
"loss": 0.7112,
"mean_token_accuracy": 0.8206736445426941,
"num_tokens": 16639646.0,
"step": 356
},
{
"epoch": 4.518987341772152,
"grad_norm": 0.5910729765892029,
"learning_rate": 5.9576362079890925e-05,
"loss": 0.7012,
"mean_token_accuracy": 0.8259279727935791,
"num_tokens": 16685375.0,
"step": 357
},
{
"epoch": 4.531645569620253,
"grad_norm": 0.5504463911056519,
"learning_rate": 5.904096396634935e-05,
"loss": 0.7073,
"mean_token_accuracy": 0.8246215581893921,
"num_tokens": 16733267.0,
"step": 358
},
{
"epoch": 4.544303797468355,
"grad_norm": 0.5555917024612427,
"learning_rate": 5.8506972932353035e-05,
"loss": 0.6635,
"mean_token_accuracy": 0.8324669599533081,
"num_tokens": 16777961.0,
"step": 359
},
{
"epoch": 4.556962025316456,
"grad_norm": 0.5440343618392944,
"learning_rate": 5.797440732227555e-05,
"loss": 0.7234,
"mean_token_accuracy": 0.8209396004676819,
"num_tokens": 16827472.0,
"step": 360
},
{
"epoch": 4.569620253164557,
"grad_norm": 0.5303831100463867,
"learning_rate": 5.744328543152253e-05,
"loss": 0.662,
"mean_token_accuracy": 0.8331236243247986,
"num_tokens": 16872839.0,
"step": 361
},
{
"epoch": 4.582278481012658,
"grad_norm": 0.563178539276123,
"learning_rate": 5.691362550590297e-05,
"loss": 0.6625,
"mean_token_accuracy": 0.8346900343894958,
"num_tokens": 16915163.0,
"step": 362
},
{
"epoch": 4.594936708860759,
"grad_norm": 0.5247779488563538,
"learning_rate": 5.638544574100249e-05,
"loss": 0.7099,
"mean_token_accuracy": 0.823519766330719,
"num_tokens": 16963986.0,
"step": 363
},
{
"epoch": 4.6075949367088604,
"grad_norm": 0.5180805325508118,
"learning_rate": 5.585876428155824e-05,
"loss": 0.6988,
"mean_token_accuracy": 0.8249117732048035,
"num_tokens": 17012220.0,
"step": 364
},
{
"epoch": 4.620253164556962,
"grad_norm": 0.5352941751480103,
"learning_rate": 5.533359922083562e-05,
"loss": 0.6849,
"mean_token_accuracy": 0.8279665112495422,
"num_tokens": 17058711.0,
"step": 365
},
{
"epoch": 4.632911392405063,
"grad_norm": 0.5777114033699036,
"learning_rate": 5.4809968600006635e-05,
"loss": 0.678,
"mean_token_accuracy": 0.8303003907203674,
"num_tokens": 17102682.0,
"step": 366
},
{
"epoch": 4.6455696202531644,
"grad_norm": 0.5614490509033203,
"learning_rate": 5.4287890407530175e-05,
"loss": 0.7108,
"mean_token_accuracy": 0.8221400380134583,
"num_tokens": 17149530.0,
"step": 367
},
{
"epoch": 4.658227848101266,
"grad_norm": 0.5888735055923462,
"learning_rate": 5.3767382578534e-05,
"loss": 0.6856,
"mean_token_accuracy": 0.828814685344696,
"num_tokens": 17193634.0,
"step": 368
},
{
"epoch": 4.670886075949367,
"grad_norm": 0.5642009377479553,
"learning_rate": 5.324846299419879e-05,
"loss": 0.7221,
"mean_token_accuracy": 0.8182055950164795,
"num_tokens": 17243375.0,
"step": 369
},
{
"epoch": 4.6835443037974684,
"grad_norm": 0.5699864625930786,
"learning_rate": 5.273114948114346e-05,
"loss": 0.6912,
"mean_token_accuracy": 0.8257492780685425,
"num_tokens": 17288116.0,
"step": 370
},
{
"epoch": 4.69620253164557,
"grad_norm": 0.5664955973625183,
"learning_rate": 5.2215459810813306e-05,
"loss": 0.7255,
"mean_token_accuracy": 0.8178353309631348,
"num_tokens": 17335928.0,
"step": 371
},
{
"epoch": 4.708860759493671,
"grad_norm": 0.5631005167961121,
"learning_rate": 5.170141169886904e-05,
"loss": 0.6987,
"mean_token_accuracy": 0.8256130218505859,
"num_tokens": 17382320.0,
"step": 372
},
{
"epoch": 4.7215189873417724,
"grad_norm": 0.5475056767463684,
"learning_rate": 5.118902280457829e-05,
"loss": 0.7383,
"mean_token_accuracy": 0.8166825771331787,
"num_tokens": 17432712.0,
"step": 373
},
{
"epoch": 4.734177215189874,
"grad_norm": 0.5569179654121399,
"learning_rate": 5.0678310730209275e-05,
"loss": 0.7157,
"mean_token_accuracy": 0.8199924230575562,
"num_tokens": 17480174.0,
"step": 374
},
{
"epoch": 4.746835443037975,
"grad_norm": 0.5541711449623108,
"learning_rate": 5.016929302042563e-05,
"loss": 0.6978,
"mean_token_accuracy": 0.826197624206543,
"num_tokens": 17528563.0,
"step": 375
},
{
"epoch": 4.759493670886076,
"grad_norm": 0.5538228750228882,
"learning_rate": 4.9661987161684045e-05,
"loss": 0.693,
"mean_token_accuracy": 0.8276927471160889,
"num_tokens": 17573303.0,
"step": 376
},
{
"epoch": 4.772151898734177,
"grad_norm": 0.5440813899040222,
"learning_rate": 4.9156410581633317e-05,
"loss": 0.699,
"mean_token_accuracy": 0.8246811628341675,
"num_tokens": 17620099.0,
"step": 377
},
{
"epoch": 4.784810126582278,
"grad_norm": 0.5575851202011108,
"learning_rate": 4.865258064851579e-05,
"loss": 0.72,
"mean_token_accuracy": 0.8187082409858704,
"num_tokens": 17666100.0,
"step": 378
},
{
"epoch": 4.7974683544303796,
"grad_norm": 0.5372059941291809,
"learning_rate": 4.8150514670570754e-05,
"loss": 0.7156,
"mean_token_accuracy": 0.8224175572395325,
"num_tokens": 17716107.0,
"step": 379
},
{
"epoch": 4.810126582278481,
"grad_norm": 0.5502781271934509,
"learning_rate": 4.765022989543958e-05,
"loss": 0.6808,
"mean_token_accuracy": 0.8300414085388184,
"num_tokens": 17762547.0,
"step": 380
},
{
"epoch": 4.822784810126582,
"grad_norm": 0.5721256732940674,
"learning_rate": 4.7151743509573444e-05,
"loss": 0.7167,
"mean_token_accuracy": 0.8231954574584961,
"num_tokens": 17808939.0,
"step": 381
},
{
"epoch": 4.8354430379746836,
"grad_norm": 0.557105541229248,
"learning_rate": 4.665507263764299e-05,
"loss": 0.6788,
"mean_token_accuracy": 0.831015944480896,
"num_tokens": 17854457.0,
"step": 382
},
{
"epoch": 4.848101265822785,
"grad_norm": 0.560921311378479,
"learning_rate": 4.6160234341949646e-05,
"loss": 0.7473,
"mean_token_accuracy": 0.8154394030570984,
"num_tokens": 17901958.0,
"step": 383
},
{
"epoch": 4.860759493670886,
"grad_norm": 0.5427091717720032,
"learning_rate": 4.5667245621839974e-05,
"loss": 0.6843,
"mean_token_accuracy": 0.8294286727905273,
"num_tokens": 17949316.0,
"step": 384
},
{
"epoch": 4.8734177215189876,
"grad_norm": 0.54844731092453,
"learning_rate": 4.5176123413121284e-05,
"loss": 0.7267,
"mean_token_accuracy": 0.8211008310317993,
"num_tokens": 17998525.0,
"step": 385
},
{
"epoch": 4.886075949367089,
"grad_norm": 0.5478676557540894,
"learning_rate": 4.468688458748006e-05,
"loss": 0.7032,
"mean_token_accuracy": 0.8235698342323303,
"num_tokens": 18045174.0,
"step": 386
},
{
"epoch": 4.89873417721519,
"grad_norm": 0.5715044140815735,
"learning_rate": 4.4199545951902286e-05,
"loss": 0.7351,
"mean_token_accuracy": 0.8134607076644897,
"num_tokens": 18094745.0,
"step": 387
},
{
"epoch": 4.911392405063291,
"grad_norm": 0.5567689538002014,
"learning_rate": 4.3714124248096067e-05,
"loss": 0.72,
"mean_token_accuracy": 0.8220183253288269,
"num_tokens": 18142769.0,
"step": 388
},
{
"epoch": 4.924050632911392,
"grad_norm": 0.5515459179878235,
"learning_rate": 4.3230636151916495e-05,
"loss": 0.7314,
"mean_token_accuracy": 0.8181837201118469,
"num_tokens": 18190392.0,
"step": 389
},
{
"epoch": 4.936708860759493,
"grad_norm": 0.5599684715270996,
"learning_rate": 4.274909827279283e-05,
"loss": 0.6852,
"mean_token_accuracy": 0.8275984525680542,
"num_tokens": 18238292.0,
"step": 390
},
{
"epoch": 4.949367088607595,
"grad_norm": 0.581655740737915,
"learning_rate": 4.226952715315779e-05,
"loss": 0.6965,
"mean_token_accuracy": 0.8275977969169617,
"num_tokens": 18282932.0,
"step": 391
},
{
"epoch": 4.962025316455696,
"grad_norm": 0.5861680507659912,
"learning_rate": 4.17919392678795e-05,
"loss": 0.6881,
"mean_token_accuracy": 0.8262351155281067,
"num_tokens": 18325542.0,
"step": 392
},
{
"epoch": 4.974683544303797,
"grad_norm": 0.5522813200950623,
"learning_rate": 4.131635102369513e-05,
"loss": 0.7188,
"mean_token_accuracy": 0.8196642398834229,
"num_tokens": 18373317.0,
"step": 393
},
{
"epoch": 4.987341772151899,
"grad_norm": 0.5678694248199463,
"learning_rate": 4.084277875864776e-05,
"loss": 0.7326,
"mean_token_accuracy": 0.8180271983146667,
"num_tokens": 18422185.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.4936027526855469,
"learning_rate": 4.037123874152472e-05,
"loss": 0.5711,
"mean_token_accuracy": 0.8599328398704529,
"num_tokens": 18468998.0,
"step": 395
},
{
"epoch": 5.012658227848101,
"grad_norm": 0.5264456272125244,
"learning_rate": 3.9901747171298766e-05,
"loss": 0.5328,
"mean_token_accuracy": 0.8718881011009216,
"num_tokens": 18514452.0,
"step": 396
},
{
"epoch": 5.025316455696203,
"grad_norm": 0.5222989320755005,
"learning_rate": 3.943432017657186e-05,
"loss": 0.5193,
"mean_token_accuracy": 0.8739416599273682,
"num_tokens": 18561288.0,
"step": 397
},
{
"epoch": 5.037974683544304,
"grad_norm": 0.5219823718070984,
"learning_rate": 3.8968973815020806e-05,
"loss": 0.4756,
"mean_token_accuracy": 0.884689211845398,
"num_tokens": 18607731.0,
"step": 398
},
{
"epoch": 5.050632911392405,
"grad_norm": 0.5559691786766052,
"learning_rate": 3.850572407284569e-05,
"loss": 0.4868,
"mean_token_accuracy": 0.8799352645874023,
"num_tokens": 18650422.0,
"step": 399
},
{
"epoch": 5.063291139240507,
"grad_norm": 0.6586586236953735,
"learning_rate": 3.80445868642208e-05,
"loss": 0.5133,
"mean_token_accuracy": 0.8707754015922546,
"num_tokens": 18694425.0,
"step": 400
},
{
"epoch": 5.075949367088608,
"grad_norm": 0.7043012976646423,
"learning_rate": 3.7585578030747744e-05,
"loss": 0.4937,
"mean_token_accuracy": 0.8765274882316589,
"num_tokens": 18743180.0,
"step": 401
},
{
"epoch": 5.0886075949367084,
"grad_norm": 0.7497896552085876,
"learning_rate": 3.7128713340911535e-05,
"loss": 0.4978,
"mean_token_accuracy": 0.8755159974098206,
"num_tokens": 18792905.0,
"step": 402
},
{
"epoch": 5.10126582278481,
"grad_norm": 0.7151162028312683,
"learning_rate": 3.667400848953845e-05,
"loss": 0.5065,
"mean_token_accuracy": 0.875111997127533,
"num_tokens": 18839835.0,
"step": 403
},
{
"epoch": 5.113924050632911,
"grad_norm": 0.6478233337402344,
"learning_rate": 3.622147909725724e-05,
"loss": 0.4802,
"mean_token_accuracy": 0.8800956010818481,
"num_tokens": 18888029.0,
"step": 404
},
{
"epoch": 5.1265822784810124,
"grad_norm": 0.6064746975898743,
"learning_rate": 3.577114070996247e-05,
"loss": 0.5117,
"mean_token_accuracy": 0.8728470802307129,
"num_tokens": 18933322.0,
"step": 405
},
{
"epoch": 5.139240506329114,
"grad_norm": 0.5626401305198669,
"learning_rate": 3.532300879828013e-05,
"loss": 0.4832,
"mean_token_accuracy": 0.8781822919845581,
"num_tokens": 18980522.0,
"step": 406
},
{
"epoch": 5.151898734177215,
"grad_norm": 0.546474039554596,
"learning_rate": 3.4877098757036665e-05,
"loss": 0.5058,
"mean_token_accuracy": 0.8778883218765259,
"num_tokens": 19028624.0,
"step": 407
},
{
"epoch": 5.1645569620253164,
"grad_norm": 0.5445472002029419,
"learning_rate": 3.44334259047297e-05,
"loss": 0.4888,
"mean_token_accuracy": 0.8800671696662903,
"num_tokens": 19074522.0,
"step": 408
},
{
"epoch": 5.177215189873418,
"grad_norm": 0.531647801399231,
"learning_rate": 3.3992005483002e-05,
"loss": 0.4776,
"mean_token_accuracy": 0.8834218978881836,
"num_tokens": 19122571.0,
"step": 409
},
{
"epoch": 5.189873417721519,
"grad_norm": 0.5426664352416992,
"learning_rate": 3.355285265611784e-05,
"loss": 0.5024,
"mean_token_accuracy": 0.8779997825622559,
"num_tokens": 19171389.0,
"step": 410
},
{
"epoch": 5.2025316455696204,
"grad_norm": 0.5555723905563354,
"learning_rate": 3.3115982510442014e-05,
"loss": 0.5103,
"mean_token_accuracy": 0.8771188855171204,
"num_tokens": 19219296.0,
"step": 411
},
{
"epoch": 5.215189873417722,
"grad_norm": 0.5892623066902161,
"learning_rate": 3.268141005392163e-05,
"loss": 0.4948,
"mean_token_accuracy": 0.8789801597595215,
"num_tokens": 19262386.0,
"step": 412
},
{
"epoch": 5.227848101265823,
"grad_norm": 0.5882421731948853,
"learning_rate": 3.224915021557049e-05,
"loss": 0.4821,
"mean_token_accuracy": 0.8825682401657104,
"num_tokens": 19307259.0,
"step": 413
},
{
"epoch": 5.2405063291139244,
"grad_norm": 0.6074917316436768,
"learning_rate": 3.1819217844956214e-05,
"loss": 0.4925,
"mean_token_accuracy": 0.8789646625518799,
"num_tokens": 19355152.0,
"step": 414
},
{
"epoch": 5.253164556962025,
"grad_norm": 0.6312512159347534,
"learning_rate": 3.1391627711690296e-05,
"loss": 0.4878,
"mean_token_accuracy": 0.8776240944862366,
"num_tokens": 19400470.0,
"step": 415
},
{
"epoch": 5.265822784810126,
"grad_norm": 0.6164311766624451,
"learning_rate": 3.0966394504920317e-05,
"loss": 0.4695,
"mean_token_accuracy": 0.8826056718826294,
"num_tokens": 19446848.0,
"step": 416
},
{
"epoch": 5.2784810126582276,
"grad_norm": 0.6131919026374817,
"learning_rate": 3.0543532832825715e-05,
"loss": 0.4808,
"mean_token_accuracy": 0.8802450299263,
"num_tokens": 19493432.0,
"step": 417
},
{
"epoch": 5.291139240506329,
"grad_norm": 0.6002056002616882,
"learning_rate": 3.0123057222115836e-05,
"loss": 0.4986,
"mean_token_accuracy": 0.8771020174026489,
"num_tokens": 19542496.0,
"step": 418
},
{
"epoch": 5.30379746835443,
"grad_norm": 0.6012871265411377,
"learning_rate": 2.9704982117530777e-05,
"loss": 0.5124,
"mean_token_accuracy": 0.8735976815223694,
"num_tokens": 19590605.0,
"step": 419
},
{
"epoch": 5.3164556962025316,
"grad_norm": 0.5826122164726257,
"learning_rate": 2.9289321881345254e-05,
"loss": 0.4848,
"mean_token_accuracy": 0.8811623454093933,
"num_tokens": 19636816.0,
"step": 420
},
{
"epoch": 5.329113924050633,
"grad_norm": 0.5988377332687378,
"learning_rate": 2.887609079287521e-05,
"loss": 0.4867,
"mean_token_accuracy": 0.8805438280105591,
"num_tokens": 19683441.0,
"step": 421
},
{
"epoch": 5.341772151898734,
"grad_norm": 0.5812557339668274,
"learning_rate": 2.8465303047987267e-05,
"loss": 0.4878,
"mean_token_accuracy": 0.8807899951934814,
"num_tokens": 19731605.0,
"step": 422
},
{
"epoch": 5.3544303797468356,
"grad_norm": 0.5604175329208374,
"learning_rate": 2.805697275861101e-05,
"loss": 0.4961,
"mean_token_accuracy": 0.8778889179229736,
"num_tokens": 19780346.0,
"step": 423
},
{
"epoch": 5.367088607594937,
"grad_norm": 0.5724864602088928,
"learning_rate": 2.765111395225424e-05,
"loss": 0.4884,
"mean_token_accuracy": 0.8789756894111633,
"num_tokens": 19828326.0,
"step": 424
},
{
"epoch": 5.379746835443038,
"grad_norm": 0.5703694224357605,
"learning_rate": 2.7247740571521118e-05,
"loss": 0.4896,
"mean_token_accuracy": 0.8801313042640686,
"num_tokens": 19875600.0,
"step": 425
},
{
"epoch": 5.3924050632911396,
"grad_norm": 0.5990126132965088,
"learning_rate": 2.6846866473633125e-05,
"loss": 0.4726,
"mean_token_accuracy": 0.8829923868179321,
"num_tokens": 19919174.0,
"step": 426
},
{
"epoch": 5.405063291139241,
"grad_norm": 0.6109516024589539,
"learning_rate": 2.6448505429952917e-05,
"loss": 0.4907,
"mean_token_accuracy": 0.8786324262619019,
"num_tokens": 19963492.0,
"step": 427
},
{
"epoch": 5.417721518987342,
"grad_norm": 0.5848973393440247,
"learning_rate": 2.605267112551154e-05,
"loss": 0.5069,
"mean_token_accuracy": 0.8753526210784912,
"num_tokens": 20011058.0,
"step": 428
},
{
"epoch": 5.430379746835443,
"grad_norm": 0.590811014175415,
"learning_rate": 2.5659377158538012e-05,
"loss": 0.499,
"mean_token_accuracy": 0.8782621622085571,
"num_tokens": 20058905.0,
"step": 429
},
{
"epoch": 5.443037974683544,
"grad_norm": 0.6152106523513794,
"learning_rate": 2.5268637039992293e-05,
"loss": 0.4988,
"mean_token_accuracy": 0.875298023223877,
"num_tokens": 20105945.0,
"step": 430
},
{
"epoch": 5.455696202531645,
"grad_norm": 0.592876136302948,
"learning_rate": 2.488046419310114e-05,
"loss": 0.4965,
"mean_token_accuracy": 0.877647340297699,
"num_tokens": 20153462.0,
"step": 431
},
{
"epoch": 5.468354430379747,
"grad_norm": 0.6070770025253296,
"learning_rate": 2.4494871952896947e-05,
"loss": 0.4933,
"mean_token_accuracy": 0.8780992031097412,
"num_tokens": 20197529.0,
"step": 432
},
{
"epoch": 5.481012658227848,
"grad_norm": 0.5933142900466919,
"learning_rate": 2.411187356575969e-05,
"loss": 0.4813,
"mean_token_accuracy": 0.880434513092041,
"num_tokens": 20241594.0,
"step": 433
},
{
"epoch": 5.493670886075949,
"grad_norm": 0.5929135084152222,
"learning_rate": 2.3731482188961818e-05,
"loss": 0.4783,
"mean_token_accuracy": 0.8830586671829224,
"num_tokens": 20288083.0,
"step": 434
},
{
"epoch": 5.506329113924051,
"grad_norm": 0.5733610391616821,
"learning_rate": 2.335371089021623e-05,
"loss": 0.49,
"mean_token_accuracy": 0.8810379505157471,
"num_tokens": 20337667.0,
"step": 435
},
{
"epoch": 5.518987341772152,
"grad_norm": 0.5939366221427917,
"learning_rate": 2.297857264722756e-05,
"loss": 0.4756,
"mean_token_accuracy": 0.8813409209251404,
"num_tokens": 20385161.0,
"step": 436
},
{
"epoch": 5.531645569620253,
"grad_norm": 0.5886082649230957,
"learning_rate": 2.260608034724595e-05,
"loss": 0.5091,
"mean_token_accuracy": 0.8750845789909363,
"num_tokens": 20432529.0,
"step": 437
},
{
"epoch": 5.544303797468355,
"grad_norm": 0.6086618900299072,
"learning_rate": 2.2236246786624792e-05,
"loss": 0.4902,
"mean_token_accuracy": 0.8768316507339478,
"num_tokens": 20476679.0,
"step": 438
},
{
"epoch": 5.556962025316456,
"grad_norm": 0.5850755572319031,
"learning_rate": 2.1869084670380835e-05,
"loss": 0.5056,
"mean_token_accuracy": 0.8765684962272644,
"num_tokens": 20524559.0,
"step": 439
},
{
"epoch": 5.569620253164557,
"grad_norm": 0.5923234224319458,
"learning_rate": 2.150460661175768e-05,
"loss": 0.4736,
"mean_token_accuracy": 0.8819867372512817,
"num_tokens": 20568152.0,
"step": 440
},
{
"epoch": 5.582278481012658,
"grad_norm": 0.5886726975440979,
"learning_rate": 2.114282513179281e-05,
"loss": 0.4752,
"mean_token_accuracy": 0.8854075074195862,
"num_tokens": 20613760.0,
"step": 441
},
{
"epoch": 5.594936708860759,
"grad_norm": 0.6090703010559082,
"learning_rate": 2.0783752658887066e-05,
"loss": 0.4786,
"mean_token_accuracy": 0.8821261525154114,
"num_tokens": 20658957.0,
"step": 442
},
{
"epoch": 5.6075949367088604,
"grad_norm": 0.6041176915168762,
"learning_rate": 2.0427401528377953e-05,
"loss": 0.4982,
"mean_token_accuracy": 0.8764042258262634,
"num_tokens": 20704330.0,
"step": 443
},
{
"epoch": 5.620253164556962,
"grad_norm": 0.60368812084198,
"learning_rate": 2.0073783982115723e-05,
"loss": 0.5062,
"mean_token_accuracy": 0.8757708668708801,
"num_tokens": 20752555.0,
"step": 444
},
{
"epoch": 5.632911392405063,
"grad_norm": 0.5774247050285339,
"learning_rate": 1.9722912168042897e-05,
"loss": 0.511,
"mean_token_accuracy": 0.8744285106658936,
"num_tokens": 20805115.0,
"step": 445
},
{
"epoch": 5.6455696202531644,
"grad_norm": 0.6094748973846436,
"learning_rate": 1.937479813977703e-05,
"loss": 0.4879,
"mean_token_accuracy": 0.8806090950965881,
"num_tokens": 20849571.0,
"step": 446
},
{
"epoch": 5.658227848101266,
"grad_norm": 0.6145944595336914,
"learning_rate": 1.9029453856196376e-05,
"loss": 0.5112,
"mean_token_accuracy": 0.8738813400268555,
"num_tokens": 20896678.0,
"step": 447
},
{
"epoch": 5.670886075949367,
"grad_norm": 0.5843153595924377,
"learning_rate": 1.868689118102931e-05,
"loss": 0.4848,
"mean_token_accuracy": 0.8810961246490479,
"num_tokens": 20942796.0,
"step": 448
},
{
"epoch": 5.6835443037974684,
"grad_norm": 0.5841859579086304,
"learning_rate": 1.8347121882446717e-05,
"loss": 0.4932,
"mean_token_accuracy": 0.8793487548828125,
"num_tokens": 20989971.0,
"step": 449
},
{
"epoch": 5.69620253164557,
"grad_norm": 0.606610894203186,
"learning_rate": 1.8010157632657543e-05,
"loss": 0.4786,
"mean_token_accuracy": 0.8826842904090881,
"num_tokens": 21037258.0,
"step": 450
},
{
"epoch": 5.708860759493671,
"grad_norm": 0.6054370999336243,
"learning_rate": 1.7676010007508092e-05,
"loss": 0.4914,
"mean_token_accuracy": 0.8785582184791565,
"num_tokens": 21082183.0,
"step": 451
},
{
"epoch": 5.7215189873417724,
"grad_norm": 0.6061049699783325,
"learning_rate": 1.7344690486084137e-05,
"loss": 0.5013,
"mean_token_accuracy": 0.8739482760429382,
"num_tokens": 21126697.0,
"step": 452
},
{
"epoch": 5.734177215189874,
"grad_norm": 0.5808444023132324,
"learning_rate": 1.701621045031666e-05,
"loss": 0.5065,
"mean_token_accuracy": 0.8762862086296082,
"num_tokens": 21177006.0,
"step": 453
},
{
"epoch": 5.746835443037975,
"grad_norm": 0.5869651436805725,
"learning_rate": 1.6690581184590858e-05,
"loss": 0.5022,
"mean_token_accuracy": 0.8760119080543518,
"num_tokens": 21224010.0,
"step": 454
},
{
"epoch": 5.759493670886076,
"grad_norm": 0.5848543047904968,
"learning_rate": 1.636781387535843e-05,
"loss": 0.5056,
"mean_token_accuracy": 0.8729737401008606,
"num_tokens": 21273056.0,
"step": 455
},
{
"epoch": 5.772151898734177,
"grad_norm": 0.6035214066505432,
"learning_rate": 1.604791961075336e-05,
"loss": 0.4964,
"mean_token_accuracy": 0.8771805167198181,
"num_tokens": 21318121.0,
"step": 456
},
{
"epoch": 5.784810126582278,
"grad_norm": 0.587157666683197,
"learning_rate": 1.5730909380210945e-05,
"loss": 0.485,
"mean_token_accuracy": 0.8795527815818787,
"num_tokens": 21366754.0,
"step": 457
},
{
"epoch": 5.7974683544303796,
"grad_norm": 0.5755473971366882,
"learning_rate": 1.5416794074090258e-05,
"loss": 0.495,
"mean_token_accuracy": 0.8767243027687073,
"num_tokens": 21415895.0,
"step": 458
},
{
"epoch": 5.810126582278481,
"grad_norm": 0.5992995500564575,
"learning_rate": 1.5105584483300162e-05,
"loss": 0.462,
"mean_token_accuracy": 0.88564532995224,
"num_tokens": 21461554.0,
"step": 459
},
{
"epoch": 5.822784810126582,
"grad_norm": 0.6188696622848511,
"learning_rate": 1.479729129892835e-05,
"loss": 0.4892,
"mean_token_accuracy": 0.8776053190231323,
"num_tokens": 21506718.0,
"step": 460
},
{
"epoch": 5.8354430379746836,
"grad_norm": 0.6524665951728821,
"learning_rate": 1.4491925111874383e-05,
"loss": 0.4889,
"mean_token_accuracy": 0.8804559111595154,
"num_tokens": 21551527.0,
"step": 461
},
{
"epoch": 5.848101265822785,
"grad_norm": 0.6141889095306396,
"learning_rate": 1.4189496412485592e-05,
"loss": 0.4781,
"mean_token_accuracy": 0.8806585073471069,
"num_tokens": 21597694.0,
"step": 462
},
{
"epoch": 5.860759493670886,
"grad_norm": 0.6022236943244934,
"learning_rate": 1.3890015590196803e-05,
"loss": 0.4957,
"mean_token_accuracy": 0.8784832954406738,
"num_tokens": 21644912.0,
"step": 463
},
{
"epoch": 5.8734177215189876,
"grad_norm": 0.5849525332450867,
"learning_rate": 1.3593492933173512e-05,
"loss": 0.4981,
"mean_token_accuracy": 0.8747273683547974,
"num_tokens": 21694492.0,
"step": 464
},
{
"epoch": 5.886075949367089,
"grad_norm": 0.5798141360282898,
"learning_rate": 1.3299938627958297e-05,
"loss": 0.5031,
"mean_token_accuracy": 0.8752538561820984,
"num_tokens": 21745772.0,
"step": 465
},
{
"epoch": 5.89873417721519,
"grad_norm": 0.6097593903541565,
"learning_rate": 1.300936275912098e-05,
"loss": 0.4789,
"mean_token_accuracy": 0.8802154660224915,
"num_tokens": 21790391.0,
"step": 466
},
{
"epoch": 5.911392405063291,
"grad_norm": 0.6151306629180908,
"learning_rate": 1.2721775308912132e-05,
"loss": 0.5194,
"mean_token_accuracy": 0.8713752031326294,
"num_tokens": 21837009.0,
"step": 467
},
{
"epoch": 5.924050632911392,
"grad_norm": 0.5922465324401855,
"learning_rate": 1.2437186156920167e-05,
"loss": 0.5141,
"mean_token_accuracy": 0.8723000288009644,
"num_tokens": 21884990.0,
"step": 468
},
{
"epoch": 5.936708860759493,
"grad_norm": 0.5962823033332825,
"learning_rate": 1.2155605079732046e-05,
"loss": 0.5089,
"mean_token_accuracy": 0.8751126527786255,
"num_tokens": 21931648.0,
"step": 469
},
{
"epoch": 5.949367088607595,
"grad_norm": 0.6032353639602661,
"learning_rate": 1.1877041750597173e-05,
"loss": 0.4964,
"mean_token_accuracy": 0.8769810795783997,
"num_tokens": 21978656.0,
"step": 470
},
{
"epoch": 5.962025316455696,
"grad_norm": 0.6158297657966614,
"learning_rate": 1.160150573909532e-05,
"loss": 0.5099,
"mean_token_accuracy": 0.8746172189712524,
"num_tokens": 22026071.0,
"step": 471
},
{
"epoch": 5.974683544303797,
"grad_norm": 0.5986502766609192,
"learning_rate": 1.132900651080785e-05,
"loss": 0.4691,
"mean_token_accuracy": 0.8836339712142944,
"num_tokens": 22070263.0,
"step": 472
},
{
"epoch": 5.987341772151899,
"grad_norm": 0.6113969087600708,
"learning_rate": 1.1059553426992365e-05,
"loss": 0.5074,
"mean_token_accuracy": 0.8743844032287598,
"num_tokens": 22117638.0,
"step": 473
},
{
"epoch": 6.0,
"grad_norm": 0.5078223347663879,
"learning_rate": 1.0793155744261351e-05,
"loss": 0.4089,
"mean_token_accuracy": 0.9015847444534302,
"num_tokens": 22162756.0,
"step": 474
},
{
"epoch": 6.012658227848101,
"grad_norm": 0.5180269479751587,
"learning_rate": 1.0529822614264018e-05,
"loss": 0.4232,
"mean_token_accuracy": 0.8996778726577759,
"num_tokens": 22210317.0,
"step": 475
},
{
"epoch": 6.025316455696203,
"grad_norm": 0.521119236946106,
"learning_rate": 1.026956308337199e-05,
"loss": 0.4206,
"mean_token_accuracy": 0.9003894925117493,
"num_tokens": 22257364.0,
"step": 476
},
{
"epoch": 6.037974683544304,
"grad_norm": 0.5258929133415222,
"learning_rate": 1.0012386092368475e-05,
"loss": 0.3874,
"mean_token_accuracy": 0.9093874096870422,
"num_tokens": 22302190.0,
"step": 477
},
{
"epoch": 6.050632911392405,
"grad_norm": 0.5309813618659973,
"learning_rate": 9.75830047614117e-06,
"loss": 0.4006,
"mean_token_accuracy": 0.9050379395484924,
"num_tokens": 22347967.0,
"step": 478
},
{
"epoch": 6.063291139240507,
"grad_norm": 0.5413678288459778,
"learning_rate": 9.507314963378745e-06,
"loss": 0.3956,
"mean_token_accuracy": 0.905818521976471,
"num_tokens": 22393369.0,
"step": 479
},
{
"epoch": 6.075949367088608,
"grad_norm": 0.5256166458129883,
"learning_rate": 9.259438176270962e-06,
"loss": 0.3977,
"mean_token_accuracy": 0.9056070446968079,
"num_tokens": 22441212.0,
"step": 480
},
{
"epoch": 6.0886075949367084,
"grad_norm": 0.5342482328414917,
"learning_rate": 9.014678630212469e-06,
"loss": 0.3903,
"mean_token_accuracy": 0.9074738025665283,
"num_tokens": 22489792.0,
"step": 481
},
{
"epoch": 6.10126582278481,
"grad_norm": 0.5547141432762146,
"learning_rate": 8.773044733510338e-06,
"loss": 0.3841,
"mean_token_accuracy": 0.9071083068847656,
"num_tokens": 22537589.0,
"step": 482
},
{
"epoch": 6.113924050632911,
"grad_norm": 0.6087285280227661,
"learning_rate": 8.534544787095078e-06,
"loss": 0.3873,
"mean_token_accuracy": 0.9074901342391968,
"num_tokens": 22583540.0,
"step": 483
},
{
"epoch": 6.1265822784810124,
"grad_norm": 0.6063216328620911,
"learning_rate": 8.299186984235585e-06,
"loss": 0.3916,
"mean_token_accuracy": 0.9041749238967896,
"num_tokens": 22630982.0,
"step": 484
},
{
"epoch": 6.139240506329114,
"grad_norm": 0.613871693611145,
"learning_rate": 8.06697941025768e-06,
"loss": 0.3752,
"mean_token_accuracy": 0.9080203175544739,
"num_tokens": 22675795.0,
"step": 485
},
{
"epoch": 6.151898734177215,
"grad_norm": 0.6383016705513,
"learning_rate": 7.837930042266262e-06,
"loss": 0.4072,
"mean_token_accuracy": 0.9005741477012634,
"num_tokens": 22724800.0,
"step": 486
},
{
"epoch": 6.1645569620253164,
"grad_norm": 0.6214612126350403,
"learning_rate": 7.612046748871327e-06,
"loss": 0.3898,
"mean_token_accuracy": 0.9051695466041565,
"num_tokens": 22772528.0,
"step": 487
},
{
"epoch": 6.177215189873418,
"grad_norm": 0.6447484493255615,
"learning_rate": 7.389337289917652e-06,
"loss": 0.4098,
"mean_token_accuracy": 0.9014731049537659,
"num_tokens": 22820518.0,
"step": 488
},
{
"epoch": 6.189873417721519,
"grad_norm": 0.6162357330322266,
"learning_rate": 7.1698093162182125e-06,
"loss": 0.3847,
"mean_token_accuracy": 0.9040086269378662,
"num_tokens": 22866857.0,
"step": 489
},
{
"epoch": 6.2025316455696204,
"grad_norm": 0.5872465968132019,
"learning_rate": 6.953470369291348e-06,
"loss": 0.3906,
"mean_token_accuracy": 0.9052353501319885,
"num_tokens": 22915399.0,
"step": 490
},
{
"epoch": 6.215189873417722,
"grad_norm": 0.5958002209663391,
"learning_rate": 6.74032788110166e-06,
"loss": 0.3833,
"mean_token_accuracy": 0.9080662727355957,
"num_tokens": 22961333.0,
"step": 491
},
{
"epoch": 6.227848101265823,
"grad_norm": 0.5847265124320984,
"learning_rate": 6.530389173804807e-06,
"loss": 0.388,
"mean_token_accuracy": 0.9040992259979248,
"num_tokens": 23007601.0,
"step": 492
},
{
"epoch": 6.2405063291139244,
"grad_norm": 0.5710330605506897,
"learning_rate": 6.323661459495811e-06,
"loss": 0.3927,
"mean_token_accuracy": 0.9061951637268066,
"num_tokens": 23057268.0,
"step": 493
},
{
"epoch": 6.253164556962025,
"grad_norm": 0.5893294811248779,
"learning_rate": 6.1201518399613635e-06,
"loss": 0.3649,
"mean_token_accuracy": 0.9110230207443237,
"num_tokens": 23101467.0,
"step": 494
},
{
"epoch": 6.265822784810126,
"grad_norm": 0.5623788833618164,
"learning_rate": 5.919867306435934e-06,
"loss": 0.3651,
"mean_token_accuracy": 0.9124348163604736,
"num_tokens": 23146389.0,
"step": 495
},
{
"epoch": 6.2784810126582276,
"grad_norm": 0.557794451713562,
"learning_rate": 5.722814739361459e-06,
"loss": 0.3735,
"mean_token_accuracy": 0.9109086394309998,
"num_tokens": 23192664.0,
"step": 496
},
{
"epoch": 6.291139240506329,
"grad_norm": 0.5795067548751831,
"learning_rate": 5.529000908151105e-06,
"loss": 0.3955,
"mean_token_accuracy": 0.9051991701126099,
"num_tokens": 23238466.0,
"step": 497
},
{
"epoch": 6.30379746835443,
"grad_norm": 0.5689795017242432,
"learning_rate": 5.338432470956589e-06,
"loss": 0.3903,
"mean_token_accuracy": 0.9060965776443481,
"num_tokens": 23287016.0,
"step": 498
},
{
"epoch": 6.3164556962025316,
"grad_norm": 0.5454722046852112,
"learning_rate": 5.151115974439569e-06,
"loss": 0.3707,
"mean_token_accuracy": 0.9100461602210999,
"num_tokens": 23334093.0,
"step": 499
},
{
"epoch": 6.329113924050633,
"grad_norm": 0.5693135261535645,
"learning_rate": 4.967057853546653e-06,
"loss": 0.3775,
"mean_token_accuracy": 0.9082093238830566,
"num_tokens": 23379118.0,
"step": 500
},
{
"epoch": 6.341772151898734,
"grad_norm": 0.5589075684547424,
"learning_rate": 4.786264431288423e-06,
"loss": 0.3701,
"mean_token_accuracy": 0.9106748104095459,
"num_tokens": 23423089.0,
"step": 501
},
{
"epoch": 6.3544303797468356,
"grad_norm": 0.5521835684776306,
"learning_rate": 4.608741918522097e-06,
"loss": 0.3806,
"mean_token_accuracy": 0.9093685746192932,
"num_tokens": 23469649.0,
"step": 502
},
{
"epoch": 6.367088607594937,
"grad_norm": 0.5633716583251953,
"learning_rate": 4.434496413738332e-06,
"loss": 0.392,
"mean_token_accuracy": 0.9065303802490234,
"num_tokens": 23516862.0,
"step": 503
},
{
"epoch": 6.379746835443038,
"grad_norm": 0.5469903945922852,
"learning_rate": 4.263533902851535e-06,
"loss": 0.3696,
"mean_token_accuracy": 0.9113619923591614,
"num_tokens": 23563520.0,
"step": 504
},
{
"epoch": 6.3924050632911396,
"grad_norm": 0.5530360341072083,
"learning_rate": 4.095860258994388e-06,
"loss": 0.4062,
"mean_token_accuracy": 0.9027206897735596,
"num_tokens": 23612505.0,
"step": 505
},
{
"epoch": 6.405063291139241,
"grad_norm": 0.5586188435554504,
"learning_rate": 3.931481242315993e-06,
"loss": 0.3604,
"mean_token_accuracy": 0.9130181670188904,
"num_tokens": 23658981.0,
"step": 506
},
{
"epoch": 6.417721518987342,
"grad_norm": 0.5679466724395752,
"learning_rate": 3.770402499783976e-06,
"loss": 0.3913,
"mean_token_accuracy": 0.9053800106048584,
"num_tokens": 23704807.0,
"step": 507
},
{
"epoch": 6.430379746835443,
"grad_norm": 0.5666420459747314,
"learning_rate": 3.6126295649906216e-06,
"loss": 0.3983,
"mean_token_accuracy": 0.9038554430007935,
"num_tokens": 23752518.0,
"step": 508
},
{
"epoch": 6.443037974683544,
"grad_norm": 0.5628715753555298,
"learning_rate": 3.458167857962613e-06,
"loss": 0.3987,
"mean_token_accuracy": 0.9056045413017273,
"num_tokens": 23799205.0,
"step": 509
},
{
"epoch": 6.455696202531645,
"grad_norm": 0.5618675947189331,
"learning_rate": 3.3070226849749366e-06,
"loss": 0.372,
"mean_token_accuracy": 0.9113752841949463,
"num_tokens": 23845114.0,
"step": 510
},
{
"epoch": 6.468354430379747,
"grad_norm": 0.5676432847976685,
"learning_rate": 3.159199238368593e-06,
"loss": 0.3799,
"mean_token_accuracy": 0.9109406471252441,
"num_tokens": 23891720.0,
"step": 511
},
{
"epoch": 6.481012658227848,
"grad_norm": 0.5845745205879211,
"learning_rate": 3.0147025963721433e-06,
"loss": 0.4173,
"mean_token_accuracy": 0.9012231826782227,
"num_tokens": 23938465.0,
"step": 512
},
{
"epoch": 6.493670886075949,
"grad_norm": 0.5692048668861389,
"learning_rate": 2.8735377229273998e-06,
"loss": 0.3965,
"mean_token_accuracy": 0.9037320613861084,
"num_tokens": 23987403.0,
"step": 513
},
{
"epoch": 6.506329113924051,
"grad_norm": 0.5562811493873596,
"learning_rate": 2.735709467518699e-06,
"loss": 0.3817,
"mean_token_accuracy": 0.9068973064422607,
"num_tokens": 24034877.0,
"step": 514
},
{
"epoch": 6.518987341772152,
"grad_norm": 0.5730811357498169,
"learning_rate": 2.6012225650064893e-06,
"loss": 0.39,
"mean_token_accuracy": 0.9057947993278503,
"num_tokens": 24082104.0,
"step": 515
},
{
"epoch": 6.531645569620253,
"grad_norm": 0.5873252153396606,
"learning_rate": 2.470081635464594e-06,
"loss": 0.4219,
"mean_token_accuracy": 0.8977401256561279,
"num_tokens": 24129958.0,
"step": 516
},
{
"epoch": 6.544303797468355,
"grad_norm": 0.5700328350067139,
"learning_rate": 2.342291184021461e-06,
"loss": 0.3936,
"mean_token_accuracy": 0.9058045744895935,
"num_tokens": 24176606.0,
"step": 517
},
{
"epoch": 6.556962025316456,
"grad_norm": 0.5592919588088989,
"learning_rate": 2.2178556007054872e-06,
"loss": 0.3819,
"mean_token_accuracy": 0.9092505574226379,
"num_tokens": 24224494.0,
"step": 518
},
{
"epoch": 6.569620253164557,
"grad_norm": 0.5832672119140625,
"learning_rate": 2.0967791602941154e-06,
"loss": 0.3858,
"mean_token_accuracy": 0.9063412547111511,
"num_tokens": 24271142.0,
"step": 519
},
{
"epoch": 6.582278481012658,
"grad_norm": 0.5810838937759399,
"learning_rate": 1.979066022167042e-06,
"loss": 0.385,
"mean_token_accuracy": 0.9060366153717041,
"num_tokens": 24318948.0,
"step": 520
},
{
"epoch": 6.594936708860759,
"grad_norm": 0.6128122806549072,
"learning_rate": 1.8647202301633194e-06,
"loss": 0.39,
"mean_token_accuracy": 0.9060620665550232,
"num_tokens": 24362743.0,
"step": 521
},
{
"epoch": 6.6075949367088604,
"grad_norm": 0.5534291863441467,
"learning_rate": 1.7537457124423895e-06,
"loss": 0.3817,
"mean_token_accuracy": 0.9087843298912048,
"num_tokens": 24412031.0,
"step": 522
},
{
"epoch": 6.620253164556962,
"grad_norm": 0.5778301954269409,
"learning_rate": 1.6461462813492034e-06,
"loss": 0.4057,
"mean_token_accuracy": 0.9008567929267883,
"num_tokens": 24459713.0,
"step": 523
},
{
"epoch": 6.632911392405063,
"grad_norm": 0.5713034868240356,
"learning_rate": 1.5419256332832255e-06,
"loss": 0.3706,
"mean_token_accuracy": 0.9108288288116455,
"num_tokens": 24505913.0,
"step": 524
},
{
"epoch": 6.6455696202531644,
"grad_norm": 0.5820364952087402,
"learning_rate": 1.4410873485714238e-06,
"loss": 0.3786,
"mean_token_accuracy": 0.9070352911949158,
"num_tokens": 24550467.0,
"step": 525
},
{
"epoch": 6.658227848101266,
"grad_norm": 0.5694465637207031,
"learning_rate": 1.3436348913453578e-06,
"loss": 0.391,
"mean_token_accuracy": 0.9062048196792603,
"num_tokens": 24598945.0,
"step": 526
},
{
"epoch": 6.670886075949367,
"grad_norm": 0.5639371871948242,
"learning_rate": 1.249571609422029e-06,
"loss": 0.3754,
"mean_token_accuracy": 0.9100679755210876,
"num_tokens": 24646089.0,
"step": 527
},
{
"epoch": 6.6835443037974684,
"grad_norm": 0.5671195387840271,
"learning_rate": 1.158900734189039e-06,
"loss": 0.3881,
"mean_token_accuracy": 0.9070022702217102,
"num_tokens": 24692595.0,
"step": 528
},
{
"epoch": 6.69620253164557,
"grad_norm": 0.5708573460578918,
"learning_rate": 1.0716253804934795e-06,
"loss": 0.4032,
"mean_token_accuracy": 0.9024674892425537,
"num_tokens": 24741494.0,
"step": 529
},
{
"epoch": 6.708860759493671,
"grad_norm": 0.5634827017784119,
"learning_rate": 9.877485465349058e-07,
"loss": 0.3845,
"mean_token_accuracy": 0.9086854457855225,
"num_tokens": 24787520.0,
"step": 530
},
{
"epoch": 6.7215189873417724,
"grad_norm": 0.5839213132858276,
"learning_rate": 9.072731137624413e-07,
"loss": 0.3967,
"mean_token_accuracy": 0.9044073820114136,
"num_tokens": 24834324.0,
"step": 531
},
{
"epoch": 6.734177215189874,
"grad_norm": 0.5715585350990295,
"learning_rate": 8.3020184677568e-07,
"loss": 0.3823,
"mean_token_accuracy": 0.9075259566307068,
"num_tokens": 24881558.0,
"step": 532
},
{
"epoch": 6.746835443037975,
"grad_norm": 0.5677687525749207,
"learning_rate": 7.56537393229817e-07,
"loss": 0.3884,
"mean_token_accuracy": 0.9045724868774414,
"num_tokens": 24929386.0,
"step": 533
},
{
"epoch": 6.759493670886076,
"grad_norm": 0.5910177826881409,
"learning_rate": 6.862822837445881e-07,
"loss": 0.3795,
"mean_token_accuracy": 0.9077647924423218,
"num_tokens": 24975723.0,
"step": 534
},
{
"epoch": 6.772151898734177,
"grad_norm": 0.5636204481124878,
"learning_rate": 6.194389318173954e-07,
"loss": 0.3844,
"mean_token_accuracy": 0.9066954255104065,
"num_tokens": 25022655.0,
"step": 535
},
{
"epoch": 6.784810126582278,
"grad_norm": 0.5545103549957275,
"learning_rate": 5.560096337404397e-07,
"loss": 0.392,
"mean_token_accuracy": 0.9055996537208557,
"num_tokens": 25072115.0,
"step": 536
},
{
"epoch": 6.7974683544303796,
"grad_norm": 0.5688847303390503,
"learning_rate": 4.959965685216949e-07,
"loss": 0.4038,
"mean_token_accuracy": 0.9030274748802185,
"num_tokens": 25118852.0,
"step": 537
},
{
"epoch": 6.810126582278481,
"grad_norm": 0.5681838989257812,
"learning_rate": 4.3940179781019055e-07,
"loss": 0.3654,
"mean_token_accuracy": 0.9127160906791687,
"num_tokens": 25163403.0,
"step": 538
},
{
"epoch": 6.822784810126582,
"grad_norm": 0.5705924034118652,
"learning_rate": 3.8622726582514537e-07,
"loss": 0.41,
"mean_token_accuracy": 0.904007613658905,
"num_tokens": 25210752.0,
"step": 539
},
{
"epoch": 6.8354430379746836,
"grad_norm": 0.570173978805542,
"learning_rate": 3.364747992891215e-07,
"loss": 0.3828,
"mean_token_accuracy": 0.9091429710388184,
"num_tokens": 25256206.0,
"step": 540
},
{
"epoch": 6.848101265822785,
"grad_norm": 0.575129508972168,
"learning_rate": 2.901461073653633e-07,
"loss": 0.3892,
"mean_token_accuracy": 0.9063740372657776,
"num_tokens": 25301877.0,
"step": 541
},
{
"epoch": 6.860759493670886,
"grad_norm": 0.5604121088981628,
"learning_rate": 2.472427815989886e-07,
"loss": 0.3715,
"mean_token_accuracy": 0.9102283716201782,
"num_tokens": 25348136.0,
"step": 542
},
{
"epoch": 6.8734177215189876,
"grad_norm": 0.5795130729675293,
"learning_rate": 2.0776629586239936e-07,
"loss": 0.3988,
"mean_token_accuracy": 0.90403151512146,
"num_tokens": 25395403.0,
"step": 543
},
{
"epoch": 6.886075949367089,
"grad_norm": 0.5694568157196045,
"learning_rate": 1.7171800630458868e-07,
"loss": 0.3567,
"mean_token_accuracy": 0.915683925151825,
"num_tokens": 25439053.0,
"step": 544
},
{
"epoch": 6.89873417721519,
"grad_norm": 0.556625247001648,
"learning_rate": 1.3909915130457808e-07,
"loss": 0.3759,
"mean_token_accuracy": 0.9094910621643066,
"num_tokens": 25484781.0,
"step": 545
},
{
"epoch": 6.911392405063291,
"grad_norm": 0.5877848267555237,
"learning_rate": 1.0991085142886271e-07,
"loss": 0.3996,
"mean_token_accuracy": 0.9032759070396423,
"num_tokens": 25529901.0,
"step": 546
},
{
"epoch": 6.924050632911392,
"grad_norm": 0.5745137929916382,
"learning_rate": 8.41541093929199e-08,
"loss": 0.3932,
"mean_token_accuracy": 0.9050623774528503,
"num_tokens": 25578302.0,
"step": 547
},
{
"epoch": 6.936708860759493,
"grad_norm": 0.5791630148887634,
"learning_rate": 6.182981002679223e-08,
"loss": 0.3789,
"mean_token_accuracy": 0.907834529876709,
"num_tokens": 25623589.0,
"step": 548
},
{
"epoch": 6.949367088607595,
"grad_norm": 0.6007780432701111,
"learning_rate": 4.293872024463408e-08,
"loss": 0.4255,
"mean_token_accuracy": 0.8964483737945557,
"num_tokens": 25671040.0,
"step": 549
},
{
"epoch": 6.962025316455696,
"grad_norm": 0.5847962498664856,
"learning_rate": 2.7481489018410523e-08,
"loss": 0.3983,
"mean_token_accuracy": 0.9039490222930908,
"num_tokens": 25718204.0,
"step": 550
},
{
"epoch": 6.974683544303797,
"grad_norm": 0.5613832473754883,
"learning_rate": 1.545864735558178e-08,
"loss": 0.375,
"mean_token_accuracy": 0.9110968708992004,
"num_tokens": 25764993.0,
"step": 551
},
{
"epoch": 6.987341772151899,
"grad_norm": 0.5971652269363403,
"learning_rate": 6.8706082808955855e-09,
"loss": 0.3968,
"mean_token_accuracy": 0.9042324423789978,
"num_tokens": 25810208.0,
"step": 552
},
{
"epoch": 7.0,
"grad_norm": 0.5324912667274475,
"learning_rate": 1.7176668221208225e-09,
"loss": 0.3848,
"mean_token_accuracy": 0.9090686440467834,
"num_tokens": 25859276.0,
"step": 553
},
{
"epoch": 7.0,
"step": 553,
"total_flos": 1.6654859065779814e+18,
"train_loss": 1.0050470797752602,
"train_runtime": 3322.7101,
"train_samples_per_second": 10.534,
"train_steps_per_second": 0.166
}
],
"logging_steps": 1.0,
"max_steps": 553,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6654859065779814e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}