YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order3
33cc08a verified
Raw
History Blame Contribute Delete
141 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 7.0,
"eval_steps": 500,
"global_step": 553,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 2.3777403831481934,
"learning_rate": 0.0,
"loss": 2.987,
"mean_token_accuracy": 0.43647515773773193,
"num_tokens": 49462.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 2.2921016216278076,
"learning_rate": 1.1764705882352942e-05,
"loss": 2.9692,
"mean_token_accuracy": 0.43469536304473877,
"num_tokens": 103343.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 2.1817562580108643,
"learning_rate": 2.3529411764705884e-05,
"loss": 2.9708,
"mean_token_accuracy": 0.4287627935409546,
"num_tokens": 159396.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 1.69505774974823,
"learning_rate": 3.529411764705883e-05,
"loss": 2.8333,
"mean_token_accuracy": 0.4467816650867462,
"num_tokens": 214939.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 0.8903109431266785,
"learning_rate": 4.705882352941177e-05,
"loss": 2.7946,
"mean_token_accuracy": 0.4477955102920532,
"num_tokens": 269347.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 0.7307999730110168,
"learning_rate": 5.882352941176471e-05,
"loss": 2.7415,
"mean_token_accuracy": 0.4459383189678192,
"num_tokens": 322665.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 1.0384595394134521,
"learning_rate": 7.058823529411765e-05,
"loss": 2.6873,
"mean_token_accuracy": 0.45682191848754883,
"num_tokens": 376321.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 0.6653650999069214,
"learning_rate": 8.23529411764706e-05,
"loss": 2.6668,
"mean_token_accuracy": 0.4562457799911499,
"num_tokens": 432471.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.5289244651794434,
"learning_rate": 9.411764705882353e-05,
"loss": 2.5618,
"mean_token_accuracy": 0.4725915491580963,
"num_tokens": 484508.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.41668060421943665,
"learning_rate": 0.00010588235294117647,
"loss": 2.595,
"mean_token_accuracy": 0.459774911403656,
"num_tokens": 539575.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.4126631021499634,
"learning_rate": 0.00011764705882352942,
"loss": 2.5641,
"mean_token_accuracy": 0.46722716093063354,
"num_tokens": 595661.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.42117854952812195,
"learning_rate": 0.00012941176470588237,
"loss": 2.4867,
"mean_token_accuracy": 0.4772918224334717,
"num_tokens": 649252.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.3347395360469818,
"learning_rate": 0.0001411764705882353,
"loss": 2.4066,
"mean_token_accuracy": 0.4961014986038208,
"num_tokens": 698181.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.3450194001197815,
"learning_rate": 0.00015294117647058822,
"loss": 2.4575,
"mean_token_accuracy": 0.4829401671886444,
"num_tokens": 751997.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.3743025064468384,
"learning_rate": 0.0001647058823529412,
"loss": 2.5271,
"mean_token_accuracy": 0.47433584928512573,
"num_tokens": 804157.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.31017568707466125,
"learning_rate": 0.00017647058823529413,
"loss": 2.4469,
"mean_token_accuracy": 0.4821561872959137,
"num_tokens": 857853.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.2644542455673218,
"learning_rate": 0.00018823529411764707,
"loss": 2.4757,
"mean_token_accuracy": 0.4836902916431427,
"num_tokens": 911658.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.276317298412323,
"learning_rate": 0.0002,
"loss": 2.4031,
"mean_token_accuracy": 0.49243834614753723,
"num_tokens": 966472.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.2615073621273041,
"learning_rate": 0.0001999982823331779,
"loss": 2.4172,
"mean_token_accuracy": 0.48848584294319153,
"num_tokens": 1021121.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.29055628180503845,
"learning_rate": 0.00019999312939171914,
"loss": 2.4338,
"mean_token_accuracy": 0.48929548263549805,
"num_tokens": 1073873.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.27930697798728943,
"learning_rate": 0.00019998454135264444,
"loss": 2.4522,
"mean_token_accuracy": 0.48395559191703796,
"num_tokens": 1127694.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.26422643661499023,
"learning_rate": 0.0001999725185109816,
"loss": 2.3931,
"mean_token_accuracy": 0.49215826392173767,
"num_tokens": 1182019.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.24653665721416473,
"learning_rate": 0.00019995706127975537,
"loss": 2.4242,
"mean_token_accuracy": 0.49197646975517273,
"num_tokens": 1236984.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.23459693789482117,
"learning_rate": 0.00019993817018997323,
"loss": 2.3932,
"mean_token_accuracy": 0.49121400713920593,
"num_tokens": 1290713.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.2341814786195755,
"learning_rate": 0.0001999158458906071,
"loss": 2.3674,
"mean_token_accuracy": 0.4998742640018463,
"num_tokens": 1342478.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.23303280770778656,
"learning_rate": 0.00019989008914857116,
"loss": 2.371,
"mean_token_accuracy": 0.49253204464912415,
"num_tokens": 1399050.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.23921893537044525,
"learning_rate": 0.00019986090084869545,
"loss": 2.3414,
"mean_token_accuracy": 0.504025936126709,
"num_tokens": 1450903.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.23109662532806396,
"learning_rate": 0.00019982828199369541,
"loss": 2.383,
"mean_token_accuracy": 0.4947618544101715,
"num_tokens": 1502703.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.23166801035404205,
"learning_rate": 0.00019979223370413763,
"loss": 2.3427,
"mean_token_accuracy": 0.5024489760398865,
"num_tokens": 1554830.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.23221726715564728,
"learning_rate": 0.00019975275721840103,
"loss": 2.316,
"mean_token_accuracy": 0.5067493915557861,
"num_tokens": 1608232.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.25872787833213806,
"learning_rate": 0.00019970985389263467,
"loss": 2.4018,
"mean_token_accuracy": 0.4859926998615265,
"num_tokens": 1664017.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.21597705781459808,
"learning_rate": 0.0001996635252007109,
"loss": 2.373,
"mean_token_accuracy": 0.4899657070636749,
"num_tokens": 1720089.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.21651999652385712,
"learning_rate": 0.00019961377273417487,
"loss": 2.3406,
"mean_token_accuracy": 0.5002290606498718,
"num_tokens": 1774726.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.27110129594802856,
"learning_rate": 0.00019956059820218982,
"loss": 2.2649,
"mean_token_accuracy": 0.5155223608016968,
"num_tokens": 1825040.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.2406129240989685,
"learning_rate": 0.00019950400343147833,
"loss": 2.2383,
"mean_token_accuracy": 0.5138267874717712,
"num_tokens": 1874103.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.23772259056568146,
"learning_rate": 0.0001994439903662596,
"loss": 2.308,
"mean_token_accuracy": 0.5060418248176575,
"num_tokens": 1927131.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.2241072952747345,
"learning_rate": 0.00019938056106818261,
"loss": 2.3184,
"mean_token_accuracy": 0.5003350377082825,
"num_tokens": 1980917.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.21709077060222626,
"learning_rate": 0.00019931371771625544,
"loss": 2.297,
"mean_token_accuracy": 0.5099939703941345,
"num_tokens": 2038766.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.23601983487606049,
"learning_rate": 0.0001992434626067702,
"loss": 2.2036,
"mean_token_accuracy": 0.5218307971954346,
"num_tokens": 2091004.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.2275037169456482,
"learning_rate": 0.00019916979815322433,
"loss": 2.2341,
"mean_token_accuracy": 0.5191103219985962,
"num_tokens": 2140073.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.2513538599014282,
"learning_rate": 0.00019909272688623756,
"loss": 2.253,
"mean_token_accuracy": 0.5178407430648804,
"num_tokens": 2188061.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.23898564279079437,
"learning_rate": 0.0001990122514534651,
"loss": 2.3332,
"mean_token_accuracy": 0.5028094053268433,
"num_tokens": 2238848.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.23017625510692596,
"learning_rate": 0.00019892837461950652,
"loss": 2.281,
"mean_token_accuracy": 0.5065714120864868,
"num_tokens": 2290423.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.22404694557189941,
"learning_rate": 0.00019884109926581096,
"loss": 2.3715,
"mean_token_accuracy": 0.4927098751068115,
"num_tokens": 2346796.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.26679301261901855,
"learning_rate": 0.00019875042839057798,
"loss": 2.2823,
"mean_token_accuracy": 0.5043882131576538,
"num_tokens": 2398134.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.35434162616729736,
"learning_rate": 0.00019865636510865467,
"loss": 2.2726,
"mean_token_accuracy": 0.5074643492698669,
"num_tokens": 2451183.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.25821197032928467,
"learning_rate": 0.0001985589126514286,
"loss": 2.2611,
"mean_token_accuracy": 0.5144078135490417,
"num_tokens": 2504378.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.24773675203323364,
"learning_rate": 0.0001984580743667168,
"loss": 2.2926,
"mean_token_accuracy": 0.5041046142578125,
"num_tokens": 2560111.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.2054610252380371,
"learning_rate": 0.0001983538537186508,
"loss": 2.2683,
"mean_token_accuracy": 0.5050387978553772,
"num_tokens": 2615347.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.2727196216583252,
"learning_rate": 0.0001982462542875576,
"loss": 2.2515,
"mean_token_accuracy": 0.5132653713226318,
"num_tokens": 2668557.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.220747172832489,
"learning_rate": 0.0001981352797698367,
"loss": 2.2114,
"mean_token_accuracy": 0.5235074162483215,
"num_tokens": 2719222.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.22235804796218872,
"learning_rate": 0.00019802093397783296,
"loss": 2.3158,
"mean_token_accuracy": 0.5008944869041443,
"num_tokens": 2774066.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.21352076530456543,
"learning_rate": 0.0001979032208397059,
"loss": 2.2094,
"mean_token_accuracy": 0.5189113616943359,
"num_tokens": 2826453.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.24351590871810913,
"learning_rate": 0.00019778214439929452,
"loss": 2.237,
"mean_token_accuracy": 0.5208898782730103,
"num_tokens": 2879916.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.22591541707515717,
"learning_rate": 0.00019765770881597855,
"loss": 2.2748,
"mean_token_accuracy": 0.5128757953643799,
"num_tokens": 2935627.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.23585133254528046,
"learning_rate": 0.00019752991836453543,
"loss": 2.2592,
"mean_token_accuracy": 0.517071008682251,
"num_tokens": 2987299.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.2299552857875824,
"learning_rate": 0.00019739877743499352,
"loss": 2.2103,
"mean_token_accuracy": 0.5231272578239441,
"num_tokens": 3039920.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.22556596994400024,
"learning_rate": 0.0001972642905324813,
"loss": 2.1801,
"mean_token_accuracy": 0.5252166390419006,
"num_tokens": 3093758.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.2583288252353668,
"learning_rate": 0.00019712646227707263,
"loss": 2.2206,
"mean_token_accuracy": 0.5194674134254456,
"num_tokens": 3146320.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.23114819824695587,
"learning_rate": 0.00019698529740362785,
"loss": 2.1938,
"mean_token_accuracy": 0.5238490104675293,
"num_tokens": 3199447.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.27613702416419983,
"learning_rate": 0.00019684080076163142,
"loss": 2.218,
"mean_token_accuracy": 0.5217007398605347,
"num_tokens": 3249325.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.2257266640663147,
"learning_rate": 0.00019669297731502507,
"loss": 2.1838,
"mean_token_accuracy": 0.527215301990509,
"num_tokens": 3301933.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.2396840751171112,
"learning_rate": 0.0001965418321420374,
"loss": 2.287,
"mean_token_accuracy": 0.5053610801696777,
"num_tokens": 3359168.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.2592514753341675,
"learning_rate": 0.0001963873704350094,
"loss": 2.2362,
"mean_token_accuracy": 0.5132758021354675,
"num_tokens": 3413805.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.21635417640209198,
"learning_rate": 0.00019622959750021605,
"loss": 2.2325,
"mean_token_accuracy": 0.516057550907135,
"num_tokens": 3468018.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.31652048230171204,
"learning_rate": 0.000196068518757684,
"loss": 2.1816,
"mean_token_accuracy": 0.5242221355438232,
"num_tokens": 3520245.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.2590932548046112,
"learning_rate": 0.0001959041397410056,
"loss": 2.2603,
"mean_token_accuracy": 0.5067430734634399,
"num_tokens": 3575996.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.2672514021396637,
"learning_rate": 0.0001957364660971485,
"loss": 2.1668,
"mean_token_accuracy": 0.5292069911956787,
"num_tokens": 3626048.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.2696274518966675,
"learning_rate": 0.0001955655035862617,
"loss": 2.2775,
"mean_token_accuracy": 0.5012869834899902,
"num_tokens": 3680891.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.263043075799942,
"learning_rate": 0.0001953912580814779,
"loss": 2.1221,
"mean_token_accuracy": 0.5379413366317749,
"num_tokens": 3734485.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.2448316514492035,
"learning_rate": 0.0001952137355687116,
"loss": 2.2553,
"mean_token_accuracy": 0.5112840533256531,
"num_tokens": 3788386.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.24373596906661987,
"learning_rate": 0.00019503294214645337,
"loss": 2.2736,
"mean_token_accuracy": 0.5043618679046631,
"num_tokens": 3844848.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.24015116691589355,
"learning_rate": 0.00019484888402556045,
"loss": 2.1951,
"mean_token_accuracy": 0.5237194299697876,
"num_tokens": 3897780.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.23572903871536255,
"learning_rate": 0.00019466156752904343,
"loss": 2.1952,
"mean_token_accuracy": 0.522976279258728,
"num_tokens": 3951508.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.2306000143289566,
"learning_rate": 0.0001944709990918489,
"loss": 2.2095,
"mean_token_accuracy": 0.5186269879341125,
"num_tokens": 4005526.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.24925322830677032,
"learning_rate": 0.00019427718526063856,
"loss": 2.2771,
"mean_token_accuracy": 0.5064836144447327,
"num_tokens": 4060883.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.24365416169166565,
"learning_rate": 0.00019408013269356408,
"loss": 2.2302,
"mean_token_accuracy": 0.5153389573097229,
"num_tokens": 4116720.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.2500327229499817,
"learning_rate": 0.00019387984816003867,
"loss": 2.2153,
"mean_token_accuracy": 0.5156280994415283,
"num_tokens": 4171909.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.2392851859331131,
"learning_rate": 0.00019367633854050422,
"loss": 2.2053,
"mean_token_accuracy": 0.5209515690803528,
"num_tokens": 4223258.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.25848275423049927,
"learning_rate": 0.00019346961082619522,
"loss": 2.1435,
"mean_token_accuracy": 0.5287906527519226,
"num_tokens": 4276360.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.2851516902446747,
"learning_rate": 0.00019325967211889834,
"loss": 2.0766,
"mean_token_accuracy": 0.5436299443244934,
"num_tokens": 4327593.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.24724675714969635,
"learning_rate": 0.0001930465296307087,
"loss": 2.1137,
"mean_token_accuracy": 0.5325369834899902,
"num_tokens": 4381903.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.2525455951690674,
"learning_rate": 0.00019283019068378182,
"loss": 2.1432,
"mean_token_accuracy": 0.5336418747901917,
"num_tokens": 4436200.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.25476905703544617,
"learning_rate": 0.00019261066271008235,
"loss": 2.0469,
"mean_token_accuracy": 0.5430089831352234,
"num_tokens": 4488753.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.2865007817745209,
"learning_rate": 0.0001923879532511287,
"loss": 2.0638,
"mean_token_accuracy": 0.5452839732170105,
"num_tokens": 4541054.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.3013957440853119,
"learning_rate": 0.00019216206995773373,
"loss": 2.0805,
"mean_token_accuracy": 0.5348638892173767,
"num_tokens": 4595128.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.254112184047699,
"learning_rate": 0.00019193302058974232,
"loss": 2.0616,
"mean_token_accuracy": 0.537585973739624,
"num_tokens": 4646940.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.2646372318267822,
"learning_rate": 0.00019170081301576444,
"loss": 2.0863,
"mean_token_accuracy": 0.5361210703849792,
"num_tokens": 4699591.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.2960815131664276,
"learning_rate": 0.00019146545521290495,
"loss": 2.0699,
"mean_token_accuracy": 0.5427575707435608,
"num_tokens": 4751599.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.25750261545181274,
"learning_rate": 0.00019122695526648968,
"loss": 2.1036,
"mean_token_accuracy": 0.5315433144569397,
"num_tokens": 4809837.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.4250410199165344,
"learning_rate": 0.00019098532136978754,
"loss": 2.0947,
"mean_token_accuracy": 0.5293768048286438,
"num_tokens": 4865472.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.2557165324687958,
"learning_rate": 0.00019074056182372907,
"loss": 2.0543,
"mean_token_accuracy": 0.5417463183403015,
"num_tokens": 4917852.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.3148958384990692,
"learning_rate": 0.00019049268503662126,
"loss": 2.1255,
"mean_token_accuracy": 0.5321261286735535,
"num_tokens": 4972202.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.22774221003055573,
"learning_rate": 0.00019024169952385885,
"loss": 2.0793,
"mean_token_accuracy": 0.5393686890602112,
"num_tokens": 5028656.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.32660016417503357,
"learning_rate": 0.00018998761390763154,
"loss": 2.0631,
"mean_token_accuracy": 0.5409747958183289,
"num_tokens": 5080935.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.2552703619003296,
"learning_rate": 0.00018973043691662803,
"loss": 2.0697,
"mean_token_accuracy": 0.5411579012870789,
"num_tokens": 5131609.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.3084775507450104,
"learning_rate": 0.000189470177385736,
"loss": 2.069,
"mean_token_accuracy": 0.5433229804039001,
"num_tokens": 5186563.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.2627609074115753,
"learning_rate": 0.00018920684425573865,
"loss": 2.1484,
"mean_token_accuracy": 0.5229992270469666,
"num_tokens": 5240868.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.3135717809200287,
"learning_rate": 0.00018894044657300765,
"loss": 2.0522,
"mean_token_accuracy": 0.5427237153053284,
"num_tokens": 5296826.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.23775604367256165,
"learning_rate": 0.00018867099348919217,
"loss": 2.1287,
"mean_token_accuracy": 0.5334255695343018,
"num_tokens": 5351818.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.2612893581390381,
"learning_rate": 0.0001883984942609047,
"loss": 2.0926,
"mean_token_accuracy": 0.5350447297096252,
"num_tokens": 5405328.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.29380878806114197,
"learning_rate": 0.00018812295824940285,
"loss": 2.03,
"mean_token_accuracy": 0.5474804043769836,
"num_tokens": 5456234.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.2552684545516968,
"learning_rate": 0.00018784439492026798,
"loss": 2.1386,
"mean_token_accuracy": 0.5273610353469849,
"num_tokens": 5510225.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.2983575761318207,
"learning_rate": 0.00018756281384307982,
"loss": 2.1227,
"mean_token_accuracy": 0.529445230960846,
"num_tokens": 5564780.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.26163336634635925,
"learning_rate": 0.0001872782246910879,
"loss": 2.045,
"mean_token_accuracy": 0.5461205840110779,
"num_tokens": 5615071.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.3032778799533844,
"learning_rate": 0.00018699063724087904,
"loss": 2.1803,
"mean_token_accuracy": 0.5188722014427185,
"num_tokens": 5672415.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.2592957615852356,
"learning_rate": 0.0001867000613720417,
"loss": 2.0498,
"mean_token_accuracy": 0.5388314723968506,
"num_tokens": 5725503.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.29061180353164673,
"learning_rate": 0.0001864065070668265,
"loss": 2.098,
"mean_token_accuracy": 0.5372474193572998,
"num_tokens": 5778470.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.26013630628585815,
"learning_rate": 0.00018610998440980324,
"loss": 2.0141,
"mean_token_accuracy": 0.5491858124732971,
"num_tokens": 5832086.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.26930177211761475,
"learning_rate": 0.00018581050358751445,
"loss": 2.1008,
"mean_token_accuracy": 0.5337706804275513,
"num_tokens": 5884133.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.2522057294845581,
"learning_rate": 0.00018550807488812562,
"loss": 2.0286,
"mean_token_accuracy": 0.547819197177887,
"num_tokens": 5936059.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.30630195140838623,
"learning_rate": 0.00018520270870107166,
"loss": 2.0577,
"mean_token_accuracy": 0.5432639718055725,
"num_tokens": 5989782.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.29105985164642334,
"learning_rate": 0.00018489441551669986,
"loss": 2.091,
"mean_token_accuracy": 0.5343809127807617,
"num_tokens": 6044702.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.2534923255443573,
"learning_rate": 0.00018458320592590975,
"loss": 2.0732,
"mean_token_accuracy": 0.5419034361839294,
"num_tokens": 6097733.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.3388892114162445,
"learning_rate": 0.00018426909061978908,
"loss": 2.0036,
"mean_token_accuracy": 0.5546702146530151,
"num_tokens": 6148501.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.24488019943237305,
"learning_rate": 0.00018395208038924667,
"loss": 2.0736,
"mean_token_accuracy": 0.5427255034446716,
"num_tokens": 6204129.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.30311962962150574,
"learning_rate": 0.00018363218612464158,
"loss": 2.0696,
"mean_token_accuracy": 0.5433797240257263,
"num_tokens": 6252960.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.2518928050994873,
"learning_rate": 0.00018330941881540915,
"loss": 2.1633,
"mean_token_accuracy": 0.5237207412719727,
"num_tokens": 6309325.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.27587708830833435,
"learning_rate": 0.00018298378954968337,
"loss": 2.0865,
"mean_token_accuracy": 0.5355247855186462,
"num_tokens": 6363661.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.25085651874542236,
"learning_rate": 0.0001826553095139159,
"loss": 2.0476,
"mean_token_accuracy": 0.5387334227561951,
"num_tokens": 6418897.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.27475208044052124,
"learning_rate": 0.00018232398999249192,
"loss": 2.0465,
"mean_token_accuracy": 0.5438748598098755,
"num_tokens": 6471964.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.2808888554573059,
"learning_rate": 0.00018198984236734246,
"loss": 2.1187,
"mean_token_accuracy": 0.5324656367301941,
"num_tokens": 6526578.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.25396695733070374,
"learning_rate": 0.0001816528781175533,
"loss": 2.1141,
"mean_token_accuracy": 0.5278106331825256,
"num_tokens": 6579913.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.26733213663101196,
"learning_rate": 0.0001813131088189707,
"loss": 1.9808,
"mean_token_accuracy": 0.5578979253768921,
"num_tokens": 6629737.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.25329867005348206,
"learning_rate": 0.00018097054614380365,
"loss": 2.0034,
"mean_token_accuracy": 0.5492294430732727,
"num_tokens": 6682879.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.2658468186855316,
"learning_rate": 0.000180625201860223,
"loss": 2.1381,
"mean_token_accuracy": 0.527422308921814,
"num_tokens": 6735929.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.23761491477489471,
"learning_rate": 0.0001802770878319571,
"loss": 2.1088,
"mean_token_accuracy": 0.5335116982460022,
"num_tokens": 6791675.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.26158007979393005,
"learning_rate": 0.00017992621601788428,
"loss": 2.0366,
"mean_token_accuracy": 0.5437957048416138,
"num_tokens": 6845500.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.2551691234111786,
"learning_rate": 0.00017957259847162205,
"loss": 2.0507,
"mean_token_accuracy": 0.5451430082321167,
"num_tokens": 6897510.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.2645633816719055,
"learning_rate": 0.00017921624734111292,
"loss": 2.0529,
"mean_token_accuracy": 0.542524516582489,
"num_tokens": 6951343.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.25614386796951294,
"learning_rate": 0.00017885717486820722,
"loss": 2.1082,
"mean_token_accuracy": 0.5370593070983887,
"num_tokens": 7004619.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.2779742181301117,
"learning_rate": 0.00017849539338824231,
"loss": 1.9767,
"mean_token_accuracy": 0.558155357837677,
"num_tokens": 7056140.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.2670557498931885,
"learning_rate": 0.0001781309153296192,
"loss": 2.0374,
"mean_token_accuracy": 0.5427295565605164,
"num_tokens": 7108147.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.2564358711242676,
"learning_rate": 0.00017776375321337521,
"loss": 2.1222,
"mean_token_accuracy": 0.530992865562439,
"num_tokens": 7162046.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.2533285617828369,
"learning_rate": 0.00017739391965275404,
"loss": 2.078,
"mean_token_accuracy": 0.5365890264511108,
"num_tokens": 7215432.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.2570582926273346,
"learning_rate": 0.00017702142735277247,
"loss": 2.0243,
"mean_token_accuracy": 0.5478048324584961,
"num_tokens": 7269455.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.27466800808906555,
"learning_rate": 0.00017664628910978375,
"loss": 2.0785,
"mean_token_accuracy": 0.5374588966369629,
"num_tokens": 7325754.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.29858797788619995,
"learning_rate": 0.0001762685178110382,
"loss": 2.0338,
"mean_token_accuracy": 0.5446484684944153,
"num_tokens": 7380064.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.26779335737228394,
"learning_rate": 0.00017588812643424032,
"loss": 2.0546,
"mean_token_accuracy": 0.5391934514045715,
"num_tokens": 7434359.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.2574562430381775,
"learning_rate": 0.0001755051280471031,
"loss": 2.0319,
"mean_token_accuracy": 0.5409929156303406,
"num_tokens": 7483712.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.31137484312057495,
"learning_rate": 0.00017511953580689888,
"loss": 2.0427,
"mean_token_accuracy": 0.5435848832130432,
"num_tokens": 7537602.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.31535619497299194,
"learning_rate": 0.00017473136296000772,
"loss": 1.9553,
"mean_token_accuracy": 0.5641329884529114,
"num_tokens": 7589870.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.2668202519416809,
"learning_rate": 0.000174340622841462,
"loss": 2.0205,
"mean_token_accuracy": 0.5494571924209595,
"num_tokens": 7644284.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.26058775186538696,
"learning_rate": 0.00017394732887448847,
"loss": 2.1271,
"mean_token_accuracy": 0.527405321598053,
"num_tokens": 7699465.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.2781299948692322,
"learning_rate": 0.00017355149457004709,
"loss": 1.9947,
"mean_token_accuracy": 0.5520567297935486,
"num_tokens": 7751165.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.26897257566452026,
"learning_rate": 0.0001731531335263669,
"loss": 2.0708,
"mean_token_accuracy": 0.5371328592300415,
"num_tokens": 7804955.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.3198035955429077,
"learning_rate": 0.0001727522594284789,
"loss": 2.0811,
"mean_token_accuracy": 0.5379791259765625,
"num_tokens": 7860668.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.2609718143939972,
"learning_rate": 0.00017234888604774574,
"loss": 2.0328,
"mean_token_accuracy": 0.542784571647644,
"num_tokens": 7915857.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.31711193919181824,
"learning_rate": 0.00017194302724138903,
"loss": 2.0753,
"mean_token_accuracy": 0.5399681925773621,
"num_tokens": 7969326.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.3608168959617615,
"learning_rate": 0.00017153469695201277,
"loss": 2.0528,
"mean_token_accuracy": 0.5399906039237976,
"num_tokens": 8022615.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.2569022476673126,
"learning_rate": 0.0001711239092071248,
"loss": 2.0195,
"mean_token_accuracy": 0.5482782125473022,
"num_tokens": 8075995.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.3743065595626831,
"learning_rate": 0.00017071067811865476,
"loss": 2.0105,
"mean_token_accuracy": 0.5483627915382385,
"num_tokens": 8125167.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.25395363569259644,
"learning_rate": 0.00017029501788246924,
"loss": 2.0084,
"mean_token_accuracy": 0.5484933257102966,
"num_tokens": 8179589.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.3222920894622803,
"learning_rate": 0.00016987694277788417,
"loss": 1.9888,
"mean_token_accuracy": 0.5601121187210083,
"num_tokens": 8228886.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.2416379451751709,
"learning_rate": 0.0001694564671671743,
"loss": 2.0704,
"mean_token_accuracy": 0.5397144556045532,
"num_tokens": 8284635.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.2981293797492981,
"learning_rate": 0.0001690336054950797,
"loss": 2.1268,
"mean_token_accuracy": 0.5291581153869629,
"num_tokens": 8340584.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.263873815536499,
"learning_rate": 0.00016860837228830974,
"loss": 2.0321,
"mean_token_accuracy": 0.5468259453773499,
"num_tokens": 8394144.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.31899693608283997,
"learning_rate": 0.0001681807821550438,
"loss": 1.9678,
"mean_token_accuracy": 0.554486870765686,
"num_tokens": 8448377.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.29040661454200745,
"learning_rate": 0.00016775084978442955,
"loss": 1.889,
"mean_token_accuracy": 0.5655468106269836,
"num_tokens": 8502288.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.4248679578304291,
"learning_rate": 0.00016731858994607838,
"loss": 1.8803,
"mean_token_accuracy": 0.5686565637588501,
"num_tokens": 8554248.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.37469160556793213,
"learning_rate": 0.00016688401748955802,
"loss": 1.853,
"mean_token_accuracy": 0.5755634307861328,
"num_tokens": 8607380.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.32907748222351074,
"learning_rate": 0.00016644714734388217,
"loss": 1.946,
"mean_token_accuracy": 0.5507125854492188,
"num_tokens": 8661612.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.35196223855018616,
"learning_rate": 0.00016600799451699802,
"loss": 1.8451,
"mean_token_accuracy": 0.5690965056419373,
"num_tokens": 8713806.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.29669368267059326,
"learning_rate": 0.0001655665740952703,
"loss": 1.8824,
"mean_token_accuracy": 0.5658582448959351,
"num_tokens": 8770112.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.31338831782341003,
"learning_rate": 0.00016512290124296336,
"loss": 1.8446,
"mean_token_accuracy": 0.5760558247566223,
"num_tokens": 8825655.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.3266657888889313,
"learning_rate": 0.00016467699120171987,
"loss": 1.8758,
"mean_token_accuracy": 0.5682055950164795,
"num_tokens": 8879263.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.343274861574173,
"learning_rate": 0.00016422885929003758,
"loss": 1.7457,
"mean_token_accuracy": 0.5934667587280273,
"num_tokens": 8929195.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.3215281665325165,
"learning_rate": 0.00016377852090274276,
"loss": 1.821,
"mean_token_accuracy": 0.5799418687820435,
"num_tokens": 8980171.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.35965943336486816,
"learning_rate": 0.0001633259915104616,
"loss": 1.8355,
"mean_token_accuracy": 0.5785340070724487,
"num_tokens": 9034861.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.39557531476020813,
"learning_rate": 0.0001628712866590885,
"loss": 1.799,
"mean_token_accuracy": 0.5816659331321716,
"num_tokens": 9090450.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.30929461121559143,
"learning_rate": 0.00016241442196925223,
"loss": 1.8251,
"mean_token_accuracy": 0.5757784843444824,
"num_tokens": 9141254.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.3711070120334625,
"learning_rate": 0.00016195541313577923,
"loss": 1.8639,
"mean_token_accuracy": 0.5689946413040161,
"num_tokens": 9194554.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.36852866411209106,
"learning_rate": 0.00016149427592715432,
"loss": 1.8202,
"mean_token_accuracy": 0.5803923010826111,
"num_tokens": 9248454.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.30636078119277954,
"learning_rate": 0.00016103102618497922,
"loss": 1.9217,
"mean_token_accuracy": 0.5586243271827698,
"num_tokens": 9301960.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.365090936422348,
"learning_rate": 0.00016056567982342817,
"loss": 1.7946,
"mean_token_accuracy": 0.585414707660675,
"num_tokens": 9354954.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.3484059274196625,
"learning_rate": 0.00016009825282870126,
"loss": 1.7078,
"mean_token_accuracy": 0.6031553149223328,
"num_tokens": 9407754.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.3187144100666046,
"learning_rate": 0.00015962876125847535,
"loss": 1.9279,
"mean_token_accuracy": 0.5545867681503296,
"num_tokens": 9461265.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.38731351494789124,
"learning_rate": 0.00015915722124135227,
"loss": 1.8782,
"mean_token_accuracy": 0.5675600171089172,
"num_tokens": 9515170.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.3368418514728546,
"learning_rate": 0.0001586836489763049,
"loss": 1.7767,
"mean_token_accuracy": 0.5821657180786133,
"num_tokens": 9570117.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.33595919609069824,
"learning_rate": 0.00015820806073212055,
"loss": 1.8194,
"mean_token_accuracy": 0.5774704217910767,
"num_tokens": 9620355.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.3396199941635132,
"learning_rate": 0.0001577304728468422,
"loss": 1.7706,
"mean_token_accuracy": 0.5850851535797119,
"num_tokens": 9670463.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.33389562368392944,
"learning_rate": 0.0001572509017272072,
"loss": 1.8639,
"mean_token_accuracy": 0.5703521966934204,
"num_tokens": 9723880.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.3759293854236603,
"learning_rate": 0.00015676936384808354,
"loss": 1.9416,
"mean_token_accuracy": 0.5503548383712769,
"num_tokens": 9780026.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.3279268145561218,
"learning_rate": 0.00015628587575190395,
"loss": 1.8682,
"mean_token_accuracy": 0.5664793252944946,
"num_tokens": 9834182.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.33523041009902954,
"learning_rate": 0.00015580045404809772,
"loss": 1.8708,
"mean_token_accuracy": 0.5720546245574951,
"num_tokens": 9889926.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.31567129492759705,
"learning_rate": 0.00015531311541251995,
"loss": 1.8889,
"mean_token_accuracy": 0.5600780248641968,
"num_tokens": 9945343.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.32239577174186707,
"learning_rate": 0.00015482387658687875,
"loss": 1.84,
"mean_token_accuracy": 0.5734173655509949,
"num_tokens": 9997772.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.34426018595695496,
"learning_rate": 0.00015433275437816004,
"loss": 1.8681,
"mean_token_accuracy": 0.5655243396759033,
"num_tokens": 10052083.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.32579970359802246,
"learning_rate": 0.00015383976565805035,
"loss": 1.848,
"mean_token_accuracy": 0.5735384225845337,
"num_tokens": 10105908.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.313778817653656,
"learning_rate": 0.00015334492736235705,
"loss": 1.9487,
"mean_token_accuracy": 0.55268394947052,
"num_tokens": 10161226.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.3332686722278595,
"learning_rate": 0.00015284825649042655,
"loss": 1.7781,
"mean_token_accuracy": 0.592665433883667,
"num_tokens": 10214163.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.31427377462387085,
"learning_rate": 0.00015234977010456047,
"loss": 1.7905,
"mean_token_accuracy": 0.5814598202705383,
"num_tokens": 10268714.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.3140884339809418,
"learning_rate": 0.00015184948532942928,
"loss": 1.8759,
"mean_token_accuracy": 0.5640963315963745,
"num_tokens": 10322260.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.314708948135376,
"learning_rate": 0.0001513474193514842,
"loss": 1.8658,
"mean_token_accuracy": 0.5691792368888855,
"num_tokens": 10377579.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.31301847100257874,
"learning_rate": 0.0001508435894183667,
"loss": 1.8546,
"mean_token_accuracy": 0.5749539732933044,
"num_tokens": 10432470.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.31218788027763367,
"learning_rate": 0.00015033801283831596,
"loss": 1.9022,
"mean_token_accuracy": 0.5633723735809326,
"num_tokens": 10484189.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.3280318081378937,
"learning_rate": 0.00014983070697957438,
"loss": 1.7818,
"mean_token_accuracy": 0.5819751620292664,
"num_tokens": 10536958.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.3817770481109619,
"learning_rate": 0.00014932168926979074,
"loss": 1.841,
"mean_token_accuracy": 0.5792132616043091,
"num_tokens": 10591451.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.35046157240867615,
"learning_rate": 0.00014881097719542173,
"loss": 1.8229,
"mean_token_accuracy": 0.5766626596450806,
"num_tokens": 10646157.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.3283882439136505,
"learning_rate": 0.000148298588301131,
"loss": 1.8715,
"mean_token_accuracy": 0.5702670216560364,
"num_tokens": 10700706.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.3310740292072296,
"learning_rate": 0.0001477845401891867,
"loss": 1.9048,
"mean_token_accuracy": 0.5702333450317383,
"num_tokens": 10752882.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.33611828088760376,
"learning_rate": 0.00014726885051885653,
"loss": 1.8881,
"mean_token_accuracy": 0.5651430487632751,
"num_tokens": 10807334.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.32620447874069214,
"learning_rate": 0.00014675153700580124,
"loss": 1.8265,
"mean_token_accuracy": 0.5770817995071411,
"num_tokens": 10859985.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.3716906011104584,
"learning_rate": 0.00014623261742146602,
"loss": 1.8504,
"mean_token_accuracy": 0.5766309499740601,
"num_tokens": 10912058.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.43748190999031067,
"learning_rate": 0.00014571210959246988,
"loss": 1.9149,
"mean_token_accuracy": 0.5612872838973999,
"num_tokens": 10964792.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.3213548958301544,
"learning_rate": 0.00014519003139999337,
"loss": 1.7896,
"mean_token_accuracy": 0.582744836807251,
"num_tokens": 11020364.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.4236705005168915,
"learning_rate": 0.0001446664007791644,
"loss": 1.887,
"mean_token_accuracy": 0.5643614530563354,
"num_tokens": 11075593.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.3708915114402771,
"learning_rate": 0.00014414123571844178,
"loss": 1.7496,
"mean_token_accuracy": 0.59052973985672,
"num_tokens": 11128137.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.36450517177581787,
"learning_rate": 0.00014361455425899756,
"loss": 1.8051,
"mean_token_accuracy": 0.579054057598114,
"num_tokens": 11180975.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.34610500931739807,
"learning_rate": 0.00014308637449409706,
"loss": 1.8752,
"mean_token_accuracy": 0.566521406173706,
"num_tokens": 11235420.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.32428479194641113,
"learning_rate": 0.00014255671456847748,
"loss": 1.846,
"mean_token_accuracy": 0.5711670517921448,
"num_tokens": 11290657.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.3470180630683899,
"learning_rate": 0.00014202559267772444,
"loss": 1.9229,
"mean_token_accuracy": 0.5572388172149658,
"num_tokens": 11346697.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.3158308267593384,
"learning_rate": 0.00014149302706764697,
"loss": 1.8882,
"mean_token_accuracy": 0.5655895471572876,
"num_tokens": 11400268.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.3739509880542755,
"learning_rate": 0.00014095903603365066,
"loss": 1.8327,
"mean_token_accuracy": 0.5739619731903076,
"num_tokens": 11457003.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.3665842115879059,
"learning_rate": 0.0001404236379201091,
"loss": 1.855,
"mean_token_accuracy": 0.5749245285987854,
"num_tokens": 11507411.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.33928871154785156,
"learning_rate": 0.00013988685111973384,
"loss": 1.7869,
"mean_token_accuracy": 0.5864142179489136,
"num_tokens": 11559706.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.376045823097229,
"learning_rate": 0.00013934869407294245,
"loss": 1.9374,
"mean_token_accuracy": 0.5520438551902771,
"num_tokens": 11617577.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.31934303045272827,
"learning_rate": 0.00013880918526722497,
"loss": 1.8828,
"mean_token_accuracy": 0.5626968741416931,
"num_tokens": 11675100.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.3510988652706146,
"learning_rate": 0.000138268343236509,
"loss": 1.8147,
"mean_token_accuracy": 0.5796269178390503,
"num_tokens": 11727056.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.3386330306529999,
"learning_rate": 0.0001377261865605227,
"loss": 1.8044,
"mean_token_accuracy": 0.5796509385108948,
"num_tokens": 11775594.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.36835694313049316,
"learning_rate": 0.0001371827338641568,
"loss": 1.8303,
"mean_token_accuracy": 0.5750265717506409,
"num_tokens": 11827393.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.3421669006347656,
"learning_rate": 0.00013663800381682464,
"loss": 1.8834,
"mean_token_accuracy": 0.5673810243606567,
"num_tokens": 11881070.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.3295755684375763,
"learning_rate": 0.00013609201513182075,
"loss": 1.9107,
"mean_token_accuracy": 0.557906448841095,
"num_tokens": 11938701.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.34180569648742676,
"learning_rate": 0.00013554478656567818,
"loss": 1.8386,
"mean_token_accuracy": 0.577558696269989,
"num_tokens": 11991409.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.3204934000968933,
"learning_rate": 0.0001349963369175239,
"loss": 1.9146,
"mean_token_accuracy": 0.5546259880065918,
"num_tokens": 12048012.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.3490206003189087,
"learning_rate": 0.0001344466850284333,
"loss": 1.861,
"mean_token_accuracy": 0.573200523853302,
"num_tokens": 12098868.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.32708510756492615,
"learning_rate": 0.00013389584978078258,
"loss": 1.8304,
"mean_token_accuracy": 0.5713738799095154,
"num_tokens": 12153777.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.33750301599502563,
"learning_rate": 0.00013334385009760032,
"loss": 1.8488,
"mean_token_accuracy": 0.5716525912284851,
"num_tokens": 12204858.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.35124820470809937,
"learning_rate": 0.00013279070494191737,
"loss": 1.8847,
"mean_token_accuracy": 0.569037675857544,
"num_tokens": 12258219.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.32959967851638794,
"learning_rate": 0.00013223643331611537,
"loss": 1.827,
"mean_token_accuracy": 0.578726589679718,
"num_tokens": 12308590.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.35620811581611633,
"learning_rate": 0.000131681054261274,
"loss": 1.7977,
"mean_token_accuracy": 0.5861988663673401,
"num_tokens": 12360244.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.32876428961753845,
"learning_rate": 0.00013112458685651668,
"loss": 1.7982,
"mean_token_accuracy": 0.5834053754806519,
"num_tokens": 12410047.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.329098105430603,
"learning_rate": 0.00013056705021835546,
"loss": 1.8335,
"mean_token_accuracy": 0.5807684659957886,
"num_tokens": 12465052.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.3197422921657562,
"learning_rate": 0.0001300084635000341,
"loss": 1.8429,
"mean_token_accuracy": 0.5740662217140198,
"num_tokens": 12517110.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.3175854980945587,
"learning_rate": 0.00012944884589086993,
"loss": 1.8138,
"mean_token_accuracy": 0.5791066884994507,
"num_tokens": 12570033.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.32739362120628357,
"learning_rate": 0.00012888821661559508,
"loss": 1.8057,
"mean_token_accuracy": 0.5797368288040161,
"num_tokens": 12620563.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.3728819191455841,
"learning_rate": 0.00012832659493369557,
"loss": 1.6939,
"mean_token_accuracy": 0.5952839851379395,
"num_tokens": 12674613.0,
"step": 237
},
{
"epoch": 3.0126582278481013,
"grad_norm": 0.42436647415161133,
"learning_rate": 0.00012776400013875006,
"loss": 1.5034,
"mean_token_accuracy": 0.6346282958984375,
"num_tokens": 12725335.0,
"step": 238
},
{
"epoch": 3.0253164556962027,
"grad_norm": 0.4612860381603241,
"learning_rate": 0.0001272004515577668,
"loss": 1.5386,
"mean_token_accuracy": 0.6292459964752197,
"num_tokens": 12775888.0,
"step": 239
},
{
"epoch": 3.037974683544304,
"grad_norm": 0.6946155428886414,
"learning_rate": 0.0001266359685505198,
"loss": 1.5901,
"mean_token_accuracy": 0.617897093296051,
"num_tokens": 12828765.0,
"step": 240
},
{
"epoch": 3.050632911392405,
"grad_norm": 0.4287043809890747,
"learning_rate": 0.0001260705705088837,
"loss": 1.5589,
"mean_token_accuracy": 0.6239352226257324,
"num_tokens": 12880836.0,
"step": 241
},
{
"epoch": 3.0632911392405062,
"grad_norm": 0.4556795060634613,
"learning_rate": 0.00012550427685616765,
"loss": 1.5111,
"mean_token_accuracy": 0.6317170262336731,
"num_tokens": 12932355.0,
"step": 242
},
{
"epoch": 3.0759493670886076,
"grad_norm": 0.4299950897693634,
"learning_rate": 0.00012493710704644805,
"loss": 1.5545,
"mean_token_accuracy": 0.6259156465530396,
"num_tokens": 12984295.0,
"step": 243
},
{
"epoch": 3.088607594936709,
"grad_norm": 0.41609516739845276,
"learning_rate": 0.0001243690805639002,
"loss": 1.623,
"mean_token_accuracy": 0.6103270649909973,
"num_tokens": 13040406.0,
"step": 244
},
{
"epoch": 3.1012658227848102,
"grad_norm": 0.4679557681083679,
"learning_rate": 0.00012380021692212894,
"loss": 1.6624,
"mean_token_accuracy": 0.6014009714126587,
"num_tokens": 13097146.0,
"step": 245
},
{
"epoch": 3.1139240506329116,
"grad_norm": 0.5160155892372131,
"learning_rate": 0.00012323053566349834,
"loss": 1.608,
"mean_token_accuracy": 0.6115766167640686,
"num_tokens": 13153064.0,
"step": 246
},
{
"epoch": 3.1265822784810124,
"grad_norm": 0.4674924314022064,
"learning_rate": 0.00012266005635846037,
"loss": 1.5492,
"mean_token_accuracy": 0.6278569102287292,
"num_tokens": 13207908.0,
"step": 247
},
{
"epoch": 3.1392405063291138,
"grad_norm": 0.45278114080429077,
"learning_rate": 0.0001220887986048825,
"loss": 1.5134,
"mean_token_accuracy": 0.6304005980491638,
"num_tokens": 13256925.0,
"step": 248
},
{
"epoch": 3.151898734177215,
"grad_norm": 0.4184185564517975,
"learning_rate": 0.00012151678202737456,
"loss": 1.6149,
"mean_token_accuracy": 0.6162724494934082,
"num_tokens": 13311314.0,
"step": 249
},
{
"epoch": 3.1645569620253164,
"grad_norm": 0.4231603443622589,
"learning_rate": 0.00012094402627661447,
"loss": 1.5758,
"mean_token_accuracy": 0.6183434128761292,
"num_tokens": 13366962.0,
"step": 250
},
{
"epoch": 3.1772151898734178,
"grad_norm": 0.4317049980163574,
"learning_rate": 0.00012037055102867321,
"loss": 1.5862,
"mean_token_accuracy": 0.6172645092010498,
"num_tokens": 13419156.0,
"step": 251
},
{
"epoch": 3.189873417721519,
"grad_norm": 0.43530407547950745,
"learning_rate": 0.00011979637598433899,
"loss": 1.6126,
"mean_token_accuracy": 0.6087615489959717,
"num_tokens": 13473982.0,
"step": 252
},
{
"epoch": 3.2025316455696204,
"grad_norm": 0.46672239899635315,
"learning_rate": 0.00011922152086844023,
"loss": 1.556,
"mean_token_accuracy": 0.6229726076126099,
"num_tokens": 13524480.0,
"step": 253
},
{
"epoch": 3.2151898734177213,
"grad_norm": 0.455728143453598,
"learning_rate": 0.00011864600542916813,
"loss": 1.611,
"mean_token_accuracy": 0.6102961897850037,
"num_tokens": 13577923.0,
"step": 254
},
{
"epoch": 3.2278481012658227,
"grad_norm": 0.4760991930961609,
"learning_rate": 0.00011806984943739821,
"loss": 1.562,
"mean_token_accuracy": 0.6255306005477905,
"num_tokens": 13629815.0,
"step": 255
},
{
"epoch": 3.240506329113924,
"grad_norm": 0.4103173315525055,
"learning_rate": 0.00011749307268601111,
"loss": 1.6351,
"mean_token_accuracy": 0.602997899055481,
"num_tokens": 13687720.0,
"step": 256
},
{
"epoch": 3.2531645569620253,
"grad_norm": 0.4410172998905182,
"learning_rate": 0.00011691569498921264,
"loss": 1.6159,
"mean_token_accuracy": 0.6079987287521362,
"num_tokens": 13743993.0,
"step": 257
},
{
"epoch": 3.2658227848101267,
"grad_norm": 0.4677037000656128,
"learning_rate": 0.00011633773618185302,
"loss": 1.5324,
"mean_token_accuracy": 0.6266757845878601,
"num_tokens": 13795152.0,
"step": 258
},
{
"epoch": 3.278481012658228,
"grad_norm": 0.4234687387943268,
"learning_rate": 0.00011575921611874565,
"loss": 1.5927,
"mean_token_accuracy": 0.6112661957740784,
"num_tokens": 13850390.0,
"step": 259
},
{
"epoch": 3.291139240506329,
"grad_norm": 0.47788316011428833,
"learning_rate": 0.00011518015467398489,
"loss": 1.6094,
"mean_token_accuracy": 0.6132988929748535,
"num_tokens": 13905000.0,
"step": 260
},
{
"epoch": 3.3037974683544302,
"grad_norm": 0.48243483901023865,
"learning_rate": 0.00011460057174026335,
"loss": 1.6604,
"mean_token_accuracy": 0.6029521822929382,
"num_tokens": 13958652.0,
"step": 261
},
{
"epoch": 3.3164556962025316,
"grad_norm": 0.43476489186286926,
"learning_rate": 0.0001140204872281886,
"loss": 1.6219,
"mean_token_accuracy": 0.61234050989151,
"num_tokens": 14012717.0,
"step": 262
},
{
"epoch": 3.329113924050633,
"grad_norm": 0.43300172686576843,
"learning_rate": 0.00011343992106559898,
"loss": 1.5688,
"mean_token_accuracy": 0.6212312579154968,
"num_tokens": 14067408.0,
"step": 263
},
{
"epoch": 3.3417721518987342,
"grad_norm": 0.43267443776130676,
"learning_rate": 0.00011285889319687923,
"loss": 1.5304,
"mean_token_accuracy": 0.6297682523727417,
"num_tokens": 14122235.0,
"step": 264
},
{
"epoch": 3.3544303797468356,
"grad_norm": 0.44928601384162903,
"learning_rate": 0.00011227742358227522,
"loss": 1.5597,
"mean_token_accuracy": 0.6211428046226501,
"num_tokens": 14177164.0,
"step": 265
},
{
"epoch": 3.367088607594937,
"grad_norm": 0.4439207911491394,
"learning_rate": 0.00011169553219720828,
"loss": 1.5676,
"mean_token_accuracy": 0.6210277676582336,
"num_tokens": 14230158.0,
"step": 266
},
{
"epoch": 3.379746835443038,
"grad_norm": 0.48783257603645325,
"learning_rate": 0.00011111323903158885,
"loss": 1.614,
"mean_token_accuracy": 0.6099197268486023,
"num_tokens": 14283429.0,
"step": 267
},
{
"epoch": 3.392405063291139,
"grad_norm": 0.49185577034950256,
"learning_rate": 0.00011053056408913001,
"loss": 1.5395,
"mean_token_accuracy": 0.6258946061134338,
"num_tokens": 14335612.0,
"step": 268
},
{
"epoch": 3.4050632911392404,
"grad_norm": 0.4414823651313782,
"learning_rate": 0.0001099475273866601,
"loss": 1.6256,
"mean_token_accuracy": 0.6063946485519409,
"num_tokens": 14389471.0,
"step": 269
},
{
"epoch": 3.4177215189873418,
"grad_norm": 0.4640585780143738,
"learning_rate": 0.0001093641489534351,
"loss": 1.6266,
"mean_token_accuracy": 0.6118572354316711,
"num_tokens": 14442549.0,
"step": 270
},
{
"epoch": 3.430379746835443,
"grad_norm": 0.4561823904514313,
"learning_rate": 0.0001087804488304506,
"loss": 1.6005,
"mean_token_accuracy": 0.6093841791152954,
"num_tokens": 14496917.0,
"step": 271
},
{
"epoch": 3.4430379746835444,
"grad_norm": 0.4885174036026001,
"learning_rate": 0.00010819644706975332,
"loss": 1.564,
"mean_token_accuracy": 0.6223441362380981,
"num_tokens": 14547294.0,
"step": 272
},
{
"epoch": 3.4556962025316453,
"grad_norm": 0.43165430426597595,
"learning_rate": 0.00010761216373375221,
"loss": 1.6193,
"mean_token_accuracy": 0.6121744513511658,
"num_tokens": 14600650.0,
"step": 273
},
{
"epoch": 3.4683544303797467,
"grad_norm": 0.46113377809524536,
"learning_rate": 0.0001070276188945293,
"loss": 1.5433,
"mean_token_accuracy": 0.624561071395874,
"num_tokens": 14653684.0,
"step": 274
},
{
"epoch": 3.481012658227848,
"grad_norm": 0.4514339864253998,
"learning_rate": 0.00010644283263315014,
"loss": 1.6049,
"mean_token_accuracy": 0.6116100549697876,
"num_tokens": 14708528.0,
"step": 275
},
{
"epoch": 3.4936708860759493,
"grad_norm": 0.5267874002456665,
"learning_rate": 0.00010585782503897388,
"loss": 1.6155,
"mean_token_accuracy": 0.6114990711212158,
"num_tokens": 14760857.0,
"step": 276
},
{
"epoch": 3.5063291139240507,
"grad_norm": 0.4393192231655121,
"learning_rate": 0.00010527261620896323,
"loss": 1.5409,
"mean_token_accuracy": 0.6235739588737488,
"num_tokens": 14814302.0,
"step": 277
},
{
"epoch": 3.518987341772152,
"grad_norm": 0.4979285001754761,
"learning_rate": 0.00010468722624699401,
"loss": 1.6588,
"mean_token_accuracy": 0.6001515984535217,
"num_tokens": 14869767.0,
"step": 278
},
{
"epoch": 3.5316455696202533,
"grad_norm": 0.4557904005050659,
"learning_rate": 0.00010410167526316457,
"loss": 1.6458,
"mean_token_accuracy": 0.6057513952255249,
"num_tokens": 14924809.0,
"step": 279
},
{
"epoch": 3.5443037974683547,
"grad_norm": 0.47976383566856384,
"learning_rate": 0.00010351598337310482,
"loss": 1.5589,
"mean_token_accuracy": 0.6206314563751221,
"num_tokens": 14979954.0,
"step": 280
},
{
"epoch": 3.5569620253164556,
"grad_norm": 0.4409061372280121,
"learning_rate": 0.00010293017069728535,
"loss": 1.6327,
"mean_token_accuracy": 0.6080577373504639,
"num_tokens": 15031819.0,
"step": 281
},
{
"epoch": 3.569620253164557,
"grad_norm": 0.47851356863975525,
"learning_rate": 0.00010234425736032607,
"loss": 1.5299,
"mean_token_accuracy": 0.6291932463645935,
"num_tokens": 15083484.0,
"step": 282
},
{
"epoch": 3.5822784810126582,
"grad_norm": 0.44256338477134705,
"learning_rate": 0.00010175826349030496,
"loss": 1.5426,
"mean_token_accuracy": 0.624239444732666,
"num_tokens": 15134003.0,
"step": 283
},
{
"epoch": 3.5949367088607596,
"grad_norm": 0.4588923454284668,
"learning_rate": 0.00010117220921806664,
"loss": 1.5259,
"mean_token_accuracy": 0.6249427199363708,
"num_tokens": 15186435.0,
"step": 284
},
{
"epoch": 3.607594936708861,
"grad_norm": 0.4287813901901245,
"learning_rate": 0.00010058611467653066,
"loss": 1.5826,
"mean_token_accuracy": 0.6139138340950012,
"num_tokens": 15240316.0,
"step": 285
},
{
"epoch": 3.620253164556962,
"grad_norm": 0.44988927245140076,
"learning_rate": 0.0001,
"loss": 1.5698,
"mean_token_accuracy": 0.6190887689590454,
"num_tokens": 15292484.0,
"step": 286
},
{
"epoch": 3.632911392405063,
"grad_norm": 0.4369228780269623,
"learning_rate": 9.941388532346934e-05,
"loss": 1.6259,
"mean_token_accuracy": 0.6063051223754883,
"num_tokens": 15345711.0,
"step": 287
},
{
"epoch": 3.6455696202531644,
"grad_norm": 0.44405412673950195,
"learning_rate": 9.882779078193339e-05,
"loss": 1.5726,
"mean_token_accuracy": 0.6200418472290039,
"num_tokens": 15399323.0,
"step": 288
},
{
"epoch": 3.6582278481012658,
"grad_norm": 0.4382248520851135,
"learning_rate": 9.824173650969507e-05,
"loss": 1.5953,
"mean_token_accuracy": 0.61171555519104,
"num_tokens": 15453247.0,
"step": 289
},
{
"epoch": 3.670886075949367,
"grad_norm": 0.44934383034706116,
"learning_rate": 9.765574263967396e-05,
"loss": 1.5937,
"mean_token_accuracy": 0.621938943862915,
"num_tokens": 15504070.0,
"step": 290
},
{
"epoch": 3.6835443037974684,
"grad_norm": 0.44672778248786926,
"learning_rate": 9.706982930271465e-05,
"loss": 1.5322,
"mean_token_accuracy": 0.6252855658531189,
"num_tokens": 15557540.0,
"step": 291
},
{
"epoch": 3.6962025316455698,
"grad_norm": 0.45192646980285645,
"learning_rate": 9.648401662689521e-05,
"loss": 1.5109,
"mean_token_accuracy": 0.6344218254089355,
"num_tokens": 15606480.0,
"step": 292
},
{
"epoch": 3.708860759493671,
"grad_norm": 0.4427901804447174,
"learning_rate": 9.589832473683547e-05,
"loss": 1.613,
"mean_token_accuracy": 0.614681601524353,
"num_tokens": 15660271.0,
"step": 293
},
{
"epoch": 3.721518987341772,
"grad_norm": 0.45339709520339966,
"learning_rate": 9.531277375300599e-05,
"loss": 1.6333,
"mean_token_accuracy": 0.6080583930015564,
"num_tokens": 15714986.0,
"step": 294
},
{
"epoch": 3.7341772151898733,
"grad_norm": 0.44133368134498596,
"learning_rate": 9.472738379103682e-05,
"loss": 1.5492,
"mean_token_accuracy": 0.6258243918418884,
"num_tokens": 15765390.0,
"step": 295
},
{
"epoch": 3.7468354430379747,
"grad_norm": 0.4260408282279968,
"learning_rate": 9.414217496102614e-05,
"loss": 1.6041,
"mean_token_accuracy": 0.6146592497825623,
"num_tokens": 15820600.0,
"step": 296
},
{
"epoch": 3.759493670886076,
"grad_norm": 0.44411468505859375,
"learning_rate": 9.355716736684988e-05,
"loss": 1.6526,
"mean_token_accuracy": 0.6064497232437134,
"num_tokens": 15875643.0,
"step": 297
},
{
"epoch": 3.7721518987341773,
"grad_norm": 0.43013662099838257,
"learning_rate": 9.297238110547074e-05,
"loss": 1.6829,
"mean_token_accuracy": 0.5955364108085632,
"num_tokens": 15931178.0,
"step": 298
},
{
"epoch": 3.7848101265822782,
"grad_norm": 0.4368194341659546,
"learning_rate": 9.238783626624781e-05,
"loss": 1.5791,
"mean_token_accuracy": 0.6144816875457764,
"num_tokens": 15985338.0,
"step": 299
},
{
"epoch": 3.7974683544303796,
"grad_norm": 0.45760172605514526,
"learning_rate": 9.180355293024669e-05,
"loss": 1.5706,
"mean_token_accuracy": 0.6167289018630981,
"num_tokens": 16038448.0,
"step": 300
},
{
"epoch": 3.810126582278481,
"grad_norm": 0.4340561032295227,
"learning_rate": 9.121955116954942e-05,
"loss": 1.5906,
"mean_token_accuracy": 0.6153745055198669,
"num_tokens": 16091704.0,
"step": 301
},
{
"epoch": 3.8227848101265822,
"grad_norm": 0.42591392993927,
"learning_rate": 9.063585104656493e-05,
"loss": 1.5561,
"mean_token_accuracy": 0.6215280890464783,
"num_tokens": 16145809.0,
"step": 302
},
{
"epoch": 3.8354430379746836,
"grad_norm": 0.4405565857887268,
"learning_rate": 9.005247261333993e-05,
"loss": 1.4882,
"mean_token_accuracy": 0.6390531659126282,
"num_tokens": 16198299.0,
"step": 303
},
{
"epoch": 3.848101265822785,
"grad_norm": 0.4609524607658386,
"learning_rate": 8.946943591087e-05,
"loss": 1.5796,
"mean_token_accuracy": 0.6171963810920715,
"num_tokens": 16251223.0,
"step": 304
},
{
"epoch": 3.8607594936708862,
"grad_norm": 0.4306551218032837,
"learning_rate": 8.88867609684112e-05,
"loss": 1.5733,
"mean_token_accuracy": 0.6200153231620789,
"num_tokens": 16306155.0,
"step": 305
},
{
"epoch": 3.8734177215189876,
"grad_norm": 0.47058236598968506,
"learning_rate": 8.830446780279176e-05,
"loss": 1.599,
"mean_token_accuracy": 0.6126205325126648,
"num_tokens": 16360987.0,
"step": 306
},
{
"epoch": 3.8860759493670884,
"grad_norm": 0.46783286333084106,
"learning_rate": 8.772257641772479e-05,
"loss": 1.5925,
"mean_token_accuracy": 0.6167819499969482,
"num_tokens": 16413238.0,
"step": 307
},
{
"epoch": 3.8987341772151898,
"grad_norm": 0.46523240208625793,
"learning_rate": 8.71411068031208e-05,
"loss": 1.5129,
"mean_token_accuracy": 0.6336224675178528,
"num_tokens": 16467260.0,
"step": 308
},
{
"epoch": 3.911392405063291,
"grad_norm": 0.46208396553993225,
"learning_rate": 8.656007893440106e-05,
"loss": 1.6122,
"mean_token_accuracy": 0.6104090809822083,
"num_tokens": 16520662.0,
"step": 309
},
{
"epoch": 3.9240506329113924,
"grad_norm": 0.5171907544136047,
"learning_rate": 8.597951277181142e-05,
"loss": 1.6877,
"mean_token_accuracy": 0.5934458374977112,
"num_tokens": 16577850.0,
"step": 310
},
{
"epoch": 3.9367088607594938,
"grad_norm": 0.4658549427986145,
"learning_rate": 8.539942825973666e-05,
"loss": 1.5145,
"mean_token_accuracy": 0.6306940317153931,
"num_tokens": 16630074.0,
"step": 311
},
{
"epoch": 3.9493670886075947,
"grad_norm": 0.5423455834388733,
"learning_rate": 8.481984532601515e-05,
"loss": 1.7042,
"mean_token_accuracy": 0.5973284244537354,
"num_tokens": 16684788.0,
"step": 312
},
{
"epoch": 3.962025316455696,
"grad_norm": 0.4419417679309845,
"learning_rate": 8.424078388125436e-05,
"loss": 1.5366,
"mean_token_accuracy": 0.627940833568573,
"num_tokens": 16736325.0,
"step": 313
},
{
"epoch": 3.9746835443037973,
"grad_norm": 0.5917538404464722,
"learning_rate": 8.366226381814697e-05,
"loss": 1.6817,
"mean_token_accuracy": 0.5960053205490112,
"num_tokens": 16792964.0,
"step": 314
},
{
"epoch": 3.9873417721518987,
"grad_norm": 0.43734970688819885,
"learning_rate": 8.308430501078739e-05,
"loss": 1.5546,
"mean_token_accuracy": 0.621354877948761,
"num_tokens": 16846936.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.5773450136184692,
"learning_rate": 8.25069273139889e-05,
"loss": 1.3048,
"mean_token_accuracy": 0.6735352277755737,
"num_tokens": 16898151.0,
"step": 316
},
{
"epoch": 4.012658227848101,
"grad_norm": 0.6190834641456604,
"learning_rate": 8.19301505626018e-05,
"loss": 1.3439,
"mean_token_accuracy": 0.6669641137123108,
"num_tokens": 16952008.0,
"step": 317
},
{
"epoch": 4.025316455696203,
"grad_norm": 0.5162801146507263,
"learning_rate": 8.13539945708319e-05,
"loss": 1.2842,
"mean_token_accuracy": 0.6779625415802002,
"num_tokens": 17009438.0,
"step": 318
},
{
"epoch": 4.037974683544304,
"grad_norm": 0.8861052989959717,
"learning_rate": 8.07784791315598e-05,
"loss": 1.2423,
"mean_token_accuracy": 0.6833261847496033,
"num_tokens": 17063065.0,
"step": 319
},
{
"epoch": 4.050632911392405,
"grad_norm": 0.7958038449287415,
"learning_rate": 8.020362401566103e-05,
"loss": 1.3678,
"mean_token_accuracy": 0.6559507250785828,
"num_tokens": 17121080.0,
"step": 320
},
{
"epoch": 4.063291139240507,
"grad_norm": 0.5480073094367981,
"learning_rate": 7.962944897132678e-05,
"loss": 1.2981,
"mean_token_accuracy": 0.6758822798728943,
"num_tokens": 17174387.0,
"step": 321
},
{
"epoch": 4.075949367088608,
"grad_norm": 0.5921289920806885,
"learning_rate": 7.905597372338558e-05,
"loss": 1.3479,
"mean_token_accuracy": 0.6665363311767578,
"num_tokens": 17228166.0,
"step": 322
},
{
"epoch": 4.0886075949367084,
"grad_norm": 0.5580439567565918,
"learning_rate": 7.848321797262548e-05,
"loss": 1.3442,
"mean_token_accuracy": 0.6631233096122742,
"num_tokens": 17279970.0,
"step": 323
},
{
"epoch": 4.10126582278481,
"grad_norm": 0.5380421280860901,
"learning_rate": 7.791120139511752e-05,
"loss": 1.2944,
"mean_token_accuracy": 0.6707260608673096,
"num_tokens": 17334147.0,
"step": 324
},
{
"epoch": 4.113924050632911,
"grad_norm": 0.6376309394836426,
"learning_rate": 7.733994364153969e-05,
"loss": 1.2812,
"mean_token_accuracy": 0.6757416129112244,
"num_tokens": 17383798.0,
"step": 325
},
{
"epoch": 4.1265822784810124,
"grad_norm": 0.6679216027259827,
"learning_rate": 7.67694643365017e-05,
"loss": 1.3301,
"mean_token_accuracy": 0.6633830666542053,
"num_tokens": 17440101.0,
"step": 326
},
{
"epoch": 4.139240506329114,
"grad_norm": 0.6206209659576416,
"learning_rate": 7.619978307787108e-05,
"loss": 1.2626,
"mean_token_accuracy": 0.6785885095596313,
"num_tokens": 17492366.0,
"step": 327
},
{
"epoch": 4.151898734177215,
"grad_norm": 0.5746794939041138,
"learning_rate": 7.563091943609984e-05,
"loss": 1.2677,
"mean_token_accuracy": 0.6740871071815491,
"num_tokens": 17550513.0,
"step": 328
},
{
"epoch": 4.1645569620253164,
"grad_norm": 0.5489034652709961,
"learning_rate": 7.506289295355198e-05,
"loss": 1.3781,
"mean_token_accuracy": 0.65250164270401,
"num_tokens": 17609219.0,
"step": 329
},
{
"epoch": 4.177215189873418,
"grad_norm": 0.5608614683151245,
"learning_rate": 7.449572314383237e-05,
"loss": 1.2503,
"mean_token_accuracy": 0.6817007064819336,
"num_tokens": 17661897.0,
"step": 330
},
{
"epoch": 4.189873417721519,
"grad_norm": 0.5509681105613708,
"learning_rate": 7.392942949111633e-05,
"loss": 1.2831,
"mean_token_accuracy": 0.6758288741111755,
"num_tokens": 17716642.0,
"step": 331
},
{
"epoch": 4.2025316455696204,
"grad_norm": 0.5699339509010315,
"learning_rate": 7.336403144948022e-05,
"loss": 1.1983,
"mean_token_accuracy": 0.6953414678573608,
"num_tokens": 17769319.0,
"step": 332
},
{
"epoch": 4.215189873417722,
"grad_norm": 0.5870381593704224,
"learning_rate": 7.279954844223323e-05,
"loss": 1.1973,
"mean_token_accuracy": 0.6953087449073792,
"num_tokens": 17821544.0,
"step": 333
},
{
"epoch": 4.227848101265823,
"grad_norm": 0.5986402034759521,
"learning_rate": 7.223599986124994e-05,
"loss": 1.2402,
"mean_token_accuracy": 0.6869230270385742,
"num_tokens": 17873822.0,
"step": 334
},
{
"epoch": 4.2405063291139244,
"grad_norm": 0.5851041078567505,
"learning_rate": 7.167340506630445e-05,
"loss": 1.2882,
"mean_token_accuracy": 0.6755807399749756,
"num_tokens": 17929117.0,
"step": 335
},
{
"epoch": 4.253164556962025,
"grad_norm": 0.5770756006240845,
"learning_rate": 7.111178338440496e-05,
"loss": 1.337,
"mean_token_accuracy": 0.6594337224960327,
"num_tokens": 17981027.0,
"step": 336
},
{
"epoch": 4.265822784810126,
"grad_norm": 0.55469810962677,
"learning_rate": 7.055115410913009e-05,
"loss": 1.1853,
"mean_token_accuracy": 0.7015496492385864,
"num_tokens": 18034651.0,
"step": 337
},
{
"epoch": 4.2784810126582276,
"grad_norm": 0.5626926422119141,
"learning_rate": 6.999153649996595e-05,
"loss": 1.3398,
"mean_token_accuracy": 0.6679387092590332,
"num_tokens": 18089744.0,
"step": 338
},
{
"epoch": 4.291139240506329,
"grad_norm": 0.5761396288871765,
"learning_rate": 6.943294978164454e-05,
"loss": 1.2738,
"mean_token_accuracy": 0.6804162859916687,
"num_tokens": 18142270.0,
"step": 339
},
{
"epoch": 4.30379746835443,
"grad_norm": 0.5691214799880981,
"learning_rate": 6.887541314348333e-05,
"loss": 1.3552,
"mean_token_accuracy": 0.6607176661491394,
"num_tokens": 18195620.0,
"step": 340
},
{
"epoch": 4.3164556962025316,
"grad_norm": 0.5720015168190002,
"learning_rate": 6.831894573872601e-05,
"loss": 1.3218,
"mean_token_accuracy": 0.6686378121376038,
"num_tokens": 18251997.0,
"step": 341
},
{
"epoch": 4.329113924050633,
"grad_norm": 0.6008363962173462,
"learning_rate": 6.776356668388464e-05,
"loss": 1.2333,
"mean_token_accuracy": 0.6878805756568909,
"num_tokens": 18302311.0,
"step": 342
},
{
"epoch": 4.341772151898734,
"grad_norm": 0.6210716366767883,
"learning_rate": 6.720929505808265e-05,
"loss": 1.2887,
"mean_token_accuracy": 0.6707760691642761,
"num_tokens": 18352666.0,
"step": 343
},
{
"epoch": 4.3544303797468356,
"grad_norm": 0.5934692025184631,
"learning_rate": 6.665614990239969e-05,
"loss": 1.2217,
"mean_token_accuracy": 0.6912603974342346,
"num_tokens": 18402309.0,
"step": 344
},
{
"epoch": 4.367088607594937,
"grad_norm": 0.5864667296409607,
"learning_rate": 6.610415021921747e-05,
"loss": 1.2923,
"mean_token_accuracy": 0.6747585535049438,
"num_tokens": 18456419.0,
"step": 345
},
{
"epoch": 4.379746835443038,
"grad_norm": 0.5857178568840027,
"learning_rate": 6.555331497156672e-05,
"loss": 1.3078,
"mean_token_accuracy": 0.6736264824867249,
"num_tokens": 18508975.0,
"step": 346
},
{
"epoch": 4.3924050632911396,
"grad_norm": 0.5825328826904297,
"learning_rate": 6.50036630824761e-05,
"loss": 1.273,
"mean_token_accuracy": 0.6832161545753479,
"num_tokens": 18561387.0,
"step": 347
},
{
"epoch": 4.405063291139241,
"grad_norm": 0.5755932331085205,
"learning_rate": 6.445521343432188e-05,
"loss": 1.2756,
"mean_token_accuracy": 0.6811782717704773,
"num_tokens": 18612950.0,
"step": 348
},
{
"epoch": 4.417721518987342,
"grad_norm": 0.5817604064941406,
"learning_rate": 6.390798486817929e-05,
"loss": 1.3343,
"mean_token_accuracy": 0.6663679480552673,
"num_tokens": 18664340.0,
"step": 349
},
{
"epoch": 4.430379746835443,
"grad_norm": 0.5856095552444458,
"learning_rate": 6.336199618317537e-05,
"loss": 1.3448,
"mean_token_accuracy": 0.6607745289802551,
"num_tokens": 18719562.0,
"step": 350
},
{
"epoch": 4.443037974683544,
"grad_norm": 0.5836370587348938,
"learning_rate": 6.281726613584321e-05,
"loss": 1.3236,
"mean_token_accuracy": 0.6663780212402344,
"num_tokens": 18772746.0,
"step": 351
},
{
"epoch": 4.455696202531645,
"grad_norm": 0.5693697929382324,
"learning_rate": 6.227381343947733e-05,
"loss": 1.4024,
"mean_token_accuracy": 0.6489980220794678,
"num_tokens": 18829049.0,
"step": 352
},
{
"epoch": 4.468354430379747,
"grad_norm": 0.5808230042457581,
"learning_rate": 6.173165676349103e-05,
"loss": 1.3548,
"mean_token_accuracy": 0.6583444476127625,
"num_tokens": 18884707.0,
"step": 353
},
{
"epoch": 4.481012658227848,
"grad_norm": 0.5697141289710999,
"learning_rate": 6.119081473277501e-05,
"loss": 1.2806,
"mean_token_accuracy": 0.6785191297531128,
"num_tokens": 18938037.0,
"step": 354
},
{
"epoch": 4.493670886075949,
"grad_norm": 0.5767077803611755,
"learning_rate": 6.065130592705759e-05,
"loss": 1.3013,
"mean_token_accuracy": 0.6735213398933411,
"num_tokens": 18990328.0,
"step": 355
},
{
"epoch": 4.506329113924051,
"grad_norm": 0.5735676288604736,
"learning_rate": 6.01131488802662e-05,
"loss": 1.3132,
"mean_token_accuracy": 0.6706185936927795,
"num_tokens": 19046567.0,
"step": 356
},
{
"epoch": 4.518987341772152,
"grad_norm": 0.5731688141822815,
"learning_rate": 5.9576362079890925e-05,
"loss": 1.2473,
"mean_token_accuracy": 0.682766318321228,
"num_tokens": 19096632.0,
"step": 357
},
{
"epoch": 4.531645569620253,
"grad_norm": 0.5659275650978088,
"learning_rate": 5.904096396634935e-05,
"loss": 1.3143,
"mean_token_accuracy": 0.6679917573928833,
"num_tokens": 19151535.0,
"step": 358
},
{
"epoch": 4.544303797468355,
"grad_norm": 0.6067102551460266,
"learning_rate": 5.8506972932353035e-05,
"loss": 1.2347,
"mean_token_accuracy": 0.6812778115272522,
"num_tokens": 19201059.0,
"step": 359
},
{
"epoch": 4.556962025316456,
"grad_norm": 0.6011271476745605,
"learning_rate": 5.797440732227555e-05,
"loss": 1.2771,
"mean_token_accuracy": 0.6814538836479187,
"num_tokens": 19252902.0,
"step": 360
},
{
"epoch": 4.569620253164557,
"grad_norm": 0.5889953374862671,
"learning_rate": 5.744328543152253e-05,
"loss": 1.3188,
"mean_token_accuracy": 0.6712836027145386,
"num_tokens": 19306465.0,
"step": 361
},
{
"epoch": 4.582278481012658,
"grad_norm": 0.587265133857727,
"learning_rate": 5.691362550590297e-05,
"loss": 1.2569,
"mean_token_accuracy": 0.682069718837738,
"num_tokens": 19360739.0,
"step": 362
},
{
"epoch": 4.594936708860759,
"grad_norm": 0.5950151085853577,
"learning_rate": 5.638544574100249e-05,
"loss": 1.2659,
"mean_token_accuracy": 0.6816703677177429,
"num_tokens": 19414612.0,
"step": 363
},
{
"epoch": 4.6075949367088604,
"grad_norm": 0.6016396284103394,
"learning_rate": 5.585876428155824e-05,
"loss": 1.238,
"mean_token_accuracy": 0.6834296584129333,
"num_tokens": 19466914.0,
"step": 364
},
{
"epoch": 4.620253164556962,
"grad_norm": 0.5939626693725586,
"learning_rate": 5.533359922083562e-05,
"loss": 1.3226,
"mean_token_accuracy": 0.6637207269668579,
"num_tokens": 19521516.0,
"step": 365
},
{
"epoch": 4.632911392405063,
"grad_norm": 0.5587190389633179,
"learning_rate": 5.4809968600006635e-05,
"loss": 1.2707,
"mean_token_accuracy": 0.6756612658500671,
"num_tokens": 19577799.0,
"step": 366
},
{
"epoch": 4.6455696202531644,
"grad_norm": 0.5682988166809082,
"learning_rate": 5.4287890407530175e-05,
"loss": 1.2354,
"mean_token_accuracy": 0.6873900890350342,
"num_tokens": 19630750.0,
"step": 367
},
{
"epoch": 4.658227848101266,
"grad_norm": 0.5705362558364868,
"learning_rate": 5.3767382578534e-05,
"loss": 1.3058,
"mean_token_accuracy": 0.670261561870575,
"num_tokens": 19685521.0,
"step": 368
},
{
"epoch": 4.670886075949367,
"grad_norm": 0.5939800143241882,
"learning_rate": 5.324846299419879e-05,
"loss": 1.2875,
"mean_token_accuracy": 0.6791155934333801,
"num_tokens": 19735924.0,
"step": 369
},
{
"epoch": 4.6835443037974684,
"grad_norm": 0.5905841588973999,
"learning_rate": 5.273114948114346e-05,
"loss": 1.29,
"mean_token_accuracy": 0.6750991344451904,
"num_tokens": 19790223.0,
"step": 370
},
{
"epoch": 4.69620253164557,
"grad_norm": 0.5728279948234558,
"learning_rate": 5.2215459810813306e-05,
"loss": 1.3004,
"mean_token_accuracy": 0.6714416742324829,
"num_tokens": 19843830.0,
"step": 371
},
{
"epoch": 4.708860759493671,
"grad_norm": 0.5861008763313293,
"learning_rate": 5.170141169886904e-05,
"loss": 1.3081,
"mean_token_accuracy": 0.6724933385848999,
"num_tokens": 19895896.0,
"step": 372
},
{
"epoch": 4.7215189873417724,
"grad_norm": 0.590370237827301,
"learning_rate": 5.118902280457829e-05,
"loss": 1.3177,
"mean_token_accuracy": 0.6696312427520752,
"num_tokens": 19951955.0,
"step": 373
},
{
"epoch": 4.734177215189874,
"grad_norm": 0.5858080387115479,
"learning_rate": 5.0678310730209275e-05,
"loss": 1.2543,
"mean_token_accuracy": 0.6782749891281128,
"num_tokens": 20006233.0,
"step": 374
},
{
"epoch": 4.746835443037975,
"grad_norm": 0.5834558606147766,
"learning_rate": 5.016929302042563e-05,
"loss": 1.2638,
"mean_token_accuracy": 0.6811890602111816,
"num_tokens": 20059548.0,
"step": 375
},
{
"epoch": 4.759493670886076,
"grad_norm": 0.587447464466095,
"learning_rate": 4.9661987161684045e-05,
"loss": 1.2763,
"mean_token_accuracy": 0.6746391654014587,
"num_tokens": 20112126.0,
"step": 376
},
{
"epoch": 4.772151898734177,
"grad_norm": 0.5700677037239075,
"learning_rate": 4.9156410581633317e-05,
"loss": 1.3477,
"mean_token_accuracy": 0.6617173552513123,
"num_tokens": 20167484.0,
"step": 377
},
{
"epoch": 4.784810126582278,
"grad_norm": 0.5649070143699646,
"learning_rate": 4.865258064851579e-05,
"loss": 1.3037,
"mean_token_accuracy": 0.6660420894622803,
"num_tokens": 20221983.0,
"step": 378
},
{
"epoch": 4.7974683544303796,
"grad_norm": 0.5917767882347107,
"learning_rate": 4.8150514670570754e-05,
"loss": 1.3665,
"mean_token_accuracy": 0.6614978909492493,
"num_tokens": 20273252.0,
"step": 379
},
{
"epoch": 4.810126582278481,
"grad_norm": 0.6018021702766418,
"learning_rate": 4.765022989543958e-05,
"loss": 1.3038,
"mean_token_accuracy": 0.6711691617965698,
"num_tokens": 20325361.0,
"step": 380
},
{
"epoch": 4.822784810126582,
"grad_norm": 0.5708827376365662,
"learning_rate": 4.7151743509573444e-05,
"loss": 1.3366,
"mean_token_accuracy": 0.6616772413253784,
"num_tokens": 20383615.0,
"step": 381
},
{
"epoch": 4.8354430379746836,
"grad_norm": 0.586915135383606,
"learning_rate": 4.665507263764299e-05,
"loss": 1.324,
"mean_token_accuracy": 0.6650412082672119,
"num_tokens": 20439047.0,
"step": 382
},
{
"epoch": 4.848101265822785,
"grad_norm": 0.5868443250656128,
"learning_rate": 4.6160234341949646e-05,
"loss": 1.2787,
"mean_token_accuracy": 0.6764598488807678,
"num_tokens": 20493809.0,
"step": 383
},
{
"epoch": 4.860759493670886,
"grad_norm": 0.5989151000976562,
"learning_rate": 4.5667245621839974e-05,
"loss": 1.2877,
"mean_token_accuracy": 0.6735488176345825,
"num_tokens": 20544245.0,
"step": 384
},
{
"epoch": 4.8734177215189876,
"grad_norm": 0.5820327997207642,
"learning_rate": 4.5176123413121284e-05,
"loss": 1.3003,
"mean_token_accuracy": 0.6759911179542542,
"num_tokens": 20598289.0,
"step": 385
},
{
"epoch": 4.886075949367089,
"grad_norm": 0.5799569487571716,
"learning_rate": 4.468688458748006e-05,
"loss": 1.2629,
"mean_token_accuracy": 0.6812482476234436,
"num_tokens": 20651708.0,
"step": 386
},
{
"epoch": 4.89873417721519,
"grad_norm": 0.5748412609100342,
"learning_rate": 4.4199545951902286e-05,
"loss": 1.2656,
"mean_token_accuracy": 0.679618775844574,
"num_tokens": 20703501.0,
"step": 387
},
{
"epoch": 4.911392405063291,
"grad_norm": 0.595779538154602,
"learning_rate": 4.3714124248096067e-05,
"loss": 1.2518,
"mean_token_accuracy": 0.683225691318512,
"num_tokens": 20755138.0,
"step": 388
},
{
"epoch": 4.924050632911392,
"grad_norm": 0.5738579034805298,
"learning_rate": 4.3230636151916495e-05,
"loss": 1.2484,
"mean_token_accuracy": 0.6847042441368103,
"num_tokens": 20807223.0,
"step": 389
},
{
"epoch": 4.936708860759493,
"grad_norm": 0.5756692290306091,
"learning_rate": 4.274909827279283e-05,
"loss": 1.3462,
"mean_token_accuracy": 0.6611171960830688,
"num_tokens": 20863749.0,
"step": 390
},
{
"epoch": 4.949367088607595,
"grad_norm": 0.5885776281356812,
"learning_rate": 4.226952715315779e-05,
"loss": 1.2916,
"mean_token_accuracy": 0.6735062003135681,
"num_tokens": 20916497.0,
"step": 391
},
{
"epoch": 4.962025316455696,
"grad_norm": 0.6201795935630798,
"learning_rate": 4.17919392678795e-05,
"loss": 1.1691,
"mean_token_accuracy": 0.6980156302452087,
"num_tokens": 20964335.0,
"step": 392
},
{
"epoch": 4.974683544303797,
"grad_norm": 0.5966718196868896,
"learning_rate": 4.131635102369513e-05,
"loss": 1.3067,
"mean_token_accuracy": 0.6753334999084473,
"num_tokens": 21020321.0,
"step": 393
},
{
"epoch": 4.987341772151899,
"grad_norm": 0.5949414968490601,
"learning_rate": 4.084277875864776e-05,
"loss": 1.316,
"mean_token_accuracy": 0.6707158088684082,
"num_tokens": 21071013.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.6401087045669556,
"learning_rate": 4.037123874152472e-05,
"loss": 1.0996,
"mean_token_accuracy": 0.7210924029350281,
"num_tokens": 21124428.0,
"step": 395
},
{
"epoch": 5.012658227848101,
"grad_norm": 0.7365010976791382,
"learning_rate": 3.9901747171298766e-05,
"loss": 1.0391,
"mean_token_accuracy": 0.7338370084762573,
"num_tokens": 21177437.0,
"step": 396
},
{
"epoch": 5.025316455696203,
"grad_norm": 0.6505429148674011,
"learning_rate": 3.943432017657186e-05,
"loss": 0.9978,
"mean_token_accuracy": 0.7425819635391235,
"num_tokens": 21233884.0,
"step": 397
},
{
"epoch": 5.037974683544304,
"grad_norm": 0.6625313758850098,
"learning_rate": 3.8968973815020806e-05,
"loss": 1.0228,
"mean_token_accuracy": 0.7341680526733398,
"num_tokens": 21289374.0,
"step": 398
},
{
"epoch": 5.050632911392405,
"grad_norm": 1.0251473188400269,
"learning_rate": 3.850572407284569e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.7449803352355957,
"num_tokens": 21340089.0,
"step": 399
},
{
"epoch": 5.063291139240507,
"grad_norm": 1.1878520250320435,
"learning_rate": 3.80445868642208e-05,
"loss": 1.0699,
"mean_token_accuracy": 0.7249756455421448,
"num_tokens": 21388356.0,
"step": 400
},
{
"epoch": 5.075949367088608,
"grad_norm": 0.8483335971832275,
"learning_rate": 3.7585578030747744e-05,
"loss": 1.0448,
"mean_token_accuracy": 0.7355468273162842,
"num_tokens": 21439862.0,
"step": 401
},
{
"epoch": 5.0886075949367084,
"grad_norm": 0.6893622279167175,
"learning_rate": 3.7128713340911535e-05,
"loss": 0.961,
"mean_token_accuracy": 0.7475458979606628,
"num_tokens": 21493001.0,
"step": 402
},
{
"epoch": 5.10126582278481,
"grad_norm": 0.6758370399475098,
"learning_rate": 3.667400848953845e-05,
"loss": 1.008,
"mean_token_accuracy": 0.7371683716773987,
"num_tokens": 21548553.0,
"step": 403
},
{
"epoch": 5.113924050632911,
"grad_norm": 0.6713793277740479,
"learning_rate": 3.622147909725724e-05,
"loss": 1.001,
"mean_token_accuracy": 0.7425588369369507,
"num_tokens": 21602540.0,
"step": 404
},
{
"epoch": 5.1265822784810124,
"grad_norm": 0.6601512432098389,
"learning_rate": 3.577114070996247e-05,
"loss": 1.0354,
"mean_token_accuracy": 0.7336742281913757,
"num_tokens": 21654822.0,
"step": 405
},
{
"epoch": 5.139240506329114,
"grad_norm": 0.6632497906684875,
"learning_rate": 3.532300879828013e-05,
"loss": 1.0393,
"mean_token_accuracy": 0.7334464192390442,
"num_tokens": 21711490.0,
"step": 406
},
{
"epoch": 5.151898734177215,
"grad_norm": 0.7294788956642151,
"learning_rate": 3.4877098757036665e-05,
"loss": 1.0106,
"mean_token_accuracy": 0.7395373582839966,
"num_tokens": 21762521.0,
"step": 407
},
{
"epoch": 5.1645569620253164,
"grad_norm": 0.746837317943573,
"learning_rate": 3.44334259047297e-05,
"loss": 1.0651,
"mean_token_accuracy": 0.7258839011192322,
"num_tokens": 21815081.0,
"step": 408
},
{
"epoch": 5.177215189873418,
"grad_norm": 0.806247889995575,
"learning_rate": 3.3992005483002e-05,
"loss": 1.0844,
"mean_token_accuracy": 0.7215079069137573,
"num_tokens": 21871064.0,
"step": 409
},
{
"epoch": 5.189873417721519,
"grad_norm": 0.8033056855201721,
"learning_rate": 3.355285265611784e-05,
"loss": 1.0074,
"mean_token_accuracy": 0.7389492392539978,
"num_tokens": 21924405.0,
"step": 410
},
{
"epoch": 5.2025316455696204,
"grad_norm": 0.7441568970680237,
"learning_rate": 3.3115982510442014e-05,
"loss": 1.0617,
"mean_token_accuracy": 0.7245724201202393,
"num_tokens": 21981769.0,
"step": 411
},
{
"epoch": 5.215189873417722,
"grad_norm": 0.7295483350753784,
"learning_rate": 3.268141005392163e-05,
"loss": 1.062,
"mean_token_accuracy": 0.7272607684135437,
"num_tokens": 22034990.0,
"step": 412
},
{
"epoch": 5.227848101265823,
"grad_norm": 0.6898937821388245,
"learning_rate": 3.224915021557049e-05,
"loss": 0.9831,
"mean_token_accuracy": 0.7429006695747375,
"num_tokens": 22089566.0,
"step": 413
},
{
"epoch": 5.2405063291139244,
"grad_norm": 0.6886006593704224,
"learning_rate": 3.1819217844956214e-05,
"loss": 0.9795,
"mean_token_accuracy": 0.7483858466148376,
"num_tokens": 22141515.0,
"step": 414
},
{
"epoch": 5.253164556962025,
"grad_norm": 0.6947466135025024,
"learning_rate": 3.1391627711690296e-05,
"loss": 1.0315,
"mean_token_accuracy": 0.7290645241737366,
"num_tokens": 22195005.0,
"step": 415
},
{
"epoch": 5.265822784810126,
"grad_norm": 0.6854252815246582,
"learning_rate": 3.0966394504920317e-05,
"loss": 1.0079,
"mean_token_accuracy": 0.7384724617004395,
"num_tokens": 22250111.0,
"step": 416
},
{
"epoch": 5.2784810126582276,
"grad_norm": 0.6747215390205383,
"learning_rate": 3.0543532832825715e-05,
"loss": 1.0281,
"mean_token_accuracy": 0.7306157350540161,
"num_tokens": 22307554.0,
"step": 417
},
{
"epoch": 5.291139240506329,
"grad_norm": 0.7181615829467773,
"learning_rate": 3.0123057222115836e-05,
"loss": 1.0336,
"mean_token_accuracy": 0.7309041619300842,
"num_tokens": 22358637.0,
"step": 418
},
{
"epoch": 5.30379746835443,
"grad_norm": 0.7213126420974731,
"learning_rate": 2.9704982117530777e-05,
"loss": 1.0904,
"mean_token_accuracy": 0.7194147706031799,
"num_tokens": 22415297.0,
"step": 419
},
{
"epoch": 5.3164556962025316,
"grad_norm": 0.7304534316062927,
"learning_rate": 2.9289321881345254e-05,
"loss": 1.0136,
"mean_token_accuracy": 0.736984372138977,
"num_tokens": 22469008.0,
"step": 420
},
{
"epoch": 5.329113924050633,
"grad_norm": 0.7307331562042236,
"learning_rate": 2.887609079287521e-05,
"loss": 1.0368,
"mean_token_accuracy": 0.7307581305503845,
"num_tokens": 22524472.0,
"step": 421
},
{
"epoch": 5.341772151898734,
"grad_norm": 0.7253232002258301,
"learning_rate": 2.8465303047987267e-05,
"loss": 1.0469,
"mean_token_accuracy": 0.7322298884391785,
"num_tokens": 22578489.0,
"step": 422
},
{
"epoch": 5.3544303797468356,
"grad_norm": 0.7165502309799194,
"learning_rate": 2.805697275861101e-05,
"loss": 0.9725,
"mean_token_accuracy": 0.7465605139732361,
"num_tokens": 22629796.0,
"step": 423
},
{
"epoch": 5.367088607594937,
"grad_norm": 0.7150178551673889,
"learning_rate": 2.765111395225424e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.7396253347396851,
"num_tokens": 22681693.0,
"step": 424
},
{
"epoch": 5.379746835443038,
"grad_norm": 0.6943763494491577,
"learning_rate": 2.7247740571521118e-05,
"loss": 1.0145,
"mean_token_accuracy": 0.7367216348648071,
"num_tokens": 22732008.0,
"step": 425
},
{
"epoch": 5.3924050632911396,
"grad_norm": 0.6839891672134399,
"learning_rate": 2.6846866473633125e-05,
"loss": 0.9447,
"mean_token_accuracy": 0.7547025084495544,
"num_tokens": 22784119.0,
"step": 426
},
{
"epoch": 5.405063291139241,
"grad_norm": 0.671549916267395,
"learning_rate": 2.6448505429952917e-05,
"loss": 1.0198,
"mean_token_accuracy": 0.733854353427887,
"num_tokens": 22840096.0,
"step": 427
},
{
"epoch": 5.417721518987342,
"grad_norm": 0.6969998478889465,
"learning_rate": 2.605267112551154e-05,
"loss": 1.057,
"mean_token_accuracy": 0.7291796803474426,
"num_tokens": 22894698.0,
"step": 428
},
{
"epoch": 5.430379746835443,
"grad_norm": 0.6982560753822327,
"learning_rate": 2.5659377158538012e-05,
"loss": 1.0138,
"mean_token_accuracy": 0.7372158765792847,
"num_tokens": 22947992.0,
"step": 429
},
{
"epoch": 5.443037974683544,
"grad_norm": 0.7151924967765808,
"learning_rate": 2.5268637039992293e-05,
"loss": 0.9917,
"mean_token_accuracy": 0.7383322715759277,
"num_tokens": 23000294.0,
"step": 430
},
{
"epoch": 5.455696202531645,
"grad_norm": 0.7005829215049744,
"learning_rate": 2.488046419310114e-05,
"loss": 1.0214,
"mean_token_accuracy": 0.734840989112854,
"num_tokens": 23055985.0,
"step": 431
},
{
"epoch": 5.468354430379747,
"grad_norm": 0.7062477469444275,
"learning_rate": 2.4494871952896947e-05,
"loss": 1.0029,
"mean_token_accuracy": 0.7360851764678955,
"num_tokens": 23110703.0,
"step": 432
},
{
"epoch": 5.481012658227848,
"grad_norm": 0.6942815184593201,
"learning_rate": 2.411187356575969e-05,
"loss": 1.0621,
"mean_token_accuracy": 0.7231142520904541,
"num_tokens": 23166447.0,
"step": 433
},
{
"epoch": 5.493670886075949,
"grad_norm": 0.742875337600708,
"learning_rate": 2.3731482188961818e-05,
"loss": 1.0389,
"mean_token_accuracy": 0.7320136427879333,
"num_tokens": 23218898.0,
"step": 434
},
{
"epoch": 5.506329113924051,
"grad_norm": 0.7092304229736328,
"learning_rate": 2.335371089021623e-05,
"loss": 1.0546,
"mean_token_accuracy": 0.7280179858207703,
"num_tokens": 23272392.0,
"step": 435
},
{
"epoch": 5.518987341772152,
"grad_norm": 0.7047234773635864,
"learning_rate": 2.297857264722756e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7427883744239807,
"num_tokens": 23326050.0,
"step": 436
},
{
"epoch": 5.531645569620253,
"grad_norm": 0.7014687061309814,
"learning_rate": 2.260608034724595e-05,
"loss": 1.0677,
"mean_token_accuracy": 0.724626898765564,
"num_tokens": 23381192.0,
"step": 437
},
{
"epoch": 5.544303797468355,
"grad_norm": 0.6740880012512207,
"learning_rate": 2.2236246786624792e-05,
"loss": 1.039,
"mean_token_accuracy": 0.737155556678772,
"num_tokens": 23438849.0,
"step": 438
},
{
"epoch": 5.556962025316456,
"grad_norm": 0.6918567419052124,
"learning_rate": 2.1869084670380835e-05,
"loss": 1.0365,
"mean_token_accuracy": 0.7317704558372498,
"num_tokens": 23492617.0,
"step": 439
},
{
"epoch": 5.569620253164557,
"grad_norm": 0.6956952214241028,
"learning_rate": 2.150460661175768e-05,
"loss": 1.0282,
"mean_token_accuracy": 0.7331886887550354,
"num_tokens": 23544759.0,
"step": 440
},
{
"epoch": 5.582278481012658,
"grad_norm": 0.6904217004776001,
"learning_rate": 2.114282513179281e-05,
"loss": 1.0341,
"mean_token_accuracy": 0.7316084504127502,
"num_tokens": 23596151.0,
"step": 441
},
{
"epoch": 5.594936708860759,
"grad_norm": 0.7040565609931946,
"learning_rate": 2.0783752658887066e-05,
"loss": 1.0227,
"mean_token_accuracy": 0.7370526790618896,
"num_tokens": 23650203.0,
"step": 442
},
{
"epoch": 5.6075949367088604,
"grad_norm": 0.7769550085067749,
"learning_rate": 2.0427401528377953e-05,
"loss": 1.0127,
"mean_token_accuracy": 0.7367920875549316,
"num_tokens": 23701808.0,
"step": 443
},
{
"epoch": 5.620253164556962,
"grad_norm": 0.7274349927902222,
"learning_rate": 2.0073783982115723e-05,
"loss": 1.0214,
"mean_token_accuracy": 0.7346363067626953,
"num_tokens": 23752218.0,
"step": 444
},
{
"epoch": 5.632911392405063,
"grad_norm": 0.7190005779266357,
"learning_rate": 1.9722912168042897e-05,
"loss": 0.9928,
"mean_token_accuracy": 0.745000958442688,
"num_tokens": 23803392.0,
"step": 445
},
{
"epoch": 5.6455696202531644,
"grad_norm": 0.7127588391304016,
"learning_rate": 1.937479813977703e-05,
"loss": 1.0507,
"mean_token_accuracy": 0.724457323551178,
"num_tokens": 23854958.0,
"step": 446
},
{
"epoch": 5.658227848101266,
"grad_norm": 0.7291621565818787,
"learning_rate": 1.9029453856196376e-05,
"loss": 1.019,
"mean_token_accuracy": 0.7388318181037903,
"num_tokens": 23904963.0,
"step": 447
},
{
"epoch": 5.670886075949367,
"grad_norm": 0.7113199830055237,
"learning_rate": 1.868689118102931e-05,
"loss": 1.0059,
"mean_token_accuracy": 0.7382575273513794,
"num_tokens": 23959466.0,
"step": 448
},
{
"epoch": 5.6835443037974684,
"grad_norm": 0.6915891170501709,
"learning_rate": 1.8347121882446717e-05,
"loss": 1.0548,
"mean_token_accuracy": 0.7301124930381775,
"num_tokens": 24015809.0,
"step": 449
},
{
"epoch": 5.69620253164557,
"grad_norm": 0.7390320301055908,
"learning_rate": 1.8010157632657543e-05,
"loss": 1.0465,
"mean_token_accuracy": 0.7288335561752319,
"num_tokens": 24066661.0,
"step": 450
},
{
"epoch": 5.708860759493671,
"grad_norm": 0.6886243224143982,
"learning_rate": 1.7676010007508092e-05,
"loss": 1.0437,
"mean_token_accuracy": 0.7315667271614075,
"num_tokens": 24120690.0,
"step": 451
},
{
"epoch": 5.7215189873417724,
"grad_norm": 0.6963152289390564,
"learning_rate": 1.7344690486084137e-05,
"loss": 1.0505,
"mean_token_accuracy": 0.7260193824768066,
"num_tokens": 24175444.0,
"step": 452
},
{
"epoch": 5.734177215189874,
"grad_norm": 0.6931020617485046,
"learning_rate": 1.701621045031666e-05,
"loss": 1.0465,
"mean_token_accuracy": 0.7293127775192261,
"num_tokens": 24229829.0,
"step": 453
},
{
"epoch": 5.746835443037975,
"grad_norm": 0.7032824754714966,
"learning_rate": 1.6690581184590858e-05,
"loss": 1.098,
"mean_token_accuracy": 0.7177731394767761,
"num_tokens": 24284374.0,
"step": 454
},
{
"epoch": 5.759493670886076,
"grad_norm": 0.6938078999519348,
"learning_rate": 1.636781387535843e-05,
"loss": 1.0065,
"mean_token_accuracy": 0.7374997735023499,
"num_tokens": 24335977.0,
"step": 455
},
{
"epoch": 5.772151898734177,
"grad_norm": 0.7007805705070496,
"learning_rate": 1.604791961075336e-05,
"loss": 1.0198,
"mean_token_accuracy": 0.734321653842926,
"num_tokens": 24389937.0,
"step": 456
},
{
"epoch": 5.784810126582278,
"grad_norm": 0.704025387763977,
"learning_rate": 1.5730909380210945e-05,
"loss": 1.0306,
"mean_token_accuracy": 0.7323794364929199,
"num_tokens": 24443674.0,
"step": 457
},
{
"epoch": 5.7974683544303796,
"grad_norm": 0.7411045432090759,
"learning_rate": 1.5416794074090258e-05,
"loss": 1.0176,
"mean_token_accuracy": 0.7357881665229797,
"num_tokens": 24492676.0,
"step": 458
},
{
"epoch": 5.810126582278481,
"grad_norm": 0.7155459523200989,
"learning_rate": 1.5105584483300162e-05,
"loss": 1.0839,
"mean_token_accuracy": 0.7148189544677734,
"num_tokens": 24544714.0,
"step": 459
},
{
"epoch": 5.822784810126582,
"grad_norm": 0.7093493342399597,
"learning_rate": 1.479729129892835e-05,
"loss": 1.0426,
"mean_token_accuracy": 0.7318651676177979,
"num_tokens": 24599314.0,
"step": 460
},
{
"epoch": 5.8354430379746836,
"grad_norm": 0.7229861617088318,
"learning_rate": 1.4491925111874383e-05,
"loss": 1.0331,
"mean_token_accuracy": 0.7305112481117249,
"num_tokens": 24653499.0,
"step": 461
},
{
"epoch": 5.848101265822785,
"grad_norm": 0.682659924030304,
"learning_rate": 1.4189496412485592e-05,
"loss": 1.0739,
"mean_token_accuracy": 0.7230107188224792,
"num_tokens": 24710493.0,
"step": 462
},
{
"epoch": 5.860759493670886,
"grad_norm": 0.6993433833122253,
"learning_rate": 1.3890015590196803e-05,
"loss": 1.0591,
"mean_token_accuracy": 0.7279648780822754,
"num_tokens": 24765719.0,
"step": 463
},
{
"epoch": 5.8734177215189876,
"grad_norm": 0.7131443023681641,
"learning_rate": 1.3593492933173512e-05,
"loss": 1.0473,
"mean_token_accuracy": 0.7293837666511536,
"num_tokens": 24819527.0,
"step": 464
},
{
"epoch": 5.886075949367089,
"grad_norm": 0.6991192698478699,
"learning_rate": 1.3299938627958297e-05,
"loss": 1.0703,
"mean_token_accuracy": 0.7221192121505737,
"num_tokens": 24874064.0,
"step": 465
},
{
"epoch": 5.89873417721519,
"grad_norm": 0.6935943961143494,
"learning_rate": 1.300936275912098e-05,
"loss": 0.9366,
"mean_token_accuracy": 0.7561765313148499,
"num_tokens": 24925694.0,
"step": 466
},
{
"epoch": 5.911392405063291,
"grad_norm": 0.7046949863433838,
"learning_rate": 1.2721775308912132e-05,
"loss": 1.0577,
"mean_token_accuracy": 0.7263013124465942,
"num_tokens": 24978915.0,
"step": 467
},
{
"epoch": 5.924050632911392,
"grad_norm": 0.6971089839935303,
"learning_rate": 1.2437186156920167e-05,
"loss": 1.0268,
"mean_token_accuracy": 0.7334689497947693,
"num_tokens": 25030110.0,
"step": 468
},
{
"epoch": 5.936708860759493,
"grad_norm": 0.7104247808456421,
"learning_rate": 1.2155605079732046e-05,
"loss": 1.062,
"mean_token_accuracy": 0.7263693809509277,
"num_tokens": 25083410.0,
"step": 469
},
{
"epoch": 5.949367088607595,
"grad_norm": 0.7165059447288513,
"learning_rate": 1.1877041750597173e-05,
"loss": 1.0257,
"mean_token_accuracy": 0.7345736622810364,
"num_tokens": 25135074.0,
"step": 470
},
{
"epoch": 5.962025316455696,
"grad_norm": 0.720089852809906,
"learning_rate": 1.160150573909532e-05,
"loss": 1.0055,
"mean_token_accuracy": 0.7425574064254761,
"num_tokens": 25185087.0,
"step": 471
},
{
"epoch": 5.974683544303797,
"grad_norm": 0.7024204730987549,
"learning_rate": 1.132900651080785e-05,
"loss": 1.0197,
"mean_token_accuracy": 0.7319695353507996,
"num_tokens": 25241514.0,
"step": 472
},
{
"epoch": 5.987341772151899,
"grad_norm": 0.6910815834999084,
"learning_rate": 1.1059553426992365e-05,
"loss": 1.0526,
"mean_token_accuracy": 0.7272513508796692,
"num_tokens": 25296867.0,
"step": 473
},
{
"epoch": 6.0,
"grad_norm": 0.6968879699707031,
"learning_rate": 1.0793155744261351e-05,
"loss": 0.8455,
"mean_token_accuracy": 0.7779576182365417,
"num_tokens": 25350056.0,
"step": 474
},
{
"epoch": 6.012658227848101,
"grad_norm": 0.7330729365348816,
"learning_rate": 1.0529822614264018e-05,
"loss": 0.8765,
"mean_token_accuracy": 0.7725006341934204,
"num_tokens": 25401263.0,
"step": 475
},
{
"epoch": 6.025316455696203,
"grad_norm": 0.7381304502487183,
"learning_rate": 1.026956308337199e-05,
"loss": 0.9087,
"mean_token_accuracy": 0.7671048045158386,
"num_tokens": 25454660.0,
"step": 476
},
{
"epoch": 6.037974683544304,
"grad_norm": 0.6964046359062195,
"learning_rate": 1.0012386092368475e-05,
"loss": 0.9349,
"mean_token_accuracy": 0.7573679685592651,
"num_tokens": 25508979.0,
"step": 477
},
{
"epoch": 6.050632911392405,
"grad_norm": 0.7061088681221008,
"learning_rate": 9.75830047614117e-06,
"loss": 0.8418,
"mean_token_accuracy": 0.7831987738609314,
"num_tokens": 25561801.0,
"step": 478
},
{
"epoch": 6.063291139240507,
"grad_norm": 0.7184389233589172,
"learning_rate": 9.507314963378745e-06,
"loss": 0.9069,
"mean_token_accuracy": 0.7647831439971924,
"num_tokens": 25615169.0,
"step": 479
},
{
"epoch": 6.075949367088608,
"grad_norm": 0.7675829529762268,
"learning_rate": 9.259438176270962e-06,
"loss": 0.8598,
"mean_token_accuracy": 0.7760006189346313,
"num_tokens": 25667126.0,
"step": 480
},
{
"epoch": 6.0886075949367084,
"grad_norm": 0.8120074272155762,
"learning_rate": 9.014678630212469e-06,
"loss": 0.846,
"mean_token_accuracy": 0.774548351764679,
"num_tokens": 25717560.0,
"step": 481
},
{
"epoch": 6.10126582278481,
"grad_norm": 0.8958349227905273,
"learning_rate": 8.773044733510338e-06,
"loss": 0.919,
"mean_token_accuracy": 0.7592644691467285,
"num_tokens": 25771189.0,
"step": 482
},
{
"epoch": 6.113924050632911,
"grad_norm": 0.8866109848022461,
"learning_rate": 8.534544787095078e-06,
"loss": 0.9448,
"mean_token_accuracy": 0.7527633309364319,
"num_tokens": 25826350.0,
"step": 483
},
{
"epoch": 6.1265822784810124,
"grad_norm": 0.8762211203575134,
"learning_rate": 8.299186984235585e-06,
"loss": 0.8883,
"mean_token_accuracy": 0.7666193842887878,
"num_tokens": 25879319.0,
"step": 484
},
{
"epoch": 6.139240506329114,
"grad_norm": 0.844354510307312,
"learning_rate": 8.06697941025768e-06,
"loss": 0.7943,
"mean_token_accuracy": 0.7924570441246033,
"num_tokens": 25928303.0,
"step": 485
},
{
"epoch": 6.151898734177215,
"grad_norm": 0.8180962800979614,
"learning_rate": 7.837930042266262e-06,
"loss": 0.896,
"mean_token_accuracy": 0.7649088501930237,
"num_tokens": 25983150.0,
"step": 486
},
{
"epoch": 6.1645569620253164,
"grad_norm": 0.7528831362724304,
"learning_rate": 7.612046748871327e-06,
"loss": 0.8709,
"mean_token_accuracy": 0.7727630734443665,
"num_tokens": 26035305.0,
"step": 487
},
{
"epoch": 6.177215189873418,
"grad_norm": 0.7552682161331177,
"learning_rate": 7.389337289917652e-06,
"loss": 0.7608,
"mean_token_accuracy": 0.8003422021865845,
"num_tokens": 26085630.0,
"step": 488
},
{
"epoch": 6.189873417721519,
"grad_norm": 0.7309929728507996,
"learning_rate": 7.1698093162182125e-06,
"loss": 0.9185,
"mean_token_accuracy": 0.7621966004371643,
"num_tokens": 26138393.0,
"step": 489
},
{
"epoch": 6.2025316455696204,
"grad_norm": 0.7125580906867981,
"learning_rate": 6.953470369291348e-06,
"loss": 0.8313,
"mean_token_accuracy": 0.7828810214996338,
"num_tokens": 26192105.0,
"step": 490
},
{
"epoch": 6.215189873417722,
"grad_norm": 0.7312189340591431,
"learning_rate": 6.74032788110166e-06,
"loss": 0.9374,
"mean_token_accuracy": 0.7564448118209839,
"num_tokens": 26244071.0,
"step": 491
},
{
"epoch": 6.227848101265823,
"grad_norm": 0.7063823342323303,
"learning_rate": 6.530389173804807e-06,
"loss": 0.8842,
"mean_token_accuracy": 0.7675926685333252,
"num_tokens": 26296259.0,
"step": 492
},
{
"epoch": 6.2405063291139244,
"grad_norm": 0.7618180513381958,
"learning_rate": 6.323661459495811e-06,
"loss": 0.8576,
"mean_token_accuracy": 0.7767826318740845,
"num_tokens": 26345226.0,
"step": 493
},
{
"epoch": 6.253164556962025,
"grad_norm": 0.7362849116325378,
"learning_rate": 6.1201518399613635e-06,
"loss": 0.8982,
"mean_token_accuracy": 0.7671923041343689,
"num_tokens": 26399893.0,
"step": 494
},
{
"epoch": 6.265822784810126,
"grad_norm": 0.7188842296600342,
"learning_rate": 5.919867306435934e-06,
"loss": 0.8716,
"mean_token_accuracy": 0.7712004780769348,
"num_tokens": 26454826.0,
"step": 495
},
{
"epoch": 6.2784810126582276,
"grad_norm": 0.7352620959281921,
"learning_rate": 5.722814739361459e-06,
"loss": 0.8841,
"mean_token_accuracy": 0.7689441442489624,
"num_tokens": 26506951.0,
"step": 496
},
{
"epoch": 6.291139240506329,
"grad_norm": 0.7250537872314453,
"learning_rate": 5.529000908151105e-06,
"loss": 0.9214,
"mean_token_accuracy": 0.7619938850402832,
"num_tokens": 26561501.0,
"step": 497
},
{
"epoch": 6.30379746835443,
"grad_norm": 0.741434633731842,
"learning_rate": 5.338432470956589e-06,
"loss": 0.8713,
"mean_token_accuracy": 0.7752888798713684,
"num_tokens": 26612279.0,
"step": 498
},
{
"epoch": 6.3164556962025316,
"grad_norm": 0.7042741775512695,
"learning_rate": 5.151115974439569e-06,
"loss": 0.918,
"mean_token_accuracy": 0.759595513343811,
"num_tokens": 26670391.0,
"step": 499
},
{
"epoch": 6.329113924050633,
"grad_norm": 0.7422060370445251,
"learning_rate": 4.967057853546653e-06,
"loss": 0.8468,
"mean_token_accuracy": 0.7787840366363525,
"num_tokens": 26724339.0,
"step": 500
},
{
"epoch": 6.341772151898734,
"grad_norm": 0.7409331202507019,
"learning_rate": 4.786264431288423e-06,
"loss": 0.8453,
"mean_token_accuracy": 0.7787643074989319,
"num_tokens": 26778463.0,
"step": 501
},
{
"epoch": 6.3544303797468356,
"grad_norm": 0.7570395469665527,
"learning_rate": 4.608741918522097e-06,
"loss": 0.8242,
"mean_token_accuracy": 0.7847666144371033,
"num_tokens": 26829402.0,
"step": 502
},
{
"epoch": 6.367088607594937,
"grad_norm": 0.7759395837783813,
"learning_rate": 4.434496413738332e-06,
"loss": 0.9319,
"mean_token_accuracy": 0.7584540843963623,
"num_tokens": 26881630.0,
"step": 503
},
{
"epoch": 6.379746835443038,
"grad_norm": 0.7546198964118958,
"learning_rate": 4.263533902851535e-06,
"loss": 0.9328,
"mean_token_accuracy": 0.7532243132591248,
"num_tokens": 26936667.0,
"step": 504
},
{
"epoch": 6.3924050632911396,
"grad_norm": 0.787138819694519,
"learning_rate": 4.095860258994388e-06,
"loss": 0.8714,
"mean_token_accuracy": 0.7742336392402649,
"num_tokens": 26987394.0,
"step": 505
},
{
"epoch": 6.405063291139241,
"grad_norm": 0.7618371844291687,
"learning_rate": 3.931481242315993e-06,
"loss": 0.9072,
"mean_token_accuracy": 0.7687786221504211,
"num_tokens": 27042241.0,
"step": 506
},
{
"epoch": 6.417721518987342,
"grad_norm": 0.7442908883094788,
"learning_rate": 3.770402499783976e-06,
"loss": 0.9159,
"mean_token_accuracy": 0.7618834972381592,
"num_tokens": 27098286.0,
"step": 507
},
{
"epoch": 6.430379746835443,
"grad_norm": 0.7562023997306824,
"learning_rate": 3.6126295649906216e-06,
"loss": 0.8177,
"mean_token_accuracy": 0.7862200140953064,
"num_tokens": 27153009.0,
"step": 508
},
{
"epoch": 6.443037974683544,
"grad_norm": 0.7642728090286255,
"learning_rate": 3.458167857962613e-06,
"loss": 0.9324,
"mean_token_accuracy": 0.7579013109207153,
"num_tokens": 27209108.0,
"step": 509
},
{
"epoch": 6.455696202531645,
"grad_norm": 0.7718908786773682,
"learning_rate": 3.3070226849749366e-06,
"loss": 0.9163,
"mean_token_accuracy": 0.7598476409912109,
"num_tokens": 27260885.0,
"step": 510
},
{
"epoch": 6.468354430379747,
"grad_norm": 0.7596184611320496,
"learning_rate": 3.159199238368593e-06,
"loss": 0.9469,
"mean_token_accuracy": 0.7533886432647705,
"num_tokens": 27315764.0,
"step": 511
},
{
"epoch": 6.481012658227848,
"grad_norm": 0.7800886034965515,
"learning_rate": 3.0147025963721433e-06,
"loss": 0.8988,
"mean_token_accuracy": 0.7648918628692627,
"num_tokens": 27367702.0,
"step": 512
},
{
"epoch": 6.493670886075949,
"grad_norm": 0.7586997151374817,
"learning_rate": 2.8735377229273998e-06,
"loss": 0.8676,
"mean_token_accuracy": 0.7724491953849792,
"num_tokens": 27419583.0,
"step": 513
},
{
"epoch": 6.506329113924051,
"grad_norm": 0.7350573539733887,
"learning_rate": 2.735709467518699e-06,
"loss": 0.8614,
"mean_token_accuracy": 0.7761837244033813,
"num_tokens": 27476037.0,
"step": 514
},
{
"epoch": 6.518987341772152,
"grad_norm": 0.7755162119865417,
"learning_rate": 2.6012225650064893e-06,
"loss": 0.7956,
"mean_token_accuracy": 0.7926900386810303,
"num_tokens": 27523981.0,
"step": 515
},
{
"epoch": 6.531645569620253,
"grad_norm": 0.7676106095314026,
"learning_rate": 2.470081635464594e-06,
"loss": 0.858,
"mean_token_accuracy": 0.7748537063598633,
"num_tokens": 27574963.0,
"step": 516
},
{
"epoch": 6.544303797468355,
"grad_norm": 0.7565949559211731,
"learning_rate": 2.342291184021461e-06,
"loss": 0.9054,
"mean_token_accuracy": 0.7672910094261169,
"num_tokens": 27628682.0,
"step": 517
},
{
"epoch": 6.556962025316456,
"grad_norm": 0.7573908567428589,
"learning_rate": 2.2178556007054872e-06,
"loss": 0.8732,
"mean_token_accuracy": 0.772281289100647,
"num_tokens": 27682255.0,
"step": 518
},
{
"epoch": 6.569620253164557,
"grad_norm": 0.7215973734855652,
"learning_rate": 2.0967791602941154e-06,
"loss": 0.8207,
"mean_token_accuracy": 0.785857617855072,
"num_tokens": 27733654.0,
"step": 519
},
{
"epoch": 6.582278481012658,
"grad_norm": 0.743601381778717,
"learning_rate": 1.979066022167042e-06,
"loss": 0.886,
"mean_token_accuracy": 0.7737412452697754,
"num_tokens": 27786706.0,
"step": 520
},
{
"epoch": 6.594936708860759,
"grad_norm": 0.7350673079490662,
"learning_rate": 1.8647202301633194e-06,
"loss": 0.8471,
"mean_token_accuracy": 0.7783074378967285,
"num_tokens": 27839636.0,
"step": 521
},
{
"epoch": 6.6075949367088604,
"grad_norm": 0.7188898921012878,
"learning_rate": 1.7537457124423895e-06,
"loss": 0.9255,
"mean_token_accuracy": 0.75742107629776,
"num_tokens": 27897306.0,
"step": 522
},
{
"epoch": 6.620253164556962,
"grad_norm": 0.7354036569595337,
"learning_rate": 1.6461462813492034e-06,
"loss": 0.9245,
"mean_token_accuracy": 0.7580609917640686,
"num_tokens": 27952078.0,
"step": 523
},
{
"epoch": 6.632911392405063,
"grad_norm": 0.7150800824165344,
"learning_rate": 1.5419256332832255e-06,
"loss": 0.8486,
"mean_token_accuracy": 0.7778921723365784,
"num_tokens": 28008475.0,
"step": 524
},
{
"epoch": 6.6455696202531644,
"grad_norm": 0.7539225816726685,
"learning_rate": 1.4410873485714238e-06,
"loss": 0.9198,
"mean_token_accuracy": 0.7615216970443726,
"num_tokens": 28063110.0,
"step": 525
},
{
"epoch": 6.658227848101266,
"grad_norm": 0.7394741773605347,
"learning_rate": 1.3436348913453578e-06,
"loss": 0.9504,
"mean_token_accuracy": 0.7545590996742249,
"num_tokens": 28117900.0,
"step": 526
},
{
"epoch": 6.670886075949367,
"grad_norm": 0.7107752561569214,
"learning_rate": 1.249571609422029e-06,
"loss": 0.8333,
"mean_token_accuracy": 0.7816824316978455,
"num_tokens": 28171148.0,
"step": 527
},
{
"epoch": 6.6835443037974684,
"grad_norm": 0.7358193397521973,
"learning_rate": 1.158900734189039e-06,
"loss": 0.8975,
"mean_token_accuracy": 0.7663297653198242,
"num_tokens": 28225040.0,
"step": 528
},
{
"epoch": 6.69620253164557,
"grad_norm": 0.7299255132675171,
"learning_rate": 1.0716253804934795e-06,
"loss": 0.8914,
"mean_token_accuracy": 0.7701156139373779,
"num_tokens": 28278222.0,
"step": 529
},
{
"epoch": 6.708860759493671,
"grad_norm": 0.7237915396690369,
"learning_rate": 9.877485465349058e-07,
"loss": 0.8646,
"mean_token_accuracy": 0.7740433216094971,
"num_tokens": 28331544.0,
"step": 530
},
{
"epoch": 6.7215189873417724,
"grad_norm": 0.7234286665916443,
"learning_rate": 9.072731137624413e-07,
"loss": 0.8846,
"mean_token_accuracy": 0.7751022577285767,
"num_tokens": 28387340.0,
"step": 531
},
{
"epoch": 6.734177215189874,
"grad_norm": 0.7300404906272888,
"learning_rate": 8.3020184677568e-07,
"loss": 0.8896,
"mean_token_accuracy": 0.7671842575073242,
"num_tokens": 28440854.0,
"step": 532
},
{
"epoch": 6.746835443037975,
"grad_norm": 0.7527182102203369,
"learning_rate": 7.56537393229817e-07,
"loss": 0.8803,
"mean_token_accuracy": 0.7691497206687927,
"num_tokens": 28494052.0,
"step": 533
},
{
"epoch": 6.759493670886076,
"grad_norm": 0.7488577961921692,
"learning_rate": 6.862822837445881e-07,
"loss": 0.8548,
"mean_token_accuracy": 0.7733297944068909,
"num_tokens": 28546849.0,
"step": 534
},
{
"epoch": 6.772151898734177,
"grad_norm": 0.7488005757331848,
"learning_rate": 6.194389318173954e-07,
"loss": 0.888,
"mean_token_accuracy": 0.7672020792961121,
"num_tokens": 28601514.0,
"step": 535
},
{
"epoch": 6.784810126582278,
"grad_norm": 0.7336114645004272,
"learning_rate": 5.560096337404397e-07,
"loss": 0.8876,
"mean_token_accuracy": 0.7662824392318726,
"num_tokens": 28655716.0,
"step": 536
},
{
"epoch": 6.7974683544303796,
"grad_norm": 0.7397316694259644,
"learning_rate": 4.959965685216949e-07,
"loss": 0.8851,
"mean_token_accuracy": 0.7723047733306885,
"num_tokens": 28708605.0,
"step": 537
},
{
"epoch": 6.810126582278481,
"grad_norm": 0.7416898012161255,
"learning_rate": 4.3940179781019055e-07,
"loss": 0.8685,
"mean_token_accuracy": 0.7749481797218323,
"num_tokens": 28762190.0,
"step": 538
},
{
"epoch": 6.822784810126582,
"grad_norm": 0.7306899428367615,
"learning_rate": 3.8622726582514537e-07,
"loss": 0.9062,
"mean_token_accuracy": 0.7666445970535278,
"num_tokens": 28819630.0,
"step": 539
},
{
"epoch": 6.8354430379746836,
"grad_norm": 0.7442116141319275,
"learning_rate": 3.364747992891215e-07,
"loss": 0.8668,
"mean_token_accuracy": 0.770470917224884,
"num_tokens": 28871426.0,
"step": 540
},
{
"epoch": 6.848101265822785,
"grad_norm": 0.7165699005126953,
"learning_rate": 2.901461073653633e-07,
"loss": 0.8279,
"mean_token_accuracy": 0.78138667345047,
"num_tokens": 28926139.0,
"step": 541
},
{
"epoch": 6.860759493670886,
"grad_norm": 0.7217394113540649,
"learning_rate": 2.472427815989886e-07,
"loss": 0.8511,
"mean_token_accuracy": 0.778727114200592,
"num_tokens": 28982030.0,
"step": 542
},
{
"epoch": 6.8734177215189876,
"grad_norm": 0.7448404431343079,
"learning_rate": 2.0776629586239936e-07,
"loss": 0.8987,
"mean_token_accuracy": 0.7639403343200684,
"num_tokens": 29035572.0,
"step": 543
},
{
"epoch": 6.886075949367089,
"grad_norm": 0.7140018343925476,
"learning_rate": 1.7171800630458868e-07,
"loss": 0.8414,
"mean_token_accuracy": 0.7787364721298218,
"num_tokens": 29090688.0,
"step": 544
},
{
"epoch": 6.89873417721519,
"grad_norm": 0.7151165008544922,
"learning_rate": 1.3909915130457808e-07,
"loss": 0.8353,
"mean_token_accuracy": 0.7813047170639038,
"num_tokens": 29146167.0,
"step": 545
},
{
"epoch": 6.911392405063291,
"grad_norm": 0.7673919796943665,
"learning_rate": 1.0991085142886271e-07,
"loss": 0.8912,
"mean_token_accuracy": 0.7691309452056885,
"num_tokens": 29197862.0,
"step": 546
},
{
"epoch": 6.924050632911392,
"grad_norm": 0.7264222502708435,
"learning_rate": 8.41541093929199e-08,
"loss": 0.9261,
"mean_token_accuracy": 0.7595686912536621,
"num_tokens": 29252923.0,
"step": 547
},
{
"epoch": 6.936708860759493,
"grad_norm": 0.741691529750824,
"learning_rate": 6.182981002679223e-08,
"loss": 0.8706,
"mean_token_accuracy": 0.7722748517990112,
"num_tokens": 29307443.0,
"step": 548
},
{
"epoch": 6.949367088607595,
"grad_norm": 0.7263526320457458,
"learning_rate": 4.293872024463408e-08,
"loss": 0.9296,
"mean_token_accuracy": 0.7559453248977661,
"num_tokens": 29364064.0,
"step": 549
},
{
"epoch": 6.962025316455696,
"grad_norm": 0.7507171034812927,
"learning_rate": 2.7481489018410523e-08,
"loss": 0.8557,
"mean_token_accuracy": 0.7787690162658691,
"num_tokens": 29417484.0,
"step": 550
},
{
"epoch": 6.974683544303797,
"grad_norm": 0.7565820813179016,
"learning_rate": 1.545864735558178e-08,
"loss": 0.9,
"mean_token_accuracy": 0.764269232749939,
"num_tokens": 29470354.0,
"step": 551
},
{
"epoch": 6.987341772151899,
"grad_norm": 0.7323611378669739,
"learning_rate": 6.8706082808955855e-09,
"loss": 0.839,
"mean_token_accuracy": 0.776936411857605,
"num_tokens": 29521789.0,
"step": 552
},
{
"epoch": 7.0,
"grad_norm": 0.7202613353729248,
"learning_rate": 1.7176668221208225e-09,
"loss": 0.8342,
"mean_token_accuracy": 0.7798174023628235,
"num_tokens": 29574859.0,
"step": 553
},
{
"epoch": 7.0,
"step": 553,
"total_flos": 1.6684160180929167e+18,
"train_loss": 1.57913771772902,
"train_runtime": 3337.6138,
"train_samples_per_second": 10.487,
"train_steps_per_second": 0.166
}
],
"logging_steps": 1.0,
"max_steps": 553,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6684160180929167e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}