LLM-continual-learning / trace /seq /order7 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order7
4c42f51 verified
Raw
History Blame Contribute Delete
99.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.942675159235669,
"eval_steps": 500,
"global_step": 390,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 3.7824301719665527,
"learning_rate": 0.0,
"loss": 1.2233,
"mean_token_accuracy": 0.8302195966243744,
"num_tokens": 5210.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 3.9117865562438965,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.2964,
"mean_token_accuracy": 0.818906307220459,
"num_tokens": 10552.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 3.2288713455200195,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.1763,
"mean_token_accuracy": 0.8304943442344666,
"num_tokens": 15783.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 2.576040029525757,
"learning_rate": 5e-05,
"loss": 0.9544,
"mean_token_accuracy": 0.8481430411338806,
"num_tokens": 21055.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 1.6133369207382202,
"learning_rate": 6.666666666666667e-05,
"loss": 0.7482,
"mean_token_accuracy": 0.8650574088096619,
"num_tokens": 26525.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 0.8690425753593445,
"learning_rate": 8.333333333333334e-05,
"loss": 0.5017,
"mean_token_accuracy": 0.8963637351989746,
"num_tokens": 31775.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 0.674253523349762,
"learning_rate": 0.0001,
"loss": 0.4655,
"mean_token_accuracy": 0.8968947529792786,
"num_tokens": 37075.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 0.5956063866615295,
"learning_rate": 0.00011666666666666668,
"loss": 0.4192,
"mean_token_accuracy": 0.8946096897125244,
"num_tokens": 42353.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.5653583407402039,
"learning_rate": 0.00013333333333333334,
"loss": 0.3808,
"mean_token_accuracy": 0.9010607898235321,
"num_tokens": 47529.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 0.531235933303833,
"learning_rate": 0.00015000000000000001,
"loss": 0.3412,
"mean_token_accuracy": 0.9112062156200409,
"num_tokens": 52843.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.45494160056114197,
"learning_rate": 0.0001666666666666667,
"loss": 0.2764,
"mean_token_accuracy": 0.9187242984771729,
"num_tokens": 57941.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.44628530740737915,
"learning_rate": 0.00018333333333333334,
"loss": 0.2744,
"mean_token_accuracy": 0.9186911284923553,
"num_tokens": 63062.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.3284648656845093,
"learning_rate": 0.0002,
"loss": 0.2801,
"mean_token_accuracy": 0.9165399074554443,
"num_tokens": 68111.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.37082329392433167,
"learning_rate": 0.0001999965463076377,
"loss": 0.3087,
"mean_token_accuracy": 0.9133042097091675,
"num_tokens": 73237.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.3130003809928894,
"learning_rate": 0.00019998618546911056,
"loss": 0.2477,
"mean_token_accuracy": 0.9158357977867126,
"num_tokens": 78491.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.3563134968280792,
"learning_rate": 0.00019996891820008164,
"loss": 0.282,
"mean_token_accuracy": 0.912090390920639,
"num_tokens": 83703.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.29488661885261536,
"learning_rate": 0.00019994474569326757,
"loss": 0.2589,
"mean_token_accuracy": 0.9159494936466217,
"num_tokens": 88876.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.29270514845848083,
"learning_rate": 0.00019991366961835642,
"loss": 0.2396,
"mean_token_accuracy": 0.921425074338913,
"num_tokens": 93966.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.27681994438171387,
"learning_rate": 0.00019987569212189224,
"loss": 0.2243,
"mean_token_accuracy": 0.9262824356555939,
"num_tokens": 99078.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.29514309763908386,
"learning_rate": 0.00019983081582712685,
"loss": 0.2013,
"mean_token_accuracy": 0.9278378784656525,
"num_tokens": 104362.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.3255820870399475,
"learning_rate": 0.0001997790438338385,
"loss": 0.2071,
"mean_token_accuracy": 0.928867369890213,
"num_tokens": 109431.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.24862290918827057,
"learning_rate": 0.00019972037971811802,
"loss": 0.1889,
"mean_token_accuracy": 0.9348132014274597,
"num_tokens": 114757.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.33368730545043945,
"learning_rate": 0.00019965482753212156,
"loss": 0.2195,
"mean_token_accuracy": 0.927293449640274,
"num_tokens": 119944.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.27442213892936707,
"learning_rate": 0.0001995823918037908,
"loss": 0.2068,
"mean_token_accuracy": 0.9322147965431213,
"num_tokens": 125131.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.2690294682979584,
"learning_rate": 0.00019950307753654017,
"loss": 0.1975,
"mean_token_accuracy": 0.9335231781005859,
"num_tokens": 130305.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.23441526293754578,
"learning_rate": 0.0001994168902089112,
"loss": 0.176,
"mean_token_accuracy": 0.9373516738414764,
"num_tokens": 135592.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.257511168718338,
"learning_rate": 0.00019932383577419432,
"loss": 0.1991,
"mean_token_accuracy": 0.9299597442150116,
"num_tokens": 140754.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.23336845636367798,
"learning_rate": 0.00019922392066001722,
"loss": 0.1838,
"mean_token_accuracy": 0.9314956963062286,
"num_tokens": 145828.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.25471892952919006,
"learning_rate": 0.0001991171517679013,
"loss": 0.1911,
"mean_token_accuracy": 0.933700293302536,
"num_tokens": 151081.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.2571130394935608,
"learning_rate": 0.00019900353647278466,
"loss": 0.1908,
"mean_token_accuracy": 0.9333758354187012,
"num_tokens": 156157.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.28059864044189453,
"learning_rate": 0.00019888308262251285,
"loss": 0.1861,
"mean_token_accuracy": 0.9347586631774902,
"num_tokens": 161402.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.22686001658439636,
"learning_rate": 0.00019875579853729676,
"loss": 0.1769,
"mean_token_accuracy": 0.93821582198143,
"num_tokens": 166536.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.20812684297561646,
"learning_rate": 0.00019862169300913785,
"loss": 0.163,
"mean_token_accuracy": 0.9406305253505707,
"num_tokens": 171906.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.3466432988643646,
"learning_rate": 0.00019848077530122083,
"loss": 0.1831,
"mean_token_accuracy": 0.9393357038497925,
"num_tokens": 177080.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.21919341385364532,
"learning_rate": 0.00019833305514727395,
"loss": 0.1669,
"mean_token_accuracy": 0.9385254979133606,
"num_tokens": 182316.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.2825665771961212,
"learning_rate": 0.0001981785427508966,
"loss": 0.1708,
"mean_token_accuracy": 0.9377457201480865,
"num_tokens": 187617.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.23675024509429932,
"learning_rate": 0.00019801724878485438,
"loss": 0.1711,
"mean_token_accuracy": 0.9380519986152649,
"num_tokens": 192716.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.25276389718055725,
"learning_rate": 0.00019784918439034216,
"loss": 0.1611,
"mean_token_accuracy": 0.9403159916400909,
"num_tokens": 197979.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.23940987884998322,
"learning_rate": 0.00019767436117621413,
"loss": 0.1638,
"mean_token_accuracy": 0.936554491519928,
"num_tokens": 203088.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.20817831158638,
"learning_rate": 0.00019749279121818235,
"loss": 0.1539,
"mean_token_accuracy": 0.9392144680023193,
"num_tokens": 208270.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.21488814055919647,
"learning_rate": 0.00019730448705798239,
"loss": 0.1635,
"mean_token_accuracy": 0.940779834985733,
"num_tokens": 213525.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.23421017825603485,
"learning_rate": 0.000197109461702507,
"loss": 0.1496,
"mean_token_accuracy": 0.9416719675064087,
"num_tokens": 218891.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.258142352104187,
"learning_rate": 0.0001969077286229078,
"loss": 0.1691,
"mean_token_accuracy": 0.934789776802063,
"num_tokens": 224040.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.2293170988559723,
"learning_rate": 0.00019669930175366472,
"loss": 0.1577,
"mean_token_accuracy": 0.9377670586109161,
"num_tokens": 229247.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.24188922345638275,
"learning_rate": 0.00019648419549162348,
"loss": 0.1521,
"mean_token_accuracy": 0.9420928061008453,
"num_tokens": 234459.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.21200227737426758,
"learning_rate": 0.0001962624246950012,
"loss": 0.1527,
"mean_token_accuracy": 0.9398773610591888,
"num_tokens": 239713.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.19552259147167206,
"learning_rate": 0.00019603400468235998,
"loss": 0.1573,
"mean_token_accuracy": 0.9376706182956696,
"num_tokens": 244800.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.2834009826183319,
"learning_rate": 0.0001957989512315489,
"loss": 0.1577,
"mean_token_accuracy": 0.941499799489975,
"num_tokens": 250082.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.16560231149196625,
"learning_rate": 0.0001955572805786141,
"loss": 0.1465,
"mean_token_accuracy": 0.9433980286121368,
"num_tokens": 255252.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.21149985492229462,
"learning_rate": 0.0001953090094166773,
"loss": 0.1625,
"mean_token_accuracy": 0.9402491450309753,
"num_tokens": 260269.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.1948973536491394,
"learning_rate": 0.0001950541548947829,
"loss": 0.1493,
"mean_token_accuracy": 0.9446166753768921,
"num_tokens": 265479.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.19634638726711273,
"learning_rate": 0.0001947927346167132,
"loss": 0.151,
"mean_token_accuracy": 0.9424458146095276,
"num_tokens": 270804.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.1933320313692093,
"learning_rate": 0.00019452476663977248,
"loss": 0.1495,
"mean_token_accuracy": 0.9416649639606476,
"num_tokens": 276011.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.21446828544139862,
"learning_rate": 0.00019425026947353992,
"loss": 0.1466,
"mean_token_accuracy": 0.9454257786273956,
"num_tokens": 281225.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.19887098670005798,
"learning_rate": 0.00019396926207859084,
"loss": 0.157,
"mean_token_accuracy": 0.9424851536750793,
"num_tokens": 286422.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.1844012588262558,
"learning_rate": 0.0001936817638651871,
"loss": 0.144,
"mean_token_accuracy": 0.9469358026981354,
"num_tokens": 291678.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.18799826502799988,
"learning_rate": 0.00019338779469193639,
"loss": 0.1534,
"mean_token_accuracy": 0.9458630979061127,
"num_tokens": 296804.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.19042469561100006,
"learning_rate": 0.00019308737486442045,
"loss": 0.1545,
"mean_token_accuracy": 0.9410763680934906,
"num_tokens": 301857.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.158956378698349,
"learning_rate": 0.00019278052513379255,
"loss": 0.1379,
"mean_token_accuracy": 0.9460055828094482,
"num_tokens": 307051.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.1815986931324005,
"learning_rate": 0.00019246726669534415,
"loss": 0.1409,
"mean_token_accuracy": 0.9435812532901764,
"num_tokens": 312257.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.22261983156204224,
"learning_rate": 0.00019214762118704076,
"loss": 0.156,
"mean_token_accuracy": 0.9413077235221863,
"num_tokens": 317412.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.1710008829832077,
"learning_rate": 0.00019182161068802741,
"loss": 0.1378,
"mean_token_accuracy": 0.9503642618656158,
"num_tokens": 322734.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.3039683401584625,
"learning_rate": 0.00019148925771710347,
"loss": 0.1385,
"mean_token_accuracy": 0.9450577795505524,
"num_tokens": 328129.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.15925206243991852,
"learning_rate": 0.00019115058523116733,
"loss": 0.1311,
"mean_token_accuracy": 0.9462718069553375,
"num_tokens": 333272.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.1598874181509018,
"learning_rate": 0.0001908056166236305,
"loss": 0.1391,
"mean_token_accuracy": 0.946659117937088,
"num_tokens": 338420.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.18179531395435333,
"learning_rate": 0.00019045437572280194,
"loss": 0.1426,
"mean_token_accuracy": 0.945913702249527,
"num_tokens": 343626.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.17175814509391785,
"learning_rate": 0.0001900968867902419,
"loss": 0.132,
"mean_token_accuracy": 0.9485920369625092,
"num_tokens": 348845.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.1869221180677414,
"learning_rate": 0.00018973317451908642,
"loss": 0.1356,
"mean_token_accuracy": 0.9477656185626984,
"num_tokens": 354138.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.20954406261444092,
"learning_rate": 0.00018936326403234125,
"loss": 0.1454,
"mean_token_accuracy": 0.9445447623729706,
"num_tokens": 359314.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.1922268569469452,
"learning_rate": 0.0001889871808811469,
"loss": 0.1354,
"mean_token_accuracy": 0.9471762180328369,
"num_tokens": 364473.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.17652815580368042,
"learning_rate": 0.00018860495104301345,
"loss": 0.1376,
"mean_token_accuracy": 0.9477506279945374,
"num_tokens": 369703.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.23259028792381287,
"learning_rate": 0.00018821660092002641,
"loss": 0.1352,
"mean_token_accuracy": 0.9448699951171875,
"num_tokens": 374865.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.22274835407733917,
"learning_rate": 0.00018782215733702286,
"loss": 0.1466,
"mean_token_accuracy": 0.9414529800415039,
"num_tokens": 379986.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.2029760628938675,
"learning_rate": 0.00018742164753973855,
"loss": 0.1321,
"mean_token_accuracy": 0.9473606944084167,
"num_tokens": 385254.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.2057085484266281,
"learning_rate": 0.00018701509919292613,
"loss": 0.1368,
"mean_token_accuracy": 0.946168452501297,
"num_tokens": 390556.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.15876570343971252,
"learning_rate": 0.00018660254037844388,
"loss": 0.1295,
"mean_token_accuracy": 0.9503520429134369,
"num_tokens": 395877.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.17099611461162567,
"learning_rate": 0.0001861839995933164,
"loss": 0.1351,
"mean_token_accuracy": 0.9449459612369537,
"num_tokens": 400995.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.15932753682136536,
"learning_rate": 0.00018575950574776595,
"loss": 0.1295,
"mean_token_accuracy": 0.9448761940002441,
"num_tokens": 406243.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.15932753682136536,
"learning_rate": 0.00018532908816321558,
"loss": 0.1417,
"mean_token_accuracy": 0.9469307065010071,
"num_tokens": 408800.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.2659032642841339,
"learning_rate": 0.00018489277657026375,
"loss": 0.1304,
"mean_token_accuracy": 0.9467148184776306,
"num_tokens": 413872.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.14225730299949646,
"learning_rate": 0.0001844506011066308,
"loss": 0.1282,
"mean_token_accuracy": 0.9470857381820679,
"num_tokens": 419058.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.14326529204845428,
"learning_rate": 0.00018400259231507717,
"loss": 0.1257,
"mean_token_accuracy": 0.9480691254138947,
"num_tokens": 424398.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.18412485718727112,
"learning_rate": 0.00018354878114129367,
"loss": 0.1232,
"mean_token_accuracy": 0.9475138187408447,
"num_tokens": 429816.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.16766390204429626,
"learning_rate": 0.00018308919893176396,
"loss": 0.1234,
"mean_token_accuracy": 0.9507202506065369,
"num_tokens": 435036.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.14527039229869843,
"learning_rate": 0.0001826238774315995,
"loss": 0.1275,
"mean_token_accuracy": 0.9464537501335144,
"num_tokens": 440091.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.20255133509635925,
"learning_rate": 0.00018215284878234642,
"loss": 0.1424,
"mean_token_accuracy": 0.9444701671600342,
"num_tokens": 445081.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.1725914031267166,
"learning_rate": 0.00018167614551976567,
"loss": 0.1335,
"mean_token_accuracy": 0.9467510879039764,
"num_tokens": 450138.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.2247326523065567,
"learning_rate": 0.00018119380057158568,
"loss": 0.14,
"mean_token_accuracy": 0.9452223479747772,
"num_tokens": 455277.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.20980721712112427,
"learning_rate": 0.00018070584725522762,
"loss": 0.1289,
"mean_token_accuracy": 0.9489553868770599,
"num_tokens": 460438.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.14790885150432587,
"learning_rate": 0.0001802123192755044,
"loss": 0.1253,
"mean_token_accuracy": 0.9499755501747131,
"num_tokens": 465678.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.14694303274154663,
"learning_rate": 0.00017971325072229226,
"loss": 0.1205,
"mean_token_accuracy": 0.9478762447834015,
"num_tokens": 470920.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.1444869190454483,
"learning_rate": 0.00017920867606817625,
"loss": 0.1258,
"mean_token_accuracy": 0.9522562026977539,
"num_tokens": 476011.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.1662275493144989,
"learning_rate": 0.0001786986301660689,
"loss": 0.1282,
"mean_token_accuracy": 0.9508558809757233,
"num_tokens": 481122.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.12791097164154053,
"learning_rate": 0.000178183148246803,
"loss": 0.1323,
"mean_token_accuracy": 0.944861888885498,
"num_tokens": 486156.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.15323220193386078,
"learning_rate": 0.00017766226591669785,
"loss": 0.1293,
"mean_token_accuracy": 0.951024740934372,
"num_tokens": 491386.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.14362579584121704,
"learning_rate": 0.0001771360191551,
"loss": 0.1279,
"mean_token_accuracy": 0.9486364126205444,
"num_tokens": 496639.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.16863521933555603,
"learning_rate": 0.0001766044443118978,
"loss": 0.1304,
"mean_token_accuracy": 0.9472695589065552,
"num_tokens": 501899.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.14442408084869385,
"learning_rate": 0.00017606757810501088,
"loss": 0.1276,
"mean_token_accuracy": 0.9468772709369659,
"num_tokens": 506969.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.18459908664226532,
"learning_rate": 0.0001755254576178535,
"loss": 0.1288,
"mean_token_accuracy": 0.9511973857879639,
"num_tokens": 512177.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.15920302271842957,
"learning_rate": 0.00017497812029677344,
"loss": 0.125,
"mean_token_accuracy": 0.9510241746902466,
"num_tokens": 517503.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.14390042424201965,
"learning_rate": 0.00017442560394846516,
"loss": 0.1235,
"mean_token_accuracy": 0.9539001286029816,
"num_tokens": 522650.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.15696237981319427,
"learning_rate": 0.0001738679467373586,
"loss": 0.1294,
"mean_token_accuracy": 0.9488069415092468,
"num_tokens": 527850.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.14888447523117065,
"learning_rate": 0.00017330518718298264,
"loss": 0.1264,
"mean_token_accuracy": 0.9493102431297302,
"num_tokens": 533004.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.159367173910141,
"learning_rate": 0.00017273736415730488,
"loss": 0.1275,
"mean_token_accuracy": 0.947404533624649,
"num_tokens": 538199.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.12455767393112183,
"learning_rate": 0.0001721645168820462,
"loss": 0.1189,
"mean_token_accuracy": 0.9485114812850952,
"num_tokens": 543545.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.1362970769405365,
"learning_rate": 0.00017158668492597186,
"loss": 0.1239,
"mean_token_accuracy": 0.9471650719642639,
"num_tokens": 548699.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.10838621109724045,
"learning_rate": 0.00017100390820215804,
"loss": 0.1221,
"mean_token_accuracy": 0.9493043720722198,
"num_tokens": 553971.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.14165404438972473,
"learning_rate": 0.00017041622696523518,
"loss": 0.1219,
"mean_token_accuracy": 0.951966792345047,
"num_tokens": 559156.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.12003354728221893,
"learning_rate": 0.00016982368180860728,
"loss": 0.1188,
"mean_token_accuracy": 0.9512242674827576,
"num_tokens": 564284.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.11046839505434036,
"learning_rate": 0.00016922631366164797,
"loss": 0.1191,
"mean_token_accuracy": 0.9494934380054474,
"num_tokens": 569516.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.13339076936244965,
"learning_rate": 0.0001686241637868734,
"loss": 0.1186,
"mean_token_accuracy": 0.9493625164031982,
"num_tokens": 574816.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.15977565944194794,
"learning_rate": 0.00016801727377709194,
"loss": 0.1319,
"mean_token_accuracy": 0.9512809216976166,
"num_tokens": 580117.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.18785618245601654,
"learning_rate": 0.00016740568555253155,
"loss": 0.1203,
"mean_token_accuracy": 0.9501672685146332,
"num_tokens": 585339.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.13912543654441833,
"learning_rate": 0.00016678944135794374,
"loss": 0.1209,
"mean_token_accuracy": 0.9528982639312744,
"num_tokens": 590648.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.1673336625099182,
"learning_rate": 0.00016616858375968595,
"loss": 0.1278,
"mean_token_accuracy": 0.9478160440921783,
"num_tokens": 595944.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.13905712962150574,
"learning_rate": 0.000165543155642781,
"loss": 0.1235,
"mean_token_accuracy": 0.9476510584354401,
"num_tokens": 601036.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.2041148841381073,
"learning_rate": 0.0001649132002079552,
"loss": 0.1236,
"mean_token_accuracy": 0.9503988921642303,
"num_tokens": 606263.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.1707996129989624,
"learning_rate": 0.00016427876096865394,
"loss": 0.1245,
"mean_token_accuracy": 0.9471159875392914,
"num_tokens": 611452.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.15354764461517334,
"learning_rate": 0.00016363988174803638,
"loss": 0.1211,
"mean_token_accuracy": 0.9493577182292938,
"num_tokens": 616575.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.10961586982011795,
"learning_rate": 0.00016299660667594814,
"loss": 0.1189,
"mean_token_accuracy": 0.9515132904052734,
"num_tokens": 621819.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.165780708193779,
"learning_rate": 0.00016234898018587337,
"loss": 0.1228,
"mean_token_accuracy": 0.9477584362030029,
"num_tokens": 626913.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.1603623777627945,
"learning_rate": 0.00016169704701186527,
"loss": 0.1231,
"mean_token_accuracy": 0.9464293122291565,
"num_tokens": 632152.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.14159291982650757,
"learning_rate": 0.00016104085218545633,
"loss": 0.1258,
"mean_token_accuracy": 0.9506712853908539,
"num_tokens": 637425.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.11082585901021957,
"learning_rate": 0.00016038044103254775,
"loss": 0.1183,
"mean_token_accuracy": 0.9518589675426483,
"num_tokens": 642786.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.1823294758796692,
"learning_rate": 0.00015971585917027862,
"loss": 0.122,
"mean_token_accuracy": 0.9472161531448364,
"num_tokens": 647984.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.11483275145292282,
"learning_rate": 0.00015904715250387498,
"loss": 0.1262,
"mean_token_accuracy": 0.947608083486557,
"num_tokens": 653201.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.1607467085123062,
"learning_rate": 0.000158374367223479,
"loss": 0.1196,
"mean_token_accuracy": 0.954265683889389,
"num_tokens": 658517.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.10482734441757202,
"learning_rate": 0.0001576975498009583,
"loss": 0.1202,
"mean_token_accuracy": 0.9509238004684448,
"num_tokens": 663717.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.1322750598192215,
"learning_rate": 0.0001570167469866962,
"loss": 0.1185,
"mean_token_accuracy": 0.9499522149562836,
"num_tokens": 668899.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.10216841846704483,
"learning_rate": 0.0001563320058063622,
"loss": 0.117,
"mean_token_accuracy": 0.9509294629096985,
"num_tokens": 674100.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.1417446881532669,
"learning_rate": 0.00015564337355766412,
"loss": 0.1168,
"mean_token_accuracy": 0.9485281705856323,
"num_tokens": 679353.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.12658298015594482,
"learning_rate": 0.0001549508978070806,
"loss": 0.1146,
"mean_token_accuracy": 0.9511803686618805,
"num_tokens": 684663.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.11299584060907364,
"learning_rate": 0.00015425462638657595,
"loss": 0.1192,
"mean_token_accuracy": 0.9505378007888794,
"num_tokens": 689891.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.13253171741962433,
"learning_rate": 0.00015355460739029586,
"loss": 0.1205,
"mean_token_accuracy": 0.9539958238601685,
"num_tokens": 695197.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.14320266246795654,
"learning_rate": 0.00015285088917124556,
"loss": 0.123,
"mean_token_accuracy": 0.9514380991458893,
"num_tokens": 700335.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.1291801780462265,
"learning_rate": 0.0001521435203379498,
"loss": 0.1233,
"mean_token_accuracy": 0.9470665752887726,
"num_tokens": 705406.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.10977620631456375,
"learning_rate": 0.00015143254975109538,
"loss": 0.1198,
"mean_token_accuracy": 0.9482473433017731,
"num_tokens": 710535.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.1165376827120781,
"learning_rate": 0.0001507180265201559,
"loss": 0.1159,
"mean_token_accuracy": 0.9500870704650879,
"num_tokens": 715713.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.09521724283695221,
"learning_rate": 0.00015000000000000001,
"loss": 0.1157,
"mean_token_accuracy": 0.9525724649429321,
"num_tokens": 720964.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.11171551793813705,
"learning_rate": 0.00014927851978748178,
"loss": 0.1164,
"mean_token_accuracy": 0.9490360617637634,
"num_tokens": 726071.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.09082835912704468,
"learning_rate": 0.00014855363571801523,
"loss": 0.1121,
"mean_token_accuracy": 0.9526254236698151,
"num_tokens": 731318.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.0980280190706253,
"learning_rate": 0.00014782539786213183,
"loss": 0.1141,
"mean_token_accuracy": 0.9535337686538696,
"num_tokens": 736504.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.09917044639587402,
"learning_rate": 0.00014709385652202203,
"loss": 0.1225,
"mean_token_accuracy": 0.94985231757164,
"num_tokens": 741575.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.10919863730669022,
"learning_rate": 0.00014635906222806058,
"loss": 0.1113,
"mean_token_accuracy": 0.9551882147789001,
"num_tokens": 746946.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.1464734524488449,
"learning_rate": 0.0001456210657353163,
"loss": 0.1174,
"mean_token_accuracy": 0.9487408995628357,
"num_tokens": 752294.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.130368173122406,
"learning_rate": 0.00014487991802004623,
"loss": 0.1211,
"mean_token_accuracy": 0.9474329650402069,
"num_tokens": 757381.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.11154960840940475,
"learning_rate": 0.0001441356702761744,
"loss": 0.1179,
"mean_token_accuracy": 0.9520448744297028,
"num_tokens": 762617.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.14685551822185516,
"learning_rate": 0.00014338837391175582,
"loss": 0.1206,
"mean_token_accuracy": 0.9540107548236847,
"num_tokens": 767864.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.12117283046245575,
"learning_rate": 0.0001426380805454254,
"loss": 0.1084,
"mean_token_accuracy": 0.9583871364593506,
"num_tokens": 773276.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.11210386455059052,
"learning_rate": 0.0001418848420028325,
"loss": 0.1151,
"mean_token_accuracy": 0.9484023153781891,
"num_tokens": 778515.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.11518337577581406,
"learning_rate": 0.00014112871031306119,
"loss": 0.1223,
"mean_token_accuracy": 0.9511970281600952,
"num_tokens": 783599.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.09871043264865875,
"learning_rate": 0.00014036973770503624,
"loss": 0.1177,
"mean_token_accuracy": 0.9499721825122833,
"num_tokens": 788755.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.10248729586601257,
"learning_rate": 0.0001396079766039157,
"loss": 0.1141,
"mean_token_accuracy": 0.9549025297164917,
"num_tokens": 794052.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.10185417532920837,
"learning_rate": 0.00013884347962746948,
"loss": 0.1154,
"mean_token_accuracy": 0.9485199749469757,
"num_tokens": 799324.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.10412627458572388,
"learning_rate": 0.00013807629958244498,
"loss": 0.1144,
"mean_token_accuracy": 0.9535442888736725,
"num_tokens": 804598.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.09640145301818848,
"learning_rate": 0.0001373064894609194,
"loss": 0.1144,
"mean_token_accuracy": 0.9523051679134369,
"num_tokens": 809991.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.12382632493972778,
"learning_rate": 0.00013653410243663952,
"loss": 0.118,
"mean_token_accuracy": 0.950864315032959,
"num_tokens": 815085.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.1575586348772049,
"learning_rate": 0.0001357591918613486,
"loss": 0.112,
"mean_token_accuracy": 0.9533618092536926,
"num_tokens": 817690.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.1542641818523407,
"learning_rate": 0.0001349818112611015,
"loss": 0.1125,
"mean_token_accuracy": 0.9523372650146484,
"num_tokens": 822995.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.10381153225898743,
"learning_rate": 0.00013420201433256689,
"loss": 0.11,
"mean_token_accuracy": 0.9508816599845886,
"num_tokens": 828255.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.0960901603102684,
"learning_rate": 0.00013341985493931877,
"loss": 0.1154,
"mean_token_accuracy": 0.9514484405517578,
"num_tokens": 833390.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.0993146151304245,
"learning_rate": 0.0001326353871081156,
"loss": 0.1138,
"mean_token_accuracy": 0.9487912058830261,
"num_tokens": 838553.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.10440049320459366,
"learning_rate": 0.00013184866502516845,
"loss": 0.1088,
"mean_token_accuracy": 0.9525078237056732,
"num_tokens": 843860.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.12403910607099533,
"learning_rate": 0.00013105974303239838,
"loss": 0.1127,
"mean_token_accuracy": 0.9510957598686218,
"num_tokens": 849076.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.11162856221199036,
"learning_rate": 0.0001302686756236826,
"loss": 0.1095,
"mean_token_accuracy": 0.957258552312851,
"num_tokens": 854384.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.09947948902845383,
"learning_rate": 0.00012947551744109043,
"loss": 0.1111,
"mean_token_accuracy": 0.9516081511974335,
"num_tokens": 859636.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.12568730115890503,
"learning_rate": 0.00012868032327110904,
"loss": 0.1128,
"mean_token_accuracy": 0.9562821388244629,
"num_tokens": 864827.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.15059728920459747,
"learning_rate": 0.00012788314804085903,
"loss": 0.1156,
"mean_token_accuracy": 0.9558725357055664,
"num_tokens": 870035.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.11143993586301804,
"learning_rate": 0.00012708404681430053,
"loss": 0.1135,
"mean_token_accuracy": 0.9555186331272125,
"num_tokens": 875272.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.14999280869960785,
"learning_rate": 0.00012628307478842953,
"loss": 0.1137,
"mean_token_accuracy": 0.9542877078056335,
"num_tokens": 880368.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.1020786389708519,
"learning_rate": 0.0001254802872894655,
"loss": 0.1132,
"mean_token_accuracy": 0.9493483901023865,
"num_tokens": 885550.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.13141581416130066,
"learning_rate": 0.00012467573976902935,
"loss": 0.1118,
"mean_token_accuracy": 0.9513366222381592,
"num_tokens": 890817.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.13585546612739563,
"learning_rate": 0.0001238694878003138,
"loss": 0.1118,
"mean_token_accuracy": 0.9503801763057709,
"num_tokens": 896078.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.15674127638339996,
"learning_rate": 0.00012306158707424403,
"loss": 0.1164,
"mean_token_accuracy": 0.9482068419456482,
"num_tokens": 901259.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.16721534729003906,
"learning_rate": 0.00012225209339563145,
"loss": 0.1152,
"mean_token_accuracy": 0.95207279920578,
"num_tokens": 906393.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.16014410555362701,
"learning_rate": 0.00012144106267931876,
"loss": 0.1113,
"mean_token_accuracy": 0.9518575370311737,
"num_tokens": 911516.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.10618874430656433,
"learning_rate": 0.00012062855094631778,
"loss": 0.1156,
"mean_token_accuracy": 0.9505187571048737,
"num_tokens": 916572.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.14721563458442688,
"learning_rate": 0.00011981461431993977,
"loss": 0.111,
"mean_token_accuracy": 0.9537347555160522,
"num_tokens": 921824.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.10303163528442383,
"learning_rate": 0.00011899930902191902,
"loss": 0.1124,
"mean_token_accuracy": 0.9502955079078674,
"num_tokens": 926978.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.1269257515668869,
"learning_rate": 0.00011818269136852909,
"loss": 0.1148,
"mean_token_accuracy": 0.9499041736125946,
"num_tokens": 932220.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.12417840957641602,
"learning_rate": 0.00011736481776669306,
"loss": 0.1157,
"mean_token_accuracy": 0.949295312166214,
"num_tokens": 937491.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.2725951075553894,
"learning_rate": 0.00011654574471008713,
"loss": 0.1097,
"mean_token_accuracy": 0.9541505873203278,
"num_tokens": 942876.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.14981700479984283,
"learning_rate": 0.00011572552877523854,
"loss": 0.1099,
"mean_token_accuracy": 0.9530862867832184,
"num_tokens": 948142.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.17998529970645905,
"learning_rate": 0.00011490422661761744,
"loss": 0.1111,
"mean_token_accuracy": 0.9553705453872681,
"num_tokens": 953361.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.18095913529396057,
"learning_rate": 0.00011408189496772368,
"loss": 0.1085,
"mean_token_accuracy": 0.9569565951824188,
"num_tokens": 958698.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.12876005470752716,
"learning_rate": 0.00011325859062716795,
"loss": 0.11,
"mean_token_accuracy": 0.9540988802909851,
"num_tokens": 963904.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.1892637312412262,
"learning_rate": 0.00011243437046474853,
"loss": 0.1124,
"mean_token_accuracy": 0.9509802162647247,
"num_tokens": 969068.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.10241339355707169,
"learning_rate": 0.00011160929141252303,
"loss": 0.1108,
"mean_token_accuracy": 0.9518979787826538,
"num_tokens": 974289.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.1427609920501709,
"learning_rate": 0.00011078341046187589,
"loss": 0.1094,
"mean_token_accuracy": 0.9557224214076996,
"num_tokens": 979548.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.12035023421049118,
"learning_rate": 0.00010995678465958168,
"loss": 0.1156,
"mean_token_accuracy": 0.9529212415218353,
"num_tokens": 984731.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.11421657353639603,
"learning_rate": 0.00010912947110386484,
"loss": 0.1158,
"mean_token_accuracy": 0.950139731168747,
"num_tokens": 989909.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.12608011066913605,
"learning_rate": 0.00010830152694045552,
"loss": 0.1118,
"mean_token_accuracy": 0.9534354209899902,
"num_tokens": 995130.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.176521435379982,
"learning_rate": 0.00010747300935864243,
"loss": 0.1184,
"mean_token_accuracy": 0.9504529535770416,
"num_tokens": 1000143.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 77.22000122070312,
"learning_rate": 0.00010664397558732244,
"loss": 0.1686,
"mean_token_accuracy": 0.9431236684322357,
"num_tokens": 1005201.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 3.9037532806396484,
"learning_rate": 0.00010581448289104758,
"loss": 0.1153,
"mean_token_accuracy": 0.9525106251239777,
"num_tokens": 1010256.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.08692986518144608,
"learning_rate": 0.00010498458856606972,
"loss": 0.1106,
"mean_token_accuracy": 0.9518369734287262,
"num_tokens": 1015347.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.1722182035446167,
"learning_rate": 0.00010415434993638269,
"loss": 0.1116,
"mean_token_accuracy": 0.9541844427585602,
"num_tokens": 1020700.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.07971198856830597,
"learning_rate": 0.00010332382434976266,
"loss": 0.1097,
"mean_token_accuracy": 0.9521732032299042,
"num_tokens": 1025991.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.3300648033618927,
"learning_rate": 0.0001024930691738073,
"loss": 0.1128,
"mean_token_accuracy": 0.9527797996997833,
"num_tokens": 1031201.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 2.3378825187683105,
"learning_rate": 0.00010166214179197264,
"loss": 0.1738,
"mean_token_accuracy": 0.9447502791881561,
"num_tokens": 1036370.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.1075408086180687,
"learning_rate": 0.00010083109959960973,
"loss": 0.1154,
"mean_token_accuracy": 0.951427161693573,
"num_tokens": 1041418.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.15424466133117676,
"learning_rate": 0.0001,
"loss": 0.1158,
"mean_token_accuracy": 0.9483841061592102,
"num_tokens": 1046481.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.131869375705719,
"learning_rate": 9.916890040039031e-05,
"loss": 0.1122,
"mean_token_accuracy": 0.9509872794151306,
"num_tokens": 1051665.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.13468806445598602,
"learning_rate": 9.833785820802739e-05,
"loss": 0.1116,
"mean_token_accuracy": 0.9532687067985535,
"num_tokens": 1057014.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.12996461987495422,
"learning_rate": 9.750693082619273e-05,
"loss": 0.107,
"mean_token_accuracy": 0.9560883641242981,
"num_tokens": 1062314.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.08511005342006683,
"learning_rate": 9.667617565023735e-05,
"loss": 0.1094,
"mean_token_accuracy": 0.953723281621933,
"num_tokens": 1067456.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.09277484565973282,
"learning_rate": 9.584565006361734e-05,
"loss": 0.1102,
"mean_token_accuracy": 0.9523052871227264,
"num_tokens": 1072700.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.10232524573802948,
"learning_rate": 9.501541143393028e-05,
"loss": 0.1068,
"mean_token_accuracy": 0.955791175365448,
"num_tokens": 1078034.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.10213851183652878,
"learning_rate": 9.418551710895243e-05,
"loss": 0.1169,
"mean_token_accuracy": 0.9503030478954315,
"num_tokens": 1083050.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.10190371423959732,
"learning_rate": 9.335602441267759e-05,
"loss": 0.1112,
"mean_token_accuracy": 0.953047126531601,
"num_tokens": 1088281.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.11229667067527771,
"learning_rate": 9.252699064135758e-05,
"loss": 0.1164,
"mean_token_accuracy": 0.9506237506866455,
"num_tokens": 1093435.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.08696591854095459,
"learning_rate": 9.169847305954447e-05,
"loss": 0.1107,
"mean_token_accuracy": 0.9544893801212311,
"num_tokens": 1098644.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.09480199962854385,
"learning_rate": 9.087052889613518e-05,
"loss": 0.1109,
"mean_token_accuracy": 0.9502566158771515,
"num_tokens": 1103775.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.09873849153518677,
"learning_rate": 9.004321534041835e-05,
"loss": 0.1094,
"mean_token_accuracy": 0.9538437724113464,
"num_tokens": 1109082.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.16237005591392517,
"learning_rate": 8.921658953812415e-05,
"loss": 0.1107,
"mean_token_accuracy": 0.9529086649417877,
"num_tokens": 1114250.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.08408457785844803,
"learning_rate": 8.839070858747697e-05,
"loss": 0.1134,
"mean_token_accuracy": 0.9480299949645996,
"num_tokens": 1119375.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.2315531224012375,
"learning_rate": 8.756562953525152e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.95367431640625,
"num_tokens": 1124684.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.09821003675460815,
"learning_rate": 8.674140937283208e-05,
"loss": 0.1121,
"mean_token_accuracy": 0.9524604380130768,
"num_tokens": 1129903.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.08394256979227066,
"learning_rate": 8.591810503227635e-05,
"loss": 0.1058,
"mean_token_accuracy": 0.9550954103469849,
"num_tokens": 1135243.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.0909803956747055,
"learning_rate": 8.509577338238255e-05,
"loss": 0.1131,
"mean_token_accuracy": 0.9511939585208893,
"num_tokens": 1140430.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.0834677517414093,
"learning_rate": 8.427447122476148e-05,
"loss": 0.1138,
"mean_token_accuracy": 0.9512240588665009,
"num_tokens": 1145518.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.08603792637586594,
"learning_rate": 8.345425528991288e-05,
"loss": 0.1093,
"mean_token_accuracy": 0.9524519443511963,
"num_tokens": 1150818.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.12986299395561218,
"learning_rate": 8.263518223330697e-05,
"loss": 0.1083,
"mean_token_accuracy": 0.9532658159732819,
"num_tokens": 1156130.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.08395830541849136,
"learning_rate": 8.181730863147093e-05,
"loss": 0.1138,
"mean_token_accuracy": 0.9518845081329346,
"num_tokens": 1161182.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.1729099005460739,
"learning_rate": 8.100069097808103e-05,
"loss": 0.1156,
"mean_token_accuracy": 0.9514641165733337,
"num_tokens": 1166254.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.16455362737178802,
"learning_rate": 8.018538568006027e-05,
"loss": 0.1107,
"mean_token_accuracy": 0.9519481658935547,
"num_tokens": 1171502.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.07433055341243744,
"learning_rate": 7.937144905368226e-05,
"loss": 0.1069,
"mean_token_accuracy": 0.9540406763553619,
"num_tokens": 1176744.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.08446791768074036,
"learning_rate": 7.855893732068125e-05,
"loss": 0.1101,
"mean_token_accuracy": 0.9524591267108917,
"num_tokens": 1181989.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.0870402455329895,
"learning_rate": 7.774790660436858e-05,
"loss": 0.109,
"mean_token_accuracy": 0.9547540843486786,
"num_tokens": 1187312.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.08110392093658447,
"learning_rate": 7.693841292575598e-05,
"loss": 0.1134,
"mean_token_accuracy": 0.9487438499927521,
"num_tokens": 1192374.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.07331240177154541,
"learning_rate": 7.613051219968623e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.9551816880702972,
"num_tokens": 1197504.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.06998025625944138,
"learning_rate": 7.532426023097063e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.9534473717212677,
"num_tokens": 1202857.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.07499606907367706,
"learning_rate": 7.451971271053455e-05,
"loss": 0.1101,
"mean_token_accuracy": 0.9513660669326782,
"num_tokens": 1208019.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.08685536682605743,
"learning_rate": 7.371692521157048e-05,
"loss": 0.1073,
"mean_token_accuracy": 0.9565198719501495,
"num_tokens": 1213375.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.08383391052484512,
"learning_rate": 7.291595318569951e-05,
"loss": 0.1079,
"mean_token_accuracy": 0.9528385400772095,
"num_tokens": 1218678.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.09736430644989014,
"learning_rate": 7.211685195914097e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.951784610748291,
"num_tokens": 1223932.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.09736430644989014,
"learning_rate": 7.131967672889101e-05,
"loss": 0.1097,
"mean_token_accuracy": 0.9564379453659058,
"num_tokens": 1226558.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 0.12066958844661713,
"learning_rate": 7.052448255890957e-05,
"loss": 0.11,
"mean_token_accuracy": 0.950747162103653,
"num_tokens": 1231687.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.1692134290933609,
"learning_rate": 6.973132437631742e-05,
"loss": 0.1035,
"mean_token_accuracy": 0.9540812373161316,
"num_tokens": 1236936.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.06671499460935593,
"learning_rate": 6.894025696760163e-05,
"loss": 0.1025,
"mean_token_accuracy": 0.9547434747219086,
"num_tokens": 1242302.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.0693930983543396,
"learning_rate": 6.815133497483157e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9553611278533936,
"num_tokens": 1247575.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.07331426441669464,
"learning_rate": 6.736461289188445e-05,
"loss": 0.111,
"mean_token_accuracy": 0.9509542286396027,
"num_tokens": 1252615.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.09026432782411575,
"learning_rate": 6.658014506068126e-05,
"loss": 0.1085,
"mean_token_accuracy": 0.9518916606903076,
"num_tokens": 1257709.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.0691080093383789,
"learning_rate": 6.579798566743314e-05,
"loss": 0.1024,
"mean_token_accuracy": 0.9566259384155273,
"num_tokens": 1262980.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.07958503067493439,
"learning_rate": 6.501818873889855e-05,
"loss": 0.1091,
"mean_token_accuracy": 0.9549121856689453,
"num_tokens": 1268116.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.07630956918001175,
"learning_rate": 6.424080813865138e-05,
"loss": 0.106,
"mean_token_accuracy": 0.9562622308731079,
"num_tokens": 1273328.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.07538638263940811,
"learning_rate": 6.34658975633605e-05,
"loss": 0.1058,
"mean_token_accuracy": 0.9536794424057007,
"num_tokens": 1278573.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.07185419648885727,
"learning_rate": 6.269351053908061e-05,
"loss": 0.1051,
"mean_token_accuracy": 0.956435889005661,
"num_tokens": 1283847.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.08341516554355621,
"learning_rate": 6.192370041755505e-05,
"loss": 0.1073,
"mean_token_accuracy": 0.9528530836105347,
"num_tokens": 1288981.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.07855644077062607,
"learning_rate": 6.115652037253053e-05,
"loss": 0.1055,
"mean_token_accuracy": 0.9546916782855988,
"num_tokens": 1294255.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.08059215545654297,
"learning_rate": 6.039202339608432e-05,
"loss": 0.1054,
"mean_token_accuracy": 0.9560668766498566,
"num_tokens": 1299486.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.08181022852659225,
"learning_rate": 5.963026229496378e-05,
"loss": 0.1111,
"mean_token_accuracy": 0.9553267061710358,
"num_tokens": 1304437.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.08100328594446182,
"learning_rate": 5.887128968693887e-05,
"loss": 0.109,
"mean_token_accuracy": 0.9509040117263794,
"num_tokens": 1309471.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.08512415736913681,
"learning_rate": 5.8115157997167536e-05,
"loss": 0.1087,
"mean_token_accuracy": 0.9532097578048706,
"num_tokens": 1314603.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.08154093474149704,
"learning_rate": 5.736191945457463e-05,
"loss": 0.1025,
"mean_token_accuracy": 0.9590216279029846,
"num_tokens": 1319916.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.08640050143003464,
"learning_rate": 5.6611626088244194e-05,
"loss": 0.1102,
"mean_token_accuracy": 0.9538323879241943,
"num_tokens": 1325115.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.08790913224220276,
"learning_rate": 5.58643297238256e-05,
"loss": 0.1056,
"mean_token_accuracy": 0.9544298946857452,
"num_tokens": 1330383.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.08440745621919632,
"learning_rate": 5.5120081979953785e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9548279345035553,
"num_tokens": 1335583.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.08989395946264267,
"learning_rate": 5.43789342646837e-05,
"loss": 0.1078,
"mean_token_accuracy": 0.9546796679496765,
"num_tokens": 1340769.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.0709109902381897,
"learning_rate": 5.3640937771939436e-05,
"loss": 0.1082,
"mean_token_accuracy": 0.9568992257118225,
"num_tokens": 1345904.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.1291133016347885,
"learning_rate": 5.290614347797802e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.9526994228363037,
"num_tokens": 1351168.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.07290786504745483,
"learning_rate": 5.217460213786821e-05,
"loss": 0.109,
"mean_token_accuracy": 0.9547650516033173,
"num_tokens": 1356428.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.08591271936893463,
"learning_rate": 5.1446364281984774e-05,
"loss": 0.1037,
"mean_token_accuracy": 0.9587284922599792,
"num_tokens": 1361775.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.08994387835264206,
"learning_rate": 5.072148021251821e-05,
"loss": 0.1099,
"mean_token_accuracy": 0.9539965689182281,
"num_tokens": 1366926.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.07574263960123062,
"learning_rate": 5.000000000000002e-05,
"loss": 0.1071,
"mean_token_accuracy": 0.9549139440059662,
"num_tokens": 1372136.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.07433713972568512,
"learning_rate": 4.92819734798441e-05,
"loss": 0.1086,
"mean_token_accuracy": 0.955206036567688,
"num_tokens": 1377357.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.07785839587450027,
"learning_rate": 4.856745024890466e-05,
"loss": 0.1035,
"mean_token_accuracy": 0.9549472033977509,
"num_tokens": 1382709.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.08468873053789139,
"learning_rate": 4.78564796620502e-05,
"loss": 0.1105,
"mean_token_accuracy": 0.9527934193611145,
"num_tokens": 1387820.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.07234114408493042,
"learning_rate": 4.7149110828754464e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.9562168121337891,
"num_tokens": 1393297.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.07486510276794434,
"learning_rate": 4.644539260970416e-05,
"loss": 0.1033,
"mean_token_accuracy": 0.9566996693611145,
"num_tokens": 1398625.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.07534699141979218,
"learning_rate": 4.574537361342407e-05,
"loss": 0.1114,
"mean_token_accuracy": 0.9527919888496399,
"num_tokens": 1403629.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.08369162678718567,
"learning_rate": 4.50491021929194e-05,
"loss": 0.1116,
"mean_token_accuracy": 0.9526659250259399,
"num_tokens": 1408724.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.07841815799474716,
"learning_rate": 4.435662644233594e-05,
"loss": 0.1043,
"mean_token_accuracy": 0.9549655616283417,
"num_tokens": 1414006.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.09484494477510452,
"learning_rate": 4.3667994193637796e-05,
"loss": 0.1054,
"mean_token_accuracy": 0.9525864720344543,
"num_tokens": 1419316.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.07024021446704865,
"learning_rate": 4.298325301330383e-05,
"loss": 0.1054,
"mean_token_accuracy": 0.9536097049713135,
"num_tokens": 1424568.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.06818420439958572,
"learning_rate": 4.23024501990417e-05,
"loss": 0.1102,
"mean_token_accuracy": 0.9506390392780304,
"num_tokens": 1429595.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.07772965729236603,
"learning_rate": 4.1625632776521037e-05,
"loss": 0.1009,
"mean_token_accuracy": 0.9574998021125793,
"num_tokens": 1435023.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.06488121300935745,
"learning_rate": 4.095284749612503e-05,
"loss": 0.106,
"mean_token_accuracy": 0.9521074295043945,
"num_tokens": 1440328.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.07453517615795135,
"learning_rate": 4.028414082972141e-05,
"loss": 0.1054,
"mean_token_accuracy": 0.954413890838623,
"num_tokens": 1445571.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.07654673606157303,
"learning_rate": 3.961955896745224e-05,
"loss": 0.106,
"mean_token_accuracy": 0.9553346335887909,
"num_tokens": 1450837.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.06677993386983871,
"learning_rate": 3.89591478145437e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9563196003437042,
"num_tokens": 1456075.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.07811679691076279,
"learning_rate": 3.8302952988134756e-05,
"loss": 0.1094,
"mean_token_accuracy": 0.9542314112186432,
"num_tokens": 1461230.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.07797476649284363,
"learning_rate": 3.7651019814126654e-05,
"loss": 0.1066,
"mean_token_accuracy": 0.9561484158039093,
"num_tokens": 1466562.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.068536177277565,
"learning_rate": 3.7003393324051874e-05,
"loss": 0.1085,
"mean_token_accuracy": 0.9561351835727692,
"num_tokens": 1471687.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.08289831131696701,
"learning_rate": 3.6360118251963645e-05,
"loss": 0.1067,
"mean_token_accuracy": 0.9524477422237396,
"num_tokens": 1476904.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.07308328151702881,
"learning_rate": 3.5721239031346066e-05,
"loss": 0.1063,
"mean_token_accuracy": 0.9520415663719177,
"num_tokens": 1482100.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.07325176149606705,
"learning_rate": 3.508679979204481e-05,
"loss": 0.1092,
"mean_token_accuracy": 0.9525676369667053,
"num_tokens": 1487266.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.08290306478738785,
"learning_rate": 3.445684435721897e-05,
"loss": 0.1086,
"mean_token_accuracy": 0.9519762396812439,
"num_tokens": 1492492.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.06719819456338882,
"learning_rate": 3.383141624031408e-05,
"loss": 0.1033,
"mean_token_accuracy": 0.954697459936142,
"num_tokens": 1497790.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.07050006091594696,
"learning_rate": 3.3210558642056275e-05,
"loss": 0.1064,
"mean_token_accuracy": 0.954306036233902,
"num_tokens": 1502956.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.0685805082321167,
"learning_rate": 3.259431444746846e-05,
"loss": 0.103,
"mean_token_accuracy": 0.9540392458438873,
"num_tokens": 1508286.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.06632719188928604,
"learning_rate": 3.198272622290804e-05,
"loss": 0.1058,
"mean_token_accuracy": 0.9538767337799072,
"num_tokens": 1513510.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.0773625299334526,
"learning_rate": 3.137583621312665e-05,
"loss": 0.1075,
"mean_token_accuracy": 0.9506730139255524,
"num_tokens": 1518701.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.07610657811164856,
"learning_rate": 3.077368633835205e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.9538764953613281,
"num_tokens": 1523921.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.0694374367594719,
"learning_rate": 3.0176318191392726e-05,
"loss": 0.1013,
"mean_token_accuracy": 0.9555954337120056,
"num_tokens": 1529415.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.06636825203895569,
"learning_rate": 2.9583773034764826e-05,
"loss": 0.1077,
"mean_token_accuracy": 0.9531519114971161,
"num_tokens": 1534538.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.07177619636058807,
"learning_rate": 2.8996091797841973e-05,
"loss": 0.1089,
"mean_token_accuracy": 0.9525831937789917,
"num_tokens": 1539634.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.0751037448644638,
"learning_rate": 2.8413315074028158e-05,
"loss": 0.1044,
"mean_token_accuracy": 0.9543749690055847,
"num_tokens": 1544802.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.08280035108327866,
"learning_rate": 2.7835483117953788e-05,
"loss": 0.1074,
"mean_token_accuracy": 0.9507263600826263,
"num_tokens": 1549931.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.07366805523633957,
"learning_rate": 2.7262635842695127e-05,
"loss": 0.1096,
"mean_token_accuracy": 0.952391117811203,
"num_tokens": 1555036.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.06576742231845856,
"learning_rate": 2.669481281701739e-05,
"loss": 0.1099,
"mean_token_accuracy": 0.9533363580703735,
"num_tokens": 1560093.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.088027223944664,
"learning_rate": 2.6132053262641466e-05,
"loss": 0.1063,
"mean_token_accuracy": 0.9537536799907684,
"num_tokens": 1565240.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.08146074414253235,
"learning_rate": 2.5574396051534832e-05,
"loss": 0.1092,
"mean_token_accuracy": 0.9527508616447449,
"num_tokens": 1570302.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.06479709595441818,
"learning_rate": 2.502187970322657e-05,
"loss": 0.1094,
"mean_token_accuracy": 0.9502229988574982,
"num_tokens": 1575412.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.0956709012389183,
"learning_rate": 2.4474542382146537e-05,
"loss": 0.1076,
"mean_token_accuracy": 0.9498851895332336,
"num_tokens": 1580547.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.08334702998399734,
"learning_rate": 2.3932421894989167e-05,
"loss": 0.1092,
"mean_token_accuracy": 0.9494307339191437,
"num_tokens": 1585694.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.08375080674886703,
"learning_rate": 2.339555568810221e-05,
"loss": 0.1017,
"mean_token_accuracy": 0.9544005393981934,
"num_tokens": 1591093.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.0755012109875679,
"learning_rate": 2.2863980844900036e-05,
"loss": 0.1034,
"mean_token_accuracy": 0.9553941786289215,
"num_tokens": 1596426.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.07963601499795914,
"learning_rate": 2.2337734083302164e-05,
"loss": 0.1055,
"mean_token_accuracy": 0.9529078900814056,
"num_tokens": 1601611.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.09792937338352203,
"learning_rate": 2.181685175319702e-05,
"loss": 0.1055,
"mean_token_accuracy": 0.9546305239200592,
"num_tokens": 1606921.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.0747600793838501,
"learning_rate": 2.1301369833931117e-05,
"loss": 0.1066,
"mean_token_accuracy": 0.9536134004592896,
"num_tokens": 1612115.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.07063605636358261,
"learning_rate": 2.079132393182378e-05,
"loss": 0.1087,
"mean_token_accuracy": 0.9522020220756531,
"num_tokens": 1617203.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.07867901027202606,
"learning_rate": 2.0286749277707782e-05,
"loss": 0.1059,
"mean_token_accuracy": 0.9549467265605927,
"num_tokens": 1622415.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.07289194315671921,
"learning_rate": 1.9787680724495617e-05,
"loss": 0.1085,
"mean_token_accuracy": 0.9504382014274597,
"num_tokens": 1627563.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.07952401041984558,
"learning_rate": 1.929415274477239e-05,
"loss": 0.1038,
"mean_token_accuracy": 0.9552877843379974,
"num_tokens": 1632867.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.11535109579563141,
"learning_rate": 1.880619942841435e-05,
"loss": 0.109,
"mean_token_accuracy": 0.9492900371551514,
"num_tokens": 1635364.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.06943787634372711,
"learning_rate": 1.832385448023435e-05,
"loss": 0.1015,
"mean_token_accuracy": 0.9556294083595276,
"num_tokens": 1640683.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.06671405583620071,
"learning_rate": 1.7847151217653624e-05,
"loss": 0.1064,
"mean_token_accuracy": 0.9508287012577057,
"num_tokens": 1645733.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.07054504007101059,
"learning_rate": 1.7376122568400532e-05,
"loss": 0.1035,
"mean_token_accuracy": 0.9549604058265686,
"num_tokens": 1650927.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.07232412695884705,
"learning_rate": 1.6910801068236016e-05,
"loss": 0.1051,
"mean_token_accuracy": 0.9545462131500244,
"num_tokens": 1656050.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.08388278633356094,
"learning_rate": 1.6451218858706374e-05,
"loss": 0.0994,
"mean_token_accuracy": 0.9571965932846069,
"num_tokens": 1661487.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.06368128955364227,
"learning_rate": 1.5997407684922862e-05,
"loss": 0.1009,
"mean_token_accuracy": 0.9551970958709717,
"num_tokens": 1666819.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.0757264643907547,
"learning_rate": 1.5549398893369216e-05,
"loss": 0.1042,
"mean_token_accuracy": 0.9547902643680573,
"num_tokens": 1671948.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.0689975917339325,
"learning_rate": 1.5107223429736272e-05,
"loss": 0.1032,
"mean_token_accuracy": 0.953640878200531,
"num_tokens": 1677077.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.07469335198402405,
"learning_rate": 1.467091183678444e-05,
"loss": 0.1028,
"mean_token_accuracy": 0.9557537734508514,
"num_tokens": 1682321.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.08852046728134155,
"learning_rate": 1.4240494252234049e-05,
"loss": 0.103,
"mean_token_accuracy": 0.9547942876815796,
"num_tokens": 1687547.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.07536771148443222,
"learning_rate": 1.3816000406683604e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.9549121856689453,
"num_tokens": 1692801.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.07635539770126343,
"learning_rate": 1.339745962155613e-05,
"loss": 0.1064,
"mean_token_accuracy": 0.95393306016922,
"num_tokens": 1697836.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.08687105029821396,
"learning_rate": 1.2984900807073919e-05,
"loss": 0.1078,
"mean_token_accuracy": 0.9537835717201233,
"num_tokens": 1702813.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.06335142999887466,
"learning_rate": 1.2578352460261456e-05,
"loss": 0.0978,
"mean_token_accuracy": 0.9576011598110199,
"num_tokens": 1708220.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.07969138771295547,
"learning_rate": 1.2177842662977135e-05,
"loss": 0.1066,
"mean_token_accuracy": 0.9537541568279266,
"num_tokens": 1713259.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.06776980310678482,
"learning_rate": 1.1783399079973578e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.9574141502380371,
"num_tokens": 1718488.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.07281561940908432,
"learning_rate": 1.1395048956986575e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.954279750585556,
"num_tokens": 1723510.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.07905755937099457,
"learning_rate": 1.1012819118853147e-05,
"loss": 0.1042,
"mean_token_accuracy": 0.9547126591205597,
"num_tokens": 1728674.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.07528189569711685,
"learning_rate": 1.0636735967658784e-05,
"loss": 0.1004,
"mean_token_accuracy": 0.9574441611766815,
"num_tokens": 1734002.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.07986707240343094,
"learning_rate": 1.0266825480913611e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.9533541202545166,
"num_tokens": 1739079.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.07390084117650986,
"learning_rate": 9.903113209758096e-06,
"loss": 0.1015,
"mean_token_accuracy": 0.9537836015224457,
"num_tokens": 1744315.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.06952923536300659,
"learning_rate": 9.545624277198084e-06,
"loss": 0.103,
"mean_token_accuracy": 0.9543668627738953,
"num_tokens": 1749512.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.07176285237073898,
"learning_rate": 9.194383376369508e-06,
"loss": 0.1032,
"mean_token_accuracy": 0.9570850133895874,
"num_tokens": 1754610.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.07516177743673325,
"learning_rate": 8.849414768832687e-06,
"loss": 0.1037,
"mean_token_accuracy": 0.9540053308010101,
"num_tokens": 1759789.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.0716799721121788,
"learning_rate": 8.510742282896544e-06,
"loss": 0.0998,
"mean_token_accuracy": 0.9560298323631287,
"num_tokens": 1765129.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.0837906002998352,
"learning_rate": 8.178389311972612e-06,
"loss": 0.105,
"mean_token_accuracy": 0.9543243944644928,
"num_tokens": 1770338.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.07087274640798569,
"learning_rate": 7.852378812959227e-06,
"loss": 0.102,
"mean_token_accuracy": 0.9561855792999268,
"num_tokens": 1775583.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.08090753108263016,
"learning_rate": 7.532733304655848e-06,
"loss": 0.1039,
"mean_token_accuracy": 0.958774983882904,
"num_tokens": 1780820.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.07000670582056046,
"learning_rate": 7.219474866207465e-06,
"loss": 0.1044,
"mean_token_accuracy": 0.9566550850868225,
"num_tokens": 1786008.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.0725073516368866,
"learning_rate": 6.9126251355795864e-06,
"loss": 0.0995,
"mean_token_accuracy": 0.9561439454555511,
"num_tokens": 1791386.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.06831885874271393,
"learning_rate": 6.612205308063646e-06,
"loss": 0.1005,
"mean_token_accuracy": 0.9557774066925049,
"num_tokens": 1796648.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.07962380349636078,
"learning_rate": 6.318236134812916e-06,
"loss": 0.1006,
"mean_token_accuracy": 0.9558420777320862,
"num_tokens": 1802013.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.07603943347930908,
"learning_rate": 6.030737921409169e-06,
"loss": 0.1026,
"mean_token_accuracy": 0.9523784816265106,
"num_tokens": 1807206.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.07720854878425598,
"learning_rate": 5.749730526460073e-06,
"loss": 0.1057,
"mean_token_accuracy": 0.9522489905357361,
"num_tokens": 1812361.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.07383149862289429,
"learning_rate": 5.475233360227516e-06,
"loss": 0.1029,
"mean_token_accuracy": 0.9540509581565857,
"num_tokens": 1817605.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.07123313099145889,
"learning_rate": 5.20726538328683e-06,
"loss": 0.1035,
"mean_token_accuracy": 0.9533557295799255,
"num_tokens": 1822772.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.08088903874158859,
"learning_rate": 4.945845105217117e-06,
"loss": 0.107,
"mean_token_accuracy": 0.9517634212970734,
"num_tokens": 1827936.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.07305390387773514,
"learning_rate": 4.6909905833226966e-06,
"loss": 0.1022,
"mean_token_accuracy": 0.9566372334957123,
"num_tokens": 1833113.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.07187072187662125,
"learning_rate": 4.442719421385922e-06,
"loss": 0.1022,
"mean_token_accuracy": 0.9553613364696503,
"num_tokens": 1838352.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.08292709290981293,
"learning_rate": 4.20104876845111e-06,
"loss": 0.1016,
"mean_token_accuracy": 0.9544655084609985,
"num_tokens": 1843665.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.07301212102174759,
"learning_rate": 3.965995317640025e-06,
"loss": 0.1039,
"mean_token_accuracy": 0.9533164799213409,
"num_tokens": 1848911.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.08238684386014938,
"learning_rate": 3.7375753049987973e-06,
"loss": 0.1008,
"mean_token_accuracy": 0.9585762619972229,
"num_tokens": 1854213.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.07075439393520355,
"learning_rate": 3.515804508376508e-06,
"loss": 0.1046,
"mean_token_accuracy": 0.9562832713127136,
"num_tokens": 1859356.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.07496190071105957,
"learning_rate": 3.3006982463352766e-06,
"loss": 0.1026,
"mean_token_accuracy": 0.9552099406719208,
"num_tokens": 1864689.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.07805922627449036,
"learning_rate": 3.092271377092215e-06,
"loss": 0.1046,
"mean_token_accuracy": 0.9539024233818054,
"num_tokens": 1869816.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.06747109442949295,
"learning_rate": 2.8905382974930172e-06,
"loss": 0.0994,
"mean_token_accuracy": 0.9568324387073517,
"num_tokens": 1875191.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.08741574734449387,
"learning_rate": 2.6955129420176196e-06,
"loss": 0.1051,
"mean_token_accuracy": 0.9548819065093994,
"num_tokens": 1880330.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.07086427509784698,
"learning_rate": 2.5072087818176382e-06,
"loss": 0.1028,
"mean_token_accuracy": 0.9552706182003021,
"num_tokens": 1885618.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.09037292748689651,
"learning_rate": 2.3256388237858807e-06,
"loss": 0.1058,
"mean_token_accuracy": 0.9500741064548492,
"num_tokens": 1890809.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.07957708090543747,
"learning_rate": 2.150815609657875e-06,
"loss": 0.1029,
"mean_token_accuracy": 0.9558984339237213,
"num_tokens": 1896020.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.06979665160179138,
"learning_rate": 1.9827512151456173e-06,
"loss": 0.0993,
"mean_token_accuracy": 0.9556711912155151,
"num_tokens": 1901407.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.066802479326725,
"learning_rate": 1.8214572491034198e-06,
"loss": 0.1016,
"mean_token_accuracy": 0.9537667632102966,
"num_tokens": 1906685.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.07699089497327805,
"learning_rate": 1.66694485272606e-06,
"loss": 0.1015,
"mean_token_accuracy": 0.9554409980773926,
"num_tokens": 1911956.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.06872906535863876,
"learning_rate": 1.5192246987791981e-06,
"loss": 0.1044,
"mean_token_accuracy": 0.9550608098506927,
"num_tokens": 1917050.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.07824942469596863,
"learning_rate": 1.378306990862177e-06,
"loss": 0.1016,
"mean_token_accuracy": 0.9562693536281586,
"num_tokens": 1922307.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.07499802857637405,
"learning_rate": 1.2442014627032316e-06,
"loss": 0.1069,
"mean_token_accuracy": 0.9526033401489258,
"num_tokens": 1927350.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.0749669075012207,
"learning_rate": 1.1169173774871478e-06,
"loss": 0.1038,
"mean_token_accuracy": 0.9533734917640686,
"num_tokens": 1932562.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.08355723321437836,
"learning_rate": 9.964635272153633e-07,
"loss": 0.1044,
"mean_token_accuracy": 0.9523906707763672,
"num_tokens": 1937735.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.07518034428358078,
"learning_rate": 8.828482320987319e-07,
"loss": 0.1044,
"mean_token_accuracy": 0.9536759555339813,
"num_tokens": 1942841.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.0784311518073082,
"learning_rate": 7.760793399827937e-07,
"loss": 0.1079,
"mean_token_accuracy": 0.9512859582901001,
"num_tokens": 1947957.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.07679091393947601,
"learning_rate": 6.761642258056978e-07,
"loss": 0.1006,
"mean_token_accuracy": 0.9535685181617737,
"num_tokens": 1953276.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.07247486710548401,
"learning_rate": 5.831097910887873e-07,
"loss": 0.1021,
"mean_token_accuracy": 0.9537284970283508,
"num_tokens": 1958636.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.07884224504232407,
"learning_rate": 4.969224634598591e-07,
"loss": 0.1026,
"mean_token_accuracy": 0.9526365101337433,
"num_tokens": 1963897.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.08129719644784927,
"learning_rate": 4.176081962092182e-07,
"loss": 0.1027,
"mean_token_accuracy": 0.9571616053581238,
"num_tokens": 1969073.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.07397085428237915,
"learning_rate": 3.451724678784518e-07,
"loss": 0.1032,
"mean_token_accuracy": 0.9548551142215729,
"num_tokens": 1974327.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.08152173459529877,
"learning_rate": 2.7962028188198706e-07,
"loss": 0.1038,
"mean_token_accuracy": 0.9496630430221558,
"num_tokens": 1979511.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.08115998655557632,
"learning_rate": 2.2095616616150115e-07,
"loss": 0.1026,
"mean_token_accuracy": 0.9531446695327759,
"num_tokens": 1984765.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.0791371688246727,
"learning_rate": 1.6918417287318245e-07,
"loss": 0.1048,
"mean_token_accuracy": 0.9550330936908722,
"num_tokens": 1989926.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.07414387911558151,
"learning_rate": 1.2430787810776555e-07,
"loss": 0.1053,
"mean_token_accuracy": 0.95284703373909,
"num_tokens": 1995060.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.07836966216564178,
"learning_rate": 8.633038164358454e-08,
"loss": 0.1044,
"mean_token_accuracy": 0.9553065896034241,
"num_tokens": 2000215.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.06861698627471924,
"learning_rate": 5.5254306732444025e-08,
"loss": 0.1024,
"mean_token_accuracy": 0.9546225965023041,
"num_tokens": 2005435.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.075834721326828,
"learning_rate": 3.1081799918375454e-08,
"loss": 0.1014,
"mean_token_accuracy": 0.9536567032337189,
"num_tokens": 2010721.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.07424164563417435,
"learning_rate": 1.3814530889433296e-08,
"loss": 0.1021,
"mean_token_accuracy": 0.9579430222511292,
"num_tokens": 2015921.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.07672765851020813,
"learning_rate": 3.453692362309635e-09,
"loss": 0.1054,
"mean_token_accuracy": 0.9539982378482819,
"num_tokens": 2020985.0,
"step": 390
},
{
"epoch": 4.942675159235669,
"step": 390,
"total_flos": 1.1265274541611418e+17,
"train_loss": 0.13867208319596755,
"train_runtime": 627.158,
"train_samples_per_second": 39.862,
"train_steps_per_second": 0.622
}
],
"logging_steps": 1.0,
"max_steps": 390,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1265274541611418e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}