LLM-continual-learning / trace /seq /order4 /trainer_state.json
YeMoKoo's picture
Add final checkpoint: trace_seq_order4
c7cd6c8 verified
Raw
History Blame Contribute Delete
99.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.942675159235669,
"eval_steps": 500,
"global_step": 390,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012738853503184714,
"grad_norm": 2.731952428817749,
"learning_rate": 0.0,
"loss": 1.1688,
"mean_token_accuracy": 0.809821754693985,
"num_tokens": 30618.0,
"step": 1
},
{
"epoch": 0.025477707006369428,
"grad_norm": 2.9573097229003906,
"learning_rate": 1.6666666666666667e-05,
"loss": 1.2048,
"mean_token_accuracy": 0.8096106648445129,
"num_tokens": 57834.0,
"step": 2
},
{
"epoch": 0.03821656050955414,
"grad_norm": 2.3572206497192383,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.2344,
"mean_token_accuracy": 0.8015994131565094,
"num_tokens": 83683.0,
"step": 3
},
{
"epoch": 0.050955414012738856,
"grad_norm": 1.6275570392608643,
"learning_rate": 5e-05,
"loss": 1.1427,
"mean_token_accuracy": 0.8016693592071533,
"num_tokens": 109319.0,
"step": 4
},
{
"epoch": 0.06369426751592357,
"grad_norm": 1.5466352701187134,
"learning_rate": 6.666666666666667e-05,
"loss": 0.9917,
"mean_token_accuracy": 0.8147929906845093,
"num_tokens": 130905.0,
"step": 5
},
{
"epoch": 0.07643312101910828,
"grad_norm": 0.7876960039138794,
"learning_rate": 8.333333333333334e-05,
"loss": 0.8381,
"mean_token_accuracy": 0.8273780345916748,
"num_tokens": 161660.0,
"step": 6
},
{
"epoch": 0.08917197452229299,
"grad_norm": 0.666037917137146,
"learning_rate": 0.0001,
"loss": 0.7595,
"mean_token_accuracy": 0.8374767899513245,
"num_tokens": 191893.0,
"step": 7
},
{
"epoch": 0.10191082802547771,
"grad_norm": 0.612377941608429,
"learning_rate": 0.00011666666666666668,
"loss": 0.7383,
"mean_token_accuracy": 0.8415369987487793,
"num_tokens": 219163.0,
"step": 8
},
{
"epoch": 0.11464968152866242,
"grad_norm": 0.5555623769760132,
"learning_rate": 0.00013333333333333334,
"loss": 0.659,
"mean_token_accuracy": 0.8522799015045166,
"num_tokens": 249175.0,
"step": 9
},
{
"epoch": 0.12738853503184713,
"grad_norm": 0.581606388092041,
"learning_rate": 0.00015000000000000001,
"loss": 0.6833,
"mean_token_accuracy": 0.8534884452819824,
"num_tokens": 269887.0,
"step": 10
},
{
"epoch": 0.14012738853503184,
"grad_norm": 0.36686646938323975,
"learning_rate": 0.0001666666666666667,
"loss": 0.6006,
"mean_token_accuracy": 0.8640938997268677,
"num_tokens": 297750.0,
"step": 11
},
{
"epoch": 0.15286624203821655,
"grad_norm": 0.4784420132637024,
"learning_rate": 0.00018333333333333334,
"loss": 0.6608,
"mean_token_accuracy": 0.851963609457016,
"num_tokens": 323030.0,
"step": 12
},
{
"epoch": 0.16560509554140126,
"grad_norm": 0.4178142845630646,
"learning_rate": 0.0002,
"loss": 0.5849,
"mean_token_accuracy": 0.8634214401245117,
"num_tokens": 353170.0,
"step": 13
},
{
"epoch": 0.17834394904458598,
"grad_norm": 0.3077121078968048,
"learning_rate": 0.0001999965463076377,
"loss": 0.5771,
"mean_token_accuracy": 0.8672670423984528,
"num_tokens": 381576.0,
"step": 14
},
{
"epoch": 0.1910828025477707,
"grad_norm": 0.3658709228038788,
"learning_rate": 0.00019998618546911056,
"loss": 0.5995,
"mean_token_accuracy": 0.8625359535217285,
"num_tokens": 409703.0,
"step": 15
},
{
"epoch": 0.20382165605095542,
"grad_norm": 0.30979523062705994,
"learning_rate": 0.00019996891820008164,
"loss": 0.6,
"mean_token_accuracy": 0.8614856898784637,
"num_tokens": 438811.0,
"step": 16
},
{
"epoch": 0.21656050955414013,
"grad_norm": 0.3065497875213623,
"learning_rate": 0.00019994474569326757,
"loss": 0.5938,
"mean_token_accuracy": 0.861987829208374,
"num_tokens": 468774.0,
"step": 17
},
{
"epoch": 0.22929936305732485,
"grad_norm": 0.30102476477622986,
"learning_rate": 0.00019991366961835642,
"loss": 0.5299,
"mean_token_accuracy": 0.8783503472805023,
"num_tokens": 492753.0,
"step": 18
},
{
"epoch": 0.24203821656050956,
"grad_norm": 0.2817172408103943,
"learning_rate": 0.00019987569212189224,
"loss": 0.5211,
"mean_token_accuracy": 0.8772054016590118,
"num_tokens": 523031.0,
"step": 19
},
{
"epoch": 0.25477707006369427,
"grad_norm": 0.26896849274635315,
"learning_rate": 0.00019983081582712685,
"loss": 0.5437,
"mean_token_accuracy": 0.8750361204147339,
"num_tokens": 552515.0,
"step": 20
},
{
"epoch": 0.267515923566879,
"grad_norm": 0.2550504803657532,
"learning_rate": 0.0001997790438338385,
"loss": 0.5481,
"mean_token_accuracy": 0.8728193938732147,
"num_tokens": 583290.0,
"step": 21
},
{
"epoch": 0.2802547770700637,
"grad_norm": 0.2866853177547455,
"learning_rate": 0.00019972037971811802,
"loss": 0.4961,
"mean_token_accuracy": 0.8841757476329803,
"num_tokens": 603285.0,
"step": 22
},
{
"epoch": 0.2929936305732484,
"grad_norm": 0.25682392716407776,
"learning_rate": 0.00019965482753212156,
"loss": 0.559,
"mean_token_accuracy": 0.8713036179542542,
"num_tokens": 637583.0,
"step": 23
},
{
"epoch": 0.3057324840764331,
"grad_norm": 0.24620702862739563,
"learning_rate": 0.0001995823918037908,
"loss": 0.5419,
"mean_token_accuracy": 0.8724701404571533,
"num_tokens": 668657.0,
"step": 24
},
{
"epoch": 0.3184713375796178,
"grad_norm": 0.25744566321372986,
"learning_rate": 0.00019950307753654017,
"loss": 0.5587,
"mean_token_accuracy": 0.869242787361145,
"num_tokens": 695335.0,
"step": 25
},
{
"epoch": 0.33121019108280253,
"grad_norm": 0.23623758554458618,
"learning_rate": 0.0001994168902089112,
"loss": 0.5589,
"mean_token_accuracy": 0.8748637139797211,
"num_tokens": 723727.0,
"step": 26
},
{
"epoch": 0.34394904458598724,
"grad_norm": 0.25645118951797485,
"learning_rate": 0.00019932383577419432,
"loss": 0.5035,
"mean_token_accuracy": 0.8788127899169922,
"num_tokens": 751154.0,
"step": 27
},
{
"epoch": 0.35668789808917195,
"grad_norm": 0.23220489919185638,
"learning_rate": 0.00019922392066001722,
"loss": 0.5386,
"mean_token_accuracy": 0.8756157159805298,
"num_tokens": 783078.0,
"step": 28
},
{
"epoch": 0.36942675159235666,
"grad_norm": 0.2706703841686249,
"learning_rate": 0.0001991171517679013,
"loss": 0.538,
"mean_token_accuracy": 0.8703268766403198,
"num_tokens": 802685.0,
"step": 29
},
{
"epoch": 0.3821656050955414,
"grad_norm": 0.23708438873291016,
"learning_rate": 0.00019900353647278466,
"loss": 0.5621,
"mean_token_accuracy": 0.86676886677742,
"num_tokens": 826425.0,
"step": 30
},
{
"epoch": 0.39490445859872614,
"grad_norm": 0.2513059973716736,
"learning_rate": 0.00019888308262251285,
"loss": 0.5905,
"mean_token_accuracy": 0.8621217608451843,
"num_tokens": 851265.0,
"step": 31
},
{
"epoch": 0.40764331210191085,
"grad_norm": 0.28542405366897583,
"learning_rate": 0.00019875579853729676,
"loss": 0.5255,
"mean_token_accuracy": 0.8751068413257599,
"num_tokens": 878297.0,
"step": 32
},
{
"epoch": 0.42038216560509556,
"grad_norm": 0.24914482235908508,
"learning_rate": 0.00019862169300913785,
"loss": 0.489,
"mean_token_accuracy": 0.8854367136955261,
"num_tokens": 899381.0,
"step": 33
},
{
"epoch": 0.43312101910828027,
"grad_norm": 0.20723982155323029,
"learning_rate": 0.00019848077530122083,
"loss": 0.5498,
"mean_token_accuracy": 0.8704783916473389,
"num_tokens": 930759.0,
"step": 34
},
{
"epoch": 0.445859872611465,
"grad_norm": 0.22724807262420654,
"learning_rate": 0.00019833305514727395,
"loss": 0.5522,
"mean_token_accuracy": 0.8706673681735992,
"num_tokens": 957135.0,
"step": 35
},
{
"epoch": 0.4585987261146497,
"grad_norm": 0.24670973420143127,
"learning_rate": 0.0001981785427508966,
"loss": 0.5207,
"mean_token_accuracy": 0.8706326186656952,
"num_tokens": 981142.0,
"step": 36
},
{
"epoch": 0.4713375796178344,
"grad_norm": 0.21167397499084473,
"learning_rate": 0.00019801724878485438,
"loss": 0.5588,
"mean_token_accuracy": 0.8660498857498169,
"num_tokens": 1009855.0,
"step": 37
},
{
"epoch": 0.4840764331210191,
"grad_norm": 0.22114594280719757,
"learning_rate": 0.00019784918439034216,
"loss": 0.5789,
"mean_token_accuracy": 0.8654206991195679,
"num_tokens": 1035989.0,
"step": 38
},
{
"epoch": 0.4968152866242038,
"grad_norm": 0.23111383616924286,
"learning_rate": 0.00019767436117621413,
"loss": 0.4989,
"mean_token_accuracy": 0.8822118937969208,
"num_tokens": 1063409.0,
"step": 39
},
{
"epoch": 0.5095541401273885,
"grad_norm": 0.20834460854530334,
"learning_rate": 0.00019749279121818235,
"loss": 0.5529,
"mean_token_accuracy": 0.8721747994422913,
"num_tokens": 1094423.0,
"step": 40
},
{
"epoch": 0.5222929936305732,
"grad_norm": 0.2471723109483719,
"learning_rate": 0.00019730448705798239,
"loss": 0.5971,
"mean_token_accuracy": 0.8657170534133911,
"num_tokens": 1119067.0,
"step": 41
},
{
"epoch": 0.535031847133758,
"grad_norm": 0.19489862024784088,
"learning_rate": 0.000197109461702507,
"loss": 0.5133,
"mean_token_accuracy": 0.8722980916500092,
"num_tokens": 1147347.0,
"step": 42
},
{
"epoch": 0.5477707006369427,
"grad_norm": 0.18404309451580048,
"learning_rate": 0.0001969077286229078,
"loss": 0.4991,
"mean_token_accuracy": 0.8807591199874878,
"num_tokens": 1174458.0,
"step": 43
},
{
"epoch": 0.5605095541401274,
"grad_norm": 0.21981379389762878,
"learning_rate": 0.00019669930175366472,
"loss": 0.5163,
"mean_token_accuracy": 0.8810671269893646,
"num_tokens": 1202708.0,
"step": 44
},
{
"epoch": 0.5732484076433121,
"grad_norm": 0.19955477118492126,
"learning_rate": 0.00019648419549162348,
"loss": 0.5124,
"mean_token_accuracy": 0.8778521418571472,
"num_tokens": 1226511.0,
"step": 45
},
{
"epoch": 0.5859872611464968,
"grad_norm": 0.20685520768165588,
"learning_rate": 0.0001962624246950012,
"loss": 0.4903,
"mean_token_accuracy": 0.8821050524711609,
"num_tokens": 1254823.0,
"step": 46
},
{
"epoch": 0.5987261146496815,
"grad_norm": 0.21673081815242767,
"learning_rate": 0.00019603400468235998,
"loss": 0.524,
"mean_token_accuracy": 0.8739053308963776,
"num_tokens": 1280157.0,
"step": 47
},
{
"epoch": 0.6114649681528662,
"grad_norm": 0.20037099719047546,
"learning_rate": 0.0001957989512315489,
"loss": 0.5243,
"mean_token_accuracy": 0.8742711842060089,
"num_tokens": 1311204.0,
"step": 48
},
{
"epoch": 0.6242038216560509,
"grad_norm": 0.17604073882102966,
"learning_rate": 0.0001955572805786141,
"loss": 0.4874,
"mean_token_accuracy": 0.8826193511486053,
"num_tokens": 1338924.0,
"step": 49
},
{
"epoch": 0.6369426751592356,
"grad_norm": 0.19787156581878662,
"learning_rate": 0.0001953090094166773,
"loss": 0.519,
"mean_token_accuracy": 0.8827911615371704,
"num_tokens": 1364640.0,
"step": 50
},
{
"epoch": 0.6496815286624203,
"grad_norm": 0.23413977026939392,
"learning_rate": 0.0001950541548947829,
"loss": 0.5818,
"mean_token_accuracy": 0.865499883890152,
"num_tokens": 1386817.0,
"step": 51
},
{
"epoch": 0.6624203821656051,
"grad_norm": 0.19605080783367157,
"learning_rate": 0.0001947927346167132,
"loss": 0.5408,
"mean_token_accuracy": 0.8805167376995087,
"num_tokens": 1417598.0,
"step": 52
},
{
"epoch": 0.6751592356687898,
"grad_norm": 0.19370882213115692,
"learning_rate": 0.00019452476663977248,
"loss": 0.5277,
"mean_token_accuracy": 0.8767336308956146,
"num_tokens": 1452103.0,
"step": 53
},
{
"epoch": 0.6878980891719745,
"grad_norm": 0.2124357670545578,
"learning_rate": 0.00019425026947353992,
"loss": 0.4488,
"mean_token_accuracy": 0.8942307233810425,
"num_tokens": 1476260.0,
"step": 54
},
{
"epoch": 0.7006369426751592,
"grad_norm": 0.19639843702316284,
"learning_rate": 0.00019396926207859084,
"loss": 0.5053,
"mean_token_accuracy": 0.8811178207397461,
"num_tokens": 1505761.0,
"step": 55
},
{
"epoch": 0.7133757961783439,
"grad_norm": 0.1861242651939392,
"learning_rate": 0.0001936817638651871,
"loss": 0.5098,
"mean_token_accuracy": 0.8793118894100189,
"num_tokens": 1535906.0,
"step": 56
},
{
"epoch": 0.7261146496815286,
"grad_norm": 0.18348966538906097,
"learning_rate": 0.00019338779469193639,
"loss": 0.5253,
"mean_token_accuracy": 0.8732865154743195,
"num_tokens": 1569652.0,
"step": 57
},
{
"epoch": 0.7388535031847133,
"grad_norm": 0.20582278072834015,
"learning_rate": 0.00019308737486442045,
"loss": 0.5484,
"mean_token_accuracy": 0.8730612993240356,
"num_tokens": 1596153.0,
"step": 58
},
{
"epoch": 0.7515923566878981,
"grad_norm": 0.1865556836128235,
"learning_rate": 0.00019278052513379255,
"loss": 0.517,
"mean_token_accuracy": 0.8760738968849182,
"num_tokens": 1624508.0,
"step": 59
},
{
"epoch": 0.7643312101910829,
"grad_norm": 0.23167841136455536,
"learning_rate": 0.00019246726669534415,
"loss": 0.4624,
"mean_token_accuracy": 0.886768102645874,
"num_tokens": 1653507.0,
"step": 60
},
{
"epoch": 0.7770700636942676,
"grad_norm": 0.2016674131155014,
"learning_rate": 0.00019214762118704076,
"loss": 0.5536,
"mean_token_accuracy": 0.8673790991306305,
"num_tokens": 1682796.0,
"step": 61
},
{
"epoch": 0.7898089171974523,
"grad_norm": 0.19925245642662048,
"learning_rate": 0.00019182161068802741,
"loss": 0.5173,
"mean_token_accuracy": 0.8760708868503571,
"num_tokens": 1710159.0,
"step": 62
},
{
"epoch": 0.802547770700637,
"grad_norm": 0.22986213862895966,
"learning_rate": 0.00019148925771710347,
"loss": 0.5277,
"mean_token_accuracy": 0.8781446814537048,
"num_tokens": 1739246.0,
"step": 63
},
{
"epoch": 0.8152866242038217,
"grad_norm": 0.1752689927816391,
"learning_rate": 0.00019115058523116733,
"loss": 0.4663,
"mean_token_accuracy": 0.8877492845058441,
"num_tokens": 1770785.0,
"step": 64
},
{
"epoch": 0.8280254777070064,
"grad_norm": 0.18831022083759308,
"learning_rate": 0.0001908056166236305,
"loss": 0.4976,
"mean_token_accuracy": 0.8858269155025482,
"num_tokens": 1800635.0,
"step": 65
},
{
"epoch": 0.8407643312101911,
"grad_norm": 0.19960662722587585,
"learning_rate": 0.00019045437572280194,
"loss": 0.4967,
"mean_token_accuracy": 0.8812806904315948,
"num_tokens": 1829104.0,
"step": 66
},
{
"epoch": 0.8535031847133758,
"grad_norm": 0.1994195133447647,
"learning_rate": 0.0001900968867902419,
"loss": 0.5614,
"mean_token_accuracy": 0.867830902338028,
"num_tokens": 1858519.0,
"step": 67
},
{
"epoch": 0.8662420382165605,
"grad_norm": 0.20042599737644196,
"learning_rate": 0.00018973317451908642,
"loss": 0.5059,
"mean_token_accuracy": 0.877477616071701,
"num_tokens": 1882458.0,
"step": 68
},
{
"epoch": 0.8789808917197452,
"grad_norm": 0.18692034482955933,
"learning_rate": 0.00018936326403234125,
"loss": 0.4931,
"mean_token_accuracy": 0.8819095194339752,
"num_tokens": 1914075.0,
"step": 69
},
{
"epoch": 0.89171974522293,
"grad_norm": 0.2646773159503937,
"learning_rate": 0.0001889871808811469,
"loss": 0.5257,
"mean_token_accuracy": 0.8753155171871185,
"num_tokens": 1941347.0,
"step": 70
},
{
"epoch": 0.9044585987261147,
"grad_norm": 0.21669141948223114,
"learning_rate": 0.00018860495104301345,
"loss": 0.5334,
"mean_token_accuracy": 0.8770544230937958,
"num_tokens": 1969128.0,
"step": 71
},
{
"epoch": 0.9171974522292994,
"grad_norm": 0.20509248971939087,
"learning_rate": 0.00018821660092002641,
"loss": 0.5268,
"mean_token_accuracy": 0.8741115033626556,
"num_tokens": 1995848.0,
"step": 72
},
{
"epoch": 0.9299363057324841,
"grad_norm": 0.2039647400379181,
"learning_rate": 0.00018782215733702286,
"loss": 0.4668,
"mean_token_accuracy": 0.8840380907058716,
"num_tokens": 2021243.0,
"step": 73
},
{
"epoch": 0.9426751592356688,
"grad_norm": 0.2123929262161255,
"learning_rate": 0.00018742164753973855,
"loss": 0.4872,
"mean_token_accuracy": 0.8842201232910156,
"num_tokens": 2048558.0,
"step": 74
},
{
"epoch": 0.9554140127388535,
"grad_norm": 0.2204159051179886,
"learning_rate": 0.00018701509919292613,
"loss": 0.541,
"mean_token_accuracy": 0.8701495230197906,
"num_tokens": 2078250.0,
"step": 75
},
{
"epoch": 0.9681528662420382,
"grad_norm": 0.2006702870130539,
"learning_rate": 0.00018660254037844388,
"loss": 0.5311,
"mean_token_accuracy": 0.8764555752277374,
"num_tokens": 2107652.0,
"step": 76
},
{
"epoch": 0.9808917197452229,
"grad_norm": 0.20622111856937408,
"learning_rate": 0.0001861839995933164,
"loss": 0.5147,
"mean_token_accuracy": 0.8776688575744629,
"num_tokens": 2134576.0,
"step": 77
},
{
"epoch": 0.9936305732484076,
"grad_norm": 0.20862704515457153,
"learning_rate": 0.00018575950574776595,
"loss": 0.4786,
"mean_token_accuracy": 0.8834514617919922,
"num_tokens": 2162186.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.20862704515457153,
"learning_rate": 0.00018532908816321558,
"loss": 0.4914,
"mean_token_accuracy": 0.8792589902877808,
"num_tokens": 2175983.0,
"step": 79
},
{
"epoch": 1.0127388535031847,
"grad_norm": 0.36284950375556946,
"learning_rate": 0.00018489277657026375,
"loss": 0.43,
"mean_token_accuracy": 0.8981749415397644,
"num_tokens": 2203353.0,
"step": 80
},
{
"epoch": 1.0254777070063694,
"grad_norm": 0.18358495831489563,
"learning_rate": 0.0001844506011066308,
"loss": 0.5233,
"mean_token_accuracy": 0.8746683299541473,
"num_tokens": 2224613.0,
"step": 81
},
{
"epoch": 1.0382165605095541,
"grad_norm": 0.21040311455726624,
"learning_rate": 0.00018400259231507717,
"loss": 0.4447,
"mean_token_accuracy": 0.8906852006912231,
"num_tokens": 2251981.0,
"step": 82
},
{
"epoch": 1.0509554140127388,
"grad_norm": 0.21265040338039398,
"learning_rate": 0.00018354878114129367,
"loss": 0.4362,
"mean_token_accuracy": 0.8928681313991547,
"num_tokens": 2281605.0,
"step": 83
},
{
"epoch": 1.0636942675159236,
"grad_norm": 0.23001955449581146,
"learning_rate": 0.00018308919893176396,
"loss": 0.434,
"mean_token_accuracy": 0.8912529349327087,
"num_tokens": 2306102.0,
"step": 84
},
{
"epoch": 1.0764331210191083,
"grad_norm": 0.2564128637313843,
"learning_rate": 0.0001826238774315995,
"loss": 0.4321,
"mean_token_accuracy": 0.8965701758861542,
"num_tokens": 2335253.0,
"step": 85
},
{
"epoch": 1.089171974522293,
"grad_norm": 0.2404835820198059,
"learning_rate": 0.00018215284878234642,
"loss": 0.4167,
"mean_token_accuracy": 0.8949294686317444,
"num_tokens": 2358904.0,
"step": 86
},
{
"epoch": 1.1019108280254777,
"grad_norm": 0.18374451994895935,
"learning_rate": 0.00018167614551976567,
"loss": 0.4305,
"mean_token_accuracy": 0.8946235775947571,
"num_tokens": 2391283.0,
"step": 87
},
{
"epoch": 1.1146496815286624,
"grad_norm": 0.1883268803358078,
"learning_rate": 0.00018119380057158568,
"loss": 0.4233,
"mean_token_accuracy": 0.89813432097435,
"num_tokens": 2422101.0,
"step": 88
},
{
"epoch": 1.127388535031847,
"grad_norm": 0.17908215522766113,
"learning_rate": 0.00018070584725522762,
"loss": 0.4617,
"mean_token_accuracy": 0.8903807699680328,
"num_tokens": 2454815.0,
"step": 89
},
{
"epoch": 1.1401273885350318,
"grad_norm": 0.19653795659542084,
"learning_rate": 0.0001802123192755044,
"loss": 0.4367,
"mean_token_accuracy": 0.8922165334224701,
"num_tokens": 2481424.0,
"step": 90
},
{
"epoch": 1.1528662420382165,
"grad_norm": 0.21111823618412018,
"learning_rate": 0.00017971325072229226,
"loss": 0.4174,
"mean_token_accuracy": 0.895957350730896,
"num_tokens": 2512270.0,
"step": 91
},
{
"epoch": 1.1656050955414012,
"grad_norm": 0.1942635476589203,
"learning_rate": 0.00017920867606817625,
"loss": 0.4502,
"mean_token_accuracy": 0.8907138109207153,
"num_tokens": 2535781.0,
"step": 92
},
{
"epoch": 1.178343949044586,
"grad_norm": 0.261258065700531,
"learning_rate": 0.0001786986301660689,
"loss": 0.4638,
"mean_token_accuracy": 0.8896288275718689,
"num_tokens": 2559254.0,
"step": 93
},
{
"epoch": 1.1910828025477707,
"grad_norm": 0.21905386447906494,
"learning_rate": 0.000178183148246803,
"loss": 0.4508,
"mean_token_accuracy": 0.8896691501140594,
"num_tokens": 2590325.0,
"step": 94
},
{
"epoch": 1.2038216560509554,
"grad_norm": 0.2133377492427826,
"learning_rate": 0.00017766226591669785,
"loss": 0.4366,
"mean_token_accuracy": 0.8902366161346436,
"num_tokens": 2618053.0,
"step": 95
},
{
"epoch": 1.21656050955414,
"grad_norm": 0.2296481728553772,
"learning_rate": 0.0001771360191551,
"loss": 0.4278,
"mean_token_accuracy": 0.8949062824249268,
"num_tokens": 2649403.0,
"step": 96
},
{
"epoch": 1.2292993630573248,
"grad_norm": 0.1748172491788864,
"learning_rate": 0.0001766044443118978,
"loss": 0.3914,
"mean_token_accuracy": 0.9003350138664246,
"num_tokens": 2680357.0,
"step": 97
},
{
"epoch": 1.2420382165605095,
"grad_norm": 0.20810891687870026,
"learning_rate": 0.00017606757810501088,
"loss": 0.4308,
"mean_token_accuracy": 0.897574782371521,
"num_tokens": 2706511.0,
"step": 98
},
{
"epoch": 1.2547770700636942,
"grad_norm": 0.21128255128860474,
"learning_rate": 0.0001755254576178535,
"loss": 0.4728,
"mean_token_accuracy": 0.8870101869106293,
"num_tokens": 2734107.0,
"step": 99
},
{
"epoch": 1.267515923566879,
"grad_norm": 0.24089288711547852,
"learning_rate": 0.00017497812029677344,
"loss": 0.4484,
"mean_token_accuracy": 0.889725536108017,
"num_tokens": 2757919.0,
"step": 100
},
{
"epoch": 1.2802547770700636,
"grad_norm": 0.20210997760295868,
"learning_rate": 0.00017442560394846516,
"loss": 0.399,
"mean_token_accuracy": 0.8993033766746521,
"num_tokens": 2784820.0,
"step": 101
},
{
"epoch": 1.2929936305732483,
"grad_norm": 0.2276032418012619,
"learning_rate": 0.0001738679467373586,
"loss": 0.3626,
"mean_token_accuracy": 0.9096324741840363,
"num_tokens": 2809247.0,
"step": 102
},
{
"epoch": 1.305732484076433,
"grad_norm": 0.22977371513843536,
"learning_rate": 0.00017330518718298264,
"loss": 0.4334,
"mean_token_accuracy": 0.895849198102951,
"num_tokens": 2840004.0,
"step": 103
},
{
"epoch": 1.3184713375796178,
"grad_norm": 0.22106525301933289,
"learning_rate": 0.00017273736415730488,
"loss": 0.4166,
"mean_token_accuracy": 0.8970482349395752,
"num_tokens": 2866302.0,
"step": 104
},
{
"epoch": 1.3312101910828025,
"grad_norm": 0.23758462071418762,
"learning_rate": 0.0001721645168820462,
"loss": 0.4115,
"mean_token_accuracy": 0.8981644213199615,
"num_tokens": 2894217.0,
"step": 105
},
{
"epoch": 1.3439490445859872,
"grad_norm": 0.1981382668018341,
"learning_rate": 0.00017158668492597186,
"loss": 0.449,
"mean_token_accuracy": 0.8924685120582581,
"num_tokens": 2918539.0,
"step": 106
},
{
"epoch": 1.356687898089172,
"grad_norm": 0.2146390974521637,
"learning_rate": 0.00017100390820215804,
"loss": 0.4508,
"mean_token_accuracy": 0.8852833211421967,
"num_tokens": 2946667.0,
"step": 107
},
{
"epoch": 1.3694267515923566,
"grad_norm": 0.24695628881454468,
"learning_rate": 0.00017041622696523518,
"loss": 0.4489,
"mean_token_accuracy": 0.890505313873291,
"num_tokens": 2976512.0,
"step": 108
},
{
"epoch": 1.3821656050955413,
"grad_norm": 0.2295302450656891,
"learning_rate": 0.00016982368180860728,
"loss": 0.4247,
"mean_token_accuracy": 0.8994563519954681,
"num_tokens": 3002099.0,
"step": 109
},
{
"epoch": 1.394904458598726,
"grad_norm": 0.25571876764297485,
"learning_rate": 0.00016922631366164797,
"loss": 0.483,
"mean_token_accuracy": 0.8808054029941559,
"num_tokens": 3025720.0,
"step": 110
},
{
"epoch": 1.4076433121019107,
"grad_norm": 0.2006886899471283,
"learning_rate": 0.0001686241637868734,
"loss": 0.4022,
"mean_token_accuracy": 0.899999737739563,
"num_tokens": 3054719.0,
"step": 111
},
{
"epoch": 1.4203821656050954,
"grad_norm": 0.22816525399684906,
"learning_rate": 0.00016801727377709194,
"loss": 0.4429,
"mean_token_accuracy": 0.893610805273056,
"num_tokens": 3083697.0,
"step": 112
},
{
"epoch": 1.4331210191082802,
"grad_norm": 0.20023752748966217,
"learning_rate": 0.00016740568555253155,
"loss": 0.4171,
"mean_token_accuracy": 0.8969627320766449,
"num_tokens": 3110382.0,
"step": 113
},
{
"epoch": 1.4458598726114649,
"grad_norm": 0.2151436060667038,
"learning_rate": 0.00016678944135794374,
"loss": 0.4296,
"mean_token_accuracy": 0.8962332010269165,
"num_tokens": 3139512.0,
"step": 114
},
{
"epoch": 1.4585987261146496,
"grad_norm": 0.21061868965625763,
"learning_rate": 0.00016616858375968595,
"loss": 0.416,
"mean_token_accuracy": 0.8994052708148956,
"num_tokens": 3168845.0,
"step": 115
},
{
"epoch": 1.4713375796178343,
"grad_norm": 0.19060927629470825,
"learning_rate": 0.000165543155642781,
"loss": 0.4147,
"mean_token_accuracy": 0.9013650715351105,
"num_tokens": 3195898.0,
"step": 116
},
{
"epoch": 1.484076433121019,
"grad_norm": 0.2071344256401062,
"learning_rate": 0.0001649132002079552,
"loss": 0.3862,
"mean_token_accuracy": 0.9036861956119537,
"num_tokens": 3223855.0,
"step": 117
},
{
"epoch": 1.4968152866242037,
"grad_norm": 0.20986929535865784,
"learning_rate": 0.00016427876096865394,
"loss": 0.3703,
"mean_token_accuracy": 0.9042750298976898,
"num_tokens": 3251564.0,
"step": 118
},
{
"epoch": 1.5095541401273884,
"grad_norm": 0.18998707830905914,
"learning_rate": 0.00016363988174803638,
"loss": 0.4309,
"mean_token_accuracy": 0.8953231573104858,
"num_tokens": 3281326.0,
"step": 119
},
{
"epoch": 1.5222929936305731,
"grad_norm": 0.20126497745513916,
"learning_rate": 0.00016299660667594814,
"loss": 0.4298,
"mean_token_accuracy": 0.8964099586009979,
"num_tokens": 3309696.0,
"step": 120
},
{
"epoch": 1.5350318471337578,
"grad_norm": 0.20899806916713715,
"learning_rate": 0.00016234898018587337,
"loss": 0.4565,
"mean_token_accuracy": 0.890906423330307,
"num_tokens": 3339274.0,
"step": 121
},
{
"epoch": 1.5477707006369426,
"grad_norm": 0.2075766921043396,
"learning_rate": 0.00016169704701186527,
"loss": 0.4058,
"mean_token_accuracy": 0.8975411057472229,
"num_tokens": 3367650.0,
"step": 122
},
{
"epoch": 1.5605095541401273,
"grad_norm": 0.18813498318195343,
"learning_rate": 0.00016104085218545633,
"loss": 0.4145,
"mean_token_accuracy": 0.8943947851657867,
"num_tokens": 3395280.0,
"step": 123
},
{
"epoch": 1.573248407643312,
"grad_norm": 0.2107289433479309,
"learning_rate": 0.00016038044103254775,
"loss": 0.4139,
"mean_token_accuracy": 0.8994401693344116,
"num_tokens": 3419713.0,
"step": 124
},
{
"epoch": 1.5859872611464967,
"grad_norm": 0.2302611917257309,
"learning_rate": 0.00015971585917027862,
"loss": 0.4669,
"mean_token_accuracy": 0.8907433152198792,
"num_tokens": 3445597.0,
"step": 125
},
{
"epoch": 1.5987261146496814,
"grad_norm": 0.23754490911960602,
"learning_rate": 0.00015904715250387498,
"loss": 0.4066,
"mean_token_accuracy": 0.9026502966880798,
"num_tokens": 3474786.0,
"step": 126
},
{
"epoch": 1.611464968152866,
"grad_norm": 0.1973937302827835,
"learning_rate": 0.000158374367223479,
"loss": 0.3996,
"mean_token_accuracy": 0.8982687294483185,
"num_tokens": 3500905.0,
"step": 127
},
{
"epoch": 1.6242038216560508,
"grad_norm": 0.2112189680337906,
"learning_rate": 0.0001576975498009583,
"loss": 0.4103,
"mean_token_accuracy": 0.8986146748065948,
"num_tokens": 3533088.0,
"step": 128
},
{
"epoch": 1.6369426751592355,
"grad_norm": 0.20334266126155853,
"learning_rate": 0.0001570167469866962,
"loss": 0.4155,
"mean_token_accuracy": 0.8960614800453186,
"num_tokens": 3564101.0,
"step": 129
},
{
"epoch": 1.6496815286624202,
"grad_norm": 0.23099584877490997,
"learning_rate": 0.0001563320058063622,
"loss": 0.4164,
"mean_token_accuracy": 0.8984293341636658,
"num_tokens": 3594946.0,
"step": 130
},
{
"epoch": 1.662420382165605,
"grad_norm": 0.21379804611206055,
"learning_rate": 0.00015564337355766412,
"loss": 0.4532,
"mean_token_accuracy": 0.8880736827850342,
"num_tokens": 3622979.0,
"step": 131
},
{
"epoch": 1.6751592356687897,
"grad_norm": 0.1995055377483368,
"learning_rate": 0.0001549508978070806,
"loss": 0.4119,
"mean_token_accuracy": 0.8986586034297943,
"num_tokens": 3656610.0,
"step": 132
},
{
"epoch": 1.6878980891719744,
"grad_norm": 0.18747873604297638,
"learning_rate": 0.00015425462638657595,
"loss": 0.4457,
"mean_token_accuracy": 0.8943086564540863,
"num_tokens": 3682683.0,
"step": 133
},
{
"epoch": 1.700636942675159,
"grad_norm": 0.22786714136600494,
"learning_rate": 0.00015355460739029586,
"loss": 0.488,
"mean_token_accuracy": 0.8869983851909637,
"num_tokens": 3709699.0,
"step": 134
},
{
"epoch": 1.7133757961783438,
"grad_norm": 0.20793353021144867,
"learning_rate": 0.00015285088917124556,
"loss": 0.4209,
"mean_token_accuracy": 0.8953282237052917,
"num_tokens": 3736127.0,
"step": 135
},
{
"epoch": 1.7261146496815285,
"grad_norm": 0.23483413457870483,
"learning_rate": 0.0001521435203379498,
"loss": 0.4475,
"mean_token_accuracy": 0.893291562795639,
"num_tokens": 3767828.0,
"step": 136
},
{
"epoch": 1.7388535031847132,
"grad_norm": 0.1924842745065689,
"learning_rate": 0.00015143254975109538,
"loss": 0.4636,
"mean_token_accuracy": 0.8875114619731903,
"num_tokens": 3797497.0,
"step": 137
},
{
"epoch": 1.7515923566878981,
"grad_norm": 0.22160354256629944,
"learning_rate": 0.0001507180265201559,
"loss": 0.4296,
"mean_token_accuracy": 0.890423446893692,
"num_tokens": 3822354.0,
"step": 138
},
{
"epoch": 1.7643312101910829,
"grad_norm": 0.21033191680908203,
"learning_rate": 0.00015000000000000001,
"loss": 0.4455,
"mean_token_accuracy": 0.8900648355484009,
"num_tokens": 3854962.0,
"step": 139
},
{
"epoch": 1.7770700636942676,
"grad_norm": 0.2192336469888687,
"learning_rate": 0.00014927851978748178,
"loss": 0.4211,
"mean_token_accuracy": 0.8970896303653717,
"num_tokens": 3881037.0,
"step": 140
},
{
"epoch": 1.7898089171974523,
"grad_norm": 0.20573553442955017,
"learning_rate": 0.00014855363571801523,
"loss": 0.4671,
"mean_token_accuracy": 0.8863770067691803,
"num_tokens": 3907459.0,
"step": 141
},
{
"epoch": 1.802547770700637,
"grad_norm": 0.22238121926784515,
"learning_rate": 0.00014782539786213183,
"loss": 0.4143,
"mean_token_accuracy": 0.897837221622467,
"num_tokens": 3939449.0,
"step": 142
},
{
"epoch": 1.8152866242038217,
"grad_norm": 0.2159305065870285,
"learning_rate": 0.00014709385652202203,
"loss": 0.4186,
"mean_token_accuracy": 0.8961680829524994,
"num_tokens": 3969866.0,
"step": 143
},
{
"epoch": 1.8280254777070064,
"grad_norm": 0.20582257211208344,
"learning_rate": 0.00014635906222806058,
"loss": 0.4537,
"mean_token_accuracy": 0.8933248817920685,
"num_tokens": 3992840.0,
"step": 144
},
{
"epoch": 1.8407643312101911,
"grad_norm": 0.2202337086200714,
"learning_rate": 0.0001456210657353163,
"loss": 0.4291,
"mean_token_accuracy": 0.8948224484920502,
"num_tokens": 4018527.0,
"step": 145
},
{
"epoch": 1.8535031847133758,
"grad_norm": 0.21440590918064117,
"learning_rate": 0.00014487991802004623,
"loss": 0.4368,
"mean_token_accuracy": 0.8931339383125305,
"num_tokens": 4043208.0,
"step": 146
},
{
"epoch": 1.8662420382165605,
"grad_norm": 0.24883124232292175,
"learning_rate": 0.0001441356702761744,
"loss": 0.4568,
"mean_token_accuracy": 0.8917295932769775,
"num_tokens": 4069096.0,
"step": 147
},
{
"epoch": 1.8789808917197452,
"grad_norm": 0.2184818983078003,
"learning_rate": 0.00014338837391175582,
"loss": 0.4184,
"mean_token_accuracy": 0.8986537158489227,
"num_tokens": 4093319.0,
"step": 148
},
{
"epoch": 1.89171974522293,
"grad_norm": 0.198222354054451,
"learning_rate": 0.0001426380805454254,
"loss": 0.4521,
"mean_token_accuracy": 0.8902782797813416,
"num_tokens": 4131084.0,
"step": 149
},
{
"epoch": 1.9044585987261147,
"grad_norm": 0.19184260070323944,
"learning_rate": 0.0001418848420028325,
"loss": 0.3702,
"mean_token_accuracy": 0.9042331576347351,
"num_tokens": 4161283.0,
"step": 150
},
{
"epoch": 1.9171974522292994,
"grad_norm": 0.20852942764759064,
"learning_rate": 0.00014112871031306119,
"loss": 0.4591,
"mean_token_accuracy": 0.8892327547073364,
"num_tokens": 4189696.0,
"step": 151
},
{
"epoch": 1.929936305732484,
"grad_norm": 0.2122785896062851,
"learning_rate": 0.00014036973770503624,
"loss": 0.4011,
"mean_token_accuracy": 0.9002106189727783,
"num_tokens": 4214858.0,
"step": 152
},
{
"epoch": 1.9426751592356688,
"grad_norm": 0.24969106912612915,
"learning_rate": 0.0001396079766039157,
"loss": 0.4398,
"mean_token_accuracy": 0.8920584619045258,
"num_tokens": 4239007.0,
"step": 153
},
{
"epoch": 1.9554140127388535,
"grad_norm": 0.2375272810459137,
"learning_rate": 0.00013884347962746948,
"loss": 0.4547,
"mean_token_accuracy": 0.8890532553195953,
"num_tokens": 4263429.0,
"step": 154
},
{
"epoch": 1.9681528662420382,
"grad_norm": 0.26299113035202026,
"learning_rate": 0.00013807629958244498,
"loss": 0.4653,
"mean_token_accuracy": 0.8913359940052032,
"num_tokens": 4288110.0,
"step": 155
},
{
"epoch": 1.980891719745223,
"grad_norm": 0.23416920006275177,
"learning_rate": 0.0001373064894609194,
"loss": 0.4476,
"mean_token_accuracy": 0.893648236989975,
"num_tokens": 4315394.0,
"step": 156
},
{
"epoch": 1.9936305732484076,
"grad_norm": 0.21231195330619812,
"learning_rate": 0.00013653410243663952,
"loss": 0.436,
"mean_token_accuracy": 0.887963205575943,
"num_tokens": 4339453.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.3712882995605469,
"learning_rate": 0.0001357591918613486,
"loss": 0.3925,
"mean_token_accuracy": 0.9056902527809143,
"num_tokens": 4351488.0,
"step": 158
},
{
"epoch": 2.0127388535031847,
"grad_norm": 0.25778403878211975,
"learning_rate": 0.0001349818112611015,
"loss": 0.32,
"mean_token_accuracy": 0.9173864722251892,
"num_tokens": 4371410.0,
"step": 159
},
{
"epoch": 2.0254777070063694,
"grad_norm": 0.23973894119262695,
"learning_rate": 0.00013420201433256689,
"loss": 0.3256,
"mean_token_accuracy": 0.915358692407608,
"num_tokens": 4395306.0,
"step": 160
},
{
"epoch": 2.038216560509554,
"grad_norm": 0.22796404361724854,
"learning_rate": 0.00013341985493931877,
"loss": 0.3154,
"mean_token_accuracy": 0.9181290864944458,
"num_tokens": 4418479.0,
"step": 161
},
{
"epoch": 2.050955414012739,
"grad_norm": 0.24940259754657745,
"learning_rate": 0.0001326353871081156,
"loss": 0.3561,
"mean_token_accuracy": 0.9136996567249298,
"num_tokens": 4446513.0,
"step": 162
},
{
"epoch": 2.0636942675159236,
"grad_norm": 0.2551908493041992,
"learning_rate": 0.00013184866502516845,
"loss": 0.2875,
"mean_token_accuracy": 0.9239294826984406,
"num_tokens": 4475587.0,
"step": 163
},
{
"epoch": 2.0764331210191083,
"grad_norm": 0.31779205799102783,
"learning_rate": 0.00013105974303239838,
"loss": 0.337,
"mean_token_accuracy": 0.9131913781166077,
"num_tokens": 4507803.0,
"step": 164
},
{
"epoch": 2.089171974522293,
"grad_norm": 0.3075869381427765,
"learning_rate": 0.0001302686756236826,
"loss": 0.3437,
"mean_token_accuracy": 0.9136849045753479,
"num_tokens": 4534774.0,
"step": 165
},
{
"epoch": 2.1019108280254777,
"grad_norm": 0.27857956290245056,
"learning_rate": 0.00012947551744109043,
"loss": 0.2961,
"mean_token_accuracy": 0.9221843779087067,
"num_tokens": 4561771.0,
"step": 166
},
{
"epoch": 2.1146496815286624,
"grad_norm": 0.24581745266914368,
"learning_rate": 0.00012868032327110904,
"loss": 0.3091,
"mean_token_accuracy": 0.9198079109191895,
"num_tokens": 4591242.0,
"step": 167
},
{
"epoch": 2.127388535031847,
"grad_norm": 0.26451313495635986,
"learning_rate": 0.00012788314804085903,
"loss": 0.3353,
"mean_token_accuracy": 0.9105002880096436,
"num_tokens": 4617453.0,
"step": 168
},
{
"epoch": 2.140127388535032,
"grad_norm": 0.25673994421958923,
"learning_rate": 0.00012708404681430053,
"loss": 0.3369,
"mean_token_accuracy": 0.9157171845436096,
"num_tokens": 4644719.0,
"step": 169
},
{
"epoch": 2.1528662420382165,
"grad_norm": 0.24341438710689545,
"learning_rate": 0.00012628307478842953,
"loss": 0.3177,
"mean_token_accuracy": 0.9162335693836212,
"num_tokens": 4672500.0,
"step": 170
},
{
"epoch": 2.1656050955414012,
"grad_norm": 0.24725079536437988,
"learning_rate": 0.0001254802872894655,
"loss": 0.2765,
"mean_token_accuracy": 0.9274137318134308,
"num_tokens": 4698067.0,
"step": 171
},
{
"epoch": 2.178343949044586,
"grad_norm": 0.25747695565223694,
"learning_rate": 0.00012467573976902935,
"loss": 0.2873,
"mean_token_accuracy": 0.9210238754749298,
"num_tokens": 4721310.0,
"step": 172
},
{
"epoch": 2.1910828025477707,
"grad_norm": 0.26107609272003174,
"learning_rate": 0.0001238694878003138,
"loss": 0.3402,
"mean_token_accuracy": 0.9148900210857391,
"num_tokens": 4751803.0,
"step": 173
},
{
"epoch": 2.2038216560509554,
"grad_norm": 0.2875032126903534,
"learning_rate": 0.00012306158707424403,
"loss": 0.2983,
"mean_token_accuracy": 0.9225635528564453,
"num_tokens": 4780290.0,
"step": 174
},
{
"epoch": 2.21656050955414,
"grad_norm": 0.2381308525800705,
"learning_rate": 0.00012225209339563145,
"loss": 0.2977,
"mean_token_accuracy": 0.9232416152954102,
"num_tokens": 4811354.0,
"step": 175
},
{
"epoch": 2.229299363057325,
"grad_norm": 0.26640740036964417,
"learning_rate": 0.00012144106267931876,
"loss": 0.2846,
"mean_token_accuracy": 0.9265687465667725,
"num_tokens": 4842332.0,
"step": 176
},
{
"epoch": 2.2420382165605095,
"grad_norm": 0.24563997983932495,
"learning_rate": 0.00012062855094631778,
"loss": 0.3108,
"mean_token_accuracy": 0.9207164347171783,
"num_tokens": 4870984.0,
"step": 177
},
{
"epoch": 2.254777070063694,
"grad_norm": 0.27466630935668945,
"learning_rate": 0.00011981461431993977,
"loss": 0.3281,
"mean_token_accuracy": 0.9170567989349365,
"num_tokens": 4894780.0,
"step": 178
},
{
"epoch": 2.267515923566879,
"grad_norm": 0.2519949972629547,
"learning_rate": 0.00011899930902191902,
"loss": 0.3175,
"mean_token_accuracy": 0.9188465774059296,
"num_tokens": 4921436.0,
"step": 179
},
{
"epoch": 2.2802547770700636,
"grad_norm": 0.26715734601020813,
"learning_rate": 0.00011818269136852909,
"loss": 0.3441,
"mean_token_accuracy": 0.9148562848567963,
"num_tokens": 4948039.0,
"step": 180
},
{
"epoch": 2.2929936305732483,
"grad_norm": 0.23166969418525696,
"learning_rate": 0.00011736481776669306,
"loss": 0.319,
"mean_token_accuracy": 0.915693461894989,
"num_tokens": 4978581.0,
"step": 181
},
{
"epoch": 2.305732484076433,
"grad_norm": 0.2414565235376358,
"learning_rate": 0.00011654574471008713,
"loss": 0.3072,
"mean_token_accuracy": 0.9196109175682068,
"num_tokens": 5009258.0,
"step": 182
},
{
"epoch": 2.3184713375796178,
"grad_norm": 0.2841672897338867,
"learning_rate": 0.00011572552877523854,
"loss": 0.3672,
"mean_token_accuracy": 0.9095753729343414,
"num_tokens": 5036488.0,
"step": 183
},
{
"epoch": 2.3312101910828025,
"grad_norm": 0.26623329520225525,
"learning_rate": 0.00011490422661761744,
"loss": 0.2767,
"mean_token_accuracy": 0.9287644922733307,
"num_tokens": 5064738.0,
"step": 184
},
{
"epoch": 2.343949044585987,
"grad_norm": 0.28330451250076294,
"learning_rate": 0.00011408189496772368,
"loss": 0.3229,
"mean_token_accuracy": 0.9160982072353363,
"num_tokens": 5093434.0,
"step": 185
},
{
"epoch": 2.356687898089172,
"grad_norm": 0.2630554735660553,
"learning_rate": 0.00011325859062716795,
"loss": 0.3055,
"mean_token_accuracy": 0.9205747842788696,
"num_tokens": 5123026.0,
"step": 186
},
{
"epoch": 2.3694267515923566,
"grad_norm": 0.2821624279022217,
"learning_rate": 0.00011243437046474853,
"loss": 0.3071,
"mean_token_accuracy": 0.9194858074188232,
"num_tokens": 5154338.0,
"step": 187
},
{
"epoch": 2.3821656050955413,
"grad_norm": 0.28624358773231506,
"learning_rate": 0.00011160929141252303,
"loss": 0.3229,
"mean_token_accuracy": 0.917842447757721,
"num_tokens": 5178219.0,
"step": 188
},
{
"epoch": 2.394904458598726,
"grad_norm": 0.3025202453136444,
"learning_rate": 0.00011078341046187589,
"loss": 0.3013,
"mean_token_accuracy": 0.9202087819576263,
"num_tokens": 5203234.0,
"step": 189
},
{
"epoch": 2.4076433121019107,
"grad_norm": 0.24336163699626923,
"learning_rate": 0.00010995678465958168,
"loss": 0.3285,
"mean_token_accuracy": 0.9186490774154663,
"num_tokens": 5232408.0,
"step": 190
},
{
"epoch": 2.4203821656050954,
"grad_norm": 0.25561633706092834,
"learning_rate": 0.00010912947110386484,
"loss": 0.3698,
"mean_token_accuracy": 0.9088276028633118,
"num_tokens": 5261026.0,
"step": 191
},
{
"epoch": 2.43312101910828,
"grad_norm": 0.2555694282054901,
"learning_rate": 0.00010830152694045552,
"loss": 0.3148,
"mean_token_accuracy": 0.919522762298584,
"num_tokens": 5288695.0,
"step": 192
},
{
"epoch": 2.445859872611465,
"grad_norm": 0.24887681007385254,
"learning_rate": 0.00010747300935864243,
"loss": 0.2944,
"mean_token_accuracy": 0.9257466793060303,
"num_tokens": 5315340.0,
"step": 193
},
{
"epoch": 2.4585987261146496,
"grad_norm": 0.23277120292186737,
"learning_rate": 0.00010664397558732244,
"loss": 0.2951,
"mean_token_accuracy": 0.9233549237251282,
"num_tokens": 5348114.0,
"step": 194
},
{
"epoch": 2.4713375796178343,
"grad_norm": 0.273926705121994,
"learning_rate": 0.00010581448289104758,
"loss": 0.3484,
"mean_token_accuracy": 0.9133157134056091,
"num_tokens": 5377152.0,
"step": 195
},
{
"epoch": 2.484076433121019,
"grad_norm": 0.279252827167511,
"learning_rate": 0.00010498458856606972,
"loss": 0.3105,
"mean_token_accuracy": 0.9215060770511627,
"num_tokens": 5403199.0,
"step": 196
},
{
"epoch": 2.4968152866242037,
"grad_norm": 0.23848757147789001,
"learning_rate": 0.00010415434993638269,
"loss": 0.3066,
"mean_token_accuracy": 0.9202364385128021,
"num_tokens": 5431148.0,
"step": 197
},
{
"epoch": 2.5095541401273884,
"grad_norm": 0.25585582852363586,
"learning_rate": 0.00010332382434976266,
"loss": 0.314,
"mean_token_accuracy": 0.921753317117691,
"num_tokens": 5461750.0,
"step": 198
},
{
"epoch": 2.522292993630573,
"grad_norm": 0.25233033299446106,
"learning_rate": 0.0001024930691738073,
"loss": 0.3226,
"mean_token_accuracy": 0.9191461503505707,
"num_tokens": 5491122.0,
"step": 199
},
{
"epoch": 2.535031847133758,
"grad_norm": 0.3022018373012543,
"learning_rate": 0.00010166214179197264,
"loss": 0.3584,
"mean_token_accuracy": 0.911718875169754,
"num_tokens": 5514434.0,
"step": 200
},
{
"epoch": 2.5477707006369426,
"grad_norm": 0.2553904950618744,
"learning_rate": 0.00010083109959960973,
"loss": 0.3342,
"mean_token_accuracy": 0.9178999066352844,
"num_tokens": 5548042.0,
"step": 201
},
{
"epoch": 2.5605095541401273,
"grad_norm": 0.2905219495296478,
"learning_rate": 0.0001,
"loss": 0.3583,
"mean_token_accuracy": 0.9109853804111481,
"num_tokens": 5575394.0,
"step": 202
},
{
"epoch": 2.573248407643312,
"grad_norm": 0.255098432302475,
"learning_rate": 9.916890040039031e-05,
"loss": 0.3194,
"mean_token_accuracy": 0.9198348224163055,
"num_tokens": 5601082.0,
"step": 203
},
{
"epoch": 2.5859872611464967,
"grad_norm": 0.2750662565231323,
"learning_rate": 9.833785820802739e-05,
"loss": 0.3325,
"mean_token_accuracy": 0.914797455072403,
"num_tokens": 5629018.0,
"step": 204
},
{
"epoch": 2.5987261146496814,
"grad_norm": 0.2625913619995117,
"learning_rate": 9.750693082619273e-05,
"loss": 0.3198,
"mean_token_accuracy": 0.9208146929740906,
"num_tokens": 5655575.0,
"step": 205
},
{
"epoch": 2.611464968152866,
"grad_norm": 0.2661764621734619,
"learning_rate": 9.667617565023735e-05,
"loss": 0.3205,
"mean_token_accuracy": 0.9181171953678131,
"num_tokens": 5684062.0,
"step": 206
},
{
"epoch": 2.624203821656051,
"grad_norm": 0.27836722135543823,
"learning_rate": 9.584565006361734e-05,
"loss": 0.3373,
"mean_token_accuracy": 0.9147651493549347,
"num_tokens": 5707293.0,
"step": 207
},
{
"epoch": 2.6369426751592355,
"grad_norm": 0.25967466831207275,
"learning_rate": 9.501541143393028e-05,
"loss": 0.3209,
"mean_token_accuracy": 0.9182553887367249,
"num_tokens": 5736018.0,
"step": 208
},
{
"epoch": 2.6496815286624202,
"grad_norm": 0.300536185503006,
"learning_rate": 9.418551710895243e-05,
"loss": 0.3436,
"mean_token_accuracy": 0.9132080078125,
"num_tokens": 5759355.0,
"step": 209
},
{
"epoch": 2.662420382165605,
"grad_norm": 0.2817765176296234,
"learning_rate": 9.335602441267759e-05,
"loss": 0.3308,
"mean_token_accuracy": 0.9144207537174225,
"num_tokens": 5786713.0,
"step": 210
},
{
"epoch": 2.6751592356687897,
"grad_norm": 0.27997687458992004,
"learning_rate": 9.252699064135758e-05,
"loss": 0.2886,
"mean_token_accuracy": 0.9254343807697296,
"num_tokens": 5810146.0,
"step": 211
},
{
"epoch": 2.6878980891719744,
"grad_norm": 0.2512475848197937,
"learning_rate": 9.169847305954447e-05,
"loss": 0.3294,
"mean_token_accuracy": 0.9175789952278137,
"num_tokens": 5839567.0,
"step": 212
},
{
"epoch": 2.700636942675159,
"grad_norm": 0.2896527349948883,
"learning_rate": 9.087052889613518e-05,
"loss": 0.333,
"mean_token_accuracy": 0.9168034195899963,
"num_tokens": 5863274.0,
"step": 213
},
{
"epoch": 2.713375796178344,
"grad_norm": 0.24823246896266937,
"learning_rate": 9.004321534041835e-05,
"loss": 0.3175,
"mean_token_accuracy": 0.9179215729236603,
"num_tokens": 5891923.0,
"step": 214
},
{
"epoch": 2.7261146496815285,
"grad_norm": 0.26605039834976196,
"learning_rate": 8.921658953812415e-05,
"loss": 0.325,
"mean_token_accuracy": 0.919013649225235,
"num_tokens": 5919710.0,
"step": 215
},
{
"epoch": 2.738853503184713,
"grad_norm": 0.28539609909057617,
"learning_rate": 8.839070858747697e-05,
"loss": 0.333,
"mean_token_accuracy": 0.9131192266941071,
"num_tokens": 5946338.0,
"step": 216
},
{
"epoch": 2.7515923566878984,
"grad_norm": 0.27890920639038086,
"learning_rate": 8.756562953525152e-05,
"loss": 0.3211,
"mean_token_accuracy": 0.9164293110370636,
"num_tokens": 5970380.0,
"step": 217
},
{
"epoch": 2.7643312101910826,
"grad_norm": 0.2748299837112427,
"learning_rate": 8.674140937283208e-05,
"loss": 0.2877,
"mean_token_accuracy": 0.9252252280712128,
"num_tokens": 5996619.0,
"step": 218
},
{
"epoch": 2.777070063694268,
"grad_norm": 0.26802513003349304,
"learning_rate": 8.591810503227635e-05,
"loss": 0.3117,
"mean_token_accuracy": 0.9208323955535889,
"num_tokens": 6023567.0,
"step": 219
},
{
"epoch": 2.789808917197452,
"grad_norm": 0.2869545817375183,
"learning_rate": 8.509577338238255e-05,
"loss": 0.3161,
"mean_token_accuracy": 0.9191421270370483,
"num_tokens": 6048364.0,
"step": 220
},
{
"epoch": 2.802547770700637,
"grad_norm": 0.27043092250823975,
"learning_rate": 8.427447122476148e-05,
"loss": 0.32,
"mean_token_accuracy": 0.9222770631313324,
"num_tokens": 6078904.0,
"step": 221
},
{
"epoch": 2.8152866242038215,
"grad_norm": 0.2868477404117584,
"learning_rate": 8.345425528991288e-05,
"loss": 0.3534,
"mean_token_accuracy": 0.9121315777301788,
"num_tokens": 6102971.0,
"step": 222
},
{
"epoch": 2.8280254777070066,
"grad_norm": 0.2407357096672058,
"learning_rate": 8.263518223330697e-05,
"loss": 0.3213,
"mean_token_accuracy": 0.9192101955413818,
"num_tokens": 6133199.0,
"step": 223
},
{
"epoch": 2.840764331210191,
"grad_norm": 0.2626263201236725,
"learning_rate": 8.181730863147093e-05,
"loss": 0.2971,
"mean_token_accuracy": 0.9247592687606812,
"num_tokens": 6159899.0,
"step": 224
},
{
"epoch": 2.853503184713376,
"grad_norm": 0.2626074552536011,
"learning_rate": 8.100069097808103e-05,
"loss": 0.2947,
"mean_token_accuracy": 0.9244669079780579,
"num_tokens": 6186375.0,
"step": 225
},
{
"epoch": 2.8662420382165603,
"grad_norm": 0.2592032849788666,
"learning_rate": 8.018538568006027e-05,
"loss": 0.3211,
"mean_token_accuracy": 0.919723629951477,
"num_tokens": 6214396.0,
"step": 226
},
{
"epoch": 2.8789808917197455,
"grad_norm": 0.24237875640392303,
"learning_rate": 7.937144905368226e-05,
"loss": 0.3019,
"mean_token_accuracy": 0.922019898891449,
"num_tokens": 6246576.0,
"step": 227
},
{
"epoch": 2.8917197452229297,
"grad_norm": 0.2897930145263672,
"learning_rate": 7.855893732068125e-05,
"loss": 0.3562,
"mean_token_accuracy": 0.9106606543064117,
"num_tokens": 6269193.0,
"step": 228
},
{
"epoch": 2.904458598726115,
"grad_norm": 0.23334293067455292,
"learning_rate": 7.774790660436858e-05,
"loss": 0.2918,
"mean_token_accuracy": 0.923689991235733,
"num_tokens": 6300908.0,
"step": 229
},
{
"epoch": 2.917197452229299,
"grad_norm": 0.2914448380470276,
"learning_rate": 7.693841292575598e-05,
"loss": 0.3441,
"mean_token_accuracy": 0.9132694602012634,
"num_tokens": 6326792.0,
"step": 230
},
{
"epoch": 2.9299363057324843,
"grad_norm": 0.24014908075332642,
"learning_rate": 7.613051219968623e-05,
"loss": 0.3196,
"mean_token_accuracy": 0.9171076416969299,
"num_tokens": 6360064.0,
"step": 231
},
{
"epoch": 2.9426751592356686,
"grad_norm": 0.26138004660606384,
"learning_rate": 7.532426023097063e-05,
"loss": 0.3186,
"mean_token_accuracy": 0.91810542345047,
"num_tokens": 6386431.0,
"step": 232
},
{
"epoch": 2.9554140127388537,
"grad_norm": 0.2643719017505646,
"learning_rate": 7.451971271053455e-05,
"loss": 0.2985,
"mean_token_accuracy": 0.9218295514583588,
"num_tokens": 6416732.0,
"step": 233
},
{
"epoch": 2.968152866242038,
"grad_norm": 0.24162565171718597,
"learning_rate": 7.371692521157048e-05,
"loss": 0.3065,
"mean_token_accuracy": 0.9209640920162201,
"num_tokens": 6449012.0,
"step": 234
},
{
"epoch": 2.980891719745223,
"grad_norm": 0.2610671818256378,
"learning_rate": 7.291595318569951e-05,
"loss": 0.3162,
"mean_token_accuracy": 0.9178925156593323,
"num_tokens": 6482223.0,
"step": 235
},
{
"epoch": 2.9936305732484074,
"grad_norm": 0.24371646344661713,
"learning_rate": 7.211685195914097e-05,
"loss": 0.3032,
"mean_token_accuracy": 0.9201788902282715,
"num_tokens": 6515308.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.24371646344661713,
"learning_rate": 7.131967672889101e-05,
"loss": 0.2291,
"mean_token_accuracy": 0.9397472143173218,
"num_tokens": 6524518.0,
"step": 237
},
{
"epoch": 3.0127388535031847,
"grad_norm": 0.42819610238075256,
"learning_rate": 7.052448255890957e-05,
"loss": 0.2481,
"mean_token_accuracy": 0.9369410872459412,
"num_tokens": 6554034.0,
"step": 238
},
{
"epoch": 3.0254777070063694,
"grad_norm": 0.22651733458042145,
"learning_rate": 6.973132437631742e-05,
"loss": 0.1993,
"mean_token_accuracy": 0.9478741586208344,
"num_tokens": 6583871.0,
"step": 239
},
{
"epoch": 3.038216560509554,
"grad_norm": 0.22783218324184418,
"learning_rate": 6.894025696760163e-05,
"loss": 0.1907,
"mean_token_accuracy": 0.9485516846179962,
"num_tokens": 6609766.0,
"step": 240
},
{
"epoch": 3.050955414012739,
"grad_norm": 0.24459128081798553,
"learning_rate": 6.815133497483157e-05,
"loss": 0.2249,
"mean_token_accuracy": 0.9421961307525635,
"num_tokens": 6638606.0,
"step": 241
},
{
"epoch": 3.0636942675159236,
"grad_norm": 0.26941463351249695,
"learning_rate": 6.736461289188445e-05,
"loss": 0.2244,
"mean_token_accuracy": 0.9397568106651306,
"num_tokens": 6663990.0,
"step": 242
},
{
"epoch": 3.0764331210191083,
"grad_norm": 0.31805625557899475,
"learning_rate": 6.658014506068126e-05,
"loss": 0.2348,
"mean_token_accuracy": 0.9378407299518585,
"num_tokens": 6684932.0,
"step": 243
},
{
"epoch": 3.089171974522293,
"grad_norm": 0.3326071798801422,
"learning_rate": 6.579798566743314e-05,
"loss": 0.208,
"mean_token_accuracy": 0.9450594484806061,
"num_tokens": 6715073.0,
"step": 244
},
{
"epoch": 3.1019108280254777,
"grad_norm": 0.3544203042984009,
"learning_rate": 6.501818873889855e-05,
"loss": 0.197,
"mean_token_accuracy": 0.9472306370735168,
"num_tokens": 6743374.0,
"step": 245
},
{
"epoch": 3.1146496815286624,
"grad_norm": 0.4308759272098541,
"learning_rate": 6.424080813865138e-05,
"loss": 0.1947,
"mean_token_accuracy": 0.945770800113678,
"num_tokens": 6771549.0,
"step": 246
},
{
"epoch": 3.127388535031847,
"grad_norm": 0.3265669345855713,
"learning_rate": 6.34658975633605e-05,
"loss": 0.171,
"mean_token_accuracy": 0.9553861618041992,
"num_tokens": 6799304.0,
"step": 247
},
{
"epoch": 3.140127388535032,
"grad_norm": 0.3212307393550873,
"learning_rate": 6.269351053908061e-05,
"loss": 0.2043,
"mean_token_accuracy": 0.9439343512058258,
"num_tokens": 6826996.0,
"step": 248
},
{
"epoch": 3.1528662420382165,
"grad_norm": 0.33451324701309204,
"learning_rate": 6.192370041755505e-05,
"loss": 0.2055,
"mean_token_accuracy": 0.9447910487651825,
"num_tokens": 6858807.0,
"step": 249
},
{
"epoch": 3.1656050955414012,
"grad_norm": 0.32139697670936584,
"learning_rate": 6.115652037253053e-05,
"loss": 0.2265,
"mean_token_accuracy": 0.9411024153232574,
"num_tokens": 6891927.0,
"step": 250
},
{
"epoch": 3.178343949044586,
"grad_norm": 0.25394192337989807,
"learning_rate": 6.039202339608432e-05,
"loss": 0.2257,
"mean_token_accuracy": 0.941776305437088,
"num_tokens": 6921866.0,
"step": 251
},
{
"epoch": 3.1910828025477707,
"grad_norm": 0.2920042872428894,
"learning_rate": 5.963026229496378e-05,
"loss": 0.1807,
"mean_token_accuracy": 0.9529874622821808,
"num_tokens": 6946938.0,
"step": 252
},
{
"epoch": 3.2038216560509554,
"grad_norm": 0.2611655592918396,
"learning_rate": 5.887128968693887e-05,
"loss": 0.2024,
"mean_token_accuracy": 0.942744642496109,
"num_tokens": 6971723.0,
"step": 253
},
{
"epoch": 3.21656050955414,
"grad_norm": 0.3016382157802582,
"learning_rate": 5.8115157997167536e-05,
"loss": 0.2105,
"mean_token_accuracy": 0.944105714559555,
"num_tokens": 7004160.0,
"step": 254
},
{
"epoch": 3.229299363057325,
"grad_norm": 0.27568382024765015,
"learning_rate": 5.736191945457463e-05,
"loss": 0.2475,
"mean_token_accuracy": 0.9371559321880341,
"num_tokens": 7032700.0,
"step": 255
},
{
"epoch": 3.2420382165605095,
"grad_norm": 0.2987270951271057,
"learning_rate": 5.6611626088244194e-05,
"loss": 0.2239,
"mean_token_accuracy": 0.9423088431358337,
"num_tokens": 7063449.0,
"step": 256
},
{
"epoch": 3.254777070063694,
"grad_norm": 0.30039167404174805,
"learning_rate": 5.58643297238256e-05,
"loss": 0.2109,
"mean_token_accuracy": 0.9426285624504089,
"num_tokens": 7087519.0,
"step": 257
},
{
"epoch": 3.267515923566879,
"grad_norm": 0.26526811718940735,
"learning_rate": 5.5120081979953785e-05,
"loss": 0.2019,
"mean_token_accuracy": 0.9480101764202118,
"num_tokens": 7120853.0,
"step": 258
},
{
"epoch": 3.2802547770700636,
"grad_norm": 0.29212793707847595,
"learning_rate": 5.43789342646837e-05,
"loss": 0.2,
"mean_token_accuracy": 0.943680614233017,
"num_tokens": 7149753.0,
"step": 259
},
{
"epoch": 3.2929936305732483,
"grad_norm": 0.3073207437992096,
"learning_rate": 5.3640937771939436e-05,
"loss": 0.1831,
"mean_token_accuracy": 0.9496051073074341,
"num_tokens": 7179133.0,
"step": 260
},
{
"epoch": 3.305732484076433,
"grad_norm": 0.3157687783241272,
"learning_rate": 5.290614347797802e-05,
"loss": 0.2113,
"mean_token_accuracy": 0.9447730183601379,
"num_tokens": 7202811.0,
"step": 261
},
{
"epoch": 3.3184713375796178,
"grad_norm": 0.33937543630599976,
"learning_rate": 5.217460213786821e-05,
"loss": 0.2181,
"mean_token_accuracy": 0.9423291087150574,
"num_tokens": 7226396.0,
"step": 262
},
{
"epoch": 3.3312101910828025,
"grad_norm": 0.3266925513744354,
"learning_rate": 5.1446364281984774e-05,
"loss": 0.2075,
"mean_token_accuracy": 0.9435094892978668,
"num_tokens": 7257956.0,
"step": 263
},
{
"epoch": 3.343949044585987,
"grad_norm": 0.3351779580116272,
"learning_rate": 5.072148021251821e-05,
"loss": 0.2209,
"mean_token_accuracy": 0.940418541431427,
"num_tokens": 7285205.0,
"step": 264
},
{
"epoch": 3.356687898089172,
"grad_norm": 0.32669177651405334,
"learning_rate": 5.000000000000002e-05,
"loss": 0.2285,
"mean_token_accuracy": 0.9397756159305573,
"num_tokens": 7311154.0,
"step": 265
},
{
"epoch": 3.3694267515923566,
"grad_norm": 0.30711665749549866,
"learning_rate": 4.92819734798441e-05,
"loss": 0.2024,
"mean_token_accuracy": 0.9481330215930939,
"num_tokens": 7343227.0,
"step": 266
},
{
"epoch": 3.3821656050955413,
"grad_norm": 0.31600600481033325,
"learning_rate": 4.856745024890466e-05,
"loss": 0.1907,
"mean_token_accuracy": 0.9468717575073242,
"num_tokens": 7371681.0,
"step": 267
},
{
"epoch": 3.394904458598726,
"grad_norm": 0.26683205366134644,
"learning_rate": 4.78564796620502e-05,
"loss": 0.2164,
"mean_token_accuracy": 0.9429590404033661,
"num_tokens": 7404896.0,
"step": 268
},
{
"epoch": 3.4076433121019107,
"grad_norm": 0.3237342834472656,
"learning_rate": 4.7149110828754464e-05,
"loss": 0.215,
"mean_token_accuracy": 0.9443815350532532,
"num_tokens": 7433420.0,
"step": 269
},
{
"epoch": 3.4203821656050954,
"grad_norm": 0.37115031480789185,
"learning_rate": 4.644539260970416e-05,
"loss": 0.2134,
"mean_token_accuracy": 0.9406436383724213,
"num_tokens": 7456572.0,
"step": 270
},
{
"epoch": 3.43312101910828,
"grad_norm": 0.3020355999469757,
"learning_rate": 4.574537361342407e-05,
"loss": 0.1806,
"mean_token_accuracy": 0.9492580592632294,
"num_tokens": 7485631.0,
"step": 271
},
{
"epoch": 3.445859872611465,
"grad_norm": 0.291256308555603,
"learning_rate": 4.50491021929194e-05,
"loss": 0.2131,
"mean_token_accuracy": 0.9445066750049591,
"num_tokens": 7511362.0,
"step": 272
},
{
"epoch": 3.4585987261146496,
"grad_norm": 0.33195558190345764,
"learning_rate": 4.435662644233594e-05,
"loss": 0.2254,
"mean_token_accuracy": 0.9385928213596344,
"num_tokens": 7537935.0,
"step": 273
},
{
"epoch": 3.4713375796178343,
"grad_norm": 0.31009262800216675,
"learning_rate": 4.3667994193637796e-05,
"loss": 0.2132,
"mean_token_accuracy": 0.9448133111000061,
"num_tokens": 7566246.0,
"step": 274
},
{
"epoch": 3.484076433121019,
"grad_norm": 0.3261551856994629,
"learning_rate": 4.298325301330383e-05,
"loss": 0.1986,
"mean_token_accuracy": 0.9451175630092621,
"num_tokens": 7593750.0,
"step": 275
},
{
"epoch": 3.4968152866242037,
"grad_norm": 0.30474022030830383,
"learning_rate": 4.23024501990417e-05,
"loss": 0.2189,
"mean_token_accuracy": 0.9432675242424011,
"num_tokens": 7622251.0,
"step": 276
},
{
"epoch": 3.5095541401273884,
"grad_norm": 0.32641172409057617,
"learning_rate": 4.1625632776521037e-05,
"loss": 0.2424,
"mean_token_accuracy": 0.9352215826511383,
"num_tokens": 7646162.0,
"step": 277
},
{
"epoch": 3.522292993630573,
"grad_norm": 0.36916500329971313,
"learning_rate": 4.095284749612503e-05,
"loss": 0.2124,
"mean_token_accuracy": 0.9441305100917816,
"num_tokens": 7668654.0,
"step": 278
},
{
"epoch": 3.535031847133758,
"grad_norm": 0.3254569470882416,
"learning_rate": 4.028414082972141e-05,
"loss": 0.2257,
"mean_token_accuracy": 0.940665602684021,
"num_tokens": 7695678.0,
"step": 279
},
{
"epoch": 3.5477707006369426,
"grad_norm": 0.3033880293369293,
"learning_rate": 3.961955896745224e-05,
"loss": 0.2177,
"mean_token_accuracy": 0.9448119699954987,
"num_tokens": 7720952.0,
"step": 280
},
{
"epoch": 3.5605095541401273,
"grad_norm": 0.3547619581222534,
"learning_rate": 3.89591478145437e-05,
"loss": 0.217,
"mean_token_accuracy": 0.9433469474315643,
"num_tokens": 7746292.0,
"step": 281
},
{
"epoch": 3.573248407643312,
"grad_norm": 0.2937956154346466,
"learning_rate": 3.8302952988134756e-05,
"loss": 0.214,
"mean_token_accuracy": 0.9453655481338501,
"num_tokens": 7775263.0,
"step": 282
},
{
"epoch": 3.5859872611464967,
"grad_norm": 0.2963101863861084,
"learning_rate": 3.7651019814126654e-05,
"loss": 0.1858,
"mean_token_accuracy": 0.950236588716507,
"num_tokens": 7804091.0,
"step": 283
},
{
"epoch": 3.5987261146496814,
"grad_norm": 0.2752476930618286,
"learning_rate": 3.7003393324051874e-05,
"loss": 0.2013,
"mean_token_accuracy": 0.9444670975208282,
"num_tokens": 7831415.0,
"step": 284
},
{
"epoch": 3.611464968152866,
"grad_norm": 0.30236101150512695,
"learning_rate": 3.6360118251963645e-05,
"loss": 0.2146,
"mean_token_accuracy": 0.9440622627735138,
"num_tokens": 7861196.0,
"step": 285
},
{
"epoch": 3.624203821656051,
"grad_norm": 0.3374358117580414,
"learning_rate": 3.5721239031346066e-05,
"loss": 0.2083,
"mean_token_accuracy": 0.945656806230545,
"num_tokens": 7888551.0,
"step": 286
},
{
"epoch": 3.6369426751592355,
"grad_norm": 0.332331120967865,
"learning_rate": 3.508679979204481e-05,
"loss": 0.2274,
"mean_token_accuracy": 0.939465343952179,
"num_tokens": 7916173.0,
"step": 287
},
{
"epoch": 3.6496815286624202,
"grad_norm": 0.3092139661312103,
"learning_rate": 3.445684435721897e-05,
"loss": 0.1997,
"mean_token_accuracy": 0.9468453824520111,
"num_tokens": 7942870.0,
"step": 288
},
{
"epoch": 3.662420382165605,
"grad_norm": 0.2880033552646637,
"learning_rate": 3.383141624031408e-05,
"loss": 0.1905,
"mean_token_accuracy": 0.9489818811416626,
"num_tokens": 7971239.0,
"step": 289
},
{
"epoch": 3.6751592356687897,
"grad_norm": 0.3255373239517212,
"learning_rate": 3.3210558642056275e-05,
"loss": 0.2318,
"mean_token_accuracy": 0.9415358006954193,
"num_tokens": 7997893.0,
"step": 290
},
{
"epoch": 3.6878980891719744,
"grad_norm": 0.3434557318687439,
"learning_rate": 3.259431444746846e-05,
"loss": 0.2012,
"mean_token_accuracy": 0.946794331073761,
"num_tokens": 8027066.0,
"step": 291
},
{
"epoch": 3.700636942675159,
"grad_norm": 0.28656280040740967,
"learning_rate": 3.198272622290804e-05,
"loss": 0.1882,
"mean_token_accuracy": 0.9503431022167206,
"num_tokens": 8057253.0,
"step": 292
},
{
"epoch": 3.713375796178344,
"grad_norm": 0.30829906463623047,
"learning_rate": 3.137583621312665e-05,
"loss": 0.204,
"mean_token_accuracy": 0.9471130073070526,
"num_tokens": 8092026.0,
"step": 293
},
{
"epoch": 3.7261146496815285,
"grad_norm": 0.2918407618999481,
"learning_rate": 3.077368633835205e-05,
"loss": 0.2311,
"mean_token_accuracy": 0.9399546384811401,
"num_tokens": 8120782.0,
"step": 294
},
{
"epoch": 3.738853503184713,
"grad_norm": 0.3347460627555847,
"learning_rate": 3.0176318191392726e-05,
"loss": 0.1995,
"mean_token_accuracy": 0.9461638033390045,
"num_tokens": 8146581.0,
"step": 295
},
{
"epoch": 3.7515923566878984,
"grad_norm": 0.3317808508872986,
"learning_rate": 2.9583773034764826e-05,
"loss": 0.2002,
"mean_token_accuracy": 0.9467883110046387,
"num_tokens": 8171884.0,
"step": 296
},
{
"epoch": 3.7643312101910826,
"grad_norm": 0.3350849747657776,
"learning_rate": 2.8996091797841973e-05,
"loss": 0.1985,
"mean_token_accuracy": 0.9433420896530151,
"num_tokens": 8195633.0,
"step": 297
},
{
"epoch": 3.777070063694268,
"grad_norm": 0.30415278673171997,
"learning_rate": 2.8413315074028158e-05,
"loss": 0.2192,
"mean_token_accuracy": 0.9425555467605591,
"num_tokens": 8225423.0,
"step": 298
},
{
"epoch": 3.789808917197452,
"grad_norm": 0.3231201171875,
"learning_rate": 2.7835483117953788e-05,
"loss": 0.2172,
"mean_token_accuracy": 0.9424301981925964,
"num_tokens": 8251132.0,
"step": 299
},
{
"epoch": 3.802547770700637,
"grad_norm": 0.2972840964794159,
"learning_rate": 2.7262635842695127e-05,
"loss": 0.2058,
"mean_token_accuracy": 0.9453469514846802,
"num_tokens": 8279946.0,
"step": 300
},
{
"epoch": 3.8152866242038215,
"grad_norm": 0.310139000415802,
"learning_rate": 2.669481281701739e-05,
"loss": 0.2107,
"mean_token_accuracy": 0.9437506794929504,
"num_tokens": 8303728.0,
"step": 301
},
{
"epoch": 3.8280254777070066,
"grad_norm": 0.3299463391304016,
"learning_rate": 2.6132053262641466e-05,
"loss": 0.2316,
"mean_token_accuracy": 0.9386799037456512,
"num_tokens": 8329630.0,
"step": 302
},
{
"epoch": 3.840764331210191,
"grad_norm": 0.3343072831630707,
"learning_rate": 2.5574396051534832e-05,
"loss": 0.185,
"mean_token_accuracy": 0.9503215253353119,
"num_tokens": 8355220.0,
"step": 303
},
{
"epoch": 3.853503184713376,
"grad_norm": 0.2927515208721161,
"learning_rate": 2.502187970322657e-05,
"loss": 0.1981,
"mean_token_accuracy": 0.948171466588974,
"num_tokens": 8389035.0,
"step": 304
},
{
"epoch": 3.8662420382165603,
"grad_norm": 0.31487882137298584,
"learning_rate": 2.4474542382146537e-05,
"loss": 0.2098,
"mean_token_accuracy": 0.9438025951385498,
"num_tokens": 8418162.0,
"step": 305
},
{
"epoch": 3.8789808917197455,
"grad_norm": 0.29079580307006836,
"learning_rate": 2.3932421894989167e-05,
"loss": 0.2286,
"mean_token_accuracy": 0.9384362697601318,
"num_tokens": 8440831.0,
"step": 306
},
{
"epoch": 3.8917197452229297,
"grad_norm": 0.352939635515213,
"learning_rate": 2.339555568810221e-05,
"loss": 0.1843,
"mean_token_accuracy": 0.9493797421455383,
"num_tokens": 8470669.0,
"step": 307
},
{
"epoch": 3.904458598726115,
"grad_norm": 0.3093090355396271,
"learning_rate": 2.2863980844900036e-05,
"loss": 0.2185,
"mean_token_accuracy": 0.9417230188846588,
"num_tokens": 8494127.0,
"step": 308
},
{
"epoch": 3.917197452229299,
"grad_norm": 0.33930864930152893,
"learning_rate": 2.2337734083302164e-05,
"loss": 0.2171,
"mean_token_accuracy": 0.9457297027111053,
"num_tokens": 8523365.0,
"step": 309
},
{
"epoch": 3.9299363057324843,
"grad_norm": 0.2833450436592102,
"learning_rate": 2.181685175319702e-05,
"loss": 0.1996,
"mean_token_accuracy": 0.9482668936252594,
"num_tokens": 8549781.0,
"step": 310
},
{
"epoch": 3.9426751592356686,
"grad_norm": 0.3223772346973419,
"learning_rate": 2.1301369833931117e-05,
"loss": 0.2388,
"mean_token_accuracy": 0.9379838705062866,
"num_tokens": 8573872.0,
"step": 311
},
{
"epoch": 3.9554140127388537,
"grad_norm": 0.35899412631988525,
"learning_rate": 2.079132393182378e-05,
"loss": 0.2086,
"mean_token_accuracy": 0.943289190530777,
"num_tokens": 8600357.0,
"step": 312
},
{
"epoch": 3.968152866242038,
"grad_norm": 0.3071880638599396,
"learning_rate": 2.0286749277707782e-05,
"loss": 0.1928,
"mean_token_accuracy": 0.9484856128692627,
"num_tokens": 8629976.0,
"step": 313
},
{
"epoch": 3.980891719745223,
"grad_norm": 0.3144143223762512,
"learning_rate": 1.9787680724495617e-05,
"loss": 0.2347,
"mean_token_accuracy": 0.9397814869880676,
"num_tokens": 8658611.0,
"step": 314
},
{
"epoch": 3.9936305732484074,
"grad_norm": 0.34338703751564026,
"learning_rate": 1.929415274477239e-05,
"loss": 0.1975,
"mean_token_accuracy": 0.9477995038032532,
"num_tokens": 8686630.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.46533268690109253,
"learning_rate": 1.880619942841435e-05,
"loss": 0.2113,
"mean_token_accuracy": 0.9439818263053894,
"num_tokens": 8699872.0,
"step": 316
},
{
"epoch": 4.012738853503185,
"grad_norm": 0.23810382187366486,
"learning_rate": 1.832385448023435e-05,
"loss": 0.144,
"mean_token_accuracy": 0.9630288481712341,
"num_tokens": 8734596.0,
"step": 317
},
{
"epoch": 4.025477707006369,
"grad_norm": 0.2706077992916107,
"learning_rate": 1.7847151217653624e-05,
"loss": 0.1504,
"mean_token_accuracy": 0.9619067907333374,
"num_tokens": 8761637.0,
"step": 318
},
{
"epoch": 4.038216560509555,
"grad_norm": 0.26191478967666626,
"learning_rate": 1.7376122568400532e-05,
"loss": 0.1588,
"mean_token_accuracy": 0.9599383473396301,
"num_tokens": 8790955.0,
"step": 319
},
{
"epoch": 4.050955414012739,
"grad_norm": 0.26356980204582214,
"learning_rate": 1.6910801068236016e-05,
"loss": 0.1433,
"mean_token_accuracy": 0.9618352353572845,
"num_tokens": 8819777.0,
"step": 320
},
{
"epoch": 4.063694267515924,
"grad_norm": 0.24432717263698578,
"learning_rate": 1.6451218858706374e-05,
"loss": 0.138,
"mean_token_accuracy": 0.9636504054069519,
"num_tokens": 8849131.0,
"step": 321
},
{
"epoch": 4.076433121019108,
"grad_norm": 0.33173316717147827,
"learning_rate": 1.5997407684922862e-05,
"loss": 0.1956,
"mean_token_accuracy": 0.9531349837779999,
"num_tokens": 8872843.0,
"step": 322
},
{
"epoch": 4.089171974522293,
"grad_norm": 0.2538873851299286,
"learning_rate": 1.5549398893369216e-05,
"loss": 0.1502,
"mean_token_accuracy": 0.9617005288600922,
"num_tokens": 8901795.0,
"step": 323
},
{
"epoch": 4.101910828025478,
"grad_norm": 0.2779563069343567,
"learning_rate": 1.5107223429736272e-05,
"loss": 0.1502,
"mean_token_accuracy": 0.96136873960495,
"num_tokens": 8927244.0,
"step": 324
},
{
"epoch": 4.114649681528663,
"grad_norm": 0.2902298867702484,
"learning_rate": 1.467091183678444e-05,
"loss": 0.1549,
"mean_token_accuracy": 0.9591580033302307,
"num_tokens": 8957527.0,
"step": 325
},
{
"epoch": 4.127388535031847,
"grad_norm": 0.2964951992034912,
"learning_rate": 1.4240494252234049e-05,
"loss": 0.1367,
"mean_token_accuracy": 0.9627481400966644,
"num_tokens": 8987686.0,
"step": 326
},
{
"epoch": 4.140127388535032,
"grad_norm": 0.3314071297645569,
"learning_rate": 1.3816000406683604e-05,
"loss": 0.147,
"mean_token_accuracy": 0.9618198573589325,
"num_tokens": 9016214.0,
"step": 327
},
{
"epoch": 4.1528662420382165,
"grad_norm": 0.31644365191459656,
"learning_rate": 1.339745962155613e-05,
"loss": 0.1463,
"mean_token_accuracy": 0.9603260159492493,
"num_tokens": 9044452.0,
"step": 328
},
{
"epoch": 4.165605095541402,
"grad_norm": 0.34280964732170105,
"learning_rate": 1.2984900807073919e-05,
"loss": 0.1579,
"mean_token_accuracy": 0.9591144621372223,
"num_tokens": 9073099.0,
"step": 329
},
{
"epoch": 4.178343949044586,
"grad_norm": 0.35573169589042664,
"learning_rate": 1.2578352460261456e-05,
"loss": 0.1341,
"mean_token_accuracy": 0.964358389377594,
"num_tokens": 9097666.0,
"step": 330
},
{
"epoch": 4.191082802547771,
"grad_norm": 0.36377403140068054,
"learning_rate": 1.2177842662977135e-05,
"loss": 0.161,
"mean_token_accuracy": 0.9578590989112854,
"num_tokens": 9123233.0,
"step": 331
},
{
"epoch": 4.203821656050955,
"grad_norm": 0.35682496428489685,
"learning_rate": 1.1783399079973578e-05,
"loss": 0.1432,
"mean_token_accuracy": 0.9622423648834229,
"num_tokens": 9148234.0,
"step": 332
},
{
"epoch": 4.2165605095541405,
"grad_norm": 0.34052160382270813,
"learning_rate": 1.1395048956986575e-05,
"loss": 0.1403,
"mean_token_accuracy": 0.9617478549480438,
"num_tokens": 9176122.0,
"step": 333
},
{
"epoch": 4.229299363057325,
"grad_norm": 0.3558754622936249,
"learning_rate": 1.1012819118853147e-05,
"loss": 0.1387,
"mean_token_accuracy": 0.9619651436805725,
"num_tokens": 9203206.0,
"step": 334
},
{
"epoch": 4.24203821656051,
"grad_norm": 0.32240667939186096,
"learning_rate": 1.0636735967658784e-05,
"loss": 0.1485,
"mean_token_accuracy": 0.9607774615287781,
"num_tokens": 9236391.0,
"step": 335
},
{
"epoch": 4.254777070063694,
"grad_norm": 0.3066593408584595,
"learning_rate": 1.0266825480913611e-05,
"loss": 0.1337,
"mean_token_accuracy": 0.9634624421596527,
"num_tokens": 9267928.0,
"step": 336
},
{
"epoch": 4.267515923566879,
"grad_norm": 0.28590208292007446,
"learning_rate": 9.903113209758096e-06,
"loss": 0.1396,
"mean_token_accuracy": 0.9620433747768402,
"num_tokens": 9302449.0,
"step": 337
},
{
"epoch": 4.280254777070064,
"grad_norm": 0.3486238420009613,
"learning_rate": 9.545624277198084e-06,
"loss": 0.1579,
"mean_token_accuracy": 0.9601101279258728,
"num_tokens": 9326476.0,
"step": 338
},
{
"epoch": 4.292993630573249,
"grad_norm": 0.3066675066947937,
"learning_rate": 9.194383376369508e-06,
"loss": 0.1424,
"mean_token_accuracy": 0.9623628258705139,
"num_tokens": 9353379.0,
"step": 339
},
{
"epoch": 4.305732484076433,
"grad_norm": 0.3062663972377777,
"learning_rate": 8.849414768832687e-06,
"loss": 0.1313,
"mean_token_accuracy": 0.9649600684642792,
"num_tokens": 9380878.0,
"step": 340
},
{
"epoch": 4.318471337579618,
"grad_norm": 0.3205564022064209,
"learning_rate": 8.510742282896544e-06,
"loss": 0.146,
"mean_token_accuracy": 0.961448460817337,
"num_tokens": 9404190.0,
"step": 341
},
{
"epoch": 4.3312101910828025,
"grad_norm": 0.2969525158405304,
"learning_rate": 8.178389311972612e-06,
"loss": 0.1142,
"mean_token_accuracy": 0.9698503613471985,
"num_tokens": 9434911.0,
"step": 342
},
{
"epoch": 4.343949044585988,
"grad_norm": 0.2806640565395355,
"learning_rate": 7.852378812959227e-06,
"loss": 0.1437,
"mean_token_accuracy": 0.9614557027816772,
"num_tokens": 9465444.0,
"step": 343
},
{
"epoch": 4.356687898089172,
"grad_norm": 0.31179293990135193,
"learning_rate": 7.532733304655848e-06,
"loss": 0.1435,
"mean_token_accuracy": 0.9619892239570618,
"num_tokens": 9493253.0,
"step": 344
},
{
"epoch": 4.369426751592357,
"grad_norm": 0.27424463629722595,
"learning_rate": 7.219474866207465e-06,
"loss": 0.1367,
"mean_token_accuracy": 0.963774561882019,
"num_tokens": 9524445.0,
"step": 345
},
{
"epoch": 4.382165605095541,
"grad_norm": 0.3105311691761017,
"learning_rate": 6.9126251355795864e-06,
"loss": 0.1372,
"mean_token_accuracy": 0.9609047770500183,
"num_tokens": 9548202.0,
"step": 346
},
{
"epoch": 4.3949044585987265,
"grad_norm": 0.2936761677265167,
"learning_rate": 6.612205308063646e-06,
"loss": 0.1329,
"mean_token_accuracy": 0.964224636554718,
"num_tokens": 9577700.0,
"step": 347
},
{
"epoch": 4.407643312101911,
"grad_norm": 0.2974602282047272,
"learning_rate": 6.318236134812916e-06,
"loss": 0.1285,
"mean_token_accuracy": 0.965183287858963,
"num_tokens": 9600239.0,
"step": 348
},
{
"epoch": 4.420382165605096,
"grad_norm": 0.32353323698043823,
"learning_rate": 6.030737921409169e-06,
"loss": 0.1621,
"mean_token_accuracy": 0.9579569697380066,
"num_tokens": 9629129.0,
"step": 349
},
{
"epoch": 4.43312101910828,
"grad_norm": 0.2739459276199341,
"learning_rate": 5.749730526460073e-06,
"loss": 0.1322,
"mean_token_accuracy": 0.965122252702713,
"num_tokens": 9659390.0,
"step": 350
},
{
"epoch": 4.445859872611465,
"grad_norm": 0.322262167930603,
"learning_rate": 5.475233360227516e-06,
"loss": 0.1382,
"mean_token_accuracy": 0.9616671204566956,
"num_tokens": 9683445.0,
"step": 351
},
{
"epoch": 4.45859872611465,
"grad_norm": 0.29362499713897705,
"learning_rate": 5.20726538328683e-06,
"loss": 0.149,
"mean_token_accuracy": 0.9616740643978119,
"num_tokens": 9714620.0,
"step": 352
},
{
"epoch": 4.471337579617835,
"grad_norm": 0.27419713139533997,
"learning_rate": 4.945845105217117e-06,
"loss": 0.1354,
"mean_token_accuracy": 0.963752031326294,
"num_tokens": 9744461.0,
"step": 353
},
{
"epoch": 4.484076433121019,
"grad_norm": 0.26769745349884033,
"learning_rate": 4.6909905833226966e-06,
"loss": 0.1194,
"mean_token_accuracy": 0.9685969352722168,
"num_tokens": 9778730.0,
"step": 354
},
{
"epoch": 4.496815286624204,
"grad_norm": 0.3312217593193054,
"learning_rate": 4.442719421385922e-06,
"loss": 0.1521,
"mean_token_accuracy": 0.9596065580844879,
"num_tokens": 9802092.0,
"step": 355
},
{
"epoch": 4.509554140127388,
"grad_norm": 0.31302008032798767,
"learning_rate": 4.20104876845111e-06,
"loss": 0.1549,
"mean_token_accuracy": 0.9606733918190002,
"num_tokens": 9828739.0,
"step": 356
},
{
"epoch": 4.522292993630574,
"grad_norm": 0.30936190485954285,
"learning_rate": 3.965995317640025e-06,
"loss": 0.1375,
"mean_token_accuracy": 0.9651446044445038,
"num_tokens": 9853204.0,
"step": 357
},
{
"epoch": 4.535031847133758,
"grad_norm": 0.3037811517715454,
"learning_rate": 3.7375753049987973e-06,
"loss": 0.1407,
"mean_token_accuracy": 0.9609975516796112,
"num_tokens": 9881685.0,
"step": 358
},
{
"epoch": 4.547770700636943,
"grad_norm": 0.3009647727012634,
"learning_rate": 3.515804508376508e-06,
"loss": 0.126,
"mean_token_accuracy": 0.9648471772670746,
"num_tokens": 9910121.0,
"step": 359
},
{
"epoch": 4.560509554140127,
"grad_norm": 0.30609554052352905,
"learning_rate": 3.3006982463352766e-06,
"loss": 0.1354,
"mean_token_accuracy": 0.9628312587738037,
"num_tokens": 9936532.0,
"step": 360
},
{
"epoch": 4.573248407643312,
"grad_norm": 0.3455513119697571,
"learning_rate": 3.092271377092215e-06,
"loss": 0.1545,
"mean_token_accuracy": 0.9557880163192749,
"num_tokens": 9960775.0,
"step": 361
},
{
"epoch": 4.585987261146497,
"grad_norm": 0.29719001054763794,
"learning_rate": 2.8905382974930172e-06,
"loss": 0.1696,
"mean_token_accuracy": 0.9552532136440277,
"num_tokens": 9991896.0,
"step": 362
},
{
"epoch": 4.598726114649682,
"grad_norm": 0.3069824278354645,
"learning_rate": 2.6955129420176196e-06,
"loss": 0.1465,
"mean_token_accuracy": 0.9637337028980255,
"num_tokens": 10021620.0,
"step": 363
},
{
"epoch": 4.611464968152866,
"grad_norm": 0.36662521958351135,
"learning_rate": 2.5072087818176382e-06,
"loss": 0.1516,
"mean_token_accuracy": 0.9591758251190186,
"num_tokens": 10041121.0,
"step": 364
},
{
"epoch": 4.624203821656051,
"grad_norm": 0.2813502252101898,
"learning_rate": 2.3256388237858807e-06,
"loss": 0.1292,
"mean_token_accuracy": 0.9643067419528961,
"num_tokens": 10069137.0,
"step": 365
},
{
"epoch": 4.6369426751592355,
"grad_norm": 0.3128413259983063,
"learning_rate": 2.150815609657875e-06,
"loss": 0.147,
"mean_token_accuracy": 0.9592329561710358,
"num_tokens": 10093871.0,
"step": 366
},
{
"epoch": 4.649681528662421,
"grad_norm": 0.31675484776496887,
"learning_rate": 1.9827512151456173e-06,
"loss": 0.1396,
"mean_token_accuracy": 0.9628662765026093,
"num_tokens": 10120069.0,
"step": 367
},
{
"epoch": 4.662420382165605,
"grad_norm": 0.30800846219062805,
"learning_rate": 1.8214572491034198e-06,
"loss": 0.133,
"mean_token_accuracy": 0.9657087326049805,
"num_tokens": 10147672.0,
"step": 368
},
{
"epoch": 4.67515923566879,
"grad_norm": 0.32580551505088806,
"learning_rate": 1.66694485272606e-06,
"loss": 0.1381,
"mean_token_accuracy": 0.9616196155548096,
"num_tokens": 10175371.0,
"step": 369
},
{
"epoch": 4.687898089171974,
"grad_norm": 0.2909785807132721,
"learning_rate": 1.5192246987791981e-06,
"loss": 0.1384,
"mean_token_accuracy": 0.9626062214374542,
"num_tokens": 10205366.0,
"step": 370
},
{
"epoch": 4.7006369426751595,
"grad_norm": 0.27137643098831177,
"learning_rate": 1.378306990862177e-06,
"loss": 0.1268,
"mean_token_accuracy": 0.9658531844615936,
"num_tokens": 10237324.0,
"step": 371
},
{
"epoch": 4.713375796178344,
"grad_norm": 0.32333460450172424,
"learning_rate": 1.2442014627032316e-06,
"loss": 0.1413,
"mean_token_accuracy": 0.9629768431186676,
"num_tokens": 10263701.0,
"step": 372
},
{
"epoch": 4.726114649681529,
"grad_norm": 0.334445983171463,
"learning_rate": 1.1169173774871478e-06,
"loss": 0.1552,
"mean_token_accuracy": 0.9588431119918823,
"num_tokens": 10286775.0,
"step": 373
},
{
"epoch": 4.738853503184713,
"grad_norm": 0.30994829535484314,
"learning_rate": 9.964635272153633e-07,
"loss": 0.1297,
"mean_token_accuracy": 0.9650968909263611,
"num_tokens": 10312644.0,
"step": 374
},
{
"epoch": 4.751592356687898,
"grad_norm": 0.3495871126651764,
"learning_rate": 8.828482320987319e-07,
"loss": 0.171,
"mean_token_accuracy": 0.9548489153385162,
"num_tokens": 10336997.0,
"step": 375
},
{
"epoch": 4.764331210191083,
"grad_norm": 0.30105888843536377,
"learning_rate": 7.760793399827937e-07,
"loss": 0.1375,
"mean_token_accuracy": 0.964127242565155,
"num_tokens": 10370155.0,
"step": 376
},
{
"epoch": 4.777070063694268,
"grad_norm": 0.27851420640945435,
"learning_rate": 6.761642258056978e-07,
"loss": 0.1331,
"mean_token_accuracy": 0.9646726548671722,
"num_tokens": 10398233.0,
"step": 377
},
{
"epoch": 4.789808917197452,
"grad_norm": 0.26956307888031006,
"learning_rate": 5.831097910887873e-07,
"loss": 0.1226,
"mean_token_accuracy": 0.9662437736988068,
"num_tokens": 10428060.0,
"step": 378
},
{
"epoch": 4.802547770700637,
"grad_norm": 0.28100118041038513,
"learning_rate": 4.969224634598591e-07,
"loss": 0.1506,
"mean_token_accuracy": 0.9616421461105347,
"num_tokens": 10460208.0,
"step": 379
},
{
"epoch": 4.8152866242038215,
"grad_norm": 0.35656845569610596,
"learning_rate": 4.176081962092182e-07,
"loss": 0.1547,
"mean_token_accuracy": 0.9571482837200165,
"num_tokens": 10482012.0,
"step": 380
},
{
"epoch": 4.828025477707007,
"grad_norm": 0.32229557633399963,
"learning_rate": 3.451724678784518e-07,
"loss": 0.1425,
"mean_token_accuracy": 0.9625223577022552,
"num_tokens": 10506770.0,
"step": 381
},
{
"epoch": 4.840764331210191,
"grad_norm": 0.30760592222213745,
"learning_rate": 2.7962028188198706e-07,
"loss": 0.1328,
"mean_token_accuracy": 0.9646367728710175,
"num_tokens": 10532512.0,
"step": 382
},
{
"epoch": 4.853503184713376,
"grad_norm": 0.308159202337265,
"learning_rate": 2.2095616616150115e-07,
"loss": 0.1267,
"mean_token_accuracy": 0.9646133780479431,
"num_tokens": 10559879.0,
"step": 383
},
{
"epoch": 4.86624203821656,
"grad_norm": 0.33381935954093933,
"learning_rate": 1.6918417287318245e-07,
"loss": 0.1539,
"mean_token_accuracy": 0.9574156403541565,
"num_tokens": 10582617.0,
"step": 384
},
{
"epoch": 4.8789808917197455,
"grad_norm": 0.2868056297302246,
"learning_rate": 1.2430787810776555e-07,
"loss": 0.1306,
"mean_token_accuracy": 0.9653586149215698,
"num_tokens": 10611812.0,
"step": 385
},
{
"epoch": 4.89171974522293,
"grad_norm": 0.3218814432621002,
"learning_rate": 8.633038164358454e-08,
"loss": 0.1353,
"mean_token_accuracy": 0.9647776186466217,
"num_tokens": 10637325.0,
"step": 386
},
{
"epoch": 4.904458598726115,
"grad_norm": 0.288083016872406,
"learning_rate": 5.5254306732444025e-08,
"loss": 0.1447,
"mean_token_accuracy": 0.9615972638130188,
"num_tokens": 10668037.0,
"step": 387
},
{
"epoch": 4.917197452229299,
"grad_norm": 0.3000580370426178,
"learning_rate": 3.1081799918375454e-08,
"loss": 0.1233,
"mean_token_accuracy": 0.9653524458408356,
"num_tokens": 10696621.0,
"step": 388
},
{
"epoch": 4.929936305732484,
"grad_norm": 0.29908129572868347,
"learning_rate": 1.3814530889433296e-08,
"loss": 0.1424,
"mean_token_accuracy": 0.9596949517726898,
"num_tokens": 10726256.0,
"step": 389
},
{
"epoch": 4.942675159235669,
"grad_norm": 0.3002137839794159,
"learning_rate": 3.453692362309635e-09,
"loss": 0.1325,
"mean_token_accuracy": 0.9654920101165771,
"num_tokens": 10752813.0,
"step": 390
},
{
"epoch": 4.942675159235669,
"step": 390,
"total_flos": 1.1057949593084887e+18,
"train_loss": 0.3398277919070843,
"train_runtime": 2376.0061,
"train_samples_per_second": 10.522,
"train_steps_per_second": 0.164
}
],
"logging_steps": 1.0,
"max_steps": 390,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1057949593084887e+18,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}