YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order6
0c20f2a verified
Raw
History Blame Contribute Delete
101 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 395,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 11.197978973388672,
"learning_rate": 0.0,
"loss": 2.2125,
"mean_token_accuracy": 0.6573320031166077,
"num_tokens": 5956.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 11.276443481445312,
"learning_rate": 1.6666666666666667e-05,
"loss": 2.1926,
"mean_token_accuracy": 0.6713488101959229,
"num_tokens": 11573.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 8.826214790344238,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.9803,
"mean_token_accuracy": 0.6706287860870361,
"num_tokens": 17442.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 3.760211229324341,
"learning_rate": 5e-05,
"loss": 1.5535,
"mean_token_accuracy": 0.7151785492897034,
"num_tokens": 23106.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 2.5126516819000244,
"learning_rate": 6.666666666666667e-05,
"loss": 1.3566,
"mean_token_accuracy": 0.7275997996330261,
"num_tokens": 29007.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 1.2685871124267578,
"learning_rate": 8.333333333333334e-05,
"loss": 1.1504,
"mean_token_accuracy": 0.7566807270050049,
"num_tokens": 34759.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 0.7646545171737671,
"learning_rate": 0.0001,
"loss": 1.0527,
"mean_token_accuracy": 0.7682668566703796,
"num_tokens": 40489.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 0.7801079750061035,
"learning_rate": 0.00011666666666666668,
"loss": 1.041,
"mean_token_accuracy": 0.7639105319976807,
"num_tokens": 46322.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.7384425401687622,
"learning_rate": 0.00013333333333333334,
"loss": 0.9788,
"mean_token_accuracy": 0.7751237154006958,
"num_tokens": 52247.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.6203671097755432,
"learning_rate": 0.00015000000000000001,
"loss": 0.8751,
"mean_token_accuracy": 0.790015697479248,
"num_tokens": 58040.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.6348746418952942,
"learning_rate": 0.0001666666666666667,
"loss": 0.7843,
"mean_token_accuracy": 0.8102871179580688,
"num_tokens": 63781.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.5648266077041626,
"learning_rate": 0.00018333333333333334,
"loss": 0.7496,
"mean_token_accuracy": 0.8179905414581299,
"num_tokens": 69548.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.5915428996086121,
"learning_rate": 0.0002,
"loss": 0.653,
"mean_token_accuracy": 0.8322916626930237,
"num_tokens": 75372.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.748708963394165,
"learning_rate": 0.0001999966358932628,
"loss": 0.6096,
"mean_token_accuracy": 0.845966637134552,
"num_tokens": 81188.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.8758018016815186,
"learning_rate": 0.00019998654379939533,
"loss": 0.5494,
"mean_token_accuracy": 0.855889081954956,
"num_tokens": 86949.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.8752768039703369,
"learning_rate": 0.00019996972439741538,
"loss": 0.5225,
"mean_token_accuracy": 0.8620573282241821,
"num_tokens": 92943.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.7944232225418091,
"learning_rate": 0.0001999461788189681,
"loss": 0.3732,
"mean_token_accuracy": 0.8982363343238831,
"num_tokens": 98677.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 1.1192169189453125,
"learning_rate": 0.00019991590864825028,
"loss": 0.3387,
"mean_token_accuracy": 0.910362720489502,
"num_tokens": 104531.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 1.0875548124313354,
"learning_rate": 0.00019987891592190366,
"loss": 0.3235,
"mean_token_accuracy": 0.9153859615325928,
"num_tokens": 110386.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.7268864512443542,
"learning_rate": 0.00019983520312887785,
"loss": 0.275,
"mean_token_accuracy": 0.9278350472450256,
"num_tokens": 116076.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.6245627403259277,
"learning_rate": 0.00019978477321026282,
"loss": 0.2344,
"mean_token_accuracy": 0.9346787333488464,
"num_tokens": 121789.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.5919852256774902,
"learning_rate": 0.0001997276295590912,
"loss": 0.2204,
"mean_token_accuracy": 0.937617838382721,
"num_tokens": 127688.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.7417113780975342,
"learning_rate": 0.00019966377602010984,
"loss": 0.2393,
"mean_token_accuracy": 0.9361550807952881,
"num_tokens": 133375.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.587989091873169,
"learning_rate": 0.0001995932168895211,
"loss": 0.1962,
"mean_token_accuracy": 0.9441181421279907,
"num_tokens": 139058.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.6960006952285767,
"learning_rate": 0.00019951595691469396,
"loss": 0.1871,
"mean_token_accuracy": 0.947879433631897,
"num_tokens": 144993.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.5633086562156677,
"learning_rate": 0.00019943200129384444,
"loss": 0.1649,
"mean_token_accuracy": 0.9524052143096924,
"num_tokens": 150940.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.45496875047683716,
"learning_rate": 0.0001993413556756859,
"loss": 0.168,
"mean_token_accuracy": 0.9526759386062622,
"num_tokens": 156815.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.5659371018409729,
"learning_rate": 0.0001992440261590491,
"loss": 0.1711,
"mean_token_accuracy": 0.95039302110672,
"num_tokens": 162604.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.44007769227027893,
"learning_rate": 0.00019914001929247167,
"loss": 0.1652,
"mean_token_accuracy": 0.9532406330108643,
"num_tokens": 168207.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.49571409821510315,
"learning_rate": 0.0001990293420737576,
"loss": 0.1549,
"mean_token_accuracy": 0.9526830315589905,
"num_tokens": 174104.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.5281901359558105,
"learning_rate": 0.00019891200194950643,
"loss": 0.1606,
"mean_token_accuracy": 0.9500631093978882,
"num_tokens": 179715.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.4619312286376953,
"learning_rate": 0.00019878800681461222,
"loss": 0.144,
"mean_token_accuracy": 0.9560834169387817,
"num_tokens": 185631.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.34627005457878113,
"learning_rate": 0.00019865736501173238,
"loss": 0.1337,
"mean_token_accuracy": 0.9609469771385193,
"num_tokens": 191482.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.31673797965049744,
"learning_rate": 0.00019852008533072625,
"loss": 0.1276,
"mean_token_accuracy": 0.958939254283905,
"num_tokens": 197391.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.2983987033367157,
"learning_rate": 0.00019837617700806383,
"loss": 0.1283,
"mean_token_accuracy": 0.9599243402481079,
"num_tokens": 203269.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.33408424258232117,
"learning_rate": 0.00019822564972620427,
"loss": 0.1352,
"mean_token_accuracy": 0.956938624382019,
"num_tokens": 209069.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.3550320863723755,
"learning_rate": 0.0001980685136129445,
"loss": 0.1303,
"mean_token_accuracy": 0.9570572972297668,
"num_tokens": 214978.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.32619988918304443,
"learning_rate": 0.00019790477924073755,
"loss": 0.1305,
"mean_token_accuracy": 0.9614076614379883,
"num_tokens": 220924.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.39009329676628113,
"learning_rate": 0.00019773445762598163,
"loss": 0.1417,
"mean_token_accuracy": 0.9594571590423584,
"num_tokens": 226883.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.26525068283081055,
"learning_rate": 0.00019755756022827846,
"loss": 0.1287,
"mean_token_accuracy": 0.9604967832565308,
"num_tokens": 232744.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.3513065576553345,
"learning_rate": 0.00019737409894966267,
"loss": 0.1335,
"mean_token_accuracy": 0.957602858543396,
"num_tokens": 238398.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.33718594908714294,
"learning_rate": 0.00019718408613380074,
"loss": 0.1291,
"mean_token_accuracy": 0.9594740867614746,
"num_tokens": 244014.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.35459810495376587,
"learning_rate": 0.00019698753456516048,
"loss": 0.1325,
"mean_token_accuracy": 0.9590643048286438,
"num_tokens": 249892.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.25926443934440613,
"learning_rate": 0.00019678445746815107,
"loss": 0.1151,
"mean_token_accuracy": 0.9624645709991455,
"num_tokens": 255604.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.4317176640033722,
"learning_rate": 0.00019657486850623306,
"loss": 0.1064,
"mean_token_accuracy": 0.9645217657089233,
"num_tokens": 261418.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.30352234840393066,
"learning_rate": 0.00019635878178099928,
"loss": 0.1105,
"mean_token_accuracy": 0.9666838645935059,
"num_tokens": 267305.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.2374143749475479,
"learning_rate": 0.0001961362118312259,
"loss": 0.1115,
"mean_token_accuracy": 0.967215895652771,
"num_tokens": 273256.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.3764690160751343,
"learning_rate": 0.0001959071736318942,
"loss": 0.1168,
"mean_token_accuracy": 0.9633293747901917,
"num_tokens": 279183.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.2127414494752884,
"learning_rate": 0.00019567168259318325,
"loss": 0.1106,
"mean_token_accuracy": 0.9629500508308411,
"num_tokens": 284996.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.3254893720149994,
"learning_rate": 0.00019542975455943281,
"loss": 0.1082,
"mean_token_accuracy": 0.9625527262687683,
"num_tokens": 290748.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.3024154603481293,
"learning_rate": 0.00019518140580807744,
"loss": 0.1159,
"mean_token_accuracy": 0.9615980982780457,
"num_tokens": 296619.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.6238520741462708,
"learning_rate": 0.00019492665304855132,
"loss": 0.1168,
"mean_token_accuracy": 0.962277352809906,
"num_tokens": 302409.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.24419891834259033,
"learning_rate": 0.0001946655134211639,
"loss": 0.1015,
"mean_token_accuracy": 0.9673066735267639,
"num_tokens": 308254.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.2389822155237198,
"learning_rate": 0.0001943980044959468,
"loss": 0.113,
"mean_token_accuracy": 0.9640350937843323,
"num_tokens": 314018.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.2802983224391937,
"learning_rate": 0.0001941241442714716,
"loss": 0.1072,
"mean_token_accuracy": 0.9653002023696899,
"num_tokens": 319961.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.18901215493679047,
"learning_rate": 0.0001938439511736388,
"loss": 0.1033,
"mean_token_accuracy": 0.9646428823471069,
"num_tokens": 325625.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.32898858189582825,
"learning_rate": 0.0001935574440544381,
"loss": 0.1033,
"mean_token_accuracy": 0.9662618041038513,
"num_tokens": 331617.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.16215252876281738,
"learning_rate": 0.0001932646421906802,
"loss": 0.0929,
"mean_token_accuracy": 0.9681463837623596,
"num_tokens": 337583.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.21538810431957245,
"learning_rate": 0.00019296556528269952,
"loss": 0.1094,
"mean_token_accuracy": 0.9648312330245972,
"num_tokens": 343277.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.20596884191036224,
"learning_rate": 0.00019266023345302887,
"loss": 0.1007,
"mean_token_accuracy": 0.9644421339035034,
"num_tokens": 349050.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.1876419484615326,
"learning_rate": 0.00019234866724504555,
"loss": 0.0955,
"mean_token_accuracy": 0.9664292931556702,
"num_tokens": 355012.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.18318991363048553,
"learning_rate": 0.00019203088762158915,
"loss": 0.0957,
"mean_token_accuracy": 0.9672302603721619,
"num_tokens": 360813.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.21235841512680054,
"learning_rate": 0.00019170691596355114,
"loss": 0.0997,
"mean_token_accuracy": 0.9650312066078186,
"num_tokens": 366482.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.17755351960659027,
"learning_rate": 0.00019137677406843619,
"loss": 0.091,
"mean_token_accuracy": 0.9684760570526123,
"num_tokens": 372478.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.18638521432876587,
"learning_rate": 0.00019104048414889587,
"loss": 0.0964,
"mean_token_accuracy": 0.9686295390129089,
"num_tokens": 378248.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.16087719798088074,
"learning_rate": 0.00019069806883123387,
"loss": 0.0893,
"mean_token_accuracy": 0.9704923629760742,
"num_tokens": 384141.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.16863004863262177,
"learning_rate": 0.00019034955115388363,
"loss": 0.0935,
"mean_token_accuracy": 0.9690488576889038,
"num_tokens": 389956.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.2595883905887604,
"learning_rate": 0.00018999495456585854,
"loss": 0.1035,
"mean_token_accuracy": 0.966398298740387,
"num_tokens": 395734.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.15674294531345367,
"learning_rate": 0.00018963430292517398,
"loss": 0.1001,
"mean_token_accuracy": 0.9677476286888123,
"num_tokens": 401472.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.13319358229637146,
"learning_rate": 0.00018926762049724228,
"loss": 0.0936,
"mean_token_accuracy": 0.9681246876716614,
"num_tokens": 407183.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.16479410231113434,
"learning_rate": 0.00018889493195323997,
"loss": 0.0891,
"mean_token_accuracy": 0.9669564962387085,
"num_tokens": 412997.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.19525185227394104,
"learning_rate": 0.00018851626236844786,
"loss": 0.0916,
"mean_token_accuracy": 0.9695397615432739,
"num_tokens": 419036.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.14232105016708374,
"learning_rate": 0.00018813163722056396,
"loss": 0.0949,
"mean_token_accuracy": 0.9683631658554077,
"num_tokens": 424916.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.14310362935066223,
"learning_rate": 0.0001877410823879893,
"loss": 0.0878,
"mean_token_accuracy": 0.9713746905326843,
"num_tokens": 430814.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.1776161938905716,
"learning_rate": 0.0001873446241480868,
"loss": 0.0933,
"mean_token_accuracy": 0.9697895646095276,
"num_tokens": 436770.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.16261084377765656,
"learning_rate": 0.00018694228917541313,
"loss": 0.0933,
"mean_token_accuracy": 0.9694162607192993,
"num_tokens": 442556.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.17474666237831116,
"learning_rate": 0.00018653410453992413,
"loss": 0.091,
"mean_token_accuracy": 0.9704390168190002,
"num_tokens": 448337.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.16762994229793549,
"learning_rate": 0.0001861200977051535,
"loss": 0.0885,
"mean_token_accuracy": 0.9703090190887451,
"num_tokens": 454194.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.15185800194740295,
"learning_rate": 0.0001857002965263648,
"loss": 0.0868,
"mean_token_accuracy": 0.9698991179466248,
"num_tokens": 460105.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.1631181240081787,
"learning_rate": 0.00018527472924867756,
"loss": 0.0881,
"mean_token_accuracy": 0.969143271446228,
"num_tokens": 465970.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.138313889503479,
"learning_rate": 0.00018484342450516671,
"loss": 0.087,
"mean_token_accuracy": 0.9698519110679626,
"num_tokens": 471706.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.2044484168291092,
"learning_rate": 0.0001844064113149361,
"loss": 0.0882,
"mean_token_accuracy": 0.9679310321807861,
"num_tokens": 477570.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.12826398015022278,
"learning_rate": 0.0001839637190811661,
"loss": 0.0886,
"mean_token_accuracy": 0.9679872393608093,
"num_tokens": 483288.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.14064167439937592,
"learning_rate": 0.00018351537758913518,
"loss": 0.0897,
"mean_token_accuracy": 0.9681583642959595,
"num_tokens": 489162.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.12677496671676636,
"learning_rate": 0.00018306141700421606,
"loss": 0.0887,
"mean_token_accuracy": 0.9705982208251953,
"num_tokens": 495110.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.15661370754241943,
"learning_rate": 0.000182601867869846,
"loss": 0.0854,
"mean_token_accuracy": 0.9703992009162903,
"num_tokens": 501086.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.17122779786586761,
"learning_rate": 0.00018213676110547176,
"loss": 0.0841,
"mean_token_accuracy": 0.9700527191162109,
"num_tokens": 507027.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.14393500983715057,
"learning_rate": 0.0001816661280044693,
"loss": 0.0879,
"mean_token_accuracy": 0.9708383679389954,
"num_tokens": 512852.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.13653580844402313,
"learning_rate": 0.00018119000023203837,
"loss": 0.0836,
"mean_token_accuracy": 0.9715254306793213,
"num_tokens": 518816.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.119191013276577,
"learning_rate": 0.0001807084098230719,
"loss": 0.0888,
"mean_token_accuracy": 0.969799816608429,
"num_tokens": 524774.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.13606540858745575,
"learning_rate": 0.0001802213891800007,
"loss": 0.0914,
"mean_token_accuracy": 0.9713476896286011,
"num_tokens": 530492.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.1045287474989891,
"learning_rate": 0.00017972897107061328,
"loss": 0.0892,
"mean_token_accuracy": 0.9692742228507996,
"num_tokens": 536219.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.11407322436571121,
"learning_rate": 0.00017923118862585123,
"loss": 0.0868,
"mean_token_accuracy": 0.9704458117485046,
"num_tokens": 542272.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.09578792750835419,
"learning_rate": 0.00017872807533758007,
"loss": 0.0865,
"mean_token_accuracy": 0.9701651334762573,
"num_tokens": 547967.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.10400957614183426,
"learning_rate": 0.00017821966505633587,
"loss": 0.0862,
"mean_token_accuracy": 0.9684265851974487,
"num_tokens": 553732.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.1001543328166008,
"learning_rate": 0.00017770599198904763,
"loss": 0.0879,
"mean_token_accuracy": 0.9701571464538574,
"num_tokens": 559459.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.09234999120235443,
"learning_rate": 0.00017718709069673594,
"loss": 0.0846,
"mean_token_accuracy": 0.968562126159668,
"num_tokens": 565344.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.13882777094841003,
"learning_rate": 0.00017666299609218745,
"loss": 0.0891,
"mean_token_accuracy": 0.9695484638214111,
"num_tokens": 571122.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.08778692781925201,
"learning_rate": 0.00017613374343760594,
"loss": 0.0878,
"mean_token_accuracy": 0.9698153138160706,
"num_tokens": 576818.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.10923833400011063,
"learning_rate": 0.00017559936834223982,
"loss": 0.0879,
"mean_token_accuracy": 0.9689220190048218,
"num_tokens": 582513.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.10132668167352676,
"learning_rate": 0.0001750599067599863,
"loss": 0.0863,
"mean_token_accuracy": 0.9684970378875732,
"num_tokens": 588259.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.08531607687473297,
"learning_rate": 0.00017451539498697225,
"loss": 0.0836,
"mean_token_accuracy": 0.967986524105072,
"num_tokens": 594258.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.09016811102628708,
"learning_rate": 0.0001739658696591121,
"loss": 0.0876,
"mean_token_accuracy": 0.966867983341217,
"num_tokens": 600117.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.08775028586387634,
"learning_rate": 0.00017341136774964307,
"loss": 0.0867,
"mean_token_accuracy": 0.9703442454338074,
"num_tokens": 605846.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.11099086701869965,
"learning_rate": 0.0001728519265666373,
"loss": 0.0895,
"mean_token_accuracy": 0.970858633518219,
"num_tokens": 611675.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.10359926521778107,
"learning_rate": 0.00017228758375049185,
"loss": 0.09,
"mean_token_accuracy": 0.9666965007781982,
"num_tokens": 617324.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.0925629511475563,
"learning_rate": 0.00017171837727139613,
"loss": 0.0826,
"mean_token_accuracy": 0.9694368243217468,
"num_tokens": 623212.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.09996061027050018,
"learning_rate": 0.0001711443454267772,
"loss": 0.0867,
"mean_token_accuracy": 0.9683344960212708,
"num_tokens": 628992.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.09014004468917847,
"learning_rate": 0.00017056552683872292,
"loss": 0.0831,
"mean_token_accuracy": 0.9679315090179443,
"num_tokens": 635012.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.09641507267951965,
"learning_rate": 0.00016998196045138353,
"loss": 0.0833,
"mean_token_accuracy": 0.9693028330802917,
"num_tokens": 640842.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.10992120206356049,
"learning_rate": 0.00016939368552835137,
"loss": 0.0821,
"mean_token_accuracy": 0.9706032276153564,
"num_tokens": 646791.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.08793023973703384,
"learning_rate": 0.00016880074165001905,
"loss": 0.0842,
"mean_token_accuracy": 0.9703037738800049,
"num_tokens": 652748.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.08371416479349136,
"learning_rate": 0.0001682031687109165,
"loss": 0.0839,
"mean_token_accuracy": 0.9678037166595459,
"num_tokens": 658558.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.0789172500371933,
"learning_rate": 0.00016760100691702674,
"loss": 0.0809,
"mean_token_accuracy": 0.970935046672821,
"num_tokens": 664643.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.08477390557527542,
"learning_rate": 0.0001669942967830807,
"loss": 0.0826,
"mean_token_accuracy": 0.9699388742446899,
"num_tokens": 670595.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.08667643368244171,
"learning_rate": 0.00016638307912983136,
"loss": 0.0838,
"mean_token_accuracy": 0.9711210131645203,
"num_tokens": 676511.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.08859161287546158,
"learning_rate": 0.00016576739508130726,
"loss": 0.0889,
"mean_token_accuracy": 0.9705829620361328,
"num_tokens": 682150.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.08228243142366409,
"learning_rate": 0.0001651472860620455,
"loss": 0.0835,
"mean_token_accuracy": 0.9720097184181213,
"num_tokens": 687966.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.07806692272424698,
"learning_rate": 0.00016452279379430463,
"loss": 0.0834,
"mean_token_accuracy": 0.9707849621772766,
"num_tokens": 693712.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.09221310168504715,
"learning_rate": 0.00016389396029525762,
"loss": 0.0885,
"mean_token_accuracy": 0.9690666794776917,
"num_tokens": 699401.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.08803010731935501,
"learning_rate": 0.0001632608278741646,
"loss": 0.0839,
"mean_token_accuracy": 0.9693771600723267,
"num_tokens": 705245.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.08484382927417755,
"learning_rate": 0.00016262343912952656,
"loss": 0.0848,
"mean_token_accuracy": 0.9663436412811279,
"num_tokens": 710984.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.06981898099184036,
"learning_rate": 0.0001619818369462188,
"loss": 0.0834,
"mean_token_accuracy": 0.9713114500045776,
"num_tokens": 716660.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.08020604401826859,
"learning_rate": 0.0001613360644926059,
"loss": 0.0847,
"mean_token_accuracy": 0.968184232711792,
"num_tokens": 722413.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.09930495172739029,
"learning_rate": 0.00016068616521763707,
"loss": 0.0836,
"mean_token_accuracy": 0.9696969985961914,
"num_tokens": 728285.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.08344559371471405,
"learning_rate": 0.00016003218284792298,
"loss": 0.086,
"mean_token_accuracy": 0.967332124710083,
"num_tokens": 733859.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.07405643910169601,
"learning_rate": 0.00015937416138479344,
"loss": 0.0838,
"mean_token_accuracy": 0.9711013436317444,
"num_tokens": 739598.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.0813552737236023,
"learning_rate": 0.0001587121451013373,
"loss": 0.0844,
"mean_token_accuracy": 0.9705159664154053,
"num_tokens": 745360.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.07733441889286041,
"learning_rate": 0.0001580461785394233,
"loss": 0.0826,
"mean_token_accuracy": 0.9701492786407471,
"num_tokens": 751253.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.0735301524400711,
"learning_rate": 0.00015737630650670335,
"loss": 0.0844,
"mean_token_accuracy": 0.9684435725212097,
"num_tokens": 756926.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.08164644241333008,
"learning_rate": 0.00015670257407359792,
"loss": 0.0868,
"mean_token_accuracy": 0.9707592129707336,
"num_tokens": 762667.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.07316756993532181,
"learning_rate": 0.00015602502657026328,
"loss": 0.0863,
"mean_token_accuracy": 0.9686090350151062,
"num_tokens": 768274.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.06914970278739929,
"learning_rate": 0.00015534370958354186,
"loss": 0.0806,
"mean_token_accuracy": 0.9706634879112244,
"num_tokens": 774201.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.07306254655122757,
"learning_rate": 0.00015465866895389495,
"loss": 0.0803,
"mean_token_accuracy": 0.9705682396888733,
"num_tokens": 780143.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.07241412997245789,
"learning_rate": 0.00015396995077231854,
"loss": 0.0822,
"mean_token_accuracy": 0.9694019556045532,
"num_tokens": 785959.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.08982262760400772,
"learning_rate": 0.00015327760137724212,
"loss": 0.0816,
"mean_token_accuracy": 0.9704459309577942,
"num_tokens": 791809.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.0707545205950737,
"learning_rate": 0.00015258166735141092,
"loss": 0.0805,
"mean_token_accuracy": 0.9702767133712769,
"num_tokens": 797727.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.06939110159873962,
"learning_rate": 0.0001518821955187519,
"loss": 0.0821,
"mean_token_accuracy": 0.9708311557769775,
"num_tokens": 803482.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.06984034180641174,
"learning_rate": 0.00015117923294122312,
"loss": 0.0814,
"mean_token_accuracy": 0.9717060327529907,
"num_tokens": 809519.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.071834996342659,
"learning_rate": 0.0001504728269156475,
"loss": 0.0837,
"mean_token_accuracy": 0.9692060947418213,
"num_tokens": 815201.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.06867428123950958,
"learning_rate": 0.00014976302497053036,
"loss": 0.0818,
"mean_token_accuracy": 0.969128429889679,
"num_tokens": 821128.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.07886156439781189,
"learning_rate": 0.00014904987486286184,
"loss": 0.0846,
"mean_token_accuracy": 0.9705423712730408,
"num_tokens": 826963.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.07062580436468124,
"learning_rate": 0.00014833342457490361,
"loss": 0.0802,
"mean_token_accuracy": 0.9710095524787903,
"num_tokens": 832891.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.0702303871512413,
"learning_rate": 0.00014761372231096047,
"loss": 0.0807,
"mean_token_accuracy": 0.9701517820358276,
"num_tokens": 838818.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.07356806099414825,
"learning_rate": 0.00014689081649413708,
"loss": 0.0815,
"mean_token_accuracy": 0.9718139171600342,
"num_tokens": 844665.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.07695885747671127,
"learning_rate": 0.00014616475576308005,
"loss": 0.0824,
"mean_token_accuracy": 0.9687390327453613,
"num_tokens": 850423.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.07924854755401611,
"learning_rate": 0.00014543558896870531,
"loss": 0.084,
"mean_token_accuracy": 0.9691846966743469,
"num_tokens": 856166.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.06506441533565521,
"learning_rate": 0.0001447033651709114,
"loss": 0.0812,
"mean_token_accuracy": 0.9717061519622803,
"num_tokens": 862097.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.08221415430307388,
"learning_rate": 0.0001439681336352785,
"loss": 0.0847,
"mean_token_accuracy": 0.96860671043396,
"num_tokens": 867831.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.06203217804431915,
"learning_rate": 0.00014322994382975386,
"loss": 0.081,
"mean_token_accuracy": 0.9704849123954773,
"num_tokens": 873587.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.0693584606051445,
"learning_rate": 0.0001424888454213235,
"loss": 0.0835,
"mean_token_accuracy": 0.9718832969665527,
"num_tokens": 879306.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.07542399317026138,
"learning_rate": 0.0001417448882726703,
"loss": 0.0869,
"mean_token_accuracy": 0.9694873094558716,
"num_tokens": 885007.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.06910575181245804,
"learning_rate": 0.00014099812243881948,
"loss": 0.0798,
"mean_token_accuracy": 0.9715608358383179,
"num_tokens": 891119.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.07143940776586533,
"learning_rate": 0.00014024859816377046,
"loss": 0.0832,
"mean_token_accuracy": 0.9683129787445068,
"num_tokens": 896832.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.06761741638183594,
"learning_rate": 0.00013949636587711644,
"loss": 0.084,
"mean_token_accuracy": 0.9718760848045349,
"num_tokens": 902514.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.07367364317178726,
"learning_rate": 0.0001387414761906516,
"loss": 0.0789,
"mean_token_accuracy": 0.9691286087036133,
"num_tokens": 908603.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.06280063837766647,
"learning_rate": 0.00013798397989496549,
"loss": 0.0818,
"mean_token_accuracy": 0.9685900807380676,
"num_tokens": 914334.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.06626482307910919,
"learning_rate": 0.00013722392795602594,
"loss": 0.0812,
"mean_token_accuracy": 0.970950722694397,
"num_tokens": 920078.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.0648651048541069,
"learning_rate": 0.0001364613715117499,
"loss": 0.0817,
"mean_token_accuracy": 0.9702180624008179,
"num_tokens": 925783.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.06400693207979202,
"learning_rate": 0.00013569636186856288,
"loss": 0.0806,
"mean_token_accuracy": 0.9703844785690308,
"num_tokens": 931621.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.06594045460224152,
"learning_rate": 0.0001349289504979467,
"loss": 0.0816,
"mean_token_accuracy": 0.9699637293815613,
"num_tokens": 937478.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.07075533270835876,
"learning_rate": 0.0001341591890329766,
"loss": 0.0826,
"mean_token_accuracy": 0.9692522883415222,
"num_tokens": 943266.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.06899682432413101,
"learning_rate": 0.00013338712926484725,
"loss": 0.0795,
"mean_token_accuracy": 0.9705134630203247,
"num_tokens": 949231.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.07616809010505676,
"learning_rate": 0.00013261282313938795,
"loss": 0.0806,
"mean_token_accuracy": 0.9711308479309082,
"num_tokens": 955149.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.07235827296972275,
"learning_rate": 0.00013183632275356777,
"loss": 0.0792,
"mean_token_accuracy": 0.9715502262115479,
"num_tokens": 961083.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.07813423871994019,
"learning_rate": 0.00013105768035199034,
"loss": 0.0839,
"mean_token_accuracy": 0.969510018825531,
"num_tokens": 966821.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.07437107712030411,
"learning_rate": 0.0001302769483233786,
"loss": 0.0826,
"mean_token_accuracy": 0.9698913097381592,
"num_tokens": 972498.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.07271190732717514,
"learning_rate": 0.00012949417919705007,
"loss": 0.0846,
"mean_token_accuracy": 0.9689054489135742,
"num_tokens": 978190.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.07017494738101959,
"learning_rate": 0.00012870942563938264,
"loss": 0.0812,
"mean_token_accuracy": 0.9709565043449402,
"num_tokens": 984004.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.07087378203868866,
"learning_rate": 0.0001279227404502709,
"loss": 0.0804,
"mean_token_accuracy": 0.9712267518043518,
"num_tokens": 989872.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.07257304340600967,
"learning_rate": 0.00012713417655957376,
"loss": 0.081,
"mean_token_accuracy": 0.9708016514778137,
"num_tokens": 995587.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.06339263916015625,
"learning_rate": 0.00012634378702355313,
"loss": 0.0813,
"mean_token_accuracy": 0.9715899229049683,
"num_tokens": 1001318.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.06601085513830185,
"learning_rate": 0.00012555162502130433,
"loss": 0.0802,
"mean_token_accuracy": 0.970442533493042,
"num_tokens": 1007235.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.06804762035608292,
"learning_rate": 0.00012475774385117786,
"loss": 0.0809,
"mean_token_accuracy": 0.9702970385551453,
"num_tokens": 1013056.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.07080934196710587,
"learning_rate": 0.00012396219692719363,
"loss": 0.0829,
"mean_token_accuracy": 0.9680212140083313,
"num_tokens": 1018780.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.06396940350532532,
"learning_rate": 0.000123165037775447,
"loss": 0.0817,
"mean_token_accuracy": 0.9708994626998901,
"num_tokens": 1024514.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.0716780498623848,
"learning_rate": 0.00012236632003050736,
"loss": 0.0829,
"mean_token_accuracy": 0.9703912734985352,
"num_tokens": 1030252.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.07340048253536224,
"learning_rate": 0.00012156609743180969,
"loss": 0.0832,
"mean_token_accuracy": 0.9693446159362793,
"num_tokens": 1035992.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.06560252606868744,
"learning_rate": 0.0001207644238200387,
"loss": 0.0811,
"mean_token_accuracy": 0.9689528346061707,
"num_tokens": 1041757.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.0696624368429184,
"learning_rate": 0.00011996135313350636,
"loss": 0.0815,
"mean_token_accuracy": 0.969944417476654,
"num_tokens": 1047577.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.06634440273046494,
"learning_rate": 0.0001191569394045228,
"loss": 0.079,
"mean_token_accuracy": 0.9712415933609009,
"num_tokens": 1053448.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.06298618018627167,
"learning_rate": 0.00011835123675576092,
"loss": 0.0804,
"mean_token_accuracy": 0.9704663157463074,
"num_tokens": 1059302.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.06103714182972908,
"learning_rate": 0.0001175442993966149,
"loss": 0.077,
"mean_token_accuracy": 0.9714381694793701,
"num_tokens": 1065318.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.08317714929580688,
"learning_rate": 0.00011673618161955288,
"loss": 0.0828,
"mean_token_accuracy": 0.9694072604179382,
"num_tokens": 1071135.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.06834248453378677,
"learning_rate": 0.00011592693779646405,
"loss": 0.0812,
"mean_token_accuracy": 0.9709871411323547,
"num_tokens": 1077024.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.06887873262166977,
"learning_rate": 0.00011511662237500032,
"loss": 0.0816,
"mean_token_accuracy": 0.9696813225746155,
"num_tokens": 1082893.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.07658988982439041,
"learning_rate": 0.00011430528987491305,
"loss": 0.0784,
"mean_token_accuracy": 0.9689241647720337,
"num_tokens": 1088878.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.07818251848220825,
"learning_rate": 0.00011349299488438485,
"loss": 0.0832,
"mean_token_accuracy": 0.9675313234329224,
"num_tokens": 1094763.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.06414368003606796,
"learning_rate": 0.00011267979205635675,
"loss": 0.0815,
"mean_token_accuracy": 0.9699221253395081,
"num_tokens": 1100479.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.08263374865055084,
"learning_rate": 0.00011186573610485098,
"loss": 0.0836,
"mean_token_accuracy": 0.9690180420875549,
"num_tokens": 1106256.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.06332731992006302,
"learning_rate": 0.00011105088180128976,
"loss": 0.079,
"mean_token_accuracy": 0.9711905717849731,
"num_tokens": 1112082.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.06817943602800369,
"learning_rate": 0.00011023528397081011,
"loss": 0.0794,
"mean_token_accuracy": 0.9718405604362488,
"num_tokens": 1118041.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.07826139777898788,
"learning_rate": 0.0001094189974885752,
"loss": 0.0819,
"mean_token_accuracy": 0.9710296392440796,
"num_tokens": 1123835.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.09749728441238403,
"learning_rate": 0.00010860207727608214,
"loss": 0.0824,
"mean_token_accuracy": 0.9701254963874817,
"num_tokens": 1129556.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.08234766125679016,
"learning_rate": 0.00010778457829746666,
"loss": 0.0825,
"mean_token_accuracy": 0.9703004956245422,
"num_tokens": 1135344.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.0916622132062912,
"learning_rate": 0.00010696655555580524,
"loss": 0.0794,
"mean_token_accuracy": 0.9722175002098083,
"num_tokens": 1141275.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.07968051731586456,
"learning_rate": 0.00010614806408941422,
"loss": 0.0824,
"mean_token_accuracy": 0.9686840176582336,
"num_tokens": 1147023.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.06887777894735336,
"learning_rate": 0.00010532915896814672,
"loss": 0.0812,
"mean_token_accuracy": 0.9703223705291748,
"num_tokens": 1152950.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.0808170810341835,
"learning_rate": 0.00010450989528968746,
"loss": 0.084,
"mean_token_accuracy": 0.9684757590293884,
"num_tokens": 1158597.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.06715542078018188,
"learning_rate": 0.00010369032817584561,
"loss": 0.0807,
"mean_token_accuracy": 0.970038115978241,
"num_tokens": 1164435.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.08024689555168152,
"learning_rate": 0.00010287051276884618,
"loss": 0.0832,
"mean_token_accuracy": 0.9692226648330688,
"num_tokens": 1170185.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.06640373915433884,
"learning_rate": 0.00010205050422761988,
"loss": 0.0829,
"mean_token_accuracy": 0.9687222242355347,
"num_tokens": 1175876.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.07751741260290146,
"learning_rate": 0.00010123035772409184,
"loss": 0.0822,
"mean_token_accuracy": 0.96784508228302,
"num_tokens": 1181569.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.06302241235971451,
"learning_rate": 0.0001004101284394696,
"loss": 0.0796,
"mean_token_accuracy": 0.9697484970092773,
"num_tokens": 1187517.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.06423830986022949,
"learning_rate": 9.958987156053045e-05,
"loss": 0.08,
"mean_token_accuracy": 0.9715918898582458,
"num_tokens": 1193354.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.07380242645740509,
"learning_rate": 9.87696422759082e-05,
"loss": 0.0787,
"mean_token_accuracy": 0.9722175002098083,
"num_tokens": 1199321.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.06480070948600769,
"learning_rate": 9.794949577238013e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9726945161819458,
"num_tokens": 1205208.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.09705960750579834,
"learning_rate": 9.712948723115383e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9717357158660889,
"num_tokens": 1211039.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.07256985455751419,
"learning_rate": 9.630967182415442e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9715599417686462,
"num_tokens": 1216975.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.07309860736131668,
"learning_rate": 9.549010471031256e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9698572158813477,
"num_tokens": 1222712.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.08559804409742355,
"learning_rate": 9.467084103185329e-05,
"loss": 0.0796,
"mean_token_accuracy": 0.9707877039909363,
"num_tokens": 1228527.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.0890304371714592,
"learning_rate": 9.385193591058579e-05,
"loss": 0.0789,
"mean_token_accuracy": 0.9719783663749695,
"num_tokens": 1234515.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.07330089062452316,
"learning_rate": 9.303344444419476e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.972399890422821,
"num_tokens": 1240521.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.06156392768025398,
"learning_rate": 9.221542170253339e-05,
"loss": 0.0819,
"mean_token_accuracy": 0.9704664349555969,
"num_tokens": 1246138.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.07013130933046341,
"learning_rate": 9.139792272391791e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.9703513383865356,
"num_tokens": 1252037.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.07664390653371811,
"learning_rate": 9.058100251142483e-05,
"loss": 0.0817,
"mean_token_accuracy": 0.970625102519989,
"num_tokens": 1257684.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.11009793728590012,
"learning_rate": 8.976471602918991e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.9696917533874512,
"num_tokens": 1263588.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.06719589978456497,
"learning_rate": 8.894911819871026e-05,
"loss": 0.0795,
"mean_token_accuracy": 0.9698387980461121,
"num_tokens": 1269421.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.12703068554401398,
"learning_rate": 8.813426389514903e-05,
"loss": 0.0818,
"mean_token_accuracy": 0.9672332406044006,
"num_tokens": 1275192.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.16315780580043793,
"learning_rate": 8.732020794364326e-05,
"loss": 0.0811,
"mean_token_accuracy": 0.9697076082229614,
"num_tokens": 1280967.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.20341816544532776,
"learning_rate": 8.650700511561514e-05,
"loss": 0.0793,
"mean_token_accuracy": 0.9723266363143921,
"num_tokens": 1286885.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.11723124235868454,
"learning_rate": 8.5694710125087e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.9704720973968506,
"num_tokens": 1292774.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.1419627070426941,
"learning_rate": 8.488337762499972e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9703508615493774,
"num_tokens": 1298538.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.11497867107391357,
"learning_rate": 8.407306220353596e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9683766961097717,
"num_tokens": 1304294.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.1476864069700241,
"learning_rate": 8.326381838044713e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9735862016677856,
"num_tokens": 1310264.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.16264992952346802,
"learning_rate": 8.245570060338512e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9690141081809998,
"num_tokens": 1316008.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.08981442451477051,
"learning_rate": 8.164876324423909e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9729821681976318,
"num_tokens": 1321957.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.12265730649232864,
"learning_rate": 8.084306059547722e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.970678985118866,
"num_tokens": 1327853.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.08478284627199173,
"learning_rate": 8.003864686649366e-05,
"loss": 0.0817,
"mean_token_accuracy": 0.9698615670204163,
"num_tokens": 1333624.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.08693704754114151,
"learning_rate": 7.923557617996131e-05,
"loss": 0.082,
"mean_token_accuracy": 0.9714744091033936,
"num_tokens": 1339297.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.0729907900094986,
"learning_rate": 7.843390256819034e-05,
"loss": 0.0762,
"mean_token_accuracy": 0.9713568091392517,
"num_tokens": 1345331.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.07349084317684174,
"learning_rate": 7.763367996949267e-05,
"loss": 0.0807,
"mean_token_accuracy": 0.9700000286102295,
"num_tokens": 1351095.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.07819319516420364,
"learning_rate": 7.683496222455304e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9721308350563049,
"num_tokens": 1356936.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.07689930498600006,
"learning_rate": 7.603780307280639e-05,
"loss": 0.0825,
"mean_token_accuracy": 0.9697132706642151,
"num_tokens": 1362580.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.09075320512056351,
"learning_rate": 7.524225614882216e-05,
"loss": 0.0798,
"mean_token_accuracy": 0.9697710871696472,
"num_tokens": 1368367.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.09070567041635513,
"learning_rate": 7.44483749786957e-05,
"loss": 0.0786,
"mean_token_accuracy": 0.971564769744873,
"num_tokens": 1374304.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.06513367593288422,
"learning_rate": 7.365621297644686e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9717634320259094,
"num_tokens": 1379999.0,
"step": 237
},
{
"epoch": 3.0126582278481013,
"grad_norm": 0.1306091845035553,
"learning_rate": 7.286582344042625e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9709312915802002,
"num_tokens": 1385636.0,
"step": 238
},
{
"epoch": 3.0253164556962027,
"grad_norm": 0.07664618641138077,
"learning_rate": 7.207725954972913e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9686498045921326,
"num_tokens": 1391314.0,
"step": 239
},
{
"epoch": 3.037974683544304,
"grad_norm": 0.0977763831615448,
"learning_rate": 7.129057436061739e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9701290130615234,
"num_tokens": 1397270.0,
"step": 240
},
{
"epoch": 3.050632911392405,
"grad_norm": 0.06652140617370605,
"learning_rate": 7.050582080294996e-05,
"loss": 0.0759,
"mean_token_accuracy": 0.9703101515769958,
"num_tokens": 1403363.0,
"step": 241
},
{
"epoch": 3.0632911392405062,
"grad_norm": 0.06535639613866806,
"learning_rate": 6.972305167662145e-05,
"loss": 0.0761,
"mean_token_accuracy": 0.9717714786529541,
"num_tokens": 1409343.0,
"step": 242
},
{
"epoch": 3.0759493670886076,
"grad_norm": 0.14863204956054688,
"learning_rate": 6.89423196480097e-05,
"loss": 0.0764,
"mean_token_accuracy": 0.9727972745895386,
"num_tokens": 1415252.0,
"step": 243
},
{
"epoch": 3.088607594936709,
"grad_norm": 0.12706619501113892,
"learning_rate": 6.816367724643224e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.9703253507614136,
"num_tokens": 1420910.0,
"step": 244
},
{
"epoch": 3.1012658227848102,
"grad_norm": 0.11461978405714035,
"learning_rate": 6.738717686061206e-05,
"loss": 0.0775,
"mean_token_accuracy": 0.9719387888908386,
"num_tokens": 1426854.0,
"step": 245
},
{
"epoch": 3.1139240506329116,
"grad_norm": 0.07422919571399689,
"learning_rate": 6.661287073515275e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.9705517292022705,
"num_tokens": 1432555.0,
"step": 246
},
{
"epoch": 3.1265822784810124,
"grad_norm": 0.1299969106912613,
"learning_rate": 6.58408109670234e-05,
"loss": 0.0802,
"mean_token_accuracy": 0.970957338809967,
"num_tokens": 1438197.0,
"step": 247
},
{
"epoch": 3.1392405063291138,
"grad_norm": 0.06016664579510689,
"learning_rate": 6.507104950205336e-05,
"loss": 0.0808,
"mean_token_accuracy": 0.9692197442054749,
"num_tokens": 1443849.0,
"step": 248
},
{
"epoch": 3.151898734177215,
"grad_norm": 0.07276305556297302,
"learning_rate": 6.430363813143716e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9725557565689087,
"num_tokens": 1449743.0,
"step": 249
},
{
"epoch": 3.1645569620253164,
"grad_norm": 0.14158909022808075,
"learning_rate": 6.35386284882501e-05,
"loss": 0.0812,
"mean_token_accuracy": 0.9695501923561096,
"num_tokens": 1455587.0,
"step": 250
},
{
"epoch": 3.1772151898734178,
"grad_norm": 0.07185238599777222,
"learning_rate": 6.277607204397408e-05,
"loss": 0.08,
"mean_token_accuracy": 0.9723237752914429,
"num_tokens": 1461396.0,
"step": 251
},
{
"epoch": 3.189873417721519,
"grad_norm": 0.11205340176820755,
"learning_rate": 6.201602010503454e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.9720181822776794,
"num_tokens": 1467178.0,
"step": 252
},
{
"epoch": 3.2025316455696204,
"grad_norm": 0.16124460101127625,
"learning_rate": 6.125852380934841e-05,
"loss": 0.078,
"mean_token_accuracy": 0.9711191058158875,
"num_tokens": 1473059.0,
"step": 253
},
{
"epoch": 3.2151898734177213,
"grad_norm": 0.08562294393777847,
"learning_rate": 6.0503634122883556e-05,
"loss": 0.079,
"mean_token_accuracy": 0.9705219268798828,
"num_tokens": 1478890.0,
"step": 254
},
{
"epoch": 3.2278481012658227,
"grad_norm": 0.11821357160806656,
"learning_rate": 5.975140183622958e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9715889692306519,
"num_tokens": 1484832.0,
"step": 255
},
{
"epoch": 3.240506329113924,
"grad_norm": 0.1310524344444275,
"learning_rate": 5.900187756118055e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9707400798797607,
"num_tokens": 1490706.0,
"step": 256
},
{
"epoch": 3.2531645569620253,
"grad_norm": 0.09574417024850845,
"learning_rate": 5.8255111727329717e-05,
"loss": 0.0796,
"mean_token_accuracy": 0.969775915145874,
"num_tokens": 1496527.0,
"step": 257
},
{
"epoch": 3.2658227848101267,
"grad_norm": 0.13490068912506104,
"learning_rate": 5.751115457867653e-05,
"loss": 0.0803,
"mean_token_accuracy": 0.9699646830558777,
"num_tokens": 1502251.0,
"step": 258
},
{
"epoch": 3.278481012658228,
"grad_norm": 0.06857483088970184,
"learning_rate": 5.6770056170246175e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9711849689483643,
"num_tokens": 1508180.0,
"step": 259
},
{
"epoch": 3.291139240506329,
"grad_norm": 0.14988020062446594,
"learning_rate": 5.6031866364721554e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9725578427314758,
"num_tokens": 1514038.0,
"step": 260
},
{
"epoch": 3.3037974683544302,
"grad_norm": 1.6094964742660522,
"learning_rate": 5.529663482908864e-05,
"loss": 0.0811,
"mean_token_accuracy": 0.9708961844444275,
"num_tokens": 1519737.0,
"step": 261
},
{
"epoch": 3.3164556962025316,
"grad_norm": 0.12591439485549927,
"learning_rate": 5.4564411031294695e-05,
"loss": 0.078,
"mean_token_accuracy": 0.9724565148353577,
"num_tokens": 1525610.0,
"step": 262
},
{
"epoch": 3.329113924050633,
"grad_norm": 0.07375043630599976,
"learning_rate": 5.383524423691994e-05,
"loss": 0.0793,
"mean_token_accuracy": 0.9706550240516663,
"num_tokens": 1531399.0,
"step": 263
},
{
"epoch": 3.3417721518987342,
"grad_norm": 0.07204035669565201,
"learning_rate": 5.310918350586291e-05,
"loss": 0.0767,
"mean_token_accuracy": 0.9731408357620239,
"num_tokens": 1537420.0,
"step": 264
},
{
"epoch": 3.3544303797468356,
"grad_norm": 0.06837223470211029,
"learning_rate": 5.2386277689039565e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.9714285731315613,
"num_tokens": 1543084.0,
"step": 265
},
{
"epoch": 3.367088607594937,
"grad_norm": 0.09739254415035248,
"learning_rate": 5.1666575425096396e-05,
"loss": 0.0767,
"mean_token_accuracy": 0.9723784923553467,
"num_tokens": 1549013.0,
"step": 266
},
{
"epoch": 3.379746835443038,
"grad_norm": 0.06620758026838303,
"learning_rate": 5.095012513713815e-05,
"loss": 0.0814,
"mean_token_accuracy": 0.9697670340538025,
"num_tokens": 1554700.0,
"step": 267
},
{
"epoch": 3.392405063291139,
"grad_norm": 3.2062768936157227,
"learning_rate": 5.023697502946969e-05,
"loss": 0.0874,
"mean_token_accuracy": 0.9678978323936462,
"num_tokens": 1560558.0,
"step": 268
},
{
"epoch": 3.4050632911392404,
"grad_norm": 0.07550380378961563,
"learning_rate": 4.9527173084352544e-05,
"loss": 0.0805,
"mean_token_accuracy": 0.9684154391288757,
"num_tokens": 1566226.0,
"step": 269
},
{
"epoch": 3.4177215189873418,
"grad_norm": 2.6636927127838135,
"learning_rate": 4.882076705877689e-05,
"loss": 0.0854,
"mean_token_accuracy": 0.9687827229499817,
"num_tokens": 1572024.0,
"step": 270
},
{
"epoch": 3.430379746835443,
"grad_norm": 0.11234506964683533,
"learning_rate": 4.811780448124812e-05,
"loss": 0.0809,
"mean_token_accuracy": 0.970019519329071,
"num_tokens": 1577725.0,
"step": 271
},
{
"epoch": 3.4430379746835444,
"grad_norm": 0.24648332595825195,
"learning_rate": 4.741833264858909e-05,
"loss": 0.0873,
"mean_token_accuracy": 0.9710736870765686,
"num_tokens": 1583666.0,
"step": 272
},
{
"epoch": 3.4556962025316453,
"grad_norm": 0.13464736938476562,
"learning_rate": 4.6722398622757935e-05,
"loss": 0.0807,
"mean_token_accuracy": 0.9684116840362549,
"num_tokens": 1589365.0,
"step": 273
},
{
"epoch": 3.4683544303797467,
"grad_norm": 0.15187641978263855,
"learning_rate": 4.603004922768148e-05,
"loss": 0.0844,
"mean_token_accuracy": 0.9703108668327332,
"num_tokens": 1595155.0,
"step": 274
},
{
"epoch": 3.481012658227848,
"grad_norm": 0.11025819182395935,
"learning_rate": 4.5341331046105064e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.970588207244873,
"num_tokens": 1600999.0,
"step": 275
},
{
"epoch": 3.4936708860759493,
"grad_norm": 0.16418573260307312,
"learning_rate": 4.465629041645819e-05,
"loss": 0.0817,
"mean_token_accuracy": 0.9688612222671509,
"num_tokens": 1606683.0,
"step": 276
},
{
"epoch": 3.5063291139240507,
"grad_norm": 0.20723280310630798,
"learning_rate": 4.397497342973676e-05,
"loss": 0.0835,
"mean_token_accuracy": 0.9696651101112366,
"num_tokens": 1612450.0,
"step": 277
},
{
"epoch": 3.518987341772152,
"grad_norm": 0.10691708326339722,
"learning_rate": 4.3297425926402115e-05,
"loss": 0.079,
"mean_token_accuracy": 0.970613956451416,
"num_tokens": 1618231.0,
"step": 278
},
{
"epoch": 3.5316455696202533,
"grad_norm": 0.08413207530975342,
"learning_rate": 4.2623693493296644e-05,
"loss": 0.0853,
"mean_token_accuracy": 0.9680407047271729,
"num_tokens": 1623802.0,
"step": 279
},
{
"epoch": 3.5443037974683547,
"grad_norm": 0.0731053277850151,
"learning_rate": 4.1953821460576715e-05,
"loss": 0.0757,
"mean_token_accuracy": 0.9723010063171387,
"num_tokens": 1629859.0,
"step": 280
},
{
"epoch": 3.5569620253164556,
"grad_norm": 0.12216750532388687,
"learning_rate": 4.1287854898662705e-05,
"loss": 0.0815,
"mean_token_accuracy": 0.9699074029922485,
"num_tokens": 1635539.0,
"step": 281
},
{
"epoch": 3.569620253164557,
"grad_norm": 0.14565329253673553,
"learning_rate": 4.0625838615206566e-05,
"loss": 0.0814,
"mean_token_accuracy": 0.9697181582450867,
"num_tokens": 1641316.0,
"step": 282
},
{
"epoch": 3.5822784810126582,
"grad_norm": 0.10866527259349823,
"learning_rate": 3.996781715207706e-05,
"loss": 0.0813,
"mean_token_accuracy": 0.9699694514274597,
"num_tokens": 1646941.0,
"step": 283
},
{
"epoch": 3.5949367088607596,
"grad_norm": 0.07269653677940369,
"learning_rate": 3.9313834782362926e-05,
"loss": 0.0781,
"mean_token_accuracy": 0.9698261022567749,
"num_tokens": 1652871.0,
"step": 284
},
{
"epoch": 3.607594936708861,
"grad_norm": 0.08844961225986481,
"learning_rate": 3.866393550739416e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9734051823616028,
"num_tokens": 1658688.0,
"step": 285
},
{
"epoch": 3.620253164556962,
"grad_norm": 0.23879852890968323,
"learning_rate": 3.801816305378124e-05,
"loss": 0.0799,
"mean_token_accuracy": 0.9712653756141663,
"num_tokens": 1664529.0,
"step": 286
},
{
"epoch": 3.632911392405063,
"grad_norm": 0.07687602192163467,
"learning_rate": 3.737656087047347e-05,
"loss": 0.0796,
"mean_token_accuracy": 0.9710347056388855,
"num_tokens": 1670324.0,
"step": 287
},
{
"epoch": 3.6455696202531644,
"grad_norm": 0.06936953216791153,
"learning_rate": 3.673917212583538e-05,
"loss": 0.0756,
"mean_token_accuracy": 0.972872793674469,
"num_tokens": 1676323.0,
"step": 288
},
{
"epoch": 3.6582278481012658,
"grad_norm": 0.06485825031995773,
"learning_rate": 3.610603970474239e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9692094922065735,
"num_tokens": 1682168.0,
"step": 289
},
{
"epoch": 3.670886075949367,
"grad_norm": 0.05847015231847763,
"learning_rate": 3.547720620569539e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9695237874984741,
"num_tokens": 1688007.0,
"step": 290
},
{
"epoch": 3.6835443037974684,
"grad_norm": 0.07112373411655426,
"learning_rate": 3.485271393795453e-05,
"loss": 0.0767,
"mean_token_accuracy": 0.9705587029457092,
"num_tokens": 1694049.0,
"step": 291
},
{
"epoch": 3.6962025316455698,
"grad_norm": 0.07661055028438568,
"learning_rate": 3.4232604918692754e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9712532758712769,
"num_tokens": 1699818.0,
"step": 292
},
{
"epoch": 3.708860759493671,
"grad_norm": 0.08328502625226974,
"learning_rate": 3.361692087016863e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9705464839935303,
"num_tokens": 1705518.0,
"step": 293
},
{
"epoch": 3.721518987341772,
"grad_norm": 0.07525166124105453,
"learning_rate": 3.300570321691934e-05,
"loss": 0.0782,
"mean_token_accuracy": 0.9703742265701294,
"num_tokens": 1711354.0,
"step": 294
},
{
"epoch": 3.7341772151898733,
"grad_norm": 0.05936251953244209,
"learning_rate": 3.2398993082973294e-05,
"loss": 0.0792,
"mean_token_accuracy": 0.9714688062667847,
"num_tokens": 1717096.0,
"step": 295
},
{
"epoch": 3.7468354430379747,
"grad_norm": 0.9336976408958435,
"learning_rate": 3.179683128908352e-05,
"loss": 0.0852,
"mean_token_accuracy": 0.9706405401229858,
"num_tokens": 1722780.0,
"step": 296
},
{
"epoch": 3.759493670886076,
"grad_norm": 0.06697431206703186,
"learning_rate": 3.1199258349980966e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9715363383293152,
"num_tokens": 1728676.0,
"step": 297
},
{
"epoch": 3.7721518987341773,
"grad_norm": 0.06829504668712616,
"learning_rate": 3.0606314471648643e-05,
"loss": 0.0804,
"mean_token_accuracy": 0.9701782464981079,
"num_tokens": 1734407.0,
"step": 298
},
{
"epoch": 3.7848101265822782,
"grad_norm": 0.07030507922172546,
"learning_rate": 3.0018039548616494e-05,
"loss": 0.0749,
"mean_token_accuracy": 0.9729909896850586,
"num_tokens": 1740469.0,
"step": 299
},
{
"epoch": 3.7974683544303796,
"grad_norm": 0.07017358392477036,
"learning_rate": 2.943447316127712e-05,
"loss": 0.081,
"mean_token_accuracy": 0.968805730342865,
"num_tokens": 1746143.0,
"step": 300
},
{
"epoch": 3.810126582278481,
"grad_norm": 0.06848268955945969,
"learning_rate": 2.8855654573222825e-05,
"loss": 0.0784,
"mean_token_accuracy": 0.9709241986274719,
"num_tokens": 1751985.0,
"step": 301
},
{
"epoch": 3.8227848101265822,
"grad_norm": 0.06129057705402374,
"learning_rate": 2.8281622728603864e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9718717932701111,
"num_tokens": 1757915.0,
"step": 302
},
{
"epoch": 3.8354430379746836,
"grad_norm": 0.059805795550346375,
"learning_rate": 2.7712416249508177e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9707764387130737,
"num_tokens": 1763762.0,
"step": 303
},
{
"epoch": 3.848101265822785,
"grad_norm": 0.06053877994418144,
"learning_rate": 2.714807343336273e-05,
"loss": 0.0791,
"mean_token_accuracy": 0.9692063927650452,
"num_tokens": 1769509.0,
"step": 304
},
{
"epoch": 3.8607594936708862,
"grad_norm": 0.059059906750917435,
"learning_rate": 2.6588632250356948e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9722741842269897,
"num_tokens": 1775452.0,
"step": 305
},
{
"epoch": 3.8734177215189876,
"grad_norm": 0.05404770001769066,
"learning_rate": 2.6034130340887895e-05,
"loss": 0.0801,
"mean_token_accuracy": 0.9705519080162048,
"num_tokens": 1781187.0,
"step": 306
},
{
"epoch": 3.8860759493670884,
"grad_norm": 0.06307448446750641,
"learning_rate": 2.5484605013027784e-05,
"loss": 0.0771,
"mean_token_accuracy": 0.9702105522155762,
"num_tokens": 1787092.0,
"step": 307
},
{
"epoch": 3.8987341772151898,
"grad_norm": 0.056615523993968964,
"learning_rate": 2.4940093240013717e-05,
"loss": 0.0768,
"mean_token_accuracy": 0.9707582592964172,
"num_tokens": 1793038.0,
"step": 308
},
{
"epoch": 3.911392405063291,
"grad_norm": 0.06251045316457748,
"learning_rate": 2.4400631657760186e-05,
"loss": 0.0777,
"mean_token_accuracy": 0.9698939323425293,
"num_tokens": 1798948.0,
"step": 309
},
{
"epoch": 3.9240506329113924,
"grad_norm": 0.06428255885839462,
"learning_rate": 2.3866256562394083e-05,
"loss": 0.0769,
"mean_token_accuracy": 0.9723984003067017,
"num_tokens": 1804845.0,
"step": 310
},
{
"epoch": 3.9367088607594938,
"grad_norm": 0.06822579354047775,
"learning_rate": 2.333700390781256e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9734973311424255,
"num_tokens": 1810682.0,
"step": 311
},
{
"epoch": 3.9493670886075947,
"grad_norm": 0.07946109026670456,
"learning_rate": 2.2812909303264085e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9704923629760742,
"num_tokens": 1816575.0,
"step": 312
},
{
"epoch": 3.962025316455696,
"grad_norm": 0.05697230249643326,
"learning_rate": 2.2294008010952382e-05,
"loss": 0.0788,
"mean_token_accuracy": 0.9713143110275269,
"num_tokens": 1822391.0,
"step": 313
},
{
"epoch": 3.9746835443037973,
"grad_norm": 0.05985480546951294,
"learning_rate": 2.1780334943664162e-05,
"loss": 0.0778,
"mean_token_accuracy": 0.9696394801139832,
"num_tokens": 1828252.0,
"step": 314
},
{
"epoch": 3.9873417721518987,
"grad_norm": 0.07457312196493149,
"learning_rate": 2.127192466241994e-05,
"loss": 0.0771,
"mean_token_accuracy": 0.9737654328346252,
"num_tokens": 1834148.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.07451052963733673,
"learning_rate": 2.07688113741488e-05,
"loss": 0.0807,
"mean_token_accuracy": 0.970366358757019,
"num_tokens": 1839780.0,
"step": 316
},
{
"epoch": 4.012658227848101,
"grad_norm": 0.06042718142271042,
"learning_rate": 2.0271028929386738e-05,
"loss": 0.0751,
"mean_token_accuracy": 0.9707651138305664,
"num_tokens": 1845830.0,
"step": 317
},
{
"epoch": 4.025316455696203,
"grad_norm": 0.05794535577297211,
"learning_rate": 1.977861081999931e-05,
"loss": 0.079,
"mean_token_accuracy": 0.9711419939994812,
"num_tokens": 1851577.0,
"step": 318
},
{
"epoch": 4.037974683544304,
"grad_norm": 0.057247843593358994,
"learning_rate": 1.92915901769281e-05,
"loss": 0.0796,
"mean_token_accuracy": 0.9693425297737122,
"num_tokens": 1857284.0,
"step": 319
},
{
"epoch": 4.050632911392405,
"grad_norm": 0.06188493221998215,
"learning_rate": 1.880999976796164e-05,
"loss": 0.0757,
"mean_token_accuracy": 0.9716632962226868,
"num_tokens": 1863312.0,
"step": 320
},
{
"epoch": 4.063291139240507,
"grad_norm": 0.05771747604012489,
"learning_rate": 1.8333871995530726e-05,
"loss": 0.0785,
"mean_token_accuracy": 0.9692708253860474,
"num_tokens": 1869136.0,
"step": 321
},
{
"epoch": 4.075949367088608,
"grad_norm": 0.05652361363172531,
"learning_rate": 1.786323889452828e-05,
"loss": 0.0773,
"mean_token_accuracy": 0.9709202647209167,
"num_tokens": 1875046.0,
"step": 322
},
{
"epoch": 4.0886075949367084,
"grad_norm": 0.05673353746533394,
"learning_rate": 1.739813213015401e-05,
"loss": 0.0793,
"mean_token_accuracy": 0.9699859023094177,
"num_tokens": 1880774.0,
"step": 323
},
{
"epoch": 4.10126582278481,
"grad_norm": 0.06132633239030838,
"learning_rate": 1.693858299578396e-05,
"loss": 0.0763,
"mean_token_accuracy": 0.9706130623817444,
"num_tokens": 1886759.0,
"step": 324
},
{
"epoch": 4.113924050632911,
"grad_norm": 0.056123439222574234,
"learning_rate": 1.6484622410864835e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9699808955192566,
"num_tokens": 1892586.0,
"step": 325
},
{
"epoch": 4.1265822784810124,
"grad_norm": 0.06860559433698654,
"learning_rate": 1.6036280918833924e-05,
"loss": 0.0762,
"mean_token_accuracy": 0.9718095660209656,
"num_tokens": 1898574.0,
"step": 326
},
{
"epoch": 4.139240506329114,
"grad_norm": 0.057196494191884995,
"learning_rate": 1.5593588685063896e-05,
"loss": 0.0755,
"mean_token_accuracy": 0.9706724882125854,
"num_tokens": 1904571.0,
"step": 327
},
{
"epoch": 4.151898734177215,
"grad_norm": 0.05489705130457878,
"learning_rate": 1.515657549483328e-05,
"loss": 0.0769,
"mean_token_accuracy": 0.9721410274505615,
"num_tokens": 1910450.0,
"step": 328
},
{
"epoch": 4.1645569620253164,
"grad_norm": 0.062416039407253265,
"learning_rate": 1.4725270751322452e-05,
"loss": 0.0789,
"mean_token_accuracy": 0.9689679145812988,
"num_tokens": 1916250.0,
"step": 329
},
{
"epoch": 4.177215189873418,
"grad_norm": 0.05836787447333336,
"learning_rate": 1.4299703473635218e-05,
"loss": 0.0759,
"mean_token_accuracy": 0.9725050926208496,
"num_tokens": 1922206.0,
"step": 330
},
{
"epoch": 4.189873417721519,
"grad_norm": 0.06579294800758362,
"learning_rate": 1.3879902294846536e-05,
"loss": 0.0774,
"mean_token_accuracy": 0.9693894982337952,
"num_tokens": 1928085.0,
"step": 331
},
{
"epoch": 4.2025316455696204,
"grad_norm": 0.06163820996880531,
"learning_rate": 1.3465895460075873e-05,
"loss": 0.0814,
"mean_token_accuracy": 0.9713560342788696,
"num_tokens": 1933665.0,
"step": 332
},
{
"epoch": 4.215189873417722,
"grad_norm": 0.06440580636262894,
"learning_rate": 1.3057710824586899e-05,
"loss": 0.0794,
"mean_token_accuracy": 0.9684858918190002,
"num_tokens": 1939409.0,
"step": 333
},
{
"epoch": 4.227848101265823,
"grad_norm": 0.06846589595079422,
"learning_rate": 1.2655375851913232e-05,
"loss": 0.0779,
"mean_token_accuracy": 0.9719237685203552,
"num_tokens": 1945243.0,
"step": 334
},
{
"epoch": 4.2405063291139244,
"grad_norm": 0.06552578508853912,
"learning_rate": 1.22589176120107e-05,
"loss": 0.0768,
"mean_token_accuracy": 0.9721074104309082,
"num_tokens": 1951115.0,
"step": 335
},
{
"epoch": 4.253164556962025,
"grad_norm": 0.059337787330150604,
"learning_rate": 1.186836277943606e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9703677892684937,
"num_tokens": 1956916.0,
"step": 336
},
{
"epoch": 4.265822784810126,
"grad_norm": 0.07464569061994553,
"learning_rate": 1.1483737631552161e-05,
"loss": 0.0797,
"mean_token_accuracy": 0.9708686470985413,
"num_tokens": 1962644.0,
"step": 337
},
{
"epoch": 4.2784810126582276,
"grad_norm": 0.06734161078929901,
"learning_rate": 1.1105068046760048e-05,
"loss": 0.0776,
"mean_token_accuracy": 0.9691272974014282,
"num_tokens": 1968506.0,
"step": 338
},
{
"epoch": 4.291139240506329,
"grad_norm": 0.06930230557918549,
"learning_rate": 1.0732379502757717e-05,
"loss": 0.0789,
"mean_token_accuracy": 0.969554603099823,
"num_tokens": 1974318.0,
"step": 339
},
{
"epoch": 4.30379746835443,
"grad_norm": 0.0679992139339447,
"learning_rate": 1.036569707482602e-05,
"loss": 0.0753,
"mean_token_accuracy": 0.9715152382850647,
"num_tokens": 1980315.0,
"step": 340
},
{
"epoch": 4.3164556962025316,
"grad_norm": 0.07055645436048508,
"learning_rate": 1.0005045434141502e-05,
"loss": 0.0789,
"mean_token_accuracy": 0.967298686504364,
"num_tokens": 1986128.0,
"step": 341
},
{
"epoch": 4.329113924050633,
"grad_norm": 0.06478093564510345,
"learning_rate": 9.6504488461164e-06,
"loss": 0.0777,
"mean_token_accuracy": 0.9695026874542236,
"num_tokens": 1991963.0,
"step": 342
},
{
"epoch": 4.341772151898734,
"grad_norm": 0.05864814668893814,
"learning_rate": 9.301931168766164e-06,
"loss": 0.0789,
"mean_token_accuracy": 0.9722025394439697,
"num_tokens": 1997675.0,
"step": 343
},
{
"epoch": 4.3544303797468356,
"grad_norm": 0.057372983545064926,
"learning_rate": 8.959515851104117e-06,
"loss": 0.0763,
"mean_token_accuracy": 0.9710463881492615,
"num_tokens": 2003645.0,
"step": 344
},
{
"epoch": 4.367088607594937,
"grad_norm": 0.05886904522776604,
"learning_rate": 8.623225931563805e-06,
"loss": 0.0765,
"mean_token_accuracy": 0.9717639088630676,
"num_tokens": 2009588.0,
"step": 345
},
{
"epoch": 4.379746835443038,
"grad_norm": 0.058638498187065125,
"learning_rate": 8.293084036448895e-06,
"loss": 0.0778,
"mean_token_accuracy": 0.9706800580024719,
"num_tokens": 2015416.0,
"step": 346
},
{
"epoch": 4.3924050632911396,
"grad_norm": 0.055953070521354675,
"learning_rate": 7.96911237841088e-06,
"loss": 0.0778,
"mean_token_accuracy": 0.9712381362915039,
"num_tokens": 2021182.0,
"step": 347
},
{
"epoch": 4.405063291139241,
"grad_norm": 0.05705662816762924,
"learning_rate": 7.651332754954477e-06,
"loss": 0.0781,
"mean_token_accuracy": 0.9709312319755554,
"num_tokens": 2026991.0,
"step": 348
},
{
"epoch": 4.417721518987342,
"grad_norm": 0.06720998138189316,
"learning_rate": 7.3397665469711495e-06,
"loss": 0.0785,
"mean_token_accuracy": 0.9710195660591125,
"num_tokens": 2032783.0,
"step": 349
},
{
"epoch": 4.430379746835443,
"grad_norm": 0.05840713158249855,
"learning_rate": 7.034434717300509e-06,
"loss": 0.0749,
"mean_token_accuracy": 0.973750650882721,
"num_tokens": 2038790.0,
"step": 350
},
{
"epoch": 4.443037974683544,
"grad_norm": 0.06675554811954498,
"learning_rate": 6.735357809319809e-06,
"loss": 0.0756,
"mean_token_accuracy": 0.9730185270309448,
"num_tokens": 2044784.0,
"step": 351
},
{
"epoch": 4.455696202531645,
"grad_norm": 0.06554147601127625,
"learning_rate": 6.442555945561901e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9715539813041687,
"num_tokens": 2050543.0,
"step": 352
},
{
"epoch": 4.468354430379747,
"grad_norm": 0.06406175345182419,
"learning_rate": 6.156048826361238e-06,
"loss": 0.0775,
"mean_token_accuracy": 0.9712255001068115,
"num_tokens": 2056376.0,
"step": 353
},
{
"epoch": 4.481012658227848,
"grad_norm": 0.05737734213471413,
"learning_rate": 5.8758557285284125e-06,
"loss": 0.0759,
"mean_token_accuracy": 0.9722080826759338,
"num_tokens": 2062341.0,
"step": 354
},
{
"epoch": 4.493670886075949,
"grad_norm": 0.058641061186790466,
"learning_rate": 5.6019955040531925e-06,
"loss": 0.0771,
"mean_token_accuracy": 0.9707903861999512,
"num_tokens": 2068225.0,
"step": 355
},
{
"epoch": 4.506329113924051,
"grad_norm": 0.06712588667869568,
"learning_rate": 5.334486578836118e-06,
"loss": 0.0765,
"mean_token_accuracy": 0.9706331491470337,
"num_tokens": 2074180.0,
"step": 356
},
{
"epoch": 4.518987341772152,
"grad_norm": 0.06461600959300995,
"learning_rate": 5.073346951448699e-06,
"loss": 0.08,
"mean_token_accuracy": 0.9709550738334656,
"num_tokens": 2079856.0,
"step": 357
},
{
"epoch": 4.531645569620253,
"grad_norm": 0.07402454316616058,
"learning_rate": 4.818594191922576e-06,
"loss": 0.0795,
"mean_token_accuracy": 0.9725420475006104,
"num_tokens": 2085565.0,
"step": 358
},
{
"epoch": 4.544303797468355,
"grad_norm": 0.05966600775718689,
"learning_rate": 4.5702454405672e-06,
"loss": 0.078,
"mean_token_accuracy": 0.9685818552970886,
"num_tokens": 2091390.0,
"step": 359
},
{
"epoch": 4.556962025316456,
"grad_norm": 0.06288423389196396,
"learning_rate": 4.328317406816751e-06,
"loss": 0.0776,
"mean_token_accuracy": 0.9723670482635498,
"num_tokens": 2097208.0,
"step": 360
},
{
"epoch": 4.569620253164557,
"grad_norm": 0.06594210118055344,
"learning_rate": 4.092826368105795e-06,
"loss": 0.0808,
"mean_token_accuracy": 0.9683079719543457,
"num_tokens": 2102857.0,
"step": 361
},
{
"epoch": 4.582278481012658,
"grad_norm": 0.06201909855008125,
"learning_rate": 3.863788168774118e-06,
"loss": 0.0762,
"mean_token_accuracy": 0.9730194211006165,
"num_tokens": 2108740.0,
"step": 362
},
{
"epoch": 4.594936708860759,
"grad_norm": 0.07590262591838837,
"learning_rate": 3.6412182190007082e-06,
"loss": 0.0792,
"mean_token_accuracy": 0.9691489338874817,
"num_tokens": 2114444.0,
"step": 363
},
{
"epoch": 4.6075949367088604,
"grad_norm": 0.058905087411403656,
"learning_rate": 3.425131493766931e-06,
"loss": 0.0788,
"mean_token_accuracy": 0.9723153114318848,
"num_tokens": 2120179.0,
"step": 364
},
{
"epoch": 4.620253164556962,
"grad_norm": 0.06537073850631714,
"learning_rate": 3.2155425318489584e-06,
"loss": 0.0775,
"mean_token_accuracy": 0.9721066951751709,
"num_tokens": 2126015.0,
"step": 365
},
{
"epoch": 4.632911392405063,
"grad_norm": 0.074104443192482,
"learning_rate": 3.012465434839529e-06,
"loss": 0.0785,
"mean_token_accuracy": 0.9693859815597534,
"num_tokens": 2131828.0,
"step": 366
},
{
"epoch": 4.6455696202531644,
"grad_norm": 0.06384899467229843,
"learning_rate": 2.8159138661992824e-06,
"loss": 0.0795,
"mean_token_accuracy": 0.9716049432754517,
"num_tokens": 2137562.0,
"step": 367
},
{
"epoch": 4.658227848101266,
"grad_norm": 0.07530912756919861,
"learning_rate": 2.6259010503373206e-06,
"loss": 0.0769,
"mean_token_accuracy": 0.9712377786636353,
"num_tokens": 2143467.0,
"step": 368
},
{
"epoch": 4.670886075949367,
"grad_norm": 0.06394244730472565,
"learning_rate": 2.4424397717215387e-06,
"loss": 0.078,
"mean_token_accuracy": 0.9697181582450867,
"num_tokens": 2149244.0,
"step": 369
},
{
"epoch": 4.6835443037974684,
"grad_norm": 0.07698839902877808,
"learning_rate": 2.2655423740183924e-06,
"loss": 0.0798,
"mean_token_accuracy": 0.9722123146057129,
"num_tokens": 2154922.0,
"step": 370
},
{
"epoch": 4.69620253164557,
"grad_norm": 0.0612369030714035,
"learning_rate": 2.0952207592624505e-06,
"loss": 0.0794,
"mean_token_accuracy": 0.969454824924469,
"num_tokens": 2160617.0,
"step": 371
},
{
"epoch": 4.708860759493671,
"grad_norm": 0.06153201311826706,
"learning_rate": 1.9314863870555255e-06,
"loss": 0.0791,
"mean_token_accuracy": 0.9693984985351562,
"num_tokens": 2166367.0,
"step": 372
},
{
"epoch": 4.7215189873417724,
"grad_norm": 0.05991169437766075,
"learning_rate": 1.7743502737957106e-06,
"loss": 0.0787,
"mean_token_accuracy": 0.9701519012451172,
"num_tokens": 2172093.0,
"step": 373
},
{
"epoch": 4.734177215189874,
"grad_norm": 0.061358775943517685,
"learning_rate": 1.6238229919361858e-06,
"loss": 0.079,
"mean_token_accuracy": 0.9693090319633484,
"num_tokens": 2177859.0,
"step": 374
},
{
"epoch": 4.746835443037975,
"grad_norm": 0.06134023889899254,
"learning_rate": 1.4799146692737741e-06,
"loss": 0.0767,
"mean_token_accuracy": 0.9715369939804077,
"num_tokens": 2183720.0,
"step": 375
},
{
"epoch": 4.759493670886076,
"grad_norm": 0.05467069521546364,
"learning_rate": 1.3426349882676325e-06,
"loss": 0.0787,
"mean_token_accuracy": 0.9697826504707336,
"num_tokens": 2189443.0,
"step": 376
},
{
"epoch": 4.772151898734177,
"grad_norm": 0.06292378157377243,
"learning_rate": 1.211993185387772e-06,
"loss": 0.0807,
"mean_token_accuracy": 0.9686599373817444,
"num_tokens": 2195059.0,
"step": 377
},
{
"epoch": 4.784810126582278,
"grad_norm": 0.05961504578590393,
"learning_rate": 1.0879980504935772e-06,
"loss": 0.0756,
"mean_token_accuracy": 0.9717646837234497,
"num_tokens": 2201073.0,
"step": 378
},
{
"epoch": 4.7974683544303796,
"grad_norm": 0.06441368907690048,
"learning_rate": 9.706579262424131e-07,
"loss": 0.0807,
"mean_token_accuracy": 0.969048023223877,
"num_tokens": 2206694.0,
"step": 379
},
{
"epoch": 4.810126582278481,
"grad_norm": 0.07030190527439117,
"learning_rate": 8.599807075283406e-07,
"loss": 0.0768,
"mean_token_accuracy": 0.9719101190567017,
"num_tokens": 2212632.0,
"step": 380
},
{
"epoch": 4.822784810126582,
"grad_norm": 0.06316056102514267,
"learning_rate": 7.559738409508855e-07,
"loss": 0.0773,
"mean_token_accuracy": 0.9711191058158875,
"num_tokens": 2218513.0,
"step": 381
},
{
"epoch": 4.8354430379746836,
"grad_norm": 0.06939555704593658,
"learning_rate": 6.586443243140838e-07,
"loss": 0.0775,
"mean_token_accuracy": 0.9715026021003723,
"num_tokens": 2224367.0,
"step": 382
},
{
"epoch": 4.848101265822785,
"grad_norm": 0.06221834197640419,
"learning_rate": 5.679987061555703e-07,
"loss": 0.0767,
"mean_token_accuracy": 0.9719110727310181,
"num_tokens": 2230234.0,
"step": 383
},
{
"epoch": 4.860759493670886,
"grad_norm": 0.06537239253520966,
"learning_rate": 4.840430853060518e-07,
"loss": 0.0749,
"mean_token_accuracy": 0.9727303385734558,
"num_tokens": 2236202.0,
"step": 384
},
{
"epoch": 4.8734177215189876,
"grad_norm": 0.06031161919236183,
"learning_rate": 4.0678311047890327e-07,
"loss": 0.0776,
"mean_token_accuracy": 0.9701727032661438,
"num_tokens": 2241999.0,
"step": 385
},
{
"epoch": 4.886075949367089,
"grad_norm": 0.0632636696100235,
"learning_rate": 3.362239798901712e-07,
"loss": 0.0793,
"mean_token_accuracy": 0.9722172617912292,
"num_tokens": 2247678.0,
"step": 386
},
{
"epoch": 4.89873417721519,
"grad_norm": 0.06093168631196022,
"learning_rate": 2.723704409087979e-07,
"loss": 0.0795,
"mean_token_accuracy": 0.9690831303596497,
"num_tokens": 2253370.0,
"step": 387
},
{
"epoch": 4.911392405063291,
"grad_norm": 0.0712820366024971,
"learning_rate": 2.1522678973718847e-07,
"loss": 0.0776,
"mean_token_accuracy": 0.9702679514884949,
"num_tokens": 2259219.0,
"step": 388
},
{
"epoch": 4.924050632911392,
"grad_norm": 0.06232396140694618,
"learning_rate": 1.6479687112217479e-07,
"loss": 0.0775,
"mean_token_accuracy": 0.9717797636985779,
"num_tokens": 2265059.0,
"step": 389
},
{
"epoch": 4.936708860759493,
"grad_norm": 0.07412244379520416,
"learning_rate": 1.2108407809635624e-07,
"loss": 0.0798,
"mean_token_accuracy": 0.9692225456237793,
"num_tokens": 2270744.0,
"step": 390
},
{
"epoch": 4.949367088607595,
"grad_norm": 0.06119261309504509,
"learning_rate": 8.40913517497377e-08,
"loss": 0.0761,
"mean_token_accuracy": 0.9705832004547119,
"num_tokens": 2276655.0,
"step": 391
},
{
"epoch": 4.962025316455696,
"grad_norm": 0.059338781982660294,
"learning_rate": 5.382118103193223e-08,
"loss": 0.0773,
"mean_token_accuracy": 0.9722415208816528,
"num_tokens": 2282483.0,
"step": 392
},
{
"epoch": 4.974683544303797,
"grad_norm": 0.07498956471681595,
"learning_rate": 3.027560258465067e-08,
"loss": 0.0774,
"mean_token_accuracy": 0.9694932699203491,
"num_tokens": 2288349.0,
"step": 393
},
{
"epoch": 4.987341772151899,
"grad_norm": 0.06674467027187347,
"learning_rate": 1.345620060465569e-08,
"loss": 0.0799,
"mean_token_accuracy": 0.9709312915802002,
"num_tokens": 2293986.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.06420715898275375,
"learning_rate": 3.3641067372358612e-09,
"loss": 0.0742,
"mean_token_accuracy": 0.9736490845680237,
"num_tokens": 2300046.0,
"step": 395
},
{
"epoch": 5.0,
"step": 395,
"total_flos": 1.433986508301271e+17,
"train_loss": 0.13250939466908007,
"train_runtime": 455.932,
"train_samples_per_second": 54.833,
"train_steps_per_second": 0.866
}
],
"logging_steps": 1.0,
"max_steps": 395,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.433986508301271e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}