YeMoKoo's picture
Add final checkpoint: trace_upstream_pre_order7
94611be verified
Raw
History Blame Contribute Delete
101 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 395,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.012658227848101266,
"grad_norm": 2.261342763900757,
"learning_rate": 0.0,
"loss": 0.9274,
"mean_token_accuracy": 0.8330742120742798,
"num_tokens": 5210.0,
"step": 1
},
{
"epoch": 0.02531645569620253,
"grad_norm": 2.449852466583252,
"learning_rate": 1.6666666666666667e-05,
"loss": 0.9839,
"mean_token_accuracy": 0.8264493942260742,
"num_tokens": 10552.0,
"step": 2
},
{
"epoch": 0.0379746835443038,
"grad_norm": 2.1478281021118164,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.8987,
"mean_token_accuracy": 0.8358815312385559,
"num_tokens": 15783.0,
"step": 3
},
{
"epoch": 0.05063291139240506,
"grad_norm": 1.6363688707351685,
"learning_rate": 5e-05,
"loss": 0.7419,
"mean_token_accuracy": 0.849078357219696,
"num_tokens": 21055.0,
"step": 4
},
{
"epoch": 0.06329113924050633,
"grad_norm": 1.1455320119857788,
"learning_rate": 6.666666666666667e-05,
"loss": 0.5762,
"mean_token_accuracy": 0.8692193627357483,
"num_tokens": 26525.0,
"step": 5
},
{
"epoch": 0.0759493670886076,
"grad_norm": 0.8304877281188965,
"learning_rate": 8.333333333333334e-05,
"loss": 0.3965,
"mean_token_accuracy": 0.9039722084999084,
"num_tokens": 31775.0,
"step": 6
},
{
"epoch": 0.08860759493670886,
"grad_norm": 0.6689921617507935,
"learning_rate": 0.0001,
"loss": 0.3648,
"mean_token_accuracy": 0.901260495185852,
"num_tokens": 37075.0,
"step": 7
},
{
"epoch": 0.10126582278481013,
"grad_norm": 0.5956555008888245,
"learning_rate": 0.00011666666666666668,
"loss": 0.3464,
"mean_token_accuracy": 0.9010356664657593,
"num_tokens": 42353.0,
"step": 8
},
{
"epoch": 0.11392405063291139,
"grad_norm": 0.6162813305854797,
"learning_rate": 0.00013333333333333334,
"loss": 0.3337,
"mean_token_accuracy": 0.9090375304222107,
"num_tokens": 47529.0,
"step": 9
},
{
"epoch": 0.12658227848101267,
"grad_norm": 0.5204370617866516,
"learning_rate": 0.00015000000000000001,
"loss": 0.304,
"mean_token_accuracy": 0.912761926651001,
"num_tokens": 52843.0,
"step": 10
},
{
"epoch": 0.13924050632911392,
"grad_norm": 0.48423895239830017,
"learning_rate": 0.0001666666666666667,
"loss": 0.2637,
"mean_token_accuracy": 0.9209375977516174,
"num_tokens": 57941.0,
"step": 11
},
{
"epoch": 0.1518987341772152,
"grad_norm": 0.38198572397232056,
"learning_rate": 0.00018333333333333334,
"loss": 0.2515,
"mean_token_accuracy": 0.9205062389373779,
"num_tokens": 63062.0,
"step": 12
},
{
"epoch": 0.16455696202531644,
"grad_norm": 0.33576324582099915,
"learning_rate": 0.0002,
"loss": 0.2714,
"mean_token_accuracy": 0.9151454567909241,
"num_tokens": 68111.0,
"step": 13
},
{
"epoch": 0.17721518987341772,
"grad_norm": 0.39188244938850403,
"learning_rate": 0.0001999966358932628,
"loss": 0.2835,
"mean_token_accuracy": 0.9112998843193054,
"num_tokens": 73237.0,
"step": 14
},
{
"epoch": 0.189873417721519,
"grad_norm": 0.337475448846817,
"learning_rate": 0.00019998654379939533,
"loss": 0.2363,
"mean_token_accuracy": 0.9202312231063843,
"num_tokens": 78491.0,
"step": 15
},
{
"epoch": 0.20253164556962025,
"grad_norm": 0.3103994131088257,
"learning_rate": 0.00019996972439741538,
"loss": 0.252,
"mean_token_accuracy": 0.9178321957588196,
"num_tokens": 83703.0,
"step": 16
},
{
"epoch": 0.21518987341772153,
"grad_norm": 0.3581632971763611,
"learning_rate": 0.0001999461788189681,
"loss": 0.2444,
"mean_token_accuracy": 0.9205324053764343,
"num_tokens": 88876.0,
"step": 17
},
{
"epoch": 0.22784810126582278,
"grad_norm": 0.32648301124572754,
"learning_rate": 0.00019991590864825028,
"loss": 0.234,
"mean_token_accuracy": 0.9243931770324707,
"num_tokens": 93966.0,
"step": 18
},
{
"epoch": 0.24050632911392406,
"grad_norm": 0.2799859642982483,
"learning_rate": 0.00019987891592190366,
"loss": 0.2141,
"mean_token_accuracy": 0.9284865260124207,
"num_tokens": 99078.0,
"step": 19
},
{
"epoch": 0.25316455696202533,
"grad_norm": 0.313972145318985,
"learning_rate": 0.00019983520312887785,
"loss": 0.1924,
"mean_token_accuracy": 0.9333333373069763,
"num_tokens": 104362.0,
"step": 20
},
{
"epoch": 0.26582278481012656,
"grad_norm": 0.2953855097293854,
"learning_rate": 0.00019978477321026282,
"loss": 0.2044,
"mean_token_accuracy": 0.9312687516212463,
"num_tokens": 109431.0,
"step": 21
},
{
"epoch": 0.27848101265822783,
"grad_norm": 0.25561973452568054,
"learning_rate": 0.0001997276295590912,
"loss": 0.1856,
"mean_token_accuracy": 0.9355758428573608,
"num_tokens": 114757.0,
"step": 22
},
{
"epoch": 0.2911392405063291,
"grad_norm": 0.3690224885940552,
"learning_rate": 0.00019966377602010984,
"loss": 0.214,
"mean_token_accuracy": 0.9297286868095398,
"num_tokens": 119944.0,
"step": 23
},
{
"epoch": 0.3037974683544304,
"grad_norm": 0.30690351128578186,
"learning_rate": 0.0001995932168895211,
"loss": 0.2016,
"mean_token_accuracy": 0.9312902688980103,
"num_tokens": 125131.0,
"step": 24
},
{
"epoch": 0.31645569620253167,
"grad_norm": 0.2413513958454132,
"learning_rate": 0.00019951595691469396,
"loss": 0.1891,
"mean_token_accuracy": 0.9348336458206177,
"num_tokens": 130305.0,
"step": 25
},
{
"epoch": 0.3291139240506329,
"grad_norm": 0.24211426079273224,
"learning_rate": 0.00019943200129384444,
"loss": 0.17,
"mean_token_accuracy": 0.9368179440498352,
"num_tokens": 135592.0,
"step": 26
},
{
"epoch": 0.34177215189873417,
"grad_norm": 0.2686380445957184,
"learning_rate": 0.0001993413556756859,
"loss": 0.1896,
"mean_token_accuracy": 0.9321302175521851,
"num_tokens": 140754.0,
"step": 27
},
{
"epoch": 0.35443037974683544,
"grad_norm": 0.23685204982757568,
"learning_rate": 0.0001992440261590491,
"loss": 0.1819,
"mean_token_accuracy": 0.9341317415237427,
"num_tokens": 145828.0,
"step": 28
},
{
"epoch": 0.3670886075949367,
"grad_norm": 0.2507152259349823,
"learning_rate": 0.00019914001929247167,
"loss": 0.1872,
"mean_token_accuracy": 0.9352476596832275,
"num_tokens": 151081.0,
"step": 29
},
{
"epoch": 0.379746835443038,
"grad_norm": 0.3149111270904541,
"learning_rate": 0.0001990293420737576,
"loss": 0.1856,
"mean_token_accuracy": 0.9363527297973633,
"num_tokens": 156157.0,
"step": 30
},
{
"epoch": 0.3924050632911392,
"grad_norm": 0.32569149136543274,
"learning_rate": 0.00019891200194950643,
"loss": 0.1871,
"mean_token_accuracy": 0.9361127018928528,
"num_tokens": 161402.0,
"step": 31
},
{
"epoch": 0.4050632911392405,
"grad_norm": 0.22079512476921082,
"learning_rate": 0.00019878800681461222,
"loss": 0.1797,
"mean_token_accuracy": 0.9368836283683777,
"num_tokens": 166536.0,
"step": 32
},
{
"epoch": 0.4177215189873418,
"grad_norm": 0.19111287593841553,
"learning_rate": 0.00019865736501173238,
"loss": 0.1579,
"mean_token_accuracy": 0.9415755867958069,
"num_tokens": 171906.0,
"step": 33
},
{
"epoch": 0.43037974683544306,
"grad_norm": 0.26968979835510254,
"learning_rate": 0.00019852008533072625,
"loss": 0.184,
"mean_token_accuracy": 0.9414872527122498,
"num_tokens": 177080.0,
"step": 34
},
{
"epoch": 0.4430379746835443,
"grad_norm": 0.22977136075496674,
"learning_rate": 0.00019837617700806383,
"loss": 0.1676,
"mean_token_accuracy": 0.939095139503479,
"num_tokens": 182316.0,
"step": 35
},
{
"epoch": 0.45569620253164556,
"grad_norm": 0.24089650809764862,
"learning_rate": 0.00019822564972620427,
"loss": 0.1625,
"mean_token_accuracy": 0.9419515132904053,
"num_tokens": 187617.0,
"step": 36
},
{
"epoch": 0.46835443037974683,
"grad_norm": 0.2149692326784134,
"learning_rate": 0.0001980685136129445,
"loss": 0.1676,
"mean_token_accuracy": 0.939225435256958,
"num_tokens": 192716.0,
"step": 37
},
{
"epoch": 0.4810126582278481,
"grad_norm": 0.26619356870651245,
"learning_rate": 0.00019790477924073755,
"loss": 0.1611,
"mean_token_accuracy": 0.9411424994468689,
"num_tokens": 197979.0,
"step": 38
},
{
"epoch": 0.4936708860759494,
"grad_norm": 0.23377306759357452,
"learning_rate": 0.00019773445762598163,
"loss": 0.1641,
"mean_token_accuracy": 0.9381566047668457,
"num_tokens": 203088.0,
"step": 39
},
{
"epoch": 0.5063291139240507,
"grad_norm": 0.19846892356872559,
"learning_rate": 0.00019755756022827846,
"loss": 0.1535,
"mean_token_accuracy": 0.9402109980583191,
"num_tokens": 208270.0,
"step": 40
},
{
"epoch": 0.5189873417721519,
"grad_norm": 0.23873910307884216,
"learning_rate": 0.00019737409894966267,
"loss": 0.1631,
"mean_token_accuracy": 0.9398959875106812,
"num_tokens": 213525.0,
"step": 41
},
{
"epoch": 0.5316455696202531,
"grad_norm": 0.20881879329681396,
"learning_rate": 0.00019718408613380074,
"loss": 0.1471,
"mean_token_accuracy": 0.9439833760261536,
"num_tokens": 218891.0,
"step": 42
},
{
"epoch": 0.5443037974683544,
"grad_norm": 0.2424459010362625,
"learning_rate": 0.00019698753456516048,
"loss": 0.1685,
"mean_token_accuracy": 0.9352998733520508,
"num_tokens": 224040.0,
"step": 43
},
{
"epoch": 0.5569620253164557,
"grad_norm": 0.21166983246803284,
"learning_rate": 0.00019678445746815107,
"loss": 0.1509,
"mean_token_accuracy": 0.9393350481987,
"num_tokens": 229247.0,
"step": 44
},
{
"epoch": 0.569620253164557,
"grad_norm": 0.1993303894996643,
"learning_rate": 0.00019657486850623306,
"loss": 0.1469,
"mean_token_accuracy": 0.943667471408844,
"num_tokens": 234459.0,
"step": 45
},
{
"epoch": 0.5822784810126582,
"grad_norm": 0.25715190172195435,
"learning_rate": 0.00019635878178099928,
"loss": 0.1526,
"mean_token_accuracy": 0.942389190196991,
"num_tokens": 239713.0,
"step": 46
},
{
"epoch": 0.5949367088607594,
"grad_norm": 0.24931733310222626,
"learning_rate": 0.0001961362118312259,
"loss": 0.1563,
"mean_token_accuracy": 0.939279317855835,
"num_tokens": 244800.0,
"step": 47
},
{
"epoch": 0.6075949367088608,
"grad_norm": 0.26232779026031494,
"learning_rate": 0.0001959071736318942,
"loss": 0.1557,
"mean_token_accuracy": 0.9432733058929443,
"num_tokens": 250082.0,
"step": 48
},
{
"epoch": 0.620253164556962,
"grad_norm": 0.1654760241508484,
"learning_rate": 0.00019567168259318325,
"loss": 0.1421,
"mean_token_accuracy": 0.9437916278839111,
"num_tokens": 255252.0,
"step": 49
},
{
"epoch": 0.6329113924050633,
"grad_norm": 0.21212145686149597,
"learning_rate": 0.00019542975455943281,
"loss": 0.162,
"mean_token_accuracy": 0.9394306540489197,
"num_tokens": 260269.0,
"step": 50
},
{
"epoch": 0.6455696202531646,
"grad_norm": 0.20102886855602264,
"learning_rate": 0.00019518140580807744,
"loss": 0.1506,
"mean_token_accuracy": 0.9436455368995667,
"num_tokens": 265479.0,
"step": 51
},
{
"epoch": 0.6582278481012658,
"grad_norm": 0.19386816024780273,
"learning_rate": 0.00019492665304855132,
"loss": 0.1509,
"mean_token_accuracy": 0.9443071484565735,
"num_tokens": 270804.0,
"step": 52
},
{
"epoch": 0.6708860759493671,
"grad_norm": 0.214805006980896,
"learning_rate": 0.0001946655134211639,
"loss": 0.1503,
"mean_token_accuracy": 0.9397239089012146,
"num_tokens": 276011.0,
"step": 53
},
{
"epoch": 0.6835443037974683,
"grad_norm": 0.21464605629444122,
"learning_rate": 0.0001943980044959468,
"loss": 0.1462,
"mean_token_accuracy": 0.9446601867675781,
"num_tokens": 281225.0,
"step": 54
},
{
"epoch": 0.6962025316455697,
"grad_norm": 0.18139995634555817,
"learning_rate": 0.0001941241442714716,
"loss": 0.1563,
"mean_token_accuracy": 0.9417494535446167,
"num_tokens": 286422.0,
"step": 55
},
{
"epoch": 0.7088607594936709,
"grad_norm": 0.19541846215724945,
"learning_rate": 0.0001938439511736388,
"loss": 0.1469,
"mean_token_accuracy": 0.9456856846809387,
"num_tokens": 291678.0,
"step": 56
},
{
"epoch": 0.7215189873417721,
"grad_norm": 0.17339253425598145,
"learning_rate": 0.0001935574440544381,
"loss": 0.1483,
"mean_token_accuracy": 0.94073486328125,
"num_tokens": 296804.0,
"step": 57
},
{
"epoch": 0.7341772151898734,
"grad_norm": 0.1698339283466339,
"learning_rate": 0.0001932646421906802,
"loss": 0.1499,
"mean_token_accuracy": 0.9414712190628052,
"num_tokens": 301857.0,
"step": 58
},
{
"epoch": 0.7468354430379747,
"grad_norm": 0.15577521920204163,
"learning_rate": 0.00019296556528269952,
"loss": 0.1367,
"mean_token_accuracy": 0.9456140398979187,
"num_tokens": 307051.0,
"step": 59
},
{
"epoch": 0.759493670886076,
"grad_norm": 0.1727830171585083,
"learning_rate": 0.00019266023345302887,
"loss": 0.1345,
"mean_token_accuracy": 0.9436017274856567,
"num_tokens": 312257.0,
"step": 60
},
{
"epoch": 0.7721518987341772,
"grad_norm": 0.21114714443683624,
"learning_rate": 0.00019234866724504555,
"loss": 0.1493,
"mean_token_accuracy": 0.9414653182029724,
"num_tokens": 317412.0,
"step": 61
},
{
"epoch": 0.7848101265822784,
"grad_norm": 0.16771085560321808,
"learning_rate": 0.00019203088762158915,
"loss": 0.1359,
"mean_token_accuracy": 0.9490300416946411,
"num_tokens": 322734.0,
"step": 62
},
{
"epoch": 0.7974683544303798,
"grad_norm": 0.2068631500005722,
"learning_rate": 0.00019170691596355114,
"loss": 0.1369,
"mean_token_accuracy": 0.9427874684333801,
"num_tokens": 328129.0,
"step": 63
},
{
"epoch": 0.810126582278481,
"grad_norm": 0.21625596284866333,
"learning_rate": 0.00019137677406843619,
"loss": 0.1337,
"mean_token_accuracy": 0.9430990219116211,
"num_tokens": 333272.0,
"step": 64
},
{
"epoch": 0.8227848101265823,
"grad_norm": 0.18965695798397064,
"learning_rate": 0.00019104048414889587,
"loss": 0.1402,
"mean_token_accuracy": 0.946105420589447,
"num_tokens": 338420.0,
"step": 65
},
{
"epoch": 0.8354430379746836,
"grad_norm": 0.2020321488380432,
"learning_rate": 0.00019069806883123387,
"loss": 0.144,
"mean_token_accuracy": 0.9439906477928162,
"num_tokens": 343626.0,
"step": 66
},
{
"epoch": 0.8481012658227848,
"grad_norm": 0.16373580694198608,
"learning_rate": 0.00019034955115388363,
"loss": 0.1305,
"mean_token_accuracy": 0.9499515295028687,
"num_tokens": 348845.0,
"step": 67
},
{
"epoch": 0.8607594936708861,
"grad_norm": 0.21636246144771576,
"learning_rate": 0.00018999495456585854,
"loss": 0.1379,
"mean_token_accuracy": 0.9468349814414978,
"num_tokens": 354138.0,
"step": 68
},
{
"epoch": 0.8734177215189873,
"grad_norm": 0.17930467426776886,
"learning_rate": 0.00018963430292517398,
"loss": 0.1435,
"mean_token_accuracy": 0.9450312852859497,
"num_tokens": 359314.0,
"step": 69
},
{
"epoch": 0.8860759493670886,
"grad_norm": 0.1796340048313141,
"learning_rate": 0.00018926762049724228,
"loss": 0.1377,
"mean_token_accuracy": 0.9456329941749573,
"num_tokens": 364473.0,
"step": 70
},
{
"epoch": 0.8987341772151899,
"grad_norm": 0.16919006407260895,
"learning_rate": 0.00018889493195323997,
"loss": 0.1388,
"mean_token_accuracy": 0.9469609260559082,
"num_tokens": 369703.0,
"step": 71
},
{
"epoch": 0.9113924050632911,
"grad_norm": 0.1674400418996811,
"learning_rate": 0.00018851626236844786,
"loss": 0.1344,
"mean_token_accuracy": 0.9464495778083801,
"num_tokens": 374865.0,
"step": 72
},
{
"epoch": 0.9240506329113924,
"grad_norm": 0.16778463125228882,
"learning_rate": 0.00018813163722056396,
"loss": 0.1444,
"mean_token_accuracy": 0.9406762719154358,
"num_tokens": 379986.0,
"step": 73
},
{
"epoch": 0.9367088607594937,
"grad_norm": 0.15615388751029968,
"learning_rate": 0.0001877410823879893,
"loss": 0.1285,
"mean_token_accuracy": 0.9444658160209656,
"num_tokens": 385254.0,
"step": 74
},
{
"epoch": 0.9493670886075949,
"grad_norm": 0.18973414599895477,
"learning_rate": 0.0001873446241480868,
"loss": 0.1351,
"mean_token_accuracy": 0.9457808136940002,
"num_tokens": 390556.0,
"step": 75
},
{
"epoch": 0.9620253164556962,
"grad_norm": 0.1932706981897354,
"learning_rate": 0.00018694228917541313,
"loss": 0.1345,
"mean_token_accuracy": 0.9486399292945862,
"num_tokens": 395877.0,
"step": 76
},
{
"epoch": 0.9746835443037974,
"grad_norm": 0.21864649653434753,
"learning_rate": 0.00018653410453992413,
"loss": 0.1331,
"mean_token_accuracy": 0.9453898072242737,
"num_tokens": 400995.0,
"step": 77
},
{
"epoch": 0.9873417721518988,
"grad_norm": 0.16413134336471558,
"learning_rate": 0.0001861200977051535,
"loss": 0.1308,
"mean_token_accuracy": 0.9469521641731262,
"num_tokens": 406243.0,
"step": 78
},
{
"epoch": 1.0,
"grad_norm": 0.22194692492485046,
"learning_rate": 0.0001857002965263648,
"loss": 0.1345,
"mean_token_accuracy": 0.9429290294647217,
"num_tokens": 411476.0,
"step": 79
},
{
"epoch": 1.0126582278481013,
"grad_norm": 0.15325264632701874,
"learning_rate": 0.00018527472924867756,
"loss": 0.1321,
"mean_token_accuracy": 0.9436901211738586,
"num_tokens": 416548.0,
"step": 80
},
{
"epoch": 1.0253164556962024,
"grad_norm": 0.18894121050834656,
"learning_rate": 0.00018484342450516671,
"loss": 0.1278,
"mean_token_accuracy": 0.9453338384628296,
"num_tokens": 421734.0,
"step": 81
},
{
"epoch": 1.0379746835443038,
"grad_norm": 0.2188521921634674,
"learning_rate": 0.0001844064113149361,
"loss": 0.1267,
"mean_token_accuracy": 0.9463608860969543,
"num_tokens": 427074.0,
"step": 82
},
{
"epoch": 1.0506329113924051,
"grad_norm": 0.27444732189178467,
"learning_rate": 0.0001839637190811661,
"loss": 0.1249,
"mean_token_accuracy": 0.946395218372345,
"num_tokens": 432492.0,
"step": 83
},
{
"epoch": 1.0632911392405062,
"grad_norm": 0.14062751829624176,
"learning_rate": 0.00018351537758913518,
"loss": 0.1205,
"mean_token_accuracy": 0.9433669447898865,
"num_tokens": 437712.0,
"step": 84
},
{
"epoch": 1.0759493670886076,
"grad_norm": 0.2686416804790497,
"learning_rate": 0.00018306141700421606,
"loss": 0.1285,
"mean_token_accuracy": 0.9453015327453613,
"num_tokens": 442767.0,
"step": 85
},
{
"epoch": 1.0886075949367089,
"grad_norm": 0.1684628427028656,
"learning_rate": 0.000182601867869846,
"loss": 0.1381,
"mean_token_accuracy": 0.9451888203620911,
"num_tokens": 447757.0,
"step": 86
},
{
"epoch": 1.1012658227848102,
"grad_norm": 0.21591678261756897,
"learning_rate": 0.00018213676110547176,
"loss": 0.1363,
"mean_token_accuracy": 0.9451231956481934,
"num_tokens": 452814.0,
"step": 87
},
{
"epoch": 1.1139240506329113,
"grad_norm": 0.22342060506343842,
"learning_rate": 0.0001816661280044693,
"loss": 0.1395,
"mean_token_accuracy": 0.9416748881340027,
"num_tokens": 457953.0,
"step": 88
},
{
"epoch": 1.1265822784810127,
"grad_norm": 0.15861928462982178,
"learning_rate": 0.00018119000023203837,
"loss": 0.1298,
"mean_token_accuracy": 0.9489896297454834,
"num_tokens": 463114.0,
"step": 89
},
{
"epoch": 1.139240506329114,
"grad_norm": 0.14701464772224426,
"learning_rate": 0.0001807084098230719,
"loss": 0.1247,
"mean_token_accuracy": 0.9497681856155396,
"num_tokens": 468354.0,
"step": 90
},
{
"epoch": 1.1518987341772151,
"grad_norm": 0.11642320454120636,
"learning_rate": 0.0001802213891800007,
"loss": 0.1212,
"mean_token_accuracy": 0.949401319026947,
"num_tokens": 473596.0,
"step": 91
},
{
"epoch": 1.1645569620253164,
"grad_norm": 0.15525047481060028,
"learning_rate": 0.00017972897107061328,
"loss": 0.126,
"mean_token_accuracy": 0.9478814601898193,
"num_tokens": 478687.0,
"step": 92
},
{
"epoch": 1.1772151898734178,
"grad_norm": 0.15354906022548676,
"learning_rate": 0.00017923118862585123,
"loss": 0.1305,
"mean_token_accuracy": 0.9484842419624329,
"num_tokens": 483798.0,
"step": 93
},
{
"epoch": 1.189873417721519,
"grad_norm": 0.16433700919151306,
"learning_rate": 0.00017872807533758007,
"loss": 0.1331,
"mean_token_accuracy": 0.9448692202568054,
"num_tokens": 488832.0,
"step": 94
},
{
"epoch": 1.2025316455696202,
"grad_norm": 0.14196732640266418,
"learning_rate": 0.00017821966505633587,
"loss": 0.1252,
"mean_token_accuracy": 0.9504452347755432,
"num_tokens": 494062.0,
"step": 95
},
{
"epoch": 1.2151898734177216,
"grad_norm": 0.15048350393772125,
"learning_rate": 0.00017770599198904763,
"loss": 0.128,
"mean_token_accuracy": 0.9498940110206604,
"num_tokens": 499315.0,
"step": 96
},
{
"epoch": 1.2278481012658227,
"grad_norm": 0.19549059867858887,
"learning_rate": 0.00017718709069673594,
"loss": 0.1345,
"mean_token_accuracy": 0.9464973211288452,
"num_tokens": 504575.0,
"step": 97
},
{
"epoch": 1.240506329113924,
"grad_norm": 0.1423873007297516,
"learning_rate": 0.00017666299609218745,
"loss": 0.1245,
"mean_token_accuracy": 0.9458649754524231,
"num_tokens": 509645.0,
"step": 98
},
{
"epoch": 1.2531645569620253,
"grad_norm": 0.1903885006904602,
"learning_rate": 0.00017613374343760594,
"loss": 0.1306,
"mean_token_accuracy": 0.9471228718757629,
"num_tokens": 514853.0,
"step": 99
},
{
"epoch": 1.2658227848101267,
"grad_norm": 0.15726621448993683,
"learning_rate": 0.00017559936834223982,
"loss": 0.1273,
"mean_token_accuracy": 0.9503991007804871,
"num_tokens": 520179.0,
"step": 100
},
{
"epoch": 1.2784810126582278,
"grad_norm": 0.12970785796642303,
"learning_rate": 0.0001750599067599863,
"loss": 0.1249,
"mean_token_accuracy": 0.9486523866653442,
"num_tokens": 525326.0,
"step": 101
},
{
"epoch": 1.2911392405063291,
"grad_norm": 0.16852085292339325,
"learning_rate": 0.00017451539498697225,
"loss": 0.1302,
"mean_token_accuracy": 0.9456775784492493,
"num_tokens": 530526.0,
"step": 102
},
{
"epoch": 1.3037974683544304,
"grad_norm": 0.1304207593202591,
"learning_rate": 0.0001739658696591121,
"loss": 0.126,
"mean_token_accuracy": 0.9477406740188599,
"num_tokens": 535680.0,
"step": 103
},
{
"epoch": 1.3164556962025316,
"grad_norm": 0.12224633246660233,
"learning_rate": 0.00017341136774964307,
"loss": 0.1283,
"mean_token_accuracy": 0.9467939734458923,
"num_tokens": 540875.0,
"step": 104
},
{
"epoch": 1.3291139240506329,
"grad_norm": 0.15364806354045868,
"learning_rate": 0.0001728519265666373,
"loss": 0.1235,
"mean_token_accuracy": 0.9479364156723022,
"num_tokens": 546221.0,
"step": 105
},
{
"epoch": 1.3417721518987342,
"grad_norm": 0.122112937271595,
"learning_rate": 0.00017228758375049185,
"loss": 0.1245,
"mean_token_accuracy": 0.943025529384613,
"num_tokens": 551375.0,
"step": 106
},
{
"epoch": 1.3544303797468356,
"grad_norm": 0.12079890817403793,
"learning_rate": 0.00017171837727139613,
"loss": 0.1232,
"mean_token_accuracy": 0.9487327337265015,
"num_tokens": 556647.0,
"step": 107
},
{
"epoch": 1.3670886075949367,
"grad_norm": 0.22763219475746155,
"learning_rate": 0.0001711443454267772,
"loss": 0.1286,
"mean_token_accuracy": 0.9476664662361145,
"num_tokens": 561832.0,
"step": 108
},
{
"epoch": 1.379746835443038,
"grad_norm": 0.14368991553783417,
"learning_rate": 0.00017056552683872292,
"loss": 0.1206,
"mean_token_accuracy": 0.9500395059585571,
"num_tokens": 566960.0,
"step": 109
},
{
"epoch": 1.3924050632911391,
"grad_norm": 0.137187197804451,
"learning_rate": 0.00016998196045138353,
"loss": 0.1196,
"mean_token_accuracy": 0.9471749067306519,
"num_tokens": 572192.0,
"step": 110
},
{
"epoch": 1.4050632911392404,
"grad_norm": 0.12349066883325577,
"learning_rate": 0.00016939368552835137,
"loss": 0.1191,
"mean_token_accuracy": 0.9507257342338562,
"num_tokens": 577492.0,
"step": 111
},
{
"epoch": 1.4177215189873418,
"grad_norm": 0.1606503129005432,
"learning_rate": 0.00016880074165001905,
"loss": 0.1308,
"mean_token_accuracy": 0.951308012008667,
"num_tokens": 582793.0,
"step": 112
},
{
"epoch": 1.4303797468354431,
"grad_norm": 0.1452348381280899,
"learning_rate": 0.0001682031687109165,
"loss": 0.1236,
"mean_token_accuracy": 0.9501745104789734,
"num_tokens": 588015.0,
"step": 113
},
{
"epoch": 1.4430379746835442,
"grad_norm": 0.1393907517194748,
"learning_rate": 0.00016760100691702674,
"loss": 0.1215,
"mean_token_accuracy": 0.953479528427124,
"num_tokens": 593324.0,
"step": 114
},
{
"epoch": 1.4556962025316456,
"grad_norm": 0.17773191630840302,
"learning_rate": 0.0001669942967830807,
"loss": 0.1272,
"mean_token_accuracy": 0.9480122327804565,
"num_tokens": 598620.0,
"step": 115
},
{
"epoch": 1.4683544303797469,
"grad_norm": 0.1251114010810852,
"learning_rate": 0.00016638307912983136,
"loss": 0.1253,
"mean_token_accuracy": 0.9470962882041931,
"num_tokens": 603712.0,
"step": 116
},
{
"epoch": 1.481012658227848,
"grad_norm": 0.2559885084629059,
"learning_rate": 0.00016576739508130726,
"loss": 0.1275,
"mean_token_accuracy": 0.9498353600502014,
"num_tokens": 608939.0,
"step": 117
},
{
"epoch": 1.4936708860759493,
"grad_norm": 0.1673833280801773,
"learning_rate": 0.0001651472860620455,
"loss": 0.1252,
"mean_token_accuracy": 0.9469268321990967,
"num_tokens": 614128.0,
"step": 118
},
{
"epoch": 1.5063291139240507,
"grad_norm": 0.13037990033626556,
"learning_rate": 0.00016452279379430463,
"loss": 0.1231,
"mean_token_accuracy": 0.9495947957038879,
"num_tokens": 619251.0,
"step": 119
},
{
"epoch": 1.518987341772152,
"grad_norm": 0.11066332459449768,
"learning_rate": 0.00016389396029525762,
"loss": 0.1203,
"mean_token_accuracy": 0.9498069286346436,
"num_tokens": 624495.0,
"step": 120
},
{
"epoch": 1.5316455696202531,
"grad_norm": 0.1207226887345314,
"learning_rate": 0.0001632608278741646,
"loss": 0.1223,
"mean_token_accuracy": 0.948310136795044,
"num_tokens": 629589.0,
"step": 121
},
{
"epoch": 1.5443037974683544,
"grad_norm": 0.1282467097043991,
"learning_rate": 0.00016262343912952656,
"loss": 0.123,
"mean_token_accuracy": 0.9489855170249939,
"num_tokens": 634828.0,
"step": 122
},
{
"epoch": 1.5569620253164556,
"grad_norm": 0.16653472185134888,
"learning_rate": 0.0001619818369462188,
"loss": 0.1274,
"mean_token_accuracy": 0.947590708732605,
"num_tokens": 640101.0,
"step": 123
},
{
"epoch": 1.5696202531645569,
"grad_norm": 0.1379830688238144,
"learning_rate": 0.0001613360644926059,
"loss": 0.12,
"mean_token_accuracy": 0.9533698558807373,
"num_tokens": 645462.0,
"step": 124
},
{
"epoch": 1.5822784810126582,
"grad_norm": 0.1411072164773941,
"learning_rate": 0.00016068616521763707,
"loss": 0.1246,
"mean_token_accuracy": 0.9507206678390503,
"num_tokens": 650660.0,
"step": 125
},
{
"epoch": 1.5949367088607596,
"grad_norm": 0.15294188261032104,
"learning_rate": 0.00016003218284792298,
"loss": 0.1247,
"mean_token_accuracy": 0.9487677216529846,
"num_tokens": 655877.0,
"step": 126
},
{
"epoch": 1.6075949367088609,
"grad_norm": 0.1204475536942482,
"learning_rate": 0.00015937416138479344,
"loss": 0.1175,
"mean_token_accuracy": 0.9533510804176331,
"num_tokens": 661193.0,
"step": 127
},
{
"epoch": 1.620253164556962,
"grad_norm": 0.13293962180614471,
"learning_rate": 0.0001587121451013373,
"loss": 0.1223,
"mean_token_accuracy": 0.9472352266311646,
"num_tokens": 666393.0,
"step": 128
},
{
"epoch": 1.6329113924050633,
"grad_norm": 0.11509446054697037,
"learning_rate": 0.0001580461785394233,
"loss": 0.118,
"mean_token_accuracy": 0.9501758217811584,
"num_tokens": 671575.0,
"step": 129
},
{
"epoch": 1.6455696202531644,
"grad_norm": 0.11632049083709717,
"learning_rate": 0.00015737630650670335,
"loss": 0.1198,
"mean_token_accuracy": 0.9511387944221497,
"num_tokens": 676776.0,
"step": 130
},
{
"epoch": 1.6582278481012658,
"grad_norm": 0.14730048179626465,
"learning_rate": 0.00015670257407359792,
"loss": 0.1179,
"mean_token_accuracy": 0.948544979095459,
"num_tokens": 682029.0,
"step": 131
},
{
"epoch": 1.6708860759493671,
"grad_norm": 0.169641375541687,
"learning_rate": 0.00015602502657026328,
"loss": 0.1234,
"mean_token_accuracy": 0.9496759176254272,
"num_tokens": 687339.0,
"step": 132
},
{
"epoch": 1.6835443037974684,
"grad_norm": 0.10720019787549973,
"learning_rate": 0.00015534370958354186,
"loss": 0.1192,
"mean_token_accuracy": 0.950038731098175,
"num_tokens": 692567.0,
"step": 133
},
{
"epoch": 1.6962025316455698,
"grad_norm": 0.14673638343811035,
"learning_rate": 0.00015465866895389495,
"loss": 0.1232,
"mean_token_accuracy": 0.9517359733581543,
"num_tokens": 697873.0,
"step": 134
},
{
"epoch": 1.7088607594936709,
"grad_norm": 0.11593678593635559,
"learning_rate": 0.00015396995077231854,
"loss": 0.1194,
"mean_token_accuracy": 0.9523058533668518,
"num_tokens": 703011.0,
"step": 135
},
{
"epoch": 1.721518987341772,
"grad_norm": 0.09349008649587631,
"learning_rate": 0.00015327760137724212,
"loss": 0.122,
"mean_token_accuracy": 0.9510685205459595,
"num_tokens": 708082.0,
"step": 136
},
{
"epoch": 1.7341772151898733,
"grad_norm": 0.10837123543024063,
"learning_rate": 0.00015258166735141092,
"loss": 0.1214,
"mean_token_accuracy": 0.9500493407249451,
"num_tokens": 713211.0,
"step": 137
},
{
"epoch": 1.7468354430379747,
"grad_norm": 0.10963979363441467,
"learning_rate": 0.0001518821955187519,
"loss": 0.1199,
"mean_token_accuracy": 0.9493547081947327,
"num_tokens": 718389.0,
"step": 138
},
{
"epoch": 1.759493670886076,
"grad_norm": 0.108366958796978,
"learning_rate": 0.00015117923294122312,
"loss": 0.1182,
"mean_token_accuracy": 0.9521881341934204,
"num_tokens": 723640.0,
"step": 139
},
{
"epoch": 1.7721518987341773,
"grad_norm": 0.10612353682518005,
"learning_rate": 0.0001504728269156475,
"loss": 0.1173,
"mean_token_accuracy": 0.9468570351600647,
"num_tokens": 728747.0,
"step": 140
},
{
"epoch": 1.7848101265822784,
"grad_norm": 0.10319573432207108,
"learning_rate": 0.00014976302497053036,
"loss": 0.1121,
"mean_token_accuracy": 0.9531159400939941,
"num_tokens": 733994.0,
"step": 141
},
{
"epoch": 1.7974683544303798,
"grad_norm": 0.11267366260290146,
"learning_rate": 0.00014904987486286184,
"loss": 0.1137,
"mean_token_accuracy": 0.9541195034980774,
"num_tokens": 739180.0,
"step": 142
},
{
"epoch": 1.810126582278481,
"grad_norm": 0.13383233547210693,
"learning_rate": 0.00014833342457490361,
"loss": 0.1214,
"mean_token_accuracy": 0.9502696394920349,
"num_tokens": 744251.0,
"step": 143
},
{
"epoch": 1.8227848101265822,
"grad_norm": 0.17001107335090637,
"learning_rate": 0.00014761372231096047,
"loss": 0.1157,
"mean_token_accuracy": 0.9521386623382568,
"num_tokens": 749622.0,
"step": 144
},
{
"epoch": 1.8354430379746836,
"grad_norm": 0.12594255805015564,
"learning_rate": 0.00014689081649413708,
"loss": 0.1182,
"mean_token_accuracy": 0.9487131237983704,
"num_tokens": 754970.0,
"step": 145
},
{
"epoch": 1.8481012658227849,
"grad_norm": 0.1139696016907692,
"learning_rate": 0.00014616475576308005,
"loss": 0.1211,
"mean_token_accuracy": 0.9446545839309692,
"num_tokens": 760057.0,
"step": 146
},
{
"epoch": 1.8607594936708862,
"grad_norm": 0.11146289855241776,
"learning_rate": 0.00014543558896870531,
"loss": 0.1165,
"mean_token_accuracy": 0.949729323387146,
"num_tokens": 765293.0,
"step": 147
},
{
"epoch": 1.8734177215189873,
"grad_norm": 0.11601708829402924,
"learning_rate": 0.0001447033651709114,
"loss": 0.1216,
"mean_token_accuracy": 0.9519582986831665,
"num_tokens": 770540.0,
"step": 148
},
{
"epoch": 1.8860759493670884,
"grad_norm": 0.1349141150712967,
"learning_rate": 0.0001439681336352785,
"loss": 0.1134,
"mean_token_accuracy": 0.9564322829246521,
"num_tokens": 775952.0,
"step": 149
},
{
"epoch": 1.8987341772151898,
"grad_norm": 0.11901061981916428,
"learning_rate": 0.00014322994382975386,
"loss": 0.1158,
"mean_token_accuracy": 0.9476328492164612,
"num_tokens": 781191.0,
"step": 150
},
{
"epoch": 1.9113924050632911,
"grad_norm": 0.10183963924646378,
"learning_rate": 0.0001424888454213235,
"loss": 0.1222,
"mean_token_accuracy": 0.949402391910553,
"num_tokens": 786275.0,
"step": 151
},
{
"epoch": 1.9240506329113924,
"grad_norm": 0.10988782346248627,
"learning_rate": 0.0001417448882726703,
"loss": 0.1206,
"mean_token_accuracy": 0.950117826461792,
"num_tokens": 791431.0,
"step": 152
},
{
"epoch": 1.9367088607594938,
"grad_norm": 0.11146315932273865,
"learning_rate": 0.00014099812243881948,
"loss": 0.1154,
"mean_token_accuracy": 0.9520351886749268,
"num_tokens": 796728.0,
"step": 153
},
{
"epoch": 1.9493670886075949,
"grad_norm": 0.09734103083610535,
"learning_rate": 0.00014024859816377046,
"loss": 0.1144,
"mean_token_accuracy": 0.9512288570404053,
"num_tokens": 802000.0,
"step": 154
},
{
"epoch": 1.9620253164556962,
"grad_norm": 0.09847570210695267,
"learning_rate": 0.00013949636587711644,
"loss": 0.1162,
"mean_token_accuracy": 0.9531669616699219,
"num_tokens": 807274.0,
"step": 155
},
{
"epoch": 1.9746835443037973,
"grad_norm": 0.11049605160951614,
"learning_rate": 0.0001387414761906516,
"loss": 0.1168,
"mean_token_accuracy": 0.9521486163139343,
"num_tokens": 812667.0,
"step": 156
},
{
"epoch": 1.9873417721518987,
"grad_norm": 0.12828807532787323,
"learning_rate": 0.00013798397989496549,
"loss": 0.1213,
"mean_token_accuracy": 0.9485089182853699,
"num_tokens": 817761.0,
"step": 157
},
{
"epoch": 2.0,
"grad_norm": 0.08749315142631531,
"learning_rate": 0.00013722392795602594,
"loss": 0.1153,
"mean_token_accuracy": 0.9507448077201843,
"num_tokens": 822860.0,
"step": 158
},
{
"epoch": 2.0126582278481013,
"grad_norm": 0.1040758490562439,
"learning_rate": 0.0001364613715117499,
"loss": 0.113,
"mean_token_accuracy": 0.9519175887107849,
"num_tokens": 828165.0,
"step": 159
},
{
"epoch": 2.0253164556962027,
"grad_norm": 0.1114276871085167,
"learning_rate": 0.00013569636186856288,
"loss": 0.1109,
"mean_token_accuracy": 0.9505388736724854,
"num_tokens": 833425.0,
"step": 160
},
{
"epoch": 2.037974683544304,
"grad_norm": 0.0839025005698204,
"learning_rate": 0.0001349289504979467,
"loss": 0.1154,
"mean_token_accuracy": 0.9530664682388306,
"num_tokens": 838560.0,
"step": 161
},
{
"epoch": 2.050632911392405,
"grad_norm": 0.09230242669582367,
"learning_rate": 0.0001341591890329766,
"loss": 0.1146,
"mean_token_accuracy": 0.9486173987388611,
"num_tokens": 843723.0,
"step": 162
},
{
"epoch": 2.0632911392405062,
"grad_norm": 0.07964486628770828,
"learning_rate": 0.00013338712926484725,
"loss": 0.1095,
"mean_token_accuracy": 0.9523173570632935,
"num_tokens": 849030.0,
"step": 163
},
{
"epoch": 2.0759493670886076,
"grad_norm": 0.12312997877597809,
"learning_rate": 0.00013261282313938795,
"loss": 0.1161,
"mean_token_accuracy": 0.950698733329773,
"num_tokens": 854246.0,
"step": 164
},
{
"epoch": 2.088607594936709,
"grad_norm": 0.11605784296989441,
"learning_rate": 0.00013183632275356777,
"loss": 0.1129,
"mean_token_accuracy": 0.9517543911933899,
"num_tokens": 859554.0,
"step": 165
},
{
"epoch": 2.1012658227848102,
"grad_norm": 0.09419958293437958,
"learning_rate": 0.00013105768035199034,
"loss": 0.112,
"mean_token_accuracy": 0.950269877910614,
"num_tokens": 864806.0,
"step": 166
},
{
"epoch": 2.1139240506329116,
"grad_norm": 0.11429665982723236,
"learning_rate": 0.0001302769483233786,
"loss": 0.1137,
"mean_token_accuracy": 0.9541642069816589,
"num_tokens": 869997.0,
"step": 167
},
{
"epoch": 2.1265822784810124,
"grad_norm": 0.11947552114725113,
"learning_rate": 0.00012949417919705007,
"loss": 0.116,
"mean_token_accuracy": 0.9537324905395508,
"num_tokens": 875205.0,
"step": 168
},
{
"epoch": 2.1392405063291138,
"grad_norm": 0.13403531908988953,
"learning_rate": 0.00012870942563938264,
"loss": 0.1182,
"mean_token_accuracy": 0.9547651410102844,
"num_tokens": 880442.0,
"step": 169
},
{
"epoch": 2.151898734177215,
"grad_norm": 0.09392501413822174,
"learning_rate": 0.0001279227404502709,
"loss": 0.1148,
"mean_token_accuracy": 0.9532988667488098,
"num_tokens": 885538.0,
"step": 170
},
{
"epoch": 2.1645569620253164,
"grad_norm": 0.13457965850830078,
"learning_rate": 0.00012713417655957376,
"loss": 0.1151,
"mean_token_accuracy": 0.9484173655509949,
"num_tokens": 890720.0,
"step": 171
},
{
"epoch": 2.1772151898734178,
"grad_norm": 0.096675805747509,
"learning_rate": 0.00012634378702355313,
"loss": 0.1109,
"mean_token_accuracy": 0.9544493556022644,
"num_tokens": 895987.0,
"step": 172
},
{
"epoch": 2.189873417721519,
"grad_norm": 0.09749137610197067,
"learning_rate": 0.00012555162502130433,
"loss": 0.1102,
"mean_token_accuracy": 0.9534346461296082,
"num_tokens": 901248.0,
"step": 173
},
{
"epoch": 2.2025316455696204,
"grad_norm": 0.09648600965738297,
"learning_rate": 0.00012475774385117786,
"loss": 0.1132,
"mean_token_accuracy": 0.9511432647705078,
"num_tokens": 906429.0,
"step": 174
},
{
"epoch": 2.2151898734177213,
"grad_norm": 0.11956477910280228,
"learning_rate": 0.00012396219692719363,
"loss": 0.1159,
"mean_token_accuracy": 0.9516765475273132,
"num_tokens": 911563.0,
"step": 175
},
{
"epoch": 2.2278481012658227,
"grad_norm": 0.11230012029409409,
"learning_rate": 0.000123165037775447,
"loss": 0.1129,
"mean_token_accuracy": 0.951176106929779,
"num_tokens": 916686.0,
"step": 176
},
{
"epoch": 2.240506329113924,
"grad_norm": 0.13427633047103882,
"learning_rate": 0.00012236632003050736,
"loss": 0.1191,
"mean_token_accuracy": 0.9477163553237915,
"num_tokens": 921742.0,
"step": 177
},
{
"epoch": 2.2531645569620253,
"grad_norm": 0.1290883868932724,
"learning_rate": 0.00012156609743180969,
"loss": 0.1127,
"mean_token_accuracy": 0.950269877910614,
"num_tokens": 926994.0,
"step": 178
},
{
"epoch": 2.2658227848101267,
"grad_norm": 0.08057372272014618,
"learning_rate": 0.0001207644238200387,
"loss": 0.1125,
"mean_token_accuracy": 0.9483300447463989,
"num_tokens": 932148.0,
"step": 179
},
{
"epoch": 2.278481012658228,
"grad_norm": 0.11464843153953552,
"learning_rate": 0.00011996135313350636,
"loss": 0.1165,
"mean_token_accuracy": 0.9480494260787964,
"num_tokens": 937390.0,
"step": 180
},
{
"epoch": 2.291139240506329,
"grad_norm": 0.1148659810423851,
"learning_rate": 0.0001191569394045228,
"loss": 0.1135,
"mean_token_accuracy": 0.9494910836219788,
"num_tokens": 942661.0,
"step": 181
},
{
"epoch": 2.3037974683544302,
"grad_norm": 0.1096266508102417,
"learning_rate": 0.00011835123675576092,
"loss": 0.1108,
"mean_token_accuracy": 0.9535801410675049,
"num_tokens": 948046.0,
"step": 182
},
{
"epoch": 2.3164556962025316,
"grad_norm": 0.11258285492658615,
"learning_rate": 0.0001175442993966149,
"loss": 0.1116,
"mean_token_accuracy": 0.9536716938018799,
"num_tokens": 953312.0,
"step": 183
},
{
"epoch": 2.329113924050633,
"grad_norm": 0.09487363696098328,
"learning_rate": 0.00011673618161955288,
"loss": 0.1123,
"mean_token_accuracy": 0.9542192220687866,
"num_tokens": 958531.0,
"step": 184
},
{
"epoch": 2.3417721518987342,
"grad_norm": 0.10504362732172012,
"learning_rate": 0.00011592693779646405,
"loss": 0.1091,
"mean_token_accuracy": 0.9548643827438354,
"num_tokens": 963868.0,
"step": 185
},
{
"epoch": 2.3544303797468356,
"grad_norm": 0.10166207700967789,
"learning_rate": 0.00011511662237500032,
"loss": 0.111,
"mean_token_accuracy": 0.9527420997619629,
"num_tokens": 969074.0,
"step": 186
},
{
"epoch": 2.367088607594937,
"grad_norm": 0.0899074450135231,
"learning_rate": 0.00011430528987491305,
"loss": 0.1134,
"mean_token_accuracy": 0.9507843255996704,
"num_tokens": 974238.0,
"step": 187
},
{
"epoch": 2.379746835443038,
"grad_norm": 0.08563630282878876,
"learning_rate": 0.00011349299488438485,
"loss": 0.11,
"mean_token_accuracy": 0.955788254737854,
"num_tokens": 979459.0,
"step": 188
},
{
"epoch": 2.392405063291139,
"grad_norm": 0.11500842124223709,
"learning_rate": 0.00011267979205635675,
"loss": 0.1091,
"mean_token_accuracy": 0.954186737537384,
"num_tokens": 984718.0,
"step": 189
},
{
"epoch": 2.4050632911392404,
"grad_norm": 0.092518649995327,
"learning_rate": 0.00011186573610485098,
"loss": 0.1149,
"mean_token_accuracy": 0.9542879462242126,
"num_tokens": 989901.0,
"step": 190
},
{
"epoch": 2.4177215189873418,
"grad_norm": 0.11641688644886017,
"learning_rate": 0.00011105088180128976,
"loss": 0.1163,
"mean_token_accuracy": 0.9520922899246216,
"num_tokens": 995079.0,
"step": 191
},
{
"epoch": 2.430379746835443,
"grad_norm": 0.10992075502872467,
"learning_rate": 0.00011023528397081011,
"loss": 0.1131,
"mean_token_accuracy": 0.9550126194953918,
"num_tokens": 1000300.0,
"step": 192
},
{
"epoch": 2.4430379746835444,
"grad_norm": 0.12892654538154602,
"learning_rate": 0.0001094189974885752,
"loss": 0.1174,
"mean_token_accuracy": 0.9511012434959412,
"num_tokens": 1005313.0,
"step": 193
},
{
"epoch": 2.4556962025316453,
"grad_norm": 0.10617399960756302,
"learning_rate": 0.00010860207727608214,
"loss": 0.1162,
"mean_token_accuracy": 0.9493392109870911,
"num_tokens": 1010371.0,
"step": 194
},
{
"epoch": 2.4683544303797467,
"grad_norm": 0.1117515116930008,
"learning_rate": 0.00010778457829746666,
"loss": 0.1132,
"mean_token_accuracy": 0.9525145292282104,
"num_tokens": 1015426.0,
"step": 195
},
{
"epoch": 2.481012658227848,
"grad_norm": 0.09666470438241959,
"learning_rate": 0.00010696655555580524,
"loss": 0.1123,
"mean_token_accuracy": 0.9508653283119202,
"num_tokens": 1020517.0,
"step": 196
},
{
"epoch": 2.4936708860759493,
"grad_norm": 0.13866201043128967,
"learning_rate": 0.00010614806408941422,
"loss": 0.112,
"mean_token_accuracy": 0.9557572603225708,
"num_tokens": 1025870.0,
"step": 197
},
{
"epoch": 2.5063291139240507,
"grad_norm": 0.0827043205499649,
"learning_rate": 0.00010532915896814672,
"loss": 0.1095,
"mean_token_accuracy": 0.9521714448928833,
"num_tokens": 1031161.0,
"step": 198
},
{
"epoch": 2.518987341772152,
"grad_norm": 0.09126809984445572,
"learning_rate": 0.00010450989528968746,
"loss": 0.1111,
"mean_token_accuracy": 0.951029896736145,
"num_tokens": 1036371.0,
"step": 199
},
{
"epoch": 2.5316455696202533,
"grad_norm": 0.0837259516119957,
"learning_rate": 0.00010369032817584561,
"loss": 0.114,
"mean_token_accuracy": 0.9502448439598083,
"num_tokens": 1041540.0,
"step": 200
},
{
"epoch": 2.5443037974683547,
"grad_norm": 0.09508928656578064,
"learning_rate": 0.00010287051276884618,
"loss": 0.115,
"mean_token_accuracy": 0.9502407908439636,
"num_tokens": 1046588.0,
"step": 201
},
{
"epoch": 2.5569620253164556,
"grad_norm": 0.10246361792087555,
"learning_rate": 0.00010205050422761988,
"loss": 0.1143,
"mean_token_accuracy": 0.947189450263977,
"num_tokens": 1051651.0,
"step": 202
},
{
"epoch": 2.569620253164557,
"grad_norm": 0.11269509047269821,
"learning_rate": 0.00010123035772409184,
"loss": 0.1159,
"mean_token_accuracy": 0.951171875,
"num_tokens": 1056835.0,
"step": 203
},
{
"epoch": 2.5822784810126582,
"grad_norm": 0.19371971487998962,
"learning_rate": 0.0001004101284394696,
"loss": 0.1139,
"mean_token_accuracy": 0.9502364993095398,
"num_tokens": 1062184.0,
"step": 204
},
{
"epoch": 2.5949367088607596,
"grad_norm": 0.07230806350708008,
"learning_rate": 9.958987156053045e-05,
"loss": 0.1075,
"mean_token_accuracy": 0.9555003643035889,
"num_tokens": 1067484.0,
"step": 205
},
{
"epoch": 2.607594936708861,
"grad_norm": 0.08113159984350204,
"learning_rate": 9.87696422759082e-05,
"loss": 0.1088,
"mean_token_accuracy": 0.9582512974739075,
"num_tokens": 1072626.0,
"step": 206
},
{
"epoch": 2.620253164556962,
"grad_norm": 0.1027611568570137,
"learning_rate": 9.794949577238013e-05,
"loss": 0.111,
"mean_token_accuracy": 0.9528957605361938,
"num_tokens": 1077870.0,
"step": 207
},
{
"epoch": 2.632911392405063,
"grad_norm": 0.0853879526257515,
"learning_rate": 9.712948723115383e-05,
"loss": 0.1063,
"mean_token_accuracy": 0.9563567638397217,
"num_tokens": 1083204.0,
"step": 208
},
{
"epoch": 2.6455696202531644,
"grad_norm": 0.09815023094415665,
"learning_rate": 9.630967182415442e-05,
"loss": 0.1174,
"mean_token_accuracy": 0.9501211643218994,
"num_tokens": 1088220.0,
"step": 209
},
{
"epoch": 2.6582278481012658,
"grad_norm": 0.08170381933450699,
"learning_rate": 9.549010471031256e-05,
"loss": 0.1115,
"mean_token_accuracy": 0.9547125697135925,
"num_tokens": 1093451.0,
"step": 210
},
{
"epoch": 2.670886075949367,
"grad_norm": 0.09601102769374847,
"learning_rate": 9.467084103185329e-05,
"loss": 0.1171,
"mean_token_accuracy": 0.9542239904403687,
"num_tokens": 1098605.0,
"step": 211
},
{
"epoch": 2.6835443037974684,
"grad_norm": 0.09155265986919403,
"learning_rate": 9.385193591058579e-05,
"loss": 0.1093,
"mean_token_accuracy": 0.9578231573104858,
"num_tokens": 1103814.0,
"step": 212
},
{
"epoch": 2.6962025316455698,
"grad_norm": 0.09160866588354111,
"learning_rate": 9.303344444419476e-05,
"loss": 0.1112,
"mean_token_accuracy": 0.951647937297821,
"num_tokens": 1108945.0,
"step": 213
},
{
"epoch": 2.708860759493671,
"grad_norm": 0.10708494484424591,
"learning_rate": 9.221542170253339e-05,
"loss": 0.1133,
"mean_token_accuracy": 0.9530802965164185,
"num_tokens": 1114252.0,
"step": 214
},
{
"epoch": 2.721518987341772,
"grad_norm": 0.08773200213909149,
"learning_rate": 9.139792272391791e-05,
"loss": 0.11,
"mean_token_accuracy": 0.9543495178222656,
"num_tokens": 1119420.0,
"step": 215
},
{
"epoch": 2.7341772151898733,
"grad_norm": 0.10514669865369797,
"learning_rate": 9.058100251142483e-05,
"loss": 0.1162,
"mean_token_accuracy": 0.9470460414886475,
"num_tokens": 1124545.0,
"step": 216
},
{
"epoch": 2.7468354430379747,
"grad_norm": 0.13822774589061737,
"learning_rate": 8.976471602918991e-05,
"loss": 0.1084,
"mean_token_accuracy": 0.955195426940918,
"num_tokens": 1129854.0,
"step": 217
},
{
"epoch": 2.759493670886076,
"grad_norm": 0.10257484018802643,
"learning_rate": 8.894911819871026e-05,
"loss": 0.1127,
"mean_token_accuracy": 0.9548011422157288,
"num_tokens": 1135073.0,
"step": 218
},
{
"epoch": 2.7721518987341773,
"grad_norm": 0.15447267889976501,
"learning_rate": 8.813426389514903e-05,
"loss": 0.1058,
"mean_token_accuracy": 0.9547005295753479,
"num_tokens": 1140413.0,
"step": 219
},
{
"epoch": 2.7848101265822782,
"grad_norm": 0.08518294990062714,
"learning_rate": 8.732020794364326e-05,
"loss": 0.1112,
"mean_token_accuracy": 0.9537380337715149,
"num_tokens": 1145600.0,
"step": 220
},
{
"epoch": 2.7974683544303796,
"grad_norm": 0.1725679337978363,
"learning_rate": 8.650700511561514e-05,
"loss": 0.1139,
"mean_token_accuracy": 0.9512341022491455,
"num_tokens": 1150688.0,
"step": 221
},
{
"epoch": 2.810126582278481,
"grad_norm": 0.09164884686470032,
"learning_rate": 8.5694710125087e-05,
"loss": 0.1083,
"mean_token_accuracy": 0.9564552903175354,
"num_tokens": 1155988.0,
"step": 222
},
{
"epoch": 2.8227848101265822,
"grad_norm": 0.12649889290332794,
"learning_rate": 8.488337762499972e-05,
"loss": 0.1082,
"mean_token_accuracy": 0.9533155560493469,
"num_tokens": 1161300.0,
"step": 223
},
{
"epoch": 2.8354430379746836,
"grad_norm": 0.10542358458042145,
"learning_rate": 8.407306220353596e-05,
"loss": 0.113,
"mean_token_accuracy": 0.9506816267967224,
"num_tokens": 1166352.0,
"step": 224
},
{
"epoch": 2.848101265822785,
"grad_norm": 0.12877212464809418,
"learning_rate": 8.326381838044713e-05,
"loss": 0.1136,
"mean_token_accuracy": 0.9508786201477051,
"num_tokens": 1171424.0,
"step": 225
},
{
"epoch": 2.8607594936708862,
"grad_norm": 0.08036050945520401,
"learning_rate": 8.245570060338512e-05,
"loss": 0.108,
"mean_token_accuracy": 0.9533178806304932,
"num_tokens": 1176672.0,
"step": 226
},
{
"epoch": 2.8734177215189876,
"grad_norm": 0.11726133525371552,
"learning_rate": 8.164876324423909e-05,
"loss": 0.1069,
"mean_token_accuracy": 0.9536500573158264,
"num_tokens": 1181914.0,
"step": 227
},
{
"epoch": 2.8860759493670884,
"grad_norm": 0.09797175228595734,
"learning_rate": 8.084306059547722e-05,
"loss": 0.1111,
"mean_token_accuracy": 0.9521328210830688,
"num_tokens": 1187159.0,
"step": 228
},
{
"epoch": 2.8987341772151898,
"grad_norm": 0.09934044629335403,
"learning_rate": 8.003864686649366e-05,
"loss": 0.1057,
"mean_token_accuracy": 0.9541738033294678,
"num_tokens": 1192482.0,
"step": 229
},
{
"epoch": 2.911392405063291,
"grad_norm": 0.12974561750888824,
"learning_rate": 7.923557617996131e-05,
"loss": 0.1126,
"mean_token_accuracy": 0.9513805508613586,
"num_tokens": 1197544.0,
"step": 230
},
{
"epoch": 2.9240506329113924,
"grad_norm": 0.15223093330860138,
"learning_rate": 7.843390256819034e-05,
"loss": 0.1119,
"mean_token_accuracy": 0.9524279236793518,
"num_tokens": 1202674.0,
"step": 231
},
{
"epoch": 2.9367088607594938,
"grad_norm": 0.0986715778708458,
"learning_rate": 7.763367996949267e-05,
"loss": 0.1043,
"mean_token_accuracy": 0.9544337391853333,
"num_tokens": 1208027.0,
"step": 232
},
{
"epoch": 2.9493670886075947,
"grad_norm": 0.10474951565265656,
"learning_rate": 7.683496222455304e-05,
"loss": 0.1108,
"mean_token_accuracy": 0.951941967010498,
"num_tokens": 1213189.0,
"step": 233
},
{
"epoch": 2.962025316455696,
"grad_norm": 0.12877650558948517,
"learning_rate": 7.603780307280639e-05,
"loss": 0.1071,
"mean_token_accuracy": 0.954459547996521,
"num_tokens": 1218545.0,
"step": 234
},
{
"epoch": 2.9746835443037973,
"grad_norm": 0.14582286775112152,
"learning_rate": 7.524225614882216e-05,
"loss": 0.1079,
"mean_token_accuracy": 0.9513266086578369,
"num_tokens": 1223848.0,
"step": 235
},
{
"epoch": 2.9873417721518987,
"grad_norm": 0.07670250535011292,
"learning_rate": 7.44483749786957e-05,
"loss": 0.1066,
"mean_token_accuracy": 0.9508670568466187,
"num_tokens": 1229102.0,
"step": 236
},
{
"epoch": 3.0,
"grad_norm": 0.11895658075809479,
"learning_rate": 7.365621297644686e-05,
"loss": 0.1084,
"mean_token_accuracy": 0.9556490182876587,
"num_tokens": 1234397.0,
"step": 237
},
{
"epoch": 3.0126582278481013,
"grad_norm": 0.07659917324781418,
"learning_rate": 7.286582344042625e-05,
"loss": 0.1094,
"mean_token_accuracy": 0.9530108571052551,
"num_tokens": 1239526.0,
"step": 238
},
{
"epoch": 3.0253164556962027,
"grad_norm": 0.08306147903203964,
"learning_rate": 7.207725954972913e-05,
"loss": 0.1029,
"mean_token_accuracy": 0.9556412696838379,
"num_tokens": 1244775.0,
"step": 239
},
{
"epoch": 3.037974683544304,
"grad_norm": 0.11685889959335327,
"learning_rate": 7.129057436061739e-05,
"loss": 0.1036,
"mean_token_accuracy": 0.9539796113967896,
"num_tokens": 1250141.0,
"step": 240
},
{
"epoch": 3.050632911392405,
"grad_norm": 0.08046155422925949,
"learning_rate": 7.050582080294996e-05,
"loss": 0.1042,
"mean_token_accuracy": 0.9550777673721313,
"num_tokens": 1255414.0,
"step": 241
},
{
"epoch": 3.0632911392405062,
"grad_norm": 0.09916442632675171,
"learning_rate": 6.972305167662145e-05,
"loss": 0.1107,
"mean_token_accuracy": 0.9493569135665894,
"num_tokens": 1260454.0,
"step": 242
},
{
"epoch": 3.0759493670886076,
"grad_norm": 0.07666052132844925,
"learning_rate": 6.89423196480097e-05,
"loss": 0.107,
"mean_token_accuracy": 0.9538767337799072,
"num_tokens": 1265548.0,
"step": 243
},
{
"epoch": 3.088607594936709,
"grad_norm": 0.09515383839607239,
"learning_rate": 6.816367724643224e-05,
"loss": 0.103,
"mean_token_accuracy": 0.9558286666870117,
"num_tokens": 1270819.0,
"step": 244
},
{
"epoch": 3.1012658227848102,
"grad_norm": 0.07828706502914429,
"learning_rate": 6.738717686061206e-05,
"loss": 0.1075,
"mean_token_accuracy": 0.9554416537284851,
"num_tokens": 1275955.0,
"step": 245
},
{
"epoch": 3.1139240506329116,
"grad_norm": 0.06959263980388641,
"learning_rate": 6.661287073515275e-05,
"loss": 0.1057,
"mean_token_accuracy": 0.9535741806030273,
"num_tokens": 1281167.0,
"step": 246
},
{
"epoch": 3.1265822784810124,
"grad_norm": 0.08991727977991104,
"learning_rate": 6.58408109670234e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9538699388504028,
"num_tokens": 1286412.0,
"step": 247
},
{
"epoch": 3.1392405063291138,
"grad_norm": 0.0742548480629921,
"learning_rate": 6.507104950205336e-05,
"loss": 0.1057,
"mean_token_accuracy": 0.9552783370018005,
"num_tokens": 1291686.0,
"step": 248
},
{
"epoch": 3.151898734177215,
"grad_norm": 0.09274096041917801,
"learning_rate": 6.430363813143716e-05,
"loss": 0.108,
"mean_token_accuracy": 0.9522682428359985,
"num_tokens": 1296820.0,
"step": 249
},
{
"epoch": 3.1645569620253164,
"grad_norm": 0.07980688661336899,
"learning_rate": 6.35386284882501e-05,
"loss": 0.1049,
"mean_token_accuracy": 0.954318642616272,
"num_tokens": 1302094.0,
"step": 250
},
{
"epoch": 3.1772151898734178,
"grad_norm": 0.0840386226773262,
"learning_rate": 6.277607204397408e-05,
"loss": 0.1056,
"mean_token_accuracy": 0.9568414688110352,
"num_tokens": 1307325.0,
"step": 251
},
{
"epoch": 3.189873417721519,
"grad_norm": 0.11037012934684753,
"learning_rate": 6.201602010503454e-05,
"loss": 0.1121,
"mean_token_accuracy": 0.950276255607605,
"num_tokens": 1312276.0,
"step": 252
},
{
"epoch": 3.2025316455696204,
"grad_norm": 0.08207038044929504,
"learning_rate": 6.125852380934841e-05,
"loss": 0.1086,
"mean_token_accuracy": 0.9517102837562561,
"num_tokens": 1317310.0,
"step": 253
},
{
"epoch": 3.2151898734177213,
"grad_norm": 0.08561797440052032,
"learning_rate": 6.0503634122883556e-05,
"loss": 0.1088,
"mean_token_accuracy": 0.9532359838485718,
"num_tokens": 1322442.0,
"step": 254
},
{
"epoch": 3.2278481012658227,
"grad_norm": 0.1632906049489975,
"learning_rate": 5.975140183622958e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.9594208598136902,
"num_tokens": 1327755.0,
"step": 255
},
{
"epoch": 3.240506329113924,
"grad_norm": 0.07698379456996918,
"learning_rate": 5.900187756118055e-05,
"loss": 0.1091,
"mean_token_accuracy": 0.9542356133460999,
"num_tokens": 1332954.0,
"step": 256
},
{
"epoch": 3.2531645569620253,
"grad_norm": 0.07018712162971497,
"learning_rate": 5.8255111727329717e-05,
"loss": 0.1051,
"mean_token_accuracy": 0.955034613609314,
"num_tokens": 1338222.0,
"step": 257
},
{
"epoch": 3.2658227848101267,
"grad_norm": 0.07832547277212143,
"learning_rate": 5.751115457867653e-05,
"loss": 0.1057,
"mean_token_accuracy": 0.954049825668335,
"num_tokens": 1343422.0,
"step": 258
},
{
"epoch": 3.278481012658228,
"grad_norm": 0.11230257153511047,
"learning_rate": 5.6770056170246175e-05,
"loss": 0.1061,
"mean_token_accuracy": 0.9552909135818481,
"num_tokens": 1348608.0,
"step": 259
},
{
"epoch": 3.291139240506329,
"grad_norm": 0.07142212241888046,
"learning_rate": 5.6031866364721554e-05,
"loss": 0.1072,
"mean_token_accuracy": 0.9554328322410583,
"num_tokens": 1353743.0,
"step": 260
},
{
"epoch": 3.3037974683544302,
"grad_norm": 0.0787329375743866,
"learning_rate": 5.529663482908864e-05,
"loss": 0.1051,
"mean_token_accuracy": 0.953653872013092,
"num_tokens": 1359007.0,
"step": 261
},
{
"epoch": 3.3164556962025316,
"grad_norm": 0.1963065266609192,
"learning_rate": 5.4564411031294695e-05,
"loss": 0.1095,
"mean_token_accuracy": 0.9543879628181458,
"num_tokens": 1364267.0,
"step": 262
},
{
"epoch": 3.329113924050633,
"grad_norm": 0.07281672954559326,
"learning_rate": 5.383524423691994e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.9560855627059937,
"num_tokens": 1369614.0,
"step": 263
},
{
"epoch": 3.3417721518987342,
"grad_norm": 0.09342652559280396,
"learning_rate": 5.310918350586291e-05,
"loss": 0.1104,
"mean_token_accuracy": 0.952820897102356,
"num_tokens": 1374765.0,
"step": 264
},
{
"epoch": 3.3544303797468356,
"grad_norm": 0.07760917395353317,
"learning_rate": 5.2386277689039565e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9535561800003052,
"num_tokens": 1379975.0,
"step": 265
},
{
"epoch": 3.367088607594937,
"grad_norm": 0.0827326700091362,
"learning_rate": 5.1666575425096396e-05,
"loss": 0.1073,
"mean_token_accuracy": 0.9565638899803162,
"num_tokens": 1385196.0,
"step": 266
},
{
"epoch": 3.379746835443038,
"grad_norm": 0.06986885517835617,
"learning_rate": 5.095012513713815e-05,
"loss": 0.1025,
"mean_token_accuracy": 0.9559379816055298,
"num_tokens": 1390548.0,
"step": 267
},
{
"epoch": 3.392405063291139,
"grad_norm": 0.0762210562825203,
"learning_rate": 5.023697502946969e-05,
"loss": 0.1104,
"mean_token_accuracy": 0.9542302489280701,
"num_tokens": 1395659.0,
"step": 268
},
{
"epoch": 3.4050632911392404,
"grad_norm": 0.08255967497825623,
"learning_rate": 4.9527173084352544e-05,
"loss": 0.102,
"mean_token_accuracy": 0.9543691277503967,
"num_tokens": 1401136.0,
"step": 269
},
{
"epoch": 3.4177215189873418,
"grad_norm": 0.2949913442134857,
"learning_rate": 4.882076705877689e-05,
"loss": 0.1044,
"mean_token_accuracy": 0.9576367735862732,
"num_tokens": 1406464.0,
"step": 270
},
{
"epoch": 3.430379746835443,
"grad_norm": 0.0810595452785492,
"learning_rate": 4.811780448124812e-05,
"loss": 0.1116,
"mean_token_accuracy": 0.9548583030700684,
"num_tokens": 1411468.0,
"step": 271
},
{
"epoch": 3.4430379746835444,
"grad_norm": 0.11588563770055771,
"learning_rate": 4.741833264858909e-05,
"loss": 0.1096,
"mean_token_accuracy": 0.9515007138252258,
"num_tokens": 1416563.0,
"step": 272
},
{
"epoch": 3.4556962025316453,
"grad_norm": 0.12587064504623413,
"learning_rate": 4.6722398622757935e-05,
"loss": 0.1046,
"mean_token_accuracy": 0.9545803070068359,
"num_tokens": 1421845.0,
"step": 273
},
{
"epoch": 3.4683544303797467,
"grad_norm": 0.09493621438741684,
"learning_rate": 4.603004922768148e-05,
"loss": 0.1055,
"mean_token_accuracy": 0.9531071186065674,
"num_tokens": 1427155.0,
"step": 274
},
{
"epoch": 3.481012658227848,
"grad_norm": 0.12601108849048615,
"learning_rate": 4.5341331046105064e-05,
"loss": 0.1048,
"mean_token_accuracy": 0.9577872157096863,
"num_tokens": 1432407.0,
"step": 275
},
{
"epoch": 3.4936708860759493,
"grad_norm": 0.10189390927553177,
"learning_rate": 4.465629041645819e-05,
"loss": 0.1126,
"mean_token_accuracy": 0.9512391686439514,
"num_tokens": 1437434.0,
"step": 276
},
{
"epoch": 3.5063291139240507,
"grad_norm": 0.0744316354393959,
"learning_rate": 4.397497342973676e-05,
"loss": 0.1011,
"mean_token_accuracy": 0.9574943780899048,
"num_tokens": 1442862.0,
"step": 277
},
{
"epoch": 3.518987341772152,
"grad_norm": 0.08852620422840118,
"learning_rate": 4.3297425926402115e-05,
"loss": 0.1056,
"mean_token_accuracy": 0.9545888304710388,
"num_tokens": 1448167.0,
"step": 278
},
{
"epoch": 3.5316455696202533,
"grad_norm": 0.10621877759695053,
"learning_rate": 4.2623693493296644e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9530797600746155,
"num_tokens": 1453410.0,
"step": 279
},
{
"epoch": 3.5443037974683547,
"grad_norm": 0.12595853209495544,
"learning_rate": 4.1953821460576715e-05,
"loss": 0.1061,
"mean_token_accuracy": 0.9557862281799316,
"num_tokens": 1458676.0,
"step": 280
},
{
"epoch": 3.5569620253164556,
"grad_norm": 0.07249915599822998,
"learning_rate": 4.1287854898662705e-05,
"loss": 0.1051,
"mean_token_accuracy": 0.9545806050300598,
"num_tokens": 1463914.0,
"step": 281
},
{
"epoch": 3.569620253164557,
"grad_norm": 0.07927811145782471,
"learning_rate": 4.0625838615206566e-05,
"loss": 0.1098,
"mean_token_accuracy": 0.9522687196731567,
"num_tokens": 1469069.0,
"step": 282
},
{
"epoch": 3.5822784810126582,
"grad_norm": 0.090684674680233,
"learning_rate": 3.996781715207706e-05,
"loss": 0.1066,
"mean_token_accuracy": 0.9550113677978516,
"num_tokens": 1474401.0,
"step": 283
},
{
"epoch": 3.5949367088607596,
"grad_norm": 0.08619457483291626,
"learning_rate": 3.9313834782362926e-05,
"loss": 0.1077,
"mean_token_accuracy": 0.956727921962738,
"num_tokens": 1479526.0,
"step": 284
},
{
"epoch": 3.607594936708861,
"grad_norm": 0.08588071167469025,
"learning_rate": 3.866393550739416e-05,
"loss": 0.107,
"mean_token_accuracy": 0.951872706413269,
"num_tokens": 1484743.0,
"step": 285
},
{
"epoch": 3.620253164556962,
"grad_norm": 0.14406421780586243,
"learning_rate": 3.801816305378124e-05,
"loss": 0.105,
"mean_token_accuracy": 0.9508963227272034,
"num_tokens": 1489939.0,
"step": 286
},
{
"epoch": 3.632911392405063,
"grad_norm": 0.07721186429262161,
"learning_rate": 3.737656087047347e-05,
"loss": 0.1072,
"mean_token_accuracy": 0.955703616142273,
"num_tokens": 1495105.0,
"step": 287
},
{
"epoch": 3.6455696202531644,
"grad_norm": 0.12911659479141235,
"learning_rate": 3.673917212583538e-05,
"loss": 0.1072,
"mean_token_accuracy": 0.9535064101219177,
"num_tokens": 1500331.0,
"step": 288
},
{
"epoch": 3.6582278481012658,
"grad_norm": 0.11017242074012756,
"learning_rate": 3.610603970474239e-05,
"loss": 0.1031,
"mean_token_accuracy": 0.955674409866333,
"num_tokens": 1505629.0,
"step": 289
},
{
"epoch": 3.670886075949367,
"grad_norm": 0.08761169761419296,
"learning_rate": 3.547720620569539e-05,
"loss": 0.1072,
"mean_token_accuracy": 0.9508035778999329,
"num_tokens": 1510795.0,
"step": 290
},
{
"epoch": 3.6835443037974684,
"grad_norm": 0.09792128205299377,
"learning_rate": 3.485271393795453e-05,
"loss": 0.103,
"mean_token_accuracy": 0.9534751176834106,
"num_tokens": 1516125.0,
"step": 291
},
{
"epoch": 3.6962025316455698,
"grad_norm": 0.12610845267772675,
"learning_rate": 3.4232604918692754e-05,
"loss": 0.1055,
"mean_token_accuracy": 0.9523255825042725,
"num_tokens": 1521349.0,
"step": 292
},
{
"epoch": 3.708860759493671,
"grad_norm": 0.08853945136070251,
"learning_rate": 3.361692087016863e-05,
"loss": 0.1059,
"mean_token_accuracy": 0.9500682950019836,
"num_tokens": 1526540.0,
"step": 293
},
{
"epoch": 3.721518987341772,
"grad_norm": 0.06902845948934555,
"learning_rate": 3.300570321691934e-05,
"loss": 0.1056,
"mean_token_accuracy": 0.9520946741104126,
"num_tokens": 1531760.0,
"step": 294
},
{
"epoch": 3.7341772151898733,
"grad_norm": 0.07241090387105942,
"learning_rate": 3.2398993082973294e-05,
"loss": 0.1009,
"mean_token_accuracy": 0.9556169509887695,
"num_tokens": 1537254.0,
"step": 295
},
{
"epoch": 3.7468354430379747,
"grad_norm": 0.10073200613260269,
"learning_rate": 3.179683128908352e-05,
"loss": 0.1069,
"mean_token_accuracy": 0.9539434909820557,
"num_tokens": 1542377.0,
"step": 296
},
{
"epoch": 3.759493670886076,
"grad_norm": 0.0977904349565506,
"learning_rate": 3.1199258349980966e-05,
"loss": 0.1071,
"mean_token_accuracy": 0.9532988667488098,
"num_tokens": 1547473.0,
"step": 297
},
{
"epoch": 3.7721518987341773,
"grad_norm": 0.08963675051927567,
"learning_rate": 3.0606314471648643e-05,
"loss": 0.1049,
"mean_token_accuracy": 0.952194333076477,
"num_tokens": 1552641.0,
"step": 298
},
{
"epoch": 3.7848101265822782,
"grad_norm": 0.08540157228708267,
"learning_rate": 3.0018039548616494e-05,
"loss": 0.1078,
"mean_token_accuracy": 0.9502468109130859,
"num_tokens": 1557770.0,
"step": 299
},
{
"epoch": 3.7974683544303796,
"grad_norm": 0.07660060375928879,
"learning_rate": 2.943447316127712e-05,
"loss": 0.1101,
"mean_token_accuracy": 0.9517952799797058,
"num_tokens": 1562875.0,
"step": 300
},
{
"epoch": 3.810126582278481,
"grad_norm": 0.08242560923099518,
"learning_rate": 2.8855654573222825e-05,
"loss": 0.1087,
"mean_token_accuracy": 0.9529340863227844,
"num_tokens": 1567932.0,
"step": 301
},
{
"epoch": 3.8227848101265822,
"grad_norm": 0.07197526842355728,
"learning_rate": 2.8281622728603864e-05,
"loss": 0.1072,
"mean_token_accuracy": 0.9523903131484985,
"num_tokens": 1573079.0,
"step": 302
},
{
"epoch": 3.8354430379746836,
"grad_norm": 0.0890003964304924,
"learning_rate": 2.7712416249508177e-05,
"loss": 0.1092,
"mean_token_accuracy": 0.9537814855575562,
"num_tokens": 1578141.0,
"step": 303
},
{
"epoch": 3.848101265822785,
"grad_norm": 0.10012844949960709,
"learning_rate": 2.714807343336273e-05,
"loss": 0.108,
"mean_token_accuracy": 0.9498612880706787,
"num_tokens": 1583251.0,
"step": 304
},
{
"epoch": 3.8607594936708862,
"grad_norm": 0.08376947045326233,
"learning_rate": 2.6588632250356948e-05,
"loss": 0.1057,
"mean_token_accuracy": 0.9516860842704773,
"num_tokens": 1588386.0,
"step": 305
},
{
"epoch": 3.8734177215189876,
"grad_norm": 0.12690703570842743,
"learning_rate": 2.6034130340887895e-05,
"loss": 0.1088,
"mean_token_accuracy": 0.9529805183410645,
"num_tokens": 1593533.0,
"step": 306
},
{
"epoch": 3.8860759493670884,
"grad_norm": 0.09463846683502197,
"learning_rate": 2.5484605013027784e-05,
"loss": 0.101,
"mean_token_accuracy": 0.9561387300491333,
"num_tokens": 1598932.0,
"step": 307
},
{
"epoch": 3.8987341772151898,
"grad_norm": 0.0749184638261795,
"learning_rate": 2.4940093240013717e-05,
"loss": 0.1017,
"mean_token_accuracy": 0.9565382599830627,
"num_tokens": 1604265.0,
"step": 308
},
{
"epoch": 3.911392405063291,
"grad_norm": 0.0753999873995781,
"learning_rate": 2.4400631657760186e-05,
"loss": 0.1048,
"mean_token_accuracy": 0.9529388546943665,
"num_tokens": 1609450.0,
"step": 309
},
{
"epoch": 3.9240506329113924,
"grad_norm": 0.09461472928524017,
"learning_rate": 2.3866256562394083e-05,
"loss": 0.1053,
"mean_token_accuracy": 0.9552039504051208,
"num_tokens": 1614760.0,
"step": 310
},
{
"epoch": 3.9367088607594938,
"grad_norm": 0.08459661155939102,
"learning_rate": 2.333700390781256e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9539961218833923,
"num_tokens": 1619954.0,
"step": 311
},
{
"epoch": 3.9493670886075947,
"grad_norm": 0.0780106633901596,
"learning_rate": 2.2812909303264085e-05,
"loss": 0.1086,
"mean_token_accuracy": 0.9520302414894104,
"num_tokens": 1625042.0,
"step": 312
},
{
"epoch": 3.962025316455696,
"grad_norm": 0.0692264512181282,
"learning_rate": 2.2294008010952382e-05,
"loss": 0.1052,
"mean_token_accuracy": 0.9553224444389343,
"num_tokens": 1630254.0,
"step": 313
},
{
"epoch": 3.9746835443037973,
"grad_norm": 0.08776938170194626,
"learning_rate": 2.1780334943664162e-05,
"loss": 0.108,
"mean_token_accuracy": 0.9492525458335876,
"num_tokens": 1635402.0,
"step": 314
},
{
"epoch": 3.9873417721518987,
"grad_norm": 0.08817070722579956,
"learning_rate": 2.127192466241994e-05,
"loss": 0.1033,
"mean_token_accuracy": 0.955152690410614,
"num_tokens": 1640706.0,
"step": 315
},
{
"epoch": 4.0,
"grad_norm": 0.07555601745843887,
"learning_rate": 2.07688113741488e-05,
"loss": 0.1071,
"mean_token_accuracy": 0.9514446258544922,
"num_tokens": 1645754.0,
"step": 316
},
{
"epoch": 4.012658227848101,
"grad_norm": 0.09684138000011444,
"learning_rate": 2.0271028929386738e-05,
"loss": 0.1006,
"mean_token_accuracy": 0.956803023815155,
"num_tokens": 1651073.0,
"step": 317
},
{
"epoch": 4.025316455696203,
"grad_norm": 0.0689501166343689,
"learning_rate": 1.977861081999931e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9500601887702942,
"num_tokens": 1656123.0,
"step": 318
},
{
"epoch": 4.037974683544304,
"grad_norm": 0.0964011624455452,
"learning_rate": 1.92915901769281e-05,
"loss": 0.1031,
"mean_token_accuracy": 0.9536062479019165,
"num_tokens": 1661317.0,
"step": 319
},
{
"epoch": 4.050632911392405,
"grad_norm": 0.07395302504301071,
"learning_rate": 1.880999976796164e-05,
"loss": 0.1046,
"mean_token_accuracy": 0.9519667625427246,
"num_tokens": 1666440.0,
"step": 320
},
{
"epoch": 4.063291139240507,
"grad_norm": 0.08307081460952759,
"learning_rate": 1.8333871995530726e-05,
"loss": 0.1002,
"mean_token_accuracy": 0.9573794603347778,
"num_tokens": 1671877.0,
"step": 321
},
{
"epoch": 4.075949367088608,
"grad_norm": 0.06272169202566147,
"learning_rate": 1.786323889452828e-05,
"loss": 0.1008,
"mean_token_accuracy": 0.9574791193008423,
"num_tokens": 1677209.0,
"step": 322
},
{
"epoch": 4.0886075949367084,
"grad_norm": 0.07284139841794968,
"learning_rate": 1.739813213015401e-05,
"loss": 0.104,
"mean_token_accuracy": 0.9567620754241943,
"num_tokens": 1682338.0,
"step": 323
},
{
"epoch": 4.10126582278481,
"grad_norm": 0.06694748252630234,
"learning_rate": 1.693858299578396e-05,
"loss": 0.1031,
"mean_token_accuracy": 0.9539980292320251,
"num_tokens": 1687467.0,
"step": 324
},
{
"epoch": 4.113924050632911,
"grad_norm": 0.07162707298994064,
"learning_rate": 1.6484622410864835e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.954440176486969,
"num_tokens": 1692711.0,
"step": 325
},
{
"epoch": 4.1265822784810124,
"grad_norm": 0.06535227596759796,
"learning_rate": 1.6036280918833924e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.9556373357772827,
"num_tokens": 1697937.0,
"step": 326
},
{
"epoch": 4.139240506329114,
"grad_norm": 0.07000143826007843,
"learning_rate": 1.5593588685063896e-05,
"loss": 0.1018,
"mean_token_accuracy": 0.9560693502426147,
"num_tokens": 1703191.0,
"step": 327
},
{
"epoch": 4.151898734177215,
"grad_norm": 0.07342347502708435,
"learning_rate": 1.515657549483328e-05,
"loss": 0.1062,
"mean_token_accuracy": 0.9525246620178223,
"num_tokens": 1708226.0,
"step": 328
},
{
"epoch": 4.1645569620253164,
"grad_norm": 0.08151296526193619,
"learning_rate": 1.4725270751322452e-05,
"loss": 0.1073,
"mean_token_accuracy": 0.9529818892478943,
"num_tokens": 1713203.0,
"step": 329
},
{
"epoch": 4.177215189873418,
"grad_norm": 0.06281263381242752,
"learning_rate": 1.4299703473635218e-05,
"loss": 0.0973,
"mean_token_accuracy": 0.958076000213623,
"num_tokens": 1718610.0,
"step": 330
},
{
"epoch": 4.189873417721519,
"grad_norm": 0.08737554401159286,
"learning_rate": 1.3879902294846536e-05,
"loss": 0.1069,
"mean_token_accuracy": 0.9523618221282959,
"num_tokens": 1723649.0,
"step": 331
},
{
"epoch": 4.2025316455696204,
"grad_norm": 0.12319174408912659,
"learning_rate": 1.3465895460075873e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.9562439322471619,
"num_tokens": 1728878.0,
"step": 332
},
{
"epoch": 4.215189873417722,
"grad_norm": 0.07765615731477737,
"learning_rate": 1.3057710824586899e-05,
"loss": 0.106,
"mean_token_accuracy": 0.9550222158432007,
"num_tokens": 1733900.0,
"step": 333
},
{
"epoch": 4.227848101265823,
"grad_norm": 0.0769255980849266,
"learning_rate": 1.2655375851913232e-05,
"loss": 0.1029,
"mean_token_accuracy": 0.9560784101486206,
"num_tokens": 1739064.0,
"step": 334
},
{
"epoch": 4.2405063291139244,
"grad_norm": 0.07434723526239395,
"learning_rate": 1.22589176120107e-05,
"loss": 0.0997,
"mean_token_accuracy": 0.9566869139671326,
"num_tokens": 1744392.0,
"step": 335
},
{
"epoch": 4.253164556962025,
"grad_norm": 0.06731196492910385,
"learning_rate": 1.186836277943606e-05,
"loss": 0.1056,
"mean_token_accuracy": 0.9545182585716248,
"num_tokens": 1749469.0,
"step": 336
},
{
"epoch": 4.265822784810126,
"grad_norm": 0.07609716057777405,
"learning_rate": 1.1483737631552161e-05,
"loss": 0.1023,
"mean_token_accuracy": 0.953596293926239,
"num_tokens": 1754705.0,
"step": 337
},
{
"epoch": 4.2784810126582276,
"grad_norm": 0.07831935584545135,
"learning_rate": 1.1105068046760048e-05,
"loss": 0.1022,
"mean_token_accuracy": 0.9571400880813599,
"num_tokens": 1759902.0,
"step": 338
},
{
"epoch": 4.291139240506329,
"grad_norm": 0.09007194638252258,
"learning_rate": 1.0732379502757717e-05,
"loss": 0.104,
"mean_token_accuracy": 0.9568931460380554,
"num_tokens": 1765000.0,
"step": 339
},
{
"epoch": 4.30379746835443,
"grad_norm": 0.07691890746355057,
"learning_rate": 1.036569707482602e-05,
"loss": 0.104,
"mean_token_accuracy": 0.953274667263031,
"num_tokens": 1770179.0,
"step": 340
},
{
"epoch": 4.3164556962025316,
"grad_norm": 0.06939467787742615,
"learning_rate": 1.0005045434141502e-05,
"loss": 0.1,
"mean_token_accuracy": 0.956974983215332,
"num_tokens": 1775519.0,
"step": 341
},
{
"epoch": 4.329113924050633,
"grad_norm": 0.08041319996118546,
"learning_rate": 9.6504488461164e-06,
"loss": 0.1049,
"mean_token_accuracy": 0.95549076795578,
"num_tokens": 1780728.0,
"step": 342
},
{
"epoch": 4.341772151898734,
"grad_norm": 0.07367473840713501,
"learning_rate": 9.301931168766164e-06,
"loss": 0.1011,
"mean_token_accuracy": 0.956186056137085,
"num_tokens": 1785973.0,
"step": 343
},
{
"epoch": 4.3544303797468356,
"grad_norm": 0.07549143582582474,
"learning_rate": 8.959515851104117e-06,
"loss": 0.1051,
"mean_token_accuracy": 0.9559249877929688,
"num_tokens": 1791210.0,
"step": 344
},
{
"epoch": 4.367088607594937,
"grad_norm": 0.07187310606241226,
"learning_rate": 8.623225931563805e-06,
"loss": 0.104,
"mean_token_accuracy": 0.9560890197753906,
"num_tokens": 1796398.0,
"step": 345
},
{
"epoch": 4.379746835443038,
"grad_norm": 0.06743541359901428,
"learning_rate": 8.293084036448895e-06,
"loss": 0.0988,
"mean_token_accuracy": 0.9584117531776428,
"num_tokens": 1801776.0,
"step": 346
},
{
"epoch": 4.3924050632911396,
"grad_norm": 0.067915178835392,
"learning_rate": 7.96911237841088e-06,
"loss": 0.1004,
"mean_token_accuracy": 0.9545979499816895,
"num_tokens": 1807038.0,
"step": 347
},
{
"epoch": 4.405063291139241,
"grad_norm": 0.09219470620155334,
"learning_rate": 7.651332754954477e-06,
"loss": 0.1003,
"mean_token_accuracy": 0.9545368552207947,
"num_tokens": 1812403.0,
"step": 348
},
{
"epoch": 4.417721518987342,
"grad_norm": 0.11064563691616058,
"learning_rate": 7.3397665469711495e-06,
"loss": 0.1019,
"mean_token_accuracy": 0.9539871215820312,
"num_tokens": 1817596.0,
"step": 349
},
{
"epoch": 4.430379746835443,
"grad_norm": 0.09897923469543457,
"learning_rate": 7.034434717300509e-06,
"loss": 0.105,
"mean_token_accuracy": 0.9534472823143005,
"num_tokens": 1822751.0,
"step": 350
},
{
"epoch": 4.443037974683544,
"grad_norm": 0.07111285626888275,
"learning_rate": 6.735357809319809e-06,
"loss": 0.1018,
"mean_token_accuracy": 0.9563706517219543,
"num_tokens": 1827995.0,
"step": 351
},
{
"epoch": 4.455696202531645,
"grad_norm": 0.2520071566104889,
"learning_rate": 6.442555945561901e-06,
"loss": 0.1053,
"mean_token_accuracy": 0.9519890546798706,
"num_tokens": 1833162.0,
"step": 352
},
{
"epoch": 4.468354430379747,
"grad_norm": 0.12714385986328125,
"learning_rate": 6.156048826361238e-06,
"loss": 0.1061,
"mean_token_accuracy": 0.9527450799942017,
"num_tokens": 1838326.0,
"step": 353
},
{
"epoch": 4.481012658227848,
"grad_norm": 0.08718091994524002,
"learning_rate": 5.8758557285284125e-06,
"loss": 0.1032,
"mean_token_accuracy": 0.9563856720924377,
"num_tokens": 1843503.0,
"step": 354
},
{
"epoch": 4.493670886075949,
"grad_norm": 0.07357566058635712,
"learning_rate": 5.6019955040531925e-06,
"loss": 0.1023,
"mean_token_accuracy": 0.9551690816879272,
"num_tokens": 1848742.0,
"step": 355
},
{
"epoch": 4.506329113924051,
"grad_norm": 0.07677753269672394,
"learning_rate": 5.334486578836118e-06,
"loss": 0.1004,
"mean_token_accuracy": 0.9548485279083252,
"num_tokens": 1854055.0,
"step": 356
},
{
"epoch": 4.518987341772152,
"grad_norm": 0.07052655518054962,
"learning_rate": 5.073346951448699e-06,
"loss": 0.1038,
"mean_token_accuracy": 0.9546507000923157,
"num_tokens": 1859301.0,
"step": 357
},
{
"epoch": 4.531645569620253,
"grad_norm": 0.07745072990655899,
"learning_rate": 4.818594191922576e-06,
"loss": 0.1005,
"mean_token_accuracy": 0.95723557472229,
"num_tokens": 1864603.0,
"step": 358
},
{
"epoch": 4.544303797468355,
"grad_norm": 0.08845014125108719,
"learning_rate": 4.5702454405672e-06,
"loss": 0.105,
"mean_token_accuracy": 0.9560937285423279,
"num_tokens": 1869746.0,
"step": 359
},
{
"epoch": 4.556962025316456,
"grad_norm": 0.0690731629729271,
"learning_rate": 4.328317406816751e-06,
"loss": 0.1015,
"mean_token_accuracy": 0.9542607665061951,
"num_tokens": 1875079.0,
"step": 360
},
{
"epoch": 4.569620253164557,
"grad_norm": 0.0831163302063942,
"learning_rate": 4.092826368105795e-06,
"loss": 0.1051,
"mean_token_accuracy": 0.9527947902679443,
"num_tokens": 1880206.0,
"step": 361
},
{
"epoch": 4.582278481012658,
"grad_norm": 0.0732286274433136,
"learning_rate": 3.863788168774118e-06,
"loss": 0.0997,
"mean_token_accuracy": 0.9570702314376831,
"num_tokens": 1885581.0,
"step": 362
},
{
"epoch": 4.594936708860759,
"grad_norm": 0.08837465196847916,
"learning_rate": 3.6412182190007082e-06,
"loss": 0.105,
"mean_token_accuracy": 0.9544827342033386,
"num_tokens": 1890720.0,
"step": 363
},
{
"epoch": 4.6075949367088604,
"grad_norm": 0.08702041208744049,
"learning_rate": 3.425131493766931e-06,
"loss": 0.1033,
"mean_token_accuracy": 0.9553981423377991,
"num_tokens": 1896008.0,
"step": 364
},
{
"epoch": 4.620253164556962,
"grad_norm": 0.09506855905056,
"learning_rate": 3.2155425318489584e-06,
"loss": 0.1046,
"mean_token_accuracy": 0.9514335989952087,
"num_tokens": 1901199.0,
"step": 365
},
{
"epoch": 4.632911392405063,
"grad_norm": 0.07980173826217651,
"learning_rate": 3.012465434839529e-06,
"loss": 0.1028,
"mean_token_accuracy": 0.9555080533027649,
"num_tokens": 1906410.0,
"step": 366
},
{
"epoch": 4.6455696202531644,
"grad_norm": 0.07992957532405853,
"learning_rate": 2.8159138661992824e-06,
"loss": 0.0993,
"mean_token_accuracy": 0.9551005363464355,
"num_tokens": 1911797.0,
"step": 367
},
{
"epoch": 4.658227848101266,
"grad_norm": 0.06562772393226624,
"learning_rate": 2.6259010503373206e-06,
"loss": 0.1005,
"mean_token_accuracy": 0.9560797810554504,
"num_tokens": 1917075.0,
"step": 368
},
{
"epoch": 4.670886075949367,
"grad_norm": 0.08056320250034332,
"learning_rate": 2.4424397717215387e-06,
"loss": 0.1007,
"mean_token_accuracy": 0.9569810032844543,
"num_tokens": 1922346.0,
"step": 369
},
{
"epoch": 4.6835443037974684,
"grad_norm": 0.0747138187289238,
"learning_rate": 2.2655423740183924e-06,
"loss": 0.1052,
"mean_token_accuracy": 0.9540755748748779,
"num_tokens": 1927440.0,
"step": 370
},
{
"epoch": 4.69620253164557,
"grad_norm": 0.08138495683670044,
"learning_rate": 2.0952207592624505e-06,
"loss": 0.1023,
"mean_token_accuracy": 0.9549393653869629,
"num_tokens": 1932697.0,
"step": 371
},
{
"epoch": 4.708860759493671,
"grad_norm": 0.07584184408187866,
"learning_rate": 1.9314863870555255e-06,
"loss": 0.1068,
"mean_token_accuracy": 0.95260089635849,
"num_tokens": 1937740.0,
"step": 372
},
{
"epoch": 4.7215189873417724,
"grad_norm": 0.07171127945184708,
"learning_rate": 1.7743502737957106e-06,
"loss": 0.1037,
"mean_token_accuracy": 0.9526029229164124,
"num_tokens": 1942952.0,
"step": 373
},
{
"epoch": 4.734177215189874,
"grad_norm": 0.07656321674585342,
"learning_rate": 1.6238229919361858e-06,
"loss": 0.1044,
"mean_token_accuracy": 0.95380699634552,
"num_tokens": 1948125.0,
"step": 374
},
{
"epoch": 4.746835443037975,
"grad_norm": 0.07331555336713791,
"learning_rate": 1.4799146692737741e-06,
"loss": 0.1049,
"mean_token_accuracy": 0.9529948234558105,
"num_tokens": 1953231.0,
"step": 375
},
{
"epoch": 4.759493670886076,
"grad_norm": 0.07884940505027771,
"learning_rate": 1.3426349882676325e-06,
"loss": 0.1068,
"mean_token_accuracy": 0.9540776014328003,
"num_tokens": 1958347.0,
"step": 376
},
{
"epoch": 4.772151898734177,
"grad_norm": 0.1426946520805359,
"learning_rate": 1.211993185387772e-06,
"loss": 0.1001,
"mean_token_accuracy": 0.9522359371185303,
"num_tokens": 1963666.0,
"step": 377
},
{
"epoch": 4.784810126582278,
"grad_norm": 0.07278037071228027,
"learning_rate": 1.0879980504935772e-06,
"loss": 0.1008,
"mean_token_accuracy": 0.9554380774497986,
"num_tokens": 1969026.0,
"step": 378
},
{
"epoch": 4.7974683544303796,
"grad_norm": 0.08306018263101578,
"learning_rate": 9.706579262424131e-07,
"loss": 0.1028,
"mean_token_accuracy": 0.9530498385429382,
"num_tokens": 1974287.0,
"step": 379
},
{
"epoch": 4.810126582278481,
"grad_norm": 0.08014005422592163,
"learning_rate": 8.599807075283406e-07,
"loss": 0.1036,
"mean_token_accuracy": 0.9550078511238098,
"num_tokens": 1979463.0,
"step": 380
},
{
"epoch": 4.822784810126582,
"grad_norm": 0.09596075862646103,
"learning_rate": 7.559738409508855e-07,
"loss": 0.1025,
"mean_token_accuracy": 0.954913318157196,
"num_tokens": 1984717.0,
"step": 381
},
{
"epoch": 4.8354430379746836,
"grad_norm": 0.08025940507650375,
"learning_rate": 6.586443243140838e-07,
"loss": 0.104,
"mean_token_accuracy": 0.951367199420929,
"num_tokens": 1989901.0,
"step": 382
},
{
"epoch": 4.848101265822785,
"grad_norm": 0.12304380536079407,
"learning_rate": 5.679987061555703e-07,
"loss": 0.1032,
"mean_token_accuracy": 0.9531791806221008,
"num_tokens": 1995155.0,
"step": 383
},
{
"epoch": 4.860759493670886,
"grad_norm": 0.07420387864112854,
"learning_rate": 4.840430853060518e-07,
"loss": 0.1052,
"mean_token_accuracy": 0.9540906548500061,
"num_tokens": 2000316.0,
"step": 384
},
{
"epoch": 4.8734177215189876,
"grad_norm": 0.06775283068418503,
"learning_rate": 4.0678311047890327e-07,
"loss": 0.1049,
"mean_token_accuracy": 0.951873779296875,
"num_tokens": 2005450.0,
"step": 385
},
{
"epoch": 4.886075949367089,
"grad_norm": 0.08906703442335129,
"learning_rate": 3.362239798901712e-07,
"loss": 0.1036,
"mean_token_accuracy": 0.956197202205658,
"num_tokens": 2010605.0,
"step": 386
},
{
"epoch": 4.89873417721519,
"grad_norm": 0.06832820922136307,
"learning_rate": 2.723704409087979e-07,
"loss": 0.1024,
"mean_token_accuracy": 0.954034149646759,
"num_tokens": 2015825.0,
"step": 387
},
{
"epoch": 4.911392405063291,
"grad_norm": 0.08005010336637497,
"learning_rate": 2.1522678973718847e-07,
"loss": 0.1018,
"mean_token_accuracy": 0.9544236063957214,
"num_tokens": 2021111.0,
"step": 388
},
{
"epoch": 4.924050632911392,
"grad_norm": 0.09537311643362045,
"learning_rate": 1.6479687112217479e-07,
"loss": 0.102,
"mean_token_accuracy": 0.9552180767059326,
"num_tokens": 2026311.0,
"step": 389
},
{
"epoch": 4.936708860759493,
"grad_norm": 0.07920707017183304,
"learning_rate": 1.2108407809635624e-07,
"loss": 0.1052,
"mean_token_accuracy": 0.9539999961853027,
"num_tokens": 2031375.0,
"step": 390
},
{
"epoch": 4.949367088607595,
"grad_norm": 0.07268811017274857,
"learning_rate": 8.40913517497377e-08,
"loss": 0.1069,
"mean_token_accuracy": 0.9519230723381042,
"num_tokens": 2036431.0,
"step": 391
},
{
"epoch": 4.962025316455696,
"grad_norm": 0.08966528624296188,
"learning_rate": 5.382118103193223e-08,
"loss": 0.1058,
"mean_token_accuracy": 0.9516574740409851,
"num_tokens": 2041563.0,
"step": 392
},
{
"epoch": 4.974683544303797,
"grad_norm": 0.09453365951776505,
"learning_rate": 3.027560258465067e-08,
"loss": 0.1062,
"mean_token_accuracy": 0.9526419043540955,
"num_tokens": 2046737.0,
"step": 393
},
{
"epoch": 4.987341772151899,
"grad_norm": 0.07027182728052139,
"learning_rate": 1.345620060465569e-08,
"loss": 0.1008,
"mean_token_accuracy": 0.9557777643203735,
"num_tokens": 2052002.0,
"step": 394
},
{
"epoch": 5.0,
"grad_norm": 0.06676497310400009,
"learning_rate": 3.3641067372358612e-09,
"loss": 0.0987,
"mean_token_accuracy": 0.9561353921890259,
"num_tokens": 2057355.0,
"step": 395
},
{
"epoch": 5.0,
"step": 395,
"total_flos": 1.1838517166892646e+17,
"train_loss": 0.13332003966162476,
"train_runtime": 398.9704,
"train_samples_per_second": 62.661,
"train_steps_per_second": 0.99
}
],
"logging_steps": 1.0,
"max_steps": 395,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.1838517166892646e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}